LoCoMo audit 제기한 r/MachineLearning, answer key 오류 6.4%와 judge 취약성 지적
Penfield Labs는 LoCoMo answer key 1,540문항 중 99개가 score를 왜곡한다고 주장했고, gpt-4o-mini judge가 의도적으로 틀린 답변도 62.81% 통과시켰다고 보고해 benchmark 신뢰성 논쟁을 키웠다.
태그
#benchmarks 태그가 달린 기사
Penfield Labs는 LoCoMo answer key 1,540문항 중 99개가 score를 왜곡한다고 주장했고, gpt-4o-mini judge가 의도적으로 틀린 답변도 62.81% 통과시켰다고 보고해 benchmark 신뢰성 논쟁을 키웠다.
ARC Prize의 ARC-AGI 3 공개 직후 r/singularity는 새 벤치마크가 정답 여부뿐 아니라 행동 수 효율까지 점수에 반영한다는 점에 주목했다. 요지는 현재 frontier AI가 여전히 일반화된 상호작용 추론에서 사람과 큰 격차를 보인다는 것이다.
Hacker News에서 화제가 된 ATLAS는 consumer GPU 기반 local coding agent의 비용 효율을 크게 강조한다. 다만 README의 74.6% LiveCodeBench 수치는 best-of-3 plus repair 파이프라인과 다른 task 수를 전제로 하므로, Claude 4.5 Sonnet과의 비교는 비통제 비교로 읽어야 한다.
Google DeepMind는 AGI 진척을 평가하기 위한 cognitive taxonomy를 발표하고, 이를 실제 benchmark로 연결하기 위한 Kaggle hackathon도 함께 시작했다. 핵심은 단일 headline score 대신 10개 cognitive ability별로 AI를 human baseline과 비교하자는 제안이다.
r/LocalLLaMA의 rerun benchmark는 Apple M5 Max가 token generation보다 prompt processing에서 더 큰 이득을 보인다고 주장한다. 특히 Qwen 3.5 35B-A3B MoE는 2,845 tok/s PP512와 92.2 tok/s generation을 기록했다고 post author가 설명한다.
새 r/LocalLLaMA 스레드는 multi-hop QA의 병목이 retrieval이 아니라 reasoning일 수 있다는 Graph-RAG 결과를 끌어올렸다. structured prompting과 graph-based context compression을 결합하면 Llama 8B가 plain 70B baseline에 맞설 수 있다는 주장이 핵심이다.
Hacker News에서 화제가 된 llm-circuit-finder는 training 없이 layer routing만으로 reasoning score를 끌어올릴 수 있다고 주장한다. 하지만 README의 전체 benchmark는 IFEval/MBPP와 평균 점수 하락도 보여 주며, 이 접근은 universal improvement보다 capability steering으로 보는 편이 더 타당하다.
Google DeepMind가 2026년 3월 17일 AGI 진전을 평가하기 위한 cognitive framework를 공개했다. benchmark leaderboard 대신 인간 인지 능력 분해와 capability profile 비교로 논의를 옮기려는 시도다.
Google DeepMind는 X에서 20만 달러 상금 규모의 Kaggle hackathon을 열어 AI용 새로운 cognitive evaluation을 만들겠다고 밝혔다. 연결된 Google 글은 이 노력이 단일 benchmark가 아니라 10개의 cognitive ability 전반에서 AGI 진행 상황을 측정하려는 더 큰 프레임워크의 일부라고 설명한다.
OpenAI는 2026년 3월 10일 IH-Challenge를 공개하며 frontier LLM의 instruction hierarchy 동작을 개선하면 safety steerability와 prompt injection 저항성을 함께 높일 수 있다고 밝혔다. 회사는 추가 연구를 위해 데이터셋도 Hugging Face에 공개했다.
최근 r/LocalLLaMA에서 주목받은 글은 커뮤니티가 이미 400개가 넘는 모델에 대해 거의 1만 건에 이르는 Apple Silicon 벤치마크를 제출했다고 주장한다. 이 글이 중요한 이유는 흩어진 체감담을 넘어, M-series 칩과 context 길이별 패턴을 비교할 수 있는 공유 데이터셋이 생기기 시작했기 때문이다.
최근 r/LocalLLaMA 벤치마크 글은 Apple Silicon에서 MLX와 llama.cpp를 비교할 때 단순 tok/s 화면만 보면 중요한 차이를 놓칠 수 있다고 지적했다. MLX는 짧은 context의 generation에서는 여전히 빠르지만, 긴 context workload에서는 prefill이 전체 지연 시간을 지배해 체감 속도 우위가 크게 줄어들 수 있다.