Qwen 팀, GPQA·HLE 벤치마크 데이터 품질에 심각한 문제 있음을 공식 확인
Qwen 연구팀이 GPQA와 HLE(Humanity's Last Exam) 벤치마크 데이터셋의 품질에 심각한 문제가 있음을 공식 논문을 통해 확인했습니다. OCR 오류, 잘못된 정답, 검증 불가능한 문항들이 포함돼 있어 현재 AI 모델 평가의 신뢰성에 의문이 제기되고 있습니다.
태그
#benchmark 태그가 달린 기사
Qwen 연구팀이 GPQA와 HLE(Humanity's Last Exam) 벤치마크 데이터셋의 품질에 심각한 문제가 있음을 공식 논문을 통해 확인했습니다. OCR 오류, 잘못된 정답, 검증 불가능한 문항들이 포함돼 있어 현재 AI 모델 평가의 신뢰성에 의문이 제기되고 있습니다.
Google DeepMind가 Gemini 3.1 Pro를 출시했다. 전작 대비 추론 성능이 2배 이상 향상됐으며 ARC-AGI-2에서 77.1%를 달성했다. 18개 추적 벤치마크 중 12개에서 1위를 기록하면서 API 가격은 $2/$12로 그대로 유지된다.
Claude Opus 4.6이 METR의 소프트웨어 작업 벤치마크에서 50% 완료 시간 기준으로 약 14.5시간을 달성해 모든 예측을 뛰어넘었습니다. 배가 시간이 3개월 미만으로 측정되며 AI 역량이 지수적으로 성장하고 있음을 보여줍니다.
Hacker News에서 주목받은 SkillsBench 논문은 86개 태스크·11개 도메인에서 Agent Skill의 실제 효용을 비교했다. curated skill은 평균 통과율을 크게 끌어올렸지만, 모델이 직접 만든 skill은 평균 개선 효과를 보이지 않았다.
OpenAI는 160개 이상 정치학 저널 논문을 대상으로 100만 건 이상 synthetic evaluation을 수행해 재현연구 후보를 선별하는 방법을 공개했다. 논문 제목·초록 기반 예측과 실제 표본 결과의 불일치를 활용해, 검증 가치가 높은 연구를 찾는 접근이다.
LocalLLaMA 토론에서 공유된 SWE-rebench 1월 결과는 Claude Code 선두 속에 상위 모델 격차 축소와 오픈 모델 추격을 보여줬다.
Anthropic이 Claude Opus 4.6을 공개하며 코딩, 장문 맥락 이해, 지식 업무에서 업계 최고 성능을 달성했습니다.
한 개발자가 중국 Moonshot AI의 Kimi K2.5와 Anthropic의 Claude Opus 4.5를 실제 코딩 작업으로 비교했다. 복잡한 작업에서는 Opus가 우위를 보였지만, Kimi K2.5는 중급 난이도 작업에서 비용 대비 충분한 성능을 입증했다.
Anthropic이 Claude AI로 개발한 C 컴파일러(CCC)가 GCC와 비교하여 얼마나 효율적인지 벤치마크한 결과, 코드 생성은 성공했지만 실행 속도는 737배~158,000배 느린 것으로 나타났습니다.
Anthropic이 새로운 Opus 4.6 모델을 공개했다. 금융·법무 분야 지식 업무 벤치마크에서 OpenAI의 GPT-5.2를 앞섰으며, 기업 템플릿에 맞춘 프레젠테이션 자동 생성 기능을 선보였다.
OpenAI 연구원 Noam Brown이 METR 벤치마크에서 보이는 놀라운 AI 진보 속도에 대해 "이 속도가 계속될 것"이라 답했으며, 연말쯤에는 METR이 그 수준의 시간 범위를 측정하기 어려워질 것이라 전망했다.