ARC-AGI-3 최신 결과: GPT-5.5는 0.43%, Claude Opus 4.7은 0.18%
AGI 수준 평가 벤치마크 ARC-AGI-3에서 GPT-5.5 High가 0.43%, Claude Opus 4.7이 0.18%를 기록했다. 최강 모델들도 이 벤치마크 앞에서는 사실상 제로에 수렴한다.
원문: ARC-AGI-3 Update (GPT-5.5 High and Opus4.7) 원문 보기 →
ARC-AGI-3 현황
r/singularity에 354점으로 공유된 최신 업데이트에 따르면 ARC-AGI-3 벤치마크 결과: GPT-5.5 High 0.43%, Claude Opus 4.7 0.18%.
ARC-AGI-3이란?
ARC Prize 팀이 개발한 AGI 평가 벤치마크로 전작보다 훨씬 어렵게 설계됐다. 인간은 쉽게 통과하지만 현재 최강 AI 모델들도 1% 미만의 정확도를 보인다.
시사점
GPT-5.5와 Claude Opus 4.7 같은 모델들이 일상적 언어 과제에서는 인간 수준을 넘어섰음에도, 진정한 추론 능력을 측정하는 ARC-AGI-3 앞에서는 무력함을 드러낸다.
관련 기사
DeepSeek V4 Pro, 프론티어 대비 17배 저렴하면서 GPT-5.2와 성능 동률
에이전트 벤치마크 FoodTruck Bench에서 DeepSeek V4 Pro가 GPT-5.2와 사실상 동등한 성능을 기록했다. GPT-5.2 테스트 대비 10주 만에, 비용은 약 17배 저렴하다.
Opus 4.8, ARC-AGI-3에서 1.5%·약 $10K로 새 SOTA 기록
ARC Prize가 Opus 4.8을 ARC-AGI-3 새 SOTA로 기록하며 benchmark 경쟁의 기준을 다시 낮은 숫자로 보여줬다. 점수는 1.5%, 비용은 약 $10K로, 향상은 분명하지만 일반 지능과는 아직 거리가 있다.
"Car Wash" 테스트 — 53개 LLM 중 11개만 통과한 간단한 논리 문제
Opper가 53개 주요 LLM을 대상으로 "Car Wash" 논리 테스트를 실시했다. "세차장이 50미터 앞에 있는데 걸어갈까, 운전해 갈까?"라는 단순한 질문에 단 11개 모델만 정답을 맞혔다.