ARC-AGI-3 점수 13.3%→38.3%, 모델보다 harness가 바꾼 순위
같은 GPT-5.6 Sol도 평가 harness가 reasoning을 보존하고 compaction을 쓰면 ARC-AGI-3 점수가 13.3%에서 38.3%로 뛴다. 모델 성능표를 볼 때 API 설정과 context 처리 방식까지 같이 봐야 한다는 경고다.
원문: How enabling two settings tripled our scores on the ARC-AGI-3 benchmark 원문 보기 →
ARC-AGI-3에서 달라진 것은 모델이 아니라 평가 환경이었다. OpenAI가 2026년 7월 29일 공개한 실험에 따르면 GPT-5.6 Sol은 공식 harness에서 ARC-AGI-3 public set 13.3%를 기록했지만, reasoning 보존과 compaction을 켠 Responses API harness에서는 38.3%까지 올랐다. 출력 토큰은 6분의 1 수준으로 줄었다.
ARC-AGI-3는 agent가 낯선 2D puzzle game을 탐색하면서 규칙을 추론하는 벤치마크다. 점수는 Relative Human Action Efficiency, 즉 인간 기준 대비 행동 효율을 본다. OpenAI의 설명에 따르면 평균 인간 테스터 추정치는 48%였고, frontier model은 leaderboard에서 첫 level 이후를 거의 풀지 못했다. 같은 조건에서 GPT-5.6 Sol의 초기 점수도 7.8%에 그쳤다.
차이는 memory 처리에서 나왔다. 공식 harness는 각 action 뒤 private reasoning을 버렸고, context가 길어지면 오래된 기록을 rolling truncation으로 잘라냈다. 모델 입장에서는 매 turn마다 게임을 다시 이해해야 하고, 앞서 세운 가설이나 실패 기록도 흐려진다. OpenAI는 Responses API에서 이전 response ID를 넘겨 reasoning을 이어가고, context 한계를 compaction으로 다루는 방식으로 다시 실험했다.
이 결과가 중요한 이유는 단순한 benchmark 개선이 아니라 평가 해석의 문제이기 때문이다. 모델 비교표는 흔히 하나의 숫자로 압축되지만, 실제 agent 성능은 모델 weights, tool interface, memory, context 정책, prompt 구조가 함께 만든다. ARC-AGI-3 같은 장기 task에서는 특히 harness가 모델의 학습 능력을 가리거나 키울 수 있다.
다만 이 실험은 OpenAI가 자사 production 설정에 더 가까운 환경을 적용한 결과다. 독립 leaderboard의 동일 조건 비교를 대체하지는 않는다. 앞으로 봐야 할 지점은 두 가지다. 첫째, 다른 모델도 reasoning retention과 compaction에서 비슷한 폭의 이득을 얻는가. 둘째, benchmark 운영자가 model-agnostic 공정성과 real-world deployment 재현성 사이에서 어떤 기준을 택할 것인가.
관련 기사
GPT-6 Astra, Code Arena 웹개발 1위…Claude Fable 5.1에 35점 차
실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.
GPT-6 Astra, Pro·Enterprise·API 전면 개방과 불투명 추론 논란
OpenAI가 9월 4일 GPT-6 Astra를 ChatGPT Pro, Enterprise, Business Premium 전 사용자와 API에 공개했다. 컴퓨터 사용·소프트웨어 엔지니어링 최고 성능을 주장하지만 추론 과정을 외부에서 관찰하기 어려운 '불투명 재귀' 방식을 도입해 안전성 우려도 제기됐다.
OpenAI, GPT-5.5 Instant으로 ChatGPT 기본 모델 교체 — 환각 52.5% 감소
OpenAI가 ChatGPT 기본 모델을 GPT-5.5 Instant으로 교체했다. 의료·법률·금융 등 고위험 분야에서 환각 오류가 52.5% 줄었고, 응답 길이도 30.2% 단축됐다.