ARC-AGI-3が13.3%→38.3%、評価harnessが変える順位
Original: How enabling two settings tripled our scores on the ARC-AGI-3 benchmark View original →
ARC-AGI-3で大きく動いたのは、モデルそのものではなく評価環境だった。OpenAIが2026年7月29日に公開した実験では、GPT-5.6 Solは公式harnessのARC-AGI-3 public setで13.3%だったが、reasoning保持とcompactionを有効にしたResponses API harnessでは38.3%まで上がった。出力トークンも6分の1に減っている。
ARC-AGI-3は、agentが未知の2D puzzle gameを探索し、明示されていないルールを推論できるかを見るbenchmarkだ。指標はRelative Human Action Efficiencyで、人間の行動効率を基準にする。OpenAIの説明によると、平均的な人間テスターの推定値は48%。一方、公開leaderboardではfrontier modelが第1 levelの先をほとんど解けていない。GPT-5.6 Solも当初は7.8%にとどまっていた。
問題はmemoryの扱いにあった。公式harnessでは各actionの後にprivate reasoningが捨てられ、モデルには過去の手順の記録だけが残る。さらにcontextが175,000文字を超えると古いmessageをrolling truncationで削るため、初期の観察や試行錯誤も失われる。長いtaskでは、agentが毎turnゲームを読み直すような状態になりやすい。
OpenAIはこの条件を、ChatGPTやCodexで使う運用環境に近づけた。Responses APIで前回のresponse IDを渡すと、tool callやturnをまたいでreasoningを保持できる。長くなったcontextは古い情報を単純に捨てるのではなく、compactionで要約して続ける。これにより、GPT-5.6 Solは各action前の考え直しを減らし、学んだルールを長いrunの中で保ちやすくなった。
この話の焦点は、ひとつのスコア上昇にとどまらない。agent評価の数字は、model weightsだけでなくtool interface、memory、context policy、prompt設計の合成結果だ。長期taskでは、汎用harnessが能力を低く見せることもあれば、最適化されたharnessが比較の読み方を難しくすることもある。
もちろん、これはOpenAI自身の実装による結果であり、独立したleaderboard比較を置き換えるものではない。次に見るべき点は、他のfrontier modelもreasoning retentionとcompactionで同じように伸びるのか、それともGPT-5.6 Solに特に効く条件なのかだ。
Related Articles
OpenAIは、AIの費用対効果をトークン単価ではなく成功タスクあたりのコストで測るべきだと示した。GPT-5.6 SolはDeepSWE v1.1で72.7%を記録し、Claude Fable 5の69.9%を上回り、推定APIコストは36.2%低いとされる。
alignment評価は、モデルが正しく振る舞った理由まで見る段階に入った。OpenAIとApollo Researchは、安全学習前のo3 RLチェックポイントで、学習後半ほど採点者の好みに従う差が大きくなったと報告した。
ChatGPT VoiceがmacOSとWindowsのdesktop appに入り、CodexやChatGPT Workの複数agentを音声で動かせるようになった。260万超の閲覧は、音声UIが会話から作業実行へ移る節目を示している。