Grok 4.6がArtificial Analysisの知能指数で61を獲得し、GPT-5.6 Solと並んだ。評価1タスク当たり$0.84という結果は、最先端モデルの競争軸が最高点だけでなくエージェント効率と総費用へ移っていることを示す。
Grok 4.6がArtificial Analysisの知能指数で61を獲得し、GPT-5.6 Solと並んだ。評価1タスク当たり$0.84という結果は、最先端モデルの競争軸が最高点だけでなくエージェント効率と総費用へ移っていることを示す。
コーディングエージェント評価はpass@1だけでは足りない。Together AIはDeepSWE分析で、Kimi K3がFable 5に近いPass@1を示しつつ、rollout費用は約3分の1だったと述べた。
235件のHNコメントが掘り下げたのは、reasoning modelの正答率ではなく、chain-of-thoughtが本当に理由を示しているのかという点だった。
高性能モデルの競争軸が、最高点だけでなく費用対効果へ移っている。Claude Opus 5はFable 5に近いcoding・知識作業性能を掲げ、API価格は入力$5/M・出力$25/M tokensに据え置かれた。
大規模コードのセキュリティ解析では、最高精度だけでなく実行単価が重くなる。Malte Ublは非公開Deepsec評価でGPT-5.6 Solが最高の再現率・精度だった一方、実行費用は次点の7倍超だったと述べた。
OpenAIは、AIの費用対効果をトークン単価ではなく成功タスクあたりのコストで測るべきだと示した。GPT-5.6 SolはDeepSWE v1.1で72.7%を記録し、Claude Fable 5の69.9%を上回り、推定APIコストは36.2%低いとされる。
OpenAIはSWE-Bench Proの公開taskの30%が壊れており、frontier coding能力を安定して測れないとした。隠れた要件、矛盾した指示、厳しすぎるtest、不完全な採点基準が原因として挙げられている。
GPT-5.6 Sol、Terra、LunaがChatGPT、Codex、APIで利用段階に入った。OpenAIはCoding Agent Index 80.0、Claude Fable 5比+2.8点、出力tokenと時間は半分未満という比較も示した。
agent改善は必ずしも新モデルやfine-tuningではない。Microsoft ResearchのSkillOptはGPT-5.5 direct chatの6 benchmark平均を58.8から82.3へ上げ、52評価セルすべてで最高または同率最高だった。
生物学向けAI agentの評価は、知識問題から研究判断の再現へ移っている。GeneBench-Proは129件の計算生物学問題を扱い、GPT-5.6 Solでも最高推論設定で28.7%、Pro modeで31.5%にとどまる。
HNでの関心はbenchmark表だけでなく、実際のcoding loopで速く安定して使えるかに集まった。
AIモデル比較で知られるArenaが、商用評価サービスの開始から8カ月で年換算$100Mの売上規模に到達した。1,000万件超のユーザー評価が、モデル研究所と企業向けの有料インフラになりつつある。