Grok 4.6、知能指数61でGPT-5.6 Solと並び1タスク$0.84の費用効率で最前線入り
Original: Grok 4.6 Scores 61, Matching GPT-5.6 Sol at $0.84 per Task View original →
知能指数61と1タスク$0.84の意味
Grok 4.6はArtificial Analysis Intelligence Indexで61を獲得し、最大設定のGPT-5.6 Solと同点になった。最大設定のClaude Opus 5は63、フォールバック付きClaude Fable 5は62で、差は1〜2ポイントに縮まった。さらに重要なのが費用である。評価では1タスク当たり$0.84、API価格は入力100万トークン当たり$2、出力100万トークン当たり$6とされた。最先端モデルを選ぶ基準は、順位表の一点だけでなく、実務を完了するまでの総費用へ広がっている。
「Grok 4.6はArtificial Analysisの知能指数で61を獲得し、GPT-5.6 Solと並んで最前線に加わった」
これは2026年8月12日15時39分(UTC)に公開されたArtificial Analysisの投稿の要点である。同投稿によると、Grok 4.6は約1カ月前のGrok 4.5から5ポイント、Grok 4.3から23ポイント伸ばした。その数分前のSpaceXAI公式投稿は、Grok 4.5と同じ価格で性能を引き上げたとしている。
総合点より注目すべきエージェント性能
導入判断には総合指数より内訳が重要だ。長時間の知識作業を測る非公開評価AA-Briefcaseで、Grok 4.6はElo 1577を記録し、Claude Fable 5級に入った。平均約53ターン、入力約5億トークンでタスクを完了したのに対し、最大設定のClaude Opus 5は約103ターン、入力約20億トークンを使ったとされる。少ない対話回数と入力量は、長時間稼働するエージェントの遅延と費用の双方に直結する。
銀行業務評価のτ³-Bankingでは50.7%で、Qwen3.8 Maxの51.3%に迫った。Terminal-Bench v2.1は88.4%だった。コンテキスト長はGrok 4.5と同じ500Kである。一方、キャッシュヒット時の入力価格は100万トークン当たり$0.30から$0.50へ上がっており、同じ情報を繰り返し参照するワークロードでは見逃せない。
Artificial Analysisはモデルの品質、速度、価格、エージェント性能を継続的に比較する独立分析アカウントである。短い製品説明に比較可能な実行データを加えた点で今回の投稿は有用だ。ただし、単一の総合指数だけでは業務別の失敗パターンを把握できない。AA-Briefcaseが非公開であるため、外部研究者が同じ条件を直接再現しにくい点にも注意が必要だ。
次に確認すべきこと
今後の焦点は、コーディング、ブラウザー操作、長時間のツール呼び出しでも少ないターン数を維持できるかどうかだ。500K上限付近の安定性、キャッシュ利用後の総費用、独立した実務評価での再現も必要になる。測定された効率が本番環境でも続けば、最先端モデルの評価軸は最高スコアから「1ドルで安定して完了できる仕事量」へさらに近づく。
Related Articles
718点を集めたHNの関心は順位よりも、安く速いreasoning modelを日常のagent作業に入れられるかに向かった。
30Bのagentic modelを消費者向けGPU 1枚で動かせるかが焦点だ。MetaはApache 2.0のweights、約4-bit量子化、DFlash speculative decodingを組み合わせた。
Open-weight LLMの争点は、単価比較からエージェント実装の設計へ移っている。OpenRouterはJune 2026の4モデルを挙げ、DeepSeek V4 FlashのSWE-bench 79.0%、GLM 5.2のAA Index 51、1M contextを具体例にした。