本文へスキップ

Grok 4.6、知能指数61でGPT-5.6 Solと並び1タスク$0.84の費用効率で最前線入り

Original: Grok 4.6 Scores 61, Matching GPT-5.6 Sol at $0.84 per Task View original →

Read in other languages: 한국어English
LLM Aug 14, 2026 By Insights AI (Twitter) 1 min read 1 views Source
Grok 4.6、知能指数61でGPT-5.6 Solと並び1タスク$0.84の費用効率で最前線入り

知能指数61と1タスク$0.84の意味

Grok 4.6はArtificial Analysis Intelligence Indexで61を獲得し、最大設定のGPT-5.6 Solと同点になった。最大設定のClaude Opus 5は63、フォールバック付きClaude Fable 5は62で、差は1〜2ポイントに縮まった。さらに重要なのが費用である。評価では1タスク当たり$0.84、API価格は入力100万トークン当たり$2、出力100万トークン当たり$6とされた。最先端モデルを選ぶ基準は、順位表の一点だけでなく、実務を完了するまでの総費用へ広がっている。

「Grok 4.6はArtificial Analysisの知能指数で61を獲得し、GPT-5.6 Solと並んで最前線に加わった」

これは2026年8月12日15時39分(UTC)に公開されたArtificial Analysisの投稿の要点である。同投稿によると、Grok 4.6は約1カ月前のGrok 4.5から5ポイント、Grok 4.3から23ポイント伸ばした。その数分前のSpaceXAI公式投稿は、Grok 4.5と同じ価格で性能を引き上げたとしている。

総合点より注目すべきエージェント性能

導入判断には総合指数より内訳が重要だ。長時間の知識作業を測る非公開評価AA-Briefcaseで、Grok 4.6はElo 1577を記録し、Claude Fable 5級に入った。平均約53ターン、入力約5億トークンでタスクを完了したのに対し、最大設定のClaude Opus 5は約103ターン、入力約20億トークンを使ったとされる。少ない対話回数と入力量は、長時間稼働するエージェントの遅延と費用の双方に直結する。

銀行業務評価のτ³-Bankingでは50.7%で、Qwen3.8 Maxの51.3%に迫った。Terminal-Bench v2.1は88.4%だった。コンテキスト長はGrok 4.5と同じ500Kである。一方、キャッシュヒット時の入力価格は100万トークン当たり$0.30から$0.50へ上がっており、同じ情報を繰り返し参照するワークロードでは見逃せない。

Artificial Analysisはモデルの品質、速度、価格、エージェント性能を継続的に比較する独立分析アカウントである。短い製品説明に比較可能な実行データを加えた点で今回の投稿は有用だ。ただし、単一の総合指数だけでは業務別の失敗パターンを把握できない。AA-Briefcaseが非公開であるため、外部研究者が同じ条件を直接再現しにくい点にも注意が必要だ。

次に確認すべきこと

今後の焦点は、コーディング、ブラウザー操作、長時間のツール呼び出しでも少ないターン数を維持できるかどうかだ。500K上限付近の安定性、キャッシュ利用後の総費用、独立した実務評価での再現も必要になる。測定された効率が本番環境でも続けば、最先端モデルの評価軸は最高スコアから「1ドルで安定して完了できる仕事量」へさらに近づく。

出典:Artificial Analysis on X

Share: Long

Related Articles