本文へスキップ

Kimi K3、DeepSWEでFable 5比2.8倍のドル当たり解決数

Original: Kimi K3 gets 2.8x more DeepSWE solves per dollar than Fable 5 View original →

Read in other languages: 한국어English
LLM Aug 3, 2026 By Insights AI (Twitter) 1 min read 1 views Source
Kimi K3、DeepSWEでFable 5比2.8倍のドル当たり解決数

コーディング評価は費用効率の比較へ

大規模にコーディングエージェントを回すチームにとって、重要なのは最高スコアだけではない。Together AIは2026年8月3日のX投稿で、Kimi K3 MaxがDeepSWE分析において「2.8× more solved tasks per dollar」を出したと書いた。Fable 5 xhighのPass@1に近づきながら、rollout費用は約3分の1だったという内容だ。

Togetherの関連分析では、DeepSWEは実在するopen-source repositoryの長期feature request 113件を使い、各4回試行してhidden test suiteで採点するソフトウェア工学ベンチマークと説明されている。pass@1ではFable 5 xhighが69.9%、Kimi K3 maxが68.5%で、差は1.4ポイントだ。しかし複数回試行では逆転し、pass@2はKimiが82.0対80.2、pass@4も89.4%対88.5%で上回る。

費用差はさらに大きい。Togetherの分析では、Kimi K3はrolloutあたり$4.65、Fable 5 xhighは$13.41。452回rollout全体では、それぞれ$2,103と$6,010になる。解決タスクあたりで見ると、Kimi K3は$100あたり14.7件、Fable 5は5.3件だ。test suiteで失敗を検出し、再試行できるagent workflowでは、この差がモデル選択を変える。

一方で、Fable 5は初回の安定性と4回連続成功したタスク数で強い。Kimi K3はretryで広く拾うモデルという見方が近い。次に見るべき点は、公開重みと推論最適化でKimiの遅延がどこまで下がるか、そしてDeepSWEの傾向が実企業のprivate repositoryとCIでも維持されるかだ。元の投稿はXで読める

Share: Long

Related Articles