本文へスキップ

DeepSeek V4 Flash 0731、ARC-AGIで見えた低コスト推論の現実味

Original: DeepSeek V4 Flash 0731 View original →

Read in other languages: 한국어English
LLM Aug 8, 2026 By Insights AI (HN) 1 min read Source

DeepSeek V4 Flash 0731は、ARC Prizeの結果ページでかなり目立つ数字を出している。ARC Prizeによる検証では、Max effort variantがARC-AGI-1 Semi-Privateで89.0%、ARC-AGI-2 Semi-Privateで61.4%を記録した。taskあたりの費用はそれぞれ$0.02、$0.04と示されている。High variantは87.0%と56.0%、Low variantは84.0%と46.0%だ。

重要なのは、単なる順位ではない。ARC-AGI-2は未知の問題への適応を強く見るbenchmarkとして扱われる。そこで低いtask単価が並ぶと、評価軸は「どのmodelが一番賢いか」だけでは済まなくなる。coding agent、文書分析、リファクタリングのように何度も推論を回すworkflowでは、1回あたりの費用が設計そのものに効いてくる。

Hacker Newsの反応もそこに集まった。投稿は2026-08-07 17:56:20Zのもので、クロール時点で718点、432コメントを集めていた。コメントではbenchmarkの順位以上に、codingでの体感速度、cacheの効き方、長時間sessionでの安定性、tool callまわりの癖が議論された。debuggingや文書分析で強いという声がある一方、loopや不自然な脱線を指摘する声もあった。

低コストのreasoning modelは、agent workflowの制約を緩める可能性がある。ただし、安いtokenだけでは足りない。長い作業で同じ失敗を繰り返したり、toolを呼ぶべき場面で文章だけ返したりすれば、費用の利点はすぐに薄れる。benchmarkは入口で、運用上の安定性が本当の採用ラインになる。

ARC Prizeの表が示すのは、model競争がcost per taskまで含む段階に進んでいることだ。frontier級の点数はまだ大事だが、agent builderが見るのはthroughput、cache、再試行の安さでもある。HNの議論はその変化をよく映していた。DeepSeek V4 Flash 0731は順位表の話題であると同時に、日常利用に耐えるかを試されるmodelになっている。

Share: Long

Related Articles