本文へスキップ

Claude Opus 5、Fable級のcoding性能を半額圏に寄せる日常高性能モデルとroutingの狙い

Original: Introducing Claude Opus 5 View original →

Read in other languages: 한국어English
LLM Jul 25, 2026 By Insights AI 1 min read 1 views Source

今回まず目に入るのは、最高性能そのものより価格あたりの作業完了率だ。Claude Opus 5は、Anthropicの上位モデルClaude Fable 5に近いcoding・知識作業性能を、半分のコストで狙うモデルとして投入された。提供はすでに始まっており、Claude Maxのdefault model、Claude Proで使える最上位モデルという位置づけになる。API価格はOpus 4.8と同じ入力$5 per million tokens、出力$25 per million tokensだ。

この出し方は、frontier modelの競争が単純な順位争いから費用対効果へ移っていることを示している。Anthropicによると、Opus 5はFrontier-Bench v0.1で他モデルを上回り、Opus 4.8の性能を2倍以上に伸ばした。CursorBench 3.2のmax effortではFable 5の最高スコアから0.5%以内に入り、taskあたりの費用は半分。さらにARC-AGI 3では次点モデルの3倍、Zapier AutomationBenchでは同じ費用あたり約1.5倍のpass rateという数字が示された。

製品としての焦点は、長いagent作業を最後まで進められるかにある。AnthropicはOpus 5について、検証しながら反復し、複雑な作業を完了する力が強いと説明する。例として、図面を直接見られない条件でraw pixelsからcomputer vision pipelineを作り、3D FreeCAD部品を再構成したFrontier-Bench課題が挙げられている。別の例では、人気open-source package managerの実際のbugで、表面的な症状ではなく根本原因とedge caseを修正したという。

科学用途でも差分は具体的だ。Opus 5は、構造生物学、有機化学、bioinformaticsを含むAnthropicのlife sciences評価全体でOpus 4.8を上回った。特に、分光データから分子構造を推定する有機化学タスクでは内部benchmarkで10.2 percentage points、タンパク質配列の変異が機能に与える影響を予測するタスクでは7.7 percentage points高かったとされる。研究支援では、汎用chat能力よりもこうした個別タスクの改善幅が採用判断に直結しやすい。

安全面の設計も、このモデルの位置づけを決めている。AnthropicはOpus 5について、危険なdual-use capabilityのfrontierを押し広げるものではなく、生物学研究とoffensive cybersecurityではMythos 5に届かないと説明する。SafeguardsはOpus 4.8に近く、一部のcyber taskではより強いguardrailを加えた。一方で、cyber classifierの介入頻度はFable 5より約85%低い見込みだ。Claude.ai、Claude Code、Claude Coworkではflagged requestが既定でOpus 4.8にfallbackでき、APIにはautomatic fallbacksのbetaも加わる。

見るべき点は、Opus 5がFable 5を置き換えるかではない。Fable 5を最高到達点として残しつつ、日常的に回せる高性能defaultとしてOpus 5を置く構成こそが重要だ。企業や開発チームは、modelを一つ選ぶのではなく、費用、effort setting、risk controlに応じてroutingを設計することになる。次の判断材料は公開benchmarkの順位だけでなく、coding toolやenterprise agent、研究支援workflowでFable級の仕事がどれだけOpus 5へ移るかだ。

Share: Long

Related Articles