Claude Opus 5がGitHub Copilotのモデル選択肢に入り、長時間のコード変更や回帰検証をGitHubの作業面から直接任せやすくなる。対象はPro+、Max、Business、Enterpriseで、VS Code、Copilot CLI、cloud agent、JetBrainsなどへ段階的に展開される。
#coding-agents
RSSフィード高性能モデルの競争軸が、最高点だけでなく費用対効果へ移っている。Claude Opus 5はFable 5に近いcoding・知識作業性能を掲げ、API価格は入力$5/M・出力$25/M tokensに据え置かれた。
coding agentを増やせば人間のreviewを消せるのか。議論は自動化の量ではなく、検証と運用リスクに向かった。
公開モデル向けコーディングエージェントは、モデル名だけでなくハーネスとSDK互換性で差が出る段階に入った。OpenInterpreterはRust製Kimi K3ネイティブハーネス、Apacheライセンス、ACPとCodex SDK互換を示した。
HNで注目されたのは、local model、cloud fallback、coding支援、closed-source appが同居する緊張感だった。
HNで議論になったのはRust製TUIやACP対応だけではない。telemetry、fork、provider lock-inへの不安が、open source化の意味を大きくした。
エージェントに実行権限を渡すほど便利になる一方、ローカル環境をそのまま触らせる不安も大きい。Clawkは作業場所をネットワーク制限付きの使い捨てVMへ移す。
OpenAIはSWE-Bench Proの公開taskの30%が壊れており、frontier coding能力を安定して測れないとした。隠れた要件、矛盾した指示、厳しすぎるtest、不完全な採点基準が原因として挙げられている。
HNでの論点はpass rateではなく、同じ成功に必要なtoken量と探索の少なさだった。
AI codingは単一assistantの選択から、複数agentの運用へ移っている。Omnigentはshared sessions、guardrails、human-in-the-loop workflowを持つopen-source meta-harnessだ。
Copilotのmodel pickerに初めてopen-weightモデルが入る。GitHubはKimi K2.7 CodeをVS Codeから段階提供し、BusinessとEnterpriseでは管理者のpolicy有効化が必要だとしている。
HNでの関心はbenchmark表だけでなく、実際のcoding loopで速く安定して使えるかに集まった。