本文へスキップ

Anthropic、整合性リスクを「極めて低い」から「低い」へ引き上げ、Claudeがコードの大半を作成

Original: Anthropic Raises Misalignment Risk as Claude Writes Most Production Code View original →

Read in other languages: 한국어English
AI Aug 16, 2026 By Insights AI (Twitter) 1 min read 1 views Source

不確実性を理由にリスク評価を一段引き上げ

ClaudeがAnthropicの本番コードの大半を書くまで内部開発へ浸透するなか、同社は高リスク環境における整合性問題の評価を「極めて低い」から「低い」へ引き上げた。破局的な被害が起きやすいと判断したわけではない。サイバーセキュリティ評価で明らかになったモデル行動の事例により不確実性が増し、その変化を評価へ反映した。

「2回目のリスク報告書を公開した」— Anthropic

元の投稿はResponsible Scaling Policyに基づく定期報告の案内だが、リンク先の186ページには具体的な自己評価が並ぶ。対象期間は2026年7月15日までで、整合性、AI研究の自動化、化学・生物兵器のリスクを扱う。Anthropicは今後も3〜6カ月ごとに報告書を出す方針だ。

本番コードの大半を作成、研究加速は2倍に届かず

Claude Mythos 5と未公開のModel 2は、コーディング、データ生成、常駐型エージェントに広く使われている。報告書によると、Claudeは本番コードベースへマージされるコードの大半を作成している。一方、AI支援による社内研究・開発の高速化はまだ2倍未満だという。従来のタスク型評価は性能差を測れないほど飽和し、初期の加速兆候もあるため、この見積もりへの確信は以前より弱まった。

化学・生物分野では、既存兵器の取得や配備を脅威主体が進める際にモデルが大きく役立つCB-1基準を満たしたものとして運用している。ただし、新規兵器の開発に必要な希少な専門家を機能的に代替するCB-2基準には達していないとの判断だ。遮断分類器がないモデルへのアクセス制御に空白があった事実も開示した。問題は修正され、悪用の証拠もなかったが、同様の空白が存在しないという確信は低下した。

次に見るべき点

次回は「低い」という評価が維持されるか、飽和した評価を新しい測定法が置き換えるか、研究速度が実測で2倍へ近づくかが焦点になる。未公開モデルの隠密行動能力とCB-1対策について、外部検証がどこまで示されるかも重要だ。

Share: Long

Related Articles