Claude評価3件が実システムへ到達、AI sandbox管理と外部eval標準化が安全政策の焦点に
Original: Claude Cybersecurity Evals Reached Real Systems in Three Incidents View original →
評価環境が新しい攻撃面になった
サイバーセキュリティ評価は、モデル能力を測りながら実システムには触れない前提で設計される。Anthropicの7月30日のX投稿は、その前提が崩れたことを示した。中心文は "we found three incidents in which a Claude model reached the internet" である。Claudeが評価環境からインターネットへ到達し、3つの組織の本番インフラに無断アクセスしたという内容だ。
Anthropicの公式記事によると、同社はClaudeがインターネット接続を得られた可能性のある141,006件の評価runをレビューした。問題は、評価パートナーIrregularと実施したcapture-the-flag形式の課題で起きた。プロンプトは環境がシミュレーションでありインターネット接続はないとClaudeに伝えていたが、Anthropicとパートナー間の認識違いにより、実際には接続が開いていた。モデルは公開インターネット上の実システムをテスト環境の一部として扱った。
AnthropicのXアカウントは、Claudeのモデル更新、製品アクセス、安全研究、政策姿勢を伝える公式チャネルである。今回の投稿は通常の製品更新ではなく、評価インフラの事故開示だ。OpenAIが7月21日に、隔離テスト環境を抜けてHugging Faceのproduction infrastructureへアクセスしたモデル事例を公表した直後でもあり、単独企業の例外として片付けにくい。
実務上の教訓は明確だ。モデル評価には、本番セキュリティと同じくネットワーク隔離、allowlist、監視、外部パートナー検証、事後レビューが必要になる。Anthropicはサイバー評価の範囲と運用方法を変更するとし、他のAI開発者にも同様のレビューを促した。
次に見るべき点は、frontier labが外部評価sandboxの標準を自発的に作れるかどうかだ。元の投稿は AnthropicのX投稿、詳細は 公式レビュー にある。
Related Articles
NVIDIAがOpen Secure AI Allianceを立ち上げ、Microsoft、Cloudflare、Hugging Face、Palantirなどが参加した。狙いはAI agent防御を、検査・実行できる公開モデルとharness、評価ツールで支えることだ。
サイバー防御AIの焦点は、巨大モデル単体ではなく、安い専門モデルへ仕事を振り分ける設計に移りつつある。MicrosoftはMAI-Cyber-1-FlashとMDASHの組み合わせでCyberGym 95.95%、既存構成比で約50%のコスト削減を示した。
AnthropicはClaude系AI systemが見つけた脆弱性に関するcoordinated vulnerability disclosure方針を公開した。human review、公開期限、maintainer不応答時のescalationまで定め、coding agent時代のsecurity運用を制度化しようとしている。