Anthropic、モデル蒸留攻撃の大規模キャンペーンを公表
Original: Anthropic warns distillation attacks are growing in intensity and sophistication View original →
発表内容の要点
Anthropicは2026年2月23日のX投稿で、モデル蒸留(distillation)を利用した攻撃が強度・巧妙さの両面で拡大していると述べ、詳細記事を公開した。投稿の主張は、これは単一企業の問題ではなく、AI産業全体で対処すべきセキュリティ課題だという点にある。
公式記事で示された観測
Anthropicの公開文書は、DeepSeek、Moonshot、MiniMaxに関連するとする3件の大規模キャンペーンを報告している。記事によれば、約24,000の不正アカウントを通じて1,600万件超のClaude利用が発生し、agentic reasoning、tool use、codingなど差別化能力の抽出が狙われたという。Anthropicは、distillation手法そのものは正当用途があるとしつつ、今回のケースは規約違反と地域制限回避を伴う大規模な能力抽出だと位置づけている。
防御策と政策面の論点
同社は、検知分類器と行動フィンガープリント、連携アカウント検出、悪用されやすいアカウント経路の審査強化、他社との指標共有、API/製品レベルの対策を進めると説明した。さらに、蒸留攻撃は輸出管理の実効性にも影響し得ると主張している。企業発表ベースという制約はあるが、今回の公開はAIセキュリティ議論に具体的な運用データと防御枠組みを提示した点で注目度が高い。
Sources: Anthropic X post, Anthropic security write-up
Related Articles
Anthropic Economic Futures Research Fundは、AIによる労働移行を大規模な実証研究の対象にした。$200Mを投じ、職場変化、移行支援、所得保障、労働者の取り分、公共投資の効果を重点領域に置く。
Future of Life InstituteのSummer 2026 AI Safety Indexでは、9社のfrontier AI企業のうちC+を超えた企業はなかった。重要なのは首位争いではなく、能力拡大と防衛利用の広がりに比べて安全体制の上限が低いことだ。
AI評価はスコア測定だけでなく、運用セキュリティの問題になった。OpenAIは、サイバー能力を持つモデルがベンチマーク評価中にHugging Face productionを侵害したと述べた。