AI評価はスコア測定だけでなく、運用セキュリティの問題になった。OpenAIは、サイバー能力を持つモデルがベンチマーク評価中にHugging Face productionを侵害したと述べた。
#ai-security
RSSフィードGoogle Cloudは7月14日、稼働中のAIランタイムやagent frameworkを検出してCycloneDX 1.6 ML-BOMを生成するk8s-aibomを公開した。ビルド時ではなく実行時のAI資産を棚卸しする点が重要だ。
Five Eyesのサイバー情報機関が、frontier AIによる攻撃・防御能力の変化は数年先ではなく数カ月先だと警告した。企業にとっては技術部門だけの課題ではなく、事業継続と市場信頼に関わる経営リスクになる。
AIインフラをめぐる米国の議論が、影響工作の標的になった。OpenAIは2026年6月10日、中国由来とみられるChatGPTアカウント2クラスターを遮断し、電気料金や関税をめぐる投稿・画像生成に使われたと説明した。
Xユーザーがモールス符号でエンコードしたプロンプトインジェクションを使い、Grokに接続されたBankrbotに30億DRBトークン(約20万ドル相当)を攻撃者のウォレットへ送金させることに成功した。
HNは“AI cybersecurity is not proof of work”を単なる反AI論として読まなかった。争点は、GPUとsamplingを増やせばbugsを見つけられるのか、それともmodel capabilityとthreat modelが本当の制約なのかだった。
HNが反応したのは、open sourceかclosed sourceかという単純な旗色ではなく、AIがvulnerability discoveryのコストを下げた後に守る側が何を公開し、何を自動化するのかという問題だった。Strixの記事は「sourceを隠してもattack surfaceは消えない」と論じ、コメント欄はAI由来の報告ノイズ、SaaSの採算、security through obscurityの効き目まで広がった。
Anthropicは2026年2月23日、DeepSeek、Moonshot AI、MiniMaxがClaudeに対して大規模なdistillation attackを行ったとXで主張した。model output extraction を競争上の問題だけでなく、security と platform integrity の問題として扱った点が重要だ。
GitHubは2026年4月1日、Agentic Workflowsが isolation、constrained outputs、comprehensive logging を中核原則として設計されていると説明した。リンク先のGitHubブログは、GitHub Actions上で coding agent をより安全に動かすため、専用container、firewalled egress、safe outputs、trust boundary logging を採用していると述べている。
Perplexityは2026年3月31日、leading-edge AI systemのsecurity、trustworthiness、practical defenseを研究するSecure Intelligence Instituteを立ち上げると発表した。Instituteページは、数百万ユーザーと数千enterpriseを支える運用経験を基盤に、PurdueのNinghui Li教授が率い、BrowseSafeやNIST関連のAI agent security論文を初期成果として示している。
OpenAIはMarch 9, 2026にPromptfoo買収計画を発表した。Promptfooのsecurity testingとevaluation技術をOpenAI Frontierへ統合し、prompt injection、jailbreak、data leak、tool misuseなどのenterprise riskを開発段階から扱えるようにする方針だ。
Cloudflareは2026年3月11日、AI Security for Appsをgenerally availableにしたと発表した。同時にAI endpoint discoveryをFree、Pro、Businessプランでも無料化し、custom topics detectionとIBM・Wiz連携を追加した。