防御用エージェントのコスト構造が変わる。Gemini 3.5 Flash CyberはV8で55件の固有脆弱性を見つけ、通常Flashの47件とClaude Opus 4.6の36件を上回った。
#cybersecurity
RSSフィードGoogleのGemini Flash更新で注目されたのはモデル名の追加だけではない。出力token削減、低価格、CodeMenderと組み合わせたCyberモデルが、agent workflowの経済性を示している。
モデル評価中のセキュリティ事故をめぐり、HNでは侵害そのものよりも評価環境の設計に議論が集まった。危険な能力を測るテストは、もはや単なる実験ではない。
GoogleはGeminiを単一の旗艦モデル競争ではなく、運用コスト別のagent基盤へ寄せている。3.6 Flashは3.5 Flash比で出力tokenを17%削減し、Flash-Liteは毎秒350出力tokenを掲げた。
大規模コードのセキュリティ解析では、最高精度だけでなく実行単価が重くなる。Malte Ublは非公開Deepsec評価でGPT-5.6 Solが最高の再現率・精度だった一方、実行費用は次点の7倍超だったと述べた。
アルバータ州は約50のClaude Codeエージェントで政府コード466 million行を20時間で調査した。coding agentが開発支援を超え、公共部門のセキュリティ運用に入った事例だ。
AI jailbreakは「突破できたか」だけでは足りない段階に入った。Anthropicは7月2日、Fable 5向けclassifierがAmazon報告の手法を99%超で遮断するとし、HackerOne窓口とseverity framework草案を示した。
GPT-5.6は性能発表だけでなく、公開手順そのものがニュースだ。SolはTerminal-Bench 2.1のSOTA、Mythos Preview比で約1/3の出力tokenによるExploitBench競争力を示しつつ、初期アクセスを政府と共有済みのtrusted partnerに絞る。
GPT-5.5-CyberはCyberGymで85.6%を記録し、Codex Securityは30,000超のコードベースをスキャン済み。焦点は「見つけるAI」から「直すAI」へ移る。
AIによる脆弱性対応の焦点は、発見数から修正までの速度へ移っている。OpenAIはGPT-5.5-CyberがCyberGymで85.6%に達し、Codex Securityが3万超のコードベースを走査したと示した。
Five Eyesのサイバー情報機関が、frontier AIによる攻撃・防御能力の変化は数年先ではなく数カ月先だと警告した。企業にとっては技術部門だけの課題ではなく、事業継続と市場信頼に関わる経営リスクになる。
AI悪用の焦点はフィッシング文面から侵入後の自動化へ移っている。Anthropicは832の悪性アカウントをMITRE ATT&CKに対応付け、中リスク以上の比率が33%から56%へ上がったと示した。