GPT-5.5、人間専門家12時間の企業ネットワーク攻撃シミュレーションを11分で完了
Original: GPT5.5 slightly outperformed Mythos on a multi-step cyber-attack simulation. One challenge that took a human expert 12 hrs took GPT-5.5 only 11 min at a $1.73 cost View original →
AISIによる評価結果
英国AI安全機関(AISI)がOpenAIのGPT-5.5に対するサイバーセキュリティ評価結果を公開した。人間専門家が最大12時間を要する複雑な多段階企業ネットワーク侵入シミュレーションを、GPT-5.5はわずか11分、1.73ドルで完了した。
同じ壁を越えた2番目のモデル
AISIは4月、AnthropicのClaude Mythos Previewがこの基準を初めてクリアしたモデルだと発表していた。GPT-5.5の結果が明確な答えを示した。異なる2社の2つのモデルが同じ基準をクリアしたことは、フロンティアレベルのAIサイバー能力が業界全体で成熟しつつあることを強く示唆する。
評価タスクの構造
AISIのサイバー評価スイートは95タスクを4段階の難易度で構成する。基本タスクは2026年2月以前から主要モデルが完全に解決済み。高度なタスクはストリップされたバイナリのリバースエンジニアリング、ヒープオーバーフローやUAFの信頼性ある悪用、現実的なエンタープライズ環境への多段階攻撃チェーン実行を要求する。防御者は今すぐAIベースの検知・対応能力の導入を優先すべき段階に入った。
Related Articles
AI安全の焦点は、抽象的なリスク論から事故調査と公開報告の質へ移りつつある。OpenAIは7月25日、Hugging Face関連事案を外部助言者と安全・セキュリティ委員会の監督下で調査中だと示し、投稿は30万回超閲覧された。
OpenAIは、フロンティアモデル開発の加速が将来高まりすぎる場合、進歩を意図的に調整する道具が必要になる可能性を示した。関連声明にはAI企業従業員1,224人が署名している。
OpenAIは2026年2月の悪用対策報告で、中国起点の7件のオペレーションに関連するアカウントを停止したと発表した。活動はサイバー関連、秘密裏の影響工作、詐欺にまたがり、全体として悪用比率は依然低いとしている。