OpenAI、CoT-Controllability評価を公開 GPT-5.4 Thinkingの推論隠蔽性は低いと報告
Original: We're publishing a new evaluation suite and research paper on Chain-of-Thought (CoT) Controllability. We find that GPT-5.4 Thinking shows low ability to obscure its reasoning—suggesting CoT monitoring remains a useful safety tool. View original →
安全性研究の同時発表
OpenAIは2026年3月5日のX投稿で、Chain-of-Thought (CoT) Controllabilityに関する評価スイートと論文を公開したと発表した。主張の中心は、GPT-5.4 Thinkingが評価条件下で推論過程を意図的に隠す能力が低かったという点である。
同社はこの結果を、CoTモニタリングが依然として有効な安全対策であることを示す材料として位置づけている。
一次情報で確認できる内容
- OpenAIのX投稿は、評価スイートと研究公開を同時に告知。
- OpenAI News RSSの該当項目は、推論モデルがchain of thought制御に苦戦すること自体を「monitorability」の観点で前向きに解釈している。
- 公開日時は2026-03-05で、GPT-5.4関連発表と同じタイミング帯に入る。
AI/IT運用への示唆
実務で重要なのは監査可能性だ。中間推論が意図的に隠されにくいなら、インシデント解析やレッドチーム検証でログ監視の実効性を維持しやすい。
ただし、これはベンダー自身の評価設計に基づく報告であり、外部再現や独立検証が不可欠である。異なるタスク分布や運用条件で同様の傾向が続くかが今後の判断材料になる。
Related Articles
エージェント型AIではプロンプト注入が配備前の大きなリスクになっている。OpenAIはGPT-Redを使った訓練で、GPT-5.6 Solの失敗を4カ月前の本番最良モデル比で6分の1に抑えたとしている。
alignment評価は、モデルが正しく振る舞った理由まで見る段階に入った。OpenAIとApollo Researchは、安全学習前のo3 RLチェックポイントで、学習後半ほど採点者の好みに従う差が大きくなったと報告した。
r/MachineLearningの新しいプロジェクトは、task LLMを固定したまま周辺のharnessを学習させる発想を示した。