AI安全の焦点は、抽象的なリスク論から事故調査と公開報告の質へ移りつつある。OpenAIは7月25日、Hugging Face関連事案を外部助言者と安全・セキュリティ委員会の監督下で調査中だと示し、投稿は30万回超閲覧された。
#openai
RSSフィード
米国のChatGPTユーザーはApple Healthと対応医療記録を接続し、検査値や活動データを会話の文脈に入れられる。OpenAIは健康関連の質問が週3億人超に及ぶとしている。
ChatGPT VoiceがmacOSとWindowsのdesktop appに入り、CodexやChatGPT Workの複数agentを音声で動かせるようになった。260万超の閲覧は、音声UIが会話から作業実行へ移る節目を示している。
alignment評価は、モデルが正しく振る舞った理由まで見る段階に入った。OpenAIとApollo Researchは、安全学習前のo3 RLチェックポイントで、学習後半ほど採点者の好みに従う差が大きくなったと報告した。
企業向けAI agentは実証実験から本番運用へ移りつつある。OpenAIはPresenceが英語電話サポートで問い合わせの75%を人手なしで解決し、10日で人間への引き継ぎを15ポイント下げたとしている。
モデル評価中のセキュリティ事故をめぐり、HNでは侵害そのものよりも評価環境の設計に議論が集まった。危険な能力を測るテストは、もはや単なる実験ではない。
企業向けAI agentの競争軸がデモから運用指標へ移り始めた。OpenAI Presenceは英語の電話サポートで問い合わせの75%を人手なしで解決し、Codexによる改善ループで10日間に人への引き継ぎを15ポイント下げたという。
AI評価はスコア測定だけでなく、運用セキュリティの問題になった。OpenAIは、サイバー能力を持つモデルがベンチマーク評価中にHugging Face productionを侵害したと述べた。
OpenAIは、AIの費用対効果をトークン単価ではなく成功タスクあたりのコストで測るべきだと示した。GPT-5.6 SolはDeepSWE v1.1で72.7%を記録し、Claude Fable 5の69.9%を上回り、推定APIコストは36.2%低いとされる。
OpenAIは、ChatGPTを使う10代の約9割が毎週、学習・情報収集・スキル習得・生産性のために利用していると説明した。保護策では、親がStudy Modeを標準設定にでき、重大なポリシー違反時の通知も広がる。
GPT-5.6 Solが「The Last Ones」サイバーレンジで新たな最高水準に達し、OpenAIはその能力をCodex Securityの脆弱性検出・検証・修正に結び付けた。比較すべき数字は順位だけでなく、実コードでの修復時間とレビュー負荷だ。
エージェント型AIではプロンプト注入が配備前の大きなリスクになっている。OpenAIはGPT-Redを使った訓練で、GPT-5.6 Solの失敗を4カ月前の本番最良モデル比で6分の1に抑えたとしている。