GPT-Live、音声AIをターン制から連続ストリームへ転換
Original: GPT-Live rebuild cuts voice startup from six round trips to one View original →
会話の自然さは音声経路の設計で決まる
ChatGPT Voiceの体験は、回答の賢さだけでは決まらない。人が話している途中に相づちを打つ、言い直す、割り込むといった場面で、AIがどれだけ遅れずに反応できるかが重要になる。OpenAIは2026年8月3日、GPT-Liveが話しながら聞けるように、クライアントからモデルまで音声スタックを作り直したとXで述べた。
GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model.
リンク先の技術記事によると、GPT-Liveは従来のturn detector中心の構成から離れ、full-duplexの音声モデルで入力音声と出力音声を同時に扱う。より深い推論やツール利用は別の非同期経路で処理し、音声の流れそのものは止めない。リアルタイムのメディア経路とアプリケーション処理を分けた点が設計の核だ。
具体的な数字では、WebRTCの開始処理が大きい。OpenAIはWARPとInstant Connectにより、メディアとデータの開始を6回のネットワーク往復から1回に削減したと説明している。さらにGoで書き直したメディアフロントエンド、状態を持つ推論、長時間セッションでのコンテキスト圧縮やモデルインスタンス切り替えも、音声を途切れさせないための仕組みとして挙げられている。
この投稿は製品名より基盤技術の意味が大きい。今後のGPT-Live APIで同じ低遅延設計が外部開発者にどこまで開かれるか、また長時間会話や地域差のあるネットワークでも1回往復の効果が保たれるかが焦点になる。 Source tweet
Related Articles
ChatGPTの音声体験は、発話を待つ方式から同時に聞いて話す方式へ進む。OpenAIのGPT-Live投稿は51万回以上表示され、音声AIの競争軸が遅延と割り込み処理に移りつつあることを示した。
GPT-5.6 Solは、reasoningを保持しcompactionを使うharnessではARC-AGI-3のスコアを13.3%から38.3%へ伸ばした。モデル比較では、重みだけでなくmemoryとcontext設計も読まなければならない。
フロンティアモデル競争は推論コストの競争にもなっている。OpenAIはGPT-5.6 Solを配備後の最適化に使い、サービング費用20%削減とトークン生成効率15%超改善を得たとした。