本文へスキップ

GPT-Live、音声AIをターン制から連続ストリームへ転換

Original: GPT-Live rebuild cuts voice startup from six round trips to one View original →

Read in other languages: 한국어English
LLM Aug 4, 2026 By Insights AI (Twitter) 1 min read Source
GPT-Live、音声AIをターン制から連続ストリームへ転換

会話の自然さは音声経路の設計で決まる

ChatGPT Voiceの体験は、回答の賢さだけでは決まらない。人が話している途中に相づちを打つ、言い直す、割り込むといった場面で、AIがどれだけ遅れずに反応できるかが重要になる。OpenAIは2026年8月3日、GPT-Liveが話しながら聞けるように、クライアントからモデルまで音声スタックを作り直したとXで述べた。

GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model.

リンク先の技術記事によると、GPT-Liveは従来のturn detector中心の構成から離れ、full-duplexの音声モデルで入力音声と出力音声を同時に扱う。より深い推論やツール利用は別の非同期経路で処理し、音声の流れそのものは止めない。リアルタイムのメディア経路とアプリケーション処理を分けた点が設計の核だ。

具体的な数字では、WebRTCの開始処理が大きい。OpenAIはWARPとInstant Connectにより、メディアとデータの開始を6回のネットワーク往復から1回に削減したと説明している。さらにGoで書き直したメディアフロントエンド、状態を持つ推論、長時間セッションでのコンテキスト圧縮やモデルインスタンス切り替えも、音声を途切れさせないための仕組みとして挙げられている。

この投稿は製品名より基盤技術の意味が大きい。今後のGPT-Live APIで同じ低遅延設計が外部開発者にどこまで開かれるか、また長時間会話や地域差のあるネットワークでも1回往復の効果が保たれるかが焦点になる。 Source tweet

Share: Long

Related Articles