腐食中
OpenAI、GPT-5クラスの推論を備えたリアルタイム音声AIモデル3種を公開
Read in other languages: 한국어
3モデルの概要
OpenAIは2026年5月7日、開発者が新世代の音声アプリを構築できるリアルタイムオーディオモデル3種をAPIを通じて公開した。各モデルは異なるユースケースを対象としている。
- GPT-Realtime-2: OpenAI初のGPT-5クラスの推論能力を備えたリアルタイム音声モデル。複雑なリクエストへの対応、ツールの呼び出し、割り込みへの対処を行いながら自然な会話の流れを維持する。Big Bench Audioでは前世代モデル比15.2%高いスコアを記録。
- GPT-Realtime-Translate: 話者のペースに合わせて70以上の入力言語を13の出力言語へリアルタイムで翻訳するモデル。
- GPT-Realtime-Whisper: 話者が話しながらリアルタイムで文字起こしを行うストリーミング音声テキスト変換モデル。
価格
GPT-Realtime-2は音声入力100万トークンあたり32ドル、出力100万トークンあたり64ドル。GPT-Realtime-Translateは1分あたり0.034ドル、GPT-Realtime-Whisperは1分あたり0.017ドル。
意義
GPT-5クラスの推論をリアルタイム音声モデルに組み込むことは、単純な音声コマンドを超えて複雑なマルチステップタスクを音声で処理するエージェントの実現に向けた重要な一歩だ。詳細はOpenAI公式発表を参照。
Related Articles
LLM X/Twitter 4d ago 1 min read
有料版ChatGPTではInstantとdeep reasoningの両方をGPT-5.6 Solが担う形になる。OpenAIは金融、医療、法律を含む事実性評価で、GPT-5.5 Instantより事実誤りのある回答が68%少なかったとしている。
LLM X/Twitter Jul 24, 2026 1 min read
ChatGPT VoiceがmacOSとWindowsのdesktop appに入り、CodexやChatGPT Workの複数agentを音声で動かせるようになった。260万超の閲覧は、音声UIが会話から作業実行へ移る節目を示している。
LLM Jul 31, 2026 1 min read
OpenAIはGPT-5.6 Lunaを80%、Terraを20%値下げし、Sol APIにはStandard比で最大2.5倍速いFast modeを追加した。モデル競争の焦点が、性能だけでなく運用単価にも広がっている。