本文へスキップ

OpenAI、音声認識APIをfile用とlive用へ分離 GPT TranscribeがGA

Original: GPT Transcribe and GPT Live Transcribe View original →

Read in other languages: 한국어English
AI Jul 29, 2026 By Insights AI 1 min read Source

音声AIを組み込む開発者は、まず「録音済みか、live streamか」を選ぶ形になる。OpenAIは2026年7月28日のrelease notesで、GPT TranscribeとGPT Live TranscribeをGAにした。前者はcompleted audio fileやRealtimeのcommitted turnのfinal transcript向け、後者はlive audioから低遅延のtranscript deltaを得る用途向けだ。

価格と用途も分かれた。OpenAIのmodel docsでは、GPT TranscribeはfileとRealtime input transcription用のspeech-to-text modelで、価格は1分あたり$0.0045。GPT Live Transcribeはrealtime transcription用のstreaming modelで、価格は1分あたり$0.017と示されている。会議録、support archive、podcast処理のようなbounded audioと、call center assistantやlive captionのような低遅延用途では、評価すべき軸が違う。

API面で重要なのはcontext入力だ。両modelはfree-formのprompt、literal termを渡すkeywords、複数の想定入力言語を渡すlanguagesを受け取る。domain term、略語、multilingual audio、code-switchingが入る現場では、この差がtranscript品質に直結する。

OpenAIのtranscription guideは、新しいintegrationの出発点としてfile transcriptionにはgpt-transcribe、realtime transcriptionにはgpt-live-transcribeを推奨している。一方で、speaker-labeled transcriptはgpt-4o-transcribe-diarize、subtitle timestampや英語translationはwhisper-1を使う形を残した。すべての音声機能を2モデルに統合したのではなく、一般的なtranscriptionのdefault pathを整理した変更だ。

次の焦点は、平均的なword error rateではなくworkflow別の失敗コストになる。OpenAIのdocsも、target language、accent、code-switching、background noise、name、number、date、alphanumeric stringを実データで試すよう促している。voice interfaceがagent UIに広がるほど、transcriptionは補助機能ではなく、後続tool callの入力品質を決める最初の工程になる。

Share: Long

Related Articles