OpenAI、音声認識APIをfile用とlive用へ分離 GPT TranscribeがGA
Original: GPT Transcribe and GPT Live Transcribe View original →
音声AIを組み込む開発者は、まず「録音済みか、live streamか」を選ぶ形になる。OpenAIは2026年7月28日のrelease notesで、GPT TranscribeとGPT Live TranscribeをGAにした。前者はcompleted audio fileやRealtimeのcommitted turnのfinal transcript向け、後者はlive audioから低遅延のtranscript deltaを得る用途向けだ。
価格と用途も分かれた。OpenAIのmodel docsでは、GPT TranscribeはfileとRealtime input transcription用のspeech-to-text modelで、価格は1分あたり$0.0045。GPT Live Transcribeはrealtime transcription用のstreaming modelで、価格は1分あたり$0.017と示されている。会議録、support archive、podcast処理のようなbounded audioと、call center assistantやlive captionのような低遅延用途では、評価すべき軸が違う。
API面で重要なのはcontext入力だ。両modelはfree-formのprompt、literal termを渡すkeywords、複数の想定入力言語を渡すlanguagesを受け取る。domain term、略語、multilingual audio、code-switchingが入る現場では、この差がtranscript品質に直結する。
OpenAIのtranscription guideは、新しいintegrationの出発点としてfile transcriptionにはgpt-transcribe、realtime transcriptionにはgpt-live-transcribeを推奨している。一方で、speaker-labeled transcriptはgpt-4o-transcribe-diarize、subtitle timestampや英語translationはwhisper-1を使う形を残した。すべての音声機能を2モデルに統合したのではなく、一般的なtranscriptionのdefault pathを整理した変更だ。
次の焦点は、平均的なword error rateではなくworkflow別の失敗コストになる。OpenAIのdocsも、target language、accent、code-switching、background noise、name、number、date、alphanumeric stringを実データで試すよう促している。voice interfaceがagent UIに広がるほど、transcriptionは補助機能ではなく、後続tool callの入力品質を決める最初の工程になる。
Related Articles
モデル評価中のセキュリティ事故をめぐり、HNでは侵害そのものよりも評価環境の設計に議論が集まった。危険な能力を測るテストは、もはや単なる実験ではない。
AI評価はスコア測定だけでなく、運用セキュリティの問題になった。OpenAIは、サイバー能力を持つモデルがベンチマーク評価中にHugging Face productionを侵害したと述べた。
米国のChatGPTユーザーはApple Healthと対応医療記録を接続し、検査値や活動データを会話の文脈に入れられる。OpenAIは健康関連の質問が週3億人超に及ぶとしている。