企業向けAI agentは実証実験から本番運用へ移りつつある。OpenAIはPresenceが英語電話サポートで問い合わせの75%を人手なしで解決し、10日で人間への引き継ぎを15ポイント下げたとしている。
#voice-ai
RSSフィードChatGPTの音声体験は、発話を待つ方式から同時に聞いて話す方式へ進む。OpenAIのGPT-Live投稿は51万回以上表示され、音声AIの競争軸が遅延と割り込み処理に移りつつあることを示した。
xAIが企業向けカスタマーサポートに特化した音声エージェント「Grok Voice Think Fast 1.0」を発表。低遅延の応答と自然な会話フローを重視した製品設計となっている。
OpenAIがRealtime APIに推論機能を持つ音声モデル3種を追加。開発者はGPT-5クラスの知性を持つリアルタイム音声アプリケーションを構築できるようになった。
OpenAIがGPT-5クラスの推論能力を備えたリアルタイム音声モデル「GPT-Realtime-2」をAPIで公開した。リアルタイム翻訳モデル「GPT-Realtime-Translate」とストリーミング文字起こしモデル「GPT-Realtime-Whisper」も同時リリースされた。
ElevenLabsはARR5億ドル到達を発表し、BlackRock、NVIDIA、Deutsche TelekomらがシリーズDラウンドに新規参加したことを明らかにした。2026年Q1だけで純新規ARR1億ドルを追加した。
HNの反応は「また音声モデルが来た」よりも、「今回は何が公開されたのか」を確かめる方向に向いた。VibeVoiceは長時間ASRとリアルタイムTTSを前面に出す一方、コミュニティは過去のコード撤回と現在の公開範囲を先に見にいった。
重要なのは、xAIがGrok Voiceのstackをstandalone STT/TTS APIに切り出し、batch $0.10/hour、streaming $0.20/hourという価格を出した点だ。25+ languages、diarization、word-level timestampsでenterprise transcriptionを正面から狙う。
Google DeepMindは2026年3月26日、Gemini 3.1 Flash LiveをGemini LiveとGoogle Search Liveへ順次展開し、開発者はGoogle AI Studioから利用を始められると発表した。Googleはこれを自社最高品質のaudio modelと位置づけ、低latency、向上したtonal understanding、ComplexFuncBench Audio 90.8%を打ち出している。
GoogleはMar 26, 2026にGemini 3.1 Flash Liveを発表し、real-time audio AIをdeveloper、enterprise、consumer productへ横断展開した。Gemini Live API、Gemini Enterprise for Customer Experience、Search Live、Gemini Liveが同じvoice stackで強化される。
Launch HNスレッドはRunAnywhereのMetalRTとRCLIを押し上げ、Apple Silicon上でSTT・LLM・TTSをクラウドなしでつなぐ低遅延音声AIスタックに注目を集めた。
Launch HNスレッドでRunAnywhereのRCLIが可視化された。Apple Silicon上でSTT、LLM、TTS、ローカルRAG、38個のmacOS actionをまとめて動かすmacOS向けVoice AIの試みだ。