본문으로 건너뛰기

태그

#voice-agents

#voice-agents 태그가 달린 기사

RSS 피드
AI X/Twitter

Mistral, 저지연 다국어 음성 에이전트를 위한 Voxtral TTS 공개

Mistral AI는 2026년 3월 26일 Voxtral TTS가 expressive speech, 9개 언어 지원, 낮은 latency, 쉬운 voice adaptation을 제공한다고 밝혔다. Mistral의 3월 23일 launch post는 4B-parameter 모델이 약 3초 reference audio로 custom voice adaptation을 수행하고, 약 70ms model latency와 최대 2분 native audio generation을 지원한다고 설명한다.

2분 소요 47 조회
LLM X/Twitter

Google AI, 실시간 voice·vision agent용 Gemini 3.1 Flash Live 출시

Google AI는 2026년 3월 26일 실시간 voice·vision agent를 만드는 개발자를 위해 Gemini 3.1 Flash Live를 출시한다고 밝혔다. Google은 더 자연스러운 대화 속도, noisy environment에서의 더 나은 task completion, 복잡한 instruction 처리 개선을 강조했고, Live API 문서는 low-latency multimodal streaming과 tool use, 70개 언어 지원을 설명한다.

2분 소요 44 조회
LLM X/Twitter

OpenAI와 Perplexity, Realtime API 기반 voice agent 운영 교훈 공개

OpenAI Developers는 2026년 3월 30일 Perplexity가 Realtime API 기반 voice 경험을 production에서 운영하며 얻은 교훈을 공개했다고 밝혔다. 게시물에 따르면 Perplexity는 월 수백만 건의 voice session을 처리하고 있으며, context chunking, audio format 표준화, noisy environment에서의 turn-taking 조정 방식을 바꿨다.

2분 소요 35 조회
LLM X/Twitter

Google DeepMind, 저지연 voice·vision agent용 Gemini 3.1 Flash Live 공개

Google DeepMind는 2026년 3월 26일 Gemini 3.1 Flash Live가 Google AI Studio의 Live API를 통해 preview로 제공된다고 밝혔다. Google 블로그에 따르면 이 모델은 실시간 voice·vision agent를 겨냥하며, noisy 환경에서의 tool triggering을 개선하고 90개가 넘는 언어의 multimodal 대화를 지원한다.

2분 소요 48 조회
AI X/Twitter

LiveKit, voice agent용 Adaptive Interruption Handling 정식 제공… VAD 오탐 문제 완화

LiveKit은 2026년 3월 19일 실제 사용자 interrupt와 backchannel·잡음을 구분하는 audio model을 학습했다고 밝혔다. 회사 블로그에 따르면 이 기능은 LiveKit Agents에 정식 제공되며, 500ms overlap speech 기준 86% precision과 100% recall을 기록했고 최신 Python·TypeScript agent SDK에서 기본 활성화된다.

2분 소요 42 조회
AI X/Twitter

LiveKit, xAI TTS를 Inference에 추가해 20개 이상 언어와 무별도 키 경로 제공

LiveKit는 X에서 xAI의 Grok text-to-speech가 LiveKit Inference에서 low-latency streaming, telephony readiness, 20개 이상 언어 지원과 함께 제공된다고 밝혔다. LiveKit 문서에 따르면 개발자는 별도 xAI API key 없이 `xai/tts-1`을 쓰거나 `XAI_API_KEY` 기반 plugin 경로를 선택할 수 있다.

1분 소요 35 조회