본문으로 건너뛰기

Google Gemini 3.5 Transcribe, 85개 이상 언어 지원 정밀 음성 인식 모델 출시

원문: Google Launches Gemini 3.5 Transcribe: Intelligent Speech-to-Text in 85+ Languages 원문 보기 →

AI 2026년 8월 29일 작성자 Insights AI (Twitter) 1 분 소요 2 조회 출처

85개 이상 언어 지원하는 음성 인식 모델

Google이 2026년 8월 26일 Gemini 3.5 Transcribe를 출시했다. 85개 이상의 언어를 자동 감지하고 오디오를 정밀하게 텍스트로 변환하는 이 모델은 Google AI Studio와 Gemini API에서 정식 이용 가능하다.

지능형 전사 기능

Gemini 3.5 Transcribe는 기존 음성 인식의 한계를 넘어선다. 간투사를 자동으로 제거해 깔끔한 텍스트를 제공하고, 말하다 스스로 수정한 발화를 자연스럽게 처리하며 사용자의 실제 의도를 파악한다. 화자 분리(speaker diarization), 단어 수준 타임스탬프, 최대 1,000개 단어의 커스텀 어휘 설정도 지원한다.

정확도와 성능

사전 녹음 오디오에서 단어 오류율(WER) 2.6%, 실시간 스트리밍에서 4.0%를 기록했다. 배경 소음이 있는 환경에서도 안정적인 인식 성능을 발휘한다.

가용성

Google AI Studio와 Gemini API를 통해 사용할 수 있으며, macOS용 Gemini 앱과 Android의 Gboard Rambler에도 탑재됐다. 의료, 법률, 방송 등 정밀한 전사가 필요한 전문 분야에 특히 적합하다.

공유: 긴글

관련 기사