Google Gemini 3.5 Transcribe, 85개 이상 언어 지원 정밀 음성 인식 모델 출시
원문: Google Launches Gemini 3.5 Transcribe: Intelligent Speech-to-Text in 85+ Languages 원문 보기 →
85개 이상 언어 지원하는 음성 인식 모델
Google이 2026년 8월 26일 Gemini 3.5 Transcribe를 출시했다. 85개 이상의 언어를 자동 감지하고 오디오를 정밀하게 텍스트로 변환하는 이 모델은 Google AI Studio와 Gemini API에서 정식 이용 가능하다.
지능형 전사 기능
Gemini 3.5 Transcribe는 기존 음성 인식의 한계를 넘어선다. 간투사를 자동으로 제거해 깔끔한 텍스트를 제공하고, 말하다 스스로 수정한 발화를 자연스럽게 처리하며 사용자의 실제 의도를 파악한다. 화자 분리(speaker diarization), 단어 수준 타임스탬프, 최대 1,000개 단어의 커스텀 어휘 설정도 지원한다.
정확도와 성능
사전 녹음 오디오에서 단어 오류율(WER) 2.6%, 실시간 스트리밍에서 4.0%를 기록했다. 배경 소음이 있는 환경에서도 안정적인 인식 성능을 발휘한다.
가용성
Google AI Studio와 Gemini API를 통해 사용할 수 있으며, macOS용 Gemini 앱과 Android의 Gboard Rambler에도 탑재됐다. 의료, 법률, 방송 등 정밀한 전사가 필요한 전문 분야에 특히 적합하다.
관련 기사
Google이 Gemini 모델 개발과 앱, Frontier AI research를 Koray Kavukcuoglu에게 맡기고 Demis Hassabis를 Alphabet Chief Scientist로 이동시켰다. Gemini 앱 950M+ 월간 사용자와 Gemma 900M+ 다운로드 뒤에서, Jeff Dean과 Sanjay Ghemawat은 독립 public benefit corporation으로 빠져나간다.
Google이 Gemini in Chrome에 Skills를 넣어 반복 prompt를 한 번 저장하고 현재 page나 선택한 tabs에서 다시 실행하게 했다. Mac, Windows, ChromeOS의 English-US desktop 사용자부터 rolling out되며 calendar 추가나 email 발송 같은 작업에는 확인 절차가 붙는다.
Google이 Gemini CLI를 2026년 6월 18일부로 종료하고 Antigravity CLI로 전환한다고 공식 발표했다. 무료 및 AI Pro 구독자 모두 해당하며, 엔터프라이즈 라이선스 사용자만 계속 지원받는다.