Gemini 3.5 Live Translate, 70개 이상 언어 실시간 음성 번역으로 확대
Original: Gemini 3.5 Live Translate expands real-time voice translation past 70 languages View original →
실시간 음성 번역이 앱 기능을 넘어 모델 API와 회의 도구의 공통 계층으로 이동하고 있다. Google DeepMind는 2026년 6월 9일 트윗에서 Gemini 3.5 Live Translate를 소개하며 “fast, cross-language communication”을 위한 최신 오디오 모델이라고 밝혔다.
핵심 숫자는 70개 이상 언어다. 이어진 설명과 Google의 개발자 문서는 이 모델이 음성을 스트리밍되는 동안 번역하고, 말투와 속도, 음높이를 유지하는 것을 목표로 한다고 설명한다. 일반 사용자는 Google Translate의 Android와 iOS 앱에서, 개발자는 Gemini Live API와 Google AI Studio의 public preview에서, 기업은 Google Meet의 private preview에서 접근하는 구조다.
Google DeepMind 계정은 Gemini 모델, 연구 성과, 제품 적용 사례를 함께 올리는 공식 채널이다. 이번 트윗은 단순한 데모보다 배포 경로가 중요하다. 번역이 문장 단위 입력 뒤 결과를 기다리는 방식에서 벗어나, 대화가 진행되는 동안 낮은 지연으로 따라붙는 음성-음성 모델로 바뀌면 고객 지원, 원격 회의, 교육, 여행 앱의 UX 기준이 달라진다.
다음 관전점은 품질 편차와 지연 시간이다. 70개 이상 언어를 지원해도 억양, 전문 용어, 겹쳐 말하기, 배경 소음에서 품질이 흔들리면 회의나 상담 업무에는 제한이 남는다. 개발자 preview가 열렸기 때문에 앞으로는 Google의 데모보다 실제 앱에서 측정되는 지연, 비용, 언어별 정확도가 더 중요한 평가 기준이 된다.
Related Articles
생성형 미디어 모델이 소비자 기능에서 개발자 워크플로로 들어가고 있다. Google DeepMind는 Nano Banana 2 Lite를 이미지 생성·편집용으로, Gemini Omni Flash를 대화형 영상 편집용으로 공개하며 속도와 비용을 전면에 세웠다.
구글 딥마인드가 Gemini Flash 기반의 이미지 생성·편집 모델 Nano Banana 2(Gemini 3.1 Flash Image)를 출시했다. 프로급 품질과 빠른 생성 속도를 결합해 출시 직후 이미지 생성 벤치마크 1위를 기록했다.
Google DeepMind가 마우스 커서를 맥락 인식 AI 에이전트로 전환하는 Magic Pointer를 공개했다. 화면 내용을 이해하고 사용자 의도에 맞는 행동을 제안하는 새로운 인터페이스 패러다임이다.