본문으로 건너뛰기

태그

#speech-recognition

#speech-recognition 태그가 달린 기사

RSS 피드
AI X/Twitter

Meta Muse Voice Transcribe, 20명 이상 화자 실시간 분리로 음성 벤치마크 1위

Meta의 Muse Voice Transcribe가 실시간 스트리밍 인식과 20명 이상 화자 분리, 다국어 코드 전환을 한 모델에 묶었다. Artificial Analysis의 스트리밍 음성 인식과 공개 화자 분리 벤치마크에서 모두 1위라는 주장이 핵심이다. 지원 언어와 지연시간은 추가 공개가 필요하다.

2분 소요 2 조회
AI X/Twitter

Cohere, open 2B ASR model Transcribe와 WebGPU 브라우저 demo 전면 배치

Cohere는 2026년 3월 28일 Transcribe가 real-world noise 환경에서 speech recognition accuracy의 새 기준을 세운다고 밝히며 체험 링크를 공유했다. 함께 공개된 Hugging Face 자료는 Transcribe를 Apache 2.0 기반 2B-parameter, 14-language ASR model로 설명하고, 별도 WebGPU demo는 이 모델이 브라우저 로컬 환경에서도 동작함을 보여 준다.

2분 소요 57 조회
AI X/Twitter

Cohere, 2B·Apache 2.0 기반 speech recognition 모델 Transcribe 공개

Cohere는 2026년 3월 26일 Transcribe를 open-source speech recognition model로 발표했다. Cohere에 따르면 이 2B Conformer 기반 시스템은 14개 언어를 지원하고, Hugging Face Open ASR Leaderboard에서 평균 WER 5.42로 1위를 기록했으며, Apache 2.0 license로 배포되고, download·API·Model Vault 경로를 모두 제공한다.

1분 소요 48 조회
AI 해커뉴스

순수 C 언어로 구현된 Mistral Voxtral 음성인식 모델, CPU만으로 실시간 처리

Mistral AI의 Voxtral Realtime 4B 음성인식 모델을 순수 C 언어로 구현한 voxtral.c가 공개되었습니다. Python이나 CUDA 없이 C 표준 라이브러리만으로 실행되며, Apple Silicon에서는 실시간보다 2.5배 빠른 속도로 음성을 텍스트로 변환할 수 있습니다. 메모리 맵핑 방식으로 '거의 즉시' 로딩되며, 무제한 길이의 오디오를 1.8GB 메모리로 처리할 수 있습니다.

2분 소요 32 조회