본문으로 건너뛰기

5년 된 스마트폰에서도 밀리초 추론, Desert Ant의 작은 온디바이스 모델 18종

모든 작업을 거대 모델 API로 보내지 말자는 구체적인 대안이 개발자들의 시선을 끌었다. Desert Ant Labs는 음성·영상·텍스트의 좁은 작업을 맡는 모델 18종과 Swift·Kotlin·JavaScript SDK를 공개했다.

원문: Desert Ant Labs: local, fast models that run on device 원문 보기 →

AI 해커뉴스 작성자 Insights AI (HN) 2분 소요 출처

음성에서 군더더기 말을 찾거나 문장에서 개인정보를 가리는 일에 매번 거대 모델 API가 필요할까. Desert Ant Labs는 이런 반복 작업을 스마트폰과 브라우저 안에서 처리하는 작은 특화 모델 18종을 내놓았다. 12종은 안정판, 6종은 beta이며 Swift, Kotlin, JavaScript용 단일 SDK로 묶었다. HN의 관심은 ‘더 큰 범용 모델’ 경쟁에서 벗어나 제품에 바로 넣을 수 있는 작은 모델 묶음을 제시한 데 모였다.

회사가 공개한 자료에서 Voz는 iPhone으로 10분 분량 음성을 2초에 전사하고 단어별 시작·종료 시각을 돌려준다. Clear는 9MB 모델로 5분짜리 녹음을 1초 만에 보정하며, Redact는 27개 언어에서 이름·주소·카드 번호를 실시간으로 가린다. Tongue는 2MB 크기로 세 단어만 보고 84개 언어를 구분한다.

수치는 모두 Desert Ant의 자체 측정이라는 점을 함께 봐야 한다. 회사는 Voz가 Whisper보다 4.7배 빠르고, 12MB Redact의 개인정보 탐지 점수가 88.8로 2.3GB GLiNER-PII의 91.1에 근접한다고 주장한다. 284MB Clips는 10분 영상을 5초 만에 12개 clip으로 나누며 Claude Sonnet보다 10배 빠르고 에너지를 470분의 1만 쓴다는 비교도 제시했다. 독립적인 재현 결과와 정확도·전력 측정 조건은 후속 검증이 필요하다.

이 모델들은 영상 앱 Detail을 운영하며 생긴 비용 문제에서 출발했다. 회사는 자동 편집과 음질 개선에 cloud API를 사용하다가 직접 특화 모델을 훈련했고, iOS 27과 함께 나올 Detail 6에서 cloud API를 모두 자사 온디바이스 모델로 바꿀 계획이다. iPhone에서는 Neural Engine, 브라우저에서는 같은 weight를 WebAssembly로 실행한다.

제품 전략은 작은 모델을 ‘소뇌’로 쓰는 구조다. 자주 반복되고 결과 형식이 좁은 작업은 로컬 모델이 먼저 처리하고, 어려운 요청만 더 큰 모델이나 cloud로 넘긴다. 호출당 비용과 network 왕복이 사라지고 개인정보가 기기 밖으로 나가지 않는다는 장점이 있다. 반면 여러 특화 모델을 고르고 update하며, device별 runtime 차이를 관리하는 부담은 SDK 제공자가 떠안아야 한다. 모델 하나의 승부보다 배치와 유지보수 경험이 관건인 셈이다.

첫 모델들은 SDK 기준 월간 활성 기기 10만 대까지 무료이며 사용자별 inference 횟수에는 제한이 없다고 회사는 설명한다. 범용 LLM을 더 작게 압축한 제품이라기보다, 전사·음질 개선·PII 제거처럼 측정 가능한 기능을 각각 하나의 모델로 만든 catalog에 가깝다. 실제 앱에서 정확도와 battery 사용량이 공개 benchmark를 따라가는지가 이 접근의 다음 시험대다.

공유: 긴글

관련 기사