본문으로 건너뛰기

Meta Muse Glimmer, 30B 에이전트 모델을 20GB 아래로 압축해 RTX 5090에서 3.1배 가속

Original: Meta Shrinks 30B Muse Glimmer Below 20GB for Local AI Agents View original →

Read in other languages: English日本語
LLM Aug 10, 2026 By Insights AI (Twitter) 2 min read Source
Meta Muse Glimmer, 30B 에이전트 모델을 20GB 아래로 압축해 RTX 5090에서 3.1배 가속

30B 에이전트 모델이 소비자 장비 안으로

상시 작동하는 개인 에이전트를 클라우드가 아니라 노트북이나 데스크톱에서 돌릴 수 있는 하드웨어 기준이 한 단계 낮아졌다. Meta의 Muse Glimmer는 30B 매개변수를 유지하면서 언어 모델 가중치를 20GB 미만으로 줄였고, 단일 소비자용 GPU가 달린 PC나 Mac을 목표로 삼았다. 일정, 메시지, 파일처럼 민감한 개인 맥락을 외부 서버에 계속 보내지 않고 처리할 수 있다는 점이 핵심이다.

“Muse Glimmer는 로컬 상시 에이전트 작업 흐름에 최적화한 30B 매개변수 오픈웨이트 모델이다.” — AI at Meta

원문 게시물은 모델 가중치를 Apache 2.0 라이선스로 공개한다고 밝혔다. AI at Meta 계정은 Meta의 연구 모델, 데이터셋, 평가 결과를 공유하는 공식 연구 채널이다. 이번 게시물도 단순 제품 홍보보다 모델 구조와 배포 조건을 설명한 기술 블로그, Hugging Face 저장소, 개발자 문서로 이어진다.

4비트 양자화와 DFlash가 만든 실행 범위

30B 모델은 전체 정밀도에서 55GB가 넘는 메모리를 요구한다. Meta는 약 4비트 정밀도의 양자화를 적용해 언어 모델을 20GB 아래로 압축했다. 남은 공간에는 긴 문맥을 위한 KV 캐시, 이미지 입력을 처리하는 인식 인코더, 추측 디코딩용 보조 모델이 함께 들어간다. 회사가 제시한 목표 구성은 24GB 또는 32GB 메모리 범위다. 양자화가 에이전트 과제의 품질을 거의 떨어뜨리지 않았다는 것이 Meta의 자체 평가이지만, 독립 재현은 아직 필요하다.

속도 개선에는 DFlash 기반의 가벼운 초안 모델을 쓴다. 초안 모델이 여러 토큰을 한꺼번에 제안하고 본 모델이 병렬로 확인하는 방식이다. Meta의 측정에서 디코딩 속도는 RTX 5090에서 3.1배, M5 Max에서 1.8배, M4 Max에서 1.5배 높아졌다. 출력 품질을 바꾸지 않고 응답 지연을 줄이는 설계여서, 여러 도구를 연속 호출하는 에이전트 작업에 특히 중요하다.

비교 대상과 실제 용도

기술 자료는 Muse Glimmer를 Gemma4-31B와 Qwen3.6-27B에 비교했다. 평가는 DeepSearch QA, MCP-Atlas, τ-Bench, SWE-Bench를 포함하며 도구 호출, 코딩, 다단계 작업 완수 능력을 다룬다. 모델은 텍스트와 이미지를 함께 받고, 100개가 넘는 언어로 학습됐으며, OpenClaw 같은 에이전트 실행 구조와의 호환성을 내세운다. 다만 Meta가 게시물에서 강조한 것은 특정 종합 점수의 1위가 아니라 같은 크기대에서의 성능과 로컬 실행 가능성의 결합이다.

가중치는 Hugging Face에서 받을 수 있다. llama.cpp, MLX, ExecuTorch 최적화는 며칠 안에 제공될 예정이며 Ollama, LM Studio, Unsloth 지원도 예고됐다. 다음 확인 지점은 24GB 장비에서의 실제 토큰 속도와 긴 도구 호출의 안정성, 공개 평가표의 독립 재현, Apache 2.0 가중치가 개인용 로컬 에이전트 생태계에서 얼마나 빠르게 채택되는지다.

Share: Long

Related Articles