본문으로 건너뛰기

Muse Glimmer 30B, 20GB 아래로 줄인 로컬 agent 모델

Original: Meta Muse Glimmer – Open weights 30B local coding model View original →

Read in other languages: English日本語
LLM Aug 10, 2026 By Insights AI (HN) 1 min read Source

30B 규모의 agentic 모델을 Mac이나 소비자용 GPU 한 장에서 계속 돌릴 수 있다는 점이 이번 공개의 중심이다. Meta Superintelligence Labs가 내놓은 Muse Glimmer는 모델 weights를 Apache 2.0으로 공개하고, 로컬 coding·function calling·LLM-as-a-judge 작업을 주요 용도로 잡았다. 클라우드 API 없이 장시간 동작하는 개인 agent가 현실적인 선택지가 되는지 확인할 만한 릴리스다. 특히 자료가 로컬에 머물고 network 연결이 끊겨도 동작한다는 특성은 개인 정보와 지연 시간에 민감한 workflow에서 매력적이다. 다만 모델 자체를 내려받아 관리해야 한다.

24GB 안에 모델과 작업 메모리를 함께 넣는 방식

원래 30B 모델은 full precision에서 55GB가 넘는 메모리를 요구한다. Meta는 weights를 약 4-bit로 양자화해 language model 부분을 20GB 아래로 줄였다. 남는 공간에는 KV cache, 이미지 입력용 perception encoder, speculative decoding에 쓰는 작은 drafter를 함께 올린다. 회사 설명상 24GB 또는 32GB 메모리 범위에서 전체 구성을 실행할 수 있으며, agentic 과제에서 양자화에 따른 성능 저하는 작았다.

속도는 DFlash 기반 drafter가 맡는다. 작은 동반 모델이 여러 token을 먼저 제안하면 본 모델이 병렬로 검증하고 틀린 부분만 고친다. Meta가 공개한 측정에서는 RTX 5090에서 decode 속도가 3.1배, M5 Max에서 1.8배, M4 Max에서 1.5배 높아졌다. 출력 품질을 바꾸지 않으면서 긴 reasoning과 연속 tool call의 대기 시간을 줄이려는 설계다.

benchmark보다 실제 로컬 운용이 시험대

Muse Glimmer는 text와 image가 섞인 입력, tool 호출 오류 후 재시도, 여러 reasoning effort 단계, 100개가 넘는 언어를 지원한다. Hugging Face에서 weights를 받을 수 있고, Ollama·LM Studio·Unsloth와 llama.cpp·MLX·vLLM 등 생태계 지원도 예고됐다. 다만 출시 직후인 만큼 Meta가 제시한 benchmark와 메모리 수치가 다양한 장비와 장기 작업에서도 이어지는지는 별도 검증이 필요하다.

커뮤니티 논점은 빠르게 실제 사용성으로 이동했다. 32GB Mac mini에서 구동했다는 초기 보고는 결과가 괜찮지만 느리다고 전했고, 다른 사용자는 반복적인 thinking이 적어 체감 효율이 좋다고 평가했다. 반면 공개 benchmark에 과도하게 맞춘 모델인지, 곧 나올 비슷한 크기의 Qwen 계열과 비교해 어떤 위치인지도 질문으로 남았다. 687점과 386개 댓글을 모은 HN 토론의 관심은 결국 하나다. 30B가 로컬 agent의 실용 구간에 들어왔는가.

Meta의 원문과 기술 설명에서 weights, 최적화 방식, 지원 도구를 확인할 수 있다.

Share: Long

Related Articles