Muse Glimmer 30B、24GB枠に収めるローカルエージェント
Original: Meta Muse Glimmer – Open weights 30B local coding model View original →
Muse Glimmerで注目すべきは、Metaが新たなmodel weightsを公開したことだけではない。300億パラメータのagentic modelと作業メモリ、画像用encoder、高速化用の小型modelを、デスクに置けるハードウェアに収めようとしている。Meta Superintelligence LabsはweightsをApache 2.0で公開し、local coding、function calling、常時稼働のpersonal agent、LLM-as-a-judgeを主な用途に挙げる。
24GBまたは32GBに収める方法
30B modelはfull precisionなら55GB以上のメモリを必要とする。Metaはweightsを約4-bitに量子化し、language model部分を20GB未満に縮小した。残りの容量にKV cache、画像入力用のperception encoder、speculative decoding用のdrafterを置く。同社はagenticタスクでの精度低下は小さいとするが、異なる機器と長時間ワークロードでの独立検証はこれからだ。
速度を支えるのはDFlashベースのdrafterだ。小型ネットワークがtokenのまとまりを先に提案し、メインmodelが並列に検証する。Metaの測定ではdecode速度がRTX 5090で3.1倍、M5 Maxで1.8倍、M4 Maxで1.5倍になった。長いreasoningや連続するtool callで待ち時間を減らすための設計である。
benchmarkの後に始まる実用試験
Muse Glimmerはtextとimageが混在する入力、tool呼び出し失敗後の再試行、複数のreasoning effort、100以上の言語に対応する。weightsはHugging Faceから入手でき、Ollama、LM Studio、Unsloth、llama.cpp、MLX、vLLMなどの対応も示された。これらの統合が整うかどうかが、実際に運用できるmodelかを決める。
687 pointsと386 commentsを集めたHNの議論は、すぐに実機の話へ移った。32GB Mac miniで試したユーザーは結果を評価しつつも、動作は遅いと報告した。別のユーザーは、同程度のlocal modelよりも同じ思考を繰り返しにくいと感じたという。一方で、公開benchmarkに偏っていないか、同規模のQwen系とどう比較されるかは未解決だ。初期感想は結論ではない。それでも、実メモリと待ち時間の制約下で継続的に仕事を任せられるかという、重要な評価軸を示している。
Metaの技術解説で、公開内容、最適化方法、modelへのリンクを確認できる。
Related Articles
300億パラメータのエージェントモデルを20GB未満に圧縮し、24GB級の一般向けマシンでローカル実行を狙う。Metaの測定では、DFlashによりRTX 5090のデコード速度が3.1倍になった。
718点を集めたHNの関心は順位よりも、安く速いreasoning modelを日常のagent作業に入れられるかに向かった。
エージェントリスクは昨年のブラックメール実験だけではない。Anthropicはコード妨害、詐欺支援、意図的なラベル操作、人間を介した情報開示誘導という4類型を示した。