Muse Glimmer、30B agent modelを20GB未満へ量子化し端末内実行
これは何?Muse Glimmerは、cloud APIではなく個人のMacやPC上でtool操作・coding・画像理解を行う常駐agent向けのopen-weight言語modelです。
Meta Superintelligence Labsは30B parameterのMuse GlimmerをApache 2.0で公開し、約4-bit量子化で言語modelを20GB未満、K-Quant版を17GBに収めました。tool calling、長期task、失敗回復、画像入力を大規模teacherからのdistillationとreinforcement learningで強化し、24GBまたは32GBのmemory枠で周辺componentと同時実行する設計です。benchmarkと速度値はMetaによる評価で、llama.cpp・MLX・ExecuTorchなどの最適化integrationは今後数日で提供予定です。
local agentはoffline利用とdata localityを得られますが、30B modelではweightsだけでなくKV cache・画像encoder・補助modelを含むmemory budgetが導入条件になります。open weightsとApache 2.0は検証・fine-tuningを可能にする一方、vendor benchmarkの独立再現は別途必要です。
- 読むべき人
- local LLM、AI agent、desktop application、inference optimizationの開発者
- HN
- 969 points / 549 comments


