智能與秩序
24GB 内存,能留住一个会看图、稳定调用工具的 30B Agent 吗?
摘要
介紹 Meta 開源的 30B 參數 Apache 2.0 授權模型 Muse Glimmer,定位為本地 agent、函式呼叫、本地編程與判斷評估。相較於單純比拚榜單分數,這篇報導聚焦在真正落地的內存與速度帳本:透過約 4bit 量化把權重壓到 20GB 以下,讓 24GB、32GB 這類消費級顯卡與 Mac 也有機會跑起 30B 級 agent 模型,並搭配輕量草稿模型 D-Flash 做投機解碼加速生成速度。內容為簡體中文頻道轉寫,已正體化與用語校正。
重點
- Muse Glimmer 在官方選定的 agent 與程式碼任務上分數多數領先 Gemma 3 31B 與 Qwen 3.6 27B,例如 MCP Atlas 75.5 分(對照 54.2、62.5),但在 Terminal-Bench 2.1(51.7 分,Qwen 為 60.7)等項目上並未全面領先
- 30B 模型滿精度權重超過 55GB,Meta 提供的量化方案可把權重壓到 20GB 以下,並給出兩檔內存目標:32GB VRAM(KCache Dynamic,平均準確度下降 0.2%)與 24GB VRAM(KCache 17GB,平均下降 1.0%)
- 官方公開的 Home Assistant 演示:模型自主透過工具呼叫找到局域網內的 Home Assistant、發現需要憑證後主動向用戶索取、查詢裝置,最後從零寫出 HTML、CSS、JavaScript 控制面板
- 輕量草稿模型 D-Flash 做投機解碼:RTX 5090 生成速度從每秒 74.9 個 token 提升到 233 個(3.1 倍),M5 Max 從 26.6 提升到 50(1.8 倍),M4 Max 從 23.7 提升到 38(1.5 倍)
- 訓練路徑:先用更大模型 Muse Spark 的輸出做 logit 蒸餾,再加入更長上下文與更偏 agent 的資料,並融入監督微調、線上策略蒸餾與強化學習
- 上下文長度 131K 以上,可同時接收文字與圖片;模型權重已在 Hugging Face 開放,llama.cpp、MLX、ExecuTorch 的優化集成陸續到來
金句
一個真正有用的 agent 根本不是這樣工作的:它需要記住你正在做什麼,需要讀一張截圖,需要調用工具,需要在報錯之後繼續排查。
本地 agent 接下來的競爭,不能只比誰打得更漂亮,還要比誰能在有限的內存裡,把一件真實的事做得更久、更穩和更快。