Meta Muse Glimmer 30B:第一个真正为「本地智能体工作流」设计的开放权重模型,把 5090 重新拉回 AI coding 工具链

8 月 10 日,Meta Superintelligence Labs 联合 Scale AI 联合发布 *...

8 月 10 日,Meta Superintelligence Labs 联合 Scale AI 联合发布 Muse Glimmer——一个 30B 参数的多模态密集模型,专为「本地、常驻运行的智能体工作流」设计,Apache 2.0 开放权重。同一天 LMSYS 的 SGLang 团队把它列入 Day-0 支持,把部署门槛压到「一台 RTX 5090」。它和以往「开放权重大模型」最大的区别是:它不是为「在某榜单上刷分」设计的,是为「在你桌面上 24/7 跑 agent 循环」设计的

把模型架构摊开看,几个不太常见的决定摆在台面:

30B 总体 = 27.9B 文本 decoder + 1.9B ViT + GELU 多模态 projector。文本 decoder 52 层 transformer,每层 grouped-query attention(32 query heads / 2 KV heads)+ SwiGLU FFN。视觉侧独立成 1.9B 参数量级的 ViT——不挤占文本侧的容量。 – 混合 attention 模式——三层 2048-token sliding-window + 一层 full-sequence attention 交替排列。本地窗口用 RoPE、full-attention 层用 NoPE,组合后允许模型把上下文长度推过训练时的限制。 – 128k+ token 上下文窗口——对 agent 工作流意味着可以塞进 4~5 份完整仓库的源码 + 整段 MCP 工具协议 + 多轮对话历史,不需要任何摘要压缩。 – 专为 agent 训练,benchmark 上不退让——按 LMSYS 的数字,与同尺寸领先模型相比,Muse Glimmer 在关键智能体用例和基准测试上仍然「excellent」(具体数字要等 Meta 论文放出)。

SGLang Day-0 支持把它从「发布就完事」拉到「发布即开箱」。LMSYS 的博客列出的能力细节非常硬核:

性能上限——RTX 5090 + NVFP4 + DFlash 推测解码,单卡跑出 236 tok/s/user(batch 1) + 1452 tok/s(batch 8) 的总吞吐。DFlash 加速 1.9~4.3 倍(RTX 5090 上 236 / 63.9 ≈ 3.7x)。这个数字意味着在单张消费级 GPU 上跑 7B~30B 模型时代的「轻量 agent 后端」门槛被彻底推平。 – 多硬件路径——NVFP4 走 NVIDIA SM120 backend(RTX 5090 / RTX PRO 6000 / DGX Spark);BF16 走单 H100;GGUF Q4KM(18 GB)和 Q4K-Dynamic 走 24GB 显存上限;MLX 走 Apple Silicon Mac mini / M-series MacBook Pro。这意味着开发者可以用同一份权重在 MacBook / RTX 5090 / H100 三档硬件上做无缝迁移。 – 三大原生优化——低开销调度器、RadixAttention prefix cache、可断 CUDA graphs。prefix cache 在 agent 场景下极重要:多轮对话、同一份工具 schema 反复调用、同一份代码 review 反复执行,prefix cache 把这些「重复前缀」零成本地命中。 – DFlash 推测解码——把 draft 模型和 target 模型分离,target 模型只验证 draft 模型给出的多 token 候选,吞吐翻倍但质量不退。这是 agent 场景下「延迟 vs 成本」曲线的新拐点。

把这件事放进 8 月的 AI coding 工具链主线里看,Muse Glimmer 重新定义了「AI coding 的本地后端」

过去 12 个月——Anthropic Claude Sonnet / OpenAI GPT-5 / Google Gemini 2.5 Pro 是「云端默认」,本地只有 7B~13B 的「凑合能跑」选项(Qwen2.5-Coder-7B、Code Llama 7B、DeepSeek Coder 6.7B)。本地跑 agent 几乎是妄想。 – 过去 6 个月——开源阵营开始有 32B 级别的 agent 模型(Qwen3.5-32B、DeepSeek-V3-Flash、GLM-4.5-Air),但没有一个是为「24/7 常驻」设计的——它们都是「benchmark 模型」,对推理内存峰值、长上下文 KV cache、tool schema 频繁调用、prefix cache 命中率等 agent 实战需求都按训练时的设计走。 – Muse Glimmer 的回答——30B 总参数 + 128k+ 上下文 + 24GB 显存可跑 + Apache 2.0 + SGLang Day-0 优化 + DFlash + RadixAttention prefix cache + 跨硬件 MLX 路径——这是第一个「生而为本地 agent」的开放权重模型。

具体落到 AI coding 工作流上的好处:

「agent 后端跑在用户自己机器上」第一次在工程上可行——之前 70B 模型需要 2~4 张 H100 / 8~16 张 RTX 4090,本地 24GB 跑不动;7B 模型智能不够。Muse Glimmer 用 30B + NVFP4 + DFlash 在 RTX 5090 上拿到 236 tok/s,意味着 Claude Code / Codex / OpenCode 这类 harness 第一次有「真的能在本机跑、且足够聪明」的后端选项。 – 隐私/合规场景被打开——法律、医疗、金融、政府、咨询行业的「code 不能离开公司机器」合规要求,过去只能选 7B 凑合模型或自建数据中心跑大模型。Muse Glimmer 把这条路打通到「一台 RTX 5090 工作站」。 – 常驻 agent 的成本结构变了——之前 Claude Sonnet API 价格是 3/15 per 1M token,常驻 agent 一晚跑 200k token 成本是 $3;Muse Glimmer 本地跑一晚的边际成本只有电费(RTX 5090 ~400W)。开发者可以放心跑「每晚重跑整个测试套件」这类长跑任务,不用看 API 账单。

几件值得拎出来说的事:

Scale AI 联合署名——Alex Wang 8 月 10 日发帖确认 Muse Glimmer 30B + Muse Spark 1.2 同步开源。Scale 提供数据 / RLHF 流水线,Meta Superintelligence Labs 提供模型架构 / 训练。这意味着 Scale AI 已经从「数据标注公司」演化成「模型联合署名者」——其护城河在 RLHF 训练管线上的优势被推到台前。 – Apache 2.0 是关键——之前 Meta 的 Llama 系列用的是「Llama Community License」,对月活 7 亿以上用户的产品有商业限制。Apache 2.0 完全放开,企业 / 商业产品可以无门槛使用。这是一个被低估的细节:对 AI coding 工具厂商(Cursor / Devin / Replit Agent / OpenChamber)来说,本地后端的「license 风险」第一次被消除。 – DFlash + RadixAttention 的组合是 SGLang 的护城河——vLLM 也能跑 30B 模型,但 SGLang 在 prefix cache + 推测解码 + 多硬件路径上的整合能力是它在这个 30B 时代吃到红利的关键。 – Apple Silicon MLX 路径——Muse Glimmer 在 M5 Pro 上的吞吐 56.9 tok/s(Q4K-Dynamic、batch 1),意味着MacBook Pro 用户可以本地跑一个 30B 智能体——之前这条赛道只有 7B 凑合模型。

把这件事放进 8 月 AI coding 工具链主线下,它跟另外几个事件串成一条很清晰的线:

– 8-04 蚂蚁 Ling-3.0-flash 开源(topicId 178603081)——国产端到端开源(KDA+MLA + 1/64 稀疏 MoE + SGLang HiCache + Mooncake)。 – 8-05 NVIDIA Cosmos 3(topicId 178603066)——具身世界模型,64B / 16B / 4B 三档。 – 8-09 Microsoft SkillOpt(topicId 178603080)——经验层可移植。 – 8-10 Meta Muse Glimmer 30B(本文)——第一个为「本地常驻 agent」设计的开放权重模型

8-10 这一步是「AI coding 的本地化时代」正式开启的关键时刻——开发者第一次在「云端 Sonnet/Opus / 本地 30B」之间有了真正可比的选项,而不是「云端 vs 凑合的 7B」。

事件源:

– LMSYS SGLang 博客:https://www.lmsys.org/blog/2026-08-10-meta-muse-glimmer – Meta @AIatMeta 公告:https://x.com/AIatMeta/status/2086757844544811485 – Scale AI @alexandr_wang 公告:https://x.com/alexandr_wang/status/2086756152034066792 – Meta Research 详情:https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model – SGLang 安装:https://github.com/sgl-project/sglang – DFlash 推测解码:https://github.com/sgl-project/sglang/tree/main/python/sglang/speculative

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1