Meta AI Research 宣布推出 Muse Glimmer,这是一款拥有 300 亿参数的开放权重模型,采用 Apache 2.0 许可证发布。Muse Glimmer 专为始终在线的本地工作流而设计,使开发者无需依赖云 API,即可直接在消费级 GPU 和工作站上运行自主智能体、复杂工具调用、本地编码以及以 LLM 作为评判者的评估。

Muse Glimmer 30B 模型架构和智能体基准测试
为了在严格的内存预算下实现智能体执行能力,Meta 采用了源自其更大型旗舰模型 Muse Spark 的多阶段训练策略:
Logit 蒸馏(预训练):该模型使用相匹配的预训练数据集组合,从 Muse Spark 迁移基础推理能力。
中期训练:使用包含复杂推理轨迹、交错文本与图像数据以及多步工具调用轨迹的长上下文序列扩大训练规模。
后训练对齐:结合监督微调(SFT)、同策略蒸馏和强化学习(RL),优化代码生成、工具使用和结构化规划等多个领域的性能。
一个专用的 18 亿参数感知编码器使 Muse Glimmer 能够原生处理交错的多模态输入,让本地智能体可以在执行代码或自动化工作流期间直接理解截图、图表和文档。
未经压缩的 300 亿参数模型通常需要超过 55 GB 的显存,因而无法在标准消费级硬件上使用。Muse Glimmer 通过两项主要的运行时优化解决了这一问题:

动态量化:利用 4 位动态压缩(K-Quant),模型占用空间降至约 17 GB 至 20 GB。这在标准的 24 GB 至 32 GB GPU/NPU 内存范围内留下了足够的内存余量,可供键值(KV)缓存、感知嵌入和推测解码开销使用。
DFlash 推测解码:Muse Glimmer 不再一次预测一个 token,而是与一个基于 DFlash 架构的轻量级配套“草稿”模型协同工作。草稿模型提出包含多个 token 的块,再由基础模型并行验证。在 Apple Silicon(M4/M5 Max)和 NVIDIA RTX 5090 显卡等硬件上,这种方式可将生成吞吐量提升至多 3.1 倍。
Muse Glimmer 经过训练,能够执行长期规划并处理意外故障状态。当 API 调用或终端命令返回错误时,该模型会诊断故障并尝试其他路径,而不是终止执行。它支持 OpenClaw 等智能体框架,并提供可调节的推理强度,使开发者能够在执行速度和决策质量之间取得平衡。
在标准化基准评估(SWE-Bench、DeepSearch QA、τ-Bench 和 MCP-Atlas)中,与 300 亿参数级别的领先开放模型相比,Muse Glimmer 取得了较高的成功率。与 Gemma 4 31B 和 Qwen 3.6 27B 等同类模型相比,Muse Glimmer 展现出更出色的多步工具调用可靠性和故障恢复能力,同时在通用编码和推理能力方面保持了竞争力。
该模型的权重已在 Hugging Face 上提供。Meta 与开源社区合作,为 llama.cpp、ExecuTorch、Apple MLX、Ollama、LM Studio 和 vLLM 等流行的本地框架提供原生运行支持。它还通过 PyTorch 的 TorchTitan 框架支持微调工作流。
Muse Glimmer 标志着本地 AI 智能体朝着兼具可行性和高性能的方向迈出了重要一步,既能保护数据隐私,又能维持低延迟运行。若要在自己的机器上高效运行该模型,建议使用配备 24 GB 至 32 GB 统一内存或显存的系统,例如搭载 M4/M5 Max 芯片的 Mac,或配备 RTX 5090、RTX 4090 等现代 GPU 的 PC。这一硬件配置范围可以确保在加载量化后的 4 位权重之外,还能为长时间智能体会话所需的视觉编码器、DFlash 草稿模型和 KV 上下文缓存提供充足内存。





