Notebookcheck Logo

Meta Muse Glimmer 可在单张 GPU 上离线运行,但需要 24 GB 显存

深色背景上带有“Build with Muse”字样的Meta标志
ⓘ Meta
Muse Glimmer 完全在本地运行,但需要至少 24 GB 的显存。
Meta 发布了 Muse Glimmer,这是一个拥有约 300 亿个参数的语言模型,采用 Apache 2.0 许可证。它完全在您自己的机器上运行,无需互联网连接,也无需订阅。 但有一个前提:你需要 24 GB 的显存,因此需要配备 RTX 5090、RTX 4090 或搭载 M4 Max 芯片的 Mac 电脑。该模型的权重可在 Hugging Face 上免费获取。
AI Open Source Software GPU

Meta 于 8 月 10 日发布了 Muse Glimmer,这是一个拥有约 300 亿个参数的语言模型。引人注目的并非模型本身,而是其许可协议和目标运行环境。该模型的权重已发布在 Hugging Face 上,采用 Apache 2.0 许可协议,因此您可以下载、修改并将其用于商业用途。 而且该模型并非为在数据中心运行而设计,而是可在您桌下的单张显卡上运行。

该模型源自Meta超级智能实验室,是从更大的Muse Spark模型中蒸馏而来的,这意味着一个大型模型教会了一个小型模型如何回答问题。 它接受文本和图像作为输入,但仅生成文本,支持超过100种语言,并能处理超过131,000个令牌的上下文窗口。其知识更新截止于2026年1月4日。Meta最近发布的还有Muse Code智能代理Muse Image生成器

24 GB的VRAM是最低配置要求

若以全精度运行,该模型将需要64 GB的显存。Meta通过量化技术将其压缩至约4位——这是一种存储数字的粗略方式,所占空间远小于全精度。这使得语言处理部分的占用空间缩减至20 GB以下,从而为视觉编码器和实时对话缓存腾出了空间。

该模型随附两种现成的变体。K-Quant-Dynamic 针对 32 GB 显存优化,在 15 项基准测试中平均精度损失 0.2%;而 K-Quant-17GB 可在 24 GB 显存内运行,精度损失为 1.0%。 实际上,这意味着需要配备 GeForce RTX 5090、RTX 4090、RTX 3090 或搭载 M4 Max 芯片的 Mac 电脑。配备 12 GB 显存的中端显卡则无法满足需求。 若您的内存容量不足,我们的指南中涵盖了适用于个人笔记本电脑的较小规模模型,甚至 iPhone 如今也能运行可用的语言模型

一个加速器使其速度提升三倍

为了避免本地模型运行迟缓,Meta 提供了一个名为 DFlash 的辅助工具。它一次提交 16 个令牌,大型模型通过单次遍历检查整个块,并仅对错误部分进行修正。 根据 Meta 自身的测试数据,在 RTX 5090 上的吞吐量从每秒 74.9 个令牌跃升至 233.4 个令牌,提升了 3.1 倍。 搭载 M5 Max 的 MacBook 处理量从 26.6 提升至 50.2 个令牌,M4 Max 则从 23.7 提升至 37.8。

AMD 也在同一天公布了其测试数据。 搭载 Ryzen AI Max+ 395 的迷你电脑最高可达每秒 24 个令牌,而搭载 Radeon AI PRO R9700 的机型最高可达 53 个令牌,这些数据是在 Windows 系统上使用 llama.cpp 测得的。AMD 将这些数据标记为初步数据。

规划能力强,交互能力稍弱

Meta 将 Muse Glimmer 与谷歌的 Gemma4-31B 以及阿里巴巴的 Qwen3.6-27B 进行了对比。 当模型调用工具并进行多步骤规划时,其表现明显领先。在MCP Atlas测试中,其得分为75.5,而Gemma4-31B和Qwen3.6-27B分别为54.2和62.5;在DeepSearch QA测试中,其得分为74.6,而Gemma4-31B和Qwen3.6-27B分别为61.7和71.1。

在其他方面,Qwen表现更佳。 在实际桌面界面操作测试中,其得分分别为65.9和75.6;在终端操作测试中,得分分别为51.7和60.7。 而在 Siren AgentDojo 安全测试中——该测试衡量模型被外部文档中隐藏的指令操纵的难易程度——Muse Glimmer 的 28.4% 攻击成功率虽优于 Qwen,但仍低于 Gemma4 的 25.6%。在将模型应用于您自己的文件和邮件之前,这一点值得留意。

如何获取

Hugging Face 上已提供四个软件包:包含完整 BF16 权重的基模型、适用于 llama.cpp 的 GGUF 文件、针对 Apple 设备的 ExecuTorch 构建版本以及 DFlash 辅助工具。最便捷的获取途径是 LM Studio,在该平台搜索即可找到该模型。 AMD建议为此配备32 GB以上的显存,或等量的系统内存分配。若内存不足,Unsloth等服务商提供较小的量化版本,但此时必须将模型的一部分卸载到普通系统内存中,这会导致明显的性能损失。社区反应迅速。 发布不到一天,就已经有 57 种额外的量化版本和 6 种微调版本与之并存。像使用 Kimi K3 那样在浏览器中试用这里是不可能的。如果没有合适的硬件,Muse Glimmer 便无法使用。

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebookcheck中文版(NBC中国) > 新闻 > 新闻档案 > 新闻档案 2026 08 > Meta Muse Glimmer 可在单张 GPU 上离线运行,但需要 24 GB 显存
Steffen Zahn, 2026-08-11 (Update: 2026-08-11)