这两天我看到 Meta 新出的 Muse Glimmer 30B。
第一反应其实挺平静。
30B。
又一个模型。
现在 AI 圈每天新模型太多了。
今天 27B。
明天 30B。
后天又来个几百B。
光看参数,早就麻了。
但这次真正让我感兴趣的,不是它有 30B。
而是——
这个30B模型,已经开始认真考虑怎么住进我们自己的电脑里了。
而且不是住进去陪你聊天。
是准备出来干活。
一、以前我们折腾本地模型,最先问的是:跑得动吗?
本地大模型过去有一个非常现实的问题。
模型能力越强,显存要求越高。
结果经常变成:
模型很好。
跑不了。
或者能跑。
慢得不想用。
Muse Glimmer 30B 这次做了一件很现实的事情。
Meta 官方提供了针对本地设备优化的量化版本,4-bit 后模型权重可以压到 20GB 以内,官方直接把 24GB、32GB 显存设备列为目标硬件。
这意味着什么?
RTX 4090、5090,包括各种大显存工作站,终于不只是“体验一下大模型”。
而是开始有机会长期跑一个真正面向 Agent 的模型。
如果是 4090D 48G 这一类扩容显存环境,从容量上来看就更加从容。
真正需要关注的,已经不是:
“它能不能加载进去?”
而是:
“上下文能开多长?”
“Agent连续跑任务稳不稳定?”
“一天跑下来值不值得?”
这是完全不同的阶段。
Meta 自己公布的数据也挺夸张。
17GB 量化版本在 RTX 5090 上,普通生成大约 74.9 Token/s。
加入 DFlash speculative decoding 之后,平均达到约 233.4 Token/s。
当然。
这里一定要提醒一句:
速度快,不代表智商就高。
这也是这次实测最有意思的地方。
二、跑得飞快,不等于代码就写得飞起
很多人现在看模型,特别容易掉进一个坑。
Token/s 越高。
觉得模型越强。
其实完全不是一回事。
一个模型一分钟能输出一万字。
如果方向错了。
那只是更快地给你制造一万字垃圾。
Meta 官方甚至自己拿 Muse Glimmer 30B 和 Qwen3.6-27B Thinking 做了大量比较。
结果很有意思。
不是 Glimmer 全赢。
也不是 Qwen 全赢。
部分基准跑分对比:
MCP Atlas:Glimmer 75.5 > Qwen 62.5
DeepSearch QA:Glimmer 74.6 > Qwen 71.1
SWE-Bench Pro:Glimmer 51.2 > Qwen 50.2
SWE-Bench Verified:Glimmer 76.0 < Qwen 77.2
TerminalBench 2.1:Glimmer 51.7 < Qwen 60.7
OSWorld:Glimmer 65.9 < Qwen 75.6
所以我觉得,“Muse Glimmer 干翻 Qwen”这种标题看看就行。
真正有价值的结论是:
30B这个级别,本地模型的Agent能力已经开始进入真正可用的竞争区间。
至于具体用哪个。
还得看你的工作。
如果只是聊天。
没有必要这么折腾。
如果你让它看代码、调用工具、打开文件、修改项目、反复测试、发现错误再重新执行……
这时候差距才会慢慢体现出来。
三、真正值得看的,其实是 Hermes + Codex + 本地模型这套东西
Muse Glimmer 最让我感兴趣的地方,不是聊天能力。
而是它从出生开始,就是按照 Agent 智能体 去设计的。
多步推理。
工具调用。
失败重试。
代码修改。
图片理解。
长上下文。
这些能力被完整整合。
更关键的是,Ollama 已原生支持 Muse Glimmer 驱动 Hermes、Codex、Pi 等 Agent 工具。
这里很多人容易混淆。
可以简单理解成:
Muse Glimmer 是大脑。
Hermes、Codex 是手和脚。
以前我们玩本地大模型:
> 你问它一个问题。
> 它回答你一句话。
现在开始变成:
> 你给它一个目标。
> 它自己看文件。
> 自己调用工具。
> 自己写代码。
> 自己运行。
> 报错了再修改。
> 最后把结果交给你。
这才是我觉得真正值得关注的变化。
不是AI越来越会聊天了。
而是:
AI正在从“聊天框”往“执行层”移动。
Muse Glimmer 30B 到底值不值得用?
我的看法很简单。
如果你的目标只是找一个最聪明的聊天模型。
我不会因为它刚发布,就马上换。
如果你的目标是追求目前最强的编程模型。
我同样不会因为几个漂亮跑分,就直接下结论。
但是如果你正在研究:
本地部署、Hermes Agent、Codex、自动化工作流、企业私有AI
甚至想搭一台机器,让 AI 24 小时替你执行任务。
那这个模型非常值得关注。
因为它释放出来的信号,比模型本身更重要:
消费级硬件上的本地 Agent,正在从“极客玩具”,变成真正的生产工具。
以后衡量一台 AI 电脑,也许不会再只问:
“这张显卡能跑多少B?”
而会变成:
“这台机器一天能替我干多少活?”
这才是下一轮本地 AI 真正有意思的地方。
资料说明:Muse Glimmer 30B 于 2026 年 8 月发布,约 29.6B 参数,支持图文输入和 131K+ 上下文,采用 Apache 2.0 许可;Meta 官方将其定位为面向消费级设备运行的 Agent 模型。
本文涉及官方跑分及速度数据均来自 Meta 模型卡及官方发布资料。

