大数跨境

一张显卡跑30B Agent:Meta这次真正让我在意的,不是模型有多大

一张显卡跑30B Agent:Meta这次真正让我在意的,不是模型有多大 唐门AI OPC社区
2026-08-14
3
导读:这两天我看到 Meta 新出的 Muse Glimmer 30B。第一反应其实挺平静。30B。又一个模型。

这两天我看到 Meta 新出的 Muse Glimmer 30B

第一反应其实挺平静。

30B。

又一个模型。

现在 AI 圈每天新模型太多了。

今天 27B。

明天 30B。

后天又来个几百B。

光看参数,早就麻了。

但这次真正让我感兴趣的,不是它有 30B。

而是——

这个30B模型,已经开始认真考虑怎么住进我们自己的电脑里了。

而且不是住进去陪你聊天。

是准备出来干活。


一、以前我们折腾本地模型,最先问的是:跑得动吗?

本地大模型过去有一个非常现实的问题。

模型能力越强,显存要求越高。

结果经常变成:

模型很好。

跑不了。

或者能跑。

慢得不想用。

Muse Glimmer 30B 这次做了一件很现实的事情。

Meta 官方提供了针对本地设备优化的量化版本,4-bit 后模型权重可以压到 20GB 以内,官方直接把 24GB、32GB 显存设备列为目标硬件。

这意味着什么?

RTX 4090、5090,包括各种大显存工作站,终于不只是“体验一下大模型”。

而是开始有机会长期跑一个真正面向 Agent 的模型

如果是 4090D 48G 这一类扩容显存环境,从容量上来看就更加从容。

真正需要关注的,已经不是:

“它能不能加载进去?”

而是:

“上下文能开多长?”

“Agent连续跑任务稳不稳定?”

“一天跑下来值不值得?”

这是完全不同的阶段。

Meta 自己公布的数据也挺夸张。

17GB 量化版本在 RTX 5090 上,普通生成大约 74.9 Token/s

加入 DFlash speculative decoding 之后,平均达到约 233.4 Token/s

当然。

这里一定要提醒一句:

速度快,不代表智商就高。

这也是这次实测最有意思的地方。


二、跑得飞快,不等于代码就写得飞起

很多人现在看模型,特别容易掉进一个坑。

Token/s 越高。

觉得模型越强。

其实完全不是一回事。

一个模型一分钟能输出一万字。

如果方向错了。

那只是更快地给你制造一万字垃圾。

Meta 官方甚至自己拿 Muse Glimmer 30B 和 Qwen3.6-27B Thinking 做了大量比较。

结果很有意思。

不是 Glimmer 全赢。

也不是 Qwen 全赢。

部分基准跑分对比:

MCP Atlas:Glimmer 75.5 > Qwen 62.5

DeepSearch QA:Glimmer 74.6 > Qwen 71.1

SWE-Bench Pro:Glimmer 51.2 > Qwen 50.2

SWE-Bench Verified:Glimmer 76.0 < Qwen 77.2

TerminalBench 2.1:Glimmer 51.7 < Qwen 60.7

OSWorld:Glimmer 65.9 < Qwen 75.6

所以我觉得,“Muse Glimmer 干翻 Qwen”这种标题看看就行。

真正有价值的结论是:

30B这个级别,本地模型的Agent能力已经开始进入真正可用的竞争区间。

至于具体用哪个。

还得看你的工作。

如果只是聊天。

没有必要这么折腾。

如果你让它看代码、调用工具、打开文件、修改项目、反复测试、发现错误再重新执行……

这时候差距才会慢慢体现出来。


三、真正值得看的,其实是 Hermes + Codex + 本地模型这套东西

Muse Glimmer 最让我感兴趣的地方,不是聊天能力。

而是它从出生开始,就是按照 Agent 智能体 去设计的。

多步推理。

工具调用。

失败重试。

代码修改。

图片理解。

长上下文。

这些能力被完整整合。

更关键的是,Ollama 已原生支持 Muse Glimmer 驱动 Hermes、Codex、Pi 等 Agent 工具

这里很多人容易混淆。

可以简单理解成:

Muse Glimmer 是大脑。

Hermes、Codex 是手和脚。

以前我们玩本地大模型:

> 你问它一个问题。

> 它回答你一句话。

现在开始变成:

> 你给它一个目标。

> 它自己看文件。

> 自己调用工具。

> 自己写代码。

> 自己运行。

> 报错了再修改。

> 最后把结果交给你。

这才是我觉得真正值得关注的变化。

不是AI越来越会聊天了。

而是:

AI正在从“聊天框”往“执行层”移动。


Muse Glimmer 30B 到底值不值得用?

我的看法很简单。

如果你的目标只是找一个最聪明的聊天模型。

我不会因为它刚发布,就马上换。

如果你的目标是追求目前最强的编程模型。

我同样不会因为几个漂亮跑分,就直接下结论。

但是如果你正在研究:

本地部署Hermes AgentCodex自动化工作流企业私有AI

甚至想搭一台机器,让 AI 24 小时替你执行任务。

那这个模型非常值得关注。

因为它释放出来的信号,比模型本身更重要:

消费级硬件上的本地 Agent,正在从“极客玩具”,变成真正的生产工具。

以后衡量一台 AI 电脑,也许不会再只问:

“这张显卡能跑多少B?”

而会变成:

“这台机器一天能替我干多少活?”

这才是下一轮本地 AI 真正有意思的地方。


资料说明:Muse Glimmer 30B 于 2026 年 8 月发布,约 29.6B 参数,支持图文输入和 131K+ 上下文,采用 Apache 2.0 许可;Meta 官方将其定位为面向消费级设备运行的 Agent 模型。

本文涉及官方跑分及速度数据均来自 Meta 模型卡及官方发布资料。



【声明】内容源于网络
0
0
唐门AI OPC社区
1234
内容 36
粉丝 0
唐门AI OPC社区 1234
总阅读8
粉丝0
内容36