大数跨境

小扎高调开战闭源AI!推30B智能体模型,消费级显卡就能跑,杨立昆点赞

小扎高调开战闭源AI!推30B智能体模型,消费级显卡就能跑,杨立昆点赞 智东西
2026-08-11
16
导读:Meta的愿景是为数十亿人提供免费Agent。

Meta 愿景:为数十亿人提供免费本地 Agent。
编译 |  茄子
编辑 |  程茜
智东西 8 月 11 日消息,Meta 昨晚正式发布 300 亿参数本地 Agent 模型 Muse Glimmer,并宣布开放权重。这是 Meta 成立超级智能实验室后首次开源模型权重。
Meta 创始人兼 CEO 扎克伯格随后发表长文,阐述超级智能发展路线,呼吁减少美国对开源 AI 的限制,批评封闭模型对技术的垄断,同时支持维持芯片出口管制。他还预告将开放旗舰模型 Muse Spark 1.2 的权重。

▲扎克伯格官宣开放 Muse Glimmer 权重并发长文(图源:X)

Muse Glimmer 具备工具调用、多步推理及多模态处理能力,能在执行失败时自动分析并重试。该模型定位为本地个人 Agent 基础模型,适用于文件整理、日程管理、消息起草、本地编程等场景。
经量化优化,Muse Glimmer 体积不足 20GB,可在配备单张消费级显卡的 PC 或部分 Mac 上离线运行。Meta 前首席 AI 科学家杨立昆对此表示高度认可,称开放权重是重要一步。

▲杨立昆评论(图源:X)

Meta 超级智能实验室负责人亚历山大·王指出,Muse Glimmer 为 300 亿参数稠密模型,基于 Apache 2.0 协议开源,可在 24GB 显存设备上稳定运行而不牺牲 Agent 任务性能。目前模型权重已在 Hugging Face 上线。

▲亚历山大·王官宣开放 Muse Glimmer 权重并预告开放 Muse Spark 1.2 权重(图源:X)

▲Muse Glimmer 的开放权重页面(图源:Hugging Face)

实测显示,Muse Glimmer 支持离线操作 Mac 应用、生成可运行游戏,并在单张 RTX 4090 上支持长上下文,但在响应速度和 Token 消耗方面仍有优化空间。在着色器生成测试中,其表现优于同量级的 Qwen 3.6。

▲网友对比 Muse Glimmer 30B 和 Qwen 3.6 27B 的着色器生成能力(图源:X)

基准测试方面,Muse Glimmer 在 22 项测试中斩获 12 项 SOTA,优势集中在 Agent 任务和推理领域;但在桌面操作、编程及部分多模态任务上略逊于 Qwen 3.6,安全性测试表现不及 Gemma 4。

▲Muse Glimmer 在 Agent、编程、多模态测试中的表现(图源:Meta)

技术上,Muse Glimmer 通过知识蒸馏、4 比特量化和 DFlash 推测解码,将模型从 55GB 压缩至 20GB 以内,并利用草稿模型显著提升输出速度。
扎克伯格强调,超级智能不应被少数巨头垄断。Meta 计划恢复部分模型开源,向全球用户提供免费或低价的个人 Agent,并推出连 Meta 自身也无法访问数据的完全私密模式。此外,Meta 设立 10 亿美元基金,支持美国数据中心建设及相关社区发展。

▲Meta 认为应将超级智能普及到每个人手中(图源:Meta)

三组实测:离线操控 Mac、生成游戏与单卡长上下文

本地电脑操作能力验证

开发者通过 Cua Driver 验证了 Muse Glimmer 的本地操作能力。模型结合 macOS 辅助功能接口与屏幕识别,成功完成备忘录新建清单及提醒事项添加日程等任务。尽管在苹果自研芯片设备上存在延迟,但其“离线操作”的可用性已获认可。

▲Muse Glimmer 在本地操作 macOS 备忘录(图源:X)

测试中也发现,工具定义和屏幕截图会快速占用上下文,导致操作混乱。开发者计划通过精简工具接口和优化状态信息占比,提升模型连续运行能力。

本地编程与游戏生成对比

AI 平台 Atomic Chat 在 RTX 5090 上对比了 Muse Glimmer、Gemma 4 和 Qwen 3.6 的游戏生成能力。Muse Glimmer 一次性生成的《太空侵略者》《俄罗斯方块》和《打砖块》均可正常运行,逻辑完整无崩溃;而竞品均出现不同程度的逻辑错误或画面失效。

▲Atomic Chat 比较三款本地模型生成复古街机游戏的效果(图源:X)

代价是 Muse Glimmer 消耗了更多时间和 Token(约 8.34 万 Token,耗时 17.7 分钟),远高于其他两款模型。

▲Atomic Chat 比较 Muse Glimmer、Gemma 4 31B 和 Qwen 3.6 27B 的本地编程能力(图源:X)

消费级显卡部署效率

在单张 RTX 4090 上,UD-Q4_K_XL 量化版本的 Muse Glimmer 可配置 13 万 Token 上下文,显存占用约 19.34GB。启用 DFlash 草稿模型后,输出速度提升至 75 token/s,基本跑满 24GB 显存。该技术通过共享注意力查询缓存,有效降低了长文本处理的显存需求。

▲开发者在单张 RTX 4090 上测试 Muse Glimmer 的 UD-Q4_K_XL 量化版本效果(图源:X)

▲开发者在单张 RTX 4090 上测试 Muse Glimmer(图源:X)

核心能力:工具调用纠错与全流程开发

多轮任务规划与错误自愈

Muse Glimmer 具备长流程执行、准确工具调用及多模态理解能力。在多轮操作中,若工具执行失败,模型能判断原因并重新尝试,而非直接终止任务。其内置感知编码器可同步处理图文信息,支持 100 多种语言及推理强度调节。

从零开发智能家居面板案例

Meta 演示了 Muse Glimmer 在 OpenCode 中的复杂任务:用户仅输入自然语言指令,模型即自主制定计划,查找局域网 Home Assistant 地址,索取访问令牌,识别影音接收器功能,并最终编写 HTML/CSS/JS 生成响应式控制面板,实现了对设备的全面控制。

▲Muse Glimmer 在 OpenCode 中开发影音接收器控制面板(图源:Meta)

基准测试:22 项中夺 12 项 SOTA

Agent 与推理任务优势明显

在与 Gemma 4 31B 和 Qwen 3.6 27B 的对比中,Muse Glimmer 在 22 项基准测试中获得 12 项第一。其在 MCP Atlas(多工具调度)和 DeepSearch QA(深度检索)中得分领先,SWE-Bench Pro 编程测试略胜 Qwen 3.6,AIME 2026 数学测试更是位居榜首。
不过,Qwen 3.6 在部分桌面操作和多模态任务上表现更佳,Gemma 4 则在安全测试中违规率更低。

▲Muse Glimmer 与 Gemma 4、Qwen 3.6 基准测试对比(图源:Meta)

技术解密:模型压缩与加速解码

从 55GB 压缩至 20GB 的关键技术

Muse Glimmer 采用知识蒸馏路线,以 Muse Spark 为教师模型,结合监督微调、在线蒸馏和强化学习进行训练。通过 4 比特量化技术,模型体积从 55GB 降至 20GB 以下,使其能在 24GB 或 32GB 显存环境中与感知编码器、KV 缓存及草稿模型协同运行。

▲压缩后的模型可以与 KV 缓存和小型模型共同运行在 24GB 或 32GB 内存环境中(图源:Meta)

DFlash 推测解码提速 3.1 倍

为解决长推理等待问题,Meta 引入基于 DFlash 的轻量级草稿模型,通过并行验证候选 Token 提升生成速度。测试显示,该技术在 RTX 5090 上使解码速度提升 3.1 倍,在 M5 Max 和 M4 Max 上分别提升 1.8 倍和 1.5 倍。

▲DFlash 推测解码在不同硬件上的加速效果(图源:Meta)

目前,Ollama、LM Studio、Unsloth 等主流框架已宣布支持 Muse Glimmer,AMD、英伟达等硬件厂商也正参与性能优化。

战略愿景:普及个人超级智能

免费 Agent 与完全私密模式

扎克伯格提出四大举措落地个人超级智能路线:一是提供免费或低价个人 Agent,覆盖健康、财务等生活场景;二是推出完全私密模式,确保连 Meta 也无法读取用户数据;三是继续开放模型权重,反对过度审查;四是加速芯片、能源及数据中心建设,同时支持维持先进芯片出口管制。
在治理层面,Meta 将引入独立董事会审查发布标准,并考虑在训练期间向政府提供中间检查点,以评估模型能力并加固基础设施安全。

结语:本地 Agent 开启新竞争维度

Muse Glimmer 的成功压缩标志着 Meta 在本地 AI 领域的实质性突破。其实测表现证明,断网状态下的桌面操作与编程任务已具备可行性。随着硬件性能提升及生态完善,Agent 的竞争焦点将从云端能力延伸至端侧执行效率与数据隐私保护。
来源:Meta、X
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11763
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读201.1k
粉丝0
内容11.8k