大数跨境

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功 新智元
2026-09-03
8
导读:性能封顶价格击穿,谷歌被甩

新智元报道

九月伊始,AI 大模型竞赛进入白热化阶段。短短三天内,Anthropic、谷歌、Meta 等巨头接连发布五款前沿模型。就在谷歌 Gemini 3.8 Flash 刚确立轻量级霸主地位之际,Meta 迅速推出 Muse Spark 1.3,以更优的性能和极致的成本效率引发行业震动。

Muse Spark 1.3 被 Meta 视为编程与智能体工作领域的重大飞跃。Meta 超级智能实验室负责人 Alexandr Wang 透露,相比上一代,新版本减少了约 20% 的工具调用次数和 25% 的 Token 消耗,在长周期任务中的需求保持能力显著增强。

性能霸榜:全面超越竞品

Muse Spark 1.3 在多项权威基准测试中表现卓越,直接改写当前大模型排名格局。

在衡量长程编程能力的 DeepSWE v1.1 测试中,Muse Spark 1.3 以 75.4 分的成绩超越 Claude Opus 5(74.0 分)和 GPT-5.6 Sol(73.0 分),同时也将刚刚发布的 Gemini 3.8 Flash 甩在身后。

Muse Spark 1.3:75.4 分

Claude Opus 5:74.0 分

GPT-5.6 Sol:73.0 分

在其他关键开发者指标上,该模型同样表现出色:

  • SWEAtlas CodeBase QnA:得分 59.4,优于 GPT-5.6 Sol 和 Opus 5;
  • Terminal-Bench 2.1:得分 88.8;
  • MRCR 512K-1M:得分高达 98.1,远超 GPT-5.6 Sol 的 73.8 分;
  • Agent 能力:在 JobBench、OSWorld 等测试中与 Opus 5 差距微弱,跻身第一梯队。

在 Artificial Analysis 智能指数评测中,Muse Spark 1.3 获得 62 分,与 Claude Fable 5 持平,明显领先于 Gemini 3.8 Flash。

极致性价比:Less is More

Muse Spark 1.3 的核心优势不仅在于性能,更在于其惊人的成本控制能力。Meta 采取了“做减法”的技术路线,通过优化指令遵循能力和减少无效交互轮次,实现了输出更简洁、代码更干净的效果。

实测数据显示,开发者在使用 Muse Spark 1.3 Ultra Contributor 模式进行长达 2 小时的复杂任务时,模型进行了 20 轮自我改进循环(相当于 60 多次智能体运行),总成本不到 1 美元。相比之下,同等智力水平的竞品单任务成本普遍在 0.94 至 1.23 美元之间,而 Muse Spark 1.3 仅为 0.55 美元。

在定价策略上,Meta 维持了输入 1.25 美元/百万 Token、输出 4.25 美元/百万 Token 的标准,而其贡献者版定价更是被称为美国 AI 实验室的"DeepSeek 时刻”,极具竞争力。

战略意图:布局 7×24 小时个人智能体

Muse Spark 1.3 的快速迭代反映了 Meta 在 ASI(超级人工智能)领域的雄心。Alexandr Wang 明确表示,所有改进均服务于打造"7×24 小时在线的个人智能体”这一终极目标。

要实现全天候智能代理服务,模型必须兼具极高的稳定性与极低的运行成本。Muse Spark 1.3 展现出的长线程处理能力、并行工作流支持以及低幻觉率,正是为了解决智能体在模糊指令下的主动提问、阻碍时的求助机制以及关键操作前的确认逻辑。

行业反思:刷榜背后的真实体验

尽管 Muse Spark 1.3 数据亮眼,但行业对其“刷榜”现象仍存质疑。BridgeMind 等机构指出,近期各大模型基准测试分数飙升,但真实世界的应用体验并未同步提升。

压力测试显示,部分模型在特定约束下表现不佳,暴露出“为了跑分而训练”的行业怪圈。Artificial Analysis 报告也发现,Muse Spark 1.3 在某些知识测试中的弃权率有所上升,这表明其通过减少胡编乱造降低了幻觉率,但也侧面反映出绝对知识储备的增长可能不如跑分显示得那么夸张。

未来展望:智能体工程决胜下半场

Muse Spark 1.3 与 Gemini 3.8 Flash 的发布标志着大模型竞争进入新阶段:

  1. 参数红利见顶:单纯依靠扩大参数规模提升智力的边际效益递减,系统架构创新(如循环深度推理)和工具调用的极致优化成为关键。
  2. 智能体工程为王:竞争焦点从“谁更会说话”转向“谁更能干活”。未来的核心壁垒是在极低成本下,完成长程复杂任务的真实落地能力。

Muse Spark 1.3 以不到 1 美元完成 60 次试错循环的能力,预示着 AI 商业模式的重塑。谁能率先实现低成本、高可靠的智能体规模化应用,谁就能掌握下一个时代的主动权。

参考资料:

https://research.meta.ai/blog/introducing-muse-spark-1-3
https://artificialanalysis.ai/zh/models/muse-spark-1-3

编辑:Aeneas

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16515
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读377.3k
粉丝0
内容16.5k