大数跨境

Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini

Meta旗舰模型翻身!比DeepSeek还便宜,华裔掌门人骑脸Gemini 智东西
2026-09-03
6
导读:5个月迭代4款模型,下一步还要开源。

5个月迭代4款模型,下一步还要开源。
编译 |  程茜
编辑 |  心缘

智东西9月3日消息,Meta今日发布新一代旗舰模型Muse Spark 1.3。在Artificial Analysis的AI分析指数榜上,该模型得分仅次于Claude Fable 5.1与Claude Opus 5,性能表现超乎预期。

Meta CEO马克·扎克伯格(Mark Zuckerberg)在社交平台X上高度评价了新模型的性能。Meta首席AI官汪滔(Alexander Wang)指出,Muse Spark 1.3成本极低,且在智能体与编程能力上大幅提升。搭配Muse Code使用时,其评测表现可媲美"Claude Code + Opus 5"组合。
实测数据显示,开发者利用该模型制作《我的世界》游戏,成本仅10美分(约合人民币0.67元)
就在Meta发布新模型4小时前,谷歌推出了其最强的推理与编程模型Gemini 3.8 Flash系列。然而随后在AI分析指数榜上,Muse Spark 1.3以62分反超Gemini 3.8 Flash的59分,仅次于Claude系列的66分和63分。
针对谷歌的短暂领先,汪滔在社交平台上直言"gemini who?”,并调侃"Gemini现在取消上线还不算晚”。
过去5个月,Meta密集发布了四款Muse Spark模型,迭代节奏显著加快。

基准测试显示,Muse Spark 1.3拿下5项第一。在长上下文及大部分编程测试中优于GPT‑5.6 Sol和Claude Opus 5,仅在Terminal‑Bench终端操作测试中与前者持平。其相对短板在于Agent能力,在联网搜索及通用知识任务中分数较低。

定价方面,Muse Spark 1.3与前代保持一致:输入(缓存未命中)1.25美元/百万token,输入(缓存命中)0.15美元/百万token,输出4.25美元/百万token。该价格略高于Gemini 3.8 Flash,但低于DeepSeek-V4-Pro高峰期价格。

▲部分大模型价格对比(智东西制表)

目前,Muse Spark 1.3已在Muse Code与Meta Model API中逐步上线,推理模式可用,极致推理模式(max‑reasoning)将在完成安全测试后开放。

Meta已规划后续路线图,包括更大参数规模模型、开源权重版本发布等。

开发者实测:速度快、成本低但生成效果一般

多位开发者在社交平台X分享了实测案例,普遍评价 Muse Spark 1.3 速度快、成本低,但生成效果尚未达到惊艳程度。

在基于照片进行3D建筑模拟的对比中,从1.1到1.3版本,模型在几何形状、结构及视觉效果上提升明显,且总成本维持在0.6美元(约合人民币4.03元)不变。

另一项对比测试中,开发者使用相同提示词让 Muse Spark 1.3 Ultra与Claude Fable 5.1 xHigh运行约2小时。Muse Spark 在2小时内执行了60次以上智能体任务,完成20轮自我优化循环,总成本不到1美元(约合人民币6.7元)。

也有网友质疑,低成本是否意味着模型未能彻底完成任务即停止。

在开源3D空间推理基准测试MineBench中,Gemini 3.8 Flash耗时1分51秒,Elo评分1888分;而 Muse Spark 1.3 耗时5分36秒,得分1787分,输出质量与顶尖前沿模型仍有差距。

综合对比Qwen 3.8 Max、GLM 5.3及GPT-5.6 Sol,开发者认为 Muse Spark 1.3 在成本与速度上可媲美 Qwen 3.8 Max,但 GLM 5.3 在性能、成本及Token用量上的综合表现最佳。

尽管 Muse Spark 1.3 价格低廉且运行迅速(约2分钟),但在成果质量与完成度上,仍不及耗时更长的 Qwen 3.8 Max(约1.5小时)。

长周期任务不跑偏,编程Token量减少25%

Meta官方博客强调,Muse Spark 1.3的核心优势在于支撑长周期任务及编程能力。

该模型能在单条长对话中并行处理多条工作流。面对开放式目标,它能自主构建上下文,修正方案漏洞,并输出完整交付成果。

通过多样化评测框架训练,模型能适配各类智能体环境。即使在信息杂乱的上下文中,也能准确匹配新输入与对应任务,避免偏离工作流程或遗漏约束条件。

模型具备更强的自我认知能力,能明确自身能力边界,在遇到障碍时采取审慎策略而非产生错误预测。例如在撰写流体仿真报告的任务中,它能准确生成所需文件。

编程方面,相比1.2版本,Muse Spark 1.3操作步骤更少,表述更简洁。测试显示,其工具调用次数减少20%,Token使用量减少25%。

▲Muse Spark 1.3生成的超能力风暴游戏

此外,模型在安全能力上进行了升级,增强了对抗鲁棒性,提升了对提示注入攻击的抵御能力,并在处理复杂任务时具备对不可逆操作的风险判断力。

结语:5个月迭代4版,Meta大模型要起飞了?

5个月内连续迭代4个版本,标志着Meta AI研发进程的重大转变。Muse Spark 1.3并未追求全维度通杀,而是集中资源突破长上下文与编程能力,在DeepSWE、OSWorld等真实工程任务基准上实现了对前沿模型的反超。
这种策略暗示未来企业与开发者选型将不再依赖“万能模型”,而是倾向于多模型路由方案,根据具体任务类型调度不同专长的模型,这或将成为Agent落地的主流趋势。
来源:Meta、X

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11807
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读223.7k
粉丝0
内容11.8k