
智东西9月3日消息,Meta今日发布新一代旗舰模型Muse Spark 1.3。在Artificial Analysis的AI分析指数榜上,该模型得分仅次于Claude Fable 5.1与Claude Opus 5,性能表现超乎预期。
基准测试显示,Muse Spark 1.3拿下5项第一。在长上下文及大部分编程测试中优于GPT‑5.6 Sol和Claude Opus 5,仅在Terminal‑Bench终端操作测试中与前者持平。其相对短板在于Agent能力,在联网搜索及通用知识任务中分数较低。
▲部分大模型价格对比(智东西制表)
目前,Muse Spark 1.3已在Muse Code与Meta Model API中逐步上线,推理模式可用,极致推理模式(max‑reasoning)将在完成安全测试后开放。
Meta已规划后续路线图,包括更大参数规模模型、开源权重版本发布等。
开发者实测:速度快、成本低但生成效果一般
多位开发者在社交平台X分享了实测案例,普遍评价 Muse Spark 1.3 速度快、成本低,但生成效果尚未达到惊艳程度。
在基于照片进行3D建筑模拟的对比中,从1.1到1.3版本,模型在几何形状、结构及视觉效果上提升明显,且总成本维持在0.6美元(约合人民币4.03元)不变。
另一项对比测试中,开发者使用相同提示词让 Muse Spark 1.3 Ultra与Claude Fable 5.1 xHigh运行约2小时。Muse Spark 在2小时内执行了60次以上智能体任务,完成20轮自我优化循环,总成本不到1美元(约合人民币6.7元)。
在开源3D空间推理基准测试MineBench中,Gemini 3.8 Flash耗时1分51秒,Elo评分1888分;而 Muse Spark 1.3 耗时5分36秒,得分1787分,输出质量与顶尖前沿模型仍有差距。
综合对比Qwen 3.8 Max、GLM 5.3及GPT-5.6 Sol,开发者认为 Muse Spark 1.3 在成本与速度上可媲美 Qwen 3.8 Max,但 GLM 5.3 在性能、成本及Token用量上的综合表现最佳。
尽管 Muse Spark 1.3 价格低廉且运行迅速(约2分钟),但在成果质量与完成度上,仍不及耗时更长的 Qwen 3.8 Max(约1.5小时)。
长周期任务不跑偏,编程Token量减少25%
该模型能在单条长对话中并行处理多条工作流。面对开放式目标,它能自主构建上下文,修正方案漏洞,并输出完整交付成果。
通过多样化评测框架训练,模型能适配各类智能体环境。即使在信息杂乱的上下文中,也能准确匹配新输入与对应任务,避免偏离工作流程或遗漏约束条件。
模型具备更强的自我认知能力,能明确自身能力边界,在遇到障碍时采取审慎策略而非产生错误预测。例如在撰写流体仿真报告的任务中,它能准确生成所需文件。
编程方面,相比1.2版本,Muse Spark 1.3操作步骤更少,表述更简洁。测试显示,其工具调用次数减少20%,Token使用量减少25%。
▲Muse Spark 1.3生成的超能力风暴游戏
此外,模型在安全能力上进行了升级,增强了对抗鲁棒性,提升了对提示注入攻击的抵御能力,并在处理复杂任务时具备对不可逆操作的风险判断力。
结语:5个月迭代4版,Meta大模型要起飞了?

