模型发布“大周”:Meta Muse Spark 1.3 正式上线
本周堪称 AI 模型发布的“大周”。继 Claude Fable 5.1、Gemini 3.8 Flash 发布后,OpenAI 的 Astra 与 SpaceXAI 的 Grok 4.7 也即将面世。在此背景下,Meta 正式推出新一代模型 Muse Spark 1.3。
Meta 创始人扎克伯格罕见地在 X 平台亲自发文站台。他表示,Muse Spark 1.3 是公司在编程和智能体任务上迄今为止最大的一次提升,并预告代号为“西瓜”的下一代模型及 Muse Spark 即将开源。该帖子发布 3 小时内,浏览量已突破 120 万。Meta 首席 AI 官 Alexandr Wang 随后转发确认了新模型的发布。
基准测试:编程与长上下文表现强劲
相较于上一代 Muse Spark 1.2 对标 GPT-5.6 中杯版本引发的争议,此次 1.3 版本直接对标顶配模型。测试数据显示,Muse Spark 1.3 在 11 项基准测试中获得 5 项第一,优势主要集中在编程能力和长上下文处理两个方向。
核心指标领先
在软件工程基准 DeepSWE v1.1 中,Muse Spark 1.3 得分为 75.4%,超越 Claude Opus 5(74.0%)和 GPT-5.6 Sol(73.0%)。在代码库理解测试 SWEAtlas 中,其准确率达到 59.4%,位居全场第一。终端编程测试 Terminal-Bench 2.1 中,该模型得分 88.8%,与 GPT-5.6 Sol 持平。此外,在长上下文检索 MRCR 两项测试中,得分均超过 98 分,表现遥遥领先。
与上一代 1.2 版本相比,1.3 版本提升显著:DeepSWE 从 55.0% 跃升至 75.4%,OSWorld 从 47.6% 提升至 66.9%。
智能体任务仍有差距
尽管在编码领域表现优异,Muse Spark 1.3 在通用智能体(Agent)基准上的表现略显平淡。在知识工作 GDPVal-AA v2 测试中,得分为 1754,略低于 Claude Opus 5 的 1824;工具调用 JobBench 测试中得分为 64.9,稍逊于 Claude Opus 5 的 65.7;计算机操控 OSWorld 2.0 测试中得分为 66.9,仍落后于竞争对手的 68.3。
值得注意的是,跑分最强的 Muse Spark 1.3 (max) 版本目前尚未正式发布,需等待额外安全测试结束后上线。
定价策略:低价背后的数据代价
Muse Spark 1.3 的标准 API 定价为每百万 tokens 输入 1.25 美元、输出 4.25 美元,与上一代保持一致。相较于 Claude Opus 5(5/25 美元)、GPT-5.6 Sol(4/20 美元)及 Claude Fable 5.1(10/50 美元),其价格极具竞争力。同日发布的 Gemini 3.8 Flash 定价虽更低(0.75/3.75 美元),但从综合排名来看,满血版 Muse Spark 1.3 性能更优。
扎克伯格所称的“几乎不要钱”,特指打折的 Contributor 层级:输入 0.10 美元,输出 0.20 美元,缓存输入仅需 0.002 美元。然而,选择该层级的代价是用户的提示词和代码输出将被 Meta 用于模型训练。此前 Muse Code 上线时,默认开启此数据共享模式,用户需手动切换方可退出。因此,企业在选用时需审慎评估数据隐私风险。
行业观察:Meta AI 的挑战与困境
当前 Meta AI 的发展处境略显尴尬。在开源领域,面对国内 DeepSeek、千问、Kimi、GLM 等模型的强势竞争,Meta 的优势不再明显;而在闭源高端模型赛道,其与 OpenAI、Anthropic 乃至 Grok 仍存在差距,尤其在六项 Agent 基准测试中未获第一,官方仅能表示“越来越接近”。
自 Llama 4 被指跑分注水以来,Meta 的 AI 战略似乎屡受挫折。今年 7 月,扎克伯格在内部会议上对智能体进展缓慢表示不满,当时 Alexandr Wang 曾展示代号“西瓜”的新模型声称追平 GPT-5.5。然而历经近五个月,从牛油果到 1.1、1.2 再到如今的 1.3,四个版本的迭代似乎仍未完全实现既定目标。代号“西瓜”的终极模型仍在路上,Meta 此次可谓“起了个大早,赶了个晚集”。

