Hi~新朋友,记得关注我们哟
凭借 Llama,Meta 将自己定位为 OpenAI 的开放替代方案。随着其新的闭源模型发布,Meta 现在将自己定位为一家低成本、高价值的竞争者。
最新消息:Meta 正式发布 Muse Spark 1.1,这是一款专为智能体任务训练的视觉 - 语言模型,并同步推出 Meta Model API,首次以付费形式提供模型访问服务。
✴ 输入/输出:支持文本、图像及视频输入(最大 1,048,576 token);输出为文本(最大 131,072 token,生成速度 119 token/s)。
✴ 核心功能:具备工具调用、Prompt 缓存及可调节推理级别(从无到超高共六档)。
✴ 性能表现:在 Scale AI 的 MCP Atlas 工具使用榜及 JobBench 中位居榜首;在 Artificial Analysis 智力指数中与 GPT-5.6 Luna、GLM-5.2 持平,且单任务成本更低。
✴ 可用性/定价:可通过 Meta AI 应用及官网免费使用;API 处于公开预览版(限美国,需排队,含 20 美元额度)。定价为:输入 1.25 美元/百万 token,缓存 0.15 美元/百万 token,输出 4.25 美元/百万 token;网络搜索功能 2.50 美元/千次查询。
✴ 未披露信息:参数量、模型架构、训练数据及具体训练方法。
运作方式
Meta 未披露 Muse Spark 1.1 的具体构建细节。该模型更新了自今年 4 月以来驱动 Meta AI 的初代版本,训练重点聚焦于上下文管理、计算机操作及多智能体协调。
智能体编程框架适配
模型经过训练,可在多种面向智能体的编程框架中运行。这些框架能连接文件、工具及测试环境,支持任务规划与子智能体编排。
双向委派机制
模型具备双向委派能力:作为主导者时,它将任务拆解并分派给多个子智能体并行执行,缩短耗时;作为执行者时,它遵循既定角色,并在决策超出权限时将控制权交还编排模型。
动态上下文管理
模型能在长任务中自动调整输入上下文,检索早期细节并压缩中间交互,同时保留后续步骤所需的关键信息。
高效计算机操作
在自动化操作中,模型可自主选择编写脚本或直接操作(点击/输入),以寻求最优速度与路径。此外,它支持单次执行多个操作,显著提升了速度与性能。
测试结果
Muse Spark 1.1 在智能体工具使用基准测试中表现卓越,虽整体智能水平略逊于顶尖模型,但在盲测中排名紧随其后,且单任务成本控制极佳。
综合智力指数 (Intelligence Index)
在 Artificial Analysis 的九项经济价值任务评测中,开启"xhigh"推理模式的 Muse Spark 1.1 得分为 51 分,与 GLM-5.2 及 GPT-5.6 Luna 持平,略低于 Claude Sonnet 5(53 分)。其单任务成本为 0.26 美元,除 GPT-5.6 Luna(0.21 美元)外,优于所有同分段模型。
人工盲测排名 (Text Arena)
在 Arena.ai 的 Text Arena 中,Muse Spark 1.1 以 1,490 Elo 排名第六,仅次于 Claude Fable 5 及四个 Claude Opus 版本,略高于 GPT-5.6 Sol(1,486 Elo)。
编程智能体指数 (Coding Agent Index)
在该指数中,Muse Spark 1.1 得分为 71.3,微落后于 GPT-5.6 Luna(71.4),但高于 Gemini 3.5 Flash(70.1)。其单任务成本约 1.40 美元,属同类最低,但完成任务耗时较长。
工具使用与职业任务基准
在 MCP Atlas 排行榜中,Muse Spark 1.1 通过率达 88.1%,超越 Gemini-3.5-Flash 及 Claude Fable 5。在 JobBench 白领职业任务测试中,它以 54.7% 的得分排名第二,仅次于 Claude Fable 5。
新闻背后
Muse Spark 1.1 发布于模型密集迭代期。同日,OpenAI 向公众开放 GPT-5.6 系列;前一日,Grok 4.5 强调低成本优势;两周后,Google 将发布 Gemini 新系列。此外,Meta 本周还推出了 Muse Image 及 Muse Video 模型。Muse Spark 1.1 是首个通过 Meta Model API 提供的模型。
重要原因
Token 定价决定了应用规模化的经济可行性。Muse Spark 1.1 大幅降低了这一门槛,其输出 Token 成本仅为竞争对手(如 Claude Opus 4.8、GPT-5.6 Sol 等)的一小部分。数据显示,仅 GPT-5.6 Luna 的运行成本更低。
扎克伯格将此策略视为对竞争对手商业模式的挑战,指出其他实验室定价过高且利润丰厚。依托广告收入补贴研发与推理成本,Meta 拥有结构性优势。若迫使竞争对手跟进降价,整个行业的智能体运行成本将显著下降。
行业观察
模型能力正从外围支撑系统向模型权重本身迁移。指令遵循与工具使用已从提示工程或外部代码包裹,转变为模型的内在训练目标。Muse Spark 1.1 延续了这一趋势,将任务委派、升级处理及上下文管理等原本需开发者手工构建的功能内化至模型中。这将减少对外部工具的依赖,加速智能体应用的普及。
点击下方阅读原文查看更多有趣内容哦~

