用户与 Agent 的交互逻辑发生显著变化:面对模糊指令,模型会主动询问;遇到阻碍时寻求帮助;涉及不可逆操作前进行确认。此外,模型支持根据用户偏好调整汇报频率,既能持续更新进度,也能减少打扰以专注完成任务。Meta 还强化了模型的能力边界判断,使其能准确区分“已知与未知”、“可为与不可为”,避免虚构结果。在复杂指令遵循方面,新模型在多步骤、多限制条件的任务中,能更持久地记忆前文要求,减少后半程遗漏或偏离流程的情况。Meta 展示的航空工程报告案例印证了这一点:模型需同时读取 CFD 仿真数据与 STEP 格式 CAD 文件,整理计算域、材料属性等参数,分析升阻力与湍流现象,最终按指定章节生成 PDF。这表明,能否在长周期、高复杂度任务中保持状态,已成为下一阶段模型竞争的关键指标。Meta AI 负责人 Alexandr Wang 指出,此次改进直接服务于“个人 Agent"愿景,即构建能长期代表用户工作、持续达成目标的 AI 系统。
Coding Agent 效能跃升与成本优化
编程能力是 Muse Spark 1.3 的另一大升级重点。通过增加长周期编程任务训练,新模型在日常工程场景中表现更为克制,生成的代码风格更加简洁,有效减少了不必要的对话轮次。内部测试数据显示,完成相同任务时,Muse Spark 1.3 平均减少约 20% 的工具调用和 25% 的 Token 消耗。对于向 Agent 编程演进的 AI Coding 产品而言,这意味着等待时间、推理成本及 API 消耗的同步降低,其实际意义远超单纯的 Benchmark 分数提升。参与研发的北大校友孙之清透露,团队对 Avocado 模型进行了后训练并强化了测试时扩展能力。此外,Meta 推出了"contributor tier"计划:开发者若同意使用其代码和数据训练模型,即可享受更低的使用价格。目前已有相当比例的开发者加入该计划,这使得 Meta 能以低成本获取真实开发场景数据,反哺模型迭代。针对长时运行带来的安全挑战,Meta 采取了增加安全与对齐投入的策略,而非暂停研发。目前推理模式已开放,高计算量的 max reasoning 版本将在完成额外安全测试后发布。