他们家的 M2.7 模型,正式引入了 Agent Teams(多智能体协作)机制。这超越了常规的群聊功能,从底层让 AI 学会了像公司团队一样分工协作、自主拆解复杂长周期任务。
一句话总结:AI 正在从听指令干活的工具,进化为自己组队、自己分任务、自己解决问题的"数字同事"。
🤖 什么是 Agent Teams?为什么重要?
先说痛点。
过去的 AI Agent,无论多聪明,本质上都是"单兵作战"。你给它一个复杂任务,它要么硬扛到底出错,要么拆成几步让你手动衔接。
MiniMax 的解法是:让模型自己内化多角色协作能力。
“Agent Teams 对模型提出了范式级的要求:角色边界、对抗性推理、协议遵从、行为差异化——这些不是靠提示词就能实现的,必须内化为模型的原生能力。”
具体体现在三个层面:
|
|
|
|
|---|---|---|
| 角色锚定 |
|
|
| 对抗性推理 |
|
|
| 状态机自主决策 |
|
|
这意味着什么?一个长周期项目,现在可以交给一组 AI 团队,它们自己分工、自己审核、自己迭代。
⚡ 实战数据:硬指标说话
光说概念不够,看实测数据。
软件工程:3分钟恢复生产事故
在传统开发中,线上出 bug,排查流程通常是:看告警 → 查日志 → 定位代码 → 修复 → 测试 → 上线。一套下来几小时起步。
M2.7 的做法是:
-
1. 关联监控指标和部署时间线做因果推理 -
2. Trace 采样统计分析,提出精确假设 -
3. 主动连数据库验证根因 -
4. 定位到缺失索引迁移文件后,先用非阻塞索引止血,再提交合并请求
结果?MiniMax 披露多次将生产事故恢复时间缩短至 3 分钟以内。
|
|
|
|
|---|---|---|
| SWE-Pro |
|
|
| VIBE-Pro |
|
|
| Terminal Bench 2 |
|
|
| SWE Multilingual |
|
|
| Multi SWE Bench |
|
|
办公自动化:从写文档到财报建模
在专业办公领域,M2.7 的 GDPval-AA ELO 得分 1495,开源模型最高,超过 GPT-5.3。
典型案例:台积电营收建模。
-
• 自主阅读年报和电话会议纪要 -
• 交叉比对多份研报 -
• 独立设计假设并构建营收预测模型 -
• 输出 PPT 和 Word 研报
从业者反馈:输出可直接作为初稿进入后续工作流。
🔁 100轮自主进化:模型在"自己训练自己"
这才是最狠的部分。
MiniMax 让 M2.7 参与自身的进化过程。内部 Agent 自主完成了一个完整的优化闭环:
-
1. 分析失败轨迹 -
2. 规划修改方案 -
3. 修改代码 -
4. 运行评估 -
5. 对比结果 -
6. 决定保留或回滚
这个循环在内部编程脚手架优化中自主跑了 100+ 轮。
结果?内部评估集性能提升 30%。
Agent 发现了采样参数最优组合、工作流指南优化、循环检测等改进点。在 MLE Bench Lite(22 个 ML 竞赛)中,M2.7 取得 66.6% 获奖率,仅次于 Opus-4.6 (75.7%) 和 GPT-5.4 (71.2%),与 Gemini 3.1 持平。
🌏 中国 AI 在 Agent 赛道的位置
把数据拉出来对比一下:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
MiniMax 的差异化很清晰:不做全能选手,专注把 Agent 协作和自我进化做到极致。
🚀 M3 前瞻:下一步是什么?
2026 年 6 月 1 日,MiniMax 发布了 M3 旗舰模型:
-
• 1M 超长上下文:百万 token 级文档处理 -
• 原生多模态:文本、图像、音频统一架构 -
• MiniMax Code:本地浏览器 agentic 编码引擎
Agent 生态正在加速。从"能用"到"好用",从"单兵"到"团队",这条路的下一步,值得持续关注。
参考来源:
• MiniMax M2.7 官方博客 • MiniMax M2.7 GitHub • PanDaily M3 报道 • DataCamp M3 教程

