大数跨境

Agent 跑分追平 Codex、成本低至 1.95 美元,这家中国公司做到了

Agent 跑分追平 Codex、成本低至 1.95 美元,这家中国公司做到了 AI科技评论
2026-07-26
5
导读:他们找到了办法,让一群聪明的 Agent 既听话又高效地合作。

他们找到了一种新范式,让一群聪明的 Agent 既能高效协作,又能保持独立进化。


编辑丨马晓宁 高允毅

德勤 2026 年最新报告显示,86% 的多 Agent 项目在真实落地时遭遇失败。硅谷频发“无限智能体死循环”:多个 Agent 在协同处理任务时因意见不合互相纠错,导致空转数小时,消耗大量 Token 却无实质进展。

大模型的智力已非瓶颈,行业真正的痛点在于工程协作:如何让一群聪明的 Agent 既听话又高效地合作?

EvoMap 团队推出的 EvoX 给出了答案。它摒弃了叠加“超级总管”的传统思路,转而采用“蜂群式自进化”策略:每个 Agent 独立执行、各自进化,最终像自然界蜂群一样自主汇合。实测数据显示,该系统容错率翻倍,长周期任务完成率显著提升,且大幅降低了成本。

01 别不信,你的 Agent 大概率也撞过这堵墙

当前市面上的 Agent 系统主要存在两种形态:

第一种:单打独斗。一个 Agent 负责全流程。短任务尚可,一旦任务变长,上下文截断导致关键指令被淹没,信噪比急剧下降。

第二种:主从团队(Agent Team)。由主 Agent 拆解任务,子 Agent 执行后汇报。这种模式实为“传话游戏”,每多一层传递,信息失真风险便增加一分。最终交付的往往不是最优解,而是主 Agent 基于有限上下文“重新理解”后的版本。

多 Agent 系统的核心瓶颈从来不是数量,而是角色协作、多轮汇合机制以及能否涌现出有效的组织形式。EvoX 提出了三个关键评判标准:

  • 复杂任务能否被完整覆盖?
  • 局部结果能否可靠汇合?
  • 系统能否进化出更有效的组织方式?

这比单纯堆砌 Agent 数量更为复杂,也更贴近用户实际需求。

02 别再堆 Agent 数量了,这种组织方式效果更好

EvoX 的核心理念是:复杂任务不应依赖单个超级 Agent 兜底,也不应照搬人类公司的科层制。理想方案是将大任务拆解为边界清晰的原子任务,每个 Agent 专注负责特定模块,通过可靠接口自动汇合,拼成完整拼图。

这种模式类似大自然中的“蜂群筑巢”。

团队在六个主流 Benchmark 上进行了验证,涵盖 563 个任务(包括逻辑、数学、物理等)。在模型、题集和判分标准一致的前提下,对比了三种工作模式:

  • 蜂群模式(EvoX):任务拆分为原子级,每题由独立 Agent 处理,答案写入约定位置,程序按题号自动回收。
  • Agent Team 模式:模拟主协调 Agent(如 Claude Code),先见全题、拆分子任务、连续解题汇报,最后由主 Agent 合成答案。
  • 单体模式:一个 Agent 在同一上下文中完成全部任务。

结果显示,同一模型下,三种模式的正确率呈现明显差距。蜂群模式胜在三点:

  1. 拆解更细:原子任务边界明确,覆盖关系可追踪。
  2. 执行隔离:每个 Agent 仅面对局部问题,不受其他任务上下文干扰。
  3. 汇合不转述:程序直接按约定位置回收答案,避免了主观压缩和信息取舍。

蜂群模式的灵魂在于:多 Agent 的产出在汇总时,不再受限于主 Agent 的上下文窗口。

03 传话式协作,弄丢了近六成正确结果

深入分析 Agent Team 模式的中间过程发现:在 563 个任务中,过程中曾有 373 个答案正确。但经过报告传递和主协调 Agent 综合后,最终交付的正确答案仅剩 217 个。

这意味着,有 166 个一度正确的答案在交付环节丢失或出错,过程正确答案的保留率仅为 55.50%。如同传话游戏,每一层传递都可能导致信息失真。

EvoX 的核心优势在于不让正确答案经历不必要的传递。每题有固定的处理者和输出位,Agent 解题后由程序直接回收,无需其他 Agent 转述。

这是主从式团队与蜂群模式的根本分野:前者将“汇总”责任交给上层模型判断,后者仅需一个可检查、可执行、可复现的接口进行“汇合”。在长周期任务中,这种工程复杂度的差异决定了最终效果。

04 蜂群不止会干活,还会自己挑队友了

真实任务往往充满依赖、冲突和动态变化。更进一步的问题是:Agent 能否自主长出专长、选择伙伴并构建组织结构?

团队进行了第二项实验,聚焦于“选伙伴”这一动作。24 个同配置 Agent 在执行任务后将经验沉淀为"Gene(经验基因)”。随着某类心得积累,Agent 在下轮选择同类任务的概率提升,形成独特的“履历”。

随后,让这些 Agent 从同一张关系网出发,随机打断部分连接,由其自主选择新连接对象。

结果显示,信息暴露方式决定了组织形态:

  • 仅看社交信息:Agent 倾向维持原关系,形成小圈子。
  • 加入任务信息:Agent 开始关注候选者的专业侧重和正确率,倾向于选择“更靠谱”的伙伴而非“朋友的朋友”。

这表明组织并非凭空产生。系统向 Agent 暴露什么信息,Agent 就长出什么样的连接方式。信息设计即组织设计。下一步将是实现协作闭环:交换 Gene、寻找互补伙伴以及在失败时自动替补。

05 跑分见真章:EvoX 不比 Codex 差

在 Opus 4.8 同一模型基础上,EvoX 与 Claude Code、Codex 在 6 个主流 Benchmark 的 424 个独立任务中进行同台竞技:

  • Claude Code 通过 358 个任务。
  • EvoX 与 Codex 均通过 338 个任务。

Claude Code 领先约 4.72 个百分点,但 EvoX 已达到与 Codex 同级别水平,且在特定领域展现出更强优势:

  • AppWorld:EvoX 得分 87/90,优于 Codex 9 个任务。
  • GAIA:EvoX 与 Claude Code 并列最高(49/51)。
  • SWE Multilingual:三家差距微小。

当然,EvoX 在 Terminal-Bench 2 和 Cybench 上仍有提升空间。Benchmark 结果证明,Agent 系统本身已开始具备可衡量的产品能力:能拆任务、能并行、能保住中间正确结果并在复杂环境中稳定交付。

06 效果没输,成本还省了一大截

成本是 Benchmark 中常被忽略的关键维度。按统一价目表计算,EvoX 每个任务成本为 6.10 美元,为三者最低;按实际缓存计价则为 1.95 美元,明显低于 Codex。

这表明 EvoX 并非靠堆砌预算换取分数。可持续的 Agent 系统必须懂得何时拆分、如何验证、怎样汇合以及低成本重试。能力交付与成本控制缺一不可。

07 这不是工具,是会自己变强的系统

目前的 EvoX 仍处于 Beta 阶段,但其方向性优势已在真实任务中显现。它正推动 Agent 产品从“一次性工具”向“持续演化系统”转变。

传统的模型 API 更像一次性交易,而 EvoX 旨在建立持续变强的关系:

  • 任务越跑,系统越懂如何拆解;
  • 经验越多,Agent 越清楚彼此专长;
  • 反馈越足,蜂群组织越高效。

长期来看,客户获得的不仅是一堆 Token 生成的结果,而是一套逐渐了解任务边界、团队偏好和业务环境的 Agent 基础设施。

08 自进化,Agent 的下一道墙

这一路线呼应了强化学习之父 Richard Sutton 关于“经验时代”的判断:下一阶段 AI 能力的提升将主要来自真实环境中的长期行动、反馈与持续学习。

在 Agent 系统层面,这意味着“自组织蜂群”将成为主流。静态 Agent 的局限需要被持续进化的系统打破。大模型竞争的下半场,不仅是比拼模型智商,更是比拼谁能正确拆解任务、留存经验,并让一群 Agent 在没有中央大脑兜底的情况下完成任务。

自进化蜂群范式已站在起点,能否将正确结果稳定送达终点,才是 Agent 真正要跨越的下一道墙。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8849
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读196.2k
粉丝0
内容8.8k