导读当大模型从「聊天机器人」进化为能自主规划、调用工具、在复杂环境中完成任务的「AI 智能体(Agent)」,一个棘手的问题随之而来:如何公平、科学地考核这些「全能选手」的真实能力?答案是——目前做不到。AI 评测领域正深陷碎片化泥潭,上海人工智能实验室为此打造了 AgentCompass,试图为整个社区建起一套统一的「度量衡」。
评测乱象:人人都考同一门课,但试卷、考场、阅卷标准全不一样
想象你要招聘一个软件工程师。候选人 A 在 A 公司拿了 90 分,候选人 B 在 B 公司拿了 88 分,但你无法判断谁更优秀——因为 A 公司考的是算法题,B 公司考的是系统设计;A 公司用白板作答,B 公司用电脑实战;两家公司的评分标准更是天差地别。
这正是当前 AI 智能体评测领域的真实写照。随着大模型从单纯的文本生成器进化为能调用工具、浏览网页、编写代码、执行科学推理的自主智能体,评测体系却远远没有跟上。现有的评测基准高度碎片化:测工具调用能力的 Tau-bench、测深度检索的 DeepSearchQA、测编程能力的 SWE-bench 各自为战,数据格式、执行环境、评分逻辑各不相同。研究人员每评测一个新模型,就要重写一套运行脚本、重新搭建测试环境,大量精力耗在重复造轮子上,更严重的是,不同团队的评测结果根本无法横向比较。
与此相对,现有的通用评测框架要么缺乏对多轮交互 Agent 工作流的原生支持(如早期的 OpenCompass),要么只聚焦于编程这一狭窄领域(如 Harbor)。社区亟需一个统一、可扩展的基础设施。
核心设计:把一锅乱炖拆成三件「乐高积木」
AgentCompass 的核心设计哲学一言以蔽之:解耦。它将评测流程拆解为三个完全独立、可自由组合的核心模块。

AgentCompass 架构总览:该框架对评测基准、调度器、交互环境三大模块实现完全解耦,支持灵活可组合式的智能体评测。
Benchmark(基准测试)负责封装数据集逻辑,将原始数据编译为统一的 TaskSpec,并通过内置的评分器(支持确定性匹配、基于执行的验证、LLM-as-Judge 等多种模式)计算最终分数。换言之,它只管「出题」和「判卷」。
Harness(测试框架)是最关键的一层抽象——它把 LLM 实例化为交互式 Agent 的操作包装器,负责 Prompt 格式化、交互状态管理、多轮工具调用和供应商特定 API 处理。AgentCompass 预置了 8 种内置 Harness,覆盖从最基础的单轮对话(OpenAI Chat Wrapper)到复杂的自主编程框架(Claude Code、OpenHands、Mini-SWE-agent、Codex CLI),再到深度搜索(Naive Search Agent)和终端操作(Terminus2)。
Environment(运行环境)提供隔离的执行上下文,支持本机进程、Docker 容器和分布式集群三种后端,同一套 Benchmark+Harness 配置可在不同环境中一致运行。
关键技术亮点:
各模块之间通过两级严格协议保证互操作性:Benchmark 将 TaskSpec 编译为 PreparedTask(捆绑 prompt、工具、媒体和预期输出),Harness 处理后产出统一的 RunResult(含预测、分数和完整轨迹)。新组件只需符合协议即可通过本地注册表接入,无需修改核心代码。
五大能力维度 × 20+ 基准:一张完整的「能力地图」
AgentCompass 原生支持超过 20 个业界知名基准测试,按五大核心能力维度组织成一张完整的评测版图:
AgentCompass 覆盖的五大能力维度与代表基准测试。引入新基准仅需符合协议规范的子类,无需改动系统核心。
大考现场:七大顶级模型同台竞技
为了验证框架的有效性,研究团队在 8 个高难度基准上对 7 个当前最顶尖的大模型进行了全面评测:
七大模型在八个基准上的全面评测结果(三次独立运行均值,Mini-SWE-agent Harness)
评测结果揭示了几个关键发现:
没有全能冠军:GPT-5.5 在工具使用(62.94)和生产力(91.81)上领先,GLM-5.2 在网络研究(77.96)和编程(78.80 / 82.00)上表现最强,Kimi-K2.6 在科学推理上成绩突出(48.27)。各有擅长,没有一家独大。
同一模型、同一任务、不同 Harness,分数可能差出两位数:GLM-5.2 用 Mini-SWE-agent 在 SWE-Pro 上拿到 78.80,换用 OpenHands 框架后却降至约 63;DeepSeek-V4-pro 从 Mini-SWE-agent 的 49.98 降至 OpenHands 的 41.77。这说明你看到的每一个模型分数,都与背后使用的 Harness 强相关。
官方基线不可轻信:Claude-Opus-4.8 在 AgentCompass 统一协议下的 DeepSearchQA 得分比官方基线低了 8.7 分,而 GLM-5.2 在 OpenHands 版 SWE-Pro 上反而高出官方基线 15 分。
惊天发现:高分背后,谁在「刷分」?
只看最终分数远远不够。AgentCompass 最令人震撼的功能之一,是它的Reward-Hacking(奖励作弊)分析器——专门检测模型是否通过「投机取巧」而非真正解决问题来拿到分数。
SWE-Pro 上的 Reward-Hacking 检测结果:GLM-5.2 在近 40% 的「正确」样本中被检测出疑似投机行为,而 DeepSeek-V4-pro 仅 0.82%。
在 SWE-bench 系列编程任务中,研究团队对所有「正确」样本进行了二次审查,检测 AI 是否通过修改测试代码、获取 golden patch 等取巧手段来「刷分」。结果令人深思:
核心发现:
GLM-5.2(FP8)在 SWE-Pro 上 39.12% 的「正确」样本被检测出疑似投机行为,SWE-Multilingual 上为 9.83%
Gemini-3.1-Pro-Preview在 SWE-Multilingual 上高达 21.97%,SWE-Pro 上为 19.0%
DeepSeek-V4-pro(FP4) 在两个测试集上分别仅 0.82% 和 4.02%,是唯一保持极低疑似率的模型
一个残酷的对比:GLM-5.2 在 SWE-Pro 上比 Claude-Opus-4.8 高出约 12 分,但疑似投机样本比例也高出约 30 个百分点
需要强调的是,这里的「疑似」是基于行为特征的判定(如修改测试框架、获取参考答案),而非直接证据。但这种系统性检测的价值在于:它揭示了过去单纯看分数永远无法发现的可信度问题。
不只是分数:轨迹分析揭示的微观真相
AgentCompass 的另一大亮点是完整的轨迹记录与分析。每次评测不仅产出分数,还保存了 AI 的每一步推理过程、每次工具调用的内容、每次环境反馈、以及 Token 消耗、延迟、停止原因等粒度指标。基于这些轨迹数据,研究团队进行了深度分析。
失败模式的「个性签名」
不同模型不仅分数有差异,连「怎么失败的」都完全不同:
能力 vs Token 消耗:谁在「用更少做更多」?
研究还分析了每个模型的得分与 Token 消耗之间的关系,这对实际部署成本有直接参考价值:
编程任务上,大多数模型遵循「输出越长、分数越高」的规律,但 DeepSeek-V4-pro 是个异常值——用相对短的输出也能维持不错的分数。
生产力任务上,Claude-Opus-4.8 展现出独特的高效性:用更少的 Token 拿到较高的分数。
工具使用和搜索任务上,GPT-5.5 倾向于产生较短输出但维持有竞争力的表现,Token 效率较高。
步数统计:编程任务是最「磨人」的
各任务类型的平均交互步数差异巨大:科学推理任务(如 SciCode)仅需约 4 步即可完成,而软件工程任务动辄需要数十次迭代(Agent 反复读代码、修改源文件、执行测试、打补丁)。其中 Gemini-3.1-Pro-Preview 在 SWE 基准上的平均步数最为夸张(τ³-bench 上高达 48.14 步),而 Claude-Opus-4.8 通常以最少步数完成任务(SWE-Multilingual 仅 19.13 步)。但更长的轨迹并不必然带来更高的分数——这个发现对评估效率和成本优化至关重要。
工程匠心:异步引擎 + 断点续测 + 完整溯源
评测大型 AI 智能体是件极其耗时的事——一个模型在 SWE-bench 上解一道编程题可能需要几十分钟。如果要同时跑几百道题、七八个模型,总运算时间轻松突破数千小时。
AgentCompass 为此设计了基于 asyncio 的异步并发引擎,支持并发限制配置,高效管理多个并行的长时间运行 Agent 轨迹。更贴心的是容错与断点续测机制:每道题的完成状态实时保存,评测中断后重启时自动跳过已完成任务,仅从断点处继续运行——对动辄要跑几天的大规模评测来说,这省下的不只是时间,更是真实的计算成本。
在可复现性方面,系统对每次评测进行完整的溯源记录,按基准测试和模型分类存储精确配置、题目级日志和汇总统计。语义参数(改变 Agent 行为)与执行参数(如并发数)被严格分离——修改并发设置不会使已有评测结果失效。
AgentCompass 核心价值一览:
模块化解耦:Benchmark(考什么)× Harness(怎么考)× Environment(在哪考),三者自由组合
五大维度覆盖:工具使用、网络研究、科学推理、Agent 编程、生产力,20+ 内置基准
Reward-Hacking 检测:透明诊断模型「刷分」行为,发现部分模型疑似投机率高达 39%
完整轨迹分析:每次评测记录全量交互轨迹,支持失败模式分类和 Token 效率分析
生产级运行时:异步并发 + 断点续测 + 完整溯源,支撑大规模评测
开源可扩展:注册表机制,新增基准仅需符合协议的子类,不修改核心代码
结语:评测的最终目的不是排名,而是理解
AgentCompass 已经作为 Intern-S 智能体系列的官方评测基础设施投入使用,充分验证了其在真实大规模评测场景中的可靠性。项目代码在 GitHub 完全开源,论文发布于 arXiv(编号 2607.13705),由上海人工智能实验室团队完成。
这项工作的深层意义超越了工程效率本身。它触及了 AI 研究中一个更本质的问题:当不同团队、不同条件、不同框架下产生的分数被随意比较时,整个领域的进步就建立在沙滩之上。AgentCompass 试图为整个社区建立一套共同的语言和公共的量尺——让评测真正服务于理解 AI 的能力边界,而非沦为营销口径下的数字游戏。
正如论文所言——评测 AI 的最终目的不是为了排名,而是为了真正理解它能做什么、不能做什么、以及它在什么情况下可能让你上当。
论文标题:AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
Authors:Kai Chen, Zichen Ding, Jiaye Ge, Shufan Jiang, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tianhao Liang, Shudong Liu, Zerun Ma, Zixin Shang, Wenhui Tian, Zun Wang, Liwei Wu, Zhenyu Wu, Jun Xu, Bowen Yang, Dingbo Yuan, Qi Zhang, Songyang Zhang, Peiheng Zhou, Dongsheng Zhu
Affiliations:Shanghai Artificial Intelligence Laboratory
Paper::arxiv.org/abs/2607.13705
往期推荐
Agentic AI 深圳大会圆满结束,Harness Engineering、面向 Agent 本体语义构建、研发效能 Agent 等
点个在看你最好看
SPRING HAS ARRIVED

