导读让 GPT、Claude、DeepSeek 指挥同一个编程 Agent,会发生什么?编程 Agent 不变,任务条件也一样。几个模型分别看进展、下指令,决定什么时候继续开发、什么时候补测试,以及何时结束工作。
这正是阿里巴巴 DreamX 团队开源项目 LoopArena 关注的能力:模型能否在长程 Loop 中持续作出有效的控制决策。
随着 Loop Engineering 受到关注,开发者开始把连续安排工作的职责交给系统。人设定目标和验收要求,Loop 接收执行反馈,再决定 Agent 后续该做什么。负责这层控制的模型如何选择,也就成了一个值得专门评测的问题。
首批评测包括 GPT-5.5、Claude Opus 4.8、Qwen3.7-Plus、DeepSeek-V4-Flash 和 GLM 5.2。在论文的完整任务评测中,GPT-5.5 排名第一,Qwen3.7-Plus 位列第二。
这场围绕 Loop 控制能力的比较,很快在海外 AI 社区引起热议。论文拿下 Hugging Face Daily Papers 8 月 31 日日榜榜首。
Daily Papers 主理人 Ahsen Khaliq(AK)随后在 X 上分享,DAIR.AI 和 Rohan Paul 等海外 AI 媒体、博主也陆续介绍。
博主 Shashank Ashtikar 更是直言:“太需要这样的工作了!”他认为,许多团队已经在交付 Loop,却缺少真正评价它们的办法。看到 LoopArena 后,他又补上一句:“太棒了!”
另一位博主 Brain Cramps,则把 LoopArena 列进了自己的「将影响 AI 领域的七件事」清单。
想亲自测一测?费用也有惊喜。
长程 Agent 评测的账单动辄不菲。Terminal-Bench 4.0 的公开榜单中,有多组评测记录总费用达到数千美元,个别接近一万美元。
LoopArena 的 Type I 专门测模型如何选择下一步行动,不需要在评测时运行编程 Agent。根据 arXiv 论文中的结果,单个模型测完整套 Type I,估算模型调用成本最低只要 0.31 美元。
这个价格,对学生和小团队就很友好了。不必先花大笔预算跑完整任务,也能试试自己感兴趣的模型。
用起来也不麻烦:准备好环境与模型接口,跟着仓库示例,几分钟就能开始 Type I 试跑。代码、数据和运行说明都已开放。
团队还在持续更新评测数据。想关注后续有哪些模型加入、榜单会有什么变化,欢迎点个 Star 收藏,一起关注项目的新进展,也给开源团队一点支持。
代码写到一半,模型知道下一步该做什么吗?
一份开发计划写得再细,执行过程中也会出现新的信息。代码改完了,测试反馈是否支持继续推进?眼前的功能已经实现,原有行为是否还需要检查?这些判断必须结合当前状态来做。
以修改现有项目为例,初期可能要让 Agent 查清模块之间的关系;进入实现阶段后,要根据运行结果调整安排;准备交付时,关注点又落到需求是否覆盖、验证是否充分。
负责控制 Loop 的模型,需要一路跟着这些变化作决策。
在 Addy Osmani 关于 Loop Engineering 的讨论中,人负责确定目标和验收要求,再设计一个能根据反馈持续给 Agent 安排工作的 Loop。每一轮结束后,下一条指令不必再由人手动补上。
软件工程师使用编程 Agent 时,常常要作这样的判断:功能已经写好了,接下来是继续开发,还是先跑一轮回归测试?LoopArena 将这类持续跟进交给模型,考察它能否根据执行反馈,在长程任务中安排好下一步。
研究者把两项职责解耦:Worker代表真正进行编程的 Coding Agent,负责读写代码、运行工具和测试;Controller负责读取反馈、下达后续指令。被比较的模型担任 Controller。
实验中固定 Qwen3.7-Plus 作为 Worker,并统一任务环境、工具、执行预算与评测方式。这样的控制变量设计,让不同 Controller 可以在共同条件下比较。

图 1|外层 Controller 指导编程 Worker;执行信息返回控制端,最终结果交由统一评测器检查。
Worker 完成一轮后,系统将进展和执行记录整理给 Controller。模型随后决定继续还是停止;继续时,输出一份称为Loop Contract 的安排,交代下一轮目标、应保留的行为及完成条件。
Worker 按指令执行,Controller 再看结果,决定下一轮怎么做。Controller 不直接改代码,但它安排的工作会真正落到仓库中,最后由评测器检查代码和实际行为。
对于固定 Worker、比较 Controller 的设计,X 用户 cixier 在讨论中评价:"Worker 锁死、只考 Controller,这才像在测 agent。”
对开发团队而言,这套设计提供了明确的试验条件:换一个控制模型,或调整指令策略,都能观察它如何指导同样的执行者。
每次评测都要从头跑?任务切片能省下约六成推理成本
长程控制最直观的检验,是让模型从任务开始一直参与到交付。LoopArena 将这种形式称为 Type III。
任务从原始仓库状态启动。调查、实现与验证不断推进,Controller 依据各轮反馈安排后续工作,并判断结束时机。完整任务的最终验收,给出了对这一过程的评价。
但研究一个新的控制想法,并不一定每次都需要重复整段开发。团队还设计了 Type II:从准备好的任务中间状态接手,让 Controller 带着 Worker 继续完成后续阶段。
这里保留了真实执行和多轮反馈。模型仍然需要应对运行中的新信息,只是前面已经完成的工作无需再做一遍。
Type II 与对应的 Type III 完整任务一一配对。 团队因此可以直接比较:只跑任务切片,得到的模型排序与跑完整任务有多接近?
论文结果显示,Type II 的平均估算模型推理成本较配对完整任务降低约六成,同时,得到的模型排序与完整任务评测高度一致。
做研究时,可以先用切片筛选模型、尝试控制方法,再把选定方案放到完整任务中检验。少做重复运行,同一份预算就能多试几个想法。
整套评测最低只用 0.31 美元,这是如何做到的?
如果只想先看看模型会怎样安排下一步,就可以用前面提到的 Type I。
它向模型提供某个控制点的任务进展,以及若干候选指令,让模型选择下一步行动。评分的依据来自执行:团队在构建基准时已经运行候选方案,比较它们产生的后续结果。
当一个新模型来参加评测,这些执行便不必重复。模型读取题目并完成选择,就能获得控制决策成绩。
昂贵的候选方案执行,在出题时就已经完成了;评测新模型时,只需要它作答。 所以前面提到的 0.31 美元,指的是单个模型测完整套 Type I 的最低估算调用成本。
不用启动编程 Worker,也不用 Docker。想先体验一下、比较几种模型,直接从仓库里的示例开始就行。

图 2|Type I 评价单次决策,Type II 考察任务阶段中的连续控制,Type III 覆盖完整开发过程。
数据和代码已开源,你的模型也能来试试
Loop Engineering 的实践者经常要作这样的选择:让哪个模型控制外层 Loop?一套新的指令设计是否有效?值得把哪种方案放进更长的任务?
基准数据、评测代码、使用说明和首批成绩都已公开。有了这些材料,研究者可以接入自己的 Controller,沿用同样的条件比较结果。
已经在开发 Agent 系统的团队,也可以用它测试新的控制指令:同样的 Worker,换一种安排,任务完成情况会怎样变化?
想知道自己的模型会怎样指挥 Agent,可以直接接入试试。欢迎分享评测结果,也欢迎在 GitHub 上 Star 支持项目。
GitHub:github.com/AMAP-ML/LoopArena
Hugging Face:
huggingface.co/papers/2608.28281
ModelScope:
modelscope.cn/papers/2608.28281
arXiv:arxiv.org/abs/2608.28281
项目主页:amap-ml.github.io/LoopArena

往期推荐
AWS 突然押注 DuckDB:折腾 20 年,90% 的查询做成了分布式
得物:需求澄清→Coding→Testing→Notebook 全链路 Agent
本体驱动知识资产持续进化,构筑企业全域运营决策智能
Palantir CEO:AI 时代,不做“有”的企业,就等着被掏空
Data Agent 上岗要多久?Aloudata: 30 分钟新标准
面向企业智能办公 Agent 的本体驱动知识工程构建与应用
腾讯云智能数据湖计算 AI DLC:AI Native 数据湖的 Spark + Ray 一体化实践
端侧 Agent 的最后一公里:量化、指令集、部署,一次讲透
语义层进入 Agent 时代:从统一指标到业务编译器|DataFun 独家电子书限时领
AI 把语义层做成“一次性代码”:MotherDuck 实测,真正该保存的可能不是 Semantic Model
点个在看你最好看

