大数跨境

人大联合清华 74页重磅综述:长视界Agent的三次跃迁

人大联合清华 74页重磅综述:长视界Agent的三次跃迁 AIGC 深一度
2026-07-20
3

SURVEY · 长视界Agent综述

Agent只会秒级问答?

任务完成时间从秒级到12小时翻倍增长

Harness × Optimization 共演化 · 三阶段进化 · 六大应用场景

RUC-NLPIR · 人民大学 | LLM Agent | Long-Horizon

METR 数据显示

前沿Agent的任务完成时间每7个月翻一倍,最新模型已可独立运行12小时

01

引言:为什么需要长视界Agent

过去几年,大语言模型已经从单轮对话走向了自主Agent的决策核心——在软件工程、通用助理、科学发现、计算机操控、多模态交互等领域,它们正在接管越来越复杂的真实任务。但这些领域表面上千差万别,却共享一个决定性的需求:长视界(Long-Horizon)——它们需要在推理、工具使用、观察和修正之间进行持续迭代,从单次上下文窗口内的任务,跨越到跨窗口、跨会话、甚至开放式任务流的执行。

METR的实证数据揭示了一个令人振奋的趋势:前沿Agent的任务完成时间跨度正在加速翻倍——从秒级到分钟级再到小时级,最新模型已可独立执行长达十二小时的任务。例如GLM-5.1被报道可在单个任务上持续运行八小时,覆盖规划、实现、测试、迭代优化与最终交付。这意味着Agent正在从对话工具走向生产力工具

然而,这种能力无法仅靠优化模型参数或扩大上下文窗口获得。它的能力边界随外部Harness(运行时框架)的变化而剧烈波动。因此,本文的核心论点是:长视界能力是一种系统级能力,由外部Harness工程和内部模型优化两个共演化组件共同塑造。

前沿Agent时间跨度趋势:任务完成时间从秒级增长至12小时以上(METR)

02

什么是长视界Agent

本文将长视界Agent形式化为模型-Harness耦合决策过程(πθ⊕H),而非单独的基础模型。其定义包含三个核心要素:在扩展的视界上规划、与真实世界环境交互、从自身错误中恢复,以及在执行过程中调整策略。

三层任务层级与匹配能力

论文将长视界任务的难度组织为三个嵌套层级(H1-H3),每层对应一种必须具备的能力(C1-C3):

H1 · C1 上下文内交互推理:单窗口内持续推理、工具调用与环境交互

H2 · C2 跨上下文状态与记忆:跨窗口、跨会话维护状态和记忆

H3 · C3 跨任务经验积累:跨任务迁移经验、技能和记忆。三层嵌套递进,高层包含低层能力

与邻近概念的辨析

长视界Agent常与三个邻近概念混淆:长运行执行(Long-Running)关注持续时间而非逻辑耦合;自主性(Autonomy)控制人类参与程度而非能力边界;自演化(Self-Evolution)要求持久性参数改变而非执行可靠性。三者都是长视界Agent的部分属性,但任何一个都不能单独定义长视界能力。

核心区分:长运行问"执行多久",自主性问"谁在循环中",自演化问"是否持久改进"。而长视界能力问的是:耦合系统能否在交互中持续推理(C1),跨上下文维护状态(C2),跨任务积累经验(C3)?

Figure 1:长视界Agent研究全景图——外部Harness工程(下)与内部模型优化(上)的共演化视角

03

三大核心挑战

长视界任务执行的困难不在于单步准确率,而在于多个紧密耦合的步骤组合成一条轨迹——不是任何一个决策的失败,而是组合的失败。论文总结了三种反复出现的代表性失败模式:

1. 目标漂移与误差累积(Goal Drift & Compounding Error):在数千步执行中,Agent会缓慢偏离原始目标。由于没有任何步骤完全可靠,局部误差沿轨迹累积,最终将Agent推上错误的推理路径。Chain-of-Thought、Self-Consistency等方法正是在对抗这一失败模式。

2. 上下文腐化与容量压力(Context Rot & Context-Limit Pressure):随着工作上下文填满,Agent在跨过某个上下文利用率阈值后性能急剧退化。相反,感知到上下文限制的Agent可能过早终止并声称部分进展为成功——MemGPT的分层内存和上下文工程正是为了解决这一问题。

3. 稀疏延迟奖励与不可逆性(Sparse, Delayed Rewards & Irreversibility):许多长视界任务只在最终返回奖励,中间决策的学习信号极其稀疏。执行越久,Agent越可能采取不可逆的危险操作——这直接催生了对验证机制和安全治理的迫切需求。

论文核心论点:长视界能力是系统级能力,由外部Harness和内部优化共演化决定

04

共演化框架:Harness × Optimization

论文的核心理念是:长视界能力既不完全来自模型权重,也不完全来自外部工程——它来自两者的共演化外部Harness工程提供运行时结构(循环与工作流、上下文与记忆、工具、编排、钩子与中间件、验证),内部模型优化通过架构、数据、微调、强化学习与自演化提升策略。两者缺一不可——长视界能力只在两者共演化时涌现。

一个关键动态是能力迁移:Harness机制逐步内化到策略中(如CoT从提示技巧变成训练目标),更强的策略反过来解锁更高级的Harness。这正是论文跟踪的核心动态——Harness→策略迁移贯穿三个演化阶段。

外部Harness:循环·记忆·工具·编排·钩子·验证

内部优化:架构·数据·微调·RL·蒸馏·自演化

能力在两者之间持续迁移——Harness内化→策略强化→解锁更高级Harness

✦ 关键洞察

评估长视界Agent不再只看静态的单次调用准确率,而应追踪任务完成率、交互鲁棒性、跨上下文恢复、跨任务迁移、成本和安全性。这要求我们重新审视整个Agent评估体系。

05

三阶段进化:从Prompt到Runtime

论文追踪了长视界Agent从提示词工程到运行时系统的三阶段共演化轨迹。三个阶段并非相继替代,而是嵌套层叠——每个新控制面吸收前一个而非丢弃它。

STAGE I · 提示工程 Prompt Engineering(2020-2023)

控制单元是单次查询的语言。核心发现是正确的提示词可以激发基础模型中潜在的能力。代表性工作包括:CoT(Chain-of-Thought)通过中间步骤外化推理过程;Self-Consistency通过多样本投票提升可靠性;Tree-of-Thoughts将推理重构为搜索;Plan-and-Solve建立了"先规划后执行"的模板。提示优化则让能力开始内化——InstructGPT和RLHF让模型无需精心设计模板即可遵循意图,这是Harness→策略迁移的第一个实例。

STAGE II · 上下文工程 Context Engineering(2023-2025)

工程焦点从"怎么问"转向"让模型看到什么"。三大方向:RAG将外部证据接入提示词以减少幻觉;工具使用让模型查询和操作文本之外的世界——Toolformer自监督学习何时调用API,ReAct将推理与工具调用交错形成循环雏形;上下文管理则解决"信息多了不等于信息好了"——MemGPT将上下文视为分页层级,上下文工程成为在硬token预算下系统化选择、组织、压缩和刷新模型输入的实践。但上下文工程仍保留了提示工程的结构假设——它优化的是单次模型调用的输入,而非调用之后发生什么。

STAGE III · 运行时Harness Runtime Harnesses(2025-至今)

工程单元从单次调用扩展到整条轨迹。Agent通过重复的推理-行动-观察-验证-恢复循环在环境中执行。三大运动:①Agent循环成为运行时原语——Reflexion在失败后进行语言反思,LATS用价值引导搜索和回溯;②Harness工程将提示、上下文、工具、状态、权限、验证和恢复组织成系统级控制面——MetaGPT将软件工作流化为角色专门的消息传递,LangGraph提供图结构运行时;③循环内化将Harness行为吸收进模型权重——Search-R1蒸馏搜索式Harness,SWE-RL在软件工程环境中训练。

Figure 6:长视界Agent三阶段共演化——控制面从单次提示词扩展到上下文信息,再到运行时Harness维持的完整轨迹

Table 1:三阶段对比——控制单元、关键技术路线与C1/C2/C3能力评分

06

Harness工程详解

长视界能力不必起源于权重——在模型学会规划、记忆或恢复之前,这些能力可以外部化到运行时系统中。Harness正是这样一个运行时层,它包裹模型并中介其与世界的每一次交互,使长视界执行变得可规约、可导向、可验证、可恢复。论文将Harness组织为六大组件:

① 循环与工作流 Loops & Workflows

规定执行如何在状态间推进,包括何时调用模型、如何执行动作、观察后如何返回控制。三种结构:线性工作流(ReAct)、计划-执行工作流(ReWOO、Arbor)和分支工作流(Tree-of-Thoughts、LATS)。分支工作流的核心价值是"评估后提交"——在做出不可逆承诺之前搜索替代方案。

② 上下文与记忆 Context & Memory

管理模型可用的状态——从当前运行的活跃上下文到跨窗口、跨任务、跨会话的持久记忆。三大操作:丢弃(移除过时信息)、压缩(保留相关信息但减少token占用)、选择(从外部存储中检索相关内容)。MemGPT将上下文视为分页层级,ReSum用滚动摘要维持长运行状态。

③ 工具、MCP与技能 Tools, MCP & Skills

定义Agent如何访问外部能力、表示动作和复用已习得过程。Toolformer自监督学习API调用,MCP统一异构工具为可发现、可授权的服务层,Voyager在Minecraft中构建可复用技能库。Agent正从"被给定工具"走向主动工具发现——AnyTool和ToolGen让Agent在运行时发现和创建新工具。

④ 编排 Orchestration

组织单个Agent循环之外的工作——任务分解、角色分配、路由和Agent间协调。MetaGPT和ChatDev将软件工程转化为角色专门的消息传递,Magentic-One用双账本分离外层重规划与内层调度,LangGraph提供图结构运行时支持状态恢复、分支和审计。A2A协议则标准化了Agent间通信。

⑤ 钩子与中间件 Hooks & Middleware

在运行时提供预定义拦截点,执行可检查、修改、暂停或移交。三层范式:基于规则的钩子(AEGIS沙箱隔离)、用户自定义钩子(AgentSpec和VeriGuard将自然语言策略编译为可执行守卫代码)、运行时自适应钩子(AdaptiveGuard通过持续学习适应新型攻击,AGrail以终身学习方式迭代精化安全检查)。

⑥ 验证 Verification

检查状态、动作、输出或副作用是否满足任务、安全和质量约束。四个评估目标:正确性(SelfCheckGPT)、安全性(VeriGuard、ToolSafe)、忠实性(NSVIF)、多Agent交叉验证。两个验证级别:步骤级(PRM、AgentPRM、CRITIC的验证-修正循环)和运行结束级(LLM-as-a-Judge、Agent-as-a-Judge、Reflexion)。

Table 2:Agent Harness六大组件总览——职责、机制与代表系统

Harness工程的核心命题——让长视界执行变得可规约、可导向、可验证、可恢复

07

模型优化详解

如果说Harness是在外部供给长视界能力,优化则研究如何将这些能力逐步内化到模型参数中。论文沿训练流水线组织了七个阶段:

架构基底

架构决定了长轨迹训练和推理是否可行——一个无法高效处理长交互历史的策略,无法在长轨迹上训练或服务。三种表示路径:显式上下文架构(Longformer、BigBird通过稀疏注意力扩展输入)、压缩状态架构(Mamba、RWKV以近线性复杂度替代注意力)、混合架构(Jamba融合注意力与状态空间模型)。高吞吐机制如EAGLE和GQA则让长轨迹服务变得实际可行。

数据与环境合成

构建可验证的长视界经验:TaskCraft和WebShaper合成可验证任务,SWE-Gym构建神经环境,TOUCAN和AgentGym-RL生成高质量轨迹。关键洞察是——长视界训练需要环境级的反馈闭环,而非简单的输入-输出对

预训练与中期训练

构建动作-观察和推理先验,使Agent行为成为原生能力而非提示激发。DeepSeek-V3和Qwen3-Coder在预训练中注入推理先验,YaRN和LongLoRA构建长上下文先验,Qwen2-VL和InternVL3建立多模态感知先验。DoReMi和OPUS则研究数据混合设计策略。

微调

从精心策划的Agent轨迹中灌输行为和工具使用纪律。AgentTuning展示了指令选择与混合策略,ScalingInter-RL通过课程学习从简单到困难逐步提升,AgentDistillation和Agent-R则用蒸馏将大模型的Agent能力迁移到小模型。

Agent强化学习

这是内化长视界能力的核心阶段——在稀疏、延迟奖励下优化整条轨迹。四大子方向:信用分配(ToolRL和RuscaRL解决多步决策的归因问题)、策略优化(DAPO和GiGPO改进长轨迹策略梯度)、采样策略(Tree-GRPO和TCOD优化探索)、交互模式(GLIDER和Memory-R1研究Agent与环境交互的不同范式)。

在线策略蒸馏与自演化

在线策略蒸馏(OPD)在自身状态分布上巩固策略,减少分布偏移。教师引导的OPD从更强模型学习,自改进OPD让模型在自己生成的轨迹上迭代提升。自演化则是最高阶段——将自生成的经验、反馈和任务-环境更新转化为持续策略改进。离线自演化在固定环境中迭代,在线自演化让环境和策略共同进化。Agent-World更进一步,耦合环境-任务发现与持续自演化训练。

优化流水线的核心逻辑:先让架构能处理长轨迹,再合成可验证经验,然后通过预训练注入先验,微调注入纪律,RL注入反馈驱动的决策,蒸馏稳定策略,最终自演化实现持续改进——每一步都对应一种长视界能力的内化。

08

五大应用场景

论文按Agent-环境接口组织了长视界Agent的五大应用形式,每种都面临同样的长视界压力——误差累积、上下文腐化和稀疏奖励在此重现。

CASE 01 · 软件工程

长视界Agent最成熟的应用领域。SWE-bench和SWE-agent展示了仓库级代码理解与修复——OpenHands的Agent-Computer Interface证明接口设计本身就能决定长视界成功率。三大核心能力:仓库级接地(理解整个代码库上下文)、工作流级规划(将开发任务分解为可验证的子目标)、反馈驱动修复(根据测试结果迭代修正)。

CASE 02 · 信息搜索

从深度搜索(Deep Search,在单一领域深入挖掘)到广度搜索(Wide Search,跨领域横向检索),再到多模态接地(Multimodal Grounding,在视觉和文本中交叉验证)和研究综合(Research Synthesis,将分散发现整合为连贯报告)。Deep Agents和Flash-Searcher代表了深度研究系统的最新实践。

CASE 03 · 计算机操控

涵盖浏览器Agent(WebArena评估在真实网页上完成复杂任务)、桌面GUI Agent(OSWorld测试操作系统级操控)和移动Agent(在手机界面中完成跨应用工作流)。计算机操控是长视界压力最直观的体现——每一步操作都可能不可逆,且反馈延迟严重。

CASE 04 · 多模态Agent

从多模态理解(同时处理文本、图像、音频)到多模态生成(跨模态创作),再到全模态代理(Omnimodal Agency,在所有模态中自主行动)。多模态Agent需要更复杂的Harness来管理跨模态状态和工具链。

CASE 05 · 通用Agent

个人助理(Claude Code和OpenClaw代表本地个人Agent运行时)、具身Agent与世界模型(在物理世界中持续行动与学习)、生产力Agent(在办公场景中完成多天协作任务)。通用Agent是长视界能力的终极考验——它要求Agent在开放的、不可预测的环境中持续运行。

✦ 评估趋势

评估正在从单一端到端分数转向:模型是否原生携带了Harness本应供给的能力?最新基准测试已覆盖跨行业计算机操控工作流、长视界工具与MCP使用、本地控制与多天协作、生产力办公推理等维度。

09

前沿挑战与展望

论文从四个维度勾勒了长视界Agent的前沿挑战:

1. 演化(Evolution):如何实现Harness和Agent的自演化、跨领域泛化与迁移、以及持续终身学习?当前的Harness大多是手工构建的——未来需要Harness能自动发现、优化和迁移。Darwin Gödel Machine已展示了自编辑Harness代码的可能性。

2. 有效性(Effectiveness):如何在真实世界环境中可靠行动?从数字世界到具身Agent的跨越——真实环境的非平稳性、部分可观察性和物理约束,使得长视界执行面临根本性挑战。

3. 效率(Efficiency):如何合理分配计算、上下文和模态预算?长视界执行的token成本、工具调用成本和时间成本都呈线性甚至超线性增长——成本感知的Agent决策和全模态Harness是关键方向。

4. 可信度(Trustworthiness):如何在长视界执行中保持鲁棒性和受治理的自主性?反思与错误鲁棒性、安全与治理是不可回避的课题——Agent执行越久,不可逆操作的风险越大,安全治理的紧迫性越高。

核心张力:效率与安全的权衡。长视界Agent越自主、越高效,不可逆操作的风险越大。未来系统必须在成本感知与安全治理之间找到动态平衡。

///

写在最后

这篇来自人民大学NLP组的综述,为长视界Agent研究提供了统一的全景图。它不仅形式化了定义、梳理了演化、组织了Harness和优化的技术栈,更重要的是揭示了一个核心洞察:长视界能力不是模型的事,也不是Harness的事,而是两者共演化的系统属性

从CoT到ReAct,从Reflexion到Voyager,从Toolformer到MemGPT,从MetaGPT到SWE-agent——每一个里程碑都是Harness能力向策略内化的一次迁移。当这种迁移完成,更强的策略反过来解锁更高级的Harness,循环往复,推动了长视界能力的指数级增长。

论文最后的期许:希望这篇综述不仅是已有工作的参考,更是构建下一代有能力、可信赖长视界Agent的基石

论文开源地址:github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。


【声明】内容源于网络
0
0
AIGC 深一度
专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
内容 588
粉丝 0
AIGC 深一度 专注AIGC领域,关注微软 OpenAI、百度文心一言、讯飞星火 DeepSeek等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC,欢迎关注 个人网站 https://www.chenbaiqi.com
总阅读6.7k
粉丝0
内容588