大数跨境

RE-TRAC框架:让AI智能体"记住"失败经验

RE-TRAC框架:让AI智能体"记住"失败经验 微软亚洲研究院
2026-07-22
4
导读:无需重复探索,让小模型也能获得接近大模型的深度搜索能力

(本文阅读时间:8 分钟)

想象一下,让 AI 助手结合搜索工具探索复杂问题时,若其首次尝试走错方向,后续多次探索仍重复同样的错误路径。用户虽可从结果中筛选勉强满意的答案,但这不仅低效且需人工干预。这正是当前大多数深度搜索智能体面临的困境——它们无法“记住”之前的探索经验,每次均从头开始,导致大量冗余搜索和资源浪费。

现有的深度搜索智能体大多基于 ReAct 框架构建,采用“思考→调用工具→观察→再思考”的线性推理方式。这种设计在简单任务上表现良好,但在需要多轮探索的深度搜索任务中,往往陷入局部最优、重复探索和低效搜索的泥潭。

针对这一痛点,来自微软亚洲研究院、东南大学等机构的研究员提出了一种全新解决方案:RE-TRAC(REcursive TRAjectory Compression,递归轨迹压缩)。该框架赋予 AI 智能体“记忆”能力,使其能够在多个探索轨迹之间传递经验,实现渐进式的智能搜索。相关论文已被ICML 2026接收。

图 1:RE-TRAC 总览。智能体在每轮探索结束后压缩出结构化状态并传递给下一轮,使探索从“彼此独立的尝试”转变为“渐进式学习”。

让探索变成“渐进式学习”过程

ReAct 框架的核心缺陷在于其线性设计:每个探索轨迹相互独立,模型无法回顾先前尝试的状态。在长上下文场景中,早期制定的计划逐渐被遗忘,关键线索随之埋没。

研究员深入分析发现,现有深度搜索模型即使经过大量强化学习训练,其 Pass@K 性能仍远高于 Pass@1。这表明模型本身具备解决问题的推理潜能,问题在于上下文长度限制导致单次探索难以生成足够多样的路径,无法覆盖宽广的搜索空间。

RE-TRAC:递归式轨迹压缩

RE-TRAC 的核心思想是将探索从一系列独立尝试转变为渐进式学习过程。具体而言,在每个探索轨迹结束时生成一个结构化的状态表示,针对深度搜索任务,记录以下三个维度的信息:

- 答案与分析结论:当前可能性最高的答案与其关键推理结果,为后续推理提供锚点。

- 证据库与来源验证:已搜集到的证据及其来源,并标记哪些已被查阅、验证,从而避免冗余的工具调用和重复检查。

- 不确定项与待探索方向:现阶段需要继续探索验证的角度、曾被遗漏的候选分支与曾因失败放弃的方向,帮助模型在下一轮中补全未探索的搜索空间。

这个结构化状态将被添加到下一轮探索的输入中,确保智能体在每轮新尝试开始时,都能清晰掌握已验证内容、未决问题以及接下来的探索重点。

图 2:RE-TRAC 方法示意。每轮探索末尾压缩出结构化状态(答案、证据、待探索方向),并作为下一轮的输入,使搜索空间逐步收敛。

小模型也能“以小博大”

研究员在五个具有挑战性的搜索导向基准上评估了 RE-TRAC,包括 BrowseComp、BrowseComp-ZH、XBench、GAIA 和 HLE。

4B 模型性能 SOTA

RE-TRAC-4B 在所有小于 15B 参数的基线中表现最佳。其在 BrowseComp 上准确率达 30.0%,BrowseComp-ZH 达 36.1%,GAIA 达 70.4%,XBench 达 76.6%,HLE 达 22.2%。

表 1:RE-TRAC 与各基线在五个基准上的准确率对比(ACC = Accuracy)。

更令人惊讶的是,这个仅 4B 参数的模型在多个基准上超越了更大规模的模型。在 XBench 基准上,RE-TRAC-4B 的 76.6% 准确率不仅远超 InfoAgent-14B 的 40.4%(提升近 90%),也超过了 NestBrowse-4B 的 74.0%。在 GAIA 基准上,其 70.4% 的准确率同样优于 AgentCPM-Explore-4B 和 NestBrowse-4B。

30B 模型的进一步突破

RE-TRAC-30B 同样表现出色,在除 HLE 外的所有基准上都击败了 MiniMAX-M2-229B。在 BrowseComp 上,其准确率达到 53%,甚至超过了 GLM-4.7-358B 的 52%。在 GAIA 上,RE-TRAC-30B 击败了所有闭源模型,并在 BrowseComp 和 BrowseComp-ZH 上排名第二。

这些结果证明,通过轨迹压缩与跨轮次信息传递,小模型在资源受限场景下也能获得接近甚至超越大模型的效果。

更少的消耗、更高的性能:一种通用的测试时扩展

RE-TRAC 不仅可以通过训练提升小模型性能,还可以作为无需训练的测试时扩展(Test-Time Scaling)直接应用于前沿模型。

研究员在 o4-mini、o3、GPT-5、DeepSeek-V3.2、GLM-4.7 和 MiniMax-M2.1 上实现了 RE-TRAC 框架,并与多数投票、加权投票和最佳选择(Best-of-N)等方法进行了对比。

图 3:将 RE-TRAC 作为测试时扩展方法应用于前沿模型的效果,与多数投票、加权投票、Best-of-N 等方法对比。

结果显示,RE-TRAC 在所有模型上都达到了最佳或具有竞争力的性能。在 BrowseComp300 子集上,o4-mini 通过 RE-TRAC 从 25.7% 提升到 46.8%,o3 从 54.9% 提升到 69.8%,GPT-5-medium 从 48.3% 提升到 66.6%,DeepSeek-V3.2 从 45.3% 提升到 60.8%,GLM-4.7 从 37.7% 提升到 60.7%。

在传统框架中,由于轨迹相互独立,资源使用量通常随扩展近似线性增长。而 RE-TRAC 会继承之前轮次的状态,使搜索空间逐步收敛,从而减少冗余工具调用与重复探索,显著提升效率。

如何训练 RE-TRAC 模型?

研究员开发了一种后训练方法,构建了基于结构化状态表示的监督微调(SFT)数据。训练数据通过实体树(Entity Tree)方法构建:从维基百科收集大量实体作为树根,然后递归搜索相关实体作为子节点,直到树达到预定义深度。通过选择从根到叶节点的路径并将边转换为子问题,研究员合成了 33K 个问答对。随后,利用收集 GLM-4.7 在这些合成问题上的 RE-TRAC(4 轮)轨迹,经过过滤后得到 104k 个训练样本,用于训练 RE-TRAC-4B 和 RE-TRAC-30B 模型。

实验结果显示,经过 SFT 训练后,Qwen3-4B-Instruct 在 BrowseComp 上的准确率从 2.7% 大幅提升到 30.0%,在 BrowseComp-ZH 上从 6.9% 提升到 36.1%,在 GAIA 上从 24.4% 提升到 70.4%,在 XBench 上从 45.0% 提升到 76.6%。这表明通过简单的 SFT 训练配合 RE-TRAC 框架,可以产生强大的搜索智能体,实现与大规模强化学习训练模型相当甚至更好的性能。

让小模型跑出大模型表现:优化 ReAct 的搜索框架

RE-TRAC 可视为针对深度搜索任务优化的 ReAct 框架:在原有“思考→调用工具→观察→再思考”的范式上,引入了跨轮次的轨迹压缩和结构化状态表示。这让智能体在开放网络检索、复杂信息汇总等场景中不再“从零开始”,而是像人类一样复用既有证据、总结失败教训并规划未来方向。

更重要的是,这种有针对性的框架设计让小模型也能跑出大模型级别的效果,为资源受限场景(如边缘设备、本地部署)提供了一条“用小模型做大事”的现实路径。随着深度搜索智能体走向更长程的探索与更广泛的实际部署,“让智能体学会从经验中成长”或将成为下一代搜索智能体的关键能力。

RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents (ICML 2026)


论文链接:

https://arxiv.org/abs/2602.02486


项目页面:

https://github.com/microsoft/InfoAgent

#智能体 #智能搜索 #ICML #ReAct #小模型 #大模型

【声明】内容源于网络
0
0
微软亚洲研究院
1234
内容 217
粉丝 0
微软亚洲研究院 1234
总阅读7.4k
粉丝0
内容217