大数跨境

智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」

智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」 新智元
2026-08-10
1

随着大模型在对话、推理、编程及工具调用能力的日益成熟,自主研究(Autonomous Research)被视为人工智能领域的下一个关键突破点。其核心意义在于打破人类知识边界的限制,构建一种全新的智能生产 Scaling Law:投入多少能源,即转化多少智力。

与普通问答仅需定位单一事实不同,自主研究面对的是相互关联且彼此制约的复杂条件。智能体不仅需在海量信息中定位候选答案,更需整合分散甚至冲突的证据,确保最终答案满足所有关键约束。该领域的核心难题并非搜索时长或证据获取难度,而在于智能体能否清晰认知当前解题进度、缺失环节及下一步最优研究方向

智源研究院发布的AREX正是针对这一核心痛点提出的解决方案。它抓住了自主研究中的关键突破口——“发现—验证不对称性”:完整答案虽难一次性生成,但一旦形成候选解,即可通过针对关键约束的逐项验证,快速定位不足并指导后续探索。验证的目的不仅是判断对错,更是帮助智能体明确“已知、未知与下一步”,使每一轮研究更具方向性。

这一理念与 Jeff Dean 近期创立的 Discovery Loop 公司愿景不谋而合:未来 AI 需具备通过持续实验、反馈和修正形成的自主发现能力。AREX 对“求解—验证”双循环的探索,标志着通过闭环迭代推动智能持续进化已成为 AI 发展的重要趋势。

项目资源:
项目主页:https://vectorspacelab.github.io/arex-model/
模型权重:https://huggingface.co/collections/BAAI/arex
体验链接:https://arex-research.com

AREX 旨在训练能长期运行、自我验证、持续修正的研究型智能体

双循环递归求解框架

AREX 的目标并非让模型在单轮回答中生成看似完整的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体。其核心在于“研究→验证→再研究”的循环机制,使模型具备持续改进当前解的能力。

面对复杂任务,智能体先给出阶段性答案,随后逐项检查约束满足情况,保留已验证证据,定位未决主张,发起针对性后续研究。新证据到来后,智能体更新答案并重新验证,判断是继续深入还是输出结论。这一过程可递归执行多轮,实现真正的“自我改进”——即对自身研究状态和当前答案的持续修正,而非在线更新参数。

AREX 通过双循环递归求解框架打通了“找到答案”与“改进答案”的闭环:

内层循环:Research Loop(研究循环)

负责完成一轮相对完整的研究。智能体围绕当前问题搜索信息、调用工具、收集证据、比较候选并构造暂定答案。其目标不是直接得到终局解,而是形成结构完整、证据可追踪的当前解。若经过外层验证,内层循环将面对被重新定义的聚焦新问题(如补齐缺失证据、消解矛盾等),确保每一轮研究都在更清晰的基础上推进。

外层循环:Self-Improvement Loop(自我改进循环)

负责审计当前答案的完成度。AREX 依据任务约束对暂定答案进行逐项检查,形成置信度判断:哪些条件已充分支持,哪些仍不确定,哪些缺乏证据。若所有条件满足则输出答案;否则,将验证结果转化为下一轮内层循环的具体研究目标。这使得每一轮递归都能继承已有成果,避免从头开始。

机制分析:长程研究状态维护带来的性能提升

AREX 的推理机制包含两个协同循环:内层负责搜索、验证与生成暂定答案;外层根据置信度决定接受、细化或重启。其中,自主上下文更新(ACU)是关键机制。它并非普通摘要,而是面向下一步行动的研究状态记录,包含已验证发现、已排除候选、未解决约束及下一步计划。

BrowseComp 基准分析显示,AREX 会主动更新上下文,而非被动等待窗口填满。受控实验表明,AREX 完整系统在 BrowseComp 上得分 82.5,比关闭 ACU 和外层循环的版本高出 22.9 个百分点。训练消融实验进一步证实,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别优化了工具交互、关键决策和长程策略。

长程研究的难点不在于例行搜索,而在于关键时刻的决策能力:何时相信证据、何时放弃候选、何时重整方向。AREX 通过高质量轨迹筛选与关键步骤强化,塑造了智能体在这些转折点上的判断力。

核心创新:让自主研究智能体在长程任务中持续自我进化

长程研究不“失忆”:将历史包袱转化为进度路标

长程研究的核心挑战在于模型能否在交互轨迹延展中稳定记忆进展。AREX 通过主动调用上下文更新工具,将交互历史整理为“研究进度表”,明确当前进展、已证伪假设及下一步重点。这种方式既继承了有效信息,又压缩了冗余内容,帮助模型在当前阶段形成稳健最优解。

构造可验证的训练数据:从确定答案出发

AREX 设计了一套可验证的自主研究任务生成方法:从确定实体答案出发,构造必须被真实证据支撑的约束条件,再改写为无法通过关键词直接命中的开放式问题。强教师模型在执行过程中留下的全过程轨迹,经严格筛选(剔除猜答案、证据不足等情况),最终形成从不确定候选走向可验证答案的高质量训练数据。

分阶段训练与关键步骤强化

AREX 采取分阶段训练策略:先学习多轮工具调用与证据获取,再进阶至长链推理与困难问题求解。同时,模型不对长轨迹中的每一步同等对待,而是重点关注关键转折点(如发现关键证据、否定错误候选、切换方向等),并在强化学习阶段进一步优化研究策略。这种设计使智能体更接近真正的研究者,能够精准判断坚持、掉头或停止的时机。

实验评估:AREX 以 10B 激活参数达到自主研究前沿水平

智源研究院在六个基准上对 AREX 进行了全面评测,涵盖信息深度、广度、综合能力及端到端 Agent 能力:

信息深度:在多跳信息中持续挖掘

在 BrowseComp 和 xbench-2510 等高难度基准上,AREX-Base 得分 82.5,接近 GPT-5.4、Kimi-K2.6、DeepSeek-V4-Pro 和 Claude Opus-4.6,并超越 GLM-5 与 Qwen3.5-397B。结果表明,AREX 的优势源于稳定的研究状态维护,能够保留已验证信息并持续围绕未决约束推进。

信息广度:在大规模信息空间中全面覆盖

在 WideSearch-en 基准上,AREX-Base 取得 82.0 Item-F1,为对比范围内最高结果,超越 Kimi-K2.6、DeepSeek-V4-Pro 等模型。这证明 AREX 不仅能“挖深”,也能在长程检索中有效管理大范围搜索任务,持续维护已覆盖范围与剩余空白。

深度与广度的结合:可迁移的研究方法论

在 DeepSearchQA 综合测试中,AREX-Base 取得 89.9 F1,超过 GPT-5.4 与 DeepSeek-V4-Pro。这说明 AREX 学到的是一套可迁移的方法论:检索、比较、验证、修正、聚合,而非特定领域的搜索技巧。

端到端能力:从搜索到完整研究流程

在 GAIA 和 HLE with tools 测试中,AREX-Base 表现优异,超过 Kimi-K2.6、Gemini-3.1-Pro 及 Qwen3.5-397B 等模型。这表明 AREX 的能力已成功迁移至完整智能体工作流,具备规划行动、调用工具、验证中间结论并组织最终答案的综合能力。

总体性能对比

与开源前沿模型相比:AREX-Base 在多项基准上全面领先,尤其在深搜、广搜及工具推理之间取得了均衡的综合竞争力。
与闭源旗舰模型相比:AREX-Base 在 BrowseComp、DeepSearchQA 及 WideSearch-en 等关键任务上与 GPT-5.4、Claude Opus-4.6 等正面竞争,甚至在部分大范围信息覆盖任务中占据优势。
与同量级模型相比:AREX-Base 总参数量 122B(每次推理激活 10B),在六项完整可比基准上全部领先于更大规模的 Qwen3.5-397B。AREX-Turbo(4B 参数)也在多项指标上超越 30B+ 级别的专用智能体模型。这证明自主研究能力不仅来自参数规模,更来自对长程研究过程的专门训练。

AREX 研究平台:将自主研究能力封装为日常工具

基于 AREX LLMs,智源研究院推出了AREX Research Platform,将自主研究能力封装为面向科研与产业用户的日常工具。针对学术与产业界信息碎片化、获取成本高的问题,平台提供三类由 AREX 智能体驱动的独立入口:

  • 资讯持续追踪:指定领域内的每日动态检索、筛选与汇总。
  • 论文深度理解:筛选高关注度研究工作并提供深度解析。
  • 播客观点提取:从长时段访谈中提取关键观点与行业趋势。

定制化资讯服务

平台支持用户指定关注方向(如 Coding Agent、芯片行业等),生成专属资讯智能体。信息流由“按热度排序”转向“按相关性组织”,显著降低无关信息干扰。

自由的可扩展性

每条资讯、论文或播客旁均提供自主研究入口。智能体感知当前阅读内容与上下文,可一键启动针对具体问题的检索、对比与分析,输出完整知识脉络。平台承担内容发现,智能体承担理解分析,二者在统一上下文下无缝衔接。

当前版本覆盖科研工作流中的“信息获取”与“认知构建”阶段。未来,智源研究院计划将能力延伸至端到端自主科研,包括方案设计、工程实现(代码生成与执行)及性能调优,最终实现用户定义问题,AREX 自主完成探索、实验与优化并交付可验证结果。

AREX 当前已开放 BETA 版测试,欢迎访问 arex-research.com 体验。

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16466
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读339.9k
粉丝0
内容16.5k