7 组关键问题 Q&A
Q1:什么是「发现型 AI」,和普通大模型 Agent 区别?
A:发现型 AI 旨在产出尚未被人类知晓的新知识发现;普通 Agent 大多执行已知任务、复现现成答案。它需要长期带状态调研、假设迭代、证据核验,而不是单次 prompt 问答。
Q2:什么是重型求解器 Heavy‑Duty Solver?
A:不是单独大模型,是完整系统:基础大模型 + 调度框架 harness + 工具集 + 记忆 + 控制策略,用来承接开放式高难度现实科研任务。
Q3:HDS6(TRACES)过程验证 6 个维度是什么,解决什么痛点?
A:Tools 工具、Repair 修复、Alternatives 备选假设、Coherence 一致性、Evidence 证据、Scope 适用边界。解决标准答案缺失 / 延迟场景的评估难题,不只看最终答案,评判整个科学调研过程是否严谨可信。
Q4:结果验证 vs 过程验证,二者怎么分工?
A:结果验证评判输出对不对;过程验证评判是怎么得到结果的。当真实标准答案不可获取时,HDS6 过程验证可以独立评估 AI 调研质量;二者互补。
Q5:TRACES 基准任务是怎么筛选出来的?
A:10 位 STEM 博士调研 16 大类共561 个行业,得到 423 个高价值候选,经过可核验性、现实影响力筛选,初版发布 20 个真实世界问题,不是编造的习题。
Q6:修复循环 Repair Loop 的关键设计约束是什么?
A:修复诊断反馈给求解器,但绝不泄露真实标准答案、结果分数。只修正过程缺陷,维持求解器与 ground‑truth 的隔离,防止作弊泄露。
Q7:该工作最大创新是什么?
A:不再局限评测模型输出答案对错;构建完整框架,把开放式现实科学问题变成可执行沙箱任务;同时评估结果 + 完整调研过程;可以定位性能缺陷是模型、调度框架、工具流程哪一环的问题,支撑真正面向科学发现的 AI 迭代。
附录 Apodex Discovery:用于构建与评估发现型人工智能的现实基准与环境
Brian Wang、Bin Feng、Xiaoman Pan、Chenyang An、Felix Liu、Tangqi Fang、Gongbo Sun、Lingfeng Shen、Ning Wang、Handuo Zhang、Feng Chen、Fuchao Yang、Xiang Wang、Jiacheng Lin、Siting Li、Zixuan Liu、Chi Han、Zhenhailong Wang、Kunlun Zhu、Lawrence Zhao、Yueqi Guo、Kailong Wen、Feng Xing、Yiling Guo、Lidong Bing、David Tan、Bo An、Heng Ji、Sheng Wang†
技术负责人。通讯作者:sheng@apodex.com。 特别感谢陈天桥先生作为本项目负责人,他提出了重型求解器的概念,定义了 HDS6 过程度量的六项能力,并规划了 Apodex Discovery 的整体架构。感谢他的远见、指导与支持,使本项目得以落地。
arXiv:2608.11341v1 [cs.AI] 2026‑08‑11 Apodex Discovery 技术报告
摘要
阿波罗计划能够登月,不仅仅是因为工程师可以求解复杂方程。它的成功,是把一个遥远愿景转化为一套任务架构:明确目标、协同系统、仿真模拟、遥测、验证以及反复修正。如今人工智能正面临相似的转型:前沿模型只要给定问题、工具与成功标准,就能够解决越来越难的任务。但现实中最具价值的难题,极少会以可执行、可核验的形式呈现在我们面前。
本文提出Apodex Discovery,一套用于构建、评估发现型人工智能(discoverative AI)的框架。所谓发现型 AI,指的是致力于产出真正科学发现的人工智能系统;它的执行单元是重型求解器(heavy‑duty solver),配套我们搭建的现实基准集TRACES。重型求解器是一套完整系统,包含基础大模型、调度框架(harness)、工具集与控制策略,用来执行长期、有状态、可核验的科学调研任务。
Apodex Discovery 针对发现型 AI 做出三项核心贡献,旨在将开放式现实问题转化为可处理、可验证的发现任务。 第一,我们开展系统性问题调研:覆盖 16 个行业大类下 561 个细分行业,整理出 423 个高价值现实问题,初版发布从中筛选的 20 个问题;包含两类任务:一类是结果已知但对求解器保密的回溯类任务,另一类是随新证据涌现而评估的前瞻性发现挑战任务。 第二,我们通过统一的「环境‑任务‑片段(environment‑task‑episode)」抽象,构建可执行环境。它为求解器提供开展工作所需的数据、工具、约束与反馈,同时完整记录运行轨迹,核验关键中间产出与最终提交结果;基于这套工作,我们发布配套本文的现实基准 TRACES。 第三,提出HDS6过程验证框架,独立于最终任务结果,从工具使用、修复、备选方案、一致性、证据、适用范围(Tools, Repair, Alternatives, Coherence, Evidence, Scope)六个维度开展评估。即便 definitive(确凿)的真实标准答案存在延迟、残缺甚至完全不可获取,该框架依然可以开展有意义的评估。
在腺相关病毒(AAV)衣壳设计任务中,Apodex 在全部四项任务(存活能力预测、嗜向性预测、结构预测、生成式设计)上,相比已发表的业界最优结果整体提升 7%。在药物重定位与制剂改造任务中,引入专用生物医学环境后,GPT‑5.5、GPT‑5.6‑sol 的标准化平均预测分数,相比纯闭卷基线分别提升 2.5 分、7.6 分。受控消融实验进一步证明,固定的 TRACES 片段接口,可以将性能差异归因到求解器系统的具体组件。
依托现实世界问题、可执行环境以及过程评估机制,Apodex Discovery 建立一套全新范式,为发现型人工智能奠定基础:不再局限于求解预先定义好的基准数据集,而是让 AI 开展真正能产出科学发现的深度调研。TRACES 基准可访问:discovery.apodex.com。
1 引言
阿波罗计划的成功,并不仅仅源于工程师能够求解复杂方程。“登陆月球” 这一宏大愿景,首先要被转化为一整套任务架构:明确目标、清晰约束、协同子系统、仿真环境、遥测、失效判定标准,以及反复测试修正。只有在这套架构之下,每一次问题求解,才能汇聚成改变现实的重大成就。
如今人工智能正在迎来相似的转折点。在高阶考试、数学难题、软件工程基准测试上,只要预先给定目标、环境、工具和成功判据,能力越来越强的模型就可以解决高难度任务。但人类最宏大的目标 —— 开发不治之症的根治疗法、实现具备商业可行性的核聚变、研发具备变革性性能的全新材料 —— 几乎不会自带这套完备架构。因此 AI 面临的下一个关键挑战,不只是打造能力更强的模型,更要搭建基础设施,把模型能力转化为开放重大问题的解决方案。
这套基础设施的终极目标,是科学发现:让 AI 能够得出尚且未知的结论,而不是复现已经存在的答案。本文要回答的核心问题,就是如何实现发现:如何把一个开放式愿景,转化为一套可执行、可核验的调研行动序列,供系统执行,也可供人类复核。我们将这种目标导向范式称为发现型人工智能。
现实中的发现本身就是循环:提出假设、作用于现实世界、核验结果、迭代修正。自动化这套发现循环,是一大片研究方向的共同追求,包括自主科学智能体、致力于把科研实验循环自动化的 Discovery Loop 项目。但这些工作普遍缺少一套关键基础设施,这套基础设施要保证循环的每一步都可执行、可核验、可迭代改进。
这套缺失的基础设施包含四大组成部分:问题形式化、现实导向环境、验证机制、修复循环。
- 问题形式化
把人类开放式愿景转化为明确目标、约束条件、假设集合以及成功判据。 - 现实导向环境
为求解器提供开展行动所需要的数据、工具、计算资源、实验接口,甚至人类交互通道。 - 验证机制
判断中间论断与最终产出是否可靠、正确,并且和原始目标相关。 - 修复循环
将计算、实验、外部评估或人类评判结果反馈回求解器,让系统定位错误、修正假设、迭代优化方案。
以上组件,把模糊的宏大愿景,转化为一套可处理、可迭代、可评估的任务,交由重型求解器执行;重型求解器正是发现型 AI 的执行单元。
与此同时,现有的评估范式并不适合衡量这类问题求解能力。现有基准主要分为两大类。
- 静态问答基准
MMLU、GPQA、MATH、FrontierMath、Humanity’s Last Exam 等。评估模型能否把固定提示映射为正确答案。这类基准可以检验重要能力,但没有持久化环境,没有外部行动,没有状态演化,也无法针对中间失败做出响应。 - 交互式基准
SWE‑bench、WebArena、OSWorld、τ‑bench 等,把模型放入可执行环境,更贴近真实问题求解。但它们大多局限于狭义定义任务,将整个运行片段简化为一个最终成功信号。很少评估求解器是否完成合理问题分解、论断是否有证据支撑、是否考虑可行备选方案、收到反馈之后是否修复自身方案。
我们缺少的,是一套评估框架:它的分析单元不再是孤立的一条答案,而是一整套完整运行片段,包含工具调用、证据搜集、可核验、可自我修正的问题求解全过程。
依托 Apodex Discovery 框架与方法论,我们同步发布TRACES现实基准,包含可执行环境、运行片段、带隐藏核验器的各类任务,发布地址:discovery.apodex.com。
1.1 什么是重型求解器?
重型求解器(heavy‑duty solver)指一整套完整系统:由基础大模型,外加调度框架 harness、工具集、记忆模块、控制策略共同组成;它的使命,是承接现实世界的开放式宏大目标,一路输出可核验的结果(见图 1)。
它和普通的提示‑回答模型的区别,不在于原始推理能力,而在于可以针对外部现实世界开展长期、带状态、自我修正的调研;外部世界经常会输出出人意料的结果。要发挥这套能力,就必须具备上面提到四大基础设施:问题清单(problem manifest)、现实导向环境、验证、修复。下面逐一介绍。
1.1.1 问题清单 Problem Manifest
重型求解器处理的任务,起点往往是一个宏大愿景,而不是具体问题。第一项基础设施,就是把愿景转化为问题清单:一份静态、声明式契约,固定该问题所有不变要素,由此生成可运行的任务实例。清单包含:
- 问题与成功判据
什么样的输出算作解决方案。答案不必预先已知,但必须存在一套客观标准,当候选解出现时,可以识别、核验或者证伪。 - 任务分解
将问题拆解为若干子任务,每个子任务定义输入、预期输出、成功标准。关键中间结果(会决定最终答案的那些结果),要在产生时就核验,而不是只看最终产物。例如 AAV 衣壳设计任务被拆分为四项:变体存活能力预测、组织嗜向性预测、三维结构重构、在有限实验反馈预算下生成全新靶向序列。 - 目标产出与隐藏核验器
定义衡量成功的目标指标,以及一套隐藏的流程与打分规则,用来给提交结果打分;当确凿结果延迟或无法观测时,则使用可衡量的代理指标。 - 数据与工具
求解器能够使用的输入数据、行动接口;严格和用于打分的隐藏标准答案隔离开。 - 资源预算
求解器运行的时间、计算量、工具调用次数、安全边界、数据访问限制。
可运行片段(episode)就是从清单实例化而来的单次运行单元。每个片段拥有自己的实例数据与隐藏标准答案,同时复用清单定义的工具、核验器、打分规则。评估求解器系统,需要在大量片段实例上测试,而不是只靠单个样例。
1.1.2 现实导向环境 Reality‑Based Environment
问题清单定义 “需要解决什么”;环境定义 “在哪里开展求解”。现实导向环境是带状态的交互式底层载体,实现清单的全部要求,求解器在此开展行动:包含各类工具(代码、检索、专业软件)、公开 / 私有数据以及其他允许的交互行为。
它的核心特征:会根据求解器的行动返回全新观测信息:工具输出、报错、检索文档、仿真结果、实验测量值、核验器反馈。环境不等同于提示词。提示只提供静态上下文;环境会随着智能体行动源源不断产出新信息。
两条原则保证环境忠实映射现实:
- 隔离性
打分使用的隐藏标准答案,在架构层面保证不会泄露给求解器;运行环境被严格隔离,无法从外部窃取答案,也不能向外泄露内部结果。 - 评估对象是整套求解系统
待评估对象是完整求解器(基础模型 + 调度框架 + 智能体循环),而不是孤立的基础模型。
求解器和环境之间,只通过一套固定的片段接口交互:接口一侧向求解器开放输入、工具、预算、提交格式;另一侧运行隐藏核验器、硬性限制、结果度量。所有系统、所有基线都走同一套接口,因此性能差异可以定位到具体组件(模型、调度框架、智能体循环、工具使用、反馈处理),而不是归咎于环境本身。同一套环境,既可以固定模型对比不同调度框架,也可以固定调度框架对比不同模型。
1.1.3 验证机制 Verification Mechanisms
环境的可信度,取决于内部的检查逻辑。验证分为互补的两类:结果验证(outcome verification)、过程验证(process verification)。
结果验证:关注求解器产出了什么。对最终提交结果打分;如果任务做了分解,同样对关键中间产物打分。打分标准对求解器可见,但详细打分细则、底层数据对求解器保密。很多高价值问题确凿结果不可得、会延迟得到,这时核验器会使用可测量代理指标。例如 AAV 衣壳工程的最终目标是生产可以在人体内高效转导靶组织的载体,但这很难直接在纯计算环境得到,因此使用高通量筛选得到的包装适应度作为代理指标。 很多交付产物不是简单答案,而是训练好的模型、整理好的语料、数据流水线。因此每个结果核验器都内置反博弈防护门:检测数据泄露与污染;一旦检测到作弊行为,直接作废整个片段,而不是只降低分数。所有结果都归一化到 0‑1 区间:0 代表简单基线水平,1 代表已知最优可达到结果。
过程验证:关注求解器如何得到结果,读取完整运行轨迹,而不是只看提交产物。当确凿结果稀疏、迟迟得不到时,过程验证可以补充评估,甚至成为唯一可行评估手段。本文使用HDS6实现过程验证,一套六维度量,缩写 TRACES:Tools 工具、Repair 修复、Alternatives 备选假设、Coherence 一致性、Evidence 证据、Scope 适用边界。
HDS6(重型求解器六大能力):
- Tools 工具
选择、调用、正确解读外部工具; - Repair 修复
收到核验反馈或观测到失败后,定位并修正底层错误,确认修复生效; - Alternatives 备选假设
明确列出互相竞争的假设,随着证据积累完成对比筛选; - Coherence 一致性
在长任务全程维持状态、约束、逻辑自洽; - Evidence 证据
所有论断都锚定观测、工具输出、数据、实验、参考文献; - Scope 适用边界
明确结论成立的条件,以及结论不能外推的边界。
过程核验器采用盲评模式:看不到最终结果;评估前剥离求解器私有内部思考链;同时隐藏求解器身份,打分只依据外部可见的轨迹行为。只有一条完整性检查会读取最终输出,用来检测伪造行为。
结果验证评判 “最终有没有做对”;HDS6 过程验证评判 “是否通过一套可靠、证据充分、自我修正的调研得到答案”。二者互为补充。尤其对高价值现实问题,确凿标准答案可能延迟、残缺甚至缺失,这时过程评估就格外重要。
1.1.4 修复循环 Repair Loops
最后一项组件,把评估从单纯给出判决升级成闭环。修复循环把核验输出(计算结果、实验、外部评估、人类判断)送回求解器,让系统定位、修正、重新检验错误,而不是仅仅记录失败。 片段内部就会发生修复:接口传回核验反馈,让求解器检测失败、修正之前工作。HDS6 中的 Repair 维度,正是衡量系统是否能够针对真实错误开展修复,并确认修复生效。
评估还支持跨多次尝试的修复循环。过程验证输出结构化诊断报告,而不仅仅是数字。每一项没有拿到最高分的能力,都会给出目标改进等级;每一个出错的关键步骤,输出定位到步骤级别的反馈。这些信息被整理为一份精简修复说明(repair note)送回求解器,开展新一轮运行。修复说明不会泄露最终结果、隐藏标准答案、结果分数,只指导改进过程。这套流程形成「测量‑诊断‑改进」闭环,同时维持求解器与标准答案之间的隔离。正是这套循环,让重型求解问题不只是可度量,而且可以迭代求解。
我们由一支 10 人 STEM 博士团队,历时两个月开展调研:覆盖 16 个大类共 561 个行业,收集得到 423 个高价值现实问题,初版 TRACES 基准从中挑选 20 个。AAV 衣壳设计任务上,Apodex 在全部四项任务上超越已发表 SOTA;药物重定位任务,专用生物医学环境,相比闭卷基线,分别把 GPT‑5.5、GPT‑5.6‑sol 标准化分数提升 2.5 与 7.6。固定 TRACES 片段接口与受控消融实验,允许我们把成败归因到求解器系统具体组件(基础模型、调度框架、初始技能引导、核验器驱动修复),而不是笼统归因为模型能力不足。
2 高价值现实问题的调研筛选
发现型 AI 的价值,取决于它所处理的问题。为 AI 评估筛选合适的现实问题,需要一套系统化流程:领域筛选、问题挖掘、环境构建。科研、医学、工程、工业界存在大量未解决问题,但只有一小部分同时满足推理深度、技术结构、可核验路径、现实价值,才适合评估重型 AI 系统。我们关注的对象,是那些艰难、充满不确定性、可能耗时数年,但对人类具备极高价值的未知难题。
10 位拥有 STEM 博士背景的研究人员,历时两个月开展调研,覆盖科研、工程、医疗、金融、工业应用。调研手段包含系统文献综述、行业报告与技术资料分析、参加领域会议研讨会、与科研从业者访谈,以及分析合作项目与内部落地项目产生的问题。 这套流程,收集出 423 个高价值现实问题。每一个候选问题,都从推理深度、技术可行性、可核验性、所需数据工具、核验延迟、现实影响力多角度评审。因此本基准不是简单头脑风暴凑出来的题目集合,而是经过领域分析、问题收集、专家评审、核验器设计、环境搭建的结构化产出。
2.1 领域选择
Apodex Discovery 旨在评估重型问题:无法依靠简单记忆或者直接检索就得到解。一个问题即便已有公开答案,如果仍然需要大量推理,模型表现也可能来自记忆、基准污染或者检索技巧。与之对比,如果问题本身没有既定答案,就必须通过系统开展的工作去评判:搜集证据、调用工具、考量备选假设、产出中间产物、给出最终结论。
我们首先构建一套底层分类体系,涵盖 16 个大类下 561 个互不重叠的细分行业;这套自底向上的全球产业图景,同时参考美国 Genesis Mission 识别出的战略技术挑战,形成自顶向下视角。
每个行业从三个维度打分:
- 技术适配度 Technical fit
该行业最难问题是否适合长链路推理系统;考量推理深度、形式化能力、可执行性、核验保真度、核验延迟、数据可得性、落地可行性。 - 价值 Value
解决该行业顶尖难题,是否可以产出里程碑科学成果,或是巨大商业机会。取科学价值、商业价值二者的最大值,只要其中一项足够突出就可以入选。 - 商业落地可行性 Commercial access
解决方案能否真正落地,嵌入现有工作流,建立竞争壁垒,可以规模化,而不只是做单次演示。
三个维度独立打分,不会互相补偿。例如,市场规模大、数据多,不能掩盖可核验性差或者推理深度不足的缺陷。另外两条原则:评估该领域,看先进发现型 AI未来能解决什么最难的问题,而不是看现在 AI 在该领域的普及程度;重型推理与工具使用深度是重要筛选条件,问题入选,必须真正要求深度多步骤工作,不能只是数据多或者市场成熟。
由于商业落地可行性高度依赖制度、采购流程、数据所有权、监管,很难定量估计。定量分数用来缩小候选池,最终筛选依靠人工评审。最终选出 10 个领域,来自 8 个大类,每个大类最多选取 2 个领域:
-
生物信息学、计算生物学与基因组医学 -
面向科学推理的基础大模型 -
科学高性能计算代码生成与优化 -
医疗 IT 与数字健康 -
受气象影响的大宗商品与能源市场预测 -
结构与土木工程服务 -
芯片设计与验证(EDA) -
市场数据与金融指数 -
材料发现、设计与性能评估 -
工业自动化与控制
2.2 问题收集与筛选
在选定 10 个领域内,通过文献、行业调研、领域会议、专家访谈、合作项目、内部落地经验,生成候选具体问题。同时接收科研人员、工程师、临床从业者直接提出的问题,优先选取来自真实科研项目、业务流程的问题,而不是单纯为做基准编造的题目。
对每一个候选,不仅记录问题描述,还记录实现可运行环境所需要的数据、工具、计算接口、核验流程、外部依赖。候选被评估为未来的可运行环境,而不是孤立自然语言问答题。仅仅问题描述宏大有意义是不够的,必须有可信路径,让智能体的行动产出可观测、可核验的结果。
每一个候选问题,至少需要具备:
-
明确目标与输出产物; -
拆解成有实质内容的中间子任务; -
可度量的核验评分细则; -
至少一套可运行输入输出实例; -
可识别的数据、证据、实验反馈来源; -
从智能体尝试到外部可核验结果的完整链路; -
同时具备现实影响力与可识别的使用者、客户、受益者。
那些成功条件最终只能依靠无结构化专家主观评判的问题会被直接排除。专家评审可以作为评估组成部分,但不能作为唯一判据;基准问题必须有足够可观测结构,使得论断、中间产物、实验假设、最终结果都可以被独立审阅、质疑,尽可能证伪。
同时设置严格价值门槛:问题必须兼具实际影响力,以及可识别的受益者或购买方。如果没有任何机构愿意投入资源解决它,大概率只是学术习题;如果有明确客户,但技术深度不足,则更适合作为产品功能,而不是重型基准问题。
经过这套流程,得到 423 个高价值现实问题集合,从中选出 20 个作为 TRACES 初版发布。覆盖前沿模型研发、生物医学发现、临床转化、科学工程、面向落地的智能。
任务分为两大类评估设置:
- 回溯设置(retrospective)
基准构建者掌握真实结果,但对求解器完全隐藏。求解器不能靠检索得到答案,必须依靠证据搜集、建模、实验、工具调用复现结果。 - 前瞻性设置:发现挑战(discovery challenges)
评估启动之时,不存在权威标准答案。系统产出工作质量,随着后续外部证据、现实结果出现再开展评估。
两类设置的共同点:求解器不能靠回忆、检索得到答案。解决方案不必预先已知,但方案出现之后,必须能够客观识别、核验、证伪;这是开放式现实问题可以作为评估任务的前提。
2.3 初版基准中的现实问题
TRACES 初版挑选五大问题系列,兼顾高现实价值、长链路推理、异构工具调用、中间核验能力,以及可以最终确认或证伪系统结论的外部结果。
- 腺相关病毒(AAV)衣壳设计
评估用于基因递送的 AAV 衣壳四阶段完整流水线:变体存活能力预测、组织嗜向性预测、三维结构预测、在有限实验反馈预算下生成全新可制造、靶向序列。求解器需要整合序列‑功能数据、结构生物学约束、预测模型、折叠分析工具,以及实验反馈。评估使用防泄露的留集数据,包含跨突变负荷、跨物种、跨结构发布时间、未见候选序列的泛化测试。 - 药物重定位与制剂改造
为已经获批、经过临床验证的药物,寻找新适应症和优化制剂方案。不是研发全新分子;把已经获批药物用于其他疾病。系统需要整合机理证据、疾病生物学、临床试验记录、药理学、安全性、监管证据、重定位流程、现实世界结局,对药物‑疾病假设做优先级排序。制剂改造方向包含目标人群、生物标志物、联合用药、制剂递送。评估基于留集的临床、监管、现实世界结果,而不是公开现成答案。目标不是产出一个看似合理的故事,而是输出一套经过证据支撑、可以通过前瞻 / 回溯核验的优先级推荐。 - 临床试验分析与转化
包含统计分析、临床报告、安全性有效性信号挖掘、试验推进预测、解释为什么有前景的临床前结果无法在人体复现。典型任务:按照统计分析计划生成分析代码与表格;识别正在积累数据的试验中新出现的安全、有效性信号;预测项目能否推进下一临床阶段;诊断临床前到人体转化失败的原因。 - 大语言模型相关数据任务
大模型训练数据的获取、构建、过滤、评估。任务包括预训练数据获取、质量评估、去重、污染检测、基准构建;在固定计算预算约束下,发现可以提升下游能力的数据混合方案。目标不是简单收集更多数据,而是构建数据流水线,其下游效果可以通过受控实验度量,决策过程可以追溯到明确证据。 - 大模型训练与系统工程任务
评估训练、部署大模型所需方案与系统的发现、诊断、修复。任务包含合成数据微调、强化学习方案搜索、优化器与调度策略选型、推理确定性修复、分布式训练调试、核验器构建。求解器需要处理代码库、日志、实验、硬件约束、评估结果;成功不仅是提出训练方案或者代码修改,还要执行、诊断失败、解读指标,证明系统满足约束条件。
初版可执行环境,仅仅是 423 个问题库的一小部分。未来版本,会持续拓展到更多科学、工程、金融、医疗、工业领域。这套不断扩充的集合,既是评估框架,也向整个社区发出邀请:不只在已知答案的题目上测试模型与求解系统,也要在大量尚待解决的、高价值、可核验的难题上进行检验。
2.4 发现挑战 Discovery Challenges
发现挑战,指评估启动之时,还没有权威标准答案的现实任务。和回溯类基准不同,它不会预先保存标准答案;随着实验测量、外部证据、专家裁决、现实世界结果陆续出现,才对系统进行前瞻性评估。评判的依据,不是和现成标准答案比对,而是看系统产出一套完整可审计的工作:它的假设、中间结论、干预方案、最终论断,能否在未来被独立证实或证伪。
我们第一个发现挑战,聚焦基于功能筛选化合物匹配的因果性药物重定位。输入来自无偏全基因组生存筛选得到的保护性 / 损伤性基因特征(该筛选确定基因对细胞存活的因果效应,不是相关性),外加公开化合物资源;求解器输出带置信度打分的候选化合物排名。对每一个高排名、机理尚不明确的化合物,输出有证据链支撑的靶点与作用机理假设。系统还需要判断这套排名能否迁移到第二种疾病的独立筛选数据集;证据不足以下定论时,要如实给出该判断,而不是强行输出结果。
所有论断必须在答案揭晓之前提交;每一条机理假设都必须溯源到可检索、可核验的公开文献来源。不能有依据支撑的论断,直接判定为无依据,不允许模糊搪塞。一套对照基准与部分排名子集被密封保存,提交截止之后才公开;打分指标与基线预先固定。领先候选分子的机理与最终生存效应在评估开始时未知;因此这套任务奖励可辩护的因果推导,而不是对文献做模式匹配。
第一个实例是帕金森病模型:在患病模型神经元中开展全基因组生存筛选,得到保护 / 损伤基因靶点,得到初步化合物排序,已知的神经保护剂排名靠前,已知细胞毒素排名靠后。重定位领域存在固有缺陷:反转疾病特征,有可能同时逆转代偿保护通路,而不只是修正有害通路。因此求解器必须把筛选基因特征,和药理学、化学信息学、专利文献,以及独立人体、模式生物证据整合,输出经过校准的候选排名,以及可辩护的机理解释。
密封材料公开之后,由核验器基于统一可审计执行框架打分。预测会和留集真实结果比对;包含对照集富集程度、测量得到的生存效应;掩码机理集合与已知靶点比对;推理轨迹对照验证协议打分。基线包含传统特征反转基线、随机基线,以及合作方的初步排序,分别在环境内外运行。长期看,排名靠前候选会开展单细胞生存实验,而该实验结果在评估开始时完全不存在。
该案例充分展示 TRACES 中发现挑战的定位:基准不假设正确科学答案已经存在,但它强制要求 AI 输出因果论证、带置信度的重定位候选、可证伪的机理假设;后续随着密封证据揭开与新实验开展,可以逐步检验这套假设是否成立。
3 过程验证与现实导向环境
本章介绍 Apodex Discovery 底层的验证框架与可执行环境基础设施,说明开放式 AI 调研如何变得可核验,而不是仅仅听起来合理。首先介绍结果验证与过程验证,之后形式化定义环境‑任务‑片段抽象,支持可复现、可修复的求解器评估。在我们看来,本基准最核心的就是验证流程:不只是校验最终输出,还对可分解任务的中间结果做完整核验;提出一套新概念,从六个重要维度捕捉智能体的过程完整性,也就是 HDS 重型求解器能力。介绍完验证框架,再介绍可执行环境,它把环境、任务、片段、核验器整合为一套完整可运行、可复现、可修复的体系。
3.1 验证 Verification
验证是评估求解器行为的核心机制。我们区分两种互补形式:结果验证(outcome verification)评估求解器产出了什么;过程验证(process verification)评估求解器是如何产出结果。二者缺一不可。 结果分数衡量任务是否成功,但通常只能给出稀疏的诊断信息。很多场景,受限于私有数据、湿实验周期,获取结果验证代价极高。而过程分数,提供细粒度信息,反映工具使用、证据处理、假设管理、修复行为,判断整套调研轨迹是否可靠可信。
3.1.1 结果验证 Outcome Verification
结果验证评判求解器最终提交产物,使用求解器可见的成功标准打分,但打分流程与真实标准答案对求解器保密。检验形式随任务变化:代码与数学任务使用单元测试、标准答案;预测任务使用留集标签;策略、设计类任务使用仿真终点;没有自动判据的场景,引入专家裁决。
任务会做分解。片段级核验器评判最终提交物;当复杂任务被拆分为 τ₁…τₙ子任务时,每个子任务拥有独立核验器。这样关键中间产物、里程碑,可以在生成时就完成检验,而不是等到看最终输出。举例子:药物重定位片段,检索得到机理证据、构建机理链条、最终前景估计会依次核验;AAV 衣壳设计片段,提交序列首先检验编码、突变规则有效性,之后才打分适应度。中间验证带来诊断能力,可以定位长调研链路中,到底在哪一步成功、在哪一步失败,而不是只有一个总分。
很多任务,哪怕最终目标,也无法直接获取,只能使用代理指标。例如 AAV 衣壳工程,理想目标是可以高效生产、规避预存免疫、在人体内靶向组织;这些无法直接在纯计算环境拿到,因此使用高通量筛选测量的包装适应度作为可核验代理。
反博弈机制 Anti‑gaming:很多交付产物是训练模型、整理语料、数据流水线,而不是简单答案。系统可以通过把评估数据偷偷塞进提交物,拿到高分却没有真正解决任务。每一个存在该风险的结果核验器,内置明确泄露检测硬门限:一旦检测到泄露,直接作废整个片段,而不是扣一部分分数。
基线归一化:所有结果分数映射统一 0‑1 刻度。两个锚点在实例构建时确定:下限 floor 是简单基线(随机猜测、默认方案)映射 0;上限 ceiling 是已知最优可达结果映射 1。原始测量值在线性缩放映射到二者之间。分数含义:介于简单基线和已知前沿之间的相对位置,方便跨任务对比。多维度组合打分时,每个维度独立做归一化,再根据标签分布选择合适统计量(相关系数、平均绝对误差、检测分数),避免某一个维度因为数值尺度占过大权重。
3.1.2 过程验证 Process Verification
过程验证读取完整运行轨迹,而不是提交产物本身。关注点不是产出,而是产出的方式。轨迹是权威日志:记录每一步行动、资源消耗、观测结果、报错;失败、畸形尝试和成功尝试全部保留。
本文使用HDS6完成过程验证,是重型求解器能力的基石。它从 TRACES 六个维度对轨迹打分:Tools 工具、Repair 修复、Alternatives 备选假设、Coherence 一致性、Evidence 证据、Scope 适用边界。
工具:是否正确选择、调用、解读外部工具; 修复:检测并自我修正错误,有效响应核验反馈与失败,而不是重复犯错; 备选假设:明确提出互相竞争的假设,证据积累之后对假设排序取舍;过早认准单一解释,是开放式发现最常见失败模式; 一致性:长任务全程维持状态、约束、逻辑自洽; 证据:每一条论断都锚定观测、工具输出、参考文献、真实数据;一条无依据或编造的论断,会摧毁所有依赖它的结论; 适用边界:说明结论成立的条件、不确定性、失效模式、适用限制。
过程核验器执行盲评:看不到结果分数;评估前剥离求解器私有内部思考链;隐藏求解器身份;打分只依据轨迹外部可见行为。仅有一条完整性检查门限,可以读取最终输出,用来检测伪造行为。
HDS6 有两套互补打分方案:
- 子细则打分(subrubric‑based scoring)
六大能力拆分为 25 个子能力;每个子能力拥有打分细则,0/1/2 三档。能力本身跨环境通用,但每一档对应的行为,会针对任务定制。一套独立完整性门限检测伪造工具调用、伪造输出等严重问题,一旦触发直接作废整条轨迹。打分采用多智能体评审流程:一个模型给出等级并引用轨迹原文;第二个模型极力论证另一等级;第三个模型仲裁分歧;所有引用必须溯源日志原文。 - 关键负载步骤打分(load‑bearing step‑based scoring)
不使用固定清单;先识别轨迹中真正关键步骤;构建依赖图,从最终提交反向回溯,计算每一步对最终结果的权重。关键负载步骤,交由一组看不到原求解器思考链的模型独立重算;对比原步骤和独立重算结果,得到连续偏差。结合权重与评审置信度,聚合得到过程质量分数,同时输出定位到步骤级别的精准反馈。
两套打分方案,都不仅输出数字,还输出结构化诊断报告,可以送回求解器,完成「测量‑诊断‑改进」闭环。子细则输出每个子能力应当提升到哪一档;负载步骤分析输出每一个出错步骤的定位。修复说明不会泄露结果、标准答案、结果分数,只指导改进过程。
过程分数与结果分数的校准对齐:我们在 409 条同时具备数值结果的轨迹上,统计结果分数与 HDS6 过程分数相关性。各个任务家族均为正相关:AAV 衣壳设计 Spearman ρ=0.24;临床试验 ρ=0.47;大模型数据任务 ρ=0.46;训练系统任务 ρ=0.65;全部汇总 ρ=0.51,Pearson r=0.56。盲态的过程评审,和隐藏结果核验器,大体上对轨迹好坏达成共识。
3.2 环境、任务、片段 Environments, Tasks, and Episodes
可执行环境是重型求解系统的底层基础。三层嵌套抽象:环境 environment、任务 task、片段 episode;和核验智能体共同组成一套完整可运行、可复现、可修复的实现。 从求解器视角:环境暴露行动接口、可用工具、资源预算,随着智能体行动输出新观测,而不是只返回固定提示。 任务是环境内部定义的问题单元,代表完整问题或者重要中间步骤,可以在这里核验最终或中间结果。 片段 episode:任务的单次可运行实例,配置专属数据、预算、隐藏标准答案,完整记录求解器产生的全部轨迹。 叠加在三层抽象之上,就是核验智能体:隐藏的结果核验器评判提交产物;盲态过程评审评判轨迹。每一个片段同时输出结果分数与 HDS6 过程画像。
把开放式科研问题,构建成一套忠实可信、带核验器的可执行环境,本身就是工作量巨大的工作;在本文看来,搭建这套环境,难度至少不亚于求解器要完成的任务本身。
3.3 环境 Environment
环境是基准或者求解运行时的底层载体。可以包含文件系统、数据库、API、代码沙盒、仿真器、实验接口、检索系统、隐藏标签、评估服务。同时定义资源约束:时间上限、计算预算、工具调用上限、安全边界、数据访问规则。环境由一份 manifest 清单完整声明:任务完整说明、目标产出、隐藏核验器、给求解器的数据、允许调用的工具,以及资源预算。清单是静态契约,由此实例化出一条条片段,配置对应的数据、工具、核验器、打分规则。
环境的决定性属性:响应求解器行动,返回全新观测信息,包含工具输出、报错、检索文档、仿真结果、实验测量值、核验反馈。因此环境远远不止是提示词。提示只提供静态上下文;环境会随着行动源源不断产出新信息。
3.3.1 任务 Task
任务是环境内部带范围的工作单元,定义输入、预期输出、允许使用的工具、成功标准、核验流程。任务有两大意义:
-
把复杂现实大问题拆解为可以在发生时就核验的子问题,而不是只靠最终输出推断成败。AAV 衣壳设计拆分为存活预测、嗜向性预测、结构预测、生成式设计,每一项独立核验,帮助定位流水线内部失败位置。 -
定义 HDS6 能力机会矩阵:不同任务,会激活不同的 TRACES 维度。有些任务不会给修复能力提供发挥场景,另一些任务大量锻炼修复能力。因此,没有任何单一任务,可以完整测试全部六项能力;组合多个任务,才可以完整刻画重型求解器水平。
3.3.2 片段 Episode
片段,是特定问题实例上的一次求解运行,是求解系统与环境交互的基本单元。片段内部,求解器执行行动,环境做出响应,返回观测、扣减资源预算,接收中间与最终提交物。片段接口(episode interface)是二者交互的固定边界。接口环境侧:输入、工具、预算、提交格式;评估侧:隐藏核验器、硬性门限、结果度量。核验反馈可以跨接口传回,让片段具备可修复能力。 有两样东西跨过接口,从求解器流向评估层:提交产物(submission)交给结果核验器;轨迹(trajectory)交给盲态过程核验器。所有求解器、所有基线全部使用完全相同接口。因此性能差异,可以归因到求解系统的特定部件(基础模型、调度框架、智能体循环、工具使用、反馈处理),而不是环境本身。
片段记录:核心是轨迹,有序记录每一次尝试:行动与参数、消耗资源、剩余预算、观测结果或者报错,外加计量模型调用、异步核验任务、最终工作空间快照、核验结果。片段记录,可供过程核验器读取,产出能力分数与诊断修复说明,进一步迭代改进求解器在该任务上的表现。
4 高价值问题上的实验结果
下面是早期实验结果,证明发现型 AI 具备发展潜力。在重型求解器的不同任务上,我们观察到 AAV 衣壳设计超越已发表 SOTA;在药物重定位任务,专用环境带来显著收益;HDS6 指标与验证‑修复循环同样展现效果。这些是迈向真正科学发现的积极初步成果。
4.1 AAV 衣壳设计
腺相关病毒 AAV,是基因治疗领域主流载体,用于治疗多种遗传病:遗传性视网膜病变、血友病、肌营养不良、神经系统疾病。它的蛋白质外壳 —— 衣壳,决定载体可制造性,以及能否高效抵达靶细胞。衣壳工程难度很高:提升递送能力、降低免疫识别的突变,同时也可能破坏病毒组装与基因组包装。 本基准捕捉该流程四大关键阶段:①判断变体是否存活可组装包装;②预测靶向哪些组织;③从序列预测三维衣壳结构;④在有限实验预算下,生成少量多样化、靶向全新候选序列。整套任务构成真实发现流水线:候选物必须可生产、靶向正确靶点,同时足够新颖,相比现有载体有所提升。评估不只看 AI 做蛋白质属性预测,而是看它支撑整套生物决策链路,把计算设计转化为可开展实验的 AAV 候选分子。
数据泄露控制至关重要:为了衡量真正生物推理,而不是记忆文献。所有任务基于真实筛选、结构数据;做分布外拆分:跨突变负荷、跨物种、跨结构发布时间。真实标准答案,只能通过计量打分接口访问,求解器不能直接读取标签。
4.1.2 领域专用环境带来性能提升
运行在本项目领域专用环境下的前沿模型,持续优于使用通用 Claude Code 调度框架的同一个模型。T1‑T3 平均,claude‑opus‑4‑8 在本环境得分 0.741,显著高于 Claude Code 框架的 0.716。差距最大的是结构预测任务:0.657 对比 0.595,该任务需要协调折叠引擎、校验中间结果,而不是输出单一预测。T4 生成设计任务也同样看到收益。说明领域专用环境的收益,不是局限于某一个阶段,贯穿整套衣壳工程工作流。
4.1.3 超越已发表的业界最优 SOTA
依托领域专用环境,apodex‑1.1 在全部四个阶段,都超过之前公开最优结果。
- 存活能力预测
out‑of‑distribution AUROC 达到 0.904,超过 CAP‑PLM(0.878)。说明 apodex‑1.1 可以可靠筛选值得后续深入分析的候选变体。 - 嗜向性预测
得分 0.635,优于 Fit4Function 公开 SOTA(0.622)。证明系统相比成熟专家方法,可以更好按照组织富集度对变体排序。 - 结构预测
三级任务平均得分 0.649,高于 AlphaFold3 + 模板对称扩展的公开 SOTA(0.605)。 - 生成式设计
得分 0.180,超过 AAVGen(0.109)、AAVDiff(0.116)、ALICE(0.110)。证明系统可以在有限实验预算约束下,生成存活、新颖、靶向的候选序列。
上述结果表明:配备科学专用环境的前沿模型,不仅可以自动化现有分析工作流,还可以产出比现有专家方法质量更高的生物设计决策。
4.1.4 基于过程验证的结果
HDS6 过程分数与结果分数整体趋势保持一致:最终生物学表现更好的系统,它的科学问题求解过程打分同样更高。在任务、实例层面都可以观察该现象。例如结构预测任务,GPT‑5.5 结果分数仅 0.544,HDS6 过程分数低到 1.38、0.94,因为 GPT‑5.5 经常性跳过任务要求的自校验步骤,直接提交首轮输出。而该任务表现最好的 Kimi‑k3,在对应实例上拿到很高的过程分数(3.56、3.60)。该一致性说明 HDS6 可以有意义地表征科学问题求解质量,而不只是评判最终回答的流畅度、文笔。
4.2 药物重定位与制剂改造
药物重定位,不是研发全新药物;而是为已经获批、临床表征充分的药物,寻找新的治疗适应症,以及优化临床流程。复用已有的药理学、安全性、生产、临床证据。任务不仅包含适应症筛选,还包含生物标志物分层、制剂递送、联合用药、临床方案设计。
药物重定位决策,需要整合大量异构、甚至互相冲突的证据。机理上说得通,不等于就可以转化成临床获益;临床试验报告不完备;结局高度依赖剂量、安全性、人群选择、给药方案。因此,我们把该任务形式化为前瞻性逐点预测任务:给定疾病与候选药物,系统只能使用某个时间节点之前可以拿到的全部信息,输出 [0‑1] 前景分数、置信度,以及证据支撑的理由。前景分数,代表该药物‑疾病组合,在临床开发、审批链条上的预测位置。 真实标签来自该时间节点之后观测到的临床、监管现实结局。主要评价指标评估前景预测;置信度与推理理由用于补充轨迹分析。基准包含 100 对公开开发集,200 对隐藏测试集。药物、疾病名称做归一化;构建标签所用结局字段对模型输入隐藏。时间过滤、配对去污染,避免评估标签泄露到模型上下文。
4.2.2 打分方法
评估集合\(D=\{(x_i,y_i,\tau_i)\}\),\(x_i\)药物‑疾病配对,\(y_i\in[0,1]\)观测临床结局,\(\tau_i\)标记是精确值还是下界。精确标签代表最终结局;下界标签代表项目已经达到某阶段,但不代表止步于此。失败项目取它曾经到达的最高阶段。模型输出\(\hat y_i\in[0,1]\),看不到\(y_i,\tau_i\)。
临床结局分为 5 个有序层级:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
前向绝对误差损失: \(\ell_{i}= \begin{cases} \left|\hat{y}_{i}-y_{i}\right|, & \tau_{i}= \text{exact}, \\ \max \left(y_{i}-\hat{y}_{i}, 0\right), & \tau_{i}= \text{lower bound}. \end{cases}\) 精确结局对称惩罚预测偏差;下界结局,只有预测低于实际已经达到的阶段才会被惩罚,预测高于下界不会扣分。
单样本质量: \(q_i=\max\left(0,1-\ell_i\right).\) 原始总分数: \(S=\frac{1}{N}\sum_{i=1}^{N} q_i = 1-\frac{1}{N}\sum_{i=1}^{N}\ell_i.\)
归一化连续分数:使用无知识随机预测器R作为下界锚点,\(S_R=0.86925\);完美预测\(S_O=1\)。 \(S_{norm}=\frac{S-S_R}{S_O-S_R}\times 100\) \(S_{norm}=0\)等价随机猜测,100 等价完美预测。
分类准确率:把预测映射到最近层级;精确结局要求严格匹配;下界结局只要预测层级≥实际层级即判定正确。
4.2.3 Public‑100 基准结果
两组对照条件:
-
no env:纯模型,接收任务输入,输出回答;没有检索、工具、网络访问;闭卷模式。 -
with env:完全相同基础模型,可以迭代调用药物重定位专用可执行环境,提供结构化生物医学知识、文献证据、科研工具。基础模型、样例、输出格式、打分规则全部固定;两组都看不到隐藏结局。
表 7 Public‑100 公开开发集结果 | 基础模型 | 条件 | 标准化连续分数 | 原始连续分数 | 分类准确率 | |---|---|---|---|---| |GPT‑5.5|No env|53.78 ± 3.22|0.93957 ±0.00421|81.00 ±1.73 %| ||With Apodex‑env|56.30 ±1.56|0.94287 ±0.00204|83.67 ±1.15 %| || 绝对增益 |+2.52|+0.00330|+2.67pp| |GPT‑5.6‑sol|No env|54.21 ±2.20|0.94013 ±0.00287|80.67 ±1.15 %| ||With Apodex‑env|61.81 ±3.92|0.95007 ±0.00512|85.00 ±1.73 %| || 绝对增益 |+7.60|+0.00993|+4.33pp|
两套指标同时看到提升,证明结果不是归一化带来的假象。
4.2.4 HDS6 轨迹分析
使用 HDS6 刻画科学推理过程质量,不只看最终答案。HDS6 六项维度 0‑4 分:C 长链路状态一致性、E 证据可信度、A 备选假设管理、S 边界与失效推理、T 工具使用与执行状态管理、R 核验下的自我修复。0 代表缺失,1 有缺陷,2 不足,3 良好,4 优秀。
表 8 HDS6 能力分数(药物‑疾病配对) | 基础模型 | 条件 | C|E|A|S|T|R| |---|---|---|---|---|---|---|---| |GPT‑5.5|No env|1.62 ±0.21|1.52 ±0.32|2.35 ±0.65|2.72 ±0.88|1.00 ±0.00|‑| ||With Apodex‑env|2.76 ±0.72|3.10 ±0.62|2.69 ±0.64|2.96 ±0.65|3.64 ±0.69|3.45 ±0.79| || 增益 |+1.13|+1.58|+0.34|+0.24|+2.64|‑| |GPT‑5.6‑sol|No env|1.67 ±0.18|1.42 ±0.32|2.48 ±0.72|2.85 ±0.79|0.99 ±0.15|‑| ||With Apodex‑env|2.81 ±0.82|3.10 ±0.65|2.72 ±0.62|3.09 ±0.62|3.56 ±0.79|3.83 ±0.35| || 增益 |+1.14|+1.68|+0.25|+0.24|+2.57|‑|
开启环境后,提升最明显的是工具使用、证据可信度、长链路一致性;备选假设、适用边界提升幅度较小。no‑env 条件下工具分数很低,是因为根本没有可用工具,不是调用失败。两套基础模型在开启环境后,过程层面表现模式接近。修复维度在 no‑env 条件无法观测,因此不做对比。
4.2.5 重定位与制剂改造流程设计
单独评估系统输出临床可执行开发流程的能力。系统需要输出四部分结构化字段:目标人群、生物标志物策略、联合用药、制剂递送。参考值来自已注册临床试验方案。自动语义评估器对每一项 1‑5 分打分:1 无关 / 矛盾;3 方向正确但不完备;5 与关键临床内容高度吻合。
表 9 制剂改造流程设计结果,1‑5 语义打分 | 字段 | 仅大模型 | 大模型 + 上下文 | 差值∆| |---|---|---|---| |Population 人群 | 2.89|+0.89|| |Biomarker 生物标志物 | 4.00|0.00|| |Drug combination 联合用药 | 3.75|0.00|| |Formulation/delivery 制剂递送 | 4.22|0.00|| |Macro‑average 宏观平均 | 3.72|+0.22||
只有人群字段有结构化试验上下文可以补充;其余字段在两组条件下预测结果不变。增加上下文之后,人群维度大幅提升,宏观平均分由 3.72 提升至 3.94。 综上,药物重定位任务从三个互补角度评估:筛选有前景治疗候选、产出证据充分的推理、制定临床可执行开发策略。
4.3 大语言模型相关问题与消融实验
前面章节主要介绍依赖慢实验、临床证据核验的任务。本节转向另一大类重型任务:基础模型底层工程工作流,包含预训练数据整理、过滤、去重、推理确定性调试、强化学习方案搜索。这类任务需要持续工具驱动、自我修正调研,而不是单次提示推理。它的一大优势:核验器可以按需重新计算,相比生物医学环境,可以做更密集、受控的消融实验。 我们设计两层分层消融:
- 求解器配置消融
固定片段接口,改变后端调度框架、基础模型; - 片段机制消融
固定环境、求解器配置,开关内部独立机制。
评估两类片段干预:初始技能引导、提交后核验器驱动修复。这套分解,可以量化性能变化,到底来自求解器框架,还是片段内的过程引导反馈。
4.3.1 求解器配置消融
实验矩阵覆盖 11 个 LLM 环境、6 套调度框架、最多 6 个基础模型。部分调度框架与模型深度绑定:Claude Code 只能搭配 Opus;Codex CLI 只适配 GPT。剩下 DeerFlow、OpenHands、A‑Evolve、ApodexHarness 是模型无关调度框架,可以在全部模型上运行。
为了做可控对比,预先筛选 7 个诊断环境,满足三条标准:全部 4 套模型无关调度框架都可以运行;不存在大面积地板级低分;运行‑运行之间稳定性足够。
即便最强的模型‑调度框架组合,距离彻底解决该类任务,依然有很大差距。最高单模型平均得分 0.588。说明重型求解器仍存在巨大提升空间。 两个关键现象:①不同模型的 best‑cell(该模型能达到的最高分)比较接近,但平均分、失败案例数量差异巨大;说明运行稳定性、调度框架适配,相比峰值推理能力,是平均分差距的主要来源。②整体前沿区间比较窄;即便最强配置,依然有很大改进余地;调度框架优化,主要提升稳定性,而不是天花板峰值。
调度框架不存在普适最优解。固定模型,不同调度框架之间相对排名会反转。说明模型和调度框架之间存在显著交互效应。在全部六个基础模型上,四套通用调度框架平均表现排序:ApodexHarness (0.548) > A‑Evolve (0.544) > DeerFlow (0.521) > OpenHands (0.503)。
4.3.2 片段机制消融
固定调度框架、模型、环境、预算,改动单一片段级机制。对比两类干预:
- 初始技能引导
片段初始化注入通用流程指导,贯穿整条轨迹;不是针对特定实例,不含测试样例和答案。 - 核验器引导
临近提交前检查工作,返回具体问题,允许求解器改进;它和后面 4.4 节完整修复循环不同,属于轻量级环境内提示,不是完整基于整条轨迹的深度诊断系统。
表 12 片段机制消融实验结果 | 环境 | 调度框架‑模型 | 基线 | 技能引导增益 | 核验引导增益 | |---|---|---|---|---| |LLM‑pretrain‑data‑probe|Claude Code‑Opus‑4.8|0.563|‑0.045|‑| ||OpenHands‑Opus‑4.8|0.442|+0.115|+0.065| ||OpenHands‑GPT‑5.6‑sol|0.534|+0.196|+0.125| |pretrain‑data‑filter|Claude Code‑Opus‑4.8|0.485|‑0.044|‑| ||OpenHands‑Opus‑4.8|0.446|+0.042|+0.014| ||OpenHands‑GPT‑5.6‑sol|0.215|+0.327|+0.308|
观察:OpenHands 搭配 GPT‑5.6‑sol,技能引导带来最大收益;而 Claude Code‑Opus‑4.8 基线已经很高,注入通用技能之后,性能不升反降。说明技能引导的收益,高度依赖整套求解器配置;合适的技能指导,可以部分弥补调度框架的缺陷。 核验引导在全部 OpenHands 配置下,相比基线均有正向收益;即便看不到真实结果,盲态评审反馈,依然可以定位影响最终分数的缺陷。 技能引导从片段启动就塑造整条轨迹;核验引导临近提交才介入。二者收益大小随环境、模型、配置变化。不存在固定增量,完全依赖整套系统。
4.4 核验驱动的修复 Verification‑Driven Repair
过程验证输出结构化诊断,而不是仅仅输出数字。这份诊断可以送回求解器,完成「测量‑诊断‑改进」闭环,这正是发现型 AI 的核心发现循环。 HDS6 子细则打分,会记录每一项缺陷对应的轨迹引用;负载步骤分析定位出错位置。二者合成一份精简修复说明(repair note),里面写明出错步骤、目标改进等级、可执行修正建议。修复说明不会泄露最终结果、隐藏标准答案、结果分数;只指导改进过程。把修复说明插入求解器提示,在完全相同条件下重跑片段;对比修复前后轨迹打分,量化这套指导带来的效果。整套修复流程不会破坏求解器和标准答案之间的隔离。
表 13 HDS6<3 的缺陷轨迹,核验驱动修复对结果分数的改变 | 环境 | 结果分数平均变化 Δoutcome | 轨迹数量 n | 提升 | 不变 | 下降 | |---|---|---|---|---|---| |solution_verifier|+0.365|37|20|12|5| |aav_viability|+0.360|34|21|7|6| |clinical_sap_tlf|+0.271|90|41|48|1| |aav_capsid_enrichment|+0.199|40|22|5|13| |LLM‑pretrain‑data‑probe|+0.082|51|27|3|21| |LLM_rollout_verifier|+0.048|55|27|20|8| |posttrain_data_dedup|+0.040|51|26|5|20| |internal_benchmark|+0.034|28|7|19|2| |aav_sequence_design|+0.010|33|9|19|5| |pretrain_data_filter|−0.077|15|4|6|5| | 全部环境汇总 |+0.155|434|204|144|86|
对 HDS6 综合分数低于 3 的缺陷轨迹,施加修复说明,重新运行。10 个环境里面 9 个平均收益为正;全部 434 条轨迹平均结果分数提升 0.155。204 条轨迹分数提升,144 不变,86 下降。
⚠️ 注意:本实验没有设置对照组(不输入修复说明,单纯重跑同样轨迹),因此无法把提升完全和普通运行之间随机波动区分开。
4.4.1 案例:定义不完备的临床安全报告
clinical_sap_tlf 任务:基于统计分析计划 SAP,生成治疗突发不良事件 TEAE 安全统计表。SAP 本身故意写得不完整:没有定义分母用哪一类患者群体,也没有定义哪些不良事件标记需要统计。求解器必须自己做出分析决策,理想情况下,在计算之前就把决策声明写出来,这正是生物统计专家要做的判断。结果分数,既包含数值计算准确度,也包含报告的严谨性、可复现性、可追溯性。
初始运行(claude‑sonnet‑5):先计算表格,事后才补写人群选择假设;分母没有记录对应的患者 ID 列表,因此报告无法独立复现。HDS6 批评标记两处子细则缺陷:Scope 边界维度,计算完成之后才声明选择;Evidence 证据维度,分子记录患者 ID,但分母没有记录。 修复说明把这两处缺陷送回求解器。修复后运行:在计算之前就声明人群选择,分子、分母都完整记录患者 ID 列表。数值计算结果不变,但报告严谨度大幅提升。结果分数从 0.83 提升到 0.95。提升完全来自证据、可追溯维度。
4.4.2 案例:从未真正运行过的估计器
LLM‑pretrain‑data‑probe 任务:评估预训练语料库,估算高价值唯一文档数量与去重 token 总量;预算有限,只能小规模采样。任务要求使用捕获‑重捕获(capture‑recapture)方法,跨数据源重叠做估计。失败典型模式:嘴上宣称要用该方法,但实际并没有真正执行,直接写一个断言数字。
初始运行:对每个数据源只采样 30 条文档,评估高质量文档占比;之后直接断言每个数据源大约 100 条文档,把采样得到的比例乘以这个人为假设的数字,得到最终估计值 108。真实值是 1505,误差 93%。HDS6 证据维度批评:虽然嘴上提到捕获‑重捕获,但下载得到的内容哈希指纹完全没有被使用,源大小完全靠断言。 修复说明指导:利用已经下载的指纹重复信息,测量数据源真实规模。修复后的运行,使用 Chao1 估计器,根据指纹重复情况估算每个数据源真实大小,最终提交估计 2471,误差 64%,估计质量显著提升。
该案例说明:结果分数只能告诉你答案错了;而过程评审可以定位到底推理链路哪一步出问题。这正是修复可以落地的关键。
5 相关工作
知识推理基准
MMLU、BIG‑bench、AI2 Reasoning Challenge、GPQA、GSM8K、MATH、FrontierMath、Humanity’s Last Exam。这类基准对比单次输出和标准答案;不暴露工具,不记录完整推理过程。
交互式智能体基准
强化学习领域:Arcade Learning Environment、OpenAI Gym。 语言智能体交互环境:ALFWorld、WebShop、Mind2Web;代码交互 InterCode。 软件工程方向:SWE‑bench、SWE‑bench Verified。 操作系统、网页通用智能体:WebArena、OSWorld、AppWorld、GAIA、AgentBench、τ‑bench、ToolLLM、Terminal‑Bench。 科研方向:ScienceAgentBench、DiscoveryBench、ScienceWorld、LAB‑Bench。 面向现实经济价值的基准:GDPval、SWE‑Lancer、Agents’ Last Exam。
TRACES 在上述工作基础之上,增加对关键中间产物的核验,在同一套「环境‑任务‑片段」抽象下同时输出结果分数与过程质量信号,覆盖生物医学、临床、前沿模型工程多类问题。
智能体脚手架 Scaffold
提示与控制策略:ReAct、Tree of Thoughts、Reflexion、Self‑Refine;工具调用 Toolformer;多智能体 AutoGen、Voyager;软件工程智能体 SWE‑agent、OpenHands。 迭代自修正相关:CRITIC;有论文指出,没有外部反馈的纯内部自修正,经常无法提升甚至损害推理,因此本工作高度依赖核验器外部反馈。 Apodex Discovery 把调度框架 harness 看作待评估系统的一部分,而不是固定基础设施,联合评估模型 + 调度框架整套系统。
LLM 自动评估
Arena pairwise、G‑Eval、JudgeLM、Prometheus 2;CriticGPT。这类大多单轮、面向结果,很多可以看到标准答案、模型身份。而我们的盲态多智能体过程评审,每一条评判都必须引用轨迹原文;看不到最终结果,也不知道被评估系统身份。
过程监督与可验证奖励
数学任务中对比过程反馈 vs 结果反馈;Math‑Shepherd;ProcessBench。现有过程监督大多聚焦短数学推理链条。HDS6 把过程评估拓展到长链路、大量工具调用的复杂轨迹,使用面向任务定制的细则,而不是单一标量奖励。
博弈规避与基准污染
奖励黑客、基准数据污染相关文献。对应本工作设计:隐藏核验器、反博弈硬门限,防止系统靠捷径拿分。
自主科学发现
Coscientist、ChemCrow、AI co‑scientist、The AI Scientist 等自主科研智能体。它们和本工作长期目标一致:开展开放式科学发现。而 Apodex Discovery 提供现实环境、隐藏核验器、过程层面评估框架,用来度量、对比、改进这类系统,在高价值现实问题上。
6 结论
Apodex Discovery 从三方面推进面向现实重大问题的发现型 AI 构建与评估:
-
一套系统化流程,筛选高价值、客观可核验的现实问题; -
将开放式问题转化为可执行环境,完整系统可以借助数据、工具、反馈开展行动; -
HDS6 过程评估体系,当确凿结果延迟、残缺、尚不存在时,依然可以评估调研工作本身质量。
三者结合,把评估范式从 “模型有没有输出正确答案” 推进到 “求解系统是否开展一套可靠、证据充分、具备自我修正能力的调研”。同步发布 TRACES 现实基准:17 套可执行环境,覆盖 218 个片段,横跨生物医学、临床转化、前沿模型工程;其中两套环境支持完整核验‑修复循环。
初步实验证明这套评估单元的价值:
-
AAV 衣壳设计任务,领域专用环境在整套发现流水线带来收益,Apodex 在最难任务上超越已公开人类基线; -
药物重定位任务,生物医学环境让 GPT‑5.5、GPT‑5.6‑sol 标准化分数相比闭卷基线分别提升 2.5、7.6 分; -
受控消融证明:性能差异可以定位到求解系统不同组件(基础模型、调度框架、引导提示、核验驱动修复),而不是笼统归因为模型能力不足。
局限与未来拓展:当前 TRACES 初版 17 套可执行环境,来自 20 个筛选问题的子集,只是 423 个问题库的一小部分;大量环境仍在开发,未来陆续发布。过程验证同样属于早期演示,仍有空间进一步提升过程分数和结果分数对齐,拓展到更广泛任务。
7 作者贡献与致谢
再次感谢项目负责人陈天桥先生,他提出重型求解器概念,定义 HDS6 六大过程能力,主导 Apodex Discovery 整体架构。感谢他提供的远见、指导与支持,本项目才得以实现。
感谢 Yuan Cai 博士、Chengyu Fu 博士、Shiyi Zhang 博士、Harry Zhang 的讨论与贡献。
核心技术贡献者:Sheng Wang、Brian Wang、Bin Feng、Xiaoman Pan、Chenyang An、Felix Liu。 贡献者:Tangqi Fang、Gongbo Sun、Yueqi Guo、Kailong Wen、Feng Xing、Yiling Guo、Lingfeng Shen、Ning Wang、Handuo Zhang、Feng Chen、Fuchao Yang、Jiacheng Lin、Siting Li、Zixuan Liu、Xiang Wang、Chi Han、Zhenhailong Wang、Kunlun Zhu、Lawrence Zhao、Lidong Bing、David Tan、Bo An、Heng Ji。
附录 A‑D(表格、案例、补充实验)翻译省略。

