编者摘要:Apodex 1.1 是面向复杂科研与专业工作的智能体模型,核心是把 AI 推理从生成报告延伸至真实任务全流程执行。它提出完成复杂可验证工作需要六大能力,依托环境规模化与智能体协同规模化两条技术路线,基于 AgentOS 执行底座,搭配 PIVOT‑RL 长时序强化学习训练。产品包含完整版在线工作台与 35B 参数可本地部署的 Apodex 1.1 Mini,开源 FrontierAgent 执行框架。
核心功能有:全链路数据处理与自适应故障恢复、用户任务中途介入、任务进度可视化、异步智能体团队并行作业、Statement Review 关键论断独立复核。同时支持 AI4AI 自训练,可自动迭代训练小模型。在法律、金融、分子模拟科研场景完成真实案例验证。未来将打造 Heavy‑Duty Solver 重型求解器,开发原生预训练的 Apodex 2.0。评测显示其在科研、金融、专业工作达到第一梯队水平。
10 个关键问题问与答
2026 年 8 月 24 日
深度研究能力已经让 AI 能够检索海量资料、整理信息并输出结构化报告。但真正的研究工作,往往是在报告生成之后才正式开启。原始输入资料可能包含数十篇论文、实验记录、数据表、图像以及各类专业格式文件。研究人员需要完成数据清洗、方法选型、代码编写、分析运算以及结果解读等一系列工作。单一任务通常由多项相互依存的环节构成,执行方案还需要根据中间产出持续动态调整。最终输出的结论不仅要行文通顺,更要能够回溯原始数据、代码与证据,经得起核验。
Apodex 1.1 正是为解决这一痛点而生。本次版本更新的核心在于模型推理能力本身的升级。检索、文件处理、代码执行与工具调用并非独立于推理之外的附加功能,而是推理落地到真实场景的实现载体。当推理需要依据数据做出判断时,模型便读取文件、运行代码;当推理需要验证某个前提假设时,模型便发起检索核验。整套执行逻辑围绕推理能力完成重构。Apodex 不再将生成报告视作任务终点,而是致力于打造一套在线工作台,能够和研究人员协同完成复杂任务的全流程。
能够输出正确答案,和能够完整、可验证地做完一整套工作,是两种截然不同的能力。后者要求模型具备六项核心素养:精准理解任务的真实目标;在真实的文件、代码与工具环境中开展作业;在长链路任务过程中维护并更新自身状态;处理执行过程中不断涌现的新增反馈;遭遇中途故障时自动恢复,而非全盘推倒重来;保障最终交付成果经得起审查。以上六项能力共同构成一套完整的能力单元,也是 Apodex 1.1 着力搭建的能力底座。
简言之:Apodex 1.1 将推理从报告生成环节延伸至真实任务的完整执行流程。
本次发布包含 Apodex 1.1 模型,以及由其驱动的在线工作台。研究人员可以在单次长周期任务内整合文件处理、信息检索、代码运行与智能体团队协作,把推理过程转化为可查看、可复用的工作成果。同时,我们也将这套能力拓展至本地与开源生态:FrontierAgent 为文件读写、检索、代码运行、智能体团队提供执行框架;35B 参数的 Apodex 1.1 mini 支持本地部署。完整版模型承载 Apodex 1.1 的全部能力;Mini 版本与执行框架则可供开发者在自有环境运行、管控、拓展这套面向复杂工作的范式。
我们沿着两条互补的路径迭代这套能力。第一条是环境规模化:拓展模型可学习、可交互的文件、检索、代码等各类可执行环境。第二条是智能体协同规模化:提升任务拆解、跨多智能体、多分支、跨时间维度的调度、整合与重构能力。其底层全部以推理为核心:在复杂文件与数据环境中调用各类工具时,保障推理不间断运行,这正是环境规模化的直接体现;让推理拆分为多条并行路径,同时维持整体协同,由此诞生异步智能体团队,该行为通过智能体协同规模化训练习得;支持用户在推理任意阶段介入并调整方向;完整可视化推理链路与任务进度;关键结论交付前经过独立校验,即我们所说的陈述复核(Statement Review)。与此同时,模型本身的推理能力也完成系统性升级,相关细节将在下文技术章节展开。
值得一提的是,下一代模型的预训练工作已经启动,本次版本沉淀的大量工程与数据成果,将直接复用在后续迭代版本中。
真实研究任务不止需要一份报告
传统深度搜索产品擅长处理网页与文本内容,但研究任务的关键证据往往存储于 CSV、Excel、PDF、图片、实验数据以及各类领域专属格式文件。仅靠文献摘要无法完成完整研究。系统还需要理解多份文件之间的关联关系,匹配适配任务的分析方法,编写并运行分析代码,校验中间结果,在出现问题时修正方案,最终实现结论到原始数据、处理步骤、产出物的完整溯源。
Apodex 1.1 并不会通过简化问题、转化为问答来回避复杂数据,而是尽可能在真实文件环境中走完从输入到成果交付的全流程。一个典型案例是分析异基因移植后 EB 病毒再激活患者群体中,EASIX 指标对总生存期的预后影响。该任务需要读取原始数据表与数据字典,完成数据核查清洗,选定合适的统计方法,运行生存分析代码,生成 KM 生存曲线与统计表格,输出可溯源核验的结论。若过程中出现数据缺失、格式异常或者假设失效,系统会说明调整逻辑并继续执行,而非卡死报错或给出模棱两可的结果。
材料科学、生物信息学、计算药物设计领域也存在大量同类场景:粉末 X 射线衍射的索引与晶胞精修、GLUT3 蛋白与小分子的批量盲对接、镁合金纳米压痕数据的曲线拟合等。这类任务的共性在于,输入本身就是专业数据集,而非文字描述;模型必须真正在文件‑代码环境内开展作业,而不是仅在外围推演、直接输出结论。
用户可在执行过程中随时介入干预
复杂研究任务很难在初始指令中一次性定义全部细节。新增数据可能推翻原有假设,早期结果会暴露输入本身存在的问题,研究人员也可能中途收窄或扩大分析范围。过去的常规做法是等待全部结果输出后重新发起一轮任务,长周期场景下成本会急剧攀升。
Apodex 1.1 将任务中途的用户介入视作任务本身的一部分。系统会理解新增需求,判断哪些已完成的中间结果依旧有效,更新后续执行规划,基于现有状态继续推进,而不是丢弃全部已有工作从头再来。其价值不只是 “支持随时中断”,更重要的是,研究人员可以在长任务运行期间把控整体方向,而不是提交任务之后只能被动等待。
该能力在多文件、多轮复核场景下尤为实用。例如审阅多份合同、开展尽职调查时,用户常会在分析中途新增文件或者更新审查标准。此时系统会保留依旧有效的分析结论,重新规划受影响的环节,避免整体任务推倒重来。
复杂任务的拆解与进度全程透明可见
当智能体需要运行数十分钟甚至更久时,仅展示加载动画无法建立用户信任。用户需要了解系统计划完成哪些子任务、当前正在处理什么、哪些步骤已经完成及其产出、哪些步骤失败 / 重试 / 变更方向,以及哪些节点需要用户确认。
任务过程可视化,并非把模型冗长原始的内部思考全部展示出来,而是向用户提供可读、可操作的任务状态:包含规划方案、执行步骤、产出物、依赖关系、异常信息与后续行动。这套状态由 AgentOS 在后台持续维护;但任务规划本身,以及规划的动态变更,由模型在执行过程中自主推导生成,而非固化的工作流模板。这对于长周期任务至关重要:任务完成率不能代表全部,任务故障恢复能力、规划与实际执行的匹配度、用户定位问题的耗时,同样十分关键。
异步智能体团队推动复杂任务持续推进
在深度探索(Deep Discover)模式下,Apodex 1.1 会根据任务动态组建异步智能体团队。这并非预先编写好的编排脚本;而是依托智能体协同规模化训练习得的能力:模型自主判断任务是否可拆解、拆解方式、分配多少子智能体,并且在执行过程中持续决定何时汇总结果、何时调整方案。多个子智能体并行探索不同子任务、证据来源或者候选假设,持续向主任务回传中间结果,不必等待所有分支全部结束再做处理。
复杂研究任务中很多环节可以并行推进。例如一个智能体专注梳理文献证据,另一个负责数据分析,第三个校验方法、寻找反例。传统同步工作流往往需要等待某一阶段或者全部分支完成才能继续;一旦某一分支耗时过久或者失败,整体任务就容易陷入停滞。
异步智能体团队的核心,不只是同时运行更多智能体,而是保障结果、反馈与决策在任务中持续流转。多项独立子任务同步开展,能够切实缩短复杂任务整体耗时。子智能体产出有效发现后,主任务即可立刻吸收信息、更新全局状态,无需等待其余分支执行完毕。当获取新证据,系统可以重排任务优先级、新增分支或者终止低价值路径。某个子智能体卡顿或失败时,其余分支仍可持续产出,已完成的工作会被保留,用于后续规划。用户也可以在任务运行的任意时刻查看进度、上传文件、补充背景信息、提出新需求,要求系统深化、暂停或终止某条分析路径。
这套异步架构带来双重价值:一方面并行协作提升任务速度与效率;另一方面,在模型、子智能体与用户之间建立持续反馈闭环,让高耗时的复杂工作保持可见、可控、可调整,而不是提交之后只能等待的黑盒。
关键论断接受独立复核
分析报告中不同语句的权重并不相同。真正需要严格审查的是左右最终判断的核心论断:一份数据是否真的支撑统计显著性结论;引用文献是否和报告转述内容一致;计算结果是否和代码实际输出匹配;某一项推论是已证实事实、合理猜想,还是尚且无法确认的观点。
陈述复核(Statement Review)将内容生成与结果校验拆分为两个独立环节,核心论断在交付用户前接受独立核查。这不代表系统输出永远正确,而是让证据链条、潜在矛盾点与不确定性清晰可查。当分析遇到证据不足、引文不符、计算结果与预期冲突等情况,系统会标记问题,展示修正过程,并完整留存复核记录。
统一执行框架支撑两大规模化方向
推理能力与执行逻辑升级的背后,是两条相辅相成的规模化路径,以及支撑二者的统一执行底座。
第一条路径是面向真实智能体场景的任务流水线与环境规模化。升级不只是扩充代码相关训练数据,更关键的是围绕复杂文件处理、代码执行、工具调用、多步骤任务推进等真实场景,构建海量高质量训练任务,覆盖检索、文件处理、工具调用等多种环境,规模达数千万任务样本。以此全面提升通用智能体能力、科研能力、代码能力与多智能体协作水平。与此同时,我们持续优化本地检索引擎与知识图谱,为跨论文、跨数据源的研究任务筑牢底层基础。
第二条路径即智能体协同规模化,也就是上文介绍的智能体团队能力:模型学习拆解任务、组织子智能体,持续吸收整合多分支的输出结果。
环境规模化与智能体协同规模化,必须依托同一套执行底座才能落地,我们将其命名为 AgentOS。AgentOS 负责维护单次任务执行过程中的工具调用、文件状态、任务进度;管控子智能体的创建、调度与生命周期,并提供统一校验机制。两种规模化路径并非简单拼接的独立功能,它们共享同一运行时,这也是文件环境能力提升与智能体团队协同能力,能够在同一套训练与评估体系中同步迭代的根本原因。
面向长周期任务的强化学习
以上全部以推理为核心的能力,最终都依赖模型在长时序任务中维持稳定推理表现。环境规模化与智能体协同规模化提供更丰富的环境与任务结构;而训练的作用,是把这些特性内化为模型自身行为。我们结合监督微调(SFT)与智能体强化学习:监督微调赋予模型工具调用、任务拆解、多智能体协同的基础行为范式;智能体强化学习则基于真实执行与协同轨迹持续打磨,让工具使用、故障恢复、任务交付、智能体团队协作成为模型习得的原生行为,而非外部编排带来的效果。Apodex 1.1 的强化学习专为长时序智能体任务设计,核心目标是强化模型在文件、代码、检索环境中持续推理与作业的能力。
文件、代码、检索、多智能体协作分别对应不同交互模式、执行成本、轨迹长度与故障模式,一项成功任务往往需要融合多项能力。由此带来核心算法难题:长任务最终结果仅能提供粗粒度监督信号,如何让模型聚焦学习那些真正改变任务走向的关键决策。我们提出 PIVOT‑RL 来解决该问题:训练不再对整条轨迹一概而论,而是围绕改变任务走向的关键决策点开展学习。
长时序任务的最终结果通常只能提供粗粒度监督。一条成功轨迹中,依然可能存在低效、证据薄弱的中间决策;而失败轨迹中,前期也会产出大量有效工作。PIVOT‑RL 采用事后轨迹定位机制,对数十万条训练轨迹与问题做回溯分析,识别关键决策拐点:也就是模型开始采用无效策略、证据不足、工具误用、未能修正错误假设的节点。在每一个拐点,保留此前正确的执行前置片段,构建局部接续任务,附带简短修正提示。该提示仅在训练阶段提供方向引导,不作为预测目标,推理阶段不会出现。针对有状态任务,我们还会还原对应的可执行环境状态。训练过程中将这类局部接续样本与完整无提示任务混合输入,让模型在高频出错节点高效学习,同时保留独立完成完整任务的能力。
局部轨迹样本与完整无提示任务共同构成强化学习训练方案。这使得模型能够高效掌握典型故障模式,推理阶段依旧可以独立完成完整任务。PIVOT‑RL 将长轨迹的粗粒度结果,转化为关键决策点上的局部学习信号,提升模型在复杂可执行环境下的实际作业能力。对应的规模化效果将在结果部分展示,更详尽的训练细节将在后续技术文档中披露。
AI4AI:让模型参与其他模型的训练
apodex.ai / AI4AI
Apodex 1.1 具备的持续执行、文件处理、工具调用能力,除了服务用户任务之外,还可以反哺模型训练。其中一个应用场景是将 Apodex 1.1 作为训练导师:无需人工参与数据采集、标注、质量审核,也不依赖其他高性能模型,自动生成问题、筛选有效执行轨迹、运行评估、迭代优化,帮助更小参数的模型习得新能力。
我们借助这套流水线训练 Qwen3.5‑0.8B,使其掌握智能体任务中的检索工具与权威数据库调用能力。评测覆盖三类任务:临床试验与药物信息检索、蛋白结构数据库查询、蛋白序列与功能注释查询,共计 200 道测试题。经过 10 轮自动化迭代,该小模型综合得分由 51.0% 提升至 56.0%。整个流程中,Apodex 1.1 同时承担出题人、轨迹筛选器、训练进度评估者的角色,形成一套无需人工标注的能力自提升闭环。这也为 “实际作业能力” 提供新的理解视角:具备稳定作业能力的模型,不止可以替人完成任务,还可以把自身能力转化为训练其他模型的生产要素。
Apodex 1.1 模型:面向复杂工作的在线工作台
本次主要发布完整版 Apodex 1.1 模型,以及由其驱动的复杂工作在线工作台。用户可以上传论文、数据集、表格、图片或代码,启动长周期任务,让模型完成检索、文件处理、代码运行、方案迭代、智能体团队协同,输出可供审查的成果物。工作台并非依附模型的独立产品,而是依托环境规模化、智能体协同规模化、统一执行框架,将主模型实际作业能力落地交付的载体。
评测结果显示,整套模型‑系统栈,在复杂专业工作、金融、科研任务上跻身当前智能体系统第一梯队,同时在通用推理、深度检索、数学、代码领域保持全面能力。ReAct 范式已经体现出优秀的底层作业策略;智能体团队则可以根据任务需求调度更多计算资源,持续带来性能增益:主模型保障任务持续运行,协同系统按需调度更多工作单元。
Apodex 1.1 Mini:高能力密度,支持本地部署
Apodex 1.1 mini 是本次版本在模型效率层面的重要成果。在专业工作、金融、科研任务上,它达到部分前沿系统的性能区间;相较于 Apodex 1.0 mini,重叠任务上性能提升显著,智能体团队协同还能带来进一步增益。由于部分商业系统并未公开参数量,我们不做无依据的规模对比。核心结论是:公开参数量为 35B 的该模型,能够在复杂工作评测基准中和前沿系统同台竞争。
依托底层 ReAct 能力叠加智能体团队带来的增益,Apodex 1.1 mini 可配合 FrontierAgent 执行框架,部署为本地 ReAct 模式或智能体团队系统,将文件、检索、代码执行、任务状态、成果产出整合至同一工作流。数学、代码、深度检索的评测结果进一步证明,这并非针对少数专业基准的专项优化,而是一套跨多类任务通用的作业策略。
我们同步构建 FrontierSearchBench 与 FrontierResearchBench 两套基准,分别用于结构化证据获取与端到端科研任务评测。专门的基准介绍博客会详细说明任务设计、评测方法、基线与开源发布计划。
从推理走向完整任务闭环
文件与数据环境下的持续作业、任务中途用户干预、任务流程可视化、异步智能体团队、陈述复核,并非推理之外的零散独立功能,而是推理向外延伸到真实任务的不同表现形式。要让模型推理能够走完复杂文件与数据链路,就需要不间断调用工具;当推理链路变长,研究者需要清晰掌握现状,随时介入调整;当推理任务可以拆分为多条并行探索路径,就诞生异步智能体团队;推理结论交付给用户之前,还要经过陈述复核的独立校验。以上环节共同构成从启动到交付的完整复杂任务闭环。
即刻体验
Apodex 1.1 现已上线网页端。在线工作台由完整版 Apodex 1.1 模型驱动,面向需要文件处理、检索、代码运行、智能体团队协同、持续产出成果的复杂任务。裸模型接口也将陆续登陆主流 API 平台。与此同时,35B Mini 版本与开源 FrontierAgent 框架提供本地化方案:开发者可在自有环境运行 ReAct 或智能体团队模式,将这套复杂工作能力集成进现有系统。模型权重、技术报告、开发者文档正在筹备中。
真正的研究工作从来无法单靠搜索完成。它需要处理海量文献与数据,走完完整长推理链路,产出经得起检验的证据。Apodex 1.1 是我们朝该方向迈出的一步。我们会持续投入文件环境、工具链、智能体协同方向的研发,完善这套在线研究工作台。欢迎广大科研人员与专业用户使用真实业务场景进行测试,你的反馈将直接驱动下一轮迭代。
除网页应用外,我们开源了智能体框架与终端产品 FrontierAgent(https://github.com/ApodexAI/FrontierAgent)。原生支持命令行 TUI 交互,提供两种模式:ReAct 模式,单个智能体串行完成研究与文件任务;智能体团队模式,协调器拆解任务,调度多个子智能体并行执行。在 macOS 与 Linux 环境下单命令开箱即用,无需预安装依赖,也不强制依赖 Docker。若检测到 Docker 环境,会启用容器实现更强的执行隔离;无 Docker 时自动切换原生本地运行环境,依旧流畅可用。希望这套单机开箱即用的执行框架,帮助更多开发者直接在本地终端调用 Apodex 的推理能力。
真实业务案例
案例一:法律 —— 优先受偿债务风险评估
某企业破产追回案件,核心诉求:企业破产前向某债权人支付的六笔款项中,破产管理人实际可追回的金额为多少?债权人可以提出哪些抗辩来降低追回数额? 读取案件材料后,Apodex 1.1 逐笔还原每一笔付款的时间、付款条款、回款记录,权衡正常业务流程、同步交换、后续新价值等多项法律规则之间的相互作用,计算得出潜在追偿金额 55 万美元,与参考答案保持一致。模型进一步给出 17.5 万‑35 万美元的和解区间、关键谈判事实,输出可直接交付客户的法律备忘录,完成事实梳理、法律推理、金额计算、谈判建议到最终文档交付的完整链路。
案例二:金融 —— 复杂金融工具与会计判断
跨境外汇风险管理任务,核心诉求:面对汇率波动,企业应当选择何种期权或组合对冲结构管控风险;各结构成本如何;在哪些汇率点位产生盈亏;能否获得更有利的对冲会计处理。 Apodex 1.1 准确计算不同结构的期权权利金、五档结算汇率下的收益情况,算出组合对冲净成本 760 万美元、盈亏平衡点汇率 1.1172。同时识别出 CFO 原本关于会计处理的底层假设存在错误。模型没有顺着错误假设继续运算,而是依据 ASC 815 准则重新推导三类结构的会计影响,说明其对损益、其他综合收益、累计汇兑调整以及后续重分类风险带来的影响,输出 199 词的专业备忘录,完整复现金融计算、会计判断、识别错误前提、限定格式输出的全流程。
案例三:科研级任务
分子动力学建模任务,核心目标:基于真实蛋白三维结构,自动构建可用于后续仿真的计算体系。 读取 7M6J 蛋白结构后,Apodex 1.1 选用 Martini 3 粗粒化方法完成结构转换,生成力场拓扑文件;复制三份蛋白,添加水分子与生理浓度盐离子,搭建完整 GROMACS 仿真体系。执行过程中,模型保证蛋白链、拓扑文件、分子数量、坐标顺序全部相互匹配,并根据实际运行结果调整能量最小化参数。最终构建包含 69652 个仿真位点的体系,完成能量最小化;输出的全部输入文件、结构文件、日志、可视化结果均可直接用于后续仿真。该任务并非简单解释仿真方法,而是真正把蛋白结构转化为一套可运行、可校验、可复用的科研计算环境。
未来展望
我们的长期目标是打造重型求解器(Heavy‑Duty Solver, HDS):一套能够承接越来越复杂的长周期任务,同时保障端到端结果可核验的系统。Apodex 1.1 是通往该目标的其中一步。持续工具调用、自我修复、多方案权衡、长时序一致性、证据驱动推理,这些能力很难仅靠后训练完成。因此,下一代 Apodex 2.0 将从预训练阶段开始全新搭建:面向重型求解器能力做端到端原生预训练,以自研发现式 AI 评测基准 TRACES 作为评估标尺。更多细节后续公布。

