大数跨境

MetaboAnnotate:用大模型“智能体”把多个注释工具串起来的非靶向代谢组学平台

MetaboAnnotate:用大模型“智能体”把多个注释工具串起来的非靶向代谢组学平台 MetaboAI
2026-09-03
4

原文:MetaboAnnotate: An AI-powered Multiagent Framework for Integrating Annotation Tools for Untargeted Metabolomics

  Yan Zhou Chen, Brandon Mukadziwashe, Frederick Zhang, Soha HassounTufts 大学计算机科学系 化学与生物工程系)

期刊 / 类型

Analytical ChemistryACS),研究论文(Article

DOI

10.1021/acs.analchem.6c01717(收稿 2026-03-12,接收 2026-08-06

研究问题

注释工具众多但多为研究型软件:依赖复杂、接口不统一,普通用户难以整合并比较多个互补工具的结果。

解决方案

Web 平台 MetaboAnnotate:以 LLM 多智能体为编排层,用统一自然语言接口驱动 SIRIUSFLAREJESTRDiffMS,无需安装与编程。

核心结论

多工具一致性能显著降低假发现率并提升排名准确度(rank@5+);在工业化梯度粪便代谢组案例中,三工具一致时 0% 假发现率(但仅 10 例)。

 

一句话概括MetaboAnnotate 把 个代谢物注释工具包装成标准 REST API 并交给 个 LLM 智能体调度:用户用自然语言提交 MS/MS 谱,系统自动完成候选检索、参数配置、并行注释和结果汇总。在 CASMI 2016/2022 基准上,工具间一致性与更低的 FDR、更高的 Rank@K 相关;粪便代谢组数据上借助一致性筛选出高置信候选,获原研究作者确认 个合理新注释。
  

 

一、研究背景:工具越来越多,用起来越来越难

高分辨质谱产生了海量 MS/MS 谱,但准确赋名仍是瓶颈。候选方法已相当丰富(大规模谱库、机器学习模型 FLARE/JESTR/DiffMS、社区基准 CASMI 等),且捕捉谱-结构关系的互补方面本应互相印证;但许多新工具以研究型软件发布,接口非标准、依赖复杂、文档有限,实践者往往只敢用少数成熟工具。

现有主流平台(MZmineGNPSMetaboAnalyst)改善了易用性与可重复性,但都基于预定义管线与固定方法集合。与此同时,LLM 编排异构计算工具提供了新范式——从 ToolformerChemCrow 到 ReActReWOOLLMCompiler(结构化推理、多智能体协调执行)。本文把它引入代谢组学:AI 不替你做化学,而是作为编排层,协调异构算法、数据库与软件服务

本研究的三个贡献

• 提出 MetaboAnnotate——多智能体 LLM 框架,以统一自然语言界面编排多个注释工具;

• 用 CASMI 基准证明独立工具间的一致性降低假发现率、提升注释准确度,并在粪便代谢组数据上验证其实用性。

二、系统架构:四个智能体,两种用例(原图 Figure 1)

系统基于 ReWOOReasoning with Optimized Orchestration)框架,包含四个协作智能体,每个负责专门职能;与通常生成自由文本的 LLM 系统不同,每个智能体按预定义的机器可读模式输出(如 type/valid/reasonsummary/preparation_steps/annotation_stepsresponse/generated_code 等字段),以保证工作流协调与执行的可靠性。系统支持两种用例:① 处理并注释 MS/MS (请求类,需要规划与执行);② 回答关于已有注释结果的追问(提问类,访问存储结果、必要时生成并执行代码、综合回答)。

 

原图 1(论文 Figure 1):用户交互(左)与后端工作流(右)。Supervisor 把输入分类为“Request / Question”:请求(绿色箭头)交给 Planner 生成预处理 工具调用计划,Executor 预处理顺序、注释并行的策略执行并调用 Annotation Tools Hub;提问(橙色箭头)交给 Evaluator,其访问 Results、必要时生成代码(</> 图标)后给出回答。所有结果按会话持久化(见 Results 表:spec_001…spec_003diffms / flare 列)。

 

• Supervisor(系统入口):判断输入是有效注释请求、后续提问还是越界/无效查询;无效则终止对话并告知原因。

• Planner:把请求分解为可执行的端到端步骤;用户可指定工具参数(如每谱用 diffms 生成 个分子),未指定时应用预设默认参数。计划分两阶段:预处理(谱重格式化、候选检索)与注释(调用一个或多个工具)。

• Executor:执行计划。预处理按顺序(步骤间有依赖),注释按并行(工具相互独立)。作者不评估 Executor,因为它是完全确定性的、严格按计划执行。

• Evaluator:回答追问;访问存储结果、必要时生成并执行代码计算派生统计量或筛选结果,再合成上下文相关的回答。

三、输入、输出与工具集成(原图 Figure 2)

交互与数据

• 使用门槛Web 界面(hassounlab.cs.tufts.edu/MetaboAnnotate),无需安装与编程;需提供 Gemini 或 OpenAI API 密钥(免费版 Gemini 即可满足典型分析)。

• 会话:每次分析生成唯一会话 ID,交互、中间计算与结果持久化,可凭 ID 恢复继续探索。

• 输入MS/MS 谱以 MGF 提交;可选 JSON 候选文件(谱 ID → 候选 SMILES);未提供时按默认检索(分子式或前体质量)从整合的 200 万以上化合物NIST23MassSpecGymGNPS MULTIPLEXCOCONUTHMDB)中检索候选。架构与格式无关,可扩展 .msp / .txt 等。

• 输出:可下载 CSV——每行含谱 ID、所用工具、候选 SMILES、候选排名;标准化格式便于下游分析与跨工具比较。

• 工具层Annotation Tools Hub 抽象层):四个工具各自封装为独立服务——SIRIUS(与数据库无关的结构信息工具)、JESTR(联合嵌入空间对候选分子排序)、FLARE(谱-分子表征的细粒度学习对齐,来自本组)、DiffMS(以质谱为条件的扩散生成模型)。全部以 Flask 标准化 REST API 暴露,工具间不共享状态、互不干扰。

 

原图 2(论文 Figure 2):Web 用户界面。(a) 用户与智能体的对话界面(实时报告工作流状态);(b) 单个工具运行的任务进度追踪器;(c) 各工具的排名输出。平台另有数据探索模块(筛选、排序、跨工具比较、共识排名)与 FLARE 风格的峰-子结构可视化。

 

四、系统自身评测:智能体可靠吗?

共人工整理69 条查询33 条注释请求、33 条分析性问题、条越界查询),覆盖所有支持的工具、参数与配置。用 GPT-5-nano 评测(换成其他 OpenAI 或 Gemini 模型未见显著差异,作者归因于各智能体任务相对简单且严格遵循预定义输出格式):

智能体

样本量

结果

Supervisor(分类准确率)

69 

误判 2 条:①“用 MADGEN 显示挑战 25 的最佳分子”——正确识别为提问但未查出 MADGEN 不受支持;一句越界问句因疑问句形式被归为提问。

Planner(计划质量 0–3 分)

30 条请求

全部可执行、有效——没有因无效/不完整计划导致的失败。

Evaluator(回答质量 0–5 分)

30 条问题

变异最大:个最低分(分)中 个源于生成不可执行代码;分多为歧义问题(有效但解读不同);整体过半产生连贯且近似准确的回答。

 

测评还显示一个有趣的模式:评级分数时常取决于裁判 LLM”的严格程度——3–4 分多源于裁判期待了并未明确要求的数值输出。这提醒我们,用 LLM 评价 LLM 输出时,评分标准本身的稳定性值得关注。

为实现这样的可靠性,作者采用了一组提示工程策略:每个提示以清晰的角色定义与任务描述开头、要点式指令、关键指令用 * 强调、指定输出结构并给出示例——据作者称,这些策略提升了准确率、满意度与可重复性并降低幻觉。

给使用者的两条实操建议① 使用明确的领域词(用 工具 MADGEN”,而不是用 MADGEN”;写明 toolspectrum_id 等)帮助 Evaluator 关联工具名、区分谱 ID② 对可能有多种合理解释的复杂问题,显式说明评估策略——例如问哪些工具最常一致时,明确一致性度量(Jaccard@10、排名 Pearson 相关、top-1 一致)。这也是与 LLM 驱动多智能体系统交互时的一般经验。
  

 

一个重要前提:本文不评估注释工具本身的输出质量——假定有效输入 → 工具行为正确,因为 MetaboAnnotate 只是用轻量 API 包装器对接现有工具,不修改其实现。换句话说,本文评估的是编排共识策略,不是各工具的算法性能。

 

五、CASMI 基准:多工具一致性确实降低假发现率(原图 Figure 3)

评测数据:CASMI 2016208 张谱,正离子,有预定义候选列表)与 CASMI 2022500 张谱,正负离子,无候选列表),覆盖/无候选列表两种典型场景。参与排名比较的为 FLAREJESTRSIRIUSDiffMS 是生成模型、不参与。

 

原图 3(论文 Figure 3):(a) 智能体评测分数分布(Supervisor 67/69 满分;Planner 30/30 满分;Evaluator 分布最分散且出现 分);(b)(c) CASMI16 / CASMI22 各工具及多工具一致组合的正确(绿)与错误(粉)注释数——灰点=该工具参与,黑点=工具间一致;(d) 各组合的假发现率——JESTR 单独最高,S+F 与 J+F 组合显著左移;(e)(f) Rank@1/5/10/20——共识 RRF(粉)在 rank@5 以后优于任何单工具。

 

• 假发现率(FDR,错误注释占比):单工具总体正确注释更多,但错误注释也多 2–3 ;要求两个及以上工具一致,错误注释数量大幅下降,FDR 显著降低(图 3d——这是覆盖(coverage)与准确性之间的经典权衡。

• 共识排名(RRF,加权倒数排名融合)

RRF(c) = Σt∈T wt · 1 / rankt(c)  T = {FLARE, JESTR, SIRIUS},权重 w = SIRIUS 3 : FLARE 2 : JESTR 1

 

权重依据工具成熟度与经验性能设定(SIRIUS 训练数据更大更多样;FLARE 在 MassSpecGym 上优于 JESTR);候选缺席某工具则不贡献该工具的分数。

• Rank@Kk ∈ {1,5,10,20}:两个数据集上 RRF 在 rank@5 及以后一致优于单工具。CASMI 2016 中 RRF 的 rank@1 输给 FLARE 与 SIRIUS——共识被明显更弱的 JESTR 拖累(共识不是免费午餐);CASMI 2022 中工具性能更接近,共识更常把正确分子排到第一。

• 务实卖点:这些收益只用了一个简单的、与工具无关的共识策略,无需重训模型或调工具参数;传统跑多工具需大量搭建与算力投入,MetaboAnnotate 让它既可行又可扩展

六、粪便代谢组案例:把共识用到真实数据上(原图 Figure 4)

应用对象是此前发表的人类粪便样本研究:样本来自不同地理区域,鉴定出377 个随工业化梯度(城市工业 → 乡村工业 → 乡村传统 → 封闭传统)显著变化的代谢特征——粪便代谢谱反映饮食、宿主-微生物互作与环境暴露,注释置信度直接决定生物学解释的可信度。

 

原图 4(论文 Figure 4):(a) 各工具恢复特征的 Upset 图;(b) 基于两工具或以上工具 top-1 一致的正确/错误注释计数——最右列是所有任意两工具以上一致的情况;(c) 一个此前未注释特征的可信候选代谢物(结合型氨基酸类结构);(d) 该代谢物在四个工业化等级中的标准化峰面积——封闭传统人群显著更高。

 

1. 基准子集377 个特征中 217 个有可映射到有效 SMILES 的先前注释,作为定量参照。三个工具共同恢复了 70 代谢物(总体准确率32.3%;若目标结构在候选集中则为81.4%)。

2. 候选检索上限217 个参照特征中仅 86 个(39.6%)的目标结构出现在检索到的候选集中——这是检索驱动方法在本分析中的准确率上限。作者强调它取决于数据集组成与候选空间结构,不是 MetaboAnnotate 或 ML 方法的通用性能天花板。

3. 一致性的价值:两工具一致的 49 例中 例错误(16.3% FDR);三工具一致的 10 例 错误(0% FDR——但作者提醒样本量小,需谨慎解读。

4. 新注释挖掘:其余 113 个原本未注释的差异特征中,41 个获得两工具以上一致,个三工具全一致。原研究通讯作者复核后认为 5/6 不太可能是粪便中的真实代谢物,仅 个合理——3-甲基-2-[[4-甲基-2-[(2,3,4,5-四羟基氧杂环-2-)甲基氨基]戊酰基]氨基]戊酸(一种结合型代谢物):在封闭传统环境中显著高于其他三组。作者强调结合型代谢物仍是快速演化的领域,需正交实验验证才能最终确定。

七、结论、局限与延伸思考

作者结论

MetaboAnnotate 把自然语言查询转化为可执行工作流,无需本地安装与编程即可调用并比较互补注释方法;它把多工具系统化比较从高成本实验变成常规操作——独立工具一致性与降低的 FDR、提升的准确度相关。

局限性(作者自述)

• 为保持受控执行,对话功能被有意限制;每个工具只暴露了部分可配置参数;未来将扩大参数控制、纳入更多注释方法、提升工作流可靠性。

值得欣赏的设计选择与需要注意的点

• 抽象层(Annotation Tools Hub:工具是独立 API 服务、不共享状态,新增工具只需实现标准输入输出——平台不会随工具迭代而过时;结构化智能体输出(机器可读 schema)解释了为什么换模型性能差异不大;会话持久化让分析可复现、可追问。

• 需要留意39.6% 是候选检索导致的准确率上限;0% FDR 仅基于 10 例(作者也要求谨慎);FDR 依赖基准真值69 条查询、个工具、个基准集,规模普适性仍待检验。

跨文献视角:与“结构—谱保真度”研究互为表里


    同期发表的 Uritboonthai 等(2026)用 7,700 万对化合物量化了 谱相似度的概率性:同式候选空间里真实近同类似物只约占 1%,即使 27 倍富集,修改余弦 ≥0.7 的接受对仍有 72.9% 假发现率。两篇论文共同指向:单一证据源的像 ≠ ,多工具一致性与校准置信度是把概率性证据变可靠的基本手段MetaboAnnotate 恰好提供了互补证据的低门槛实现,呼应蛋白质组学用 target-decoy 把谱相似度转化为校准 FDR 的路径。
  

 

关键数字速览

4

集成的注释工具(Hub 架构)

69 条

系统评测查询(误判 2 条)

3:2:1

RRF 权重(SIRIUS:FLARE:JESTR)

16.3%→0%

→三工具一致的 FDR

39.6%

目标结构入候选集比例(上限)

81.4%

目标在候选集内时的注释准确率

200 万+

候选检索化合物库条目

1 例

人工确认的合理新注释

 

本文档基于原文(Anal. Chem. 2026, DOI 10.1021/acs.analchem.6c01717)撰写;引用的 幅正文插图(Figure 1–4)为从原文 PDF 提取的原图,仅供学习交流,版权归原文作者与 ACS 所有。工具描述基于论文正文与引文信息(详见原文 Supporting Information S4)。

 

 

【声明】内容源于网络
0
0
MetaboAI
中国农科院基因组所纪宏超课题组公众号,更名MetaboAI,将继续关注化学计量学,生物信息学和人工智能,在计算化学生物学,尤其是代谢组学领域的发展动态。
内容 95
粉丝 0
MetaboAI 中国农科院基因组所纪宏超课题组公众号,更名MetaboAI,将继续关注化学计量学,生物信息学和人工智能,在计算化学生物学,尤其是代谢组学领域的发展动态。
总阅读2.0k
粉丝0
内容95