大数跨境

Anal. Chem.|MS2LLM:大语言模型能否将 MS/MS 翻译为分子描述?

Anal. Chem.|MS2LLM:大语言模型能否将 MS/MS 翻译为分子描述? MetaboAI
2026-07-17
8
导读:在代谢组学和天然产物研究中,一张 MS/MS 谱图就像分子碰撞后留下的一组“碎片线索”。



在代谢组学和天然产物研究中,一张 MS/MS 谱图就像分子碰撞后留下的一组“碎片线索”。研究人员希望根据这些碎片判断分子结构,但现实中,大量未知化合物并未被收录在现有数据库中。当数据库里找不到完全匹配的答案时,我们还能从谱图中读出什么?
最近,我们尝试换一种思路:

不要求模型一步给出唯一结构,而是先让大语言模型描述这个分子可能具有怎样的骨架、官能团和化学类别。

为什么未知化合物仍然难以鉴定?
目前,MS/MS 解析主要依赖谱图库匹配、结构数据库检索或候选结构排序。研究人员通常先从数据库中寻找可能的候选分子,再判断哪个候选与实验谱图最接近。这种方法对已知化合物较为有效,但对于数据库外的新化合物,往往只能得到相似候选,而不能直接回答“这个分子究竟具有哪些结构特征”。
MS2LLM 不首先追求唯一结构,而是尝试恢复更稳健、更可解释的分子语义。

把质谱解析变成一项“翻译任务”
MS2LLM 将 MS/MS 谱图、前体离子、分子式和相似分子信息统一转化为大语言模型可以处理的文本序列。模型经过指令微调后,学习从碎片峰和辅助化学信息中推断分子的整体骨架、局部官能团和化学类别。

图 1. MS2LLM 的示意图


输入

  • MS/MS 碎片峰
  • 前体离子
  • 分子式
  • DeepMASS相似分子

模型

  • ChemDFM-v1.5-8B
  • LoRA 指令微调

输出

  • 简化结构
  • 分子特征
  • 化学分类


MS2LLM表现如何?

  • 化学分类方面:

MS2LLM分别在59个Superclass和225个Class 两个层级上,与CANOPUS、GPT-4o、binning+MLP 和 Spec2Vec+MLP 等方法进行了比较。结果显示,在Superclass层级,MS2LLM在Micro-F1、Macro-F1、Weighted-F1、Mean Jaccard和Subset Accuracy五项指标上均取得最佳表现;在更具挑战性的 Class 层级,MS2LLM 同样在五项指标中的四项保持领先。尽管细粒度分类中所有方法的性能都有所下降,但 MS2LLM 仍表现出更强的整体分类准确性和多标签恢复能力,说明经过质谱领域微调后,模型能够较好地从MS/MS谱图中识别分子的化学类别。

  • 分子描述方面:

    在分子描述任务中,MS2LLM 需要根据谱图生成分子的简化结构描述和分子特征描述,并与GPT-4o、DeepSeek-R1-Distill-Qwen-32B和Qwen2.5-32B 等通用大语言模型进行比较。除 Sentence-BERT 相似度、BERTScore、ROUGE 和 TF-IDF 相似度等文本评价指标外,本研究还引入了面向化学概念的 Concept F1。该指标从生成描述和参考描述中提取官能团、骨架与环系、糖基化特征、杂原子以及理化性质与反应性等关键概念,并同时评价这些概念的预测准确性和覆盖完整性。结果表明,MS2LLM 在多数评价指标上整体取得最佳表现,生成内容与参考描述在整体语义和关键化学概念上更加一致,说明其能够更具体地恢复分子骨架、官能团和局部结构特征。


消融实验


注:图中结果以完整模型的性能归一化为100%,表示不同消融设置下的相对性能变化,并非模型的绝对准确率。

消融实验结果表明,完整模型在化学分类和分子描述两项任务中均取得最佳表现,说明 MS/MS 谱图、分子式和相似分子信息之间具有明显的互补作用。去除分子式或相似分子后,模型性能均出现下降,其中分子式的缺失对化学分类影响更明显,表明其能够为元素组成和结构空间提供关键约束;相似分子则为化学类别判断提供了重要先验。值得注意的是,仅使用谱图时,模型在分子描述任务中仍保留了较高性能,说明 MS2LLM 能够直接从碎片峰中学习分子结构语义,而不是简单复制检索到的邻近分子信息。总体而言,完整模型通过整合直接实验依据、组成约束和结构先验,实现了更准确、稳定的质谱解析。


局限性与展望

MS2LLM 目前仍不能直接确定唯一、完整的分子结构,也无法保证准确区分所有同分异构体、确定具体取代位置。其预测结果还会受到碎片信息不足、谱图质量较低以及相似分子检索偏差等因素影响,因此现阶段更适合作为未知化合物解析中的智能辅助工具,为研究人员提供分子骨架、官能团和化学类别等可解释线索,而不是作为最终鉴定结论。

未来,MS2LLM 可进一步融合保留时间、碰撞能量等多源实验信息,以提升结构推断的准确性和稳定性。同时,通过扩充高质量质谱数据、优化相似分子检索和化学概念评价体系,该框架有望进一步应用于非靶向代谢组学、天然产物发现和复杂样品分析,帮助研究人员快速筛选未知峰、缩小候选范围并辅助后续实验验证。


论文链接:https://pubs.acs.org/doi/10.1021/acs.analchem.6c02505
代码链接:https://github.com/menglinzhou-bio/MS2LLM


【声明】内容源于网络
0
0
MetaboAI
中国农科院基因组所纪宏超课题组公众号,更名MetaboAI,将继续关注化学计量学,生物信息学和人工智能,在计算化学生物学,尤其是代谢组学领域的发展动态。
内容 91
粉丝 0
MetaboAI 中国农科院基因组所纪宏超课题组公众号,更名MetaboAI,将继续关注化学计量学,生物信息学和人工智能,在计算化学生物学,尤其是代谢组学领域的发展动态。
总阅读1.5k
粉丝0
内容91