大数跨境

Nature 2026 | 用构象迁移的生成采样打破时间尺度

Nature 2026 | 用构象迁移的生成采样打破时间尺度 AI in Graph
2026-09-14
7
导读:欢迎向本公众号投稿文献解读类原创文章,投稿邮箱:380198025@qq.com,请将稿件以附件形式发送。

向本公众号投稿文献解读类原创文章,投稿邮箱:380198025@qq.com,请将稿件以附件形式发送。海内外招生、访学、招聘等稿件,请联系微信:xiongzhankun1997。


编辑 | 石艺杨

审核 | 王紫嫣

今天介绍的是 2026 年发表于 Nature 的论文 “Breaking timescales with generative sampling of conformational transitions”。该工作由法国洛林大学、马德里理工大学、芝加哥大学和伊利诺伊大学厄巴纳-香槟分校等团队合作完成,提出生成式承诺概率(committor)引导路径采样框架Gen-COMPAS(Generative Committor-guided Path Sampling)。与传统增强采样方法不同,Gen-COMPAS不需要预先指定少数低维集体变量(collective variables, CVs)来驱动体系跨越自由能势垒,而是利用扩散模型提出可能的中间构象,再通过真实分子Hamiltonian下的分子动力学筛选和修正这些结构,并利用committor持续将采样集中到真正的过渡区域。

其核心思想并不是用生成模型取代分子动力学,而是让生成模型回答“哪里值得采样”,再让分子动力学判断“这个区域是否真的物理可达”。最终,Gen-COMPAS可以从少量已知端点结构出发,获得过渡态集合、主要构象转变路径、committor以及重加权自由能景观等信息。

一、摘要

蛋白质折叠、别构调控、膜转运和配体结合等过程常涉及不同亚稳态之间的稀有构象转换,传统MD往往需要较长时间才能捕获完整过渡过程,而增强采样又常依赖预先选择的CVs。

为此,作者提出Gen-COMPAS。该方法从反应物态A和产物态B的短时间无偏MD出发,训练去噪扩散模型生成候选中间构象;随后分别从A和B通过targeted molecular dynamics(TMD)向这些候选结构靠近,以检验其在真实分子力场下的物理可达性。去除偏置后,再从修正结构启动无偏MD,并利用所得轨迹训练variational committor network(VCN)。VCN用于识别 的过渡区域,Gen-COMPAS据此不断更新扩散模型和VCN,形成“生成—物理修正—无偏采样—committor筛选”的迭代闭环。

作者在小型肽、Trp-cage、线粒体ADP/ATP载体和五聚体烟碱型乙酰胆碱受体等体系上进行了验证。结果表明,Gen-COMPAS能够在较低累计无偏采样预算下恢复过渡态、主要转变路径和自由能景观,并解析配体运动、大尺度构象变化及非对称亚基重排等复杂过程。

二、引言

研究分子构象转变时,真正困难的不是“能不能看到A态和B态”,而是如何描述两者之间的过渡路径、过渡态集合以及自由能景观。传统增强采样通常会先选择CVs,再沿这些变量施加偏置,使体系更容易跨越能垒。但这种策略本质上依赖研究者事先知道哪些自由度最重要;如果CV没有覆盖真正的慢自由度,就可能遗漏亚稳态或得到偏离真实机制的路径。

另一条路线来自transition-path theory。其中,committor 被认为是描述反应进程的理想坐标。对于某一构象 表示从该状态出发后,体系先到达B态而不是回到A态的概率;因此 分别对应两个端点,而 的构象则位于两侧概率近似相等的过渡区域。

近年来,机器学习已经被用于学习CVs、committor和transition path,也出现了Boltzmann generator、MDGen、BioEmu等生成式分子模型。但作者指出,这些方法往往依赖已有长轨迹、大规模预训练数据或先验transition data;对于一个只有少数端点结构的新体系,如何同时获得动力学路径和热力学景观仍然困难。

Gen-COMPAS的思路因此不是再设计一个新的CV,而是把生成模型、committor学习和显式Hamiltonian分子动力学组织成一个反馈循环:生成模型负责扩展构象空间,MD负责判断候选结构是否物理可达,committor则负责决定下一轮采样应该集中在哪里。作者强调,其方法学创新主要来自这些已有模块的组合,而不是单独提出一种新的扩散模型或committor理论。

三、方法&结果

1. Gen-COMPAS整体流程

Gen-COMPAS从两个已知亚稳态A和B出发。研究者首先分别进行约1–2ns的短时间无偏MD,并利用所得构象训练去噪扩散模型。该模型直接处理中心化后的三维原子坐标,通过对真实结构加噪并学习恢复clean coordinates,在推理阶段生成A与B之间的候选中间构象。对于包含配体的体系,蛋白质与配体坐标被联合建模,而不是先生成蛋白质再单独对接。

这些生成结构并不会直接被视为真实过渡态。作者进一步将其作为TMD的目标,分别从A和B出发,通过RMSD偏置逐步向同一个候选构象靠近。TMD的作用主要是检验生成结构是否位于真实分子Hamiltonian可到达的构象区域,而不是直接用于估计动力学。随后移除偏置,从TMD得到的结构启动短时间无偏MD;真正进入后续committor学习、动力学和自由能分析的是这些无偏轨迹。

从第二轮开始,作者利用累积的无偏轨迹训练VCN。与传统方法提前指定少数RMSD、距离或二面角作为CV不同,VCN使用选定原子的Z-matrix内部坐标,包括键长、键角和二面角。对于包含   个原子的非线性体系,去除整体平移和旋转后,共保留 个内部自由度。

VCN输出committor  ,即体系从当前构象出发后先到达B而不是返回A的概率。其中 表示向A、B两侧演化的概率接近,对应最接近过渡态的区域。模型通过变分目标学习committor,并额外加入边界约束,使A态输出接近0、B态接近1。随后Gen-COMPAS优先选择 的结构继续进行TMD和无偏MD,再利用新数据重新训练扩散模型和VCN,从而形成Diffusion→TMD→Unbiased MD→Committor→Retraining的迭代闭环。

因此,Gen-COMPAS所谓“突破时间尺度”,并不是让MD的单个时间步计算得更快,而是减少体系长期停留在稳定自由能盆地中的无效采样,将更多计算资源集中到真正的transition region。

2. Trp-cage:恢复两条竞争折叠路径

该图以Trp-cage蛋白折叠为例,对Gen-COMPAS的采样能力进行验证。作者不仅考察模型能否找到合理的折叠态和过渡态,还进一步比较其预测的折叠路径、committor和自由能景观与长时间MD模拟是否一致,以验证Gen-COMPAS能否在较低采样成本下恢复真实的蛋白质构象转变机制。

图a:子图a展示了Trp-cage从未折叠态到折叠态过程中的代表性结构,包括最终folded state、unfolded state,以及两类不同的过渡态 。其中橙色区域为α螺旋, 表示蛋白两端之间的距离。两个不同过渡态提示Trp-cage并不是沿单一路径完成折叠,而可能存在不同的折叠机制。

图b:子图b将Gen-COMPAS学习到的committor  投影到不同CV组合上,包括整体Cα RMSD、α螺旋区域RMSD以及端到端距离 。图中的橙色和蓝色曲线分别代表Path 1和Path 2,可以看到两条路径在CV空间中明显不同,说明模型捕捉到了两种竞争性的折叠通路。

图c:子图c比较了Gen-COMPAS和DESRES长时间MD得到的自由能景观。Gen-COMPAS仅使用594 ns累计无偏采样,而参考DESRES轨迹长度为208.8 μs。两种方法得到的folded、unfolded以及主要transition region在不同CV空间中总体一致,说明Gen-COMPAS能够用更少的采样恢复主要自由能盆地和构象转变特征。

图d:子图d进一步展示了沿Path 1和Path 2前进时,各CV以及committor的变化。Path 1中,α螺旋相关RMSD较早下降,说明体系倾向于先形成α螺旋,再完成整体结构压实;Path 2则更早发生整体塌缩和三级结构接触,而螺旋形成相对滞后,因此更接近先发生疏水塌缩,再形成α螺旋的过程。灰色虚线为committor  ,其中 所在位置对应各自路径上的transition-state region。

图e:子图e比较了Gen-COMPAS预测的committor分布,与从DESRES长时间轨迹中直接统计得到的committor分布。二者在整体Cα RMSD和α螺旋RMSD空间中的变化趋势较为一致,说明Gen-COMPAS学习到的committor能够较好地区分unfolded、transition和folded区域,也进一步支持其对Trp-cage折叠机制的判断。

3. AAC:重建多状态膜转运过程

为验证Gen-COMPAS能否处理比蛋白折叠更复杂的膜蛋白多亚稳态构象转换,作者利用利用线粒体 ADP/ATP转运蛋白AAC对此进行检验。在该部分,作者重点研究holo-AAC(ADP结合状态)从胞质开放态 C-state 到基质开放态 M-state 的转换,并分析中间的 O-state(occluded state,封闭态)。随后再与无底物的 apo-AAC 对比,从而判断ADP在转运过程中的作用。

图a:子图a展示了 holo-AAC 从 C-state 经 O-state 到 M-state 的完整转变过程。在 C-state 中,蛋白朝胞质侧开放;随后进入 O-state,蛋白两侧均趋于关闭,ADP被暂时封闭在中央腔体中;最后转变为M-state,通道朝线粒体基质侧开放。右侧同时展示了ADP在转变过程中的位置变化,可以看到底物并不是简单直线移动,而会伴随蛋白构象变化发生明显的转动。底部三维图则将整条转变路径投影到  三个CV组成的空间中,可以看到C、O、M对应不同的构象区域,两条路径分别连接C→O和O→M。

图b:子图b首先展示了holo-AAC在膜环境中的整体结构,并介绍了图a中三个便于解释转变过程的CV。 其中:

:描述一组盐桥/残基距离,主要反映一侧的开闭程度;

:描述另一组盐桥网络,对应另一侧的开闭变化;

:描述 ADP 在蛋白中央腔体中的位置。

图c:子图c展示了两个独立转变阶段对应的committor分布: 。背景颜色代表committor  ,蓝色区域更接近起始态,红色区域更接近目标态,而中间区域对应过渡区域。图中的路径方面:橙色路径表示C→O,蓝色路径则表示O→M。这部分结果说明,多状态体系可以被拆分为相邻亚稳态之间的多个committor-guided transition:先找到C→O的过渡区域,再研究O→M,而不是强行用一个单一反应坐标描述整个C→M过程。

图d:子图d展示了ADP结合状态下AAC的自由能景观,并分别投影到不同CV组合上。从图中可以看到明显的 三个自由能盆地,说明O-state并不是一个瞬时、无意义的结构,而是具有相对稳定性的中间亚稳态。

图e:子图e则展示了 apo-AAC,也就是没有ADP时的结果。上方只展示出明显的 C-state 和 M-state;下方自由能景观中也主要只存在 C 和 M 两个盆地,holo体系中明显的 O-state basin 消失。与此同时,C和M之间的自由能势垒升高到约10kcal/mol,显著高于holo体系中的约2–2.5kcal/mol。

综上,该部分结果最终传达的生物学结论是:ADP并不是被AAC被动运输的“乘客”,它本身也参与塑造AAC的构象自由能景观。ADP能够稳定occluded中间态,从而降低C→O→M构象转换的能垒,使AAC更容易沿完整的转运路径运动。

(更详细的结果内容请参见原文)

四、总结

该研究提出Gen-COMPAS,将生成模型、committor学习和显式Hamiltonian MD结合起来研究稀有构象转变。扩散模型负责提出可能的中间结构,TMD负责将候选结构修正到真实力场可达区域,无偏MD提供具有统计意义的轨迹,而VCN进一步利用committor将采样集中到过渡区域。该方法在Trp-cage折叠、AAC膜转运和nAChR激活等体系中恢复了过渡态、主要路径和自由能景观,并在nAChR中获得了实验支持的单配体中间状态。

Gen-COMPAS的关键之处在于利用AI负责寻找值得计算的位置,MD负责验证这些位置是否符合真实分子动力学。不过,作者也将其定位为一种exploratory sampling workflow。其结果仍依赖端点状态、力场、原子选择以及过渡区域覆盖程度,也可能遗漏未被生成—采样循环探索到的路径;复杂体系中的全局自由能差仍需额外收敛验证。

论文链接:https://www.nature.com/articles/s41586-026-11025-1

代码链接:https://github.com/Tangcyu/Gen-COMPAS


图片

AiGraph

本公众号主要介绍应用于图、知识图谱的人工智能算法和研究进展,及其在生物信息、医学健康领域的应用。欢迎关注本公众号获取领域最新文献解读。

图片

+


【声明】内容源于网络
0
0
AI in Graph
介绍应用于图、知识图谱的人工智能算法和研究进展,及其在生物信息、医学健康领域的应用。
内容 300
粉丝 0
AI in Graph 介绍应用于图、知识图谱的人工智能算法和研究进展,及其在生物信息、医学健康领域的应用。
总阅读3.3k
粉丝0
内容300