欢迎向本公众号投稿文献解读类原创文章,投稿邮箱:380198025@qq.com,请将稿件以附件形式发送。海内外招生、访学、招聘等稿件,请联系微信:xiongzhankun1997。
编辑 | 石艺杨
审核 | 王紫嫣
今天介绍的是 2026 年发表于 Nature 的论文 “Breaking timescales with generative sampling of conformational transitions”。该工作由法国洛林大学、马德里理工大学、芝加哥大学和伊利诺伊大学厄巴纳-香槟分校等团队合作完成,提出生成式承诺概率(committor)引导路径采样框架Gen-COMPAS(Generative Committor-guided Path Sampling)。与传统增强采样方法不同,Gen-COMPAS不需要预先指定少数低维集体变量(collective variables, CVs)来驱动体系跨越自由能势垒,而是利用扩散模型提出可能的中间构象,再通过真实分子Hamiltonian下的分子动力学筛选和修正这些结构,并利用committor持续将采样集中到真正的过渡区域。
其核心思想并不是用生成模型取代分子动力学,而是让生成模型回答“哪里值得采样”,再让分子动力学判断“这个区域是否真的物理可达”。最终,Gen-COMPAS可以从少量已知端点结构出发,获得过渡态集合、主要构象转变路径、committor以及重加权自由能景观等信息。
一、摘要
蛋白质折叠、别构调控、膜转运和配体结合等过程常涉及不同亚稳态之间的稀有构象转换,传统MD往往需要较长时间才能捕获完整过渡过程,而增强采样又常依赖预先选择的CVs。
为此,作者提出Gen-COMPAS。该方法从反应物态A和产物态B的短时间无偏MD出发,训练去噪扩散模型生成候选中间构象;随后分别从A和B通过targeted molecular dynamics(TMD)向这些候选结构靠近,以检验其在真实分子力场下的物理可达性。去除偏置后,再从修正结构启动无偏MD,并利用所得轨迹训练variational committor network(VCN)。VCN用于识别 的过渡区域,Gen-COMPAS据此不断更新扩散模型和VCN,形成“生成—物理修正—无偏采样—committor筛选”的迭代闭环。
作者在小型肽、Trp-cage、线粒体ADP/ATP载体和五聚体烟碱型乙酰胆碱受体等体系上进行了验证。结果表明,Gen-COMPAS能够在较低累计无偏采样预算下恢复过渡态、主要转变路径和自由能景观,并解析配体运动、大尺度构象变化及非对称亚基重排等复杂过程。
二、引言
研究分子构象转变时,真正困难的不是“能不能看到A态和B态”,而是如何描述两者之间的过渡路径、过渡态集合以及自由能景观。传统增强采样通常会先选择CVs,再沿这些变量施加偏置,使体系更容易跨越能垒。但这种策略本质上依赖研究者事先知道哪些自由度最重要;如果CV没有覆盖真正的慢自由度,就可能遗漏亚稳态或得到偏离真实机制的路径。
另一条路线来自transition-path theory。其中,committor 被认为是描述反应进程的理想坐标。对于某一构象 , 表示从该状态出发后,体系先到达B态而不是回到A态的概率;因此 和 分别对应两个端点,而 的构象则位于两侧概率近似相等的过渡区域。
近年来,机器学习已经被用于学习CVs、committor和transition path,也出现了Boltzmann generator、MDGen、BioEmu等生成式分子模型。但作者指出,这些方法往往依赖已有长轨迹、大规模预训练数据或先验transition data;对于一个只有少数端点结构的新体系,如何同时获得动力学路径和热力学景观仍然困难。
Gen-COMPAS的思路因此不是再设计一个新的CV,而是把生成模型、committor学习和显式Hamiltonian分子动力学组织成一个反馈循环:生成模型负责扩展构象空间,MD负责判断候选结构是否物理可达,committor则负责决定下一轮采样应该集中在哪里。作者强调,其方法学创新主要来自这些已有模块的组合,而不是单独提出一种新的扩散模型或committor理论。
三、方法&结果
1. Gen-COMPAS整体流程
Gen-COMPAS从两个已知亚稳态A和B出发。研究者首先分别进行约1–2ns的短时间无偏MD,并利用所得构象训练去噪扩散模型。该模型直接处理中心化后的三维原子坐标,通过对真实结构加噪并学习恢复clean coordinates,在推理阶段生成A与B之间的候选中间构象。对于包含配体的体系,蛋白质与配体坐标被联合建模,而不是先生成蛋白质再单独对接。
这些生成结构并不会直接被视为真实过渡态。作者进一步将其作为TMD的目标,分别从A和B出发,通过RMSD偏置逐步向同一个候选构象靠近。TMD的作用主要是检验生成结构是否位于真实分子Hamiltonian可到达的构象区域,而不是直接用于估计动力学。随后移除偏置,从TMD得到的结构启动短时间无偏MD;真正进入后续committor学习、动力学和自由能分析的是这些无偏轨迹。
从第二轮开始,作者利用累积的无偏轨迹训练VCN。与传统方法提前指定少数RMSD、距离或二面角作为CV不同,VCN使用选定原子的Z-matrix内部坐标,包括键长、键角和二面角。对于包含 个原子的非线性体系,去除整体平移和旋转后,共保留 个内部自由度。
VCN输出committor ,即体系从当前构象出发后先到达B而不是返回A的概率。其中 表示向A、B两侧演化的概率接近,对应最接近过渡态的区域。模型通过变分目标学习committor,并额外加入边界约束,使A态输出接近0、B态接近1。随后Gen-COMPAS优先选择 的结构继续进行TMD和无偏MD,再利用新数据重新训练扩散模型和VCN,从而形成Diffusion→TMD→Unbiased MD→Committor→Retraining的迭代闭环。
因此,Gen-COMPAS所谓“突破时间尺度”,并不是让MD的单个时间步计算得更快,而是减少体系长期停留在稳定自由能盆地中的无效采样,将更多计算资源集中到真正的transition region。
2. Trp-cage:恢复两条竞争折叠路径
该图以Trp-cage蛋白折叠为例,对Gen-COMPAS的采样能力进行验证。作者不仅考察模型能否找到合理的折叠态和过渡态,还进一步比较其预测的折叠路径、committor和自由能景观与长时间MD模拟是否一致,以验证Gen-COMPAS能否在较低采样成本下恢复真实的蛋白质构象转变机制。
图a:子图a展示了Trp-cage从未折叠态到折叠态过程中的代表性结构,包括最终folded state、unfolded state,以及两类不同的过渡态 和 。其中橙色区域为α螺旋, 表示蛋白两端之间的距离。两个不同过渡态提示Trp-cage并不是沿单一路径完成折叠,而可能存在不同的折叠机制。
图b:子图b将Gen-COMPAS学习到的committor 投影到不同CV组合上,包括整体Cα RMSD、α螺旋区域RMSD以及端到端距离 。图中的橙色和蓝色曲线分别代表Path 1和Path 2,可以看到两条路径在CV空间中明显不同,说明模型捕捉到了两种竞争性的折叠通路。
图c:子图c比较了Gen-COMPAS和DESRES长时间MD得到的自由能景观。Gen-COMPAS仅使用594 ns累计无偏采样,而参考DESRES轨迹长度为208.8 μs。两种方法得到的folded、unfolded以及主要transition region在不同CV空间中总体一致,说明Gen-COMPAS能够用更少的采样恢复主要自由能盆地和构象转变特征。
图d:子图d进一步展示了沿Path 1和Path 2前进时,各CV以及committor的变化。Path 1中,α螺旋相关RMSD较早下降,说明体系倾向于先形成α螺旋,再完成整体结构压实;Path 2则更早发生整体塌缩和三级结构接触,而螺旋形成相对滞后,因此更接近先发生疏水塌缩,再形成α螺旋的过程。灰色虚线为committor ,其中 所在位置对应各自路径上的transition-state region。
图e:子图e比较了Gen-COMPAS预测的committor分布,与从DESRES长时间轨迹中直接统计得到的committor分布。二者在整体Cα RMSD和α螺旋RMSD空间中的变化趋势较为一致,说明Gen-COMPAS学习到的committor能够较好地区分unfolded、transition和folded区域,也进一步支持其对Trp-cage折叠机制的判断。
3. AAC:重建多状态膜转运过程
为验证Gen-COMPAS能否处理比蛋白折叠更复杂的膜蛋白多亚稳态构象转换,作者利用利用线粒体 ADP/ATP转运蛋白AAC对此进行检验。在该部分,作者重点研究holo-AAC(ADP结合状态)从胞质开放态 C-state 到基质开放态 M-state 的转换,并分析中间的 O-state(occluded state,封闭态)。随后再与无底物的 apo-AAC 对比,从而判断ADP在转运过程中的作用。
图a:子图a展示了 holo-AAC 从 C-state 经 O-state 到 M-state 的完整转变过程。在 C-state 中,蛋白朝胞质侧开放;随后进入 O-state,蛋白两侧均趋于关闭,ADP被暂时封闭在中央腔体中;最后转变为M-state,通道朝线粒体基质侧开放。右侧同时展示了ADP在转变过程中的位置变化,可以看到底物并不是简单直线移动,而会伴随蛋白构象变化发生明显的转动。底部三维图则将整条转变路径投影到 、 、 三个CV组成的空间中,可以看到C、O、M对应不同的构象区域,两条路径分别连接C→O和O→M。
图b:子图b首先展示了holo-AAC在膜环境中的整体结构,并介绍了图a中三个便于解释转变过程的CV。 其中:
① :描述一组盐桥/残基距离,主要反映一侧的开闭程度;
② :描述另一组盐桥网络,对应另一侧的开闭变化;
③ :描述 ADP 在蛋白中央腔体中的位置。
图c:子图c展示了两个独立转变阶段对应的committor分布: 和 。背景颜色代表committor ,蓝色区域更接近起始态,红色区域更接近目标态,而中间区域对应过渡区域。图中的路径方面:橙色路径表示C→O,蓝色路径则表示O→M。这部分结果说明,多状态体系可以被拆分为相邻亚稳态之间的多个committor-guided transition:先找到C→O的过渡区域,再研究O→M,而不是强行用一个单一反应坐标描述整个C→M过程。
图d:子图d展示了ADP结合状态下AAC的自由能景观,并分别投影到不同CV组合上。从图中可以看到明显的 、 、 三个自由能盆地,说明O-state并不是一个瞬时、无意义的结构,而是具有相对稳定性的中间亚稳态。
图e:子图e则展示了 apo-AAC,也就是没有ADP时的结果。上方只展示出明显的 C-state 和 M-state;下方自由能景观中也主要只存在 C 和 M 两个盆地,holo体系中明显的 O-state basin 消失。与此同时,C和M之间的自由能势垒升高到约10kcal/mol,显著高于holo体系中的约2–2.5kcal/mol。
综上,该部分结果最终传达的生物学结论是:ADP并不是被AAC被动运输的“乘客”,它本身也参与塑造AAC的构象自由能景观。ADP能够稳定occluded中间态,从而降低C→O→M构象转换的能垒,使AAC更容易沿完整的转运路径运动。
(更详细的结果内容请参见原文)
四、总结
该研究提出Gen-COMPAS,将生成模型、committor学习和显式Hamiltonian MD结合起来研究稀有构象转变。扩散模型负责提出可能的中间结构,TMD负责将候选结构修正到真实力场可达区域,无偏MD提供具有统计意义的轨迹,而VCN进一步利用committor将采样集中到过渡区域。该方法在Trp-cage折叠、AAC膜转运和nAChR激活等体系中恢复了过渡态、主要路径和自由能景观,并在nAChR中获得了实验支持的单配体中间状态。
Gen-COMPAS的关键之处在于利用AI负责寻找值得计算的位置,MD负责验证这些位置是否符合真实分子动力学。不过,作者也将其定位为一种exploratory sampling workflow。其结果仍依赖端点状态、力场、原子选择以及过渡区域覆盖程度,也可能遗漏未被生成—采样循环探索到的路径;复杂体系中的全局自由能差仍需额外收敛验证。
论文链接:https://www.nature.com/articles/s41586-026-11025-1
代码链接:https://github.com/Tangcyu/Gen-COMPAS
扫描二维码获取
更多精彩
AI in Graph
本公众号主要介绍应用于图、知识图谱的人工智能算法和研究进展,及其在生物信息、医学健康领域的应用。欢迎关注本公众号获取领域最新文献解读。
点个在看+赞支持一下

