大数跨境

AlphaFold 3 的结构能直接跑分子动力学吗?差的是这 5 步

AlphaFold 3 的结构能直接跑分子动力学吗?差的是这 5 步 AI4Peptide
2026-09-26
4
导读:从AF3到MD:"骨架",怎么变成能动的"活体"

AlphaFold 3跑出一个漂亮的复合物,配体端端正正卡在口袋里,截图往组会 PPT上一放,全场点头。散会后你把同一个文件丢进GROMACS,跑完100 ns回来一看——配体飞了,蛋白局部"炸"成一团毛线。于是结论出来了:"还是不准。"

先别急着冤枉它。多数情况下,结构本身没那么离谱,是你少做了一步"翻译":AF3交出来的是几何答案,分子动力学要的是一套物理体系。这两者之间,隔着 5 道工序。

30 秒看懂

  • AF3在"猜形状",MD 在"算运动",两者的输出根本不是一类东西。
  • AF3的结构缺MD必需的东西:氢原子与质子化状态、配体的力场参数、水/离子/膜这些环境。
  • 最容易被忽略的一点:AF3自己就会标出"有没有原子打架"(has_clash),不看这个指标直接开跑,等于把雷留给积分器。


一、先分清:AF3在"猜形状",MD 在"算运动"

AF3的内核是一个扩散模块:从一团噪声出发,一步一步"去噪",最后落在一组原子坐标上,条件信息就是你要预测的序列(以及MSA等)。它是生成式的,默认一次给你5个候选样本(同一个seed采样5次),换个随机种子再跑,还会得到更多不一样的解[1][2][3]。

MD完全不同。它不猜,它算:给每个原子配好力场参数(键长、键角、二面角、静电、范德华),按牛顿方程一步步积分,输出的是随时间的轨迹。

一句话:AF3给你"一张概率很高的快照",MD要"一套能守恒的物理规则"。快照不能当规则用,中间必须补课。

反过来说也成立:MD算不出"结构本该长什么样",它只能回答"从这个起点出发会怎么动"。所以两者是接力关系,不是替代关系——这也是我们做大规模预测时反复强调的一件事。

二、AF3的输出,缺了MD必需的三样东西

第一样:氢原子和质子化状态。预测输出的坐标里通常不含氢(PDB/mmCIF 文件本身也常省略氢),氢要自己加;更关键的是同一个 His、Asp、Glu、Cys,在 pH7.4 下带不带电、带几个电,模型不替你决定。这一步一般交给PDB2PQR这类工具按pH自动分配质子化状态[4]。 电荷错一个,静电作用和氢键网络就变了样,跑出来的轨迹也就没法解释。

第二样:配体的"物理身份"。AF3能把小分子按原子级别放进口袋里(它把配体的每个原子当成一个token来建模),但给的是姿态,不是参数。要让配体在MD里守规矩,得补上它的键长、键角与电荷参数(GAFF、OpenFF这类力场,配AM1-BCC或RESP电荷)[2][5]。另外,官方在PoseBusters基准上报告过4.4%的手性违反率——跑之前顺手查一下手性,不然可能整篇结论都建立在"镜像分子"上[1]。

第三样:环境。真空里的蛋白不是蛋白。水、离子(生理条件常按0.15M 左右配)、以及膜蛋白要先插进膜里,这类体系搭建现在有CHARMM-GUI这类半自动流程,能省掉大半体力活[6]。

三、另一个隐藏雷:原子"打架"和低置信区

AF3偶尔会预测出重叠的原子。官方培训材料特别点名:当复合物里有两条以上相同的链(同源多聚体)时,有时会夸张到整条链重叠;不过在超过2000个token的大复合物里,这类错误很少见[2]。

好消息是模型自己会承认。输出里的has_clash指标,专门标记"某条链超过一半原子重叠,或单链重叠原子超过100个"的情况;官方排序分ranking_score里,这一项直接乘以−100[3]。 所以拿到结果第一件事不是感动,是看这个布尔值。

低置信区同样要处理。pLDDT低于50的区段,基本可以认为"预测大概率不对";而且AF3是生成式模型,在无序区可能"幻觉"出并不存在的规则结构,比如一段漂亮的α螺旋[1][2] 。输出里还有一个 fraction_disordered,直接告诉你有多大比例的区域被判为无序——比例偏高的体系,先想清楚这些区段在模拟里到底要不要保留。总之低置信区要么截断、要么补全、要么加弱约束,别让它自由发挥[3]。

四、指标速查表 + 建体系 5 步

体检 5 步(按顺序做,别跳):

  1. 看置信度
    :pLDDT上色+PAE图+ipTM,先决定"这份结构值不值得用"。
  2. 清理与补全
    :删tag、信号肽,截掉低置信loop,缺失残基按需补全。
  3. 定化学状态
    :质子化、二硫键、金属配位,配体的力场参数与电荷。
  4. 建环境
    :水盒、离子、膜(膜蛋白)、盒子尺寸与周期性边界。
  5. 先最小化再平衡
    :能量最小化把冲突揉开,再做NVT/NPT平衡;跑生产之前用RMSD/RMSF 确认体系稳住了,最好多副本验证。


五、一句话记住

AF3负责"长得像",MD负责"动得真";中间那5步,才是从一张图到一个可信结论之间的距离。

#AlphaFold3 #结构预测 #分子动力学 #科研避坑 #科普


参考文献

[1] ABRAMSON J, ADLER J, DUNGER J, et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3[J/OL]. Nature, 2024, 630(8016): 493-500[2026-09-26].

[2] EMBL-EBI Training. AlphaFold: A practical guide — How does AlphaFold 3 work? / What AlphaFold 3 struggles with / How to assess the quality of AlphaFold 3 predictions[EB/OL]. [2026-09-26].

[3] Google DeepMind. AlphaFold 3 output documentation[EB/OL]. [2026-09-26].

[4] DOLINSKY T J, CZODROWSKI P, LI H, et al. PDB2PQR: expanding and upgrading automated preparation of biomolecular structures for molecular simulations[J]. Nucleic Acids Research, 2007, 35(Web Server issue): W522-W525.

[5] WANG J, WOLF R M, CALDWELL J W, et al. Development and testing of a general amber force field[J]. Journal of Computational Chemistry, 2004, 25(9): 1157-1174.

[6] JO S, KIM T, IYER V G, et al. CHARMM-GUI: a web-based graphical user interface for CHARMM[J]. Journal of Computational Chemistry, 2008, 29(11): 1859-1865.


【声明】内容源于网络
0
0
AI4Peptide
专注探索人工智能在多肽药物设计与研发中的应用,定期发布相关的前沿研究、技术解析和行业动态,迎接未来智能药物研发的新时代。
内容 40
粉丝 0
AI4Peptide 专注探索人工智能在多肽药物设计与研发中的应用,定期发布相关的前沿研究、技术解析和行业动态,迎接未来智能药物研发的新时代。
总阅读926
粉丝0
内容40