AlphaFold 3跑出一个漂亮的复合物,配体端端正正卡在口袋里,截图往组会 PPT上一放,全场点头。散会后你把同一个文件丢进GROMACS,跑完100 ns回来一看——配体飞了,蛋白局部"炸"成一团毛线。于是结论出来了:"还是不准。"
先别急着冤枉它。多数情况下,结构本身没那么离谱,是你少做了一步"翻译":AF3交出来的是几何答案,分子动力学要的是一套物理体系。这两者之间,隔着 5 道工序。
30 秒看懂
-
AF3在"猜形状",MD 在"算运动",两者的输出根本不是一类东西。 -
AF3的结构缺MD必需的东西:氢原子与质子化状态、配体的力场参数、水/离子/膜这些环境。 -
最容易被忽略的一点:AF3自己就会标出"有没有原子打架"(has_clash),不看这个指标直接开跑,等于把雷留给积分器。
一、先分清:AF3在"猜形状",MD 在"算运动"
AF3的内核是一个扩散模块:从一团噪声出发,一步一步"去噪",最后落在一组原子坐标上,条件信息就是你要预测的序列(以及MSA等)。它是生成式的,默认一次给你5个候选样本(同一个seed采样5次),换个随机种子再跑,还会得到更多不一样的解[1][2][3]。
MD完全不同。它不猜,它算:给每个原子配好力场参数(键长、键角、二面角、静电、范德华),按牛顿方程一步步积分,输出的是随时间的轨迹。
一句话:AF3给你"一张概率很高的快照",MD要"一套能守恒的物理规则"。快照不能当规则用,中间必须补课。
反过来说也成立:MD算不出"结构本该长什么样",它只能回答"从这个起点出发会怎么动"。所以两者是接力关系,不是替代关系——这也是我们做大规模预测时反复强调的一件事。
二、AF3的输出,缺了MD必需的三样东西
第一样:氢原子和质子化状态。预测输出的坐标里通常不含氢(PDB/mmCIF 文件本身也常省略氢),氢要自己加;更关键的是同一个 His、Asp、Glu、Cys,在 pH7.4 下带不带电、带几个电,模型不替你决定。这一步一般交给PDB2PQR这类工具按pH自动分配质子化状态[4]。 电荷错一个,静电作用和氢键网络就变了样,跑出来的轨迹也就没法解释。
第二样:配体的"物理身份"。AF3能把小分子按原子级别放进口袋里(它把配体的每个原子当成一个token来建模),但给的是姿态,不是参数。要让配体在MD里守规矩,得补上它的键长、键角与电荷参数(GAFF、OpenFF这类力场,配AM1-BCC或RESP电荷)[2][5]。另外,官方在PoseBusters基准上报告过4.4%的手性违反率——跑之前顺手查一下手性,不然可能整篇结论都建立在"镜像分子"上[1]。
第三样:环境。真空里的蛋白不是蛋白。水、离子(生理条件常按0.15M 左右配)、以及膜蛋白要先插进膜里,这类体系搭建现在有CHARMM-GUI这类半自动流程,能省掉大半体力活[6]。
三、另一个隐藏雷:原子"打架"和低置信区
AF3偶尔会预测出重叠的原子。官方培训材料特别点名:当复合物里有两条以上相同的链(同源多聚体)时,有时会夸张到整条链重叠;不过在超过2000个token的大复合物里,这类错误很少见[2]。
好消息是模型自己会承认。输出里的has_clash指标,专门标记"某条链超过一半原子重叠,或单链重叠原子超过100个"的情况;官方排序分ranking_score里,这一项直接乘以−100[3]。 所以拿到结果第一件事不是感动,是看这个布尔值。
低置信区同样要处理。pLDDT低于50的区段,基本可以认为"预测大概率不对";而且AF3是生成式模型,在无序区可能"幻觉"出并不存在的规则结构,比如一段漂亮的α螺旋[1][2] 。输出里还有一个 fraction_disordered,直接告诉你有多大比例的区域被判为无序——比例偏高的体系,先想清楚这些区段在模拟里到底要不要保留。总之低置信区要么截断、要么补全、要么加弱约束,别让它自由发挥[3]。
四、指标速查表 + 建体系 5 步
体检 5 步(按顺序做,别跳):
- 看置信度
:pLDDT上色+PAE图+ipTM,先决定"这份结构值不值得用"。 - 清理与补全
:删tag、信号肽,截掉低置信loop,缺失残基按需补全。 - 定化学状态
:质子化、二硫键、金属配位,配体的力场参数与电荷。 - 建环境
:水盒、离子、膜(膜蛋白)、盒子尺寸与周期性边界。 - 先最小化再平衡
:能量最小化把冲突揉开,再做NVT/NPT平衡;跑生产之前用RMSD/RMSF 确认体系稳住了,最好多副本验证。
五、一句话记住
AF3负责"长得像",MD负责"动得真";中间那5步,才是从一张图到一个可信结论之间的距离。
#AlphaFold3 #结构预测 #分子动力学 #科研避坑 #科普
参考文献
[1] ABRAMSON J, ADLER J, DUNGER J, et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3[J/OL]. Nature, 2024, 630(8016): 493-500[2026-09-26].
[2] EMBL-EBI Training. AlphaFold: A practical guide — How does AlphaFold 3 work? / What AlphaFold 3 struggles with / How to assess the quality of AlphaFold 3 predictions[EB/OL]. [2026-09-26].
[3] Google DeepMind. AlphaFold 3 output documentation[EB/OL]. [2026-09-26].
[4] DOLINSKY T J, CZODROWSKI P, LI H, et al. PDB2PQR: expanding and upgrading automated preparation of biomolecular structures for molecular simulations[J]. Nucleic Acids Research, 2007, 35(Web Server issue): W522-W525.
[5] WANG J, WOLF R M, CALDWELL J W, et al. Development and testing of a general amber force field[J]. Journal of Computational Chemistry, 2004, 25(9): 1157-1174.
[6] JO S, KIM T, IYER V G, et al. CHARMM-GUI: a web-based graphical user interface for CHARMM[J]. Journal of Computational Chemistry, 2008, 29(11): 1859-1865.

