大数跨境

【David Baker 子刊解读12】给 ProteinMPNN 装上原子视野

【David Baker 子刊解读12】给 ProteinMPNN 装上原子视野 AI4Peptide
2026-07-22
1
导读:ProteinMPNN 很强,但它有一个天然盲区:它主要看蛋白骨架。

AI4BioScience Paper Reading

【David Baker 子刊解读12】给 ProteinMPNN 装上原子视野

ProteinMPNN 很强,但它有一个天然盲区:它主要看蛋白骨架。对折叠稳定性来说,这已经很有用;可一旦目标变成 enzyme(酶)、sensor(传感器)、DNA-binding protein(DNA 结合蛋白)或 small-molecule binder(小分子结合蛋白),真正决定功能的往往不是骨架本身,而是某个氧原子、氮原子、金属离子和侧链之间能不能对上。

一句话总结:背景:ProteinMPNN 等 sequence design(序列设计)工具已经能为蛋白骨架快速配序列;问题:很多真正的功能来自蛋白与小分子、核酸或金属的原子级相互作用,只看蛋白骨架会漏掉这些约束;方法:作者提出 LigandMPNN,把非蛋白原子上下文直接编码进图神经网络,并同时预测序列和侧链扭转角;验证:模型在小分子、核酸、金属附近的天然序列恢复率分别达到 63.3%、50.5% 和 77.5%,并在 rocuronium 与 cholic acid 结合蛋白上完成实验救援;结论:LigandMPNN 把 ProteinMPNN 从“会看骨架”推进到“会看原子环境”,更适合功能蛋白设计。

论文速览

发布时间2025-03-28 online

原文题目:Atomic context-conditioned protein sequence design using LigandMPNN

作者:Justas Dauparas、Gyu Rie Lee、Robert Pecoraro、Linna An 等

第一单位:Department of Biochemistry, University of Washington, Seattle, WA, USA

发布平台:Nature Methods(Article;Nature 大子刊正式论文,不是预印本)

问题真正难在哪里

这也是很多 AI 蛋白设计流程里最别扭的一步。前面可以用 RFdiffusion 或其他方法生成一个口袋,后面可以用 ProteinMPNN 给骨架配序列,但如果配序列的模型没有看见 ligand(配体),它就只能回答“这个序列像不像能折成这个蛋白”,却很难回答“这个序列能不能把目标分子真的抓住”。两者看起来接近,实际差得很远。

LigandMPNN 试图补上这个缺口。它不是重新发明从头生成骨架的模型,而是把 sequence design(序列设计)这一步升级成 atomic context-conditioned design(原子上下文条件化设计)。这篇文章真正解决的不是“怎样再造一个 ProteinMPNN”,而是让配序列模型终于看见蛋白功能赖以成立的那些非蛋白原子。

Fig. 1:把小分子、核酸和金属也放进图神经网络

Fig. 1

Fig. 1:LigandMPNN 的整体架构:模型把蛋白骨架、小分子/核酸/金属等非蛋白原子,以及它们之间的几何关系放进三个图结构中,再通过蛋白编码器、蛋白-配体编码器和解码器预测氨基酸序列与侧链扭转角。

Fig. 1 是 LigandMPNN 的方法图,也是理解这篇文章的入口。作者保留了 ProteinMPNN 的核心思想:把蛋白 residue(残基)看作图上的节点,用 Cα-Cα 距离选最近邻边,再用 N、Cα、C、O 和 virtual Cβ(虚拟 Cβ)之间的几何距离描述骨架环境。

新东西在于,模型不再只看 protein graph(蛋白图)。它额外加入 ligand graph(配体图)和 protein-ligand graph(蛋白-配体图):前者把小分子、核酸、金属等非蛋白原子当成节点,编码元素类型和原子间距离;后者把蛋白残基和非蛋白原子连起来,让模型知道每个残基附近有什么原子、距离多远、可能形成什么相互作用。

这套设计背后的直觉很清楚。一个结合口袋里,亮氨酸、天冬氨酸、组氨酸该不该出现,并不只取决于骨架形状,还取决于旁边是不是有疏水碳链、带电基团、磷酸骨架或金属离子。作者最后选择对每个残基使用最近的 25 个配体原子,作为效率和信息量之间的折中。

模型规模也很克制。LigandMPNN 大约有 2.62 million parameters(262 万参数),ProteinMPNN 大约是 1.66 million parameters(166 万参数);在单个 CPU 上处理 100 个残基,ProteinMPNN 约 0.6 秒,LigandMPNN 约 0.9 秒。对一个要嵌入设计 pipeline(流程)的工具来说,这个速度很关键:它不是一个只适合论文展示的重模型,而是可以反复调用的设计模块。

Fig. 2:第一张成绩单,别再假装 ligand 不存在

Fig. 2

Fig. 2:LigandMPNN 的序列设计基准结果:在靠近小分子、核酸和金属的位点上,它的 native sequence recovery(天然序列恢复率)分别达到 63.3%、50.5% 和 77.5%,明显高于 Rosetta 与 ProteinMPNN。

Fig. 2 回答一个最直接的问题:看见非蛋白原子,是否真的让序列设计更准?作者构建了三个测试集合,分别包含 317 个小分子复合物、74 个核酸复合物和 83 个过渡金属复合物,并重点评估距离非蛋白原子 5 Å 以内的位点。

结果很漂亮。对小分子附近残基,LigandMPNN 的 native sequence recovery(天然序列恢复率)达到 63.3%,Rosetta 是 50.4%,ProteinMPNN 是 50.5%。对核酸附近残基,LigandMPNN 是 50.5%,Rosetta 是 35.2%,ProteinMPNN 是 34.0%。对金属附近残基,LigandMPNN 更明显,达到 77.5%,而 Rosetta 和 ProteinMPNN 分别是 36.0% 和 40.6%。

这些数字的意思不是“天然序列一定就是唯一正确答案”。在设计任务里,一个口袋可以有不止一种序列解。但如果模型能更好地恢复天然蛋白在功能位点用过的氨基酸,至少说明它学到了哪些化学环境更偏好哪些残基。对 DNA 磷酸骨架、金属配位、小分子极性基团来说,这种偏好非常重要。

Fig. 2 里的 ablation(消融实验)也值得看。减少每个残基能看到的配体原子数,会特别伤害核酸任务;去掉化学元素类型,会让金属恢复率下降约 8%;去掉蛋白-配体图和配体图,序列恢复率整体下降约 3%。这些结果支持一个判断:LigandMPNN 的提升不是单纯来自多加参数,而是来自把原子环境以合适的方式送进模型。

这里最值得记住的一点是:功能位点的序列,不是蛋白骨架单独决定的,而是骨架和目标分子一起决定的。

Fig. 3:不只选氨基酸,还要把侧链角度摆对

Fig. 3

Fig. 3:LigandMPNN 的侧链 packing(侧链摆放)结果:模型在 chi1/chi2 等关键扭转角恢复上优于 Rosetta 和不使用非蛋白原子上下文的版本,但 chi3/chi4 仍然是更难的长侧链问题。

只把氨基酸选对还不够。小分子结合、金属配位和核酸识别通常要求侧链以合适角度伸向目标原子,所以 Fig. 3 看的是 packing(侧链摆放)能力。作者训练了一个 sidechain packing network(侧链摆放网络),按 chi1、chi2、chi3、chi4 的顺序自回归预测侧链扭转角。

在小分子复合物中,如果以 chi1 是否落在 10° 以内作为标准,Rosetta 是 76.0%,不使用非蛋白原子上下文的 LigandMPNN-wo 是 83.3%,完整 LigandMPNN 是 86.1%。核酸场景里三者分别是 66.2%、65.6%、71.4%;金属场景里分别是 68.6%、76.7%、79.3%。这说明模型不仅更会选残基,也更会把常见关键侧链摆到合理位置。

不过这张图也提醒我们,不要把问题看得太简单。对小分子任务,LigandMPNN 的 chi1、chi2、chi3、chi4 加权平均恢复率分别为 84.0%、64.0%、28.3%、18.7%。也就是说,越往侧链末端走,角度自由度越高,预测就越难。长侧链的末端构象仍然是硬问题,尤其当它们参与细微氢键或疏水堆积时,后续可能还需要 Rosetta 或分子模拟来精修。

这部分最有意思的地方在于,作者发现侧链摆放的很多信息来自蛋白环境本身,而不完全来自 ligand(配体)。这和 binding site preorganization(结合位点预组织)这个经典观点一致:一个好的结合口袋,往往在配体来之前就已经把很多侧链预先排好,配体只是把这个构象稳定下来。

Fig. 4:真正有说服力的是把失败设计救回来

Fig. 4

Fig. 4:LigandMPNN 的实验验证:作者用它重新设计先前失败或很弱的小分子结合蛋白,救回 rocuronium(罗库溴铵)结合,并把 cholic acid(胆酸)案例推进到纳摩尔级结合亲和力,图中报告的 KD 为 331.3 nM。

Fig. 4 是这篇文章从基准测试走向真实设计的部分,也最能说明 LigandMPNN 为什么值得放进工具链。作者拿了先前 Rosetta 设计中失败或很弱的小分子结合蛋白,重新用 LigandMPNN 设计序列,看看能不能把 binding(结合)救回来。

第一个例子是 rocuronium(罗库溴铵)。先前的 Rosetta 设计没有检测到结合,LigandMPNN 重新设计后恢复或引入了关键的 sidechain-ligand hydrogen bond(侧链-配体氢键)相互作用。作者用 yeast display(酵母展示)和流式细胞术检测,条件包括 1 μM 生物素化 rocuronium 以及 streptavidin phycoerythrin(链霉亲和素-藻红蛋白)标记,结果显示原本不结合的设计被救回来了。

第二个例子是 cholic acid(胆酸)。先前设计只有很弱的结合,LigandMPNN 重新设计后显著提升 affinity(亲和力)。图中 fluorescence polarization(荧光偏振)实验报告的 KD 为 331.3 nM,已经进入纳摩尔级。论文还提到,在一个已有胆酸结合蛋白晶体结构出发的案例中,LigandMPNN 带来了约 100-fold(100 倍)的亲和力提升。

作者还做了一个重要检查:训练数据里没有 rocuronium 结合蛋白复合物结构;对胆酸,PDB 中最接近的已知结合蛋白与设计目标的 TM-score 只有 0.59,而且结合位置不同。这个细节很关键,因为它说明 Fig. 4 不是简单记住训练集里的同款口袋,而是在一定程度上学会了原子环境和序列选择之间的关系。

对设计工具来说,最硬的证据不是基准测试多漂亮,而是能不能把一个原本不工作的设计推到可测的实验信号。Fig. 4 给的正是这种证据。

边界与启发

LigandMPNN 的定位需要说清楚。它不是一个从零生成结合蛋白骨架的模型,也不会自动替你决定 ligand(配体)该放在哪里。它更像是一个强力的 sequence design(序列设计)步骤:当你已经有蛋白骨架、目标分子坐标和大致结合构象时,它负责在这个原子环境下给出更合理的序列。

这也意味着它非常适合接在其他设计工具后面。比如先用 RFdiffusion 或 Rosetta 生成候选骨架,再用 LigandMPNN 进行功能位点感知的配序列,最后用 AlphaFold、Rosetta 或实验筛选去过滤。对 AI4Bio 的实际项目来说,这种“生成骨架 - 原子上下文配序列 - 结构/实验验证”的分工,会比把所有事情压给一个模型更稳。

边界也存在。第一,模型训练来自 PDB 中截至 2022 年 12 月 16 日的结构,筛选条件包括 X-ray/cryo-EM(X 射线/冷冻电镜)分辨率优于 3.5 Å、总长度小于 6000 个残基,以及 30% sequence identity(序列一致性)聚类划分。PDB 里稀有化学元素和罕见配体本来就少,所以论文也提醒,遇到训练中很少或没有出现的元素时,可能需要映射到相近元素,或者结合物理方法处理。

第二,模型的输入仍然依赖相对可信的三维坐标。若 ligand pose(配体构象)本身错了,LigandMPNN 很可能只是围绕一个错误假设认真配序列。第三,侧链末端构象和水分子、质子化状态、诱导契合等细节,仍然不是这篇文章完全解决的问题。

但放在 David Baker 系列里,这篇文章的意义很清楚。早期 ProteinMPNN 让蛋白骨架配序列变得又快又好;LigandMPNN 则把这个能力推进到功能位点。它承认一个现实:蛋白不是孤立折叠的雕塑,很多时候它是为了识别另一个分子而存在。当设计目标从“折得对”走向“做得成”,模型就必须开始看见那些真正发生化学作用的原子。

论文信息与发布提醒:
来源:https://www.nature.com/articles/s41592-025-02626-1
DOI:10.1038/s41592-025-02626-1

【声明】内容源于网络
0
0
AI4Peptide
专注探索人工智能在多肽药物设计与研发中的应用,定期发布相关的前沿研究、技术解析和行业动态,迎接未来智能药物研发的新时代。
内容 11
粉丝 0
AI4Peptide 专注探索人工智能在多肽药物设计与研发中的应用,定期发布相关的前沿研究、技术解析和行业动态,迎接未来智能药物研发的新时代。
总阅读135
粉丝0
内容11