论文标题:RFOptimization: Guiding Design Optimization with All-Atom Structure Prediction
作者团队:Odin Zhang, Jiaqi Wang, Tuscan Rock Thompson, Ziyi You, Zihao Song, Frank DiMaio, and David Baker(华盛顿大学蛋白质设计研究所等)
文章链接:https://doi.org/10.64898/2026.09.04.749184
引言:突破计算蛋白质设计的高淘汰率瓶颈
计算蛋白质设计在推动生物分子互作工程(如针对治疗方法或合成生物学)方面发挥着核心作用。然而,目前从头设计(de novo design)管线在计算机模拟(in silico)验证阶段的成功率仍然极低,构成了该领域的主要瓶颈。以RFdiffusion等基于扩散的模型为例,研究人员通常需要采样数以万计的设计方案,然后通过极其严格的计算过滤标准,才能筛选出极少数适合进行湿实验验证的候选分子。
在这个过程中,大量的生成序列因为处于“决策边界”附近,即便包含了非常有潜力的结构特征,也会被残酷淘汰。针对这一痛点,诺贝尔化学奖得主David Baker团队提出了一种全新的无训练(Training-free)全原子生物分子结合剂优化框架——RFOptimization (RFO)。该框架通过结合基于梯度的局部搜索与基于正交模型的结构循环预测,能够将那些在传统管线中被判定为“失败”的边缘设计,在短短几分钟内转化为高质量、高置信度的候选分子,极大地提升了蛋白质设计的计算效率与成功率。
核心架构:双引擎驱动的局部序列探索
RFOptimization将结合剂的优化转化为一个残基级别的突变搜索问题。为了避免模型在单一预测器中出现过拟合并陷入“对抗性陷阱”(即序列只在某个特定模型中得分高,但在其他模型或真实世界中无效),RFOptimization巧妙地设计了两个互补的突变策略分支,并在每个优化步骤中以相等的概率(50%)交替调用:
-
1. 基于梯度的突变分支(Gradient-based mutation move):利用RoseTTAFold3 (RF3) 模型的梯度信息引导序列优化。 -
2. 基于循环的突变分支(Cycling-based mutation move):结合Boltz结构预测模型与MPNN(ProteinMPNN或LigandMPNN)进行结构条件下的序列重采样。
图注(Figure 1):RFOptimization全原子序列优化框架概览。
• 分图 1a:展示了RFOptimization框架广泛的输入兼容性。无论是蛋白质结构、配体结构还是SMILES字符串,该方法均能对蛋白质结合剂、环肽、酶及小分子结合剂等多种生物分子复合物进行精细优化,并展示了各类型优化后的三维结构实例。
• 分图 1b:展示了双分支混合优化策略的计算工作流。系统在每一轮迭代中,通过路由器(Router)随机选择基于RF3梯度的MCMC突变路径,或基于Boltz和MPNN的结构循环预测路径,从而在定向优化与结构重采样之间取得平衡。
1. 跨越扩散模块的梯度引导优化 (GradMCMC)
在基于梯度的优化中,最大的挑战在于RF3等先进模型的扩散模块(Diffusion Module)本身是不可导的,无法直接将梯度反向传播到输入序列。为了解决这一问题,RFOptimization在反向传播时应用了“停止梯度(stop-gradient)”技术,直接绕过扩散模块,转而从连接在Pairformer主干上的置信度头(Confidence head)和距离图头(Distogram head)计算目标损失。这一设计不仅极大地节省了计算资源(单次完整前向传播仅需45-60秒),还保留了对精细几何结构进行约束的能力。
为了防止优化器利用连续序列表示中的伪影(Artifacts),RFOptimization在每次迭代中严格将序列维持在离散的One-hot编码状态。每当候选突变产生,模型会重新运行RF3的标准特征化管线,从头生成原子级别的输入特征(包括原子类型、连接性等),确保梯度始终是相对于合法的离散序列计算得出的。
在搜索策略上,RFO采用梯度引导的马尔可夫链蒙特卡洛(MCMC)算法。系统根据归一化后的梯度矩阵提出离散突变,并结合模拟退火(Simulated Annealing)机制,利用Metropolis-Hastings准则决定是否接受突变。在优化初期,较高的温度允许序列进行广泛探索;随着温度呈几何级数衰减,搜索过程逐渐收敛于局部最优解。
2. 正交验证的结构循环重采样 (Boltz + MPNN)
为了避免模型仅在RF3中产生“自嗨”的高分,RFOptimization引入了独立的结构循环分支。该分支将当前序列输入到另一个独立的结构预测大模型(默认使用Boltz)中,获取复合物的全原子预测结构。随后,基于该预测主链骨架,系统使用ProteinMPNN(针对纯蛋白)或LigandMPNN(针对包含小分子/配体的靶点)进行逆向折叠。
为了确保关键结合界面的稳定性,系统会根据Boltz输出的原子置信度(pLDDT > 80且连续长度≥5)或界面距离(如与靶点距离<8Å的残基)自动冻结部分氨基酸序列,仅对非固定区域进行重采样,随后选择MPNN对数似然得分最高的序列作为下一次迭代的起点。
图注(Figure 2):RFOptimization的双分支突变生成管线详解。
• 分图 2a(梯度分支):展示了梯度回传的具体机制。前向预测(黑箭头)与损失反向传播(粉箭头)分离,目标函数直接由置信度模块和距离图模块计算,跳过扩散模块。生成的梯度图被输入GradMCMC模块,指导离散序列的突变更新。
• 分图 2b(循环分支):展示了基于正交预测器的循环机制。当前结合剂与靶点序列经过结构预测模型(如Boltz)处理后生成预测结构,随后送入LigandMPNN或ProteinMPNN中进行基于物理空间限制的序列采样,最终选取最优得分序列。
可定制化目标函数:定义任意设计准则
真实世界的蛋白质设计任务往往需要同时满足多个甚至相互竞争的条件。传统的生成模型优化内部固定目标,使得研究者只能在事后依靠过滤器进行筛选。而RFOptimization提供了一个极其灵活的、完全可微的目标函数定制系统,分为三大类:
-
1. 基于置信度的损失 (Confidence-based losses):例如界面预测对齐误差 (iPAE)、pLDDT分数、界面预测TM-score (iPTM)。这使得模型能够直接朝着提升结合稳定性的方向演化。 -
2. 基于距离图的代理损失 (Distogram-based proxy losses):无需等待三维坐标生成,直接从距离分布中计算接触损失(Contact losses,例如促进结合剂与靶标之间<22Å的链间接触,或<14Å的链内接触)以及界面距离信息熵损失(降低结合界面预测的不确定性)。 -
3. 原子级几何约束 (Atom-level geometric constraints):这对于酶设计或金属配位至关重要。用户可以指定任意两个原子之间的精确距离区间,RFOptimization通过平滑的惩罚函数确保设计严格符合催化所需的几何构型。
计算机模拟 (In Silico) 基准测试与应用成果
为了验证其实际效果,研究团队在不同生物分子设计任务上,使用独立于优化过程的AlphaFold3 (AF3) 对优化前后的序列进行了盲测评估(通过标准:AF3预测的 iPAE < 2.5 且 iPTM > 0.8)。结果表明,仅需1-10次迭代(约1-10分钟计算),RFOptimization便能将大量原本失败的设计“变废为宝”。
1. 蛋白质-蛋白质结合剂与环肽设计
在13个经典的治疗性蛋白质靶点(如PD-L1, InsulinR, IL-7Rα等)上,RFOptimization将RFdiffusion初始生成设计的平均成功率从 6.73% 飙升至 22.31%。其中在PDGFR、PDL1等靶点上获得了极大的绝对提升,部分靶点(如CD3d, FGFR2等)的成功率甚至实现了从0到近30%的突破。
对于更具几何约束挑战的环肽设计(测试了GABARAP, MCL1, MDM2, RbtA等靶点),RFOptimization同样将平均成功率从 1.25% 提升到了 12.57%。
2. 配体结合蛋白设计
针对小分子配体(FAD, IAI, OQO, SAM),RFO利用其全原子表示优势,精确优化了结合口袋的几何形状。优化后,针对这四种化学性质迥异的配体,设计的平均成功率从 5.62% 大幅增长至 24.91%。只需三轮迭代,所有靶点的成功率均突破了10%,证明了其在处理小分子互作时的高效性。
3. 酶设计与原子基序支架化
酶设计被公认为计算蛋白质设计中最具几何挑战性的任务,要求对特定原子进行精确的3D定位。在24个原子基序酶(AME)基准测试中,RFOptimization结合了催化残基的几何距离约束与整体骨架的pLDDT置信度奖励进行优化。结果显示,经过优化,绝大多数靶点的综合适应度损失显著下降,同时底物置信度稳步上升,实现了催化活性构型与整体结构稳定性的双赢。
图注(Figure 3):RFOptimization在四种生物分子设计挑战中的In Silico基准测试及性能评估。
• 分图 3a:蛋白-蛋白界面的优化性能。折线图展示了13个治疗靶点在10次迭代中iPAE与iPTM的轨迹,条形图显示平均成功率由6.73%跃升至22.31%。 • 分图 3b:环肽靶向优化的性能。展示了四个靶点的迭代演化轨迹,平均成功率从1.25%提升至12.57%,在GABARAP靶点上提升尤为显著。
• 分图 3c:小分子配体结合蛋白的优化。对四种辅助因子/配体的平均结合成功率由5.62%增加至24.91%,显示了全原子环境下的优异调节能力。 • 分图 3d:酶活性中心支架优化的适应度分布。箱线图对比了24个靶点在优化前后的复合适应度函数(几何约束+pLDDT),显示大多数设计的催化几何特征与整体折叠质量均得到显著优化。
• 分图 3e:跨模型一致性去偏分析。曲线对比了完整双分支方案、单一梯度消融、单一循环消融及Protein Hunter在AF3、Boltz和RF3三模型严苛共识标准下的通过率,RFOptimization在所有iPTM阈值下均保持领先。 • 分图 3f:计算成本效率对比。绘制了累计GPU小时数与成功设计数量的关系,RFOptimization平均获取一个通过过滤器的设计仅需约26 GPU分钟,远超其他对比方法的效率。
去偏机制与计算效率:真金不怕火炼
结构预测引导优化的一个潜在风险是“模型过拟合”。为了证明RFO的优化结果具有真正的泛化能力,研究团队引入了极其苛刻的 “三模型共识标准”:一个序列必须同时在AlphaFold3、RoseTTAFold3和Boltz中满足严格的评估阈值才能算作成功。
在消融实验中,完整包含梯度和循环两个分支的RFOptimization取得了12.08%的共识成功率,远高于仅使用循环分支(7.50%)、仅使用梯度分支(6.67%)或对比方法Protein Hunter(7.50%)。这证明了双分支结构极大地消除了单一模型的偏见。
在计算效率方面,得益于从“漫无目的的大规模搜索”向“目标导向的局部精细优化”的范式转变,RFOptimization在单张A100显卡上,平均只需约26分钟就能产出一个满足严格跨模型标准的高质量设计;相比之下,Protein Hunter需要约178分钟,而早期的BindCraft更是需要惊人的34小时。
总结与展望
RFOptimization通过一种无需重新训练的创新架构,完美反转了诸如RF3等全原子模型以获取梯度,并辅以Boltz结构重采样。这一机制填补了从头设计管线中粗筛与最终精修之间的巨大鸿沟,把大量处于淘汰边缘的设计方案快速转化为极具潜力的实验候选物。随着底层结构预测模型的不断迭代升级,RFOptimization这种即插即用的优化框架将展现出更为广阔的设计空间,为药物研发、酶工程及合成生物学提供了一个通用、极速且具备原子级精度的强大武器。

