非天然氨基酸的引入为环肽设计提供了更丰富的化学多样性,也对残基表示、结构预测和序列优化提出了更高要求。今天分享一篇段宏亮团队2026年发表于European Journal of Medicinal Chemistry的HighPlay2,将60种非天然氨基酸、可变长度序列搜索和结构约束评分整合为统一的设计框架,并通过分级计算筛选与SPR实验,在MDM2和GABARAP上获得了微摩尔级结合候选。
该框架的重要价值在于,将非天然残基作为设计变量直接纳入迭代优化,使化学空间扩展与靶点界面适配能够协同开展。从化学信息的显式表示,到候选序列的生成、结构评价与实验验证,HighPlay2形成了较为完整的技术流程,为含非天然氨基酸环肽的结构引导设计提供了具有实验支持的方法基础。
1 研究背景
蛋白质之间的结合界面往往较大、较浅,未必存在适合小分子进入的深口袋。环肽能够通过多个残基覆盖界面,而环化有助于限制构象自由度,因而具有靶向此类界面的研究价值。非天然氨基酸(non-canonical amino acids,ncAAs)进一步提供了天然残基中缺少或不充分的化学特征,例如额外的芳香基团、卤素取代或特殊侧链。它们为亲和力、选择性和稳定性的后续优化提供了可能性。然而,残基种类的增加并不必然提高设计效率。将扩展后的化学空间用于候选发现,主要面临以下三方面挑战:
化学表示:非天然残基的编码需要关联明确的原子组成、键连接和立体化学信息。
结构预测:模型对非天然残基的表示能力,仍需与其构象和相互作用预测准确性分别评估。
序列搜索:残基类别与肽长的共同变化显著增加了候选组合数量。
HighPlay2通过整合化学表示、序列搜索和结构评价,将ncAAs作为设计变量纳入迭代优化过程。
2 核心思路:联合优化残基组成、肽长与界面匹配
HighPlay2延续前代HighPlay的蒙特卡洛树搜索与策略与价值网络框架,主要扩展了三个方面。
作者选取20种天然氨基酸和60种ncAAs。后者的两个筛选条件是:具有商业可获得性,以及在化学组分字典(Chemical Component Dictionary,CCD)中有可识别的三字母编码。CCD编码使结构预测后端能够读取残基的原子组成、键连接及化学拓扑,从而为非天然残基提供明确的化学身份与建模输入。
这60种残基是兼顾合成可及性与建模兼容性的实用集合,不能代表全部非天然氨基酸空间。
算法采用固定最大长度的序列表示,并允许部分位置使用空白标记。在构建实际肽序列时,依次读取非空白位置,以确定有效序列及其长度。例如,表示序列[C, A, ∅, G, C]对应实际肽序列CAGC。空白标记替换为氨基酸对应残基插入,氨基酸替换为空白标记则对应残基删除。该机制将残基替换、插入和删除统一为位点赋值操作,使网络能够在固定维度的动作空间中处理可变长度序列。输入表示为最大长度L乘以81类符号的独热编码矩阵,其中81包括80种残基和1个空白标记。
本文实际评估的环化方式主要是两端半胱氨酸之间的二硫键。该拓扑应与N端和C端主链之间形成酰胺键的头尾环化区分。作者讨论了其他共价闭环方式的编码可能性,但未对它们进行系统验证。
HighPlay2使用结构约束目标评分(Structure-Constrained Objective Score,SCOS)评价候选。它综合预测置信度与热点几何关系,用于优先选择具有较高预测可信度和界面匹配程度的复合物模型。
3 模型框架
图1A是迭代设计闭环。输入包括靶蛋白序列、候选肽序列、残基化学定义和环化约束;若已有口袋或热点信息,也可提供相应定义。Boltz-2预测蛋白质与环肽复合物,SCOS对预测模型进行评分,随后树搜索与策略与价值网络指导新一轮替换、插入和删除。
网络包含策略与价值两个输出分支,分别估计序列编辑动作的概率与候选质量。评价结果沿搜索路径回传,用于更新节点信息,并在后续搜索中平衡高评分分支的利用与未充分访问分支的探索。
图1B展示分级筛选流程。作者先根据Boltz-2结构指标过滤,再使用Rosetta InterfaceAnalyzer考察界面能量,之后对选定候选开展分子动力学(MD)分析,并在部分靶点上合成肽、进行表面等离子体共振(SPR)检测。该流程输出候选序列、预测复合物结构及多层次评价结果,为后续实验验证和药物化学优化提供依据。
4 关键公式:结构评分、搜索准则与训练目标
按正文方法部分的定义展开,评分为:
距离项在3.5 Å时取得最大值0.5,并随距离偏离该值而下降,体现了对适宜界面距离的约束。已知口袋时,距离根据预定义口袋原子到肽的最近距离计算;未知口袋时,则利用预测接触概率选出热点对并计算距离。
在已知热点模式下:
Pred是预测接触的受体残基集合,Pocket是用户指定的热点集合。若预测接触全部落在热点中,精确率为1;若没有重叠,则为0。该指标衡量接触精确率,不代表热点覆盖率;仅接触少数预定义热点时,也可能获得较高精确率。
论文使用的选择准则为:
s表示当前序列状态,a表示一次编辑动作;v是价值估计,p是策略给出的动作先验,N是访问次数,ω控制探索强度。第一项优先选择价值估计较高的动作,第二项依据动作先验与访问次数提供探索增益。同一动作的访问次数增加时,其探索增益减小;增大ω则提高探索项的相对权重。该公式用于搜索节点选择,不参与训练损失的直接计算。
论文给出的损失为:
其中r是结构评价奖励,v是价值分支预测,p是策略输出,π是策略学习目标的原文记号,θ为网络参数,c为正则权重。主文将π描述为采样突变动作,但未在该处进一步说明其具体编码或分布构造方式。
价值误差项:使预测价值接近结构奖励。两者一致时,该项为零。
策略学习项:使网络提高对目标动作的预测概率;该概率过低时,惩罚增大。
参数正则项:限制参数规模,降低过度拟合当前搜索反馈的风险。
5 数据与评估:样本构成及报告范围
HighPlay2采用由20种天然氨基酸和60种非天然氨基酸组成的残基字母表,通过迭代序列搜索与结构评价生成候选。跨靶点评估涵盖6个蛋白靶点,各获得数百条满足肽链pLDDT>80、归一化ipAE<0.2及ipTM>0.8的候选;经进一步筛选后,所展示的代表性序列长度为10至18个残基,含1至3个非天然氨基酸。实验评估中,5条MDM2候选均完成合成与SPR测定,GABARAP的5条入选候选中4条完成合成与测定,另1条因合成失败未接受测试;MCL1候选仅开展计算评估。
6 跨靶点结果:流程适用性
图2A展示了带有CCD编码的残基及其化学结构,支持特殊原子和基团在模型中得到显式保留。图2B用表格列出代表候选的序列、置信度、ncAA数量及Rosetta界面指标;图2C展示候选与不同界面的几何匹配。
这些结果表明流程可以在多个靶点上产生满足预设筛选标准的候选。支持搜索对预设结构指标的优化能力,但不足以确定跨靶点实验成功率。此外,非天然残基的显式化学表示与其三维构象、氢键及卤素相关相互作用的预测准确性,仍需分别验证。
7 靶点案例
作者围绕MDM2的p53结合界面设计候选,并对前五条进行合成和SPR测定。结果如下,数值采用正文报告精度。
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
图3A至F为预测结构及接触分析;G、I的横轴为模拟时间、纵轴为骨架均方根偏差(RMSD),用于观察100 ns内的构象变化;H汇总实验KD与MM/GBSA能量估计。其中计算指标与实验亲和力的排序并不完全一致。例如,MDM2-CP4的MM/GBSA估计为−54.87 kcal/mol,低于CP3的−43.50 kcal/mol,但CP4的实验KD更大,提示其亲和力较低。说明较有利的模拟能量估计并不必然对应较高的实验亲和力。
在所测候选中亲和力最高的CP3还接受了重复结构预测和延长MD模拟评估:20次Boltz-2预测都落在同一结合沟槽内,其中17个属于主要构象簇;相对最高置信度模型的肽骨架RMSD中位数为1.74 Å。进一步的1 μs模拟中未观察到解离,肽中磷酸化丝氨酸与MDM2 Arg96形成盐桥的轨迹占有率约70%。
GABARAP属于ATG8相关蛋白家族,具有识别LIR短肽基序的表面区域,为环肽设计提供了可定位的界面。
图中A至C为预测接触,D的横轴为时间、纵轴为RMSD,E为候选指标与实验数据:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
这些结果支持选定分子与GABARAP结合,CP5虽具有较高预测置信度,但未能成功合成。
图5A至C给出BH3沟槽附近的预测结合模式,图D展示100 ns的RMSD,图E以时间为横轴、蛋白质与肽重原子接触数为纵轴,接触阈值为4.5 Å。接触数经过早期调整后进入平台,支持该预测姿态在模拟时间内维持界面接触。图F中前五条候选的MM/GBSA估计均低于−40 kcal/mol。文中作者还将代表候选与已知配体的实验复合物比较:MDM2-CP3、GAB-CP1、MCL1-CP2覆盖的参考接触残基比例分别为68.2%、60.9%、37.0%,这支持它们定位到已知或部分重叠的结合区域。
8 总结与启示
HighPlay2围绕含非天然氨基酸环肽设计中的关键问题,将化学表示、可变长度搜索、结构评价和实验筛选有机整合。其方法特色不仅体现在残基选择空间的扩展,还体现在通过统一的迭代机制协调序列组成、肽长与界面几何匹配,为复杂环肽候选的探索提供了系统化路径。并通过多靶点计算评估及MDM2、GABARAP的SPR结果,共同支持了这一框架用于早期结合候选发现的可行性。研究还将计算设计推进至可合成、可测定的分子层面,为后续亲和力优化和构效关系研究提供了明确起点,也体现了结构预测与智能搜索结合在扩展环肽设计空间方面的应用潜力。
在此基础上,进一步引入配对残基替换实验、功能测定及可开发性评价,有望更充分地发挥框架的化学空间探索能力。随着实验反馈逐步融入候选生成与评价过程,HighPlay2所建立的技术路线可为非天然环肽的多目标优化及药物发现研究提供有价值的方法参考。
原文链接
https://doi.org/10.1016/j.ejmech.2026.119160
往期文章
bioRxiv | David Baker团队发布RFOptimization,基于全原子结构预测的蛋白质设计极速优化框架
三环肽不再混成异构体:柔性四官能支架把拓扑控制带进mRNA展示
Mirror-Peptidizer:无需合成 L-蛋白,AI 全程计算设计 D-肽结合剂

