论文标题:Designing enzymes for new-to-nature chemistry and non-natural substrates with AlphaProtein Novo
作者团队:Zachary Wu, Josh Abramson, Thomas Frerix, Alexander E. Chu 等(Google DeepMind、加州理工学院、匹兹堡大学等)
文章链接:https://doi.org/10.64898/2026.10.01.756017
导言:打破自然进化的桎梏,开启酶工程新纪元
在生物化学领域,为任意化学反应量身定制高效的催化酶,一直是被誉为“圣杯”的终极目标。它不仅能彻底颠覆现代制药工业,更能为绿色化工和环境可持续发展提供终极解决方案。长久以来,定向进化(Directed Evolution)是优化酶活性的黄金标准,但这一路径极其依赖于大自然中已有的天然酶序列作为“起点”。如果大自然从未合成过某种特定分子,我们又该去哪里寻找起步的基石?
从头设计(De novo design)为我们提供了一条跳出自然限制的破局之路——从第一性原理出发,直接创造自然界中不存在的全新酶。然而,此前从头设计的酶在催化效率上往往远落后于天然酶,极少能在实际应用中真正超越传统的天然序列挖掘方法。
今天,这一历史被彻底改写。Google DeepMind联合加州理工学院(Frances H. Arnold团队)和匹兹堡大学等顶尖科研力量,隆重推出了名为 AlphaProtein Novo (AP Novo) 的机器学习酶从头设计管线。该研究首次在极具挑战性的化学反应中证明:人工智能从头设计的酶,其表现可以直接击败传统的天然序列挖掘策略!
无论是用于合成重磅药物核心骨架的高选择性酶,还是能够在极端变性条件下强效降解环境毒素的工程酶,AlphaProtein Novo 都交出了令人惊叹的答卷。同时,该研究还揭示了基于AlphaFold 3的构象预测以及全新的序列系综打分机制(Sequence-ensemble-based scoring),为未来的计算生物学指明了方向。
一、精准控制区域选择性:合成药物核心骨架“哌啶”
在第一项核心挑战中,研究团队将目光投向了非天然化学领域:利用碳氢键(C-H)胺化反应合成哌啶(Piperidine)。哌啶是现代药物化学中最常见、最重要的含氮杂环骨架之一,广泛存在于FDA批准的众多药物中。
对于(5-叠氮戊基)苯底物的竞争性环化反应,通常存在两种产物:通过有利的1,5-氢原子转移(HAT)几何构型生成五元环的吡咯烷(Pyrrolidine),或者通过断裂能较低的苄基C-H键生成六元环的哌啶。此前,基于天然血红素蛋白或工程化P450酶的催化往往严重偏向于生成五元环的吡咯烷。研究人员在筛选了188种天然及已报道的突变体序列后发现,即使是表现最好的天然支架,其生成哌啶与吡咯烷的比例也从未超过 30:70,这凸显了利用现有自然支架实现六元环主导选择性的巨大难度。
AlphaProtein Novo 展现了其对支架几何构型的惊人控制力。通过输入特定的氮宾中间体或产物构象作为催化基序,AP Novo 成功生成了具有不同区域选择性的全新血红素结合蛋白。在第二轮专门针对哌啶合成的设计中,研究团队获得了极具突破性的催化剂 GDM_NT_270。该设计彻底逆转了自然酶的催化偏好,实现了高达 99:1 的哌啶区域选择性(r.r.),以及 94% 的对映体过量率(e.e.),并且完成了22次催化转化。这标志着计算设计酶首次在区域选择性这一复杂化学难题上提供了与自然界完全正交的优质起点。
图1:利用 AlphaProtein Novo 设计催化非天然反应的全新酶
• 分图 A:AP Novo 设计管线流程示意图。展示了从输入催化基序,到扩散模型生成三维结构,再到通过多重指标过滤并进行实验验证的完整闭环。 • 分图 B:氮宾转移酶催化生成吡咯烷与哌啶的竞争性反应路径方程式。 • 分图 C:AP Novo 设计的高区域选择性全新支架氮宾转移酶 GDM_NT_121 的三维结构全景及活性中心放大图(清晰展示了轴向配体与底物的结合姿态)。
• 分图 D:天然序列挖掘与 AP Novo 第一轮、第二轮设计在哌啶合成任务中的活性命中率对比柱状图。灰色代表具备基础活性的命中率,蓝色代表具有哌啶高度选择性的命中率,直观展现了 AI 设计在选择性上的压倒性优势。 • 分图 E:DEHP(邻苯二甲酸二(2-乙基己基)酯)水解降解为 MEHP 的反应方程式。 • 分图 F:具备高活性的 DEHP 降解酶 GDM_DEHP_376 的结构预测图及其丝氨酸催化三联体、氧负离子洞的精细构型。
• 分图 G:针对 DEHP 降解任务,历经三轮设计的命中率演变图,展示了全新支架(蓝色)与回收支架(灰色)的迭代提升过程。 • 分图 H:人工设计酶 GDM_DEHP_376 与天然对照酶(QHH、Q7SIG1)在不同严苛条件(如90摄氏度高温、75%乙腈溶液)及不同反应时间下的 MEHP 生成总转化数(TTN)对比柱状图,彰显了设计酶卓越的极端环境耐受力。
二、挑战自然极限:在极端环境中降解环境毒素DEHP
除了开辟新化学反应,AP Novo 在拓展已知酶学机制的底物范围上也展现了惊人潜力。DEHP(邻苯二甲酸二(2-乙基己基)酯)是一种极其泛滥的塑料添加剂和严重的环境内分泌干扰物。自然界中极其罕见能够降解DEHP的丝氨酸酯酶,原因在于其两条 2-乙基己基 侧链带来的巨大空间位阻。更棘手的是,DEHP 在水中的溶解度极低(约 0.3 mg/L),需要高浓度的有机溶剂助溶,而这些有机溶剂会直接导致绝大多数天然酶变性失活。
为了解决这一难题,研究团队从天然水解酶晶体结构中提取了“丝氨酸-组氨酸-天冬氨酸”催化三联体和氧负离子洞基序,并利用 AlphaProtein Novo 构建了能够容纳巨大底物的全新支架。在历经三轮设计后,全新支架设计的活性命中率(达到天然酶QHH活性的2%以上)提升至11%。相较于近期一项筛选了65种天然酯酶仅发现1种微弱活性酶的研究,AP Novo 的成功率可谓实现了数量级的跨越。
最令人振奋的是这些设计酶展现出的独特物理化学性质。以表现最优的 GDM_DEHP_376 为例,它在 90摄氏度 时的催化活性是室温下的14倍!不仅如此,在高达 75%的乙腈(Acetonitrile) 水-有机溶剂极性混合物中,它的活性甚至比在纯水缓冲液中翻倍。而在相同条件下,包括来自嗜热菌的天然酶 Q7SIG1 在内的所有天然对照酶,活性均完全丧失。极性有机溶剂通常会深入破坏蛋白质的疏水核心并剥离表面的水化层,是极其苛刻的变性条件。GDM_DEHP_376 不仅体积比天然酶小40%到60%,在大肠杆菌中的表达量也更高。这种大自然中极为罕见的极端稳定性,为未来的工业级生物修复铺平了道路。
三、刷新行业标杆:在经典模型反应中实现顶尖催化效率
为了深入验证设计管线的潜力并总结设计规律,研究团队还在三个被广泛研究的模型反应上进行了大规模的设计-测试-学习循环:Kemp消除反应(测试单步破环)、丝氨酸酯酶催化 4MU-Ac 水解(测试多步复杂构象控制)以及通过碳烯转移实现苯乙烯环丙烷化(测试非共价辅因子和立体选择性)。
其取得的成果打破了以往“必须依靠多轮湿实验定向进化才能获得高活性”的刻板印象:
-
1. Kemp消除酶:最优设计 GDM_KE_1483 在 pH 7.5 条件下,kcat/Km 值达到了 14,600 M-1s-1;另一款设计在 pH 10 下更是突破了 45,000 M-1s-1,比此前发表的最好从头设计基准高出了整整70倍。 -
2. 丝氨酸酯酶 (4MU-Ac):最优设计的 kcat/Km 值高达 360,000 M-1s-1。而即使是排除了与天然丝氨酸水解酶拓扑结构相似的设计,纯粹的全新非天然拓扑结构酶也达到了 4,900 M-1s-1 的优异效率。 -
3. 碳烯转移酶:在不需要任何实验室中期优化的前提下,单轮设计直接实现了 >99:1 的非对映选择性,以及 96% 的对映体过量率(e.e.)。
图2:AlphaProtein Novo 在经典模型反应中的顶尖设计成果
• 分图 A:Kemp消除反应(5-NBO的单步开环反应)化学方程式。 • 分图 B:丝氨酸酯酶催化的 4MU-Ac 多步水解反应化学方程式。 • 分图 C:Kemp消除酶在第1至第7轮设计中所有被测试序列的反应速率(k_obs)分布趋势,叠加了命中阈值与检测下限虚线。
• 分图 D:活性极高的 Kemp消除酶 GDM_KE_1483 的 AlphaFold 3 预测整体结构及其活性中心(显示催化碱与底物模拟物)细节。 • 分图 E:GDM_KE_1483 的经典米氏动力学(Michaelis-Menten)拟合曲线,展示了极高的底物亲和力与催化速率。 • 分图 F:丝氨酸酯酶在不同设计轮次中所有被测试序列的反应速率(k_obs)分布图,区分了天然拓扑(NSE)与非天然拓扑结构。
• 分图 G:高活性非天然拓扑丝氨酸酯酶 GDM_SE_2754 的预测结构及复杂的活性口袋氨基酸排布。 • 分图 H:GDM_SE_2754 的米氏动力学拟合曲线(灰色曲线表示引入了底物抑制效应的拟合结果)。 • 分图 I:苯乙烯环丙烷化反应(通过碳烯转移)的制备级化学方程式。
• 分图 J:碳烯转移酶 GDM_CT_103 的三维结构侧视图以及活性口袋内血红素与底物分子的结合模式。 • 分图 K:碳烯转移酶设计的 LC-MS 对映选择性与非对映选择性定量表征图表,显示了近乎完美的构型控制能力。
四、方法学革命:AlphaFold 3 几何过滤与序列系综打分
AlphaProtein Novo 之所以能够取得如此恐怖的成功率,并非仅仅因为扩散模型本身的强大,更在于研究团队基于生物化学第一性原理,开发出了一套革命性的 “硅基筛选(in silico filtering)” 机制。
1. 基于 AlphaFold 3 的反应机制几何过滤
酶的催化需要极其精准的原子级空间预组织(Pre-organization)。研究人员利用 AlphaFold 3 (AF3) 对设计的酶进行了多状态预测(如结合底物状态 ES,与过渡态模拟物结合状态 TI1 等)。研究发现,如果 AF3 预测的结构中,催化残基与底物或过渡态关键原子之间的距离和角度符合量子化学机理,该设计的实际成功率就会呈指数级上升。例如在 Kemp 消除反应中,严格限制催化碱(谷氨酸/天冬氨酸)与底物氮原子之间的距离进行过滤,使实验命中率直接提升了近3倍!而在丝氨酸酯酶中,ES 状态与 TI1 状态之间配体构象的低 RMSD 偏差(意味着酶能稳固地锁定底物进行亲核攻击),与最终的实验催化速率呈现出强烈的负相关性。
图3:基于 AlphaFold 3 多状态预测的生物化学几何过滤策略
• 分图 A:Kemp消除酶设计中,典型的失活设计(上)与高活性设计(下)在催化碱、氢键供体与过渡态模拟物几何位置上的显著差异对比图。 • 分图 B:左侧展示过滤前催化碱与底物特征原子距离的分布(活性设计集中在短距离区);右侧柱状图展示在后续轮次中加入几何过滤后,命中率与平均催化速率的显著跃升。
• 分图 C:丝氨酸酯酶的失活设计(上)与活性设计(下)在 ES状态(彩色)与 TI1状态(灰色)下配体位置的重叠情况,活性设计展现出极低的 RMSD 偏差。 • 分图 D:丝氨酸酯酶设计中,ES-TI1 状态间配体最小 RMSD 与实验测得的对数反应速率(Log10 k_obs)呈现明显的负相关散点及密度等高线图。
2. 多重重测序(MR)与多重部分扩散(MPD)打分机制
这是本次研究最深刻的方法学洞见之一。以往的设计往往评估“一条蛋白质序列”是否能折叠成特定结构。而 AP Novo 团队引入了 多重重测序(Multi-resequence, MR) 策略:针对扩散模型生成的一个蛋白质主干(Backbone),使用 LigandMPNN 生成10条不同的氨基酸序列。如果这10条序列中有大量序列都能通过 AF3 的严苛几何过滤,说明这个主干具有极强的鲁棒性,为其提供了极其广阔的“功能序列空间”。
实验数据证明了这一逻辑的伟大:经过严格 MR 过滤的 Kemp 消除酶命中率提高了超过两倍(达到23%);而丝氨酸酯酶的命中率暴涨了30倍,高达 44%!
更进一步,团队利用 AP Novo 扩散模型本身对序列添加少量噪声并重新降噪(类似于在主干附近进行局部结构-序列联合采样),提出了 多重部分扩散(Multi-partial-diffusion, MPD) 过滤。当研究人员将 MR 过滤和 MPD 过滤结合,要求生成的10条测序结果全部通关时,Kemp 消除酶的命中率达到了惊人的 60%,丝氨酸酯酶命中率甚至触及了 80% 的理论天花板。这一机制完美解释了为何业内流行的“迭代重设计”管线往往有效——其本质正是在隐式地筛选那些具有宽广功能盆地(Functional Basins)的优质蛋白质主干。
图4:基于序列系综打分(多重重测序与多重部分扩散)的震撼效果
• 分图 A:多重重测序 (MR) 与多重部分扩散 (MPD) 结合 AlphaFold 3 过滤的打分流程概念示意图。 • 分图 B:Kemp消除酶设计中,通过过滤的重测序序列数量与最终活性的回溯性分析(左),以及引入 MR 过滤后的前瞻性高命中率(23%)展示(右)。 • 分图 C:丝氨酸酯酶设计中对应的 MR 回溯性与前瞻性分析。引入 MR 过滤后,命中率从 1% 飙升至 44%。
• 分图 D:针对 Kemp 消除反应,联合使用 MR(横轴)与 MPD(纵轴)通过数量的二维热力图,揭示了在最严苛过滤条件下(10/10)不仅能获得高达 60% 的命中率,还能显著提高平均催化效率。 • 分图 E:针对丝氨酸酯酶的二维热力图分析,同样证明了 MR 与 MPD 联用可以锁定极高活性的序列,且最优过滤条件下的理论命中率可达 80%。
五、深入验证:突变分析、热稳定性与高度结构创新
为了确保这些计算机生成的酶的确是依靠其设计的活性中心执行催化功能,团队进行了严谨的定点突变验证。结果毫无悬念:当敲除 Kemp 消除酶的关键催化碱或丝氨酸酯酶的催化三联体时,酶的活性出现了断崖式下跌甚至完全丧失,这有力地证明了设计的催化机制在原子层面是精准运作的。
在热稳定性测试中,所有被测试的 AP Novo 设计酶在经受高达 80摄氏度(甚至更高)的高温孵育10分钟后,依然能保持满血活性甚至活性微升。相比之下,天然对照酯酶 CES1 在 60度 时便已全军覆没。这种极其强悍的热稳定性,不仅有利于工业生产中的长效使用,也为后续通过定向进化进一步打磨活性预留了极大的冗余空间。
更为重要的是,研究人员通过 Foldseek 与整个已知蛋白质结构数据库(PDB)进行对比,发现 AP Novo 生成的绝大多数设计酶的 TM-score 中位数仅为 0.33。这意味着它们不仅在序列上与大自然完全无关(最高序列相似度不足29%),在三维折叠骨架上也是前所未见的“异类”。这证实了从头设计真正兑现了它的承诺——将人类探索的触角,伸向了浩瀚而未知的蛋白质宇宙。
图5:活性中心验证、热稳定性评估及支架结构新颖性分析
• 分图 A:Kemp消除酶关键催化位点(如催化碱Base、氧负离子洞OAH)定点突变前后的产物生成曲线,证明突变导致活性大幅下降或消失。 • 分图 B:丝氨酸酯酶催化三联体及氢键网络突变实验的活性曲线,验证了反应完全依赖于预测设计的活性位点。
结语:迈向完全可编程的化学催化
AlphaProtein Novo 无疑在酶从头设计领域竖起了一座全新的丰碑。该管线首次正面击败了天然序列挖掘这一长久以来的行业惯例,让我们有能力为极难的区域选择性反应或顽固的环境毒素直接“凭空捏造”高效的降解机器。
尽管目前的计算设计酶的绝对催化速率相比于经过千万年进化或长期定向进化打磨的完美酶仍有一定差距,且其严重依赖于人类专家的先验化学机理假设,但多重序列系综打分(MR与MPD)等概念的提出,为解决从骨架到序列的复杂映射指明了方向。
结合当前基因合成技术与高通量检测技术的爆发,我们有理由相信:“创造并理解(Understanding by creating)”这一计算设计的核心信条,正以前所未有的规模和速度照进现实。人工智能不仅能折叠已知的生命,正在大踏步地谱写自然界中从未存在过的生命化学乐章!

