
AlphaFold 之后的最大震撼已然降临。
OpenAI 总裁 Greg Brockman 转发的一条消息引爆科技与医药圈:知名科学家 Andrew Aiginin 宣布,在严苛的独立基准测试中,GPT-6 Astra 击败所有前沿模型,成为抗体可开发性预测的最强 AI。

Astra 不仅斩获跑分第一,更在短短 1 小时内构建了复杂的抗体机理交互式可视化页面。这一突破打破了"AI for Science 必须使用专用模型”的行业共识,标志着通用大模型正式切入生物医药研发中最难量化的临床前核心环节。
构建该测试基准的顶尖 AI 制药团队 Insilico Medicine 随后在 arXiv 发布重磅论文,揭示了从小分子化学合成到大分子抗体预测,通用大模型正在全面接管科学边界。

标题:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
37.98 分!GPT-6 登顶权威「DDD 基准测试」
实测数据显示,GPT-6 Astra 接入 DDD Benchmark 中的抗体可开发性测试模块(综合 6 种不同抗体实验数据)后,取得 37.98 分的惊人成绩,碾压所有受测模型。
AI 学者 Rim Shayakhmetov 惊叹道:“在不依赖外部专用工具的情况下,前沿大语言模型能在药物发现基准测试中如此闪耀,实属罕见。”

在没有专业生物信息学插件、未进行抗体数据微调的前提下,通用大模型直接切中抗体成药性命脉,这一进展令业界兴奋不已。
发现抗体只是开始,「成药」才是真正的死亡之谷
理解 GPT-6 Astra 成绩的含金量,需先认清医药界的残酷现实。Andrew 指出:“找到能结合的抗体仅是起点,关键在于其是否聚集、稳定,以及能否真正发挥药效。”
过去,抗体药物研发聚焦于“结合力”,即抗体识别并结合靶点的能力。早期 AI 模型如 AlphaFold 在此领域表现卓越。然而,“能结合”并不等于“能成药”。

现实中,无数“完美抗体”在进入真实生理环境或工业生产环节时,会暴露致命缺陷:聚集、结构不稳定或无法表现得像一款真正的药物。这些属性统称为“抗体可开发性”,是生物制药界的“死亡之谷”。
全球每年成千上万个抗体分子倒在成药性评估阶段,导致药企耗费数十亿美金及数年时光却颗粒无收。如今,GPT-6 Astra 宣称能比任何现有模型更精准地预测这些特征。
揭秘试金石:GPT-6 Astra 面对的「地狱级」基准测试
Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台是他们构建的 DDD Benchmark。相关论文展示了该团队在小分子化学领域建立的硬核评测标准。
研究团队聚焦制药界世纪难题——单步逆合成,即从目标药物分子倒推合成原料。传统评测依赖专利数据库匹配,限制了 AI 探索未知的能力。

Insilico 团队构建了严苛的测试环境:
1. URSA-expert-2026 基准:包含 100 个由机器生成并经人类专家确认的全新分子数据集,与公开训练数据隔离,杜绝“背题”。
2. ChemCensor 打分系统:不看是否复刻专利,而是从反应中心映射、官能团兼容性等底层化学物理规则出发,判断反应的化学合理性。
在此类考核下,传统 LLM 几乎全军覆没。即便是 GPT-5.5、Gemini 3.1 Pro 等强力模型,表现也未超越顶尖专用化学模型。
4500 万数据,LLM 被「逼出」科学直觉
论文提出三大策略,解锁大模型在化学领域的潜力:
第一招:Top-K 提示词范式
针对逆合成“一对多”特性,团队要求模型输出多种答案。切换至 Top-K 模式后,各大模型在化学合理性和多样性上迎来爆发式增长,证明大模型具备科学知识,仅因提问方式受限而未显现。

第二招:构建超大核验数据集
团队利用虚拟合成引擎和 ChemCensor 框架,构建了包含约 4560 万个经过验证的真实化学反应数据集(CREED-CCV-2+USPTO-XL),用于训练化学限制对齐的语言模型(C3LM)。

第三招:强化学习中的「新颖性」奖励
引入 GRPO 强化学习算法,奖励函数设定为:若模型生成的合成路径既符合化学合理性,又超出训练集范围,将获得额外奖励。
经此训练,C3LM 在盲测中击败所有传统专用模型,并探索出与传统模型互补的反应空间。

降维打击:从 C3LM 到 GPT-6 Astra,通用智能的全面接管
Insilico 团队耗费巨大资源才让小分子化学合成取得突破,而 GPT-6 Astra 在未使用外部工具的情况下,直接在更复杂的大分子可开发性预测中登顶,堪称降维打击。
GPT-6 Astra 的通用世界模型似乎已内化物理、化学、生物的底层逻辑,能像人类专家般“直觉”判断蛋白质分子的溶液行为。
此外,Astra 展现出惊人的工程效率:原本需数周完成的交互式可视化系统,现在仅需 1 小时即可由单人配合大模型完成。
AlphaFold 之后,真正的范式转移
GPT-6 在抗体基准上的夺魁,宣告通用大模型已在人类顶尖智力活动中取得实质性统治地位。未来十年,科学发现的核心驱动力将不再是定制专用模型,而是学会向超级智能提出正确的问题。
从小分子逆合成到大分子抗体成药性,通用大模型的外溢红利即将席卷新药研发、材料科学、聚变控制及量子物理等硬核行业。
参考资料:
编辑:Aeneas 大卫

