AI 让科学猜想变得廉价,但验证依然昂贵,这一差距正在撕裂整个科研体系。
Google DeepMind 发布报告《Conjecture Machines: AI agents and the new validation bottleneck in science》,探讨了 AI Agent 涌入科学界后引发的变革与挑战。Agent 正将科学转变为高速运转的“猜想机器”,但物理世界的验证速度、同行评审机制及数据基础设施却难以跟上,新的瓶颈已然形成。
一夜赶超十年功
伦敦帝国理工学院微生物学家 José Penadés 的团队耗时近 10 年,研究超级细菌如何传播抗生素耐药性。2024 年,他将问题描述输入 Google DeepMind 的 AI Agent"Co-Scientist"。仅两天后,该 Agent 返回了 5 个按优先级排序的解释,其中排名第一的假设与团队十年研究的结论完全一致:某些超级细菌利用从病毒获取的“尾巴”作为钥匙,在不同宿主间跳跃。
这一案例揭示了基于 LLM 的 Agent 的核心能力:它不仅能规划步骤、并行调度子任务、纠错,还能调用外部数据库及操作机器人。不同于传统聊天机器人,Agent 具备自主拆解目标、执行并迭代的能力。
报告指出,Agent 能力的爆发源于三股力量:
- 前沿模型增强:顶级模型在 Humanity's Last Exam 等高难度科学基准上已超越人类专家,尤其是推理时计算(inference-time reasoning)赋予了其深度思考与推演修正能力。
- 脚手架(Scaffolding)成熟:包裹模型的代码框架提供了结构、记忆和工具调用能力。随着 Agent 间通信协议等标准的出现,通用性显著提升。
- 可定制性提升:通过"Agent 技能(skills)”,科学家可将方法论转化为文本指令,让 Agent 按特定流程工作。
计算生物学家 Natasha Latysheva 预判,科研工作将从“亲手执行”转向“高层编排”。科学家只需每日审查 Agent 的运行结果,调整方向并引导注意力。
猜想廉价,验证昂贵
Agent 最直接的改变是提供了永不知疲倦的数字助手,将文献梳理、数据分析等工作从数天压缩至几分钟。但更深层的结构性变化在于科研范式的重构。
斯坦福大学 Gary Peltz 在肝纤维化研究中,凭经验挑选的 2 个候选药物在实验中无效,而 Co-Scientist 挑选的 3 个药物中,有 2 个不仅阻断纤维化还促进了细胞再生。Agent 通过调度子 Agent 群,模拟人类研究小组的多样性假设、互评与迭代机制,且速度远超人类。
然而,报告也坦承 Agent 的软肋。Co-Scientist 负责人 Vivek Natarajan 指出,一个编造的事实即可毁掉整份报告,这需要领域专家进行甄别。他提出“认知谦逊(epistemic humility)”概念,即模型需明确知晓并表达其不确定性,但这在开放的科学推理中仍是难题。
此外,AlphaEvolve 等系统在搜索最优解方面表现卓越,曾协助设计下一代 TPU 芯片及解决数学难题。但在材料科学等领域,AI 生成的线索仍需在实验台上进行物理验证。
报告核心判断认为:AI 改变了“猜想与反驳”的经济学。猜想变得丰富且廉价,但反驳(验证)受限于物理世界和制度,依然昂贵缓慢。数学和计算机科学是例外,其验证可在硅基世界完成。今年 2 月的"First Proof"挑战中,AI 系统 Aletheia 在一周内解决了 6 个未公开的数学问题。但数学家们已开始抱怨 AI 生成的证明过长,出现了“证明消化不良”现象,产出速度超过了人类审阅速度。
对于大多数学科,验证鸿沟正在扩大。实验室的生长周期和反应时间设定了科研节奏,Agent 无法加速物理过程。
基础设施该升级了
针对上述挑战,报告向政策制定者和资助机构提出四项紧迫优先级:
确保科学家能用上 Agent
这不仅是训练模型的问题,更是部署问题。国家需关注如何将 Agent 有效部署到整个科学生态中,而非仅聚焦于地缘政治层面的模型训练权。
建立新的资助与合作模式
随着 Agent 能力扩展,计算开销将持续增长。资助机构需决定实验室如何选择和付费使用 Agent,并探索如美国"Genesis Mission"般的公私合作新模式。
让国家数据资产对 Agent 友好
开放数据应通过完善的 API 暴露给 Agent;敏感数据(如基因组学、病毒学)则需开发类似 OpenSAFELY 的隐私保护方案,确保 Agent 能安全访问。
解决验证瓶颈与革新同行评审
面对假设激增而实验设施有限的矛盾,建议投资并共享现有验证设施,加速自动化实验室建设。同时,鉴于 AI 深度参与论文写作,传统的写作质量已非可靠区分标准。报告建议推行“人机交互卡片”,记录关键洞见的生成过程,并允许审稿人使用 Agent 辅助检测错误。
AI Agent 不应成为削减科研经费的理由。唯有正视这一结构性变化并升级管理制度的国家,才能释放最大的公共价值。科学家用上 Agent 之后,便不会再回头。
参考资料:
https://deepmind.google/public-policy/conjecture-machines-ai-agents-and-the-new-validation-bottleneck-in-science/

