大数跨境

Nature 用一篇「方法失败了」的论文,宣布了科研自动化的到来

Nature 用一篇「方法失败了」的论文,宣布了科研自动化的到来 AI前沿速递
2026-07-28
4
导读:一、43 篇投稿,其中 3 篇是 AI 写的,评审不知道是哪 3 篇2025 年 2 月,ICLR 的一个研

一、43 篇投稿,其中 3 篇是 AI 写的,评审不知道是哪 3 篇

2025 年 2 月,ICLR 的一个研讨会照常启动了同行评审。

研讨会的名字有点自嘲,叫 ICBINB,全称是 I Can't Believe It's Not Better,专门收那些没做成的研究和负面结果。这一届总共 43 篇投稿,双盲评审,流程和往年没有区别。

唯一的区别写在发给审稿人的须知里。组织者提前告知所有评审,这 43 篇投稿中有 3 篇是 AI 完整生成的,但不会告诉任何人自己手上分到的是不是其中之一。如果不愿意评审 AI 生成的论文,可以在 2 月 11 日之前发邮件退出。

评审结束,3 篇里有 2 篇被拒。剩下那一篇拿到了 6、7、6 三个分数,平均 6.33 分,越过了录用线,也高于当届 55% 的人类论文。

这篇论文研究的是,给神经网络加一个组合性正则项能不能提升泛化能力。它的结论是,不能,这条路走不通。

一年后,2026 年 3 月 25 日,讲清楚这套系统是怎么做出来的论文,登上了 Nature 正刊。

二、这套系统到底替人做了什么

做出这套系统的是东京的 Sakana AI,合作方是不列颠哥伦比亚大学、Vector Institute 和牛津大学。系统的名字就叫 The AI Scientist。

人类给它的只有一个宽泛的研究方向。之后的每一步都是它自己走的。

  • 生成新的研究想法
  • 检索并阅读相关文献
  • 设计实验,写代码
  • 用并行的智能体树搜索来跑实验
  • 分析数据,画图
  • 用 LaTeX 写出整篇论文,包括标题、图表摆放和参考文献
  • 由一个带视觉能力的模型回看自己画的图,再修改

投到研讨会的那三篇稿子,人类一个字都没有改过。

图源:Sakana AI 官方博客 sakana.ai/ai-scientist-nature/
图源:Sakana AI 官方博客 sakana.ai/ai-scientist-nature/

三、Nature 这次登的到底是什么

先把出处说准,这一点后面会有用。

论文题目是 Towards end-to-end automation of AI research,2026 年 3 月 25 日上线,刊于 Nature 第 651 卷第 8107 期第 914 到 919 页,DOI 是 10.1038/s41586-026-10265-5,开放获取。同一期 Nature 还配了一篇社论和一篇新闻报道。

Nature 社论的第一段说得很直白。这一期发的这篇论文,核心发现或许有点平淡无奇,因为它证明的是某个技术没能改善神经网络的学习效果。编辑们看重的不是这个结论,而是这项工作是怎么被完成的。

社论的标题是《AI 科学家正在改变研究,机构、资助方和出版商必须作出回应》。

四、真正的新东西不是「会写论文」,是「会审论文」

Nature 版本比之前的预印本多出来的部分,才是这次值得单独说的地方。

图:The AI Scientist 工作流与关键结果。(b) 论文质量随基座模型发布日期同步上涨;(c) 自动评审的判断准确率与人类审稿人相当。
来源:Lu et al., Nature 651, 914–919 (2026), Fig. 1. 开放获取(CC BY 4.0)。
图:The AI Scientist 工作流与关键结果。(b) 论文质量随基座模型发布日期同步上涨;(c) 自动评审的判断准确率与人类审稿人相当。 来源:Lu et al., Nature 651, 914–919 (2026), Fig. 1. 开放获取(CC BY 4.0)。

Sakana 团队做了一个自动评审系统。他们让模型扮演领域主席的角色,集成五份独立评审意见给出最终决定,判断依据是 NeurIPS 的官方评审指南。然后拿 OpenReview 上数千份真实的人类决定当基准去测它。

结果是,这个自动评审的平衡准确率达到 69%,与人类审稿人相当。它的 F1 值甚至超过了 NeurIPS 2021 一致性实验中测出的人类审稿人彼此之间的一致程度。

翻译成大白话,让两个人类审稿人评同一篇论文,他们的意见分歧,比这个 AI 和人类之间的分歧还要大。

接下来才是最狠的一步。团队用这个自动评审去给不同基座模型生成的论文打分,发现了一条清晰的规律,基座模型越强,它生成的论文质量就越高,两者同步上涨。

也就是说,这不是一次靠调参碰运气的演示。只要基座模型继续变强,这套系统的产出就会跟着变好。

五、必须泼的三盆冷水

这一段如果不写,这篇文章就只是又一条 AI 吹捧稿。

第一,研讨会不是主会。

ICLR 2025 的 ICBINB 研讨会录用率是 70%,同年 ICLR 主会的录用率是 32%。作者自己在论文里写明,三篇 AI 生成的论文没有任何一篇达到主会的标准。

第二,人还在回路里,而且在关键位置上。

系统生成了大量论文,最终投出去的三篇是人类挑的。挑选标准有三条,与研讨会主题是否契合、代码能不能正常跑通、稿件格式是否规范。作者强调人类没有干预科研流程本身,但确实决定了哪些产出值得往前推一步。

第三,能力边界很清楚,失败模式也很具体。

目前这套系统只能做计算类实验,碰不了需要动手的湿实验。论文里列出的常见失败包括,想法幼稚或不成熟,方法学深度不够,复杂代码实现容易出错,以及产生幻觉,比如生成不准确的引用,或者在附录里重复放同一张图。

顺便说一句,团队为所有 AI 生成的论文都打了水印,并建议整个学术共同体都采纳这个做法。他们还提前约定,论文一旦被录用就主动撤稿,事后也确实撤了。这项实验拿到了不列颠哥伦比亚大学伦理审查委员会的批准,也获得了 ICLR 领导层和研讨会组织者的同意。

这些动作本身就说明,做这套系统的人,比很多转发这条新闻的人更清楚它意味着什么。

六、两个月后,Nature 又发了两篇

2026 年 5 月 19 日,Nature 同期上线了两篇多智能体科研系统的论文。

Co-Scientist,来自 Google DeepMind,基于 Gemini 2.0,定位是跨学科通用,初期验证集中在生物医学。它为急性髓系白血病提出了新的候选药物和联合疗法,在细胞系实验中显示出潜在效果。作者同时写明,要真正作为疗法,还需要严格的临床前和临床评估。除此之外,它还发现了肝纤维化的新药物靶点,并揭示了抗微生物耐药性背后的关键遗传机制。

Robin,来自 FutureHouse,底座用的是 OpenAI o4-mini 和 Anthropic Claude 3.7,面向实验生物学。它协助识别出了干性年龄相关性黄斑变性的潜在治疗方向,包括视网膜细胞内一个可以干预的过程,以及一个此前从未被提出用于这个适应症的候选药物。它还提出了后续研究方向,并从中找到了新的潜在靶点。

两个团队都强调了同一件事,这些系统是用来和研究者协作的,科学家始终在回路中。

Nature 为这两篇论文配的社论,标题是《为什么没有人类,AI 做不出好科学》。

三个月内,Nature 就同一个主题连发两轮论文加两篇社论。这本身就是一个信号。

七、镜头转回国内,7 月 15 日知网出手了

2026 年 7 月 15 日,同方知网发布《知网关于人工智能(AI)署名为作者的论文处理声明》,对把 DeepSeek、Gemini 等 AI 列为作者的论文做了下架处理。

声明给了三条理由。

  • 法律层面。AI 既无民事权利能力,亦无民事行为能力,将其署名为作者不符合《民法典》《著作权法》的相关规定。
  • 伦理层面。AI 无法承担学术核查、整改、追责等义务,一旦署名会导致责任主体模糊,滋生学术不端隐患。
  • 当前要求。所有作者须为自然人、法人或非法人组织,知网不接受 AI 工具被列为论文署名作者。

同一份声明里还有一条更值得每个人抄下来的操作口径。作者如果在学术研究与论文写作过程中使用了 AI 工具,须在论文的研究方法或致谢段落明确说明,以保证使用 AI 的透明性和可溯源性。

触发这件事的,是《华东师范大学学报(教育科学版)》2026 年第 8 期的一组「AI 一作」论文。它们来自 2025 年 9 月华东师大发起的「AI 一作」大型社会实验,规则是 AI 必须列为第一作者,人类只能排在后面做协作与把关。这场实验最终收到 724 篇有效投稿,1177 名人类作者参与。

一个细节比结果更有意思。2026 年 3 月 21 日成果发布时,主办方把原计划的「评奖」改成了「发布榜单」,理由是专家组在评审中发现,现阶段人机协同的成果还没有完全达到传统学术奖项的高度与成熟度。

一边是 Nature 用正刊和社论承认自动化科研已经跑通闭环,一边是国内的检索平台明确划出署名红线。这两件事不矛盾。它们说的是同一句话,能力已经到了,规则还没跟上。

八、对普通科研人来说,真正变了的是什么

有一种说法是,这不过是把研究生干的活自动化了,不用紧张。这个判断有一半是对的。目前被替代掉的确实主要是执行环节,而且是计算类的执行环节。

但另一半需要看清楚。当写论文和审论文的质量都跟着基座模型同步上涨,你的竞争力就不再取决于你能把活干多快,而取决于三件旧事情。

一是提出问题。系统需要人给它一个宽泛的研究方向。方向给错了,后面跑得再快也是白跑。

二是判断真伪。这些系统公认的失败模式就是编造引用。判断一个漂亮结论是不是真的,正在从一项基本功变成一项稀缺能力。

三是设计证伪。能想出一个实验去推翻自己的假设,这件事目前的系统做得最差。

三个可以今天就做的动作。

  1. 把你这一年用 AI 的方式,写成一句能直接贴进论文致谢或方法部分的话,现在就写,别等审稿意见来问。
  2. 挑你最近一篇稿子,把所有参考文献的 DOI 反查一遍,看看有没有对不上的。
  3. 在实验记录里补一栏,写清楚这一步为什么这么做。这一栏是 AI 目前最难替你填的。

结尾

Sakana 团队给自己每一篇 AI 论文都打了水印,还在录用后主动撤了稿。他们比谁都清楚,一旦这件事变成常态,同行评审系统撑不撑得住是个真问题。

所以留一个问题给你。

如果 AI 既能写论文也能审论文,而且写和审的水平都在跟着基座模型往上涨,你手里那份「工作量」,还能值多少钱。


本文核心事实的一手出处

  1. Nature 论文原文|Towards end-to-end automation of AI research,Nature 651, 914–919 (2026),DOI 10.1038/s41586-026-10265-5
  2. Nature 同期社论|AI scientists are changing research,2026 年 3 月 25 日
  3. Nature 同期新闻|How to build an AI scientist,2026 年 3 月 25 日
  4. Sakana AI 官方博客|sakana.ai/ai-scientist-nature/
  5. Sakana AI 首次过审说明|sakana.ai/ai-scientist-first-publication/
  6. ICBINB 研讨会审稿人须知(43 篇中有 3 篇为 AI 生成的原始出处)|ICLR 2025 ICBINB 官网
  7. Co-Scientist|Nature (2026),DOI 10.1038/s41586-026-10644-y,2026 年 5 月 19 日
  8. Robin|Nature (2026),DOI 10.1038/s41586-026-10652-y,2026 年 5 月 19 日
  9. Nature 5 月社论|Why AI cannot do good science without humans
  10. 知网声明|《知网关于人工智能(AI)署名为作者的论文处理声明》,2026 年 7 月 15 日

完整链接、三大系统能力对照表、AI 使用声明模板、幻觉引用五步核查法,都放进配套资料包了。后台回复关键词【B770】领取。


【声明】内容源于网络
0
0
AI前沿速递
AI前沿速递 聚焦人工智能最新科研成果与技术动态,专注前沿论文解读、行业资讯分享与高校招生信息推送,助力AI爱好者和从业者把握学界风向标。每日更新技术干货与深度内容,让全球优秀研究被更多人看见。关注我们,探索AI无限可能!
内容 1976
粉丝 0
AI前沿速递 AI前沿速递 聚焦人工智能最新科研成果与技术动态,专注前沿论文解读、行业资讯分享与高校招生信息推送,助力AI爱好者和从业者把握学界风向标。每日更新技术干货与深度内容,让全球优秀研究被更多人看见。关注我们,探索AI无限可能!
总阅读17.3k
粉丝0
内容2.0k