导读
自动化科研 Agent 已能连接文献检索、假设生成、代码实验、论文写作与模拟审稿,但这条工程链路仍存在验证缺口:系统可以优化一个可计算指标,却未必能判断问题是否值得研究、证据是否足够、结论能否经受物理世界检验。本文从代表性系统出发,解释自动科研的真实进展、关键瓶颈,以及 AI Co-Scientist 为何比“无人科研”更接近可行终局。
科研 Agent 已经跑通了一条很长的工程流水线
2024 年,Sakana AI 公布 The AI Scientist:给系统一个机器学习代码模板,它可以提出研究想法、修改代码、运行实验、绘图、写成 LaTeX 论文,再交给另一个模型模拟审稿。
这件事真正厉害的地方,不是“AI 会写论文”。大模型早就会写。它的增量在于,原本散落在浏览器、终端、实验记录和论文模板里的动作,被串成了一个可以循环执行的工作流。
到了 The AI Scientist-v2,这条流水线又往前走了一步。系统减少了对人工代码模板的依赖,引入 渐进式 Agent 树搜索(Progressive Agentic Tree Search):它把不同研究方向、代码修改和实验结果组织成搜索分支,由实验管理 Agent 决定继续、回退还是换路。论文还加入视觉语言模型反馈,用来检查图表的内容与观感。
但“更开放”不等于“更稳定”。Sakana AI 在官方仓库里专门提醒:当已有高质量代码模板时,v1 的成功率反而更高;v2 面向开放探索,搜索范围更宽,运行成功率也更低。这是科研 Agent 很典型的一笔交换:少一点人工脚手架,换来更大的探索空间,也换来更多失败分支。
仓库还有一条很工程、也很现实的警告:系统会直接执行 LLM 写出的代码,可能调用危险软件包、访问网络或生成意外进程,因此应放在 Docker 等受控沙箱中运行。所谓“自动科研”,说到底仍是一套需要隔离风险的软件系统。
说得直白一点,它不再只沿着一条路硬着头皮跑。此路不通,退回岔口,再试一条。
v2 团队从生成结果中选出三篇稿件,投向 ICLR 2025 的“I Can’t Believe It’s Not Better”研讨会。其中,《Compositional Regularization: Unexpected Obstacles in Enhancing Neural Network Generalization》获得三位评审给出的 6、7、6 分,平均 6.33 分,高于该研讨会的接收门槛。
但它并未正式发表。按照事先与会议方面约定的实验协议,团队在评审结束后主动撤稿,研讨会也没有继续进行最终 meta-review。换句话说,这篇论文证明的是“AI 生成稿件可以获得高于接收线的外部评审分数”,而不是“AI 论文已经完成正式接收”。越过一次 workshop 的评分线,不等于系统已经具备成熟科学家的研究能力。
同一时期,其他系统在把流水线拆得更细。
Agent Laboratory 将过程分成文献回顾、实验执行和报告撰写,并允许人类在每个阶段提供反馈。PaperQA2 则专攻科学文献问答:通过检索、重排、上下文摘要和引用关系遍历,尽量把答案钉在论文证据上。Google 的 AI Co-Scientist 更关注假设生成,采用“生成—辩论—演进”的多 Agent 机制,再用类似 Elo 的锦标赛对候选假设排序。
这几套系统看起来差异很大,底层却在做同一件事:把科研中能够描述、调用和评分的部分,改写成状态机。
文献可以检索,代码可以执行,报错可以回传,指标可以比较,论文可以编译。于是,科研中最像工程的部分,正在迅速被自动化。
科研 Skill:科研 Agent 的一条轻量支线
如果说 The AI Scientist-v2 是把完整科研流程固化进专用系统,那么另一条更轻的路线,是给 Codex、Claude Code 这类通用编码 Agent 加载 科研 Skill。它仍然属于科研 Agent 的实现方式,只是把原本写在平台代码里的流程,拆成了可以按需组合的模块。
⬆️AI生成
Skill 不是另一个模型,也不一定是独立 Agent。按 Codex 的技能结构,它通常以 SKILL.md 为入口,并可携带脚本、参考资料和模板。Skill 固化“任务应该按什么步骤做、何时停下来检查”;Codex 或 Claude Code 才是读取文件、调用工具、执行代码并决定下一步的主体。
Karpathy 的 autoresearch 正好位于两者之间:它没有重新开发一整套多 Agent 平台,而是用 program.md 约束通用编码 Agent,让它在固定代码、时间预算和评价指标下反复修改、训练、比较与回滚。项目官方也把这个文件称为一种“超轻量 Skill”。
这条路线显著降低了工程门槛:研究者不必先搭建调度器、任务队列、状态数据库和模拟审稿系统,一个写清目标、工具、约束与停止条件的 Skill,就能驱动现成 Agent 工作。但它降低的是搭建自动化流程的门槛,不是做出可信科学判断的门槛。
调研公开仓库后,四种形态尤其有代表性。
-
Academic Research Skills(ARS)把检索、论文写作、审稿和完整管道拆成可组合 Skill,并在关键阶段设置完整性闸门。项目也明确承认,它能检查引用与声明的一致性,却不能证明原始数据真实或实验确实发生。 -
RigorPilot 把论文复现与候选探索分成两条通道:Agent 先冻结评测口径,再提出可证伪假设,以单变量实验决定保留或回滚,并留下证据账本。它在 Skills Registry 上显示出很高的安装次数,但安装次数可能包含重复安装和自动化调用,不能直接等同于独立科研用户数。 -
Scientific Agent Skills 走向领域工具化:为通用 Agent 提供科学数据库、统计分析、生物信息和化学计算等能力。价值在于把“模型记得什么”改成“Agent 能调用什么”,但其“17 万科研人员使用”等数字属于项目方自述,不能当成独立效果证明。 -
ARIS 更接近由 Skill 拼成的自动科研管线:Claude Code 或 Codex 执行文献、代码与实验任务,再让不同模型承担审查,并设置“循环可以推进,不能自行宣判正确”的约束。
The AI Scientist-v2、autoresearch 与“Codex + 科研 Skill”由此构成一条由重到轻的工程光谱:专用系统把实验管理和树搜索固化在平台中,autoresearch 把闭环收缩到单一代码库,Skill 则把科研步骤拆成可插拔模块,交给通用 Agent 调度。它们仍然属于同一个科研 Agent 议题:封装方式不同,面对的验证问题却完全相同——流程可以复用,科学判断不能随包安装。
先说清楚:什么才算科研
这里所说的科研,不是“运行了实验”,也不是“写出了一篇论文”,而是围绕未知问题提出可检验的主张,通过系统方法获得证据,并让其他人能够审查、质疑或复现,从而增加可靠知识的过程。
这至少要求问题尚未确定、假设可能被证伪、方法与对照能够说明、结论不超过证据范围,而且关键材料可以接受外部检查。论文只是这条证据链的表达形式,不是科研本身。
因此,让 Agent 在固定指标下反复改代码,更接近自动化经验搜索;只有当系统进一步提出可证伪假设、设置公平对照、分析失败案例并检查结论边界时,它才开始接近完整科研。很多所谓“自动科研”,目前真正自动化的仍是科研中的工程劳动。
树搜索能修复失败,却不能自动定义“什么是真问题”
⬆️AI生成
科研 Agent 的进步,很大程度来自反馈回路。
代码报错时,系统把 StackTrace、标准输出和修改历史重新交给代码 Agent;实验指标下降时,搜索器回退到父节点;两个假设冲突时,让评审 Agent 做成对比较。自我反思(Self-Reflection)在这里不是模型突然拥有了自省,而是系统把失败信号重新塞回上下文,要求它再生成一次行动。
工程上,这很实用。
Andrej Karpathy 开源的 autoresearch,把这种反馈回路压缩到了近乎教科书式的程度:Agent 只能修改 train.py,每次训练固定运行 5 分钟,再以验证集的 val_bpb 为唯一核心指标。指标变好,保留提交;变差,回退代码;程序崩溃,就读取日志后修复或放弃这条路线。
只要目标单一、环境封闭、结果可重复计算,这种循环就能一直跑。人睡了,实验不用睡。
可科学研究还有一个更难的问题:反馈信号本身对不对?
autoresearch 的边界也正在这里。它的评测脚本与时间预算被固定,Agent 因而拥有一条清楚的跑道;开放式科研却很少只有一个指标。如果目标函数只是验证集准确率,Agent 仍可能通过扩大搜索空间或挑选有利的数据切分获得更高分。每一步都合规,结果却可能只得到一篇包装精细的超参数报告。树搜索擅长在给定地图上找路,却不会替人判断这张地图是否画错了。
Google AI Co-Scientist 的 Elo 机制也有类似边界。Elo 原本用于根据对局结果更新选手等级;在这里,它依据 Agent 间的成对比较给假设排序。高 Elo 可以表示“更受内部评审器偏好”,但并不天然等于假设为真。Google 自己也明确提示,自动 Elo 不是独立真值;最终仍需要专家判断和实验验证。
这就是自动化科研最容易被忽略的一层:可计算的成功,与科学上的成功不是同一个对象。
可计算的成功关心代码是否运行、指标是否上升、论文是否像样;科学上的成功还要追问问题是否新、对照是否公平、证据是否排除了其他解释,以及结果能否被独立复现。
有点像自动驾驶。车辆完成一条路线,不代表它理解城市;更不代表地图之外突然滚来的皮球,它一定知道后面可能跟着一个孩子。
真正的瓶颈不是写作,而是验证缺口
⬆️AI生成
2025 年,来自锡根大学与新加坡国立大学的团队独立复现 The AI Scientist,得到的是一组混合结果:系统能够产出完整研究材料,但执行稳定性、论文质量和成本都明显受模型、模板与任务影响。这个结论比“AI 能不能写论文”重要得多。
2026 年另一项真实任务评估测试了 Agent Laboratory、AutoGen 等八个开源框架。在两个研究复现任务中,没有一个系统完成从理解文献、执行计算,到验证结果并形成论文的完整周期。研究者还观察到更麻烦的错误:系统会给出落在合理区间内的虚构数值,甚至配上误差项和专业术语。
假的,但长得很像真的。这个问题很黏手。
普通幻觉还容易识别:引用不存在,链接打不开。更危险的是“半真”:论文真实存在,引用的结论却不在原文里;实验确实运行,比较基线却没有采用同样预算;图表数字彼此一致,数据来源却站不住。
因此,所谓 验证缺口(Verification Gap),指的不是系统完全无法验证,而是生成一项主张的成本,远低于证明它可靠的成本。Agent 可以快速批量生成假设,人类却需要逐一核查证据。生成吞吐量越高,审查债务反而越厚。
这也是“AI Slop”风险的根源。问题不只是文字平庸,而是低成本生成的论文状产物大量进入文献与评审系统,挤占本来就稀缺的专家注意力。
当论文生产被自动化,而证据审查没有同步自动化,科研系统得到的不是免费知识,而是更昂贵的怀疑。
走进物理世界,Agent 才真正碰到科学的硬边界
今天多数端到端科研 Agent 仍活在 in-silico 环境,也就是计算机模拟、代码仓库和数字数据中。这里的失败通常有明确返回值:程序退出、单元测试失败、损失函数变差。
真实实验不这么客气。
试剂纯度、仪器漂移、样品制备、温湿度和操作顺序,都可能让同一个方案得到不同结果。环境不会贴心地送回一段 StackTrace。
领域工具正在缩小这道缝。ChemCrow 把大模型与 13 个化学专家工具连接起来,让 Agent 能调用分子检索、反应预测和合成规划能力。它说明一个重要方向:与其要求 LLM 靠参数记住化学,不如让它在受控接口里调用可靠工具。
材料研究中的 MIND 走的是另一条路。它将多 Agent 假设验证流程与 SevenNet-Omni 等机器学习原子间势结合,在计算环境中检查候选晶体结构和材料行为。这里的原子间势,简单说就是一个学习得到的物理近似器,用比第一性原理计算更低的成本估计原子如何相互作用。
但模拟器提供的是更坚硬的约束,不是最终裁决。势函数有训练分布,化学工具有适用范围,机器人也会把小误差放大成一桌狼藉。in-silico 的通过,只能提高真实实验值得做的概率,不能替代烧结、合成、表征和复现。
说回正题。科研 Agent 真正需要的,不是再多一个会写 Introduction 的角色,而是一条可追溯的证据链:每个结论对应哪组数据、哪段代码、哪次实验、哪个版本,以及谁检查过它。
终局不是 AI Scientist,而是责任清晰的 AI Co-Scientist
如果把科研拆开看,AI 与人类的优势并不对称。
AI 适合高吞吐工作:扫描文献、整理引用网络、生成实验脚手架、遍历参数、清洗数据、发现结果异常、维护实验日志。人类更适合处理价值与边界:为什么研究这个问题,什么对照才公平,异常是否揭示新机制,什么时候应该停止,以及什么证据足以支撑公开结论。
所以,更现实的终局不是“实验室里一个人都没有”,而是 AI Co-Scientist。不过,“人机协作”也不能只停留在一句口号里,它至少可以拆成三档控制关系。
-
Human-in-the-Loop:Agent 每推进到关键步骤,都等待人类审批。适合研究方向、实验方案和论文结论等高风险节点。 -
Human-on-the-Loop:Agent 在预设范围内自主循环,人类监控运行,在异常或阶段性检查点介入。autoresearch 更接近这一档。 -
Human-out-of-the-Loop:系统从目标到结果基本无人干预。它适合边界清楚、失败可恢复的低风险任务,却不适合作为开放科学研究的默认模式。
这三档并不是一条“越无人越高级”的升级路线。真正成熟的系统,会根据风险动态切换:文献去重、格式检查和固定评测可以放开跑;修改实验口径、排除异常样本和发布结论,则应把人重新拉回回路。
落到实际选择上,多数研究者不必先部署一套 The AI Scientist-v2。更稳妥的起点,是用 Codex 或 Claude Code 配合 Academic Research Skills,把文献、结构规划、写作、审稿和返修交给 Agent 辅助;如果研究包含代码实验,再叠加 RigorPilot,用冻结评测口径、单变量比较和实验账本约束探索过程。工具可以按任务增加,但原始数据、关键引用和最终结论必须由研究者逐项核对。
换句话说,Agent 越能行动,研究者越要把权限、证据和停止条件写清楚。人类定义目标和物理约束,Agent 扩展搜索宽度;Agent 提供候选解释,人类审查证据链;机器人执行标准化实验,人类处理异常并承担决策责任。
这不是保守。恰恰相反,它把自动化放在最能产生复利的位置。
一个可信的科研 Agent,至少应留下四类可审计记录:来源可追溯、实验可复现、评价器彼此独立、关键节点有人类签字。 尤其不能让同一模型既提出假设、选择数据,又评判自己是否成功。那不是同行评审,更像自己出题、自己判卷。
⬆️AI生成
科学史上的范式变化,从来不只是工具变快。望远镜改变天文学,是因为它带来了新的可观察证据;计算模拟改变科学,是因为模型能与实验相互校验。
自动化科研 Agent 也必须跨过同一道门槛。
工程闭环解决的是“能不能跑完”,科学范式回答的是“凭什么相信”。
在这两个问题之间,人类科学家暂时还不能离场。也不该离场。
参考资料
-
The AI Scientist: https://arxiv.org/abs/2408.06292 -
The AI Scientist-v2: https://arxiv.org/abs/2504.08066 -
The AI Scientist-v2 官方代码仓库: https://github.com/SakanaAI/AI-Scientist-v2 -
Compositional Regularization(AI 生成论文,带人工批注): https://github.com/SakanaAI/AI-Scientist-ICLR2025-Workshop-Experiment/blob/master/compositional-regularization/annotated_paper.pdf -
ICLR 2025 Workshop 实验与评审记录: https://github.com/SakanaAI/AI-Scientist-ICLR2025-Workshop-Experiment -
Agent Laboratory: https://arxiv.org/abs/2501.04227 -
Language Agents Achieve Superhuman Synthesis of Scientific Knowledge: https://storage.googleapis.com/fh-public/paperqa/Language_Agents_Science.pdf -
Towards an AI Co-Scientist: https://arxiv.org/abs/2502.18864 -
Evaluating Sakana’s AI Scientist: https://isg.beel.org/pubs/2025-sakana-ai-scientist-reproduced.pdf -
Augmenting Large Language Models with Chemistry Tools: https://www.nature.com/articles/s42256-024-00832-8 -
MIND: AI Co-Scientist for Material Research: https://arxiv.org/abs/2604.13699 -
Can AI Conduct Autonomous Scientific Research?: https://www.biorxiv.org/content/10.64898/2026.01.05.697809v1.full -
autoresearch: https://github.com/karpathy/autoresearch -
Codex Skill 结构说明: https://github.com/openai/codex/blob/main/codex-rs/skills/src/assets/samples/skill-creator/SKILL.md -
Academic Research Skills: https://github.com/Imbad0202/academic-research-skills -
Academic Research Skills(Codex 版): https://github.com/Imbad0202/academic-research-skills-codex -
RigorPilot Skills: https://github.com/lllllllama/rigorpilot-skills -
Scientific Agent Skills: https://github.com/K-Dense-AI/scientific-agent-skills -
ARIS: https://github.com/wanshuiyin/Auto-claude-code-research-in-sleep

文章仅做学术分享,如有侵权请联系删除,非常感谢!

