
10月1日,Anthropic在官方科学博客刊发了哈佛大学理论物理学家马修·施瓦茨(Matthew Schwartz)的客座文章。同日,施瓦茨借助Claude搭建的科研工具包BootLoops 1.0在GitHub以MIT协议正式开源。
据施瓦茨透露,过去三个月间,他与19位合作者利用Claude及该工具包,从约400个候选问题中筛选推进,最终完成了36篇学术手稿,涵盖粒子物理、宇宙学、生态学、群体遗传学、经济学、语言学等18个领域。
从“Vibe Physics”到“阻抗失配”:重构AI科研范式
这是施瓦茨今年第二次在Anthropic博客分享AI科研经验。早在今年3月,他曾发表《Vibe Physics》一文,讲述如何携Claude Opus 4.5在两周内完成通常需一年的量子色动力学论文。但他指出,当时的协作过程极为煎熬,需逐句修改并时刻防止模型跑偏。
此次,施瓦茨引入物理学中的“阻抗失配”概念,指出科学家需求与AI能力之间存在错位:“Claude和GPT擅长科学任务,但它们并非科学家。”与其强迫模型模仿人类思维,不如寻找适合其发挥的“Claude形状的问题”——即那些数学、物理或计算机领域已有成熟解法,但特定学科学者尚不知情的跨学科难题。
图丨当前这一代 AI 工具尚无法解决科学中的大多数问题。然而,它们在某些“智能体式 AI 形态”的问题上表现得惊人地出色。(来源:Anthropic)
BootLoops框架:以严格标准防范AI“作弊”
BootLoops框架应运而生,其定位为类似Claude Code之于Claude的运行框架(harness),但不绑定特定模型,兼容Claude、Gemini或ChatGPT。该框架起源于粒子物理中的散射振幅计算,核心挑战在于费曼图对应的多维积分。
传统“S矩阵自举法”在复杂理论中常因约束不足而失效,进而发展出“半数值自举”,即在特殊点计算极高精度数值以确定系数。施瓦茨认为,这种方法天然适合AI:它跨越数学、物理和计算机科学,需要海量代码开发,且结果易于通过脚本验证。
为此,团队确立了“BootLoops标准”:只有当费曼图的完整函数解析形式已知,且能通过Python脚本在普通笔记本上算至任意精度时,才算真正攻克。这一标准旨在通过30位有效数字的对齐要求,杜绝AI“蒙混过关”的可能。
效率跃升与工具整合
在Claude Fable 5发布后,施瓦茨测试了其将网络安全攻防能力迁移至科学计算的潜力。Claude仅用20分钟便复现了施瓦茨耗时数周完成的论文结果,并指出了原有算法的低效之处,提供了更优解法。
目前,BootLoops官网已列出五十多个工具,部分由Claude原生编写,部分为社区工具移植。其中核心的费曼积分引擎AMFlow和Blade,其理论与程序源自北京大学马滟青团队。
跨界突破:从椭圆积分到生态学与遗传学
施瓦茨团队推动Claude挑战高阶椭圆函数积分。此类积分难度极高,历史上鲜有纯靠自举法求解的案例。借助Claude拓展的工具链,团队在几周内从头至尾求解了30个复杂积分,其中15个为全新结果。
生态学:重新审视中性生物多样性理论
研究发现,费曼积分在数学形式上与贝叶斯统计中的“证据积分”一致,广泛应用于群体遗传学、生态学等领域。以往这些领域依赖蒙特卡洛抽样近似计算,存在统计噪声,而物理数学工具可直接求出解析解。
在生态学案例中,团队求解了兰帕尔·艾蒂安2005年提出的中性生物多样性理论方程,并应用于巴拿马巴罗科罗拉多岛的热带森林数据。结果显示,实际树种更替速率是理论极限的4.5倍。尽管生态学家指出这符合常识,但该计算扣除了中性背景噪音,帮助构建了更精准的最小化预测模型,揭示了物种依赖性的生物学特征。
群体遗传学:发现“基因转换”的关键作用
在群体遗传学项目中,Claude精确求解了刻画自然选择塑造罕见突变的复杂积分公式,并应用于gnomAD数据库。经哈佛同事迈克尔·德赛指导,团队转向研究相邻突变关联性。
通过分析“千人基因组计划”中冈比亚人的57亿对相邻突变,研究发现约95%的偏离现象可由“基因转换”机制解释。这一发现挑战了以往忽略基因转换影响的经典统计分析,对远古种群演化推断及疾病基因定位具有重要意义。
大规模数据复现与学科基建
除了前沿研究,BootLoops还承担了繁琐的基础设施工作。
经济学:顶刊论文复现与纠错
团队开发了“AI数据编辑”系统,抓取五大顶级经济学期刊2000年以来4452篇论文的复现包,将约3万个程序从MATLAB、Stata移植为开源代码,并逐一核对数据。初步核查显示:
- 3460篇论文存在至少一处数字不符;
- 496篇论文通过代码重构实现10倍以上加速;
- 923篇论文成功跑出扩展分析。
语言学:构建AccStack数据库
针对语言词重音类型学目录样本偏差问题,团队与语言学家合作构建AccStack数据库,收录6072种语言的重音与声调数据,覆盖全球约七成已知口语语言,并附带16万部音系学文献书目。
此外,项目还涉及地球“大氧化事件”演进模型、太阳黑子寿命测算以及1939年格点积分未解之谜的攻关。
图丨今天的人类知识是参差不齐的——特定的科学家和子领域在某些方向上比在其他方向上推进得更多。中间区域,即人类能够到达但没有特定人类到达过的地方,是人工智能的理想用武之地。(来源:Anthropic)
工程架构与AI局限性
该研究依托谷歌云虚拟机部署,采用“主控会话”统筹全局,“对抗性审稿人”会话内部挑刺,底层密集运算下派给子智能体(sub-agents)。这种架构不仅提高了效率,还避免了因触发安全拦截导致整个会话崩溃的风险。
尽管成果显著,施瓦茨强调了AI当前的局限:
- 时间感缺失与夸大其词:AI常戏剧性地描述长期奋斗过程,而实际计算仅需数天。
- 算力使用低效:倾向于“大力出奇迹”硬算,缺乏优化算法的主动性。
- 逻辑陷阱:常宣称任务完成却遗留核心未证明引理,或擅自添加“新公理”。
- 缺乏学术品味:难以鉴别研究价值,偏爱陈旧争论,需人类把关选题。
因此,所有分析图表仍需人类肉眼审阅,自动化检查不可完全信赖。
未来展望:学术生态的重塑与挑战
BootLoops虽由Claude编写且IP登记在Anthropic名下,但Anthropic澄清其为施瓦茨个人拥有并维护的独立开源项目。合作者包括尼玛·阿尔卡尼-哈米德、诺姆·埃尔基斯等知名学者。
施瓦茨认为,AI虽能释放巨大生产力,但无法将科学探索压缩为一个按键。真正的突破仍源于对真实世界数据的观测与提炼。AI的最佳舞台在于填补人类知识版图边缘的交叉地带。
然而,AI的快速介入也带来了现实困惑:若难题可一夜解决,青年学者为何还需申请长期基金?编程技能是否还值得作为研究生必修课?更重要的是,在“Claude形状”的新范式下,如何公正分配学术署名与尊重,避免底层执行者默默无闻,是学术界亟待解决的伦理与制度难题。施瓦茨表示:“我们绝不能继续假装那些繁重的工作全是由人类亲手完成的。”
参考资料:
1. https://www.anthropic.com/research/claude-shaped-science
2. https://github.com/BootLoops-ai/bootloops/tree/66b680ce742e654cfe86da4f072a69061fe182b1

