大数跨境

Google、DeepMind等:《科学中的AI:早期见解》

Google、DeepMind等:《科学中的AI:早期见解》 智强战略咨询
2026-09-24
7

2026年9月,由 Google、Google DeepMind、University of Chicago、CUNEF Universidad、MIT FutureTech、University of Oxford、Carnegie Mellon University、University of Pennsylvania 等机构联合完成论文《科学研究中的AI:早期观察》(AI in Science:Early Insights)。
文章认为,AI 对科学的影响令人非常兴奋,但也令人担忧,但到目前为止,数据很少。文章从3个数据源提供了关于这一点的早期见解。文章研究发现,科学界已经广泛采用AI;LLM用于一般分析、编码和手稿准备,而专用模型提供特定领域的预测、数据生成和分类;使用AI可以大幅提高科研产出效率;AI 已经在改变科学研究过程。
以下编译、整理了文章的主要观点和认识。






AI in Science: Early Insights
科学中的AI:早期见解

摘要:四大核心发现

论文基于三类新数据源:

  1. 1500万条 Gemini 交互样本;

  2. 2600多个跨学科科学专用 AI 模型清单;

  3. 600多名科学家调查。
    并将它们映射到 MIT FutureTech 的科学任务分类法,形成任务层面的分析。

四个主要发现:

  1. 采用广泛、覆盖广:科学家使用 AI 的比例高于多数职业;专用 AI 模型覆盖多个学科且被高度引用;近一半受访科学家每天使用某种 AI。

  2. LLM 与专用模型互补:LLM 主要用于通用分析、编码、论文准备;专用模型用于领域预测、数据生成、分类和模拟。二者任务重叠有限。

  3. 生产率收益显著:科学家报告平均每周节省近 7 小时,且主要再投资于研究。

  4. 科研流程正在改变:部分环节变容易后,瓶颈向下游转移,出现未测试假说积压、验证需求大增等问题。

总体判断:AI 有潜力显著提高科学生产率,但最终影响取决于复杂的任务相互依赖,以及能否投资消除新出现的瓶颈。


1. 引言:乐观与担忧并存,但缺乏实证

  • 科学发现是长期经济增长的核心动力,但近年出现“研究生产率下降”“想法越来越难找”的担忧。

  • AI 被视为可能扭转趋势的“发明方法的发明”(IMI),如 AlphaFold 已被视为诺奖级突破,通用 LLM 也在快速扩散。

  • 但担忧同样存在:AI 生成内容、幻觉、“理解错觉”会冲击同行评审和验证;模型可能引导研究者走向增量、安全课题;算力和资本要求可能扩大富实验室与资源不足机构之间的差距;还可能加速低质量研究。

  • 既有研究多依赖论文、引用、专利等滞后数据;前沿 AI 实验室虽有实时使用遥测,但多聚焦劳动力市场,较少聚焦科学。

  • 本文用实时日志、专用模型清单和科学家调查,首次系统描绘 AI 在科学中的采用、分工与影响。


2. 数据与测量

2.1 科学定义与分类工具

  • 采用广义科学定义:学术、产业、非营利、政府中的研究活动;包括应用、计算和理论研究。

  • 使用 OCTO 分类引擎,将非结构化文本映射到 OpenAlex 学科分类和 MIT FutureTech 科学任务分类法。

  • MIT FutureTech 任务分类法基于约 380 万条科研招聘广告,包含 12 个一级领域、114 个二级领域、2433 个三级任务组,覆盖 217 个科学子领域。

2.2 三类数据源

  1. Gemini 交互日志(Google ATLAS 1.0):约 1500 万条匿名交互,来自 Gemini App、AI Mode 和 API。经三阶段过滤:排除非工作交互;限制在六类研究密集型 SOC 职业;再用科学分类器识别科研工作流。最终得到约 36 万条科学交互。

  2. 科学专用 AI 模型清单:共 2690 个 2012 年后发布、且有代码仓库的模型。覆盖 26 个 OpenAlex 领域、83% 子领域。提取出 4475 个任务。

  3. 科学家调查:2026 年 7 月 27 日至 8 月 11 日,由 More in Common 在线执行,调查 637 名 美英活跃研究者,涵盖物理、生命、健康、社会科学,以及学术与产业界。样本为非概率筛选样本,未加权。


3. LLM 在科学中的使用

3.1 采用程度:科学家是 AI 高使用群体

  • 六类研究密集型职业的 Gemini 交互量约为其美国就业份额的 1.8 倍。

  • 核心科学职业 SOC 19(生命、物理、社会科学)使用 AI 的可能性约为就业基线的 2.7 倍。

  • 科学交互比普通工作交互更复杂:多模态高约 7%,token 使用高约 19%,对话轮次高约 11%,领域专长得分高约 26%。

  • 在 217 个最细科学子领域中,LLM 使用覆盖 195 个。

3.2 学科分布

  • 物理科学(含计算机科学)占科学 LLM 交互的 55.3%,社会科学 21.4%,健康科学 14.1%,生命科学 9.2%。

  • 字段层面:计算机科学约 28.3%,工程 14.1%,政治学/社会学/人类学 11.3%,医学 9.6%,农业与生物科学 5.4%。

  • 按 OpenAlex 作者数归一化后,某领域研究者份额每增加 1 个百分点,其科学 Gemini 交互份额约增加 0.7 个百分点,解释力接近 30%。物理和社会科学相对过度代表,生命和健康科学相对不足。

3.3 任务分布

LLM 被用于整个科研流程,但集中于:

  • “分析和建模定量研究数据”:约 42.5%;

  • “传播研究成果与利益相关者信息”:14.0%;

  • “开发产品、原型和工艺技术”:11.4%;

  • “开展实验和样品处理操作”:9.8%;

  • 教学培训 6.4%,项目管理 3.9%,概念化研究 3.0%,临床研究协调 2.8% 等。

不同学科任务异质性明显:计算机科学更多用于软件排错和定量分析;健康科学更多用于临床研究协调、质量合规;生命科学更多用于实验和样品处理;社会科学更多用于数据收集、教学和项目管理。

3.4 地理分布

  • 一国研究者份额每增加 1 个百分点,其科学 LLM 交互份额约增加 0.9 个百分点,可解释约四分之三的跨国方差。

  • 美国、韩国、日本、澳大利亚、新加坡、荷兰等采用较高;非洲、中南亚等科学人力较小地区交互较少。


4. 科学专用 AI 模型

4.1 领域覆盖

  • 专用模型在物理科学/计算机科学中占比最高,为 54.1%;生命科学 20.4%,健康科学 15.5%,社会科学 10.2%。

  • 与 LLM 使用相比,专用模型在生命和健康科学中占比更高:二者合计约 36%,而 LLM 使用中约 23%。

  • Top 字段:计算机科学 31.8%,医学 13.3%,生物化学/遗传学/分子生物学 10.1%,工程 7.7%,地球与行星科学 4.4% 等。

4.2 任务特征

  • 专用模型主要用于 预测、生成、分类,以及分割、检测、分析、估计、求解等。

  • 映射到 MIT 任务分类法后:

    • “分析和建模定量研究数据”占 68.4%;

    • “开发产品、原型和工艺技术” 10.8%;

    • “开发与排错研究测定和软件” 5.2%;

    • 实验操作 4.9%,沟通 4.5%,数据收集 2.5%,概念化 1.1%。

  • 专用模型覆盖 MIT 三级任务的 17.6%;排除运营和教学任务后,覆盖 24.3%,即约四分之一实质性科研任务已有 AI 能力覆盖。但论文强调,这不等同于 AI 在这些任务上有效。

4.3 与 LLM 的分工:互补而非替代

  • 在最高层任务分类上,LLM 与专用模型都集中在“数据分析和建模”,看似相似。

  • 但任务越细化,重叠越低:log-log 弹性从一级任务的约 0.6,降到二级的 0.5,再到三级任务的 0.2;若纳入至少一方有正份额的任务,三级弹性甚至略为负。

  • 结论:LLM 更像通用工具,用于写作、编码、文献综述、统计分析和操作支持;专用模型更像领域资本,用于预测疾病结果、设计分子构造、运行复杂模拟。二者当前更多是互补关系。

4.4 引用与知识流动

  • 专用模型被高度引用:2012 年以来累计超过 130 万次引用,2020 年以来近 50 万次;近一半模型论文在其领域内进入前 1% 引用,83% 进入前 10%。

  • 超过四分之一引用链接跨越学科边界。

  • 健康科学模型近一半引用来自物理科学(主要是计算机科学),10% 来自生命科学;社会科学模型超过七成引用流向物理科学;物理科学模型较封闭,85% 引用来自物理科学内部。

  • 可能解释包括:领域技术被计算机科学吸收、基础与应用领域知识扩散、领域数据用于基准测试等。

4.5 地理集中

  • 专用模型开发高度集中:前 10 个国家/地区占 84%,主要是美国、中国、英国、欧盟、韩国、加拿大。

  • 中国约占专用模型引用量的 40%。

  • 许多中低收入国家开发能力弱,但引用较活跃,说明开放模型可以在缺乏开发能力的地区扩散使用。


5. 科学家调查:采用、时间、瓶颈与影响

5.1 使用频率与时间分配

  • 47% 受访科学家每天使用某种 AI,31% 每周使用。

  • 使用 AI 的时间中,约 70% 用于通用 LLM:其中通用聊天与文档 LLM 占 41%,编码代理和代码助手占其余部分;专用模型约占 30%。

  • 科学家平均每周时间分配:数据分析和解释约 7 小时;数据收集和实验近 8 小时;写作与传播约 5 小时;方法与设计约 5 小时;知识获取约 5 小时;概念化及基金/行政等运营任务合计约 9 小时。

5.2 生产率收益

  • 近四分之三受访者报告 AI 净节省时间,仅 6% 报告净损失时间。

  • 平均每周节省 6.9 小时。

  • 节省时间再投资于:增加研究量和产出约 30%;物理实验和数据收集约 21%;攻克更难、更雄心问题约 19%;改善工作生活平衡/减少工时约 18%;教学、指导、行政约 12%。

  • 过去三年,84% 科学家报告其实验室或专业产出净增加,47% 报告产出增加 10% 以上。

  • 未来三年,约 90% 预期产出增加;预期增长 25% 以上 的比例从约 7% 升至 18%。

5.3 瓶颈、验证与科研问题选择

  • 当前最大瓶颈:物理实验和数据收集 24%(物理科学与工程中达 30%),数据分析和解释约 21%,写作与传播约 14%。

  • 过去两年,44% 受访者表示主要瓶颈向下游转移,14% 表示向上游转移,42% 表示未变。

  • 41% 科学家报告未测试假说积压增加,25% 报告减少。AI 加快了假说生成和计算预测,但实验验证能力跟不上。

  • 在节省时间的人中,89% 会用超过十分之一的节省时间检查 AI 输出,46% 会用超过四分之一的时间验证、调试或事实核查 AI 输出。生命科学中“验证税”尤其高。

  • 对科研问题的影响:

    • 68% 认为 AI 增加了跨学科洞察获取;

    • 67% 认为 AI 提高了所研究问题的雄心;

    • 65% 认为研究议程广度增加;

    • 40% 认为低质量论文增加,35% 认为减少;

    • 45% 认为每篇论文所需努力增加,31% 认为减少;

    • 49% 表示 AI 促使他们转向更安全、增量的课题,28% 表示转向更高风险课题。

  • 论文将此称为可能的“街灯效应”:AI 更容易降低数据丰富、可基准测试、可计算问题的成本,而高风险、数据稀缺、验证昂贵的问题可能被挤出。


6. 讨论与下一步

  • AI 在科学中的采用不是简单的劳动力替代或自动发现爆炸,而是更复杂的图景。

  • 科学家 AI 使用过度代表,但采用与各国科研人力规模大致成比例;专用模型开发集中在少数发达经济体,可能加剧全球科研能力差距。

  • LLM 与专用模型存在分工:专用模型生成合成数据、预测分子性质、执行模拟;通用 LLM 承担编码、文献综合、写作和运营。

  • AI 带来真实的时间节省,但瓶颈向下游转移,任务捆绑和组织互补性限制了宏观发现率的提升。

  • 高“验证税”说明 AI 输出并非即插即用;科学中正确性至关重要,验证和人类判断的边际价值上升。

  • 未来可能形态:LLM 作为 orchestrator,规划实验、调用 AlphaFold 或材料模型等专用模型、交叉检查输出,科学家负责选择问题、设定证据标准、决定什么值得做物理实验。

  • 政策含义:需要投资物理实验和验证能力、验证工具、数据与基准,并缓解全球科研能力差距。


7. 局限

论文明确列出多项限制:

  1. Gemini 日志仅来自 Google ATLAS,排除企业数据;Gemini 用户可能不代表其他模型用户,健康等受监管领域可能更多使用企业账户或专用方案。

  2. 专用模型清单偏向“知名”、易检索、有代码仓库的模型,遗漏定制模型、商业模型和私有模型;引用分析存在滞后。

  3. 科学家调查可能存在选择偏差,热衷 AI 的科学家更可能回应,可能高估采用率和节省时间。

  4. MIT 任务分类法源自招聘广告,科学与更广 STEM 经济边界存在误分类。

  5. 分类流程可能误判、单标签映射,忽略一个模型对应多任务、一次对话包含多任务等情况。

  6. 论文是 2026 年早中期的快照,LLM 与专用模型的分工可能变化。

  7. 结果主要是关联而非因果,未来需因果识别。


总体认识

这篇论文的核心判断是:AI 已经广泛进入科研工作流,并带来显著的时间节省和任务重组,但目前更像“局部加速器”而非“自动发现机器”。 通用 LLM 与专用模型形成互补分工;瓶颈正从分析、编码、写作向下游实验、临床验证和数据收集转移;验证成本、未测试假说积压和向增量课题倾斜,是 AI 提升科学生产率的主要制约。最终影响不取决于单一模型能力,而取决于任务依赖、组织互补性、验证能力和对下游瓶颈的投资。





来源:https://futuretech.mit.edu(英文)


         AI编译 / 智强咨询 编辑(中文)


原文链接


本平台发布和分享的有关文章和信息的观点及版权属于文章和信息的作者或者来源渠道。本平台发布和分享的文章和信息等,旨在战略决策咨询、专业研究与学习用途。分享信息若有侵权,联系后台删除。AI生成内容请谨慎参考。

图片



【声明】内容源于网络
0
0
智强战略咨询
科技发展以及创新驱动发展相关的战略政策研究与智库咨询。
内容 2004
粉丝 0
智强战略咨询 科技发展以及创新驱动发展相关的战略政策研究与智库咨询。
总阅读34.5k
粉丝0
内容2.0k