LLM 生成的研究想法,单看质量不差。真正的问题藏在别处:它们翻来覆去就那么几种套路。
耶鲁和芝加哥大学的研究者用了一个很巧妙的办法来验证这件事。他们收集了 11,683 篇真实论文,5,994 篇来自 ICLR、ICML、NeurIPS(2023-2026),5,689 篇来自 Nature Communications(2023-2025)。对每篇论文,先反向工程出几篇"最可能启发作者核心想法"的邻近工作,再把同样的文献列表喂给 LLM,让它从同一个起点提出新想法。
然后他们设计了一套"研究品味"分类法,把每个想法沿两个轴拆开:Opportunity Pattern(机会类型)问的是这个想法发现了什么 gap,Method Paradigm(方法范式)问的是它怎么把 gap 变成贡献。每个轴各有七种标签。
结果很清楚。
人类想法的分布很广。只有 12.1% 的动机是"桥梁机会"(连接割裂的文献/方法),仅 5.1% 的核心方法是"综合/统一"。LLM 呢?"桥梁机会"占了 47.1% 到 64.2%,"综合/统一"占 22.5% 到 38.7%。分别是人类的 4 到 5 倍。
9 个主流模型全测了,Claude、Gemini、GPT、Qwen、DeepSeek,没有一个例外。
如果让模型多推理几步,情况会更糟。开了 thinking mode 后,Qwen3-8B 的"桥梁机会"从 49.7% 飙到 71.1%,"综合/统一"从 38.7% 涨到 52.2%。思维链没有帮它探索更多路径,反而让它更确信那条最熟的路是对的。
这显然不是 prompt 或者上下文给得不够的问题。研究者做了消融实验:给模型看完整论文而不是摘要,差距没缩小;换成更中性的 prompt 措辞,桥接偏好纹丝不动。
从分布指标来看,人类想法的归一化熵在机会轴上高达 0.926,模型只有 0.550 到 0.758。即使在方法轴上表现最好的 Claude-Sonnet-4.6,其 TVD(总变差距离)仍有 0.211,意味着超过五分之一的概率质量需要移动,才能匹配人类分布。
有个细节很说明问题。Claude-Sonnet-4.6 在诊断分数上甚至略超人类:瓶颈特异性更高,模板化程度更低。也就是说,它写得很好,甚至比人类更精准。但它的分布照样严重偏向桥接和综合。它的问题不是写不好,是只会写那几种。
机制分析进一步印证了这一点。把每个想法抽象成"操作动词"后,差距一目了然:
- integrate:模型 34.2%,人类 2.35%
- unify:模型 8.2%,人类 1.9%
- replace:人类 9.13%,模型 0.92%
- decouple:人类 2.33%,模型 0.21%
人类倾向于修改、替换、解耦一个局部机制。模型倾向于把两个高频概念"整合"在一起。这不是随机偏差,是一套稳定的行为模式。
说白了,LLM 像是一个特别擅长"缝合"的博士生:能快速把两篇文献串起来,写得头头是道。但让它跳出这个套路,去设计实验验证假设,或者分析一项失败的原因,它就露怯了。
对做 research 的人来说,这意味着别只依赖 LLM 帮你 brainstorm。它输出的东西大概率是主流范式的变体。真正的突破,可能藏在它不太愿意去的地方。
论文:https://arxiv.org/pdf/2607.01233
代码和数据集:https://github.com/ziyuuc/TasteGap。
关注公众号回复“进群”入群讨论

