什么样的论文能启发一项新研究,这件事现在基本还靠科学家的直觉。AI 系统已经能解定义清楚的问题,但面对一个刚冒头、还没成形的研究想法,该去翻哪篇旧工作,判断权大多还在人手里。斯坦福联合首尔国立、华盛顿大学、卡内基梅隆、Allen Institute for AI、MIT 等做了 ScholarCatalyst,把这种被叫做 research taste 的能力,变成一个能算分的检索任务。
它要测什么
任务设定很直接。给一个研究项目早期的问题,让系统从项目开始之前发表的文献里,找回真正推动过这个项目的论文,作者称其为 catalyst paper。检索库限定在项目启动前的文献,参与评测的模型知识截止都早于源论文,外部网页也关掉,防止模型靠训练时见过的答案作弊。
难点在相关性上。一篇能启发你的论文,跟你的问题在字面上常常不像,它提供的是一个思路、一个可借鉴的做法;主题相近的论文,反而未必有用。图里那组对比说的就是这件事,左边主题相似但没帮上忙,右边看着不同领域却给对了方向。现有检索靠语义相似度排序,这条最要命的信号它抓不住。
标准答案从哪来
这类判断在公开记录里查不到。一篇论文发表时,参考文献不会区分哪几篇是关键启发、哪几篇只是常规引用,更早的构思过程基本不留痕迹。作者的做法是直接问做过项目的人,请 184 位一作、覆盖 207 篇计算机论文,逐条确认项目起步时的研究问题,标出哪些先前论文确实或可能帮到了自己并写理由,其中也包括当时自己没读到的论文。为了让标注能规模化,他们做了一条流水线,输入论文编号就能生成供作者审核的草稿数据,新论文随时能补进来,基准也就跟着文献持续扩充。
整个基准有 894 条查询,检索库约 19 万篇论文,比预印本库三百多万篇小得多,相当于把难度先降一档。查询分两类,一类问中心研究问题,一类从具体子领域切入。子领域问题里,作者认可的启发论文有 43.6% 根本没被最终论文引用,这说明真正管用的启发,常常不在参考文献列表里。
结果,系统普遍找不到
成绩居前的通用稠密检索,在中心问题上只把 39% 的启发论文排进前 20,子领域问题上高一些,51%。专门在科学文献上训练的检索器反而更差,比通用模型低十几个点,说明只在引用数据上微调解决不了这个任务。
更值得注意的是智能体检索没跑过普通检索。让大模型反复改写查询、调用同一个检索器,多轮搜索是 42%,还不如单次稠密检索的 48%。原因也清楚,智能体每次搜索末尾还是要过一层按相似度排序的检索器,相似度这个信号本身不行,问得再多结果也上不去。用正则做检索的那个智能体,只找到 8% 的正确论文对。
作者还放了一个知识截止更晚的 Claude 做参照,它训练时可能已经见过这些源论文,前 20 也才 51%,照样漏掉近一半。
ScholarCatalyst 把研究品味这种偏主观的判断,落成了一个能算分的检索任务,也点出一个明确短板,现在的检索靠语义相似度,找不到字面不像、但确实有用的工作。作者认为要补的是训练方法,让模型具备专家级的判断,知道哪些想法值得读。对做科研智能体的人,这面镜子照出的,是会搜和会挑之间那道还没补上的差距。
【ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research,arXiv 2610.02202】
GPT-6.1 Sol 把旗舰价打到五分之一,dots 全天候智能体上线
北大跑了 591 次 RLVR 训练,把「挑数据」这件事重新测了一遍。换 12 个 seed,你的 RLVR 冠军方案可能就换人了
DeepSeek-V4.1-Flash 这份报告,主角是那条 KV 缓存曲线
张吕敏新作 把 AI 视频的记忆练出来了,60 秒前消失的东西,回来还是原样

