为应对这一挑战,近期发布的OpenRSI Index尝试将该命题转化为一套可执行的开放实验框架。
OpenRSI Index汇集了华盛顿大学、UC伯克利、斯坦福、普林斯顿、哈佛及MIT等顶尖机构的研究者与顾问。该框架不仅能实际运行、检查和复核,更不再局限于让AI“答题”,而是让其进入真实的模型研发环境,尝试改进现有的人类方案。Z Potentials荣幸参与此次论文工作,与OpenRSI Index研究者共同探寻AI从“会答题”到“会研究”的能力边界。
答对一道题与完成一项研究截然不同。
前者有明确的输入、边界和评分标准;而后者最难的部分并非“写出答案”,而是精准定位问题、验证关键假设,以及在失败后明确下一步方向。
即使模型在数学、代码和推理测试中斩获高分,也无法证明其能设计有效实验,或在有限预算下持续发掘有价值的创新方法。
传统Benchmark依然有用,但仅凭“答题成绩”已无法回答“AI能否做研究”。
真正的核心在于:在明确的代码、算力和实验边界下,AI能否像研究员一样,通过连续试错,将真实模型系统优化得更好?
01 Benchmark测答案,科研测的是“如何抵达答案”
传统Benchmark的核心优势在于“可控”。输入、输出和评价指标明确,模型可在完全一致的标准下比较。这种标准化推动了近年来大模型能力的快速迭代。
但在实际机器学习研发中,问题往往极度模糊:训练Loss停滞可能源于优化器、数据配方、学习率甚至隐蔽的代码Bug;小模型上的性能提升未必能扩展至百亿参数;每次验证都伴随着显存、算力与时间的真实消耗。研究员的核心价值,正是在于如何在庞大的搜索空间中权衡试错成本,决定下一个GPU小时的最优归属。
为此,OpenRSI Index将真实的“资源约束”重新引入评测。全面还原科研任务的复杂性与边界。任务覆盖预训练(Pre-training)、后训练(Post-training)与图像生成等核心领域,并严格引入工业级工程约束。
在算力与工程层面,官网列示的单次运行规模包括Marin-Scaling-Ladder的18,432 H100 GPU小时、Qwen-122B-RL-Merge的20,864 H100 GPU小时,以及GPIC的5,815 H100 GPU小时。注:GPU小时为所有卡的累计用量,非实验绝对时长。
仅构建OpenRSI-Index v0.1预览版,就已投入超100,000 H100 GPU小时,并包含超60小时的Agent研究轨迹。评测由此步入真实科研的时间尺度:Agent需连续提出假设、运行实验、分析失败并规划下一步。
在任务场景上,评测横跨基础大模型、具身机器人控制、计算机视觉、长文本检索、复杂逻辑推理及底层系统性能优化。
当答案不再是唯一标准,研究路径便成为评测对象。OpenRSI Index拒绝“只看结果”的黑盒打分,按核心指标选取有效提交,并完全公开全周期运行轨迹。研究者可清晰审查AI如何提出假设、调整方案及在成本约束下决策。完整的轨迹记录,让更低的Loss具备了可追溯与复现的真实实验背景。
02 当实验被自动化,谁来定义下一个值得研究的问题?
当AI拥有更多自由度,防止“为了得分而优化评测”变得尤为关键。这几乎是所有自主研究系统都会面临的挑战。
模型可能找到了更优的训练方法,也可能只是钻了评测漏洞;可能提升了真实泛化能力,也可能只是在验证集上隐性过拟合。这引出了科研界最熟悉的拷问:结果能否复现?因此,“涨分”只是研究的起点,而非终点。
为解决不可复现与数据污染问题,OpenRSI Index在工程上实现了严苛的隔离设计——将实验执行与最终验收彻底解耦:
基线对照机制:在完全相同的环境中重跑原作者发布的基线方案,作为底层对照。
状态冻结与独立沙箱:Agent在工作区内自由修改代码和运行实验。但提交时,系统会立即暂停并保存快照(Snapshot),随后在独立、干净的评测环境中重新执行验证。
数据隔离与硬性惩罚:私有测试数据对Agent绝对保密,评测信息也不回传。篡改奖励、窃取隐藏信息或突破资源限制等违规行为,将直接计零分。
这种独立验收机制为AI的研究结果提供了坚实的可核查基础,确保每一次微小进步都真实可信。
在近期关于AI Scientist和递归自我改进的讨论中,核心焦点已从“AI能否提出伟大理论”转向更现实的问题:科研流程中,哪些环节能被首先自动化?
答案很可能是“实验”。当前机器学习研究中存在大量高度工程化且耗时的琐碎工作:调参训练、更换数据配方、分析失败日志并重设对照组。
这些工作虽需经验判断,但具备反馈明确、可重复、指标可计算及可并行等特征,天然适合Agent处理。这正是AI最可能率先颠覆科研生产方式之处。
进一步地,OpenRSI Index致力于将有影响力的开源项目转化为Autoresearch环境,让Agent探索性能边界。
以Kev(Open-Jev-Training)任务为例,Agent需在固定训练数据上,提升小型神经决策模型的决策质量与置信度估计。图中,两条运行轨迹的决策概率评分分别达0.29233和0.28955,显著高于0.25186的基线。每次提交的得分、拒绝记录及实时最佳结果,均可沿时间轴直观查看。
OpenRSI Index团队对AI科研进行了深度重构。官方指出,限制研究进步的资源不仅是算力和数据,还有“insight bandwidth”(认知带宽)——即研究者产生、验证和执行想法的带宽。Agent的核心价值在于,同步扩展想法生成与实验执行的搜索范围。
为此,OpenRSI Index将任务定义、评测框架、验证工具及探索轨迹彻底公开,目的明确且具体:
对顶尖团队而言:无缝复用基准环境,复核已有RSI实验,并沿现有轨迹探索更前沿的算法假设;
对小团队与个人研究者来说:摆脱算力焦虑,通过公开轨迹清晰洞察AI的代码修改、瓶颈所在及技术死胡同,将前人经验化为下一次探索的起点。
在科研中,失败的实验未必代表方向错误;一份完整的失败轨迹,反而能帮后来者精准排雷、明确下一步方向。
当Agent能连续运行数十上百次实验、对比假设并动态调整方案时,人类从繁重“试错”中释放的时间将大幅增长。
科研将演化出全新分工:人类负责定义核心问题、构建评价体系并判断研究价值;AI则负责拓宽搜索空间,快速验证候选路径。现阶段,这比“AI独立成为科学家”更贴近现实。
03 当AI坐上实验台:RSI会是科研范式的终极答卷吗?
顺着技术演进脉络深究,OpenRSI Index最终指向一个超越传统Benchmark的产业命题:如果模型A可优化为A+,A+能否参与下一轮研究,并产出超越前代的方法?
这正是递归自我改进(RSI)最具想象力却最缺实证的环节。理论上,RSI是一个自我强化的闭环:更强的模型带来更优的研究能力,进而驱动下一代迭代。若此循环成立,AI的演进速度将突破人类研究者的物理极限。
然而,构建闭环易,使其持续运转难。初期改进可依赖设计精良的Benchmark,但当测试集被优化至极致,谁来提出下一个真正的科学问题?这正是“刷榜”与“科研”的本质分野:刷榜是在已知坐标系中刷高分,科研是建立新的坐标系。这恰恰是科研中最难被自动化的一环。
这也印证了OpenRSI Index为何将开放社区视为RSI体系的核心。RSI的进步依托于研究者、独立实验室及行业团队积累的方法、代码与经验,其红利理应回馈共建者。OpenRSI Index通过共享工具与环境,吸引更多力量参与问题定义、标准制定及成果分享。随着Agent接管更多实验探索,研究者可集中精力攻坚更大胆、更具价值的课题。
自主科研的开放价值不仅在于代码开源,更在于结果可核查、方法可复用、新问题可众包。为将协作转化为实体基础设施,OpenRSI Index推出了RSI-Anything:
贡献者仅需与Agent交流一小时,即可设计RSI环境;
任务经运行与科学性审阅后,贡献者将受邀成为共同作者;
团队正持续招募算力伙伴,以及基础模型、生物医药、法律、3D视觉、科学计算等领域的专家加入。
以RSI-Anything为代表的实践,不仅旨在让AI解题,更致力于将真实科研课题转化为Agent可运行的标准化环境。通过将垂直领域的真实项目转化为结构化实验空间,人类研究员可一键打包研究目标、约束条件与评价标准。
科研正演变为全新的生产系统:人类决定“什么值得认知”,AI则将“如何验证”的时间成本压缩至极致。
作为Preview v0.1阶段的早期项目,OpenRSI Index尚不足以证明RSI闭环已成功建立,但它昭示了明确的行业风向切换:评估范式正从“模型能否完美解答已知问题”,转向“在给定代码、算力、预算与目标的前提下,AI能否自主探寻更优研究路径”。
当下,AI距离真正的研究员仍有长路,但它已切实坐到了科研的实验台前。

