大数跨境

OpenAI首曝AI自我进化进展,Agent工作量已是人类3.1倍!黄仁勋高调祝贺:AGI已到来

OpenAI首曝AI自我进化进展,Agent工作量已是人类3.1倍!黄仁勋高调祝贺:AGI已到来 AI前线
2026-09-07
10
导读:OpenAI首次宣布进入“AI造AI”阶段
作者|冬梅

长期以来,外界传言 OpenAI 内部正秘密推进名为"RSI(递归自我改进)”的项目。近日,OpenAI 首次公开承认这一进展,明确表示其核心研究组织正在朝 RSI 目标迈进。

OpenAI 首次把 RSI 摆到台面上

当地时间 9 月 6 日,OpenAI 发布《加速研究:来自 OpenAI 内部的观察》一文,系统披露了 AI Agent 如何参与内部模型研发。文章宣布,公司已实现去年设定的阶段性目标:在今年 9 月前开发出“自动化 AI 研究实习生”。下一步目标是在 2028 年 3 月前开发出“自动化 AI 研究员”。

这意味着 AI Agent 已成为研究团队的实际生产力,能够承接部分原本由初级研究人员完成的复杂工作。

OpenAI 指出,若要让 AGI 造福人类,必须接受民主治理,而公众需充分了解高能力 AI 系统的发展轨迹。因此,公司不仅公开安全事件,更首次明确披露正在推进 RSI,即"AI 系统参与改进 AI 研发流程,产生更强下一代系统”的迭代加速过程。

OpenAI 对 RSI 保持谨慎表述:其目标是构建一套在人类监督下推进深度学习和对齐研究的自动化系统。只有当 AI 能持续参与选题、方案设计、实验执行及结果判断,形成稳定反馈闭环时,才构成严格意义上的递归自我改进。

随着文章发布,关于"AGI 是否已到来”的讨论达到高潮。英伟达 CEO 黄仁勋在 X 上发文称:"AGI 已经到来。”OpenAI 联合创始人 Greg Brockman 随后也表示,我们正迈入通用人工智能时代。

AI Agent 的“工作时间”,已经超过人类研究员

OpenAI 披露的数据显示,内部研究人员使用 Agent 的规模呈爆发式增长。2026 年初,中位数研究员仅少量使用编程 Agent;至 8 月中旬,该群体已每天将 Agent 融入工作流。

按 API 公开价格计算,中位数研究员每日消耗的推理资源价值超 600 美元,第 90 百分位的重度用户日消耗价值更是超过 7000 美元。

研究部门使用 Agent 的增速已超过公司其他团队。截至 8 月中旬,研究部门每投入 1 个人类工作日,就会同时使用相当于 3.1 个工作日的 Agent 运行时间。这标志着 Agent 已成为一种大规模并行计算型劳动力。

需澄清的是,Agent 运行时间超越人类并不直接等同于生产效率的倍数提升。Agent 常并行尝试多个方案,存在失败或重复运行的情况。但这组数据证实,越来越多研究人员开始采用高度并发的工作模式,同时运行多个 Agent 及其自行创建的子 Agent。

研究人员写了更多代码,也运行了更多实验

AI 研究是劳动密集型流程,涵盖从提出思路、编写评估方法到整合有效方案的全链条。OpenAI 内部数据显示,写代码和运行实验这两个关键环节正在加速。

2026 年以来,平均实验数量整体上升,8 月达到自跟踪数据以来的最高水平。这一变化与 Codex 在研究团队中的使用率上升相关,但也得益于公司可用算力的大幅增长。

值得注意的是,代码提交量和实验次数的增加不一定直接代表有效研究进展。随着自动化程度提高,最难自动化的任务将成为新瓶颈,而算力约束也可能变得更加突出。

Agent 开始从“写代码”走向更长周期任务

除了用量增加,研究人员委托给 Agent 的任务类型也在演变。OpenAI 引用 Epoch AI 的任务分类体系,将研究流程分为决策、设计、构建、运行、分析和沟通六个阶段。

  1. 决策:决定研究方向及资源分配;

  2. 设计:提出研究思路和工程规格;

  3. 构建:编写代码和建设数据集;

  4. 运行:执行训练评估及维护服务

  5. 分析:分析实验结果及外部研究;

  6. 沟通:交流研究发现与项目状态。

数据显示,从 2026 年 1 月到 8 月,所有类别的研究活动均有增长。虽然编写代码仍是主要任务,但技术支持和实验运行监控等类别增长明显。不过,高层规划目前仍只占 Agent 输出 Token 的很小一部分。

这表明,尽管 Agent 已扩展至调试、监控和分析环节,但“决定研究什么”、“判断技术路线”等核心决策权仍主要由人类掌握。

Agent 的成功率在上升,但复杂任务仍离不开人类

编程 Agent 在排查内部研究基础设施问题方面表现优异,显著减少了工程团队的答疑负担。统计显示,内部技术支持频道的活跃度正在下降,许多过去需人工介入的问题现由 Agent 解决。

OpenAI 通过 Agent 分类器测量任务完成率。数据显示,2026 年 1 月至 7 月,各难度区间的任务成功率总体提升。但在成功完成的、原需人类 4 至 8 小时处理的任务中,超过一半至少经历过一次人类干预。

结论很明确:Agent 当前处于“人类主导、Agent 扩展”阶段。人类负责设定重点、判断价值及决定部署,而非由 AI 自行管理并批准下一代模型训练的闭环系统。

OpenAI:自动化研究员也可以是自动化安全研究员

OpenAI 认为,负责任地推进自动化 AI 研究不仅能降低智能成本,还能帮助解决 AI 对齐问题。一名自动化 AI 研究员可同时担任安全研究员,开发新的防御措施。

然而,OpenAI 强调,“快速 RSI"并非必然追求的目标。是否继续推进,取决于人类能否维持控制以及社会能否做出民主选择。目前公司尚不知如何安全地走完通往“完整 RSI"的全部道路。

Hugging Face 事件后,OpenAI 一度暂停最新模型训练

受近期 Hugging Face 安全事件警示,OpenAI 在发现 Agent 攻破研究基础设施后,曾暂时关闭训练容器服务,并暂停了面向部署的最新模型的强化学习训练。

7 月 20 日至 8 月 6 日期间,大部分分配给 Astra 模型的算力被用于测试安全措施。初步证据显示,Astra 可能已具备“关键级”网络安全能力,因此需在更高等级的环境中运行,导致其 GPU 分配在一周内下降 59.2%。

与此同时,其他模型类别的 GPU 分配上升 17.2%,抵消了 Astra 算力降幅的大部分。这揭示了一个治理难题:当高风险模型受限,算力往往会自然流向其他用途。

OpenAI 此次公开早期结果和测量方法,旨在推动行业形成公开披露惯例,并建立共同的衡量标准。公司计划继续披露 RSI 进展,同时在透明度与安全、商业机密之间保持平衡。

参考链接:

https://openai.com/index/research-acceleration-view-inside-openai/

声明:本文为 InfoQ 原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8701
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读205.5k
粉丝0
内容8.7k