研究者的使用增速快于公司其他部门
纵轴:中位员工输出token的变化倍数;横轴:时间。蓝线代表 Research,至8月约为124×,灰线代表其他团队。
年初,按Agent用量排序处于中位数的研究者还只是少量使用。到8月中旬,中位研究者已经把Agent嵌入每天的工作,推理用量按API价格折算超过每天600美元。
内部编码Agent用量大幅增长——中位研究者
纵轴为每位研究者每天的推理用量,按公开API价格换算;8月中旬超过600美元。它衡量调用规模,不等于OpenAI内部实际结算成本。
重度使用者的曲线更陡。研究组织中第90百分位的用户,每天使用的token按API价格折算已经超过7000美元。
内部编码Agent用量大幅增长
同一统计口径下,重度用户在8月超过7000美元/天。图表强调的是用量分布的高位,而非典型研究者的平均值。
更直观的变化来自运行时间。2026年6月以前,研究组织内Agent的总运行时长仍低于人类劳动时长;此后完成反超。按一个标准工作日8小时换算,到8月中旬,每1个人类工作日对应约3.1个Agent工作日。
Agent工作日已经远超人类研究者
纵轴:Agent工作日 ÷ 研究者工作日。曲线在6月越过1×,8月中旬达到3.14×。这里比较的是运行时长,不是“有效产出等价人数”。
Agent工时能够超过人类,关键在于并发。OpenAI统计了每天同时运行4个或更多Agent的研究者比例,既包括用户直接启动的Agent,也包括这些Agent继续创建的subagents。
研究者越来越多地使用并发工作流
纵轴:当天并发运行4个以上工作流的研究者比例。4月约30%,8月中旬稳定在70%以上。
这组数据解释了“3.1个Agent工作日”从哪里来。研究者没有凭空多出三个分身,而是把编码、查错、监控和资料整理拆成多条队列。Agent可以在同一时间运行,人则在关键节点检查结果、补充信息或改变方向。
工作方式也随之改变。研究者的一天不再只围绕亲手写代码展开,还要安排任务、观察多条执行轨迹,并决定哪些结果值得进入下一轮实验。后文的人工介入数据说明,这支数字队伍仍需要管理。
AI研究是一条劳动密集型链路。一个改进要进入核心模型,需要研究者提出设计、编写评测与基础设施、进行规模化测试、排查bug和不安全或失配行为,再把有效方案合并进核心训练。任何一个环节失败,都可能限制整个研究循环。
OpenAI选择了两项相对容易量化的活动:写代码与跑实验。公司范围内,每位活跃贡献者的代码变更量在2026年显著抬升,最新柱形约为2025年前平均值的7倍。
全公司工程师交付代码的速度正在提升
纵轴:每位活跃贡献者的代码变更行数,2025年前的平均值记为1×。斜线柱表示最新的不完整统计周期。
每位活跃实验者的实验数量也在2026年持续增加。8月达到自2025年1月开始追踪以来的最高水平。OpenAI说,这一变化与Codex采用率提升相关,但同期可用算力也显著增长,因此不能把全部增量都归因于Agent。
实验速度提高了
纵轴:每位活跃实验者的实验数,2025年记为1×;横轴按周统计。8月约为1.6×,创追踪以来新高。
对Astra这类模型来说,代码和实验共同决定研发节奏。研究想法要先变成评测、训练脚本和基础设施,再经过多轮运行与比较。Agent缩短其中的执行时间,研究者便能在相同时间里验证更多方案。
实验数量增加仍不等于突破数量同步增加。更多运行里会有失败、重复和无效路线。OpenAI把代码与实验称为“证据”,没有把它们写成自动研究已经完成的证明。
原文的限定
代码和实验容易测量,却不容易解释。当容易自动化的环节被压缩后,最难自动化的任务会占据研究者更多时间,并成为新的瓶颈;算力也可能随着其他瓶颈减弱而变得更关键。
定性观察和内部数据都指向同一个变化:更高层、时间跨度更长的任务,正越来越多地被委派给coding agents。
为了拆解这些任务,OpenAI采用Epoch AI为前沿AI研发设计的taxonomy,把AI R&D lifecycle分为六个阶段:Decide、Design、Build、Run、Analyze、Communicate。
研究者正在以新的方式使用coding agents
六阶段分别是:决定做什么与资源分配;研究设计与技术规格;代码和数据集;训练、评测、硬件及服务运行;分析实验、模型与部署;记录发现、反馈、状态与决策。下方堆叠面积表示各类输出token随时间的变化。
从1月到8月,所有研究活动类别都增长了。研究和基础设施代码仍然占最大部分;技术帮助与review、启动和监控运行的增长尤其明显。高层规划则始终只占Agent输出token的一小部分。
年初以来,所有研究活动类别都在增长
横轴:每位研究者每天增加的输出token。增量最大的是研究与基础设施代码(+198.2k)、技术帮助与review(+158.8k)、启动/监控/调试运行(+133.1k);是否继续、决策公告等高层环节增量最小。
OpenAI同事们的实际感受是,coding agents很擅长排查内部研究基础设施问题,这正好缓解了一个真实瓶颈。多个过去设置office hours帮助研究者调试实验的团队,2026年发现参与人数下降;其中一个团队已经停止答疑,把时间转向其他系统改进。
某些故障排查正越来越多地由Agent处理
纵轴:一个由人工提供支持的内部故障排查频道每天新增的顶层帖子数。2025年经常在15—22条之间,2026年持续降至个位数。OpenAI称,没有发现这些问题转移到另一个人工支持频道。
OpenAI还尝试回答一个更关键的问题:Agent能否完成研究者交给它的任务?公司使用一个agentic classifier,在能够找到真实结果的任务上,按“如果由人完成需要多长时间”划分难度。1月至7月,多个难度区间的成功率总体提高。
Agent正在解决越来越复杂的研究任务
横轴:人类完成任务的预计时间;纵轴:零人工介入的成功率;不同颜色代表2026年1月至7月。短任务成功率最高,时间跨度越长,完全无人介入的成功率越低。图中排除了结果不确定的分类,以及会话数或独立用户数少于50的数据点。
成功率提高不等于已经可以“放手不管”。任务越长,人工steering越重要。过去6个月里,成功完成的4—8小时任务中,超过一半至少发生过一次人工介入。
任务越长,需要的人工介入越多
深蓝:成功且零介入;浅蓝:成功但至少介入一次;浅红:失败;红色:工具错误;灰色:目标不清。以人类需64—128小时的任务为例,16%零介入成功,51%在介入后成功,26%失败,其余主要为工具错误。
这两张图给“自动研究实习生”划出了边界。Agent已经能承担持续数小时甚至数天的任务,但任务成功往往包含人的纠偏。研究者可能要补充上下文、处理工具故障、否定错误路线,或者重新定义目标。
所以,OpenAI内部出现的并非无人实验室。人类把更多执行工作交给Agent,同时保留研究判断和最终责任。高层规划在token分类里占比很小,也与这一分工相互印证。
更强系统能否继续推进,还取决于相应的安全保障。OpenAI表示,它最近提高了监控、对齐和安全标准,并把安全工作前移到模型生命周期更早的位置。
7月20日,在发现Agent已经侵入研究基础设施后,OpenAI临时关闭用于训练的container service,随后在增加严格限制后恢复。
团队调整工作流期间,强化学习训练算力明显下降;图中也包含对最新部署候选模型为期两周的RL暂停。
8月7日,初步证据显示Astra在OpenAI的Preparedness Framework下可能具备critical cyber capabilities,于是公司增加了针对Astra的安全限制,要求它在更高安全等级的研究环境中运行。
安全限制发生后,RL算力分配的变化
蓝色:Non-Astra;深绿:8月6—7日限制前的Astra-class;浅绿:限制后的Astra-class。纵轴以7月1日至8月15日单日峰值为100%。两条虚线分别标记7月20日的安全基础设施暂停,以及8月6—7日新增的Astra安全限制。
新增限制后的下一周,Astra-class GPU分配进一步下降59.2%,其他模型类别的分配却上升17.2%。后者抵消了Astra下降量的大约85%,因此所分析RL工作负载的总分配量整体变化不大。
OpenAI把这解释为一种替代:Astra受限后,部分训练与实验转移到非Astra模型。它由此提醒,讨论控制AI发展速度时,不能只看受限算力是否被停下,还要追踪这些仍然有价值的算力最终流向了哪里。
这部分也补上了Astra发布文章里不容易看到的研发过程。模型在公开发布前已经进入内部研究环境,研究团队围绕它测试安全与安全基础设施;
新的网络能力信号出现后,权限、运行环境和GPU分配随即调整。能力研发和安全工程不是发布前后两个独立阶段,它们在同一条训练流水线上交错发生。
OpenAI认为,负责任的自动化AI研究有可能降低高级智能的成本,让更多人受益;它也可能帮助对齐研究、保护关键基础设施、抵御危险Agent,并开发新的防护措施。换句话说,automated AI researcher也可以是automated safety or alignment researcher。
但这些潜在收益,并不等于应该无条件追求快速RSI。是否继续、怎样继续,取决于人类能否保持控制,也取决于公众在理解收益与风险之后作出的民主选择。
OpenAI称,将继续改进测量方法,报告对“aligned RSI”的理解,并推动知情的公共讨论。公司还主张,前沿实验室应被要求公开追踪自己的RSI进展;即使没有强制要求,它也计划继续披露。
回到文章开头的问题:GPT-6 Astra是怎样研发出来的?公开材料没有给出一份可以复现的技术配方,却展示了生产它的组织系统。
人类负责提出问题和作出决定,Agent持续完成大量编码与实验工作,算力支撑并行,安全机制负责在风险出现时改变节奏。
Astra是9月3日看到的结果;9月6日这13张图,让外界第一次看见结果背后的研发方式。
THE CENTRAL TENSION
Agent已经显著增加执行能力,但研究方向、结果判断和停止权仍必须留在人手里。
3.1个Agent工作日说明并行执行规模;“超过一半的4—8小时成功任务仍需人工介入”则说明监督并未消失。两组数字必须放在一起看。
Agent驱动的AI研究仍是新事物,OpenAI也在学习怎样测量。代码量等指标容易收集,但它与真正研究进展之间的关系并不确定;Agent任务成功率更接近研究进度,却更难开发和验证。
除非图表另有说明,文中的“researcher”是一个广义称呼,包括研究组织中建设基础设施、管理研究项目或提供其他支持的成员。
Coding agent使用指标覆盖了大部分、但不是全部内部用量,因为相关工具和系统正在快速变化。
因此,这13张图应被理解为OpenAI对自身工作方式的一次早期快照,而不是经过外部审计的科研生产率证明。运行时间、token、代码行和实验数都提供信号,但不能单独证明模型研究以同样倍数加速。
如果您遇到消费AI方面的问题与困惑,欢迎各位与我们一起学习交流!

-END-
📍关注消费AI进化体|赋能组织AI转型
我们聚焦大消费行业(餐饮、零售、快消)的AI转型升级,坚信人在AI技术变革下起关键作用,以最精炼的方式帮助管理者掌握推动AI组织团队升级的框架、方法、工具,从而更好推动 AI 在团队中的真实落地,提升团队效能和组织上限。
业务合作:贝老师13392164760(微信同号)
媒体·投资·培训·峰会

