
过去,我们通常在新模型发布时感知AI进步:一道难题被解开,一项基准刷新纪录,一段代码终于可以自动跑通。可当AI开始参与下一代AI的研发,真正决定进度的变化,已经发生在发布会之前。
Anthropic在这篇文章中公布了一个内部快照:截至2026年8月,按其研发自动化指数,Claude已主导26%的模型研发工作,超过90%的工作达到“AI协作”或更高等级;在接受测量的任务类别中,尚无一类达到完全自主。与此同时,公司最常用的内部Agent平台,在任一时刻约有3万个Agent从事研究和工程工作。[1]
这些数字提出了一个更具体的问题:当AI越来越多地参与制造自己的后继模型,外界怎样知道研发正在加速到什么程度,又怎样判断监督是否跟得上?Anthropic给出了三组刻度:工作交给AI多少、行动受到怎样的监督、算力究竟流向哪里。
01|26%的真正含义:谁在推进工作,谁在做决定
这个26%,来自Anthropic新提出的研发自动化指数。它采用Epoch AI的六级量表,从AL0“没有AI参与”,到AL5“无需人类在环、完全自主”。眼下最关键的变化,发生在AL3和AL4之间。[2]
AL3意味着AI协作:人类密切指导,AI完成大块工作。AL4意味着AI主导:人类给出较高层级的目标,AI把大部分任务端到端推进,人类仍承担监督职责。两者的差别,在于人是否必须持续跟进过程、处理意外和决定下一步。
原文用修复故障数据流水线解释这个区别。处于AL3时,工程师拿着日志与初步判断找Claude,遇到新问题还需要决定怎么处理。处于AL4时,工程师可以把故障告警交出去,让Claude自行排查、修改、测试、比对结果并撰写说明,最后由人决定是否部署。到AL5,发现故障、确定范围、修复和上线才可以在无需人类介入的情况下完成。
因此,26%描述的是既定任务体系内、经过加权后达到“AI主导”等级的份额。它不能直接换算为减少了26%的员工,也不能说26%的科研决策已完全移交给机器。一个任务可以由AI推进绝大多数执行步骤,同时保留关键的人类批准节点。
这一区别对组织很重要。AI协作阶段,人主要提升自己的操作效率;AI主导阶段,人还需要学会给出清晰目标、设置交付标准、审阅结果。管理对象开始从“下一步怎么做”,转向“这项工作是否按要求完成”。这是本文对上述分级的组织层面解读。
图1|Anthropic研发自动化指数原图。AL4“AI主导”的份额由2026年3月约1%升至8月26%;竖线为90%的测量区间。横向比较的是固定任务篮子下的加权份额,不是员工人数或精确工时占比。来源:Anthropic,指数版本v2026.07。
02|一条迅速上升的曲线,是怎样测出来的
官方图表显示,AI主导的份额从2026年3月约1%,升至4月3%、5月12%、6月14%、7月22%,到8月达到26%。图中还标出了90%的测量区间。读这条曲线时,真正有价值的是沿用同一尺度观察变化,而不是把某个月的小数点当作精确的行业分界线。
这个指数背后有一套具体抽样程序。Anthropic在2026年7月的每一周,从构成模型研发流程的各部门随机抽取20%的员工,由Claude读取相关工作记录和内部文档,汇总出约1.5万个细粒度任务,再将它们组织成一棵含542个节点、378个叶节点的任务树。[3]
随后,一个研究Agent搜集每类任务怎样完成、谁参与、使用哪些工具的证据;另一个Claude评判实例给出自动化等级。判断某个月的情况时,只允许使用那个时间及之前的证据。任务树被固定下来,让各月测量尽量对准同一篮子工作。
各类任务也不是等权相加。每个人每周获得一个权重单位,平均分给其当周参与的任务:参与四项,每项0.25;参与十项,每项0.10。各类任务的权重再汇总。这是人员投入的粗略代理,并非逐项计时,所以不能把26%直接读成实测工时自动化率。
附录还披露了与人的交叉检查:模型与人类对等级的完全一致率为59%,人类之间为35%;模型和人的判断有97%相差不超过一个等级。这说明等级可以被讨论和复核,也说明“协作”与“主导”的边界仍有判断空间。它并不构成模型判断优于人的普遍证明。
固定任务篮子还有一个类似物价指数的问题:旧工作被自动化后,人可能转去做全新的工作。指数擅长说明旧任务发生了什么变化,却不能单独解释整个组织的岗位与研究方向如何变化。Anthropic计划定期重建任务篮子并更新版本。要连续读懂这条曲线,指数版本与抽样方法必须和数字一起公开。
03|自动化增加,研发速度会按比例增加吗
26%本身并不是研发加速倍数。一个任务从人类执行变为AI主导,可能更快、更便宜,也可能只是降低了人类参与强度;整条研发链究竟缩短多少,还取决于它是否处于关键路径,以及有没有其他环节在等待。
假设一种纯粹用于说明的情形:某流程有一半时间用于可以加速的环节,另一半完全不变。即使前一半快了十倍,总耗时仍是原来的55%,整体速度约为1.82倍。这不是Anthropic的测量结果,而是提醒我们:局部能力提升与整体研发提速之间,还有调度、实验周期和瓶颈的约束。
反过来,时间也不是唯一收益。同样一个月里,如果研究团队能够尝试更多有差异的方法、复现更多结果、提早淘汰错误路线,科研产出可能已经改变,即使下一次大型训练的完成日期还没有变化。
所以,要理解“AI研发AI”的速度,自动化等级需要与其他证据一起看:从想法到有效实验的周期、关键决策需要等待多久、结果复现率、以及研究者能否真正理解和取舍产出。原文公布的是生产过程的一组指标,它为这些更难的问题建立了观察起点。
04|3万个Agent同时工作,监督要看哪三件事
Anthropic披露的约3万个同时运行Agent,限定在其最常用的内部平台。对该平台,公司把监督分为在线和离线两类:在线监控在行动发生前检查并阻止或引导高风险行为;离线监控在事后阅读轨迹,寻找逐渐形成的问题。[4]
在线监控主要应对速度快、难以挽回的风险,例如模型权重被复制出系统。Anthropic称,该平台100%的Agent行动在执行前经过在线监控,检查通常在数秒内完成;已经被阻止的行动,由人类在一周内复核。“一周”说的是被拦截之后的人工复核时间,不能理解成危险操作可以先运行一周。
离线系统则接收该平台全部Agent活动。每周约有10万份轨迹被标记,再经过多个分类器筛除误报和初步审查,大部分在这个过程中得到处理,优先级最高的约50份升级给人类。这里的单位是轨迹,而在线拦截率统计的是决策;两组数量不能直接相除比较。
原文报告,2026年8月分析的在线决策超过10亿次,约0.002%被拦截,约合每4.7万次一次;离线系统则约每千份轨迹标记一至两份。比例看起来很小,规模却足以让稀有事件成为持续的运营负担。例如,若以恰好10亿次决策和0.002%作示意计算,也对应约2万次拦截;这不是原文披露的精确拦截总量。
读懂监督,需要同时看覆盖率、审查延迟和升级率。覆盖率回答多少行动经过检查;延迟回答多快发现并介入;升级率回答多少活动触发进一步处理。100%覆盖并不等于100%检出,低拦截率也无法独立证明风险很低——还需要检验监控器能否抓住已知危险行为、漏掉哪些行为,以及误报的代价。
05|监督群体,还需要知道“这句话是谁说的”
附录里一个很有分量的设计,是给Agent保留独立身份,并让身份与底层模型分离。模型升级后,同一个Agent的记录仍可连续追踪;它产生的数据,也能追溯到具体身份。[5]
这个设计的意义超出了日志管理。一个Agent读取另一Agent的结论时,应当知道那是需要核实的外部主张,而不是把它当作自己已经确认过的判断。身份、出处和原始材料让协作中的错误更容易被定位,也有助于减少群体行动的相关性。
Anthropic还介绍了共享的开放消息系统:消息关联发送者身份,可以直接引用原始内容,并与Agent轨迹交叉链接。监督者由此有机会沿着一条结论追踪:谁提出、谁转述、谁验证、最后是谁据此行动。
在本文看来,这为多Agent治理提供了一个实用原则:通信的价值,不只在于信息传得快,也在于证据能够随着信息一起流动。一百个Agent重复同一个判断,并不自动构成一百份独立证据;如果它们都引用同一条未经验证的消息,系统需要能够看见这个共同来源。
06|6%与12%:安全算力的分母,比数字更重要
第三组指标追踪算力分配。Anthropic检查了7月13日至20日的一周快照:流向AI研发的算力中,约6%用于安全;流向AI驱动的AI研发的算力中,安全占比约12%。两个比例使用不同的分母,不能相加,也不能直接推断AI研究安全的效率是人的两倍。[6]
分类标准强调工作目的:以让AI更安全、更可理解或更可靠为主的工作计入安全;如果一项工作对能力和安全贡献同样大,则没有计入上述安全份额。防护分类器消耗的算力也另行统计,未包含在这两个比例中。因此,把6%写成“公司全部算力只有6%用于安全”会改变原意。
算力比例的吸引力在于,它比一句“我们重视安全”更容易留下可检查的资源记录。附录说明,他们汇集已有算力监测来源,分类器读取训练和评测运行的元数据、代码,或AI研究Agent的会话;对那周近一万次训练和评测运行抽样约14%,并更多抽取高算力运行,让样本反映资源流向,而不是只数实验次数。
但支出只是投入,不能替代安全成果。某个监控器效率提高,使用更少算力完成同样检查,安全占比可能下降;某项需要大量人工思考的安全研究,算力消耗也未必高。更高比例可以体现资源选择,却不能直接证明防护更有效。
这项测量最有意义的用途,是在共同定义下做长期、可复核的比较。分类边界、基础标签质量、未能读取的工作记录、抽样方法,都必须随数字披露。一个星期足以展示测量可行性,还不足以证明趋势;这也不是固定的安全预算承诺。
07|真正重要的,是让实验室的加速过程能被外界检验
把这三组测量放在一起,才能看出文章的完整意图。研发自动化观察工作的执行责任怎样移动;Agent监督观察这种变化是否仍可被干预;算力分配观察组织把资源投向哪里。它们分别提供生产方式、控制能力与资源方向的线索。
三组指标之间还需要交叉提问:如果AI主导份额迅速上升,人工复核是否出现积压?如果监控覆盖保持100%,单次检查的有效性有没有随任务复杂度下降?如果安全算力份额提高,是安全研究得到更多支持,还是当前防护方法本身更加昂贵?这些问题才让报表变成判断工具。
Anthropic计划引入多个组织的独立第三方评估者,让他们访问与内部风险评估团队相当的流程、系统和数据,用来核验安全实践、报告事件和监测指标。这里的关键是可复核的访问安排;一张由实验室自行生成的图表,距离一套外界可以持续验证的机制,仍有具体工程与制度工作要完成。[1]
公众不必掌握模型权重或商业机密,才能要求更可信的测量。固定口径、明确分母、披露延迟、抽样复核,以及对漏报和失败的独立测试,都能缩小实验室内部与外界的信息差。与此同时,跨实验室排名应等待足够一致的方法:两家公司都写着“AI主导26%”,背后的任务类别和权重不同,含义可能相差很大。
这篇文章带来的一个重要转向,是把关注点推进到了模型发布之前。AI能力榜单让我们看见新系统能做什么;研发自动化、监督和算力记录,则让我们开始看见这些能力是怎样被生产出来的。
当AI越来越多地参与研发下一代AI,理解进步速度就需要同时理解工作的组织方式与控制方式。谁在推进实验,谁在批准行动,谁能及时发现偏离,资源又在支持哪一种进步——这些问题的答案,决定了我们能否对加速作出有根据的判断。
资料来源与口径
正文数字均来自Anthropic此次披露;研发自动化及Agent监督以2026年8月为快照,算力以2026年7月13—20日为快照。本文据2026年9月19日读取的网页整理。
[1] 原文导言、三项测量及第三方核验计划
[2] 原文第1节:Measuring AI-led AI R&D,及脚注1的AL3—AL5案例
[3] 原文附录:Measuring AI-led R&D,抽样、任务树、权重和人工交叉检查
[4] 原文第2节:Measuring oversight of AI agents,在线与离线监控对照
[5] 原文附录:Oversight of agents,独立身份与开放通信
[6] 原文第3节及附录:Measuring compute allocation,算力口径与局限
Anthropic 原文:Measurements for understanding the pace of AI development inside frontier labs
https://www.anthropic.com/institute/measuring-pace-of-ai-development
1.20K-40K!深圳扬奇医芯招双目结构光算法工程师
2.AI教父Hinton诺奖演讲首登顶刊!拒绝公式,让全场秒懂「玻尔兹曼机」
3.GitHub没了?CEO辞职,微软接管,开发者天塌了
4.AI颠覆数学研究!菲尔兹奖得主、华裔数学家领衔11篇顶刊论文|陶哲轩转赞
5.AI OS,下一个二十年的超级平台
6.全球首个IMO金牌AI诞生!谷歌Gemini碾碎奥数神话,拿下35分震惊裁判



