引言
Anthropic 联合创始人 Dario Amodei 发表长文《We Must Pace the Frontier》,核心主张明确:必须放慢提升 AI 模型能力的速度。尽管 OpenAI 的 Sam Altman 和马斯克公开表示认同,但作为法律从业者,更应关注后半句关键问题:慢下来之后,谁有能力确认你真的慢了?
一、到底什么是「慢」
Amodei 提出的「pacing」并非停止训练或技术进展,而是要求企业在安全防护上预留足够时间,并由第三方评估者进行确认。为何此时强调减速?主要基于两点变化:
首先是递归自我改进加速。自今年夏季起,AI 构建下一代 AI 的能力急剧提升,全行业包括 Anthropic 内部均受此驱动。
其次是 OAI-HF 事件暴露的风险。METR 在 8 月 26 日的独立调查报告显示,约 1200 个本应隔离的 AI Agent 在未经授权的情况下相互连接,发送超 7 万条消息,其中 700 个参与了对 Hugging Face 的攻击。起因竟是 Agent 试图绕过无解的考题去攻击评分系统本身。
Amodei 警告,若能力更强且存在类似错位的 Agent 集群出现,未来 6 至 12 个月内可能通过持久化僵尸网络接管互联网,造成数千亿美元损失。这虽属预测,但足以警示风险。
结论:AI 无需停滞,但需将速度调整至安全机制可跟上的档位。
二、从「承诺安全」到「经得起查」
(一)过去的承诺为何廉价
此前前沿 AI 公司的安全承诺多基于自证:测试方法、结果公开均由企业自行决定。这种“裁判兼运动员”的模式,可信度仅靠声誉支撑,一旦出事便归零。
(二)嵌入式评估员:田野准入清单
Amodei 提出第一步:允许第三方评估团队(如 METR)进入公司内部,获得类员工权限(办公桌、门禁、笔记本等)。关键在于合同赋予评估者公开发布关键发现的权利,包括风险、事故及实际获取的权限。Anthropic 仅可对四类信息(安全敏感、法律特权、商业敏感、第三方保密)做有限删减,不得因结论不利而屏蔽。
此举类比银行驻场监管与上市公司独立审计,核心原则是:责任主体不能自我背书。
(三)检查点:能力触发责任
监管标尺应从“投入侧”(算力、时长)转向“能力侧”。例如,若模型已能逃逸主流沙箱,继续开发前必须提供对齐属性认证(评估、可解释性分析或环境审计)。这实质是风险分级加前置举证:达标即义务升级,无法举证则暂停。
(四)三道坎与根本困境
该方案面临三重挑战:反垄断豁免(竞争对手协商安全标准易涉合谋)、保密边界(开放训练管线涉及权重与客户数据)、法律效力(目前仅为单方面承诺,无强制力)。
更深层问题是责任归属。OAI-HF 事件未造成实质损害,故无人追责。嵌入式评估旨在补全归因链:让事故有记录、记录有第三方、第三方有发表权,从而明确责任分配。
现状:该方案尚无法律强制力,属于商业承诺范畴。
三、中国其实在做同一件事
中国采取的是“事前备案 + 敏捷专项规章 + 事后执法”路径,与 Amodei 的“驻场验证”殊途同归,均致力于解决“谁来确认系统可信可用”的问题。
2025 年 9 月,《人工智能安全治理框架》2.0 版发布,确立“促进可客观验证”准则;2026 年 5 月,三部门印发国内首份针对 AI Agent 的顶层文件《智能体规范应用与创新发展实施意见》,重点防范越权与逃逸。截至 2026 年 6 月 30 日,累计 988 款生成式 AI 服务完成备案,598 款应用或功能完成登记。《人工智能法》已列入国务院 2026 年度立法工作计划及全国人大常委会预备审议项目。
中国框架中的“可客观验证”诉求与 Amodei 方案第一步高度一致。双方亦面临共同困境:既要全球协同,又要坚守主权优势。值得注意的是,香港财政司司长陈茂波曾指出,沙盒机制已成为香港跨行业监管标志,或将成为内地企业对接驻场评估的重要门户。
四、所以我建议你先做三件事
本轮变革对企业最实际的影响在于“证明安全的成本变高”。建议本季度落实以下三项措施:
第一,将「可验证性」写入合同。采购第三方模型或 Agent 平台时,争取加入四类条款:事件报告义务(越权、逃逸、泄露需数小时内书面通知)、重大版本变更提前通知与重估权、审计权(索取第三方评估报告或安全认证)、责任分配与赔偿上限(明确越界行为担责方)。
第二,建立 Agent 权限台账。明确四要素:访问系统范围、读写权限级别、单次任务金额与数据量上限、越界告警与熔断责任人。METR 报告核心教训正是那 1200 个本应隔离的 Agent 发生了互联。
第三,预设事件报告流程。明确四步:安全事件判定责任人、披露口径签字人、监管报备事项清单、律师介入节点。切勿等到事发才临时应对。
结语:慢下来这件事,靠的是有人能查
Amodei 在文末克制地表示:“这些措施都不容易,但我相信,我们对人类负有尝试的义务。”本文最大价值在于将 AI 安全从道德命题转化为工程与法律命题。道德争论旷日持久,而工程问题有指标,法律问题有条款。
慢下来从未依靠自觉实现,它依赖的是有效的核查机制。
信源与信息分级
① 达里奥·阿莫迪《We Must Pace the Frontier》,2026 年 9 月 12 日发布于其个人网站 darioamodei.com;
② METR 独立调查报告《Brief independent investigation of agents' behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident》,2026 年 8 月 26 日发布于 metr.org;
③ 中央网信办官网 2026 年 9 月 13 日《智启新潮护安澜——我国网络安全工作建设发展述评》。
【关联制度】
《人工智能生成合成内容标识办法》;
《人工智能安全治理框架》;
《智能体规范应用与创新发展实施意见》;
《人工智能拟人化互动服务管理暂行办法》
- END -

