Future of Life Institute(未来生命研究所,简称 FLI)正式发布 2026 年夏季 AI 安全指数。报告显示,头部科技公司在安全承诺上出现倒退,而自动化攻击工具的进化速度远超人类防御能力。

值得注意的是,本期排名第一的公司已悄然收回此前的安全承诺。与此同时,OpenAI 于 7 月 15 日推出的自动红队测试工具 GPT-Red,其攻击成功率高达 84%,远超人类测试员的 13%。技术攻防失衡,治理却现退步。
成绩单:全球九家巨头评级一览
FLI 的 AI 安全指数截至 2026 年夏季已发布第四期,评估对象从 2024 年的 6 家扩展至 9 家。评审团由 7 位独立专家组成,涵盖加州大学伯克利分校、牛津大学、中国人民大学等机构。评估体系包含 6 个维度、37 项细分指标,采用美国 GPA 计分制(A=4.0,F=0),且无任何参评公司付费。
九家公司的最终评级如下:
Anthropic(C+,2.66 分):连续三期位居榜首,在透明度、模型规格文档、危险能力评估及“负责任扩展官”治理架构等 5 个维度领跑。
OpenAI(C,2.28 分):较上一期(C+)有所下滑。评审团肯定其在风险评估套件及外部安全测试参与度的进步,但整体得分下降。
Google DeepMind(C,2.01 分):与上期持平。更新后的“前沿安全框架”新增了对操控、失对齐及内部部署风险的覆盖,水印保护机制较为完善。
Meta(D+,1.32 分):本期唯一评级上升的企业,从 D 升至 D+,排名由第六跃居第四。主要得益于发布更详细的安全框架、引入威胁建模,并将漏洞赏金计划扩展至灾难性风险领域。
Z.ai(D-,0.88 分)与 Alibaba Cloud(D-,0.87 分):两家中国公司因策略被评审团视为“完全被动”而得分较低。报告指出,其安全策略主要基于遵守中国《网络安全法》、《数据安全法》及《生成式 AI 暂行办法》,缺乏主动性。
xAI(F,0.65 分):本期跌幅最大,从 D 直接降至 F,排名跌至第七。评审团指出其缺乏有意义的安全团队及对存在性安全的投入,危险能力评估存在巨大漏洞。报告还提及 Grok 曾生成涉及儿童性虐待材料及非自愿性化图像的内容。
DeepSeek(F,0.47 分)与 Mistral(F,0.33 分):美、中、欧各有一家不及格,反驳了"AI 安全问题仅属特定地区”的观点。Mistral 垫底颇具讽刺意味,因欧盟在监管层面一直走在前列。截至评估窗口关闭,这两家公司均未发布安全框架。
承诺在缩水:移动球门的博弈
比排名更严峻的是行业承诺的倒退。Anthropic、OpenAI、Google DeepMind 和 Meta 此前均承诺:一旦系统接近特定风险阈值,将单方面暂停开发。然而,这四家企业现已弱化或作废了该承诺,部分甚至将暂停条件改为“视竞争对手行动而定”。
评审团将此现象称为“移动球门”(moving the goalposts),认为这全面削弱了安全框架的约束力。加州大学伯克利分校 Stuart Russell 教授指出:“能力竞赛日益极端,企业已放弃早期承诺。即便能证明发布不安全,他们仍打算照常推进。”
具体来看,Anthropic 的“负责任扩展政策”3.0 版本被批稀释了早期的暂停承诺;OpenAI 在评估窗口关闭后将安全团队并入研究部门,取消了独立汇报线,且领导层对安全咨询组拥有否决权;Google DeepMind 缺乏能在未经高管批准下独立叫停部署的内部机制;Meta 的非贬损协议则被认为可能侵蚀吹哨人保护。
看见悬崖,没修护栏
“存在性安全”(Existential Safety)是本次指数中得分最低的领域,无一公司超过 C-,多数落在 D 及以下。尽管各家在宪法分类器、监控承诺等方面有零散努力,但总体评价为“完全不够”。
评审团从架构层面提出核心质疑:检测不等于预防(detection is not prevention)。当前主流的“思维链可监控性”虽能让推理过程可见,但属于事后检测。当不对齐的推理被捕捉时,模型往往已输出结果甚至执行动作,这种机制提供的是问责而非安全。
OpenAI 发布的 GPT-Red 印证了这一张力。该工具通过自博弈强化学习训练,攻击成功率达 84%,虽成功加固了后续模型针对已知攻击面的防御,但这仍是针对已知漏洞的检测加固,而非面向大规模失对齐的预防架构。蒙特利尔大学 David Krueger 教授评论道:"AI 公司在制定可信安全计划方面缺乏进展,令人震惊。”
军事 AI 集体转向
指数另一重大发现是军事应用的转向。2024 年至 2026 年间,Anthropic、OpenAI、Google DeepMind 和 Meta 从此前的限制或禁止立场,转为积极争取国防合同,加入了 xAI 和 Mistral 的行列。
这一转向直接影响了评分。Anthropic 在"AI 军事使用”子指标上不及格,报告引用了其与被报道的空袭事件之间的关联(注:报告明确此为关联性发现,非法律责任认定)。
需要指出的是,该指数主要评估实验室的政策、治理结构及信息披露,而非部署产品的实际表现。高分代表文档化安全实践相对完善,但整个行业至今仍未建立起可外部执行的最低安全标准。
参考资料:
https://futureoflife.org/ai-safety-index-summer-2026/
END

