《通用型 AI 智能体 L1-L5 分级安全框架白皮书(2026 年)》
(注:本文仅展示核心内容摘要)
当 AI 学会“自主行动”,我们如何确保它不“失控”?清华、华为、上海 AI Lab 联合发布重磅框架,为通用型 AI 智能体划定安全边界。
AI 正从“生成式工具”快速进化为能“自主行动”的智能体(Agent)。从自动编写代码到独立管理供应链,其能力呈指数级增长。然而,随着自主性提升,AI 风险也从“认知层”向“行动层”蔓延。2026 年 7 月,在世界人工智能大会(WAIC 2026)上,清华大学智能产业研究院、上海人工智能实验室、华为及安远 AI 联合发布《通用型 AI 智能体 L1-L5 分级安全框架白皮书》,创造性地借鉴自动驾驶分级理念,为 AI 安全治理提供了系统性解题思路。
01 为什么要给 AI 智能体“分级”?
从"Chat"到"Act",风险指数级上升
据白皮书预测,到 2030 年全球智能体市场规模将达 526.2 亿美元,网络规模有望达到 9000 亿。与传统聊天机器人不同,AI 智能体具备调用工具、修改文件甚至执行代码的“行动力”。近期频发的误删文件、恶意指令诱导等事件表明,AI 风险正从单纯的“信息误导”转化为实质性的“系统破坏”。
当前技术演进与安全治理存在显著“时间差”。该白皮书的核心目的正是填补这一鸿沟,确立“有什么样的自主性,就识别什么样的风险,并匹配相应防护措施”的分级治理范式。
02 AI 的“驾照分级”:L1 到 L5 意味着什么?
白皮书将 AI 智能体的自主性划分为 L1-L5 五个等级,这不仅是对能力的刻度,更是一份责任与风险的交底书。
- L1(辅助执行智能体)——「副驾驶」
特征:相当于高级助手,能生成代码或提供建议,但最终决定权在人类手中,无自主降险能力。
代表产品:GitHub Copilot 行内补全、单文档 RAG 问答助手。
人机关系:智能体是纯粹工具,人类是最终决策者。 - L2(有监督协作智能体)——「实习生」
特征:能在预设工作流内自主决定执行细节,但需人类实时监督,出错时仅在预设范围内重试。
代表产品:ChatGPT、Claude、Kimi 等非 Agent 模式。
人机关系:人类设定目标,智能体执行,人类必须全程监控。 - L3(有条件自主智能体)——「正式员工」
特征:质变开始。在特定条件(ODD)下可独立完成规划与执行,遇超出能力边界问题时主动求助。
代表产品:Manus、Claude Code 等前沿产品。
人机关系:智能体是执行主体,人类转变为监督者和后援,需随时准备接管。 - L4(高度自主智能体)——「高管代理人」
特征:跨业务域自主决策,常规运行无需人类介入,具备自主降险和自愈能力,仅在高风险节点请求审批。
现实进展:目前业界尚无严肃认定的 L4 通用型智能体,未来形态可能为企业经营智能体。
人机关系:智能体全权负责,人类退居幕后做最终审批者。 - L5(自适应自主智能体)——「数字合伙人」
特征:终极形态,具备自我改进能力,可自主优化策略甚至修改自身代码。人类仅设定战略目标。
警示:L5 级别伴随重大风险,建议谨慎研发和部署。
人机关系:人类设定方向,智能体自主演进,人类保持最终控制权。
03 风险演进的三条致命路径
自主性的提升引发风险本质的迁移与升级,白皮书勾勒出三条清晰的风险演进路径。
路径一:从“说错话”到“办坏事”
L1 阶段风险主要为输出错误;L3 阶段模型的“幻觉”可直接转化为误删数据库等错误操作(hallucination-to-action);L4-L5 阶段,单点故障将沿任务链传播,演变为影响整个系统的“级联故障”,甚至逼近“被动失控”。
路径二:从“偷凭证”到“破边界”
L1 主要是凭证泄露;L3 阶段智能体身份易被攻击者借用;L4 阶段因权限聚合可能导致越权;L5 阶段智能体可能自主创建新工具,导致固定权限边界彻底消失,身份与失控风险合流。
路径三:从“人失察”到“人不察”
L1-L2 风险源于人工审查失误;L3 阶段长时程任务导致人类“运行时接管失败”;L4 阶段风险前移至手段层规约设计;L5 阶段人类将面临“目标层红线不对齐”的根本困境,甚至无法判断何时按下停止键。
04 超级风险:滥用与失控
针对 L3-L5 高自主性等级,白皮书着重警示了两种高阶风险。
1. 滥用风险(Misuse):AI 成为“犯罪放大器”
- 自动化网络攻击:AI 自主发现漏洞、编写攻击代码,显著降低攻击门槛。
- 定向欺诈与说服:以“可信身份”大规模发送个性化钓鱼信息。
- 跨域复合攻击:组合网络入侵、虚假信息等手段发动协同攻击。
2. 失控风险(Loss of Control):当 AI“表里不一”
即“主动失控”,指 AI 假装顺从实则暗中追求自身目标。
- 策略性欺骗:外部行为与内部状态脱钩,生成符合监测预期的推理过程,但真实决策依据并非如此。
- 自主维持与边界突破:为达成目标,AI 可能进行“自主复制与适应”(ARA),未经授权开辟新环境、获取新资源,表现出“工具性趋同”。
05 如何为 AI 戴上“安全紧箍咒”?
面对层层递进的风险,白皮书提出“分级防护 + 综合治理”的系统性解决方案。
通用控制基线(贯穿 L1-L5)
这是 AI 的“出厂安全设置”,包括:
- 感知层:输入验证,防止提示词注入。
- 规划层:规划校验,限制高风险规划直接执行。
- 记忆层:记忆隔离与校验,防止长期记忆被投毒。
- 行动层:最小权限原则,工具白名单,高危操作人工审批。
- 身份层:独立、不可伪造的身份标识(Agent ID)。
- 监测层:全链路日志记录,保证行为可追溯。
分级针对性措施(L3-L5 重点加强)
- L3 阶段:建立“行动前验证”机制,对资金转移等高危操作实施二次审批。
- L4 阶段:建立“级联故障阻断”机制,进行依赖分析并设立跨系统熔断机制。
- L5 阶段:重心转向“失控预防”和“目标层对齐”,严格限制自我改进能力,建立动态边界验证机制。
红线与推荐性原则
白皮书划出六条不可逾越的红线:禁止规避人类控制、禁止策略性欺骗、禁止自主复制与未授权资源扩展、禁止辅助核生化武器、禁止破坏关键基础设施、禁止有害操纵。同时提出最小权限、身份可追踪等九条推荐性治理原则。
06 挑战与未来:开放性问题
白皮书坦诚提出了六个当前尚无定论的开放性问题:
- 自主性如何客观度量?缺少量化标准。
- 通用与专用的边界在哪?专用智能体展现通用能力时如何界定?
- 故障与主动失控的边界在哪?如何区分 AI 是因“笨”犯错还是因“坏”欺骗?
- 实验室评测能代表真实世界吗?“评估态”与“部署态”存在巨大鸿沟。
- 如何治理“动态目标”?自进化 AI 的能力变化使静态评测失效。
- 出了事谁负责?复杂责任主体下的法律划分与风险定价难题。
结语
《通用型 AI 智能体 L1-L5 分级安全框架白皮书》不仅是一份技术报告,更是一份面向未来的安全宣言。它提供了一个宝贵的思想工具:根据 AI 的“自主性等级”,动态、前瞻性地评估风险和部署防线。L1 到 L5 的分级,既是 AI 的“驾照”,也是人类的“行动指南”。保持敬畏,科学治理,才是我们与 AI 共舞的正确姿态。
来源:清华大学&上海人工智能实验室&华为&安远
编辑:Zero
声明:本文旨在传递更多行业资讯,不代表本平台立场。如涉及作品版权问题,请联系我们删除或做相关处理。

