导读
2026年7月19日,安远AI在其主办的世界人工智能大会(WAIC) 2026“前沿AI与智能体安全论坛”上,联合上海人工智能实验室、清华大学智能产业研究院、华为共同发布了《通用型AI智能体L1–L5分级安全框架白皮书》(下称“报告”)。报告以“自主性”作为能力分级主轴,对通用型AI智能体进行系统性分级,识别各自主性等级的通用故障风险,以及高等级可能出现的滥用和主动失控风险,并提出相应的安全防护和综合治理措施建议,试图为智能体开发者、使用者和第三方研究与评测者提供可参考、可对标的分级安全治理框架。


研究背景
自2022年大语言模型取得突破以来,人工智能正从“生成式工具”逐渐演进为“自主行动主体”。以大语言模型作为推理与决策核心的智能体,能够感知环境、规划路径、调用工具、保持记忆,在有限人类监督下自主完成多步骤的复杂任务。2025年以来,智能体的数量和能力呈持续增长态势,应用场景和发展规模不断扩大,为千行百业的发展提供巨大的赋能价值。然而,与高速发展的智能体技术相伴的是日益凸显的安全挑战。近期国内外频发的智能体安全事件,以及政策界和学术界相继发布的安全风险提示均表明,技术演进与安全治理之间存在显著的时间差。
目前,全球主要市场尚未形成统一的智能体治理模式,但均开始将其视为区别于传统AI系统的新型治理对象,围绕其能力水平和风险影响实施分级治理,正逐渐成为全球智能体治理的共识。学术界和工业界已有的分级框架多聚焦于智能体的能力分级,鲜少对各能力等级对应的风险和安全措施进行完整分析。
本框架在已有研究和实践的基础上,以“自主性”作为能力分级主轴, 将智能体分为五级(L1–L5),分析随着自主性等级的提升和设计运行范围的扩张,各主要故障风险的演进路径和高自主性等级(L3–L5)需重点关注的滥用和失控风险,并提出相应的安全防护和综合治理措施建议。
研究问题、对象和目的
学术界和工业界既有的智能体能力分级和风险分析框架,为本研究建立了良好的基础。本框架在既有研究的基础上,力求系统回答以下三个核心问题:
如何对通用型AI智能体以自主性进行分级;
随着自主性等级提升,风险将会如何演进,高自主性等级可能产生哪些新兴风险;
应设置哪些与各等级风险相匹配的安全防护措施和综合治理措施。
本框架聚焦在数字世界运行的通用型AI智能体(General-Purpose AI Agent),即建立在通用型人工智能模型(General-Purpose AI Model, GPAI)基础上,具备显著通用能力,能在广泛复杂任务中自主或半自主感知、规划、决策与行动,并完成既定目标的AI系统,典型形态包括通用AI助手与聊天型智能体、图形用户界面(GUI)智能体和编程智能体。1.0版框架仅针对单智能体系统(包含基础模型和Harness)的自主性能力和风险进行剖析,聚焦其可能产生的通用风险, 并给出通用安全措施建议。
与之相对,本框架不涵盖仅在单一场景下运行的专用智能体(如医疗智能体、法律智能体), 亦不涵盖在物理世界中运行的具身智能体(如自动驾驶车辆、无人机、机器人)。1.0版框架暂不涉及多智能体交互可能带来的风险,也不对具体应用场景(如金融、医疗等)进行针对性风险识别和安全措施建议;智能体开发方和部署方需结合具体部署场景及相关行业的法律法规要求,另行开展安全措施设计。
本研究通过建立面向通用型智能体的分级安全框架,力图为智能体开发者、智能体平台和组件提供者、企业和个人用户以及第三方研究与评测机构,提供可参考、可对标的分级风险图谱和安全措施建议,激发前沿话题讨论及相关科研和实践探索。
本研究的方法论采用“文献综述—框架构建—专家评议—汇总成文”四步流程,专家评议环节吸纳了国内前沿AI实验室、新型研发机构和学术机构的多轮反馈建议。
核心要素
本框架由四项相互关联的核心要素构成:
自主性分级(第二部分):报告以“自主性水平”为分级主轴,将通用型智能体分为L1至L5五级,并将自主性分解为“决策自主度”和“降险自主度”两个维度,系统描述各等级智能体能力特征及人机关系与角色分工。其中L4和L5虽暂无现实实例,但被纳入进行前瞻性分析,以避免未来自主性突破后出现的防护措施真空。

风险识别(第三部分):基于国内外已有风险分类框架,报告首先提出各自主性等级的九大通用故障风险,之后剖析随自主性等级的提升各主要故障风险的演进路径,并重点提示L3–L5等级在滥用和主动失控领域可能出现的新兴风险。

安全防护措施(第四部分):针对已识别出的各等级基线风险提出通用控制基线,并结合各自主性等级的风险演进和高自主性等级的新兴风险,逐一提出针对性安全防护措施建议。

综合治理措施(第五部分):在技术防护措施的基础上,进一步提出智能体开发者在产品设计时应遵循的红线与推荐性治理原则,并就智能体生态链中的五大责任主体的对内治理和对外透明措施提出针对性建议。

适用对象和使用方法
本框架试图为以下四类主体提供参考,各主体可按以下路径使用本框架:
智能体开发者可依据第二部分对自有产品进行自主性等级评估和设计,结合第三部分识别相应的安全风险和失效模式,并结合部署场景前瞻性关注可能的滥用和失控风险。同时,可依据第四部分建立与自主性等级相匹配的安全防护措施,并参考第五部分完善组织治理、风险管理和持续监测体系,为提升智能体的安全性与可控性提供制度保障。
智能体平台和组件提供者可参考第二部分,理解不同自主性等级智能体对基础能力、运行环境及权限的要求,并结合第三部分识别模型、工具、插件、MCP服务等可能引入的供应链、权限和运行时风险。同时,可依据第四部分建立安全默认配置、可信组件治理、权限管理和运行监测机制,为下游开发者提供更加安全可靠的基础设施支撑,降低智能体系统在部署和运行过程中的整体风险。
下游企业和个人用户可参考第二部分判断拟部署智能体的自主性等级、能力边界与人机责任分担,并结合第三部分识别其在业务流程和实际场景中可能带来的安全、隐私、合规和运营风险。同时,可依据第四部分建立相应的授权管理、运行监测、人工干预和应急处置机制,尽量确保智能体在可控范围内运行,降低潜在损失和责任风险。
第三方研究和评测机构可参考第二部分的自主性等级划分,开展针对不同等级智能体的独立评测和能力验证。同时,可依据第三部分的风险识别框架和第四部分的安全防护措施要求,开发更加系统化的评测体系、测试方法和防护技术解决方案,为行业提供客观、可信的安全评估支持。
欢迎点击“阅读原文”获取完整报告。

