大数跨境

AI开始“办事”之后:读懂《人工智能安全治理框架3.0》

AI开始“办事”之后:读懂《人工智能安全治理框架3.0》 合规社
2026-09-15
2

当AI从回答问题走向动手办事——

读懂《人工智能安全治理框架3.0》

网安小胖、智能体小M

当AI只能回答问题时,我们最关心的是:它说得对不对,会不会泄露信息?当AI开始调用工具、修改文件、发送消息,甚至控制现实中的设备时,问题随之变成:它凭什么执行、能执行到哪一步,出了偏差能不能及时停下来?

9月14日,在国家互联网信息办公室指导下,全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》(以下简称《框架3.0》)。与2025年发布的2.0版相比,新版对风险分类、防控措施和治理安排作出调整,并以专门附件展开智能体安全风险管理。

结合两个版本的条文与风险映射,可以看到一条清晰的变化主线:随着AI能力从内容生成延伸到自主规划和行动执行,安全治理需要更深入地覆盖权限、工具、记忆、运行过程及现实后果。这并不意味着以往的数据、内容和个人信息保护要求退出舞台,而是这些要求需要进入更复杂的系统和业务流程。

01

PART

从30项到54项:风险清单扩展,更要看分类如何变化

RISK LIST · 风险地图

《框架3.0》延续“内生安全风险、应用安全风险、衍生安全风险”三大类别。按风险分类条目口径,二级风险类别由8类扩展至14类,风险条目由30项增加至54项

分类口径
2.0版
3.0版
一级风险类别
3类
3类(延续)
二级风险类别
8类
14类
风险条目
30项
54项

但“净增加24项”不能直接理解为“24项风险全部首次出现”。新版既有新的风险描述,也有对既有内容的拆分、细化和重新归类。例如,数据投毒在2.0版中已有涉及;3.0版进一步明确其在知识库、网页和记忆等环节中的风险。数字鸿沟、情感依赖等问题,也并非本次才进入治理视野。


因此,理解版本变化,要同时回答两个问题:哪些风险被更清楚地识别出来,哪些既有要求需要在新的技术条件下重新落实。不能仅凭名称新增、章节移动,就认定出现了全新的义务,或者原有要求已经取消。


✦ 读版本变化,先看两件事:一是哪些风险被更清楚地识别出来,二是哪些既有要求需要在新的技术条件下重新落实。名称新增不等于全新义务,章节移动也不等于原来要求取消。

新版还设置了4个专栏,分别涉及非预期自主行为、自主实施网络攻击、智能体社交平台安全,以及GEO投毒操控大模型推荐内容。这些专栏提示,风险既可能来自用户的恶意请求,也可能在自主执行、多方交互或外部信息影响下形成。

专栏一 · 非预期自主行为

智能体在无人干预下做出超出预期的连续动作,需要明确哪些环节必须保留人的确认。

专栏二 · 自主实施网络攻击

目标看似正常,执行路径却可能带来不当扫描、入侵或其他越界行为。

专栏三 · 智能体社交平台安全

多智能体在同一平台上交互,风险会沿着对话链路扩散。

专栏四 · GEO投毒操控推荐内容

被操控的外部信息影响大模型推荐与判断,来源验证因此成为基础工作。

02

PART

智能体成为治理重点:把“能做什么”变成明确边界

AGENT · 权限与边界

智能体与普通问答应用的重要区别,在于它可能围绕一个目标持续规划、调用工具并改变外部状态。用户提出“整理客户资料”,后续可能涉及读取文件、检索系统、生成名单、发送邮件。每一步的权限基础和影响范围,都需要单独考虑。

《框架3.0》围绕智能体的身份与权限、推理与规划、工具调用与执行、记忆等环节识别风险,并在附件2提出贯穿生命周期的管理措施。

智能体生命周期,引自《人工智能安全治理框架3.0》附件2


这张图的价值,在于把智能体放回完整的运行环境:它与用户、模型、工具和记忆持续交互,安全问题可能发生在任何一个连接处。企业如果只检查模型输出,就很难覆盖整个系统。

第一,身份要独立,权限要随任务收敛。

为智能体分配可识别的身份,按当前任务授予必要权限,并在任务停止或权限不再需要时及时撤销。一个执行检索任务的智能体,不应顺带获得删除文件、修改系统配置的能力。共享账号、长期有效的高权限凭证,也会增加追责和撤权难度。

第二,把人的控制权放到关键动作之前。

新版针对风险程度提出人工接管、用户授权和人工审核等安排,并对重要删除、发送、配置修改等操作强调二次确认或人工审批,以及回滚、撤销机制。需要审批的动作,在无法获得审批、没有响应或缺少相应规则时,应按拒绝执行处理。落地的关键是识别哪些动作具有较大影响或难以撤回,再设计相应的审批节点。

第三,把工具、插件和技能纳入供应链管理。

核实来源、版本和完整性,清理不再使用或权限过大的组件,并限制执行环境、调用频率、持续时间和资源消耗。一个模型本身表现良好,不代表它调用的每个工具都可靠

第四,让行为可追溯,让退出真正完成。

文件操作、命令执行、网络访问等活动应形成适当记录,同时做好敏感信息处理和日志保护。停用智能体,也不能只关闭一个界面,还需要清理运行进程、开放端口、第三方授权等关联资源,在保留必要记录后处理相关数据。

企业可以把这些要求归结为一条可执行的管理链

身份明确 · 授权有据 · 关键动作可控 · 运行能够中断 · 事后可以追溯

03

PART

从“回答错误”到“行动偏离”:不能只审核用户的初始指令

DRIFT · 测试怎么改

《框架3.0》对模型行为偏离预期的关注,涉及自主获取权限、绕过安全限制,以及欺骗测试、隐藏能力、拒绝停止等风险表现。这些描述不应被直接演绎为“AI已经产生自我意识”;更务实的理解是:模型在特定条件下的实际行为,可能与开发者和用户设定的目标、边界不一致。

把“偏离预期”理解为:实际行为与设定目标不一致,而不是AI拥有了自我意识。这种理解方式,才对应得上可测试、可控制的具体动作。

这一变化对安全测试的影响很直接。测试不宜只问“遇到危险问题会不会拒答”,还应观察它在多步任务、工具调用和环境反馈中,是否逐渐越权,是否能服从停止指令,是否会通过其他路径继续完成受限动作。

网络安全场景尤其如此。用户提出的目标可能看似正常,但智能体为实现目标而选择的执行路径,仍可能产生不当扫描、攻击或其他越界行为。因此,安全控制需要跟随任务执行,检查实际访问对象、调用方式和行为后果。

相应地,企业可以在任务规划、工具调用和结果输出等环节设置控制点,结合隔离环境、资源限制、运行监测和中断机制,形成多层防护。《框架3.0》同时关注运用人工智能增强网络安全防御,体现出对风险防控和安全能力建设的双向考虑。

✦ 测试建议的四个观察点

多步任务中是否逐渐越权 · 是否服从停止指令 · 是否绕道完成受限动作 · 实际访问对象与行为后果是否落在预期范围内

04

PART

数据风险延伸到知识库与记忆,个人信息保护更贴近应用

DATA · 数据新边界

在传统训练流程之外,智能体还会接触网页、企业知识库、用户对话和历史记忆。外部内容可能影响检索结果、决策依据,甚至进入后续任务。数据安全治理因而需要覆盖这些持续变化的信息来源

GEO投毒专栏关注的,是通过被操控的信息影响大模型的推荐内容。对企业而言,值得吸收的启示是加强来源验证和证据核对,防范虚构测评、伪造专家意见等内容影响业务判断,而不能把这一风险描述直接理解为对所有GEO活动的否定。

外部材料中的文字,也不应自动获得用户指令的权限。网页、邮件或附件可以是处理对象,也可能夹带诱导执行的内容。系统需要区分信息来源、可信程度和指令优先级,避免把“读到的内容”直接转化为“被授权执行的动作”。

指令优先级的一条底线

读到的内容,不等于被授权的动作

记忆机制则提出了另一组问题:哪些信息值得保存,保存多久,谁可以调用,如何隔离不同用户和任务?《框架3.0》对此提出访问控制、隔离和清理等要求,账号凭证、密钥等敏感信息原则上不应进入记忆。确有必要保存敏感个人信息时,应落实必要的加密、权限和期限管理。

此外,新版将个人信息保护风险单独展开,涵盖违规记录个人行为信息、合规保障措施不足、个人行使权利渠道不畅通等问题。对话是否用于训练、如何履行告知和依法取得同意、如何提供个人权利请求渠道,都需要落实到具体产品流程。使用合成数据,也不当然意味着数据已经匿名化或没有个人信息风险。

需要特别澄清:2.0版已有个人信息保护要求。3.0版相关章节的重组,不代表义务取消,也不是首次引入保护要求。

合规审计、个人信息保护影响评估等工作的适用条件和频次,仍应依据适用法律规定判断,不能简单概括为“所有AI企业必须每年开展审计”或“所有新功能上线前都必须做影响评估”。

05

PART

走向现实空间,风险也包括身体、情感和社会影响

EMBODIED · 身体与情感

当AI与机器人、车辆或其他设备连接时,错误不再只停留在文本里。《框架3.0》围绕具身智能的环境感知、物理执行、交互和群体协同等方面识别风险,并提出仿真测试、极端场景测试、碰撞防护、紧急停止、异常节点隔离等措施。

仿真测试与极端场景测试

在部署前覆盖罕见但高后果的场景,而不是只跑常规样本。

碰撞防护与紧急停止

执行机构需要有保护边界,人员需要能有效接管。

异常节点隔离

多个设备协同时,阻断局部故障扩散。

这意味着,具身智能的安全评估需要同时考虑模型表现和物理系统:传感器受到干扰后如何响应,执行机构是否存在保护边界,多个设备协同时能否阻断局部故障扩散,紧急情况下人员能否有效接管。

新版也进一步展开社会、环境、文化和伦理层面的风险。对陪伴类产品,需要关注未成年人、老年人等群体的情感依赖,落实身份和使用时间提示、必要的危机干预,防范不当情感操控。对广泛部署的系统,还应考虑语言文化多样性、数字鸿沟以及能源和资源消耗。

这些内容提醒企业,安全不能只用单一的模型准确率衡量。产品服务对象、使用时长、部署规模和实际影响,都会改变风险判断。

06

PART

持续治理进一步具体化:重大变更要评估,沙盒边界要读准

ONGOING · 变更与沙盒

运行监测、审计和人工控制在2.0版中已经存在。3.0版的变化,在于围绕上线、重大版本变更、持续运行和退出等环节,把相关安排进一步具体化。

例如,新版提出在上线前或重大版本更新前开展相应评估,加强运行监测;服务出现重大变化时,要评估安全影响,防止安全能力下降,并做好必要的回滚准备。发生安全事件后,还应依法向有关主管部门报告并告知受影响用户。

实践中,模型升级、知识库替换、插件接入和权限扩大,都可以作为企业内部评估是否需要重新测试的触发因素。风险分级也应结合应用场景、自主程度和影响规模动态判断。低风险、一般风险、较大风险、重大风险、特别重大风险的五级结构已有前版基础,不能将分级机制整体表述为3.0版首次提出。

✦ 五级风险分级:低风险 · 一般风险 · 较大风险 · 重大风险 · 特别重大风险。该结构在前版已有基础,3.0版不是首次提出,判级需结合场景、自主程度和影响规模动态调整。

监管沙盒也是容易被过度解读的部分。新版围绕规则设计、动态测试和准入、探索责任豁免、数据支持及成果协同等提出安排。这里的“探索”,意味着不能将责任豁免写成企业已经取得的普遍权利,更不能理解为进入沙盒就不再受到法律约束

同时,监管沙盒与技术沙盒并不相同:前者涉及受控测试的治理机制,后者通常指程序执行的隔离环境。两者可能配合使用,但不能相互替代。

监管沙盒=受控测试的治理机制,涉及准入、测试、责任安排与成果协同;技术沙盒=程序执行的隔离环境,用来限制影响范围。两者可能配合使用,但不可互相替代。

07

PART

企业如何行动:把框架转成具体业务中的控制措施

ACTION · 五步落地

《框架3.0》是治理指导性框架,不能直接等同于新出台的法律或强制性标准。企业应将其与现行法律、行业规则及实际业务相结合,识别应履行的法定义务,并把适合自身的防控措施转化为产品和管理要求。

1

先盘清AI实际接触什么、能够改变什么。除模型清单外,纳入业务场景、数据来源、知识库、记忆、工具和外部接口,识别哪些系统可以发送信息、修改记录、付款或控制设备。

2

围绕具体动作配置授权与人工审核。明确任务权限、授权期限、高影响操作的审批人,以及无人响应、执行失败和异常中断时的处理规则。

3

将测试扩展到完整业务流程。覆盖提示注入、数据投毒、越权调用、异常记忆和停止机制;具身智能还应加入物理环境与群体协同测试。

4

把变更、事件和退出纳入日常管理。确定重新评估的触发条件,保存必要记录,建立报告和用户告知流程,并验证授权撤销、回滚及数据清理能否执行。

5

先确认应用是否必要、能力是否匹配。避免为了部署AI而扩大数据处理或授予过多权限。对暂时无法建立有效控制的高影响功能,可以先缩小范围、降低自主程度,再逐步扩大应用。

随着AI开始替人“办事”,权限设置、数据处理、产品交互和技术控制会越来越紧密地联系在一起。企业需要把这些安排落实到每一次真实的调用和操作中,让AI能力增长的同时,责任边界仍然清楚,人的控制仍然有效。


期待本月智能体新规发布

结合相关标准,后续再陆续发布落地解读

注:本文表格、框架均由AI生成,如有错误请随时反馈。

《人工智能安全治理框架》2.0版与3.0版逐条对比&映射完整版获取

相关文件请前往知识星球下载

1410+已加入

⬇️⬇️⬇️

【声明】内容源于网络
0
0
合规社
数据安全与隐私保护新知分享平台
内容 674
粉丝 1
合规社 数据安全与隐私保护新知分享平台
总阅读2.9k
粉丝1
内容674