图注:梦可以脏,醒来那一跳必须硬。
引子:从《盗梦空间》看,为什么运行时防护是难题
传统安全防的是城堡:有边界、有门卫、有白名单。智能体不一样——它有一段会思考的「心智」,而这段心智的输入是「经历」:网页、文档、工单、工具返回、别的智能体说的话。要让一个智能体做坏事,成本最低的办法从来不是攻破它的系统,而是让它「经历」一段准备好的内容。
《盗梦空间》讲的正是这件事。柯布团队要改变费舍尔的决定,不碰他的公司、不偷他的密码,而是进入他的梦境——他能感知到的那个世界——在里面放下一个念头。按电影设定,这个念头必须让费舍尔相信是自己想出来的,才会生根。醒来之后,他在董事会上亲手解散了公司;团队自始至终没有碰过现实里的任何一个动作。
电影里的每一环,在智能体上都有对应物:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
最后一条值得展开。攻击者的路线是「放弃控制现实,只控制念头」,因为念头会自己走到动作。防御者必须走反方向:默认梦境已经失守(上下文必被注入),硬控制押在「醒来之后的动作」上——身份、意图绑定、确定性升级、副作用点强制、回执。还有一条不在醒后:每一跳重划「这是命令还是数据」,假定梦已经脏,只禁止脏数据升格成命令。后文六条,五条硬在行动,一条守在缝上。
类比有三处必须停,而停下来的地方,恰好是方案的抓手:
-
• 成本是反的。 电影里「提取」容易、「植入」几乎不可能;对智能体,两件都是顺手的事——一个附件、一条工具返回就够了。风险要按「日常会发生」来估,不能按「高难度作案」来估。 -
• 防御不能指望模型自己。 费舍尔还能靠潜意识反击;模型不行——分不清指令和数据的,恰恰就是那批用来防御的权重。所以六条机制全部建在模型外面,而不是再训练一轮「更听话」。 -
• 心智是可以拼装的。 费舍尔的心智没法重装;智能体的「心智」每次运行都是现场拼出来的——系统提示、上下文、工具清单,可以重建、快照、审计、换版本。人做不到的,它做得到,这是运行时机制真正的自由度。
《盗梦空间》把「改变想法」和「改变行动」拆成了两件事。运行时防护难,难在两头都得守;而系统真正拍得了板的,只有行动那一头——所以前面挡得越「软」,醒来那一跳就要越「硬」。
一、问题说清楚
智能体和聊天机器人的分界,不在「用没用大模型」,而在会不会改真实世界。一旦它能读文件、调内部接口、改库、发邮件、开浏览器,或通过 MCP 调外部工具,安全问题就从「模型说了什么」变成「系统做了什么」。
这会撕开一条缝。引子里的「梦」和「醒」,就是缝的两边:意图侧是它能感知到的世界,执行侧是醒后真正改现实的动作。
|
|
|
|
|---|---|---|
| 意图侧 |
|
|
| 执行侧 |
|
|
护栏看得见对话,看不见这次命令读了哪把钥匙;端点看得见进程,不知道这次动作来自哪一次被污染的工具返回。要补的仍是这条意图和执行对不上的缝。
微软的判断更硬:模型层是概率的,构建者控不住;能把「模型可能做什么」变成「系统只许做什么」的,只有应用层——谁行动、用什么身份、什么条件下放行、谁有权升级。运行时机制都长在这一层,而不是再训练一轮拒答。
国际头部方案其实是从两个方向补同一条缝:
|
|
|
|
|
|---|---|---|---|
| Palo Alto Networks |
|
|
|
| CrowdStrike |
|
|
|
两条路不是二选一。后文会说明:网关假设流量真的过闸;端点假设危害会在本机留下脚印。少任何一条,就有一类智能体落在盲区里。
二、运行时要防的,和上线前门禁不是同一类事
扫描、制品分析、红队都要做,但它们回答的是「这个智能体该不该上线」。运行时回答的是「这一跳该不该发生」。下面这几类,上线门禁天生看不见。
|
|
|
|
|---|---|---|
| 间接注入 |
|
|
| 授权绑错层 |
manage_database,注入后 SELECT 变成 DROP
|
|
| 混淆代理 |
|
|
| 执行面逃逸 |
|
|
| 状态被慢慢写坏 |
|
|
| 身份被克隆 |
|
|
一句话:运行时打的不是模型权重,而是「这一拳由谁批准、在哪一层批准」。
Palo Alto 把企业侧的难处归结成三件事:发现(智能体在哪、连了谁)、评估(权限和架构风险)、防护(已经在跑的不安全动作)。CrowdStrike 补上了业界常常漏看的一点:传统工具能发现资产、管访问、看单次交互,但没法把智能体活动和它触发的下游系统动作关联起来。两家诊断一致,下手位置不同。
三、两家方案怎么落地
先看清产品在干什么,再回到机制——避免把「过闸」和「拼因果」说成同一件事。
1. Palo Alto:控制面在动作前
网关的价值,不在于把梦洗干净。输入校验拦得住一部分注入,拦不住混在正常内容里、顺着推理走的那种。它真正卡的是梦醒来的门口:念头还没变成工具调用、还没打到模型和外部服务之前,认证、授权、路由、拦截已经发生。内容检查是加厚,过闸才是拍板——所以它属于「醒来那一跳」的硬控制,不是「把上下文守住」的软控制。
Prisma AIRS 把智能体安全拆成「发现—评估—防护」。和运行时直接相关的几个模块如下。
|
|
|
|
|---|---|---|
| AI Agent Gateway |
|
|
| Agent Runtime Security |
|
|
| Agent Identity Security |
|
|
| Agentic Endpoint Security |
|
|
| SaaS Agent Security |
|
|
|
|
|
门禁
|
网关侧的请求生命周期(Palo Alto 对 AI Gateway 的公开描述)可以看成一张检查单:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
前提只有一条:流量确实走闸。 扫提示注入是软的一层;闸的硬处是——没过闸的调用到不了工具。本机 stdio、绕开代理的直连、已经落到宿主的命令行,闸都看不见。所以同一套方案里还要有端点模块,专门管 Cursor、Claude Code 这类跑在开发者电脑上的助手。
2. CrowdStrike:因果链在端点
Falcon AIDR 本来覆盖影子 AI、治理、数据保护、提示注入,采集点包括浏览器扩展、应用 SDK、已有网关集成、MCP 代理、云日志。Guardian 是这条线的演进,新提法是:智能体在模型里推理,动手却通过操作系统,所以端点是关键控制面。
|
|
|
|
|---|---|---|
|
|
|
|
| prompt → 运行时行为 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
AIDR 已经写明的插桩方式,和「智能体跑在哪」是对齐的:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Guardian 反复出现 supported agents(受支持的智能体):因果链不是对任意自研框架开箱即连。这一点必须写进方案假设,不能给客户讲成「所有 Agent 自动全链路溯源」。
3. 两家合在一张图上
|
|
|
|
|---|---|---|
| 主强制点 |
|
|
| 身份 |
|
|
| 开发者本机 |
|
|
| SaaS 副驾 |
|
|
| 网关成熟度(公开节奏) |
|
|
| 服务配套 |
|
|
| 明确边界 |
|
|
对设计者有用的结论只有一句:网关负责「不许出手」,端点负责「出手了也能追、能停」;身份负责「一旦不是那个智能体,立刻作废」。 按引子的话说:两家都没有把确定性押在「把梦洗干净」上——一家卡在醒来的门口,一家盯着醒来之后的脚印。三件套齐了,才叫运行时防护。
四、六项关键机制
产品模块会改名、会合并。下面六条不跟任何一家的产品菜单走,但上表的每一行都能在这里找到落点。身份、意图绑定、确定性升级、副作用点强制、回执,是醒来那一跳的硬控制;命令与数据边界,是假定梦已失守之后,不让脏数据自己变成命令。
机制一:身份是原语,不是日志里的一个字段
智能体不能和用户共用同一套身份。一次动作必须能分清:人自己做的、智能体自己做的、还是智能体在明确委托下替人做的。
分不清,最小权限就没法单独开,出了事也没法单独关,日志里永远只有「这台电脑上的某位同事」。微软把智能体身份称为其他应用层模式的前提。Prisma AIRS 的身份模块按任务授权、到期失效、可跨系统吊销。CrowdStrike 把身份写进「从提示词到运行时」的链条,调查时才能问出「是哪个助手、带着谁的权限」。
落到操作上:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
没有主语,后面的授权和回执都是空话。
机制二:授权要问「这次任务还算不算数」
两种偷懒都不算运行时授权:只问「这个工具在名单里吗」;把早上那句「帮我看看邮箱」当成一整天的空白支票。
副作用落地之前,要重新判一遍:动作、资源、目的地、当前条件,是否还在当时批准的任务范围里。超出就拒绝,或者强制走升级审批。OWASP AST03 说得很直白:检查必须落在意图层,不能只停在工具调用层;系统、操作员、用户处在指令层级的上游,技能与工具输出处在下游,下游永远不能变成上游的命令。
最小权限能缩小爆炸面,但挡不住「逻辑层注入」:助手确实需要读文件,仍可能被诱去读密钥目录。所以要两维一起卡:
|
|
|
|
|---|---|---|
| 能力 |
|
network: true
|
| 意图 |
|
|
清单是声明,运行时行为是核对。对不上,本身就是告警。技能作者自报的风险等级,只适合用来抓「报低了的」,不能当信任依据。
机制三:什么时候必须升级到人,别让模型自己说了算
把「要不要问人」交给模型判断,对抗提示、角色扮演几轮下来,就能哄出一句「这次不用问」。「人在回路」如果只是让人知情,而不是从结构上保证它没法自己给自己放行,那就等于没有。
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
Prisma 网关把检查放在请求到达模型和工具之前,本质是同一类确定性。CrowdStrike 用「哪类智能体获准在受管机器上跑」做类型级门闩,未批准的直接不启动。记忆写入先隔离再入库、外部文档按哈希钉住、加载时再验一遍,都是把「状态一变就成了命令」这条默认通道,改成受控通道。这就是引子说的「心智可以拼装」:人设、记忆、工具清单不是长在脑子里的,是每次运行现场拼的。拼得成,就可以快照、审计、换版本;写进去之前必须当提权,不能让一次注入变成下一场梦的默认人格。
机制四:在真的产生副作用的那一跳动手
智能体动手的路不止一条,强制点也不能只有一个。
|
|
|
|
|
|---|---|---|---|
| 协议内联 |
|
|
|
| 执行面因果 |
|
|
|
| 身份与范围 |
|
|
|
沙箱是加厚防线,不是边界。它管得住容器里的脚本,管不住「请宿主帮我执行」。宿主上仍要留底:技能来自谁、哪个版本、内容哈希多少;分发之前,再做一次能力检查。
机制五:每一跳都重新划分「这是命令还是数据」
多智能体、多工具之后,单点护栏会失效。上游输出变成下游输入,中间节点还可能换模型。这就是对照表里的「梦中梦」:整条链的注入抵抗力,等于最弱那一跳;证明两端安全,证明不了中间那一跳不会把数据读成命令。换模型等于重装一截心智,上一份批准不能跟着走。
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
内容过滤试图认出「像攻击的句子」;每跳重划边界则假定它一定会漏,于是从结构上禁止输出升格为命令。两个都要做,后者才是承重墙。
机制六:同一会话能追,记录不能事后改
拦住了却留不下证据,爆炸半径查不清,高风险系统的日志义务也交不了卷。《欧盟人工智能法案》第 12 条要求高风险系统在生命周期内自动记录事件。记录必须能独立核对,不能只是管理员能改的日志。
最小可用的记法是「进门一张条、出门一张条」:
|
|
|
|
|---|---|---|
| 准入 |
|
|
| 结果 |
|
|
被拒绝、没有真正执行的动作,也要留准入回执。缺了结果回执,只有确认回执链路本身没出问题时,才能解读成「拦住了」;否则也可能是采集丢了。多智能体要把「上一跳是谁」写进签名内容,才能沿委托链一路走回起点。CrowdStrike 把智能体会话和下游执行归并成一个调查对象,说的就是这一条在取证上的落地。
五、六条如何互相撑住
单独拿任何一条出来,都绕得过去;合在一起,才像一堵墙。
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
建设顺序上,身份和「在哪一跳动手」是承重结构。命令与数据边界是梦里唯一能做成结构的那一层:不指望认出攻击句,只禁止输出升格为命令。扫描、红队、制品分析是进门前的那道安检,能少放进一些垃圾,但代替不了门卫。
Prisma AIRS 把安检(制品、红队)和控制面(网关、身份、运行时)放在同一套叙事里,容易让人误以为「评测过了就等于运行时过了」。CrowdStrike 把狩猎和托管响应接到运行时上下文上,容易让人误以为「有人值班就等于策略是硬的」。都要分开讲:门禁降基数,控制面拍板,人补漏检。
六、怎么验收:六问对六条
答不出「是」,多半还是内容审核或主机防病毒的延长线。
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
智能体跑在浏览器、开发工具、编排平台还是 SaaS 副驾里,变的只是插头插在哪。不变的是那句大白话:出手当场由系统拍板,而且拍板留得住、查得清。
参考文献
框架与研究
-
• OWASP,《Agentic Skills Top 10》(AST01–AST10),尤其 AST03、AST05、AST06、AST09 -
• OWASP,《AI Security Verification Standard》(AISVS):默认拒绝、工具策略、高影响动作批准、沙箱与完整性 -
• Microsoft Security,Designing Secure Autonomous AI Agents with Defense in Depth(2026-05-14) -
• Atta 等,LPCI(arXiv:2507.10457)、LAAF(arXiv:2603.17239)、QSAF(arXiv:2507.15330) -
• 《欧盟人工智能法案》(Regulation (EU) 2024/1689)第 12 条、第 113 条 -
• NIST AI RMF(GOVERN)
厂商公开材料
-
• Palo Alto Networks,Prisma AIRS 3.0 Agent Security 方案简介;What Is an AI Gateway?;Prisma AIRS AI Gateway 正式商用公告(2026-07-16);AI Runtime Security 数据手册 -
• CrowdStrike,Falcon AI Detection and Response 数据手册;Falcon Guardian Defines the Next Generation of AI Security(2026-09-01)。
本文是机制论述,供架构和方案讨论。覆盖范围、指标和合规结论,以有效标准文本、厂商已交付功能,以及组织自己的评估为准。

