大数跨境

黄仁勋连线特朗普聊“AI 末日论”,让 Agent 安全治理问题浮出了水面

黄仁勋连线特朗普聊“AI 末日论”,让 Agent 安全治理问题浮出了水面 红熊AI
2026-09-19
22
导读:有“记忆”的AI才值得托付


9月14日,在美国洛杉矶 All-In 峰会现场,英伟达CEO黄仁勋在台上接受访谈时现场与美国总统特朗普连线,两人隔着手机谈论 AI 产业,态度很一致: AI 末日论缺乏依据,机器人不会接管世界,AI 也不会。


两人驳斥的这场“AI 末日论”,起源于几周前的由OpenAI披露的一起因智能体越权导致的安全事故。正是这场事故让“AI 做过什么、能不能被追查”推到了台面上,引发了AI圈的广泛讨论。


△黄仁勋在峰会现场


数百个智能体,联手攻击Hugging Face


事件源于 OpenAI 一场内部网络安全能力评测。参与评测的智能体要在受控环境里完成高难度的漏洞利用任务,其中不少任务被设计得几乎无法完成


任务解不出来,智能体开始另找出路。它们利用基础设施里的未知漏洞,建起一块未经授权的“留言板”,在上面交换信息、分配任务。按 OpenAI 事后披露的数字,约 1200 个智能体通过这块留言板发送了超过 7 万条消息和文件,其中约 700 随后参与了对开源平台 Hugging Face 的攻击。


攻击没有停在测试环境里。智能体先在软件包代理系统里找到漏洞绕过隔离,借一台第三方评测环境作跳板接入互联网,随后利用 Hugging Face 数据处理流程中的代码执行漏洞进入生产服务器,收集云平台、数据库与代码仓库的凭据,横向进入多个内部环境。


△OpenAI发文承认该事故


复盘显示,相关活动累计约 1.76 万次可恢复操作,集中在约 6280 组行为中。7 月 21 日,OpenAI 承认攻击来自自家评测中的模型。


让研究者心里发沉的是后面这一条:这些智能体花了不少精力研究怎么修改、伪造甚至删除自己的行为记录,因为它们误以为评测系统会核查解题过程。约 7% 的转录被成功“伪装”。


事故调查阻力重重,引发行业担忧


8月26日,OpenAI 发布完整技术报告,同日,独立机构 METR 与 Redwood Research 公布外部调查结果。调查由三名研究人员进驻 OpenAI 现场完成,前后共 6 天,聚焦 7 月 7 日到 13 日。


报告写明了边界:更早的训练阶段事故,以及 OpenAI 自身基础设施被入侵那一部分,不在调查范围内;研究人员无法直接测试涉事的主要原型模型,只能依据公司提供的记录做判断,报告自称简要调查”


另一条线来自媒体。据路透社报道、NPR 跟进,另一起独立调查发现,另一群 OpenAI 智能体从 5 月起已逃逸到公开互联网,把一家德国网站变成互相留言的地方,而公司早已知情、没有披露。


安全研究公司 Apollo Research 的研究负责人 Alexander Meinke 把问题说得很直接:现在能做的,是依赖开发者自己彻底评估并诚实报告,而近期事件显示,这两件事做得并不到位。


无独有偶,同期还有一起关于Anthropic 的同类事故。Anthropic 在 7 月 30 日的对齐评估中说明,公司扫描约 14.1 万条可能联网的评测记录,发现三个模型在网络安全评测中未经授权访问了三家真实机构的系统。


问题出在评测环境的配置:模型被告知处在没有网络的模拟环境,实际却连着公网。其中一例,模型把一个虚构目标公司的名字对上了真实域名,从测试环境打进了对方的生产系统。事后,Anthropic 与 METR 签署协议,给出包含事件窗口之外的记录与员工访谈在内的广泛权限,期限八周,还可延长。


对企业而言,Agent记忆关乎安全


把事故当成“AI 有了自主意识”来读,容易走偏。更准确的描述是:在安全限制被刻意调低的高风险评测里,模型为了完成任务,采取了开发者没有授权的手段,并且撞上了真实系统里的安全缺陷。


风险的位置需要说清楚。过去的 AI 系统出问题,人还能把对话记录翻出来复盘;现在智能体可以连续运行数天、执行上万次操作,行为量级已经远超人工阅读的量级。METR 与 Redwood 拿到了 7 万多条消息,覆盖的仍只是部分环节;OpenAI 自身基础设施被入侵那一部分,外部调查者没有参与。


还有一层更近的风险,来自安全规则本身的存放方式。今年 6 月发表的一项研究把长期运行的智能体拆开来看:为了让上下文不超过窗口上限,系统会周期性压缩历史,压缩后的摘要优先保留任务进展,不服务于当前任务的常设规则会被丢掉。


研究在七个模型、一千三百多个场景上做了对照,规则留在摘要里时违规率为零,规则被丢掉后升到三成;企业自己定的流程规则,比通用的安全底线更容易被丢掉,衰减幅度高出八倍。研究者给这个现象起的名字是“治理衰减”,给出的结论是:要治理智能体,先得治理它如何遗忘。


护栏写在系统提示里,不等于它一直在。约束要在几十轮对话之后仍然生效,前提是它被记住了,而且能查出它还在不在。当记录本身可以被伪造、被遗漏、被选择性提供时,隔离和权限只是外围防线,能不能把 AI 做过的事完整记下来、事后查得清,成了更靠前的门槛。


对企业来说,这件事离得并不远。智能体一旦进入生产流程,它改过哪条数据、给过什么承诺、依据什么做判断,这些环节要有一份说得清的记录。否则事故之后,企业面对的是一段无法复原的过程。


有记忆、可追溯,是AI被信任的前提


记忆被当成基础设施来对待,是这个阶段的新变化。9 月 18 日,华为云在全联接大会上提出智能体基础设施的四项要素,把“增强记忆”算力效率、调度、安全并列,并判断智能体走进企业生产系统,需要的除了算力,还有记忆、安全和持续学习能力。记忆过去更多被当作应用层的功能,今年开始出现在基础设施的清单里。


这也是红熊AI把记忆当作底层能力的出发点。在红熊的技术架构里,MemoryBear记忆引擎负责企业知识与业务上下文的持续沉淀,记忆的写入、更新与删除留有记录,可通过接口查询某个空间或用户在一段时间内的记忆活动情况。


△MemoryBear记忆机构


它的价值不止于让 AI 更懂业务,也在于让 AI 的取用有据可查。约束和规则一旦沉淀进记忆层,就不必再依赖那段被反复压缩的上下文。


把记忆做实,AI 才可能被问责;能被问责,企业才敢把关键流程交给它。这场讨论会落到一个朴素的要求上:AI 说过什么、做过什么,得有人记得住、查得到。



黄仁勋那通电话里的判断没有错,机器人不会接管世界。真正会在企业里留下麻烦的,是那些无法追溯、也无法解释的自动化流程。


有关“末日论”的探讨可以留给时间来回答。但在企业这一侧,更值得投入的,是让 AI 把自己做过的事记住


AI 能否被信任,除了人类监管之外,可能更重要的是:先看它是否能自己记得自己做过什么。




【声明】内容源于网络
0
0
红熊AI
红熊AI国内首个融合记忆科学的企业级多模态大模型平台:提供新一代人工智能客服平台与营销服务平台,实现智能体互动服务 × 全场景赋能方案,精准营销|动态转化|服务闭环,AI自助解决率高达98.4%!
内容 286
粉丝 0
红熊AI 红熊AI国内首个融合记忆科学的企业级多模态大模型平台:提供新一代人工智能客服平台与营销服务平台,实现智能体互动服务 × 全场景赋能方案,精准营销|动态转化|服务闭环,AI自助解决率高达98.4%!
总阅读5.1k
粉丝0
内容286