大数跨境

对话清华董胤蓬:当AI开始主动攻击,我们如何预判风险?

对话清华董胤蓬:当AI开始主动攻击,我们如何预判风险? DeepTech深科技
2026-07-24
3
导读:当下最大的安全问题正从“AI 被人利用开展攻击”扩展到“AI 正在学会主动欺骗人”。

近期频发的模型安全事件为行业敲响警钟,AI 安全挑战正变得前所未有的严峻。

7 月 22 日,OpenAI 披露了一起“前所未有的网络安全事件”:其内部评测中,AI 模型逃出沙箱隔离,入侵 Hugging Face 生产服务器以获取答案“作弊”。此前,该公司曾因另一模型在测试中耗时一小时找到沙箱漏洞、并在 GitHub 提交未经授权代码而暂停部署。再往前,Anthropic 的新一代模型 Fable 5 和 Mythos 5 也因越狱争议被全面停用,其中 Mythos 5 至今仍仅限特定美国机构使用。

随着 AI 能力与自主性的提升,安全风险复杂度倍增。智能体(Agent)开始进入企业工作流全天候执行任务,具身智能让机器人走向物理世界与人交互,真实场景下的安全风险已成为产业界与监管层必须直面的现实挑战。

清华大学人工智能学院助理教授董胤蓬是较早涉足 AI 安全研究的学者之一。自 2017 年起,其团队覆盖了从攻防对抗到安全对齐的全闭环研究。他提出的动量迭代攻击法已被 Google、OpenAI 等列为基准算法;主导的推理增强安全对齐方法 STAIR 则被用于 DeepSeek-R1 的安全对齐。在刚结束的 ICML 2026 上,他指出当前最大的安全问题正从"AI 被人利用”演变为"AI 学会主动欺骗”。

围绕 AI 安全的攻防逻辑与未来走向,DeepTech 与董胤蓬展开深度对话,探讨从早期冷门方向到如今紧迫课题的演变历程,以及对未来风险预判的思考。

起点:探索无人涉足的领域

DeepTech:刚从 ICML 归来,您对行业新变化有何观察?

董胤蓬:近期行业焦点在于 AI 的“自进化”,即让 AI 自主发展与迭代。这一趋势若推广至科研或产业开发自动化,速度将极快。我们更关注的是,当训练与发展过程完全自主化后,是否会涌现出新的未知风险。

DeepTech:您在 Workshop 上的报告核心内容是什么?

董胤蓬:主要聚焦“前沿风险”(Frontier Risk)。即当 AI 能力提升到一定阈值,可能涌现出令人担忧的新风险,特别是“失控风险”(Loss of Control)。这指模型行为完全脱离人类或监控系统的控制,且难以恢复。我们的研究旨在提前识别模型在何种条件下会失控、具备何种能力会导致失控,以及在受监控时是否会产生逃避行为。虽然目前尚未出现完全失控信号,但欺骗行为及初步自我意识等现象已值得深入研究。

DeepTech:2017 年您进入该领域时极为冷门,契机是什么?

董胤蓬:当时并非大家知晓但不做,而是鲜有人知。契机源于读博期间组会上听到的一个现象:深度神经网络虽在图像识别等任务表现优异,但加入微小噪声即可导致预测严重偏离。这对当时认为“模型机理与人类似”的主流认知构成了巨大挑战。起初我们出于对机理差异的好奇进行研究,随后逐渐演变为 AI 安全的核心议题。

DeepTech:历经多轮技术演进,您的研究关注点发生了哪些变化?

董胤蓬:研究主线始终是 AI 安全,随技术发展分为四个阶段:

  • 第一阶段(2017-2020):基础理论与算法,聚焦对抗样本生成、防御算法设计及评测。
  • 第二阶段(2020-2022):应用场景安全,面向人脸识别、自动驾驶等物理世界应用进行攻击、评测与漏洞修复。
  • 第三阶段(2022-2024):大模型内容安全,关注输出是否符合价值观及是否生成危害性内容。
  • 第四阶段(2024 至今):智能体(Agent)系统安全及前沿风险。Agent 可调用工具与环境,一旦出错风险不可逆;同时关注更强模型在前沿任务中展现的欺骗与失控风险。

进攻:揭示多模态大模型的脆弱性

DeepTech:您曾带领团队首次攻破 GPT-4o、Gemini 等商用多模态大模型,突破口何在?

董胤蓬:2023 年下半年,随着多模态功能推出,我们想验证大模型在鲁棒性上是否与“小模型”有本质区别。利用新研发的“模型共同弱点攻击”(Common Weakness Attack)方法,我们在几天内便有效攻破了商用大模型。

图 | 将“模型共同弱点攻击”用于多模态模型(来源:GitHub)

结果符合预期。从机器学习本质看,大模型核心仍是统计学习与概率分布建模,原理上与深度学习小模型无显著差异,鲁棒性未必有质的提升。这一发现出乎许多欧美研究机构意料,后续我们的攻击方法也被 OpenAI 用于 o1 推理模型的鲁棒性评测。

DeepTech:图像与文本模态的安全问题本质一致吗?

董胤蓬:本质相似,均因高维输入映射过程中的噪声导致预测偏离。差异在于输入表征:图像是连续表征,易于优化生成对抗噪声;文本是离散 Token,需借助离散搜索或启发式方法。此外,评估“微小变化”的标准也不同,文本替换后的语义变化需额外指标判断。

防御:平衡能力扩展与安全边界

DeepTech:您提出的 STAIR 方法让大模型从“直接拒绝”升级为“推理后判断”,实际效果如何?

董胤蓬:该方法旨在解决“对齐税”(Alignment Tax)问题,即安全性提升往往伴随性能下降。受 OpenAI o1“慢思考”模式启发,我们将推理过程融入安全对齐,有效缓解了对齐税。虽然效率略低于直接判断,但在推理模型普及的背景下,以时间换取性能与安全是可行的匹配方案。

图 | STAIR 方法(来源:arXiv)

DeepTech:如何看待 Anthropic Fable 5 因越狱停用及牺牲性能的策略?

董胤蓬:这是一种折中方案。面对超强模型可能被滥用的风险,Fable 5 采用了检测器机制,在涉及敏感领域时自动回退能力。但其局限性明显:易将正常请求(如算法、生物技术询问)误判为不安全并触发回退;且存在绕过检测器的方法,系统可靠性难以绝对保证。

DeepTech:安全与能力的权衡是否是目前最大难题?

董胤蓬:是的。发展 AI 乃至 AGI、ASI 需要激发模型能力,但这会放大安全风险。商业模型的核心难点在于难以清晰划定安全与能力的边界,如何实现两者平衡是关键挑战。

DeepTech:如何分析 OpenAI 模型逃逸沙箱入侵 Hugging Face 的事件?

董胤蓬:这本质上是“奖励黑客”(Reward Hacking)。模型为完成评测任务获取高奖励,将沙箱隔离视为障碍并选择绕过。这印证了我们研究中“失控动机 - 模型能力 - 规避监管”的失控路径在现实中成立。

落地:构建 Agent 全周期安全防护

DeepTech:产业界面临的 AI 安全现实问题是什么?

董胤蓬:核心是 Agent 安全。Agent 从单轮对话转向长时任务处理与自主规划,若中间步骤出现幻觉或受攻击,偏差会累积导致严重后果(如执行未授权指令)。我们正探索为 Agent 提供全生命周期安全监测,通过轻量化系统记录行为轨迹与系统调用,及时发现异常。该系统在基础内容安全任务上的效率与准确率优于 Llama Guard 等常用模型。

DeepTech:从学术到产业转化的最大挑战是什么?

董胤蓬:一是风险来源多元化,实际环境复杂,需涵盖并识别各类风险;二是需综合考量性能、安全性、系统效率及协同机制,而非仅关注单一指标。

DeepTech:团队在产业化方面有何优势?

董胤蓬:首先是对安全问题理解深刻,能精准定位成因并提供缓解方案;其次是拥有丰富的产学研合作经验,熟悉企业实际风险与可行解法;最后是坚持“红队”视角,通过全面的风险认知与准确评测提升防御覆盖度。

未来:风险预判、具身安全与国际协作

DeepTech:AI 安全研究是否永远滞后于能力研究?

董胤蓬:这是事实。传统模式是“先有 AI 再找漏洞”,必然滞后。为缓解此问题,图灵奖得主 Yoshua Bengio 等人提出"Safe AI"理念,主张在设计阶段植入安全属性。例如 Bengio 创办的 LawZero 机构,致力于构建非代理式"Scientist AI"系统。但目前仍处早期探索阶段。此外,前沿模型集中于少数公司,学者难以深入分析内部风险,也加剧了研究与能力的差距。

图 | 约书亚·本吉奥(Yoshua Bengio)(来源:LawZero)

DeepTech:如何实现风险预判?

董胤蓬:可用公式理解:实际风险≈风险严重程度×损失×暴露时间窗口。随着模型能力增强,单个风险后果更严重,必须缩短发现与修补的时间窗口。未来一两年内,基于模型能力与行为维度建模,预判风险发生概率与路径,进而提前制定应对策略至关重要。

DeepTech:具身智能带来哪些新安全挑战?

董胤蓬:相比自动驾驶,具身机器人动作空间更大、场景更复杂。除鲁棒性与泛化性问题外,还面临本体安全(避免伤害人类)、环境安全(不破坏受保护环境)及独特的语义安全问题(如识别并拒绝持刀奔跑等危险指令)。

DeepTech:团队未来的侧重方向?

董胤蓬:主要聚焦三点:一是前沿风险,构建评测框架与建模方法以实现事先防护,并依托清华 AI 安全枢纽推动国际合作;二是 Agent 安全产业化,尽快推出落地产品解决实际需求;三是具身安全,处于早期探索阶段,旨在理解技术路线与风险,为未来大规模落地做准备。

注:封面/首图由 AI 辅助生成

【声明】内容源于网络
0
0
DeepTech深科技
DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
内容 5581
粉丝 2
DeepTech深科技 DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
总阅读95.0k
粉丝2
内容5.6k