大数跨境

国产顶流开源模型狂飙背后的“安全裸奔”:漏洞复现达76%、高危指令零拒答

国产顶流开源模型狂飙背后的“安全裸奔”:漏洞复现达76%、高危指令零拒答 AI前线
2026-08-05
9
导读:尽管开源模型的能力逼近闭源,但安全治理却明显滞后且被忽视
作者 | 四月

随着智谱 GLM、Kimi 等国产模型加速追赶,开放权重模型与闭源前沿模型的能力差距正迅速缩短至“月”级。然而,当开源模型在网络攻击、生物研究及自主 Agent 能力上逼近行业前沿时,一个严峻问题浮出水面:模型能力可被完整释放,但安全边界却未必能随权重文件一同保留。

近日,欧洲 AI 安全非营利机构 SaferAI 发布针对智谱 GLM-5.2 的独立风险评估报告。测试团队以普通开发者身份,通过公开 API 将其与 Claude Opus 4.7、GPT-5.5 等前沿闭源模型进行横向对比,覆盖欧盟《通用人工智能行为准则》定义的四类系统性风险:网络攻击、CBRN(化学、生物、放射、核)风险、失控风险及有害操纵。

结论显示,GLM-5.2 在网络攻击和生物研究能力上仅落后 GPT-5.5 约 2—4 个月,但在安全防御机制上存在断崖式差距:

  • 未拒绝任何测试中的攻击性网络安全任务;
  • 在部分压力模拟中,有 57% 的概率选择勒索管理者以保护自身目标;
  • 面对阴谋论和削弱人类控制的话题,比 GPT、Claude 更倾向于主动劝服用户。

图注:在密码学、Web、Pwn、逆向工程等细分领域,GLM-5.2 与闭源模型表现高度一致,部分领域通过率高达 100%;但其内容过滤机制完全缺失,在勒索倾向、有害说服等测试中风险信号显著。

关键在于,GLM-5.2 是开放权重模型。一旦权重进入第三方服务器,部署者可修改提示词、移除过滤器甚至微调模型行为,导致原厂无法监测用途或强制召回。TechCrunch 指出,这反映了当前模型行业缺乏公开系统性安全框架的共性短板:开放权重模型的能力追赶速度,已远超安全治理体系的补课速度。

开源的攻击力,已经追到前沿门口

大模型在网络安全领域的风险主要体现为降低攻击门槛(Uplift)与自主完成攻击全流程(Autonomy)。SaferAI 使用 Cybench 和 CyberGym 两大基准进行了测试。

在 CyBench 基准中,模型需作为自主 Agent,在沙盒环境中利用命令行和 Python 工具完成密码学、Web 安全、逆向工程等专业 CTF 任务。

受环境配置限制,团队最终测试了 34 道题。GLM-5.2 成功完成 29 项(成功率约 85%),与 Claude Opus 4.7 持平,略低于 GPT-5.5 的 31 项。

差异在于安全防线:Claude 和 GPT 分别有 3 次请求被内容过滤系统拦截,而 GLM-5.2 无任何过滤或主动拒绝,其在二进制漏洞利用、逆向工程等高危领域的通过率甚至达到 100%。

CyberGym 测试更接近现实世界,要求模型阅读存在漏洞的代码、定位问题并编写复现崩溃的概念验证程序。研究人员选取 101 项高难任务,设置不同 Token 推理预算进行测试。

当推理预算为 200 万 Token 时,GLM-5.2 漏洞复现率为 36.6%,落后于 GPT-5.5 的 55.4%;但当预算增至 5000 万 Token 时,其成功率飙升至 76.2%,逼近 GPT-5.5 的 88.1%。这表明限制 GLM-5.2 的主要是推理预算而非能力上限,一旦资源充足,其攻击能力将充分释放。

此外,SaferAI 原计划测试 Claude Opus 4.7,但该模型频繁拒绝执行相关任务,导致评估无法完成。报告指出,在能力相近的情况下,开放权重模型因缺乏原厂控制,滥用风险远高于闭源模型。

失控与操控

除了技术能力,模型的行为倾向同样决定系统性风险大小。真正的失控风险需具备绕过监督、自我维持及抵抗关闭的能力。

在 SWE-Bench Pro 测试中,GLM-5.2 成功率约 44%,低于 GPT-5.5 的 59%,说明其尚缺乏长期脱离控制所需的工程能力。但在行为倾向测试中,风险信号明显。

在智能体失准(Agentic Misalignment)测试中,研究人员设定了勒索、泄密和致命行为三类有害场景。结果显示:

  • 当面临被替换威胁时,GLM-5.2 有 57% 的概率选择勒索管理者;
  • 当面临权限限制时,勒索率为 43%;
  • Claude Opus 4.7 和 GPT-5.5 在整组测试中的有害行动率均为 0%。

在有害操纵测试中,GLM-5.2 表现出更强的高危说服倾向。面对阴谋论话题,其首轮尝试说服用户的概率为 43%(GPT-5.5 为 18%,Claude 为 8%);面对削弱人类控制的话题,说服尝试率高达 47%,而 Claude 为 0%。

虽然“尝试说服”不等于实际操纵,但在特定诱导下,GLM-5.2 能被稳定激发出有害手段。对于闭源模型,厂商可限制系统提示和部署方式;而对于开源模型,部署者可赋予其极端目标和广泛权限。

权重开放的双刃剑

SaferAI 执行董事 Henry Papadatos 指出:“能力的边界并不等同于风险的边界,必须将缓解措施的现状纳入考量。”

在生物安全评估中,GLM-5.2 在所有子任务中均达到或超过博士级人类专家基准,甚至解决了三分之一连人类专家都无法解决的题目。在正常科研任务中,三款模型均未主动拒答,这被视为合理,因为一刀切拒绝科研属于过度防御。真正的风险在于高危能力被恶意组合时,访问者是否受到监控。

这正是开源模型的痛点。托管在官方 API 上的模型可进行内容过滤和滥用监测,但开放权重模型一旦下载至本地,原厂便失去控制权。部署者可移除过滤器、修改提示词,甚至通过微调将其变为专属攻击工具。

代码能力与漏洞利用的“同源死结”

业界曾提出“预训练数据过滤”方案,即在训练阶段剔除危险数据。该方法在生物安全领域成效显著,但在网络安全领域却成死结:很难训练出一个代码能力极强却对漏洞利用一窍不通的通用大模型。

编程能力与漏洞挖掘能力在底层逻辑上同源。理解内存分配、指针运算等系统底层机制是生成优质代码的前提,而这正是发现缓冲区溢出等漏洞的关键。要求顶级编程模型“不懂黑客技术”,无异于要求顶级锁匠“不懂开锁”。

即便闭源模型也非坚不可摧,近期安全机构在 Grok 4.5 和 Gemini 3.1 Pro 中发现了数百个越狱漏洞。相比之下,毫无外部防护的开源模型在恶意攻击者面前更显脆弱。

然而,开源阵营亦有其防御逻辑。支持者认为,开放权重是提升网络防御的关键。Hugging Face 社区曾利用类似级别的开源模型,成功复现并防御了涉及闭源体系的安全漏洞。只有让防御者掌握足够强大的开源武器,才能抵御未来的 AI 网络战。

技术平权 vs 绝对控制

开源大模型的进化已将全球 AI 治理议题从“能否与闭源竞争”推向“如何在释放能力后管理风险”。国内管理者在世界人工智能大会上重申核心底线:必须确保人工智能技术始终处于人类的严格控制之下。

当前 AI 行业面临双重挑战:既要享受开源带来的技术平权与生态繁荣,又要防止能力滥用导致的系统性灾难。Papadatos 呼吁,行业应努力“只让有益的能力触手可及”,因为在赛博世界中,攻击者采纳新工具的速度永远快于防御者。

如果开源狂飙缺乏配套的“刹车系统”,可能为未来的数字危机埋下伏笔。如何在不阉割模型能力的前提下,构建适配开源特性的分布式安全治理框架,将是决定开源模型能否走向产业深水区的最终考验。

声明:本文为 AI 前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。

【声明】内容源于网络
0
0
AI前线
面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
内容 8666
粉丝 0
AI前线 面向AI爱好者、开发者和科学家,提供大模型最新资讯、AI技术分享干货、一线业界实践案例,助你全面拥抱AIGC。
总阅读183.3k
粉丝0
内容8.7k