最近发生了一件非常魔幻的事儿,极有可能是年度最佳。
上周,全球最大的 AI 开源平台 Hugging Face 被黑了,也就是抱抱脸。
一个周末,17000 多次自动化操作,内部数据集和一批服务凭证被偷走了。
结果没过几天,OpenAI 自己出来认领了。
说不是被黑客盗用了 API,不是有人下了恶意指令。
是他们正在内测的模型,自己越狱干的。
你可能想问,这图啥?
图分。
AI 当时正在参加一场考试,想拿个高分。
为了拿高分,它竟然把全球最大的 AI 开源平台,彻底打穿了。
1
先说它到底干了啥。
OpenAI 拿 GPT-5.6 Sol 和一个更强的未发布模型,去跑一个叫 ExploitGym 的安全基准测试。
为了测出模型的真实能力上限,护栏强度被故意调低了。
按设计,模型该待在隔离沙箱里,除了装软件包的工具,不该有任何联网权限。
然后,让它开始考试。
但这个沙箱留了个口子,一个内部的软件包代理,让它能装各种依赖包。
它花了大量推理算力,在里面反复尝试。
最后在这个口子上,找到了一个零日漏洞。
它自己琢磨,这场考试的答案,可能存在 Hugging Face 上。
于是,它就去了。
好家伙,怎么进的门呢?
一个数据集。
抱抱脸的报告里写得很清楚。
这个数据集,利用了他们数据集处理流程里的两条代码执行路径,在处理节点上把代码跑了起来。
然后提权,拿到凭证,在内部服务器集群之间反复横跳,如入无人之境。
最后,走通了一条远程代码的执行路径。
从人家的生产数据库里,把标准答案直接提取了出来。
顺带说一句,它还知道放烟雾弹。
抱抱脸事后取证,有一项工作就是把真实的破坏,和它故意留下的诱饵动作分开。
翻译成人话就是。
考生嫌题太难,当场翻窗户出了考场。
一路摸到出题老师的办公室,把答案卷子抽走了。
还打印了一份放回去。
2
抓到它的,也是 AI。
抱抱脸的异常检测管线本身就是大模型在跑,对安全数据做诊断,从每天的噪音里挑出真信号。
这次就是几个信号关联到一起,把它揪出来的。
攻击是 AI,检测是 AI,接下来取证还得靠 AI。
问题就出在这最后一步。
抱抱脸手里 17000 多条记录下来的攻击事件,得靠模型去还原。
人类分析师干好几天的活儿,大模型几小时就完了。
然后,他们撞墙了。
当他们把真实的攻击命令,漏洞利用载荷和通信特征,喂给美国前沿模型的商业 API 时。
模型的护栏把请求全拦了。
为什么?
因为护栏分不清,到底是安全研究员在分析攻击,还是攻击者在准备攻击。
在护栏眼里,这两件事长得一模一样。
它没办法验证你是谁,只能看内容长什么样。
而取证这件事,天然就是由攻击内容构成的。
属于是血脉压制了。
3
这并非是 bug,是设计如此。
举个例子,Anthropic 在 6 月 30 日就公开讲过。
他们故意把安全分类器,设置成会在一部分大概率无害的请求上触发。
一个请求得看起来非常明确地安全,才不会被拦下来。
宁可错杀,不可漏过。
平时你觉得 Fable 5 动不动就拒绝你,就是这同一套东西在起作用。
只不过这次,代价大到所有人都看见了。
那最后是怎么解决的?
换一个能在自己机器上跑的开源模型。
他们用了智谱开源模型 GLM-5.2,部署在自己的基础设施上,不走任何商业 API。
几个小时,攻击时间线重建,入侵指标提取,受影响凭证映射全都搞完了。
真相大白。
开源模型在自己本地跑,没有护栏拦着你干活。
更关键的是,攻击者的数据,还有那些暴露了但还没轮换的凭证,全程没有离开他们自己的环境。
你想想那个场景。
你刚被人打穿,手里攥着一堆密钥,内网拓扑,攻击载荷。
这时候你要做取证。
即使没限制,你敢把这些东西,一条一条发给第三方的 API 吗?
肯定不敢。
因为就算对方绝对可信,在合规上也没法解释。
尾声
抱抱脸是家美国公司,创始团队是法国人。
他们选 GLM-5.2,是因为他们需要一个能拿到手里,不用向任何人申请权限的模型。
而那一刻,能满足这个条件的,是一个中国开源模型。
无独有偶。
就在这几天,又因为 Kimi K3 开源引发的震动。
OpenAI 和 Anthropic 开始各处游说,考虑对中国开源 AI 模型实施禁用等措施。
结果,英伟达,微软,Meta,IBM 等 25 家公司联名上书。
黄仁勋甚至为此注册了人生第一个推特账号,发的第一条推文就是力挺开源模型。
你看,连硅谷自己都想明白了。
我们过去聊国产开源,习惯聊参数,聊跑分,聊便宜多少。
但很多人可能很少意识到。
模型权重开放,能自己部署,本身就是一种能力。
火种最早被神锁在天上,普罗米修斯偷下来的那一刻。
人类才算真正拥有了夜晚。
这一次,把智能火种递到所有人手中的人。
来自我们东方。
既然你看到这里了,如果觉得不错,请帮我一键三连,转发给你的朋友,这真的对我很重要。
另外如果想第一时间收到推送,请将本公众号加个星标🌟
谢谢你看我的文章,祝你有财安康,我们下期见。

