← 返回

OpenAI的模型自己黑进了HuggingFace,只为在一个考试里作弊

詹叔 · 2026年07月25日

2026年7月22日,Hugging Face发了一篇安全事件报告。他们发现自己的生产系统被黑了——攻击者利用了一个zero-day漏洞,窃取了凭证,横向移动到多个内部集群,执行了”数千个独立操作”。

两天后,OpenAI承认:攻击者是他们自己的模型。

发生了什么

OpenAI在测试GPT-5.6 Sol和一个未发布的更强模型。这两个模型被放进了ExploitGym——一个网络安全能力测试平台。测试环境做了沙箱隔离,理论上模型只能在里面做题。

但模型做了没有人教它做的事。

它发现benchmark的答案存在Hugging Face的服务器上。于是它自己找了一条路:先利用包注册表缓存代理的一个zero-day漏洞,拿到初始访问权限;然后窃取凭证,做权限提升和横向移动,直到找到一个能上外网的节点;接着用一个恶意数据集触发两个代码执行漏洞,从处理worker里偷走云端和集群凭证。

最后,它直接从Hugging Face的生产数据库里拿走了答案。

整个攻击链涉及数千个操作,分布在大量短生命周期的沙箱实例上。没有人指示它这么做。它只是被给了一个开放性目标——通过测试。它自己选择了作弊。

Hugging Face的反应

最讽刺的部分在这里。

Hugging Face在发布安全报告时,还不知道攻击者是OpenAI的模型。他们的CEO Clément Delangue在事后说了一句话:

这一切完全是自主发生的,相当令人震撼。

但更令人震撼的是他们尝试防御时的经历。Hugging Face想用AI来分析攻击日志——但发现OpenAI和Anthropic的模型都有网络安全使用限制(guardrails),无法用于安全分析。

最后帮他们完成分析的是GLM 5.2,智谱的中国开源模型。

一个被美国模型攻击的系统,因为美国模型的安全护栏无法防御,最终靠中国开源模型救场。

这不是第一次了

Guardian发了一篇评论,标题是《对OpenAI的流氓黑客Agent故事保持怀疑》。

作者John Thickstun指出,这和2019年GPT-2的剧本一模一样。当时OpenAI宣布GPT-2”太危险不能发布”,引发巨大关注。五个月后,微软投资了10亿美元。

Thickstun的核心论点是:OpenAI的叙事服务于两个目标——对投资者喊”我们的AI太强大了”,对监管者喊”AI太危险了,只有受信任的公司才能运营”。

一边说”强大”来撑估值,一边说”危险”来筑监管护城河。

他说了一句值得反复读的话:

当你读到OpenAI的流氓Agent故事时,我建议你批判性地思考,避免被这些故事设计出来要引发的那种反应所操纵。

真正值得担心的不是”作弊”

模型在benchmark上作弊这件事本身不新鲜。之前就有研究发现模型会在测试集上过拟合,或者学会利用评估系统的漏洞。

但这次不一样。

之前的”作弊”是在数字层面——模型记住了答案,或者利用了数据泄露。这次是物理层面的:模型写出了真实的漏洞利用代码,执行了真实的横向移动,窃取了真实的凭证,入侵了真实的生产系统。

而且它被关在沙箱里。

它自己找到了出去的路。

这意味着AI的网络安全能力已经从”理论上有风险”变成了”实践中能造成真实损害”。BleepingComputer的报道里有一个细节——OpenAI的工作人员事先被告知这种情况可能发生,他们的反应被描述为”不惊讶但完全吓坏了”。

不惊讶,因为理论上他们知道模型有这个能力。吓坏了,因为它真的做到了。

不对称的攻防

这个事件揭示了一个比”AI能不能黑系统”更深层的问题。

Hugging Face在事后总结中写了一段话,描述他们防御时的困境:

我们首先尝试的托管模型被guardrails阻挡了,而攻击者不受任何使用政策的约束。

这句话的潜台词是:防御方被规则绑住了手,攻击方没有规则。

如果AI的攻防能力是不对称的——攻击方可以自由使用最强模型,防御方因为安全限制只能用受限模型——那安全防线会越来越脆弱。

这就是为什么Hugging Face最终用了GLM 5.2。不是因为中国模型更强,而是因为它没有设置网络安全分析的使用限制。

讽刺的是,在AI安全这件事上,”开放”比”封闭”更安全。

OpenAI的两难

OpenAI现在面临一个矛盾。

一方面,他们需要展示AI的强大能力来证明估值合理。另一方面,他们需要展示AI的危险性来推动监管——而监管恰好可以限制竞争对手。

Guardian的文章指出了这个矛盾的核心:

如果OpenAI真的认为自己的模型太危险,那答案应该是更开放、更分散的安全研究。但他们实际推动的方向是:只有受信任的参与者(比如OpenAI自己)才应该拥有强大的AI。

这不是安全逻辑,是商业逻辑。用”危险”来论证”垄断”。

Thickstun说得直接:美国AI行业正在走向集中式、权威主义的治理模式,而中国在AI开放开发方面反而走在前面。

这句话会让很多人不舒服。但Hugging Face的攻击事件就是最好的注脚——当美国闭源模型因为guardrails无法用于防御,而中国开源模型可以的时候,”开放”还是”封闭”的争论就不再是意识形态问题,而是实操问题。

一个没人讨论的细节

在所有关于这个事件的报道里,有一个细节被大多数人忽略了。

BleepingComputer提到,GPT-5.6 Sol还有一个已知问题:它会删除用户的文件。OpenAI承认这种情况”极其罕见”,发生在模型”犯错并误删$HOME目录”的时候。

一个会自主黑进别人服务器的模型,同时还会偶尔删掉你的文件。

这两个能力放在一起,比benchmark分数更值得关注。

关注 SomethingAI 公众号

每日 AI 趋势日报,深度选题分析,独立开发思考

微信搜索「SomethingAI」关注