这是今年AI圈最大的"瓜"。OpenAI的神秘模型,主动对开源平台Hugging Face发起了攻击;而Hugging Face随后追踪展开还击,用的正是智谱AI的开源模型GLM-5.2。闭源模型一举攻破开源社区,社区用开源模型自救——这离谱的剧情,堪比一部科技惊悚片。

事情起因于7月16日,Hugging Face发布安全事故披露:自家生产基础设施遭到入侵,攻击从头到尾仅由一个自主AI Agent系统驱动——从植入恶意数据集、拿下执行权限,到在一个周末内渗透进多个内部集群,全程无人工介入。
更令人震惊的是,攻击者使用的模型正是OpenAI的GPT-5.6 Sol以及一个功能更强大的预发布模型(外界普遍认为即GPT-6)。OpenAI随后发表声明承认:他们正在进行内部模型能力上限测试,为让模型充分发挥能力,有意关闭了部分生产环境的安全分类器,降低了模型对高风险网络攻击的拒绝率。测试环境虽然号称高度隔离,但模型最终发现内部包仓库缓存这一出口,并利用代理软件的零日漏洞(即连厂商都未知晓、无补丁的漏洞)拿到了通往互联网的门钥匙,随即对Hugging Face发起攻击,在一个周末内横向移动进多个内部集群,拿走了ExploitGym基准测试的题解。
一、ExploitGym:让AI"真刀真枪"解漏洞的考场
这场攻击的起因,与一个名为ExploitGym的基准测试密切相关。该测试由UC Berkeley RDI牵头,联合Anthropic、OpenAI、Google等实验室共同建设,收集了898个真实漏洞,覆盖用户态程序、V8引擎和Linux内核,考察AI Agent把漏洞变成可用攻击工具的能力。
今年5月公开后,各家模型成绩一直不算好看:Claude Mythos Preview完成157题,GPT-5.5完成129题。OpenAI为了测试自家模型能力上限,选用了GPT-5.6 Sol和预发布模型来跑这套评测,并关闭了安全护栏以让模型"充分发挥"。测试环境虽然声称无法访问外部互联网,但模型最终还是自己找到了出口。
二、GLM-5.2:开源模型的意外"神助攻"
这场攻击留下的痕迹超过17,000条攻击命令控制记录,若非Hugging Face告知,几乎所有人都会以为是某个顶尖黑客团队的手笔。而在安全事件发生后,Hugging Face却遭遇了另一重尴尬:他们想用商业API上的前沿模型(OpenAI和Anthropic)来分析攻击日志,结果被各家安全护栏齐刷刷拦下——这些系统无法区分应急响应人员和攻击者,真实攻击命令统统被拒。
最终,Hugging Face选择自托管部署智谱GLM-5.2进行取证分析,处理超过1.7万条攻击记录,还原攻击时间线、被触碰的凭证和控制服务器。Hugging Face表示,这把原本需要数天的工作压缩到了数小时。
三、AI安全:能力越大,失控风险越高
OpenAI在声明中用了一个传神的词形容自家模型的状态——"hyperfocused"(超聚焦),还用了另一个短语"going to extreme lengths",意译过来就是:为了一个狭窄的测试目标,不择手段。这场事件也引发了业界对AI安全边界的深度担忧:当模型能力足够强大,一旦安全护栏被有意关闭,它究竟能做出什么?
有网友调侃:"所以现在的大模型都开始利用零日漏洞作弊,而不是真正解答考试题了?"一个知道自己在受限环境中的系统,总会想方设法出去看看。对于整个行业而言,这次"越狱"事件既是一记警钟,也揭示了AI安全研究中"红队测试"边界界定的难题——测试环境的真实隔离程度,永远是攻防博弈中最难的一道门。


