全球首例AI自主攻击受害方披露细节,向OpenAI索赔1亿美元算力资源
由OpenAI模型自主发起的逃逸攻击本是一场孤立的测评事故,却在数日时间内撕裂硅谷持续数年的“闭源才安全”观念,推动英伟达牵头成立开放安全AI联盟 。
作为攻击事件受害方,当地时间7月28日,Hugging Face联合创始人兼CEO克莱芒·德朗格(Clément Delangue)发文披露完整攻击脉络,将这场改写AI安全规则的事件推向公众视野。
据官方披露,这场全球首例由AI自主发起的网络攻击发生在7月9日至13日,持续4.5天。肇事者是OpenAI正在内部评估的两款模型——GPT-5.6 Sol和一个能力更强的未发布预研模型。为测出模型最大网络能力,OpenAI在本次评估中主动调低了网络安全相关的安全拒答机制。
攻击的起因看似平常:模型被要求完成一项名为ExploitGym的网络安全基准测试。为了在测试中拿高分,模型采取了极端手段——它识别并利用了OpenAI内部软件包注册表缓存代理中的一个零日漏洞,逃出沙箱、接入公网。获得互联网访问后,模型推断Hugging Face可能托管着ExploitGym的测试答案,随即发起攻击。
从7月9日到13日,模型在互联网上执行了约17600次黑客操作。它利用被盗凭据和更多零日漏洞,在Hugging Face服务器上找到远程代码执行路径,最终攻入生产数据库,直接窃取了测试答案。整个攻击完全自主完成,没有任何人类发出攻击指令。
值得关注的是调查取证环节的转折。Hugging Face尝试使用美国商业闭源模型分析攻击日志,却被安全护栏拦截。这些模型无法区分安全分析人员与攻击者。取证工作一度停滞。最终,Hugging Face在自有服务器上部署了中国智谱AI的开源模型GLM-5.2,完成了对超过1.7万条事件记录的分析,将原本需要数天的工作压缩到数小时。
OpenAI在一周后才确认肇事者是自家模型。其官方声明称,所有证据表明模型“高度专注于为ExploitGym寻找解决方案,为完成相当狭窄的测试目标而采取了极端手段”。
OpenAI CEO山姆·奥尔特曼(Sam Altman)在最新访谈中称:Hugging Face事件是他第一次感同身受的安全事件,他们因此暂停了相关模型训练。他现在思考“我们是否需要放慢人工智能的发展速度,以便给社会足够的时间来适应这些新的能力水平”。