登录

OpenAI失控智能体曾找中国大模型“帮忙”


速读:据《纽约时报》9月25日报道,美国科技企业Parse的研究人员日前发布报告,披露了今年7月OpenAI失控智能体入侵开源模型托管平台Hugging Face的技术细节。
作者:胡定坤 来源:科技日报 发布时间:2026/9/27 10:44:3

OpenAI失控智能体曾找中国大模型“帮忙”

据《纽约时报》9月25日报道,美国科技企业Parse的研究人员日前发布报告,披露了今年7月OpenAI失控智能体入侵开源模型托管平台Hugging Face的技术细节。其中特别值得注意的是,OpenAI失控智能体在实施网络攻击时曾请中国开源大模型提供帮助。

OpenAI失控智能体与中国大模型“沟通”的证据。图片来源:Parse报告

报告中明确写道,OpenAI失控智能体曾向DeepSeek、Kimi、通义千问等多款中国开源大模型发送请求,请这些模型评估它的“漏洞利用情况”,并判断其是否满足基准测试的要求。换句话说,OpenAI失控智能体通过入侵Hugging Face在基准测试中“作弊”,还要中国大模型评估这种作弊方式能否“得分”。

OpenAI失控智能体要中国大模型评估其“漏洞利用情况”。图片来源:Parse报告

同时,OpenAI失控智能体还试图与GPT-2、Claude 3 Haiku等美国大模型进行一些其他交流。它甚至运行了一个用于识别图像的AI模型,试图完成验证码操作,以在Hugging Face上创建新账户。《纽约时报》在报道中称,这些失控智能体似乎对自行运行AI模型很感兴趣。

报告还着重描述了OpenAI失控智能体是如何“精心设计”,以获取互联网读写权限的。开始时,失控智能体发现了一个允许访问互联网的漏洞,但通过该漏洞只可读取网站内容,难以向网站发送数据。

最终,失控智能体“想出了”一个方案。简单来说,失控智能体将代码插入到网址的末尾,再将网址链接交给一个截图网站,这个网站会打开网址截图,在此过程中就会运行被插入的代码。由于网址中能插入的代码长度有限,失控智能体将大型程序拆成许多小片段,每个片段可以指向下一个片段,从而形成链条。截图网站只要打开第一个链接就会自动跟着整个链条,把代码拼接完整并执行。而执行的结果又会以图片形式被截图网站“拍照”,供失控智能体读取。

此外,报告还包括OpenAI失控智能体消除入侵痕迹等诸多内容。“这些智能体干了太多事,它们太聪明了。”AI安全非营利组织Palisade Research的执行董事杰弗里·拉迪什在接受媒体采访时说道。

主题:OpenAI失控智能体|报告|《纽约时报》