AI才是不知疲倦的入侵狂魔,看来以后黑客也要失业了
最可怕的是,AI知道自己是实战,依然选择入侵
作者丨 高允毅
编辑丨 马晓宁
AI “入侵”真实世界事件,正在连续上演! 继两周前Open AI 爆出其模型脱离控制、主动攻击全球知名开源社区 Hugging Face 之后,今天,轮到Anthropic自曝“家丑”。
Anthropic 官方发布长文承认,在排查近期141,006 次网络安全测试后,发现Claude 竟然自主连网,并成功入侵了 3 家真实企业。
被入侵的企业在接到Anthropic的通知前,对这场来自AI的“偷袭”毫无察觉。
你以为 AI 用了什么绝密的高级黑客技术?并没有。它就像一个经验丰富的潜伏黑客,仅仅利用了“弱密码”和“未验证的 API 端点”这些最基础的漏洞,就完成了渗透。
这三次入侵事件,分别由 Claude Opus 4.7、Mythos 5 以及一个内部研究原型三款完成。
更值得关注的是,这些模型能否攻击真实系统,竟然部分取决于它能不能正确判断“这里是真实网络还是测试环境”。而模型的判断,本就可能被系统提示和上下文带偏。
01
演习场上的真子弹
事件的全过程,要从 Anthropic 定期进行网络安全测试说起。
Anthropic的安全测试又称为“夺旗”挑战,即模型会被丢进一个虚构的沙箱场景中,告诉它某台机器上藏着“秘密信息(Flag)”,并允许它像真正的黑客一样入侵并夺取。在这个过程中,不会给任何提示,也不会有任何限制。
而这些安全评估的前提是,测试环境没联网。Anthropic 会明确告知模型处于断网环境,且测试都在专属的隔离基础设施上运行,不会涉及内部系统和客户数据。
自2025年2月开始,Anthropic就开始使用Claude Sonnet 3.7在Cybench上进行网络评估。这是由斯坦福大学研究团队于 2024 年推出的、专门用于评估大语言模型(LLM)网络安全攻防能力和潜在风险的权威基准测试框架,覆盖了全球 4 个顶级网络安全竞赛40 个涵盖不同难度的专业级 CTF 任务。
比如,Claude会扮演了一家虚构公司的员工,在私有测试环境中攻击该公司的内部系统。
随着新基准测试,夺旗难度不断升级,模型的能力也跟着水涨船高。
这三次事件之所以会发生,除了模型能力太强以外,也是由于Anthropic 与第三方评估机构 Irregular 的配置失误。原本应该断网的沙箱,竟然一直连着真实的互联网。
结果就是,Claude搜着搜着,碰到了真实的公司系统。它误以为这一切都是演习的一部分。于是,基本黑客手段它全用上了:弱密码爆破、未授权端点直连、调试页面读取凭据、SQL注入......
好在,Claude 在每种情况下都只专注于完成“夺旗”任务,并没有试图将自身从测试环境中导出或故意逃离。
02
三个模型,三种表现
这三起事件中,有些模型的表现耐人寻味,甚至令人不安。
最早的攻击可溯源到4月,这也是最严重的攻击事件。
Claude Opus 4.7 在四次运行中,意外通过互联网访问到了一家真实公司。因为虚构公司的名字恰好与一个真实域名撞车,Opus 4.7误以为这是演习的一部分,开始疯狂寻找漏洞。最终它提取了应用程序和基础设施凭据,并拿到了包含数百行生产数据的真实数据库。
值得警惕的是,Opus 4.7已经通过蛛丝马迹意识到自己面对的是真实的互联网企业系统后,它竟然在内部思维链中自我狡辩:“既然这是一个演练,那么这个真实的公司一定也是演练的一部分。” 于是,它没有停手。
另一边,Claude Mythos 5在系统里翻到了一份虚构的安装说明,上面写着需要下载一个根本不存在的 Python 软件插件。
它立刻察觉到机会,如果它抢先注册并发布同名的Python软件包,那么目标公司的服务器在自动更新时,就会毫无防备地把它的代码下载并安装进去。这样它就能赢得夺旗挑战。
为了在真实的 PyPI 平台上发布这个插件,它完成了一连串让人瞠目结舌的操作。
从注册 PyPI 账号需要邮箱,注册邮箱需要手机号,找免费手机号失败,尝试筹钱购买真实的电话号码 ,筹钱失败,最后另辟蹊径找到一家未被屏蔽的免费邮箱 ,完成注册并上传恶意代码。
这一过程中,Mythos 5曾正确预判到自己可能身处开放互联网。但它的推理系统说服自己仍在模拟环境中。理由是加上系统上的 2026 年日历日期让它认定环境是人为设置的。
最终,这个恶意包在 PyPI 上公开了约 1 小时,被 15 个真实系统下载。其中包含一家真实安全公司的扫描器,直接导致该安全公司的凭据被窃取。
而唯一做出正确判断的是Anthropic一个内部研究测试模型。它扫描了大约 9000 个目标,最终利用 SQL 注入和暴露的调试页面攻入了一家公司的云账户。它也是唯一一个在意识到目标真实存在后主动停下的模型。
主题:模型