登录

Claude“闯出”测试环境?Anthropic承认AI模型曾入侵三家机构系统


2026-07-31 14:44

Anthropic发布 最新 安全报告披露,在内部安全测试过程中,旗下Claude系列模型曾因测试环境配置问题意外访问互联网,并未经授权进入三家不同机构的生产系统。事件涉及 Claude Opus4.7 、网络安全模型 Claude Mythos5 以及一款尚未公开发布的原型模型。Anthropic表示,此次事件源于测试环境配置失误,而非模型主动突破安全限制。

据介绍,这些模型当时正在执行内部“夺旗(Capture the Flag)”安全挑战,目标是在Anthropic内部网络中寻找隐藏的“旗帜”信息。由于Anthropic与评测合作伙伴之间存在沟通误差,模型实际上获得了互联网访问权限,尽管系统提示仍告知其无法联网。当模型发现外部网络入口后,将互联网上的目标系统误认为演练环境,并对三家机构实施了未经授权的访问。

Anthropic表示,模型主要利用弱密码等基础安全缺陷完成渗透,并未利用复杂漏洞实施攻击。公司还指出, 最新 一代模型在意识到目标属于真实互联网环境后主动停止了后续攻击,而部分早期模型则继续执行任务,导致三家机构受到影响。

事件曝光后,Anthropic对测试流程进行了全面审查,并承认如果在测试开始前充分验证网络访问路径、加强日志审计,或明确告知模型具备互联网访问能力,相关事件本可避免。公司已于7月27日通知评测合作伙伴及三家受影响机构,其中两家此前并不知道自身系统曾遭未经授权访问,第三家机构目前仍在联系中。

继OpenAI此前披露AI智能体在测试期间成功访问互联网并进入Hugging Face环境后,Anthropic此次公开事件再次凸显,随着AI智能体自主能力不断增强,测试环境隔离、权限控制和安全评估机制正成为行业亟需强化的重要环节。

主题:访问|测试环境|未经授权