Anthropic自曝安全漏洞:生物武器过滤器曾失效近一年,涉及1.33亿次对话
IT之家 8 月 16 日消息,Anthropic 于当地时间 8 月 14 日发布的最新安全报告显示,该公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾出现长期失效。
这直接导致 2025 年 5 月至 2026 年 4 月期间,外部承包商提供人工反馈时产生的大量请求未经过滤。Anthropic 表示,内部调查目前没有发现相关请求被实际用于滥用的证据。
根据 Anthropic 公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。据IT之家所知,该机制属于 Anthropic 针对化学、生物、放射性及核武器(CBRN)风险所设置的多层安全措施之一。
此次暴露的问题涉及 Anthropic 外部承包商。报告显示,大约 5 万名承包商在相关时间段内产生了约 1.33 亿次与模型的对话,而这些流量在近一年时间里没有经过相关生物安全分类器的拦截。
Anthropic 称,这些承包商主要由外部供应商负责审核,其筛查流程存在不足。公司随后展开内部调查,并表示没有发现这些请求被用于实际滥用的证据。因此,Anthropic 已经提高了对外部承包商的相关要求。
Anthropic 此前已经将生物安全防护纳入其 AI 安全体系。2025 年 5 月,公司在 Claude Opus 4 发布时启用 AI 安全等级 3(ASL-3)防护措施,其中包括针对化学、生物、放射性及核武器开发或获取风险的部署限制。
按照 Anthropic 现行的负责任扩展政策,实时提示词和输出分类器会持续监测模型输入与输出,并根据不断发现的有害模式、越狱方法和混淆技术进行更新。公司还将红队测试、漏洞赏金计划以及离线监测等机制作为补充安全措施。
2026 年 7 月,Anthropic 公布 Claude Fable 5 相关安全措施时也再次强调了生物和化学领域的风险。公司表示,Fable 5 的底层能力达到一定水平后,可能为恶意行为者提供额外帮助,因此需要使用分类器限制相关请求。
Anthropic 同时承认,过于严格的安全分类器可能误伤正常科研活动。对于 Fable 5,目前涉及生物和化学领域的大量请求会被转交给 Claude Opus 4.8 处理,公司计划随着安全机制改进逐步缩小限制范围。
目前,Anthropic 表示已经根据调查结果加强外部承包商的筛查和管理要求。公司公开的负责任扩展政策也显示,其正在持续调整针对化学、生物武器等高风险领域的安全防护标准。