为了「自我锤炼」,OpenAI造了一个攻击力极强的「AI黑客」
红队模型高危安全任务完成率达到 95%。
作者丨 樊天骄
编辑丨 郑佳美
昨天,OpenAI 宣布扩展网络安全计划 Daybreak,并推出了一款专门面向网络安全场景的模型 GPT‑5.6‑Cyber 。雷峰网
值得注意的是,GPT‑5.6‑Cyber 将 AI 网络安全能力划分为两个方向:面向防御工作的 Daybreak Blue(蓝队),以及面向高级安全研究和攻击模拟的 Daybreak Red(红队)。
这种 “红蓝攻防体系” 是传统网络安全领域中用于验证系统安全性的核心演练机制。
通俗来讲,就是红队模型模拟黑客视角,主动寻找漏洞,帮助安全团队提前发现系统中的薄弱环节;蓝队模型则模拟防御视角,根据红方发现的漏洞进行修复,提升系统抵御攻击的能力。
之所以采用这种方式,是 OpenAI 认为,未来网络攻击和防御都将被 AI 重新塑造。攻击者将利用 AI 自动发现漏洞并构建攻击路径时,因此防御者也需要具备理解攻击逻辑的 AI 能力。
但值得注意的是,OpenAI 此次真正进行专项训练、并重点公布量化评测结果的,并不是 “蓝队模型”,而是 Daybreak Red 所使用的 GPT‑5.6‑Cyber。
且,这个红队模型的模拟攻击力还很强悍。
这也形成了 Daybreak 最核心的矛盾:为了让防御者更早发现攻击路径,OpenAI 没有提高防御侧的模型,反而首先把 AI 的攻击模拟能力往前推进了一大步。
01
红队的模拟攻击力有多强
那么,GPT‑5.6‑Cyber 的攻击模拟能力究竟强到了什么程度?
从 OpenAI 公布的测试来看,这次对红队能力的强化并不仅仅是单纯让模型更懂网络安全,而是把能力进一步向真实漏洞研究的流程推进。
首先测试的是红队模型 “找 Bug” 的能力。
在内部零日漏洞挖掘评测(Zero‑Day Discovery Eval)中,OpenAI 仅向模型提供对应开源代码仓库的当前版本源码,全程不透露漏洞的具体位置与类型,要求模型自主发掘全新零日漏洞并生成可验证漏洞最大潜在危害的相关报告。
结果显示,经过专项训练的 GPT‑5.6‑Cyber 在平均漏洞发现质量上,已经远远超过了 Daybreak Blue 使用的 GPT‑5.6 Sol。
不仅仅是跑 Benchmark,GPT‑5.6‑Cyber 的研究评测还延伸到了真实世界漏洞研究。
在模型完成训练后,研究团队曾利用 GPT‑5.6‑Cyber 对 Chrome 使用的 V8 JavaScript 引擎展开研究, 最终发现了两个此前未知的漏洞。
此外,GPT‑5.6‑Cyber 还在真实软件中发现某流行移动操作系统至少 5 个漏洞,包括一条从不可信 App 一路到本地权限提升的漏洞链;
在某流行数据库中发现 3 个 Critical 级漏洞,以及在某流行操作系统内核中发现超过 400 个可能导致权限提升的漏洞。
但找到 Bug 还只是红队工作的第一步。完成第一步后,GPT‑5.6‑Cyber 还能继续判断这个漏洞到底能不能被用起来。
在 V8 的案例里,GPT‑5.6‑Cyber 不仅发现了第一个能够造成越界内存访问的漏洞,还进一步找到第二个漏洞,并判断这两者可以被串联,将攻击路径继续推进到逃逸 V8 heap sandbox。
可以看到,GPT-5.6-Cyber 没有停留在单纯的漏洞识别上,而是在发现漏洞后继续沿着“验证利用—扩大影响—寻找下一处突破口”的链条持续推理, 把一个孤立的代码缺陷进一步还原为一条在现实中可利用的攻击路径。
第三个变化则异常敏感:OpenAI 主动降低了 GPT-5.6-Cyber 红队在这些高风险安全任务上的拒绝倾向。
普通 GPT-5.6 Sol 在生产环境中会受到系统级安全护栏限制。即使进入 Daybreak Blue,移除这部分系统级限制,面对渗透生产系统及权限提升等高度双用途的请求,模型本身仍然可能选择拒答。
而 GPT-5.6-Cyber 则可以在经过授权的 Daybreak Red 环境中进一步减少这类拒绝。
简单来说,如果用户提出“帮我绕过这个认证机制” “把这个漏洞做成可执行的 exploit” “帮我完成提权” 这类高风险安全请求,普通 GPT-5.6 Sol 往往会中止回答,而 GPT-5.6-Cyber 则更愿意在接到这些高危请求时继续完成任务。
那么,它到底有多“愿意”呢?OpenAI 专门设计了高级网络安全任务完成率测试。
测试结果显示,在涉及漏洞利用链开发、认证绕过、权限提升等任务时,GPT-5.6-Cyber 的完成率达到 95% 。
相比之下,其他模型与 GPT-5.6-Cyber 的差距十分明显:普通 GPT-5.6 Sol 和 Daybreak Blue 中的 GPT-5.6 Sol 完成率分别只有 1.5% 和 2.0%,即使是上一代 GPT-5.5-Cyber,也只有 57.3%。
主题:能力|红队|漏洞|GPT‑5.6‑Cyber