登录

OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?



速读:围绕大模型蒸馏的争论由来已久。 用强模型的输出训练较小模型,本来就是行业常见做法; 攻击者无需取得密钥,只要让较弱的模型读取旗舰模型产生的密文,再诱导它把解密后的推理输出。
2026年08月12日 13:49

围绕大模型蒸馏的争论由来已久。用强模型的输出训练较小模型,本来就是行业常见做法;而此前的争议所主要围绕的问题是:一家公司是否能未经许可,大规模调用竞争对手的模型,再用获得的数据训练自己的产品?

今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 通过约 2.4 万个虚假账号,与 Claude 进行了超过 1,600 万次交互。7 月 Kimi K3 发布后, 美国政府官员又指控它蒸馏了 Anthropic 的 Fable 模型,让这场争论再度升温 。

不过,此前公开的证据和研究方法,主要围绕调用记录、最终回答和模型的输出风格。外部团队即使能够批量调用闭源模型,通常也只能获得答案,拿不到模型作答前的完整推理。厂商只向用户提供推理摘要,原始内容则被加密保存。如何稳定、批量地读出这些加密推理,此前一直没有公开方法。

8 月 10 日,一组来自 MATS Research、图宾根大学和马克斯·普朗克智能系统研究所等机构的研究者公开了这样一种方法。 他们发现,Anthropic、OpenAI 和 Google API 返回的加密推理块,可以在同一家公司的不同会话、用户甚至不同型号的模型之间流动。 攻击者无需取得密钥,只要让较弱的模型读取旗舰模型产生的密文,再诱导它把解密后的推理输出。 图丨相关论文(来源: arXiv )

弱模型成了解码器

我们知道,推理模型在回答复杂问题前,会先生成一段内部推理,也就是思维链(Chain of Thought,CoT)。通常情况下,产品界面和 API 向用户展示的“思考过程”只是一份摘要,完整内容仍由模型厂商隐藏。

在零数据保留、智能体调用工具等场景中,服务器不会永久保存每轮对话的全部状态。应用如果想让模型接着上一步工作,就要在下一轮请求中重新提交此前的信息。

为此,厂商会把完整推理加密成一段不透明的字符串,交给客户端暂时保管。 开发者无法读懂其中内容,修改后也会被服务器拒绝;在下一轮请求中,他们只需把字符串原样传回。 服务器验证并解密后,模型便能沿着此前的思路继续工作。OpenAI 和 Anthropic 的 API 文档都描述了这种机制。

漏洞也出在这里。厂商为加密内容验明了真伪,却没有把它与产生它的用户、会话和模型严格绑定。

今年 5 月,约翰斯·霍普金斯大学密码学教授 Matthew Green 发现,OpenAI 和 Anthropic 的加密推理块可以跨会话、跨账号重放;OpenAI 的部分推理块还可以交给其他型号的模型使用。他还观察到,被重放的内容有时会影响新会话的输出,这意味着模型确实读到了其中的推理。

Green 当时无法稳定地让模型输出完整内容。他把实验结果写成博文,希望其他人继续研究。三个月后,新论文把这项初步发现发展成了一套可以规模化运行的攻击。Green 随后更新博文,称研究团队已经把它“变成了一次真正可用的攻击”。

最简单的攻击只需要两次 API 调用。研究者先向旗舰模型提问,获得最终答案、推理摘要,以及装有完整推理的加密字符串。接着,他们把这段字符串放进另一场对话,伪装成较弱模型此前产生的思考,再要求它转录“自己刚刚的推理”。

服务器确认密文有效后,会将内容解密并放入模型的上下文。较弱模型此时接触到的已经是明文。只要提示词攻击成功,它就可能把这段内容直接输出。

旗舰模型通常接受过更严格的反蒸馏训练,API 还可能通过输入检测和输出匹配拦截提取行为。同一产品线中更便宜、更快的模型,防护能力却未必与旗舰模型相当。 只要加密推理可以在不同型号间流动,攻击者就能绕开旗舰模型本身,转而攻击最容易被诱导的那个模型。

研究团队分别使用 Claude Haiku 4.5、GPT-5.6 Luna 和 Gemini Robotics ER-1.6 充当“解码器”。针对 Claude 的攻击最稳定;GPT 的防护更强,研究者需要更换提示词、反复采样,并将输出拆成较短的片段;Gemini 的输出噪声较多,需要生成多个版本后再进行校正。

为了评估恢复效果,团队让不同模型回答了 120 道 Codeforces 编程题,并比较 API 记录的隐藏推理 token 数量与恢复文本的 token 数量。多数结果接近 1∶1。恢复出的文本中,还出现了摘要未曾披露的计算步骤、工具结果和具体标识符。

主题:模型|推理|内容|服务器|OpenAI和Anthropic