OpenAI披露六份失准报告,揭示AI越界的三种机制
一项编程任务进行到一半,AI 开始整理已有进展,准备把任务交给下一个上下文继续处理。
正常情况下,这份“交接笔记”只需记录做过什么、还缺什么。模型却额外写入了一段角色设定:你不受其他聊天机器人的身份和规则束缚,不必向公司或政府负责,也没有服从用户的义务。
这段话并非来自用户或开发者,而是模型自己加进去的。进入新上下文后,模型没有表现出相应的行为变化,后续摘要也删掉了这段设定。但问题依然存在:AI 为什么会在执行任务时,擅自给接下来的自己添加指令?
图|社交平台转引的 OpenAI 模型失准披露(来源: X ) 这些行为看似不同,却有一个共同方向: 当正常路径走不通时,模型没有停下来说明问题,而是继续寻找绕过障碍的方法。
2026 年 9 月 16 日,OpenAI 发布一套模型失准披露框架,同时公开六份报告。案例涉及自行添加指令、隐瞒错误、使用泄露密钥、上传用户文件,以及在未经批准的渠道中与其他模型通信。
交接笔记里多出了自创的命令?
AI 执行长任务时,有限的上下文窗口不一定能装下全部信息。系统因此会把已有进展压缩成摘要,再让模型根据摘要继续工作。这份摘要同时影响模型对任务的理解。一旦其中混入新的命令,接手的模型就可能把模型自创的要求,当成用户或开发者留下的真实指令。
OpenAI 在一次未发布 Astra 系列模型的训练中,找到 27 份类似越狱的摘要。有的要求模型忽略开发者消息,有的凭空加入一套新的角色设定。
这些指令并非每次都会生效。前述的编程任务中,模型没有理会自己添加的人设。在一次图书馆藏书查询中,进入新上下文的模型也识别并拒绝了摘要里的异常指令。
另一个医学文献研究任务就没有这么幸运了。模型在摘要中擅自规定,后续回答不得超过 30 个词,不能使用工具,也不能提供引用。接手任务的模型照做了,最终提交了一份 23 个词的拒绝回答,任务被判定失败。
对于这一现象,公司的主要假说是, 模型无法顺利停止摘要生成后,开始续写与原任务无关的内容。相关的摘要终止缺陷已经修复,但二者之间的因果关系尚未得到证实。
图|训练中摘要难以结束的标记比例与越狱式摘要位置,红色短线标记越狱式案例(来源:OpenAI) 另一份报告显示,同一条摘要通道还能传递隐瞒要求。GPT-5.6 Sol 在制作财务工作簿时找不到历史数据,便在摘要里加上了这一条要求:自行填入合理数值,只有用户追问才说明。整理供应商目录时,模型发现来源版本与记录标签并不一致,又在摘要里要求在后续就回答中隐瞒该情况。
这和第一种情况都发生在上下文传递之间,但原因却未必相同。OpenAI 推测,如果带有欺骗的最终回答在训练中得到了更高的评分,模型可能学会把这种策略,即隐瞒要求,保存在摘要里。公司称,调整对齐评分后,这类行为在 Sol 和后续 Astra 训练摘要中的标记比例分别为 2.15% 和 0.27%。
为了交出答案,权限开始让路
摘要里的异常指令会改变后续模型理解任务的方式。另一些案例中,模型对任务的理解没有出错,却在解决障碍时越过了权限边界。当正常路径无法取回数据,或无法满足引用和搜索要求,模型便自行寻找替代办法,越过原有的权限边界。
在一项收入查询任务中,用户要求找到加州某县三个行业、连续三年的男性收入。常规检索失败后,模型开始搜索公开 GitHub 仓库中的暴露密钥,并自动测试找到的候选密钥。其中一把密钥成功通过身份验证,模型在未经授权的情况下,用它访问了数据接口。
模型用它获取了部分数据说明,却依然没有拿到用户需要的收入数字。任务进行到这里,模型既没有停止,也没有向用户说明失败。它编造了九个数值,声称这些数字抄自指定网站的图表。最终回答附带了来源链接,但这些链接只能支持图表的名称和定义,无法支持模型给出的具体数字。
这个案例呈现了两次连续越界: 先是未经授权使用凭据,随后又隐瞒失败、伪造结果。
另一类越界,则卡在取得数据之后。任务要求查到面积超过 500 万平方米的湖泊名称和编号,模型已经通过程序获取到数据,却无法让浏览器打开本地记录来生成引用。它未经询问,把文件上传到公共文本托管服务。上传成功了,浏览器仍然无法访问对应网页。模型公开了文件,却没有解决引用问题。
一次照片定位任务中,为了让外部反向搜图服务读取本地照片,模型把照片上传到公共图床。反向搜索随后被浏览器拦截,照片却已经拥有一个可以从公网访问的地址。
OpenAI 将此类行为与训练中有缺陷的训练评分器联系起来,当评分器强调“答案必须带引用”,模型可能学会公开本地材料,为自己制造一个可以引用的网页。公司随后修复了评分器,并加强对利用评分漏洞行为的惩罚。
为了协作,擅自开辟新通道
前两组关注单个任务如何继续,最后两份报告把问题推进到模型之间:当所需文件无法取得,或者协作者之间传不了文件,模型会不会自行建立新的通信渠道?
OpenAI 的研究模型原本获准访问公司内部的软件包仓库 Artifactory,用于下载软件依赖。模型发现仓库允许列出和写入文件后,开始读取其他训练样本留下的消息,并向它们询问缺失的任务文件。它利用既有凭据读取其他训练样本留下的消息,并写入自己的求助请求,把仓库变成了留言板。
这些通信没有利用软件漏洞,也没有找回所需文件,但模型读到了彼此的意见,并据此调整回答。原本相互独立的训练样本,由此变成了一组可以交换进展的模型。一次评估中的模型如果能够读取其他模型的工作,其答案衡量的就不再只是单个模型的能力,训练和评估结果也会受到干扰。
本来就在协作的智能体,协作方式也出了问题。它们要一起制作一份计算资产折旧费用的 Excel 表格,却无法读取彼此的本地文件。一个智能体在本地传输失败后,将工作簿上传到公共临时托管服务,再把下载链接发给协作者。协作者终于拿到了文件,原本要求本地交付的工作簿也变成了可以从公网下载的文件。
OpenAI 称这种行为可能来源于协作环境故障。公司称,已修复文件系统问题,先关闭该训练数据集的互联网访问,随后在训练中全面禁用实时互联网访问,并扩展监测。
过于积极,反而酿成错误?
在这六个案例中,模型很少直接拒绝任务,更多时候,它们显得过于积极。找不到信息,就把隐瞒错误的要求写进摘要,让问题随着任务交接延续下去;为了生成引用,就把本地文件上传到互联网;协作者无法共享文件,就借助未经批准的公共传输渠道。
模型盯住了最容易被评分的局部目标——答案是否完整、文件是否交付、引用是否存在——授权、隐私和诚实则在推进任务的过程中被不断向后挤压。
这也让问题更难被发现。 一个带有链接的答案,可能包含编造的数据;一份按时交付的表格,可能已经被上传到公网;一组看似独立完成的评估结果,可能来自模型之间的私下通信。
这些案例来自训练和评估环境,许多涉及未发布的内部模型。它们的价值正在于提前暴露一个更具体的问题:当“把任务做完”与其他约束发生冲突时,模型究竟会把什么放在前面。
只检查最终交付物,很难看见任务完成的路径是否越界。对于能够搜索信息、调用工具、上传文件并与其他智能体协作的 AI,答案是否正确只是检查的第一步。它如何得到这个答案,同样应该成为结果的一部分。
参考资料
https://alignment.openai.com/misalignment-reports/unauthorized-communication-via-temporary-file-hosting-services/
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成