OpenAI公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3成绩暴涨3倍!
编辑|山辉
今天,对技术细节一直讳莫如深的 OpenAI,终于 OpenAI 了一把。
按照 Sam Altman 的说法,他们是公布了一篇:goblin-level 的 blog。
他们只改变了两个设置就能让模型在 ARC-AGI-3 的得分提升 3 倍!

链接:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有 13.3% ;但换用与 ChatGPT、Codex 更接近的运行方式后,得分直接提升至 38.3% ,约提升 3 倍 。
在此期间,模型本身并没有发生变化,只是改变了两个设置。
OpenAI 发现,长期运行的 Agent 如果无法保留自己的推理过程,也无法有效压缩历史上下文,就很难基于过去经验持续学习。
这也带来了一个新的问题:当 AI Agent 开始执行越来越长、越来越复杂的任务时,我们评测的究竟是模型本身,还是模型所处的运行环境?
以下是博客内容。
一段加速播放的视频,展示了 GPT-5.6 Sol 尝试解决 ARC-AGI-3 基准测试中谜题的过程。左侧为官方测试框架(official harness),右侧为 Responses API 测试框架,该框架能够保留推理过程并支持上下文压缩。在该游戏的排行榜上,目前没有任何前沿模型能够通过第一关之后的关卡。而在 Responses API 测试框架下,GPT-5.6 Sol 成功解决了全部六个关卡。
ARC-AGI-3:测试 AI 如何学习陌生游戏
ARC-AGI-3 是一个用于评估 AI Agent 学习和推理能力的基准测试。
与传统问答任务不同,ARC-AGI-3 不会直接告诉模型游戏规则,而是让 Agent 自己探索陌生的二维游戏环境,通过观察结果和不断尝试,逐渐理解游戏机制。
因此,它测试的并非单次回答能力,而是 AI 在长期交互过程中的学习能力。
ARC-AGI-3 采用了一个较为通用的测试框架,不包含额外工具或针对特定模型的优化。
ARC 团队认为,这样可以更公平地比较不同模型,同时暴露模型在推理和学习上的不足。
但 OpenAI 在分析 GPT-5.6 Sol 的测试过程时发现, 通用测试框架中的一些设计,可能影响了模型发挥。
GPT-5.6 Sol 为什么表现不佳?
最初,GPT-5.6 Sol 在 ARC-AGI-3 上的表现让 OpenAI 感到困惑。
此前,GPT-5.6 Sol 已经解决了一些长期存在的数学开放问题,也能够完成《宝可梦 火红》《杀戮尖塔》等复杂游戏任务。
但在 ARC-AGI-3 中,它的表现却明显下降。
OpenAI 检查模型运行过程后发现,问题并不完全来自模型能力,而是测试框架限制了 Agent 的长期记忆。
第一个问题: 推 理过 程被丢弃 。
GPT-5.6 Sol 在执行每一次游戏操作后,之前产生的私有推理过程都会被删除。
这意味着,每执行一个新动作,模型都需要重新理解当前游戏状态。
虽然它还能看到过去执行过的操作记录和简单说明,但无法访问此前形成的计划、规律判断以及行动背后的思考过程。
第二个问题: 历史上下文被截断 。
ARC-AGI-3 测试框架采用滚动截断机制。当上下文超过限制后,最早的消息会被删除。
因此,随着游戏持续进行,GPT-5.6 Sol 不仅无法记住过去的思考,也会逐渐失去对早期行动和观察结果的记忆。
OpenAI 认为,这两个因素共同导致模型难以在长时间任务中积累经验。
它就像一个玩家,每走一步都需要重新理解游戏规则,同时还会忘记自己之前尝试过什么。
两个设置,得分提高 3 倍
为了解决这一问题,OpenAI 使用了与 ChatGPT 和 Codex 更接近的运行方式,重新实现了 ARC-AGI-3 测试框架。
其中关键是两个 API 设置:
保留推理过程(retained reasoning)
OpenAI 的模型在生成回答或调用工具之前,会产生内部推理过程。在 ChatGPT 和 Codex 中,这些推理信息会作为上下文的一部分保留下来。
开启该设置后,GPT-5.6 Sol 不需要每一步都重新分析游戏,而是可以利用过去形成的理解继续行动。
OpenAI 观察发现,保留推理后,模型每次行动前需要的思考时间减少,同时能够基于过去经验形成更加连贯的策略。
上下文压缩(compaction)
此前 ARC-AGI-3 使用滚动截断方式解决上下文长度问题,即直接删除最早的信息。但这种方式会导致模型丢失关键历史。
上下文压缩则会对已有信息进行整理,在限制上下文规模的同时保留重要内容。
启用上下文压缩后,GPT-5.6 Sol 能够在更长时间运行中保持对游戏规律的理解,并减少输出 token。