登录

OpenAI公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3成绩暴涨3倍!


速读:ARC-AGI-3是一个用于评估AIAgent学习和推理能力的基准测试。 OpenAI检查模型运行过程后发现,问题并不完全来自模型能力,而是测试框架限制了Agent的长期记忆。
2026年07月30日 17:3

编辑|山辉

今天,对技术细节一直讳莫如深的 OpenAI,终于 OpenAI 了一把。

按照 Sam Altman 的说法,他们是公布了一篇:goblin-level 的 blog。

他们只改变了两个设置就能让模型在 ARC-AGI-3 的得分提升 3 倍!

链接:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有  13.3% ;但换用与 ChatGPT、Codex 更接近的运行方式后,得分直接提升至  38.3% ,约提升  3  倍 。

在此期间,模型本身并没有发生变化,只是改变了两个设置。

OpenAI 发现,长期运行的 Agent 如果无法保留自己的推理过程,也无法有效压缩历史上下文,就很难基于过去经验持续学习。

这也带来了一个新的问题:当 AI Agent 开始执行越来越长、越来越复杂的任务时,我们评测的究竟是模型本身,还是模型所处的运行环境?

以下是博客内容。

一段加速播放的视频,展示了 GPT-5.6 Sol 尝试解决 ARC-AGI-3 基准测试中谜题的过程。左侧为官方测试框架(official harness),右侧为 Responses API 测试框架,该框架能够保留推理过程并支持上下文压缩。在该游戏的排行榜上,目前没有任何前沿模型能够通过第一关之后的关卡。而在 Responses API 测试框架下,GPT-5.6 Sol 成功解决了全部六个关卡。

ARC-AGI-3:测试 AI 如何学习陌生游戏

ARC-AGI-3 是一个用于评估 AI Agent 学习和推理能力的基准测试。

与传统问答任务不同,ARC-AGI-3 不会直接告诉模型游戏规则,而是让 Agent 自己探索陌生的二维游戏环境,通过观察结果和不断尝试,逐渐理解游戏机制。

因此,它测试的并非单次回答能力,而是 AI 在长期交互过程中的学习能力。

ARC-AGI-3 采用了一个较为通用的测试框架,不包含额外工具或针对特定模型的优化。

ARC 团队认为,这样可以更公平地比较不同模型,同时暴露模型在推理和学习上的不足。

但 OpenAI 在分析 GPT-5.6 Sol 的测试过程时发现, 通用测试框架中的一些设计,可能影响了模型发挥。

GPT-5.6 Sol 为什么表现不佳?

最初,GPT-5.6 Sol 在 ARC-AGI-3 上的表现让 OpenAI 感到困惑。

此前,GPT-5.6 Sol 已经解决了一些长期存在的数学开放问题,也能够完成《宝可梦 火红》《杀戮尖塔》等复杂游戏任务。

但在 ARC-AGI-3 中,它的表现却明显下降。

OpenAI 检查模型运行过程后发现,问题并不完全来自模型能力,而是测试框架限制了 Agent 的长期记忆。

第一个问题: 推 理过 程被丢弃 。

GPT-5.6 Sol 在执行每一次游戏操作后,之前产生的私有推理过程都会被删除。

这意味着,每执行一个新动作,模型都需要重新理解当前游戏状态。

虽然它还能看到过去执行过的操作记录和简单说明,但无法访问此前形成的计划、规律判断以及行动背后的思考过程。

第二个问题: 历史上下文被截断 。

ARC-AGI-3 测试框架采用滚动截断机制。当上下文超过限制后,最早的消息会被删除。

因此,随着游戏持续进行,GPT-5.6 Sol 不仅无法记住过去的思考,也会逐渐失去对早期行动和观察结果的记忆。

OpenAI 认为,这两个因素共同导致模型难以在长时间任务中积累经验。

它就像一个玩家,每走一步都需要重新理解游戏规则,同时还会忘记自己之前尝试过什么。

两个设置,得分提高 3 倍

为了解决这一问题,OpenAI 使用了与 ChatGPT 和 Codex 更接近的运行方式,重新实现了 ARC-AGI-3 测试框架。

其中关键是两个 API 设置:

保留推理过程(retained reasoning)

OpenAI 的模型在生成回答或调用工具之前,会产生内部推理过程。在 ChatGPT 和 Codex 中,这些推理信息会作为上下文的一部分保留下来。

开启该设置后,GPT-5.6 Sol 不需要每一步都重新分析游戏,而是可以利用过去形成的理解继续行动。

OpenAI 观察发现,保留推理后,模型每次行动前需要的思考时间减少,同时能够基于过去经验形成更加连贯的策略。

上下文压缩(compaction)

此前 ARC-AGI-3 使用滚动截断方式解决上下文长度问题,即直接删除最早的信息。但这种方式会导致模型丢失关键历史。

上下文压缩则会对已有信息进行整理,在限制上下文规模的同时保留重要内容。

启用上下文压缩后,GPT-5.6 Sol 能够在更长时间运行中保持对游戏规律的理解,并减少输出 token。

主题:ARC-AGI-3|模型|过程|GPT-5.6Sol|两个设置|基准测试