登录

OpenAI多次修改GPT-6 Astra基准测试数据,部分成绩一度大幅变化


速读:与此同时,Astra的前代模型GPT-5.6Sol的幻觉率也从12.2%降至9.4%。
2026年09月06日 14:46

IT之家 9 月 6 日消息,据 Fortune 报道,OpenAI 自当地时间 9 月 3 日下午首次发布 GPT-6 Astra 模型公告以来,已经多次修改其中的评测基准数据。一些更新后的数据显示,Astra 的表现有所提升,而 OpenAI 最大竞争对手 Anthropic 旗下模型的部分成绩则出现下调。

这些变化发生在一次颇为反常的公告发布过程中。

据IT之家了解,OpenAI 最初计划在美国东部时间 9 月 3 日下午 2 点发布博客文章,但又过了近两个小时,文章才终于能够在网上被大多数用户正常访问。

当地时间下午 3 点 32 分,OpenAI 官方 X 账号发布博客链接,但页面无法正常打开,访问者会看到错误提示。下午 3 点 50 分,OpenAI CEO 萨姆・奥尔特曼(Sam Altman)也发布了链接,并写道:“我们在部署博客文章时遇到了一点小问题,但它真的非常棒。”

不过,当时仍有多名用户表示无法打开页面。大约一小时后,页面才终于能够正常访问。

事实证明,OpenAI 实际上在下午 2 点过后不久就发布了这篇博客,但随后又将其撤下。OpenAI 表示无法披露撤稿的具体原因,但强调此事与基准测试成绩无关。

OpenAI 最初解释称,问题源于内容管理系统的故障,随后又表示是互联网中断所致。

然而,当博客重新上线后,其中的多项评测数据已经发生变化,而且部分数据此后仍在继续调整。一些更新后的指标似乎让 Astra 的表现更加突出。

这一事件发生之际,人工智能行业正处于激烈竞争之中。各家公司以极快的速度更新大语言模型,都希望在能力上领先竞争对手。围绕这些指标的争议,也再次凸显出一个长期存在的问题:如何利用标准化基准测试准确衡量大语言模型的能力,以及这些测试成绩是否容易被人为优化甚至“刷分”。

OpenAI 发言人表示:“我们非常重视评测结果的准确性。由于具体使用的模型检查点、测试框架和评测运行方式不同,大多数评测结果本身都会存在几个百分点范围内的波动。对于发布公告中的数据,我们进行了修正,以确保这些数字能够代表我们对模型可用性能的最佳估计,让用户能够进行有意义的比较。”

最引人关注的变化之一,是 Astra 的幻觉率。

根据互联网档案中保存的一份页面快照,在美国东部时间 9 月 3 日下午 2 点 23 分发布的最初版本中,Astra 的幻觉率为 4.2%。之后的多份页面快照中,这一数字都没有变化,直到下午 3 点 11 分的第五份快照仍然如此。

大约 10 分钟后,OpenAI 才在 X 上发布了最终版本的博客链接。

但在下午 5 点 20 分保存的第六份网页快照中,也就是页面基本已经能够被公众正常访问之后,Astra 的幻觉率以及另外四项指标发生了变化。Astra 的幻觉率从 4.2% 直接降至 2%,几乎减半。

与此同时,Astra 的前代模型 GPT-5.6 Sol 的幻觉率也从 12.2% 降至 9.4%。

不过,OpenAI 此后仍在继续修改这一指标。截至本文撰写时,Astra 和 GPT-5.6 Sol 的幻觉率又分别回到了最初的 4.2% 和 12.2%。

OpenAI 似乎还大幅提高了 GPT-5.6 Sol 在其内部 ExploitBench 网络安全评测中的成绩,从最初版本的 5.5% 提高到后续版本中的 11.5%。

OpenAI 表示,公司目前正在研究是否将这一数字恢复至 5.5%,因为 11.5% 的成绩对应的是 GPT-5.6 Sol 当前并未向商业用户提供的推理能力等级。

OpenAI 在公告开头重点强调,Astra 在数学能力方面表现尤其出色。

从网页快照来看,Astra 在 FrontierMath Tier 4(v2)评测中的成绩始终保持在 97.6%,并没有发生变化。但 OpenAI 曾短暂修改 GPT-5.6 Sol 和 Anthropic 最新模型 Fable 5.1 的成绩。

这些调整一度让 Astra 看起来明显领先于另外两款模型。

在 9 月 3 日下午 2 点 23 分保存的首份网页快照中,Anthropic Fable 5.1 在该数学评测中的成绩为 87.8%。到下午 5 点 17 分,这一成绩下降近 10 个百分点至 78%。截至目前,该成绩又回升至 83%。

GPT-5.6 Sol 的成绩也经历了类似变化,从 83% 下降至 80.5%,随后又恢复至目前的 83%。

这些数据调整甚至早于 OpenAI 下午 2 点首次发布博客之前。

OpenAI 此前向媒体提供的一份受发布禁令限制的预发布草稿显示,Astra 在 ARC-AGI-3 评测中的成绩为 98.6%。而在目前公开的博客中,这一数字已经变成 99.99%。

OpenAI 当时回应称:“我们始终会在正式发布前验证评测结果,因此草稿与最终版本之间出现调整是正常的。”

OpenAI 还指出,该基准测试的创建方 Arc Prize Foundation 在独立评估中发现,如果为 Astra 配备一套特别强大的测试工具框架,也就是让模型能够调用更多工具完成任务,Astra 的成绩可以达到 99.9%。

而在使用该基准测试的标准工具框架时,Astra 的成绩为 63%。尽管如此,这一成绩仍明显领先于目前所有公开发布的其他 AI 模型。

OpenAI 表示,测试工具框架、推理等级以及其他因素都会影响最终的评测结果。

主题:发布|变化|幻觉率