登录

GPT-6 Astra正式发布:性能AGI,贵到要负债


速读:GPT-6Astra正式发布:性能AGI,贵到要负债2026年09月04日08:36爱范儿「欢迎来到AGI时代。 但与此同时,模型的价格也来到了新高度。 屏幕、键盘和鼠标是一套覆盖数十亿台电脑、兼容无数新旧软件的接口。
2026年09月04日 08:36

「欢迎来到 AGI 时代。」

OpenAI 总裁 Greg Brockman 用这句话结束了 GPT-6 Astra 的媒体吹风会。

几个小时前,ChatGPT、Claude 和 Grok 才经历了一次罕见的同时宕机,但短暂故障没有打乱 OpenAI 的发布节奏——

就在刚刚,GPT-6 Astra 正式亮相。

Brockman 对这款模型的评价,甚至超过了 OpenAI 以往任何一次新品发布:

如果几年以后回头追问,AGI 究竟在什么时候诞生,我想答案大概就在这段时间,甚至可能就是这个模型……就我个人而言,我认为我们已经达到了(AGI 水平)。

对于听惯了 AI 公司豪言壮语的人来说,问题也随之而来:Astra 到底做到了什么,足以让 OpenAI 定调说「这是全球最智能、最符合人类意图的模型」?

跑分没有横扫一切,价格倒是登上了顶峰

按照 OpenAI 的说法,Astra 是一次「代际跃迁」,能力提升覆盖电脑操作、软件工程、专业工作、科学和网络安全。

根据官方公布的数据,Astra 在代表「脑力」的研究级数学测试 FrontierMath Tier 4 和科学知识测试 GPQA Diamond 中成绩是 97.6% 和 96%。

而在代表「动手能力」的长程软件工程测试 DeepSWE、CAD 绘制测试 BenchCAD 和漏洞利用能力测试 ExploitBench 中,Astra 也分别做到了 74.1%、95.9% 和 100%。

也就是说,GPT-6 Astra 已经把很多既有测试「刷爆」了。要想完整理解它的能力上限,我们可能需要设计一些新的测试。

但 OpenAI 更倾向于介绍 ARC-AGI-3 的成绩:99.9%。

这是一项高度抽象化的测试,模型要进入一个完全陌生的小游戏世界,不提供任何规则说明和目标,模型必须自己通过互动观察环境的变化,推断出这个世界的「游戏规则」然后规划行动。

在今年 3 月刚公布时,最强的 AI 成绩只有 0.51%,即使是 GPT-5.6 Sol 在默认框架下也只有 7.8%,而现在 Astra 在特设的保留推理+压缩上下文框架下,就做到了和人类完全等同的环境推理满分成绩——这一点会和我们稍后说到的「环境操作」能力紧密相关。

作为最新的超旗舰级模型,Astra 的基本规格自然不会落后:105 万 token 上下文窗口,最高输出 12.8 万 token,知识截止时间为 2026 年 4 月 30 日,支持 low、medium、high、xhigh 和 max 五档推理强度。

但与此同时,模型的价格也来到了新高度。

标准模式下,每百万输入 token 收费 10 美元、输出 50 美元 ;输入超过 27.2 万 token 后,整次请求的输入和缓存价格翻倍,输出价格升至 75 美元。模型依然支持更快给出结果的快速模式,相应地要支付两倍价格。

对比起来,Astra 的输入与输出单价是 5.6 Sol 当前促销价的 2.5 倍,也和 Anthropic 刚发布的 Fable 5.1 相同。

想体验的话,我们可能还得稍微再等几天: Astra 目前率先向小部分可信合作企业开放,ChatGPT 各级会员用户和 API 则会在未来几天里陆续推送使用权限。 另外还有一个涉及最高级网络攻击能力的版本,只会提供给网络防御机构使用。

当然,我们都知道官方口径向来是「报喜不报忧」的,第三方独立机构的测试稍微能给官方叙事降一下温——

在 Artificial Analysis 最常用的通用智能独立测试 Intelligence Index v4.1.1 中,Astra max 的成绩「只有」61 分,和 GPT-5.6 Sol max 持平,低于 Fable 5.1 的 66 分、Opus 5 的 63 分以及 Muse Spark 1.3 的 62 分。

这也和 X 上一些提前获得内测资格的开发者体感相仿:Astra 不是那种在智能上遥遥领先的模型,但它堪称恐怖的环境理解和操作能力弥补了这一点,最终交出的输出结果相当漂亮。

虽然在通用智能测试上不算吃香,可一旦转到 Coding 测试就是另一回事了:

在 Artificial Analysis Coding Agent Index 中,Astra 得到 67 分,距离榜首 Fable 5.1 只差 3 分。与此同时,Astra 体现出了极佳的 token 效率,使用的 token 仅相当于 5.6 Sol max 的三分之一、Opus 5 high 的五分之一。

凭借效率优势,Astra max 完成单项 Coding 任务的成本和 Sol 大致相当。于是,在散点图中我们能看到 Astra 在左上角几乎划出了一个专属「斩杀区」——在相同的价格区间,Astra 目前可以说是「无敌」的。

另外,Astra 的幻觉也明显减少。Artificial Analysis 测得 Astra max 的幻觉率为 51%,远低于 Sol 的 92%,拒答率数据也显示它没有依靠频繁拒绝回答来压低幻觉。

单看综合跑分,很难说 Astra 是什么「独一档」的模型。但 它的关键进步,其实藏在「模型如何使用电脑」这件事上。

为人类设计的界面,Astra 用得比人更好

Astra 的发布宣传片开头,引用了一个 80 年代的早期 AI 演示。当时,人对电脑说「画一个黄色圆圈」,电脑就能照做。

同样的梦想延续到了今天。如今,几个人只是站在投影大屏前,或拿起筷子吃饭,或甩动手里的网球拍, 同时嘴上说出想要做一个完整可玩的 3D 游戏、把商品上架到 eBay,或是编辑照片后放入特定文件夹。

等待片刻,工作就完成了。

复杂的提示词和来回操作修改的过程全部消失,只需要像吃饭时看剧聊天一样,随口说几句话,Astra 就能把工作全部搞定。

这可能是理解 Astra 最好的方式。

OpenAI 还展示了一批更贴近日常工作的案例:

寻找猫咪寄养服务,人类平均需要半小时,Astra 用时 5 分 27 秒;寻找工作从约 5 小时缩短到 2 分 51 秒。它还能预约车管所服务、寻找公寓、填写表格、整理日历、更新 CRM,在 Excel 和 Power BI 中处理数据,在 Blender 中制作模型并进一步转换成 UE5 中的交互场景。

在这些现象的背后,是一种更具冲击力的技术路线——

以前我们希望 AI 使用一套软件或一种服务,通常要先为它开发 API,用 MCP 协议规定可用的外部工具和数据。每多接入一个系统,都要重新处理权限、数据格式和调用逻辑。大量老旧的政务、医疗、保险和企业软件,甚至根本没有合适的 API。

但我们还有另一种已经为人类这种通用智能服务了几十年的接口:GUI。

屏幕、键盘和鼠标是一套覆盖数十亿台电脑、兼容无数新旧软件的接口。模型只要能看懂屏幕、理解当前状态并准确操作,今天仍在使用的软件就可以直接成为它的工具。

Greg Brockman 在吹风会上也谈到了这一点。他认为,AI 行业长期受困于为不同工具逐一编写连接器;当电脑操作能力足够成熟,Agent 就能直接穿梭于表格、表单和网页。

模型开始主动适应人类的软件世界,企业就不必等待整个软件世界先完成一次「AI 化改造」。

衡量 Computer Use 能力的 OSWorld 2.0 基准测试结果也显示,Astra 得分达到 72.6%,高于 Sol 的 65.7%;平均完成一项任务约需 40 分钟,Sol 则需要约 75 分钟。成功率提高约 7 个百分点,耗时减少了约 47%。

效率在这里变得格外重要。GUI 任务往往持续几十分钟,包含数百次观察、判断和操作。每一步都可能产生截图、上下文和推理 token。单次决策节省一点,放进长达几百步的工作流后,差距会被迅速放大。

尽管 Astra 的单 token 价格很高,但极高的 token 效率和更少的试错,可以有效抵消涨价。OpenAI 估算,Astra 最高配置完成一项 DeepSWE 任务的 API 成本比 Sol 低约 57%。

猝不及防地,Astra 的诞生直接改换了旗舰模型的竞争赛道。它不需要追求最高的智能分数,只需要能理解目标、接管现成工具、处理途中出现的意外,就已经可以承担相当大一部分的人类工作。

开启发现和创造的新时代

适应人类现有工具框架的能力,让 Astra 拥有了让所有内测开发者都叹服的实际工程表现。

从已经公开的反馈看,不同于以往很多 AI 只能生成演示,Astra 已经可以在很大程度上一次性做出完整的产品了。

开发者 Flavio Adamo 试着用 Astra 单次生成一个完整的 Minecraft demo。可以说,这是让我这个 MC 老玩家最惊艳的 demo 没有之一。从环境、UI、音效到具体的跳跃挖掘动作和动画效果,都和原版游戏几乎如出一辙,找不出多少 AI 痕迹。

主题:模型|测试|价格