Anthropic、OpenAI同夜上新:Opus 5.5多项性能超过Astra,GPT
Anthropic、OpenAI同夜上新:Opus 5.5多项性能超过Astra,GPT-6 Sol赢在价格
2026年09月23日 08:18
北京时间 9 月 23 日凌晨,不少 Codex 用户还守在 X 上刷新 Tibo 的主页。这位 OpenAI Codex 负责人(Thibault Sottiaux)前一天发帖说,快到周二了,他答应过周二给大家重置额度,“但还有一些别的东西”。
结果没想到,“一些别的东西”居然来得如此猝不及防, 凌晨 12 点半前后,Anthropic 先发布了 Claude Opus 5.5;大约 90 分钟后,北京时间凌晨 2 点,OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna。
Tibo 的帖子随后才到,他宣布给所有 Plus、Pro 和 Business 用户的账户里存入一次重置,可以自己挑时间用。巧的是,Anthropic 这边也给订阅用户发了一次可以存着用的重置,有效期到 10 月 22 日。 一夜之间,本来只等一次重置的开发者,收到了三个新模型和两次重置。
把 Astra 的能力放进更低的价格
我们先从 OpenAI 说起。GPT-6 Astra 发布后,OpenAI 很快补上了这一代产品线的两个低价版本。
Sol 面向复杂编码和智能体工作流,Luna 面向明确、高频、大规模的任务。 两者都支持约 105 万 token 的上下文窗口、12.8 万 token 的最大输出,并提供从 none 到 max 的多档推理强度。
价格变化是本次发布最大的重点。 GPT-6 Sol 的 API 输入、输出价格分别为每百万 token 2 美元和 10 美元,较 GPT-5.6 Sol 的促销价格均下降一半。Luna 的输入价格从 0.2 美元降至 0.1 美元,输出价格从 1.2 美元降至 0.5 美元。缓存输入的价格分别只有 0.2 美元和 0.01 美元。
(来源:OpenAI) 这决定了两款模型的角色。Sol 并不追求在每项测试中超过 Astra,它负责把接近前沿的能力送进高频生产环境;Luna 则把价格压到可以大量并发、反复尝试和充当子智能体的水平。
在 AutomationBench 1.0.6 上,GPT-6 Sol 以 xhigh 推理强度取得 33.2% 的任务完成率,每项任务平均花费 0.27 美元。Claude Opus 5 在 max 档的完成率为 26.9%,成本约为 Sol 的 11.1 倍。Sol 甚至超过了低推理强度下的 GPT-6 Astra,后者得分 30.3%,每项任务成本约为 Sol 的 3.9 倍。
这项测试包含销售、营销、运营、客服、财务和人力资源等工作流。模型需要调用 47 种工具,在多个应用之间寻找信息、修改数据并完成操作。测试只检查最终环境状态,模型声称“已经完成”并不能得分。
编码测试延续了相同方向。 GPT-6 Sol 在 DeepSWE 1.1 上取得 68.8%,距离 Claude Fable 5 的最高成绩只有 1.1 个百分点,每项任务成本低约 80%。 GPT-6 Luna 得分 66.6%,接近中等推理强度下的 Opus 5 和 Fable 5,成本分别低约 93% 和 96%。
在 OSWorld 2.0 的离线计算机操作测试中,GPT-6 Sol 取得 60.5%,Claude Opus 5 为 60.3%;OpenAI 称前者每项任务的成本低约 80%。这些结果更适合说明成本曲线的移动,而非证明 Sol 已在峰值能力上超过所有旧模型,因为不同推理档位对应的 token 消耗并不相同。
Luna 的位置更特殊。它的单次调用价格只有 Sol 的二十分之一,却在部分高推理强度测试中接近上一代旗舰。单个 Luna 当然无法替代 Astra,但由多个 Luna 负责搜索、分类、检查和并行探索,再由 Sol 或 Astra 汇总的系统,可能比全程调用旗舰模型更便宜。
新一代模型的单位,也因此从“一次回答”逐渐变成“一项完成的工作”。
Opus 5.5 把旗舰能力带回 Opus
Anthropic 对 Opus 5.5 的定位更靠近性能端。
这是 Claude 5.5 系列的第一款模型。 Anthropic 称,它在大多数工作中达到 Fable 5.1 的水平,同时比 Opus 5 更快、更便宜。 其上下文窗口为 100 万 token,最大输出为 12.8 万 token;输入和输出价格分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%。
除了token 单价,Opus 5.5 完成任务时使用的 token 和工具调用也有所减少,缓存读取价格从每百万 token 0.5 美元降至 0.2 美元。Anthropic 据此估算,典型工作负载的整体成本下降约 40%,输出速度则提升超过 30%。
性能提升集中在长时间运行的编码智能体和知识工作。
在 Terminal-Bench 4.0 上,Opus 5.5 得分 66.4%,高于 Fable 5.1 的 55.8%、Opus 5 的 52.3%和 GPT-6 Astra 的 57.9%。 在衡量代码修改能否真正合并进项目的 FrontierCode 1.1 上,Opus 5.5 得分 54.4%,GPT-6 Astra 为 53.3%,GPT-5.6 Sol 为 47.5%。