登录

Claude 5.5发布,性能直逼Fable,还要卷价格



速读:官方称,它在多数任务上的表现已经达到ClaudeFable5.1水平,相比Opus5的典型任务成本降低40%,输出速度提高超过30%。
2026年09月23日 10:25

九月的新模型像下饺子一样接连登场,却大多只来得及各领风骚一两天,很快又被下一款抢走风头。

就在刚刚,Anthropic 正式发布了 Claude Opus 5.5。这是 Claude 5.5 家族的首款模型,未来几周内还会有 Sonnet 5.5 和 Haiku 5.5 陆续登场。

Opus 5.5 并非一次常规的半代升级。官方称,它在多数任务上的表现已经达到 Claude Fable 5.1 水平,相比 Opus 5 的典型任务成本降低 40%,输出速度提高超过 30%。

半代升级,Opus 性能直逼 Fable

Anthropic 将 Opus 5.5 定位为面向长时间编程 Agent 和知识工作的主力模型。从官方公布的成绩看,它在 Agent 编程、电脑操作和专业工作上都取得了明显提升。

在 Terminal-Bench 4.0 中,Opus 5.5 得分为 66.4%,高于 GPT-6 Astra 的 57.9% 和 Opus 5 的 52.3%;FrontierCode v1.1 得分为 54.4%,略高于 GPT-6 Astra 的 53.3%;CursorBench 4.0 则从 Opus 5 的 46.6% 提高到 57.8%。

面向知识工作的 GDPval-AA v2.1 中,Opus 5.5 得到 1846 Elo,超过 Fable 5.1 的 1735 和 Opus 5 的 1708。在 OSWorld 2.0 电脑操作评测中,它也从 Opus 5 的 74.0% 提高到 81.8%。

优势并没有覆盖所有项目。

Opus 5.5 在 AutomationBench 中得到 40.0%,略低于 GPT-6 Astra 的 41.4%;在 Terminal-Bench-Science 0.1 中得到 58.7%,与 Astra 的 64.6% 仍有差距。

Anthropic 自己也提醒,当前前沿模型之间的榜单差距,已经无法完整反映真实工作中的体验。在公司内部使用中,Opus 5.5 与 Fable 5.1 的差距比部分评测结果看起来更小。

真正能体现此次升级的,是持续数小时甚至十几个小时的长任务。

早期测试者曾用 Opus 5.5 在一天内完成一项涉及 68 万行代码的迁移工作;另一项 20 万行代码库审计只用了不到三小时,而 Opus 5 完成同类任务超过 20 小时,token 消耗约为前者的 2.5 倍。

Anthropic 还让 Opus 5.5 和 Fable 5.1 把 HAProxy 从 C 语言重写为 Rust,两者都通过了绝大多数回归测试,Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本低了 51%。

知识工作方面,在一项季度业绩报告测试中,模型只能从一份较难检索的网页副本中寻找资料,任何虚构数字或引语都会导致失败。Opus 5.5 在不同思考强度下提交的 18 份报告中有 16 份过关,Fable 5.1 和 Opus 5 没有一次达到同一标准。

另一项虚构并购分析要求模型先在 Excel 中建立财务模型,再制作面向管理层的演示文稿。Opus 5.5 与 Opus 5 得出了相同结论,但前者的模型更完整,演示文稿也更清楚,完成时间从 93 分钟缩短到 63 分钟,成本降低一半。

降价之后,Opus 开始成为日常主力

比榜单更容易被用户感知的变化来自价格和速度。

Opus 5.5 的 API 输入和输出价格分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%;缓存读取价格从 0.50 美元降至 0.20 美元,降幅达到 60%。

主题:Opus5.5|Opus5|Opus5.5在|知识工作|半代升级