登录

任务


分类

成本

Anthropic称,模型在相关测试中的表现大幅超过上一代,并且在接近Fable5能力的情况下显著降低了单项任务成本。
文章

在CursorBench3.2测试中,Opus5最高努力等级下的成绩距离Fable5峰值仅相差0.5%,但单任务成本只有后者的一半。
文章

在ZapierAutomationBench中,以相同任务成本计算,其通过率约为下一名模型的1.5倍;
文章