登录

任务


分类

进行测试

在使用真实Cursor编程会话任务进行测试的CursorBench上,Sonnet5.5的最佳成绩与Opus5.5相差约2分以内。
文章

成本

Anthropic展示了各模型在不同effort设置下的得分及对应的单项任务成本。
文章

在FrontierCode上,采用Higheffort设置的Sonnet5.5,比相同设置下的Sonnet5高出10分,单项任务成本却只有后者的约十五分之一。
文章

在多项基准测试中,采用Low或Mediumeffort设置的Sonnet5.5,能够以约十分之一的单项任务成本,超过Sonnet5的最佳成绩。
文章

在较低的effort设置下,Sonnet5.5的单项任务成本更低,也最能与Opus5.5形成互补。
文章

随着effort提高,模型通常会花更长时间完成任务,因此单项任务成本更高,得分通常也会提高。
文章