实测Opus 5.5:一句提示词造出100个网页,还会做动画谱曲
编辑|山辉、杨文
Opus 5.5 发布后,网友都抢着试用。
一刷就是好几个作品,从网页、动画到游戏等等。这些都比 benchmark 的数值直观,有的还能自己上手试试。
一位名为 MiaAI Lab 的创作者直接让 Opus 5.5「做 100 个 HTML 文件」,附带三条要求:好看、设计不要重复、充分发挥创意。做出来的成品十分惊人。
https://x.com/MiaAI_lab/status/2102490829306634560 还真别说,每个点开都像模像样的。同一个模型对不同交互形式和视觉风格,有非常多元化的处理。
这个案例里,Opus 5.5 从开放要求出发,自己决定做哪些作品,并且写出页面结构、CSS 和交互代码。从创意构思、任务拆解到成品制作,Opus 5.5 展现了很强的自主性。
给模型一个开放的总目标,它来自己规划步骤,并把任务完整交出来。
这正好是 Anthropic 这次强烈推荐的用法。
一次交代整件事,真的能做完?
Anthropic 在 Opus 5.5 使用指南开头就给出建议:一次交代完整任务,说清楚什么算「做完」,以及遇到什么情况需要停下来问用户,然后让模型自己工作。
指南链接:https://claude.dev/blog/getting-the-most-out-of-opus-5-5/
指南举的例子是迁移支付接口。
交代任务之外,最重要的就是写明完成标准:所有接口都使用新客户端,旧客户端被删除,测试通过。只有碰到无法解释的测试失败时,模型才需要停下来询问。这样的要求给了模型自行推进的空间,也给最终交付留下了可核对的标准。
其实这个建议在 Opus5 发布时就提过。这次 Anthropic 特意强调的是,Opus 5.5 更能在长时间、多步骤的任务中持续推进。
官方发布材料提到,一位早期测试者让它审查并修复约 20 万行代码,不到三小时完成;同一任务中,Opus 5 花了 20 多个小时。另一项内部测试要求模型把 HAProxy 从 C 改写成 Rust,Opus 5.5 用了 9.5 小时,改写结果通过了几乎全部原项目的回归测试。
不过,工作做了很久,也未必做出了用户最急着要的东西。
科技媒体 Every 在实测中,给了 Opus 5.5 十分钟,为一场客户培训写按分钟安排的日程表。它读完需求,花了将近五分钟思考,又制作训练数据、核对表格、编写学员材料。但时间到了,最需要的日程表却没有交出来。
实测报告:https://every.to/vibe-check/vibe-check-opus-5-5-is-pulling-our-codex-converts-back-to-claude/
Every 的另一次应用开发测试也很说明问题。任务页面看起来很美观,自动检查也显示通过,但测试者实际操作时,核心页面还是报错。
看来想一步到位还是不现实。
干掉破折号,还玩起了音乐、动画
在文字表达方面,Opus 5.5 进步明显,一改此前那种典型的「Claude 腔」。
有网友评价,测试完 Opus 5.5 后最大的感受是写作风格终于「修好了」。
主题:Opus5.5