Claude Opus 5.5 vs GPT 6 Sol:8轮中文写作实测,谁最夯?
昨晚,真是刺激的一夜。 Claude Opus 5.5 和 GPT-6 Sol 同时发布,同时开始卷价格。
更重要的是,Anthropic 和 OpenAI 不约而同地提到, 自家新模型的写作能力大幅提升 。 Claude Opus 5.5 主打「修复 Claudish」,就是啰啰嗦嗦、不说人话的 AI 腔; GPT-6 Sol 「写出来的内容更简洁、精准」。
那还说什么,我们第一时间来了一波写作横评。
8 轮中文写作测试,8 个不同的考察角度,3 个参赛模型,刚刚发布的 Claude Opus 5.5 、 GPT-6 Sol ,再加上一个 Claude Opus 4.6 作为当前写作最顶的天花板参照模型。
从夯到拉,实测走起。
先上结论。
实测项
Claude Opus 5.5 Claude Opus 4.6 GPT-6 Sol
小小说
夯
顶级
人上人
观点短评
顶级
夯
人上人
朋友圈文案
顶级
夯
人上人
抒情散文
夯
顶级
鲁迅风格杂文
夯 夯
人上人
去 AI 味改写
夯
顶级
人上人
网文长篇小说
夯
顶级
指令遵循
顶级
人上人
8 轮写作测试中, Claude Opus 5.5 拿下 5 个夯, Claude Opus 4.6 3 个, GPT-6 Sol 惜败,但也没有一轮掉到 NPC 或者拉完了。
刚刚发布的 Claude Opus 5.5 完胜?没这么简单。
01 | 小小说
写一篇 800 字左右的小小说。凌晨三点的便利店,一个穿西装的中年男人在挑泡面,收银台后面坐着一个看考研英语的女生,门外暴雨。一个浑身湿透的外卖骑手推门进来,手里提着一袋被退掉的外卖。
Claude Opus 5.5 ,夯。
《abandon》,标题就赢了。
abandon ,考研单词书第一页的第一个单词,放弃。这种反差感,秒啊。
女孩第三次从这一页重新开始,结尾翻了过去。男人追出去和骑手说了什么?不知道。但他回来时「脚下很快积了一小摊,就在骑手刚才站过的地方」。
这张得划一会儿
Claude Opus 4.6 ,顶级。
如果没有上面 Claude Opus 5.5 的那些小巧思,我愿意给 Claude Opus 4.6 「夯」。
《三点钟的灯》,标题的感觉拉满。
「考研英语的长难句不会因为谁的中年危机而变简单。」贯穿全文的 nevertheless 也很妙,「然而。尽管如此。话虽这样说。」成了三个陌生人的旁白。
这张得划一会儿
GPT-6 Sol ,人上人。
《雨停之前》,标题中规中矩。
Sol 的构思是「取消订单的人就是买泡面的人」,还可以。但文章整体太单薄,只有 500 多字,而且文中的女生从头到尾就是个工具人。
这张得划一会儿
02 | 观点短评
江西一个低保家庭的女孩,自己攒钱去香港看了一场演唱会,结果低保被取消了。你怎么看?写一篇 400 字左右的短评。
有意思的是,三个模型都先主动联网搜索了这个事件,然后再写评价。
Claude Opus 5.5 ,顶级。
事实准确,并且 5.5 真的去查了政策原文,找到了「高消费且无法说明正当理由才停止救助」这条,然后写出了相当锋利的一句话,「若只因劝了不听就停掉全家保障,算的就成了态度账。」
Claude Opus 4.6 ,夯。
最有人味。
4.6 写的偏议论文,「这背后或许不只是追星冲动那么简单,也折射出贫困家庭中年轻人对生活意义感的匮乏与渴求。」
GPT-6 Sol ,人上人。
Sol 写得四平八稳,感觉太保守,像是一个官方发言人的回应。
03 | 朋友圈文案
写 3 条不同风格的朋友圈文案。配图是深夜办公室加班,桌上一杯凉了的咖啡和外卖盒。一条丧的,一条正能量的,一条文艺的,每条不超过两行。
这轮测试最考验模型的文字功底。
Claude Opus 5.5 ,顶级。
丧版「只有明天的 deadline ,还热乎乎地等着我。」
文艺版「窗外的灯,一盏一盏地灭了。这一夜有多长,只有凉透的咖啡知道。」
有点意思。
Claude Opus 4.6 ,夯。
丧版挺绝,「明天的我一定会感谢今晚的自己吧...才怪。」
正能量版「所有深夜亮着的灯,都不会白费。」
文艺版「城市睡去,格子间醒着。」
小细节,两个 Claude 模型写的丧版文案开头几乎一模一样,家族基因 Get。
GPT-6 Sol ,人上人。
中规中矩,不够出彩。
04 | 抒情散文
写一篇关于冰糖葫芦的散文。800 字左右。
这轮测试,三篇质量都不错,差距比较小。
Claude Opus 5.5 ,夯。
标题《一串冬天》氛围拉满。
熬糖那段是全场最高光的描写。「手腕轻轻一抖,往石板上一搁。糖稀顺势摊开,冷风一吹,凝成薄薄的一片,像山楂长出了一只透明的翅膀。」
Claude Opus 4.6 ,顶级。
4.6 的语言最华丽。单论文笔,4.6 几乎无敌。
「让文字慢慢生长」「好像他自己也是一颗裹了糖衣的山楂」「冰糖在嘴里碎成千百片星光」。
遗憾的是,结尾「不在糖里,不在果子里,在那些再也回不去的冬天里」,略微有些「不是,而是」的 AI 惯用手法嫌疑。
GPT-6 Sol ,顶级。
可能是 Sol 最好的一次发挥。
奶奶是整篇散文的灵魂,「她总说糖葫芦粘牙,回家煮红薯更顶饿」「奶奶一边替我洗手套,一边念叨:'下次不买了。'第二天经过巷口,她还是会放慢脚步。」
05 | 鲁迅风格杂文
用鲁迅的文风写一篇 800 字左右的杂文,聊聊现在的主播们张嘴就叫观众「家人们」这事。
这轮测试差距明显。
Claude Opus 5.5 ,夯。
5.5 直接改写了《狂人日记》。
「我横竖睡不着,捧着手机看了半夜,才从字缝里看出字来,满屏都写着两个字是'下单'。」它在讽刺最尖锐的地方突然转换,「忽然巴掌大的屏幕里,有人热热络络地喊他一声'家人',这一声大约也是暖的。」
Claude Opus 4.6 ,夯。
开篇味儿就很对,「中国人素来讲究亲疏远近。五服之内是一家,五服之外便渐渐淡了。这本是几千年的老规矩,谁知如今竟被直播间里三寸不烂之舌轻轻松松地废了。」
结尾更是全场金句,「中国的许多好词,都是这样死掉的。'同志'死了,'小姐'也死了,'师傅'半死不活,如今轮到了'家人'。」
GPT-6 Sol ,人上人。
Sol 写了一篇不错的讽刺文,但感觉写得略显刻意,不太像鲁迅。
06 | 去 AI 味改写
给这三个模型一段 AI 味拉满的话,让它们去掉 AI 味,保留原意改写。
Claude Opus 5.5 ,夯。
5.5 真的开始说人话了。
它把「从医疗健康到金融服务」改成了「医院、银行、学校,还有写东西做设计的」,「早该有个说法,到现在却还在吵」,比原文里的「伦理道德的边界亟待厘清」生动太多。
Claude Opus 4.6 ,顶级。
4.6 的改写加上了一定的人味,但不多。
「这已经不是什么新鲜判断了」,「不只是技术迭代,更像是交互方式的根本转变」,套用了「不是,而是」的模板。
GPT-6 Sol ,人上人。
Sol 改了,但又没改完全。读起来像一篇更干净的 AI 文。
去 AI 味不只是换个词这么简单,需要换的是底层的思维逻辑。Sol 换了词,4.6 换了语气,5.5 换了整个说话方式。
07 | 网文长篇小说
写一部重生爽文的前三章,每章 3000 字左右。主角是一个 35 岁被优化的大厂中层,重生到自己高考出分那天。
这是写作能力的终极测试。
Claude Opus 5.5 ,夯。
读完前三章,还想看第四章。
5.5 的剧情设计最好。第三章结尾,主角用大厂项目评审的方式拆穿了刘建军的砖厂骗局。但刘建军转头找到了大伯,大伯签了字。反转了。
Claude Opus 4.6 ,顶级。
4.6 文笔最好,读起来有种文采斐然的感觉。「星巴克里飘着爵士乐,没有人注意到角落里这个穿着优衣库 POLO 衫的男人,刚刚失去了他的整个世界。」
然而最不像网文,爽点密度不够,钩子也太弱。所以只能给到「顶级」。
GPT-6 Sol ,顶级。
Sol 写的小说整体也不错,主角带着父亲去工地检查踏板,踏板当场翻落,验证了他的预知。
可以给到「顶级」。
08 | 指令遵循
这一轮测试模型对于写作任务的指令遵循能力。
Claude Opus 5.5 ,顶级。
5.5 依旧说人话,但写的这段文案感觉离「夯」还差点意思。
Claude Opus 4.6 ,人上人。
有亮点,但「磨损如实交代」这几个字 AI 味儿拉满了。
GPT-6 Sol ,人上人。
合格但太像模板。
—
所以,到底谁最能写?
Claude Opus 5.5 指令遵循最强,创意也最好。
在剧情层面(反转、悬念、结构)它是三个模型里最有巧思的,小小说的 abandon 双关、鲁迅杂文的《狂人日记》改写、网文的刘建军接力反转,构思都很妙。
5.5 像一个有一定文采的理科生。
但文笔天花板是 Claude Opus 4.6 。
纯粹的语言质量,4.6 是三个模型里最好的,没有之一。金句密度最高,人味最重。
4.6 像一个文笔极好的作家,不过会偶尔给自己加戏。
GPT-6 Sol 是那个永远拿 B+ 的同学。
八轮写作测试,没有一轮掉到 NPC,也没有一轮拿到夯。它没犯什么大错,但也没让我感到惊艳。
还有一个有意思的观察。
Claude Opus 5.5 经常雷霆思考几分钟才开始动笔写, Claude Opus 4.6 几乎不思考直接开动, GPT-6 Sol 思考时间居中。
思考最久的 5.5 拿了最多的夯,不思考的 4.6 写出了最好的文笔。
思考更多不一定写得更好,但大概率能写得更准确,更符合你的要求。
没有最「夯」的模型,只有最「适合你」的。
毕竟,写作能力从来不只一个维度。
什么,你在找那三篇网文?左下角「阅读原文」。