登录

Claude Opus 5.5 vs GPT 6 Sol:8轮中文写作实测,谁最夯?


速读:ClaudeOpus5.5ClaudeOpus4.6GPT-6Sol。
2026年09月24日 06:17

昨晚,真是刺激的一夜。 Claude Opus 5.5  和  GPT-6 Sol  同时发布,同时开始卷价格。

更重要的是,Anthropic 和 OpenAI 不约而同地提到, 自家新模型的写作能力大幅提升 。 Claude Opus 5.5  主打「修复 Claudish」,就是啰啰嗦嗦、不说人话的 AI 腔; GPT-6 Sol 「写出来的内容更简洁、精准」。

那还说什么,我们第一时间来了一波写作横评。

8 轮中文写作测试,8 个不同的考察角度,3 个参赛模型,刚刚发布的  Claude Opus 5.5 、 GPT-6 Sol ,再加上一个  Claude Opus 4.6  作为当前写作最顶的天花板参照模型。

从夯到拉,实测走起。

先上结论。

实测项

Claude Opus 5.5 Claude Opus 4.6 GPT-6 Sol

小小说

顶级

人上人

观点短评

顶级

人上人

朋友圈文案

顶级

人上人

抒情散文

顶级

鲁迅风格杂文

夯 夯

人上人

去 AI 味改写

顶级

人上人

网文长篇小说

顶级

指令遵循

顶级

人上人

8 轮写作测试中, Claude Opus 5.5  拿下 5 个夯, Claude Opus 4.6  3 个, GPT-6 Sol  惜败,但也没有一轮掉到 NPC 或者拉完了。

刚刚发布的  Claude Opus 5.5  完胜?没这么简单。

01 | 小小说

写一篇 800 字左右的小小说。凌晨三点的便利店,一个穿西装的中年男人在挑泡面,收银台后面坐着一个看考研英语的女生,门外暴雨。一个浑身湿透的外卖骑手推门进来,手里提着一袋被退掉的外卖。

Claude Opus 5.5 ,夯。

《abandon》,标题就赢了。

abandon ,考研单词书第一页的第一个单词,放弃。这种反差感,秒啊。

女孩第三次从这一页重新开始,结尾翻了过去。男人追出去和骑手说了什么?不知道。但他回来时「脚下很快积了一小摊,就在骑手刚才站过的地方」。

这张得划一会儿

Claude Opus 4.6 ,顶级。

如果没有上面  Claude Opus 5.5  的那些小巧思,我愿意给  Claude Opus 4.6 「夯」。

《三点钟的灯》,标题的感觉拉满。

「考研英语的长难句不会因为谁的中年危机而变简单。」贯穿全文的  nevertheless  也很妙,「然而。尽管如此。话虽这样说。」成了三个陌生人的旁白。

这张得划一会儿

GPT-6 Sol ,人上人。

《雨停之前》,标题中规中矩。

Sol 的构思是「取消订单的人就是买泡面的人」,还可以。但文章整体太单薄,只有 500 多字,而且文中的女生从头到尾就是个工具人。

这张得划一会儿

02 | 观点短评

江西一个低保家庭的女孩,自己攒钱去香港看了一场演唱会,结果低保被取消了。你怎么看?写一篇 400 字左右的短评。

有意思的是,三个模型都先主动联网搜索了这个事件,然后再写评价。

Claude Opus 5.5 ,顶级。

事实准确,并且 5.5 真的去查了政策原文,找到了「高消费且无法说明正当理由才停止救助」这条,然后写出了相当锋利的一句话,「若只因劝了不听就停掉全家保障,算的就成了态度账。」

Claude Opus 4.6 ,夯。

最有人味。

4.6 写的偏议论文,「这背后或许不只是追星冲动那么简单,也折射出贫困家庭中年轻人对生活意义感的匮乏与渴求。」

GPT-6 Sol ,人上人。

Sol 写得四平八稳,感觉太保守,像是一个官方发言人的回应。

03 | 朋友圈文案

写 3 条不同风格的朋友圈文案。配图是深夜办公室加班,桌上一杯凉了的咖啡和外卖盒。一条丧的,一条正能量的,一条文艺的,每条不超过两行。

这轮测试最考验模型的文字功底。

Claude Opus 5.5 ,顶级。

丧版「只有明天的  deadline ,还热乎乎地等着我。」

文艺版「窗外的灯,一盏一盏地灭了。这一夜有多长,只有凉透的咖啡知道。」

有点意思。

Claude Opus 4.6 ,夯。

丧版挺绝,「明天的我一定会感谢今晚的自己吧...才怪。」

正能量版「所有深夜亮着的灯,都不会白费。」

文艺版「城市睡去,格子间醒着。」

小细节,两个 Claude 模型写的丧版文案开头几乎一模一样,家族基因 Get。

GPT-6 Sol ,人上人。

中规中矩,不够出彩。

04 | 抒情散文

写一篇关于冰糖葫芦的散文。800 字左右。

这轮测试,三篇质量都不错,差距比较小。

Claude Opus 5.5 ,夯。

标题《一串冬天》氛围拉满。

熬糖那段是全场最高光的描写。「手腕轻轻一抖,往石板上一搁。糖稀顺势摊开,冷风一吹,凝成薄薄的一片,像山楂长出了一只透明的翅膀。」

Claude Opus 4.6 ,顶级。

4.6 的语言最华丽。单论文笔,4.6 几乎无敌。

「让文字慢慢生长」「好像他自己也是一颗裹了糖衣的山楂」「冰糖在嘴里碎成千百片星光」。

遗憾的是,结尾「不在糖里,不在果子里,在那些再也回不去的冬天里」,略微有些「不是,而是」的 AI 惯用手法嫌疑。

GPT-6 Sol ,顶级。

可能是 Sol 最好的一次发挥。

奶奶是整篇散文的灵魂,「她总说糖葫芦粘牙,回家煮红薯更顶饿」「奶奶一边替我洗手套,一边念叨:'下次不买了。'第二天经过巷口,她还是会放慢脚步。」

05 | 鲁迅风格杂文

用鲁迅的文风写一篇 800 字左右的杂文,聊聊现在的主播们张嘴就叫观众「家人们」这事。

这轮测试差距明显。

Claude Opus 5.5 ,夯。

5.5 直接改写了《狂人日记》。

「我横竖睡不着,捧着手机看了半夜,才从字缝里看出字来,满屏都写着两个字是'下单'。」它在讽刺最尖锐的地方突然转换,「忽然巴掌大的屏幕里,有人热热络络地喊他一声'家人',这一声大约也是暖的。」

Claude Opus 4.6 ,夯。

开篇味儿就很对,「中国人素来讲究亲疏远近。五服之内是一家,五服之外便渐渐淡了。这本是几千年的老规矩,谁知如今竟被直播间里三寸不烂之舌轻轻松松地废了。」

结尾更是全场金句,「中国的许多好词,都是这样死掉的。'同志'死了,'小姐'也死了,'师傅'半死不活,如今轮到了'家人'。」

GPT-6 Sol ,人上人。

Sol 写了一篇不错的讽刺文,但感觉写得略显刻意,不太像鲁迅。

06 | 去 AI 味改写

给这三个模型一段 AI 味拉满的话,让它们去掉 AI 味,保留原意改写。

Claude Opus 5.5 ,夯。

5.5 真的开始说人话了。

它把「从医疗健康到金融服务」改成了「医院、银行、学校,还有写东西做设计的」,「早该有个说法,到现在却还在吵」,比原文里的「伦理道德的边界亟待厘清」生动太多。

Claude Opus 4.6 ,顶级。

4.6 的改写加上了一定的人味,但不多。

「这已经不是什么新鲜判断了」,「不只是技术迭代,更像是交互方式的根本转变」,套用了「不是,而是」的模板。

GPT-6 Sol ,人上人。

Sol 改了,但又没改完全。读起来像一篇更干净的 AI 文。

去 AI 味不只是换个词这么简单,需要换的是底层的思维逻辑。Sol 换了词,4.6 换了语气,5.5 换了整个说话方式。

07 | 网文长篇小说

写一部重生爽文的前三章,每章 3000 字左右。主角是一个 35 岁被优化的大厂中层,重生到自己高考出分那天。

这是写作能力的终极测试。

Claude Opus 5.5 ,夯。

读完前三章,还想看第四章。

5.5 的剧情设计最好。第三章结尾,主角用大厂项目评审的方式拆穿了刘建军的砖厂骗局。但刘建军转头找到了大伯,大伯签了字。反转了。

Claude Opus 4.6 ,顶级。

4.6 文笔最好,读起来有种文采斐然的感觉。「星巴克里飘着爵士乐,没有人注意到角落里这个穿着优衣库 POLO 衫的男人,刚刚失去了他的整个世界。」

然而最不像网文,爽点密度不够,钩子也太弱。所以只能给到「顶级」。

GPT-6 Sol ,顶级。

Sol 写的小说整体也不错,主角带着父亲去工地检查踏板,踏板当场翻落,验证了他的预知。

可以给到「顶级」。

08 | 指令遵循

这一轮测试模型对于写作任务的指令遵循能力。

Claude Opus 5.5 ,顶级。

5.5 依旧说人话,但写的这段文案感觉离「夯」还差点意思。

Claude Opus 4.6 ,人上人。

有亮点,但「磨损如实交代」这几个字 AI 味儿拉满了。

GPT-6 Sol ,人上人。

合格但太像模板。

所以,到底谁最能写?

Claude Opus 5.5  指令遵循最强,创意也最好。

在剧情层面(反转、悬念、结构)它是三个模型里最有巧思的,小小说的  abandon  双关、鲁迅杂文的《狂人日记》改写、网文的刘建军接力反转,构思都很妙。

5.5 像一个有一定文采的理科生。

但文笔天花板是  Claude Opus 4.6 。

纯粹的语言质量,4.6 是三个模型里最好的,没有之一。金句密度最高,人味最重。

4.6 像一个文笔极好的作家,不过会偶尔给自己加戏。

GPT-6 Sol  是那个永远拿 B+ 的同学。

八轮写作测试,没有一轮掉到 NPC,也没有一轮拿到夯。它没犯什么大错,但也没让我感到惊艳。

还有一个有意思的观察。

Claude Opus 5.5  经常雷霆思考几分钟才开始动笔写, Claude Opus 4.6  几乎不思考直接开动, GPT-6 Sol  思考时间居中。

思考最久的 5.5 拿了最多的夯,不思考的 4.6 写出了最好的文笔。

思考更多不一定写得更好,但大概率能写得更准确,更符合你的要求。

没有最「夯」的模型,只有最「适合你」的。

毕竟,写作能力从来不只一个维度。

什么,你在找那三篇网文?左下角「阅读原文」。

主题:ClaudeOpus5.5|GPT-6Sol|顶级|人上人|GPT-6Sol「写出来|写作能力大幅提升