登录

以后让Claude写的东西可能要小心留暗底了



速读:按照Anthropic的说法,当支持水印的Claude在生成文字的时候,会直接把一个人眼无法察觉的水印融到文本里。 只是目前没有任何一种猜测得到Anthropic的确认,这个文本水印到底是怎么打上的,还得等它自己揭晓。
2026年08月12日 06:37

我重生了,回到了那个为了降重,把中文翻成英文,英文翻成罗马尼亚语,再兜兜转转翻回中文的年代。

只不过这一次,我的对手不是知网。

而是 Claude。

就在昨天,Anthropic 更新了一则官方说明: 8 月 2 日之后发布的 Claude 新模型,会支持一种机器可读的内容标记,生成的文本会被嵌入水印。(8 月 2 号之前发布的旧模型,会有一段过渡期)

以后 Claude 生成的每一段文字,都会带着一个你肉眼看不见的水印。

这事儿本来是 Anthropic 为了应付欧盟的招儿,但没想到,全世界的 Claude 用户都因此被无差别对待了。

而且,但凡你用上了 Claude 的地方,从 Claude、Claude Platform (API)、Claude Code、Cowork,到 AWS、Google Cloud、Microsoft Foundry 上调用的 Claude,都在水印的覆盖范围里。

反正消息一出,网上立马就炸锅了。

外国老哥直接开嘲讽,暗骂 Anthropic 不要脸。

还有人已经在考虑咱们的国产模型了。

当然也有人觉得这个水印能推动 AI 治理,是好事一桩。

至于乐子人,不表态纯玩梗,说所谓的水印可能压根就没什么高科技,而是Claude的那些口癖。

都不用检测器查,多看两眼都能闻到味儿了。

但更有意思的还是咱们务实的国内网友,水印有没有意义先放一边,当务之急是先琢磨怎么去掉。

复制粘贴行不行?截图呢?丢给另一个模型改写一遍?实在不行,翻译成七八种语言再倒腾回来?

先说一点,那些觉得复制粘贴出去,又或者截个图识别文字就可以去除水印的哥们,可以洗洗睡了。

虽然具体的技术原理 Anthropic 暂时还没公布,但基本的作用方式还是给咱们透露了一二。主要就两种, 文本,用嵌入式水印;文件,则是用带数字签名的出处元数据。

先说大家比较关心的文本。

按照 Anthropic 的说法,当支持水印的 Claude 在生成文字的时候,会直接把一个人眼无法察觉的水印融到文本里。

这个水印,不会改变文字的意思、质量和可读性。

因为水印本身就是文本的一部分,所以你把文字复制到 Word、公众号后台,又或者发给别人,水印也会跟着一起过去,即便是经过一些编辑之后,还有可能继续存在。

而且水印是在模型那一层就打上了,甭管哪个产品,只要背后跑的是支持水印的模型,那理论上都会留下水印。

所以网友支的那些招,别说什么复制粘贴、截图识别,你就是原封不动手打一遍,也还是甩不掉。

至于 Claude 到底是怎么把一串看不见的东西塞进文本里的,Anthropic 目前嘴很严,不过类似给文本打水印的手法,在学术界倒不是什么新鲜玩意儿。

过去几年,研究者已经想出了不少给大模型输出的文字偷偷做记号的办法,一条比较经典的路子,就是动模型选词的手脚。

大模型每往外蹦一个 token,背后其实都有一堆候选项。

2023 年发表在 ICML 的一篇论文《A Watermark for Large Language Models》,就提出过一种办法:每生成下一个 token 之前,按照一套秘密规则,把候选 token 临时分成两拨,可以简单理解成“绿名单”和“红名单”,然后在模型生成的时候,稍微偏爱一下绿名单里的词。

单看一两个词当然看不出来,但文本如果写得够长,模型一路下来都更容易选中绿名单里的词,那统计规律就慢慢出来了。

检测器照着这套规则查一遍,看看绿名单里的 token,是不是出现得明显多于正常情况,就能从看似正常的遣词造句里,把水印识别出来。

换句话说,如果“不是...而是...”这种句式,是咱们对 AI 味儿的判断,那统计规律,就是机器才能看得懂的暗号。

像用在 Gemini 上的 SynthID-Text,思路其实也有点类似。

而且,Google DeepMind 后来发表在 Nature 上的论文显示,他们拿 SynthID-Text 做过接近 2000 万次真实交互的线上实验,结果发现水印没有对回复质量产生明显影响。

对咱们来说,模型该怎么说话还是怎么说话,但水印早就已经打上去了。

除此之外,还有一拨研究是把水印往语义层藏。

比如 ICLR 2024 的一项研究,就不再只盯着前面几个 token,而是把前文整体的语义信息也考虑进来。近两年还有研究直接在 embedding 空间、句子语义甚至不同 paraphraser 的表达偏好里编码信号。

说人话就是,不再盯着具体用哪个词,而是用整句话的语义和不同改写方式来藏水印,这种思路,你用简单的同义词替换,一时半会儿还去不掉水印。

所以现在社区里有人猜 Claude 会不会是在 token 概率上做手脚,有人猜是不是通过特定措辞、句式甚至更复杂的语义结构来编码,其实都不是完全没来由。

只是目前没有任何一种猜测得到 Anthropic 的确认,这个文本水印到底是怎么打上的,还得等它自己揭晓。

当然,除了给文字塞水印,Anthropic 还准备了另外一种标记方式。

如果 Claude 生成的是 SVG、PNG、JPG 这类文件,它会在文件里加入带数字签名的“出处元数据”。

主题:水印|生成