登录

AI写的字,开始自带“暗号”


速读:这项技术不改动文字与标点符号,而是在模型生成文本的过程中,植入肉眼看不见的统计信号,机器可据此识别文本是否出自OpenAI模型。 论文第一作者、宾夕法尼亚大学博士后研究员李翔(将于2027年1月加入罗格斯大学统计系任助理教授)在接受《中国科学报》专访时表示,textGrain标志着文本水印技术走出实验室、迈入大规模产品应用,但这项技术存在明确能力边界,水印只能作为溯源核查线索,不能直接判定一段文本中AI生成内容与人类创作内容各自的占比。 大模型生成文本,会从备选词汇中做概率采样,概率越高的词,被选中的可能性越大。 已有方法也曾尝试保留采样随机性,但不同强度参数不容易直接说明消耗了多少生成自由。 “最优传输原本是求解资源调配的数学方法,在这里被用来调配词语的生成概率。
作者:樊晓丽 来源:中国科学报 发布时间:2026/10/11 21:12:0

AI写的字,开始自带“暗号”

——OpenAI发布textGrain文本水印,检测器暂不向公众开放

当地时间10月5日,OpenAI正式发布textGrain熵校准文本水印技术,同步公开同名技术论文《textGrain:Entropy-Calibrated Watermarking for Language Model Text》。这项技术不改动文字与标点符号,而是在模型生成文本的过程中,植入肉眼看不见的统计信号,机器可据此识别文本是否出自OpenAI模型。

根据OpenAI公布的产品部署方案,欧盟地区ChatGPT、Codex将默认启用水印;全球API接口交由企业自主选择是否开启。目前,水印检测器不对普通公众开放,只供通过资质审核的科研人员、专业机构申请使用。

论文第一作者、宾夕法尼亚大学博士后研究员李翔(将于2027年1月加入罗格斯大学统计系任助理教授)在接受《中国科学报》专访时表示,textGrain标志着文本水印技术走出实验室、迈入大规模产品应用,但这项技术存在明确能力边界,水印只能作为溯源核查线索,不能直接判定一段文本中AI生成内容与人类创作内容各自的占比。

合规驱动:AI文本溯源走向产品化部署

textGrain的推出,源于欧盟《人工智能法案》第五十条第2款规定。该条款要求,生成合成音频、图像、视频或文本内容的人工智能系统提供者,应确保其输出以机器可读的格式进行标记,并可被检测为人工生成或操纵。该透明度义务自2026年8月2日起实施。

按照OpenAI部署方案,未来数周内,欧盟境内符合条件的ChatGPT、Codex文本输出默认植入隐形水印。OpenAI还将联合云合作伙伴,让通过云平台调用其模型的企业也可使用该功能。

论文通讯作者、OpenAI研究员苏炜杰在个人社交平台X透露,textGrain水印算法后续将开源,供全球科研社区迭代优化。

在检测端,OpenAI设置了严格准入门槛。检测器仅反馈是否检出OpenAI水印,不会追溯使用者身份,也不会泄露提示词、对话记录等隐私信息。

实际上,在此之前,文本水印已有多年研究和产品实践。Google已将SynthID-Text用于Gemini,Anthropic也公布了采用这一方法的安排。“此次OpenAI发布textGrain,进一步推动了文本水印在主要模型产品中的应用。”李翔说。

不靠特殊字符:统计学如何让AI文本“留痕”

不少人认为,文本水印就是在文字里藏空格、插特殊符号。但textGrain并非如此:它不改动文字本身,而是在大模型选词采样的生成环节,植入一套看不见的统计倾向。

大模型生成文本,会从备选词汇中做概率采样,概率越高的词,被选中的可能性越大。textGrain利用密钥,结合上下文生成一套只有机器可识别的伪随机规则,适度引导模型的选词偏好。

李翔用“今天天气很___”举例解释其原理:假设模型原本各有一半机会输出“暖和”和“寒冷”。在一个简化例子中,两类密钥数量相同:一类让“暖和”有七成机会出现,另一类让它只有三成机会。把所有密钥放在一起看,两个词仍各占一半,这就是平均意义下的“无偏”。但固定某把密钥后,选词概率已经改变,因此还需要控制模型剩下多少抽样自由。

这套技术思路并非textGrain首创。但过去部分水印方案在密钥和上下文固定后,选词可能完全确定,从而限制重复生成的多样性。已有方法也曾尝试保留采样随机性,但不同强度参数不容易直接说明消耗了多少生成自由。增强水印信号,通常需要更强地影响模型抽样,导致可能减少文本生成的自由。textGrain的突破,正是用熵衡量这份代价,并通过预算明确控制。

“最优传输原本是求解资源调配的数学方法,在这里被用来调配词语的生成概率。密钥制造的统计倾向,人阅读完全感知不到,但算法检测器能够捕捉。”李翔解释说。这套技术只修改采样逻辑,和模型预训练相互独立,理论上适配各类语种。但他提醒,中文词表、语言习惯、信息统计特征和英文差异不小,算法框架虽可复用,但英文环境调试得到的参数不能直接迁移至中文场景,需要重新调校熵预算等核心参数。

OpenAI实测显示,启用水印的前沿模型Astra,在多组权威基准测试条件下,未出现具备实际意义的性能衰减。

现实局限不容忽视:水印只能当线索,不能当“裁判”

实验室理想条件下,textGrain拥有不错的识别效果:在1%目标假阳性率下,以心理学类内容为例,400个词元段落检出率约95%,200个词元约80%。

然而,一旦放到真实应用环境,短板随即凸显。数学、公式推导这类可选表达极少的低自由度内容,检出效果会明显下滑。改写、同义替换对水印的破坏尤其明显:400个token文本,仅替换10%的同义词,检出率就会从92%跌至66%;替换比例达到25%,检出率仅剩17%。

OpenAI官方提示:“理想条件下的强劲表现,并不能保证日常使用中的可靠检测。”检测器存在两类固有错误:一是假阳性,把没有相应水印的文本判定为有水印;二是假阴性,明明带水印却检测不出来。改写、翻译、文本截断,都有可能造成漏检。

此外,官方文件专门划定水印能力的四条清晰边界:水印无法判断一段文字内人类创作与AI加工的占比;不能判定版权归属与法律责任;无法追踪具体使用账号;也无法核实内容事实对错。

也就是说,检出文本携带水印,不代表整篇文本完全由AI生成;未检测到水印,也不能证明文本出自人类之手。这项技术只能提供核查线索,不能充当判定创作主体的裁判。即便只用AI润色修改一两句话,只要经过OpenAI模型输出,就会打上水印。现有 token 级水印技术,无法分辨“AI全权创作”和“人类主导、AI辅助润色”。李翔坦言,当前水印只关注词语和密钥之间的统计关系,并不理解文字背后语义、观点的重要程度,做不到区分二者。

正是出于对误判风险的警惕,OpenAI没有把检测工具向全社会放开。李翔分析,如果无限制开放检测接口,攻击者可以反复提交文本、迭代改写,直到检测不到水印,相当于给“洗水印”提供工具,水印体系就会形同虚设。即便未来扩大访问范围,也必须限定使用主体、调用频次,同时配套完善结果解读规范。

在李翔看来,现阶段textGrain能够发挥的实际作用,主要是防范直接复制粘贴AI生成内容、不加修改对外传播这类粗放滥用行为,面对精心改写加工后的文本则难以奏效。开源之后,攻击和防御的博弈也将长期持续。

对于未来技术演进方向,他认为主要存在两条路径:一是探索语义层级水印,跳出单个词元局限,捕捉行文逻辑结构;二是检测端创新,融合AI文本统计特征,把多套检测信号结合起来提升识别能力。但两条路线均面临不少现实技术难题。

全球治理参考:溯源体系需要多工具协同发力

textGrain作为欧盟监管催生的技术成果,可为我国生成式AI内容溯源工作提供参考样本,但不能简单照搬复制。

目前,我国已建立AI生成内容标识管理制度框架,从显式提示、隐式标识等多个维度,对AI生成内容标识作出明确规范。如《互联网信息服务深度合成管理规定》要求,深度合成服务提供者提供深度合成服务,可能导致公众混淆或者误认的,应当在生成或者编辑的信息内容的合理位置、区域进行显著标识;《人工智能生成合成内容标识办法》明确,服务提供者应当在生成合成内容的文件元数据中添加隐式标识,包括生成合成内容属性信息、服务提供者名称或者编码、内容编号等制作要素信息。

这套隐式标识依托文件自带的元信息实现,和textGrain技术路线完全不同。textGrain是将统计信号嵌入模型token采样的生成环节。二者各有现实短板,却可以互为补充:元数据标识的好处是,即便文本正文被改写,标识依旧可以留存;但如果发生文件复制、格式转换,元信息就很容易丢失。而textGrain这类统计水印把信号内嵌在文本生成逻辑之中,不怕普通文件格式变动,却很容易被同义改写、转述破坏,造成水印信号失效。

国内科研机构也已经开展中文场景下统计型文本水印相关研究,清华大学、北京大学等围绕中文语义特征、水印算法与检测理论进行探索,部分成果已在国内大模型上完成仿真验证。

放眼全球,各大厂商水印方案互不兼容,密钥、算法各自独立,一家的检测器只能识别自家模型产出,跨平台溯源很难实现。行业尚未形成统一技术共识,全球通用标准的落地,还受监管导向、企业合作、隐私安全多重因素制约,暂无明确时间表。

这也提醒教育、媒体等潜在使用场景,水印工具不能直接拿来“断案”。若引入水印检测,应当建立配套规则:检测结果仅仅作为启动人工复核的线索;面向使用者做好科普,破除“检出即AI、未检出即人写”的简单二元思维;对于短文本、数理推导类内容,谨慎使用水印检测手段。

AI生成内容呈爆发式增长,社会迫切希望找到可靠标尺,区分机器生成与人类创作。李翔认为,AI内容溯源不能把全部希望押注在单一技术之上。技术本身存在局限,能否用好技术,离不开制度约束、公众认知和行业共识。

主题:文本水印