2026年8月起,Claude等主流大模型开始给AI生成的文本悄悄嵌入肉眼完全看不见的“隐形水印”,这段文字是从哪个模型流出的,机器一测便知,而这套原理的核心,是藏在文字概率选择里的“统计学指纹”。
一、核心原理:在选词概率中嵌入“统计学指纹”
机制本质:大模型每次生成下一个词时都会在候选词中做概率选择。带水印的模型会通过一个只有厂商掌握的“绿名单/红名单”密钥,微调同义词的选中概率,让输出在统计分布上偏离自然概率。
检测方式:检测工具不需要阅读语义,只需还原密钥、统计“绿词”占比,就能判断这段文字是否由特定AI生成。对人类来说,这些词汇替换完全无感,但统计学上几乎不可能是人类随机写出的。
两层设计:以Claude为例,第一层是内嵌于文本本身的统计水印,随复制粘贴传播;第二层是为PNG、JPG等文件附加符合C2PA标准的数字签名元数据,标明文件经AI处理。
二、两种主流技术路线并存
概率分布水印(SynthID-Text):Google DeepMind在2024年发布的方案,Claude新模型沿用这一路线,通过在生成时按照密钥预设模式略微偏向某些Token,保留文本质量的同时实现高检测精度。
零宽字符注入:在文本中插入肉眼不可见、但计算机可读的特殊Unicode字符,形成加密标签。实现简单,但容易被正则匹配等工具清理。
三、检测的边界与局限
检测结果只是概率:检测到标记仅说明内容“可能经过Claude处理”,不能确认Claude就是原作者,因为用户常借助AI做校对、翻译、摘要等。
编辑可能抹去水印:大量改写、翻译、混合其他内容,都可能让水印失效;反过来说,未检测到水印也不能证明内容一定非AI生成。