AI 文本水印的工作原理:为什么轻编辑删不掉它,但重写的工具能

📅 2026/8/16 14:00:13
AI 文本水印的工作原理:为什么轻编辑删不掉它,但重写的工具能
AI 文本水印的工作原理为什么轻编辑删不掉它但重写的工具能文章来源作者: James PadolseyNOPE 创始人declaude.org标题: How AI text watermarking works: a visual guide链接: https://declaude.org/watermarking/日期: 2026 年 8 月配套工具: declaude — AI 文本重写/水印擦除工具James Padolsey 用一篇极高质量的可视化指南完整拆解了 AI 文本水印的工作原理。这篇文章不是学术论文而是一个教学模型——用交互式的投骰子模拟解释了水印为什么藏在词与词之间的选择里而不是藏在字符里。作为配套工具 declaude 的技术说明它同时解释了 declaude 的 full-rewrite 路线为什么能真正擦除这一类水印。核心问题纯文本里怎么藏水印A watermark in plain text sounds impossible. Text has no pixels to hide data in, and no metadata survives copy-and-paste; every character is right there in front of you.但水印确实存在了Google从 2024 年开始给 Gemini app 和 web 体验的文本加水印Anthropic从 2026 年 8 月开始在新 Claude 模型层面标记文本旧模型也将跟进水印不可见、复制粘贴后存活、不改变文本含义或可读性答案水印不在字符里它在词与词之间的选择里。第一步写作是一系列小选择LLM 在写下一个词时不是知道下一个词——它有一个候选列表像 autocomplete每个词有不同的偏好概率。比如 “The results of the study were quite ___”模型有一组候选词significant、notable、remarkable、promising……每个词有不同的概率权重。模型的生成过程本质上是按权重摇骰子。一个页面的文本包含数百个这样的小分叉每个词一个。关键在于在很多分叉点上几个选项同样好。这种slack就是水印的原材料。谁有资格影响骰子的落下方向谁就能在文本中隐藏模式而不改变文本内容。第二步密钥倾斜选择这是经典的 Kirchenbauer et al. 2023 方案Google 的 SynthID 以 tournament 方式达到同样效果在每个分叉点密钥驱动的数学把候选词分成green和red两组。这种分组是任意的只有密钥持有者能复现。然后骰子稍微向 green 倾斜。两个让这个标记隐蔽的特性倾斜是温和的red 词仍然可能赢——只是概率稍微低一点颜色不是词的固定属性密钥从前面的一小段词计算颜色所以同一个候选词在一种前缀后是 green在另一种前缀后是 red也就是说green 的倾向只在整个文本中累积只有密钥持有者知道哪些词在哪里是 green 的。三种水印方案文章提到了三个同源不同实现的水印方案方案作者/机构核心方法Kirchenbauer et al. (2023)UMass AmherstGreen/red 分组 概率倾斜Google SynthIDGoogle微型锦标赛从模型概率中抽取几个候选密钥给它们打分bracket 排列让每个词的平均概率保持模型原始意图Aaronson 方案Scott Aaronson / OpenAI直接从密钥导出骰子投掷本身不同的数学相同的原则标记活在选择中。第三步持有密钥的人可以计数检测不读文本不判断风格。检测器用密钥重新着色文本中的每个词简单地数有多少个是 green 的。没有标记或没有正确的密钥green 应该约 50% 赢和抛硬币一样有标记 正确密钥green 出现频率显著高于 50%有标记 错误密钥split 无意义计数在偶然水平这里有一个重要细节检测强度和文本长度成正比。在 50/50 的模型中一个 1,500 词的文档只需要约 55% 的 green 就能 flag。小倾斜只有通过长度才能变得有说服力这就是为什么短文本确实很难判定。第四步编辑对标记的影响这是最关键的一步也是 declaude 的核心价值所在。每个词的颜色是从它前面的一小段词计算出来的1 到几个词取决于方案。所以一个位置只有在一小段原始措辞保持完整时才算作证据。文章展示了五个编辑深度下的标记存活情况编辑深度效果标记存活Fix typos修正拼写错误几乎全部存活Light touch轻微润色大量存活Tighten sentences收紧句子部分存活Heavy edit重度编辑显著减少但仍有可观存活Full rewrite完全重写几乎完全消除关键数据来自 MarkLLM 的 KGW 和 EXP 方案在开放模型上的实测经 declaude 的 full-rewrite 路线清洗Full rewrite 后约 0.5% 的 windows 存活检测器准确率从近乎确定AUC 0.99下降到抛硬币水平AUC ≈ 0.5已有文献也同意这个形状在 Kirchenbauer et al. 的实验中即使是人类改写在约 800 个 tokens约 600 个词后也能重新被检测到。这里的核心区别轻编辑稀释标记而不是删除它。真正去除标记的是不共享任何措辞片段的重新创作。这就是为什么从含义重写如 declaude 的 full-rewrite 路线才能真正擦除这一类水印而保留大多数措辞的轻 edit pass 不行。值得注意的边界基于词本身的方案不依赖邻居词same-meaning 的重写保留了足够的词标记大量存活。它们的弱点不同到处复用的颜色可以从足够的输出中被逆向工程隐藏在含义中的水印same-meaning 的重写部分保留它们目前唯一的解法我们已知的是outline-level 的重新生成Anthropic 的生产方案是未公开的所以目前没有人能在 Claude 自己的标记上运行这个测试数学模型面向专业读者Step 4 的 residual-evidence 模型z ≈ f·√N·z₁f surviving fraction存活的 window 比例N document length文档长度以 tokens 计z₁ per-token strength每个 token 的水印强度这意味着编辑后的有效证据量与存活比例成正比与文本长度的平方根成正比。轻编辑让 f 接近 1full rewrite 让 f 接近 0。第五步实际含义1. 检测是私有的、概率性的、关于处理过而非作者只有密钥持有者可以检查你的老师、编辑或你最喜欢的AI 检测器网站不能运行这个测试。真正的检测需要提供商的秘密密钥或提供商运行的检测服务。Google 运行了 SynthID 的 early-access 检测门户Anthropic 说检测工具即将推出水印检测不是AI 检测器GPTZero 之类的工具从风格猜测著名地不可靠。水印是相反的一种有意的、密钥门控的统计测试发现的标记意味着被处理过不是由……撰写Anthropic 自己的文档指出人类文本仅由 Claude proofread 或翻译就会携带标记缺少标记证明的更少旧模型或重度编辑的文本对真正的 AI 文本产生干净的检测结果2. 短文本和低选择文本携带很少的标记证据随长度增长只有一种正确续写的文本代码、引文、事实列表给骰子太少的 slack 来隐藏任何东西背景为什么现在有了水印这来自EU AI Act Article 50, Part 2Providers of AI systems including general purpose AI systems, generating synthetic audio, image, and text contents, shall ensure that the outputs of the AI system are marked in a machine-readable format and detectable as artificially generated or manipulated.Anthropic 是第二个引入文本水印的主要实验室Google SynthID 在前但效果是全球性的——不论你在美国、英国还是欧盟所有 Claude 生成的文本都携带水印。Anthropic 使用两种互补的标记技术嵌入文本中的水印附加到文件上的签名来源元数据declaude 的实测数据James Padolsey 在自家已知的密钥实现上做了实验结果总结如下水印方案检测效果原始Full rewrite 后存活机制MarkLLM KGWAUC 0.99AUC ≈ 0.5仅 ~0.5% windows 存活MarkLLM EXPAUC 0.99AUC ≈ 0.5仅 ~0.5% windows 存活Context-free unigram—AUC 0.73–0.84基于词本身的颜色same-meaning 重写保留足够词Meaning-space marks—部分存活唯一解法outline-level 重新生成我的理解这篇文章的价值在于它把一篇 ICML 2023 的学术论文翻译成了任何人都能理解的交互式可视化。投骰子的比喻完美地传达了水印的本质不改变文本说什么只改变模型怎么说的概率分布。最关键的理解是关于编辑对水印的影响。大多数人直觉上认为改写一下就没水印了但数学告诉我们轻编辑换同义词、调整语序保留了大部分原始措辞片段 → 标记只是被稀释在足够长的文本后仍可检测真正删除标记的是不共享任何措辞片段的重新创作——从含义出发重建整个表达这就是 declaude 的定位不是同义词替换器而是从含义重写的工具。z ≈ f·√N·z₁ 这个公式很有启发性。它告诉我们三个方向可以攻击水印降低 ffull rewrite——declaude 做的事降低 N短文本输出——但短文本本身就携带很少标记降低 z₁水印强度——但这是提供商决定的还有一个值得注意的矛盾水印检测只能由密钥持有者运行这意味着普通用户无法验证。你的老师、编辑、HR 不能确认文本是否被 Claude 处理过——只有 Anthropic 自己或他们授权的服务可以。这从根本上限制了水印的普及应用场景。水印是合规工具不是反作弊工具。它服务于 EU AI Act 的要求告诉 regulator “这个文本被 AI 处理过”。但它不能告诉你这个文本是 AI 写的——human text 经过 Claude proofread 也会携带标记。absence 也不能证明 innocence。水印是一个单向的门找到标记说明可能被处理过找不到标记什么也不能说明。参考资料https://declaude.org/watermarking/https://declaude.orgKirchenbauer et al., “A Watermark for Large Language Models” (ICML 2023)Dathathri et al., “Scalable Watermarking for Identifying LLM Outputs” (SynthID-Text, Nature 2024)Aaronson Kirchner, “Watermarking GPT outputs” (2022)Kirchenbauer et al., “On the Reliability of Watermarks for Large Language Models” (ICLR 2024)Anthropic: How Claude marks AI-generated contentNOPE founder explains how AI text watermarks surviveEU AI Act Article 50 Part 2