最近曝出 Anthropic 正在为其 AI 模型的文本输出添加水印,这一消息在社交媒体上引发了激烈的争论。尽管其文档中没有明确详细说明具体方法,但据推测是基于统计性的选词偏差,旨在经受住复制、粘贴甚至后续 AI 校对的考验。Anthropic 自己也承认这种方法"并非完全可靠"。我们将在后文详细解释。
虽然社交网络的反应迅速而猛烈,但主流讨论中忽略了几个关键影响。以下是我们对文本水印为何是一个从根本上就有缺陷的范式的看法。
Anthropic 并非唯一一家
虽然 Anthropic 目前承受着大部分负面舆论,但它们远非这一领域的先驱。Google 至少从 2024 年 5 月起就在为其生成的文本添加水印(SynthID 论文和 Google 关于在 Gemini 中使用的公告)。OpenAI 同样声明,它完全打算在 AI 生成的文本中加入来源信号,时间就在最近的 2026 年 8 月 2 日(OpenAI 帮助中心)。
Google 早在 2 年多前就已实施了这一做法,OpenAI 也仅在 12 天前宣布打算做同样的事情,而针对 Anthropic 的愤怒却如此不成比例,这在公共关系角度是一个有趣的研究案例,但它忽略了更大的要点:文本水印现在已成为行业普遍做法。我们必须将其评估为一种系统性转变,而不是针对具体公司。这个问题远比 Anthropic 目前因此事受到的抨击要严重得多。
版权影响
在美国,完全由 AI 生成的内容无法获得版权保护,美国版权局在近年来重申了这一立场。然而,使作品可以获得版权所需的人类参与门槛仍然是一个模糊的法律前沿。水印给这个本已脆弱的等式引入了一个危险的变量。
考虑一下潜在的法律悖论:
- 校对者困境:如果你写了一本完全原创的书,但用 AI 来校对和精简文字,水印检测器可能会将整份手稿标记为 AI 生成。这会剥夺你的版权吗?
- 译者陷阱:如果你手写了一部小说,但用 AI 将其翻译成英文呢?翻译文本的水印在理论上可能表明内容 100% 由 AI 生成。英文版会失去知识产权保护吗?
- 程序员的画布:想象一下,你花了数天时间设计一个应用程序的架构,做出高层设计决策、编写提示词、迭代和测试。你将人类的创造力倾注在逻辑中,但实际的语法是由 AI 编写的。如果代码被标记为 100% AI 生成,尽管投入了大量人类劳动,你的软件是否就无法受到保护?
水印威胁着用一把宽泛而二元的大笔,将人机协作的作品在法律上涂抹掉。
误报的危险
Google 和 Anthropic 都承认它们的文本水印并非 100% 准确。如果一部完全由人类创作的作品被错误地归类为 AI 生成,举证责任就不公平地转移到了创作者身上。
一个人如何证明一个否定命题?作家们现在是否必须录下自己的屏幕和击键,甚至在工作时让摄像头对着自己,以验证自己的作者身份?还是只能依赖"相信我,这是我写的"这种模糊的说法?
误报尤其危险,因为它们可以被武器化,成为审查或职业破坏的工具。如果恶意行为者想要诋毁一名记者、竞争对手或同事,他们只需将目标的文章通过一系列不同的水印检测器——比如 Anthropic 的、Google 的、OpenAI 的等等——直到不可避免地通过"检测器选购"得到一个误报。然后他们可以公开羞辱作者,指控其学术或职业欺诈,让算法的虚假权威造成破坏。每个 AI 检测器都有误报概率,如果它们都使用不同的方法,那么每次用不同的检测器测试同一段文本,误报的概率都会增加。
实施文本水印的公司自己都声明这种方法不是 100% 准确的,因此水印完全没有资格对其标记的人造成现实世界中的后果。
个人用户追踪的后门
目前没有任何技术限制可以阻止 AI 提供商按用户实施水印。模型可以被调整为以特定的、加密学上唯一的模式偏置选词,这种模式与你的用户账户绑定,而不是通用的 Anthropic 或 Gemini 水印。
为什么这是坏事?这将把 AI 文本生成变成一个大规模监控装置。你在互联网上发布的任何文本——比如匿名博客文章、举报人投诉、敏感邮件——都可能被抓取、分析,并在数学上追溯到你特定的 AI 账户。它剥夺了用户的匿名权和隐私权,把一个永久的、隐形的指纹交给科技巨头,藏在我们句子的结构之中。
AI 提供商过去并不回避分批发布,一个面向世界,一个面向欧盟,甚至在欧盟遵守其法律之前限制欧盟的访问。当前的部署已经在全球范围内发布,而不仅仅是在欧盟,这一事实表明 AI 提供商自己认为实施这一做法对它们有利。人们必须扪心自问,它们认为给文本添加水印有利的理由是什么。
AI 输出质量下降
基本的统计逻辑表明,强迫模型遵守水印会降低其性能。通过人为地偏置选词以创建统计上显著的签名,你限制了模型的自然词汇量、表达范围和可供选择的选项数量。这一切必然会对模型输出的质量产生负面影响。我们的观点是,当必须回答的具体方式受到限制时,创造力和回答质量从未因此提高过。
这不可避免地迫使人们做出权衡:模型质量与水印可检测性之间的取舍。它限制了细微差别。此外,如果一个模型受到水印算法的严重约束,它是否会忽略复杂的风格提示(例如,"以 18 世纪海盗的风格写这个"),因为采用那个人设需要放弃其强制性的统计选词偏差?
一些研究已经支持水印会影响模型质量的观点(OpenReview、ACL Anthology、OpenReview、arXiv)。
学术诚信的幻觉
教育工作者对学生在论文和考试中使用 AI 作弊感到焦虑是可以理解的。支持者认为水印是解决方案。我们强烈反对:由于该方法是概率性的而非绝对的,它在惩罚性的学术环境中没有立足之地。
一次错误的开除就会抵消这项技术提供的任何理论上的好处。此外,它为学生创造了一个卡夫卡式的噩梦,其特征是巨大的制度性权力失衡。一所大学将一篇论文通过一个不透明的专有 API 运行;计算机说"AI 生成"。学生没有任何追索权,无法审计黑箱算法,也无法为自己辩护,只能恳求机构"再运行一次"。它用算法教条取代了教育信任。
打击虚假信息:无意义的论点
水印可以打击垃圾信息、水军和钓鱼攻击的论点忽略了一个基本现实:使用 AI 作为协作写作伙伴正迅速成为全球默认做法。许多专业人士和学生已经使用 AI 进行头脑风暴、翻译和起草;在未来几年内,不使用某种形式的 AI 辅助进行写作很可能成为例外而非常规。
如果几乎所有发布的文本都包含一定程度的 AI 协作,那么检测 AI 水印就变得完全毫无意义。这让人想起历史上对拼写检查器和计算器会"让社会变笨"的恐慌——一个早已被驳倒的论点。打击虚假信息的真正战场是验证发布文本的是真人还是自动化机器人农场,而不是纠结于文本本身是否部分由 AI 生成。
"模型崩溃"谬论
一些人认为水印是必要的,这样 AI 公司就可以在训练未来模型时过滤掉合成文本,防止"模型崩溃"。
然而,这种方法缺乏细微差别。通过深度人机协作生成的文本是新颖、高质量的数据,应该用于训练。通过盲目过滤掉任何带水印的内容,AI 公司将使下一代模型失去宝贵的人类指导内容。相反,AI 训练公司应该评估作品的新颖性和文本的实际效用,而不是依赖粗糙的水印来查看 AI 是否在某个时候接触过文本。
军备竞赛已经开始,诚实的人将付出代价
以下是使整个努力沦为安全表演的核心失败模式:水印移除是一个可解决的对抗性问题,而最有动机解决它的人恰恰是系统试图抓住的人。
统计文本水印通过推动选词概率来起作用。因此,可以像测试任何其他分类器一样对它进行测试。任何有动机去除水印的人——比如抄袭工厂、虚假信息农场或垃圾邮件发送者——都可以将其输出通过公共检测器运行,调整措辞,通过无水印的开源 LLM 进行改写,并迭代直到文本被登记为"干净"。
这不是推测;这正是我们在抄袭检查器和电子邮件垃圾过滤器中看到的猫鼠游戏动态。一个利润丰厚的"AI 人性化"工具家庭手工业已经为此唯一目的而存在。
因此,这些检测器实际抓住的人并不是恶意行为者。它们抓住的是诚实的用户:那个只用 AI 修改语法的学生,那个向 AI 征求反馈然后重写段落的作者,或者因语言困难而依赖 AI 翻译的人。这些用户不会把他们的作品通过五种不同的规避工具运行,因为他们并没有试图隐藏任何东西。
一个假阴性群体是"任何积极试图规避它的人"、假阳性群体是"任何懒得隐藏的人"的检测系统在结构上是破碎的。它筛掉了诚实,却给不诚实开了绿灯。
结论
给 AI 文本加水印是对复杂社会变迁打上的一个粗糙、表面的补丁。以目前的形式,它威胁着降低 AI 输出的质量,搅浑版权法的水,为用户追踪制造巨大的漏洞,并实质性地伤害那些作品被错误标记为 AI 生成的人。最糟糕的是,它对诚实、透明的用户起到了陷阱的作用,却完全无法阻止它表面上旨在挫败的恶意行为者。更糟的是,它正在加速一件已经在进行的事情:社会正在进入一个围绕 AI 使用的新猎巫时代,不喜欢某人的作品越来越意味着拿"这是女巫AI 生成的"说事,而不是就事论事地评价写作本身。我们必须在原始工具如水印进一步固化这种心态之前超越它们。



