AI 生成的文本被蓋上浮水印的插圖

最近爆出 Anthropic 正在為其 AI 模型的文本輸出加上浮水印,這個消息在社交媒體上引發了激烈的爭論。儘管其文件中沒有明確詳細說明具體方法,但據推測是基於統計性的選詞偏差,旨在經受住複製、貼上甚至後續 AI 校對的考驗。Anthropic 自己也承認這種方法「並非完全可靠」。我們將在後文詳細解釋。

雖然社交網路的反應迅速而猛烈,但主流討論中忽略了幾個關鍵影響。以下是我們對文本浮水印為何是一個從根本上就有缺陷的範式的看法。

Anthropic 並非唯一一家

雖然 Anthropic 目前承受著大部分負面輿論,但它們遠非這一領域的先驅。Google 至少從 2024 年 5 月起就在為其生成的文本加上浮水印(SynthID 論文和 Google 關於在 Gemini 中使用的公告)。OpenAI 同樣聲明,它完全打算在 AI 生成的文本中加入來源訊號,時間就在最近的 2026 年 8 月 2 日(OpenAI 說明中心)。

Google 早在 2 年多前就已實施了這一做法,OpenAI 也僅在 12 天前宣布打算做同樣的事情,而針對 Anthropic 的憤怒卻如此不成比例,這在公共關係角度是一個有趣的研究案例,但它忽略了更大的重點:文本浮水印現在已成為業界普遍做法。我們必須將其評估為一種系統性轉變,而不是針對特定公司。這個問題遠比 Anthropic 目前因此事受到的抨擊要嚴重得多。

版權影響

在美國,完全由 AI 生成的內容無法獲得版權保護,美國版權局在近年來重申了這一立場。然而,使作品可以獲得版權所需的人類參與門檻仍然是一個模糊的法律邊疆。浮水印為這個本已脆弱的等式引入了一個危險的變數。

考慮一下潛在的法律悖論:

  • 校對者困境:如果你寫了一本完全原創的書,但用 AI 來校對和精簡文字,浮水印偵測器可能會將整份手稿標記為 AI 生成。這會剝奪你的版權嗎?
  • 譯者陷阱:如果你手寫了一部小說,但用 AI 將其翻譯成英文呢?翻譯文本的浮水印在理論上可能表明內容 100% 由 AI 生成。英文版會失去智慧財產權保護嗎?
  • 程式設計師的畫布:想像一下,你花了數天時間設計一個應用程式的架構,做出高層設計決策、撰寫提示詞、迭代和測試。你將人類的創造力傾注在邏輯中,但實際的語法是由 AI 撰寫的。如果程式碼被標記為 100% AI 生成,儘管投入了大量人類勞動,你的軟體是否就無法受到保護?

浮水印威脅著用一把寬泛而二元的大筆,將人機協作的作品在法律上抹殺掉。

誤報的危險

Google 和 Anthropic 都承認它們的文本浮水印並非 100% 準確。如果一部完全由人類創作的作品被錯誤地歸類為 AI 生成,舉證責任就不公平地轉移到了創作者身上。

一個人如何證明一個否定命題?作家們現在是否必須錄下自己的螢幕和按鍵,甚至在工作時讓攝影機對著自己,以驗證自己的作者身份?還是只能依賴「相信我,這是我寫的」這種模糊的說法?

誤報尤其危險,因為它們可以被武器化,成為審查或職業破壞的工具。如果惡意行為者想要詆毀一名記者、競爭對手或同事,他們只需將目標的文章通過一系列不同的浮水印偵測器——比如 Anthropic 的、Google 的、OpenAI 的等等——直到不可避免地透過「偵測器選購」得到一個誤報。然後他們可以公開羞辱作者,指控其學術或職業詐欺,讓演算法的虛假權威造成破壞。每個 AI 偵測器都有誤報機率,如果它們都使用不同的方法,那麼每次用不同的偵測器測試同一段文本,誤報的機率都會增加。

實施文本浮水印的公司自己都聲明這種方法不是 100% 準確的,因此浮水印完全沒有資格對其標記的人造成現實世界中的後果。

個人使用者追蹤的後門

目前沒有任何技術限制可以阻止 AI 提供商按使用者實施浮水印。模型可以被調整為以特定的、密碼學上唯一的模式偏置選詞,這種模式與你的使用者帳戶綁定,而不是通用的 Anthropic 或 Gemini 浮水印。

為什麼這是壞事?這將把 AI 文本生成變成一個大規模監控裝置。你在網際網路上發布的任何文本——比如匿名部落格文章、吹哨人投訴、敏感郵件——都可能被擷取、分析,並在數學上追溯到你特定的 AI 帳戶。它剝奪了使用者的匿名權和隱私權,把一個永久的、隱形的指紋交給科技巨頭,藏在我們句子的結構之中。

AI 提供商過去並不迴避分批發布,一個面向世界,一個面向歐盟,甚至在歐盟遵守其法律之前限制歐盟的存取。目前的部署已經在全球範圍內發布,而不僅僅是在歐盟,這一事實表明 AI 提供商自己認為實施這一做法對它們有利。人們必須捫心自問,它們認為替文本加上浮水印有利的理由是什麼。

AI 輸出品質下降

基本的統計邏輯表明,強迫模型遵守浮水印會降低其效能。透過人為地偏置選詞以建立統計上顯著的簽名,你限制了模型的自然詞彙量、表達範圍和可供選擇的選項數量。這一切必然會對模型輸出的品質產生負面影響。我們的觀點是,當必須回答的具體方式受到限制時,創造力和回答品質從未因此提高過。

這不可避免地迫使人們做出權衡:模型品質與浮水印可偵測性之間的取捨。它限制了細微差別。此外,如果一個模型受到浮水印演算法的嚴重約束,它是否會忽略複雜的風格提示(例如,「以 18 世紀海盜的風格寫這個」),因為採用那個人設需要放棄其強制性的統計選詞偏差?

一些研究已經支持浮水印會影響模型品質的觀點(OpenReview、ACL Anthology、OpenReview、arXiv)。

學術誠信的幻覺

教育工作者對學生在論文和考試中使用 AI 作弊感到焦慮是可以理解的。支持者認為浮水印是解決方案。我們強烈反對:由於該方法是機率性的而非絕對的,它在懲罰性的學術環境中沒有立足之地。

一次錯誤的開除就會抵消這項技術提供的任何理論上的好處。此外,它為學生創造了一個卡夫卡式的噩夢,其特徵是巨大的制度性權力失衡。一所大學將一篇論文透過一個不透明的專有 API 執行;電腦說「AI 生成」。學生沒有任何追索權,無法稽核黑箱演算法,也無法為自己辯護,只能懇求機構「再執行一次」。它用演算法教條取代了教育信任。

打擊假訊息:無意義的論點

浮水印可以打擊垃圾訊息、假草根行銷和網路釣魚的論點忽略了一個基本現實:使用 AI 作為協作寫作夥伴正迅速成為全球預設做法。許多專業人士和學生已經使用 AI 進行腦力激盪、翻譯和起草;在未來幾年內,不使用某種形式的 AI 輔助進行寫作很可能成為例外而非常規。

如果幾乎所有發布的文本都包含一定程度的 AI 協作,那麼偵測 AI 浮水印就變得完全毫無意義。這讓人想起歷史上對拼字檢查器和計算機會「讓社會變笨」的恐慌——一個早已被駁倒的論點。打擊假訊息的真正戰場是驗證發布文本的是真人還是自動化機器人農場,而不是糾結於文本本身是否部分由 AI 生成。

「模型崩潰」謬論

一些人認為浮水印是必要的,這樣 AI 公司就可以在訓練未來模型時過濾掉合成文本,防止「模型崩潰」。

然而,這種方法缺乏細微差別。透過深度人機協作生成的文本是新穎、高品質的資料,應該用於訓練。透過盲目過濾掉任何帶浮水印的內容,AI 公司將使下一代模型失去寶貴的人類指導內容。相反,AI 訓練公司應該評估作品的新穎性和文本的實際效用,而不是依賴粗糙的浮水印來查看 AI 是否在某個時候接觸過文本。

軍備競賽已經開始,誠實的人將付出代價

以下是使整個努力淪為安全表演的核心失敗模式:浮水印移除是一個可解決的對抗性問題,而最有動機解決它的人恰恰是系統試圖抓住的人。

統計文本浮水印透過推動選詞機率來起作用。因此,可以像測試任何其他分類器一樣對它進行測試。任何有動機去除浮水印的人——比如抄襲工廠、假訊息農場或垃圾郵件發送者——都可以將其輸出透過公共偵測器執行,調整措辭,透過無浮水印的開源 LLM 進行改寫,並迭代直到文本被登記為「乾淨」。

這不是推測;這正是我們在抄襲檢查器和電子郵件垃圾過濾器中看到的貓捉老鼠動態。一個利潤豐厚的「AI 人性化」工具家庭手工業已經為此唯一目的而存在。

因此,這些偵測器實際抓住的人並不是惡意行為者。它們抓住的是誠實的使用者:那個只用 AI 修改文法的學生,那個向 AI 徵求回饋然後重寫段落的作者,或者因語言困難而依賴 AI 翻譯的人。這些使用者不會把他們的作品透過五種不同的規避工具執行,因為他們並沒有試圖隱藏任何東西。

一個假陰性群體是「任何積極試圖規避它的人」、假陽性群體是「任何懶得隱藏的人」的偵測系統在結構上是破碎的。它篩掉了誠實,卻給不誠實開了綠燈。

結論

替 AI 文本加浮水印是對複雜社會變遷打上的一個粗糙、表面的補丁。以目前的形式,它威脅著降低 AI 輸出的品質,攪渾版權法的水,為使用者追蹤製造巨大的漏洞,並實質性地傷害那些作品被錯誤標記為 AI 生成的人。最糟糕的是,它對誠實、透明的使用者起到了陷阱的作用,卻完全無法阻止它表面上旨在挫敗的惡意行為者。更糟的是,它正在加速一件已經在進行的事情:社會正在進入一個圍繞 AI 使用的新獵巫時代,不喜歡某人的作品越來越意味著拿「這是女巫AI 生成的」說事,而不是就事論事地評價寫作本身。我們必須在原始工具如浮水印進一步固化這種心態之前超越它們。