鉅亨網新聞中心
人工智慧(AI)生成內容的辨識技術再進一步。Anthropic近日首次公開說明Claude文字浮水印的技術細節,最新一批Claude模型已內建相關機制,舊版模型也將陸續適配。這項技術的核心,是在模型生成文字時調整選詞所使用的隨機機制,讓文字表面上與一般輸出沒有明顯差異,但持有密鑰的一方可以進一步驗證其中是否存在浮水印訊號。
Anthropic表示,這項機制不會刻意改變Claude生成文字的品質。Google過去也曾以Gemini進行A/B測試,比較有無浮水印的使用者回饋,結果顯示兩組在使用者評分上的差異並不顯著。
Anthropic此次公開的技術,也凸顯AI文字浮水印與一般AI內容偵測工具的差異。傳統AI偵測器主要依靠文字風格及語言特徵判斷內容是否由AI生成,而浮水印則透過預先植入的訊號進行驗證。
Claude生成文字時,會逐步選擇下一個詞。當多個候選詞的生成機率相近時,模型原本可以透過隨機機制決定最終選項。
Anthropic的做法,是在這個選詞階段調整隨機數產生方式,利用密鑰推導出具有特定規律的數值,取代原本無法預測的隨機數。
因此,從使用者閱讀的角度來看,生成結果不會因此變得明顯不自然,也不會刻意加入特殊詞彙。
然而,掌握密鑰的一方,則可以透過分析文字中的選詞規律,確認其中是否存在浮水印訊號。
這項概念最早可追溯至Scott Aaronson在2022年任職OpenAI期間提出的構想。Google DeepMind後續將相關思路發展為產品級技術SynthID-Text,並於2024年刊登於《自然》雜誌上。
Google也曾利用Gemini進行實際測試,在部分真實使用者身上加入文字浮水印,再與未加入浮水印的使用者進行比較。
結果顯示,兩組使用者在按讚及負評等回饋方面,並未出現具有統計顯著性的差異。
不過,Claude文字浮水印並非任何情況下都能有效辨識AI參與程度。
Anthropic指出,浮水印只會作用於Claude實際「選擇」的詞彙。這意味著,模型擁有較大選詞空間時,浮水印訊號較容易形成;反之,如果文字內容受到高度限制,能夠選擇的詞彙有限,浮水印效果也會受到影響。
翻譯就是其中一個值得注意的案例。
如果使用者提供中文文章,再要求Claude翻譯成英文,由於英文內容主要由Claude重新選詞生成,最終文字可能留下較明顯的浮水印訊號。
然而,文章原本的觀點與內容仍來自使用者,浮水印本身卻無法進一步區分文字究竟是由Claude從頭創作,還是僅協助使用者完成翻譯。
程式碼也存在類似問題。由於程式碼許多部分需要精確輸出,模型可自由選擇的空間相對有限,因此浮水印難以廣泛嵌入。不過,註解及變數命名等具有較大自由度的部分,仍可能留下浮水印。
Anthropic也指出,對短篇文字而言,浮水印同樣可能難以發揮作用。例如只有一、兩百字的電子郵件,由於可選擇的詞彙與表達方式有限,能夠累積的浮水印訊號可能不足。
純粹陳述事實的內容也存在類似限制。當特定事實只能搭配固定詞彙或表述方式時,模型沒有足夠的選詞空間植入明顯訊號。
校對則是另一個更複雜的情境。
如果使用者將一篇長文交給Claude修正錯字,模型只修改其中少數部分,整篇文章的大部分內容仍由使用者原先撰寫。此時,即使修改部分帶有浮水印,也難以據此判斷整篇文章究竟有多少內容由AI產生。
更重要的是,浮水印也無法回答Claude究竟參與到什麼程度。Anthropic承認,相關機制最多只能判斷Claude「可能參與過」某段文字,無法進一步確認究竟是從零生成,還是僅協助修改。
2026年7月一項研究發現,AI文字浮水印可能容易受到後續改寫影響。
研究人員將59篇原本能被檢測出浮水印的文章交由AI釋義工具重新改寫,結果其中58篇在改寫後便無法再檢測出浮水印,比例達98.3%。
也就是說,只要讓另一個AI重新改寫文字,就可能打亂原本藏在Claude選詞規律中的浮水印訊號。
研究顯示,按照當時的服務價格,重新處理一篇約1000字文章的成本約4美分,使移除浮水印的門檻可能相當低。
此外,若Anthropic公開浮水印檢測API,也可能產生新的攻防問題。使用者可以利用API反覆測試修改後的文字,透過「修改→檢測→再修改」的方式,逐步降低浮水印訊號,直到文字不再被辨識。
因此,Anthropic雖已表示檢測API「即將推出」,但目前仍未公布具體技術細節。
Anthropic導入文字浮水印,也與AI生成內容標記的監管要求有關。相關討論涉及歐盟AI法規對AI生成內容標記的要求,而Anthropic的技術則試圖提供一種能夠從文字本身驗證AI參與的方式。
然而,文字能夠被追溯到Claude,並不等於可以確認整篇作品都是由Claude創作。
舉例來說,如果一名作者自行完成文章,再讓Claude進行翻譯、校對或大幅修改,浮水印可能證明Claude曾經參與文字處理,卻無法界定AI究竟參與多少,也無法單憑浮水印判斷原始內容的作者。
Anthropic也強調,浮水印不會改變作品的所有權,也不會改變法律責任的歸屬。
因此,Claude文字浮水印真正能回答的問題,主要是「這段文字是否可能曾經經過Claude處理」,而不是「這段文字究竟是誰的作品」。
隨著AI生成內容大量進入寫作、翻譯及編輯流程,如何區分「AI創作」、「AI協助」與「人類創作」,也將成為文字浮水印技術除了準確率之外,仍需面對的問題。
上一篇
下一篇
