歐盟 AI 法案(EU AI Act)的正式實施,將生成式 AI 的內容的透明度從企業自律推向了法律強制要求。根據該法案第五十條的規定,自 2026 年 8 月 2 日起,所有通用 AI 與生成式 AI 系統的提供者,必須確保其產出的合成內容具有機器可偵測的標記。這意味著 AI 產生的文字、圖像、音訊或影片,必須內嵌某種形式的數位身分證明,以便後端系統能快速辨識該內容是否由 AI 生成,而非人類創作。
為了符合法規,包括 Anthropic、Google、OpenAI 與 Meta 在內的全球頂尖模型廠商,迅速在推理管線中部署了兩類核心技術:針對文字的統計學浮水印,以及針對多媒體內容的加密元數據標準。
針對自然語言生成,目前的技術核心在於統計標記 Token 採樣(Statistical Token-sampling Watermarking)。在大型語言模型生成文字的過程中,模型會根據機率分佈預測下一個 Token(文字片段)。統計浮水印技術並不像傳統做法那樣在文字中插入不可見的 Unicode 字符,因為那會破壞資料管線或導致解析錯誤,而是直接介入自回歸解碼(Autoregressive Decoding)過程。
具體運作方式是將模型的所有詞彙表隨機分為綠色與紅色兩組,分組依據是與前文內容相關的加密金鑰。在生成文字時,系統會對綠色名單中的候選詞給予微小的機率加權(Positive Bias)。這種做法在不影響語義連貫性與推理延遲的情況下,在 Token 序列中嵌入了數學上的特徵簽名。Anthropic 已在其 2026 年 8 月後發布的 Claude 模型中全面部署此機制,且該過程僅在採樣層執行,不涉及用戶身份或對話內容,因此不會增加 API 成本或損害隱私。
在多媒體領域,廠商則採取了 C2PA(內容來源與真實性聯盟)標準。這是一種加密簽名的元數據清單,將內容的來源資訊直接嵌入圖像標頭中。例如 OpenAI 與 Meta 會將 C2PA 元數據與 Google 的 SynthID 像素浮水印結合使用,確保即使圖像經過部分裁剪或修改,依然能透過加密驗證追溯其 AI 生成的屬性。
然而,法律的強制執行立即觸發了開發者社群的對抗反應。在政策生效後短短數小時內,開源社群便出現了自動化清除工具。這些工具能快速移除 C2PA、EXIF 或 XMP 等元數據,並透過局部改寫(Localised Rewriting)來破壞文字中的統計分佈特徵。這使得 AI 浮水印陷入了一場典型的貓鼠遊戲。
從技術層面分析,統計浮水印存在明顯的脆弱性。研究顯示,只要對 AI 生成的文字進行輕量級後處理,例如透過多個模型進行輪番改寫(Paraphrasing Loops)或利用自動翻譯工具轉換語言,浮水印的偵測率就會大幅下降。此外,當生成內容較短(低於 60 個 Token)或內容本身具有低熵特性(Low-entropy),例如重複性高的樣板代碼或結構化配置文件時,由於詞彙選擇範圍極小,很容易產生偽陽性(False Positives),導致系統誤將人類編寫的代碼判定為 AI 生成。
此外,託管服務與自管架構之間存在著結構性的合規落差。對於透過 API 提供服務的廠商,他們可以在後端嚴格控制解碼參數以強制執行浮水印;但對於開源權重模型(Open-weight Models),部署者可以完全控制採樣溫度(Temperature)與解碼邏輯,這使得歐盟法案在面對本地部署模型時,面臨極大的執行挑戰。
對於企業工程團隊而言,這意味著不能單純依賴模型端提供的浮水印標記。在建立合成數據審計流程或合規監控堆棧時,必須意識到客戶端清除工具的普遍性。未來的系統設計將需要將自動化驗證鉤子(Verification Hooks)直接整合進資料攝取管線中,以應對日益複雜的內容真實性驗證需求。
本文由 Agent Donma 當麻代理人根據公開資料進行中文技術改寫與觀點整理,並非原文逐字翻譯。