新 Claude 模型會喺文字藏 watermark:複製照跟,改寫後未必驗到
Tech News

新 Claude 模型會喺文字藏 watermark:複製照跟,改寫後未必驗到

圖片:via TechCrunch — https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
TechLab 編輯部(譯)·

Anthropic 全球推標記,API 同 Claude Code 都包埋

Anthropic 公布,新 Claude 模型會喺產出嘅文字入面加入機器可讀嘅隱形 watermark。安排由歐盟 AI Act 推動,不過實際會全球套用;即使你喺香港經 Claude app、API 或 Claude Code 用支援模型,輸出都可能帶住呢個標記。舊模型亦會補上支援,但官方暫時冇交代完整名單同時間表。

Watermark 放喺模型產出本身

Anthropic 將文字同檔案分開處理。文字 watermark 會由支援模型直接織入輸出,肉眼睇唔到,官方話唔會改變意思、質素或可讀性。圖片等支援檔案就另加經數碼簽署嘅 C2PA provenance metadata,用嚟記錄檔案曾經經 Claude 處理,同埋檢查之後有冇俾人竄改。

模型層標記嘅實際效果係,純文字複製貼上之後,watermark 仍會跟住內容走,唔會好似一般檔案 metadata 咁一轉格式就自然消失。Anthropic 話標記可能捱得過部分編輯,不過未公開實際算法、偵測門檻、所需文字長度、誤判率或抗改寫數據,所以而家仲講唔到改幾多字先會驗唔到。

API、Claude Code 同雲端版都覆蓋

官方列出嘅範圍包括 Claude Platform API、Claude、Claude Code、Claude Cowork 同 Claude Tag。經 AWS、Google Cloud 或 Microsoft Foundry 使用支援模型,文字 watermark 同樣會加入;檔案 metadata 就要睇個別平台支援咩功能。換句話講,開發者經 API 拎到嘅文字都唔係例外,接落嚟要檢查自己個 app 有冇再截短、翻譯或重寫輸出。

規則以 2026 年 8 月 2 日做分界:當日或之後喺歐盟推出嘅 Claude 模型,一推出就會支援標記。;較舊模型就處於過渡階段。呢個講法唔代表每段歷來由 Claude 生成嘅文字而家都驗到,亦唔代表所有平台、功能同檔案格式已經支援齊。

Watermark 同 AI detector 係兩套嘢

市面上嘅通用 AI detector,多數靠文風、用詞分布等特徵估一段文字似唔似由模型寫。Anthropic 呢套機制就係搵指定 Claude 標記,偵測範圍窄好多。官方亦寫得幾保守:驗到標記,只代表內容可能曾經經 Claude 處理,唔足以證明全文由 Claude 原創,仲證明唔到交功課或投稿嗰個人有冇作弊。

原因好直接:有人可以只叫 Claude 校對、翻譯、摘要或轉檔,原本內容仍然由人寫,但新輸出可能帶標記。掉轉頭,重度改寫、paraphrase、翻譯、混入其他文字或只抽一小段,都可能令訊號弱到驗唔出;短文亦可能冇足夠訊號。驗唔到 watermark,唔等於內容由人寫。

學校同公司唔好當佢係一槌定音

學校、出版社同企業合規團隊最容易踩中嘅位,就係將「曾經經 Claude 處理」直接當成「由 AI 代寫」。尤其 Claude Code 同 API 已納入範圍,程式碼、報告草稿、客服文字或內部文件都可能留下標記。較穩陣嘅做法係保留版本紀錄、清楚訂明可接受嘅 AI 用法,再將 watermark 當成其中一項線索。

歐盟 Article 50 要生成式 AI 供應商提供機器可讀標記,技術亦要喺可行範圍內做到可靠、耐改同可互通。Anthropic 而家只公布咗框架,第三方點樣取得偵測工具、唔同語言準確率有幾高、各家標記可唔可以用同一套系統驗證,仍然未有答案。技術文件同實際偵測數據公開之前,呢個 watermark 適合做來源提示,未夠資格單獨用嚟判定作者身份。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook