OpenAI 俾 NYT 追打證據問題,AI 版權戰開始查 ChatGPT log
Tech News

OpenAI 俾 NYT 追打證據問題,AI 版權戰開始查 ChatGPT log

圖片:via Ars Technica — https://arstechnica.com/tech-policy/2026/07/openai-faked-inability-to-search-training-data-hid-billions-of-logs-nyt-says/
TechLab 編輯部(譯)·

原告話 OpenAI 隱瞞搜尋能力,OpenAI 就話係私隱攻防

發生咩事

NYT、Daily News、Ziff Davis、Center for Investigative Reporting 等新聞機構,喺 7 月 9 日向紐約南區聯邦法院申請制裁 OpenAI,話 OpenAI 兩年來向法庭同原告低報自己搜尋訓練資料同 ChatGPT output logs 嘅能力。呢件事仍然係原告指控,法庭未裁定 OpenAI 有冇刻意隱瞞或銷毀證據;不過原告開出嘅要求好重,包括唔畀 OpenAI 用嗰個 2,000 萬 ChatGPT log sample 做抗辯、要求陪審團知道 OpenAI 曾經刪除大量 logs,仲要 OpenAI 俾律師費同專家費。

Ars 引用制裁申請講,關鍵來自 OpenAI 私隱工程師 Vincent Monaco 四月第二次 deposition。原告話佢嘅證供顯示,OpenAI 早喺訴訟前後已經有大型已去識別化 sample,包括 1,000 萬同 7,800 萬條 logs,仲曾經用嚟搜尋 NYT 內容同研究點樣擋「regurgitation」。如果屬實,OpenAI 之前話「要由零開始砌搜尋系統、成本高、要好多時間」嗰套講法,就會好難企得住。

OpenAI 官方《OpenAI and journalism》用嘅 AI 生成抽象插畫,彩色人群同天空畫面

圖片:OpenAI

點解 log 變成戰場

LLM 版權案最難搞嘅位,唔淨係模型訓練嗰刻有冇拎咗文章,仲有 ChatGPT 之後會唔會喺用戶 prompt 之下吐出付費文章,或者用摘要食走原站流量。法庭 2025 年 12 月已經講過,呢 2,000 萬條 consumer ChatGPT output logs 同案件有關,而且要求交出都算合比例;法庭文件亦提到 OpenAI 平時留住數以百億 consumer output logs,2,000 萬少過總量 0.05%。換句話講,log 係雙刃劍:入面可能有重複新聞內容嘅例子,亦可能幫 OpenAI 證明大部分用法同新聞冇關。

OpenAI 嘅反擊位

最微妙係,OpenAI 用戶私隱講法本身唔係假議題。OpenAI 向 AP 回應話,Times 案情轉弱、已經放低部分 claims,原告而家改用「入侵無關用戶私隱」嘅路線;OpenAI 會繼續守用戶私隱同 fair use。OpenAI 官方亦一直講,刪除對話同 Temporary Chat 一般 30 日後會移除,business、Enterprise 同 Edu 類資料另計。不過如果 OpenAI 同時內部用大型 log sample 調校反背稿 filter,又對外話搜尋好難,法庭要問嘅就唔止私隱,仲有點解可以為自己產品風險做分析,去到 discovery 就話做唔到。

原告仲指 OpenAI 俾出嘅 2,000 萬 sample 俾 AI redaction tool 處理到有 190 億次遮蓋,法庭曾經形容資料近乎用唔到;之後雖然移除部分 redaction,但原告話域名、機構名同欄位仍然遮住,拖慢佢哋搜尋。呢度表面似 technical housekeeping,實際牽涉樣本有冇失真。樣本一旦俾人質疑,OpenAI 就算拎住佢嚟講「背稿式輸出唔常見」,說服力都會打折。

呢單案會點影響 AI 成本

如果法庭接納制裁,殺傷力唔只係 OpenAI 俾多一筆律師費。最重係陪審團可能聽到 OpenAI 刪除大量 logs,甚至法庭可能限制 OpenAI 用 2,000 萬 sample 反駁原告。AI 公司一直講訓練公開網上內容屬 fair use,新聞機構就話你用我哋嘅成本建成替代品;一旦證據處理俾法庭睇成唔乾淨,新聞授權談判價錢自然會硬淨好多。

公司同內容團隊要點做

對香港公司同內容團隊,呢單案冇直接本地政策,但實際教訓好貼地:用 ChatGPT 或其他 LLM 摘錄付費文章、幫內部報告食新聞、或者叫 bot 代睇 subscription 內容,風險唔係淨係「會唔會畀平台封」。prompt、output、API log 有機會變成美國訴訟入面嘅可披露資料;公司 IT、法務同編輯團隊要講清楚咩資料可以入 bot、log 留幾耐、邊啲內容要有授權先可以餵入 workflow。

下一步睇法庭會唔會批制裁,特別係會唔會限制 OpenAI 用 output logs 建 fair use 抗辯。若果法庭只批費用,件事會變成 discovery 風波;若果批到陪審團指示或事實推定,AI 版權案會由抽象嘅訓練合法性,推到好具體嘅「你有冇保留同交出證據」。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook