一粒 AirTag 追到 Amazon 拆罕見書:AI 訓練推斷有幾實?
Tech News

一粒 AirTag 追到 Amazon 拆罕見書:AI 訓練推斷有幾實?

圖片:via Ars Technica — https://arstechnica.com/tech-policy/2026/08/hidden-airtag-reveals-amazon-is-trashing-rare-books-to-train-ai/
TechLab 編輯部(譯)·

追蹤結果揭開大量掃書流程,但 Amazon 仲未交代文字最後用咗去邊

AirTag 追到嘅係書,唔係訓練紀錄

404 Media 今年 7 月同一名書商合作,喺經 Biblio 接到、約有 1,000 本書嘅大額訂單中,將 AirTag 藏入其中一本。追蹤結果顯示,呢批書最後去到 Amazon 位於拉斯維加斯、內部代號 VGT3 嘅設施。404 Media 引述當地員工話,設施會接收大量實體書,掃過條碼或者 ISBN,切走書脊,再逐頁掃描;書本經過呢套流程後,已經冇辦法保持原狀。

呢組證據足以將買書、送貨同拆書地點串連起嚟,不過證據去到邊仍然要講清楚。AirTag 只能證明其中一本書去到 VGT3,冇記錄掃描檔案之後進入邊個數據庫,仲冇模型訓練紀錄。 404 Media 將 VGT3 形容為 Amazon 嘅 AI 訓練設施,亦有員工證詞支持掃書流程;但 Amazon 自己只話公司經商業渠道買書,用嚟開發同改善客戶使用嘅產品及服務,冇確認係訓練生成式 AI,亦冇講涉及 Nova、Alexa、搜尋定其他系統。

「罕見書」三個字要小心睇

調查冇公開追蹤書本嘅書名,理由係保障消息來源,所以外界無法獨立判斷佢有幾罕見、仲有幾多本存世。報道中嘅「罕見」,主要指流通量少,可能係印量細,亦可能係使用人數唔多嘅外語書;罕見唔等於昂貴、古董或者博物館級藏品。 書商亦懷疑買家按 ISBN 清單逐批掃貨,因為冇 ISBN 嘅極罕見書通常唔會出現喺訂單,但呢個仍然係業界按訂單模式作出嘅推測。

呢個缺口會削弱「Amazon 正大量毀掉珍本」嗰種最煽情講法,卻冇令保存問題消失。市場價低只代表買家少,地方史、舊技術手冊、小語種作品同小量印刷刊物一樣可能保存咗主流數據庫冇收錄嘅資料。亦正因為網上搵唔到,呢類書對想擴闊訓練語料嘅公司先有吸引力。一本書對收藏市場冇乜價,內容仍然可以有研究同文化價值,兩套價值唔應該混埋計。

點解買正版之後仲要拆書

大量掃描最慢嘅位置係裝訂。保留書脊,就要逐頁揭書、壓平同處理彎曲;切開後可以高速送紙、做 OCR,再將文字整理成機器容易處理嘅格式。Amazon 呢種做法亦有法律背景:2025 年美國聯邦法院審理 Anthropic 案時,裁定公司將合法買入嘅實體書作一對一數碼轉換、同時丟棄紙本,用作可搜尋中央書庫,屬合理使用;法院亦分開裁定該案涉及嘅模型訓練具高度轉化性。至於由盜版書庫下載、再長期保存嘅副本,法院就冇接受同一套抗辯。

所以,買一本、掃一本、棄一本已經變成 AI 公司相對容易辯護嘅取材路線。不過 Anthropic 嘅裁決唔係一張通用免死金牌:合理使用要按用途、來源、輸出同市場影響逐案判斷,美國版權局亦指出,商業 AI 用大量受版權保障內容、產生可取代原作嘅輸出時,未必符合合理使用。Amazon 冇公開 VGT3 掃描檔案嘅用途、保存方式同權限,現階段無法直接套用另一宗案件替佢落結論。

拆書掃描留得低文字,但實物資料會流失

圖書館數碼化通常先由修復員評估書況,脆弱館藏會用限制開合角度嘅掃描器,必要時更會先修補,目的係令原件同數碼副本都可以繼續使用。商業掃描追求速度,切書脊就乾脆得多,但掃到嘅多數係頁面內容;紙張、裝訂、手寫批註、印刷差異同藏書來源等實物線索可能一刀消失。掃描檔若果只留喺公司內部,研究者、原作者同保存機構亦未必有得查閱。

今次調查最值得追落去嘅,係 Amazon 會唔會公開 VGT3 買書準則、掃描規模、檔案用途同保存政策。書商亦要知道訂單背後係一般收藏、轉售,定一次性拆解。單靠一粒 AirTag 仲未證明某個模型食過邊本書,但已經清楚顯示,AI 數據競賽正由網上爬文伸到二手書架,而實體原件可能喺公司交代用途之前已經消失。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook