
Amazon 買舊書拆脊掃描:AI 訓練數據由網上搵到實體書架
追蹤器去到拉斯維加斯設施,但書本有冇餵模型仍欠直接證據
追蹤器證明到邊一步
404 Media 嘅調查將追蹤器放入一批懷疑由 AI 公司收購嘅舊書,貨件兜過幾個地方,最後去到 Amazon 喺拉斯維加斯嘅 VGT3 設施。調查指呢個據點會掃描書本,Amazon 亦向對方確認,公司會經商業渠道買書,用嚟改善客戶使用嘅產品同服務。**不過呢句回應冇講買咗幾多本、掃描檔案交畀邊個,亦冇確認追蹤嗰本書已經加入任何模型。**所以,貨件去到設施係實證;書中內容實際餵咗邊個模型,暫時仍欠直接證據。
拆書掃描點解要毀書
所謂破壞式掃描,通常係切走書脊,將每頁拆開,再用高速掃描器逐張取像,之後靠 OCR 變成可搜尋文字。呢條做法快、平,亦容易大批處理,但原書拆完基本上冇得照原貌放返上書架。Anthropic 案件嘅法院文件披露過相同流程:公司買入大量實體書,拆釘掃描,每本製成一份 PDF,再丟棄紙本。呢宗舊案證明破壞式掃描確實俾 AI 公司大規模採用;至於 Amazon 設施每本書點處理,現有公開資料未交代完整操作細節。
網上文字多,但乾淨資料愈來愈難搵
AI 公司回頭搵舊書,原因幾實際。網上公開文字雖然仲有好多,不過容易撞到重複內容、低質 SEO 頁面、授權問題,同埋愈來愈多 AI 生成文字。2022 年前出版嘅書大致避開新一代聊天機械人製造嘅內容,編輯同出版流程亦令文字密度通常高過一般網頁。另一方面,Nature 發表嘅研究顯示,模型反覆用模型生成資料訓練,資料分佈會逐代失真,極端情況可出現 model collapse。舊書對 AI 公司嘅吸引力,亦包括競爭對手可能未有嘅專門知識同寫作材料。
「罕見」唔一定等於天價珍本
呢單新聞最容易令人誤會嘅字係 rare。市場上「少見」可以係初版珍本,亦可以係冇人再版、存貨得幾本,但收藏價值好低嘅舊技術手冊。The Atlantic 嘅後續核查發現,書商遇到嘅大批訂單多數係上世紀七十至九十年代非小說作品,當中有過時軟件指南同地區資料書,未必屬收藏家眼中嘅珍品。公開資料亦未有逐本核實 Amazon 收到嘅書有幾罕有,亦冇可靠數字證明公司毀咗幾多本珍本,所以話「大批珍本已遭銷毀」就講得太盡。
買咗本書,唔代表版權爭議消失
美國加州北區聯邦法院喺 2025 年處理 Bartz 訴 Anthropic 案時,法院裁定,喺呢宗案件嘅具體情況下,用合法買入嘅紙本製作一對一數碼副本,再用作品訓練模型,可以算係合理使用;不過公司較早前由盜版書庫下載作品,唔會因為之後補買實體書就自動免責。呢個只係美國特定案件嘅裁決,唔係全球通行證。美國版權局嘅生成式 AI 訓練報告亦指出,訓練用途能否構成合理使用要按個別情況判斷,包括資料點樣取得、使用目的同市場影響。
數碼檔留低文字,留唔低成件文物
掃描可以保存頁面內容,但書本嘅裝幀、紙張、手寫批註、藏書印同流傳來源,全部都可能喺切脊一刻消失。一本舊手冊市場價低,唔等於佢冇研究價值;當全世界只剩少量實體本,逐本拆掉亦會令圖書館同研究者日後少一份可核對嘅原件。較穩妥嘅做法其實唔複雜:收書時先查館藏同存世量,罕有版本改用非破壞式掃描,再公開最基本嘅保存準則。速度會慢啲、成本會高啲,但大公司要建立私有知識庫,至少應該講清楚佢點避免永久損失。
下一步要睇 Amazon 肯公開幾多
呢次調查最有價值嘅地方,係將匿名買書潮追到一間具名公司同實體設施;證據仍未走到「指定書本已用嚟訓練指定模型」嗰一步。Amazon 如果想平息爭議,要交代 VGT3 掃描書本嘅用途、處理規模、原書去向,同埋有冇篩走罕見版本。未有呢啲資料之前,合理結論係 Amazon 確有買書同掃描活動,而 AI 訓練用途有相當線索支持,但個別貨件嘅最終用途仍有待證實。
參考來源
- TechCrunch — Amazon, once an online bookseller, is destroying rare books to train AI models — original report
- We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility — 核心調查來源,追蹤貨件到 Amazon 拉斯維加斯設施。
- Bartz v. Anthropic — Order on Fair Use — 法院判詞,交代 Anthropic 購書、破壞式掃描同合理使用裁決。
- AI models collapse when trained on recursively generated data — 解釋模型反覆吸收生成資料後出現退化嘅原始研究。
- Are AI Companies Really Destroying Books? — 核查舊書收購潮、ISBNdb 關聯同「罕見書」定義未清等證據缺口。
- Copyright and Artificial Intelligence, Part 3: Generative AI Training — 美國版權局對 AI 訓練、資料來源同合理使用分析嘅官方報告。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







