
AI 公司掃清 2022 年前舊書:拆脊背後係訓練數據供應鏈重整
買書、拆脊、掃描到訓練,版權風險每一步分開計
舊書突然變成 AI 原材料
Tom’s Hardware 引述 404 Media 調查,指專做書目數據嘅 ISBNdb 正向 AI 客戶提供大量實體書採購服務,單一訂單據報由 1,000 本去到 100 萬本都有。部分二手書商話,今年 4 月起訂單突然急升,買家集中收有 ISBN 嘅書,題材同作者就冇明顯規律,連定價偏高嘅貨都照買。不過現有資料未能證明每張訂單背後係邊間科技公司,實際數量同最後用喺咩模型都未公開,所謂「AI 公司掃書」暫時仍主要建基於採購模式同業內消息。

圖片:Wikimedia Commons — Brateevsky(CC BY-SA 4.0)
點解偏偏要 2022 年前出版
生成式 AI 公司要嘅唔止係大量文字,仲要控制數據入面有幾多垃圾、重複內容同模型自己生成嘅句子。ChatGPT 喺 2022 年底爆紅後,網上迅速多咗大量 AI 文章;再用呢批內容訓練下一代模型,好容易令錯誤、罐頭語氣同虛構資料不斷循環。2022 年前嘅實體書等於一個粗略時間濾網:內容通常經作者、編輯同出版社處理,亦較少混入生成式 AI 文字。
呢個年份分界只係降低污染風險,唔代表每本舊書都可靠。過時教科書、錯誤資料同偏見一樣可以印成書;書本有編輯把關,亦唔等於內容必然適合訓練。真正值錢嘅係來源可以追查、版本有 ISBN、出版年份清楚,AI 公司較容易整理數據血統。模型愈大,要記錄同審查數據來源亦愈花錢,成本唔再只係 GPU 同儲存空間。
拆脊掃描點解咁有效率
大量書本數碼化通常有兩條路:保留原書,用頂置、V 形或平板掃描器逐頁影;又或者直接切走書脊,將散開嘅書頁送入高速文件掃描器,再用 OCR 變成可搜尋文字。後者快好多,人工同器材成本亦低,代價係本書掃完多數冇得還原。Anthropic 案件嘅法庭紀錄顯示,公司曾買入大量實體書,交畀掃描承辦商製成 PDF,原有紙本就唔再保留。
外界最易聚焦「AI 燒書」呢幅畫面,但供應鏈問題更實際。二手書賣出後,錢通常去書商同物流商,作者及出版社未必再有收入;珍本或絕版書如果冇先篩走,亦可能永久退出流通市場。暫時冇公開證據顯示採購商刻意收珍本,亦冇資料交代點樣篩選,所以唔應該直接推論大量文化資產已經消失。不過當訂單可以去到工業規模,採購規則同銷毀政策自然要交代得清楚。
美國法院其實分開判三件事
Bartz v. Anthropic 最關鍵嘅地方,係法院冇將所有「用書訓練 AI」一概處理。法官認為,把作品複製入模型訓練流程屬轉化性用途,可以構成美國版權法下嘅 fair use;將合法購入嘅紙本一對一掃成數碼版本,方便搜尋同節省空間,亦獲判為 fair use。呢個結論同每掃一本就銷毀相應紙本有關,唔係一張任意複製書庫嘅通行證。
Anthropic 另一批由 Books3、LibGen 等盜版書庫下載、再長期保存嘅數百萬本書,法院就冇接受同一套理由。公司其後同作者及出版社達成 15 億美元和解,法院喺 2026 年 7 月 20 日正式批准,合資格作品預計每本分得約 3,000 美元。呢筆錢係民事和解款,唔係政府罰款;報道若將佢寫成「AI 訓練違法後交罰款」,就混淆咗訓練用途、格式轉換同盜版來源三項判斷。
買到本書,唔等於買埋複製同訓練權利
實體採購熱潮某程度係科技公司補做數據來源管理:保留發票、ISBN、版本同掃描紀錄,日後上庭至少講得出每份資料點樣入庫。不過合法買到一本紙書,只代表嗰份實體副本來源清楚,唔會自動取得無限複製或其他商業授權。Anthropic 得到嘅 fair use 判決亦只適用於嗰宗案件同美國法律下嘅具體做法。
出版社對 Google 提出嘅新訴訟正好顯示另一層風險。Hachette、Cengage、Elsevier 同作者 Scott Turow 指控 Google 把原先交畀 Google Books、Google Play Books 等有限用途服務嘅作品,改作 Gemini 訓練材料,亦指公司採用來歷有爭議嘅網上書庫。以上仍然係原告指控,法院未有裁決,但爭議焦點已經由「有冇接觸過本書」推前到「原先授權包唔包括模型訓練」。
數據來源會變成模型競爭力
舊書採購反映,AI 公司而家要額外花錢避開網上大量 AI 生成內容。高質素人類文字有限,公開網頁又愈來愈難分真假,乾淨數據自然變成要經採購、物流、掃描、OCR、去重同法律審查先得到嘅工業原料。大型公司負擔到呢條供應鏈,細公司就可能只買到授權數據、合成數據或者質素較差嘅網上資料,模型差距因而唔再只睇算力。
香港亦唔可以直接套用美國 fair use 結論。政府最新公開文件仍以修例建議形式處理文字及數據開採豁免,方向包括容許版權人保留權利,已有相關授權安排時亦可排除豁免。最終界線要睇正式法例點寫。接落嚟值得追嘅係 ISBNdb 客戶身份、採購書量、珍本篩選規則,同各間模型公司肯公開幾多訓練數據來源。
參考來源
- Tom's Hardware — AI companies are reportedly shredding millions of books after using them to train AI models — tech giants outsource to middlemen to secretly buy up books for training material — original report
- AI Companies Are Buying Tons of Old Books Because They’re Free of AI Slop — 最先披露 ISBNdb AI 書本採購服務同業界銷量異動嘅調查。
- Bartz et al v. Anthropic PBC — Document 437 — 法院文件清楚分開模型訓練、合法購入紙本嘅一對一數碼化,以及盜版書庫下載。
- Judge approves a $1.5B Anthropic settlement over books used to train Claude — 核實 2026 年 7 月法院正式批准 15 億美元民事和解,避免誤寫成罰款。
- Hachette v. Google — Class Action Complaint — 出版社針對 Gemini 訓練數據來源提出嘅正式申訴書;文中只按指控描述,未當成已裁定事實。
- Intellectual Property Protection — Copyright and AI — 香港政府版權與 AI 政策資料入口,交代文字及數據開採豁免仍以修例建議處理。
本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。







