作者:David,深潮 TechFlow
焚書養 AI,正在成為一門全球生意。
據 Fortune 近期報道,今年以來,荷蘭、德國、瑞士、西班牙多國古書商陸續收到異常的大額訂單。買家一次要幾千本學術書,品類繁雜,不像正常採購。
比如,一家位於荷蘭哈勒姆市的古書商 de Vries 最近就收到了一封離譜的郵件:
發件人來自一家名為 2077AI 的新加坡公司,說自己正在做一個多語種圖書採集項目;郵件附件是一份 Excel 表格,列著一份不同題材的、三千多本書的採購清單,每本都標註了出版編號,並要求報價後寄往中國。
de Vries 當時覺得過於離譜就沒理會。
幾週後荷蘭記者找上門,他才意識到這封「詐騙郵件」背後,連著整個 AI 行業對訓練數據的飢渴。

至於誰在用這些數據訓練什麼模型,據 Fortune 報道,這家買書的公司拒絕回應。
不只這一家。另一家加拿大公司 Zoom Books 每天凌晨三到五點在歐洲書商的網店上批量下單,買的全是冷門學術書,互相之間毫無關聯。
有書商對媒體說,運費比書還貴,但買家似乎並不在意。
這些書買來,當然不是為了讀。
AI 公司需要 2022 年以前出版的紙質書,因為這些文本保證沒有被 AI 生成內容污染過,是訓練大語言模型最乾淨的語料。
而拿到書之後,行業通行做法是「破壞性掃描」,切掉書脊,高速掃描全部頁面,然後銷毀紙質原件。
在海外,AI 大模型行業的頭部玩家,已經通過更加「狼性」的方式,跑通了這套全流程。
買盜版,養 AI
這件事的來龍去脈,最完整的記錄來自一場美國版權訴訟。
2024 年 8 月,美國作家 Andrea Bartz 等三人起訴了 Claude 的母公司 Anthropic,指控它未經授權使用自己的作品訓練 AI 模型。案件推進到 2026 年初,超過 4000 頁的 Anthropic 內部文件被法庭解封,《華盛頓郵報》對這批文件做了詳細報道。
這些文件展示的故事比想像中粗暴得多:
2021 到 2022 年間,Anthropic 通過 BitTorrent 從 LibGen 和 Pirate Library Mirror 這兩個盜版電子書網站下載了超過 700 萬本書,存入內部伺服器。文件裡的原話是,管理層認為逐一跟圖書出版商談授權「太過繁瑣」。

圖:公開庭審文件一角
三位提起訴訟的作家只是第一批。案件很快被擴大為集體訴訟,涉及約 50 萬部作品。2025 年 6 月,法官 Alsup 做了一個一分為二的裁定:
拿書來訓練 AI 本身算合理使用,但從盜版網站下載並永久儲存則不行。換句話說,訓練 AI 的動作不違法,但方式值得商榷。
Anthropic 面臨的賠償上限是每本書 15 萬美元,50 萬部作品,光理論上限就是天文數字。最終雙方以 15 億美元和解,平均每本書賠了大約 3000 美元。
今年 7 月 20 日法院最終批准,成為美國版權史上金額最大的集體訴訟和解。
先偷,後燒
如果故事到這裡結束了,那就只是一個偷東西被抓賠錢的簡單劇本。
但據《華盛頓郵報》2026 年 1 月的報道,法院在案件審理期間解封了超過 4000 頁 Anthropic 內部文件,裡面記錄了另一個計劃。
Anthropic 在 2024 年初啟動了一個內部代號「巴拿馬項目」的行動,專門請來了 Google Books 時期的前負責人,從二手書平台批量採購紙質書,計劃六個月內處理 50 萬到 200 萬本。
買來、切掉書脊、掃描、銷毀原件。
內部文件裡對這個項目的定義是「破壞性掃描全世界的書」,同時特別註明**「我們不希望外界知道我們在做這件事」。**
跟之前從盜版網站直接下載相比,區別在於,這次書是花錢買的。
法官後來認定這種做法合法,因為買了一本書,銷毀紙質版只留數位版,始終只有一份拷貝,不構成額外複製行為,符合版權法。
所以 Anthropic 的這個判例,實際從執行上替整個行業用古書訓練 AI 趟出了一條規避法律風險的路:
既然從盜版網站偷書會被告,那就卡 Bug,買正版再燒掉就沒事。
一條隱秘產業鏈
Anthropic 趟出來的路,現在已經有了配套基礎設施。
據 Decrypt 報道,美國聯邦法官在涉及 OpenAI 和 Meta 的單獨版權案件中,也做出了類似的合理使用裁定。「焚書訓練 AI」不再是一家公司的孤例,而是正在被判例體系逐步「合法化」的行業通行做法。
而有需求,就有供給。
據 404 Media 報道,一家擁有超過 1.1 億本書數據的圖書數據庫公司 ISBNdb,此前在自己網站上發佈了一個面向 AI 公司的營銷頁面,標題是**「為你的 AI 大模型提供紙質書語料採購服務」。據報道,頁面上提供從單筆 1000 本到 100 萬本的批量採購,並承諾通過嚴格的保密協議保護買家身份。**
報道發出後,ISBNdb 迫於口誅筆伐迅速撤下了這個頁面,並在官網發佈聲明稱相關服務「從未實際上線」,那個頁面只是在「測試市場興趣」。

圖:「我提供了服務,但你們都罵我所以我下架了」
這個解釋信不信由你,但是「測試」一下就發現,市場興趣確實很旺盛。
據 404 Media 同一篇報道引用的匿名書商說法,從今年 4 月開始,他的週銷量從大約 20 本暴漲到了幾百本。買家通過 ISBN 編號精準下單,買的都是彼此毫無關聯的冷門書籍,唯一的共性是全部在 2022 年之前出版。
為啥是 2022 年呢?
ISBNdb 之前被撤下的營銷頁面裡的某些賣點話術其實暴露了問題,因為 2022 年以前出版的紙質書不含任何 AI 生成內容,是最乾淨的訓練語料,所以它專門可以挑這種書來賣給你。
所以,理一下這條產業鏈的上下游:
- 數據庫服務商提供選書清單和匿名採購通道,
- 全球各地的二手書商供貨,
- 掃描服務商負責切書脊和高速數位化,
- 銷毀公司處理紙質殘骸,最終乾淨的數位語料進入 AI 公司的訓練管線。
這種做法也招來了大量的抵制和聲討。馬斯克於 7 月 27 日在 X 平台發文,對這種「現代焚書」般的工業流失線行為表達了反對和暗諷:

「我己要求 SpaceXAI 團隊,將處理過的任何珍稀書籍都保存在一個圖書館裡,並用『笨辦法』(非破壞性方式)去掃描它們,而不是直接切斷書脊後掃描。」
但如果沒有法庭判例文件公開,買家的名字,可能從頭到尾不會出現在任何一個環節裡,大家也並不知曉這條隱秘且略帶野蠻的產業鏈。
銷毀並非最優解
掃描圖書進行訓練,情有可原,但做法不必如此暴力。
當年 Google 做 Google Books 的時候,掃描了超過 4000 萬本書,用的是專利的非破壞性掃描技術,書掃完還給圖書館,一本都沒毀。
今年 7 月,馬斯克在社交媒體上公開表態,要求旗下 xAI 團隊對珍稀書籍採用無損掃描,原書保存進圖書館。
技術上完全做得到,只是慢一點,貴一點。
Anthropic 選了快的那條路。據 ISBNdb 博客上一篇現已刪除的文章分析,破壞性掃描之所以成為行業首選,原因只有一個:成本更低、速度更快。
非破壞性掃描需要專用設備和更多人工,每本書的處理時間是破壞性掃描的數倍。
商業競爭裡,這種選擇可以理解。AI 行業的軍備競賽不等人,誰先拿到更多高質量語料誰就跑在前面。法律也確實沒攔住,法官的判決在那裡,買書燒書合法。
但合法和合理之間,有時候隔著一段不小的距離。
一本紙質書可以被轉賣、借閱、傳承,在舊書店的角落裡躺二十年後被一個陌生人偶然翻到。掃描完燒掉之後,它變成了一家公司伺服器上的私有訓練資料,再也不會被任何人讀到。
知識從公共物品變成了私有資產,完成這個轉換的,不是什麼複雜的技術壁壘,就是一台冰冷的切割機和一份法院判決。
筆者每天都在用 AI 寫稿、查資料、整理思路。這些 AI 產品確實好用,也確實在改變很多人的工作方式。
但你如果去翻一翻這些模型背後的訓練資料是怎麼來的,會發現很多光鮮的產品背後,有一些經不起細看的東西。
這些事情單獨拿出來看,每一件都有它的商業邏輯和法律依據。
放在一起看,你很難不覺得哪裡不對,但又忍不住一聲嘆息。

