新聞 > 科教 > 正文

搶完網際網路數據,AI公司開始搶絕版…

2026年4月起,一位專營稀有書和低流通量圖書的美國書商遇到了怪事:他店裡的生意向來不算火爆,一周賣出二十本已經算不錯,但最近,訂單突然像洪水一樣湧來,每周能賣幾百本。最費解的是,買家只列出一份用國際標準書號(ISBN)索引的書籍清單,卻從不詢問品相,也不砍價。

在大洋另一端,荷蘭哈勒姆的古董書商彼得·德弗里斯(Pieter de Vries)收到了一封來自新加坡公司2077AI的郵件,對方要求採購近3,000本書。同一時期,德國、瑞士、西班牙的舊書商也接到了來自加拿大公司 Zoom Books的大批量訂單,這些書涉及的領域多種多樣,令人捉摸不透意圖。

世界上怎麼突然冒出這麼多求知若渴的「人」?荷蘭當地媒體著手調查,結果發現,這些訂單似乎並不來自普通藏家,也不像學校或圖書館的採購。

直到 Anthropic的一則秘密掃描項目曝光,所有線索匯集在一起,真相終於水落石出:訂單的來源是幾家 AI公司,所有買到的書會被掃描餵給大模型,落得屍骨無存的下場。

大模型行業正在上演現實版「飢餓遊戲」

在收集實體書日益成為小眾愛好的當下,AI廠商為何轉而盯上了書商們的書架?這還要從2024年延續至今的大模型數據危機說起。

驅動大模型智能的核心是海量高質量文本。過去幾年,訓練數據的主要來源是網際網路:維基百科、Reddit、新聞網站、博客、開放論文……但很快,生成式 AI爆發,大量 AI生成的文本湧入網絡,反過來污染了網際網路語料庫。這導致模型在自己的輸出上反覆訓練,質量螺旋式退化,最終趨於胡言亂語,研究者將這種現象稱為「模型坍塌」(model collapse)。

因此,2022年之前出版的紙質書就成了最後的乾淨數據源。它們主要由人類撰寫、編輯、校對而成,語言精煉、結構完整,在物理層面上不可能包含 AI生成內容。正如圖書元數據資料庫公司 ISBNdb所言:「世界上最好的 AI訓練數據正擺在書架上。」

文本的純淨度是一方面,競爭維度同樣關鍵。書商手中握著不少發行量極少的稀有書籍,如果一家 AI公司把它全買回來,掃描後再銷毀,就將成為自家模型的獨有優勢,書架由此變成「兵家必爭之地」。

只是,與網頁不同,書不能直接抓取。要將其變成訓練數據,需要一些更暴力的破壞手段。

2026年初,一份由美國地區法院解封的4,000多頁法庭文件揭開了 Anthropic公司內部一個代號為「巴拿馬計劃」(Project Panama)的秘密項目。

項目始於2024年初。此前,Anthropic聯合創始人本·曼恩(Ben Mann)在2021年個人下載了數百萬本來自影子圖書館 LibGen和 Books3的盜版書籍,用於早期模型訓練。這些行為給公司帶來了嚴重的法律風險。

為尋找一條更安全的路徑,2024年2月,Anthropic聘請了谷歌圖書(Google Books)項目的前合作負責人湯姆·圖爾維(Tom Turvey)。內部規劃文件毫不掩飾地寫道:「巴拿馬計劃代表了我們破壞性掃描世界上所有書籍的努力。」

流程大致如下:公司先從大型二手書商處大量採購紙質書;這些書會先被切掉書脊,再經由高速工業掃描器逐頁數位化;掃描完成後,紙張作為回收物處理,不留實體副本。按照項目供應商的說法,這一計劃的規模是六個月內處理50萬到200萬本,整個項目僅花費數千萬美元,放在模型訓練的總開銷中算是微不足道。

同樣是做大規模書籍數位化,湯姆當年負責的谷歌圖書保留實體原件,並向公眾開放了搜索和片段瀏覽;「巴拿馬計劃」卻截然不同,後者在提取內容後銷毀書籍、全程保密,產出的數字副本也僅供內部使用,永遠不會向公眾開放。

Anthropic內部很清楚,這件事一旦暴露,會引發洶湧的輿論攻擊。但整件事的最荒謬之處在於,「巴拿馬計劃」的每一步,在美國現行法律下都是合法的。換言之,AI公司幾乎不會為此付出實際代價。

合法的荒謬

2025年6月,加利福尼亞北區聯邦地區法院法官威廉·阿爾薩普(William Alsup)在 Bartz訴 Anthropic一案中作出裁定:掃描合法購買的實體書用於 AI訓練,屬於「轉化性合理使用」,受美國版權法第107條保護。

裁定邏輯分三步:其一,書是合法購買的,依據首次銷售原則,買家有權處置;其二,每本紙質書都在購買後被複製為數字版,因此具備轉化性;其三,數字副本並未被再分發、銷售或對外展示。三項條件成立,故屬合理使用。

這段推理無意中創造了一個悖論:銷毀原件反而讓 AI企業在法庭上更有利。企業可以主張是為了節省存儲空間和便於檢索,用數字副本「替代」了實體副本,這在客觀效果上獎勵了銷毀行為。此後,在涉及 OpenAI和 Meta的獨立版權案件中,其他聯邦法官作出了類似裁定。

更詭異的是,要想合法掃描並銷毀,必須得用正版書。

Anthropic早年使用的影印掃描書籍已經被認定屬於違法侵權。2026年7月20日,法官阿拉塞莉·馬丁內斯-奧爾金(Araceli Martinez-Olguin)批准了15億美元的最終和解協議,覆蓋48萬餘部作品。截至2026年5月,Anthropic的年營收已達470億美元,這筆和解金只占其中的3%。

法律開了綠燈,規模足夠可觀,但問題是,這個項目為什麼能藏這麼久?

無法溯源的影子產業鏈

前面提到的 ISBNdb,是理解這條隱秘產業鏈的關鍵節點。

這家公司成立於2001年,原本是為圖書館、書店和出版商提供書籍索引服務的元數據平台,其目錄中收錄超1.11億本書。隨著 AI行業爆發,它轉型成為 AI公司批量採購書籍的中間商。

ISBNdb在網站上公開營銷:「為大模型訓練需求定製印刷書籍採購服務,以 AI所需的規模交付。」並承諾,能獲取散落在圖書館書架、二手書店和絕版目錄中的書籍,每單規模從1,000本到100萬本不等。它還提供嚴格的保密協議:「你的身份、策略和採購目標永遠不會被披露。」

在一則博客中,ISBNdb甚至大言不慚地承認:「輿論壓力確實存在。(幫助)『AI公司銷毀兩百萬本書』並不是一個能博得同情的說法。」還試圖重構敘事,強調紙張會作為回收物重新進入供應鏈,並將整個行為定義為「數位化保存」。

(來源:ISBNdb)

7月底,產業鏈徹底曝光後,ISBNdb刪除了網站上的 AI採購專頁以及關於保密協議的承諾表述。但很快,該頁面又恢復上線,甚至引用了威廉法官在 Bartz案中的判決作為法律背書,大張旗鼓地繼續做生意。

當然,ISBNdb不是唯一的中間商,新加坡的2077AI、加拿大的 Zoom Books都曾出現在歐洲書商的採購郵件里,但依然沒人知道委託它們購書的大客戶是誰。

不可能吃飽

AI公司為了獲取數據,正在不可逆地消耗人類文化遺產。但即使把全世界的書架都搬空,可能也解決不了 AI的根本問題。

數據統計顯示,人類歷史上總共出版過約1.3億本獨特書籍,能提供大約30到40萬億 tokens的文本量。而下一代大語言模型需要的訓練數據或將達到100萬億 tokens量級,即便把有史以來所有的書都掃完,也餵不飽它們的需求。

以 Anthropic為首的 AI公司的做法,已經在業內激起巨大波瀾。

埃隆·馬斯克(Elon Musk)稱他已要求自己旗下的 AI團隊保留稀有書籍,用非破壞性方式掃描。前 AI行業高管、非營利組織「公平訓練」(Fairly Trained)創始人埃德·牛頓-雷克斯(Ed Newton-Rex)表示,巴拿馬計劃的曝光是科技巨頭與創作者之間權力失衡的又一證據。

白宮科學與技術顧問委員會主席大衛·薩克斯(David Sacks)則銳評:「Anthropic堅持認為它有權免費用全世界的產出來訓練,即使作者反對。但如果競爭對手在付費之後用 Anthropic的輸出來訓練,就是智慧財產權盜竊。這種偽善令人嘆為觀止。」

(來源:X)

先前多起與 AI訓練有關的版權訴訟中,作者群體的憤怒是普遍且合理的:AI公司在未經許可、未給予補償的情況下,將創造性勞動變成了商業 AI產品的原材料。

這次,Anthropic買下的書籍,作者可能在幾十乃至數百年前就去世,著作權的追討無從談起,但其規模之巨,已對人類文明構成了打擊。

回到開頭,那位察覺到自己生意突然變好的美國書商,在採訪中流露出一種複雜的猶豫:「我個人對這一切的感受很複雜。它在經濟上對我有利,也幫我清掉了不太可能賣出去的老書。我的庫房裡有很多來自海外和外語的書籍,的確很適合做這種生意。但另一方面,我不喜歡這個最終用途,我不喜歡這些稀有的書籍被變成紙漿。」

阿波羅網責任編輯:zhongkang

來源:MIT科技評論

轉載請註明作者、出處並保持完整。

家在美國 放眼世界 魂系中華
Copyright © 2006 - 2026 by Aboluowang

免翻牆 免翻牆連結