蕭上農近日於臉書發文指出,AI公司近來開始大量收購2022年以前出版的二手舊書,掃描後直接銷毀。
AI訓練需要大量資料,除了公開網路內容,書籍與出版品也成為重要語料來源,卻衍生著作權侵權與資料授權爭議。更令人關注的是,美國法院2025年認定,AI公司合法購買紙本書後,若掃描成數位館藏、銷毀原書且不對外散布,在特定條件下可構成合理使用;如今AI公司大量收購二手舊書,從一般書籍到稀有古籍都可能被送進掃描機,實體書保存也因此面臨新挑戰。
版權已成為AI熱潮下的主戰場,由於訓練AI模型需要有大量資料,其主要來源包括公開網路資料、書籍與出版品及專有資料庫等,也因此衍生多起著作權侵權與資料授權爭議,包括OpenAI、Anthropic、Stability AI等多家AI公司近年陸續遭到提告。然而,爭議不只涉及著作權,也延伸至實體書籍的保存。
蕭上農說,這些AI公司會專挑舊書,是因為生成式AI普及後,網路新產生的文字越來越多出自AI生成,若訓練資料混入過多AI產出的內容,可能使模型品質下滑,因此2022年以前出版的實體書,被視為較少受AI內容「汙染」的高品質語料來源,對訓練更具價值。
這類需求已形成專門生意。蕭上農指出,名為ISBNdb的服務便提供大宗採購,單筆交易可從1千本至100萬本,並主打與客戶簽署嚴格保密協議,讓買家全程匿名。處理流程則是切除書脊、將散頁放進高速掃描機,掃描完成後直接銷毀紙本,因為比逐頁翻拍更快、成本也更低。
而這種做法並非首次出現,Anthropic過去曾購買並拆解數百萬本實體書,用於訓練Claude模型,並於2024年聘用Google書籍掃描計畫的前合作主管Tom Turvey,負責取得「全世界所有的書」。
針對上述個案,美國北加州聯邦地院法官William Alsup於2025年6月裁定,Anthropic合法取得書籍後掃描、製成數位館藏並銷毀紙本,若數位版本不對外散布,可構成合理使用;不過,這項判決僅適用於該案,並不等於替所有掃描行為背書;此外,法院同時也認定Anthropic早期下載盜版書籍的行為可能構成侵權。
「問題是,這個過程無法回頭。」蕭上農引述美國媒體404 Media報導指出,1名書商今年4月銷量突然從每週不到20本暴增至數百本,由於買家選書隨機、對價格也不敏感,該名書商幾乎確定對方就是AI實驗室。
但書商也指出,他的庫存裡有大量稀有、絕版書。蕭上農強調:
網站遭爬取還可以重新上傳,暢銷書被掃描也可以再版,也就是說,如果僅存數冊的18世紀古書被送進碎紙機,這些絕版書就可能永遠消失。
蕭上農說,ISBNdb甚至在官網上表明,「AI公司銷毀200萬本書」不是一個能替企業贏得同情的標題,因此建議客戶將這項服務稱為「數位保存」,但仍持續經營這項業務。◇


loading...
