記者吳立言/綜合報導
美國聯邦法院近日公布 Anthropic 著作權訴訟判決全文,首度完整揭露 Claude 大型語言模型建立訓練資料的過程。判決指出,Anthropic 曾花費數百萬美元購買大量紙本書籍,拆除書脊、逐頁裁切後掃描成可搜尋的 PDF,再將紙本原書銷毀;此外,公司也曾下載超過 700 萬本來自盜版網站的書籍建立資料庫。法院最終認定,利用合法取得的書籍訓練 AI 可構成合理使用(Fair Use),但下載並保存盜版書籍則仍涉及著作權侵權。
▼Claude 母公司 Anthropic 被控拆解絕版書用以訓練 AI 模型。(圖/路透)

法院文件揭露資料來源與取得方式
根據美國加州北區聯邦法院法官 William Alsup 在 Bartz v. Anthropic 一案的判決,Anthropic 為建立 AI 訓練資料,投入數百萬美元購買大量紙本書籍,再委託第三方拆除書脊、裁切每一頁並掃描為數位檔。判決形容:「The print original was destroyed. One replaced the other.」,意即紙本原件遭銷毀,由數位副本取而代之。
法院認為,這些數位化書籍主要作為 Claude 訓練資料使用,而數位副本則取代原有紙本館藏。
判決:共同創辦人曾下載逾 700 萬本盜版書
除了自行購買紙本書外,法院也揭露 Anthropic 曾大量使用盜版資料來源。
判決指出,Anthropic 共同創辦人 Ben Mann 於 2021 年下載 Books3 資料庫,內容包含 196,640 本未經授權書籍;數個月後,又從 LibGen 下載至少 500 萬本書籍,2022 年再自 PiLiMi 取得至少 200 萬本內容,累計超過 700 萬本。法院表示,公司內部知道這些資料均來自未經授權的盜版網站,但仍持續保留於資料庫中。
明知法律風險仍保留資料
判決內容指出,Anthropic 後來開始意識到持續保存盜版資料可能帶來法律風險,內部也曾討論相關問題。不過,法官在判決中寫下「It kept them anyway.」意即即使已經意識到法律疑慮,公司仍選擇保留這批資料。
法院並指出,Anthropic 並非沒有其他合法取得內容的方式,而是在可選擇合法管道的情況下,仍優先利用盜版資料建立大型圖書資料庫。
曾嘗試談授權 最終改採購書掃描
判決顯示,Anthropic 於 2024 年聘請曾參與 Google Books 計畫的 Tom Turvey,希望協助取得更多合法內容,甚至提出建立「世界上所有書籍」資料庫的構想。Turvey 曾與多家出版社接觸,詢問 AI 訓練授權事宜。法院認為,如果持續協商,雙方可能達成授權協議。
然而,Anthropic 高層最終停止相關談判,改以大量購買紙本書、拆解並數位化的方式取得資料。
法院:建立永久圖書館並非單純訓練用途
法院也指出,Anthropic 建立的並非一次性的 AI 訓練資料,而是規劃建立永久保存的中央圖書館(Central Library)。即使部分書籍已確定不會再用於模型訓練,公司仍持續保存相關檔案;法院並指出,數百名工程師都可存取這些內容,甚至能建立額外副本供其他用途使用。
合法掃描可合理使用 盜版下載仍須負責
本案最具指標性的部分,在於法院區分了「合法取得內容」與「非法取得內容」。判決認為,若公司合法購買紙本書,再將內容一對一數位化供 AI 訓練使用,即使紙本遭銷毀,這類用途具有高度轉化性(Transformative),可構成合理使用,因此不構成侵權。
然而,法院同時認定,Anthropic 從 Books3、LibGen 與 PiLiMi 等盜版網站下載超過 700 萬本書籍,並建立永久保存的中央圖書館,已超出合理使用範圍,相關侵權責任仍須進一步審理,後續將進入損害賠償程序。
這項判決被視為生成式 AI 著作權訴訟的重要里程碑。法院一方面首度明確表示,利用合法取得內容訓練 AI 模型可構成合理使用;另一方面,也強調模型訓練並不能成為下載、保存大量盜版內容的免責理由。









