當 Anthropic 被揭發使用盜版書籍訓練 AI 模型的那一刻,全球科技界都陷入了震驚。這家美國人工智能公司旗下的大型語言模型 Claude,竟然涉及了數百萬美元的紙本書購買、拆解和數位化,以及從盜版網站下載數百萬本書籍,用以訓練其 AI 模型。
表象
表面上看,Anthropic 的行為似乎是一次技術突破,他們投入巨資,購買大量紙本書籍,拆解後數位化,以建立龐大的 AI 訓練資料庫。然而,真相遠比這複雜得多。
根據訴訟指控,Anthropic 不僅從創世紀圖書館(Library Genesis)及 Pirate Library Mirror 等平台下載書籍,還從 Books3 資料庫中獲得了 196,640 本未經授權的書籍,並從 LibGen 下載至少 500 萬本書籍,2022 年再取得至少 200 萬本內容,累計超過 700 萬本來自未經授權的盜版網站。
真相
Anthropic 內部清楚來自盜版網站的資料可能帶來法律風險,依然選擇保留這批資料,且並非一次性的 AI 訓練資料,而是規劃建立永久保存的中央圖書館,法院指出,數百名工程師都可存取這些內容,甚至能建立額外副本供其他用途使用。
事實上,Anthropic 曾希望取得更多合法內容,甚至提出建立「世界上所有書籍」資料庫的構想,但授權結果不如預期,隨後改以大量購買紙本書方式,投入數百萬美元購買大量紙本書籍,再委託第三方拆除書脊、裁切每一頁並掃描為數位檔。
各方角力
美國加州北區聯邦法院認為,若公司合法購買紙本書,再將內容一對一數位化供 AI 訓練使用,即使紙本遭銷毀,仍可構成合理使用。然而,來自盜版網站下載超過 700 萬本書籍,並建立永久保存的中央圖書館,已超出合理使用範圍。
這一判決不僅對 Anthropic 造成巨大打擊,也引起了全球對 AI 發展中內容著作權保護的關注。出版社、作者和法律界人士紛紛表示,這樣的行為嚴重侵犯了著作權,破壞了創作者的權益。
深層影響
從產業面來看,Anthropic 的案例暴露了 AI 發展過程中的法律盲點。AI 技術的快速進步,使得大量數據成為必要的資源,但如何合法、合規地獲取這些數據,成為了一個亟待解決的問題。
這不僅是一場技術革命,更是一場法律和道德的挑戰。Anthropic 的行為雖然在短期內推動了技術進步,但長期來看,這種做法無疑會損害創作者的利益,最終可能導致創新的萎縮。
此外,這起事件也提醒我們,AI 公司在追求技術突破的同時,必須更加重視法律和道德規範,以確保技術的健康發展。
未解之問
Anthropic 的和解金已經支付,但這起事件遠未結束。未來,AI 公司如何在尊重著作權的前提下,獲取足夠的訓練數據,依然是擺在整個行業面前的一道難題。
這起事件不僅是對 Anthropic 的警示,更是對整個 AI 行業的一次深刻反思。我們需要更多的法律框架和行業標準,來引導 AI 的健康發展。
如果你對 AI 的發展和著作權保護有獨到的見解,歡迎在留言區分享你的看法,共同探討如何在技術進步和法律規範之間找到平衡。
本文改寫整理自公開新聞來源,原始報導由自由時報發布。
常見問題 FAQ
Anthropic 為什麼被控訴?
Anthropic 被控訴的原因是從盜版網站下載數百萬本未經授權的書籍,用於訓練其 AI 模型,並建立永久保存的中央圖書館。
Anthropic 的和解金是多少?
Anthropic 同意支付 15 億美元的和解金。
這起事件對 AI 行業有何影響?
這起事件揭示了 AI 發展過程中對內容著作權保護的重視,提醒 AI 公司在追求技術突破的同時,必須更加重視法律和道德規範。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。