當那枚被夾藏在書脊夾層的 AirTag 定位訊號,最終穩定出現在內華達州拉斯維加斯東北角的物流地圖上時,404 Media 的調查團隊意識到,他們揭開的可能不只是某批貨物的終點,而是一個關於人類文明結晶如何被「解體」為數據飼料的殘酷真相。
這趟追蹤,始於一批 1,000 本的珍稀藏書交易。在賣家與調查單位的合作下,一個小小的追蹤器隨著古籍從加州出發,途經密爾瓦基、科羅拉多州大章克申,最後跨州鎖定在亞馬遜代號「LAS8」的大型物流倉庫。公開資料顯示,這座倉庫主要負責按需印刷服務,但在其內部一個名為「VGT3」的管制區,進行的卻是完全相反的破壞性作業。
表象:按需印刷倉庫裡的「VGT3」神秘管制區
走進 VGT3 作業區,運作中的不是裝訂機,而是專業的切紙設備與工業級高速進紙掃描儀。調查揭露的標準處置流程是這樣的:工作人員先切斷整本書的書脊,讓裝訂完整的書籍瞬間解體為零散紙頁,再送入掃描儀進行全自動光學辨識。
整個過程高效、冷靜,且不帶一絲保存文物的意圖。這些被數位化的文字,既不會上架供一般讀者借閱,也不會被製作成便於人類閱讀的電子書格式。它們的唯一用途,是作為預訓練演算法的「專屬飼料」,直接灌注進大語言模型的底層數據集。
「這項調查最令人震驚的不是技術本身,而是科技巨頭在 ‘合理使用’ 的法律保護傘下,正有系統地將物理世界的文化資產轉化為一次性消耗品。當書籍的資訊價值被榨乾後,剩下的紙漿與封皮只配進入垃圾桶——這不是圖書館的數位化典藏,這是文化遺產的工業級屠宰。」
一旦文字數據被萃取完畢,殘存的物理碎紙與封皮便被當作廢棄物直接丟棄。這讓「閱讀」這個動作在 AI 時代出現了荒謬的斷裂:書不再是給人讀的,而是先餵給機器,然後消失。
真相:AI 資料荒下的「未污染黃金礦脈」
為什麼科技巨頭甘願冒著文化保育的罵名,也要用這種「毀書取字」的極端手段?核心原因在於當前 AI 產業最焦慮的痛點:高品質的人類原創數據,正在快速枯竭。
隨著網路上充斥大量 AI 生成的合成內容,開發商面臨一個技術上的致命陷阱——「模型崩潰」效應。當大型語言模型反覆使用由其他 AI 產出的資料進行訓練,模型的輸出會日益同質化、平庸化,甚至連邏輯推理能力都逐步流失。更麻煩的是,合成資料會成倍放大 AI 的「幻覺」問題,讓錯誤資訊在遞迴訓練中被強化為虛假的基準。
換句話說,讓 AI 吃 AI 生成的東西,最終只會養出一個畫地自限的笨小孩。為了突破這個瓶頸,開發商需要的正是那些尚未被數位化、保留著純粹人類智慧結晶的實體書籍。這些來自前數位時代的文本,在數據市場上被視為「未被污染」的頂級礦脈。
「法律層面上,目前法院的司法判例傾向於將這類操作認定為’合理使用’,前提是科技企業沒有公開發行或轉售這些數位化副本。但法律的許可,從來就不等同於文化上的正當性。當亞馬遜和 Anthropic 這些巨頭搶購實體書進行內部訓練時,他們消耗的是一個無法再生的文化存量。」
根據調查,採取這種破壞性掃描策略的不只有亞馬遜,AI 獨角獸 Anthropic 在內的多數大型商業研發機構,也早已加入搶購實體書籍的行列。這已經不是單一企業的個案,而是整個產業在數據焦慮下形成的集體路徑依賴。
各方角力:法律許可與文化保存的對撞
這條「合法但充滿爭議」的供應鏈之所以能運作,法律基礎在於著作權法中的合理使用條款。由於這些數位化文本僅作為內部演算法參數分析,並未對外發行或銷售,目前司法判例傾向於認定未構成侵權。
但文化界的警示聲音已經無法忽視。文史學者與圖書館界擔憂的是,實體書籍的存量是有限的,尤其一些存世量本就稀少的絕版書、地方文獻與特殊裝幀本,隨著這場 AI 軍備競賽的加速,極有可能在物理世界徹底絕跡。這不是危言聳聽——當每一本珍本都被拆解、掃描、銷毀,即使數位檔案留存,書作為物質文化載體的意義也已不復存在。
然而弔詭的是,目前市場上幾乎不存在有效的制衡機制。亞馬遜的「LAS8」倉庫只是被追蹤到的一個點,還有多少未曝光的「VGT3」作業區在全球各地運作?我們無從得知。
深層影響:知識權力的世紀轉移
這起事件真正值得關注的,不僅是幾本書的消失。它標誌著一個更深層的權力轉移:誰有資格決定人類知識的哪些部分應該被保存、哪些可以被銷毀?
過去,這把鑰匙掌握在圖書館館員、檔案管理者和歷史學者手上。現在,它被交給了 AI 公司的數據工程師和成本效益分析模型。當一本書的價值只被簡化為「能否提升模型評測分數」時,那些不適合演算法但對人類文化有意義的文本,將成為被優化掉的邊角料。
更讓人不安的是,這整個過程幾乎沒有透明性可言。若非 404 Media 用 AirTag 進行了這場「跟監式調查」,大眾根本不會知道「LAS8」或「VGT3」代表什麼,也不會意識到自己書架上的某本絕版書,可能正在某個管制區裡被拆成紙片。
從產業面來看,這其實是 AI 發展進程中一個典型的「外部成本轉嫁」案例。科技公司將數據獲取的成本——無論是金錢上的採購支出,還是文化意義上的不可逆損失——外包給整個社會承擔,而自己在短期內獲得了訓練數據的競爭優勢。長期而言,如果沒有建立更明確的數位化倫理規範與實體書籍保存機制,我們恐怕會在二十年後回顧這個時代時,發現那是人類知識多樣性被大量滅絕的黑暗時刻。
未解之問
調查曝光後,亞馬遜並未對「LAS8」倉庫的具體作業內容做出詳細回應。這件事留下了一連串我們還無法回答的問題:還有多少類似「VGT3」的管制區正在運作?這些經破壞性掃描的書籍清單是否可能公開?文化機構是否有權對這類操作提出異議或介入保存?
「AI 需要數據,這不是問題。問題在於,當獲取數據的代價是讓人類的實體文化資產逐冊消失時,我們是否應該在 ‘合法’ 與 ‘正當’ 之間畫出一條更清晰的界線?畢竟,演算法可以重新訓練,但一本被切斷書脊的絕版書,永遠回不來了。」
或許,我們真正該問的是:如果 AI 的進步必須奠基於書籍的物理毀滅,那我們追求的究竟是一個更聰明的未來,還是一個更貧瘠的文明?
【編輯視角】 作為一個長期關注數位文化與閱讀產業的觀察者,我認為這起事件揭示了一個令人不安的趨勢:科技巨頭正在把「文化遺產」重新定義為「原始數據」。當一本書的價值被簡化為參數和權重,那些無法被量化的人文脈絡、紙質觸感和歷史痕跡,就成了系統性優化的代價。對一般讀者來說,這不是遠在天邊的科技新聞——你書架上那本絕版的在地文史記錄,可能就是下一批被送進 VGT3 的「飼料」。我們或許無法阻止 AI 的發展,但可以開始要求更多透明性與倫理審查,至少在知識被徹底商品化之前,留下一些值得堅持的底線。
FAQ 常見問題
亞馬遜 LAS8 倉庫的 VGT3 作業區是做什麼的?
VGT3 是亞馬遜內華達州 LAS8 倉庫內的一個管制區域,主要進行珍稀書籍的破壞性數位化作業,包括切斷書脊、高速掃描,再將文字數據作為 AI 訓練材料,最後將實體書銷毀。
為什麼 AI 公司要銷毀實體書籍來獲取數據?
因為網路上已充斥大量 AI 生成的合成內容,若用這些數據訓練模型會導致「模型崩潰」和幻覺問題。實體書籍被視為「未經污染」的高品質人類原創數據來源。
這種「毀書取字」的行為合法嗎?
目前美國法院的司法判例傾向於將此類操作認定為「合理使用」,前提是科技公司未將數位化內容公開發行或轉售牟利,而是僅用於內部演算法訓練。
哪些科技公司被點名參與這種作業?
根據 404 Media 調查,亞馬遜是直接關聯企業,此外 AI 獨角獸 Anthropic 在內的多家大型商業 AI 研發機構,也已加入搶購實體書籍進行內部訓練的行列。
一般人該如何看待這個問題?
這不僅是科技倫理問題,更涉及文化保存。讀者可以關注科技公司在數據獲取上的透明性,並支持圖書館、學術機構與民間團體推動實體書籍數位化保存的倫理規範。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。