當人工智慧模型規模持續擴張,記憶體瓶頸究竟能否被根本性突破?Google 研究院近期在官方部落格發表全新壓縮演算法 TurboQuant,宣稱可在不損失模型準確度的前提下,將 KV 快取記憶體占用量降低至少 6 倍,執行速度最高提升 8 倍。這項技術甫一發布,便引發業界廣泛討論,美系外資摩根士丹利甚至以「另一個 DeepSeek 時刻」定義其潛在影響力,認為 TurboQuant 有望從根本上改變 AI 部署的成本曲線。
傳統向量量化技術的核心矛盾:壓縮反而增加負擔
要理解 TurboQuant 的突破意義,首先必須釐清現有技術的根本困境。Google 研究院研究科學家 Amir Zandieh 與副總裁暨研究員 Vahab Mirrokni 在部落格中指出,向量是 AI 模型理解與處理資訊的基本單位。其中,高維向量(High-dimensional vectors)能捕捉影像特徵、詞語語意等複雜資訊,但也因此消耗大量記憶體,在關鍵的 KV 快取環節形成嚴重瓶頸。
所謂 KV 快取,可理解為一種高速「數位速查表」,以簡單標籤儲存常用資訊,使模型能即時存取,而無需反覆搜尋龐大資料庫。傳統的「向量量化」(Vector quantization)技術雖能縮減高維向量大小,理論上可加速相似度查詢並降低記憶體成本,然而實務上每個壓縮後的小區塊仍須存取額外的量化參數,導致每個數值反而增加 1 至 2 個位元,原本的壓縮效益因此大幅抵銷。
「TurboQuant 證明在無需訓練或微調的情況下,可將 KV 鍵值快取量化至僅 3 位元,且不會犧牲模型準確度,同時執行速度還比原始 LLM 更快。」——Google 研究院
TurboQuant 的兩階段壓縮架構:PolarQuant 與 QJL 的協同運作
TurboQuant 將於 ICLR 2026 正式發表,其核心架構由兩項子技術組成,分別是 PolarQuant(將於 AISTATS 2026 發表)與 Quantized Johnson-Lindenstrauss(QJL)演算法,兩者形成環環相扣的兩階段壓縮流程。
第一階段:PolarQuant 的高品質壓縮
PolarQuant 技術的核心在於重新定義向量的表示方式。過去的系統以 X、Y、Z 等標準直角座標描述向量,而 PolarQuant 則將向量轉換為「極座標」形式,以「簡寫」方式儲存與處理。以具體類比說明:傳統方法描述「向東走 3 個街區、向北走 4 個街區」,而 PolarQuant 則改為「以 37 度角走總共 5 個街區」,資訊量相同,但表示更為精簡。
這種轉換會產生半徑(代表核心資料強度)與角度(代表資料方向或意義)兩類資訊。由於角度模式具有已知且高度集中的特性,模型不再需要執行昂貴的資料標準化(normalization)步驟。更重要的是,當資料被映射至固定且可預測的圓形網格時,邊界是已知的,不像傳統方形網格那樣邊界持續變動,從而消除了傳統方法必然承擔的記憶體額外負擔。
第二階段:QJL 演算法的誤差修正機制
QJL 採用 Johnson-Lindenstrauss Transform 數學方法,能壓縮複雜的高維資料,同時保留資料點之間的距離與關係。具體而言,這項技術可將每個向量數值簡化為單一符號位元(+1 或 -1),建立一種高速的資料「速記形式」,且不需要額外記憶體負擔。在 TurboQuant 的架構中,QJL 扮演「誤差修正器」的角色,以極少的剩餘位元(僅 1 bit)對第一階段遺留的微小誤差進行修正,消除偏差(bias),從而提升注意力分數(attention score)的準確性。
「效率提升反而推動總需求增加。從這個角度來看,TurboQuant 與其說是漸進式優化,不如說是改變 AI 部署的成本曲線。」——摩根士丹利
實驗數據驗證:多項基準測試均達最佳表現
Google 以開源大型語言模型 Gemma 與 Mistral 為測試基礎,在 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 及 L-Eval 等多項標準長上下文基準測試中,對 TurboQuant、PolarQuant 及基準方法 KIVI 進行嚴謹評估。
實驗結果顯示,TurboQuant 在「點積失真」(dot product distortion)與「召回率」(recall)兩項指標上均達到最佳表現,同時顯著降低鍵值記憶體占用。在長上下文的「大海撈針」任務中,TurboQuant 在所有基準測試中均達到完美的下游任務表現,並將 KV 記憶體大小至少降低 6 倍以上。
效能面向同樣令人矚目。在 H100 GPU 加速器上,4 位元 TurboQuant 相較於 32 位元未量化鍵值,性能提升最高可達 8 倍。此外,與目前最先進的向量搜尋方法 PQ 及 RabbiQ 相比,TurboQuant 在高維向量搜尋任務中仍持續展現更優異的召回率,驗證其穩健性與效率。
摩根士丹利的戰略評估:短期效率提升,長期改變成本曲線
摩根士丹利對 TurboQuant 的評估分為短期與長期兩個層次。短期而言,TurboQuant 主要針對推論階段的 KV 快取進行壓縮,對模型權重與訓練工作負載並無直接影響。然而,它可以讓相同硬體支援 4 至 8 倍更長的上下文,或在不耗盡記憶體的情況下處理更大的批次規模(batch size)。摩根士丹利強調,這並非意味整體記憶體或硬體需求降低 6 倍,而是「效率提升」,增加每顆 GPU 的吞吐量。
長期而言,摩根士丹利預測將出現「傑文斯悖論」(Jevons Paradox)效應——效率提升反而推動總需求增加。目前 AI 服務擴展最大瓶頸在於 KV 快取,若模型能在顯著降低記憶體需求的情況下維持效能,每次查詢的服務成本可大幅下降,進而提升 AI 部署的獲利能力。這也是摩根士丹利以「另一個 DeepSeek 時刻」定義 TurboQuant 的核心邏輯所在。
技術展望:從 KV 快取到大規模向量搜尋的廣泛應用
Google 指出,TurboQuant 的應用潛力並不侷限於 KV 快取瓶頸的解決。這項技術預期能在極低記憶體使用量、幾乎為零的前處理時間,以及最先進準確度條件下,建立並查詢大規模向量索引,有助於 Google 語意搜尋系統變得更快速且更具效率。值得關注的是,目前 NVIDIA 亦已在論文中公開壓縮 KV 快取的新技術 KVTC,兩大科技巨頭同步投入這一領域,外界普遍預期隨著更多企業跟進,相關成本與記憶體用量將持續下降,進一步推動 AI 普及化進程。
常見問題解答
TurboQuant 是什麼技術?
TurboQuant 是 Google 研究院開發的新型壓縮演算法,由 PolarQuant 與 QJL 兩項子技術組成,能在不損失模型準確度的前提下,將大型語言模型的 KV 快取記憶體占用量降低至少 6 倍,並將執行速度提升最高 8 倍。該技術將於 ICLR 2026 正式發表。
TurboQuant 與傳統向量量化技術有何不同?
傳統向量量化技術雖能縮減向量大小,但每個壓縮後的區塊仍須存取額外量化參數,導致每個數值反而增加 1 至 2 個位元,抵銷原有壓縮效益。TurboQuant 透過 PolarQuant 的極座標轉換消除記憶體額外負擔,再以 QJL 演算法修正殘餘誤差,從根本上解決這一矛盾。
摩根士丹利為何稱 TurboQuant 為「另一個 DeepSeek 時刻」?
摩根士丹利認為,TurboQuant 能讓相同硬體支援更長上下文或更大批次規模,顯著降低每次查詢的服務成本,並預測長期將出現「傑文斯悖論」效應——效率提升反而推動 AI 總需求增加。因此,TurboQuant 被視為改變 AI 部署成本曲線的關鍵技術,而非單純的漸進式優化。
TurboQuant 對 AI 硬體需求有何影響?
短期而言,TurboQuant 主要提升推論階段的效率,並不直接降低整體硬體需求,而是增加每顆 GPU 的吞吐量,讓相同硬體能處理 4 至 8 倍更長的上下文或更大批次。長期而言,隨著 AI 部署成本下降,總體需求預期將持續擴大。