一句話總結:Google 發表革命性 TurboQuant 壓縮演算法,能將大型語言模型 KV 快取大幅壓縮至僅剩 3 位元且不犧牲模型準確度,為 AI 運算記憶體瓶頸提供關鍵解決方案。
核心要點
- Google 研究團隊正式推出 免訓練 的 TurboQuant 壓縮演算法,這項技術能將大型語言模型(LLM)的鍵值快取(KV caches)壓縮至驚人的 3 位元,且 完全不影響模型準確度。
- 根據在輝達 H100 GPU 上的基準測試結果,採用 4 位元版本的 TurboQuant 在計算注意力對數時,相較於未經量化的 32 位元金鑰,效能提升高達 8 倍,同時將 KV 快取記憶體需求量降低至少 6 倍。
- 隨著大型語言模型應用日益廣泛與上下文長度不斷擴張,KV 快取佔用的記憶體空間呈現爆炸性成長,已成為 AI 運算領域急需解決的記憶體瓶頸,TurboQuant 為此帶來顯著的硬體最佳化解方。
- 業界過去多半採用傳統的向量量化方法來縮減快取體積,然而,這類方法必須額外儲存 量化常數,導致在面對超大型上下文長度時,這些微小的額外開銷會不斷累積,最終侵蝕掉量化所帶來的記憶體節省效益。
- 為徹底消除傳統量化帶來的額外開銷,Google 團隊透過創新的「兩階段處理流程」打造 TurboQuant:第一階段是 PolarQuant 技術,將數據轉換為極座標,實現零量化常數儲存消耗;第二階段則導入 1 位元錯誤修正層(QJL),幾乎不增加運算成本,同時確保模型高精準度。
- Google 團隊使用 Gemma 與 Mistral 等開源模型,在 LongBench、Needle In A Haystack、ZeroSCROLLS 等多個長文本基準測試中全面評估,TurboQuant 在將 KV 記憶體壓縮至少 6 倍的嚴苛條件下,於 LongBench 資訊檢索任務中依然取得了完美的下游分數。
- TurboQuant 最具商業價值的優勢在於它完全不需要任何訓練或微調,且在執行時期的資源消耗微乎其微,這些特性使得該技術能非常輕易且無縫地部署於現有的生產級推論系統以及大規模的向量搜尋系統之中。這項由 Google 研究科學家 Amir Zandieh 與副總裁 Vahab Mirrokni 共同撰寫的技術論文,預計將於下個月舉辦的 2026 年國際學習表徵會議(ICLR 2026)上正式發表。
一句話結論
Google 的 TurboQuant 壓縮演算法,以其免訓練、高壓縮率與零準確度損失的創新設計,不僅成功克服了大型語言模型面臨的記憶體瓶頸,更在效能與部署靈活性上展現巨大突破,有望大幅降低 AI 運算門檻,加速大型語言模型的普及與應用。