半導體產業這幾年有個心照不宣的共識:運算單元塞得再多,記憶體頻寬跟不上,都是白搭。輝達在八月端出的新一代高頻寬記憶體技術 NVHBM,直接挑明了這個痛點。這項技術是把輝達自行開發的記憶體控制器,從 XPU 運算晶粒移到了 3D HBM 堆疊中的 Base Die,換句話說,運算晶粒上原本被控制器佔用的空間,現在可以全部還給運算單元。
數字會說話。根據輝達公布的數據,相較於標準 HBM4E,NVHBM 的記憶體頻寬最高可提升 30%,HBM 功耗降低 15%,更重要的是,XPU 運算晶粒面積最多可以釋放 25%。這不只是規格升級,它改變了晶片設計的物理限制——同樣大小的晶片,以後能塞進更多運算核心。
記憶體控制器搬家,背後是系統思維的轉變
傳統 HBM 架構把記憶體控制器放在 XPU 運算晶粒上,這在過去不是問題,因為那時候瓶頸在運算速度,不在資料傳輸。但現在 AI 模型動輒兆級參數,資料進出的速度直接決定訓練時間。輝達的做法等於是把「交通警察」從繁忙的市中心調到交流道入口,市區道路瞬間多出四分之一的路面可以跑車。
這個架構調整的意義,不只在於性能提升。輝達也計畫建立標準化的 NVHBM 實作方式,由多家記憶體供應商驗證及提供產品。這招很有意思——一方面降低 AI 晶片業者整合不同記憶體供應商的工程難度,另一方面也縮短客製化 XPU 從設計到導入市場的時間。說穿了,輝達不只是賣技術,它在賣一個「讓你更快把產品生出來」的生態系。
編輯觀點:從產業面來看,輝達這步棋下得相當精準。記憶體控制器從 XPU 移到 HBM Base Die,表面上只是架構調整,實際上是在向客製化 AI 晶片市場遞出橄欖枝。過去設計一顆 AI 晶片,記憶體控制器怎麼搞、頻寬怎麼調、供應商怎麼換,每一關都是坑。輝達現在把這條路鋪平了,你要做的就是專心設計運算核心,其他我幫你搞定。對於那些想跟輝達 GPU 整合、但又不想被綁死的雲端業者來說,這幾乎是無法拒絕的提議。
AWS 為何搶著上車?Trainium 晶片的下一步
亞馬遜旗下 Annapurna Labs 是第一個跳進來合作的業者,這不意外。AWS 這幾年一直想把自己開發的 Trainium 晶片推到更多 AI 工作負載上,但客戶端要的從來不只是「有一顆 AI 晶片」,而是「這顆晶片能不能跟輝達 GPU 一起工作」。Annapurna Labs 下一代 Trainium 晶片從 Trainium4 開始支援 NVLink Fusion,意思是 AWS 的自製 AI 晶片未來可以跟輝達 GPU 透過共同的機架級架構整合。
這個合作背後是 NVLink Fusion 平台的延伸。輝達開放客戶使用 NVLink Chiplet、NVLink-C2C、NVLink Switch,以及 MGX 系統與機架等技術,讓第三方設計的 XPU、CPU 可以接入輝達的機架級平台。簡單講,輝達正在從「賣 GPU 晶片」變成「賣 AI 機架級解決方案的骨架」,你可以在這個骨架上長出自己的肌肉,但骨架是輝達的。
記憶體戰爭的下半場,比的是誰能讓生態系跑得更順
有趣的是,輝達這次不是把 HBM 頻寬硬拉到極限,而是用「釋放運算面積」這個角度來包裝 NVHBM。這說明了 AI 基礎設施的競爭,已經從單純比拚運算能力的軍備競賽,轉向運算、記憶體、網路與軟體的整體系統設計。你晶片算得再快,資料塞不進來、送不出去,客戶照樣翻桌。
對一般讀者來說,你可能覺得「關我什麼事」。但換個角度想,AI 訓練成本降下來,最終反映的是你每個月訂閱 AI 服務的價格,或是免費版本的功能會不會變多。AWS 搶先導入 NVHBM,意味著明年 Trainium 為基礎的雲端執行個體,很可能在性價比上會有不錯的表現。
話說回來,這項技術還有一個細節值得留意:輝達強調 NVHBM 採用與未來 GPU 相同的相關技術。這代表下一代輝達 GPU 也會用上同樣的架構,而 AWS 等於提前拿到了跟輝達自家 GPU 同級的記憶體技術。這個「先發優勢」能維持多久,取決於其他記憶體供應商什麼時候能端出同等級的產品。
從整個產業鏈來看,記憶體控制器從 XPU 移走的趨勢一旦確立,接下來會影響的不只是 AI 晶片設計,還包括 EDA 工具、IP 授權模式,甚至封裝測試的流程都會跟著變。輝達這次開的第一槍,後續效應會慢慢擴散出去。
如果你正在評估明年雲端 AI 訓練的基礎設施採購,或許可以多留意 AWS 搭配 Trainium4 的執行個體價格與效能表現。NVHBM 帶來的頻寬提升與功耗降低,在規模化部署時,長期營運成本的差距會很可觀。
首圖來源:輝達
本文改寫整理自公開新聞來源,原始報導由科技新報發布。
常見問題 FAQ
NVHBM 跟 HBM4E 差在哪裡?
NVHBM 最大的不同是把記憶體控制器從 XPU 晶粒移到 HBM 的 Base Die,頻寬提升 30%、功耗降低 15%,同時釋放最多 25% 的 XPU 運算面積。
AWS 為什麼是第一個合作夥伴?
因為 AWS 旗下的 Annapurna Labs 本來就在開發 Trainium 自製晶片,導入 NVHBM 可以讓 Trainium4 透過 NVLink Fusion 跟輝達 GPU 整合,對 AWS 的 AI 雲端服務有直接助益。
NVHBM 什麼時候會實際上市?
輝達尚未公布具體量產時程,但 AWS 的 Trainium4 將率先支援,預計在下一代產品導入時開始出貨。
這項技術對一般企業有什麼影響?
記憶體頻寬提升和功耗降低,代表 AI 訓練成本有機會下降,長期來看會反映在雲端服務的定價上,對需要大量 AI 算力的企業會是利多。
其他記憶體供應商會跟進嗎?
輝達已計畫建立標準化 NVHBM 實作方式,並由多家記憶體供應商驗證,未來其他供應商也會推出符合標準的產品。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。