RSS Amplifier

Andrew Lu on global semis and techs · Aug 7, 2026

Can Nvidia really cut Rubin Ultra HBM memory?

0
Sign in to vote or save

Andrew Lu on global Semi/Techs · Andrew Lu on global semis and techs

The Information 今天報導 Nvidia 因為高頻寬存儲記憶體HBM (High Bandwidth Memory) 持續缺貨及漲價逼近50%成本,最近採取積極的行動測試三種搭配不同HBM規格及容量組合的 Rubin Ultra GPU,試圖降低下一個世代 Rubin Ultra 機櫃中 HBM 的用量及成本。雖然降低HBM用量及成本也會影響AI晶片效能,但公司打算用其他方式(增加聯網頻寬及使用更佳效率存取資料)來彌補速度損失問題及推出各種低階版本的晶片組合,如搭配採用12顆HBM4(12-Hi HBM4)堆疊288GB,12顆HBM4e推疊384GB,不是用16顆HBM4e 滿配頂規堆疊的Rubin Ultra 模組。

為了成本考量,我們對於Nvidia 對 Rubin Ultra 進行 HBM 規格降規(將 16 顆 HBM4e 降為 8 顆或 12 顆 HBM4),在技術可行性效能影響上,需要從 CoWoS 封裝佈局、記憶體頻寬與大模型(LLM)算力瓶頸三個維度來分析:

Source: Andrew Lu on global semis/techs

Rubin Ultra 屬於典型 Memory-Bound(受限於記憶體頻寬與容量) 的 AI 算力平台。降規對不同工作負載的影響如下:

① 記憶體頻寬砍半/三分之一:推理推論(LLM Inference)吞吐量暴跌

  • 影響程度:極嚴重(下降 40% – 60%)

  • 原因:大語言模型在 Autoregressive Decoding(解碼階段) 時,高度依賴 HBM 頻寬(KV Cache 讀取與模型權重加載)。

  • 頻寬從 60 TB/s 降至 20-30 TB/s,意味著 Token 產生速度 (Tokens/sec/GPU) 將呈線性縮水,巨型 MoE 模型(如 GPT-5 級別)的單卡並行 Batch Size 必須大幅壓縮。大模型駐留、長上下文、大 KV Cache、高並發 inference、超大 batch 訓練時,容量不足會強制更多模型並行/流水線並行或 offload,增加通訊開銷與延遲,對「單卡放更大模型」的優勢大幅削弱;576 GB 級仍有一定優勢但遠低於 1 TB。

Read the original on andrewhclu.substack.com

Comments

Nothing yet. Say the first thing.

    Sign in to join the conversation.