英偉達旗艦 GPU 內存首次倒退:4-HI HBM 為什麼贏
Rubin Ultra 的 HBM 從承諾的 1TB 砍到 192GB,比現在出貨的 288GB 還少。這不是技術退步,是 DRAM 短缺下的產能配給:4-HI 堆疊良率更高,能榨出兩倍以上的 HBM cube。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
Rubin Ultra 從 1TB 砍到 192GB
去年 GTC 上英偉達預覽 Rubin Ultra 時說每個 package 1TB HBM:4 個 compute die、16 個 HBM4E stack、每個 die 32 gigabit(4GB)、16-HI 堆疊。一年半後實際變成 192GB HBM4:只剩 2 個 compute die、HBM4 每 die 3GB、8-HI 堆疊。這比 Blackwell Ultra 和 vanilla Rubin 的 288GB 還低,是英偉達旗艦 GPU 歷史上第一次下一代容量小於上一代。
— Myron Xie降規格是被 DRAM 供給逼的
動機主要是供給。DRAM 晶圓產能幾乎沒有新增,而加速器出貨量在漲,HBM 需求跟著漲。供應商和英偉達、Google、Broadcom 這些客戶算了一筆賬:在 TSMC 鎖定的 logic 產能是固定的,如果把這些 HBM 做成 12-HI cube,cube 數量不夠配平所有 logic。改成 8-HI,同樣晶圓能切出更多 cube,等式才平衡。這是產能配給,不是性能取捨。
— Myron Xie容量過了閾值,回報就遞減
推理確實需要足夠 HBM 容量來放模型權重和 KV cache,才能有效 batching。但一旦越過這個閾值,額外容量的回報遞減。同時 HBM 從明年起因短缺漲價,多買用不上的容量懲罰更重。所以「容量越多越好」的假設在成本曲線上不成立。
— Myron Xie參數規模沒跟上系統規模
Hopper 時代 8 卡 H200 節點共 640GB HBM,Llama 3.1 405B 量化後佔約 60%。今天最大的 Kimi K3 是 2.8 萬億參數,約 Llama 3.1 的六倍,但 MXFP4 量化把容量需求減半。放到 NVL72(72 卡 × 288GB)上,一套 K3 權重只佔約 8% 的 HBM 容量。系統規模漲得比模型快,容量壓力反而小了。
— Myron Xie後訓練和推理吃掉了算力大頭
模型參數沒暴漲,是因為性能可以從別處來:更多 reasoning、更多 post-training 和強化學習。而後訓練非常像推理,同樣偏向帶寬而非容量。結果是推理敏感的計算(後訓練 + 標準推理)迅速佔據主導,經典預訓練——真正需要大容量的那部分——在前沿實驗室總算力裡的佔比越來越小。
— Myron Xie4-HI 是帶寬的免費午餐
HBM 帶寬由 cube 和 SoC 之間的接口決定,HBM4/4E 有 2048 條數據線,每個 cube 最多支持 512 條,所以至少需要 4 層 DRAM 才能跑滿帶寬。但供應商按容量(美元/GB)收費,8-HI、12-HI 要為同樣帶寬付兩到三倍的錢。4-HI 的美元/帶寬性價比最好,只要容量夠用,就是近乎免費午餐。物理上也不能低於 4-HI。
— Myron Xie4-HI 良率更高,cube 翻倍
HBM 堆疊每加一層都有良率損失。假設單層良率 99%,1% 的損失疊 8 次或 12 次,遠高於只疊 4 次。4-HI 還有更長的量產歷史和更簡單的製造流程,往堆疊裡送電也更容易。所以 4-HI 可收穫的 HBM cube 數量比 8-HI 多一倍以上,瓶頸從 HBM 轉移到 logic 晶圓、substrate 和 PCB。
— Myron Xie內存短缺不會在這個十年緩解
為什麼內存廠賺翻卻不擴產?半導體制造前置時間極長:要先建潔淨室(這是短期產能加不上的頭號原因),再填設備,而設備本身受限於 ASML 的 EUV 和相關工具,ASML 一年只能造那麼多,因為它自己的供應鏈——比如做極平滑鏡子的供應商——也很長。Myron 給的 TLDR 是:內存短缺不會在這個十年內緩解。
— Myron Xie原話 · 已逐字校驗
the presumption from there was that you keep going taller
當時的假設是,你會一直往更高的堆疊走。
Myron Xie2:04
once you get beyond that threshold what we find is that the returns to that are diminishing
一旦越過那個閾值,我們發現額外容量的回報是遞減的。
Myron Xie5:13
the dollar per bandwidth proposition is much better off for 4 high
4-HI 的美元/帶寬性價比要好得多。
Myron Xie18:50
if it's like 99% yield for each, each layer, this is a simple example, the 99, that 1% yield loss compounded 8 times or 12 times, it's much higher than the yield loss if you compound that only 4 times
假設每層良率 99%,這只是個簡單例子,那 1% 的良率損失疊 8 次或 12 次,遠高於只疊 4 次的損失。
Myron Xie22:56
in terms of maximizing tokens per HBM wafers, this is like going to fall high is how you sort of best optimize for that
就每片 HBM 晶圓產出的 token 數最大化而言,走向 4-HI 才是最優解。
Myron Xie28:00
the loudest cries for fall high are coming from the labs
最強烈要求 4-HI 的聲音來自那些實驗室。
Myron Xie34:14
數字與實體
| Kimi K3 參數量 | 2.8 萬億 | 9:13 |
| NVL72 單套 K3 權重佔 HBM 容量比例 | 約 8% | 10:18 |
| HBM4/4E 每 cube 數據線 | 2048 條 | 16:46 |
| 內存短缺緩解時間 | 不在這個十年內(2030 前) | 32:08 |
術語
- HBM高帶寬內存
- 堆疊 DRAM,為 AI 加速器提供高帶寬內存。
- 4-HI / 8-HI / 12-HI4/8/12 層堆疊
- HBM cube 裡 DRAM die 的層數,層數越高容量越大但良率越低。
- KV cache鍵值緩存
- 推理時緩存注意力鍵值,佔用 HBM 容量,支持 batching。
- MXFP4MXFP4 量化格式
- 4 位浮點量化,把模型權重容量需求減半。
- scale-up domain縱向擴展域
- 通過高速互聯組成單一內存池的 GPU 集群,如 NVL72。
收聽指南
關注 AI 算力供應鏈的工程師、投資人和創業者,尤其是想搞懂 HBM 供給約束如何重塑 GPU 規格和內存廠格局的人。
開頭 0:00-1:01 的寒暄和文章背景介紹可以跳過。