世界太吵,來原聲聽播客

SemiAnalysis Weekly

英偉達旗艦 GPU 內存首次倒退:4-HI HBM 為什麼贏

Rubin Ultra 的 HBM 從承諾的 1TB 砍到 192GB,比現在出貨的 288GB 還少。這不是技術退步,是 DRAM 短缺下的產能配給:4-HI 堆疊良率更高,能榨出兩倍以上的 HBM cube。

算力HBM英偉達內存供應鏈

原視頻在 YouTube 上放不出來,用音頻聽:

一期把 HBM 高度之爭講透的節目:從良率、帶寬/容量定價到模型參數為何不再暴漲,信息密度高,後半段的推理比開頭更值錢。

核心論點 · 點時間戳可跳到原聲

2:04

Rubin Ultra 從 1TB 砍到 192GB

去年 GTC 上英偉達預覽 Rubin Ultra 時說每個 package 1TB HBM:4 個 compute die、16 個 HBM4E stack、每個 die 32 gigabit(4GB)、16-HI 堆疊。一年半後實際變成 192GB HBM4:只剩 2 個 compute die、HBM4 每 die 3GB、8-HI 堆疊。這比 Blackwell Ultra 和 vanilla Rubin 的 288GB 還低,是英偉達旗艦 GPU 歷史上第一次下一代容量小於上一代。

— Myron Xie
4:11

降規格是被 DRAM 供給逼的

動機主要是供給。DRAM 晶圓產能幾乎沒有新增,而加速器出貨量在漲,HBM 需求跟著漲。供應商和英偉達、Google、Broadcom 這些客戶算了一筆賬:在 TSMC 鎖定的 logic 產能是固定的,如果把這些 HBM 做成 12-HI cube,cube 數量不夠配平所有 logic。改成 8-HI,同樣晶圓能切出更多 cube,等式才平衡。這是產能配給,不是性能取捨。

— Myron Xie
5:13

容量過了閾值,回報就遞減

推理確實需要足夠 HBM 容量來放模型權重和 KV cache,才能有效 batching。但一旦越過這個閾值,額外容量的回報遞減。同時 HBM 從明年起因短缺漲價,多買用不上的容量懲罰更重。所以「容量越多越好」的假設在成本曲線上不成立。

— Myron Xie
9:13

參數規模沒跟上系統規模

Hopper 時代 8 卡 H200 節點共 640GB HBM,Llama 3.1 405B 量化後佔約 60%。今天最大的 Kimi K3 是 2.8 萬億參數,約 Llama 3.1 的六倍,但 MXFP4 量化把容量需求減半。放到 NVL72(72 卡 × 288GB)上,一套 K3 權重只佔約 8% 的 HBM 容量。系統規模漲得比模型快,容量壓力反而小了。

— Myron Xie
13:39

後訓練和推理吃掉了算力大頭

模型參數沒暴漲,是因為性能可以從別處來:更多 reasoning、更多 post-training 和強化學習。而後訓練非常像推理,同樣偏向帶寬而非容量。結果是推理敏感的計算(後訓練 + 標準推理)迅速佔據主導,經典預訓練——真正需要大容量的那部分——在前沿實驗室總算力裡的佔比越來越小。

— Myron Xie
16:46

4-HI 是帶寬的免費午餐

HBM 帶寬由 cube 和 SoC 之間的接口決定,HBM4/4E 有 2048 條數據線,每個 cube 最多支持 512 條,所以至少需要 4 層 DRAM 才能跑滿帶寬。但供應商按容量(美元/GB)收費,8-HI、12-HI 要為同樣帶寬付兩到三倍的錢。4-HI 的美元/帶寬性價比最好,只要容量夠用,就是近乎免費午餐。物理上也不能低於 4-HI。

— Myron Xie
21:56

4-HI 良率更高,cube 翻倍

HBM 堆疊每加一層都有良率損失。假設單層良率 99%,1% 的損失疊 8 次或 12 次,遠高於只疊 4 次。4-HI 還有更長的量產歷史和更簡單的製造流程,往堆疊裡送電也更容易。所以 4-HI 可收穫的 HBM cube 數量比 8-HI 多一倍以上,瓶頸從 HBM 轉移到 logic 晶圓、substrate 和 PCB。

— Myron Xie
32:08

內存短缺不會在這個十年緩解

為什麼內存廠賺翻卻不擴產?半導體制造前置時間極長:要先建潔淨室(這是短期產能加不上的頭號原因),再填設備,而設備本身受限於 ASML 的 EUV 和相關工具,ASML 一年只能造那麼多,因為它自己的供應鏈——比如做極平滑鏡子的供應商——也很長。Myron 給的 TLDR 是:內存短缺不會在這個十年內緩解。

— Myron Xie

原話 · 已逐字校驗

the presumption from there was that you keep going taller

當時的假設是,你會一直往更高的堆疊走。

Myron Xie2:04

once you get beyond that threshold what we find is that the returns to that are diminishing

一旦越過那個閾值,我們發現額外容量的回報是遞減的。

Myron Xie5:13

the dollar per bandwidth proposition is much better off for 4 high

4-HI 的美元/帶寬性價比要好得多。

Myron Xie18:50

if it's like 99% yield for each, each layer, this is a simple example, the 99, that 1% yield loss compounded 8 times or 12 times, it's much higher than the yield loss if you compound that only 4 times

假設每層良率 99%,這只是個簡單例子,那 1% 的良率損失疊 8 次或 12 次,遠高於只疊 4 次的損失。

Myron Xie22:56

in terms of maximizing tokens per HBM wafers, this is like going to fall high is how you sort of best optimize for that

就每片 HBM 晶圓產出的 token 數最大化而言,走向 4-HI 才是最優解。

Myron Xie28:00

the loudest cries for fall high are coming from the labs

最強烈要求 4-HI 的聲音來自那些實驗室。

Myron Xie34:14

數字與實體

Kimi K3 參數量2.8 萬億9:13
NVL72 單套 K3 權重佔 HBM 容量比例約 8%10:18
HBM4/4E 每 cube 數據線2048 條16:46
內存短缺緩解時間不在這個十年內(2030 前)32:08

術語

HBM高帶寬內存
堆疊 DRAM,為 AI 加速器提供高帶寬內存。
4-HI / 8-HI / 12-HI4/8/12 層堆疊
HBM cube 裡 DRAM die 的層數,層數越高容量越大但良率越低。
KV cache鍵值緩存
推理時緩存注意力鍵值,佔用 HBM 容量,支持 batching。
MXFP4MXFP4 量化格式
4 位浮點量化,把模型權重容量需求減半。
scale-up domain縱向擴展域
通過高速互聯組成單一內存池的 GPU 集群,如 NVL72。

收聽指南

誰該聽

關注 AI 算力供應鏈的工程師、投資人和創業者,尤其是想搞懂 HBM 供給約束如何重塑 GPU 規格和內存廠格局的人。

可跳過

開頭 0:00-1:01 的寒暄和文章背景介紹可以跳過。