世界太吵,来原声听播客

SemiAnalysis Weekly

英伟达旗舰 GPU 内存首次倒退:4-HI HBM 为什么赢

Rubin Ultra 的 HBM 从承诺的 1TB 砍到 192GB,比现在出货的 288GB 还少。这不是技术退步,是 DRAM 短缺下的产能配给:4-HI 堆叠良率更高,能榨出两倍以上的 HBM cube。

算力HBM英伟达内存供应链

原视频在 YouTube 上放不出来,用音频听:

一期把 HBM 高度之争讲透的节目:从良率、带宽/容量定价到模型参数为何不再暴涨,信息密度高,后半段的推理比开头更值钱。

核心论点 · 点时间戳可跳到原声

2:04

Rubin Ultra 从 1TB 砍到 192GB

去年 GTC 上英伟达预览 Rubin Ultra 时说每个 package 1TB HBM:4 个 compute die、16 个 HBM4E stack、每个 die 32 gigabit(4GB)、16-HI 堆叠。一年半后实际变成 192GB HBM4:只剩 2 个 compute die、HBM4 每 die 3GB、8-HI 堆叠。这比 Blackwell Ultra 和 vanilla Rubin 的 288GB 还低,是英伟达旗舰 GPU 历史上第一次下一代容量小于上一代。

— Myron Xie
4:11

降规格是被 DRAM 供给逼的

动机主要是供给。DRAM 晶圆产能几乎没有新增,而加速器出货量在涨,HBM 需求跟着涨。供应商和英伟达、Google、Broadcom 这些客户算了一笔账:在 TSMC 锁定的 logic 产能是固定的,如果把这些 HBM 做成 12-HI cube,cube 数量不够配平所有 logic。改成 8-HI,同样晶圆能切出更多 cube,等式才平衡。这是产能配给,不是性能取舍。

— Myron Xie
5:13

容量过了阈值,回报就递减

推理确实需要足够 HBM 容量来放模型权重和 KV cache,才能有效 batching。但一旦越过这个阈值,额外容量的回报递减。同时 HBM 从明年起因短缺涨价,多买用不上的容量惩罚更重。所以「容量越多越好」的假设在成本曲线上不成立。

— Myron Xie
9:13

参数规模没跟上系统规模

Hopper 时代 8 卡 H200 节点共 640GB HBM,Llama 3.1 405B 量化后占约 60%。今天最大的 Kimi K3 是 2.8 万亿参数,约 Llama 3.1 的六倍,但 MXFP4 量化把容量需求减半。放到 NVL72(72 卡 × 288GB)上,一套 K3 权重只占约 8% 的 HBM 容量。系统规模涨得比模型快,容量压力反而小了。

— Myron Xie
13:39

后训练和推理吃掉了算力大头

模型参数没暴涨,是因为性能可以从别处来:更多 reasoning、更多 post-training 和强化学习。而后训练非常像推理,同样偏向带宽而非容量。结果是推理敏感的计算(后训练 + 标准推理)迅速占据主导,经典预训练——真正需要大容量的那部分——在前沿实验室总算力里的占比越来越小。

— Myron Xie
16:46

4-HI 是带宽的免费午餐

HBM 带宽由 cube 和 SoC 之间的接口决定,HBM4/4E 有 2048 条数据线,每个 cube 最多支持 512 条,所以至少需要 4 层 DRAM 才能跑满带宽。但供应商按容量(美元/GB)收费,8-HI、12-HI 要为同样带宽付两到三倍的钱。4-HI 的美元/带宽性价比最好,只要容量够用,就是近乎免费午餐。物理上也不能低于 4-HI。

— Myron Xie
21:56

4-HI 良率更高,cube 翻倍

HBM 堆叠每加一层都有良率损失。假设单层良率 99%,1% 的损失叠 8 次或 12 次,远高于只叠 4 次。4-HI 还有更长的量产历史和更简单的制造流程,往堆叠里送电也更容易。所以 4-HI 可收获的 HBM cube 数量比 8-HI 多一倍以上,瓶颈从 HBM 转移到 logic 晶圆、substrate 和 PCB。

— Myron Xie
32:08

内存短缺不会在这个十年缓解

为什么内存厂赚翻却不扩产?半导体制造前置时间极长:要先建洁净室(这是短期产能加不上的头号原因),再填设备,而设备本身受限于 ASML 的 EUV 和相关工具,ASML 一年只能造那么多,因为它自己的供应链——比如做极平滑镜子的供应商——也很长。Myron 给的 TLDR 是:内存短缺不会在这个十年内缓解。

— Myron Xie

原话 · 已逐字校验

the presumption from there was that you keep going taller

当时的假设是,你会一直往更高的堆叠走。

Myron Xie2:04

once you get beyond that threshold what we find is that the returns to that are diminishing

一旦越过那个阈值,我们发现额外容量的回报是递减的。

Myron Xie5:13

the dollar per bandwidth proposition is much better off for 4 high

4-HI 的美元/带宽性价比要好得多。

Myron Xie18:50

if it's like 99% yield for each, each layer, this is a simple example, the 99, that 1% yield loss compounded 8 times or 12 times, it's much higher than the yield loss if you compound that only 4 times

假设每层良率 99%,这只是个简单例子,那 1% 的良率损失叠 8 次或 12 次,远高于只叠 4 次的损失。

Myron Xie22:56

in terms of maximizing tokens per HBM wafers, this is like going to fall high is how you sort of best optimize for that

就每片 HBM 晶圆产出的 token 数最大化而言,走向 4-HI 才是最优解。

Myron Xie28:00

the loudest cries for fall high are coming from the labs

最强烈要求 4-HI 的声音来自那些实验室。

Myron Xie34:14

数字与实体

Kimi K3 参数量2.8 万亿9:13
NVL72 单套 K3 权重占 HBM 容量比例约 8%10:18
HBM4/4E 每 cube 数据线2048 条16:46
内存短缺缓解时间不在这个十年内(2030 前)32:08

术语

HBM高带宽内存
堆叠 DRAM,为 AI 加速器提供高带宽内存。
4-HI / 8-HI / 12-HI4/8/12 层堆叠
HBM cube 里 DRAM die 的层数,层数越高容量越大但良率越低。
KV cache键值缓存
推理时缓存注意力键值,占用 HBM 容量,支持 batching。
MXFP4MXFP4 量化格式
4 位浮点量化,把模型权重容量需求减半。
scale-up domain纵向扩展域
通过高速互联组成单一内存池的 GPU 集群,如 NVL72。

收听指南

谁该听

关注 AI 算力供应链的工程师、投资人和创业者,尤其是想搞懂 HBM 供给约束如何重塑 GPU 规格和内存厂格局的人。

可跳过

开头 0:00-1:01 的寒暄和文章背景介绍可以跳过。