HBM 堆得越高越慢,闪存堆叠要来抢它的位置
HBM 每加一层容量,单位带宽就被稀释一次;Sandisk 把 NAND 用同样的方式堆起来做 HBF,容量是 HBM4 的 8-16 倍,但读写慢两个数量级,且要重演 Optane 的软件难题。
核心论点 · 点时间戳可跳到原声
Prefill 吃算力,Decode 吃内存
Prefill 阶段模型并行处理输入内容——用户 prompt、系统 prompt、历史回复、工具调用、图像、音频、内部思维链,Attention 为每个 token 产出 Query、Key、Value 向量,后两者写进 KV Cache。Prefill 结束时你拿到输入的 KV Cache,这是算第一个输出 token 的前提。Decode 阶段则查 KV Cache 逐个吐 token,每生成一个新 token 就把它的 key 和 value 插回缓存。两者是截然不同的活:Prefill 受算力限制,因为可以并行;Decode 一个一个来,是内存受限的,GPU 的逻辑电路只能干等数据从内存加载。
模型权重和 KV Cache 同时爆炸
内存业要同时应付两种指数级增长的需求。一是模型权重:Kimi K3 总参数 2.8 万亿,8-bit 精度下约 2.8 TB,而 K2.7 只有 1 TB,DeepSeek V3 是 671 GB。二是 KV Cache:长时间运行的 agent 会跑几个小时,思维链超长,KV Cache 随之变得极其庞大。上下文窗口填得越满,agent 越糊涂。当前上下文窗口约 100 万 token,折合 1500 到 3000 页文本,读文档或大型代码库够用,但换成音频只有 11-12 小时,换成高清视频只有一小时。压缩上下文会让细节变模糊,像压 JPG;把 KV Cache 分块、把不常读的块丢到 SSD 是另一条路,但常读的块必须留在 HBM。
HBM 堆得越高,单位带宽越薄
HBM 是带逻辑基 die、上面叠 4/8/12/16 层核心存储 die 的 3D 堆叠结构,TSV 穿过 die 的中央区域把数据往下送。问题在于:中央区域能放的 TSV 数量有限,所以想加容量就必然摊薄每 GB 的带宽,增量容量和带宽的价格随时间上涨。Hot Chips 2026 内存场次上,SemiAnalysis 的分析师在 SK hynix 演讲后的 Q&A 里直接发问:单芯片内部带宽在 cell 层面约每平方厘米 20 TB,而 HBM4 做到 20 层厚,每层大约只有单芯片带宽的 20%,「你把吞吐量稀释得太厉害了」。Pat Gelsinger 当着 SK hynix 副总裁的面说 HBM 是「lousy memory」,那位副总裁 Kim Ho-sik 部分认同,说 HBM 不是 Memory Wall 问题的最终答案,但仍是当下市场上最好的东西。
HBF 用堆 HBM 的方式堆 NAND
High Bandwidth Flash 顾名思义,就是用 HBM 堆叠和连接 DRAM die 的同样方式去堆叠、连接 flash die,靠先进封装在单个封装内堆 flash die,这和单片式堆存储单元的 3D NAND 不是一回事。NAND 本来是替代硬盘的,为容量优化;HBF 把每栈容量提高 8-16 倍,512 GB 对 HBM4 单栈约 36 GB,同时保留 HBM 级别的高带宽,理论上还能更高,因为更多 NAND 单元对 GPU 开放。当前 HBF 规格有效带宽可达 3 TB/s,高于 Micron HBM3E 的 1.2 TB/s,与 Micron 和 Samsung 的 HBM4 数字相当。但按容量折算,HBF 的带宽数字要小得多。
NAND 不是 DRAM:慢、会写坏、还费电
代价有三。第一,NAND 的读和写(正式说法是 program)速度比 HBM 慢约两个数量级,写又比读更慢,延迟是根本性的;Sandisk 可以优化 die 降低延迟,但很可能要牺牲数据保持能力或每 bit 成本。第二,耐久度:NAND 存储单元写几千次就会磨损,而 DRAM 单元基本没有耐久上限,所以必须控制写入 HBF 的次数。第三,功耗和散热:驱动这些大块 HBF 立方体需要更多电力,这在今天不是小事;功耗上去热量就上去,会导致系统降频,或让耐久问题更糟。
Sandisk 拉上对手和 Google 一起定标准
用 TSV 堆叠连接 NAND 的想法早就有,2019 年 IEEE 3D Systems Integration Conference 上 Honda Research Institute Japan 的 Koji Sakui 和 Takayuki Ohba 就提出过用无凸点 TSV 堆 flash die,叫 High Bandwidth NAND。Sandisk 在 2025 年 2 月的 Future FWD 投资者日上正式推出 HBF,称架构开发了一年,有主要 AI 玩家参与;相关首件专利申请在 2024 年 5 月提交。2025 年 7 月成立技术顾问委员会,David Patterson 和 Raja Koduri 加入。8 月 Sandisk 宣布与 SK hynix 签署谅解备忘录共同标准化规格——规格只规定内存如何与芯片其余部分接口,不规定堆栈内部怎么工作,所以竞争者可以合作做大生态、又在自家产品内部规格上竞争,同时给客户一个可信的第二供应商。Google 和 Tenstorrent 也加入了 HBF 联盟。2026 年 8 月,Open Compute Project 发布首个公开的 0.7.0 版规格。Samsung 有自己的版本,叫 zNAND-O。
HBF 想挤进 Tier 1,和 HBM 并排
内存层级里,Tier 0 是 GPU/TPU 的 SRAM,最快但没容量;Tier 1 是 GPU HBM,片外但离芯片最近;Tier 2 是系统 DRAM,容量更高但离 GPU 更远。Sandisk 的设想是让 GPU 厂商把 HBF 和 HBM 并排放在 Tier 1:HBM 存「热」数据,HBF 靠容量存「温」数据。GPU interposer 的「海岸线」只能容纳一定数量的内存芯片,现在全是 HBM,架构师要决定拿多少换成 HBF。原来八栈 24GB HBM 的 GPU 总共约 192 GB,换成六栈 HBF 加两栈 HBM,系统就有 3.12 TB。因为 flash 耐久问题,这里放的应该是读多写少的数据,多数人认为是模型权重,也有人提出 KV Cache。
便宜的内存容量不等于便宜的 token
Hot Chips 2026 上两位架构师 A. Agrawal 和 R. Giduthuri 讨论了把 HBF 集成进 AI 计算的挑战,核心一点是:系统是按服务 token 的能力来评判的,HBF 有便宜的内存容量,并不一对一地意味着更便宜的 token——如果数据不能足够快地从 HBF 里取出来,加速器就得等,token 产出就受损。所以 HBF 不是无脑选择,需要大量软件支持。北京大学五位加复旦一位研究者写的论文《HBF Sucks?》指出 HBF 不是 SSD 的即插即用替代品,软件必须仔细挑选哪些数据进 HBF,比如共享 prompt 这类高频使用的数据。模型类型也要考虑:Agrawal 和 Giduthuri 提到 mixture-of-experts 模型可能更适合 HBF,因为它需要容量装下所有专家,但每个 token 只读其中少数几个,所以较低的每 GB 带宽可以接受。
Optane 的教训:技术好,别的地方全崩
Intel Optane(底层技术叫 3D XPoint)是相变存储器,非易失像 NAND,读写速度接近 DRAM,价格居中,Intel 把它定位成能和 CPU、flash 协同的东西,讲的是「温数据」——比如想要 DRAM 级延迟但太大装不进 DRAM 的数据库。用例有意思,但需要应用开发者写软件支持。后来 3D NAND 崛起压低了 flash 的每 bit 成本,Optane 的经济性被瓦解,它始终没能在 DRAM 和 NAND 之间找到自己的位置;Micron 退出,只剩 Intel 一家,没人愿意把 CPU 和内存都押在单一供应商身上,于是结束。这对 HBF 特别相关:Sandisk 现在主推 HBF 的核心高管、EVP 兼 CTO Alper Ilkbahar 曾在 Intel 担任 Optane 集团副总裁兼总经理五年。DRAM 短缺的今天,有人感慨 Intel 应该多留 Optane 几年,用它的容量和延迟存推理用的模型权重。但一位从软件侧接触过 Optane 的人说,背地里 Optane 做不到 Intel 宣称的事。有人说 HBF 的优势是起点是大家熟悉的 flash,市场表现会更好;反方观点是 Optane 的 PCM 单元本身工作得很好,核心技术很棒,失败的是控制器和上市策略这些周边。HBF 要避开同样的坑。
原话 · 已逐字校验
When you look at the internal bandwidth of a single chip, you see about 20 terabytes per square centimeter at the cell level ... You talk about going to 20 levels thick at HBM4 so maybe you are at 4 terabytes per square centimeter in a stack of 20, so you are talking about having 20% of the bandwidth of one chip [for each] layer of 20. You've diluted the throughput enormously. Why is that the correct way to go? Why are you so focused on going taller rather than going faster?
看单芯片的内部带宽,在 cell 层面大约是每平方厘米 20 TB……你说 HBM4 要做到 20 层厚,那 20 层堆栈里也许就是每平方厘米 4 TB,也就是说 20 层里每一层只有单芯片带宽的 20%。你把吞吐量稀释得太厉害了。为什么这是正确的方向?为什么你们如此专注于堆得更高,而不是跑得更快?
The way HBM works right now, you cannot get the additional gigabytes of capacity without reducing bandwidth per gigabyte because there are only so many TSVs available in the central area to move data.
按 HBM 现在的工作方式,你没法在不降低每 GB 带宽的情况下拿到额外的 GB 容量,因为中央区域能用来搬数据的 TSV 就那么多。
While Sandisk can optimize the dies for lower latency - likely sacrificing either data retention or cost-per-bit in the process - this gap is fundamental. You will need to wait longer for your data than with DRAM, end of story.
Sandisk 可以优化 die 来降低延迟——过程中很可能要牺牲数据保持能力或每 bit 成本——但这个差距是根本性的。你的数据就是要比在 DRAM 里等得更久,没别的说法。
A core point was that systems are judged on how well they can serve tokens ... and just because HBF has cheap memory capacity does not one-to-one mean cheaper tokens. Because if we can't get all that data out of the HBF fast enough, and that makes the accelerator wait, then token output suffers.
一个核心观点是,系统是按服务 token 的能力来评判的……HBF 有便宜的内存容量,并不一对一地意味着更便宜的 token。因为如果我们不能足够快地把那些数据从 HBF 里取出来,让加速器干等,token 产出就会受损。
But someone who once worked with Optane from the software side told me that - behind the scenes - Optane just couldn't do what Intel claimed it can.
但一位曾在软件侧与 Optane 打过交道的人告诉我,在幕后,Optane 就是做不到 Intel 宣称它能做的事。
But the counterpoint to that is that Optane's actual PCM cells worked brilliantly. The core technology was great. It was most everything else - like the controller and go-to market strategy - that failed to live up to its promise.
但反方观点是,Optane 实际的 PCM 单元工作得非常出色。核心技术很棒。是其他几乎所有东西——比如控制器和上市策略——没能兑现承诺。
数字与实体
| Kimi K3 总参数量 | 2.8 万亿 | 3:07 |
| 当前上下文窗口 | 约 100 万 token,折合 1500-3000 页文本 | 4:11 |
术语
- Prefill预填充
- 推理第一阶段,并行处理全部输入并生成 KV Cache,受算力限制。
- Decode解码
- 推理第二阶段,查 KV Cache 逐个生成 token,受内存带宽限制。
- KV Cache键值缓存
- Attention 为每个 token 产出的 Key/Value 向量缓存,避免重复计算。
- HBF高带宽闪存
- 用 HBM 的堆叠封装方式连接 NAND die,容量大但读写慢两个数量级。
- 3D XPoint / Optane相变存储器
- Intel 与 Micron 推出的非易失内存,速度近 DRAM,最终因经济性失败。
- mixture-of-experts混合专家模型
- 每个 token 只激活部分专家,需要容量装下全部专家但只读少数。
收听指南
关注 AI 推理成本与内存架构的工程师、芯片与存储方向的投资人,以及想搞懂 prefill/decode/KV Cache 和 HBM 瓶颈的人。
开头关于 Baader-Meinhof 和 Hot Chips 见闻的闲聊可跳过。