HBM 堆得越高越慢,閃存堆疊要來搶它的位置
HBM 每加一層容量,單位帶寬就被稀釋一次;Sandisk 把 NAND 用同樣的方式堆起來做 HBF,容量是 HBM4 的 8-16 倍,但讀寫慢兩個數量級,且要重演 Optane 的軟件難題。
核心論點 · 點時間戳可跳到原聲
Prefill 吃算力,Decode 吃內存
Prefill 階段模型並行處理輸入內容——用戶 prompt、系統 prompt、歷史回覆、工具調用、圖像、音頻、內部思維鏈,Attention 為每個 token 產出 Query、Key、Value 向量,後兩者寫進 KV Cache。Prefill 結束時你拿到輸入的 KV Cache,這是算第一個輸出 token 的前提。Decode 階段則查 KV Cache 逐個吐 token,每生成一個新 token 就把它的 key 和 value 插回緩存。兩者是截然不同的活:Prefill 受算力限制,因為可以並行;Decode 一個一個來,是內存受限的,GPU 的邏輯電路只能乾等數據從內存加載。
模型權重和 KV Cache 同時爆炸
內存業要同時應付兩種指數級增長的需求。一是模型權重:Kimi K3 總參數 2.8 萬億,8-bit 精度下約 2.8 TB,而 K2.7 只有 1 TB,DeepSeek V3 是 671 GB。二是 KV Cache:長時間運行的 agent 會跑幾個小時,思維鏈超長,KV Cache 隨之變得極其龐大。上下文窗口填得越滿,agent 越糊塗。當前上下文窗口約 100 萬 token,摺合 1500 到 3000 頁文本,讀文檔或大型代碼庫夠用,但換成音頻只有 11-12 小時,換成高清視頻只有一小時。壓縮上下文會讓細節變模糊,像壓 JPG;把 KV Cache 分塊、把不常讀的塊丟到 SSD 是另一條路,但常讀的塊必須留在 HBM。
HBM 堆得越高,單位帶寬越薄
HBM 是帶邏輯基 die、上面疊 4/8/12/16 層核心存儲 die 的 3D 堆疊結構,TSV 穿過 die 的中央區域把數據往下送。問題在於:中央區域能放的 TSV 數量有限,所以想加容量就必然攤薄每 GB 的帶寬,增量容量和帶寬的價格隨時間上漲。Hot Chips 2026 內存場次上,SemiAnalysis 的分析師在 SK hynix 演講後的 Q&A 裡直接發問:單芯片內部帶寬在 cell 層面約每平方釐米 20 TB,而 HBM4 做到 20 層厚,每層大約只有單芯片帶寬的 20%,「你把吞吐量稀釋得太厲害了」。Pat Gelsinger 當著 SK hynix 副總裁的面說 HBM 是「lousy memory」,那位副總裁 Kim Ho-sik 部分認同,說 HBM 不是 Memory Wall 問題的最終答案,但仍是當下市場上最好的東西。
HBF 用堆 HBM 的方式堆 NAND
High Bandwidth Flash 顧名思義,就是用 HBM 堆疊和連接 DRAM die 的同樣方式去堆疊、連接 flash die,靠先進封裝在單個封裝內堆 flash die,這和單片式堆存儲單元的 3D NAND 不是一回事。NAND 本來是替代硬盤的,為容量優化;HBF 把每棧容量提高 8-16 倍,512 GB 對 HBM4 單棧約 36 GB,同時保留 HBM 級別的高帶寬,理論上還能更高,因為更多 NAND 單元對 GPU 開放。當前 HBF 規格有效帶寬可達 3 TB/s,高於 Micron HBM3E 的 1.2 TB/s,與 Micron 和 Samsung 的 HBM4 數字相當。但按容量折算,HBF 的帶寬數字要小得多。
NAND 不是 DRAM:慢、會寫壞、還費電
代價有三。第一,NAND 的讀和寫(正式說法是 program)速度比 HBM 慢約兩個數量級,寫又比讀更慢,延遲是根本性的;Sandisk 可以優化 die 降低延遲,但很可能要犧牲數據保持能力或每 bit 成本。第二,耐久度:NAND 存儲單元寫幾千次就會磨損,而 DRAM 單元基本沒有耐久上限,所以必須控制寫入 HBF 的次數。第三,功耗和散熱:驅動這些大塊 HBF 立方體需要更多電力,這在今天不是小事;功耗上去熱量就上去,會導致系統降頻,或讓耐久問題更糟。
Sandisk 拉上對手和 Google 一起定標準
用 TSV 堆疊連接 NAND 的想法早就有,2019 年 IEEE 3D Systems Integration Conference 上 Honda Research Institute Japan 的 Koji Sakui 和 Takayuki Ohba 就提出過用無凸點 TSV 堆 flash die,叫 High Bandwidth NAND。Sandisk 在 2025 年 2 月的 Future FWD 投資者日上正式推出 HBF,稱架構開發了一年,有主要 AI 玩家參與;相關首件專利申請在 2024 年 5 月提交。2025 年 7 月成立技術顧問委員會,David Patterson 和 Raja Koduri 加入。8 月 Sandisk 宣布與 SK hynix 簽署諒解備忘錄共同標準化規格——規格只規定內存如何與芯片其餘部分接口,不規定堆棧內部怎麼工作,所以競爭者可以合作做大生態、又在自家產品內部規格上競爭,同時給客戶一個可信的第二供應商。Google 和 Tenstorrent 也加入了 HBF 聯盟。2026 年 8 月,Open Compute Project 發布首個公開的 0.7.0 版規格。Samsung 有自己的版本,叫 zNAND-O。
HBF 想擠進 Tier 1,和 HBM 並排
內存層級裡,Tier 0 是 GPU/TPU 的 SRAM,最快但沒容量;Tier 1 是 GPU HBM,片外但離芯片最近;Tier 2 是系統 DRAM,容量更高但離 GPU 更遠。Sandisk 的設想是讓 GPU 廠商把 HBF 和 HBM 並排放在 Tier 1:HBM 存「熱」數據,HBF 靠容量存「溫」數據。GPU interposer 的「海岸線」只能容納一定數量的內存芯片,現在全是 HBM,架構師要決定拿多少換成 HBF。原來八棧 24GB HBM 的 GPU 總共約 192 GB,換成六棧 HBF 加兩棧 HBM,系統就有 3.12 TB。因為 flash 耐久問題,這裡放的應該是讀多寫少的數據,多數人認為是模型權重,也有人提出 KV Cache。
便宜的內存容量不等於便宜的 token
Hot Chips 2026 上兩位架構師 A. Agrawal 和 R. Giduthuri 討論了把 HBF 集成進 AI 計算的挑戰,核心一點是:系統是按服務 token 的能力來評判的,HBF 有便宜的內存容量,並不一對一地意味著更便宜的 token——如果數據不能足夠快地從 HBF 裡取出來,加速器就得等,token 產出就受損。所以 HBF 不是無腦選擇,需要大量軟件支持。北京大學五位加復旦一位研究者寫的論文《HBF Sucks?》指出 HBF 不是 SSD 的即插即用替代品,軟件必須仔細挑選哪些數據進 HBF,比如共享 prompt 這類高頻使用的數據。模型類型也要考慮:Agrawal 和 Giduthuri 提到 mixture-of-experts 模型可能更適合 HBF,因為它需要容量裝下所有專家,但每個 token 只讀其中少數幾個,所以較低的每 GB 帶寬可以接受。
Optane 的教訓:技術好,別的地方全崩
Intel Optane(底層技術叫 3D XPoint)是相變存儲器,非易失像 NAND,讀寫速度接近 DRAM,價格居中,Intel 把它定位成能和 CPU、flash 協同的東西,講的是「溫數據」——比如想要 DRAM 級延遲但太大裝不進 DRAM 的數據庫。用例有意思,但需要應用開發者寫軟件支持。後來 3D NAND 崛起壓低了 flash 的每 bit 成本,Optane 的經濟性被瓦解,它始終沒能在 DRAM 和 NAND 之間找到自己的位置;Micron 退出,只剩 Intel 一家,沒人願意把 CPU 和內存都押在單一供應商身上,於是結束。這對 HBF 特別相關:Sandisk 現在主推 HBF 的核心高管、EVP 兼 CTO Alper Ilkbahar 曾在 Intel 擔任 Optane 集團副總裁兼總經理五年。DRAM 短缺的今天,有人感慨 Intel 應該多留 Optane 幾年,用它的容量和延遲存推理用的模型權重。但一位從軟件側接觸過 Optane 的人說,背地裡 Optane 做不到 Intel 宣稱的事。有人說 HBF 的優勢是起點是大家熟悉的 flash,市場表現會更好;反方觀點是 Optane 的 PCM 單元本身工作得很好,核心技術很棒,失敗的是控制器和上市策略這些周邊。HBF 要避開同樣的坑。
原話 · 已逐字校驗
When you look at the internal bandwidth of a single chip, you see about 20 terabytes per square centimeter at the cell level ... You talk about going to 20 levels thick at HBM4 so maybe you are at 4 terabytes per square centimeter in a stack of 20, so you are talking about having 20% of the bandwidth of one chip [for each] layer of 20. You've diluted the throughput enormously. Why is that the correct way to go? Why are you so focused on going taller rather than going faster?
看單芯片的內部帶寬,在 cell 層面大約是每平方釐米 20 TB……你說 HBM4 要做到 20 層厚,那 20 層堆棧裡也許就是每平方釐米 4 TB,也就是說 20 層裡每一層只有單芯片帶寬的 20%。你把吞吐量稀釋得太厲害了。為什麼這是正確的方向?為什麼你們如此專注於堆得更高,而不是跑得更快?
The way HBM works right now, you cannot get the additional gigabytes of capacity without reducing bandwidth per gigabyte because there are only so many TSVs available in the central area to move data.
按 HBM 現在的工作方式,你沒法在不降低每 GB 帶寬的情況下拿到額外的 GB 容量,因為中央區域能用來搬數據的 TSV 就那麼多。
While Sandisk can optimize the dies for lower latency - likely sacrificing either data retention or cost-per-bit in the process - this gap is fundamental. You will need to wait longer for your data than with DRAM, end of story.
Sandisk 可以優化 die 來降低延遲——過程中很可能要犧牲數據保持能力或每 bit 成本——但這個差距是根本性的。你的數據就是要比在 DRAM 裡等得更久,沒別的說法。
A core point was that systems are judged on how well they can serve tokens ... and just because HBF has cheap memory capacity does not one-to-one mean cheaper tokens. Because if we can't get all that data out of the HBF fast enough, and that makes the accelerator wait, then token output suffers.
一個核心觀點是,系統是按服務 token 的能力來評判的……HBF 有便宜的內存容量,並不一對一地意味著更便宜的 token。因為如果我們不能足夠快地把那些數據從 HBF 裡取出來,讓加速器乾等,token 產出就會受損。
But someone who once worked with Optane from the software side told me that - behind the scenes - Optane just couldn't do what Intel claimed it can.
但一位曾在軟件側與 Optane 打過交道的人告訴我,在幕後,Optane 就是做不到 Intel 宣稱它能做的事。
But the counterpoint to that is that Optane's actual PCM cells worked brilliantly. The core technology was great. It was most everything else - like the controller and go-to market strategy - that failed to live up to its promise.
但反方觀點是,Optane 實際的 PCM 單元工作得非常出色。核心技術很棒。是其他幾乎所有東西——比如控制器和上市策略——沒能兌現承諾。
數字與實體
| Kimi K3 總參數量 | 2.8 萬億 | 3:07 |
| 當前上下文窗口 | 約 100 萬 token,摺合 1500-3000 頁文本 | 4:11 |
術語
- Prefill預填充
- 推理第一階段,並行處理全部輸入並生成 KV Cache,受算力限制。
- Decode解碼
- 推理第二階段,查 KV Cache 逐個生成 token,受內存帶寬限制。
- KV Cache鍵值緩存
- Attention 為每個 token 產出的 Key/Value 向量緩存,避免重複計算。
- HBF高帶寬閃存
- 用 HBM 的堆疊封裝方式連接 NAND die,容量大但讀寫慢兩個數量級。
- 3D XPoint / Optane相變存儲器
- Intel 與 Micron 推出的非易失內存,速度近 DRAM,最終因經濟性失敗。
- mixture-of-experts混合專家模型
- 每個 token 只激活部分專家,需要容量裝下全部專家但只讀少數。
收聽指南
關注 AI 推理成本與內存架構的工程師、芯片與存儲方向的投資人,以及想搞懂 prefill/decode/KV Cache 和 HBM 瓶頸的人。
開頭關於 Baader-Meinhof 和 Hot Chips 見聞的閒聊可跳過。