推理芯片繞過CUDA是必然,但SRAM的窗口未必一直開著
訓練拼算力、推理拼帶寬,Groq和Cerebras都押SRAM,但一個為確定性打折、一個為良率打折;OpenAI卻選了最貴的HBM4,因為它缺的是電不是錢。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
訓練賭算力,推理賭帶寬
訓練時代沒人能靠訓練本身賺錢,所以成本不可量化,大家只想賭一個最強集群;推理時代賬能算清楚——用戶為每百萬Token付多少錢,我推這百萬Token花多少成本。更本質的是計算密度:訓練有海量數據把算力喂滿,推理的decode階段是嚴格自迴歸的,必須一個Token一個Token產生,而每產生一個Token都要把整個模型從存儲介質讀進計算單元。所以推理的核心矛盾從算力變成了內存帶寬。
— 子揚SRAM是共識,但兩家分道揚鑣
Groq和Cerebras都在Transformer出現前就看到了帶寬需求,最後都收斂到SRAM——因為SRAM的帶寬絕對值和每塊錢買到的帶寬都比HBM高兩三個數量級。代價是容量:DRAM一個晶體管加一個電容存一個比特,SRAM要六個晶體管,單芯片容量可能比HBM低兩個數量級。於是只能把系統做大,幾百上千顆芯片把模型權重全放下,瓶頸隨即從容量變成集群通信調度。這時兩家分歧:Groq把調度全部提前到編譯期,Cerebras乾脆把一櫃子芯片塞進一整片晶圓。
— MarkGroq的靜態調度撞上MoE的動態性
Groq圍繞編譯器設計硬件,把確定性做到極致,運行時沒有調度開銷。但MoE出現後,每個Token在128個專家裡激活8個,選哪幾個是運行時決定的,編譯期無法預測。靜態方案只有兩條路:要麼保守地把Token都送過去,讓一部分芯片空轉;要麼換一種切模型的方式,但現在的模型很難用專家以外的維度切乾淨。空轉只影響性價比,不影響它依然很快,所以Groq仍是GPU之外較好的選擇。
— MarkCerebras為良率付出的代價
單芯片尺寸極限約800平方毫米,一個晶圓能切三四十顆,良率50%還能出20顆好的。但Cerebras整個晶圓就是一顆產品,只要瑕疵超過它能接受的30%,整片晶圓作廢。這不是掩模成本(掩模可以攤薄),而是每造10個可能9個不能用。所以它可能做到10倍英偉達的帶寬,但成本是HBM的3倍,帶寬性價比要打折。Groq為確定性打折,Cerebras為良率成本打折,折扣最終都打到Token成本上。
— Mark推理時代CUDA一定會被繞過
TPU、Trainium都沒有一丁點要兼容CUDA,但大家仍覺得TPU軟件難用,Anthropic能大量採購是因為很多工程師來自谷歌、懂JAX。關鍵變化在於:訓練時代大家願意為軟件好用買單,推理時代天平倒向性能和性價比。只要不是很多個難問題、而是一個難問題,把Transformer所有算子在新芯片上寫出來,商業邏輯就通了;再加上AI Coding加速算子優化,軟件棧門檻被大幅降低。DeepSeek寧願寫底層PTX彙編做優化,就是這個邏輯。
— 子揚推理越快,模型越聰明
Agent大規模爆發後,大量Token不是給人讀的,是給別的Agent讀的,人閱讀速度100 Token每秒就到頂了。但推理速度的意義不在交互變快,而在同樣一分鐘的等待裡,模型能用10倍Token做更多內部思考,從而更聰明。老黃PPT橫軸標的就是Smarter AI,縱軸是每瓦Token數。反過來說,有些應用很快給答案,可能只是AI思考得少。時間才是本質約束——讓AI判斷明天股市,它想兩天這答案就沒意義了。
— 子揚抓不變量:FFN變成MoE後就穩了
模型結構一定會影響芯片設計,比如diffusion模型計算密集,適合另一種範式,所以要先做異構選擇:做不做這件事。更關鍵的是找不變量——Transformer裡注意力機制還在不斷革新,每個新實驗室都發論文提新思路;但後面的FFN自從變成MoE以後就成了相對不變量。RL在後訓練裡也沒有本質影響模型結構。所以優先解決已經收斂的那部分,芯片才不會被算法迭代甩掉。
— Mark一切圍繞局部性展開
Bill Dally的原話是計算機系統結構就像房地產,一切都在於location、location、location。時間局部性是用過一段數據未來大概率還會用,空間局部性是用了一段數據馬上會用到它周圍的數據,CPU的Cache就是這兩者的應用。但在AI推理decode階段,算法上的時間和空間局部性都被抹平了,所以要在架構上用硬件補回局部性——把模型權重放進SRAM,本質就是買最好的局部性。
— MarkOpenAI選HBM4,因為它缺電不缺錢
Jalapeño是一顆通用推理芯片,把prefill、decode、attention、FFN全包在一顆芯片裡,甚至能跑遊戲demo,下一代還要支持訓練。它把HBM4帶寬堆到單封裝每秒15.4TB,走的是最貴的路。原因是美國數據中心缺的不是資本和空間而是電,所以它極度關心每瓦能產出多少Token,功耗上做了很多工作,每兆瓦產出Token數大於英偉達對應Rubin架構。中國電佔成本約1/3,美國約2/3,限制條件不同,收斂點就不同。
— 子揚異構做進芯片內,還是做在系統級
OpenAI提出Dark silicon概念:一顆芯片做不同的事時,可以把其中一些部分關掉或降功耗,用更多成本買電效率。這和Groq、Cerebras的系統級異構不同——後者是一顆芯片和別的芯片配合,把attention的KV cache放到另一塊芯片上。SRAM的容量性價比低,適合存固定的模型權重,不適合存會持續增長的KV cache。所以對電是第一限制的場景,OpenAI方案很好;對帶寬性價比要求極高的場景,仍會收斂到SRAM。
— 子揚原話 · 已逐字校驗
就在訓練的時代 大家是沒有辦法依靠訓練 來獲得任何商業上的回報的 就訓練本身是一個 沒有直接回報的事情
訓練時代,大家沒法靠訓練獲得任何商業回報,訓練本身是一件沒有直接回報的事。
子揚5:06
這種介質其實不在於介質本身 而在於你要關注局部性的問題 你要提供 比起HBM更高一層的局部性
這種介質的關鍵不在介質本身,而在於你要關注局部性問題,要提供比HBM更高一層的局部性。
Mark11:11
當你可以做出一個比別人更快 而且更便宜的東西的時候 你不會告訴別人 你的成本其實是更便宜的
當你能做出一個比別人更快而且更便宜的東西時,你不會告訴別人你的成本其實更低。
子揚22:18
在一個成熟的公司裡面 把一個research idea(研究想法) 顛覆式地推給產品的團隊 還是難度非常大的
在一個成熟公司裡,把一個研究想法顛覆式地推給產品團隊,難度還是非常大的。
Mark33:29
所以推理速度更快並不意味著 你要從一分鐘的思考 最後你跟它的交互速度 要變成一秒鐘 而是在都是一分鐘的 交互速度的情況下 你這個模型可以用10倍 更多的Token 做更多內部自我的思考 來提升它的智能水平
推理速度更快並不意味著把一分鐘的思考變成一秒的交互,而是在同樣一分鐘的交互速度下,模型能用10倍更多的Token做更多內部自我思考,來提升智能水平。
子揚45:36
計算機系統結構就像房地產 一切都在於location location location
計算機系統結構就像房地產,一切都在於location、location、location。
Mark1:10:56
數字與實體
| Groq與Cerebras單用戶推理速度對比 | Groq約100 Token每秒,Cerebras可達750甚至2000 Token每秒 | 21:18 |
| SRAM相對HBM的帶寬性價比優勢 | 兩到三個數量級 | 22:18 |
| 單芯片尺寸極限 | 約800平方毫米 | 25:20 |
| Cerebras可接受的晶圓瑕疵比例 | 30% | 26:20 |
| Cerebras帶寬與成本相對英偉達 | 約10倍帶寬,約3倍HBM成本 | 29:25 |
| 英偉達acqui-hire Groq金額 | 200億美元 | 32:29 |
| 理想推理系統相對GPU的提升目標 | 速度兩到三個數量級,性價比約10倍 | 36:32 |
| 中美數據中心電費佔TCO比例 | 中國約1/3,美國約2/3 | 42:35 |
術語
- arithmetic intensity計算密度
- 每讀取一份數據能做的計算量,決定芯片是算力瓶頸還是帶寬瓶頸。
- roofline model屋頂線模型
- 用計算密度判斷應用卡在算力還是帶寬上的體系結構分析框架。
- MFU模型算力利用率
- 實際算力相對理論峰值的比例,主要統計矩陣乘法部分的利用率。
- MBU內存帶寬利用率
- 訪存帶寬被實際用起來的比例,推理高速度場景的關鍵指標。
- Dark silicon暗硅
- 芯片內部分單元在特定任務時被關閉或降功耗,以換取電效率。
- Amdahl's Law阿姆達爾定律
- 系統整體加速受限於未優化部分,解釋了異構系統為何只提升10倍。
收聽指南
做AI芯片、編譯器或推理基礎設施的工程師與創業者,以及想搞懂推理成本賬和異構路線的投資人。
1:13:03到1:14:47 Bill給學生的創業建議偏個人回憶,可快進。