世界太吵,來原聲聽播客

硅谷101

推理芯片繞過CUDA是必然,但SRAM的窗口未必一直開著

訓練拼算力、推理拼帶寬,Groq和Cerebras都押SRAM,但一個為確定性打折、一個為良率打折;OpenAI卻選了最貴的HBM4,因為它缺的是電不是錢。

推理芯片SRAMGroqCerebras異構計算
兩位一線芯片創業者拆解Groq、Cerebras與OpenAI三條路徑的取捨,含大量工程細節與成本賬,適合想搞懂推理芯片到底在賭什麼的人。

核心論點 · 點時間戳可跳到原聲

4:17

訓練賭算力,推理賭帶寬

訓練時代沒人能靠訓練本身賺錢,所以成本不可量化,大家只想賭一個最強集群;推理時代賬能算清楚——用戶為每百萬Token付多少錢,我推這百萬Token花多少成本。更本質的是計算密度:訓練有海量數據把算力喂滿,推理的decode階段是嚴格自迴歸的,必須一個Token一個Token產生,而每產生一個Token都要把整個模型從存儲介質讀進計算單元。所以推理的核心矛盾從算力變成了內存帶寬。

— 子揚
16:39

SRAM是共識,但兩家分道揚鑣

Groq和Cerebras都在Transformer出現前就看到了帶寬需求,最後都收斂到SRAM——因為SRAM的帶寬絕對值和每塊錢買到的帶寬都比HBM高兩三個數量級。代價是容量:DRAM一個晶體管加一個電容存一個比特,SRAM要六個晶體管,單芯片容量可能比HBM低兩個數量級。於是只能把系統做大,幾百上千顆芯片把模型權重全放下,瓶頸隨即從容量變成集群通信調度。這時兩家分歧:Groq把調度全部提前到編譯期,Cerebras乾脆把一櫃子芯片塞進一整片晶圓。

— Mark
19:34

Groq的靜態調度撞上MoE的動態性

Groq圍繞編譯器設計硬件,把確定性做到極致,運行時沒有調度開銷。但MoE出現後,每個Token在128個專家裡激活8個,選哪幾個是運行時決定的,編譯期無法預測。靜態方案只有兩條路:要麼保守地把Token都送過去,讓一部分芯片空轉;要麼換一種切模型的方式,但現在的模型很難用專家以外的維度切乾淨。空轉只影響性價比,不影響它依然很快,所以Groq仍是GPU之外較好的選擇。

— Mark
25:18

Cerebras為良率付出的代價

單芯片尺寸極限約800平方毫米,一個晶圓能切三四十顆,良率50%還能出20顆好的。但Cerebras整個晶圓就是一顆產品,只要瑕疵超過它能接受的30%,整片晶圓作廢。這不是掩模成本(掩模可以攤薄),而是每造10個可能9個不能用。所以它可能做到10倍英偉達的帶寬,但成本是HBM的3倍,帶寬性價比要打折。Groq為確定性打折,Cerebras為良率成本打折,折扣最終都打到Token成本上。

— Mark
33:58

推理時代CUDA一定會被繞過

TPU、Trainium都沒有一丁點要兼容CUDA,但大家仍覺得TPU軟件難用,Anthropic能大量採購是因為很多工程師來自谷歌、懂JAX。關鍵變化在於:訓練時代大家願意為軟件好用買單,推理時代天平倒向性能和性價比。只要不是很多個難問題、而是一個難問題,把Transformer所有算子在新芯片上寫出來,商業邏輯就通了;再加上AI Coding加速算子優化,軟件棧門檻被大幅降低。DeepSeek寧願寫底層PTX彙編做優化,就是這個邏輯。

— 子揚
44:25

推理越快,模型越聰明

Agent大規模爆發後,大量Token不是給人讀的,是給別的Agent讀的,人閱讀速度100 Token每秒就到頂了。但推理速度的意義不在交互變快,而在同樣一分鐘的等待裡,模型能用10倍Token做更多內部思考,從而更聰明。老黃PPT橫軸標的就是Smarter AI,縱軸是每瓦Token數。反過來說,有些應用很快給答案,可能只是AI思考得少。時間才是本質約束——讓AI判斷明天股市,它想兩天這答案就沒意義了。

— 子揚
49:04

抓不變量:FFN變成MoE後就穩了

模型結構一定會影響芯片設計,比如diffusion模型計算密集,適合另一種範式,所以要先做異構選擇:做不做這件事。更關鍵的是找不變量——Transformer裡注意力機制還在不斷革新,每個新實驗室都發論文提新思路;但後面的FFN自從變成MoE以後就成了相對不變量。RL在後訓練裡也沒有本質影響模型結構。所以優先解決已經收斂的那部分,芯片才不會被算法迭代甩掉。

— Mark
1:09:40

一切圍繞局部性展開

Bill Dally的原話是計算機系統結構就像房地產,一切都在於location、location、location。時間局部性是用過一段數據未來大概率還會用,空間局部性是用了一段數據馬上會用到它周圍的數據,CPU的Cache就是這兩者的應用。但在AI推理decode階段,算法上的時間和空間局部性都被抹平了,所以要在架構上用硬件補回局部性——把模型權重放進SRAM,本質就是買最好的局部性。

— Mark
1:17:30

OpenAI選HBM4,因為它缺電不缺錢

Jalapeño是一顆通用推理芯片,把prefill、decode、attention、FFN全包在一顆芯片裡,甚至能跑遊戲demo,下一代還要支持訓練。它把HBM4帶寬堆到單封裝每秒15.4TB,走的是最貴的路。原因是美國數據中心缺的不是資本和空間而是電,所以它極度關心每瓦能產出多少Token,功耗上做了很多工作,每兆瓦產出Token數大於英偉達對應Rubin架構。中國電佔成本約1/3,美國約2/3,限制條件不同,收斂點就不同。

— 子揚
1:27:03

異構做進芯片內,還是做在系統級

OpenAI提出Dark silicon概念:一顆芯片做不同的事時,可以把其中一些部分關掉或降功耗,用更多成本買電效率。這和Groq、Cerebras的系統級異構不同——後者是一顆芯片和別的芯片配合,把attention的KV cache放到另一塊芯片上。SRAM的容量性價比低,適合存固定的模型權重,不適合存會持續增長的KV cache。所以對電是第一限制的場景,OpenAI方案很好;對帶寬性價比要求極高的場景,仍會收斂到SRAM。

— 子揚

原話 · 已逐字校驗

就在訓練的時代 大家是沒有辦法依靠訓練 來獲得任何商業上的回報的 就訓練本身是一個 沒有直接回報的事情

訓練時代,大家沒法靠訓練獲得任何商業回報,訓練本身是一件沒有直接回報的事。

子揚5:06

這種介質其實不在於介質本身 而在於你要關注局部性的問題 你要提供 比起HBM更高一層的局部性

這種介質的關鍵不在介質本身,而在於你要關注局部性問題,要提供比HBM更高一層的局部性。

Mark11:11

當你可以做出一個比別人更快 而且更便宜的東西的時候 你不會告訴別人 你的成本其實是更便宜的

當你能做出一個比別人更快而且更便宜的東西時,你不會告訴別人你的成本其實更低。

子揚22:18

在一個成熟的公司裡面 把一個research idea(研究想法) 顛覆式地推給產品的團隊 還是難度非常大的

在一個成熟公司裡,把一個研究想法顛覆式地推給產品團隊,難度還是非常大的。

Mark33:29

所以推理速度更快並不意味著 你要從一分鐘的思考 最後你跟它的交互速度 要變成一秒鐘 而是在都是一分鐘的 交互速度的情況下 你這個模型可以用10倍 更多的Token 做更多內部自我的思考 來提升它的智能水平

推理速度更快並不意味著把一分鐘的思考變成一秒的交互,而是在同樣一分鐘的交互速度下,模型能用10倍更多的Token做更多內部自我思考,來提升智能水平。

子揚45:36

計算機系統結構就像房地產 一切都在於location location location

計算機系統結構就像房地產,一切都在於location、location、location。

數字與實體

Groq與Cerebras單用戶推理速度對比Groq約100 Token每秒,Cerebras可達750甚至2000 Token每秒21:18
SRAM相對HBM的帶寬性價比優勢兩到三個數量級22:18
單芯片尺寸極限約800平方毫米25:20
Cerebras可接受的晶圓瑕疵比例30%26:20
Cerebras帶寬與成本相對英偉達約10倍帶寬,約3倍HBM成本29:25
英偉達acqui-hire Groq金額200億美元32:29
理想推理系統相對GPU的提升目標速度兩到三個數量級,性價比約10倍36:32
中美數據中心電費佔TCO比例中國約1/3,美國約2/342:35

術語

arithmetic intensity計算密度
每讀取一份數據能做的計算量,決定芯片是算力瓶頸還是帶寬瓶頸。
roofline model屋頂線模型
用計算密度判斷應用卡在算力還是帶寬上的體系結構分析框架。
MFU模型算力利用率
實際算力相對理論峰值的比例,主要統計矩陣乘法部分的利用率。
MBU內存帶寬利用率
訪存帶寬被實際用起來的比例,推理高速度場景的關鍵指標。
Dark silicon暗硅
芯片內部分單元在特定任務時被關閉或降功耗,以換取電效率。
Amdahl's Law阿姆達爾定律
系統整體加速受限於未優化部分,解釋了異構系統為何只提升10倍。

收聽指南

誰該聽

做AI芯片、編譯器或推理基礎設施的工程師與創業者,以及想搞懂推理成本賬和異構路線的投資人。

可跳過

1:13:03到1:14:47 Bill給學生的創業建議偏個人回憶,可快進。