Cerebras 單芯片 4400 tok/s:推理速度才是護城河
Cerebras 的 WSE 3.5 把單芯片速度推到 4400 tok/s,CS4 機架把三片晶圓塞進 120kW 機櫃。核心理由:推理要拆成 prefill 和 decode,速度才是護城河。
核心論點 · 點時間戳可跳到原聲
性能翻倍沒等新制程,靠硬拉頻率
Cerebras 沒有等新制程,而是把 WSE3 做激進調頻:頻率接近翻倍,所以功耗也接近翻倍。它同時強調這不是簡單挑體(binning),而是和臺積電在同一個 N5 節點上做了針對電壓和頻率的設計優化。上一代 125 petlops 的稀疏 FP16 提到 250 petlops,核心數仍是 90 萬、SRAM 仍是 44GB。物理良率靠缺陷核心動態繞行仍接近 100%,但參數良率一直是外部質疑點。
三片晶圓進一個機架,怪東西變成標準形態
舊設計是 16U 整機、單芯片獨立供電和液冷,數據中心側只做風冷。CS4 改為機架級:前面板放風扇和電源,後面是名為 backpack 的模塊,液冷管道從頂部連接到豎直放置的晶圓芯片。一個機架放三片,作者按電源數量估算單片約 40kW、整架約 120kW,聽起來和 Nvidia NVL72 同級。這不是規格炫耀,而是把 wafer-scale 放進標準數據中心形態。
IO 做成可換模塊,賣的其實是機架平臺
每片芯片的網絡從上一代翻倍到 2.4Tbps,而且 IO 模塊設計成可替換,未來若要支持 800G/200G/100G 或其他互聯標準,可以直接換模塊而不是重做系統。backpack 同時兼容未來 wafer 尺寸,因為晶圓已到物理極限,電源和液冷接口大致相似。作者認為 Cerebras 實際上在做一個機架級平臺,這也是他們敢說 CS5 在 2027 下半年就能跟上的原因。
OpenAI 的大頭收入來自還沒造出的芯片
WSE3 在能完整裝進單芯片的模型上約 2300 tok/s,WSE 3.5 到 4400 tok/s;GPT-5.6 Sol 現在 750 tok/s,換新芯片後接近 1500 tok/s。CEO Andrew Feldman 明確說,OpenAI 這類協議雖有當期供貨,但大頭收入來自未來世代芯片,所以 CS4 這種平臺化產品是履行訂單的關鍵。此前公布與 OpenAI 的合作對應約 200 億美元收入,這也是當初 IPO 講的增長故事。
產能卡在定製機加件,不在晶圓本身
第一代 wafer-scale 系統因為量小,用了大量定製機加件,基礎設施成本遠超合理水平。CS4 把組件數量砍掉一半甚至 60%,並大幅自動化,讓產線可以爬坡——產能一直是財報電話會被追問的問題。作者得到的口徑是:新世代系統會比上一代貴,但沒透露漲多少;早期系統已開始出貨,年底前放量。
不該叫解聚,是把算力和訪存分開派活
Cerebras 推薦的用法是 GPU 負責 prefill、Cerebras 負責 decode。作者認為 disaggregation 這個詞是錯的,應該叫 workload partitioning:把需要算力的部分給算力硬件,把需要訪存的部分給訪存硬件。Nvidia 買 Groq 就是為了 SRAM 解碼性能,但他更關心 Groq 集成 NVLink 之後能否真正競爭;他看到的幻燈片說每架 NVL72 需要 9 架 Groq。Cerebras 作為獨立公司還能與 AMD、AWS 合作,這是它比 Groq 靈活的地方。
快不是體驗好,是能同時跑多個 idea
Cerebras 的取捨是通用性交換功耗和部署。Talis 等專用芯片可以跑到 17000 tok/s,但只能跑單個小模型;Cerebras 能跑任何 transformer 模型。對寫代碼或 agentic workflow 來說,每次輸入都要等結果,快不只是體驗,而是能把多個 idea 並行跑起來,減少等待。Cerebras 的商業模式就是讓客戶為高速 token 付溢價——按百萬 token 計價,速度需求永遠存在。
速度王座沒被動搖,賭注押在 CS5
作者總結:在 AI 硬件裡 Cerebras 仍是速度之王,其他公司拼上下文長度或數學優化,但沒有人在速度上超過它。這次從單臺 16U 箱子升級為 120kW 三系統機架,等於把「怪東西」做成了標準數據中心形態。下一個看點是 CS5 在 2027 年下半年能否如期兌現,以及未來 10 萬億參數模型能不能靠這套平臺支撐。
原話 · 已逐字校驗
I believe one of these chips is probably pushing based on how many power supplies there are, 40 kW. That means three in a rack is about 120, which kind of sounds like Nvidia's NVL72 of course.
按電源數量推算,我認為每顆這樣的芯片大概在 40kW。一個機架放三顆就是 120kW,這聽起來當然有點像 Nvidia 的 NVL72。
what used to be five microsconds is now two microsconds uh for chip to chip in fast mode I think they have a regular mode which is more like three microsconds
芯片到芯片的延遲從原來的 5 微秒降到現在的 2 微秒(fast 模式),我記得還有一個普通模式,大概 3 微秒。
So, wave scale engine 3 previous generation did about 2300 tokens per second um on a standard model that fit all within memory I think in one chip. Um with this new chip, you can now get 4,400 tokens per second.
上一代 WSE3 在能完整裝進單顆芯片內存的標準模型上大約每秒 2300 token。新芯片能到每秒 4400 token。
look, when these, uh, agreements are made, there's obviously some supply that's of the current generation, but you go into it knowing that a lot of that uh, revenue is going to come from future generation chips.
聽著,籤這些協議的時候,確實會有一些當前世代的供應,但你從一開始就知道,其中很大一部分收入將來自未來世代的芯片。
If you use GPU only, you might be getting 250 tokens per second. uh with Cerebrus with their new CS4 you can get over 4,500 tokens per second.
如果只用 GPU,可能每秒 250 token;用 Cerebras 新 CS4,能到每秒 4500 token 以上。
I think disagregation is the wrong word to be talking about it. We should be talking about partitioning workloads.
我認為 disaggregation 不是正確的詞,我們應該說 partitioning workloads(分區工作負載)。
CUDA is not the moat. Speed is the moat and Cerebrus is one of those chips that gets you there with that speed.
CUDA 不是護城河,速度才是護城河。Cerebras 就是能用這種速度把你帶到那裡的芯片之一。
數字與實體
| WSE3.5 稀疏 FP16 算力 | 250 petlops(上代 125 petlops) | 7:13 |
| CS4 單芯片/整機架功耗 | 約 40kW / 約 120kW | 9:16 |
| 每芯片網絡帶寬 | 2.4 Tbps,兩倍於上代 | 10:18 |
| 芯片間互連延遲 | fast 模式 2 微秒,regular 模式約 3 微秒(上代 5 微秒) | 11:18 |
| CS4 組件數量 | 減少約一半,可能達 60% | 14:24 |
| NVL72 與 Groq 機架比 | 每 1 架 NVL72 需 9 架 Groq | 17:25 |
術語
- Wafer Scale Engine (WSE)晶圓級引擎
- 把一整片晶圓做成單顆芯片,用跨掩模拼接互聯,避免多芯片間高延遲互連。
- Cross-reticle stitching跨掩模拼接技術
- 把光刻掩模區域在晶圓上拼成一顆超大芯片,讓面積超過單次曝光的極限。
- Backpack背包模塊
- CS4 機架後部的可插拔模塊,集成了液冷、供電與可替換網絡 IO,外形像背包。
- Prefill/Decode預填充/解碼
- LLM 推理兩階段:prefill 並行處理輸入,decode 逐 token 生成,兩者對硬件需求不同。
- Parametric yield參數良率
- 晶圓上達到目標頻率/電壓的芯片比例,區別於物理良率。
收聽指南
關注 AI 推理芯片代際路線的創業者、做 Infra 選型的工程師、以及追蹤 OpenAI 供應鏈的投資者。
對 Cerebras 前幾代歷史很熟的聽眾,可跳過開頭 0:01-3:09 的背景回顧,直接從 CS4 機架設計聽起。