OpenAI 自研芯片領先百倍?那是自選基準加專用棧
OpenAI 首顆自研芯片 Jalapeno 在自選基準上把 GB200 甩開 100 倍,但那是專用芯片、專用模型、專用軟件棧的結果;真正的護城河是系統集成和定價權。
核心論點 · 點時間戳可跳到原聲
9 個月不是從零起算,是從 RTL 起算
媒體大多把 Jalapeno 說成「clean sheet design」,但 OpenAI 自己的時間線顯示:2024年10月才從空白頁開始架構概念,2025年4月才有 codec CLI,2025年11月回片,2026年5月 codecs 跑起來,7月 ChatGPT 才上芯。主播全程質疑「9個月」的定義:這裡的起點是 RTL 而非產品定義,芯片設計裡 EDA、驗證這些層都被壓縮或並行掉了。所以 9 個月是真的,但它不等於別人也能 9 個月複製一顆芯片。
這組基準的規則本身偏向出題的人
OpenAI 選的是 SemiAnalysis 的 Inference X 開源模型基準,理由是開源模型讓別人也能在自己的硬件上跑同一組模型。但主播點出兩個放大器:一是明確「open to hardware specific optimization」,配合 hardware-aware training/fine-tuning,每個廠商都能把模型調成對自己最有利的形狀;二是 Jalapeno 的結果只用 single token prediction,而選中的基線裡包含 multi-token prediction。再加上非目標裡排除了 time to first token 和單芯片吞吐,整組數字的政策傾向很強。
投機解碼省下的是串行次數,不是算力
Jalapeno 的 PPT 把 speculative decoding 放在很靠前的位置。機制類似 CPU 分支預測:與其每次只預測一個 token,不如先做七個 mini pass 生成草稿 token,再用一個「batched large trunk pass」同時驗證前七個並預測第八個;只要草稿對,串行代價就從八次降到一次。主播類比了遊戲裡的 super sampling/frame generation。但注意:這批官方基準並沒有啟用投機解碼,意味著 100x 那組數字還留了性能空間,也說明真正跑滿負載時要另算。
百倍差距只在人類用不上的速度點上成立
在 GPT-OSS 120B 上,Jalapeno 對比 Nvidia GB200(NVL72):500 tokens/s 時性能高約 100 倍,另一個 500 tokens/s 點上是 53.7x;端到端 time to last token 在長上下文下低 4.2 倍,最低延遲降幅接近一半。主播提醒 500 tokens/s 對人類閱讀沒有意義,但對 agent 互聊和批量場景有意義。更大的 670B 開源模型上數字被壓低,峰值仍到 104x。所有對照都做了功率歸一化,Jalapeno 700W,GB200 約 1.2kW。
決定利用率的是內存延遲,不是帶寬
OpenAI 給的例子:128 芯片 HBM4 系統,1PB/s 帶寬除以 0.5TB 參數,理論上一秒可以讀 2000 遍完整模型權重,但實際根本到不了。延遲來自內存、擁塞路徑、核不同步和全局同步。Jalapeno 的答案是「co-design the architecture to address the bottleneck」——主播直接說這句話在五十個硬件上都聽過,真正要看的不是口號,而是它怎麼把計算放在本地、只在必要時訪問全局內存。上一代硬件的故事裡,這個「必要」的邊界才是差距來源。
自研的優勢在網絡拓撲,不在單顆芯片
Jalapeno 不是零售芯片,而是機架級系統。OpenAI 用 Broadcom Tomahawk 6 做兩層網絡:scale-up 域 128 芯片,scale-out 域 48 芯片。scale-up 大,意味著大模型可以少跨跳步;scale-out 大,意味著 tensor parallelism 的帶寬約束更低。完整系統是 448 芯片、27 exaflops(4-bit 矩陣)、432TB HBM、32PB/s。因為 OpenAI 只跑自己的負載,可以把網絡拓撲精確對準自己模型的通信模式——這是 hyperscaler 自研芯片的共同邏輯,也是它跟通用 GPU 最大的差別。
AI 省下的不是工程師,是迭代次數
OpenAI 說他們在每個設計階段用 AI 工具做改進:矩陣單元面積提升 10%,SIMD 單元面積提升 8%,且是相對「優化後的人類基線」。主播把話頭接上 Synopsys/Cadence 的說法:AI 方案能贏人類團隊,比如 50 人團隊六個月的活 AI 一週做完。這不代表工程師失業,而是同一批人能在半年裡迭代更多版。最後那句判斷值得單獨劃出來:人類負責抽象,前沿 AI 負責映射,層級就是這麼長出來的。
自研芯片的回報是談判籌碼,不是省錢
OpenAI 不會因為有了 Jalapeno 就不買 Nvidia,也不會放棄 Cerebras 這類合作;自研的動機是 optionality、leverage,以及能在不同模型、不同性能檔和不同價格點之間做組合。企業客戶會選一個模型用 3 到 24 個月不換,OpenAI 想要的是給每一種需求都提供一個不被打包綁架的選項。主播還區分了分工:Richard 的任務是把芯片做好,定價是產品團隊的事。這解釋了為什麼一顆只在內部跑的芯片也有戰略價值。
原話 · 已逐字校驗
Most media were reporting it as a clean sheet design. They've got a timeline in the deck. We'll see in a second.
多數媒體把它說成是「從白紙起步」的設計。他們不過是在 deck 裡放了一條時間線,我們等會就會看到。
rather than having a full eight passes of what tokens coming next, you can do seven mini passes and then one big what they've called batched large trunk pass that enables you to verify all seven of the draft tokens and predict token 8.
與其串行做八次完整的下一 token 預測,你可以先做七個 mini pass,再用一個大批量 pass 一次性驗證這七個草稿 token 並預測第八個。
if you can use multi-threading, you use multi-threading because it gets you more performance.
如果你能用多線程,你就會用多線程,因為它給你更高性能。
Now that's not a unique statement. If you follow the channel in any way, you'll know that we've covered 50 different pieces of hardware that say exactly the same thing. We co-design the architecture to address the bottleneck.
這並沒什麼獨特。關注這個頻道的人都知道,我們講過五十款硬件都說一模一樣的話:我們協同設計架構來解決瓶頸。
a human will abstract, but a frontier AI will map and that's how you get the hierarchy.
人會做抽象,而前沿 AI 會做映射,層級就這麼來的。
The reason why they want Jalapeno internally and why they still will buy Nvidia and they'll still buy other people's chips is because they want optionality and leverage and the ability to offer multiple different models at multiple different performance levels and at multiple different pricing points to suit whichever whichever business or whichever API uh gets on board with certain models.
他們內部想用 Jalapeno、同時仍然買 Nvidia 和其他家芯片的原因,是想要可選擇性、槓桿,以及能夠在多個模型、多個性能檔位、多個定價點之間組合,來匹配某個企業或 API 選擇固定模型的週期。
數字與實體
| GPT-OSS 120B 峰值對比 GB200 | 500 tokens/s 時性能約高 100 倍 | 10:17 |
| GPT-OSS 端到端延遲對比 GB200 | 長上下文下 time to last token 低 4.2 倍;最低延遲降幅接近 50% | 11:17 |
| GPT-OSS 在 500 tokens/s 的倍數 | 53.7x | 12:18 |
| 670B 開源模型對比 GB300 | 169 tokens/s per user 時達 104x;另一組對照從 51.2x 到 104.3x | 13:18 |
| AI 輔助設計收益 | 矩陣單元面積提升 10%,SIMD 單元面積提升 8%(在優化後人類基線之上) | 21:22 |
| GB300 對照功耗 | Jalapeno 1.2kW/加速器,GB300 MTP 2.5kW/加速器 | 25:27 |
術語
- speculative decoding投機解碼
- 先並行生成多個草稿 token,再用一次大 batch 驗證,減少串行推理步數。
- multi-token prediction (MTP)多 token 預測
- 模型一次預測多個後續 token 而非逐個生成;Jalapeno 基線裡可選,官方結果未用。
- time to last token (TTLT)末尾 token 用時
- 從請求發出到最後一個 token 生成的端到端延遲,OpenAI 的主優化指標。
- MXFP4MXFP4
- 4 位浮點矩陣計算格式;Jalapeno 以此報告 13.4 PFLOPS。
- scale-up / scale-out domain縱向/橫向擴展域
- Jalapeno 系統裡 128 芯片和 48 芯片兩級互聯域,分別服務大模型與帶寬約束。
- Tomahawk 6Tomahawk 6
- Broadcom 交換機芯片,OpenAI 用它連接 Jalapeno 的 scale-up 和 scale-out 網絡。
收聽指南
算力採購決策者、推理服務創業者、芯片產品經理,以及想從基準數字背後看出供應商能力曲線的 AI 工程師。
前 1 分鐘的活動預告可以跳過,從 2:11 的時間線進入正題。