自研芯片百倍领先?基准选择与商业筹码才是关键
OpenAI 首颗自研芯片 Jalapeno 在自选基准上把 GB200 甩开 100 倍,但那是专用芯片、专用模型、专用软件栈的结果;真正的护城河是系统集成和定价权。
核心论点 · 点时间戳可跳到原声
九个月是从RTL到回片
媒体大多把 Jalapeno 说成「clean sheet design」,但 OpenAI 自己的时间线显示:2024年10月才从空白页开始架构概念,2025年4月才有 codec CLI,2025年11月回片,2026年5月 codecs 跑起来,7月 ChatGPT 才上芯。主播全程质疑「9个月」的定义:这里的起点是 RTL 而非产品定义,芯片设计里 EDA、验证这些层都被压缩或并行掉了。所以 9 个月是真的,但它不等于别人也能 9 个月复制一颗芯片。
基准允许厂商各调各的
OpenAI 选的是 SemiAnalysis 的 Inference X 开源模型基准,理由是开源模型让别人也能在自己的硬件上跑同一组模型。但主播点出两个放大器:一是明确「open to hardware specific optimization」,配合 hardware-aware training/fine-tuning,每个厂商都能把模型调成对自己最有利的形状;二是 Jalapeno 的结果只用 single token prediction,而选中的基线里包含 multi-token prediction。再加上非目标里排除了 time to first token 和单芯片吞吐,整组数字的政策倾向很强。
投机解码省的是串行步骤
Jalapeno 的 PPT 把 speculative decoding 放在很靠前的位置。机制类似 CPU 分支预测:与其每次只预测一个 token,不如先做七个 mini pass 生成草稿 token,再用一个「batched large trunk pass」同时验证前七个并预测第八个;只要草稿对,串行代价就从八次降到一次。主播类比了游戏里的 super sampling/frame generation。但注意:这批官方基准并没有启用投机解码,意味着 100x 那组数字还留了性能空间,也说明真正跑满负载时要另算。
百倍领先只在特定条件成立
在 GPT-OSS 120B 上,Jalapeno 对比 Nvidia GB200(NVL72):500 tokens/s 时性能高约 100 倍,另一个 500 tokens/s 点上是 53.7x;端到端 time to last token 在长上下文下低 4.2 倍,最低延迟降幅接近一半。主播提醒 500 tokens/s 对人类阅读没有意义,但对 agent 互聊和批量场景有意义。更大的 670B 开源模型上数字被压低,峰值仍到 104x。所有对照都做了功率归一化,Jalapeno 700W,GB200 约 1.2kW。
内存延迟才决定利用率
OpenAI 给的例子:128 芯片 HBM4 系统,1PB/s 带宽除以 0.5TB 参数,理论上一秒可以读 2000 遍完整模型权重,但实际根本到不了。延迟来自内存、拥塞路径、核不同步和全局同步。Jalapeno 的答案是「co-design the architecture to address the bottleneck」——主播直接说这句话在五十个硬件上都听过,真正要看的不是口号,而是它怎么把计算放在本地、只在必要时访问全局内存。上一代硬件的故事里,这个「必要」的边界才是差距来源。
卖的是 448 芯片的系统
Jalapeno 不是零售芯片,而是机架级系统。OpenAI 用 Broadcom Tomahawk 6 做两层网络:scale-up 域 128 芯片,scale-out 域 48 芯片。scale-up 大,意味着大模型可以少跨跳步;scale-out 大,意味着 tensor parallelism 的带宽约束更低。完整系统是 448 芯片、27 exaflops(4-bit 矩阵)、432TB HBM、32PB/s。因为 OpenAI 只跑自己的负载,可以把网络拓扑精确对准自己模型的通信模式——这是 hyperscaler 自研芯片的共同逻辑,也是它跟通用 GPU 最大的差别。
AI 帮芯片省面积
OpenAI 说他们在每个设计阶段用 AI 工具做改进:矩阵单元面积提升 10%,SIMD 单元面积提升 8%,且是相对「优化后的人类基线」。主播把话头接上 Synopsys/Cadence 的说法:AI 方案能赢人类团队,比如 50 人团队六个月的活 AI 一周做完。这不代表工程师失业,而是同一批人能在半年里迭代更多版。最后那句判断值得单独划出来:人类负责抽象,前沿 AI 负责映射,层级就是这么长出来的。
自研芯片是商业筹码
OpenAI 不会因为有了 Jalapeno 就不买 Nvidia,也不会放弃 Cerebras 这类合作;自研的动机是 optionality、leverage,以及能在不同模型、不同性能档和不同价格点之间做组合。企业客户会选一个模型用 3 到 24 个月不换,OpenAI 想要的是给每一种需求都提供一个不被打包绑架的选项。主播还区分了分工:Richard 的任务是把芯片做好,定价是产品团队的事。这解释了为什么一颗只在内部跑的芯片也有战略价值。
原话 · 已逐字校验
Most media were reporting it as a clean sheet design. They've got a timeline in the deck. We'll see in a second.
多数媒体把它说成是「从白纸起步」的设计。他们不过是在 deck 里放了一条时间线,我们等会就会看到。
rather than having a full eight passes of what tokens coming next, you can do seven mini passes and then one big what they've called batched large trunk pass that enables you to verify all seven of the draft tokens and predict token 8.
与其串行做八次完整的下一 token 预测,你可以先做七个 mini pass,再用一个大批量 pass 一次性验证这七个草稿 token 并预测第八个。
if you can use multi-threading, you use multi-threading because it gets you more performance.
如果你能用多线程,你就会用多线程,因为它给你更高性能。
Now that's not a unique statement. If you follow the channel in any way, you'll know that we've covered 50 different pieces of hardware that say exactly the same thing. We co-design the architecture to address the bottleneck.
这并没什么独特。关注这个频道的人都知道,我们讲过五十款硬件都说一模一样的话:我们协同设计架构来解决瓶颈。
a human will abstract, but a frontier AI will map and that's how you get the hierarchy.
人会做抽象,而前沿 AI 会做映射,层级就这么来的。
The reason why they want Jalapeno internally and why they still will buy Nvidia and they'll still buy other people's chips is because they want optionality and leverage and the ability to offer multiple different models at multiple different performance levels and at multiple different pricing points to suit whichever whichever business or whichever API uh gets on board with certain models.
他们内部想用 Jalapeno、同时仍然买 Nvidia 和其他家芯片的原因,是想要可选择性、杠杆,以及能够在多个模型、多个性能档位、多个定价点之间组合,来匹配某个企业或 API 选择固定模型的周期。
数字与实体
| GPT-OSS 120B 峰值对比 GB200 | 500 tokens/s 时性能约高 100 倍 | 10:17 |
| GPT-OSS 端到端延迟对比 GB200 | 长上下文下 time to last token 低 4.2 倍;最低延迟降幅接近 50% | 11:17 |
| GPT-OSS 在 500 tokens/s 的倍数 | 53.7x | 12:18 |
| 670B 开源模型对比 GB300 | 169 tokens/s per user 时达 104x;另一组对照从 51.2x 到 104.3x | 13:18 |
| AI 辅助设计收益 | 矩阵单元面积提升 10%,SIMD 单元面积提升 8%(在优化后人类基线之上) | 21:22 |
| GB300 对照功耗 | Jalapeno 1.2kW/加速器,GB300 MTP 2.5kW/加速器 | 25:27 |
术语
- speculative decoding投机解码
- 先并行生成多个草稿 token,再用一次大 batch 验证,减少串行推理步数。
- multi-token prediction (MTP)多 token 预测
- 模型一次预测多个后续 token 而非逐个生成;Jalapeno 基线里可选,官方结果未用。
- time to last token (TTLT)末尾 token 用时
- 从请求发出到最后一个 token 生成的端到端延迟,OpenAI 的主优化指标。
- MXFP4MXFP4
- 4 位浮点矩阵计算格式;Jalapeno 以此报告 13.4 PFLOPS。
- scale-up / scale-out domain纵向/横向扩展域
- Jalapeno 系统里 128 芯片和 48 芯片两级互联域,分别服务大模型与带宽约束。
- Tomahawk 6Tomahawk 6
- Broadcom 交换机芯片,OpenAI 用它连接 Jalapeno 的 scale-up 和 scale-out 网络。
收听指南
算力采购决策者、推理服务创业者、芯片产品经理,以及想从基准数字背后看出供应商能力曲线的 AI 工程师。
前 1 分钟的活动预告可以跳过,从 2:11 的时间线进入正题。