世界太吵,来原声听播客

硅谷101

推理芯片绕过CUDA是必然,但SRAM的窗口未必一直开着

训练拼算力、推理拼带宽,Groq和Cerebras都押SRAM,但一个为确定性打折、一个为良率打折;OpenAI却选了最贵的HBM4,因为它缺的是电不是钱。

推理芯片SRAMGroqCerebras异构计算
两位一线芯片创业者拆解Groq、Cerebras与OpenAI三条路径的取舍,含大量工程细节与成本账,适合想搞懂推理芯片到底在赌什么的人。

核心论点 · 点时间戳可跳到原声

4:17

训练赌算力,推理赌带宽

训练时代没人能靠训练本身赚钱,所以成本不可量化,大家只想赌一个最强集群;推理时代账能算清楚——用户为每百万Token付多少钱,我推这百万Token花多少成本。更本质的是计算密度:训练有海量数据把算力喂满,推理的decode阶段是严格自回归的,必须一个Token一个Token产生,而每产生一个Token都要把整个模型从存储介质读进计算单元。所以推理的核心矛盾从算力变成了内存带宽。

— 子扬
16:39

SRAM是共识,但两家分道扬镳

Groq和Cerebras都在Transformer出现前就看到了带宽需求,最后都收敛到SRAM——因为SRAM的带宽绝对值和每块钱买到的带宽都比HBM高两三个数量级。代价是容量:DRAM一个晶体管加一个电容存一个比特,SRAM要六个晶体管,单芯片容量可能比HBM低两个数量级。于是只能把系统做大,几百上千颗芯片把模型权重全放下,瓶颈随即从容量变成集群通信调度。这时两家分歧:Groq把调度全部提前到编译期,Cerebras干脆把一柜子芯片塞进一整片晶圆。

— Mark
19:34

Groq的静态调度撞上MoE的动态性

Groq围绕编译器设计硬件,把确定性做到极致,运行时没有调度开销。但MoE出现后,每个Token在128个专家里激活8个,选哪几个是运行时决定的,编译期无法预测。静态方案只有两条路:要么保守地把Token都送过去,让一部分芯片空转;要么换一种切模型的方式,但现在的模型很难用专家以外的维度切干净。空转只影响性价比,不影响它依然很快,所以Groq仍是GPU之外较好的选择。

— Mark
25:18

Cerebras为良率付出的代价

单芯片尺寸极限约800平方毫米,一个晶圆能切三四十颗,良率50%还能出20颗好的。但Cerebras整个晶圆就是一颗产品,只要瑕疵超过它能接受的30%,整片晶圆作废。这不是掩模成本(掩模可以摊薄),而是每造10个可能9个不能用。所以它可能做到10倍英伟达的带宽,但成本是HBM的3倍,带宽性价比要打折。Groq为确定性打折,Cerebras为良率成本打折,折扣最终都打到Token成本上。

— Mark
33:58

推理时代CUDA一定会被绕过

TPU、Trainium都没有一丁点要兼容CUDA,但大家仍觉得TPU软件难用,Anthropic能大量采购是因为很多工程师来自谷歌、懂JAX。关键变化在于:训练时代大家愿意为软件好用买单,推理时代天平倒向性能和性价比。只要不是很多个难问题、而是一个难问题,把Transformer所有算子在新芯片上写出来,商业逻辑就通了;再加上AI Coding加速算子优化,软件栈门槛被大幅降低。DeepSeek宁愿写底层PTX汇编做优化,就是这个逻辑。

— 子扬
44:25

推理越快,模型越聪明

Agent大规模爆发后,大量Token不是给人读的,是给别的Agent读的,人阅读速度100 Token每秒就到顶了。但推理速度的意义不在交互变快,而在同样一分钟的等待里,模型能用10倍Token做更多内部思考,从而更聪明。老黄PPT横轴标的就是Smarter AI,纵轴是每瓦Token数。反过来说,有些应用很快给答案,可能只是AI思考得少。时间才是本质约束——让AI判断明天股市,它想两天这答案就没意义了。

— 子扬
49:04

抓不变量:FFN变成MoE后就稳了

模型结构一定会影响芯片设计,比如diffusion模型计算密集,适合另一种范式,所以要先做异构选择:做不做这件事。更关键的是找不变量——Transformer里注意力机制还在不断革新,每个新实验室都发论文提新思路;但后面的FFN自从变成MoE以后就成了相对不变量。RL在后训练里也没有本质影响模型结构。所以优先解决已经收敛的那部分,芯片才不会被算法迭代甩掉。

— Mark
1:09:40

一切围绕局部性展开

Bill Dally的原话是计算机系统结构就像房地产,一切都在于location、location、location。时间局部性是用过一段数据未来大概率还会用,空间局部性是用了一段数据马上会用到它周围的数据,CPU的Cache就是这两者的应用。但在AI推理decode阶段,算法上的时间和空间局部性都被抹平了,所以要在架构上用硬件补回局部性——把模型权重放进SRAM,本质就是买最好的局部性。

— Mark
1:17:30

OpenAI选HBM4,因为它缺电不缺钱

Jalapeño是一颗通用推理芯片,把prefill、decode、attention、FFN全包在一颗芯片里,甚至能跑游戏demo,下一代还要支持训练。它把HBM4带宽堆到单封装每秒15.4TB,走的是最贵的路。原因是美国数据中心缺的不是资本和空间而是电,所以它极度关心每瓦能产出多少Token,功耗上做了很多工作,每兆瓦产出Token数大于英伟达对应Rubin架构。中国电占成本约1/3,美国约2/3,限制条件不同,收敛点就不同。

— 子扬
1:27:03

异构做进芯片内,还是做在系统级

OpenAI提出Dark silicon概念:一颗芯片做不同的事时,可以把其中一些部分关掉或降功耗,用更多成本买电效率。这和Groq、Cerebras的系统级异构不同——后者是一颗芯片和别的芯片配合,把attention的KV cache放到另一块芯片上。SRAM的容量性价比低,适合存固定的模型权重,不适合存会持续增长的KV cache。所以对电是第一限制的场景,OpenAI方案很好;对带宽性价比要求极高的场景,仍会收敛到SRAM。

— 子扬

原话 · 已逐字校验

就在训练的时代 大家是没有办法依靠训练 来获得任何商业上的回报的 就训练本身是一个 没有直接回报的事情

训练时代,大家没法靠训练获得任何商业回报,训练本身是一件没有直接回报的事。

子扬5:06

这种介质其实不在于介质本身 而在于你要关注局部性的问题 你要提供 比起HBM更高一层的局部性

这种介质的关键不在介质本身,而在于你要关注局部性问题,要提供比HBM更高一层的局部性。

Mark11:11

当你可以做出一个比别人更快 而且更便宜的东西的时候 你不会告诉别人 你的成本其实是更便宜的

当你能做出一个比别人更快而且更便宜的东西时,你不会告诉别人你的成本其实更低。

子扬22:18

在一个成熟的公司里面 把一个research idea(研究想法) 颠覆式地推给产品的团队 还是难度非常大的

在一个成熟公司里,把一个研究想法颠覆式地推给产品团队,难度还是非常大的。

Mark33:29

所以推理速度更快并不意味着 你要从一分钟的思考 最后你跟它的交互速度 要变成一秒钟 而是在都是一分钟的 交互速度的情况下 你这个模型可以用10倍 更多的Token 做更多内部自我的思考 来提升它的智能水平

推理速度更快并不意味着把一分钟的思考变成一秒的交互,而是在同样一分钟的交互速度下,模型能用10倍更多的Token做更多内部自我思考,来提升智能水平。

子扬45:36

计算机系统结构就像房地产 一切都在于location location location

计算机系统结构就像房地产,一切都在于location、location、location。

数字与实体

Groq与Cerebras单用户推理速度对比Groq约100 Token每秒,Cerebras可达750甚至2000 Token每秒21:18
SRAM相对HBM的带宽性价比优势两到三个数量级22:18
单芯片尺寸极限约800平方毫米25:20
Cerebras可接受的晶圆瑕疵比例30%26:20
Cerebras带宽与成本相对英伟达约10倍带宽,约3倍HBM成本29:25
英伟达acqui-hire Groq金额200亿美元32:29
理想推理系统相对GPU的提升目标速度两到三个数量级,性价比约10倍36:32
中美数据中心电费占TCO比例中国约1/3,美国约2/342:35

术语

arithmetic intensity计算密度
每读取一份数据能做的计算量,决定芯片是算力瓶颈还是带宽瓶颈。
roofline model屋顶线模型
用计算密度判断应用卡在算力还是带宽上的体系结构分析框架。
MFU模型算力利用率
实际算力相对理论峰值的比例,主要统计矩阵乘法部分的利用率。
MBU内存带宽利用率
访存带宽被实际用起来的比例,推理高速度场景的关键指标。
Dark silicon暗硅
芯片内部分单元在特定任务时被关闭或降功耗,以换取电效率。
Amdahl's Law阿姆达尔定律
系统整体加速受限于未优化部分,解释了异构系统为何只提升10倍。

收听指南

谁该听

做AI芯片、编译器或推理基础设施的工程师与创业者,以及想搞懂推理成本账和异构路线的投资人。

可跳过

1:13:03到1:14:47 Bill给学生的创业建议偏个人回忆,可快进。