推理芯片绕过CUDA是必然,但SRAM的窗口未必一直开着
训练拼算力、推理拼带宽,Groq和Cerebras都押SRAM,但一个为确定性打折、一个为良率打折;OpenAI却选了最贵的HBM4,因为它缺的是电不是钱。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
训练赌算力,推理赌带宽
训练时代没人能靠训练本身赚钱,所以成本不可量化,大家只想赌一个最强集群;推理时代账能算清楚——用户为每百万Token付多少钱,我推这百万Token花多少成本。更本质的是计算密度:训练有海量数据把算力喂满,推理的decode阶段是严格自回归的,必须一个Token一个Token产生,而每产生一个Token都要把整个模型从存储介质读进计算单元。所以推理的核心矛盾从算力变成了内存带宽。
— 子扬SRAM是共识,但两家分道扬镳
Groq和Cerebras都在Transformer出现前就看到了带宽需求,最后都收敛到SRAM——因为SRAM的带宽绝对值和每块钱买到的带宽都比HBM高两三个数量级。代价是容量:DRAM一个晶体管加一个电容存一个比特,SRAM要六个晶体管,单芯片容量可能比HBM低两个数量级。于是只能把系统做大,几百上千颗芯片把模型权重全放下,瓶颈随即从容量变成集群通信调度。这时两家分歧:Groq把调度全部提前到编译期,Cerebras干脆把一柜子芯片塞进一整片晶圆。
— MarkGroq的静态调度撞上MoE的动态性
Groq围绕编译器设计硬件,把确定性做到极致,运行时没有调度开销。但MoE出现后,每个Token在128个专家里激活8个,选哪几个是运行时决定的,编译期无法预测。静态方案只有两条路:要么保守地把Token都送过去,让一部分芯片空转;要么换一种切模型的方式,但现在的模型很难用专家以外的维度切干净。空转只影响性价比,不影响它依然很快,所以Groq仍是GPU之外较好的选择。
— MarkCerebras为良率付出的代价
单芯片尺寸极限约800平方毫米,一个晶圆能切三四十颗,良率50%还能出20颗好的。但Cerebras整个晶圆就是一颗产品,只要瑕疵超过它能接受的30%,整片晶圆作废。这不是掩模成本(掩模可以摊薄),而是每造10个可能9个不能用。所以它可能做到10倍英伟达的带宽,但成本是HBM的3倍,带宽性价比要打折。Groq为确定性打折,Cerebras为良率成本打折,折扣最终都打到Token成本上。
— Mark推理时代CUDA一定会被绕过
TPU、Trainium都没有一丁点要兼容CUDA,但大家仍觉得TPU软件难用,Anthropic能大量采购是因为很多工程师来自谷歌、懂JAX。关键变化在于:训练时代大家愿意为软件好用买单,推理时代天平倒向性能和性价比。只要不是很多个难问题、而是一个难问题,把Transformer所有算子在新芯片上写出来,商业逻辑就通了;再加上AI Coding加速算子优化,软件栈门槛被大幅降低。DeepSeek宁愿写底层PTX汇编做优化,就是这个逻辑。
— 子扬推理越快,模型越聪明
Agent大规模爆发后,大量Token不是给人读的,是给别的Agent读的,人阅读速度100 Token每秒就到顶了。但推理速度的意义不在交互变快,而在同样一分钟的等待里,模型能用10倍Token做更多内部思考,从而更聪明。老黄PPT横轴标的就是Smarter AI,纵轴是每瓦Token数。反过来说,有些应用很快给答案,可能只是AI思考得少。时间才是本质约束——让AI判断明天股市,它想两天这答案就没意义了。
— 子扬抓不变量:FFN变成MoE后就稳了
模型结构一定会影响芯片设计,比如diffusion模型计算密集,适合另一种范式,所以要先做异构选择:做不做这件事。更关键的是找不变量——Transformer里注意力机制还在不断革新,每个新实验室都发论文提新思路;但后面的FFN自从变成MoE以后就成了相对不变量。RL在后训练里也没有本质影响模型结构。所以优先解决已经收敛的那部分,芯片才不会被算法迭代甩掉。
— Mark一切围绕局部性展开
Bill Dally的原话是计算机系统结构就像房地产,一切都在于location、location、location。时间局部性是用过一段数据未来大概率还会用,空间局部性是用了一段数据马上会用到它周围的数据,CPU的Cache就是这两者的应用。但在AI推理decode阶段,算法上的时间和空间局部性都被抹平了,所以要在架构上用硬件补回局部性——把模型权重放进SRAM,本质就是买最好的局部性。
— MarkOpenAI选HBM4,因为它缺电不缺钱
Jalapeño是一颗通用推理芯片,把prefill、decode、attention、FFN全包在一颗芯片里,甚至能跑游戏demo,下一代还要支持训练。它把HBM4带宽堆到单封装每秒15.4TB,走的是最贵的路。原因是美国数据中心缺的不是资本和空间而是电,所以它极度关心每瓦能产出多少Token,功耗上做了很多工作,每兆瓦产出Token数大于英伟达对应Rubin架构。中国电占成本约1/3,美国约2/3,限制条件不同,收敛点就不同。
— 子扬异构做进芯片内,还是做在系统级
OpenAI提出Dark silicon概念:一颗芯片做不同的事时,可以把其中一些部分关掉或降功耗,用更多成本买电效率。这和Groq、Cerebras的系统级异构不同——后者是一颗芯片和别的芯片配合,把attention的KV cache放到另一块芯片上。SRAM的容量性价比低,适合存固定的模型权重,不适合存会持续增长的KV cache。所以对电是第一限制的场景,OpenAI方案很好;对带宽性价比要求极高的场景,仍会收敛到SRAM。
— 子扬原话 · 已逐字校验
就在训练的时代 大家是没有办法依靠训练 来获得任何商业上的回报的 就训练本身是一个 没有直接回报的事情
训练时代,大家没法靠训练获得任何商业回报,训练本身是一件没有直接回报的事。
子扬5:06
这种介质其实不在于介质本身 而在于你要关注局部性的问题 你要提供 比起HBM更高一层的局部性
这种介质的关键不在介质本身,而在于你要关注局部性问题,要提供比HBM更高一层的局部性。
Mark11:11
当你可以做出一个比别人更快 而且更便宜的东西的时候 你不会告诉别人 你的成本其实是更便宜的
当你能做出一个比别人更快而且更便宜的东西时,你不会告诉别人你的成本其实更低。
子扬22:18
在一个成熟的公司里面 把一个research idea(研究想法) 颠覆式地推给产品的团队 还是难度非常大的
在一个成熟公司里,把一个研究想法颠覆式地推给产品团队,难度还是非常大的。
Mark33:29
所以推理速度更快并不意味着 你要从一分钟的思考 最后你跟它的交互速度 要变成一秒钟 而是在都是一分钟的 交互速度的情况下 你这个模型可以用10倍 更多的Token 做更多内部自我的思考 来提升它的智能水平
推理速度更快并不意味着把一分钟的思考变成一秒的交互,而是在同样一分钟的交互速度下,模型能用10倍更多的Token做更多内部自我思考,来提升智能水平。
子扬45:36
计算机系统结构就像房地产 一切都在于location location location
计算机系统结构就像房地产,一切都在于location、location、location。
Mark1:10:56
数字与实体
| Groq与Cerebras单用户推理速度对比 | Groq约100 Token每秒,Cerebras可达750甚至2000 Token每秒 | 21:18 |
| SRAM相对HBM的带宽性价比优势 | 两到三个数量级 | 22:18 |
| 单芯片尺寸极限 | 约800平方毫米 | 25:20 |
| Cerebras可接受的晶圆瑕疵比例 | 30% | 26:20 |
| Cerebras带宽与成本相对英伟达 | 约10倍带宽,约3倍HBM成本 | 29:25 |
| 英伟达acqui-hire Groq金额 | 200亿美元 | 32:29 |
| 理想推理系统相对GPU的提升目标 | 速度两到三个数量级,性价比约10倍 | 36:32 |
| 中美数据中心电费占TCO比例 | 中国约1/3,美国约2/3 | 42:35 |
术语
- arithmetic intensity计算密度
- 每读取一份数据能做的计算量,决定芯片是算力瓶颈还是带宽瓶颈。
- roofline model屋顶线模型
- 用计算密度判断应用卡在算力还是带宽上的体系结构分析框架。
- MFU模型算力利用率
- 实际算力相对理论峰值的比例,主要统计矩阵乘法部分的利用率。
- MBU内存带宽利用率
- 访存带宽被实际用起来的比例,推理高速度场景的关键指标。
- Dark silicon暗硅
- 芯片内部分单元在特定任务时被关闭或降功耗,以换取电效率。
- Amdahl's Law阿姆达尔定律
- 系统整体加速受限于未优化部分,解释了异构系统为何只提升10倍。
收听指南
做AI芯片、编译器或推理基础设施的工程师与创业者,以及想搞懂推理成本账和异构路线的投资人。
1:13:03到1:14:47 Bill给学生的创业建议偏个人回忆,可快进。