扩散模型不是图像专利,它要在推理时赢下语言模型
自回归推理必须一个 token 一个 token 顺序生成,是内存带宽瓶颈;扩散模型一次并行处理多个 token,推理负载更像训练,所以 Inception 押它。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
扩散模型的起点是嫌 GAN 太不稳
Ermon 说当年做图像生成时对 GAN 很不满意:能work,但训练极不稳定、结果很难复现。于是他和博士生在 2019 年转向 score-based generative models,思路是训练一个神经网络去噪,如果它能去噪,就说明它理解了图像结构,也就能反过来从纯噪声逐步精炼出干净图像。这就是现代扩散模型的底层技术。他强调今天最好的图像、视频、部分音乐和大量蛋白质模型都基于扩散。
— Stefano Ermon2024 年那篇论文把扩散搬到了文本上
Ermon 的团队 2024 年发表论文,首次在 GPT-2 规模(不到十亿参数)上让扩散模型匹配自回归模型的质量:同样的困惑度,同样的数据拟合程度,但生成速度快约 10 倍,因为扩散一次输出多个 token。他说这仍然偏学术,但足以让他决定创业,把技术放大到商业规模。
— Stefano Ermon自回归推理是内存带宽瓶颈
Ermon 把 2017 年 RNN 到 transformer 的切换类比到推理阶段:训练时 transformer 靠并行处理多个 token 胜出,但推理时自回归模型仍然是顺序的,生成第 10 个 token 前必须先生成前面所有 token。这种负载极度受内存带宽限制,大部分时间花在内存层级间搬运权重,算术运算很少,对 GPU 不友好。扩散模型在推理时的负载更像训练——同时并行处理多个 token,因此天然匹配 GPU 擅长的计算模式。
— Stefano Ermon推理效率还决定 RL 后训练的上限
Ermon 指出经济性由每瓦特、每美元能换来的智能决定。推理模型的大量进展来自测试时计算扩展,而 RL 后训练的瓶颈之一就是生成 rollout——让模型探索、给轨迹打分、再改进模型。所以推理效率直接卡住后训练效率:一个在推理时扩展得更好的模型,自动也会在后训练时扩展得更好。这是他押注扩散 LLM 的核心逻辑,也是他说的「更并行的方案最终会赢」。
— Stefano ErmonMercury 对标 Haiku、Flash、mini 系列
Ermon 称 Inception 的 Mercury 模型在基准上对标 Haiku、Flash、mini nano 等速度优化模型,质量相当但显著更快,且已在生产环境服务客户。他强调不能直接在 vLLM 或 SGLang 上跑扩散 LLM,必须自建 serving engine,处理真实生产负载的复杂度。这既是门槛也是护城河:即使别人训出扩散 LLM,没有对应 serving engine 也用不起来。
— Stefano Ermon语音客户从定制芯片换回英伟达 GPU
Ermon 举了语音 agent 公司 OpenCall 的例子:语音管线包含 ASR、做工具调用的推理 LLM、TTS,速度至关重要。OpenCall 原先在 Cerebras 定制芯片上服务 LLM 来达到所需速度,后来换到 Inception 的扩散 LLM,因为在英伟达 GPU 上就能拿到同等速度——可用性更高、成本更低、质量更好。Ermon 说一旦用惯快模型就回不去了,像宽带一样。
— Stefano Ermon扩散模型天生比自回归更好控制
Ermon 说扩散模型通常比自回归模型更容易控制:自回归必须等整个对象生成完,才知道它是否满足约束、是否对齐、奖励函数打多少分;扩散是粗到细的生成,从早期就能判断方向对不对,可以用外部奖励函数或约束集来引导生成。学术文献里有不少证据支持这一点,而且有些引导方式在自回归模型上根本做不到。他把这看作未来产品体验的差异化空间。
— Stefano Ermon20% 到 30% 的任务对延迟极度敏感
Ermon 参考 OpenRouter 的任务分类(研究、对话、编程、软件工程、日志处理等)做估算,认为其中约 20% 到 30% 的任务对延迟非常重要。作为下界,这部分负载可以由在给定延迟预算内提供最高质量的模型来承接。他也承认目前还没到前沿智能水平,很多负载仍需要前沿级智能,所以扩散模型的可寻址市场是分层的。
— Stefano ErmonFlash Attention 和 DPO 都出自他的实验室
Ermon 回应「学术界做不了大模型」的质疑:早期扩散工作是在学术规模上击败 GAN 且更稳定,后来长成 Stable Diffusion、Midjourney;他还共同指导了 Flash Attention,DPO 也起源于他组里的项目,如今被广泛用于对齐 LLM 和扩散模型。他认为学术界的优势是能下反直觉的赌注,有优秀学生,且大家不怕冒险——很多重要 AI 想法都源自学术界。
— Stefano Ermon原话 · 已逐字校验
the computation is one left to right one token at a time. You cannot generate the 10th token until you've generated everything that comes before it. That kind of workload is um does not map well to GPUs. that kind of workload is extremely memory bound.
计算是一个 token 一个 token 从左到右。不生成前面所有 token,就无法生成第 10 个 token。这种负载不能很好地映射到 GPU,它极度受内存带宽限制。
Stefano Ermon8:14
the equivalent at inference time is a diffusion based is a diffusion model because a diffusion model is built to have at inference time a workload where you process many tokens at the same time.
推理阶段的等价物就是扩散模型,因为扩散模型在推理时的负载就是同时处理多个 token。
Stefano Ermon9:16
the bitter lesson is that the more parallel solution is the one that is eventually going to win.
苦涩的教训是:更并行的方案最终会赢。
Stefano Ermon10:16
once you get used to a fast model, it's hard to go back. It's kind of like broadband, right?
一旦用惯快模型,就很难回去了。有点像宽带,对吧?
Stefano Ermon17:21
whenever you train these models you're effectively trying to identify common structure by trying to find an efficient way of compressing the data. And so the more you can compress the data, the more structure, the more patterns you're identifying.
训练这些模型时,你实际上是在通过寻找高效压缩数据的方式来识别共同结构。压缩得越多,说明你识别出的结构和模式越多。
Stefano Ermon22:24
right now uh the the the human ingenuity is still like super important and the ability to come up with the the right ideas and kind of like prune the space and and kind of like identify directions that are more promising has been really important to us.
目前人类的创造力仍然极其重要,提出正确想法、剪枝搜索空间、识别更有希望的方向,对我们来说一直非常关键。
Stefano Ermon33:33
数字与实体
| 扩散模型文本生成速度提升 | 约 10 倍于同规模自回归模型 | 5:11 |
| Inception 公司规模 | 约 50 人,成立约两年 | 13:19 |
| 对延迟极度敏感的任务占比估算 | 20% 到 30% | 29:29 |
术语
- diffusion model扩散模型
- 从纯噪声出发逐步去噪、迭代精炼出结果的生成模型。
- autoregressive model自回归模型
- 逐个预测下一个 token、从左到右顺序生成的模型。
- perplexity困惑度
- 衡量语言模型对数据中结构识别程度的指标,越低越好。
- serving engine推理服务引擎
- 把训练好的模型部署成线上服务、处理生产请求的软件栈。
- RL post-training强化学习后训练
- 用强化学习在预训练后继续优化模型,常需大量 rollout 生成。
收听指南
关注推理成本、延迟敏感应用(语音 agent、编程)的工程师和创业者,以及想理解架构竞争格局的 AI 投资人。
开头 0:08–2:54 的学术回忆可快进,直接听 5:11 起的架构论证。