擴散模型不是圖像專利,它要在推理時贏下語言模型
自迴歸推理必須一個 token 一個 token 順序生成,是內存帶寬瓶頸;擴散模型一次並行處理多個 token,推理負載更像訓練,所以 Inception 押它。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
擴散模型的起點是嫌 GAN 太不穩
Ermon 說當年做圖像生成時對 GAN 很不滿意:能work,但訓練極不穩定、結果很難復現。於是他和博士生在 2019 年轉向 score-based generative models,思路是訓練一個神經網絡去噪,如果它能去噪,就說明它理解了圖像結構,也就能反過來從純噪聲逐步精煉出乾淨圖像。這就是現代擴散模型的底層技術。他強調今天最好的圖像、視頻、部分音樂和大量蛋白質模型都基於擴散。
— Stefano Ermon2024 年那篇論文把擴散搬到了文本上
Ermon 的團隊 2024 年發表論文,首次在 GPT-2 規模(不到十億參數)上讓擴散模型匹配自迴歸模型的質量:同樣的困惑度,同樣的數據擬合程度,但生成速度快約 10 倍,因為擴散一次輸出多個 token。他說這仍然偏學術,但足以讓他決定創業,把技術放大到商業規模。
— Stefano Ermon自迴歸推理是內存帶寬瓶頸
Ermon 把 2017 年 RNN 到 transformer 的切換類比到推理階段:訓練時 transformer 靠並行處理多個 token 勝出,但推理時自迴歸模型仍然是順序的,生成第 10 個 token 前必須先生成前面所有 token。這種負載極度受內存帶寬限制,大部分時間花在內存層級間搬運權重,算術運算很少,對 GPU 不友好。擴散模型在推理時的負載更像訓練——同時並行處理多個 token,因此天然匹配 GPU 擅長的計算模式。
— Stefano Ermon推理效率還決定 RL 後訓練的上限
Ermon 指出經濟性由每瓦特、每美元能換來的智能決定。推理模型的大量進展來自測試時計算擴展,而 RL 後訓練的瓶頸之一就是生成 rollout——讓模型探索、給軌跡打分、再改進模型。所以推理效率直接卡住後訓練效率:一個在推理時擴展得更好的模型,自動也會在後訓練時擴展得更好。這是他押注擴散 LLM 的核心邏輯,也是他說的「更並行的方案最終會贏」。
— Stefano ErmonMercury 對標 Haiku、Flash、mini 系列
Ermon 稱 Inception 的 Mercury 模型在基準上對標 Haiku、Flash、mini nano 等速度優化模型,質量相當但顯著更快,且已在生產環境服務客戶。他強調不能直接在 vLLM 或 SGLang 上跑擴散 LLM,必須自建 serving engine,處理真實生產負載的複雜度。這既是門檻也是護城河:即使別人訓出擴散 LLM,沒有對應 serving engine 也用不起來。
— Stefano Ermon語音客戶從定製芯片換回英偉達 GPU
Ermon 舉了語音 agent 公司 OpenCall 的例子:語音管線包含 ASR、做工具調用的推理 LLM、TTS,速度至關重要。OpenCall 原先在 Cerebras 定製芯片上服務 LLM 來達到所需速度,後來換到 Inception 的擴散 LLM,因為在英偉達 GPU 上就能拿到同等速度——可用性更高、成本更低、質量更好。Ermon 說一旦用慣快模型就回不去了,像寬帶一樣。
— Stefano Ermon擴散模型天生比自迴歸更好控制
Ermon 說擴散模型通常比自迴歸模型更容易控制:自迴歸必須等整個對象生成完,才知道它是否滿足約束、是否對齊、獎勵函數打多少分;擴散是粗到細的生成,從早期就能判斷方向對不對,可以用外部獎勵函數或約束集來引導生成。學術文獻裡有不少證據支持這一點,而且有些引導方式在自迴歸模型上根本做不到。他把這看作未來產品體驗的差異化空間。
— Stefano Ermon20% 到 30% 的任務對延遲極度敏感
Ermon 參考 OpenRouter 的任務分類(研究、對話、編程、軟件工程、日誌處理等)做估算,認為其中約 20% 到 30% 的任務對延遲非常重要。作為下界,這部分負載可以由在給定延遲預算內提供最高質量的模型來承接。他也承認目前還沒到前沿智能水平,很多負載仍需要前沿級智能,所以擴散模型的可尋址市場是分層的。
— Stefano ErmonFlash Attention 和 DPO 都出自他的實驗室
Ermon 回應「學術界做不了大模型」的質疑:早期擴散工作是在學術規模上擊敗 GAN 且更穩定,後來長成 Stable Diffusion、Midjourney;他還共同指導了 Flash Attention,DPO 也起源於他組裡的項目,如今被廣泛用於對齊 LLM 和擴散模型。他認為學術界的優勢是能下反直覺的賭注,有優秀學生,且大家不怕冒險——很多重要 AI 想法都源自學術界。
— Stefano Ermon原話 · 已逐字校驗
the computation is one left to right one token at a time. You cannot generate the 10th token until you've generated everything that comes before it. That kind of workload is um does not map well to GPUs. that kind of workload is extremely memory bound.
計算是一個 token 一個 token 從左到右。不生成前面所有 token,就無法生成第 10 個 token。這種負載不能很好地映射到 GPU,它極度受內存帶寬限制。
Stefano Ermon8:14
the equivalent at inference time is a diffusion based is a diffusion model because a diffusion model is built to have at inference time a workload where you process many tokens at the same time.
推理階段的等價物就是擴散模型,因為擴散模型在推理時的負載就是同時處理多個 token。
Stefano Ermon9:16
the bitter lesson is that the more parallel solution is the one that is eventually going to win.
苦澀的教訓是:更並行的方案最終會贏。
Stefano Ermon10:16
once you get used to a fast model, it's hard to go back. It's kind of like broadband, right?
一旦用慣快模型,就很難回去了。有點像寬帶,對吧?
Stefano Ermon17:21
whenever you train these models you're effectively trying to identify common structure by trying to find an efficient way of compressing the data. And so the more you can compress the data, the more structure, the more patterns you're identifying.
訓練這些模型時,你實際上是在通過尋找高效壓縮數據的方式來識別共同結構。壓縮得越多,說明你識別出的結構和模式越多。
Stefano Ermon22:24
right now uh the the the human ingenuity is still like super important and the ability to come up with the the right ideas and kind of like prune the space and and kind of like identify directions that are more promising has been really important to us.
目前人類的創造力仍然極其重要,提出正確想法、剪枝搜索空間、識別更有希望的方向,對我們來說一直非常關鍵。
Stefano Ermon33:33
數字與實體
| 擴散模型文本生成速度提升 | 約 10 倍於同規模自迴歸模型 | 5:11 |
| Inception 公司規模 | 約 50 人,成立約兩年 | 13:19 |
| 對延遲極度敏感的任務佔比估算 | 20% 到 30% | 29:29 |
術語
- diffusion model擴散模型
- 從純噪聲出發逐步去噪、迭代精煉出結果的生成模型。
- autoregressive model自迴歸模型
- 逐個預測下一個 token、從左到右順序生成的模型。
- perplexity困惑度
- 衡量語言模型對數據中結構識別程度的指標,越低越好。
- serving engine推理服務引擎
- 把訓練好的模型部署成線上服務、處理生產請求的軟件棧。
- RL post-training強化學習後訓練
- 用強化學習在預訓練後繼續優化模型,常需大量 rollout 生成。
收聽指南
關注推理成本、延遲敏感應用(語音 agent、編程)的工程師和創業者,以及想理解架構競爭格局的 AI 投資人。
開頭 0:08–2:54 的學術回憶可快進,直接聽 5:11 起的架構論證。