世界太吵,來原聲聽播客

Latent Space

量化更多層反而更準:誤差會互相抵消

選對層之後,量化更多反而更保真——誤差會互相抵消;同理 10 倍加速不是單點突破,而是量化、speculator、PD 分離各翻一倍疊出來的。

推理優化量化投機解碼GPU 硬件視頻生成開源模型

原視頻在 YouTube 上放不出來,用音頻聽:

兩位工程師把「支持一個新模型」拆到卡數、層號和競態條件的粒度,幾乎沒有市場話術;代價是 100 分鐘裡夾了不少互相打斷的閒聊。

核心論點 · 點時間戳可跳到原聲

1:00

20 萬 token 的真實路徑

一個 20 萬 token 的請求進來,第一個問題不是算力,而是「你之前發過這段嗎」。系統先做 cache-aware routing,挑一個既有空閒 prefill worker、又已經緩存了部分前綴的副本,儘量跳過 prefill;部分模型上 prefill 和 decode 已經拆到兩組 GPU,前者產出 KV cache 和首 token,後者做逐 token 解碼。關鍵在於擋在前面的 speculator 是按流量訓的——它假設你在寫代碼,所以草稿 token 接受率高;如果你實際是讓它總結哈利波特全集,同一套系統就會變慢。延遲不是模型的固有屬性,而是流量畫像和 speculator 對不對得上的函數。

— Philip
13:16

上線新模型要重做三件事

「支持某個新模型」有兩個完全不同的含義:能出 token,和有一個生產可用的 API。前者不難,vLLM/SGLang 的維護者常常提前拿到權重、模型方自己提 PR。後者要在私有棧上重做一遍:把權重量化到 NVFP4 以吃滿 Blackwell,並校準量化確認沒有智力回退;用真實權重跑推理取 hidden states,重新訓 speculator;再為新架構補運行時支持(GLM-5.2 的 DSA 稀疏注意力就是從 DeepSeek 借來的)。因為 model API 側是零數據留存,他們不知道具體流量,只能用公開數據集近似「編碼和 agent 是主流」來訓通用 speculator。即便 K2.5 到 K2.6 只是繼續後訓練,這套流程也躲不掉。

— Philip
17:25

給 GLM 裝上 Kimi 的眼睛

開源模型可以做器官移植。團隊裡的 Haley 把 Kimi 的視覺 encoder 接到 GLM-5.2 上:encoder 和主幹權重都凍結,只訓中間那個幾百萬參數的 projector——動主幹權重的代價是模型可能在別的能力上變笨。第一版只用「描述這張圖」的數據訓,沒學明白;改成每張圖配一組判別式問題(圖裡有沒有鳥、有沒有科學家)之後出現了 grokking。結果是 MMLU Pro 56%,不算前沿,但沒有圖片輸入時直接跳過 encoder,原本的 GLM-5.2 質量一分不損。於是你得到一個 Kimi 的眼睛、GLM 的權重、DeepSeek 的注意力拼起來的模型。

— Philip
22:21

復讀 S 是集群問題

GLM-5.2 和 DSV 4 上出現過反覆輸出同一個 token(最常見的是 S)的模式崩潰,即使溫度 0.9 也會發生。他們的判斷是:這不是權重問題。同一份權重換一個推理引擎(SGLang 換 vLLM),或者把 NVIDIA 新版 TensorRT-LLM 鏡像的改動合上來,問題就消失。更極端的一次是同一模型在一個集群會崩、另一個不會,原因是前者節點間 KV cache 傳輸走的互聯更慢,把 kernel 裡缺同步屏障的競態暴露了出來——最後的處理辦法是換集群託管。線上還有一層兜底:同一 token 連續出現四次以上就掐掉重跑,但要排除表格分隔線那類特殊字符。

— Ali
30:28

多量化反而更保真

行業默認「量化越多、損失越大」,他們的結論是不一定。量化是有損壓縮,功夫全在選層(圖像模型裡 modulation 層和 out projection 不量化)。研究實習生 Joshua 的論文給出的做法是:預測哪些層的量化誤差會互相抵消——一層偏右、一層偏左——然後專挑這些層量化。評價標準也換掉了:不看 benchmark 分數,而看量化模型與全精度模型 logits 分布之間的 KL divergence,分布越接近,行為就越可能貼合原模型。結果是比 NVIDIA 的量化多量化 20%(因此多約 20% 吞吐),同時保真度更好。注意這不是讓模型變強,只是抵消損失。

— Ali
35:38

10x 從疊乘裡來

10 倍的拆解很具體:一個萬億參數模型跑在沒做優化的現成引擎上,大約 30-50 tokens/秒(這裡說的是延遲意義上的 tokens per second,行業本該叫 ITL)。做到 300-400 要同時滿足:最好的硬件、訓好的 speculator、量化做完、較高的緩存命中率、以及為延遲而非吞吐調過的小 batch 與並行配置。分項收益是 BF16→FP8 約 30-40%、FP8→FP4 再 30-40%、speculator 約 2x、PD 分離約 2x,再加運行時和新 kernel 的兩位數百分比。但如果固定同樣硬件同樣卡數,純推理優化只有 2-4x——差額是硬件換來的,10x 更多出現在 OpenRouter 上最差與最好供應商之間。

— Philip
1:03:22

看空 mega kernel

Ali 看空 mega kernel:融合 kernel 省掉啟動開銷聽起來很美,但 tensor parallelism 下半個矩陣在另一張卡上,做 softmax 這類非線性仍然必須通信,融合救不了;而且他接觸過做融合 mega kernel 的公司,生產裡最終跑的還是 TensorRT-LLM 和 modular 的 kernel。NVIDIA 揭幕 Rubin 的帖子裡,這顆 GPU 的設計乾脆讓 mega kernel 變得不必要。順著這個趨勢他反問:GPU 每代都在加專用 tensor core、TMA,你越來越只是在編排 tile 而不是控制線程,Rubin 相對 T4 已近似 ASIC,那為什麼還看多 AI ASIC 公司?Swyx 的反駁是:垂直整合的模型廠自研芯片合理——按 Martin Casado 的算法,五千億訓練預算裡拿五百億做 ASIC,換到 10% 以上效率就值;而 ASIC 公司真正在做的是互聯與內存分配,那才是 10x 到 1000x 的瓶頸。

— Ali
1:15:25

視頻的平方牆

視頻這邊的經濟學和 LLM 相反。LLM 的開源閉源差距已經接近消失,視頻上是天壤之別——Ali 的例子是:哪怕他把一部三小時電影的生成成本壓到 10 美元、比閉源便宜 100 倍,客戶面對的仍是 1000 美元的絕對值,於是照樣全片用 Veo 和 Kling。需求少→創新少→開源 checkpoint 更少,Wan 2.7 已經不開源了。技術瓶頸是注意力的平方項:16 幀/秒的 480p 視頻,5 秒鐘壓到 latent 之後仍是 35000 個 token,而這是 O(n²),時長翻倍代價就是四倍。於是只有兩條路:上稀疏注意力(每個 token 只 attend 前 12.5%,畫質明顯掉),或者走自迴歸——但今天所有自迴歸視頻模型質量都很差,而靠拼接 5-7 秒片段會逐段漂移,二十幾秒後畫面暗成黑屏。

— Ali

原話 · 已逐字校驗

It is possible that the model in which I quantized more information is going to perform better because the quantization errors have canceled out.

完全有可能,我量化了更多信息的那個模型表現更好,因為量化誤差互相抵消掉了。

When we publish optimizations, it’s 20%, it’s 100% it’s 200%. So there’s still probably like a lot further to go, honestly. Like you’ll, you’ll know that inference is pretty much solved when researchers start publishing about how they got 1% faster at something.

我們發布的優化是 20%、100%、200%。所以老實說,這條路大概還很長。等到研究者開始發論文說自己把某件事快了 1%,你就知道推理這件事基本被解決了。

Philip31:57

With local AI, it’s how do I fit this model onto my hardware and then make it less dumb? And with data center influence, it’s how do I load this model and then make it less slow?

本地 AI 的問題是:怎麼把這個模型塞進我的硬件,然後讓它別那麼笨?數據中心推理的問題是:怎麼把模型加載起來,然後讓它別那麼慢?

Philip46:17

The downsides is every single autoregressive video model is s**t. It’s just terrible quality.

缺點是,每一個自迴歸視頻模型都很爛。質量差得離譜。

So that’s the fundamental problem with trying to change a fact in an MLP within the weight. KV cache compaction fixes that.

這就是試圖在權重裡的 MLP 中改一條事實的根本問題所在。KV cache 壓縮能解決它。

數字與實體

改造視覺後的 GLM-5.2 得分MMLU Pro 56%17:25
Baseten 量化相對 NVIDIA 的增量多量化 20%,吞吐高約 20%29:27
萬億參數模型無優化基線速度30-50 tokens/秒34:31
全量優化後目標速度300-400 tokens/秒35:38
精度下降的分項收益BF16→FP8 約 30-40%,FP8→FP4 再 30-40%38:23
5 秒 480p 視頻的注意力 token 數約 35000 個 token1:15:25

術語

speculative decoding (spec dec)投機解碼
小草稿模型先連猜幾個 token,大模型一次前向驗證並接受或否決。
PD disaggregationprefill/decode 分離
把處理輸入產出 KV cache 與逐 token 生成拆到兩組 GPU 上。
NVFP4NVFP4 四位浮點
Blackwell 原生支持的 4 比特格式,每個參數只佔半字節。
mega kernel巨型融合核
把多個 GPU kernel 融成一個,省掉啟動開銷和中間數據搬運。
expert parallelism專家並行
MoE 模型裡把整個 expert 放進單卡,卡間通信量遠小於張量並行。
KV cache compactionKV 緩存壓縮
壓縮已有 KV 而不改權重,Ali 認為這是持續學習的可行路徑。

收聽指南

誰該聽

自己租 GPU 託管開源模型的基礎設施工程師、在自建與 API 之間做決策的技術負責人、以及做視頻生成的團隊。

可跳過

0:00–1:00 的實習生玩笑;1:21 之後音樂擴散那段基本沒結論。