世界太吵,來原聲聽播客

張小珺·商業訪談錄

純線性注意力不 work,3 比 1 混合才是共識

純 Linear Attention 有根本缺陷,下限無保證;Kimi、千問都收斂到每 3 層線性插 1 層全局注意力,而 MiniMax 從 M1 退回 Full Attention 是因為評測漏了多跳推理。

線性注意力模型架構KimiDeepSeek推理效率
硬核架構向,講清了 Kimi Linear 的 KDA 模塊、3 比 1 比例由來、MiniMax 退回 Full Attention 的原因,以及線性與稀疏注意力如何結合。

核心論點 · 點時間戳可跳到原聲

12:14

長思維鏈把 decoding 成本逼爆

Kimi 年初重做注意力機制的直接動因是 DeepSeek R1 和 Kimi 1.5 那波 RL 帶來的長思維鏈,長度常到幾萬 token。如果每層都是平方注意力,decoding 時每層要存大量 KV cache,且 decode L 個 token 的時間複雜度也是平方的,太貴。混合注意力能把 inference cost 打低很多,這在長思維鏈和 agentic AI 背景下非常有用。

— 楊松琳
15:14

KDA 把粗粒度衰減換成細粒度

Kimi Linear 選的線性模塊叫 KDA(Kimi Delta Attention),基於楊松琳去年的 Gated DeltaNet 改進。Gated DeltaNet 當時受限於效率,用了類似 Mamba2 的粗粒度 gating——一個 attention head 下所有維度共享同一個衰減率。KDA 把它換成每個維度有自己獨立的衰減率,每個維度對應的 RNN 隱藏狀態有獨立的類更新頻率,直覺上能更好利用有限的 hidden state,提高 performance。

— 楊松琳
18:25

Kimi 內部用規模階梯通關

Kimi 內部有個叫 Scaling Ladder 的機制:在一個規模下表現好,就要到下一個規模繼續 scale,像通關一樣一關關跟 Full Attention 比。張宇先試了一大堆混合 Gated DeltaNet 的混法,發現混 Gated DeltaNet 比其他好,但有些地方仍不如 Full Softmax Attention;後來把 decay 換成更細粒度的,提升就挺大。

— 楊松琳
23:28

MiniMax 退回 Full Attention 的原因

MiniMax M1 是很大規模的混合注意力實踐,監控指標上 Lightning Attention 表現好且效率更高,就上了。但後來發現多跳推理(multi-hop reasoning)任務上掉點非常大——最初評測 pipeline 只看 MMLU 這類能力,沒檢測多跳推理。楊松琳認為 Lightning Attention 是比較弱的線性注意力,機制像停留在兩年前。M2 退回全 Softmax 的 Full Attention,但他們說還在繼續探索混合注意力,下一版 M3 說不定又變回來。

— 楊松琳
38:55

純線性不 work,混合才有下限

現在共識是純 Linear Attention 不 work,在長文本下有比較根本的缺陷:RNN 狀態數目恆定,context 長度增加早晚存不下、損失精度。混合注意力保留一定數目的全局注意力層,下限有保證,處理長文本也有保證。Kimi Linear 和千問 3 Next 在 ruler 等任務上表現沒掉點。但楊松琳也說不知道這算不算共識,因為 DeepSeek 還在試稀疏注意力方案。

— 楊松琳
40:56

3 比 1 快變成混合比例的共識

Kimi Linear 每 3 層 KDA 插 1 層全注意力。楊松琳說 3 比 1 現在快變成一個公式:MiniMax 之前是 7 比 1,softmax 層數不夠,長文本保證沒那麼好;字節發過 paper 研究 hybrid 架構需要多少比例 softmax,做了很多 pre-train from scratch 實驗,結論也是 3 比 1 最好、Gated DeltaNet 模塊比其他候選好。千問 3 Next 也用 3 比 1 加 Gated DeltaNet。

— 楊松琳
49:01

理想架構是稀疏替換全局層

楊松琳在知乎寫過:為什麼不能把兩種方案結合?讓 sparse attention 去取代混合注意力裡的全局注意力層,這樣就不需要全局注意力的複雜度,但還是要存 KV cache,剩下很多層的 KV cache 可以通過線性注意力把 size 打下來。他認為線性注意力的競爭對手更多是 Sliding Window Attention,而不是 sparse。工業界據他所知還沒人同時結合 sparse 和線性,學界有一些探索。

— 楊松琳
1:07:24

國內算法創新更強是因為卡少

楊松琳判斷國內算法創新肯定更強,infra 架構上國內更強。原因是生態地位不同:國內沒那麼多卡,對 efficiency 要求更高,更有動力嘗試高效的 Linear Attention 變種;硅谷有些公司卡太多,買得高。他還說美國公司更注重優化器(optimization)的投入,Kimi 是最早吃 Muon 這隻螃蟹的地方之一。

— 楊松琳
1:39:37

硬件奔著矩陣乘法越來越快

楊松琳說硬件和 Transformer 在協同演進,硬件變成 Transformer 更喜歡的模樣:Tensor Core、TMA、Blackwell 上針對矩陣乘單獨的內存,都是為優化矩陣乘。甚至 FA4 因為矩陣乘太快,導致 exp 那個模塊變成瓶頸,他們用 approximate 方法來做 exp。所以設計算法必須滿足硬件通用原則,否則在當今 scalability 場景下基本沒有實際價值。

— 楊松琳

原話 · 已逐字校驗

我覺得現在共識的時候就是說 純linear attention是不work的

我覺得現在的共識是:純 Linear Attention 是不 work 的。

楊松琳38:55

那你肯定你要 首先你要 啊 讓你的算法 先去 滿足一些 非常通用的原則嘛

那你肯定首先要讓你的算法先去滿足一些非常通用的原則。

楊松琳1:34:37

數字與實體

Kimi Linear 混合比例每 3 層 KDA 插 1 層全注意力40:56
MiniMax M1 混合比例7 比 140:56
千問 3 Next 的 RoPE 比例25% RoPE,75% NoPE1:11:27
Kimi 的 RoPE 比例砍了 100%1:11:27
長思維鏈長度幾萬 token12:14
BERT 年代訓練長度51234:51
當時視角的長文本819234:51
輸入無關衰減的遺忘率舉例0.9928:39
DeltaNet 最早出現年份2021 年1:17:28
細粒度 decay 最早可考古到2016 年1:25:33

術語

Linear Attention線性注意力
去掉 softmax、把複雜度從平方降到線性的注意力機制,可寫成 RNN 推理形式。
KDAKimi Delta Attention
Kimi Linear 用的線性注意力模塊,基於 Gated DeltaNet,把粗粒度衰減換成每維度獨立衰減。
Delta Rule增量更新規則
用 key 取出舊 value,與輸入 value 做線性組合後寫回記憶網絡,含減法刪除操作。
Sparse Attention稀疏注意力
只選 Top-K 的 token 參與注意力計算,減少每 token 生成花費,但不省 KV cache。
Sliding Window Attention滑窗注意力
只關注局部窗口的注意力,KV cache 上限被窗口大小 bound 住。
Scaling Ladder規模階梯
Kimi 內部機制,一個規模表現好就到下一個規模繼續 scale,像通關。

收聽指南

誰該聽

關注大模型架構與推理效率的工程師、研究員和投資人,尤其是想搞清 Linear Attention 與 Sparse Attention 路線之爭的人。

可跳過

1:15 之後關於個人讀博經歷和考古方法的閒聊可快進。