世界太吵,来原声听播客

张小珺·商业访谈录

纯线性注意力不 work,3 比 1 混合才是共识

纯 Linear Attention 有根本缺陷,下限无保证;Kimi、千问都收敛到每 3 层线性插 1 层全局注意力,而 MiniMax 从 M1 退回 Full Attention 是因为评测漏了多跳推理。

线性注意力模型架构KimiDeepSeek推理效率
硬核架构向,讲清了 Kimi Linear 的 KDA 模块、3 比 1 比例由来、MiniMax 退回 Full Attention 的原因,以及线性与稀疏注意力如何结合。

核心论点 · 点时间戳可跳到原声

12:14

长思维链把 decoding 成本逼爆

Kimi 年初重做注意力机制的直接动因是 DeepSeek R1 和 Kimi 1.5 那波 RL 带来的长思维链,长度常到几万 token。如果每层都是平方注意力,decoding 时每层要存大量 KV cache,且 decode L 个 token 的时间复杂度也是平方的,太贵。混合注意力能把 inference cost 打低很多,这在长思维链和 agentic AI 背景下非常有用。

— 杨松琳
15:14

KDA 把粗粒度衰减换成细粒度

Kimi Linear 选的线性模块叫 KDA(Kimi Delta Attention),基于杨松琳去年的 Gated DeltaNet 改进。Gated DeltaNet 当时受限于效率,用了类似 Mamba2 的粗粒度 gating——一个 attention head 下所有维度共享同一个衰减率。KDA 把它换成每个维度有自己独立的衰减率,每个维度对应的 RNN 隐藏状态有独立的类更新频率,直觉上能更好利用有限的 hidden state,提高 performance。

— 杨松琳
18:25

Kimi 内部用规模阶梯通关

Kimi 内部有个叫 Scaling Ladder 的机制:在一个规模下表现好,就要到下一个规模继续 scale,像通关一样一关关跟 Full Attention 比。张宇先试了一大堆混合 Gated DeltaNet 的混法,发现混 Gated DeltaNet 比其他好,但有些地方仍不如 Full Softmax Attention;后来把 decay 换成更细粒度的,提升就挺大。

— 杨松琳
23:28

MiniMax 退回 Full Attention 的原因

MiniMax M1 是很大规模的混合注意力实践,监控指标上 Lightning Attention 表现好且效率更高,就上了。但后来发现多跳推理(multi-hop reasoning)任务上掉点非常大——最初评测 pipeline 只看 MMLU 这类能力,没检测多跳推理。杨松琳认为 Lightning Attention 是比较弱的线性注意力,机制像停留在两年前。M2 退回全 Softmax 的 Full Attention,但他们说还在继续探索混合注意力,下一版 M3 说不定又变回来。

— 杨松琳
38:55

纯线性不 work,混合才有下限

现在共识是纯 Linear Attention 不 work,在长文本下有比较根本的缺陷:RNN 状态数目恒定,context 长度增加早晚存不下、损失精度。混合注意力保留一定数目的全局注意力层,下限有保证,处理长文本也有保证。Kimi Linear 和千问 3 Next 在 ruler 等任务上表现没掉点。但杨松琳也说不知道这算不算共识,因为 DeepSeek 还在试稀疏注意力方案。

— 杨松琳
40:56

3 比 1 快变成混合比例的共识

Kimi Linear 每 3 层 KDA 插 1 层全注意力。杨松琳说 3 比 1 现在快变成一个公式:MiniMax 之前是 7 比 1,softmax 层数不够,长文本保证没那么好;字节发过 paper 研究 hybrid 架构需要多少比例 softmax,做了很多 pre-train from scratch 实验,结论也是 3 比 1 最好、Gated DeltaNet 模块比其他候选好。千问 3 Next 也用 3 比 1 加 Gated DeltaNet。

— 杨松琳
49:01

理想架构是稀疏替换全局层

杨松琳在知乎写过:为什么不能把两种方案结合?让 sparse attention 去取代混合注意力里的全局注意力层,这样就不需要全局注意力的复杂度,但还是要存 KV cache,剩下很多层的 KV cache 可以通过线性注意力把 size 打下来。他认为线性注意力的竞争对手更多是 Sliding Window Attention,而不是 sparse。工业界据他所知还没人同时结合 sparse 和线性,学界有一些探索。

— 杨松琳
1:07:24

国内算法创新更强是因为卡少

杨松琳判断国内算法创新肯定更强,infra 架构上国内更强。原因是生态地位不同:国内没那么多卡,对 efficiency 要求更高,更有动力尝试高效的 Linear Attention 变种;硅谷有些公司卡太多,买得高。他还说美国公司更注重优化器(optimization)的投入,Kimi 是最早吃 Muon 这只螃蟹的地方之一。

— 杨松琳
1:39:37

硬件奔着矩阵乘法越来越快

杨松琳说硬件和 Transformer 在协同演进,硬件变成 Transformer 更喜欢的模样:Tensor Core、TMA、Blackwell 上针对矩阵乘单独的内存,都是为优化矩阵乘。甚至 FA4 因为矩阵乘太快,导致 exp 那个模块变成瓶颈,他们用 approximate 方法来做 exp。所以设计算法必须满足硬件通用原则,否则在当今 scalability 场景下基本没有实际价值。

— 杨松琳

原话 · 已逐字校验

我觉得现在共识的时候就是说 纯linear attention是不work的

我觉得现在的共识是:纯 Linear Attention 是不 work 的。

杨松琳38:55

那你肯定你要 首先你要 啊 让你的算法 先去 满足一些 非常通用的原则嘛

那你肯定首先要让你的算法先去满足一些非常通用的原则。

杨松琳1:34:37

数字与实体

Kimi Linear 混合比例每 3 层 KDA 插 1 层全注意力40:56
MiniMax M1 混合比例7 比 140:56
千问 3 Next 的 RoPE 比例25% RoPE,75% NoPE1:11:27
Kimi 的 RoPE 比例砍了 100%1:11:27
长思维链长度几万 token12:14
BERT 年代训练长度51234:51
当时视角的长文本819234:51
输入无关衰减的遗忘率举例0.9928:39
DeltaNet 最早出现年份2021 年1:17:28
细粒度 decay 最早可考古到2016 年1:25:33

术语

Linear Attention线性注意力
去掉 softmax、把复杂度从平方降到线性的注意力机制,可写成 RNN 推理形式。
KDAKimi Delta Attention
Kimi Linear 用的线性注意力模块,基于 Gated DeltaNet,把粗粒度衰减换成每维度独立衰减。
Delta Rule增量更新规则
用 key 取出旧 value,与输入 value 做线性组合后写回记忆网络,含减法删除操作。
Sparse Attention稀疏注意力
只选 Top-K 的 token 参与注意力计算,减少每 token 生成花费,但不省 KV cache。
Sliding Window Attention滑窗注意力
只关注局部窗口的注意力,KV cache 上限被窗口大小 bound 住。
Scaling Ladder规模阶梯
Kimi 内部机制,一个规模表现好就到下一个规模继续 scale,像通关。

收听指南

谁该听

关注大模型架构与推理效率的工程师、研究员和投资人,尤其是想搞清 Linear Attention 与 Sparse Attention 路线之争的人。

可跳过

1:15 之后关于个人读博经历和考古方法的闲聊可快进。