K3无颠覆性创新,但把模型规模推上一个数量级
孙宇涛领读Kimi K3技术报告,指出它没有单点突破,而是融合了线性注意力、混合注意力、动态负载均衡等已有技术,把激活参数做到100B量级;他判断大模型再无Transformer式创新,只有改良。
核心论点 · 点时间戳可跳到原声
架构研究转向效率导向
孙宇涛指出,大模型时代模型的参数量是性能的最主要因素,架构改进带来的性能提升相对微小;但不同架构在推理上的性能差异巨大,直接决定模型部署价格。业界研究因此从偏性能导向逐渐转为以效率为导向,围绕推理高效性展开。他的博士课题从2023年开始,主要就是解决大模型推理环节的低效问题,包括线性注意力、混合注意力等方向。
— 孙宇涛混合注意力无损收益
混合注意力虽在架构上是工程上的off,但从模型表现看并非off。只要保持一定全注意力比例,模型可获得无损甚至更好的上限,即没有牺牲全注意力的模型能力就带来工程收益。这一实验结论使混合注意力被大规模利用。但孙宇涛也指出其局限:推理加速比与混合比成正比,例如全注意力占四分之一时,加速比也受限于此,属于常数级改进,因此他后来转向了共享KV的架构。
— 孙宇涛K3的规模扩张
Kimi K3的核心卖点是有效扩展:总参数2.8T,激活参数约100B,上下文长度达到1M量级。孙宇涛强调,更大的模型才有更大的智能上限,参数大小仍是解决模型智能最本质的变量。K3在发布时比国内其他开源模型大很多,且是相当早期就成功达到这一规模的模型。
— 孙宇涛MLA本质与未来判断
针对V4弃用MLA,孙宇涛认为MLA本质上就是MQA的等价形式,并未带来新东西,只是更好的实现路径。MLA的收益主要靠参数设计,其计算量远大于实际所需,在推理阶段有算力浪费。鲁福利觉得在推理卡上MTP能更有效利用算力,因此V4改用MTP。他认为这不是对错问题,而是一种选择。K3沿用MLA是因为K2时跑通为主,能不动就不动,未来不一定会继续用。
— 孙宇涛矩阵连乘与稳定性设计
孙宇涛提出一个架构设计原则:两个矩阵连乘在表达能力上可以合并为一个,但在优化性质上并不等价,经常导致训练不稳定。因此如果不得不把两个矩阵拆开写,中间一定要加一个归一化来稳定训练。MLA、FFN中的两层矩阵都出现了这种情况。他还提到,用clip直接截断中间激活是粗暴做法,更平滑的做法是通过归一化把中间激活限制在数学上可控的范围。
— 孙宇涛没有巨大创新只有融合
孙宇涛认为,现在的模型训练并没有一个巨大的所谓式创新,而是把之前很多工作融合起来再寻找更优组合。他用忒修斯之船比喻Transformer:2017年的船由attention加MLP等部件拼成,行驶八九年中某些部分不断被替换,今天与最初的相似度已经很低。是否还叫Transformer是一个哲学问题,但从工程上大家仍然这么叫。技术是慢慢提升的,由所有人共同推动。
— 孙宇涛WSD策略与K3的选择
孙宇涛介绍了MiniMax提出的WSD学习率策略:在cooldown阶段模型学习最快,因此可以把高质量数据集中放在该阶段,比均匀分布数据取得更好效果。WSD还允许在训练中途自由切换实际token数,方便调整发版时间。但K3团队认为,WSD的调节难度并未降低,因为最优的cooldown比例仍取决于总token数;他们选择了更简单的方案,即只有两个变量(总token数和峰值学习率),更容易调参。
— 孙宇涛大模型再无颠覆性创新
孙宇涛给出一个暴论:大模型可能没有Transformer本人的创新了,后面都是改良性进步。他认为只要能力能被清晰定义,就能达到;纯语言模型达到AGI问题不大,但涉及真实物理世界交互的AGI还有很大差距。模型大小不可能无限增长,因为人类互联网上能汇集的信息量是有限的,模型没必要无限大。他还提到,由于大模型改进空间不大,他个人转向探索世界模型。
— 孙宇涛原话 · 已逐字校验
我觉得K3它还是比较有魄力,就是在已有的开源模型这个赛基础上,他们要提升一个数量级。
我觉得K3还是比较有魄力,就是在已有的开源模型这个赛基础上,他们要提升一个数量级。
孙宇涛1:55:29
我其实的一个观点就是科学研究是不存在节约性的提升的。只是说大家习惯把这个技术的间立性提升的某些节点会成为一个mles。
我其实的一个观点就是科学研究是不存在跳跃性的提升的。只是说大家习惯把这个技术的渐进性提升的某些节点称为一个里程碑。
孙宇涛1:56:29
我说一下我的判断啊,我的判断比较暴论,我的悖论就是大模型可能没有太本人的创新了,后面都是一些改良性的进进模。
我说一下我的判断,我的判断比较大胆,我的观点就是大模型可能没有Transformer本身的创新了,后面都是一些改良性的进步。
孙宇涛2:01:46
数字与实体
| Kimi K3 总参数量 | 2.8T | 19:12 |
| Kimi K3 上下文长度 | 1M(one million) | 20:13 |
| K3 相比 K2 激活增长 | 3倍多 | 1:55:29 |
术语
- MLA多头潜在注意力
- 一种将KV压缩为潜在表示的注意力机制,推理时减少缓存开销。
- WSDWarmup-Stable-Decay 学习率调度
- 三个阶段的调度,衰减阶段学习最快,可集中优质数据。
- MTP多token预测
- 让模型同时预测多个未来token,配合推测解码加速推理。
- EP专家并行
- 将MoE专家分布到不同GPU,存在负载均衡和通信优化问题。
收听指南
大模型架构研究者、预训练与推理工程师,想了解Kimi K3技术决策和业界最新架构融合思路的人。