世界太吵,來原聲聽播客

張小珺·商業訪談錄

K3無顛覆創新,但把激活參數推到100B量級

孫宇濤領讀Kimi K3技術報告,指出它沒有單點突破,而是融合了線性注意力、混合注意力、動態負載均衡等已有技術,把激活參數做到100B量級;他判斷大模型再無Transformer式創新,只有改良。

架構創新注意力機制MoE預訓練推理優化Kimi K3
信息密度極高,嘉賓串聯十幾篇論文講清K3架構的來龍去脈,並對MLA、WSD、位置編碼等熱點給出直接判斷。

核心論點 · 點時間戳可跳到原聲

3:20

架構改進不再拼性能,只拼推理效率

孫宇濤指出,大模型時代模型的參數量是性能的最主要因素,架構改進帶來的性能提升相對微小;但不同架構在推理上的性能差異巨大,直接決定模型部署價格。業界研究因此從偏性能導向逐漸轉為以效率為導向,圍繞推理高效性展開。他的博士課題從2023年開始,主要就是解決大模型推理環節的低效問題,包括線性注意力、混合注意力等方向。

— 孫宇濤
7:34

混合注意力是工程妥協,能力卻沒損失

混合注意力雖在架構上是工程上的off,但從模型表現看並非off。只要保持一定全注意力比例,模型可獲得無損甚至更好的上限,即沒有犧牲全注意力的模型能力就帶來工程收益。這一實驗結論使混合注意力被大規模利用。但孫宇濤也指出其侷限:推理加速比與混合比成正比,例如全注意力佔四分之一時,加速比也受限於此,屬於常數級改進,因此他後來轉向了共享KV的架構。

— 孫宇濤
19:12

參數量仍是決定智能上限最本質的變量

Kimi K3的核心賣點是有效擴展:總參數2.8T,激活參數約100B,上下文長度達到1M量級。孫宇濤強調,更大的模型才有更大的智能上限,參數大小仍是解決模型智能最本質的變量。K3在發布時比國內其他開源模型大很多,且是相當早期就成功達到這一規模的模型。

— 孫宇濤
36:04

MLA不是新東西,只是MQA的等價實現

針對V4棄用MLA,孫宇濤認為MLA本質上就是MQA的等價形式,並未帶來新東西,只是更好的實現路徑。MLA的收益主要靠參數設計,其計算量遠大於實際所需,在推理階段有算力浪費。魯福利覺得在推理卡上MTP能更有效利用算力,因此V4改用MTP。他認為這不是對錯問題,而是一種選擇。K3沿用MLA是因為K2時跑通為主,能不動就不動,未來不一定會繼續用。

— 孫宇濤
49:42

兩個矩陣拆開寫,中間必須加歸一化

孫宇濤提出一個架構設計原則:兩個矩陣連乘在表達能力上可以合併為一個,但在優化性質上並不等價,經常導致訓練不穩定。因此如果不得不把兩個矩陣拆開寫,中間一定要加一個歸一化來穩定訓練。MLA、FFN中的兩層矩陣都出現了這種情況。他還提到,用clip直接截斷中間激活是粗暴做法,更平滑的做法是通過歸一化把中間激活限制在數學上可控的範圍。

— 孫宇濤
1:07:41

今天的Transformer已經是忒修斯之船

孫宇濤認為,現在的模型訓練並沒有一個巨大的所謂式創新,而是把之前很多工作融合起來再尋找更優組合。他用忒修斯之船比喻Transformer:2017年的船由attention加MLP等部件拼成,行駛八九年中某些部分不斷被替換,今天與最初的相似度已經很低。是否還叫Transformer是一個哲學問題,但從工程上大家仍然這麼叫。技術是慢慢提升的,由所有人共同推動。

— 孫宇濤
1:13:50

WSD沒降低調參難度,K3選了更簡單的方案

孫宇濤介紹了MiniMax提出的WSD學習率策略:在cooldown階段模型學習最快,因此可以把高質量數據集中放在該階段,比均勻分布數據取得更好效果。WSD還允許在訓練中途自由切換實際token數,方便調整發版時間。但K3團隊認為,WSD的調節難度並未降低,因為最優的cooldown比例仍取決於總token數;他們選擇了更簡單的方案,即只有兩個變量(總token數和峰值學習率),更容易調參。

— 孫宇濤
2:01:46

大模型可能不會再有Transformer級的創新

孫宇濤給出一個暴論:大模型可能沒有Transformer本人的創新了,後面都是改良性進步。他認為只要能力能被清晰定義,就能達到;純語言模型達到AGI問題不大,但涉及真實物理世界交互的AGI還有很大差距。模型大小不可能無限增長,因為人類互聯網上能彙集的信息量是有限的,模型沒必要無限大。他還提到,由於大模型改進空間不大,他個人轉向探索世界模型。

— 孫宇濤

原話 · 已逐字校驗

我覺得K3它還是比較有魄力,就是在已有的開源模型這個賽基礎上,他們要提升一個數量級。

我覺得K3還是比較有魄力,就是在已有的開源模型這個賽基礎上,他們要提升一個數量級。

孫宇濤1:55:29

我其實的一個觀點就是科學研究是不存在節約性的提升的。只是說大家習慣把這個技術的間立性提升的某些節點會成為一個mles。

我其實的一個觀點就是科學研究是不存在跳躍性的提升的。只是說大家習慣把這個技術的漸進性提升的某些節點稱為一個里程碑。

孫宇濤1:56:29

我說一下我的判斷啊,我的判斷比較暴論,我的悖論就是大模型可能沒有太本人的創新了,後面都是一些改良性的進進模。

我說一下我的判斷,我的判斷比較大膽,我的觀點就是大模型可能沒有Transformer本身的創新了,後面都是一些改良性的進步。

孫宇濤2:01:46

數字與實體

Kimi K3 總參數量2.8T19:12
Kimi K3 上下文長度1M(one million)20:13
K3 相比 K2 激活增長3倍多1:55:29

術語

MLA多頭潛在注意力
一種將KV壓縮為潛在表示的注意力機制,推理時減少緩存開銷。
WSDWarmup-Stable-Decay 學習率調度
三個階段的調度,衰減階段學習最快,可集中優質數據。
MTP多token預測
讓模型同時預測多個未來token,配合推測解碼加速推理。
EP專家並行
將MoE專家分布到不同GPU,存在負載均衡和通信優化問題。

收聽指南

誰該聽

大模型架構研究者、預訓練與推理工程師,想了解Kimi K3技術決策和業界最新架構融合思路的人。