DeepSeek 用 2000 張卡訓出 671B 模型,靠的是敢賭沒人做過的技術
DeepSeek 的每一步創新都是被成本逼出來的:從 MoE 到 MLA 到 FP8 訓練,別人不敢在大規模上試的東西,他們試了,而且一次訓完沒回滾。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
創新是被成本逼出來的
何俊賢認為 DeepSeek 從很早就不是純粹 follow 別人的 practice——Llama、Mistral 都很權威,但他們從 DeepSeek MoE 開始就探索更多 expert,不是為了創新而創新,而是真的想壓低成本、讓整個東西更 efficient,然後就跟別人 diverge,越來越不一樣。這條線索貫穿全篇:從 MoE 到 V2 的 MLA,每一步創新背後都是成本動機。
— 何俊賢獎勵模型這條路走了大半年彎路
何俊賢自己團隊在 R1 發布前兩個多月就在做類似工作,試過很多複雜的東西都不 work,包括用 reward model 做強化學習,效果一直不理想,反覆受挫。最後發現最簡單的東西最 work:只用 rule-based reward,數學題檢測最後答案對不對,coding 跑 unit test,不需要另一個模型來判斷生成對不對。他認為這段彎路跟 OpenAI 早期那篇過程監督獎勵模型的 paper 有很大關係,整個 community 都 follow 了,但 turns out OpenAI 自己最後做的可能並不是這麼做的。
— 何俊賢幻方 5000 張 A100 免費開放給高校
何俊賢 22 年就關注幻方,那時 DeepSeek 還沒成立。幻方當時宣傳有 5000 張英偉達 A100,在當時是很多的數量,因為還沒有 ChatGPT,大家還沒有大模型概念。幻方自己用不了那麼多算力,就搭了一個集群、做了一套調度軟件系統,免費開放給高校科研工作者使用。何俊賢后來去試用,覺得非常 impressive:幻方本身規模很小,可能就 100 多人,卻用 5000 張卡做出了一個非常成熟的超算系統,中文名叫螢火集群。
— 何俊賢DeepSeek 公開承認自己可以刷榜
何俊賢團隊做的 C-Eval 是 23 年 5 月大模型中文第一個榜單,很快出現瘋狂刷榜,後來出現高分低能現象,各公司或多或少刷榜但沒人講。DeepSeek 卻用嚴謹的對照實驗把這件事寫進論文:只要拿很多多選題去訓練,榜單可以瞬間高 20 多分,比如本來 47 分可以刷到 71。何俊賢說這個表雖然在論文很靠後的第 21 頁,但當時是理解刷榜行為很重要的結果。他後來做新 evaluation 發現 DeepSeek release 的 base model 沒有刷榜,而國內不少模型分數很高其實有刷榜行為。同期崑崙萬維的 Skywork 也寫了類似對照實驗。
— 何俊賢MLA 是 DeepSeek 第一個提出來的東西
何俊賢區分了兩類創新:加 shared expert、把 expert 數量變多,還是在別人工作上做改進;但 Multi-head Latent Attention(多頭潛在注意力)是 DeepSeek 第一個提出來的,不是在前人工作上改。它把 K 和 V 聯合壓縮成一個低維 latent 向量,部署時只存這個壓縮後的 latent,不直接存 K 和 V,KVCache 降低 93%,相當於變成以前的十分之一。代價是它比 GQA 更激進,但效果比只用 2.25 個組的 GQA 好很多。何俊賢說這個東西剛出來時大家還沒覺得那麼 fundamental,DeepSeek 火了之後國外很多人才開始讀這些 paper 關注它。
— 何俊賢V2 價格戰:不是虧錢,是賺錢
何俊賢回憶 DeepSeek V2 在 24 年 5 月發布後在國內引發價格戰,當時每百萬 token 一塊錢還是幾塊錢,比 OpenAI 低很多,比國內其他廠商也低好幾倍,可能都不是一個數量級。關鍵是他聽說 DeepSeek 還不是虧錢在做部署,其實還是賺錢,只是賺得不多。當時很震驚:用比較差的 GPU、很便宜的價格部署一個很大的模型,結果還有利潤。他記得當時開始有人叫 DeepSeek 是大模型界的拼多多。
— 何俊賢V3 一次訓練跑完,沒回滾過
DeepSeek V3 在摘要裡專門寫了一句:整個訓練過程沒有出現 loss spike,一次就訓完,沒有做任何 roll back。這在預訓練裡非常罕見——過去 GPU 故障、不可知原因都會讓 loss 突然尖起,只能停下來回滾重訓。所以 V3 的 paper 有大量篇幅在寫工程實現,這跟之前 paper 的風格不一樣,作者認為這相當於秀肌肉,說明 DeepSeek 的 infra 做得特別好。
— 講述人2000 張 H800 訓出 671B 模型
V3 是 671B 參數、14.8T token,只用了 2000 張 H800,不是 H100。作者強調這個規模對 600 多 B 的模型來說並不大,當時國內外卡超過上萬張的公司已經很多,國外甚至有數十萬張 H100 甚至更好的卡。等價價格 5.57M USD,五百多萬美金,在當時很讓人震驚。對比 Llama 3 的 400B 模型,作者記得花了 3000 萬美金,差不多有 6 倍差距,可能還不止 3000 萬。
— 講述人MTP 是沒人敢在大規模上用的技術
V3 新加了 multi token prediction:訓練時不只預測下一個詞,而是一次預測下面三個詞,好處是 training signal 更 dense,模型可能學會提前計劃更遠的 token。這個想法來自一篇不算特別有名的 paper,之前沒人在很大規模上真的用過,DeepSeek 自己 V2 也沒用過。作者認為這依然是很勇敢的行為,因為一旦訓練不穩定或出現 unexpected issue,整個東西就變了,一般團隊可能沒有這個氛圍去做。
— 講述人FP8 訓練:幾乎沒人成功做過
V3 用了 fp8 training,即 low precision training,中間很多向量不用 32 位或 16 位浮點數表示,讓訓練更快更 efficient。但挑戰很大:小數表示不精確,訓練可能不 work、不穩定或效果變差。作者說雖然部署時很多人做量化、低精度,但幾乎沒有人在真的大規模訓練上成功做過,DeepSeek V3 可能是第一個或最早的之一,真的在大規模 language model 訓練上驗證併成功做了混合精度訓練。他們做了很仔細的對照實驗,發現有些中間變量仍應用原精度,訓練才能行。
— 講述人激活參數 30B 對 400B,部署成本差十倍
DeepSeek 除了第一版大模型,從 DeepSeek MOE 到 V2 到 V3 一直是 MOE;Llama 3 從 Llama 1 到 Llama 3 穿這麼大的 Dense model,400B 依然不是 MOE,導致訓練成本特別高、激活參數特別多。DeepSeek V3 激活參數只有 30B,意味著部署成本比 Llama 3 的 400B 模型少 10 倍多。效果上,英文跟 Llama 3 各有千秋,在 reasoning、Code、Math 和中文上大幅超過 Llama 3 的 400B Base。
— 講述人RL 可能只是把正確答案排到前面
DeepSeek Math 的 figure 7 給了一個 negative 信號:k 等於 1 時,做了 RL 的藍線比沒做 RL 的綠線高好幾個點,看起來 RL 很 work;但當 k 增大、sample 多個 response 時,在簡單的數學級上綠線到後面甚至更高,說明做 RL 後模型的探索能力反而下降了。他們自己加粗的結論是 the improvement is attributed to boosting the correct response,而不是 enhancement of fundamental ability。作者說當時沒人做這個觀察,DeepSeek 明明自己結果好很多,還反過來給自己潑冷水,非常嚴謹。
— 講述人規則獎勵比獎勵模型更 robust
DeepSeek Math 討論如何實現更有效的 RL 時提到提高獎勵模型的泛化能力,但作者認為從今天看有另一條路:不要獎勵模型,只用規則,它就最 robust。因為數學最終答案對錯這個規則是普世的,不管高中、小學、初中、大學的題,標準答案做對就基本認為 response 對;而獎勵模型如果在小學初中數據上訓練,判斷小學初中題很準,突然給大學數學題就可能判斷不準。不過開放式領域、沒有正確錯誤概念的問題,還是需要獎勵模型。
— 講述人R1 拋棄獎勵模型,跟 Coder V2 結論矛盾
R1 的 reward 只有兩個:accuracy reward 看對不對,format reward 看輸出有沒有 follow 想要的格式,兩個都是規則的,沒有獎勵模型。作者指出這跟前面結果矛盾:DeepSeek Coder V2 時他們還有實驗說對 Code 用 Reward Model 更好、Compiler 更差,但 R1 在 LiveCode 上就只用 Compiler,不用 Reward Model。從 DeepSeek Prover 開始不用獎勵模型,到 R1 獎勵模型就沒有了。
— 講述人過程監督獎勵模型做 PPO 調了兩三個月沒調出來
第一次做長鏈推理時,團隊直接拿 DeepSeek 開源的過程監督獎勵模式(類似 DeepSeek Math 那套)來做 online PPO,做了很長時間、調了兩三個月,效果都不好,最後放棄強化學習,轉去做迭代式自我進化,那條路反而 work。項目做完之後他們仍判斷不行,還是要做在線的,於是去年底重新開始做 PPO。
— 嘉賓去掉獎勵模型,PPO 才容易 work
去年底重做 PPO 能 work 的關鍵區別是:不用獎勵模型。嘉賓說這跟大家收斂的路線一樣——大家用獎勵模型發現做起來有點困難,後來就不用獎勵模型,DeepSeek 跟 R1 最後都收斂到這個地方。中間還先做了一版更容易 work 的拒絕採樣 SFT,做得比較順利,但團隊認為自我進化這條路上還是應該做 online 的才比較有前途。
— 嘉賓DeepSeek 的論文像學校論文,但用的是業界資源
嘉賓評價 DeepSeek 的 paper style:很像學校的 paper,風格低調、不浮誇、不到處宣傳,但學校一般做不了這麼大的模型,他們是拿著公司業界 level 的資源寫出學校風格的東西,跟其他業界很不一樣。他補充這可能跟團隊模式有關——他們是自己孵化的,天然就是一個有點特別的團隊。
— 嘉賓原話 · 已逐字校驗
但是之前在很長一段時間 不光是我們 就我覺得這個community 包括Deepseek自己 今天也會講到相關的paper 包括Deepseek自己 其實之前大家都是默認 我們需要另一個模型 我們俗稱獎勵模型 來幫助判斷我的模型生成對不對 然後用這一套來做強化學習
但在很長一段時間裡,不光是我們,我覺得整個社區,包括 DeepSeek 自己——今天也會講到相關論文——之前大家都默認:我們需要另一個模型,俗稱獎勵模型,來幫助判斷我的模型生成對不對,然後用這一套來做強化學習。
何俊賢6:06
所以說我覺得就 也受到了一些open AI的誤導吧
所以我覺得,也受到了一些 OpenAI 的誤導吧。
何俊賢7:06
但是其實要做這個嘗試還是很勇敢 對因為你要在一個很大的規模上 花很大的算力 比如說這個投入去探索這種 你比如說以前大家都沒有怎麼做 大家MOE以前有人已經做過了 比如說就是bug expert 就少量 expert也不要shared 做過了就效果也還行 那你就直接照著做 其實最簡單的也可能風險也比較低 為啥非要自己去搞一些不一樣的東西
但其實要做這個嘗試還是很勇敢,因為你要在一個很大的規模上、花很大的算力去探索這種以前大家都沒怎麼做過的東西。MOE 以前有人已經做過了,比如少量 expert、也不要 shared,做過了效果也還行,那你直接照著做其實最簡單、風險也比較低,為啥非要自己去搞一些不一樣的東西。
何俊賢58:57
就是他們的train非常的穩定 就是整個train 他們都沒有經歷任何的這個 loss spike
他們的訓練非常穩定,整個訓練過程沒有經歷任何 loss spike。
講述人1:42:25
但是幾乎沒有人在真的大規模上訓練上 做過比較成功的做過這個事情
但幾乎沒有人在真正的大規模訓練上比較成功地做過這件事。
講述人1:53:31
the improvement is attributed to boosting the correct response
提升被歸因於把正確答案的排序提上來。
講述人2:40:56
然後發現不用講理模型之後 這個東西就很容易就work了
然後發現不用獎勵模型之後,這個東西就很容易 work 了。
嘉賓3:19:23
我覺得他們的paper很像學校的 很像學校的paper 他們資源當然很多了 學校一般做不了這麼大的模型 但是他們就是拿著公司業界的 這種level的資源 寫的這些東西
我覺得他們的 paper 很像學校的,很像學校的 paper。他們資源當然很多了,學校一般做不了這麼大的模型,但是他們就是拿著公司業界這種 level 的資源,寫的這些東西。
嘉賓3:19:23
數字與實體
| 幻方 A100 卡數 | 5000 張 | 8:07 |
| DeepSeek MoE 專有專家數 | 64 個 | 1:01:57 |
| MLA 對 KVCache 的壓縮 | 降低 93% | 1:20:06 |
| DeepSeek V3 訓練 token 量 | 14.8T | 1:41:25 |
| DeepSeek V3 訓練卡數 | 2000 張 H800 | 1:43:28 |
| 過程監督獎勵模型 PPO 調試時長 | 兩三個月 | 3:18:23 |
術語
- MoE混合專家
- 模型由多個專家子網絡組成,每次只激活部分專家,降低計算成本。
- MLA多頭潛在注意力
- DeepSeek 提出的注意力機制,將 K 和 V 壓縮成低維 latent 向量,大幅降低 KVCache。
- MTP多 token 預測
- 訓練時一次預測多個未來 token,增加訓練信號密度。
- FP88 位浮點數
- 低精度訓練格式,減少內存和計算開銷,但容易導致訓練不穩定。
- PPO近端策略優化
- 一種強化學習算法,常用於大模型對齊訓練。
- rule-based reward規則獎勵
- 用固定規則(如答案對錯、代碼編譯通過)作為獎勵信號,不依賴獎勵模型。
收聽指南
想理解 DeepSeek 技術路線和工程決策的 AI 工程師、研究員,以及關注大模型成本與效率的創業者。
對 MoE 和 MLA 數學細節不感興趣的聽眾,可跳過 1:00:00-1:30:00 的架構講解。