世界太吵,来原声听播客

张小珺·商业访谈录

DeepSeek 用 2000 张卡训出 671B 模型,靠的是敢赌没人做过的技术

DeepSeek 的每一步创新都是被成本逼出来的:从 MoE 到 MLA 到 FP8 训练,别人不敢在大规模上试的东西,他们试了,而且一次训完没回滚。

DeepSeek大模型MoE强化学习论文解读
逐篇拆解 DeepSeek 九篇论文,把 MoE、MLA、FP8、MTP、R1 奖励设计的技术动机和工程细节讲透,信息密度高,适合想理解 DeepSeek 技术路线的人。

核心论点 · 点时间戳可跳到原声

0:00

创新是被成本逼出来的

何俊贤认为 DeepSeek 从很早就不是纯粹 follow 别人的 practice——Llama、Mistral 都很权威,但他们从 DeepSeek MoE 开始就探索更多 expert,不是为了创新而创新,而是真的想压低成本、让整个东西更 efficient,然后就跟别人 diverge,越来越不一样。这条线索贯穿全篇:从 MoE 到 V2 的 MLA,每一步创新背后都是成本动机。

— 何俊贤
5:05

奖励模型这条路走了大半年弯路

何俊贤自己团队在 R1 发布前两个多月就在做类似工作,试过很多复杂的东西都不 work,包括用 reward model 做强化学习,效果一直不理想,反复受挫。最后发现最简单的东西最 work:只用 rule-based reward,数学题检测最后答案对不对,coding 跑 unit test,不需要另一个模型来判断生成对不对。他认为这段弯路跟 OpenAI 早期那篇过程监督奖励模型的 paper 有很大关系,整个 community 都 follow 了,但 turns out OpenAI 自己最后做的可能并不是这么做的。

— 何俊贤
8:07

幻方 5000 张 A100 免费开放给高校

何俊贤 22 年就关注幻方,那时 DeepSeek 还没成立。幻方当时宣传有 5000 张英伟达 A100,在当时是很多的数量,因为还没有 ChatGPT,大家还没有大模型概念。幻方自己用不了那么多算力,就搭了一个集群、做了一套调度软件系统,免费开放给高校科研工作者使用。何俊贤后来去试用,觉得非常 impressive:幻方本身规模很小,可能就 100 多人,却用 5000 张卡做出了一个非常成熟的超算系统,中文名叫萤火集群。

— 何俊贤
38:37

DeepSeek 公开承认自己可以刷榜

何俊贤团队做的 C-Eval 是 23 年 5 月大模型中文第一个榜单,很快出现疯狂刷榜,后来出现高分低能现象,各公司或多或少刷榜但没人讲。DeepSeek 却用严谨的对照实验把这件事写进论文:只要拿很多多选题去训练,榜单可以瞬间高 20 多分,比如本来 47 分可以刷到 71。何俊贤说这个表虽然在论文很靠后的第 21 页,但当时是理解刷榜行为很重要的结果。他后来做新 evaluation 发现 DeepSeek release 的 base model 没有刷榜,而国内不少模型分数很高其实有刷榜行为。同期昆仑万维的 Skywork 也写了类似对照实验。

— 何俊贤
1:07:02

MLA 是 DeepSeek 第一个提出来的东西

何俊贤区分了两类创新:加 shared expert、把 expert 数量变多,还是在别人工作上做改进;但 Multi-head Latent Attention(多头潜在注意力)是 DeepSeek 第一个提出来的,不是在前人工作上改。它把 K 和 V 联合压缩成一个低维 latent 向量,部署时只存这个压缩后的 latent,不直接存 K 和 V,KVCache 降低 93%,相当于变成以前的十分之一。代价是它比 GQA 更激进,但效果比只用 2.25 个组的 GQA 好很多。何俊贤说这个东西刚出来时大家还没觉得那么 fundamental,DeepSeek 火了之后国外很多人才开始读这些 paper 关注它。

— 何俊贤
1:36:18

V2 价格战:不是亏钱,是赚钱

何俊贤回忆 DeepSeek V2 在 24 年 5 月发布后在国内引发价格战,当时每百万 token 一块钱还是几块钱,比 OpenAI 低很多,比国内其他厂商也低好几倍,可能都不是一个数量级。关键是他听说 DeepSeek 还不是亏钱在做部署,其实还是赚钱,只是赚得不多。当时很震惊:用比较差的 GPU、很便宜的价格部署一个很大的模型,结果还有利润。他记得当时开始有人叫 DeepSeek 是大模型界的拼多多。

— 何俊贤
1:42:25

V3 一次训练跑完,没回滚过

DeepSeek V3 在摘要里专门写了一句:整个训练过程没有出现 loss spike,一次就训完,没有做任何 roll back。这在预训练里非常罕见——过去 GPU 故障、不可知原因都会让 loss 突然尖起,只能停下来回滚重训。所以 V3 的 paper 有大量篇幅在写工程实现,这跟之前 paper 的风格不一样,作者认为这相当于秀肌肉,说明 DeepSeek 的 infra 做得特别好。

— 讲述人
1:43:28

2000 张 H800 训出 671B 模型

V3 是 671B 参数、14.8T token,只用了 2000 张 H800,不是 H100。作者强调这个规模对 600 多 B 的模型来说并不大,当时国内外卡超过上万张的公司已经很多,国外甚至有数十万张 H100 甚至更好的卡。等价价格 5.57M USD,五百多万美金,在当时很让人震惊。对比 Llama 3 的 400B 模型,作者记得花了 3000 万美金,差不多有 6 倍差距,可能还不止 3000 万。

— 讲述人
1:46:28

MTP 是没人敢在大规模上用的技术

V3 新加了 multi token prediction:训练时不只预测下一个词,而是一次预测下面三个词,好处是 training signal 更 dense,模型可能学会提前计划更远的 token。这个想法来自一篇不算特别有名的 paper,之前没人在很大规模上真的用过,DeepSeek 自己 V2 也没用过。作者认为这依然是很勇敢的行为,因为一旦训练不稳定或出现 unexpected issue,整个东西就变了,一般团队可能没有这个氛围去做。

— 讲述人
1:53:31

FP8 训练:几乎没人成功做过

V3 用了 fp8 training,即 low precision training,中间很多向量不用 32 位或 16 位浮点数表示,让训练更快更 efficient。但挑战很大:小数表示不精确,训练可能不 work、不稳定或效果变差。作者说虽然部署时很多人做量化、低精度,但几乎没有人在真的大规模训练上成功做过,DeepSeek V3 可能是第一个或最早的之一,真的在大规模 language model 训练上验证并成功做了混合精度训练。他们做了很仔细的对照实验,发现有些中间变量仍应用原精度,训练才能行。

— 讲述人
1:57:33

激活参数 30B 对 400B,部署成本差十倍

DeepSeek 除了第一版大模型,从 DeepSeek MOE 到 V2 到 V3 一直是 MOE;Llama 3 从 Llama 1 到 Llama 3 穿这么大的 Dense model,400B 依然不是 MOE,导致训练成本特别高、激活参数特别多。DeepSeek V3 激活参数只有 30B,意味着部署成本比 Llama 3 的 400B 模型少 10 倍多。效果上,英文跟 Llama 3 各有千秋,在 reasoning、Code、Math 和中文上大幅超过 Llama 3 的 400B Base。

— 讲述人
2:40:56

RL 可能只是把正确答案排到前面

DeepSeek Math 的 figure 7 给了一个 negative 信号:k 等于 1 时,做了 RL 的蓝线比没做 RL 的绿线高好几个点,看起来 RL 很 work;但当 k 增大、sample 多个 response 时,在简单的数学级上绿线到后面甚至更高,说明做 RL 后模型的探索能力反而下降了。他们自己加粗的结论是 the improvement is attributed to boosting the correct response,而不是 enhancement of fundamental ability。作者说当时没人做这个观察,DeepSeek 明明自己结果好很多,还反过来给自己泼冷水,非常严谨。

— 讲述人
2:42:56

规则奖励比奖励模型更 robust

DeepSeek Math 讨论如何实现更有效的 RL 时提到提高奖励模型的泛化能力,但作者认为从今天看有另一条路:不要奖励模型,只用规则,它就最 robust。因为数学最终答案对错这个规则是普世的,不管高中、小学、初中、大学的题,标准答案做对就基本认为 response 对;而奖励模型如果在小学初中数据上训练,判断小学初中题很准,突然给大学数学题就可能判断不准。不过开放式领域、没有正确错误概念的问题,还是需要奖励模型。

— 讲述人
2:55:00

R1 抛弃奖励模型,跟 Coder V2 结论矛盾

R1 的 reward 只有两个:accuracy reward 看对不对,format reward 看输出有没有 follow 想要的格式,两个都是规则的,没有奖励模型。作者指出这跟前面结果矛盾:DeepSeek Coder V2 时他们还有实验说对 Code 用 Reward Model 更好、Compiler 更差,但 R1 在 LiveCode 上就只用 Compiler,不用 Reward Model。从 DeepSeek Prover 开始不用奖励模型,到 R1 奖励模型就没有了。

— 讲述人
3:18:23

过程监督奖励模型做 PPO 调了两三个月没调出来

第一次做长链推理时,团队直接拿 DeepSeek 开源的过程监督奖励模式(类似 DeepSeek Math 那套)来做 online PPO,做了很长时间、调了两三个月,效果都不好,最后放弃强化学习,转去做迭代式自我进化,那条路反而 work。项目做完之后他们仍判断不行,还是要做在线的,于是去年底重新开始做 PPO。

— 嘉宾
3:19:23

去掉奖励模型,PPO 才容易 work

去年底重做 PPO 能 work 的关键区别是:不用奖励模型。嘉宾说这跟大家收敛的路线一样——大家用奖励模型发现做起来有点困难,后来就不用奖励模型,DeepSeek 跟 R1 最后都收敛到这个地方。中间还先做了一版更容易 work 的拒绝采样 SFT,做得比较顺利,但团队认为自我进化这条路上还是应该做 online 的才比较有前途。

— 嘉宾
3:19:23

DeepSeek 的论文像学校论文,但用的是业界资源

嘉宾评价 DeepSeek 的 paper style:很像学校的 paper,风格低调、不浮夸、不到处宣传,但学校一般做不了这么大的模型,他们是拿着公司业界 level 的资源写出学校风格的东西,跟其他业界很不一样。他补充这可能跟团队模式有关——他们是自己孵化的,天然就是一个有点特别的团队。

— 嘉宾

原话 · 已逐字校验

但是之前在很长一段时间 不光是我们 就我觉得这个community 包括Deepseek自己 今天也会讲到相关的paper 包括Deepseek自己 其实之前大家都是默认 我们需要另一个模型 我们俗称奖励模型 来帮助判断我的模型生成对不对 然后用这一套来做强化学习

但在很长一段时间里,不光是我们,我觉得整个社区,包括 DeepSeek 自己——今天也会讲到相关论文——之前大家都默认:我们需要另一个模型,俗称奖励模型,来帮助判断我的模型生成对不对,然后用这一套来做强化学习。

何俊贤6:06

所以说我觉得就 也受到了一些open AI的误导吧

所以我觉得,也受到了一些 OpenAI 的误导吧。

何俊贤7:06

但是其实要做这个尝试还是很勇敢 对因为你要在一个很大的规模上 花很大的算力 比如说这个投入去探索这种 你比如说以前大家都没有怎么做 大家MOE以前有人已经做过了 比如说就是bug expert 就少量 expert也不要shared 做过了就效果也还行 那你就直接照着做 其实最简单的也可能风险也比较低 为啥非要自己去搞一些不一样的东西

但其实要做这个尝试还是很勇敢,因为你要在一个很大的规模上、花很大的算力去探索这种以前大家都没怎么做过的东西。MOE 以前有人已经做过了,比如少量 expert、也不要 shared,做过了效果也还行,那你直接照着做其实最简单、风险也比较低,为啥非要自己去搞一些不一样的东西。

何俊贤58:57

就是他们的train非常的稳定 就是整个train 他们都没有经历任何的这个 loss spike

他们的训练非常稳定,整个训练过程没有经历任何 loss spike。

讲述人1:42:25

但是几乎没有人在真的大规模上训练上 做过比较成功的做过这个事情

但几乎没有人在真正的大规模训练上比较成功地做过这件事。

讲述人1:53:31

the improvement is attributed to boosting the correct response

提升被归因于把正确答案的排序提上来。

讲述人2:40:56

然后发现不用讲理模型之后 这个东西就很容易就work了

然后发现不用奖励模型之后,这个东西就很容易 work 了。

嘉宾3:19:23

我觉得他们的paper很像学校的 很像学校的paper 他们资源当然很多了 学校一般做不了这么大的模型 但是他们就是拿着公司业界的 这种level的资源 写的这些东西

我觉得他们的 paper 很像学校的,很像学校的 paper。他们资源当然很多了,学校一般做不了这么大的模型,但是他们就是拿着公司业界这种 level 的资源,写的这些东西。

嘉宾3:19:23

数字与实体

幻方 A100 卡数5000 张8:07
DeepSeek MoE 专有专家数64 个1:01:57
MLA 对 KVCache 的压缩降低 93%1:20:06
DeepSeek V3 训练 token 量14.8T1:41:25
DeepSeek V3 训练卡数2000 张 H8001:43:28
过程监督奖励模型 PPO 调试时长两三个月3:18:23

术语

MoE混合专家
模型由多个专家子网络组成,每次只激活部分专家,降低计算成本。
MLA多头潜在注意力
DeepSeek 提出的注意力机制,将 K 和 V 压缩成低维 latent 向量,大幅降低 KVCache。
MTP多 token 预测
训练时一次预测多个未来 token,增加训练信号密度。
FP88 位浮点数
低精度训练格式,减少内存和计算开销,但容易导致训练不稳定。
PPO近端策略优化
一种强化学习算法,常用于大模型对齐训练。
rule-based reward规则奖励
用固定规则(如答案对错、代码编译通过)作为奖励信号,不依赖奖励模型。

收听指南

谁该听

想理解 DeepSeek 技术路线和工程决策的 AI 工程师、研究员,以及关注大模型成本与效率的创业者。

可跳过

对 MoE 和 MLA 数学细节不感兴趣的听众,可跳过 1:00:00-1:30:00 的架构讲解。