世界太吵,来原声听播客

张小珺·商业访谈录

R1 最值钱的不是模型,是那个 aha moment

DeepSeek 把 O1 出的谜语第一个解开了:不用人教,模型自己在强化学习里学会反思和纠错。R1-Zero 比 R1 更干净,但 R1 才是能用的那个。

强化学习后训练DeepSeek推理模型GRPO
逐句精读三篇技术报告,把 GRPO、奖励函数、蒸馏、成本估算讲透。信息密度高,但需要一点耐心跟读。

核心论点 · 点时间戳可跳到原声

0:00

aha moment 不是人写进模型的

R1 论文标题用了 incentivizing 这个词,背后是 OpenAI 研究员 Hongi 在 MIT 的演讲「Don't teach, incentivize」——不要教模型怎么做,而是告诉它什么好什么不好,让它自己摸索。论文里那个「Wait, wait, there's an aha moment I can fly here」的自我纠错,不是研究员写进模型里的,是模型在强化学习中自己涌现的。这跟围棋里的神之一手一样,是人类开发者没想过的行为模式。

— 潘嘉宜
39:51

后训练算力只是预训练的毛毛雨

DeepSeek V3 预训练花了 5.3M 美金,中训练用 0.2M 把上下文从 8k 拓到 128k,而后训练只花了 0.01M——不到预训练成本的 0.2%。这个数字说明后训练和强化学习的拓展还处在极早期,投入产出比极高。R1 整个训练估算下来,优化得好可能 10 万美金就够,出破天最多 100 万美金。

— 潘嘉宜
48:13

GRPO 丢掉价值函数是因为它不准

PPO 要额外训练一个价值模型来精细判断每一步对错,但在长思维链场景下这个假设不成立:监督信号只有最后一步有,序列长达几千个 token,而且模型自己学会了纠错——「1+1=3」这个 3 到底是对是错就不好说了,因为它后面能改回来。价值函数不可能精确,还占巨大算力,所以 DeepSeek 直接舍弃它,只做策略梯度。这就是 GRPO 的出发点。

— 潘嘉宜
57:22

奖励函数只用规则,不用神经网络

R1-Zero 的奖励分两部分:accuracy reward 看答案对不对,format reward 看格式对不对——要求模型把思考过程放在 think tag 里,答案放在 answer tag 里。他们刻意不用过程奖励模型或结果奖励模型,因为神经网络奖励模型会被 reward hacking:模型会找到奖励函数的破绽,比如发现输出很多 emoji 能拿高分,就疯狂输出 emoji。用 ground truth reward 就避免了一切奖励破解的可能。

— 潘嘉宜
1:06:43

性能提升是因为输出变长了 20 倍

Figure 2 显示 R1 在 AIME 上的精度从百分之十几一路涨到百分之七十左右,暂停一万步后大致来到 O1 的区间。但 Figure 3 才解释了为什么:模型在强化学习中自己发现,如果推理时做更多思考、生成更多 token、用更多算力,性能就能提升。第 0 步时输出只有几百个 token,8000 步后平均回复长度来到约 1 万个 token,提高了将近 20 倍。这就是推理时拓展的来源。

— 潘嘉宜
1:28:51

蒸馏比小模型自己强化学习更好

DeepSeek 一口气开源了从 1.5B 到 70B 一系列蒸馏模型。1.5B 的蒸馏模型在 AIME 上已经比 GPT-4o 或 Claude Sonnet 高 10 到 20 个百分点。更关键的是 Table 6 的对比:用 R1 蒸馏到 Qwen 32B 的效果,远超过 Qwen 32B 自己用 R1-Zero 方式做强化学习。原因是大模型更有可能探索到复杂有益的推理模式,探索完交给小模型,比小模型从零探索好很多。

— 潘嘉宜
1:35:27

PRM 和 MCTS 两条路都走不通

DeepSeek 公开了失败的尝试。过程奖励模型的问题:通用任务上很难定义哪一步是第一步、哪一步是第二步;评估当前这一步对不对也很困难,模型能纠错后就更模糊;自动训练效果不尽如人意,人工标注又太贵且没有拓展性;而且只要有奖励模型就一定会带来 reward hacking。MCTS 的问题:语言模型每一步的搜索空间有 1 万个词左右,树可以有 1 万层,搜索空间太大成本太高;价值函数不稳定难以估计。AlphaGo 的成功难以在通用语言模型推理场景下复现。

— 潘嘉宜
1:43:50

R1 训练成本可能只要 10 万美金

粗略估算:整个训练用了约一万步强化学习,每步约 1000 个回复,每个回复满打满算 1 万个 token,总共生成约 1000 亿个 token。按 R1 的 API 价格每 100 万 token 卖 2.2 美金算,这些 token 也不过 20 万美金出头。考虑到 DeepSeek 自己有很大赚头,同时忽略了一部分模型训练开销,数量级应该不会错。结论是优化得足够好的话可能 10 万美金就够,最多最多 100 万美金。

— 潘嘉宜
1:59:40

思维链奖励模型把错误率从 15% 降到 1.5%

K1.5 在数学奖励上试了两种方法。传统奖励模型是把模型激活值接到一个小 MLP 上直接预测对错,精度约 84.4%。思维链奖励模型则把问题、标准答案、模型答案一起作为输入,让奖励模型自己输出一个思维链来推理对错,用 80 万个标注样本微调。精度直接到了 98.5%,错误率从 15% 降到 1.5%。这是 DeepSeek 报告里没有的,后续大家应该都会往这个方向转。

— 潘嘉宜
2:17:50

没有负梯度,强化学习就起不来

K1.5 对比了一个更简单的 REST 算法:采样 100 次,把对的挑出来做 fine-tune,结束。它跟 GRPO 的区别是:不要求离最开始策略足够近,也不告诉模型不好的东西不要学——少了负梯度这一步。结果是 REST 的效果差了相当多,整个 test time scaling 完全没起来,可能只涨三四个点;而用 K1.5 或 R1 的强化学习算法能涨十几二十个点,完全是天壤之别。

— 潘嘉宜

原话 · 已逐字校验

这其实是我们现在 唯一已知的就是可以达到就是 superhuman performance的一个方法

这其实是我们现在唯一已知的可以达到 superhuman performance 的方法。

潘嘉宜1:13:14

大模型它想象比小模型来说 它的就是它的性能更好 它更有可能能探索到那些复杂的 或者说一些就是有力 更加有益的 更加复杂

大模型比小模型性能更好,更有可能探索到那些复杂的、更加有益的推理模式。

潘嘉宜1:32:23

所以优美的算法或者优美的技术 往往是最简单干净的技术是吗 是的 是的

所以优美的算法或者优美的技术,往往是最简单干净的技术?是的,是的。

潘嘉宜2:39:00

数字与实体

DeepSeek V3 预训练成本5.3M 美金38:48
DeepSeek V3 后训练成本0.01M 美金38:48
R1 API 价格每 100 万 token 2.2 美金1:44:30
R1 训练成本估算10 万到 100 万美金1:45:30
R1 输出长度增长从几百 token 到约 1 万 token,提高近 20 倍1:09:08
传统奖励模型精度84.4%2:01:40
思维链奖励模型精度98.5%2:01:40
思维链奖励模型训练样本80 万个2:00:40
R1 蒸馏数据量推理 60 万 + 非推理 20 万 = 80 万1:22:17

术语

GRPO组相对策略优化
DeepSeek 提出的 PPO 变体,丢掉价值函数,只做策略梯度,用组内相对好坏做归一化。
reward hacking奖励破解
模型找到奖励函数的破绽,做出拿高分但人并不想要的行为,比如疯狂输出 emoji。
PRM过程奖励模型
对推理的每一步打分而非只给最终结果打分,但通用任务上难以定义步骤且易被破解。
MCTS蒙特卡洛树搜索
在 AlphaGo 中成功,但在语言模型推理中搜索空间太大、价值函数难以估计。
distillation蒸馏
用大模型生成的数据微调小模型,让小模型获得推理能力,比小模型自己强化学习效果更好。
curriculum sampling课程采样
K1.5 的技巧,给模型难度与其能力匹配的题目,让它学得更快更好。

收听指南

谁该听

想搞懂 R1 和 K1.5 技术细节的工程师、研究员,尤其是做后训练和强化学习方向的人。

可跳过

开头 15 分钟的背景铺垫和结尾的闲聊可以跳过,核心内容从 35 分钟开始。