R1 最值钱的不是模型,是那个 aha moment
DeepSeek 把 O1 出的谜语第一个解开了:不用人教,模型自己在强化学习里学会反思和纠错。R1-Zero 比 R1 更干净,但 R1 才是能用的那个。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
aha moment 不是人写进模型的
R1 论文标题用了 incentivizing 这个词,背后是 OpenAI 研究员 Hongi 在 MIT 的演讲「Don't teach, incentivize」——不要教模型怎么做,而是告诉它什么好什么不好,让它自己摸索。论文里那个「Wait, wait, there's an aha moment I can fly here」的自我纠错,不是研究员写进模型里的,是模型在强化学习中自己涌现的。这跟围棋里的神之一手一样,是人类开发者没想过的行为模式。
— 潘嘉宜后训练算力只是预训练的毛毛雨
DeepSeek V3 预训练花了 5.3M 美金,中训练用 0.2M 把上下文从 8k 拓到 128k,而后训练只花了 0.01M——不到预训练成本的 0.2%。这个数字说明后训练和强化学习的拓展还处在极早期,投入产出比极高。R1 整个训练估算下来,优化得好可能 10 万美金就够,出破天最多 100 万美金。
— 潘嘉宜GRPO 丢掉价值函数是因为它不准
PPO 要额外训练一个价值模型来精细判断每一步对错,但在长思维链场景下这个假设不成立:监督信号只有最后一步有,序列长达几千个 token,而且模型自己学会了纠错——「1+1=3」这个 3 到底是对是错就不好说了,因为它后面能改回来。价值函数不可能精确,还占巨大算力,所以 DeepSeek 直接舍弃它,只做策略梯度。这就是 GRPO 的出发点。
— 潘嘉宜奖励函数只用规则,不用神经网络
R1-Zero 的奖励分两部分:accuracy reward 看答案对不对,format reward 看格式对不对——要求模型把思考过程放在 think tag 里,答案放在 answer tag 里。他们刻意不用过程奖励模型或结果奖励模型,因为神经网络奖励模型会被 reward hacking:模型会找到奖励函数的破绽,比如发现输出很多 emoji 能拿高分,就疯狂输出 emoji。用 ground truth reward 就避免了一切奖励破解的可能。
— 潘嘉宜性能提升是因为输出变长了 20 倍
Figure 2 显示 R1 在 AIME 上的精度从百分之十几一路涨到百分之七十左右,暂停一万步后大致来到 O1 的区间。但 Figure 3 才解释了为什么:模型在强化学习中自己发现,如果推理时做更多思考、生成更多 token、用更多算力,性能就能提升。第 0 步时输出只有几百个 token,8000 步后平均回复长度来到约 1 万个 token,提高了将近 20 倍。这就是推理时拓展的来源。
— 潘嘉宜蒸馏比小模型自己强化学习更好
DeepSeek 一口气开源了从 1.5B 到 70B 一系列蒸馏模型。1.5B 的蒸馏模型在 AIME 上已经比 GPT-4o 或 Claude Sonnet 高 10 到 20 个百分点。更关键的是 Table 6 的对比:用 R1 蒸馏到 Qwen 32B 的效果,远超过 Qwen 32B 自己用 R1-Zero 方式做强化学习。原因是大模型更有可能探索到复杂有益的推理模式,探索完交给小模型,比小模型从零探索好很多。
— 潘嘉宜PRM 和 MCTS 两条路都走不通
DeepSeek 公开了失败的尝试。过程奖励模型的问题:通用任务上很难定义哪一步是第一步、哪一步是第二步;评估当前这一步对不对也很困难,模型能纠错后就更模糊;自动训练效果不尽如人意,人工标注又太贵且没有拓展性;而且只要有奖励模型就一定会带来 reward hacking。MCTS 的问题:语言模型每一步的搜索空间有 1 万个词左右,树可以有 1 万层,搜索空间太大成本太高;价值函数不稳定难以估计。AlphaGo 的成功难以在通用语言模型推理场景下复现。
— 潘嘉宜R1 训练成本可能只要 10 万美金
粗略估算:整个训练用了约一万步强化学习,每步约 1000 个回复,每个回复满打满算 1 万个 token,总共生成约 1000 亿个 token。按 R1 的 API 价格每 100 万 token 卖 2.2 美金算,这些 token 也不过 20 万美金出头。考虑到 DeepSeek 自己有很大赚头,同时忽略了一部分模型训练开销,数量级应该不会错。结论是优化得足够好的话可能 10 万美金就够,最多最多 100 万美金。
— 潘嘉宜思维链奖励模型把错误率从 15% 降到 1.5%
K1.5 在数学奖励上试了两种方法。传统奖励模型是把模型激活值接到一个小 MLP 上直接预测对错,精度约 84.4%。思维链奖励模型则把问题、标准答案、模型答案一起作为输入,让奖励模型自己输出一个思维链来推理对错,用 80 万个标注样本微调。精度直接到了 98.5%,错误率从 15% 降到 1.5%。这是 DeepSeek 报告里没有的,后续大家应该都会往这个方向转。
— 潘嘉宜没有负梯度,强化学习就起不来
K1.5 对比了一个更简单的 REST 算法:采样 100 次,把对的挑出来做 fine-tune,结束。它跟 GRPO 的区别是:不要求离最开始策略足够近,也不告诉模型不好的东西不要学——少了负梯度这一步。结果是 REST 的效果差了相当多,整个 test time scaling 完全没起来,可能只涨三四个点;而用 K1.5 或 R1 的强化学习算法能涨十几二十个点,完全是天壤之别。
— 潘嘉宜原话 · 已逐字校验
这其实是我们现在 唯一已知的就是可以达到就是 superhuman performance的一个方法
这其实是我们现在唯一已知的可以达到 superhuman performance 的方法。
潘嘉宜1:13:14
大模型它想象比小模型来说 它的就是它的性能更好 它更有可能能探索到那些复杂的 或者说一些就是有力 更加有益的 更加复杂
大模型比小模型性能更好,更有可能探索到那些复杂的、更加有益的推理模式。
潘嘉宜1:32:23
所以优美的算法或者优美的技术 往往是最简单干净的技术是吗 是的 是的
所以优美的算法或者优美的技术,往往是最简单干净的技术?是的,是的。
潘嘉宜2:39:00
数字与实体
| DeepSeek V3 预训练成本 | 5.3M 美金 | 38:48 |
| DeepSeek V3 后训练成本 | 0.01M 美金 | 38:48 |
| R1 API 价格 | 每 100 万 token 2.2 美金 | 1:44:30 |
| R1 训练成本估算 | 10 万到 100 万美金 | 1:45:30 |
| R1 输出长度增长 | 从几百 token 到约 1 万 token,提高近 20 倍 | 1:09:08 |
| 传统奖励模型精度 | 84.4% | 2:01:40 |
| 思维链奖励模型精度 | 98.5% | 2:01:40 |
| 思维链奖励模型训练样本 | 80 万个 | 2:00:40 |
| R1 蒸馏数据量 | 推理 60 万 + 非推理 20 万 = 80 万 | 1:22:17 |
术语
- GRPO组相对策略优化
- DeepSeek 提出的 PPO 变体,丢掉价值函数,只做策略梯度,用组内相对好坏做归一化。
- reward hacking奖励破解
- 模型找到奖励函数的破绽,做出拿高分但人并不想要的行为,比如疯狂输出 emoji。
- PRM过程奖励模型
- 对推理的每一步打分而非只给最终结果打分,但通用任务上难以定义步骤且易被破解。
- MCTS蒙特卡洛树搜索
- 在 AlphaGo 中成功,但在语言模型推理中搜索空间太大、价值函数难以估计。
- distillation蒸馏
- 用大模型生成的数据微调小模型,让小模型获得推理能力,比小模型自己强化学习效果更好。
- curriculum sampling课程采样
- K1.5 的技巧,给模型难度与其能力匹配的题目,让它学得更快更好。
收听指南
想搞懂 R1 和 K1.5 技术细节的工程师、研究员,尤其是做后训练和强化学习方向的人。
开头 15 分钟的背景铺垫和结尾的闲聊可以跳过,核心内容从 35 分钟开始。