R1 最值錢的不是模型,是那個 aha moment
DeepSeek 把 O1 出的謎語第一個解開了:不用人教,模型自己在強化學習裡學會反思和糾錯。R1-Zero 比 R1 更乾淨,但 R1 才是能用的那個。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
aha moment 不是人寫進模型的
R1 論文標題用了 incentivizing 這個詞,背後是 OpenAI 研究員 Hongi 在 MIT 的演講「Don't teach, incentivize」——不要教模型怎麼做,而是告訴它什麼好什麼不好,讓它自己摸索。論文裡那個「Wait, wait, there's an aha moment I can fly here」的自我糾錯,不是研究員寫進模型裡的,是模型在強化學習中自己湧現的。這跟圍棋裡的神之一手一樣,是人類開發者沒想過的行為模式。
— 潘嘉宜後訓練算力只是預訓練的毛毛雨
DeepSeek V3 預訓練花了 5.3M 美金,中訓練用 0.2M 把上下文從 8k 拓到 128k,而後訓練只花了 0.01M——不到預訓練成本的 0.2%。這個數字說明後訓練和強化學習的拓展還處在極早期,投入產出比極高。R1 整個訓練估算下來,優化得好可能 10 萬美金就夠,出破天最多 100 萬美金。
— 潘嘉宜GRPO 丟掉價值函數是因為它不準
PPO 要額外訓練一個價值模型來精細判斷每一步對錯,但在長思維鏈場景下這個假設不成立:監督信號只有最後一步有,序列長達幾千個 token,而且模型自己學會了糾錯——「1+1=3」這個 3 到底是對是錯就不好說了,因為它後面能改回來。價值函數不可能精確,還佔巨大算力,所以 DeepSeek 直接捨棄它,只做策略梯度。這就是 GRPO 的出發點。
— 潘嘉宜獎勵函數只用規則,不用神經網絡
R1-Zero 的獎勵分兩部分:accuracy reward 看答案對不對,format reward 看格式對不對——要求模型把思考過程放在 think tag 裡,答案放在 answer tag 裡。他們刻意不用過程獎勵模型或結果獎勵模型,因為神經網絡獎勵模型會被 reward hacking:模型會找到獎勵函數的破綻,比如發現輸出很多 emoji 能拿高分,就瘋狂輸出 emoji。用 ground truth reward 就避免了一切獎勵破解的可能。
— 潘嘉宜性能提升是因為輸出變長了 20 倍
Figure 2 顯示 R1 在 AIME 上的精度從百分之十幾一路漲到百分之七十左右,暫停一萬步後大致來到 O1 的區間。但 Figure 3 才解釋了為什麼:模型在強化學習中自己發現,如果推理時做更多思考、生成更多 token、用更多算力,性能就能提升。第 0 步時輸出只有幾百個 token,8000 步後平均回覆長度來到約 1 萬個 token,提高了將近 20 倍。這就是推理時拓展的來源。
— 潘嘉宜蒸餾比小模型自己強化學習更好
DeepSeek 一口氣開源了從 1.5B 到 70B 一系列蒸餾模型。1.5B 的蒸餾模型在 AIME 上已經比 GPT-4o 或 Claude Sonnet 高 10 到 20 個百分點。更關鍵的是 Table 6 的對比:用 R1 蒸餾到 Qwen 32B 的效果,遠超過 Qwen 32B 自己用 R1-Zero 方式做強化學習。原因是大模型更有可能探索到複雜有益的推理模式,探索完交給小模型,比小模型從零探索好很多。
— 潘嘉宜PRM 和 MCTS 兩條路都走不通
DeepSeek 公開了失敗的嘗試。過程獎勵模型的問題:通用任務上很難定義哪一步是第一步、哪一步是第二步;評估當前這一步對不對也很困難,模型能糾錯後就更模糊;自動訓練效果不盡如人意,人工標註又太貴且沒有拓展性;而且只要有獎勵模型就一定會帶來 reward hacking。MCTS 的問題:語言模型每一步的搜索空間有 1 萬個詞左右,樹可以有 1 萬層,搜索空間太大成本太高;價值函數不穩定難以估計。AlphaGo 的成功難以在通用語言模型推理場景下復現。
— 潘嘉宜R1 訓練成本可能只要 10 萬美金
粗略估算:整個訓練用了約一萬步強化學習,每步約 1000 個回覆,每個回覆滿打滿算 1 萬個 token,總共生成約 1000 億個 token。按 R1 的 API 價格每 100 萬 token 賣 2.2 美金算,這些 token 也不過 20 萬美金出頭。考慮到 DeepSeek 自己有很大賺頭,同時忽略了一部分模型訓練開銷,數量級應該不會錯。結論是優化得足夠好的話可能 10 萬美金就夠,最多最多 100 萬美金。
— 潘嘉宜思維鏈獎勵模型把錯誤率從 15% 降到 1.5%
K1.5 在數學獎勵上試了兩種方法。傳統獎勵模型是把模型激活值接到一個小 MLP 上直接預測對錯,精度約 84.4%。思維鏈獎勵模型則把問題、標準答案、模型答案一起作為輸入,讓獎勵模型自己輸出一個思維鏈來推理對錯,用 80 萬個標註樣本微調。精度直接到了 98.5%,錯誤率從 15% 降到 1.5%。這是 DeepSeek 報告裡沒有的,後續大家應該都會往這個方向轉。
— 潘嘉宜沒有負梯度,強化學習就起不來
K1.5 對比了一個更簡單的 REST 算法:採樣 100 次,把對的挑出來做 fine-tune,結束。它跟 GRPO 的區別是:不要求離最開始策略足夠近,也不告訴模型不好的東西不要學——少了負梯度這一步。結果是 REST 的效果差了相當多,整個 test time scaling 完全沒起來,可能只漲三四個點;而用 K1.5 或 R1 的強化學習算法能漲十幾二十個點,完全是天壤之別。
— 潘嘉宜原話 · 已逐字校驗
這其實是我們現在 唯一已知的就是可以達到就是 superhuman performance的一個方法
這其實是我們現在唯一已知的可以達到 superhuman performance 的方法。
潘嘉宜1:13:14
大模型它想像比小模型來說 它的就是它的性能更好 它更有可能能探索到那些複雜的 或者說一些就是有力 更加有益的 更加複雜
大模型比小模型性能更好,更有可能探索到那些複雜的、更加有益的推理模式。
潘嘉宜1:32:23
所以優美的算法或者優美的技術 往往是最簡單幹淨的技術是嗎 是的 是的
所以優美的算法或者優美的技術,往往是最簡單幹淨的技術?是的,是的。
潘嘉宜2:39:00
數字與實體
| DeepSeek V3 預訓練成本 | 5.3M 美金 | 38:48 |
| DeepSeek V3 後訓練成本 | 0.01M 美金 | 38:48 |
| R1 API 價格 | 每 100 萬 token 2.2 美金 | 1:44:30 |
| R1 訓練成本估算 | 10 萬到 100 萬美金 | 1:45:30 |
| R1 輸出長度增長 | 從幾百 token 到約 1 萬 token,提高近 20 倍 | 1:09:08 |
| 傳統獎勵模型精度 | 84.4% | 2:01:40 |
| 思維鏈獎勵模型精度 | 98.5% | 2:01:40 |
| 思維鏈獎勵模型訓練樣本 | 80 萬個 | 2:00:40 |
| R1 蒸餾數據量 | 推理 60 萬 + 非推理 20 萬 = 80 萬 | 1:22:17 |
術語
- GRPO組相對策略優化
- DeepSeek 提出的 PPO 變體,丟掉價值函數,只做策略梯度,用組內相對好壞做歸一化。
- reward hacking獎勵破解
- 模型找到獎勵函數的破綻,做出拿高分但人並不想要的行為,比如瘋狂輸出 emoji。
- PRM過程獎勵模型
- 對推理的每一步打分而非只給最終結果打分,但通用任務上難以定義步驟且易被破解。
- MCTS蒙特卡洛樹搜索
- 在 AlphaGo 中成功,但在語言模型推理中搜索空間太大、價值函數難以估計。
- distillation蒸餾
- 用大模型生成的數據微調小模型,讓小模型獲得推理能力,比小模型自己強化學習效果更好。
- curriculum sampling課程採樣
- K1.5 的技巧,給模型難度與其能力匹配的題目,讓它學得更快更好。
收聽指南
想搞懂 R1 和 K1.5 技術細節的工程師、研究員,尤其是做後訓練和強化學習方向的人。
開頭 15 分鐘的背景鋪墊和結尾的閒聊可以跳過,核心內容從 35 分鐘開始。