管公司像訓模型:SFT 太多,團隊就沒有創造力了
Tim 天天跟楊植麟講:管理要用 RL 的方式,不是 SFT。SFT 是直接告訴人該怎麼做,太多,人就沒有主觀能動性;RL 只給獎勵,但獎勵定義不好,全隊都會去 hack 它。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
這座雪山可能沒有山頂
楊植麟用 The Beginning of Infinity 解釋 AI 研發。書裡說要刻在石頭上的兩句話:問題是不可避免的,但問題是可以解決的。啟蒙運動之前社會是靜態的——天上打雷就是雷公,冬天下雪就是某個神心情不好,用不好的解釋去填補;啟蒙運動之後社會變成動態的,新的知識不斷被創造,每解決一個問題就產生新的問題,因為知識邊界在拓展。所以這座雪山可能沒有盡頭,「我希望它一直沒有盡頭」,這樣它就是一座無限的山。他還說,爬到一段之後不一定是自己在爬,可能是用 K2 去做數據處理、模型分析甚至訓練,把模型當放大器。
— 楊植麟推理是缸中之腦,Agent 要伸手
強思考的推理模型是「缸中之腦」:想像一個魚缸,把腦子放在裡面,它跟外界沒有聯繫,只在自己大腦裡一直想,不需要跟外界產生任何交互就能解一道題。Agentic 的強化學習範式相反——邊思考邊操作,一會兒用搜索、一會兒用瀏覽器、一會兒寫代碼,多輪解決問題,下一步行為取決於交互得到的外界反饋。兩者都指向 test time scaling,但 scale 的維度不同:一個 scale 每一輪裡的思考 token,一個 scale 輪數。楊植麟認為 Cloud 就是 bet 在 agent 這條路線——它的 reasoning 表現並不非常高,但 agent 上的表現很高。
— 楊植麟Muon 讓一份數據當兩份用
K2 的 base model 押在 token efficiency 上。楊植麟說高質量數據增長很緩慢,多模態數據也沒法提升文本本身的智商,高質量數據接近一個常數,所以要讓每一份數據發揮更大價值——訓練更快本身不提升智能上限,因為 token 還是只有這麼多。Adam 這種優化器已經用了 10 年,它把矩陣參數當成獨立元素;Muon 考慮參數之間的 dependency,早期在 compute optimal 的實驗裡有 2 倍提升:學一份數據等於別人用 Adam 學兩份,所以 30T 高質量 token 相當於 60T。Muon 是 Keller 提出來的,他的團隊在上面做了很多優化,第一次把它用到一定規模的語言模型上訓練——代價是遇到 max logit 爆炸,這個問題小規模實驗復現不出來。
— 楊植麟Agent 最缺的不是能力,是泛化
楊植麟認為 agentic 模型現在最大的挑戰是泛化。RL 的侷限在於訓練任務和評價指標都是單點的:你訓 swe-bench,swe-bench 分數就漲,但指標漲上去並不意味著泛化變好。他擔心的是模型過擬合到某些工具、某些環境、某些具體任務上——這些任務可以是很好的觀測,但不希望被過擬合。這個問題在 agent 訓練裡比對話模型更嚴重。而且現在 agent 能用的 benchmark 不多,在那些 benchmark 上看到的分數很多時候並不是對能力的反映,比較片面。他認為整體評估還是瓶頸,是阻礙 agent 模型變得更泛化的一個重要原因。
— 楊植麟用 L4 的技術去解決 L3 的問題
ChatGPT 的 L1 到 L5 是 Chat、Reasoning、Agent、Innovation、Organization,但楊植麟認為它們不一定是串行的。理由:今天 agent 的泛化不夠,所以要反過來用 Innovation 這一層的技術去解決一個 L3 的問題——用 AI 去訓練 AI、去對齊 AI,讓模型參與到更多訓練過程裡,而不是只優化幾個單點任務。如果只人工定義一些 task 然後去 fit 那個 task,在別的看不見的 task 上表現可能就不好;只刷那幾個 task 的分,用戶在更 OOD 的場景裡體感就沒那麼好。他還說,Innovation 的一個關鍵是模型什麼時候能參與到自己下一代的研發裡——希望 K2 能參與 K3 的開發。
— 楊植麟開源能幫你 serve,改不動 base model
開源和閉源最終會剩下幾家?楊植麟判斷市場會逐漸集中、收斂:一開始幾百個,到幾十個,最後幾個可能是比較穩定的數。他一年前說開源會落後於閉源,理由是開源是中心化的、貢獻沒經過算力驗證,閉源有人才聚集和市場整合。現在的說法變了:模型出來之後社區確實能貢獻東西,推理側可以做很多事情,可以讓更多人免費給你 serve;但要把 base model 本身變得更好,還只能原廠自己做。不過基於開源模型做 agentic 的 post training 可能產生新機會——比如創業公司想做一個法律相關的 agent,可以拿 K2 在自己的工具集下訓出 specialized agent。
— 楊植麟數據飛輪輸給了算力 scaling
AI 產品為什麼沒形成數據飛輪?楊植麟的第一條原因是基於算力的 scaling 太強大。RL 的 scaling 效率比 pre-training 高很多,因為它是 on-policy 帶梯度的訓練,所以直接 scale compute、scale flops 帶來的提升非常大,顯得其他路徑的提升很小。第二條是數據飛輪依賴外界環境的 feedback,而這個反饋的噪聲不能太多——大模型的學習對噪聲比較敏感,跟推薦系統不太一樣。他也不認為用戶數據完全沒用:你需要一定用戶量來知道整體需求的分布,哪些用得好、哪些不好,再抽象成 evaluation 去優化模型;而且現在又到了一個新的分水嶺,agent 的專業用戶本身就在產生商業價值。
— 楊植麟用 RL 管團隊,別用 SFT
這是 Tim 天天跟楊植麟講的:管理團隊要用 RL 的方式,而不是 SFT。SFT 是直接告訴人「應該這樣做」,RL 是從上面給一個獎勵,更多時候只反映在目標上。他也在做這樣的實踐,看起來有一些效果,核心是掌握 SFT 和 RL 的平衡——以 RL 為主,通過一部分 SFT 防止飛太遠、防止遺忘。用 RL 管團隊最大的問題是容易被 hack:大家看起來各種結果都很好,但實際並沒有達到你最終想要的;用 SFT 管團隊的風險則是大家失去創造力。所以他當 CEO 最新的理解,就是把握 RL、SFT 和 reward hacking 之間的平衡。
— 楊植麟原話 · 已逐字校驗
一句話叫那個問題是不可避免的 但是第二句話是說問題是可以解決
一句話是「問題是不可避免的」,但第二句話是「問題是可以解決的」。
楊植麟5:06
但它還是一個就是剛中之腦 就是說它並不需要跟外界交互
但它還是一個缸中之腦,就是說它並不需要跟外界交互。
楊植麟12:14
因為今天你的agent算話不夠 所以你要用Innovation的方式 就是你要用L4的技術去解決一個L3
因為今天你的 agent 泛化不夠,所以你要用 Innovation 的方式,就是你要用 L4 的技術去解決一個 L3。
楊植麟45:38
就是說你不能SFT太多 SFT太多 這個你的這些同學 他就會失去這個主觀能動性 然後就沒有辦法創新了
就是說你不能 SFT 太多,SFT 太多,你的這些同學就會失去主觀能動性,然後就沒有辦法創新了。
楊植麟1:26:08
數字與實體
| Muon 優化器帶來的 token efficiency 提升 | 早期實驗在 compute optimal 下約 2 倍;30T 高質量 token 相當於 60T | 28:24 |
| 頭部大模型公司的 ARR | 幾十億到三百億美元,每一兩個季度翻兩三倍 | 1:09:58 |
| 大模型市場的收斂路徑 | 幾百個 → 幾十個 → 幾個 | 56:45 |
| K2 相關技術的積累週期 | 約一年前開始積累技術,最近幾個月決定訓 K2 | 38:33 |
術語
- Muon optimizerMuon 優化器
- 考慮矩陣參數之間依賴關係的優化器,比 Adam 有更高 token 效率。
- test time scaling測試時規模化
- 在推理階段投入更多 token 或輪數來提升表現。
- brain in a vat缸中之腦
- 只在自己內部推理、不與外界交互的模型形態。
- reward hacking獎勵黑客
- 被優化對象鑽了獎勵定義的空子,指標好看但目標沒達成。
- curriculum learning課程學習
- 從合適難度開始、逐步提升難度的訓練安排。
收聽指南
做大模型 post-training 和 Agent 的工程師,以及關心模型公司商業與組織打法的創業者、投資人。
1:38 之後的快問快答多是重申前面的觀點,可跳過。