世界太吵,來原聲聽播客

張小珺·商業訪談錄

管公司像訓模型:SFT 太多,團隊就沒有創造力了

Tim 天天跟楊植麟講:管理要用 RL 的方式,不是 SFT。SFT 是直接告訴人該怎麼做,太多,人就沒有主觀能動性;RL 只給獎勵,但獎勵定義不好,全隊都會去 hack 它。

大模型Agent強化學習開源組織管理
信息密度高,但後半段明顯更值錢:Muon 優化器的兩倍提升、數據飛輪為什麼沒起來、用 RL 管公司,都在最後四十分鐘。

核心論點 · 點時間戳可跳到原聲

6:06

這座雪山可能沒有山頂

楊植麟用 The Beginning of Infinity 解釋 AI 研發。書裡說要刻在石頭上的兩句話:問題是不可避免的,但問題是可以解決的。啟蒙運動之前社會是靜態的——天上打雷就是雷公,冬天下雪就是某個神心情不好,用不好的解釋去填補;啟蒙運動之後社會變成動態的,新的知識不斷被創造,每解決一個問題就產生新的問題,因為知識邊界在拓展。所以這座雪山可能沒有盡頭,「我希望它一直沒有盡頭」,這樣它就是一座無限的山。他還說,爬到一段之後不一定是自己在爬,可能是用 K2 去做數據處理、模型分析甚至訓練,把模型當放大器。

— 楊植麟
12:14

推理是缸中之腦,Agent 要伸手

強思考的推理模型是「缸中之腦」:想像一個魚缸,把腦子放在裡面,它跟外界沒有聯繫,只在自己大腦裡一直想,不需要跟外界產生任何交互就能解一道題。Agentic 的強化學習範式相反——邊思考邊操作,一會兒用搜索、一會兒用瀏覽器、一會兒寫代碼,多輪解決問題,下一步行為取決於交互得到的外界反饋。兩者都指向 test time scaling,但 scale 的維度不同:一個 scale 每一輪裡的思考 token,一個 scale 輪數。楊植麟認為 Cloud 就是 bet 在 agent 這條路線——它的 reasoning 表現並不非常高,但 agent 上的表現很高。

— 楊植麟
28:24

Muon 讓一份數據當兩份用

K2 的 base model 押在 token efficiency 上。楊植麟說高質量數據增長很緩慢,多模態數據也沒法提升文本本身的智商,高質量數據接近一個常數,所以要讓每一份數據發揮更大價值——訓練更快本身不提升智能上限,因為 token 還是只有這麼多。Adam 這種優化器已經用了 10 年,它把矩陣參數當成獨立元素;Muon 考慮參數之間的 dependency,早期在 compute optimal 的實驗裡有 2 倍提升:學一份數據等於別人用 Adam 學兩份,所以 30T 高質量 token 相當於 60T。Muon 是 Keller 提出來的,他的團隊在上面做了很多優化,第一次把它用到一定規模的語言模型上訓練——代價是遇到 max logit 爆炸,這個問題小規模實驗復現不出來。

— 楊植麟
33:31

Agent 最缺的不是能力,是泛化

楊植麟認為 agentic 模型現在最大的挑戰是泛化。RL 的侷限在於訓練任務和評價指標都是單點的:你訓 swe-bench,swe-bench 分數就漲,但指標漲上去並不意味著泛化變好。他擔心的是模型過擬合到某些工具、某些環境、某些具體任務上——這些任務可以是很好的觀測,但不希望被過擬合。這個問題在 agent 訓練裡比對話模型更嚴重。而且現在 agent 能用的 benchmark 不多,在那些 benchmark 上看到的分數很多時候並不是對能力的反映,比較片面。他認為整體評估還是瓶頸,是阻礙 agent 模型變得更泛化的一個重要原因。

— 楊植麟
45:38

用 L4 的技術去解決 L3 的問題

ChatGPT 的 L1 到 L5 是 Chat、Reasoning、Agent、Innovation、Organization,但楊植麟認為它們不一定是串行的。理由:今天 agent 的泛化不夠,所以要反過來用 Innovation 這一層的技術去解決一個 L3 的問題——用 AI 去訓練 AI、去對齊 AI,讓模型參與到更多訓練過程裡,而不是只優化幾個單點任務。如果只人工定義一些 task 然後去 fit 那個 task,在別的看不見的 task 上表現可能就不好;只刷那幾個 task 的分,用戶在更 OOD 的場景裡體感就沒那麼好。他還說,Innovation 的一個關鍵是模型什麼時候能參與到自己下一代的研發裡——希望 K2 能參與 K3 的開發。

— 楊植麟
53:44

開源能幫你 serve,改不動 base model

開源和閉源最終會剩下幾家?楊植麟判斷市場會逐漸集中、收斂:一開始幾百個,到幾十個,最後幾個可能是比較穩定的數。他一年前說開源會落後於閉源,理由是開源是中心化的、貢獻沒經過算力驗證,閉源有人才聚集和市場整合。現在的說法變了:模型出來之後社區確實能貢獻東西,推理側可以做很多事情,可以讓更多人免費給你 serve;但要把 base model 本身變得更好,還只能原廠自己做。不過基於開源模型做 agentic 的 post training 可能產生新機會——比如創業公司想做一個法律相關的 agent,可以拿 K2 在自己的工具集下訓出 specialized agent。

— 楊植麟
1:05:54

數據飛輪輸給了算力 scaling

AI 產品為什麼沒形成數據飛輪?楊植麟的第一條原因是基於算力的 scaling 太強大。RL 的 scaling 效率比 pre-training 高很多,因為它是 on-policy 帶梯度的訓練,所以直接 scale compute、scale flops 帶來的提升非常大,顯得其他路徑的提升很小。第二條是數據飛輪依賴外界環境的 feedback,而這個反饋的噪聲不能太多——大模型的學習對噪聲比較敏感,跟推薦系統不太一樣。他也不認為用戶數據完全沒用:你需要一定用戶量來知道整體需求的分布,哪些用得好、哪些不好,再抽象成 evaluation 去優化模型;而且現在又到了一個新的分水嶺,agent 的專業用戶本身就在產生商業價值。

— 楊植麟
1:25:07

用 RL 管團隊,別用 SFT

這是 Tim 天天跟楊植麟講的:管理團隊要用 RL 的方式,而不是 SFT。SFT 是直接告訴人「應該這樣做」,RL 是從上面給一個獎勵,更多時候只反映在目標上。他也在做這樣的實踐,看起來有一些效果,核心是掌握 SFT 和 RL 的平衡——以 RL 為主,通過一部分 SFT 防止飛太遠、防止遺忘。用 RL 管團隊最大的問題是容易被 hack:大家看起來各種結果都很好,但實際並沒有達到你最終想要的;用 SFT 管團隊的風險則是大家失去創造力。所以他當 CEO 最新的理解,就是把握 RL、SFT 和 reward hacking 之間的平衡。

— 楊植麟

原話 · 已逐字校驗

一句話叫那個問題是不可避免的 但是第二句話是說問題是可以解決

一句話是「問題是不可避免的」,但第二句話是「問題是可以解決的」。

楊植麟5:06

但它還是一個就是剛中之腦 就是說它並不需要跟外界交互

但它還是一個缸中之腦,就是說它並不需要跟外界交互。

楊植麟12:14

因為今天你的agent算話不夠 所以你要用Innovation的方式 就是你要用L4的技術去解決一個L3

因為今天你的 agent 泛化不夠,所以你要用 Innovation 的方式,就是你要用 L4 的技術去解決一個 L3。

楊植麟45:38

就是說你不能SFT太多 SFT太多 這個你的這些同學 他就會失去這個主觀能動性 然後就沒有辦法創新了

就是說你不能 SFT 太多,SFT 太多,你的這些同學就會失去主觀能動性,然後就沒有辦法創新了。

楊植麟1:26:08

數字與實體

Muon 優化器帶來的 token efficiency 提升早期實驗在 compute optimal 下約 2 倍;30T 高質量 token 相當於 60T28:24
頭部大模型公司的 ARR幾十億到三百億美元,每一兩個季度翻兩三倍1:09:58
大模型市場的收斂路徑幾百個 → 幾十個 → 幾個56:45
K2 相關技術的積累週期約一年前開始積累技術,最近幾個月決定訓 K238:33

術語

Muon optimizerMuon 優化器
考慮矩陣參數之間依賴關係的優化器,比 Adam 有更高 token 效率。
test time scaling測試時規模化
在推理階段投入更多 token 或輪數來提升表現。
brain in a vat缸中之腦
只在自己內部推理、不與外界交互的模型形態。
reward hacking獎勵黑客
被優化對象鑽了獎勵定義的空子,指標好看但目標沒達成。
curriculum learning課程學習
從合適難度開始、逐步提升難度的訓練安排。

收聽指南

誰該聽

做大模型 post-training 和 Agent 的工程師,以及關心模型公司商業與組織打法的創業者、投資人。

可跳過

1:38 之後的快問快答多是重申前面的觀點,可跳過。