世界太吵,來原聲聽播客

張小珺·商業訪談錄

不做強化學習的公司,下一波浪潮裡可能跑不出來

語言預訓練遇到瓶頸後,硅谷最核心的幾百名研究者已把資源壓注到 self-play RL 上,它用推理算力換訓練算力,讓模型自己探索出邏輯推理能力。

強化學習AGI預訓練機器人硅谷
硅谷一線研究者對 AGI 範式轉移的完整拆解,含大量未擴散的共識、具體數字和路線判斷,信息密度高。

核心論點 · 點時間戳可跳到原聲

2:07

預訓練這條路可能已經到瓶頸

廣密給出的判斷是:傳統意義上的 Scaling Law 有 50% 概率已經失效,另外 50% 是沿著老路繼續懟十萬卡還能走向 AGI,兩個概率「哈佛哈佛」。他看到的證據是參數、數據、算力三個要素都卡住了——最好的模型是 6700B 總參數的 MOE,因為這是單臺 Server 上 H100 能放得下的極限,還沒看到向上漲三五倍到兩三萬億參數的模型;數據上很多公司弄到 15 到 20T 高質量文本,但很難增加到 50 到 100 個 T;算力上 H100 單集群最大 3.2 萬張,B 系列出來前不會有倍數級提升。

— 廣密
9:15

多模態和十萬卡都不是範式級變化

廣密把替代路線歸為三條。第一條是多模態尤其是視覺,確定性高,但今天還沒有任何證據證明從視覺模態訓練裡能湧現出智能或邏輯能力,Tesla FSD 換到另一個新設備上就不 work,沒有泛化。第二條是十萬卡機群,賭算力決定生死,但 3 萬卡機群基本每兩小時 Brick 一次,10 萬卡機群二三十分鐘就 Brick 一次,互聯難度可能比 SpaceX 發重型火箭還複雜。這兩條都是時間問題,但「不過本質」。真正稱得上範式級別的只有強化學習 RL。

— 廣密
13:20

RL 是讓 AI 用隨機路徑試錯

Ilya 2018 年在 MIT 客座講課時用一句話概括強化學習:讓 AI 用隨機的一個路徑去嘗試一個新任務,如果效果超預期就更新神經網絡的權重,讓 AI 記得多使用這個成功的實踐,再開始下一次嘗試。廣密用探礦比喻解釋 reward model 的關鍵:一個人拿藏寶圖,另一個人帶 5000 個特種兵和專業探測設備,只要有寶貝幾乎百分百能探出來,但如果其中兩三個特種兵鑑寶能力不足,就會漏掉寶貝或撿回垃圾——這就是獎勵模型出錯。今天業界 reward model 最核心的還是在代碼和數學,因為環境和目標簡單清楚、容易設定。

— 廣密
22:31

語言是柺杖,強化學習才是主菜

廣密給了一個形象的比喻:把語言和預訓練比作人類的基因組,攜帶著人類幾千年進化的基因,那麼強化學習就是人類成長的一生,從出生那天起就開始接受正面信號和負面信號。語言是今天唯一走通泛化性的,AlphaGo 只能下圍棋,CV 只能做人臉識別,都沒有泛化。所以語言和預訓練有可能就是個柺杖、中間菜的甜點前菜,後面的強化學習才是主菜。他判斷今天光靠大語言模型可能走不到 AGI,AI 可能是一個偏科語文的大學生,要就業需要新的範式引入。

— 廣密
33:43

RL 用推理算力換訓練算力

廣密指出 RL 不是一個模型,而是一整套系統,包含智能體、環境、動作和獎勵模型,最重要的兩個是環境和智能體。它在語言模型中的思路本質上是 inference time 去換 training time,用來解決模型向上 scale up 時暫時邊際收益遞減的現狀。他算過一筆賬:對 GPT-4 和 Claude 3.5 這種水平的模型,合成 1 個 T 的高質量推理數據大概要 6 億美金,合成 10 個 T 可能要 60 億美金。但 inference 對單張卡性能和集群規模要求相對低一些,不一定非得用最頂尖的卡或 3 萬卡、10 萬卡的集群,分布式集群也可以跑 RL 的 inference。

— 廣密
37:45

共識只在幾百個核心研究者中

AI 範式發生轉移這件事,在硅谷只有在最核心的 researcher 中間有一些共識,有可能也就幾百個人,還沒有完全擴散。很多人都知道 RL 很重要,但不知道怎麼做,這方面人才也很稀缺,還不是傳統 RL 的那批人。廣密認為很多 AI 的管理層可能還沒有意識到,因為最近也只有少量那麼一些 paper 才開始發出來。楊立昆最近在批評強化學習 RL 說這是資源浪費,廣密的回應是:愛迪生發明燈泡也浪費了大量的實驗資源,但你只需要成功一次,就可以大量複製。

— 廣密
1:01:00

硅谷投機器人大腦,國內投整機

廣密觀察到硅谷現在都是想投一個技術人的大腦,想做 ROS 或者安卓;在國內你就投整機,OV、小米。但他提出一個悖論:是不是有可能不存在一個機器人大腦,有可能這個大腦就是 GPT 或者通用的大模型,你做一個機器人大腦可能也不適配所有硬件,A 機器的數據不能用到 B 機器上,還得端到端適配。他認為通用機器人最核心最核心還是技術的 timing,人形通用大爆發可能還得五到十年,很可能這批公司沒有真正能做出來,大家都還是在一個 research lab 的階段。

— 廣密
1:06:01

移動互聯網的暗線是推薦,AI 的暗線是 RL

廣密把移動互聯網和今天的 AI 做對比:移動互聯網的明線是全球多了四五十億移動用戶,暗線是有了用戶行為數據做推薦,過去十年沒有做推薦的公司都沒做大。關鍵 feature 能力是大屏幕、攝像頭、GPS,每個都誕生了非常大的公司。今天 AI 的明線還是 Scaling Law,背後核心是 Compute;暗線有可能是 Self Play 強化學習。他提出一個可能性:今天不做強化學習的公司,下一波浪潮裡面都跑不出來,這就跟推薦一樣。AI 的關鍵能力排序是 Coding、多模態、數學、Agent。

— 廣密

原話 · 已逐字校驗

現在只能說有50%的概率 就是傳統意義上的Skilling Law已經失效了 當然另外50%的概率就是說 沿著老的路還能繼續走向AGI對吧 繼續懟十萬卡 感覺這兩個概率哈佛哈佛吧

現在只能說有 50% 的概率,傳統意義上的 Scaling Law 已經失效了;另外 50% 的概率是沿著老路還能繼續走向 AGI,繼續懟十萬卡。感覺這兩個概率一半一半吧。

廣密3:08

就是說讓AI用隨機的一個路徑去嘗試一個新的人物 如果效果超預期那就更新神經網絡的權重 讓AI記得多使用這個成功的時間 然後再開始下一次的嘗試

就是讓 AI 用隨機的一個路徑去嘗試一個新任務,如果效果超預期,就更新神經網絡的權重,讓 AI 記得多使用這個成功的實踐,然後再開始下一次的嘗試。

廣密13:20

你可以把語言和預訓訓練 比作人類的一個基因組 攜帶著人類幾千年進化的基因 那麼強化學習就是人類成長的一生

你可以把語言和預訓練比作人類的一個基因組,攜帶著人類幾千年進化的基因,那麼強化學習就是人類成長的一生。

廣密23:31

因為R的思路 本質是用inference time 換training time 那來解決這個編輯收益遞減的問題

因為 RL 的思路,本質是用 inference time 換 training time,來解決這個邊際收益遞減的問題。

廣密34:45

也浪費了大量的實驗資源 對吧 但你只需要成功一次嘛 那你就可以大量複製

也浪費了大量的實驗資源,對吧,但你只需要成功一次嘛,那你就可以大量複製。

廣密37:45

甚至說有沒有一個可能性 今天不做強化學習的公司 下一波浪潮裡面都跑不出來 這就跟推薦一樣

甚至說有沒有一個可能性,今天不做強化學習的公司,下一波浪潮裡面都跑不出來,這就跟推薦一樣。

廣密1:07:02

其實每一次科技變革都是經歷先硬件投入 再infra建設再應用爆發 歷史上也都是先有鐵路建設 再有後來的經濟活動

其實每一次科技變革都是經歷先硬件投入,再 infra 建設,再應用爆發,歷史上也都是先有鐵路建設,再有後來的經濟活動。

廣密1:18:11

數字與實體

H100 單集群最大互聯規模3.2 萬張4:09
高質量文本數據量15 到 20T4:09
3 萬卡機群 Brick 頻率每兩小時一次8:15
10 萬卡機群 Brick 頻率二三十分鐘一次8:15
合成 1T 高質量推理數據成本約 6 億美金34:45
合成 10T 高質量推理數據成本約 60 億美金34:45
Character.AI 收購價超過 20 億美金31:39
OpenAI 年化收入40 億美金,年底可能七八十億美金1:12:06

術語

Self-Play RL自博弈強化學習
讓模型自己與自己或環境反覆對弈探索,用推理算力換訓練算力的新範式。
Scaling Law縮放定律
模型能力隨參數、數據、算力增加而可預測提升的經驗規律。
reward model獎勵模型
在強化學習中判斷 AI 動作好壞、給出正面或負面信號的模型。
RLHF基於人類反饋的強化學習
用人類偏好訓練獎勵模型,目的是讓 AI 更像人、實現人機對齊。
MOE混合專家模型
由多個專家子網絡組成、每次只激活部分參數的模型架構。
DiT擴散 Transformer
Sora 指明的視頻生成路線,用 Transformer 做擴散模型。

收聽指南

誰該聽

關注 AGI 技術路線演進的創業者、投資人和工程師,尤其是想判斷預訓練之後下一波機會在哪的人。

可跳過

1:05:54 之後關於基礎研究文化和硅谷 player 點評的部分可快進。