世界太吵,來原聲聽播客

Dwarkesh

AI 下一個突破不是訓練,是讓 AI 在工作中學習

實驗室押注 RLVR 能泛化出通用智能,但真正的瓶頸是樣本效率與持續學習。OPSD 與「做夢」或成關鍵,讓 AI 從部署中學習,而非只靠預訓練。

持續學習RLVR樣本效率OPSDAI 訓練架構創新

原視頻在 YouTube 上放不出來,用音頻聽:

這集挑戰了當前 RLVR 主導的訓練範式,提出持續學習與樣本效率是 AGI 的真正瓶頸,對理解 AI 未來演進方向至關重要。

核心論點 · 時間戳為按文稿位置估算

0:00

實驗室的豪賭

實驗室正押注:若在數千個多樣化 RL 環境中訓練 AI 完成數百萬個可驗證任務,就能構建 AGI。這種訓練會催生通用問題解決能力,如面對錯誤與模糊時數週推進開放式任務。樂觀者認為,數據低效與缺乏持續學習等缺陷可被規模化訓練碾壓,正如 NLP 中的「根本性」問題被算力洪流淹沒。模型訓練樣本效率雖僅為人類的百萬分之一,但訓練成本是一次性的,分攤到數十億用戶會話中。關鍵在於會話內模型的智能、通用性與樣本效率,而這正隨 RL 訓練提升。

— Dwarkesh Patel
2:12

可磨性比可驗證性更重要

計算機使用進展緩慢,原因不僅是可驗證性,更在於「可磨性」——能否在確定性、可重放的模擬器上並行運行大量 rollout。編碼可以創建倉庫環境讓千個代理並行嘗試,但計算機使用無法讓千個代理同時測試 Amazon 結賬流程,因為會被檢測封禁。克隆 Slack、Gmail 等應用雖可行,但勞動密集且不可擴展。這揭示:除非能為領域構建可重放的訓練目標,否則模型難以進步。而許多 AGI 所需技能,如經商、打官司、炒股,無法在數據中心內重放,驗證需數月或數年真實世界行動,且無法並行擾動。

— Dwarkesh Patel
5:41

RLVR 能否泛化?

實驗室賭 RLVR 能泛化到所有領域:在足夠多容器化、可重現環境中訓練,會得到能制定計劃、快速學習、獲取新技能的通用代理。若將無限 RLVR 的 AI 投入 1948 年德州政治,它可能比 LBJ 更懂如何贏得參議院席位;若給 2002 年的它一億美元,它能造出 SpaceX。但這是開放經驗問題。Dario 在播客中提到,短上下文訓練未必能泛化到長上下文性能,暗示 RLVR 泛化並非無限強。若無法從短到長泛化,又如何從大量白領任務訓練泛化到現實世界白手起家?

— Dwarkesh Patel
8:09

將學習寫回權重

持續學習需要回到權重,AI 不能僅靠不斷增長的 KV 緩存學習,這不具擴展性,也非人類學習方式。人類學習涉及壓縮,這有助於泛化與頓悟。但一旦進入權重,就得放棄上下文學習的樣本效率,因為梯度更新極其樣本低效。已成功上線的在線學習模型,如 Cursor Tab,每天需 4 億+ 請求預測同一目標。但持續學習的意義在於世界複雜,每個工作、公司、問題都不同,需要學習特定部署相關信息,這無法塞進共享訓練。樣本效率與持續學習是深層關聯問題:工作中可用數據少,需樣本效率,而上下文學習的「快速權重」內存擴展性差,需架構創新。

— Dwarkesh Patel
13:16

做夢:第四軸擴展

「做夢」是更投機的方法:若 AI 能構建現實模擬器來排練新技能、嘗試替代策略,就能在相同牆鍾時間內體驗數量級更多的模擬樣本。EfficientZero 在 2 小時內能擊敗新手人類,因其在腦中玩數十個模擬遊戲。未來 LLM 或能消費更少真實數據,同時在自己構建的環境中無盡練習。但構建整個世界模擬遠比圍棋難,因此更投機。若成功,它將成為繼預訓練、RL、推理時計算之後的第四擴展軸。模型花費算力編寫 RL 環境,排練生產中將用到的技能,而非僅壓縮上下文。

— Dwarkesh Patel
15:00

2027 年的持續學習

到 2027 年底,RLVR 訓練已產生能在陌生問題中定位、嘗試策略、迭代的代理。有效上下文可能擴展至一週,AI 可與你協作一週,週末你給贊或踩。若點贊,基礎模型通過 OPSD、做夢或其他技術蒸餾會話所學。AI 能改進相鄰領域,並逐步擴展能力範圍。AI 改進的主要方式不再是發布前的訓練,而是廣泛部署中積累的經驗。每次交互,AI 都會更聰明,不僅因你的歷史會話,還因全球所有用戶的交互。這既可怕又令人興奮,與當前 AI 改進方式截然不同。

— Dwarkesh Patel

原話 · 已逐字校驗

if we train AIs to accomplish millions of verifiable tasks across thousands of diverse RL environments, then we’ll basically have built AGI.

如果我們訓練 AI 在數千個多樣化 RL 環境中完成數百萬個可驗證任務,那麼我們基本上就構建了 AGI。

Dwarkesh Patel0:00

it is not enough for a domain to be verifiable. It also has to be very grindable

一個領域僅可驗證是不夠的,還必須非常可磨。

Dwarkesh Patel2:12

There’s the context length you train at and there’s a context length that you serve at. If you train at a small context length and then try to serve at a long context length, maybe you get these degradations.

訓練時的上下文長度與服務時的上下文長度不同。如果在小上下文長度訓練,然後嘗試在大上下文長度服務,可能會出現性能下降。

Dwarkesh Patel5:41

We don’t have some separation between parameters and activations. And there’s not some lump of these fast-weight representations that juts out further and further from our skull as we learn more things throughout our lifetime.

我們並不區分參數和激活。隨著一生學習更多東西,也沒有某種快速權重表徵從我們顱骨中不斷突出。

Dwarkesh Patel8:09

If the AI can build a good simulation of reality against which to rehearse new skills, or try alternative strategies and reinforce what works, then it could experience orders of magnitude more simulated samples in the same wall clock time.

如果 AI 能構建一個良好的現實模擬,用來排練新技能或嘗試替代策略並強化有效方法,那麼它就能在相同牆鍾時間內體驗數量級更多的模擬樣本。

Dwarkesh Patel13:16

Every time you interact with AI, it’ll be smarter. Not only because it has been learning from all your previous sessions, but also from all its interactions with all the other users in the world.

每次你與 AI 交互,它都會更聰明。不僅因為它從你之前的會話中學習,還因為它從世界上所有其他用戶的交互中學習。

Dwarkesh Patel15:00

數字與實體

模型訓練樣本效率與人類對比百萬分之一0:00
實驗室推理算力佔比30-50%8:09
Llama 3 70B 訓練時每 token 存儲位數0.075 位16:54
上下文學習與預訓練信息存儲差異3500 萬倍16:54

術語

RLVR強化學習與可驗證獎勵
一種訓練方法,通過可驗證的獎勵信號進行強化學習。
OPSD在線策略自蒸餾
一種技術,讓基礎模型模仿長會話後模型的預測,以蒸餾學習。
Dreaming做夢
AI 構建模擬環境進行自我訓練,以增加樣本效率。
KV cache鍵值緩存
Transformer 中存儲上下文信息的緩存,隨 token 增長。
Sample efficiency樣本效率
模型從少量數據中學習的能力。

收聽指南

誰該聽

AI 研究者、技術決策者、關注 AI 未來的創業者與投資人,尤其對訓練範式與持續學習感興趣的人。

可跳過

贊助商部分(16:54-17:56)可跳過。