世界太吵,來原聲聽播客

張小珺·商業訪談錄

o1 不是路線轉彎,是 AGI 梯子又多了幾節

預訓練這座金礦快挖到頭了,強化學習是第二座礦。o1 的 preview 更像 GPT-3 時刻,能不能成為 ChatGPT 時刻要看正式版。

強化學習o1後訓練AGIOpenAI
前 OpenAI 研究員講清了 o1 背後的強化學習三要素、reward model 為什麼難、以及 OpenAI 當年閉著眼睛挖礦的組織方式。

核心論點 · 點時間戳可跳到原聲

7:20

預訓練金礦快挖完了

吳翼把 AGI 比作挖礦搭梯子:預訓練是第一個大金礦,挖了這麼多年,能挖的越來越少。post-training 是第二個大金礦,可以在上面做強化學習、做探索、做搜索、產生合成數據,而且很可能反過來反哺預訓練。所以 o1 不是路線轉彎,是「階段一過去了,純預訓練的階段過去了」,進入以強化學習為基礎的後訓練階段,讓邁向 AGI 的梯子再往上多了幾節。

— 吳翼
9:00

o1 的 preview 更像 GPT-3 時刻

吳翼認為很難直接類比,但傾向於認為 preview 版本可能是 GPT-3 時刻,ChatGPT 時刻要等正式版。理由是:ChatGPT 和 GPT-3 在基礎能力上沒有本質差別,只是 RLHF 和指令遵從做得更好,讓模型變得可用、產品化,所以一下子火了。而 o1 在能力上已經往上走了一檔,但它能不能在產品上讓原來覺得不好用的人覺得好用,這件事還不知道。

— 吳翼
15:06

強化學習三要素每一塊都很難

吳翼把強化學習拆成三部分:reward model、搜索和探索、prompt。他用教初中生搞競賽打比方:老師給反饋是 reward model,出什麼難度的題是 prompt,學生能不能舉一反三、自己再想怎麼做對是探索。三件事都重要,而且必須同時做對才能實現能力提升。只有一個好的獎勵模型,也不能保證模型能力提升,這是強化學習門檻高的原因。

— 吳翼
19:36

PPO 只有在算力足夠時才有用

DQN 學的是價值網絡,通過它反推 Agent,優化不直接,有 Gap,但數學性質好、對算力和數據要求小。PPO 直接訓練策略網絡,讓策略自己探索、自己進化,更符合直覺,但數學性質差一些,需要足夠多的探索,所以「PPO 當且僅當你有足夠多的算力的時候才會有用」。算力不夠時跑 PPO 沒有任何效果,這也是學術界更常用 DQN、DPO 這類 Offline RL 算法的原因。

— 吳翼
33:24

reward model 不可能閉著眼睛單獨訓練

吳翼用理論計算機科學的 P 和 NP 類比:reward model 是 NP 類問題,判斷一個答案好不好,確實比寫出答案簡單,但沒有簡單太多。而且很多問題可能沒有 universal reward model,因為人的偏好沒有共識。他的建議是:reward model 不太可能有一個單獨的小組閉著眼睛訓練,它一定是耦合的——模型推理能力進步產生更高質量數據,帶來更好的 reward model,更好的 reward model 再促進模型提升。

— 吳翼
40:31

幻覺來自模型只懂相關性不懂因果

吳翼認為幻覺有兩個原因。第一,模型不知道因果性,只知道相關性,所以不知道自己到底知不知道答案,問世界盃冠軍就說是巴西。預訓練和 SFT 沒有反事實推理過程,容易 overfit 到相關性上。第二,很多推理問題有非常多中間步驟,傳統 AI 範式要求一下子輸出正確答案,不允許改。而 o1 給了模型 10 秒、20 秒的緩衝,允許它探索、允許它改,這本身就能極大提升推理表現。

— 吳翼
49:49

o1 不代表垂直模型會崛起

吳翼堅信會出現全能的大統一模型。理由是:模型參數量非常大時,很多垂類模型在高維空間裡很容易正交,正交的參數很容易合併。但他強調前提是垂類方法和預訓練範式耦合——Alpha Geometry 那種定製化的數學方法不可能反哺大模型基礎能力,而 OpenAI 如果是在通用方法上做專用領域訓練,更好的垂類模型一定代表更好的綜合模型。他預計 2 到 4 年後 RL 範式會變得常見,但 2 年尺度內不會出現特別多垂類模型。

— 吳翼
1:03:20

OpenAI 當年的 KPI 是博客關注量

吳翼描述 OpenAI 早期是一種「產品驅動又沒有產品」的奇葩組織:每個組的 KPI 是做一個大新聞,大新聞就是發博客。多智能體團隊做 hide and seek 做了一年多,發了一篇博客,那個博客可能價值幾千萬美金。他認為這種模式適應了 Scaling Law 這條路——賭信 Scaling Law,項目不可能由一兩個優秀研究員帶一兩個人做出來,需要很強的工程投入,論文週期太短沒法考核。這個模式其實也不是 OpenAI 發明的,DeepMind 搞 AlphaGo 時就這麼搞。

— 吳翼

原話 · 已逐字校驗

reward model這個東西不太有可能說有一個單獨的小組,我不管這個模型的本身的能力,我閉著眼睛去訓練一個reward model,這件事情恐怕是不太可能的。

reward model 不太可能有一個單獨的小組,不管模型本身的能力,閉著眼睛去訓練一個 reward model,這件事恐怕不太可能。

吳翼36:28

傳統的AI的這樣思維鏈也好,還是這樣輸出的模式也好,它是不允許你改的,這個其實也是幻覺的一個原因,很多時候可能這個模型可以改對,但你根本沒有給它改的機會。

傳統 AI 的思維鏈也好、輸出模式也好,它不允許你改,這其實也是幻覺的一個原因,很多時候模型本來可以改對,但你根本沒給它改的機會。

吳翼43:33

數字與實體

o1 推理鏈長度幾千個 token5:04
o1 推理時間約 10 秒5:04
吳翼在 OpenAI 時間2019 年 2 月到 2020 年 7 月底2:00
OpenAI 人數拐點2021 年以前 100 人以下1:00:45
吳翼團隊做算法人數五六個人54:41

術語

PPO近端策略優化
OpenAI 2017 年提出的強化學習算法,直接訓練策略網絡,需要足夠算力才有效。
DQN深度 Q 網絡
DeepMind 2014 年提出的算法,訓練價值網絡再反推 Agent,對算力要求小。
RLHF基於人類反饋的強化學習
用人類反饋訓練獎勵模型,再對齊大模型行為的方法。
self-play自我博弈
讓模型和自己對弈來提升,適用於有對稱結構的問題如圍棋。
Scaling Law規模定律
算力、數據、參數規模增大帶來模型能力提升的規律。

收聽指南

誰該聽

關注大模型技術路線、強化學習和 AI 創業機會的工程師、投資人與創業者,尤其適合想理解 o1 背後機制而非只看跑分的人。

可跳過

開頭 3 分鐘嘉賓自我介紹和 offer 二選一的閒聊可跳過。