o1 不是路線轉彎,是 AGI 梯子又多了幾節
預訓練這座金礦快挖到頭了,強化學習是第二座礦。o1 的 preview 更像 GPT-3 時刻,能不能成為 ChatGPT 時刻要看正式版。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
預訓練金礦快挖完了
吳翼把 AGI 比作挖礦搭梯子:預訓練是第一個大金礦,挖了這麼多年,能挖的越來越少。post-training 是第二個大金礦,可以在上面做強化學習、做探索、做搜索、產生合成數據,而且很可能反過來反哺預訓練。所以 o1 不是路線轉彎,是「階段一過去了,純預訓練的階段過去了」,進入以強化學習為基礎的後訓練階段,讓邁向 AGI 的梯子再往上多了幾節。
— 吳翼o1 的 preview 更像 GPT-3 時刻
吳翼認為很難直接類比,但傾向於認為 preview 版本可能是 GPT-3 時刻,ChatGPT 時刻要等正式版。理由是:ChatGPT 和 GPT-3 在基礎能力上沒有本質差別,只是 RLHF 和指令遵從做得更好,讓模型變得可用、產品化,所以一下子火了。而 o1 在能力上已經往上走了一檔,但它能不能在產品上讓原來覺得不好用的人覺得好用,這件事還不知道。
— 吳翼強化學習三要素每一塊都很難
吳翼把強化學習拆成三部分:reward model、搜索和探索、prompt。他用教初中生搞競賽打比方:老師給反饋是 reward model,出什麼難度的題是 prompt,學生能不能舉一反三、自己再想怎麼做對是探索。三件事都重要,而且必須同時做對才能實現能力提升。只有一個好的獎勵模型,也不能保證模型能力提升,這是強化學習門檻高的原因。
— 吳翼PPO 只有在算力足夠時才有用
DQN 學的是價值網絡,通過它反推 Agent,優化不直接,有 Gap,但數學性質好、對算力和數據要求小。PPO 直接訓練策略網絡,讓策略自己探索、自己進化,更符合直覺,但數學性質差一些,需要足夠多的探索,所以「PPO 當且僅當你有足夠多的算力的時候才會有用」。算力不夠時跑 PPO 沒有任何效果,這也是學術界更常用 DQN、DPO 這類 Offline RL 算法的原因。
— 吳翼reward model 不可能閉著眼睛單獨訓練
吳翼用理論計算機科學的 P 和 NP 類比:reward model 是 NP 類問題,判斷一個答案好不好,確實比寫出答案簡單,但沒有簡單太多。而且很多問題可能沒有 universal reward model,因為人的偏好沒有共識。他的建議是:reward model 不太可能有一個單獨的小組閉著眼睛訓練,它一定是耦合的——模型推理能力進步產生更高質量數據,帶來更好的 reward model,更好的 reward model 再促進模型提升。
— 吳翼幻覺來自模型只懂相關性不懂因果
吳翼認為幻覺有兩個原因。第一,模型不知道因果性,只知道相關性,所以不知道自己到底知不知道答案,問世界盃冠軍就說是巴西。預訓練和 SFT 沒有反事實推理過程,容易 overfit 到相關性上。第二,很多推理問題有非常多中間步驟,傳統 AI 範式要求一下子輸出正確答案,不允許改。而 o1 給了模型 10 秒、20 秒的緩衝,允許它探索、允許它改,這本身就能極大提升推理表現。
— 吳翼o1 不代表垂直模型會崛起
吳翼堅信會出現全能的大統一模型。理由是:模型參數量非常大時,很多垂類模型在高維空間裡很容易正交,正交的參數很容易合併。但他強調前提是垂類方法和預訓練範式耦合——Alpha Geometry 那種定製化的數學方法不可能反哺大模型基礎能力,而 OpenAI 如果是在通用方法上做專用領域訓練,更好的垂類模型一定代表更好的綜合模型。他預計 2 到 4 年後 RL 範式會變得常見,但 2 年尺度內不會出現特別多垂類模型。
— 吳翼OpenAI 當年的 KPI 是博客關注量
吳翼描述 OpenAI 早期是一種「產品驅動又沒有產品」的奇葩組織:每個組的 KPI 是做一個大新聞,大新聞就是發博客。多智能體團隊做 hide and seek 做了一年多,發了一篇博客,那個博客可能價值幾千萬美金。他認為這種模式適應了 Scaling Law 這條路——賭信 Scaling Law,項目不可能由一兩個優秀研究員帶一兩個人做出來,需要很強的工程投入,論文週期太短沒法考核。這個模式其實也不是 OpenAI 發明的,DeepMind 搞 AlphaGo 時就這麼搞。
— 吳翼原話 · 已逐字校驗
reward model這個東西不太有可能說有一個單獨的小組,我不管這個模型的本身的能力,我閉著眼睛去訓練一個reward model,這件事情恐怕是不太可能的。
reward model 不太可能有一個單獨的小組,不管模型本身的能力,閉著眼睛去訓練一個 reward model,這件事恐怕不太可能。
吳翼36:28
傳統的AI的這樣思維鏈也好,還是這樣輸出的模式也好,它是不允許你改的,這個其實也是幻覺的一個原因,很多時候可能這個模型可以改對,但你根本沒有給它改的機會。
傳統 AI 的思維鏈也好、輸出模式也好,它不允許你改,這其實也是幻覺的一個原因,很多時候模型本來可以改對,但你根本沒給它改的機會。
吳翼43:33
數字與實體
| o1 推理鏈長度 | 幾千個 token | 5:04 |
| o1 推理時間 | 約 10 秒 | 5:04 |
| 吳翼在 OpenAI 時間 | 2019 年 2 月到 2020 年 7 月底 | 2:00 |
| OpenAI 人數拐點 | 2021 年以前 100 人以下 | 1:00:45 |
| 吳翼團隊做算法人數 | 五六個人 | 54:41 |
術語
- PPO近端策略優化
- OpenAI 2017 年提出的強化學習算法,直接訓練策略網絡,需要足夠算力才有效。
- DQN深度 Q 網絡
- DeepMind 2014 年提出的算法,訓練價值網絡再反推 Agent,對算力要求小。
- RLHF基於人類反饋的強化學習
- 用人類反饋訓練獎勵模型,再對齊大模型行為的方法。
- self-play自我博弈
- 讓模型和自己對弈來提升,適用於有對稱結構的問題如圍棋。
- Scaling Law規模定律
- 算力、數據、參數規模增大帶來模型能力提升的規律。
收聽指南
關注大模型技術路線、強化學習和 AI 創業機會的工程師、投資人與創業者,尤其適合想理解 o1 背後機制而非只看跑分的人。
開頭 3 分鐘嘉賓自我介紹和 offer 二選一的閒聊可跳過。