o1 不是轉彎是進階:快思考模型學會了慢思考
王小川認為 o1 是範式升級而非進步退兩步——先有快思考,才能用強化學習讓它學會慢思考,這條路摸到了從語言走向智能的雛形。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
o1 不是轉彎,是範式升級
王小川不認同「進步退兩步」的說法,他認為 o1 是範式升級:先得有快思考,才能用大模型的快思考讓它學會慢思考,這是進階而非轉彎。他用 DIKW 模型解釋:搜索在 Information 層,大模型 LLM 到了 Knowledge 層,而 o1 的慢思考讓模型從 Knowledge 開始進化到有 Wisdom 的雛形,開始有智能了。原來的模型成了 o1 的組件之一,而不是強化學習只服務於大模型。
— 王小川o1 隱藏思維鏈是競爭策略
o1 隱藏思維過程、破解思維鏈會被警告封號,王小川給了兩個原因:一是之前各家用大模型數據做蒸餾能迅速接近,OpenAI 是商業公司不是公益公司,一旦公開更容易被仿效邏輯、被蒸餾數據,讓別人進步變快;二是說明這個技術本身的獨有信息有限。所以封鎖是競爭策略。他還點出 o1 兩個核心關注點:堅持以語言為中心並走向 CoT,以及把思考過程和結果分成兩個階段,從而讓 CoT 更好泛化。
— 王小川強化學習不告訴過程,只判對錯
王小川用教小孩類比:監督學習要告訴解題過程,一二三怎麼做,小孩學得快但不知其所以然;強化學習不告訴過程,只判斷做得對不對,做對說對、做錯說錯,小孩自己進去找方法。他解釋大模型為什麼特別需要強化學習:大模型是把全天下最優質語言做訓練、做壓縮,是在原有數據分布內的智能,思考能力不會超過原始數據;而談智能要跳出框架、走向分布外,所以必須創造環境,用環境反饋帶來語言數據之外的內容。
— 王小川醫療是強化學習的好領域
王小川認為醫生是蠻好的可以用強化學習提升的領域,因為醫療很多問題有答案標準:病人有什麼症狀、該做什麼檢驗檢查、該開什麼藥,都有答案。如果訪問醫生的 CoT 再驗證答案對不對,模型功力可能大漲。醫生不是光看醫學院的書就會了,臨床中一輩子可能看幾萬個病人,靠與病人互動得到提升,而且很多數據被記錄下來。他還提到百川早前用唐詩宋詞做實驗,因為詞牌字數、平仄、韻律、對仗都有規則,可以用程序做 reward model 校驗。
— 王小川之前做強化學習沒有 CoT
王小川承認百川之前的 reward model 不帶 CoT,今天看到 o1 後要復現更強的 CoT。有 CoT 有兩個意義:一是做醫療時能更早讓醫生給出思考路徑,更快提升能力,而不只是端到端;二是泛化能力會大幅提升,思路對答案就對。他還講了一個觀察:強化學習一部分從環境學新東西,一部分會激活原有能力。他們教模型字數、平仄、韻律,結果模型自己把沒教的對仗也輸出了,說明潛藏的記憶和能力可以被激活出來。
— 王小川復現 o1 可能比復現 GPT-4 快
王小川認為復現 o1 會比當年復現 GPT-4 快一些,難歸難,但國內和美國有大量開源項目,大廠和創業公司進入,資本充裕度和人才集中度已比 GPT-3.5、GPT-4 發布後多很多。他預計一兩個月內就會出現接近 o1 的模型,達到市場高度還需花力氣。他估計 GPT-4 可能用了 18 個月,o1 也許 9 個月,起步有一樣子可能一兩個月就有。他還說 o1 像當年 GPT-3 的發布,但因為在 GPT-4 基礎上跑通新範式,重要性不亞於 GPT-3。
— 王小川未來代碼會扮演更重要的角色
王小川預言未來代碼會扮演更重要的角色:以前代碼是幫助提升邏輯能力、輔助程序員寫代碼,未來代碼會變成大模型下一步的核心能力,大模型通過寫代碼解決更多問題,甚至解決自身的思考過程。他認為從強化學習還會走向寫代碼解決問題的新範式,未來幾年會實現。他還提到 o1 的可見上限:可能未來兩三年內範式會跑出接口,剩下代碼扮演更重要角色,繼續自己寫代碼、用代碼運行生成神經網絡,甚至把神經網絡和模型融合到一塊,新的範式會產生。
— 王小川做水漲船高的應用,不做沿途下蛋
王小川把應用分成兩類:沿途下蛋是模型再好我就下個新蛋,先做廣告模型、再做客服模型,蛋越多壓力越大;水漲船高是模型越大這個領域做得越好,而不是模型大的階段跟領域沒關係。他找的是終極形態的應用場景——假設模型能力特別強以後什麼場景更受益,同時模型能力一般時也能進入,門檻沒那麼高,但模型越大越受益。他今年開始大膽提醫療,明年是雙輪驅動模式,希望得到市場檢驗。
— 王小川創業公司要走出大廠射程
談到六小龍,王小川說至少活一家,並說自己是保護也是攻擊,在也有共識的裡面自己會發展非常快。他認為一定有比大廠更高的、他們看不到的東西,或他們組織能力做不到,才會有創業公司生存的機會,叫做走出大廠的射程,在射程內你是沒什麼好活的。他還重新定義百川:是一線的、想得清楚的大模型公司,唯一一個。被問最艱難時刻,他說是一開始搭團隊,團隊有了之後就會好。
— 王小川原話 · 已逐字校驗
那也說明這個技術本身 它的這個獨有信息也有限的 所以它封鎖這個事情 是一個競爭策略
那也說明這個技術本身,它的這個獨有信息也有限的,所以它封鎖這個事情,是一個競爭策略。
王小川9:04
醫生寫是因為他 不是光看醫學院的書 讀完了就會了 他在臨床中間 大概一輩子可能看幾萬個病人 要得到自己的提升 所以醫生是靠病人的這個 這個互動當中去得到自己的提升的
醫生寫是因為他不是光看醫學院的書、讀完了就會了,他在臨床中間大概一輩子可能看幾萬個病人,要得到自己的提升,所以醫生是靠病人的這個互動當中去得到自己的提升的。
王小川18:09
就是模型越大 那我這個領域能做得更好 而不是模型大的一個階段 就跟我領域沒關係了
就是模型越大,那我這個領域能做得更好,而不是模型大的一個階段,就跟我領域沒關係了。
王小川28:35
數字與實體
| 復現 GPT-4 預計用時 | 18 個月 | 23:15 |
| 復現 o1 預計用時 | 9 個月 | 23:15 |
| 接近 o1 的模型出現時間 | 一兩個月 | 23:15 |
| 中國詞牌數量 | 100 多首 | 19:10 |
| 醫生一輩子看病人數 | 幾萬個 | 18:09 |
術語
- CoT思維鏈
- 讓模型分步寫出推理過程,而非直接給答案。
- reward model獎勵模型
- 強化學習中判斷輸出對錯、給出訓練信號的評價系統。
- DIKW數據-信息-知識-智慧模型
- 從 Data 到 Information 到 Knowledge 到 Wisdom 的四層遞進框架。
- Self Play RL自我博弈強化學習
- 模型自己與自己對抗生成訓練數據,減少人工標註。
- scaling law縮放定律
- 模型能力隨算力、數據、參數規模增長的經驗規律。
收聽指南
關注大模型技術路線與創業策略的創業者、投資人和工程師,尤其想理解 o1 強化學習原理與醫療落地路徑的人。
開頭 0:00-1:00 的節目介紹和 Sam Altman 宮鬥鋪墊可快進。