AI 是浪,衝浪的人不重要:模型大廠研究員的自白
預訓練沒有到頭,撞牆的人多半是自己有 bug;AI 本質是簡單的,因為它能做實驗。個人英雄主義時代已經過去,現在拼的是組織系統性和靠譜。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
現在沒人擔心追不上,只擔心做什麼
姚順宇說,一年前在 Anthropic 大家擔心的是 OpenAI 的 reasoning 做得這麼強、我們有沒有機會追上;現在在 Gemini、OpenAI、Anthropic 這三家當中,沒有哪一家會真的擔心自己追不上。更難的事情變成了想明白要去做什麼——這是一個 bet,很需要人的 insight。這跟「模型能力被拉平」是兩回事:從用戶實際體驗上三家仍有區別,但紙面上(benchmark)已經都在 80% 附近,高一點低一點主要是 noise 而不是 signal。
— 姚順宇撞到預訓練牆的人多半是自己有 bug
很多人幾個月前就在討論預訓練 scaling law 是不是到頭了,姚順宇的體驗是沒有,未來四個月也沒看到到頭跡象。他給出三種「覺得到頭」的可能:一是認為規律適用範圍到頭了,二是認為某個條件(比如數據撞牆)不能滿足,三是——他的觀感是絕大多數人屬於這種——自己的工作裡有個 bug 自己沒發現。bug 可能是科學假設沒做對(比如 token horizon、每個大小模型配多少數據沒選清楚),也可能純粹是代碼 bug。他強調修好一個 bug 帶來的進展,往往遠大於一些很神奇的技巧。
— 姚順宇Coding 爆發是因為回饋信號好定義
Coding 從 Claude 3.5(外界叫 3.6)那一代之後一直高速發展,姚順宇給出兩個模型層面的原因:一是 reward signal 很好定義,寫一個 feature、某些輸入得到某些輸出,對不對一測就知道;二是數據有天然基礎,GitHub 匯聚了幾十年優質程序員的代碼,從那些代碼出發可以構建非常多的環境。產品層面還有第三個原因:優秀程序員寫代碼的風格比較類似,簡潔、乾淨、有合理抽象,這讓 Coding 產品比社交或遊戲簡單得多——後者每個人品位不同,得靠推薦算法。
— 姚順宇硬蒸是不知道自己想幹嘛,聰明的蒸是真 multi-agent
Dario 點名了三家公司蒸餾他。姚順宇區分兩種:硬蒸就是從 Claude 裡取出一堆生成的 token 強行訓練,商業上不道德、智力上也愚蠢,因為幹這事的公司本質上不知道自己想幹嘛,唯一能幹的就是抄別人讓數據好看。但蒸餾也有有趣的科學問題:如果在自己生成數據的鏈條裡用別的模型做輔助、或用自己的模型生成答案讓別的模型當評價者,就是灰色地帶但技術上很有意思——不同家模型的語言分布很不一樣,把它們融匯到一個訓練系統裡,是真正的 multi-agent,中國實驗室可能因此成了做 multi-agent 訓練的先驅。
— 姚順宇機器人還沒到 GPT-1 時刻
姚順宇在亞馬遜上搜過中國機器人的價格,很驚訝居然這麼便宜,覺得這體現中國在硬件產業鏈上的優勢。但軟件上他沒太看明白:機器人模型目前處於「給定環境、給定場景去優化」的階段,做 RL、構建虛擬環境可以提升,但沒有很強的泛化性。他把有沒有泛化性看作很多 AI 方向的分水嶺——十幾年前就能訓練很強的模型做翻譯、做語義分析,但做不到水平地提升所有能力;語言在 Transformer 和 GPT 之後跨入了那個階段,機器人還沒到。他推薦大家去看機器人實驗室,比語言模型實驗室有趣得多。
— 姚順宇Anthropic 能 top-down,OpenAI 幹不了
姚順宇認為 Anthropic 能實行比較 top-down 的機制是很獨特的事。難點在於:做技術決策的人必須同時是公司的決策人——技術上得能服眾,研究員才會信服;同時得是公司決策人,才能為這個公司負責任。Anthropic 有這個條件,技術 leader 像 Jared Kaplan 和 Sam 就是公司 cofounder,他們自己做決定,那是人家的公司。其他模型公司很難:OpenAI 就幹不了,Gemini 也比較難。他補充說大公司和 startup 打法本來就不一樣,startup 重要的是 make bet,得賭一件事,top-down 在組織上比 OpenAI 更有優勢。
— 姚順宇AI 本質是簡單的,因為它能做實驗
姚順宇說這不是結論,是他的一個 statement,可對可錯。他解釋:AI 本質上簡單的點在於能做實驗。和物理的區別在於,物理在那個能標下沒有實驗數據就是理解不了那個能標下的理論;但 AI 不被這個所綁,你理解不了沒關係,它也可以往前發展。他現在事實上能夠做任何能想到的實驗,只是需要時間把計算量提上來、把基礎設施準備好,沒有什麼本質上的困難。所以 AI 沒有給人碰壁的感覺:很多東西都能試,而且不是想空腦袋沒想法可試,是想法太多得一個個試。
— 姚順宇預訓練也是一種 RL,區別在數據分布
姚順宇說很難從純技術角度說預訓練、監督學習和 RL 的本質區別是什麼,因為預訓練和 SFT 本質也沒啥區別——無非是把拿到的數據當成 ground truth、當成專家輸出,朝那個分布上靠。強化學習更寬廣:輸出的東西不是給定的專家,是自己產生的,裡面有好的結果也有不好的結果,好的往上靠、不好的引力它。所以預訓練和 SFT 是強化學習的一個子集。但這兩件事在現在這個時代確實有區別,最大區別在數據上:預訓練的數據要 distribution 夠好、分布夠廣,質量不需要非常高;後訓練反過來,分布遠窄,但有的那些數據質量要求非常高。
— 姚順宇原話 · 已逐字校驗
我覺得AI這個方向本質上是簡單 就是沒有哪 我覺得沒有哪個 除了可能跳變那一下 那個idea可能是得有一些很深刻的洞見 在之後的那個過程中 很多想法其實是非常trivial !就是非常愚蠢的 就是誰都能想 誰都能幹 只是你預計好 撞到這個機會去幹而已
我覺得 AI 這個方向本質上是簡單的。除了可能跳變那一下,那個 idea 可能需要一些很深刻的洞見,在之後的那個過程中,很多想法其實是非常 trivial、非常愚蠢的,誰都能想、誰都能幹,只是你運氣好撞到這個機會去幹而已。
姚順宇2:32:13
但是我覺得未來六到十二 他目前還做不到的事情是什麼 是說他能不能從頭到尾的 把一件AI研究的事做完 比如說他不僅能寫這個code 他還能跑這個實驗 跑這個實驗還能看到這個結果 看到這個結果 還能分析這個結果 分析這個結果 指導他哪做的不對 然後提出新的假設 設計新的代碼 跑新的實驗 這條鏈條目前還沒有完整 但我覺得這條鏈條 可能是下一步會慢慢變得完整的事
但是我覺得未來六到十二個月,他目前還做不到的事情是什麼?是他能不能從頭到尾把一件 AI 研究的事做完:不僅能寫這個 code,還能跑這個實驗,跑完還能看到結果,看到結果還能分析,分析完指導他哪裡做得不對,然後提出新的假設、設計新的代碼、跑新的實驗。這條鏈條目前還沒有完整,但我覺得這條鏈條可能是下一步會慢慢變得完整的事。
姚順宇2:38:17
我覺得大家現在就是 每個人都是衝浪的人 本質上是一個浪 而不是你那個衝浪的人 浪是AI嗎 對 就是AI這個事情本身是這個浪 它會往前走 不管你衝不衝這個浪 這個浪都會拍到岸上 只是說有人可能就衝了這個浪 有人就可能晚了一點 沒趕上這個浪尖
我覺得大家現在每個人都是衝浪的人,本質上是一個浪,而不是你那個衝浪的人。浪是 AI 嗎?對,就是 AI 這個事情本身是這個浪,它會往前走,不管你衝不衝這個浪,這個浪都會拍到岸上,只是說有人可能就衝了這個浪,有人可能晚了一點,沒趕上這個浪尖。
姚順宇3:06:42
我覺得如果一個研究員做不到對全局去考慮的話 他就不是考的研究員 在現在這個時代 就是這個和我覺得這個和你就是在學術界做research是很不一樣的事 因為在學術界做research本質上是一個人吃飽全家不愁的狀態 就是我為我的項目負責 對吧 我為我的可重複性負責 但是在一個公司裡你其實更多的時候是我得為這個公司負責 對這是兩種完全不一樣的心態
我覺得如果一個研究員做不到對全局去考慮的話,他就不是好的研究員,在現在這個時代。這和你在學術界做 research 是很不一樣的事:在學術界做 research 本質上是一個人吃飽全家不愁的狀態,我為我的項目負責、為我的可重複性負責;但在一個公司裡,你更多的時候是我得為這個公司負責,這是兩種完全不一樣的心態。
姚順宇3:18:56
數字與實體
| Anthropic 員工數(姚順宇加入時) | 七八百人 | 1:58:36 |
| Anthropic 員工數(姚順宇離開時) | 接近 2000 人 | 2:22:05 |
| 姚順宇所在 Anthropic 大 team 人數(入職時) | 10 人左右 | 1:58:36 |
| Claude 3.7 從開始訓練到發布耗時 | 四五個月 | 2:18:04 |
| 姚順宇估計模型生成代碼佔比 | 保守估計超過 90%,不保守可能 99 或 100% | 39:29 |
| 姚順宇估計實驗效率提升 | 比一年到一年半前快 20 到 50 倍 | 41:30 |
| Gemini 在聊天機器人市場份額(姚順宇估計) | 20% 左右 | 2:52:34 |
| 姚順宇在伯克利 postdoc 實際待的時間 | 兩個星期 | 1:43:30 |
| 姚順宇認為 AI 自己做實驗的時間 | 未來六到十二個月 | 2:37:16 |
| 姚順宇公開場合說訪華因素佔離職原因比例 | 40% | 2:26:07 |
術語
- scaling law縮放定律
- 描述模型性能隨模型大小和數據量如何變化的經驗規律。
- reward signal回饋信號
- 強化學習中用來判斷模型輸出好壞的信號,Coding 場景下容易定義。
- multi-agent多智能體
- 多個模型互相協作或互為評價者,不同家模型語言分布不同時更接近真正的多智能體。
- VLA視覺-語言-動作模型
- 把語言模型作為基底、再訓練機器人動作的模型方向。
- context management上下文管理
- 在有限上下文窗口下選擇性丟棄和取回信息,以完成更長任務。
- continual learning持續學習
- 讓模型在運行中持續更新權重、不遺忘舊知識的學習方式。
收聽指南
關注模型公司組織機制、預訓練與後訓練路線判斷的 AI 從業者、投資人和創業者;想了解 Anthropic 與 Google DeepMind 內部差異的人。
1:20:59 到 1:53:47 的非厄米系統、高能物理與物理轉 AI 部分,除非你對物理出身的研究員路徑感興趣。