世界太吵,來原聲聽播客

張小珺·商業訪談錄

AI 是浪,衝浪的人不重要:模型大廠研究員的自白

預訓練沒有到頭,撞牆的人多半是自己有 bug;AI 本質是簡單的,因為它能做實驗。個人英雄主義時代已經過去,現在拼的是組織系統性和靠譜。

模型訓練組織管理預訓練強化學習AnthropicGoogle DeepMind
四小時訪談裡最值錢的是 Anthropic 與 Google 的組織機制對比、預訓練是否到頭的判斷,以及「AI 本質是簡單的」這個反直覺論斷。前半段物理部分可跳過。

核心論點 · 點時間戳可跳到原聲

7:05

現在沒人擔心追不上,只擔心做什麼

姚順宇說,一年前在 Anthropic 大家擔心的是 OpenAI 的 reasoning 做得這麼強、我們有沒有機會追上;現在在 Gemini、OpenAI、Anthropic 這三家當中,沒有哪一家會真的擔心自己追不上。更難的事情變成了想明白要去做什麼——這是一個 bet,很需要人的 insight。這跟「模型能力被拉平」是兩回事:從用戶實際體驗上三家仍有區別,但紙面上(benchmark)已經都在 80% 附近,高一點低一點主要是 noise 而不是 signal。

— 姚順宇
28:27

撞到預訓練牆的人多半是自己有 bug

很多人幾個月前就在討論預訓練 scaling law 是不是到頭了,姚順宇的體驗是沒有,未來四個月也沒看到到頭跡象。他給出三種「覺得到頭」的可能:一是認為規律適用範圍到頭了,二是認為某個條件(比如數據撞牆)不能滿足,三是——他的觀感是絕大多數人屬於這種——自己的工作裡有個 bug 自己沒發現。bug 可能是科學假設沒做對(比如 token horizon、每個大小模型配多少數據沒選清楚),也可能純粹是代碼 bug。他強調修好一個 bug 帶來的進展,往往遠大於一些很神奇的技巧。

— 姚順宇
36:28

Coding 爆發是因為回饋信號好定義

Coding 從 Claude 3.5(外界叫 3.6)那一代之後一直高速發展,姚順宇給出兩個模型層面的原因:一是 reward signal 很好定義,寫一個 feature、某些輸入得到某些輸出,對不對一測就知道;二是數據有天然基礎,GitHub 匯聚了幾十年優質程序員的代碼,從那些代碼出發可以構建非常多的環境。產品層面還有第三個原因:優秀程序員寫代碼的風格比較類似,簡潔、乾淨、有合理抽象,這讓 Coding 產品比社交或遊戲簡單得多——後者每個人品位不同,得靠推薦算法。

— 姚順宇
54:45

硬蒸是不知道自己想幹嘛,聰明的蒸是真 multi-agent

Dario 點名了三家公司蒸餾他。姚順宇區分兩種:硬蒸就是從 Claude 裡取出一堆生成的 token 強行訓練,商業上不道德、智力上也愚蠢,因為幹這事的公司本質上不知道自己想幹嘛,唯一能幹的就是抄別人讓數據好看。但蒸餾也有有趣的科學問題:如果在自己生成數據的鏈條裡用別的模型做輔助、或用自己的模型生成答案讓別的模型當評價者,就是灰色地帶但技術上很有意思——不同家模型的語言分布很不一樣,把它們融匯到一個訓練系統裡,是真正的 multi-agent,中國實驗室可能因此成了做 multi-agent 訓練的先驅。

— 姚順宇
1:05:53

機器人還沒到 GPT-1 時刻

姚順宇在亞馬遜上搜過中國機器人的價格,很驚訝居然這麼便宜,覺得這體現中國在硬件產業鏈上的優勢。但軟件上他沒太看明白:機器人模型目前處於「給定環境、給定場景去優化」的階段,做 RL、構建虛擬環境可以提升,但沒有很強的泛化性。他把有沒有泛化性看作很多 AI 方向的分水嶺——十幾年前就能訓練很強的模型做翻譯、做語義分析,但做不到水平地提升所有能力;語言在 Transformer 和 GPT 之後跨入了那個階段,機器人還沒到。他推薦大家去看機器人實驗室,比語言模型實驗室有趣得多。

— 姚順宇
2:02:43

Anthropic 能 top-down,OpenAI 幹不了

姚順宇認為 Anthropic 能實行比較 top-down 的機制是很獨特的事。難點在於:做技術決策的人必須同時是公司的決策人——技術上得能服眾,研究員才會信服;同時得是公司決策人,才能為這個公司負責任。Anthropic 有這個條件,技術 leader 像 Jared Kaplan 和 Sam 就是公司 cofounder,他們自己做決定,那是人家的公司。其他模型公司很難:OpenAI 就幹不了,Gemini 也比較難。他補充說大公司和 startup 打法本來就不一樣,startup 重要的是 make bet,得賭一件事,top-down 在組織上比 OpenAI 更有優勢。

— 姚順宇
2:36:15

AI 本質是簡單的,因為它能做實驗

姚順宇說這不是結論,是他的一個 statement,可對可錯。他解釋:AI 本質上簡單的點在於能做實驗。和物理的區別在於,物理在那個能標下沒有實驗數據就是理解不了那個能標下的理論;但 AI 不被這個所綁,你理解不了沒關係,它也可以往前發展。他現在事實上能夠做任何能想到的實驗,只是需要時間把計算量提上來、把基礎設施準備好,沒有什麼本質上的困難。所以 AI 沒有給人碰壁的感覺:很多東西都能試,而且不是想空腦袋沒想法可試,是想法太多得一個個試。

— 姚順宇
3:02:41

預訓練也是一種 RL,區別在數據分布

姚順宇說很難從純技術角度說預訓練、監督學習和 RL 的本質區別是什麼,因為預訓練和 SFT 本質也沒啥區別——無非是把拿到的數據當成 ground truth、當成專家輸出,朝那個分布上靠。強化學習更寬廣:輸出的東西不是給定的專家,是自己產生的,裡面有好的結果也有不好的結果,好的往上靠、不好的引力它。所以預訓練和 SFT 是強化學習的一個子集。但這兩件事在現在這個時代確實有區別,最大區別在數據上:預訓練的數據要 distribution 夠好、分布夠廣,質量不需要非常高;後訓練反過來,分布遠窄,但有的那些數據質量要求非常高。

— 姚順宇

原話 · 已逐字校驗

我覺得AI這個方向本質上是簡單 就是沒有哪 我覺得沒有哪個 除了可能跳變那一下 那個idea可能是得有一些很深刻的洞見 在之後的那個過程中 很多想法其實是非常trivial !就是非常愚蠢的 就是誰都能想 誰都能幹 只是你預計好 撞到這個機會去幹而已

我覺得 AI 這個方向本質上是簡單的。除了可能跳變那一下,那個 idea 可能需要一些很深刻的洞見,在之後的那個過程中,很多想法其實是非常 trivial、非常愚蠢的,誰都能想、誰都能幹,只是你運氣好撞到這個機會去幹而已。

姚順宇2:32:13

但是我覺得未來六到十二 他目前還做不到的事情是什麼 是說他能不能從頭到尾的 把一件AI研究的事做完 比如說他不僅能寫這個code 他還能跑這個實驗 跑這個實驗還能看到這個結果 看到這個結果 還能分析這個結果 分析這個結果 指導他哪做的不對 然後提出新的假設 設計新的代碼 跑新的實驗 這條鏈條目前還沒有完整 但我覺得這條鏈條 可能是下一步會慢慢變得完整的事

但是我覺得未來六到十二個月,他目前還做不到的事情是什麼?是他能不能從頭到尾把一件 AI 研究的事做完:不僅能寫這個 code,還能跑這個實驗,跑完還能看到結果,看到結果還能分析,分析完指導他哪裡做得不對,然後提出新的假設、設計新的代碼、跑新的實驗。這條鏈條目前還沒有完整,但我覺得這條鏈條可能是下一步會慢慢變得完整的事。

姚順宇2:38:17

我覺得大家現在就是 每個人都是衝浪的人 本質上是一個浪 而不是你那個衝浪的人 浪是AI嗎 對 就是AI這個事情本身是這個浪 它會往前走 不管你衝不衝這個浪 這個浪都會拍到岸上 只是說有人可能就衝了這個浪 有人就可能晚了一點 沒趕上這個浪尖

我覺得大家現在每個人都是衝浪的人,本質上是一個浪,而不是你那個衝浪的人。浪是 AI 嗎?對,就是 AI 這個事情本身是這個浪,它會往前走,不管你衝不衝這個浪,這個浪都會拍到岸上,只是說有人可能就衝了這個浪,有人可能晚了一點,沒趕上這個浪尖。

姚順宇3:06:42

我覺得如果一個研究員做不到對全局去考慮的話 他就不是考的研究員 在現在這個時代 就是這個和我覺得這個和你就是在學術界做research是很不一樣的事 因為在學術界做research本質上是一個人吃飽全家不愁的狀態 就是我為我的項目負責 對吧 我為我的可重複性負責 但是在一個公司裡你其實更多的時候是我得為這個公司負責 對這是兩種完全不一樣的心態

我覺得如果一個研究員做不到對全局去考慮的話,他就不是好的研究員,在現在這個時代。這和你在學術界做 research 是很不一樣的事:在學術界做 research 本質上是一個人吃飽全家不愁的狀態,我為我的項目負責、為我的可重複性負責;但在一個公司裡,你更多的時候是我得為這個公司負責,這是兩種完全不一樣的心態。

姚順宇3:18:56

數字與實體

Anthropic 員工數(姚順宇加入時)七八百人1:58:36
Anthropic 員工數(姚順宇離開時)接近 2000 人2:22:05
姚順宇所在 Anthropic 大 team 人數(入職時)10 人左右1:58:36
Claude 3.7 從開始訓練到發布耗時四五個月2:18:04
姚順宇估計模型生成代碼佔比保守估計超過 90%,不保守可能 99 或 100%39:29
姚順宇估計實驗效率提升比一年到一年半前快 20 到 50 倍41:30
Gemini 在聊天機器人市場份額(姚順宇估計)20% 左右2:52:34
姚順宇在伯克利 postdoc 實際待的時間兩個星期1:43:30
姚順宇認為 AI 自己做實驗的時間未來六到十二個月2:37:16
姚順宇公開場合說訪華因素佔離職原因比例40%2:26:07

術語

scaling law縮放定律
描述模型性能隨模型大小和數據量如何變化的經驗規律。
reward signal回饋信號
強化學習中用來判斷模型輸出好壞的信號,Coding 場景下容易定義。
multi-agent多智能體
多個模型互相協作或互為評價者,不同家模型語言分布不同時更接近真正的多智能體。
VLA視覺-語言-動作模型
把語言模型作為基底、再訓練機器人動作的模型方向。
context management上下文管理
在有限上下文窗口下選擇性丟棄和取回信息,以完成更長任務。
continual learning持續學習
讓模型在運行中持續更新權重、不遺忘舊知識的學習方式。

收聽指南

誰該聽

關注模型公司組織機制、預訓練與後訓練路線判斷的 AI 從業者、投資人和創業者;想了解 Anthropic 與 Google DeepMind 內部差異的人。

可跳過

1:20:59 到 1:53:47 的非厄米系統、高能物理與物理轉 AI 部分,除非你對物理出身的研究員路徑感興趣。