世界模型不是語言模型:謝賽寧說LM終將凋零
謝賽寧認為語言模型是很好的工具,但不是通用智能的地基——它終將凋零。真正的地基是視覺與表徵學習,這也是他離開硅谷、和楊立昆創立AMI的原因。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
兩次拒絕Ilya,分歧在視覺
2018年Ilya打電話來,謝賽寧什麼都沒說就把OpenAI的offer拒了,Ilya很生氣,問他為什麼不討論一下,是錢不夠嗎。第二次是2024年7月SSI剛成立,Ilya發郵件邀他一起工作,他又拒了。這次兩人主要討論的是「怎麼樣給未來的人工智能給予愛的能力」,但謝賽寧最後問了一句:你對多模態、對計算機視覺、對general的感知模型怎麼看?Ilya的回答是「他覺得這件事情已經解決得很不錯」。謝賽寧說,SSI有自己的基於語言的路線,而這條路線至少在現在為止不是他想設計的路線。
— 謝賽寧LM終將凋零,但不是沒有價值
謝賽寧對語言模型的判斷是「LM終將凋零」,但他馬上補了一句「LM永不會死」——老兵不死,終將凋零。他的意思是:這個東西一定會有它的價值,它是一個很好的工具,他自己天天使用LM,但它不是我們構建一個通用智能系統的基石,它不是這個世界模型大廈的地基。這個判斷是他後面所有選擇的前提:為什麼做視覺、為什麼做世界模型、為什麼和楊立昆一起創業。
— 謝賽寧baseline 決定研究上限
凱明教謝賽寧一件事:你的research的上限其實取決於你baseline的好壞。如果baseline很差,你可能很容易自欺欺人,做不出來什麼東西。這很反直覺,因為大家總說baseline差一點,performance gain就會多一點,更容易發paper。但凱明的想法是:把baseline做到高到不能再高,在這個基礎上做出新的事情,那才是ground breaking。在弱的baseline下面做的任何提升,可能只是一篇灌水的paper。所以凱明在TPU上單槍匹馬從無到有建立了一整套infrastructure,Moco、MAE、DiT都是在上面發生的。
— 謝賽寧金剛經與research taste
凱明給新入職的人送的書是《金剛經》,不是教怎麼做research的。謝賽寧說這涉及到research taste的問題。金剛經裡說「凡所有相皆是虛望,若見諸相非相,即見如來」,跟康德講物自體、叔本華講作為意志和表象的世界有相通之處:你看到的東西不是這個事情的本體,你看到的世界也不是實質。所以當你看一篇論文的時候,重要的事情是打破這個論文給你的幻想,去追問背後到底隱含著什麼樣的實質性的東西。research taste的來源就在於能不能拋開這些虛無的相,一直通往真理的道路去求索。
— 謝賽寧凱明的論文在deadline前一個月寫完
凱明所有的論文都是在deadline前一個月做完的。當其他人還在為了deadline通宵奮戰、獲得巨大滿足感的時候,凱明已經一個月把事情做完了,然後開始一遍一遍地polish,觀察著你們去趕deadline。這意味著他提前兩個月開始寫。謝賽寧說這影響了他,讓他有了OCD:論文不能有一行有小於60%的文字,如果一行有大半行是空的,看起來不好看,得把這一行佔滿或者佔到六七成滿,這樣paper看起來才比較優雅、uniform。凱明的想法是:paper不是給你自己看,是給別人看的,所以要在乎別人的觀感。
— 謝賽寧DiT被CVPR拒了,理由是novelty不夠
DiT投了paper到CVPR,被拒了,理由是novelty不夠——你沒有大段的數學,沒有大段的複雜結構,弄了一個很簡單的結構,雖然得到很好結果,但reviewer不買賬。謝賽寧說,到那個時刻他已經慢慢回過神來了:research paper這件事情,在這個巨大的隨機過程裡面,中或不中,一點都不重要。所以他們接下來又投另外一個會,什麼也沒改,又中了一篇oral paper。這再次證明,這完全是一個純粹的隨機過程。後來DiT在各個維度上都比UNet based system要好,但發出去之後,雖然有很多關注,卻沒有人真的用它幹任何事。
— 謝賽寧在Blue Bottle看過Perplexity的demo
謝賽寧說,他可能是第一個或第二個看到Perplexity demo的人。Aravind從OpenAI出來,在Palo Alto的Blue Bottle咖啡店——這也是硅谷很多事情發生的地方——拿著一個電腦給他看一個瀏覽器,說「我們要革Google的命」。謝賽寧心裡覺得,這個是什麼東西,這不就是GPT套了一個殼,Why are you doing this。然後對方問要不要一起來做,他說他還是比較enjoy being at NYU,繼續做research。他說自己對創業者的認知在過去幾年也發生了一些變化,這件事情跟research還真的不一樣,有很多相通的地方,但也有一些不同的點。
— 謝賽寧美國學術界的資源困境
謝賽寧說北美的學術界處在一個很難的境地,主要是資源不夠。美國的funding system在過去幾十年裡都沒有什麼增長,雖然有很高的通脹,所有東西都變得很貴,學生的學費變得很貴,但政府的資助以及各個公司的資助項目還是維持在一個很低的水平。像NSF這樣的政府機構,能給到每一個單獨的PI的總共資助大概就是50萬美元這個級別,五年,每年大概10萬。而工業界的資助機會變得越來越少,一旦有資助機會,一般會給你10萬到15萬美元,但大概有100個學校的100個老師去compete這10萬塊錢。10萬塊錢可以養一個學生一年作為學費,或者買半個H100的cluster,或者買三到四張卡。
— 謝賽寧原話 · 已逐字校驗
LM終將凋零 不對 LM LM永不會死 但終將凋零 就老兵不死 終將凋零
LM終將凋零。不對,LM永不會死,但終將凋零。就是老兵不死,終將凋零。
謝賽寧2:24:32
你的research的上限 其實取決於你 based on的好壞 好 就如果你的based on很差的話 你可能很容易自欺欺人 你是做不出來什麼東西的
你的research的上限,其實取決於你baseline的好壞。如果你的baseline很差的話,你可能很容易自欺欺人,你是做不出來什麼東西的。
謝賽寧2:33:37
凱明所有的論文都是在deadline前一個月做完的 只要在fair的時候是這樣的
凱明所有的論文都是在deadline前一個月做完的,至少在FAIR的時候是這樣的。
謝賽寧2:47:48
這個research paper這件事情 其實在這個巨大的隨機過程裡面 重或不重 一點都不重要
research paper這件事情,其實在這個巨大的隨機過程裡面,中或不中,一點都不重要。
謝賽寧3:06:04
數字與實體
| AMI Labs 團隊規模 | 25人 | 0:00 |
| 謝賽寧博士期間發表頂會論文數 | 五六篇 | 44:26 |
| 謝賽寧博士期間實習次數 | 五次 | 52:32 |
| FAIR 租用 TPU core 數量 | 約5000張 | 2:32:35 |
| NSF 給單個 PI 的資助總額 | 約50萬美元,五年,每年約10萬 | 3:23:14 |
| 工業界單次資助金額 | 10萬到15萬美元 | 3:23:14 |
| 競爭工業界資助的教師數量 | 約100個學校的100個老師 | 3:23:14 |
術語
- research taste研究品味
- 判斷什麼問題重要、什麼方向值得做的能力,謝賽寧認為它來自拋開表象追問實質。
- representation learning表徵學習
- 把數據映射到具有良好性質的向量空間,使下游任務更容易取得好結果。
- contrastive learning對比學習
- 在表徵空間裡讓相似物體的距離更近、不同物體的距離更遠,Moco 是第一個真正做 work 的框架。
- anti-fragile反脆弱
- 塔勒布的概念:面對隨機衝擊時收益大於損失的系統,謝賽寧認為 research 必須是反脆弱的。
- DiTDiffusion Transformer
- 用 ViT 架構替代 UNet 做擴散模型,謝賽寧和 Bill Peebles 在 FAIR 最後一個月做出來的工作。
收聽指南
關注世界模型、視覺與語言路線之爭的 AI 研究者和創業者;想知道頂尖研究員怎麼做選題、怎麼搭 baseline 的工程師。
前兩小時童年、求學、實習流水賬可跳過,從 2:43 的 research taste 開始聽。