世界模型不是语言模型:谢赛宁说LM终将凋零
谢赛宁认为语言模型是很好的工具,但不是通用智能的地基——它终将凋零。真正的地基是视觉与表征学习,这也是他离开硅谷、和杨立昆创立AMI的原因。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
两次拒绝Ilya,分歧在视觉
2018年Ilya打电话来,谢赛宁什么都没说就把OpenAI的offer拒了,Ilya很生气,问他为什么不讨论一下,是钱不够吗。第二次是2024年7月SSI刚成立,Ilya发邮件邀他一起工作,他又拒了。这次两人主要讨论的是「怎么样给未来的人工智能给予爱的能力」,但谢赛宁最后问了一句:你对多模态、对计算机视觉、对general的感知模型怎么看?Ilya的回答是「他觉得这件事情已经解决得很不错」。谢赛宁说,SSI有自己的基于语言的路线,而这条路线至少在现在为止不是他想设计的路线。
— 谢赛宁LM终将凋零,但不是没有价值
谢赛宁对语言模型的判断是「LM终将凋零」,但他马上补了一句「LM永不会死」——老兵不死,终将凋零。他的意思是:这个东西一定会有它的价值,它是一个很好的工具,他自己天天使用LM,但它不是我们构建一个通用智能系统的基石,它不是这个世界模型大厦的地基。这个判断是他后面所有选择的前提:为什么做视觉、为什么做世界模型、为什么和杨立昆一起创业。
— 谢赛宁baseline 决定研究上限
凯明教谢赛宁一件事:你的research的上限其实取决于你baseline的好坏。如果baseline很差,你可能很容易自欺欺人,做不出来什么东西。这很反直觉,因为大家总说baseline差一点,performance gain就会多一点,更容易发paper。但凯明的想法是:把baseline做到高到不能再高,在这个基础上做出新的事情,那才是ground breaking。在弱的baseline下面做的任何提升,可能只是一篇灌水的paper。所以凯明在TPU上单枪匹马从无到有建立了一整套infrastructure,Moco、MAE、DiT都是在上面发生的。
— 谢赛宁金刚经与research taste
凯明给新入职的人送的书是《金刚经》,不是教怎么做research的。谢赛宁说这涉及到research taste的问题。金刚经里说「凡所有相皆是虚望,若见诸相非相,即见如来」,跟康德讲物自体、叔本华讲作为意志和表象的世界有相通之处:你看到的东西不是这个事情的本体,你看到的世界也不是实质。所以当你看一篇论文的时候,重要的事情是打破这个论文给你的幻想,去追问背后到底隐含着什么样的实质性的东西。research taste的来源就在于能不能抛开这些虚无的相,一直通往真理的道路去求索。
— 谢赛宁凯明的论文在deadline前一个月写完
凯明所有的论文都是在deadline前一个月做完的。当其他人还在为了deadline通宵奋战、获得巨大满足感的时候,凯明已经一个月把事情做完了,然后开始一遍一遍地polish,观察着你们去赶deadline。这意味着他提前两个月开始写。谢赛宁说这影响了他,让他有了OCD:论文不能有一行有小于60%的文字,如果一行有大半行是空的,看起来不好看,得把这一行占满或者占到六七成满,这样paper看起来才比较优雅、uniform。凯明的想法是:paper不是给你自己看,是给别人看的,所以要在乎别人的观感。
— 谢赛宁DiT被CVPR拒了,理由是novelty不够
DiT投了paper到CVPR,被拒了,理由是novelty不够——你没有大段的数学,没有大段的复杂结构,弄了一个很简单的结构,虽然得到很好结果,但reviewer不买账。谢赛宁说,到那个时刻他已经慢慢回过神来了:research paper这件事情,在这个巨大的随机过程里面,中或不中,一点都不重要。所以他们接下来又投另外一个会,什么也没改,又中了一篇oral paper。这再次证明,这完全是一个纯粹的随机过程。后来DiT在各个维度上都比UNet based system要好,但发出去之后,虽然有很多关注,却没有人真的用它干任何事。
— 谢赛宁在Blue Bottle看过Perplexity的demo
谢赛宁说,他可能是第一个或第二个看到Perplexity demo的人。Aravind从OpenAI出来,在Palo Alto的Blue Bottle咖啡店——这也是硅谷很多事情发生的地方——拿着一个电脑给他看一个浏览器,说「我们要革Google的命」。谢赛宁心里觉得,这个是什么东西,这不就是GPT套了一个壳,Why are you doing this。然后对方问要不要一起来做,他说他还是比较enjoy being at NYU,继续做research。他说自己对创业者的认知在过去几年也发生了一些变化,这件事情跟research还真的不一样,有很多相通的地方,但也有一些不同的点。
— 谢赛宁美国学术界的资源困境
谢赛宁说北美的学术界处在一个很难的境地,主要是资源不够。美国的funding system在过去几十年里都没有什么增长,虽然有很高的通胀,所有东西都变得很贵,学生的学费变得很贵,但政府的资助以及各个公司的资助项目还是维持在一个很低的水平。像NSF这样的政府机构,能给到每一个单独的PI的总共资助大概就是50万美元这个级别,五年,每年大概10万。而工业界的资助机会变得越来越少,一旦有资助机会,一般会给你10万到15万美元,但大概有100个学校的100个老师去compete这10万块钱。10万块钱可以养一个学生一年作为学费,或者买半个H100的cluster,或者买三到四张卡。
— 谢赛宁原话 · 已逐字校验
LM终将凋零 不对 LM LM永不会死 但终将凋零 就老兵不死 终将凋零
LM终将凋零。不对,LM永不会死,但终将凋零。就是老兵不死,终将凋零。
谢赛宁2:24:32
你的research的上限 其实取决于你 based on的好坏 好 就如果你的based on很差的话 你可能很容易自欺欺人 你是做不出来什么东西的
你的research的上限,其实取决于你baseline的好坏。如果你的baseline很差的话,你可能很容易自欺欺人,你是做不出来什么东西的。
谢赛宁2:33:37
凯明所有的论文都是在deadline前一个月做完的 只要在fair的时候是这样的
凯明所有的论文都是在deadline前一个月做完的,至少在FAIR的时候是这样的。
谢赛宁2:47:48
这个research paper这件事情 其实在这个巨大的随机过程里面 重或不重 一点都不重要
research paper这件事情,其实在这个巨大的随机过程里面,中或不中,一点都不重要。
谢赛宁3:06:04
数字与实体
| AMI Labs 团队规模 | 25人 | 0:00 |
| 谢赛宁博士期间发表顶会论文数 | 五六篇 | 44:26 |
| 谢赛宁博士期间实习次数 | 五次 | 52:32 |
| FAIR 租用 TPU core 数量 | 约5000张 | 2:32:35 |
| NSF 给单个 PI 的资助总额 | 约50万美元,五年,每年约10万 | 3:23:14 |
| 工业界单次资助金额 | 10万到15万美元 | 3:23:14 |
| 竞争工业界资助的教师数量 | 约100个学校的100个老师 | 3:23:14 |
术语
- research taste研究品味
- 判断什么问题重要、什么方向值得做的能力,谢赛宁认为它来自抛开表象追问实质。
- representation learning表征学习
- 把数据映射到具有良好性质的向量空间,使下游任务更容易取得好结果。
- contrastive learning对比学习
- 在表征空间里让相似物体的距离更近、不同物体的距离更远,Moco 是第一个真正做 work 的框架。
- anti-fragile反脆弱
- 塔勒布的概念:面对随机冲击时收益大于损失的系统,谢赛宁认为 research 必须是反脆弱的。
- DiTDiffusion Transformer
- 用 ViT 架构替代 UNet 做扩散模型,谢赛宁和 Bill Peebles 在 FAIR 最后一个月做出来的工作。
收听指南
关注世界模型、视觉与语言路线之争的 AI 研究者和创业者;想知道顶尖研究员怎么做选题、怎么搭 baseline 的工程师。
前两小时童年、求学、实习流水账可跳过,从 2:43 的 research taste 开始听。