AI 是浪,冲浪的人不重要:模型大厂研究员的自白
预训练没有到头,撞墙的人多半是自己有 bug;AI 本质是简单的,因为它能做实验。个人英雄主义时代已经过去,现在拼的是组织系统性和靠谱。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
现在没人担心追不上,只担心做什么
姚顺宇说,一年前在 Anthropic 大家担心的是 OpenAI 的 reasoning 做得这么强、我们有没有机会追上;现在在 Gemini、OpenAI、Anthropic 这三家当中,没有哪一家会真的担心自己追不上。更难的事情变成了想明白要去做什么——这是一个 bet,很需要人的 insight。这跟「模型能力被拉平」是两回事:从用户实际体验上三家仍有区别,但纸面上(benchmark)已经都在 80% 附近,高一点低一点主要是 noise 而不是 signal。
— 姚顺宇撞到预训练墙的人多半是自己有 bug
很多人几个月前就在讨论预训练 scaling law 是不是到头了,姚顺宇的体验是没有,未来四个月也没看到到头迹象。他给出三种「觉得到头」的可能:一是认为规律适用范围到头了,二是认为某个条件(比如数据撞墙)不能满足,三是——他的观感是绝大多数人属于这种——自己的工作里有个 bug 自己没发现。bug 可能是科学假设没做对(比如 token horizon、每个大小模型配多少数据没选清楚),也可能纯粹是代码 bug。他强调修好一个 bug 带来的进展,往往远大于一些很神奇的技巧。
— 姚顺宇Coding 爆发是因为回馈信号好定义
Coding 从 Claude 3.5(外界叫 3.6)那一代之后一直高速发展,姚顺宇给出两个模型层面的原因:一是 reward signal 很好定义,写一个 feature、某些输入得到某些输出,对不对一测就知道;二是数据有天然基础,GitHub 汇聚了几十年优质程序员的代码,从那些代码出发可以构建非常多的环境。产品层面还有第三个原因:优秀程序员写代码的风格比较类似,简洁、干净、有合理抽象,这让 Coding 产品比社交或游戏简单得多——后者每个人品位不同,得靠推荐算法。
— 姚顺宇硬蒸是不知道自己想干嘛,聪明的蒸是真 multi-agent
Dario 点名了三家公司蒸馏他。姚顺宇区分两种:硬蒸就是从 Claude 里取出一堆生成的 token 强行训练,商业上不道德、智力上也愚蠢,因为干这事的公司本质上不知道自己想干嘛,唯一能干的就是抄别人让数据好看。但蒸馏也有有趣的科学问题:如果在自己生成数据的链条里用别的模型做辅助、或用自己的模型生成答案让别的模型当评价者,就是灰色地带但技术上很有意思——不同家模型的语言分布很不一样,把它们融汇到一个训练系统里,是真正的 multi-agent,中国实验室可能因此成了做 multi-agent 训练的先驱。
— 姚顺宇机器人还没到 GPT-1 时刻
姚顺宇在亚马逊上搜过中国机器人的价格,很惊讶居然这么便宜,觉得这体现中国在硬件产业链上的优势。但软件上他没太看明白:机器人模型目前处于「给定环境、给定场景去优化」的阶段,做 RL、构建虚拟环境可以提升,但没有很强的泛化性。他把有没有泛化性看作很多 AI 方向的分水岭——十几年前就能训练很强的模型做翻译、做语义分析,但做不到水平地提升所有能力;语言在 Transformer 和 GPT 之后跨入了那个阶段,机器人还没到。他推荐大家去看机器人实验室,比语言模型实验室有趣得多。
— 姚顺宇Anthropic 能 top-down,OpenAI 干不了
姚顺宇认为 Anthropic 能实行比较 top-down 的机制是很独特的事。难点在于:做技术决策的人必须同时是公司的决策人——技术上得能服众,研究员才会信服;同时得是公司决策人,才能为这个公司负责任。Anthropic 有这个条件,技术 leader 像 Jared Kaplan 和 Sam 就是公司 cofounder,他们自己做决定,那是人家的公司。其他模型公司很难:OpenAI 就干不了,Gemini 也比较难。他补充说大公司和 startup 打法本来就不一样,startup 重要的是 make bet,得赌一件事,top-down 在组织上比 OpenAI 更有优势。
— 姚顺宇AI 本质是简单的,因为它能做实验
姚顺宇说这不是结论,是他的一个 statement,可对可错。他解释:AI 本质上简单的点在于能做实验。和物理的区别在于,物理在那个能标下没有实验数据就是理解不了那个能标下的理论;但 AI 不被这个所绑,你理解不了没关系,它也可以往前发展。他现在事实上能够做任何能想到的实验,只是需要时间把计算量提上来、把基础设施准备好,没有什么本质上的困难。所以 AI 没有给人碰壁的感觉:很多东西都能试,而且不是想空脑袋没想法可试,是想法太多得一个个试。
— 姚顺宇预训练也是一种 RL,区别在数据分布
姚顺宇说很难从纯技术角度说预训练、监督学习和 RL 的本质区别是什么,因为预训练和 SFT 本质也没啥区别——无非是把拿到的数据当成 ground truth、当成专家输出,朝那个分布上靠。强化学习更宽广:输出的东西不是给定的专家,是自己产生的,里面有好的结果也有不好的结果,好的往上靠、不好的引力它。所以预训练和 SFT 是强化学习的一个子集。但这两件事在现在这个时代确实有区别,最大区别在数据上:预训练的数据要 distribution 够好、分布够广,质量不需要非常高;后训练反过来,分布远窄,但有的那些数据质量要求非常高。
— 姚顺宇原话 · 已逐字校验
我觉得AI这个方向本质上是简单 就是没有哪 我觉得没有哪个 除了可能跳变那一下 那个idea可能是得有一些很深刻的洞见 在之后的那个过程中 很多想法其实是非常trivial !就是非常愚蠢的 就是谁都能想 谁都能干 只是你预计好 撞到这个机会去干而已
我觉得 AI 这个方向本质上是简单的。除了可能跳变那一下,那个 idea 可能需要一些很深刻的洞见,在之后的那个过程中,很多想法其实是非常 trivial、非常愚蠢的,谁都能想、谁都能干,只是你运气好撞到这个机会去干而已。
姚顺宇2:32:13
但是我觉得未来六到十二 他目前还做不到的事情是什么 是说他能不能从头到尾的 把一件AI研究的事做完 比如说他不仅能写这个code 他还能跑这个实验 跑这个实验还能看到这个结果 看到这个结果 还能分析这个结果 分析这个结果 指导他哪做的不对 然后提出新的假设 设计新的代码 跑新的实验 这条链条目前还没有完整 但我觉得这条链条 可能是下一步会慢慢变得完整的事
但是我觉得未来六到十二个月,他目前还做不到的事情是什么?是他能不能从头到尾把一件 AI 研究的事做完:不仅能写这个 code,还能跑这个实验,跑完还能看到结果,看到结果还能分析,分析完指导他哪里做得不对,然后提出新的假设、设计新的代码、跑新的实验。这条链条目前还没有完整,但我觉得这条链条可能是下一步会慢慢变得完整的事。
姚顺宇2:38:17
我觉得大家现在就是 每个人都是冲浪的人 本质上是一个浪 而不是你那个冲浪的人 浪是AI吗 对 就是AI这个事情本身是这个浪 它会往前走 不管你冲不冲这个浪 这个浪都会拍到岸上 只是说有人可能就冲了这个浪 有人就可能晚了一点 没赶上这个浪尖
我觉得大家现在每个人都是冲浪的人,本质上是一个浪,而不是你那个冲浪的人。浪是 AI 吗?对,就是 AI 这个事情本身是这个浪,它会往前走,不管你冲不冲这个浪,这个浪都会拍到岸上,只是说有人可能就冲了这个浪,有人可能晚了一点,没赶上这个浪尖。
姚顺宇3:06:42
我觉得如果一个研究员做不到对全局去考虑的话 他就不是考的研究员 在现在这个时代 就是这个和我觉得这个和你就是在学术界做research是很不一样的事 因为在学术界做research本质上是一个人吃饱全家不愁的状态 就是我为我的项目负责 对吧 我为我的可重复性负责 但是在一个公司里你其实更多的时候是我得为这个公司负责 对这是两种完全不一样的心态
我觉得如果一个研究员做不到对全局去考虑的话,他就不是好的研究员,在现在这个时代。这和你在学术界做 research 是很不一样的事:在学术界做 research 本质上是一个人吃饱全家不愁的状态,我为我的项目负责、为我的可重复性负责;但在一个公司里,你更多的时候是我得为这个公司负责,这是两种完全不一样的心态。
姚顺宇3:18:56
数字与实体
| Anthropic 员工数(姚顺宇加入时) | 七八百人 | 1:58:36 |
| Anthropic 员工数(姚顺宇离开时) | 接近 2000 人 | 2:22:05 |
| 姚顺宇所在 Anthropic 大 team 人数(入职时) | 10 人左右 | 1:58:36 |
| Claude 3.7 从开始训练到发布耗时 | 四五个月 | 2:18:04 |
| 姚顺宇估计模型生成代码占比 | 保守估计超过 90%,不保守可能 99 或 100% | 39:29 |
| 姚顺宇估计实验效率提升 | 比一年到一年半前快 20 到 50 倍 | 41:30 |
| Gemini 在聊天机器人市场份额(姚顺宇估计) | 20% 左右 | 2:52:34 |
| 姚顺宇在伯克利 postdoc 实际待的时间 | 两个星期 | 1:43:30 |
| 姚顺宇认为 AI 自己做实验的时间 | 未来六到十二个月 | 2:37:16 |
| 姚顺宇公开场合说访华因素占离职原因比例 | 40% | 2:26:07 |
术语
- scaling law缩放定律
- 描述模型性能随模型大小和数据量如何变化的经验规律。
- reward signal回馈信号
- 强化学习中用来判断模型输出好坏的信号,Coding 场景下容易定义。
- multi-agent多智能体
- 多个模型互相协作或互为评价者,不同家模型语言分布不同时更接近真正的多智能体。
- VLA视觉-语言-动作模型
- 把语言模型作为基底、再训练机器人动作的模型方向。
- context management上下文管理
- 在有限上下文窗口下选择性丢弃和取回信息,以完成更长任务。
- continual learning持续学习
- 让模型在运行中持续更新权重、不遗忘旧知识的学习方式。
收听指南
关注模型公司组织机制、预训练与后训练路线判断的 AI 从业者、投资人和创业者;想了解 Anthropic 与 Google DeepMind 内部差异的人。
1:20:59 到 1:53:47 的非厄米系统、高能物理与物理转 AI 部分,除非你对物理出身的研究员路径感兴趣。