不做强化学习的公司,下一波浪潮里可能跑不出来
语言预训练遇到瓶颈后,硅谷最核心的几百名研究者已把资源压注到 self-play RL 上,它用推理算力换训练算力,让模型自己探索出逻辑推理能力。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
预训练这条路可能已经到瓶颈
广密给出的判断是:传统意义上的 Scaling Law 有 50% 概率已经失效,另外 50% 是沿着老路继续怼十万卡还能走向 AGI,两个概率「哈佛哈佛」。他看到的证据是参数、数据、算力三个要素都卡住了——最好的模型是 6700B 总参数的 MOE,因为这是单台 Server 上 H100 能放得下的极限,还没看到向上涨三五倍到两三万亿参数的模型;数据上很多公司弄到 15 到 20T 高质量文本,但很难增加到 50 到 100 个 T;算力上 H100 单集群最大 3.2 万张,B 系列出来前不会有倍数级提升。
— 广密多模态和十万卡都不是范式级变化
广密把替代路线归为三条。第一条是多模态尤其是视觉,确定性高,但今天还没有任何证据证明从视觉模态训练里能涌现出智能或逻辑能力,Tesla FSD 换到另一个新设备上就不 work,没有泛化。第二条是十万卡机群,赌算力决定生死,但 3 万卡机群基本每两小时 Brick 一次,10 万卡机群二三十分钟就 Brick 一次,互联难度可能比 SpaceX 发重型火箭还复杂。这两条都是时间问题,但「不过本质」。真正称得上范式级别的只有强化学习 RL。
— 广密RL 是让 AI 用随机路径试错
Ilya 2018 年在 MIT 客座讲课时用一句话概括强化学习:让 AI 用随机的一个路径去尝试一个新任务,如果效果超预期就更新神经网络的权重,让 AI 记得多使用这个成功的实践,再开始下一次尝试。广密用探矿比喻解释 reward model 的关键:一个人拿藏宝图,另一个人带 5000 个特种兵和专业探测设备,只要有宝贝几乎百分百能探出来,但如果其中两三个特种兵鉴宝能力不足,就会漏掉宝贝或捡回垃圾——这就是奖励模型出错。今天业界 reward model 最核心的还是在代码和数学,因为环境和目标简单清楚、容易设定。
— 广密语言是拐杖,强化学习才是主菜
广密给了一个形象的比喻:把语言和预训练比作人类的基因组,携带着人类几千年进化的基因,那么强化学习就是人类成长的一生,从出生那天起就开始接受正面信号和负面信号。语言是今天唯一走通泛化性的,AlphaGo 只能下围棋,CV 只能做人脸识别,都没有泛化。所以语言和预训练有可能就是个拐杖、中间菜的甜点前菜,后面的强化学习才是主菜。他判断今天光靠大语言模型可能走不到 AGI,AI 可能是一个偏科语文的大学生,要就业需要新的范式引入。
— 广密RL 用推理算力换训练算力
广密指出 RL 不是一个模型,而是一整套系统,包含智能体、环境、动作和奖励模型,最重要的两个是环境和智能体。它在语言模型中的思路本质上是 inference time 去换 training time,用来解决模型向上 scale up 时暂时边际收益递减的现状。他算过一笔账:对 GPT-4 和 Claude 3.5 这种水平的模型,合成 1 个 T 的高质量推理数据大概要 6 亿美金,合成 10 个 T 可能要 60 亿美金。但 inference 对单张卡性能和集群规模要求相对低一些,不一定非得用最顶尖的卡或 3 万卡、10 万卡的集群,分布式集群也可以跑 RL 的 inference。
— 广密共识只在几百个核心研究者中
AI 范式发生转移这件事,在硅谷只有在最核心的 researcher 中间有一些共识,有可能也就几百个人,还没有完全扩散。很多人都知道 RL 很重要,但不知道怎么做,这方面人才也很稀缺,还不是传统 RL 的那批人。广密认为很多 AI 的管理层可能还没有意识到,因为最近也只有少量那么一些 paper 才开始发出来。杨立昆最近在批评强化学习 RL 说这是资源浪费,广密的回应是:爱迪生发明灯泡也浪费了大量的实验资源,但你只需要成功一次,就可以大量复制。
— 广密硅谷投机器人大脑,国内投整机
广密观察到硅谷现在都是想投一个技术人的大脑,想做 ROS 或者安卓;在国内你就投整机,OV、小米。但他提出一个悖论:是不是有可能不存在一个机器人大脑,有可能这个大脑就是 GPT 或者通用的大模型,你做一个机器人大脑可能也不适配所有硬件,A 机器的数据不能用到 B 机器上,还得端到端适配。他认为通用机器人最核心最核心还是技术的 timing,人形通用大爆发可能还得五到十年,很可能这批公司没有真正能做出来,大家都还是在一个 research lab 的阶段。
— 广密移动互联网的暗线是推荐,AI 的暗线是 RL
广密把移动互联网和今天的 AI 做对比:移动互联网的明线是全球多了四五十亿移动用户,暗线是有了用户行为数据做推荐,过去十年没有做推荐的公司都没做大。关键 feature 能力是大屏幕、摄像头、GPS,每个都诞生了非常大的公司。今天 AI 的明线还是 Scaling Law,背后核心是 Compute;暗线有可能是 Self Play 强化学习。他提出一个可能性:今天不做强化学习的公司,下一波浪潮里面都跑不出来,这就跟推荐一样。AI 的关键能力排序是 Coding、多模态、数学、Agent。
— 广密原话 · 已逐字校验
现在只能说有50%的概率 就是传统意义上的Skilling Law已经失效了 当然另外50%的概率就是说 沿着老的路还能继续走向AGI对吧 继续怼十万卡 感觉这两个概率哈佛哈佛吧
现在只能说有 50% 的概率,传统意义上的 Scaling Law 已经失效了;另外 50% 的概率是沿着老路还能继续走向 AGI,继续怼十万卡。感觉这两个概率一半一半吧。
广密3:08
就是说让AI用随机的一个路径去尝试一个新的人物 如果效果超预期那就更新神经网络的权重 让AI记得多使用这个成功的时间 然后再开始下一次的尝试
就是让 AI 用随机的一个路径去尝试一个新任务,如果效果超预期,就更新神经网络的权重,让 AI 记得多使用这个成功的实践,然后再开始下一次的尝试。
广密13:20
你可以把语言和预训训练 比作人类的一个基因组 携带着人类几千年进化的基因 那么强化学习就是人类成长的一生
你可以把语言和预训练比作人类的一个基因组,携带着人类几千年进化的基因,那么强化学习就是人类成长的一生。
广密23:31
因为R的思路 本质是用inference time 换training time 那来解决这个编辑收益递减的问题
因为 RL 的思路,本质是用 inference time 换 training time,来解决这个边际收益递减的问题。
广密34:45
也浪费了大量的实验资源 对吧 但你只需要成功一次嘛 那你就可以大量复制
也浪费了大量的实验资源,对吧,但你只需要成功一次嘛,那你就可以大量复制。
广密37:45
甚至说有没有一个可能性 今天不做强化学习的公司 下一波浪潮里面都跑不出来 这就跟推荐一样
甚至说有没有一个可能性,今天不做强化学习的公司,下一波浪潮里面都跑不出来,这就跟推荐一样。
广密1:07:02
其实每一次科技变革都是经历先硬件投入 再infra建设再应用爆发 历史上也都是先有铁路建设 再有后来的经济活动
其实每一次科技变革都是经历先硬件投入,再 infra 建设,再应用爆发,历史上也都是先有铁路建设,再有后来的经济活动。
广密1:18:11
数字与实体
| H100 单集群最大互联规模 | 3.2 万张 | 4:09 |
| 高质量文本数据量 | 15 到 20T | 4:09 |
| 3 万卡机群 Brick 频率 | 每两小时一次 | 8:15 |
| 10 万卡机群 Brick 频率 | 二三十分钟一次 | 8:15 |
| 合成 1T 高质量推理数据成本 | 约 6 亿美金 | 34:45 |
| 合成 10T 高质量推理数据成本 | 约 60 亿美金 | 34:45 |
| Character.AI 收购价 | 超过 20 亿美金 | 31:39 |
| OpenAI 年化收入 | 40 亿美金,年底可能七八十亿美金 | 1:12:06 |
术语
- Self-Play RL自博弈强化学习
- 让模型自己与自己或环境反复对弈探索,用推理算力换训练算力的新范式。
- Scaling Law缩放定律
- 模型能力随参数、数据、算力增加而可预测提升的经验规律。
- reward model奖励模型
- 在强化学习中判断 AI 动作好坏、给出正面或负面信号的模型。
- RLHF基于人类反馈的强化学习
- 用人类偏好训练奖励模型,目的是让 AI 更像人、实现人机对齐。
- MOE混合专家模型
- 由多个专家子网络组成、每次只激活部分参数的模型架构。
- DiT扩散 Transformer
- Sora 指明的视频生成路线,用 Transformer 做扩散模型。
收听指南
关注 AGI 技术路线演进的创业者、投资人和工程师,尤其是想判断预训练之后下一波机会在哪的人。
1:05:54 之后关于基础研究文化和硅谷 player 点评的部分可快进。