AI 的下一个突破:在工作中学习,而非仅靠训练
实验室押注 RLVR 能泛化出通用智能,但真正的瓶颈是样本效率与持续学习。OPSD 与「做梦」或成关键,让 AI 从部署中学习,而非只靠预训练。
核心论点 · 时间戳为按文稿位置估算
实验室的豪赌
实验室正押注:若在数千个多样化 RL 环境中训练 AI 完成数百万个可验证任务,就能构建 AGI。这种训练会催生通用问题解决能力,如面对错误与模糊时数周推进开放式任务。乐观者认为,数据低效与缺乏持续学习等缺陷可被规模化训练碾压,正如 NLP 中的「根本性」问题被算力洪流淹没。模型训练样本效率虽仅为人类的百万分之一,但训练成本是一次性的,分摊到数十亿用户会话中。关键在于会话内模型的智能、通用性与样本效率,而这正随 RL 训练提升。
— Dwarkesh Patel可磨性比可验证性更重要
计算机使用进展缓慢,原因不仅是可验证性,更在于「可磨性」——能否在确定性、可重放的模拟器上并行运行大量 rollout。编码可以创建仓库环境让千个代理并行尝试,但计算机使用无法让千个代理同时测试 Amazon 结账流程,因为会被检测封禁。克隆 Slack、Gmail 等应用虽可行,但劳动密集且不可扩展。这揭示:除非能为领域构建可重放的训练目标,否则模型难以进步。而许多 AGI 所需技能,如经商、打官司、炒股,无法在数据中心内重放,验证需数月或数年真实世界行动,且无法并行扰动。
— Dwarkesh PatelRLVR 能否泛化?
实验室赌 RLVR 能泛化到所有领域:在足够多容器化、可重现环境中训练,会得到能制定计划、快速学习、获取新技能的通用代理。若将无限 RLVR 的 AI 投入 1948 年德州政治,它可能比 LBJ 更懂如何赢得参议院席位;若给 2002 年的它一亿美元,它能造出 SpaceX。但这是开放经验问题。Dario 在播客中提到,短上下文训练未必能泛化到长上下文性能,暗示 RLVR 泛化并非无限强。若无法从短到长泛化,又如何从大量白领任务训练泛化到现实世界白手起家?
— Dwarkesh Patel将学习写回权重
持续学习需要回到权重,AI 不能仅靠不断增长的 KV 缓存学习,这不具扩展性,也非人类学习方式。人类学习涉及压缩,这有助于泛化与顿悟。但一旦进入权重,就得放弃上下文学习的样本效率,因为梯度更新极其样本低效。已成功上线的在线学习模型,如 Cursor Tab,每天需 4 亿+ 请求预测同一目标。但持续学习的意义在于世界复杂,每个工作、公司、问题都不同,需要学习特定部署相关信息,这无法塞进共享训练。样本效率与持续学习是深层关联问题:工作中可用数据少,需样本效率,而上下文学习的「快速权重」内存扩展性差,需架构创新。
— Dwarkesh Patel做梦:第四轴扩展
「做梦」是更投机的方法:若 AI 能构建现实模拟器来排练新技能、尝试替代策略,就能在相同墙钟时间内体验数量级更多的模拟样本。EfficientZero 在 2 小时内能击败新手人类,因其在脑中玩数十个模拟游戏。未来 LLM 或能消费更少真实数据,同时在自己构建的环境中无尽练习。但构建整个世界模拟远比围棋难,因此更投机。若成功,它将成为继预训练、RL、推理时计算之后的第四扩展轴。模型花费算力编写 RL 环境,排练生产中将用到的技能,而非仅压缩上下文。
— Dwarkesh Patel2027 年的持续学习
到 2027 年底,RLVR 训练已产生能在陌生问题中定位、尝试策略、迭代的代理。有效上下文可能扩展至一周,AI 可与你协作一周,周末你给赞或踩。若点赞,基础模型通过 OPSD、做梦或其他技术蒸馏会话所学。AI 能改进相邻领域,并逐步扩展能力范围。AI 改进的主要方式不再是发布前的训练,而是广泛部署中积累的经验。每次交互,AI 都会更聪明,不仅因你的历史会话,还因全球所有用户的交互。这既可怕又令人兴奋,与当前 AI 改进方式截然不同。
— Dwarkesh Patel原话 · 已逐字校验
if we train AIs to accomplish millions of verifiable tasks across thousands of diverse RL environments, then we’ll basically have built AGI.
如果我们训练 AI 在数千个多样化 RL 环境中完成数百万个可验证任务,那么我们基本上就构建了 AGI。
Dwarkesh Patel0:00
it is not enough for a domain to be verifiable. It also has to be very grindable
一个领域仅可验证是不够的,还必须非常可磨。
Dwarkesh Patel2:12
There’s the context length you train at and there’s a context length that you serve at. If you train at a small context length and then try to serve at a long context length, maybe you get these degradations.
训练时的上下文长度与服务时的上下文长度不同。如果在小上下文长度训练,然后尝试在大上下文长度服务,可能会出现性能下降。
Dwarkesh Patel5:41
We don’t have some separation between parameters and activations. And there’s not some lump of these fast-weight representations that juts out further and further from our skull as we learn more things throughout our lifetime.
我们并不区分参数和激活。随着一生学习更多东西,也没有某种快速权重表征从我们颅骨中不断突出。
Dwarkesh Patel8:09
If the AI can build a good simulation of reality against which to rehearse new skills, or try alternative strategies and reinforce what works, then it could experience orders of magnitude more simulated samples in the same wall clock time.
如果 AI 能构建一个良好的现实模拟,用来排练新技能或尝试替代策略并强化有效方法,那么它就能在相同墙钟时间内体验数量级更多的模拟样本。
Dwarkesh Patel13:16
Every time you interact with AI, it’ll be smarter. Not only because it has been learning from all your previous sessions, but also from all its interactions with all the other users in the world.
每次你与 AI 交互,它都会更聪明。不仅因为它从你之前的会话中学习,还因为它从世界上所有其他用户的交互中学习。
Dwarkesh Patel15:00
数字与实体
| 模型训练样本效率与人类对比 | 百万分之一 | 0:00 |
| 实验室推理算力占比 | 30-50% | 8:09 |
| Llama 3 70B 训练时每 token 存储位数 | 0.075 位 | 16:54 |
| 上下文学习与预训练信息存储差异 | 3500 万倍 | 16:54 |
术语
- RLVR强化学习与可验证奖励
- 一种训练方法,通过可验证的奖励信号进行强化学习。
- OPSD在线策略自蒸馏
- 一种技术,让基础模型模仿长会话后模型的预测,以蒸馏学习。
- Dreaming做梦
- AI 构建模拟环境进行自我训练,以增加样本效率。
- KV cache键值缓存
- Transformer 中存储上下文信息的缓存,随 token 增长。
- Sample efficiency样本效率
- 模型从少量数据中学习的能力。
收听指南
AI 研究者、技术决策者、关注 AI 未来的创业者与投资人,尤其对训练范式与持续学习感兴趣的人。
赞助商部分(16:54-17:56)可跳过。