世界太吵,来原声听播客

张小珺·商业访谈录

o1 不是路线转弯,是 AGI 梯子又多了几节

预训练这座金矿快挖到头了,强化学习是第二座矿。o1 的 preview 更像 GPT-3 时刻,能不能成为 ChatGPT 时刻要看正式版。

强化学习o1后训练AGIOpenAI
前 OpenAI 研究员讲清了 o1 背后的强化学习三要素、reward model 为什么难、以及 OpenAI 当年闭着眼睛挖矿的组织方式。

核心论点 · 点时间戳可跳到原声

7:20

预训练金矿快挖完了

吴翼把 AGI 比作挖矿搭梯子:预训练是第一个大金矿,挖了这么多年,能挖的越来越少。post-training 是第二个大金矿,可以在上面做强化学习、做探索、做搜索、产生合成数据,而且很可能反过来反哺预训练。所以 o1 不是路线转弯,是「阶段一过去了,纯预训练的阶段过去了」,进入以强化学习为基础的后训练阶段,让迈向 AGI 的梯子再往上多了几节。

— 吴翼
9:00

o1 的 preview 更像 GPT-3 时刻

吴翼认为很难直接类比,但倾向于认为 preview 版本可能是 GPT-3 时刻,ChatGPT 时刻要等正式版。理由是:ChatGPT 和 GPT-3 在基础能力上没有本质差别,只是 RLHF 和指令遵从做得更好,让模型变得可用、产品化,所以一下子火了。而 o1 在能力上已经往上走了一档,但它能不能在产品上让原来觉得不好用的人觉得好用,这件事还不知道。

— 吴翼
15:06

强化学习三要素每一块都很难

吴翼把强化学习拆成三部分:reward model、搜索和探索、prompt。他用教初中生搞竞赛打比方:老师给反馈是 reward model,出什么难度的题是 prompt,学生能不能举一反三、自己再想怎么做对是探索。三件事都重要,而且必须同时做对才能实现能力提升。只有一个好的奖励模型,也不能保证模型能力提升,这是强化学习门槛高的原因。

— 吴翼
19:36

PPO 只有在算力足够时才有用

DQN 学的是价值网络,通过它反推 Agent,优化不直接,有 Gap,但数学性质好、对算力和数据要求小。PPO 直接训练策略网络,让策略自己探索、自己进化,更符合直觉,但数学性质差一些,需要足够多的探索,所以「PPO 当且仅当你有足够多的算力的时候才会有用」。算力不够时跑 PPO 没有任何效果,这也是学术界更常用 DQN、DPO 这类 Offline RL 算法的原因。

— 吴翼
33:24

reward model 不可能闭着眼睛单独训练

吴翼用理论计算机科学的 P 和 NP 类比:reward model 是 NP 类问题,判断一个答案好不好,确实比写出答案简单,但没有简单太多。而且很多问题可能没有 universal reward model,因为人的偏好没有共识。他的建议是:reward model 不太可能有一个单独的小组闭着眼睛训练,它一定是耦合的——模型推理能力进步产生更高质量数据,带来更好的 reward model,更好的 reward model 再促进模型提升。

— 吴翼
40:31

幻觉来自模型只懂相关性不懂因果

吴翼认为幻觉有两个原因。第一,模型不知道因果性,只知道相关性,所以不知道自己到底知不知道答案,问世界杯冠军就说是巴西。预训练和 SFT 没有反事实推理过程,容易 overfit 到相关性上。第二,很多推理问题有非常多中间步骤,传统 AI 范式要求一下子输出正确答案,不允许改。而 o1 给了模型 10 秒、20 秒的缓冲,允许它探索、允许它改,这本身就能极大提升推理表现。

— 吴翼
49:49

o1 不代表垂直模型会崛起

吴翼坚信会出现全能的大统一模型。理由是:模型参数量非常大时,很多垂类模型在高维空间里很容易正交,正交的参数很容易合并。但他强调前提是垂类方法和预训练范式耦合——Alpha Geometry 那种定制化的数学方法不可能反哺大模型基础能力,而 OpenAI 如果是在通用方法上做专用领域训练,更好的垂类模型一定代表更好的综合模型。他预计 2 到 4 年后 RL 范式会变得常见,但 2 年尺度内不会出现特别多垂类模型。

— 吴翼
1:03:20

OpenAI 当年的 KPI 是博客关注量

吴翼描述 OpenAI 早期是一种「产品驱动又没有产品」的奇葩组织:每个组的 KPI 是做一个大新闻,大新闻就是发博客。多智能体团队做 hide and seek 做了一年多,发了一篇博客,那个博客可能价值几千万美金。他认为这种模式适应了 Scaling Law 这条路——赌信 Scaling Law,项目不可能由一两个优秀研究员带一两个人做出来,需要很强的工程投入,论文周期太短没法考核。这个模式其实也不是 OpenAI 发明的,DeepMind 搞 AlphaGo 时就这么搞。

— 吴翼

原话 · 已逐字校验

reward model这个东西不太有可能说有一个单独的小组,我不管这个模型的本身的能力,我闭着眼睛去训练一个reward model,这件事情恐怕是不太可能的。

reward model 不太可能有一个单独的小组,不管模型本身的能力,闭着眼睛去训练一个 reward model,这件事恐怕不太可能。

吴翼36:28

传统的AI的这样思维链也好,还是这样输出的模式也好,它是不允许你改的,这个其实也是幻觉的一个原因,很多时候可能这个模型可以改对,但你根本没有给它改的机会。

传统 AI 的思维链也好、输出模式也好,它不允许你改,这其实也是幻觉的一个原因,很多时候模型本来可以改对,但你根本没给它改的机会。

吴翼43:33

数字与实体

o1 推理链长度几千个 token5:04
o1 推理时间约 10 秒5:04
吴翼在 OpenAI 时间2019 年 2 月到 2020 年 7 月底2:00
OpenAI 人数拐点2021 年以前 100 人以下1:00:45
吴翼团队做算法人数五六个人54:41

术语

PPO近端策略优化
OpenAI 2017 年提出的强化学习算法,直接训练策略网络,需要足够算力才有效。
DQN深度 Q 网络
DeepMind 2014 年提出的算法,训练价值网络再反推 Agent,对算力要求小。
RLHF基于人类反馈的强化学习
用人类反馈训练奖励模型,再对齐大模型行为的方法。
self-play自我博弈
让模型和自己对弈来提升,适用于有对称结构的问题如围棋。
Scaling Law规模定律
算力、数据、参数规模增大带来模型能力提升的规律。

收听指南

谁该听

关注大模型技术路线、强化学习和 AI 创业机会的工程师、投资人与创业者,尤其适合想理解 o1 背后机制而非只看跑分的人。

可跳过

开头 3 分钟嘉宾自我介绍和 offer 二选一的闲聊可跳过。