o1 不是转弯是进阶:快思考模型学会了慢思考
王小川认为 o1 是范式升级而非进步退两步——先有快思考,才能用强化学习让它学会慢思考,这条路摸到了从语言走向智能的雏形。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
o1 不是转弯,是范式升级
王小川不认同「进步退两步」的说法,他认为 o1 是范式升级:先得有快思考,才能用大模型的快思考让它学会慢思考,这是进阶而非转弯。他用 DIKW 模型解释:搜索在 Information 层,大模型 LLM 到了 Knowledge 层,而 o1 的慢思考让模型从 Knowledge 开始进化到有 Wisdom 的雏形,开始有智能了。原来的模型成了 o1 的组件之一,而不是强化学习只服务于大模型。
— 王小川o1 隐藏思维链是竞争策略
o1 隐藏思维过程、破解思维链会被警告封号,王小川给了两个原因:一是之前各家用大模型数据做蒸馏能迅速接近,OpenAI 是商业公司不是公益公司,一旦公开更容易被仿效逻辑、被蒸馏数据,让别人进步变快;二是说明这个技术本身的独有信息有限。所以封锁是竞争策略。他还点出 o1 两个核心关注点:坚持以语言为中心并走向 CoT,以及把思考过程和结果分成两个阶段,从而让 CoT 更好泛化。
— 王小川强化学习不告诉过程,只判对错
王小川用教小孩类比:监督学习要告诉解题过程,一二三怎么做,小孩学得快但不知其所以然;强化学习不告诉过程,只判断做得对不对,做对说对、做错说错,小孩自己进去找方法。他解释大模型为什么特别需要强化学习:大模型是把全天下最优质语言做训练、做压缩,是在原有数据分布内的智能,思考能力不会超过原始数据;而谈智能要跳出框架、走向分布外,所以必须创造环境,用环境反馈带来语言数据之外的内容。
— 王小川医疗是强化学习的好领域
王小川认为医生是蛮好的可以用强化学习提升的领域,因为医疗很多问题有答案标准:病人有什么症状、该做什么检验检查、该开什么药,都有答案。如果访问医生的 CoT 再验证答案对不对,模型功力可能大涨。医生不是光看医学院的书就会了,临床中一辈子可能看几万个病人,靠与病人互动得到提升,而且很多数据被记录下来。他还提到百川早前用唐诗宋词做实验,因为词牌字数、平仄、韵律、对仗都有规则,可以用程序做 reward model 校验。
— 王小川之前做强化学习没有 CoT
王小川承认百川之前的 reward model 不带 CoT,今天看到 o1 后要复现更强的 CoT。有 CoT 有两个意义:一是做医疗时能更早让医生给出思考路径,更快提升能力,而不只是端到端;二是泛化能力会大幅提升,思路对答案就对。他还讲了一个观察:强化学习一部分从环境学新东西,一部分会激活原有能力。他们教模型字数、平仄、韵律,结果模型自己把没教的对仗也输出了,说明潜藏的记忆和能力可以被激活出来。
— 王小川复现 o1 可能比复现 GPT-4 快
王小川认为复现 o1 会比当年复现 GPT-4 快一些,难归难,但国内和美国有大量开源项目,大厂和创业公司进入,资本充裕度和人才集中度已比 GPT-3.5、GPT-4 发布后多很多。他预计一两个月内就会出现接近 o1 的模型,达到市场高度还需花力气。他估计 GPT-4 可能用了 18 个月,o1 也许 9 个月,起步有一样子可能一两个月就有。他还说 o1 像当年 GPT-3 的发布,但因为在 GPT-4 基础上跑通新范式,重要性不亚于 GPT-3。
— 王小川未来代码会扮演更重要的角色
王小川预言未来代码会扮演更重要的角色:以前代码是帮助提升逻辑能力、辅助程序员写代码,未来代码会变成大模型下一步的核心能力,大模型通过写代码解决更多问题,甚至解决自身的思考过程。他认为从强化学习还会走向写代码解决问题的新范式,未来几年会实现。他还提到 o1 的可见上限:可能未来两三年内范式会跑出接口,剩下代码扮演更重要角色,继续自己写代码、用代码运行生成神经网络,甚至把神经网络和模型融合到一块,新的范式会产生。
— 王小川做水涨船高的应用,不做沿途下蛋
王小川把应用分成两类:沿途下蛋是模型再好我就下个新蛋,先做广告模型、再做客服模型,蛋越多压力越大;水涨船高是模型越大这个领域做得越好,而不是模型大的阶段跟领域没关系。他找的是终极形态的应用场景——假设模型能力特别强以后什么场景更受益,同时模型能力一般时也能进入,门槛没那么高,但模型越大越受益。他今年开始大胆提医疗,明年是双轮驱动模式,希望得到市场检验。
— 王小川创业公司要走出大厂射程
谈到六小龙,王小川说至少活一家,并说自己是保护也是攻击,在也有共识的里面自己会发展非常快。他认为一定有比大厂更高的、他们看不到的东西,或他们组织能力做不到,才会有创业公司生存的机会,叫做走出大厂的射程,在射程内你是没什么好活的。他还重新定义百川:是一线的、想得清楚的大模型公司,唯一一个。被问最艰难时刻,他说是一开始搭团队,团队有了之后就会好。
— 王小川原话 · 已逐字校验
那也说明这个技术本身 它的这个独有信息也有限的 所以它封锁这个事情 是一个竞争策略
那也说明这个技术本身,它的这个独有信息也有限的,所以它封锁这个事情,是一个竞争策略。
王小川9:04
医生写是因为他 不是光看医学院的书 读完了就会了 他在临床中间 大概一辈子可能看几万个病人 要得到自己的提升 所以医生是靠病人的这个 这个互动当中去得到自己的提升的
医生写是因为他不是光看医学院的书、读完了就会了,他在临床中间大概一辈子可能看几万个病人,要得到自己的提升,所以医生是靠病人的这个互动当中去得到自己的提升的。
王小川18:09
就是模型越大 那我这个领域能做得更好 而不是模型大的一个阶段 就跟我领域没关系了
就是模型越大,那我这个领域能做得更好,而不是模型大的一个阶段,就跟我领域没关系了。
王小川28:35
数字与实体
| 复现 GPT-4 预计用时 | 18 个月 | 23:15 |
| 复现 o1 预计用时 | 9 个月 | 23:15 |
| 接近 o1 的模型出现时间 | 一两个月 | 23:15 |
| 中国词牌数量 | 100 多首 | 19:10 |
| 医生一辈子看病人数 | 几万个 | 18:09 |
术语
- CoT思维链
- 让模型分步写出推理过程,而非直接给答案。
- reward model奖励模型
- 强化学习中判断输出对错、给出训练信号的评价系统。
- DIKW数据-信息-知识-智慧模型
- 从 Data 到 Information 到 Knowledge 到 Wisdom 的四层递进框架。
- Self Play RL自我博弈强化学习
- 模型自己与自己对抗生成训练数据,减少人工标注。
- scaling law缩放定律
- 模型能力随算力、数据、参数规模增长的经验规律。
收听指南
关注大模型技术路线与创业策略的创业者、投资人和工程师,尤其想理解 o1 强化学习原理与医疗落地路径的人。
开头 0:00-1:00 的节目介绍和 Sam Altman 宫斗铺垫可快进。