多模态缺的不是架构,是视觉空间里的思维链
图像的理解、生成、人类对齐三者天然割裂,因为图像来自大自然、不包含人类对它的理解;生成模型至今还停在语言模型「一口爆」的原始形态,连 CoT 都没有。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
对比学习学的是人工设计的不变性
张祥雨在 21 年底就想明白了为什么 contrastive learning 和 MIM 都没有 scaling 特性:它们学到的不是数据赋予的不变性,而是 handcraft 的不变性。contrastive learning 极度依赖 augmentation,分子部分在学一种你人工设计的不变性,分母部分相当于一个 regular 在防止信息坍缩;MIM 学到的是遮挡不变性,而遮挡不变性只是必要条件,不是充分条件。NLP 之所以 work,是因为它真正做到了「语料越好、模型越强」的压缩学习;CV 这边你设计了几种不变性,模型就只学那几种,数据再多也没有信息增量。
— 张祥雨图像的理解、生成、对齐是割裂的
张祥雨从三个维度拆解:GPT 这类自回归模型建模了联合概率,就同时拥有了生成、理解和人类对齐——前文会改变后文的条件概率,这就是理解;语料来自人类,建模它的分布就完成了对齐。但静态图像不是自回归的:你能做出一个完美建模图像像素联合分布的生成模型,可这个联合分布有无数种建模方式,没有任何约束要求它刚好符合人类对图像的理解方式。图像是大自然的创造,它不管你人类怎么理解。所以静态图像上做再多东西,都很难形成人类意义上的智能。
— 张祥雨生成和理解放一起,摘掉一个另一个不受影响
23 年 Step1 就把所有数据组织成图文混排,图像和文字 tokenize 到同一空间,外挂一个预训练好的 diffusion 做图像生成。结果文字部分效果不错,图像理解尤其好,字写在图上问问题和 OCR 出来问问题效果几乎一样——但生成效果特别差。更打击人的是:训练到某个阶段把生成部分去掉,理解部分完全不受影响。他做了大半年,得到一个越来越强的理解模型和一个越来越强的生成模型,放在一起没有一加一大于二的效果,随便摘掉一个另一个既不变强也不变弱。生成分支的可控性依然极差,会生成肢体畸变、违反几何约束、违反物理常识的视频,而理解模型自己都能准确指出这些不符合常识。
— 张祥雨模型越大,数学推理反而先升后降
Step2 是万亿参数、激活 200 多 B 的巨无霸,训了九个多月。结果这个模型文科极强、写作极强,理科尤其是数学还不如一个更小的模型。他们从 1B 到 7B 到 30B 到 70B 做了一系列严谨测试,确认:通用对话能力、情商、知识量确实越大越强,但推理能力尤其是数学,表现为先上升、再平缓、再扩大反而下降。张祥雨说这在去年那个时间点还是业界非共识,因为很少有人真做到这么大、把增长曲线的后半段画下来。
— 张祥雨压缩率最大化和算对,是两个目标
他给了一个思想实验:数据集里 50% 是互联网语料,十几个数字相加直接给结果、没有过程;50% 是精心清洗的、一步步相加的过程数据。理论最优是模型以 50% 概率直接输出结果、50% 概率一步步算。但小模型参数量有限,拟合不了「直接出结果」这个复杂函数,只能学会右边那条一步步算的路径——这就是生成模型里的特征坍缩。大模型不一样,Step2 激活 200 多 B,真的能十几个两位数相加一口爆出答案,大概 90% 概率是对的。问题在于:如果以压缩率论英雄,大模型压缩率更高;但数学题要求的是算对,不是分布更接近预训练语料。大模型总有倾向「觉得它行了」就跳步,90% 对,10% 错,错一步整题就废。
— 张祥雨一个 token 之内做不出关键决策
为什么 RL 之前不 work?张祥雨说关键在于 critical decision:模型走到某一步,面前有左右两个分支,这件事能不能在一个 token 之内解决?他认为对很多问题不可能。比如大数乘法,Transformer 单步做点积的复杂度是 O(n),而乘法至少是 O(n²),复杂度超过单步上限就做不对。数学题还依赖巧妙构造,你在构造那一刻只能凭感觉,算完之前不知道行不行。更麻烦的是数据里同时存在两类题:走到这个点,60% 概率走左分支对;换几个数字的另一道题,40% 走左才对。模型无法同时最大化两类题的正确率,所以永远到不了 100%。解法就是允许两条分支都走——引入反思。
— 张祥雨反思 pattern 在预训练语料里本来就有
o1 激发的反思 pattern,比如 wait、recheck、verify、大循环、审题,不是无中生有。张祥雨发现这些 pattern 在预训练语料中都有分布,虽然非常少——典型的是 Stack Overflow 上高赞的答案,作者会先尝试求解,解着解着发现不对劲,写「等等,我少考虑了一个因素」,加上去发现之前的方法完全不 work,陷入 stuck,最后用另一种形式呈现结果。国内论坛则相反,喜欢用「注意到」把脚手架全部裁掉,显得自己很牛,这种语料模型看多了是灾难,因为它把真实的思考过程隐藏了。预训练里的 pattern 虽然稀疏,但由不同人和机构生成、涵盖不同领域,跟其他数据形成全连接,所以 cold start 激发出来再用 RL 强化,就能顺带把相连的广大领域都激发出来。
— 张祥雨在图上圈点批注,预训练里根本没有
为什么视觉空间做 Long CoT 效果不好?因为圈点批注这些动作全是人工合成的数据,pattern 过于固定,在预训练语料中根本不存在——谁解幂公式会真的从第一张图走一步、第二张图再走一步?而 o3 对图像的处理看起来更原始,只做 crop、resize 这类简单编辑,但泛化性很强。原因是图文混排语料里大量存在这种模式:电子维修论坛上有人传一张图问收音机哪里坏,底下就有人把局部放大,说你看这里电容 12 号、那个电阻什么故障。所以 RL 这一步并不能无中生有,所有知识和能力都已经在分布里了。
— 张祥雨长上下文不是智能,是智能的倒费
张祥雨对 long context 有不同看法。标准 Transformer 的 context 随数据同等比例增长,不做任何压缩,这跟人类记忆完全不同——人开完会只记最重要的细节,不会记住第多少分钟桌上几个水杯。人类是分层记忆:短期记忆两到四秒,中期记忆从分钟到星期不等、会遗忘、抓重点、靠反复刺激增强,长期记忆固化下来。而 Transformer 只有短期记忆,还太长了。更麻烦的是随着 context 增长,模型性能反而下降:让它连续做一百道题,越往后性能急剧下降,attention 明显涣散,因为太多相似 context 没清空,模型要花大量精力避免干扰。他说这些训练不是智能的表现,是智能的倒费。
— 张祥雨RL 的瓶颈是环境不能 scaling
张祥雨说 Rubase RL 最大的问题是环境不可 scaling:要解编程问题就得搭环境,配 Docker、输入输出、测试数据,结果只产生一条数据,效率太低。大厂现在找很多工程师一个个写 Rubase,但这跟人类不一样——人类是自驱的,自己看文章、自己搭环境、从环境反馈中学习。他举了个很小的例子:老师评价作文会说第一段不错、第二段稍微凶持、第三段衔接不行、第四段有错别字、整体略显干巴、篇幅太短,从多个维度评价;但今天的 RL 把每条评价单独加个权,这个 0.1 分、那个 0.5 分,最后说得了 7 分,完全丢失了评价维度,模型只能靠大量样本去猜打分规则。
— 张祥雨原话 · 已逐字校验
我们做这一行,很多人都说,OE,做OE,或者做思考,本质就是PAT,就是OE。
我们做这一行,很多人都说,做 o1、做思考模型,本质就是 pattern。
张祥雨53:21
你不是有一个critical,或者你不知道从左走还是右走,没关系,你自己随便选,选到底,你意识到不对,你可以反悔。
你不是遇到一个 critical decision、不知道走左还是走右吗?没关系,你自己随便选,选到底,意识到不对,你可以反悔。
张祥雨1:07:28
我还一直强调一个观点,架构不重要,架构是服务算法和系统。
我一直强调一个观点:架构不重要,架构是服务算法和系统的。
张祥雨2:06:54
数字与实体
| Step2 训练时长 | 九个多月 | 40:19 |
| 大模型直接输出多位数相加结果的正确率 | 约 90% | 47:19 |
| 数学序列中的关键决策点数量 | 四五千长度的数学序列,不超过十个 critical decision | 58:21 |
| 人类短期记忆时长 | 两到四秒 | 1:47:46 |
| 视觉信号按码率估计的 token 量 | 两到四百,约三十万个 | 1:50:46 |
术语
- next token prediction下一词预测
- GPT 的核心范式,本质是联合概率建模,等价于对数据做无损压缩。
- critical decision关键决策点
- 长思维链中真正影响最终结果的分叉点,数量很少,RL 实际要搜的就是这些。
- Meta-CoT思维链的思维链
- o1 范式的本质,让模型在多种 CoT 之间自由切换、组合,解决网状复杂问题。
- feature collapse特征坍缩
- 模型能力或训练不足时只建模分布中最简单的模式,拟合不上复杂函数。
- environment scaling环境扩展
- RL 时代的新瓶颈:搭环境产生训练数据的效率太低,无法像数据那样规模化。
- Linear Transformer线性 Transformer
- 把注意力复杂度降到线性的架构变体,张祥雨认为它不本质,因为架构服务于算法。
收听指南
做大模型预训练、多模态、后训练与 RL 的研究员和工程师;想判断多模态与自主学习时间表的创业者和投资人。
开头 12 分钟 ResNet 与 CV 学习史的个人经历,可只听结论。