具身数据没scale up,GPT-1时刻就还没到
蚂蚁灵波沈宇军判断,具身智能还没到GPT-1时刻,卡点是数据没有scale up:互联网数据比真机数据大两个数量级,理想预训练需百万小时起步。为此团队完全重做视觉预训练,坚持从传感器出发。
核心论点 · 点时间戳可跳到原声
放弃GAN:计算量利用效率太少
沈宇军从2017年开始做生成模型,团队一直坚持做GAN的scaling。哪怕在Diffusion火之后,今年年初还做了最后一次尝试。虽然比前几年进步,但GAN最大问题是计算量利用效率太少:Diffusion可以迭代多次生成一张图,而GAN在生成复杂内容(尤其是视频)时力不从心。他们把GAN积累的技术开源后画上句号,但认为对抗训练中同时训两个模型、互相博弈的技术沉淀不会没用。
— 沈宇军数字世界模型不适配物理世界
第一代模型依赖数字世界模型做预训练,但发现数字世界的开发动机与物理世界需求不匹配:视频生成追求画质,机器人动作并不需要高画质。数字世界有自己的迭代节奏,没法反向推动他们改模型,于是在26年决定全部基于物理世界需求重做,视觉相关的理解与生成从头训练,只有语言模型继续复用LLM。另一个主张是坚持从真实传感器出发,因为真实传感器噪声大,与学术界干净数据集天然相悖。
— 沈宇军深度估计改从几何学起
第一代深度模型用的是DINO v2(数字世界语义模型),语义理解对于物理世界不够——知道有只狗,还需要知道距离。这次他们放弃DINO,完全从几何角度(点线面、边缘)重新做预训练,再迭代出新的深度估计模型。例子:反光水龙头能看到水流位置;玻璃门后的猫在新深度模型里完全看不到,因为猫被玻璃挡住,需要拉开门才逐渐出现。语义理解里猫一直在,但空间感知里必须先撞到门。这解释了为什么数字世界的语义预训练不能直接迁移到物理世界。
— 沈宇军物理世界原生:单向建模与MOE
数字世界生成视频可以等30秒,双向attention可以用;但机器人执行必须实时,历史不能看到未来,所以模型必须单向建模。他们为此花了三四个月从零训练单向attention——把双向模型强行改成单向会导致预训练知识遗忘,只能放弃。另一个技术点是原生MOE:要让每个专家被等概率激活,稀疏得均匀才算真稀疏,光把MOE训明白就花两个月、失败几十次。物理世界可以舍弃画质,这给了效率优化空间。
— 沈宇军GPT-1时刻未到,卡在数据
沈宇军判断具身智能今天还没到GPT-1时刻,因为还没有出现好的数据scale up方式。他们这次用了6万小时真机数据,但没有数量级提升,远远不够。具身原生的预训练仍依赖大量互联网数据,互联网数据比真机数据大两个数量级。架构上已经原生,数据上还没原生。当具身数据本身能scale up、至少跟互联网达到相同量级时,才是他心目中的GPT-1时刻。
— 沈宇军为什么只做大脑不做本体
今年很多公司转向只做大脑,沈宇军认为有两层原因:一是单一本体很难通用,如果不通用就要选准场景来专用设计,否则成本必高;二是当前主要矛盾是大脑落后于本体,干活还不够好。大脑和本体一定是交替上升的,现在大脑落后,随着做大脑的人变多,智能层跑得更快,某天会超过本体,届时会催生一批由智能重新定义的本体公司。上一代硬件不一定能适应下一代模型。
— 沈宇军创业是赌出来的
第一次创业给沈宇军的两个教训:落地层面,以前关注技术领先性,现在关注技术在哪方面领先——要选有价值的领先;创业层面,没人知道哪条路一定成功,资源有限的情况下必须敢赌。如果大家都知道哪条路成功,大厂一定成功,轮不到自己。他承认三大赌:传感器、原生模型、不做本体。原生是豪赌,可能训到一半不收敛,也可能思路错、太早进入或资源不够,但这是必经之路。
— 沈宇军格局:两三家创业公司加一两个大厂
机器人大脑的竞争格局会和大模型类似:大厂里出一两个玩家,创业公司里出两三个,各自跑出包括数据、本体、场景在内的生态。因为有了生态,场景加本体带来数据,模型会逐渐分化适合那个生态。进家庭之前每家模型会有不同特性,比如有的擅长精巧任务、有的擅长长程任务,最终会走向通用生态。
— 沈宇军原话 · 已逐字校验
你能看到,但你摸不到,嗯,能看到是语义理解,摸不到是空间感知。
你能看到,但你摸不到,能看到是语义理解,摸不到是空间感知。
沈宇军45:07
我我说就是MOE训把MOE训好是一个能力问题,他不是一个态度问题。
把MOE训好是一个能力问题,不是一个态度问题。
沈宇军55:55
巨深一定会有自己的模型,嗯,就是他为巨深设计的模型。
具身一定会有自己的模型,就是为具身设计的模型。
沈宇军1:15:55
最好的预期就是我真的看到机器人进家庭了,然后进家庭的机器人跑的是凌波的模型,这是我最好的预期。
最好的预期就是我真的看到机器人进家庭了,然后进家庭的机器人跑的是灵波的模型,这是我最好的预期。
沈宇军1:37:19
但至少在数据这方面,我觉得中国一定是比美国跑的快的。
但至少在数据这方面,我觉得中国一定是比美国跑得快的。
沈宇军1:50:45
数字与实体
| 第二代预训练数据量 | 6万小时 | 33:29 |
| 第一代预训练数据量(清洗后实际保留) | 约1万多小时(原2万小时经清洗) | 34:00 |
| 真机数据成本过去两年降幅 | 至少3倍 | 35:36 |
| 后训练所需数据量 | 从约100条降至约20条 | 1:06:31 |
| 互联网数据量相对真机数据量 | 大两个数量级 | 1:08:35 |
| 理想预训练数据量 | 百万小时起步 | 1:22:04 |
| 桌球任务后训练采集数据量 | 约20条 | 1:11:40 |
| 把MOE训明白耗时 | 约2个月 | 54:46 |
| 从零训练单向attention耗时 | 约三四个月 | 56:56 |
| Generalist公开数据量 | 几十万小时(可能已近百万) | 1:12:44 |
术语
- Ego第一人称视角数据
- 人戴头部相机以自己视角采集操作视频,用于机器人数据规模化。
- WAM世界动作模型
- 从视频学习世界如何响应动作,可作为机器人的世界模拟器或执行器。
- VLA视觉-语言-动作模型
- 输入视觉与语言指令、输出动作的主流机器人操作路线。
- MOE混合专家模型
- 稀疏激活架构,每次推理只激活部分参数,降低算力需求。
收听指南
具身智能创业者、机器人算法工程师、关注物理世界AI的投资人,尤其是纠结做大脑还是做本体的团队。
开场16分钟的个人学术经历可快进,从蚂蚁灵波缘起后进入正题。