世界太吵,来原声听播客

张小珺·商业访谈录

具身数据没scale up,GPT-1时刻就还没到

蚂蚁灵波沈宇军判断,具身智能还没到GPT-1时刻,卡点是数据没有scale up:互联网数据比真机数据大两个数量级,理想预训练需百万小时起步。为此团队完全重做视觉预训练,坚持从传感器出发。

具身智能机器人大脑预训练数据蚂蚁灵波创业
这集少见地讲透了具身原生模型的技术取舍和真实数据瓶颈,还诚实交代了MOE和单向建模的训练代价,适合想判断具身智能何时到临界点的人。

核心论点 · 点时间戳可跳到原声

5:19

放弃GAN:计算量利用效率太少

沈宇军从2017年开始做生成模型,团队一直坚持做GAN的scaling。哪怕在Diffusion火之后,今年年初还做了最后一次尝试。虽然比前几年进步,但GAN最大问题是计算量利用效率太少:Diffusion可以迭代多次生成一张图,而GAN在生成复杂内容(尤其是视频)时力不从心。他们把GAN积累的技术开源后画上句号,但认为对抗训练中同时训两个模型、互相博弈的技术沉淀不会没用。

— 沈宇军
23:05

数字世界模型不适配物理世界

第一代模型依赖数字世界模型做预训练,但发现数字世界的开发动机与物理世界需求不匹配:视频生成追求画质,机器人动作并不需要高画质。数字世界有自己的迭代节奏,没法反向推动他们改模型,于是在26年决定全部基于物理世界需求重做,视觉相关的理解与生成从头训练,只有语言模型继续复用LLM。另一个主张是坚持从真实传感器出发,因为真实传感器噪声大,与学术界干净数据集天然相悖。

— 沈宇军
42:03

深度估计改从几何学起

第一代深度模型用的是DINO v2(数字世界语义模型),语义理解对于物理世界不够——知道有只狗,还需要知道距离。这次他们放弃DINO,完全从几何角度(点线面、边缘)重新做预训练,再迭代出新的深度估计模型。例子:反光水龙头能看到水流位置;玻璃门后的猫在新深度模型里完全看不到,因为猫被玻璃挡住,需要拉开门才逐渐出现。语义理解里猫一直在,但空间感知里必须先撞到门。这解释了为什么数字世界的语义预训练不能直接迁移到物理世界。

— 沈宇军
51:27

物理世界原生:单向建模与MOE

数字世界生成视频可以等30秒,双向attention可以用;但机器人执行必须实时,历史不能看到未来,所以模型必须单向建模。他们为此花了三四个月从零训练单向attention——把双向模型强行改成单向会导致预训练知识遗忘,只能放弃。另一个技术点是原生MOE:要让每个专家被等概率激活,稀疏得均匀才算真稀疏,光把MOE训明白就花两个月、失败几十次。物理世界可以舍弃画质,这给了效率优化空间。

— 沈宇军
1:07:31

GPT-1时刻未到,卡在数据

沈宇军判断具身智能今天还没到GPT-1时刻,因为还没有出现好的数据scale up方式。他们这次用了6万小时真机数据,但没有数量级提升,远远不够。具身原生的预训练仍依赖大量互联网数据,互联网数据比真机数据大两个数量级。架构上已经原生,数据上还没原生。当具身数据本身能scale up、至少跟互联网达到相同量级时,才是他心目中的GPT-1时刻。

— 沈宇军
1:23:10

为什么只做大脑不做本体

今年很多公司转向只做大脑,沈宇军认为有两层原因:一是单一本体很难通用,如果不通用就要选准场景来专用设计,否则成本必高;二是当前主要矛盾是大脑落后于本体,干活还不够好。大脑和本体一定是交替上升的,现在大脑落后,随着做大脑的人变多,智能层跑得更快,某天会超过本体,届时会催生一批由智能重新定义的本体公司。上一代硬件不一定能适应下一代模型。

— 沈宇军
1:31:51

创业是赌出来的

第一次创业给沈宇军的两个教训:落地层面,以前关注技术领先性,现在关注技术在哪方面领先——要选有价值的领先;创业层面,没人知道哪条路一定成功,资源有限的情况下必须敢赌。如果大家都知道哪条路成功,大厂一定成功,轮不到自己。他承认三大赌:传感器、原生模型、不做本体。原生是豪赌,可能训到一半不收敛,也可能思路错、太早进入或资源不够,但这是必经之路。

— 沈宇军
1:40:31

格局:两三家创业公司加一两个大厂

机器人大脑的竞争格局会和大模型类似:大厂里出一两个玩家,创业公司里出两三个,各自跑出包括数据、本体、场景在内的生态。因为有了生态,场景加本体带来数据,模型会逐渐分化适合那个生态。进家庭之前每家模型会有不同特性,比如有的擅长精巧任务、有的擅长长程任务,最终会走向通用生态。

— 沈宇军

原话 · 已逐字校验

你能看到,但你摸不到,嗯,能看到是语义理解,摸不到是空间感知。

你能看到,但你摸不到,能看到是语义理解,摸不到是空间感知。

沈宇军45:07

我我说就是MOE训把MOE训好是一个能力问题,他不是一个态度问题。

把MOE训好是一个能力问题,不是一个态度问题。

沈宇军55:55

巨深一定会有自己的模型,嗯,就是他为巨深设计的模型。

具身一定会有自己的模型,就是为具身设计的模型。

沈宇军1:15:55

最好的预期就是我真的看到机器人进家庭了,然后进家庭的机器人跑的是凌波的模型,这是我最好的预期。

最好的预期就是我真的看到机器人进家庭了,然后进家庭的机器人跑的是灵波的模型,这是我最好的预期。

沈宇军1:37:19

但至少在数据这方面,我觉得中国一定是比美国跑的快的。

但至少在数据这方面,我觉得中国一定是比美国跑得快的。

沈宇军1:50:45

数字与实体

第二代预训练数据量6万小时33:29
第一代预训练数据量(清洗后实际保留)约1万多小时(原2万小时经清洗)34:00
真机数据成本过去两年降幅至少3倍35:36
后训练所需数据量从约100条降至约20条1:06:31
互联网数据量相对真机数据量大两个数量级1:08:35
理想预训练数据量百万小时起步1:22:04
桌球任务后训练采集数据量约20条1:11:40
把MOE训明白耗时约2个月54:46
从零训练单向attention耗时约三四个月56:56
Generalist公开数据量几十万小时(可能已近百万)1:12:44

术语

Ego第一人称视角数据
人戴头部相机以自己视角采集操作视频,用于机器人数据规模化。
WAM世界动作模型
从视频学习世界如何响应动作,可作为机器人的世界模拟器或执行器。
VLA视觉-语言-动作模型
输入视觉与语言指令、输出动作的主流机器人操作路线。
MOE混合专家模型
稀疏激活架构,每次推理只激活部分参数,降低算力需求。

收听指南

谁该听

具身智能创业者、机器人算法工程师、关注物理世界AI的投资人,尤其是纠结做大脑还是做本体的团队。

可跳过

开场16分钟的个人学术经历可快进,从蚂蚁灵波缘起后进入正题。