世界太吵,来原声听播客

张小珺·商业访谈录

机器人最大的瓶颈不是算法,是数据

谭捷在 Google DeepMind 做了十年机器人,他的判断是:机器人基座模型至今还不是独立学科,只是多模态大模型的微调;真正的瓶颈是数据,而摇操采数据不是终局。

机器人具身智能世界模型数据Google DeepMind
信息密度高,中后段关于数据金字塔、motion transfer、世界模型定义和硅谷 996 的部分最值钱。前 20 分钟嘉宾小传可快进。

核心论点 · 点时间戳可跳到原声

13:06

机器人基座模型还不是独立学科

国内有观点认为聚生智能基座模型不该被视作大模型的延伸,而是一个独立方向。谭捷的回应很直接:so far not yet。他的理由是,现在绝大多数做 VLA、做机器人大模型的,本质上还是在多模态大模型上做 finetuning——多模态模型能输入图像和语言,输出文本,但缺 robot action 的输出,所以大家做的事就是补全这个输出能力。他认为只有当碰到各种瓶颈、需要不一样的 data format、需要更完善的 world model 时,它才可能变成更独立的学科,但至今没有质的改变。

— 谭捷
23:44

语言模型撞数据墙,机器人是没有数据

谭捷把机器人最大的问题定为数据。语言模型的数据是 free 的,网上已有海量语言数据,wikipedia、书本都可以 digitalize,而且语言相对 robotics 是一个 narrow domain。但 robotics 是在非常复杂的 unstructured environment 里,可以发生任何事情,需要极大量、非常 diverse 的数据,而这个数据现在不存在。他确信现在的数据量完全没有办法 saturate 模型的能力,所以第二个瓶颈——比如模型 architecture——还没被发现。他描述了一个数据金字塔:最底层是互联网数据,往上是 egocentric video,再往上是 simulation 数据,最顶端是 robot specific 数据;预训练需要大量低质数据学物理直觉,后训练才需要少量高质量数据。

— 谭捷
29:21

跨本体迁移解决的是数据量不够

Gemini Robotics 1.5 的第二个突破是 cross embodiment transfer。谭捷说机器人数据稀缺,机器人 A 采的数据只能学 A 上的 task,A 升级换了 camera 位置或多一个自由度,之前采的就都没用了;不同构型的机器人数据也不能互用。他们测了三个机器人——简单的双臂 Aloha、更工业级的 Biarm Franca、Optimus 人形——把数据放在一起,又开发了 motion transfer 技术,使得在机器人 A 上见过的任务机器人 B 也能执行。他举的例子是:假设你学会了开车,我从来没学过,但我也学会了开车。这从根本上解决数据量不够的问题,因为任何机器人采的数据都能被其他机器人利用。

— 谭捷
34:22

快慢双模型是过渡,不是终局

Gemini Robotics 1.5 把系统拆成一个 ER(embody reasoning,慢思考)和一个 VLA(快思考、出 robot action)。谭捷认为这是过渡方式,不是终极方式。原因是现在受制于算力和模型大小:慢思考要做 reasoning、要 web search,需要非常大的模型,很难在每秒做五到十次决策;小模型才能做五到十次决策。要 unify 成一个模型,它必须非常大,因为要做 reasoning,而现在算力不足以支持。他还指出两个模型之间现在用语言交流,而语言不是 high bandwidth 的交流方式,会丢掉很多信息,所以理想是一个模型内部不需要额外 interface,没有信息损失。

— 谭捷
52:41

仿真数据的定义正在被生成模型改写

谭捷说仿真的定义越来越模糊。以前仿真指物理仿真,Bullet、MojoCo、Isaac Gym,在计算机里解物理方程算运动轨迹。现在因为 Video Generation Model 兴起,很多人认为仿真就是生成一段视频,只要看上去物理正确,也是一种新意义上的仿真。他判断不远的将来,传统物理模拟的仿真会慢慢被生成式模型的仿真取代。经济性上他反而说生成视频可能更贵,因为需要算力成本,但它解决了场景生成问题:传统仿真要 500 个家庭场景得一个个手建,生成模型只要 500 个不同 prompt。他也指出当前瓶颈是幻觉和非物理现象,比如人生成做体操时不知道会生成出多少条腿。

— 谭捷
56:45

能玩的才是世界模型,静态视频不是

谭捷给出世界模型的定义:如果给上前一帧,再给上机器人的动作,你可以预测下一帧。按这个标准,现在绝大多数视频生成模型都不是世界模型,因为它们不能通过输入一个机器人动作或人的动作来改变下一帧结果。他举了对比:VIO 是一个视频生成模型,但 Genie 更像世界模型,因为 Genie 是可以玩的,你可以通过按键改变生成的下一帧,可以驾驶一只龙左转右转,每一帧都有输入改变下一帧。他说这个方向 Google DeepMind 做得最好,Sora 做得也不错,OpenAI 也不错,还有很多小公司在做。

— 谭捷
1:09:57

灵巧手出现后触觉才变得必要

谭捷讲了自己对触觉判断的心路历程。他一直相信 tactile sensing 重要,因为人每天有皮肤感受触摸。但 Stanford 的 Aloha 论文让他第一次看到人可以通过纯视觉遥操机器人做非常复杂的事,包括从皮包里拿出很薄的信用卡,他以为这种事只有触觉才能做成,Aloha 狠狠打了他的脸,于是他 hold 住这个 believe 一段时间,觉得视觉能做 95% 的事。直到灵巧手普及,他去用遥操控制灵巧手用剪刀——手往两个环里一套就能用剪刀,但没有触觉反馈时他不知道什么时候开什么时候关,因为环很大,不恰当的时间开关只是手在环里动,并没有控制剪刀。他才意识到有灵巧手时触觉非常重要,之前觉得不重要是受限于当时的硬件。

— 谭捷
1:24:14

Google Robotics 从十人松散到集团军

谭捷九年前加入时团队只有十个人,Google Brain 也就几十个人,管理非常松散,每个进来的 researcher 独当一面,想做什么就做什么,资源分配不是问题。他形容那时候自己像一个 very well paid 的 PhD 或 assistant professor,有自主权,但个人 impact 非常有限,很难聚一拨人做一件大事。现在 Robotics 有 150 个人,Gemini Robotics 第一代 3 月版本 author list 上可能已经 120 人,这次可能 160 到 180 人。他说 Google 意识到不想只是一个 academic lab but very costly,于是从 promotion、performance review、incentive、structure 上创造环境,让更多人一起解决更大的事。他自己是随着团队变化,所以没有 culture shock。

— 谭捷

原话 · 已逐字校验

它到底是不是一个非常独立的单独的学科 so far not yet

它到底是不是一个非常独立的单独的学科,so far not yet。

谭捷13:06

就举个例子 就是说假设你学会了开车 我从来没有学过开车这个任务 但我也学会了开车 它可以跨本体

举个例子,假设你学会了开车,我从来没有学过开车这个任务,但我也学会了开车,它可以跨本体。

谭捷30:21

他们相信在机器人行业 很快会有一个质的变革 巨大的变革 如果这个变革发生 I'm on a wrong ship 我一定要at the right ship

他们相信在机器人行业很快会有一个质的变革、巨大的变革,如果这个变革发生,I'm on a wrong ship,我一定要 at the right ship。

谭捷1:36:24

但是我觉得这个在大模型时代 你真的需要烧很多钱 你才能看到结果

但是我觉得这个在大模型时代,你真的需要烧很多钱,你才能看到结果。

谭捷1:46:33

我觉得绝大数的绝大多数的人 尤其是不是在机器人行业里的人 对机器人的发展是overestimate的

我觉得绝大多数的、绝大多数的人,尤其是不是在机器人行业里的人,对机器人的发展是 overestimate 的。

谭捷2:00:46

数字与实体

Google Robotics 团队人数(九年前)10 人1:24:14
Google Robotics 团队人数(现在)150 人1:24:14
Gemini Robotics 第一代 3 月版本 author list 人数约 120 人1:26:14
Gemini Robotics 1.5 author list 人数160 到 180 人1:26:14
谭捷每周工作时长70 到 80 小时1:29:15
精细操作任务(拉拉链)成功率30% 到 40%16:06
简单 pick and place 成功率90% 几到 100%16:06
机器人达到 GPT-3/GPT-4 水平预计时间两三年17:08
机器人真正落地预计时间额外的五到十年17:08
MSR researcher 带来的未见设备任务完成数25 个任务完成 10 个1:54:37

术语

VLA视觉-语言-动作模型
输入图像和语言、直接输出机器人动作的模型,是当前机器人大脑的主流形态。
cross embodiment transfer跨本体迁移
把一个机器人上采的数据和学到的技能迁移到构型不同的另一个机器人上。
motion transfer动作迁移
Gemini Robotics 1.5 中让不同本体数据互用的技术,谭捷称其为 secret sauce。
sim to real仿真到真实
在仿真里训练策略再部署到真实机器人,谭捷第一篇 Google 论文即用此方法。
egocentric video第一人称视频
从人的视角拍摄的操作视频,戴眼镜或相机即可采集,量大但与机器人形态有 gap。
embodiment gap本体差距
两个机器人形态差异的程度,差距越大跨构型迁移越难。

收听指南

谁该听

做机器人或具身智能的创业者、工程师和投资人;想知道 Google DeepMind 内部对数据、架构、世界模型真实判断的人。

可跳过

前 20 分钟嘉宾小传和图形学转机器人经历,可快进到 23:44 数据部分。