世界太吵,来原声听播客

Y Combinator

机器人学会用手,靠的不是机器人数据,而是电脑操作数据

通用大模型正在把编程、操作电脑、认识空间的能力打包迁移到机器人身上,业内预计两年内就会出现能听懂任何指令、干活像称职青少年的通用机器人。

具身智能机器人控制通用大模型编程智能体苦涩的教训
两位机器人前沿创业者用具体demo和研究脉络,讲清楚为什么通用大模型可能比专用机器人模型更快赢下机器人操控这场仗。

核心论点 · 点时间戳可跳到原声

2:05

机器人动作输出也曾没有思维链

RT2这类早期VLA模型是把语言模型微调后直接输出动作坐标(末端执行器位姿),中间没有思考步骤,就像GSM8K早期模型只能直接吐出答案、不能展开推理。现在编程智能体可以先思考、写代码、调用工具,再决定动作,这被认为是机器人控制版的「思维链时刻」——能给任务分配的计算量不再固定,复杂任务可以想得更久。

— Jay
4:07

瓶颈也许从来不是模型架构

VLA架构本身就建立在语言模型之上,理论上也能推理、写代码。真正的瓶颈可能不是要不要用专门的机器人架构,而是用什么数据训练——机器人专用数据长期稀缺,进展缓慢。既然代码、网页文本这类数据是模型的「分布内」强项,一个思路是想办法把机器人这种「分布外」任务,转化成能用这些已有数据解决的问题。

12:16

上下文学习撑不起真正的规模化

Francois做过一个实验:把某项任务从训练集中剔除,只靠上下文示例(不更新权重)看模型能提升多少。结果提升是非单调的,忽好忽坏;更关键的是大概20到40个示例后就基本见顶,再往上下文里塞例子也不再有用,而且一旦超过训练时上下文长度的一半左右,表现反而变差。像Tesla这种手握海量数据的公司,不可能靠这种方式做自动驾驶。

— Francois
14:19

把临场学到的东西蒸馏成技能库

Waddle Labs把「harness」(智能体的工具与流程包装)理解为一种领域专精的载体:机器人第一次进入新环境时靠上下文现学现卖,但学到的东西可以打包成具体的代码或技能,留给以后的智能体直接调用,相当于把过去的经验蒸馏成固定资产。这也呼应了元学习的思路——一个大模型负责给小模型「编程」,小模型只需要在上下文里执行,可以做得更小更快。

17:22

延迟每月减半,年底或有实时机器人

演示中Astra直接操控机械臂时动作明显偏慢,因为整套系统被大模型自身的推理延迟卡住了。但据他们观察,前沿级大模型的延迟大约每个月能减半,如果这个趋势不变,到今年年底就有可能实现真正意义上的实时机器人控制——今天看起来卡顿的demo可能很快就不是问题。

22:32

语言学得越强,机器人也就学得越强

引用Philip Isola的「柏拉图式表征假说」:不同模型在足够大的数据和规模下,会收敛到对世界同一种底层表征。如果这成立,一个足够强的语言模型必然对应一个足够强的机器人模型,因为两者在学习同一套关于物理世界的映射。这被认为是「苦涩的教训」最彻底的体现——架构不重要,重要的是有没有一个真正强的通用模型。

23:32

Blender里拖动光标,教会了模型认识空间

Astra在空间推理上的突破被认为很大程度上来自海量电脑操作和CAD数据的预训练——比如在Blender里拖动光标环绕一个三维物体做设计,本质上就是在学习「上下左右」这类空间概念,恰好是控制机器人手臂需要的能力。有意思的是,1980年代Xerox PARC把图形界面设计得像物理世界方便人类操作,如今这套「拟物」环境反过来成了训练AI操作真实物理世界的数据。

25:32

两年内或更早,通用机器人就会出现

前沿实验室和机器人基础模型公司内部普遍认为,两年内甚至更早就会出现真正的通用机器人:给出任意自然语言指令,它就能完成一个称职青少年用双手能做到的事,这被类比为机器人领域的ChatGPT时刻。剩下的主要障碍是怎么把大模型实时推理的慢速过程,压缩成能高频重复调用的快速技能——这被类比成「睡眠」:像大脑靠睡眠把白天的经历压缩进记忆,模型也需要一个离线阶段,把上下文里的经验蒸馏进权重或不断增长的技能库。

原话 · 已逐字校验

instead of outputting English, for example, they just output what we call an end-effector pose. Which is the coordinates that you can then translate into join commands that can control the robots.

它不像输出英文那样,输出的是我们称为「末端执行器位姿」的东西——也就是可以转换成关节指令、用来控制机器人的坐标。

Jay2:05

We want to be bidderless and pill, right? We want to benefit from all kinds of data. We want to pour in computer use data into our robot models. We want to pour in coding data into our robot models.

我们想彻底服膺「苦涩的教训」,对吧?我们想从各种数据里获益——把电脑操作数据灌进我们的机器人模型,把编程数据也灌进去。

Han Mei6:09

one is non-monotonic improvement which is wild so it gets worse it gets better it gets worse it gets better like pretty grass aggressively number two is that it caps out very quickly and so after like 20 30 maybe 40 examples it is basically saturated

第一点是非单调式提升,很离谱——它一会儿变差一会儿变好,一会儿变差一会儿变好,波动很剧烈;第二点是它很快就见顶,大概20、30甚至40个示例之后基本就饱和了。

Francois12:16

So one thing that we saw is that for Fable class LLMs, their latency is improving by around 2x per month, which is very, very fast.

我们观察到的一点是,前沿级LLM的延迟正以每月约2倍的速度在改善,这非常非常快。

There's some consensus within the Frontier Labs and also in the Robotics Foundation models companies that we will have general purpose robots within the next two years or even earlier.

前沿实验室和机器人基础模型公司内部有一种共识:我们将在未来两年内、甚至更早,拥有通用机器人。

when we say general purpose robots, we mean something like if you give any natural language instruction, it can do what a competent teenager could do with their hands.

我们说的通用机器人,是指只要给出任何自然语言指令,它就能完成一个称职的青少年用双手能做到的事。

like almost everything that is intelligent sleeps. Like tell me an intelligent system that doesn't sleep, right, in some way. And then during sleep, compression happens.

几乎所有智能系统都需要睡眠——你说说看,有哪个智能系统是完全不睡觉的?而压缩正是在睡眠中发生的。

数字与实体

上下文学习(ICL)见顶所需示例数约20-40个示例后基本饱和12:16
前沿级LLM推理延迟改善速度约每月减半(2倍)17:22
业内对通用机器人出现时间的共识两年内或更早25:32

术语

VLA (Vision-Language-Action Model)视觉-语言-动作模型
直接输出动作坐标而非文字的机器人控制模型
end-effector pose末端执行器位姿
机械臂末端在空间中的坐标与朝向
code as policies代码即策略
让编程智能体直接写代码来控制机器人完成任务
in-context learning (ICL)上下文学习
不更新模型权重,只靠提示里的示例即时改善表现
platonic representation hypothesis柏拉图式表征假说
不同模型训练到足够强后会收敛到同一种世界表征
bitter lesson苦涩的教训
Rich Sutton提出:通用算力方法长期胜过人工设计的领域知识

收听指南

谁该听

关注机器人、具身智能或通用大模型应用边界的创业者、投资人和工程师,想提前判断下一波机器人公司会长什么样。

可跳过

12-14分钟关于上下文学习理论的细节偏学术、语言也较口语化,赶时间可跳过。