世界太吵,来原声听播客

Y Combinator

机器人单模型开箱打平微调专才,组合泛化已有强证据

机器人单模型开箱追平微调专才,尤其能在从未见过的机械臂上组合泛化,这都依赖用提示词驯服低质异构数据;瓶颈正在转向可靠性、速度和物理分发。

具身智能机器人模型强化学习数据处理组合泛化落地节奏
技术判断密度高:单模型、记忆分层、低质数据价值都有具体机制。后半段的落地节奏和数据问答值得听,末尾职业问答偏个人叙事。

核心论点 · 点时间戳可跳到原声

4:07

物理 AI 没有人纠错的第二次机会

过去能在现实世界里赚钱的 ML 应用——推荐、广告、ChatGPT、coding agent——最终决策大都是人做的:AI 给出建议,错了人也能识别并纠正。物理 AI 不一样,它是在真实世界直接做决定、直接对物理结果负责,所以要求的是低得多的错误率,而不是「可以犯错」。Chelsea 给出的证据是 Waymo:一年前每周 25 万次完全无人驾驶行程,说明这种完全自主的基于学习的系统物理可行;但同一个标尺放到机器人上,意味着像做意式浓缩这种需要力控、时序和搬杯不洒的任务,目标是 90% 以上成功率和连续长时间不失误。这个「没有人类兜底」的设定贯穿了后半段所有设计。

— Chelsea Finn
8:14

真机 RL 撞的是机器人天,不是算力墙

PPO、GRPO 这些 RL 算法在语言模型上能 scale,是因为每次尝试只是数据中心里的一次推理,可以堆几百万次;机器人不行,它要真的用硬件在世界里跑。粗算:把 LLM 式 RL 照搬到机器人——不做百万或千万次,只算一百万条一分钟任务轨迹——也要 700 个机器人天,而且这个任务比做咖啡还短。因此她做了两个绕行设计:一、检测到死胡同轨迹就及时截断,必要时让人远程干预机器人并示范恢复动作,避免真机时间浪费在无法带来学习价值的错误路径上;二、不再像 PPO 那样对同一条 prompt 重复 rollout 很多次来估计好坏,而是训练一个跨任务共享的通用 value function,用「距成功还有多久」给不同状态打分,把采样成本摊到多个任务上。

— Chelsea Finn
19:24

机器人没记忆,是因为视频 token 太贵

目前多数机器人基础模型根本没有 memory/context——只看当前帧传感器画面。简单重复动作能靠这种反射扛过去,但多步骤厨房清理这种长任务,机器人必须知道自己做到哪一步。为什么不加 context?因为视频进模型的 token 成本爆炸:10 秒、50Hz 控制频率、四路相机、每帧约 256 tokens,直接拼进去就是约 50 万 tokens;就算把采样压到每秒 1 帧,仍有 1 万 tokens。Physical Intelligence 的做法是分时间尺度记忆:约 10 秒的短视频记忆用更高效的方式编码,长程部分压成文字摘要再输入。有了这套记忆,机器人才能连续 10-15 分钟做「擦台面、扔纸巾、把芥末放回冰箱、收碗、洗碗」的非重复流程,全程不需人。

— Chelsea Finn
30:28

单模型开箱就打平专门微调的专才

机器人通用化对标语言模型,目标是从「预训练后必须微调」走向「开箱即用」。对比实验把单模型 PIO7 和前面为咖啡、纸箱构建等任务用 RL 后训练专门调过的 PIO6 放在一起;结果是单模型零样本的吞吐和成功率在各任务上持平或超过那些 specialists。这意味着过去每个机器人任务都要单独跑 RL 后训练的团队,现在多了一个先不微调的选择。PIO7 能做到这一点,技术关键是:把记忆、指令、子任务、数据质量元数据和可选的 subgoal 图像全部打包成 prompt,把高度异构的数据混进同一个训练配方。

— Chelsea Finn
33:30

换个身体也会折衣,才叫真泛化

他们最看重的能力是 compositional generalization——把技能平移并重组成新任务。最初的测试是空气炸锅这种几乎不在训练集出现过的电器,机器人能执行「开锅—放红薯—关锅」。真正的时刻发生在泛化到机器人本体时:折叠数据全部来自左侧小机器人,部署却换到尺寸、连杆长度和关节配置都完全不同的双臂 Biarm UR5E 上,没有任何该平台折衣训练数据。第一次跑通的瞬间团队说都被震撼到了;视频是原速,它也会试错、靠 subgoal image 自我纠正,最后把衬衫叠好。定量结果也很接近 human teleop 水平。这已不是任务匹配,而是概念理解。

— Chelsea Finn
35:31

低质数据不是废料,缺的是元数据

对数据配方的消融可能比结果本身更值得记。移走数据集里最多样化的子集时,模型在 held-out 任务上的性能大幅下跌;随机删掉 20% 不那么关键的数据,性能只小幅下降——多样性是泛化的主要燃料。更反直觉的一层在低质数据:不加 metadata 提示时,把数据从 80% 加到 100%(新增的都是低质量样本),性能反而下降;但加了质量、时长等元数据提示后,同一批低质数据会把性能继续推高。这也是她说的「能从低质数据里榨出更多 juice」。这提醒所有做机器人数据的团队:任务不是只收集高质量演示,而是把每一条数据的来源、质量和内容结构标注清楚。

— Chelsea Finn
47:32

看费德勒打球学不会网球,机器人也一样

被反复问机器人没有互联网规模数据怎么办时,Chelsea 给出了清晰的边界。人类视频、带字幕的网页图和 YouTube 能提供常识与任务知识,但它不是 robot 的 internet-scale dataset,原因是学习需要 train 和 test 分布一致:机器人在部署时要输出自己平台上的动作,它就需要自己平台的 experience。她用的比喻很直接:看罗杰·费德勒打球不会让我也会打网球;机器人看人干活,也不能直接学会自己怎么干。未来数据的主体是已部署的机器人自主尝试产生的经验,冷启动会靠远程操作数据,但最终不能只依赖人类视频。

— Chelsea Finn

原话 · 已逐字校验

Waymo passed the quarter of a million weekly autonomous rides, suggesting that it is really possible to develop a machine learning based system that can operate in a trustworthy and autonomous way directly in the physical world.

Waymo 达到了每周 25 万次完全无人驾驶行程,说明开发一个基于机器学习、能在物理世界中以可信且自主方式运行的系统,是真正可能的。

Chelsea Finn5:09

say we had maybe not millions or tens of millions, but just one million trajectories of a one-minute robot task, this is even shorter than the espresso task that I talked about, this would correspond to 700 robot days to get high reliability for that task.

就算不做百万或千万次,只做一百万条一分钟的机器人轨迹——这比我刚才说的意式浓缩任务还短——也相当于 700 个机器人天,才能换来该任务的高可靠性。

Chelsea Finn8:14

And you feed in all four camera streams on the robot. And you use around kind of 256 tokens per image. This corresponds to passing in half a million tokens into your model, which is a lot of tokens.

把机器人上四路相机画面都喂进去,每张图大约 256 个 token,这等于一次性向模型输入五十万个 token——量非常大。

Chelsea Finn19:24

The first time we saw the robot do this, we were like floored because we, like there was no training data for this task.

我们第一次看到机器人完成这个任务时都震惊了,因为对这个任务,我们完全没有训练数据。

Chelsea Finn33:30

with the metadata prompting, the performance actually increases when you add that low quality data.

加上元数据提示之后,当低质量数据被加入时,性能反而会提升。

Chelsea Finn36:31

I don't know if we'll have a single moment that has the distribution that chat GPT had.

我不确定会出现一个像 ChatGPT 那样获得海量分发的单点时刻。

Chelsea Finn40:31

if I watch Roger Federer play tennis, it doesn't mean I can play tennis as well as him, unfortunately. And likewise, robots can't, like, watch a person doing something and then figure out how to do it themselves directly.

如果我看罗杰·费德勒打网球,并不意味着我也能打得和他一样好;机器人也一样,看着人做一件事,不等于它就能自己直接做出来。

Chelsea Finn47:32

数字与实体

ChatGPT 达到 100 万用户用时5 天3:05
把 LLM 式 RL 照搬到 1 分钟机器人任务的估算100 万条轨迹 ≈ 700 个机器人天8:14
机器人连续做拿铁的评估时长13 小时14:21
RL 后训练阶段带来的吞吐提升约 2 倍16:23
意式浓缩任务最终成功率90% 以上16:23
PIO7 带记忆自主完成非重复长任务时长10-15 分钟20:25
PIO7 与微调专才 PIO6 的对比零样本均匹配或超过后者30:28

术语

compositional generalization组合泛化
把已学会的技能或概念重组为没见过的新组合,是模型具备概念理解和数据效率的标志。
subgoal image子目标图像
模型生成一小段未来应达到的画面,作为机器人下一步动作的视觉条件输入。
time-to-success距成功时间
一个标量价值估计:离任务成功还剩多久;越短表示当前状态越好。
RL post-training强化学习后训练
在基础模型预训练后,针对具体任务用强化学习继续优化,以提高可靠性与吞吐。

收听指南

谁该听

意图自己训练机器人的具身智能创业者和工程师、选机器人数据策略的人、判断通用机器人落地节奏的投资人。

可跳过

末尾谈 PhD 和跨行求职的问答可跳过;其余围绕模型、数据与落地。