世界太吵,来原声听播客

张小珺·商业访谈录

机器人不需要人形,也能叠衣服做咖啡

Pi 用三篇主线论文把机器人大脑从能力推到泛化再到表现,柯丽一鸣认为人形不是现阶段最该解的问题,真机数据不可取代,机器人自己跑出来的体验数据才是下一步。

具身智能机器人大脑强化学习真机数据Pi中美硬件
四小时访谈信息密度高,前半段成长与派系梳理可快进,中后段 Pi 三篇论文的技术逻辑和真机数据之争值得细读。

核心论点 · 点时间戳可跳到原声

1:54:43

Pi 三篇主线论文各回答一个问题

柯丽一鸣把 Pi 的主线发表拆成三个关键词:π0 是能力,π0.5 是泛化,π*0.6 是表现。π0 做了叠衣服、叠箱子、桌面抓放三个任务,2024 年 11 月的叠衣服是当时没人见过的级别。π0.5 要回答的是 in domain 和 out of domain 的问题——如果模型只在训练过的房子里表现好,影响力就很有限,所以他们去一百个 Airbnb 收数据,发现数据量到一个尺寸后,到新房子里的表现会放缓,不需要收遍全世界所有人的家。π*0.6 回到「什么都能做但什么都做不好」的质疑,强调方法简洁性,让智能体在真实世界里收集自己的体验数据放回训练池。

— 柯丽一鸣
2:00:12

机器人自己跑出来的数据比人遥操作便宜

真机数据贵,柯丽一鸣拆成几块:要有真机平台、要放到人家里、要维护、要找人做任务、还要跟这个人交流做规划,最复杂的是管理这个人。但如果把数据操纵源换成已经训好的大模型,让模型自己 roll out,数据成本能降很多。他比较 bullish 地坚信将来机器人价格应该又便宜又方便,现在很多人对数据的担忧在时间长河里其实都不重要,因为部署过程中这么多机器人收的数据都能为我所用。这也是 π*0.6 星号的含义:把成品数据放回模型之中。

— 柯丽一鸣
2:03:15

错误数据是好数据,但也可以让机器人自己跑

模仿学习有个严重问题叫积累的错误:每一步微小错误不断放大,机器人会到达一个完全没想过、人收集数据时不会碰到的糟糕情况,一旦进去就不知道怎么修正路线。所以收数据时不光要收完美的人的数据,还要收机器人进入不好情况后怎么修复、怎么继续完成任务的修正数据。但柯丽一鸣再次强调,修正数据也可以通过机器人自己跑来说,这就是强化学习比较本质的东西。在真机数据和仿真数据之争上,他是黑猫白猫抓到老鼠就是好猫,但本源上相信真机数据,因为叠衣服这种柔性、摩擦力、粘性复杂的任务,仿真器可能根本搞不出来。

— 柯丽一鸣
2:09:17

评估是机器人前沿最难定义的原因

NLP 当年生成一段话让人打分已经不容易,机器人更糟:你得在机器人上跑才能知道他做了什么,才能打分,还要受机械物理限制,一些变化你自己不知道就会影响模型表现。拿杯子这个任务,杯子放在桌子任何地方、不同光照、不同背景、桌子高度、甚至不是桌子而是柱子、杯子自己的角度,无穷尽的初始条件都会影响最终表现。评估难直接导致机器人领域不像其他领域有英雄榜,发一个超大数据集每个模型跑一跑看谁是第一名。所以现在前沿很难定义,大家方向分散,都在朝不同方向发展,不知道哪条线是那条大道。

— 柯丽一鸣
2:32:30

如果 Pi 做人形,他就不来了

柯丽一鸣 2024 年 Pi 刚创立一周内去聊,问他们先做人形吗、要做什么商业化。他感受到的氛围是确实不做人形。他说如果他们说做人形他就不来了,因为他担心不同背景的人做人形,研究重心会变成如何做一个更好的人形机器人,而他的研究重心是做更好的任务。他非常相信不需要人形就能做出很好的任务,而且不需要人形就能更快做出来——叠衣服、叠箱子、做咖啡都是先做好了,不需要人形就可以做。他觉得这是 Taste 的问题,还有很多无穷无尽的任务等着做。

— 柯丽一鸣
2:46:33

强化学习本质是巴甫洛夫的狗

柯丽一鸣说强化学习解释起来就是巴甫洛夫的狗:狗做了一个事情你给它奖励,它从此知道这个事情是好事情要多做,通过奖励和惩罚让智能体做更好的动作。它跟人的自我提升有很多关系,追求极致是强化学习非常强烈的因素,就是不停去练。另一个重要部分是探索,可大可小,可能是肌肉往左移一下网球表现更好,也可能是研究方向的切换。还有归因:宠物做了一系列事情你最后给一个奖赏,它需要知道到底哪个事情是这次得到好奖赏的决定性因素。π*0.6 里就有探索,收集这么多部署数据,究竟哪一条数据里哪个步骤做得好,让整条数据得到关键性奖赏。

— 柯丽一鸣
3:16:50

中国硬件统治力让美国不知道怎么追

柯丽一鸣说一两年前想看到春晚那种级别的 demo 只是想想而已,能看到真的做出来非常激动,背后有算法提升也有硬件实力。现阶段看中美产业对比,最直观的感受是中国在硬件上有领导力、统治力,很难想象有一家机器人公司组装好一台机器人,里面没有一个零件是中国的。中国有产业链制造业的优势实在太大,他甚至不知道美国人要追的话该怎么追。同时硬件迭代让现有算法距离商业落地端也有一些优势。但他也承认,缺少产业链制造业这一环,会让美国公司的迭代速度变慢。

— 柯丽一鸣
3:17:50

过早商业化让 Covariant 失去通用泛化性

柯丽一鸣解释 Pi 为什么暂时完全不考虑商业化,说这是有历史原因的。Peter Abell 是 Sergey Levine 的导师,有过两次创业经历,一次做给学生作业打分的系统,现在美国大学基本都在用;另一次 2015 或 2016 年创立了机器人公司 Covariant,要做机器人通用的机器学习方案。但公司在发展过程中某个时间点开始深耕物流仓储机器人,从大模型开发角度回头看,这其实是对开发大模型的分心——因为过早商业化而失去了通用泛化性,把精力放在很多商业化相关事情上,没有真的去追溯本源问题。所以 Pi 受到这段经历影响,强调不要太想商业化的事情,大家很纯粹地说要做一个研究,把它表现做得最好。

— 柯丽一鸣

原话 · 已逐字校验

第一篇是派灵 它的关键词应该就是能力 第二篇是派0.5 它的关键词是泛化 然后最近的这篇是派0.6星 它的关键词是表现

第一篇是 π0,它的关键词是能力;第二篇是 π0.5,它的关键词是泛化;最近的这篇是 π*0.6,它的关键词是表现。

柯丽一鸣1:55:10

但我觉得 就是如果机械的价格 降下来的话 就在这个过程中 我个人认为 现在的比较大的大头 其实是管这个人 去收到你想象的这个数据 但如果你可以把 就是数据的操纵源 这个给放在一边 而是换上你 已经训好的一个大模型 让大模型在这里跑 其实你数据的成本 应该是能降很多

但我觉得,如果机械的价格降下来的话,在这个过程中,我个人认为现在比较大的大头其实是管这个人去收到你想象的这个数据。但如果你可以把数据的操纵源放在一边,换上你已经训好的一个大模型,让大模型在这里跑,其实你数据的成本应该是能降很多。

柯丽一鸣2:02:14

所以现在这个frontier 还是很难定义的 我觉得可以看到一些算法 可以看到一些算法的表现 就是怎么说呢 可能是 就是一个最核心的部分 大家都看得见 然后随着它向着 更前沿的方向迈进以后 就变得越来越有些乱 就需要你能从分乱中 找到一个清晰的线

所以现在这个 frontier 还是很难定义的。我觉得可以看到一些算法,可以看到一些算法的表现,就是怎么说呢,可能就是一个最核心的部分大家都看得见,然后随着它向着更前沿的方向迈进以后,就变得越来越有些乱,就需要你能从纷乱中找到一个清晰的线。

柯丽一鸣2:09:17

我当时感受到的氛围 就是确实我们不做人型 因为他们要说做人型 我就不来了 你知道吧

我当时感受到的氛围就是,确实我们不做人形,因为他们要说做人形,我就不来了,你知道吧。

柯丽一鸣2:32:30

我觉得强化学习是一个非常本质的一类问题 也就是说一个人如何通过体验变得更好 这个问题从最传统教科书上来说 解释强化学习 其实就是解释这个巴布洛夫的狗

我觉得强化学习是非常本质的一类问题,也就是说一个人如何通过体验变得更好。这个问题从最传统的教科书上来说,解释强化学习其实就是解释巴甫洛夫的狗。

柯丽一鸣2:47:33

就是很难想象 有一家机器人公司 它 组装好了一台机器人 然这里面没有一个零件 是中国的 我觉得是不太可能

就是很难想象有一家机器人公司,它组装好了一台机器人,里面没有一个零件是中国的,我觉得是不太可能。

柯丽一鸣3:16:50

就因为过早的去商业化 而失去了就是这种通用繁华性 反而把精力放在了很多 这种商业化的相关事情上 嗯 没有真的去追溯本源的问题

就因为过早地去商业化,而失去了这种通用泛化性,反而把精力放在了很多商业化相关的事情上,没有真的去追溯本源的问题。

柯丽一鸣3:17:50

数字与实体

Pi 估值超过 50 亿美元0:00
π0.5 数据收集房屋数约 100 个家1:58:12
Pi 员工数约 70 人2:28:29
柯丽一鸣博士时长7 年2:42:32
华大博士毕业记录9 年2:43:33
Cloud Agent 带来的工作效率提升约 3-4 倍2:31:30
安徽省每万人上清华北大比例约 3-4 人25:22
大城市每万人上清华北大比例约 80 人25:22
2017 年 ShadowHand 价格50 万到 100 万美金51:45
2017 年 Franka 价格几万美金52:46

术语

VLA视觉-语言-动作模型
把视觉、语言和动作统一到一个模型里的机器人架构。
in domain / out of domain数据内 / 数据外
模型在训练数据覆盖范围内和范围外的表现差异。
Diffusion Policy扩散策略
用扩散模型生成机器人动作的一种方法。
sim2real仿真到真机迁移
把仿真器里训练的策略迁移到真实机器人上。
throughput固定时间内成功的量
π*0.6 提出的评估指标,衡量单位时间内完成任务的成功量。
FAST动作表达空间
Pi 的一篇论文,研究如何学一种更优的动作表达方式供大模型预测。

收听指南

谁该听

关注具身智能和机器人大脑的创业者、投资人、工程师,尤其是想了解 Pi 技术路线、真机数据之争和中美硬件差距的人。

可跳过

前 40 分钟的成长、写小说和武侠游戏经历可以快进,直接从中段的机器人派系和 Pi 研究听起。