机器人不需要等到 aha moment 才落地
机器人领域还没出现大模型那种 aha moment,但能力提升的斜率已经起来了,每一年每一个月的能力增长都会沿途解锁新的商业机会,不用等通用智能成熟再找应用。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
这轮机器人热的最大变量是大模型
陈建宇把这一轮和过去十年的机器人热潮区分开:真正的变量是大模型的出现。23 年上半年大模型火了半年之后,开始辐射到机器人。此前 AI for Robotics 的脉络是 Deep Learning 先进入 Computer Vision 做感知,AlphaGo 代表深度强化学习让神经网络能做连续空间的行为决策,但都不够通用。直到 ChatGPT 出现,大家才看到「有某种 AI 方法能够做到足够的通用」,于是不用再为 100 种场景开发 100 种专用模型——那种做法完全没法 scale。
— 陈建宇最棘手的问题是能 scale 的架构还没找到
被问到通用机器人最棘手、一旦解决就可能爆发的问题,陈建宇的答案是「能够去 scale 的这样的一个模型的架构」。他认为整个行业正在往这个方向快速进展,但暂时还没找到。这个问题既是科学问题也是工程问题:架构本身很大程度是科学问题,因为做具身要思考人是怎么思考、怎么学习的——「人就是一个标准的通用的 VOA 模型大佬,人就是一个 AGI」。他还判断未来 AGI 的最终形态就是具身的,语言、自动驾驶、机器人这些大模型最终都会 unify 起来。
— 陈建宇Say Can 把「可以做」和「能做的」匹配起来
Google 22 年的 Say Can 解决的是语言模型规划与机器人实际能力不吻合的问题。方法是一边让语言模型给出完成目标需要做哪些事并打分,另一边用单独训练的 Value Function 判断当前机器人状态下哪些事真的能做,两边做匹配,最终规划出既有助于完成目标、机器人又能达成的任务。陈建宇指出它的局限:一开始就规划完 12345 步,中间如果失败,没有重新规划和纠正的机制。
— 陈建宇Inner Monologue 之后,反馈要更及时
Inner Monologue 的改进是让机器人执行动作后获得环境反馈再推理修正,比如钥匙插不进去就换一把。但陈建宇团队 23 年的工作指出它的问题:如果中间某个子任务执行时间较长,要等任务做完才给高层反馈,中间这段时间就被浪费了。他们的做法是用 VLM 做实时 detector,大约 10 赫兹的频率观测当前任务有没有异常,比如搬箱子途中箱子掉了能立刻发现并重规划,而 Inner Monologue 可能要走到目的地才发现箱子没了。
— 陈建宇数据多样性比数据量重要得多
RT-1 用 130k episode、700 个任务、13 台机器人、17 个月收集的数据训练,在见过的任务上接近百分之百成功率,没见过的任务也有约百分之五十。它给出的重要 insight 是 diversity is all:横轴是数据量、纵轴是成功率,单纯加量是平滑提升,但把多样性去掉,performance 会下降得很厉害。陈建宇用自动驾驶类比:人类司机大多开在道路中间,数据趋同,corner case 数据极少,diversity 不够就很难 generalize。
— 陈建宇VLM 直接输出动作太慢,缺动作处理
陈建宇团队复现 RT-2 后发现这类 VLA 的局限:本质是拿一个 VLM 直接 decode token 成动作,太缺少对 Action 层面的专门处理,而且 VLM 运行慢,RT-2 基本只有 1 到 3 赫兹,对机器人来说频率非常低,动态任务上效果和精度都受影响。他们的 HiRT 加了一个专门的 Action Policy 模块做动作解码,并做分频处理:VLM 低频运行,参数只有几十 M 的 Action Policy 高频运行,同时接收视觉反馈形成闭环。结果是 performance 与 RT-2 相当甚至略好,推理速度明显更高。
— 陈建宇统一动作空间不如分开加小脑
RDT 把 Diffusion Policy scale 到 B 量级,预训练量大概 1M,大量用到 RT-X 数据。它的一个创新是 Unified Action Space:所有本体共用一个统一向量,把向量不同区段分配给单臂、双臂、轮式等。陈建宇明确表示自己更倾向 CrossFormer 那种不同 Action Head 的方式,因为很难预判未来会有多少种本体,统一向量可能长到没法准备,或者训练完发现向量不够用。他的判断是「加小脑更好」,共享大部分大脑,小脑部分只需较少数据去 finetune。
— 陈建宇强化学习直接训整个 VLA 会越训越差
陈建宇团队尝试用强化学习增强 VLA,发现标准 PPO 直接训练整个网络不 work,甚至会越训越差。他们找到的间接办法是分两步:第一步冻结 VLM,只训练 action head,强化学习能训上去;然后把成功的 trajectory 存下来,再放开 VLM,用监督学习的方式去训。效果上纯模仿学习不到 50 分,他们的方法能接近 100 分,在没见过的任务上优势更明显。他认为未来还是希望强化学习能直接端到端训练整个模型。
— 陈建宇原话 · 已逐字校验
之前的机器人是什么 是100种场景 100个任务 我要重新开发100种机器人
之前的机器人是什么?是 100 种场景、100 个任务,我要重新开发 100 种机器人。
陈建宇8:06
人就是一个标准的通用的VOA模型大佬 人就是一个AGI
人就是一个标准的、通用的 VLA 模型大佬,人就是一个 AGI。
陈建宇14:09
diversity is only 就是说对数据来说它的diversity 会比数据的size要重要很多
diversity is all,就是说对数据来说,它的 diversity 会比数据的 size 重要很多。
陈建宇57:25
我明显是找到了这样一种方式 可以持续快速的提升机器人的能力 这个能力的提升可以会持续好几年
我明显是找到了这样一种方式,可以持续快速地提升机器人的能力,这个能力的提升会持续好几年。
陈建宇2:24:59
现在用起来的机器 包括工业里面的工业机械臂 或者等等它的智能几乎为零 但是也有万台级别这些出货量
现在用起来的机器,包括工业里面的工业机械臂等等,它的智能几乎为零,但也有万台级别的出货量。
陈建宇2:25:59
数字与实体
| RT-1 见过任务成功率 | 接近百分之百 | 56:23 |
| RT-1 未见任务成功率 | 约百分之五十 | 56:23 |
| RT-2 推理频率 | 1 到 3 赫兹 | 1:33:21 |
| HiRT 中 Action Policy 参数量 | 几十个 M | 1:35:23 |
| 陈建宇团队实时 detector 频率 | 约 10 赫兹 | 30:15 |
| 陈建宇团队强化学习效果对比 | 纯模仿学习不到 50 分,其方法接近 100 分 | 2:05:48 |
术语
- VLA视觉-语言-动作模型
- 端到端处理 Vision、Language、Action 三种模态的机器人模型。
- Action Chunking Transformer动作分块 Transformer
- Aloha 提出的架构,一次输出未来一段动作序列,并对历史规划做加权平均使轨迹更平滑。
- Model Predictive Control模型预测控制
- 每时刻规划未来一段动作轨迹,只执行第一步,下一步重新规划。
- Co-Fine Tuning联合微调
- RT-2 在机器人数据微调时同时混入原 VLM 数据,避免过拟合到动作而丢失视觉语言理解。
- Diffusion Policy扩散策略
- 用扩散模型的加噪去噪方式生成机器人动作轨迹的训练方法。
- Unified Action Space统一动作空间
- RDT 把不同本体的动作映射到同一个长向量,按区段分配给单臂、双臂、轮式等。
收听指南
做机器人或具身智能的工程师、创业者,以及想搞清 VLA 技术脉络和落地节奏的投资人。
1:15:02 到 1:20:02 的 PaLM-E 部分偏基础,可快进。