机器人操作比运动控制难两三个数量级,硅谷却押错了方向
苏度科技认为,硅谷主流端到端模仿学习路线在开放世界操作上存在根本缺陷,上下分层结构将在今年下半年重回主流。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
视频训练无法达到亚毫米级精度
韩铮解释了为什么不能直接用互联网视频训练机器人操作。2D图片和视频里虽然包含三维信息,但「不太全,也不太准」。自动驾驶导航只需要10公分左右的精度,但机器人操作要求亚毫米级——比如把线缆插到对应孔位。只有3D建模的数据集才能做到这种精度。仿真器要求机器人对几何精度的理解达到毫米级甚至亚毫米级。
— 韩铮零样本通用抓取一次性成功率98%
苏度R1在去年11月和12月内部测试中,连续一小时操作100多个物体、240次抓放,这些物体在训练数据中从未出现过。单次抓放成功率接近98%,如果第一次失败,机器人会用闭环控制迅速调整策略,做到100%。韩铮称这是Sim2Real路线第一次填平差距。之后他们在ICRA和CVPR现场让近1000人用随机物体测试,这在以前学术会议上没人做到过。
— 韩铮短技能泛化比长程任务串联更关键
韩铮认为,Zero-Shot稳定的开放世界基础物体操作短技能,比长程任务复现更核心。如果短技能足够稳定可靠、泛化性足够高,就可以拼成各种长程操作。这也是ManiSkill框架的核心思想。苏度团队在2023年思维链提出同期,有一个叫Chain of Thought Predictive Control的工作,专门处理短任务串联成长程任务。
— 韩铮操作物体比运动控制难两三个数量级
韩铮指出,仿真里的强化学习和Sim2Real已经在波士顿动力、宇树的人形机器人和四足狗的运动控制上得到充分验证,英伟达Isaac里一部分强化学习引擎也是苏度团队成员早期贡献的。但机器人对物体做操作,难度要高两到三个数量级。因为运动控制只需关注自身动作,不需要理解物体形状、材质,也不需要知道怎么移动到物体附近并做调整。
— 韩铮无法复刻特斯拉,必须靠仿真冷启动
韩铮解释为什么机器人不能像特斯拉那样靠卖车收集数据。特斯拉十几年前开始卖车,几百万司机在公路上天天开,数据自然积累。但机器人很难在没有任何功能之前卖500万台到各个办公室和家庭,旁边还得有工人遥控。国内公司可能做到百台甚至千台规模,但离500万台、1000万台进每个家庭差很远。所以冷启动必须靠仿真,需要百万甚至千万级别在开放环境里收集全数据。
— 韩铮被硅谷抛弃的上下分层即将重回主流
韩铮透露,Physical Intelligence成立前在Google Robotics工作时,大家默契地认为底层模型有稳定操作能力后,上层做环境理解和任务拆分。但2023、2024年先后创业时,大家选择了自己擅长和熟悉的端到端套路,不再提分层。韩铮的暴论是:从今年下半年开始,上下分层结构会重新回到主流,并可能是最终商业化方案。最近几周学术界和工业界交流后,已有人意识到这可能是新方向。
— 韩铮最看好DeepMind加波士顿动力Atlas
韩铮认为最大竞争对手是DeepMind加波士顿动力电动版Atlas。去年Demis Hassabis的采访和纪录片显示,Google对物理世界AI的下注在所有大厂里最坚决。他们已经把硬件平台从Apptronik换成电动版Atlas,从波士顿动力硬件部门挖了核心人员到DeepMind。Google还收购了MuJoCo团队,有自己的世界模型Genie 3,有几乎无限的卡和最好的人才。韩铮认为这跟其他公司完全不在一个量级上。
— 韩铮亚马逊场景多但整合困难
韩铮认为亚马逊一直是机器人领域投入最多的大公司,有仓储物流的AGV、Kiva、各种机械臂和人形机器人公司如Agility、Covariant。它会提供场景,但最终要么收购这些公司,要么自己做。Covariant当时也把亚马逊作为核心客户之一。但整合多种机器人系统存在困难。
— 韩铮原话 · 已逐字校验
2D的图片和视频里边 三维的信息有 但是不太全 也不太准
2D的图片和视频里,三维信息有,但不太全,也不太准。
韩铮13:21
单次对于这个物体 做抓放的成功率是将近98% 但是如果它第一次失败之后 这个机器人 还会用一个闭环控制的方法 迅速地再去调整它的策略 就可以做到100%
单次对这个物体做抓放的成功率将近98%,但如果第一次失败,机器人会用闭环控制方法迅速调整策略,就可以做到100%。
韩铮28:05
机器人 如果是要对于物体去做操作 它这个难度要高两到三个数量级
机器人如果要对物体做操作,难度要高两到三个数量级。
韩铮44:51
机器人你是很难 同一款机器 在没有任何功能之前 我卖500万台机器人 到各个办公室 家庭 或者是工厂里边去 并且旁边还有一个工人在遥控它 去做各种各样的操作
机器人很难同一款机器在没有任何功能之前,卖500万台到各个办公室、家庭或工厂,旁边还有一个工人在遥控它做各种操作。
韩铮53:27
我们有一个暴论 可能从今年的下半年开始 上下分层的这种结构 会重新再回到主流里边来 而且可能在之后 大家选择的方案推到商业化里边去 可能是最终的一个方法
我们有一个暴论:可能从今年下半年开始,上下分层的结构会重新回到主流,而且之后大家选择的方案推到商业化里,可能是最终的方法。
韩铮55:38
他可能是未来最 因为他硬件也有 软件也有 我觉得这个跟其他公司 完全不是在一个量级上的
他可能是未来最强的,因为他硬件也有,软件也有,我觉得这跟其他公司完全不在一个量级上。
韩铮1:05:40
数字与实体
| 苏度R1零样本抓取成功率 | 单次98%,闭环调整后100% | 28:05 |
| 苏度R1测试规模 | 连续1小时,100多个物体,240次抓放 | 28:05 |
| ICRA现场测试人数 | 近1000人 | 32:11 |
| 操作比运动控制难度高 | 2到3个数量级 | 44:51 |
| 宇树2025年出货量 | 5000多台 | 59:08 |
| 特斯拉Figure出货量 | 约150台 | 59:08 |
| Skild AI最新估值 | 140亿到150亿美元 | 1:00:34 |
| Skild AI融资额 | 14亿美元 | 1:00:34 |
| Physical Intelligence估值 | 56亿美元 | 1:00:34 |
| 现代集团持有波士顿动力股份 | 软银保留10%到20% | 1:08:58 |
术语
- Sim2Real仿真到现实
- 让机器人在虚拟仿真环境中训练,再把学到的能力迁移到真实物理世界。
- Zero-Shot零样本
- 模型对训练中从未见过的物体或环境直接完成任务,无需额外微调。
- VLA视觉语言动作模型
- 以模仿人类动作为主的端到端模型,将视觉、语言和动作统一建模。
- URDF统一机器人描述格式
- 一种用于描述机器人几何和动力学约束的标准化文件格式。
- teleops遥操作
- 人类通过遥控设备远程操控机器人采集操作数据。
收听指南
关注具身智能技术路线分歧的创业者、投资人和机器人工程师,尤其是想了解Sim2Real可行性、数据冷启动策略和硅谷竞争格局的人。
1:09:01到1:10:58关于亚马逊和垂直场景商业化的讨论,信息密度较低。