机器人公司最大的敌人不是技术,是摇操和讲故事
王鹤说这一代具身智能公司只有两条死路:长期漂着讲故事,或者每个场景从头重做。他押注合成数据,真实数据只占训练量的1%。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
这一代机器人公司只有两条死路
王鹤把这一代具身智能公司的失败模式归成两类。第一类是长期漂浮:讲人形机器人的故事讲几十年,没有任何商业应用案例,所有技能本质上都是为了拍摄而编排的。第二类是算不过来账:一个场景里所有技能都给你搞定,但换到下一个场景全部从头重做,编辑成本一点不降——这在工业视觉里很常见,不同商家的料不一样就要重新建模形成模板,每做一个项目都要投入固定的人力、研发和交付周期。他的判断是,陷入任何一个,天花板都不可能超过上一代公司,因为你不可能像美国那样让资本支持一个公司几十年不盈利还存在。
— 王鹤雇人摇操采数据,一个月要烧数亿
王鹤算了一笔账:一台 full size 人形机器人制造成本最少十万,一万台就是十亿砸在制造上。制造出来还得有人摇操,每台至少两班倒甚至两班、每班两人,四个人;一台机器人上摇操的人一个月支出就是小几万,还得有人标注、质检。全部下来,维护一万台机器人每个月的成本在数亿到十亿的规模。所以他的结论是全世界没有人能这么干,美国那些公司也不 work——他们只能把 demo 拍成视频给你看,无法邀请你现场看。而车不一样,车卖出去还收钱,数据是负成本收集的。
— 王鹤真实数据只占训练量的1%
王鹤说银河通用敢在智源大会上直播 VLA 做货架、敢在会场展厅不间断演示,是因为不完全依赖真实数据——真实数据在训练数据里的比重也就是1%,甚至更小,自研的合成数据管线挑起了大量工作。他从17年做 NOX 那个工作就开始研究合成数据,到今年用合成数据做模型、解决 sim2real 问题,已经八个年头。他直接点名了反对者的动机:很多人讲仿真不够、有 sim2real gap、解决不了问题,都要用真实数据——真实数据怎么用呢,你先买我机器,然后去摇。这是一个能讲通的闭环商业模式。
— 王鹤说 sim2real 不 work 的人要回答走路为什么 work
王鹤反驳合成数据无用论的方式很直接:今天人形机器人所有的行走、跳跃、跑步技能都是通过 sim2real,都是在仿真器里经过大规模强化学习得到的。所以说不 work 的人要回答,为什么腿的 sim2real 是 work 的。对方会说那是因为腿没有视觉,加了视觉模态就不能 sim2real 了。王鹤认为这个反驳也错了:VLA 的基础是 VLM,而 VLM 的训练数据本来就有大量动画、电影数据,真假混杂——一个能看懂真实世界的 VLM,看唐老鸭米老鼠也看得懂剧情。物理渲染出来的抓放过程,跟真实世界的差距总比米老鼠和真实世界的差距小。
— 王鹤最大的乱象是分不清谁在创造生产力
王鹤说现在最大的问题是:什么人能产生生产力,什么人没有、只是在讲故事,这里头是最乱的,而且这个源自美国——美国对创新有更强的容忍,你不挣钱没关系,没有产品没关系,只要还能卖掉。他拿 Figure 举例,说对它的估值有正反两个逻辑:正逻辑是人形机器人如果真能在产线上干活,长期价值应该在数万亿美元,今天三四百亿的估值还有一百倍增长;反逻辑是它到底有没有干活能力,只出货了10台还是20台,干的活还不是靠它 claim 的方法干的。国内的问题是看到国外这么讲,也去夸大自己的硬件和软件能力。
— 王鹤公开展示不许摇操,是第一道关
王鹤提出两条验证标准。第一是公开展示,在智源大会几万个观众围着你看,现场看,而且不允许摇操——他说美国是常态化摇操,我告诉你我就是摇操的,只不过人藏在后面;国内现在有些人胆子特别大,不告诉别人我是摇操,但实际是摇操。第二是你真的进了场子,那个场子每天干多少量的活,有没有长期的报告可以让投资人和公众了解,像他们开的店一天几百单,都是得到平台方认证、常态化运营的。相比之下,video 里讲的、签了战略协议说已经怎么着了的,越来越没有说服力。
— 王鹤五年做不到一万台,这个行业就被证伪
王鹤给了一个明确的时间判据:五年内中国和美国的同行一定要有万台以上的应用,头部至少当年有一万台规模的自主机器人应用。如果五年都做不到,这个行业很可能像工业视觉一样——刚开始讲几百亿的故事,最后发现只有小几亿的应收,时间周期会大大拉长,大家可能对这个事情失去热情。他反复强调银河现在一定要生产力,因为五年如果不能形成万台级的规模化生产力,这个领域就被证伪了,泡沫全是泡沫。他给的理由是中国老龄化少子化,十年二十年后劳动力可能不到今天的一半。
— 王鹤黄仁勋请他吃饭,是因为英伟达押合成数据
王鹤解释黄仁勋为什么邀请他:英伟达是全球除了银河通用以外非常看重合成数据这条技术路线的大厂,他们的道理更简单——有卡就应该解决一切问题,如果除了卡还需要别的问题,那就没那么快推动。合成数据就是拿 GPU 做渲染做仿真,再用更高级的 GPU 做运算,所以英伟达很认同,如果能把合成数据走通,靠英伟达就能撑起具身智能的半边天。在此之前英伟达的机器人副总裁、专员都多次来银河通用参观考察,亲眼见过之后才把他叫去跟黄仁勋一起吃饭,坐在旁边是英伟达安排的。
— 王鹤原话 · 已逐字校验
我算不过来日账 就是我现在在这个场景里 我全部你要的所有技能 我挨个都给你这个用 这个各种方式 不管数据驱动 还是用这个就是轨迹视角 拖拽 重放 总之我都给你搞定了 但就这一个场景的解决方案 它到下一个场景 全从头重做
我算不过来账:我现在在这个场景里,你要的所有技能我挨个都给你用各种方式搞定,不管数据驱动还是轨迹视角、拖拽、重放,总之都给你搞定了,但就这一个场景的解决方案,到下一个场景全从头重做。
王鹤1:46:28
大家现在呢 能做一个demo 都是拍成视频给你看 无法邀请你现场看 无法做公开展示
大家现在能做一个 demo,都是拍成视频给你看,无法邀请你现场看,无法做公开展示。
王鹤1:57:36
它是一个能够讲的闭环 就是我不信核数数据 我告诉你核数数据没用 你呢不要信 你呢就给我买我的机器 然后呢你就去摇 摇够了自然这个技能就出来了 这种商业模式
它是一个能够讲通的闭环:我不信合成数据,我告诉你合成数据没用,你不要信,你就给我买我的机器,然后你去摇,摇够了自然这个技能就出来了。这是一种商业模式。
王鹤1:59:37
一个能看懂真实世界的VLM 他看唐老鸭米老鼠 他就看不懂那个剧情吗 看得懂
一个能看懂真实世界的 VLM,他看唐老鸭米老鼠,他就看不懂那个剧情吗?看得懂。
王鹤2:05:46
什么叫生产力呢 就是你在单位时间 你干的活 必须得跟人相当 如果你比人慢太多 或者你干的不够人久 你就不是优质生产力
什么叫生产力呢?就是你在单位时间干的活必须得跟人相当。如果你比人慢太多,或者你干得不够人久,你就不是优质生产力。
王鹤2:12:52
五年如果我们都不能形成万台级的规模化生产力 我们这里又被证美了 泡沫全是泡沫
五年如果我们都不能形成万台级的规模化生产力,我们这个领域又被证伪了,泡沫全是泡沫。
王鹤2:19:53
不要去搞一些砸我们行业招牌的事情了 比如承诺别人 你踩了就能训出来 你建厂你就能够有技能 我卖机器人你来踩 你踩你来训 明天他就是你的员工 这些模式是很可怕的 这些模式是在砸这个行业的饭碗
不要去搞一些砸我们行业招牌的事情了。比如承诺别人,你踩了就能训出来,你建厂你就能够有技能,我卖机器人你来踩,你踩你来训,明天他就是你的员工。这些模式是很可怕的,这些模式是在砸这个行业的饭碗。
王鹤2:22:54
数字与实体
| 王鹤年龄 | 33岁 | 3:02 |
| 银河通用估值 | 超过10亿美金 | 3:02 |
| 一台 full size 人形机器人制造成本 | 最少10万 | 1:55:35 |
| 维护一万台机器人每月成本 | 数亿到十亿 | 1:56:35 |
| 真实数据在银河通用训练数据中的比重 | 1%甚至更小 | 1:58:36 |
| Figure 估值 | 三四百亿美元 | 2:14:52 |
| Figure 出货量 | 10台还是20台 | 2:14:52 |
| 去年全球工业机械臂总产值 | 一千亿人民币 | 1:34:20 |
| 银河通用今年量产规模 | 千台级 | 1:39:23 |
术语
- sim2real仿真到真实迁移
- 在仿真器里训练的策略迁移到真实世界仍能工作。
- VLA视觉-语言-动作模型
- 把视觉、语言输入直接映射为机器人动作的大模型。
- perception action loop感知-行动闭环
- 感知决定动作,动作改变环境后再更新感知的循环。
- object goal navigation目标物体导航
- 在未知环境中找到指定物体的导航任务。
- six dof pose六维位姿
- 物体在三维空间中的位置加旋转姿态。
收听指南
做机器人、具身智能的创业者和投资人,尤其是正在纠结要不要自建真实数据采集管线、或者被 sim2real 争论困住的团队。
前40分钟的学术边缘史和快问快答可以快进,1:44之后才是判断。