仿真不等于仿真器:机器人数据荒里最赚钱的是原料商
具身智能还在 GPT-1 阶段,没找到 scaling law 的配方。真正卡住行业的是高质量物理资产和场景,而不是仿真器——所以做仿真器的人反而最不赚钱。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
长尾场景的合成数据配比可以到 1:1000
谢晨在 Cruise 做仿真时给出的经验是:合成数据与真实数据的配比没有固定答案,要分场景看。从整个数据盘子看,当时大约 30% 用合成数据;但对长尾场景,每个场景理想状态下要配 1000 到 1 万个合成数据,远超王鹤说的 1:99 或 1:100。原因是长尾场景太稀缺,一年也遇不到几次,只能靠仿真扩增。自动驾驶之所以真实数据仍占大头,是因为车被发明上百年,特斯拉、理想、小米这类车企有大量车在路上跑,司机本质上是替他们免费回传数据,成本只是计算和带宽。
— 谢晨具身智能的配比和自动驾驶完全相反
自动驾驶最大比例的数据一定是真实的,因为车这个平台有上百万辆在路上跑。但机器人平台没有被发明上百年,没有上百万辆人形机器人在全世界家里随便跑产生数据。所以谢晨的判断是:要推动具身智能发展,必须首先依赖大量合成数据,其次才是相对少量的真实数据,否则商业模式不可能成功。他也回应了「是不是必须要有这么多真实数据产业才能成功」的反问:摇操路线除非机器人能卖钱且赚钱,否则很难成立,特斯拉可能是唯一有机会走通跨州摇操的公司。
— 谢晨物理的 real2sim 才是真难点
real2sim 不是视觉上的真实到仿真,而是物理的真实到仿真。以冰箱为例:它有转轴、铰链、磁吸力,拉门时一开始要花较大力气,随着转轴角度变大所需力量越来越小;门和抽屉都是碰撞体,能和手产生力的交互。这些铰链、碰撞体、力学参数都需要采集——不同角度拉冰箱门要用多大力、不同种类冰箱的铰链结构如何、碰撞体如何设置。谢晨说现在世界上普遍的仿真资产里,冰箱门根本打不开,就算能打开,铰链、重量、所需拉力也是错的,而且往往只有单一品种,没有符合分布的多样性。
— 谢晨机器人本体的仿真模型也常常是错的
一个被忽略的点:像宇树这类机器人在真实世界的模型足够好,但在仿真里模型有很多问题。谢晨的客户遇到的情况是,机器人的手在真实世界可以拿起一公斤两公斤的东西,放到仿真里只能拿起零点一公斤,他们花了六个月以上还没调好这只手。所以好仿真不仅要对齐物理环境,还要对齐机器人本身。再往上做基于基座模型的 RL fine tune 时,如果环境需要感知在环,单卡能并行跑的环境数量很少,total fps 也足够低,并行效率和评价回环都会成为瓶颈。
— 谢晨Physical Intelligence 对外说不信仿真,内部强烈相信
谢晨认为 Physical Intelligence 是全球具身算法做得最好的公司,派零模型特别棒,Sergey 和 Chelsea 分别来自 Berkeley 和 Stanford。但这家公司对外说不相信仿真,内部又强烈相信仿真,导致它花很长时间找仿真负责人至今没找到。谢晨说他们发 offer 的人全是他的好朋友,而他都劝对方不要加入——因为作为一个最优秀的仿真人才,去一个公开宣称自己不相信仿真的公司很难接受。这些人后来不少去了 OpenAI、DeepMind、英伟达、特斯拉。谢晨判断这会是 PI 后面规模化最核心的问题,因为仿真核心还是帮助规模化。
— 谢晨Meta 买 Scale AI 买的是十万亿公司的入场券
谢晨说这笔收购名义 300 亿美金,Meta 实际付的钱大概 150 亿美金左右,本质是 acquihire,收购的是核心人才而非整个团队。他认为小扎看到的点是:未来十万亿公司的入场券是掌握 AI 数据的能力。类比十年前如果你是微软 CEO,有时光机看到现在的 AI 发展,一定会想买英伟达,因为算力是核心关键能力;现在小扎往未来十年看,缺的是数据。另一个细节是 Meta 并不是 Scale 最 top3 的客户,所以拿不到最好的数据,也训不出最好的模型。谢晨还判断十年后小扎退休,大概率是 Alexandr Wang 接班,因为他是极其 aggressive、极其追求个人 impact 的人。
— 谢晨老黄在内部说 NVIDIA is a simulation company
谢晨在英伟达时,老黄在内部就说 NVIDIA is a simulation company。英伟达最早是图形服务游戏,游戏本质上也是仿真,只是目标不同:游戏服务人的炫酷体验,现在服务物理 AI、机器人、自动驾驶,需要足够准确。老黄一直在讲 three computer problem:第一个是数据中心的计算机,英伟达已经拿下;第二个是端侧计算机,即物理 AI,车、机器人、无人机所需芯片;第三个就是 simulation。既然老黄把仿真列为三个计算机之一,说明他认为仿真计算的市场会与前两个相当,是万亿到十万亿级的市场。
— 谢晨具身智能还在 GPT-1 阶段,没找到 scaling law 配方
谢晨判断具身产业整体还在 GPT-1 阶段,还没找到可以规模化发展的配方。scaling law moment 的定义类似特斯拉 FSD:在端到端打通之前,不断加数据并没有让算法持续提升,遇到瓶颈;打通之后发现数据越多算法越好。具身现在还没到这个点。但他不认为是泡沫,因为具身现在的 founding team 优秀程度远高于当年 Waymo、Cruise 的创始团队——PI 的 Sergey、Chelsea,英伟达的朱玉可、Jim Fan,Skild 的 Deepak、Abhinav 都是最棒的科学家。加上资本关注度更高,且从 GPT 得到了 scale transformer、scale 数据算力的 insight,他乐观估计一两年内找到具身 scaling law 完全没问题。
— 谢晨原话 · 已逐字校验
因为他们对外 说他们不相信仿真 但是他们在内部又强烈的相信仿真 作为一个 最优秀的仿真的人才 为什么去一个 公开的都 宣称自己不相信仿真的公司
因为他们对外说不相信仿真,内部又强烈相信仿真。作为一个最优秀的仿真人才,为什么要去一个公开宣称自己不相信仿真的公司?
谢晨46:18
我认为就是说 meta他大概看到了一个很有意思的点 就是他认为 未来10万亿公司的入场券 你要掌握AI数据的能力
Meta 大概看到了一个很有意思的点:未来十万亿公司的入场券,是你要掌握 AI 数据的能力。
谢晨48:55
其实我当时在英伟达的时候 老黄在内部就说 NVIDIA is a simulation company
我当时在英伟达的时候,老黄在内部就说 NVIDIA is a simulation company。
谢晨1:15:33
其实你会发现仿真器的公司 都没有那么成功 就仿真不等于仿真器
你会发现仿真器公司都没有那么成功。仿真不等于仿真器。
谢晨1:37:50
数字与实体
| Meta 收购 Scale AI 名义金额 | 300 亿美金 | 48:55 |
| Meta 实际支付金额 | 约 150 亿美金 | 48:55 |
| Scale AI 当前估值 | 300 亿美金 | 51:19 |
| Figure 上一轮估值 | 300 亿美金 | 1:08:36 |
| 特斯拉自动驾驶团队规模 | 240 人 | 26:46 |
| Cruise 合成数据占整体数据比例 | 约 30% | 15:32 |
| 谢晨年龄 | 38 岁 | 2:00 |
| 光轮智能创立时间 | 2023 年 | 2:00 |
| 光轮智能融资轮次 | Series A | 2:00 |
术语
- Sim2Real仿真到现实
- 通过仿真训练机器人算法,再落地到真实机器人和场景。
- Real2Sim现实到仿真
- 把真实世界的场景、资产和物理参数映射到仿真里。
- data pyramid数据金字塔
- 底层互联网数据、中层合成仿真数据、顶层真实数据的分层结构。
- cross embodiment跨本体
- 同一套模型能在不同机器人本体上通用。
- acquihire人才收购
- 收购主要目的是获取核心人才,而非整个团队或产品。
- scaling law moment规模化拐点
- 加数据加算力就能持续提升算法表现的那个临界点。
收听指南
做具身智能、自动驾驶的创业者和工程师,以及关注机器人数据层投资机会的投资人。
2:00 快问快答和 1:37:37 最后的快问快答可跳过。