特斯拉那套数据闭环,在机器人身上走不通
特斯拉能收到最多数据,是因为它部署了最多自己的车,靠的是本体。但具身领域没有上百万台机器人,最多的数据必然来自仿真和人的第一视角,本体商当不成最好的大脑商。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
数据不是数据集,是教育系统
谢晨给数据的定义不是数据集,而是「能够帮助你去学习的信号,以及相应的这些经验的传授」。他把数据产业三个阶段跟教育类比:ImageNet 是静态数据集,相当于一次性的填鸭式教育,买一批教材发给学生;Scale AI 把数据变成工厂式流程,相当于量贩式教育;到了大模型时代,预训练吃完了互联网,重点转到后训练和评测,要靠能力很强的工程师、物理学家、数学金牌、律师、医生来出题、给评价标准,再根据评价因材施教,这才到了「师者所以传道授业解惑也」。所以数据是从静态数据集慢慢变成一个教育系统。
— 谢晨最有效的数据是先失败再成功
客户最早给光轮智能的需求是提供完全正确、完美的仿真长程任务数据,比如机器人做披萨:从冰箱拿出饼,放调料,放烤箱,按键,每个动作都不能出错。但客户和他们一起迭代后发现,最有效的数据是先失败再成功的数据——蘑菇没抓牢掉到桌上,捡起来再放回披萨上。这类被称作副样本或纠正数据的样本反而更贵、更有价值。谢晨的解释是,当模型的泛化能力提升以后,它更能从错误里把认知学回来,这更接近人的学习过程:失败了以后再成功的经验往往是最宝贵的。
— 谢晨用机械臂,恰恰因为不想碰硬件
大模型团队做 VLA 时选的是最简单的机械臂,而不做人形或轮式底盘,原因恰恰是他们不想做硬件相关的事——人形的维护和每个本体的调试都复杂得多。他们要的是零样本泛化:在十种、一百种任务上训练过,另外五个没见过的任务也能做出来。同时两边的基础设施差一个数量级:机器人公司有几千张卡已经很多了,大模型团队通常是大几万张;大规模并行的强化学习基础设施很难为了具身模型自研,而大模型团队已经有现成的,只是从大语言模型场景迁移去微调 VLA。
— 谢晨特斯拉的数据闭环在具身不成立
特斯拉的数据引擎本质是本体相关的逻辑:它在全世界部署了最多的车,收回最多的数据,训出最好的大脑,所以 OEM 自己就是最大的大脑商。谢晨认为这个逻辑在具身会被颠覆——世界上并不具备上百万台机器人部署在端侧执行任务,靠人摇操作成本又过高、无法规模化。所以具身的数据架构一定符合数据金字塔:最贵的真机数据量最小、最难规模化,中间是仿真,下面是互联网和人的第一视角数据。这意味着最多的具身数据一定不是本体提供的,不会有一个本体商既是最广泛应用的硬件、又是全世界最好的大脑——Optimus 的大脑就是交给 xAI 提供的。
— 谢晨顶级真机派过去三个月集体掉头
光轮智能最早服务的客户都是强的仿真 believer,而最顶级的 frontier lab、最顶级的大模型团队曾经是真实流派,绝对不愿意尝试任何仿真。但过去三个月,这些团队基本都成了客户。他们共同遇到的问题是没办法规模化自己的评测:真机数据或者学术界的 benchmark 打不出真正的 industry 意义,因为太简单、不够规模化。做家庭场景的大脑团队叠衣服、做家务已经做得很好,但他们需要一千个不同的家居场景和成千上万个任务随时评价自己,这个只能通过仿真拿到。
— 谢晨真机被高估,仿真评测被低估
谢晨的判断是:真实的机器人数据肯定被高估了,过去几个月连原来真机派的公司和大模型团队都在大规模采购仿真数据、仿真评测和人类数据。仿真整体还处于被低估的状态,而被低估得最厉害的是仿真的评测——大模型团队完全看到了这一点,因为没有仿真就做不了大规模评测;很多机器人公司因为规模还没那么大,等任务数量和开放场景上来才会越来越感到这个痛点,绕不开仿真。人类数据同样被低估,它补充和增强以仿真为中心的这条闭环,而不是替代它。
— 谢晨扯皮解决不了,只能靠共生
数据公司和模型公司之间的经典扯皮——数据方说你们模型没训好,模型方说你们数据采得不行——谢晨承认客观存在,并把它类比成 Scale AI 和 OpenAI 在 GPT 阶段的处境:大家其实在共同找寻数据的配方,大方向已经明确,差别在细节,比如从最早要完美的数据,到后来要副样本、纠错数据,再到要求分布更广,拿瓶子的方式不能每次都一样。解法是跟最领先的客户共生迭代。他说全世界真正能对大规模预训练级数据产生认知的团队极少,可能也就五个左右,光轮基本都跟他们有合作。
— 谢晨只解决一个数据问题就是评测
如果数据里只能解决一个最关键的问题就能实现大幅跃升,谢晨的答案是评测。理由是本体无关的数据的预训练通路和 scaling law 已经出现,评测成了真正的卡口——解决不了,大家就很难衡量自己智能的提升。对具身而言,必须把真正规模化的仿真评测做出来,这是所有人都会需要的能力。大模型那边同样卡在评测和后训练上,而且是魔高一尺道高一丈:模型能力提升以后,需要更牛的人去提供更好的反馈、制定更难的考题和更有效的评测指标。
— 谢晨原话 · 已逐字校验
但是后来 我们的客户包括我们一块通过迭代发现 其实最有效的数据是 先失败再成功的数据
但后来,客户和我们一起迭代发现,其实最有效的数据是先失败、再成功的数据。
谢晨33:26
比如说自动驾驶或者大圆模型 为什么他们的模型提升会那么快 自动驾驶本质上来讲 是因为他的评价是免费的
比如自动驾驶或者大语言模型,为什么它们的模型提升那么快?自动驾驶本质上是因为它的评价是免费的。
谢晨58:58
他们就是真实流派的 他们绝对不愿意去尝试 任何的仿真 但是其实咱们再看 我们过去的可能三个月的时间 过去的三个月时间 基本上他们都成为我们的客户
他们是真实流派,绝对不愿意尝试任何仿真;但过去三个月里,他们基本都成了我们的客户。
谢晨1:17:12
我认为仿真的话 我认为他更多的是需要 在一个足够物理准确的 一个环境中 可以可复现的 就以及可以可修正的 去产生相应的行动 并且观测到其结果 我认为这个才需要是一个仿真
仿真更多的是需要在足够物理准确的环境中,可复现、可修正地产生相应的行动,并且观测到结果——我觉得这才算一个仿真。
谢晨1:27:22
我现在观点是我认为智能越强 其实它对于知识的饥渴程度会越高 对于数据的饥渴程度会越高 但它可能就不想向外学习 它可能是自我学习
我现在的观点是,智能越强,它对知识的饥渴程度会越高,对数据的饥渴程度会越高;但它可能就不再向外学习,而是自我学习。
谢晨2:33:09
数字与实体
| 自动驾驶人工标注从业规模 | 估计十万人、几十万人 | 29:25 |
| 大模型后训练数据专家时薪 | 100 美金以上 | 30:25 |
| 大模型团队与机器人公司的卡数差距 | 机器人公司几千张卡已算很多,大模型团队大几万张 | 44:46 |
| 大模型与具身的数据成熟度打分 | 大模型 60 分,具身 0.6 分都不到 | 1:02:59 |
| Behavior 评测集最高成功率 | 100 道题,最高 26% | 1:06:01 |
| Generalist 使用的夹爪数据量 | 27 万小时 | 1:45:39 |
| 具身数据定价区间 | 一小时从几十人民币到上千人民币;做披萨这类数据几十到几千人民币不等,高质量数据在几百到上千人民币 | 1:58:46 |
| 光轮智能全职人数 | 一百来个,以工程技术方向为主 | 2:09:52 |
| 验证数据金字塔所需算力 | 几万张卡 | 2:14:56 |
术语
- Sim-to-Real仿真到真实的迁移
- 仿真里训出来的能力迁到真实机器人上时的性能落差,是仿真派被质疑的核心问题
- Shadow Mode影子模式
- 算法在车端只输出信号、不执行动作,与人的操作对比,差异就是免费的评价信号
- Data Engine数据引擎
- 评测反馈驱动、以系统而非人力为核心的数据生产闭环,区别于流水线式的 Data Factory
- Behavior具身智能评测集
- 李飞飞团队基于仿真打造的具身评测集,都是难的长程任务;后来还有用同一体系评测世界模型的 Enact
- VLA视觉-语言-动作模型
- 以基础大模型为底座的机器人行动模型,输入视觉和语言,输出动作
- Zero-shot零样本
- 没见过的任务也能做出来;谢晨认为不具备这种泛化能力的模型,不是通往通用智能的模型
收听指南
做具身智能和 AI 数据基础设施的创业者、看机器人赛道的投资人,以及大模型和机器人团队里管数据的人。
开头 12 分钟的求学与早期创业履历可以跳过,从 20 分钟的数据综述开始听。