小鹏拆掉语言模型:Language 是毒药,简单即美
小鹏自动驾驶新负责人刘先明把 VLA 里的 Language 拆掉,用 27 万到 30 万小时纯视觉数据直接输出控制信号,因为 Language 是离散的、低效的,会成为数据规模化的瓶颈。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
拆掉 Language 才能让数据流起来
刘先明认为,VLA 里如果保留 Language 作为中间监督信号,就必然引入人的标注或质检,数据使用效率会变得极低。他把模型比作机器,数据是燃料,燃料里掺了 Language 这个环节就流不动。所以小鹏的做法是直接把 Language 拆掉,用 Vision 和 Language 一起作为输入,直接输出 Action,中间不经过 Language token。
— 刘先明Language 是离散空间,物理世界是连续的
刘先明解释,Language 本质上是离散的、需要 token 化的,而物理世界的模型输入是连续的视觉或传感器信号,输出是连续的控制量,比如纵向加速度和方向盘转角。用 Language 去生成离散 token 再翻译回连续控制量,是一个低效的过程。拆掉 Language 之后,模型不再依赖人的监督信号,可以像机器一样不停流入数据。
— 刘先明拆掉 Language 后用世界模型解决维度灾难
拆掉 Language 后,输入维度很高但输出空间很小,只有未来几秒的几十个控制量,刘先明称之为维度灾难。小鹏的解法是做世界模型,让模型先理解世界怎么运行,再输出动作。他把这比作文字模型里的 COT,只是不用文字做 COT,而是用 Latent COT,甚至让 COT 直接作为隐空间,通过生成视频或 Bird Eye 图来看模型对世界的理解。
— 刘先明拆 Language 的决策只讨论了一下就做了
刘先明说拆 Language 这件事大家讨论了一下,没有讨论太久,就觉得应该这么做。他解释原因:Language 本身是离散化的,物理 AI 的输入是连续信号,输出是连续动作,中间插一个 Language 作为表达方式没有必要。这个决策大约在今年上半年到年中做出,从 VLA 1.0 到 2.0,拆 L 是最重要的变化。
— 刘先明拆激光雷达、拆规则、拆语言,基本全拆了
刘先明说从去年到今年,小鹏拆了激光雷达、拆了规控规则、拆了端到端、又拆了语言,基本全拆了。他解释为什么 AI 的进展都是要不断拆掉冗余的东西,因为好的东西一定是简单的。拆规则是最难的,因为传统做法是模型表现不好就加 loss function 或规则,但小鹏选择顶住压力不加,坚持做 scaling 和极致简化。
— 刘先明加数据看到瓶颈时才发现 Language 是瓶颈
刘先明说,当加数据看到瓶颈、加不动的时候,才意识到 Language 是一个瓶颈。他解释,Language 输出结果太慢、太低效,增加很少的信号却要增加几百个 token,完全不 make sense。他还提到 DeepSeek 的 OCR 论文也是反共识的,说明没必要把图像对齐到文字的 token space 里。
— 刘先明拆掉 Language 后没有明显回落,直接看到提升
刘先明说拆掉 Language 后基本没有太多明显的回落,上来就看到明显的 scaling 和结果提升,原因是数据量足够大,现在训练一个模型大概用 27 万到 30 万小时的纯视觉数据。他们原本担心红绿灯、带转区等场景会不 work,但发现根本没有出现,非常自然地就过去了。
— 刘先明主机厂做自动驾驶的核心逻辑是数据
刘先明回应于凯关于主机厂不会自研自动驾驶的观点,说五年后再看。他认为主机厂做这件事有道理,核心逻辑是数据:主机厂能自动化找到数据分布的缺失点,迅速让车队第二天收上来数据,形成闭环,这是第三方很难规模化的。他说明年会在广州推 L4,基于同一套架构。
— 刘先明原话 · 已逐字校验
这是最简单 最直接的路径 但实际上这么做 它一定会带来像一种毒药一样 就是你会越来越重的去依赖于它
这是最简单、最直接的路径,但实际上这么做,它一定会带来像一种毒药一样,你会越来越重地去依赖它。
刘先明21:12
那既然这样想明白这个事情之后 我们就做了一个尝试 就是我干脆全都拆掉 全都拆掉
既然想明白了这个事情,我们就做了一个尝试,就是我干脆全都拆掉,全都拆掉。
刘先明22:13
简单就是美 就是世界上好的东西都一定是简单的 所以发现的过程往往也是简单的
简单就是美,世界上好的东西都一定是简单的,所以发现的过程往往也是简单的。
刘先明28:15
就是你拆掉这个东西的话 你一定是有回退的 或者是你全面AI化之后 有可能是有回退的 但是你可以通过 不停的数据迭代 和OTA的迭代 让它逐渐拉回来变得更好 就是上限可能会更高
你拆掉这个东西的话,你一定是有回退的,或者你全面 AI 化之后,有可能是有回退的,但是你可以通过不停的数据迭代和 OTA 的迭代,让它逐渐拉回来变得更好,就是上限可能会更高。
刘先明45:27
数字与实体
| 训练模型使用的纯视觉数据量 | 27 万到 30 万小时 | 1:00:39 |
| 数据规模增长速度 | 每个季度增长 30% 到 40% | 30:17 |
| Cruise 的 infra 团队规模 | 700 人 | 8:07 |
| 小鹏 2025 年 AI 和总价值投入 | 45 亿 | 1:18:47 |
| Vimo 在旧金山每周订单量 | 25 万个 | 1:34:59 |
术语
- VLA视觉语言动作模型
- 输入视觉和语言,直接输出动作的端到端模型架构。
- Latent COT隐空间思维链
- 不生成文字,而是在隐空间里做推理的思维链方式。
- scaling规模化
- 通过增加模型参数、数据量和算力来提升模型能力。
- Physical AI物理 AI
- 与物理世界交互的 AI,输入连续传感器信号,输出连续动作。
收听指南
关注自动驾驶技术路线、AI 战略转型的创业者和工程师,尤其是对 VLA、世界模型、端到端架构有判断需求的人。
1:46:07 之后的快问快答和结尾闲聊可跳过。