世界太吵,来原声听播客

张小珺·商业访谈录

L3 不是 L2 的延长,而是 L4 的先导

理想自动驾驶团队用端到端把 200 万行代码砍到 20 万行,纵向控制第一次超过所有竞品——不是人更聪明,是终于用做能力而不是做功能的方式做自动驾驶。

自动驾驶端到端理想汽车特斯拉基座模型
郎咸朋是百度高精地图出身、在理想待了七年的亲历者,把十年技术演进讲成了可复用的判断框架,后半段的自研决策细节比技术科普更值钱。

核心论点 · 点时间戳可跳到原声

4:05

高精地图这条路走不通,是因为中国有 970 万公里普通道路

早期自动驾驶的假设是给地面铺虚拟轨道:高精地图加满身激光雷达,像高铁一样跑。但高速公路只有 30 多万公里,剩下 970 万公里是普通道路,不可能全部铺图;就算铺了,普通道路今天挖坑明天改道,更新速度也跟不上。所以 2018 年左右 Tesla 率先说不用高精地图、不用激光雷达、走纯视觉,方向看得非常对、非常准、非常早。当时业界有人不理解,有人理解了但已经投了太多钱做重激光雷达,转不了身。

— 郎咸朋
18:20

BEV 的关键不是拼图,是先融合再反投

朴素做法是每个摄像头各自识别,再把结果拼起来,这叫后融合。问题是你无法保证每一帧都识别对:这边没识别出人、那边识别出来了,该信谁;一辆车这边提取一半、那边提取一半,拼出来到底是一米五还是三米。Tesla 的 BEV 是先把所有图像信息统一做一次计算,恢复出真实世界里的完整物体,再反投回每张图,一致性有保证。郎咸朋用质能方程打比方:先想到物质和能量可以转换的人最厉害,用裂变还是聚变是后面的事。

— 郎咸朋
31:25

用场景定义自动驾驶,穷举不过来还会互相打架

很多创业公司标榜用严格手段定义所有场景:天气分晴雨、雨还分大中小,车流分拥堵密集,光照分夜晚阴天,再乘上自车速度、对方状态,组合上千万种。问题有三个:一是场景太多穷举不过来;二是场景之间不完全正交,改好一个右转场景可能影响另一个下雨天车流量大的右转;三是长尾想不到,半路穿出一匹马、路面突然塌陷一个大坑,这些没法定义。所以用场景划分做自动驾驶这条路本身就不成立。

— 郎咸朋
50:50

L3 不是 L2 的延长,而是 L4 的先导

郎咸朋认为 L2 的场景设计不完也解决不完,解决一个还会影响另一个,所以 L3 不是 L2 加加加加出来的,无论从场景、做法还是本质上都不是延长。L3 和 L4 是一体研发的:L4 很性感但不能一步到位宣布全国都能 L4,所以要先把车位到车位的全场景能力走通,园区、城市、高速、闸机、ETC 都覆盖,能力不够时人监督,无接管路段比例越来越大,最后 A 点到 B 点全是无接管,那就是 L4。

— 郎咸朋
57:51

200 公里接管一次,是推出 L3 的门槛

理想测算的关键指标是 MPI 接管率:高速 350 公里接管一次、城市 50 公里接管一次,综合起来约 200 公里接管一次,就可以推出 L3 有监督自动驾驶。按每天开四五十公里算,差不多一周接管一次,而且这次接管还不一定是安全性接管,可能只是觉得开得不舒服。安全性要求更高,是十倍于人类驾驶的安全。这个数字把「什么时候能上 L3」从感觉变成了可测算的门槛。

— 郎咸朋
1:28:14

200 万行代码砍到 20 万行,纵向控制第一次超过所有竞品

4 月 15 号在中关村封闭开发,一个多月后郎咸朋从中关村开到北京交通大学,确认没有用一行规则。之前无图版本和轻图版本的代码是 200 万行,端到端之后只剩不到 20 万行,缩减 90%。更让他惊讶的是纵向加减速:以前在有图无图版本上怎么调都调不到像人一样缓缓刹停,端到端第一次上车就比之前开过的所有自动驾驶车、包括竞品都好,问旁边的人是不是用规则调过,回答是真没调,就是学出来的。

— 郎咸朋
1:32:16

供应商要求理想解散自动驾驶团队,才肯继续合作

2021 年做理想 ONE 升级款时,ADAS 供应商知道理想要做升级,不但要付昂贵开发费,还拒绝白盒交付,甚至附加条件是理想把之后的自动驾驶研发都交给他们做,并解散自己的自动驾驶团队。郎咸朋的原话是供应商觉得你一定要跪下来求他,因为没时间了。他的回应是老子就算死也要站着死。大年初一李想打电话问他有没有决心,他说来三年就等这个时候,做不出来就引咎辞职,李想随即拉群宣布自研。

— 郎咸朋
1:45:23

基座模型是地基,不做就是给别人打工

郎咸朋判断理想必须做自己的基座大模型,理由分必要性和可行性。必要性有三:一是供应风险,机座模型如同地基和基石,哪天不给你用了上面盖多好都是空中楼阁;二是通用基座模型会适应所有客户,不会按你的要求优化,你拿不到人工智能领域的头部位置;三是等它真做好,它就是头部企业,其他人可能都给它打工。他认为人工智能不会百花齐放,最终会收到为数不多几个真正有基座大模型能力的企业手里。

— 郎咸朋

原话 · 已逐字校验

我们之前无图版本和清图版本的代码 这一条行数是200万行代码 现在只剩下不到20万行 我们缩减了90%的代码

我们之前无图版本和轻图版本的代码是 200 万行,现在只剩下不到 20 万行,缩减了 90% 的代码。

郎咸朋1:28:14

我说你们是不是用规则 或者怎么调呢 他说老婆我们真没调 就是学出来的

我说你们是不是用规则或者怎么调的,他说我们真没调,就是学出来的。

郎咸朋1:29:14

就是你貌似笨的方法 其实它是最捷径的方式 因为你必须要把前面 吃的苦 或经历的东西 你要经历一遍 你才知道 它是为什么一定要到现在的

就是你貌似笨的方法,其实它是最捷径的方式,因为你必须要把前面吃的苦、经历的东西经历一遍,你才知道它为什么一定要到现在这一步。

郎咸朋1:39:22

数字与实体

特斯拉单车传感器加芯片成本1000 美金,约六七千人民币15:16
特斯拉自研芯片算力144 TOPS9:08
理想 L3 推出的接管率门槛综合 200 公里接管一次(高速 350、城市 50)57:51
端到端后代码行数变化从 200 万行降到不到 20 万行,缩减 90%1:28:14
理想自动驾驶团队规模800 多人1:43:23
特斯拉自动驾驶团队规模200 多人到 300 人1:43:23
第一版端到端模型训练规模不到 100 万 clips,当时是 60 万还是 80 万记不清1:25:12
理想自动驾驶年度投入几十个亿1:37:21

术语

BEV鸟瞰图
Bird Eye View,把多摄像头画面统一成上帝视角的感知表示。
Transformer变换器架构
Google 提出的通用网络架构,能把图像等输入向量化编码。
VLM视觉语言模型
能识别理解场景元素的外挂模型,处理端到端没见过的场景。
MPI接管率
平均多少公里需要人接管一次,衡量自动驾驶能力的关键指标。
VLA视觉语言动作模型
在基座模型上长出自动驾驶能力的形态,郎咸朋说一到三年内会看到。
3DGS三维高斯重建
用高斯点重建真实场景,用于生成考试用的仿真题目。

收听指南

谁该听

做自动驾驶或具身智能的工程师、看智能驾驶供应链的投资人,以及想知道端到端到底改变了什么的创业者。

可跳过

开头 10 分钟的技术科普偏基础,熟悉 BEV 和激光雷达对比的可以快进到 50 分钟。