特斯拉FSD只是辅助驾驶的GPT-3时刻,不是L4
端到端让FSD一年内连升数版,但45分钟接管一次和Waymo的10万公里一次关键接管差约1000倍。L2要的是最优接管率,不是越低越好。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
辅助驾驶已到产品中期,无人驾驶还在Pre-A
孟醒用产品阶段而不是融资轮次来切:国内自动驾驶公司大多2016、2017年成立,跑了8年,融资轮次可能已经很靠后,但产品阶段还处在Pre-A和A轮。辅助驾驶已经是产品中期,无人驾驶还没有一个上限闭环、可有收入、大规模推出的产品。判断依据是用户量级——真正每天坐无人驾驶车、坐过超过一百次的人,相比网约车产品少得多得多。所以这个行业的信息基本只在业内人士之间通气,外界听到的评论很多是二手信息,追到根源那个人可能根本没体验过。
— 孟醒V12换架构没掉分,本身就是了不起
孟醒开得最多的是V12上线前最后一个非端到端版本11.3.6,以及上线后的12.3。他的个人判断和网上很多观点不一样:12.3跟V11最后一个版本其实差不太多。但从技术角度,V12换了一个纯新架构,表现没有下滑、保持一致甚至略有提升,这已经极度了不起——因为大家通常期待换架构要有十倍提升才算成功。12.3的特点是应对力强,遇到场景不会假装没看见,但成功率不高,高峰期高速汇车车流密时基本100%失败;反过来很多不预期能开启的场景它也能开启,比如后院、拦牛场。
— 孟醒L2的接管率不是越低越好,存在最优值
这是全篇最反常识的一条。孟醒跟不少同时做L2和L4的产品负责人、创始人讨论过,比较认同的观点是:在L2实现极高驾驶能力(基本是L5)之前,存在一个最优接管率,不是过高也不是过低。原因是人机共驾的安全由两个能力共同保障——车的自动驾驶能力,和人介入兜底的能力。接管里程提升的过程中,人的兜底能力反而下降:如果开三趟高速从没接管过,人一定不会再双手双脚眼睛全程盯着路。所以净能力不一定上升。最优是多少没人知道,有人说50公里,有人说100公里,有人说5000公里。L4则是完全另一个体系,绝对要做到最好、完全不接管,因为不假设有人兜底。
— 孟醒L1到L5的命名把能力和责任搅在一起
这套命名由美国公路管理局提出,数字越小需要人的参与度越高,L5完全不需要人参与。但它其实说了两件事:责任和能力。L4的意思是有限环境下完全不需要人参与,出了事不是人的责任而是系统的责任;同时它隐含了车具备在大多数情况下开得安全的能力。问题在于大家拿出来说的时候把这两件事混了——车企宣传L2、L3说的是能力,但定义的时候定义的是责任,而责任一般应该由法规来定义。所以车企可以说我具备L4能力,但以L2产品形式推出、符合L2法规,出了事责任在驾驶员。L2和L3责任都是驾驶员,L4责任是平台方。
— 孟醒V12是辅助驾驶的GPT-3时刻,不是ChatGPT时刻
孟醒明确说V12还不是自动驾驶的ChatGPT时刻,如果一定要类比,更像辅助驾驶里的GPT-3时刻。GPT-3时刻的含义是:把模型scale到一定规模后开始涌现一些能力,且没有后撤,涌现了以前没预想到的能力,同时确认这条路是正道可以继续。V12确实涌现了新能力——比如看似不该压线的地方突然压线但效率更高,比如停车场里自动调整避障,这些都没预先设置过、甚至没专门训练过,是埋在历史数据里自然习得的。但它还不是那个一下推出来、出圈、所有人都能用、口碑都说很好的产品。
— 孟醒FSD团队只有300人出头,靠不完美换速度
截至今年五月底,特斯拉FSD整个团队只有300人出头,这是FSD历史上最大的时刻,相当长一段时间小于两百人。孟醒给出两个原因:一是马斯克的管理风格,希望工作前路大、少数人少官僚,老板的需求和执行力可以直接传到最下层,架构非常扁平;二是接受不完美,到12.4版本之前高速和低速还是两个版本,很多做了一半的工程因为人手不够就先停了。这跟早期Facebook的Ship Fast & Break Things是一个模式——允许不完美,但做事要快。特斯拉一定有钱可以召一万人,它选择不这么做。
— 孟醒复刻FSD第一代版本要十几亿到三十亿美金
孟醒拆解了做成今天FSD样子需要的元素:团队、训练基础设施、数据采集。他认为人不是成本最高的,最贵的是训练基础设施——显卡、数据中心。特斯拉做到12.3之前可能是基于1万张H100的规模,1万张H100对应约3亿美金投入,他估算算一半,即1亿多美金在数据中心上。加上数据采集成本(前提是你已经有这么多车在外面采数据),第一代版本大概是十几亿到三十亿美金规模的投入,分摊在几年过程中。如果特斯拉花10块钱,复刻它一般花3到4块钱是正常比例。
— 孟醒国内几乎全员跟进,但兜底规则比特斯拉重
一线新势力、蔚小理、华为、Momenta等几乎都在跟进端到端,有些已有具体上线计划甚至已上线,每家从组织架构和人员梯队上都做了调整。但孟醒判断国内公司的端到端跟特斯拉有一点区别:核心模块类似,但国内公司相对更稳妥,会加一些规则兜底的模块,比特斯拉加得重一些,不太会把这块完全交给用户兜底。另外中国低速场景比美国复杂非常非常多,不做端到端可能压根达不到可上线的产品,所以对国内公司这变成了必然,投入可能更坚决。代际差上,特斯拉今年推出,大家可能落后一两年,但特斯拉没停,很难比。
— 孟醒原话 · 已逐字校验
过去有一个笑话 在我们这个行业里面 一直说无人驾驶 什么时候实现 然后这个答案 永远是五年之后 五年之后又是五年之后 然后永远好像实现不了 但其实到2020年实现了 Waymo已经公开 给大家打车的一个时间点 至少是进行式了 它已经不是 未来式的一个工作
过去行业里有个笑话,一直说无人驾驶什么时候实现,答案永远是五年之后,五年之后又是五年之后,好像永远实现不了。但其实到2020年就实现了,Waymo已经公开给大家打车,至少是进行式了,已经不是未来式的工作。
孟醒14:13
45分钟出现一次接管 这到底算不算过关这个产品体验对吧 就是对于大家来讲其实没有平凡标准的 很多人其实无从去认为 那确实也是 比如对于纯无人驾驶来讲 就是对于做L4的人来讲 45分钟一次接管 这简直是不可接受的一件事情 就是太差了 不是说能不能接受的问题 这是完全不可接受的一件事 但对辅助驾驶来讲 其实这可能就是属于代表了当时的水平
45分钟出现一次接管,这到底算不算过关?对大家来讲其实没有评判标准,很多人无从判断。对做L4的人来讲,45分钟一次接管简直不可接受,太差了,不是能不能接受的问题,是完全不可接受。但对辅助驾驶来讲,这可能就代表了当时的水平。
孟醒23:19
其实作为L2 直到它实现了极高极高的 车的驾驶能力之前 极高极高基本上是我们意义上的L5 这就是跟人类驾驶是什么一样 之前其实它是有一个最优接管率的 这个最优接管率不是过高也不是过低
作为L2,在实现极高极高的驾驶能力之前——极高极高基本就是我们意义上的L5,跟人类驾驶一样——其实存在一个最优接管率,不是过高也不是过低。
孟醒30:22
但是你想啊 什么样人一直要盯着这个自动驾驶系统 然后猜他能不能解决一个问题 且在解决不得的时候还要去接管 这个在我们行业里面的就叫安全测试员 这个测试员是我们要付钱给他 是一个其实蛮辛苦的工作
但你想想,什么样的人要一直盯着自动驾驶系统,猜它能不能解决一个问题,且在它解决不了的时候还要去接管?这在行业里就叫安全测试员,是我们付钱给他的,是一份蛮辛苦的工作。
孟醒37:24
GPT3时刻是什么呢 GPT3时刻是说 我把模型scale到 就是扩量到一定大之后 它开始所谓我们叫 涌现的一些能力 而且它没有后撤 它涌现了一些 我以前没有预想到的能力 且我认为这条路是正道 可以继续
GPT-3时刻是什么?是把模型scale到一定大之后,开始涌现一些能力,而且没有后撤,涌现了我以前没预想到的能力,并且我认为这条路是正道、可以继续。
孟醒53:32
但我觉得一年提升比如十倍 我觉得这个我可能看不到 12.3太远了 你都还没开始去呢 所以不知道12.3是什么 这个也无法评价
但我觉得一年提升十倍,这个我可能看不到。
孟醒1:12:41
其实我们需要看到证据的 你投入这么多 能投入一个亿 大概能看到一个什么样的结果 投入五个亿能看到一个什么样的结果 我觉得这个是我今天看到大家有点缺失的一个过程 就觉得这是一个好方向 特斯拉光买机器 把三个亿美金先投进去了 然后人反正就赶紧去 我们至少得追上 大家这么去干
其实我们需要看到证据:投入一个亿大概能看到什么结果,投入五个亿能看到什么结果。这是今天我看到大家有点缺失的过程——觉得这是个好方向,特斯拉光买机器先投了三个亿美金,人就赶紧去追,大家这么干。
孟醒1:15:43
数字与实体
| FSD团队人数(截至今年五月底) | 300人出头 | 54:11 |
| 特斯拉训练算力(12.3之前) | 1万张H100 | 1:17:32 |
| 1万张H100对应投入 | 约3亿美金 | 1:17:32 |
| 复刻FSD第一代版本投入估算 | 十几亿到三十亿美金 | 1:17:32 |
| 复刻FSD相对特斯拉的成本比例 | 特斯拉花10块钱,复刻花3到4块钱 | 1:17:32 |
| Waymo三番室内关键接管里程 | 约10万公里一次 | 27:19 |
| Waymo凤凰城关键接管里程 | 约30万公里一次 | 27:19 |
| FSD 12.5通用场景接管率 | 300到500英里或公里 | 27:19 |
| 特斯拉FSD北美渗透率 | 个位数百分比 | 1:29:54 |
| FSD订阅价格(降价后) | 99美金 | 1:29:54 |
术语
- MPI / MPCI接管里程 / 关键接管里程
- 两次接管之间行驶的里程,MPCI只统计不接管就会撞的关键接管。
- BEV + Transformer鸟瞰视角加Transformer
- 把多传感器融合到鸟瞰视角,并用Transformer做时序跟踪的感知架构。
- VLM视觉语言模型
- 多模态大模型,理想用它做系统2式的判断,但端上跑有约一秒延迟。
- Remote Assist远程协助
- L4车辆遇到自己处理不了的场景(如交警拦停)时向远程人类请求指令。
- garbage in garbage out垃圾进垃圾出
- 数据质量决定模型质量,数据清洗和处理能力比模型本身更重要。
收听指南
做自动驾驶或辅助驾驶的工程师、产品负责人,以及关注特斯拉FSD和端到端路线的投资人与创业者。
开头约8分钟的中美创业经历对比,与自动驾驶主线关系不大。