世界太吵,來原聲聽播客

張小珺·商業訪談錄

L3 不是 L2 的延長,而是 L4 的先導

理想自動駕駛團隊用端到端把 200 萬行代碼砍到 20 萬行,縱向控制第一次超過所有競品——不是人更聰明,是終於用做能力而不是做功能的方式做自動駕駛。

自動駕駛端到端理想汽車特斯拉基座模型
郎鹹朋是百度高精地圖出身、在理想待了七年的親歷者,把十年技術演進講成了可複用的判斷框架,後半段的自研決策細節比技術科普更值錢。

核心論點 · 點時間戳可跳到原聲

4:05

高精地圖這條路走不通,是因為中國有 970 萬公里普通道路

早期自動駕駛的假設是給地面鋪虛擬軌道:高精地圖加滿身激光雷達,像高鐵一樣跑。但高速公路只有 30 多萬公里,剩下 970 萬公里是普通道路,不可能全部鋪圖;就算鋪了,普通道路今天挖坑明天改道,更新速度也跟不上。所以 2018 年左右 Tesla 率先說不用高精地圖、不用激光雷達、走純視覺,方向看得非常對、非常準、非常早。當時業界有人不理解,有人理解了但已經投了太多錢做重激光雷達,轉不了身。

— 郎鹹朋
18:20

BEV 的關鍵不是拼圖,是先融合再反投

樸素做法是每個攝像頭各自識別,再把結果拼起來,這叫後融合。問題是你無法保證每一幀都識別對:這邊沒識別出人、那邊識別出來了,該信誰;一輛車這邊提取一半、那邊提取一半,拼出來到底是一米五還是三米。Tesla 的 BEV 是先把所有圖像信息統一做一次計算,恢復出真實世界裡的完整物體,再反投回每張圖,一致性有保證。郎鹹朋用質能方程打比方:先想到物質和能量可以轉換的人最厲害,用裂變還是聚變是後面的事。

— 郎鹹朋
31:25

用場景定義自動駕駛,窮舉不過來還會互相打架

很多創業公司標榜用嚴格手段定義所有場景:天氣分晴雨、雨還分大中小,車流分擁堵密集,光照分夜晚陰天,再乘上自車速度、對方狀態,組合上千萬種。問題有三個:一是場景太多窮舉不過來;二是場景之間不完全正交,改好一個右轉場景可能影響另一個下雨天車流量大的右轉;三是長尾想不到,半路穿出一匹馬、路面突然塌陷一個大坑,這些沒法定義。所以用場景劃分做自動駕駛這條路本身就不成立。

— 郎鹹朋
50:50

L3 不是 L2 的延長,而是 L4 的先導

郎鹹朋認為 L2 的場景設計不完也解決不完,解決一個還會影響另一個,所以 L3 不是 L2 加加加加出來的,無論從場景、做法還是本質上都不是延長。L3 和 L4 是一體研發的:L4 很性感但不能一步到位宣布全國都能 L4,所以要先把車位到車位的全場景能力走通,園區、城市、高速、閘機、ETC 都覆蓋,能力不夠時人監督,無接管路段比例越來越大,最後 A 點到 B 點全是無接管,那就是 L4。

— 郎鹹朋
57:51

200 公里接管一次,是推出 L3 的門檻

理想測算的關鍵指標是 MPI 接管率:高速 350 公里接管一次、城市 50 公里接管一次,綜合起來約 200 公里接管一次,就可以推出 L3 有監督自動駕駛。按每天開四五十公里算,差不多一週接管一次,而且這次接管還不一定是安全性接管,可能只是覺得開得不舒服。安全性要求更高,是十倍於人類駕駛的安全。這個數字把「什麼時候能上 L3」從感覺變成了可測算的門檻。

— 郎鹹朋
1:28:14

200 萬行代碼砍到 20 萬行,縱向控制第一次超過所有競品

4 月 15 號在中關村封閉開發,一個多月後郎鹹朋從中關村開到北京交通大學,確認沒有用一行規則。之前無圖版本和輕圖版本的代碼是 200 萬行,端到端之後只剩不到 20 萬行,縮減 90%。更讓他驚訝的是縱向加減速:以前在有圖無圖版本上怎麼調都調不到像人一樣緩緩剎停,端到端第一次上車就比之前開過的所有自動駕駛車、包括競品都好,問旁邊的人是不是用規則調過,回答是真沒調,就是學出來的。

— 郎鹹朋
1:32:16

供應商要求理想解散自動駕駛團隊,才肯繼續合作

2021 年做理想 ONE 升級款時,ADAS 供應商知道理想要做升級,不但要付昂貴開發費,還拒絕白盒交付,甚至附加條件是理想把之後的自動駕駛研發都交給他們做,並解散自己的自動駕駛團隊。郎鹹朋的原話是供應商覺得你一定要跪下來求他,因為沒時間了。他的回應是老子就算死也要站著死。大年初一李想打電話問他有沒有決心,他說來三年就等這個時候,做不出來就引咎辭職,李想隨即拉群宣布自研。

— 郎鹹朋
1:45:23

基座模型是地基,不做就是給別人打工

郎鹹朋判斷理想必須做自己的基座大模型,理由分必要性和可行性。必要性有三:一是供應風險,機座模型如同地基和基石,哪天不給你用了上面蓋多好都是空中樓閣;二是通用基座模型會適應所有客戶,不會按你的要求優化,你拿不到人工智能領域的頭部位置;三是等它真做好,它就是頭部企業,其他人可能都給它打工。他認為人工智能不會百花齊放,最終會收到為數不多幾個真正有基座大模型能力的企業手裡。

— 郎鹹朋

原話 · 已逐字校驗

我們之前無圖版本和清圖版本的代碼 這一條行數是200萬行代碼 現在只剩下不到20萬行 我們縮減了90%的代碼

我們之前無圖版本和輕圖版本的代碼是 200 萬行,現在只剩下不到 20 萬行,縮減了 90% 的代碼。

郎鹹朋1:28:14

我說你們是不是用規則 或者怎麼調呢 他說老婆我們真沒調 就是學出來的

我說你們是不是用規則或者怎麼調的,他說我們真沒調,就是學出來的。

郎鹹朋1:29:14

就是你貌似笨的方法 其實它是最捷徑的方式 因為你必須要把前面 吃的苦 或經歷的東西 你要經歷一遍 你才知道 它是為什麼一定要到現在的

就是你貌似笨的方法,其實它是最捷徑的方式,因為你必須要把前面吃的苦、經歷的東西經歷一遍,你才知道它為什麼一定要到現在這一步。

郎鹹朋1:39:22

數字與實體

特斯拉單車傳感器加芯片成本1000 美金,約六七千人民幣15:16
特斯拉自研芯片算力144 TOPS9:08
理想 L3 推出的接管率門檻綜合 200 公里接管一次(高速 350、城市 50)57:51
端到端後代碼行數變化從 200 萬行降到不到 20 萬行,縮減 90%1:28:14
理想自動駕駛團隊規模800 多人1:43:23
特斯拉自動駕駛團隊規模200 多人到 300 人1:43:23
第一版端到端模型訓練規模不到 100 萬 clips,當時是 60 萬還是 80 萬記不清1:25:12
理想自動駕駛年度投入幾十個億1:37:21

術語

BEV鳥瞰圖
Bird Eye View,把多攝像頭畫面統一成上帝視角的感知表示。
Transformer變換器架構
Google 提出的通用網絡架構,能把圖像等輸入向量化編碼。
VLM視覺語言模型
能識別理解場景元素的外掛模型,處理端到端沒見過的場景。
MPI接管率
平均多少公里需要人接管一次,衡量自動駕駛能力的關鍵指標。
VLA視覺語言動作模型
在基座模型上長出自動駕駛能力的形態,郎鹹朋說一到三年內會看到。
3DGS三維高斯重建
用高斯點重建真實場景,用於生成考試用的仿真題目。

收聽指南

誰該聽

做自動駕駛或具身智能的工程師、看智能駕駛供應鏈的投資人,以及想知道端到端到底改變了什麼的創業者。

可跳過

開頭 10 分鐘的技術科普偏基礎,熟悉 BEV 和激光雷達對比的可以快進到 50 分鐘。