世界太吵,來原聲聽播客

張小珺·商業訪談錄

小鵬拆掉語言模型:Language 是毒藥,簡單即美

小鵬自動駕駛新負責人劉先明把 VLA 裡的 Language 拆掉,用 27 萬到 30 萬小時純視覺數據直接輸出控制信號,因為 Language 是離散的、低效的,會成為數據規模化的瓶頸。

自動駕駛VLA世界模型小鵬物理AI
一位從 Meta、Cruise 到小鵬的技術負責人,講清楚為什麼拆掉 Language 是反共識但有效的路徑,以及一家車企如何向物理 AI 轉型。

核心論點 · 點時間戳可跳到原聲

19:11

拆掉 Language 才能讓數據流起來

劉先明認為,VLA 裡如果保留 Language 作為中間監督信號,就必然引入人的標註或質檢,數據使用效率會變得極低。他把模型比作機器,數據是燃料,燃料裡摻了 Language 這個環節就流不動。所以小鵬的做法是直接把 Language 拆掉,用 Vision 和 Language 一起作為輸入,直接輸出 Action,中間不經過 Language token。

— 劉先明
22:13

Language 是離散空間,物理世界是連續的

劉先明解釋,Language 本質上是離散的、需要 token 化的,而物理世界的模型輸入是連續的視覺或傳感器信號,輸出是連續的控制量,比如縱向加速度和方向盤轉角。用 Language 去生成離散 token 再翻譯回連續控制量,是一個低效的過程。拆掉 Language 之後,模型不再依賴人的監督信號,可以像機器一樣不停流入數據。

— 劉先明
23:14

拆掉 Language 後用世界模型解決維度災難

拆掉 Language 後,輸入維度很高但輸出空間很小,只有未來幾秒的幾十個控制量,劉先明稱之為維度災難。小鵬的解法是做世界模型,讓模型先理解世界怎麼運行,再輸出動作。他把這比作文字模型裡的 COT,只是不用文字做 COT,而是用 Latent COT,甚至讓 COT 直接作為隱空間,通過生成視頻或 Bird Eye 圖來看模型對世界的理解。

— 劉先明
27:15

拆 Language 的決策只討論了一下就做了

劉先明說拆 Language 這件事大家討論了一下,沒有討論太久,就覺得應該這麼做。他解釋原因:Language 本身是離散化的,物理 AI 的輸入是連續信號,輸出是連續動作,中間插一個 Language 作為表達方式沒有必要。這個決策大約在今年上半年到年中做出,從 VLA 1.0 到 2.0,拆 L 是最重要的變化。

— 劉先明
44:26

拆激光雷達、拆規則、拆語言,基本全拆了

劉先明說從去年到今年,小鵬拆了激光雷達、拆了規控規則、拆了端到端、又拆了語言,基本全拆了。他解釋為什麼 AI 的進展都是要不斷拆掉冗餘的東西,因為好的東西一定是簡單的。拆規則是最難的,因為傳統做法是模型表現不好就加 loss function 或規則,但小鵬選擇頂住壓力不加,堅持做 scaling 和極致簡化。

— 劉先明
58:37

加數據看到瓶頸時才發現 Language 是瓶頸

劉先明說,當加數據看到瓶頸、加不動的時候,才意識到 Language 是一個瓶頸。他解釋,Language 輸出結果太慢、太低效,增加很少的信號卻要增加幾百個 token,完全不 make sense。他還提到 DeepSeek 的 OCR 論文也是反共識的,說明沒必要把圖像對齊到文字的 token space 裡。

— 劉先明
1:00:39

拆掉 Language 後沒有明顯回落,直接看到提升

劉先明說拆掉 Language 後基本沒有太多明顯的回落,上來就看到明顯的 scaling 和結果提升,原因是數據量足夠大,現在訓練一個模型大概用 27 萬到 30 萬小時的純視覺數據。他們原本擔心紅綠燈、帶轉區等場景會不 work,但發現根本沒有出現,非常自然地就過去了。

— 劉先明
1:12:43

主機廠做自動駕駛的核心邏輯是數據

劉先明回應於凱關於主機廠不會自研自動駕駛的觀點,說五年後再看。他認為主機廠做這件事有道理,核心邏輯是數據:主機廠能自動化找到數據分布的缺失點,迅速讓車隊第二天收上來數據,形成閉環,這是第三方很難規模化的。他說明年會在廣州推 L4,基於同一套架構。

— 劉先明

原話 · 已逐字校驗

這是最簡單 最直接的路徑 但實際上這麼做 它一定會帶來像一種毒藥一樣 就是你會越來越重的去依賴於它

這是最簡單、最直接的路徑,但實際上這麼做,它一定會帶來像一種毒藥一樣,你會越來越重地去依賴它。

劉先明21:12

那既然這樣想明白這個事情之後 我們就做了一個嘗試 就是我乾脆全都拆掉 全都拆掉

既然想明白了這個事情,我們就做了一個嘗試,就是我乾脆全都拆掉,全都拆掉。

劉先明22:13

簡單就是美 就是世界上好的東西都一定是簡單的 所以發現的過程往往也是簡單的

簡單就是美,世界上好的東西都一定是簡單的,所以發現的過程往往也是簡單的。

劉先明28:15

就是你拆掉這個東西的話 你一定是有回退的 或者是你全面AI化之後 有可能是有回退的 但是你可以通過 不停的數據迭代 和OTA的迭代 讓它逐漸拉回來變得更好 就是上限可能會更高

你拆掉這個東西的話,你一定是有回退的,或者你全面 AI 化之後,有可能是有回退的,但是你可以通過不停的數據迭代和 OTA 的迭代,讓它逐漸拉回來變得更好,就是上限可能會更高。

劉先明45:27

數字與實體

訓練模型使用的純視覺數據量27 萬到 30 萬小時1:00:39
數據規模增長速度每個季度增長 30% 到 40%30:17
Cruise 的 infra 團隊規模700 人8:07
小鵬 2025 年 AI 和總價值投入45 億1:18:47
Vimo 在舊金山每週訂單量25 萬個1:34:59

術語

VLA視覺語言動作模型
輸入視覺和語言,直接輸出動作的端到端模型架構。
Latent COT隱空間思維鏈
不生成文字,而是在隱空間裡做推理的思維鏈方式。
scaling規模化
通過增加模型參數、數據量和算力來提升模型能力。
Physical AI物理 AI
與物理世界交互的 AI,輸入連續傳感器信號,輸出連續動作。

收聽指南

誰該聽

關注自動駕駛技術路線、AI 戰略轉型的創業者和工程師,尤其是對 VLA、世界模型、端到端架構有判斷需求的人。

可跳過

1:46:07 之後的快問快答和結尾閒聊可跳過。