世界太吵,來原聲聽播客

張小珺·商業訪談錄

具身智能還沒到GPT-1時刻,卡在數據沒scale up

螞蟻靈波沈宇軍判斷,具身智能還沒到GPT-1時刻,卡點是數據沒有scale up:互聯網數據比真機數據大兩個數量級,理想預訓練需百萬小時起步。為此團隊完全重做視覺預訓練,堅持從傳感器出發。

具身智能機器人大腦預訓練數據螞蟻靈波創業
這集少見地講透了具身原生模型的技術取捨和真實數據瓶頸,還誠實交代了MOE和單向建模的訓練代價,適合想判斷具身智能何時到臨界點的人。

核心論點 · 點時間戳可跳到原聲

5:19

放棄GAN:計算量利用效率太少

沈宇軍從2017年開始做生成模型,團隊一直堅持做GAN的scaling。哪怕在Diffusion火之後,今年年初還做了最後一次嘗試。雖然比前幾年進步,但GAN最大問題是計算量利用效率太少:Diffusion可以迭代多次生成一張圖,而GAN在生成複雜內容(尤其是視頻)時力不從心。他們把GAN積累的技術開源後畫上句號,但認為對抗訓練中同時訓兩個模型、互相博弈的技術沉澱不會沒用。

— 沈宇軍
23:05

數字世界模型不適配物理世界

第一代模型依賴數字世界模型做預訓練,但發現數字世界的開發動機與物理世界需求不匹配:視頻生成追求畫質,機器人動作並不需要高畫質。數字世界有自己的迭代節奏,沒法反向推動他們改模型,於是在26年決定全部基於物理世界需求重做,視覺相關的理解與生成從頭訓練,只有語言模型繼續複用LLM。另一個主張是堅持從真實傳感器出發,因為真實傳感器噪聲大,與學術界乾淨數據集天然相悖。

— 沈宇軍
42:03

深度估計改從幾何學起

第一代深度模型用的是DINO v2(數字世界語義模型),語義理解對於物理世界不夠——知道有隻狗,還需要知道距離。這次他們放棄DINO,完全從幾何角度(點線面、邊緣)重新做預訓練,再迭代出新的深度估計模型。例子:反光水龍頭能看到水流位置;玻璃門後的貓在新深度模型裡完全看不到,因為貓被玻璃擋住,需要拉開門才逐漸出現。語義理解裡貓一直在,但空間感知裡必須先撞到門。這解釋了為什麼數字世界的語義預訓練不能直接遷移到物理世界。

— 沈宇軍
51:27

物理世界原生:單向建模與MOE

數字世界生成視頻可以等30秒,雙向attention可以用;但機器人執行必須實時,歷史不能看到未來,所以模型必須單向建模。他們為此花了三四個月從零訓練單向attention——把雙向模型強行改成單向會導致預訓練知識遺忘,只能放棄。另一個技術點是原生MOE:要讓每個專家被等概率激活,稀疏得均勻才算真稀疏,光把MOE訓明白就花兩個月、失敗幾十次。物理世界可以捨棄畫質,這給了效率優化空間。

— 沈宇軍
1:07:31

GPT-1時刻未到,卡在數據

沈宇軍判斷具身智能今天還沒到GPT-1時刻,因為還沒有出現好的數據scale up方式。他們這次用了6萬小時真機數據,但沒有數量級提升,遠遠不夠。具身原生的預訓練仍依賴大量互聯網數據,互聯網數據比真機數據大兩個數量級。架構上已經原生,數據上還沒原生。當具身數據本身能scale up、至少跟互聯網達到相同量級時,才是他心目中的GPT-1時刻。

— 沈宇軍
1:23:10

為什麼只做大腦不做本體

今年很多公司轉向只做大腦,沈宇軍認為有兩層原因:一是單一本體很難通用,如果不通用就要選準場景來專用設計,否則成本必高;二是當前主要矛盾是大腦落後於本體,幹活還不夠好。大腦和本體一定是交替上升的,現在大腦落後,隨著做大腦的人變多,智能層跑得更快,某天會超過本體,屆時會催生一批由智能重新定義的本體公司。上一代硬件不一定能適應下一代模型。

— 沈宇軍
1:31:51

創業是賭出來的

第一次創業給沈宇軍的兩個教訓:落地層面,以前關注技術領先性,現在關注技術在哪方面領先——要選有價值的領先;創業層面,沒人知道哪條路一定成功,資源有限的情況下必須敢賭。如果大家都知道哪條路成功,大廠一定成功,輪不到自己。他承認三大賭:傳感器、原生模型、不做本體。原生是豪賭,可能訓到一半不收斂,也可能思路錯、太早進入或資源不夠,但這是必經之路。

— 沈宇軍
1:40:31

格局:兩三家創業公司加一兩個大廠

機器人大腦的競爭格局會和大模型類似:大廠裡出一兩個玩家,創業公司裡出兩三個,各自跑出包括數據、本體、場景在內的生態。因為有了生態,場景加本體帶來數據,模型會逐漸分化適合那個生態。進家庭之前每家模型會有不同特性,比如有的擅長精巧任務、有的擅長長程任務,最終會走向通用生態。

— 沈宇軍

原話 · 已逐字校驗

你能看到,但你摸不到,嗯,能看到是語義理解,摸不到是空間感知。

你能看到,但你摸不到,能看到是語義理解,摸不到是空間感知。

沈宇軍45:07

我我說就是MOE訓把MOE訓好是一個能力問題,他不是一個態度問題。

把MOE訓好是一個能力問題,不是一個態度問題。

沈宇軍55:55

巨深一定會有自己的模型,嗯,就是他為巨深設計的模型。

具身一定會有自己的模型,就是為具身設計的模型。

沈宇軍1:15:55

最好的預期就是我真的看到機器人進家庭了,然後進家庭的機器人跑的是凌波的模型,這是我最好的預期。

最好的預期就是我真的看到機器人進家庭了,然後進家庭的機器人跑的是靈波的模型,這是我最好的預期。

沈宇軍1:37:19

但至少在數據這方面,我覺得中國一定是比美國跑的快的。

但至少在數據這方面,我覺得中國一定是比美國跑得快的。

沈宇軍1:50:45

數字與實體

第二代預訓練數據量6萬小時33:29
第一代預訓練數據量(清洗後實際保留)約1萬多小時(原2萬小時經清洗)34:00
真機數據成本過去兩年降幅至少3倍35:36
後訓練所需數據量從約100條降至約20條1:06:31
互聯網數據量相對真機數據量大兩個數量級1:08:35
理想預訓練數據量百萬小時起步1:22:04
桌球任務後訓練採集數據量約20條1:11:40
把MOE訓明白耗時約2個月54:46
從零訓練單向attention耗時約三四個月56:56
Generalist公開數據量幾十萬小時(可能已近百萬)1:12:44

術語

Ego第一人稱視角數據
人戴頭部相機以自己視角採集操作視頻,用於機器人數據規模化。
WAM世界動作模型
從視頻學習世界如何響應動作,可作為機器人的世界模擬器或執行器。
VLA視覺-語言-動作模型
輸入視覺與語言指令、輸出動作的主流機器人操作路線。
MOE混合專家模型
稀疏激活架構,每次推理只激活部分參數,降低算力需求。

收聽指南

誰該聽

具身智能創業者、機器人算法工程師、關注物理世界AI的投資人,尤其是糾結做大腦還是做本體的團隊。

可跳過

開場16分鐘的個人學術經歷可快進,從螞蟻靈波緣起後進入正題。