具身智能還沒到GPT-1時刻,卡在數據沒scale up
螞蟻靈波沈宇軍判斷,具身智能還沒到GPT-1時刻,卡點是數據沒有scale up:互聯網數據比真機數據大兩個數量級,理想預訓練需百萬小時起步。為此團隊完全重做視覺預訓練,堅持從傳感器出發。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
放棄GAN:計算量利用效率太少
沈宇軍從2017年開始做生成模型,團隊一直堅持做GAN的scaling。哪怕在Diffusion火之後,今年年初還做了最後一次嘗試。雖然比前幾年進步,但GAN最大問題是計算量利用效率太少:Diffusion可以迭代多次生成一張圖,而GAN在生成複雜內容(尤其是視頻)時力不從心。他們把GAN積累的技術開源後畫上句號,但認為對抗訓練中同時訓兩個模型、互相博弈的技術沉澱不會沒用。
— 沈宇軍數字世界模型不適配物理世界
第一代模型依賴數字世界模型做預訓練,但發現數字世界的開發動機與物理世界需求不匹配:視頻生成追求畫質,機器人動作並不需要高畫質。數字世界有自己的迭代節奏,沒法反向推動他們改模型,於是在26年決定全部基於物理世界需求重做,視覺相關的理解與生成從頭訓練,只有語言模型繼續複用LLM。另一個主張是堅持從真實傳感器出發,因為真實傳感器噪聲大,與學術界乾淨數據集天然相悖。
— 沈宇軍深度估計改從幾何學起
第一代深度模型用的是DINO v2(數字世界語義模型),語義理解對於物理世界不夠——知道有隻狗,還需要知道距離。這次他們放棄DINO,完全從幾何角度(點線面、邊緣)重新做預訓練,再迭代出新的深度估計模型。例子:反光水龍頭能看到水流位置;玻璃門後的貓在新深度模型裡完全看不到,因為貓被玻璃擋住,需要拉開門才逐漸出現。語義理解裡貓一直在,但空間感知裡必須先撞到門。這解釋了為什麼數字世界的語義預訓練不能直接遷移到物理世界。
— 沈宇軍物理世界原生:單向建模與MOE
數字世界生成視頻可以等30秒,雙向attention可以用;但機器人執行必須實時,歷史不能看到未來,所以模型必須單向建模。他們為此花了三四個月從零訓練單向attention——把雙向模型強行改成單向會導致預訓練知識遺忘,只能放棄。另一個技術點是原生MOE:要讓每個專家被等概率激活,稀疏得均勻才算真稀疏,光把MOE訓明白就花兩個月、失敗幾十次。物理世界可以捨棄畫質,這給了效率優化空間。
— 沈宇軍GPT-1時刻未到,卡在數據
沈宇軍判斷具身智能今天還沒到GPT-1時刻,因為還沒有出現好的數據scale up方式。他們這次用了6萬小時真機數據,但沒有數量級提升,遠遠不夠。具身原生的預訓練仍依賴大量互聯網數據,互聯網數據比真機數據大兩個數量級。架構上已經原生,數據上還沒原生。當具身數據本身能scale up、至少跟互聯網達到相同量級時,才是他心目中的GPT-1時刻。
— 沈宇軍為什麼只做大腦不做本體
今年很多公司轉向只做大腦,沈宇軍認為有兩層原因:一是單一本體很難通用,如果不通用就要選準場景來專用設計,否則成本必高;二是當前主要矛盾是大腦落後於本體,幹活還不夠好。大腦和本體一定是交替上升的,現在大腦落後,隨著做大腦的人變多,智能層跑得更快,某天會超過本體,屆時會催生一批由智能重新定義的本體公司。上一代硬件不一定能適應下一代模型。
— 沈宇軍創業是賭出來的
第一次創業給沈宇軍的兩個教訓:落地層面,以前關注技術領先性,現在關注技術在哪方面領先——要選有價值的領先;創業層面,沒人知道哪條路一定成功,資源有限的情況下必須敢賭。如果大家都知道哪條路成功,大廠一定成功,輪不到自己。他承認三大賭:傳感器、原生模型、不做本體。原生是豪賭,可能訓到一半不收斂,也可能思路錯、太早進入或資源不夠,但這是必經之路。
— 沈宇軍格局:兩三家創業公司加一兩個大廠
機器人大腦的競爭格局會和大模型類似:大廠裡出一兩個玩家,創業公司裡出兩三個,各自跑出包括數據、本體、場景在內的生態。因為有了生態,場景加本體帶來數據,模型會逐漸分化適合那個生態。進家庭之前每家模型會有不同特性,比如有的擅長精巧任務、有的擅長長程任務,最終會走向通用生態。
— 沈宇軍原話 · 已逐字校驗
你能看到,但你摸不到,嗯,能看到是語義理解,摸不到是空間感知。
你能看到,但你摸不到,能看到是語義理解,摸不到是空間感知。
沈宇軍45:07
我我說就是MOE訓把MOE訓好是一個能力問題,他不是一個態度問題。
把MOE訓好是一個能力問題,不是一個態度問題。
沈宇軍55:55
巨深一定會有自己的模型,嗯,就是他為巨深設計的模型。
具身一定會有自己的模型,就是為具身設計的模型。
沈宇軍1:15:55
最好的預期就是我真的看到機器人進家庭了,然後進家庭的機器人跑的是凌波的模型,這是我最好的預期。
最好的預期就是我真的看到機器人進家庭了,然後進家庭的機器人跑的是靈波的模型,這是我最好的預期。
沈宇軍1:37:19
但至少在數據這方面,我覺得中國一定是比美國跑的快的。
但至少在數據這方面,我覺得中國一定是比美國跑得快的。
沈宇軍1:50:45
數字與實體
| 第二代預訓練數據量 | 6萬小時 | 33:29 |
| 第一代預訓練數據量(清洗後實際保留) | 約1萬多小時(原2萬小時經清洗) | 34:00 |
| 真機數據成本過去兩年降幅 | 至少3倍 | 35:36 |
| 後訓練所需數據量 | 從約100條降至約20條 | 1:06:31 |
| 互聯網數據量相對真機數據量 | 大兩個數量級 | 1:08:35 |
| 理想預訓練數據量 | 百萬小時起步 | 1:22:04 |
| 桌球任務後訓練採集數據量 | 約20條 | 1:11:40 |
| 把MOE訓明白耗時 | 約2個月 | 54:46 |
| 從零訓練單向attention耗時 | 約三四個月 | 56:56 |
| Generalist公開數據量 | 幾十萬小時(可能已近百萬) | 1:12:44 |
術語
- Ego第一人稱視角數據
- 人戴頭部相機以自己視角採集操作視頻,用於機器人數據規模化。
- WAM世界動作模型
- 從視頻學習世界如何響應動作,可作為機器人的世界模擬器或執行器。
- VLA視覺-語言-動作模型
- 輸入視覺與語言指令、輸出動作的主流機器人操作路線。
- MOE混合專家模型
- 稀疏激活架構,每次推理只激活部分參數,降低算力需求。
收聽指南
具身智能創業者、機器人算法工程師、關注物理世界AI的投資人,尤其是糾結做大腦還是做本體的團隊。
開場16分鐘的個人學術經歷可快進,從螞蟻靈波緣起後進入正題。