仿真不等於仿真器:機器人數據荒裡最賺錢的是原料商
具身智能還在 GPT-1 階段,沒找到 scaling law 的配方。真正卡住行業的是高質量物理資產和場景,而不是仿真器——所以做仿真器的人反而最不賺錢。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
長尾場景的合成數據配比可以到 1:1000
謝晨在 Cruise 做仿真時給出的經驗是:合成數據與真實數據的配比沒有固定答案,要分場景看。從整個數據盤子看,當時大約 30% 用合成數據;但對長尾場景,每個場景理想狀態下要配 1000 到 1 萬個合成數據,遠超王鶴說的 1:99 或 1:100。原因是長尾場景太稀缺,一年也遇不到幾次,只能靠仿真擴增。自動駕駛之所以真實數據仍佔大頭,是因為車被發明上百年,特斯拉、理想、小米這類車企有大量車在路上跑,司機本質上是替他們免費回傳數據,成本只是計算和帶寬。
— 謝晨具身智能的配比和自動駕駛完全相反
自動駕駛最大比例的數據一定是真實的,因為車這個平臺有上百萬輛在路上跑。但機器人平臺沒有被發明上百年,沒有上百萬輛人形機器人在全世界家裡隨便跑產生數據。所以謝晨的判斷是:要推動具身智能發展,必須首先依賴大量合成數據,其次才是相對少量的真實數據,否則商業模式不可能成功。他也回應了「是不是必須要有這麼多真實數據產業才能成功」的反問:搖操路線除非機器人能賣錢且賺錢,否則很難成立,特斯拉可能是唯一有機會走通跨州搖操的公司。
— 謝晨物理的 real2sim 才是真難點
real2sim 不是視覺上的真實到仿真,而是物理的真實到仿真。以冰箱為例:它有轉軸、鉸鏈、磁吸力,拉門時一開始要花較大力氣,隨著轉軸角度變大所需力量越來越小;門和抽屜都是碰撞體,能和手產生力的交互。這些鉸鏈、碰撞體、力學參數都需要採集——不同角度拉冰箱門要用多大力、不同種類冰箱的鉸鏈結構如何、碰撞體如何設置。謝晨說現在世界上普遍的仿真資產裡,冰箱門根本打不開,就算能打開,鉸鏈、重量、所需拉力也是錯的,而且往往只有單一品種,沒有符合分布的多樣性。
— 謝晨機器人本體的仿真模型也常常是錯的
一個被忽略的點:像宇樹這類機器人在真實世界的模型足夠好,但在仿真裡模型有很多問題。謝晨的客戶遇到的情況是,機器人的手在真實世界可以拿起一公斤兩公斤的東西,放到仿真裡只能拿起零點一公斤,他們花了六個月以上還沒調好這隻手。所以好仿真不僅要對齊物理環境,還要對齊機器人本身。再往上做基於基座模型的 RL fine tune 時,如果環境需要感知在環,單卡能並行跑的環境數量很少,total fps 也足夠低,並行效率和評價迴環都會成為瓶頸。
— 謝晨Physical Intelligence 對外說不信仿真,內部強烈相信
謝晨認為 Physical Intelligence 是全球具身算法做得最好的公司,派零模型特別棒,Sergey 和 Chelsea 分別來自 Berkeley 和 Stanford。但這家公司對外說不相信仿真,內部又強烈相信仿真,導致它花很長時間找仿真負責人至今沒找到。謝晨說他們發 offer 的人全是他的好朋友,而他都勸對方不要加入——因為作為一個最優秀的仿真人才,去一個公開宣稱自己不相信仿真的公司很難接受。這些人後來不少去了 OpenAI、DeepMind、英偉達、特斯拉。謝晨判斷這會是 PI 後面規模化最核心的問題,因為仿真核心還是幫助規模化。
— 謝晨Meta 買 Scale AI 買的是十萬億公司的入場券
謝晨說這筆收購名義 300 億美金,Meta 實際付的錢大概 150 億美金左右,本質是 acquihire,收購的是核心人才而非整個團隊。他認為小扎看到的點是:未來十萬億公司的入場券是掌握 AI 數據的能力。類比十年前如果你是微軟 CEO,有時光機看到現在的 AI 發展,一定會想買英偉達,因為算力是核心關鍵能力;現在小扎往未來十年看,缺的是數據。另一個細節是 Meta 並不是 Scale 最 top3 的客戶,所以拿不到最好的數據,也訓不出最好的模型。謝晨還判斷十年後小扎退休,大概率是 Alexandr Wang 接班,因為他是極其 aggressive、極其追求個人 impact 的人。
— 謝晨老黃在內部說 NVIDIA is a simulation company
謝晨在英偉達時,老黃在內部就說 NVIDIA is a simulation company。英偉達最早是圖形服務遊戲,遊戲本質上也是仿真,只是目標不同:遊戲服務人的炫酷體驗,現在服務物理 AI、機器人、自動駕駛,需要足夠準確。老黃一直在講 three computer problem:第一個是數據中心的計算機,英偉達已經拿下;第二個是端側計算機,即物理 AI,車、機器人、無人機所需芯片;第三個就是 simulation。既然老黃把仿真列為三個計算機之一,說明他認為仿真計算的市場會與前兩個相當,是萬億到十萬億級的市場。
— 謝晨具身智能還在 GPT-1 階段,沒找到 scaling law 配方
謝晨判斷具身產業整體還在 GPT-1 階段,還沒找到可以規模化發展的配方。scaling law moment 的定義類似特斯拉 FSD:在端到端打通之前,不斷加數據並沒有讓算法持續提升,遇到瓶頸;打通之後發現數據越多算法越好。具身現在還沒到這個點。但他不認為是泡沫,因為具身現在的 founding team 優秀程度遠高於當年 Waymo、Cruise 的創始團隊——PI 的 Sergey、Chelsea,英偉達的朱玉可、Jim Fan,Skild 的 Deepak、Abhinav 都是最棒的科學家。加上資本關注度更高,且從 GPT 得到了 scale transformer、scale 數據算力的 insight,他樂觀估計一兩年內找到具身 scaling law 完全沒問題。
— 謝晨原話 · 已逐字校驗
因為他們對外 說他們不相信仿真 但是他們在內部又強烈的相信仿真 作為一個 最優秀的仿真的人才 為什麼去一個 公開的都 宣稱自己不相信仿真的公司
因為他們對外說不相信仿真,內部又強烈相信仿真。作為一個最優秀的仿真人才,為什麼要去一個公開宣稱自己不相信仿真的公司?
謝晨46:18
我認為就是說 meta他大概看到了一個很有意思的點 就是他認為 未來10萬億公司的入場券 你要掌握AI數據的能力
Meta 大概看到了一個很有意思的點:未來十萬億公司的入場券,是你要掌握 AI 數據的能力。
謝晨48:55
其實我當時在英偉達的時候 老黃在內部就說 NVIDIA is a simulation company
我當時在英偉達的時候,老黃在內部就說 NVIDIA is a simulation company。
謝晨1:15:33
其實你會發現仿真器的公司 都沒有那麼成功 就仿真不等於仿真器
你會發現仿真器公司都沒有那麼成功。仿真不等於仿真器。
謝晨1:37:50
數字與實體
| Meta 收購 Scale AI 名義金額 | 300 億美金 | 48:55 |
| Meta 實際支付金額 | 約 150 億美金 | 48:55 |
| Scale AI 當前估值 | 300 億美金 | 51:19 |
| Figure 上一輪估值 | 300 億美金 | 1:08:36 |
| 特斯拉自動駕駛團隊規模 | 240 人 | 26:46 |
| Cruise 合成數據佔整體數據比例 | 約 30% | 15:32 |
| 謝晨年齡 | 38 歲 | 2:00 |
| 光輪智能創立時間 | 2023 年 | 2:00 |
| 光輪智能融資輪次 | Series A | 2:00 |
術語
- Sim2Real仿真到現實
- 通過仿真訓練機器人算法,再落地到真實機器人和場景。
- Real2Sim現實到仿真
- 把真實世界的場景、資產和物理參數映射到仿真裡。
- data pyramid數據金字塔
- 底層互聯網數據、中層合成仿真數據、頂層真實數據的分層結構。
- cross embodiment跨本體
- 同一套模型能在不同機器人本體上通用。
- acquihire人才收購
- 收購主要目的是獲取核心人才,而非整個團隊或產品。
- scaling law moment規模化拐點
- 加數據加算力就能持續提升算法表現的那個臨界點。
收聽指南
做具身智能、自動駕駛的創業者和工程師,以及關注機器人數據層投資機會的投資人。
2:00 快問快答和 1:37:37 最後的快問快答可跳過。