世界太吵,來原聲聽播客

硅谷101

機器人操作比運動控制難兩三個數量級,硅谷卻押錯了方向

蘇度科技認為,硅谷主流端到端模仿學習路線在開放世界操作上存在根本缺陷,上下分層結構將在今年下半年重回主流。

具身智能機器人Sim2Real硅谷創業
這集信息密度高,適合想了解具身智能技術路線分歧、Sim2Real可行性以及硅谷機器人公司格局的創業者和投資人。

核心論點 · 點時間戳可跳到原聲

13:21

視頻訓練無法達到亞毫米級精度

韓錚解釋了為什麼不能直接用互聯網視頻訓練機器人操作。2D圖片和視頻裡雖然包含三維信息,但「不太全,也不太準」。自動駕駛導航只需要10公分左右的精度,但機器人操作要求亞毫米級——比如把線纜插到對應孔位。只有3D建模的數據集才能做到這種精度。仿真器要求機器人對幾何精度的理解達到毫米級甚至亞毫米級。

— 韓錚
28:05

零樣本通用抓取一次性成功率98%

蘇度R1在去年11月和12月內部測試中,連續一小時操作100多個物體、240次抓放,這些物體在訓練數據中從未出現過。單次抓放成功率接近98%,如果第一次失敗,機器人會用閉環控制迅速調整策略,做到100%。韓錚稱這是Sim2Real路線第一次填平差距。之後他們在ICRA和CVPR現場讓近1000人用隨機物體測試,這在以前學術會議上沒人做到過。

— 韓錚
34:22

短技能泛化比長程任務串聯更關鍵

韓錚認為,Zero-Shot穩定的開放世界基礎物體操作短技能,比長程任務復現更核心。如果短技能足夠穩定可靠、泛化性足夠高,就可以拼成各種長程操作。這也是ManiSkill框架的核心思想。蘇度團隊在2023年思維鏈提出同期,有一個叫Chain of Thought Predictive Control的工作,專門處理短任務串聯成長程任務。

— 韓錚
44:51

操作物體比運動控制難兩三個數量級

韓錚指出,仿真裡的強化學習和Sim2Real已經在波士頓動力、宇樹的人形機器人和四足狗的運動控制上得到充分驗證,英偉達Isaac裡一部分強化學習引擎也是蘇度團隊成員早期貢獻的。但機器人對物體做操作,難度要高兩到三個數量級。因為運動控制只需關注自身動作,不需要理解物體形狀、材質,也不需要知道怎麼移動到物體附近並做調整。

— 韓錚
53:27

無法復刻特斯拉,必須靠仿真冷啟動

韓錚解釋為什麼機器人不能像特斯拉那樣靠賣車收集數據。特斯拉十幾年前開始賣車,幾百萬司機在公路上天天開,數據自然積累。但機器人很難在沒有任何功能之前賣500萬臺到各個辦公室和家庭,旁邊還得有工人遙控。國內公司可能做到百臺甚至千臺規模,但離500萬臺、1000萬臺進每個家庭差很遠。所以冷啟動必須靠仿真,需要百萬甚至千萬級別在開放環境裡收集全數據。

— 韓錚
55:38

被硅谷拋棄的上下分層即將重回主流

韓錚透露,Physical Intelligence成立前在Google Robotics工作時,大家默契地認為底層模型有穩定操作能力後,上層做環境理解和任務拆分。但2023、2024年先後創業時,大家選擇了自己擅長和熟悉的端到端套路,不再提分層。韓錚的暴論是:從今年下半年開始,上下分層結構會重新回到主流,並可能是最終商業化方案。最近幾週學術界和工業界交流後,已有人意識到這可能是新方向。

— 韓錚
1:05:40

最看好DeepMind加波士頓動力Atlas

韓錚認為最大競爭對手是DeepMind加波士頓動力電動版Atlas。去年Demis Hassabis的採訪和紀錄片顯示,Google對物理世界AI的下注在所有大廠裡最堅決。他們已經把硬件平臺從Apptronik換成電動版Atlas,從波士頓動力硬件部門挖了核心人員到DeepMind。Google還收購了MuJoCo團隊,有自己的世界模型Genie 3,有幾乎無限的卡和最好的人才。韓錚認為這跟其他公司完全不在一個量級上。

— 韓錚
1:09:01

亞馬遜場景多但整合困難

韓錚認為亞馬遜一直是機器人領域投入最多的大公司,有倉儲物流的AGV、Kiva、各種機械臂和人形機器人公司如Agility、Covariant。它會提供場景,但最終要麼收購這些公司,要麼自己做。Covariant當時也把亞馬遜作為核心客戶之一。但整合多種機器人系統存在困難。

— 韓錚

原話 · 已逐字校驗

2D的圖片和視頻裡邊 三維的信息有 但是不太全 也不太準

2D的圖片和視頻裡,三維信息有,但不太全,也不太準。

韓錚13:21

單次對於這個物體 做抓放的成功率是將近98% 但是如果它第一次失敗之後 這個機器人 還會用一個閉環控制的方法 迅速地再去調整它的策略 就可以做到100%

單次對這個物體做抓放的成功率將近98%,但如果第一次失敗,機器人會用閉環控制方法迅速調整策略,就可以做到100%。

韓錚28:05

機器人 如果是要對於物體去做操作 它這個難度要高兩到三個數量級

機器人如果要對物體做操作,難度要高兩到三個數量級。

韓錚44:51

機器人你是很難 同一款機器 在沒有任何功能之前 我賣500萬臺機器人 到各個辦公室 家庭 或者是工廠裡邊去 並且旁邊還有一個工人在遙控它 去做各種各樣的操作

機器人很難同一款機器在沒有任何功能之前,賣500萬臺到各個辦公室、家庭或工廠,旁邊還有一個工人在遙控它做各種操作。

韓錚53:27

我們有一個暴論 可能從今年的下半年開始 上下分層的這種結構 會重新再回到主流裡邊來 而且可能在之後 大家選擇的方案推到商業化裡邊去 可能是最終的一個方法

我們有一個暴論:可能從今年下半年開始,上下分層的結構會重新回到主流,而且之後大家選擇的方案推到商業化裡,可能是最終的方法。

韓錚55:38

他可能是未來最 因為他硬件也有 軟件也有 我覺得這個跟其他公司 完全不是在一個量級上的

他可能是未來最強的,因為他硬件也有,軟件也有,我覺得這跟其他公司完全不在一個量級上。

韓錚1:05:40

數字與實體

蘇度R1零樣本抓取成功率單次98%,閉環調整後100%28:05
蘇度R1測試規模連續1小時,100多個物體,240次抓放28:05
ICRA現場測試人數近1000人32:11
操作比運動控制難度高2到3個數量級44:51
宇樹2025年出貨量5000多臺59:08
特斯拉Figure出貨量約150臺59:08
Skild AI最新估值140億到150億美元1:00:34
Skild AI融資額14億美元1:00:34
Physical Intelligence估值56億美元1:00:34
現代集團持有波士頓動力股份軟銀保留10%到20%1:08:58

術語

Sim2Real仿真到現實
讓機器人在虛擬仿真環境中訓練,再把學到的能力遷移到真實物理世界。
Zero-Shot零樣本
模型對訓練中從未見過的物體或環境直接完成任務,無需額外微調。
VLA視覺語言動作模型
以模仿人類動作為主的端到端模型,將視覺、語言和動作統一建模。
URDF統一機器人描述格式
一種用於描述機器人幾何和動力學約束的標準化文件格式。
teleops遙操作
人類通過遙控設備遠程操控機器人採集操作數據。

收聽指南

誰該聽

關注具身智能技術路線分歧的創業者、投資人和機器人工程師,尤其是想了解Sim2Real可行性、數據冷啟動策略和硅谷競爭格局的人。

可跳過

1:09:01到1:10:58關於亞馬遜和垂直場景商業化的討論,信息密度較低。