機器人操作比運動控制難兩三個數量級,硅谷卻押錯了方向
蘇度科技認為,硅谷主流端到端模仿學習路線在開放世界操作上存在根本缺陷,上下分層結構將在今年下半年重回主流。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
視頻訓練無法達到亞毫米級精度
韓錚解釋了為什麼不能直接用互聯網視頻訓練機器人操作。2D圖片和視頻裡雖然包含三維信息,但「不太全,也不太準」。自動駕駛導航只需要10公分左右的精度,但機器人操作要求亞毫米級——比如把線纜插到對應孔位。只有3D建模的數據集才能做到這種精度。仿真器要求機器人對幾何精度的理解達到毫米級甚至亞毫米級。
— 韓錚零樣本通用抓取一次性成功率98%
蘇度R1在去年11月和12月內部測試中,連續一小時操作100多個物體、240次抓放,這些物體在訓練數據中從未出現過。單次抓放成功率接近98%,如果第一次失敗,機器人會用閉環控制迅速調整策略,做到100%。韓錚稱這是Sim2Real路線第一次填平差距。之後他們在ICRA和CVPR現場讓近1000人用隨機物體測試,這在以前學術會議上沒人做到過。
— 韓錚短技能泛化比長程任務串聯更關鍵
韓錚認為,Zero-Shot穩定的開放世界基礎物體操作短技能,比長程任務復現更核心。如果短技能足夠穩定可靠、泛化性足夠高,就可以拼成各種長程操作。這也是ManiSkill框架的核心思想。蘇度團隊在2023年思維鏈提出同期,有一個叫Chain of Thought Predictive Control的工作,專門處理短任務串聯成長程任務。
— 韓錚操作物體比運動控制難兩三個數量級
韓錚指出,仿真裡的強化學習和Sim2Real已經在波士頓動力、宇樹的人形機器人和四足狗的運動控制上得到充分驗證,英偉達Isaac裡一部分強化學習引擎也是蘇度團隊成員早期貢獻的。但機器人對物體做操作,難度要高兩到三個數量級。因為運動控制只需關注自身動作,不需要理解物體形狀、材質,也不需要知道怎麼移動到物體附近並做調整。
— 韓錚無法復刻特斯拉,必須靠仿真冷啟動
韓錚解釋為什麼機器人不能像特斯拉那樣靠賣車收集數據。特斯拉十幾年前開始賣車,幾百萬司機在公路上天天開,數據自然積累。但機器人很難在沒有任何功能之前賣500萬臺到各個辦公室和家庭,旁邊還得有工人遙控。國內公司可能做到百臺甚至千臺規模,但離500萬臺、1000萬臺進每個家庭差很遠。所以冷啟動必須靠仿真,需要百萬甚至千萬級別在開放環境裡收集全數據。
— 韓錚被硅谷拋棄的上下分層即將重回主流
韓錚透露,Physical Intelligence成立前在Google Robotics工作時,大家默契地認為底層模型有穩定操作能力後,上層做環境理解和任務拆分。但2023、2024年先後創業時,大家選擇了自己擅長和熟悉的端到端套路,不再提分層。韓錚的暴論是:從今年下半年開始,上下分層結構會重新回到主流,並可能是最終商業化方案。最近幾週學術界和工業界交流後,已有人意識到這可能是新方向。
— 韓錚最看好DeepMind加波士頓動力Atlas
韓錚認為最大競爭對手是DeepMind加波士頓動力電動版Atlas。去年Demis Hassabis的採訪和紀錄片顯示,Google對物理世界AI的下注在所有大廠裡最堅決。他們已經把硬件平臺從Apptronik換成電動版Atlas,從波士頓動力硬件部門挖了核心人員到DeepMind。Google還收購了MuJoCo團隊,有自己的世界模型Genie 3,有幾乎無限的卡和最好的人才。韓錚認為這跟其他公司完全不在一個量級上。
— 韓錚亞馬遜場景多但整合困難
韓錚認為亞馬遜一直是機器人領域投入最多的大公司,有倉儲物流的AGV、Kiva、各種機械臂和人形機器人公司如Agility、Covariant。它會提供場景,但最終要麼收購這些公司,要麼自己做。Covariant當時也把亞馬遜作為核心客戶之一。但整合多種機器人系統存在困難。
— 韓錚原話 · 已逐字校驗
2D的圖片和視頻裡邊 三維的信息有 但是不太全 也不太準
2D的圖片和視頻裡,三維信息有,但不太全,也不太準。
韓錚13:21
單次對於這個物體 做抓放的成功率是將近98% 但是如果它第一次失敗之後 這個機器人 還會用一個閉環控制的方法 迅速地再去調整它的策略 就可以做到100%
單次對這個物體做抓放的成功率將近98%,但如果第一次失敗,機器人會用閉環控制方法迅速調整策略,就可以做到100%。
韓錚28:05
機器人 如果是要對於物體去做操作 它這個難度要高兩到三個數量級
機器人如果要對物體做操作,難度要高兩到三個數量級。
韓錚44:51
機器人你是很難 同一款機器 在沒有任何功能之前 我賣500萬臺機器人 到各個辦公室 家庭 或者是工廠裡邊去 並且旁邊還有一個工人在遙控它 去做各種各樣的操作
機器人很難同一款機器在沒有任何功能之前,賣500萬臺到各個辦公室、家庭或工廠,旁邊還有一個工人在遙控它做各種操作。
韓錚53:27
我們有一個暴論 可能從今年的下半年開始 上下分層的這種結構 會重新再回到主流裡邊來 而且可能在之後 大家選擇的方案推到商業化裡邊去 可能是最終的一個方法
我們有一個暴論:可能從今年下半年開始,上下分層的結構會重新回到主流,而且之後大家選擇的方案推到商業化裡,可能是最終的方法。
韓錚55:38
他可能是未來最 因為他硬件也有 軟件也有 我覺得這個跟其他公司 完全不是在一個量級上的
他可能是未來最強的,因為他硬件也有,軟件也有,我覺得這跟其他公司完全不在一個量級上。
韓錚1:05:40
數字與實體
| 蘇度R1零樣本抓取成功率 | 單次98%,閉環調整後100% | 28:05 |
| 蘇度R1測試規模 | 連續1小時,100多個物體,240次抓放 | 28:05 |
| ICRA現場測試人數 | 近1000人 | 32:11 |
| 操作比運動控制難度高 | 2到3個數量級 | 44:51 |
| 宇樹2025年出貨量 | 5000多臺 | 59:08 |
| 特斯拉Figure出貨量 | 約150臺 | 59:08 |
| Skild AI最新估值 | 140億到150億美元 | 1:00:34 |
| Skild AI融資額 | 14億美元 | 1:00:34 |
| Physical Intelligence估值 | 56億美元 | 1:00:34 |
| 現代集團持有波士頓動力股份 | 軟銀保留10%到20% | 1:08:58 |
術語
- Sim2Real仿真到現實
- 讓機器人在虛擬仿真環境中訓練,再把學到的能力遷移到真實物理世界。
- Zero-Shot零樣本
- 模型對訓練中從未見過的物體或環境直接完成任務,無需額外微調。
- VLA視覺語言動作模型
- 以模仿人類動作為主的端到端模型,將視覺、語言和動作統一建模。
- URDF統一機器人描述格式
- 一種用於描述機器人幾何和動力學約束的標準化文件格式。
- teleops遙操作
- 人類通過遙控設備遠程操控機器人採集操作數據。
收聽指南
關注具身智能技術路線分歧的創業者、投資人和機器人工程師,尤其是想了解Sim2Real可行性、數據冷啟動策略和硅谷競爭格局的人。
1:09:01到1:10:58關於亞馬遜和垂直場景商業化的討論,信息密度較低。