無臉跑不是醜,是強化學習自己選出的最優解
天工Omni為了跑得更快,自動放棄人類靠擺臂平衡的直覺,改用腰部扭動完成同樣功能——機器學到的解法未必好看,卻服從物理約束下的最優解。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
無臉跑是懲罰函數逼出的產物
天工Omni的招牌動作「無臉跑」不是團隊設計出來的,是強化學習自己學出來的結果。訓練時團隊給肩關節轉動角度設了懲罰函數,不讓機器人靠揮動上肢來保持平衡,機器人自己找到了用腰部扭動代替擺臂的方案。團隊一度覺得這個跑姿不夠漂亮,還想重新訓練一套更美觀的,但因為這就是跑得最快的解,最終直接拿去參賽。熊友軍把這稱作具身智能領域少見的湧現時刻。
— 熊友軍沒人知道Scaling Law要多少數據
天工的通用運動控制器用了幾百小時人類動作數據訓練,英偉達同類模型Sonic用了700多小時,量級相近。但被問到具身智能的Scaling Law何時兌現時,熊友軍直言現在都還不知道,千萬小時級的數據量可能是需要的,但現在的數據還有幾個數量級的差距。他更明確懷疑單純堆數據是否是正確路徑:大模型能堆數據是因為互聯網上有海量文本可用,具身智能未必有這個條件,更可能需要類似人類小孩試錯探索的新學習範式。
— 熊友軍去年獨家自主,今年全員自主
去年的馬拉松比賽,全場200多臺機器人裡只有天工是完全自主參賽,其餘隊伍都要靠人遙操跟跑;今年除了障礙賽偶爾需要遙控,其餘項目已經普遍實現全自主。熊友軍認為這個變化不是靠時間堆出來的,而是過去一年整個行業把資源和人才集中投向了機器人大腦——感知、決策、認知學習——的直接結果。
— 熊友軍真正做腦的公司不到5家
主持人拋出行業裡的一個說法:不依託政府和大廠、真正有足夠算力訓練大腦模型的獨立創業公司不超過5家。熊友軍沒有反駁這個判斷,只說自己沒做過統計,但認同訓練大腦對算力要求極高——他們靠百度的雲端算力和自建數據採集中心支撐,目前開源的數據採集量已接近20萬小時,是高質量數據。
— 熊友軍本田P2點燃夢想,也提前預告了它的落幕
熊友軍對機器人的熱愛始於2002年讀博時看到的一段視頻:本田的P2(阿西莫前身)帶著中國總理參觀工廠產線,那個畫面讓他確信人機共融的未來會到來。但本田當年的技術路線完全基於數學模型求解,戰略處理和視覺能力都很弱,揹著巨大的外置計算機背包;深度學習和大模型出現後,這套範式被整體顛覆,本田就像諾基亞錯過智能手機時代一樣,失去了人形機器人領域的領先地位。
— 熊友軍任務級遙操不是作弊,是分工
這屆運動會有隊伍因謊稱自主、實際靠遙操而被取消參賽資格,但遙操本身在規則裡被保留,原因是遙操分好幾個層級:普通人想像的是逐幀操控的傀儡式遙操;而更高級的任務級遙操,是人只給機器人一個複雜目標——比如判斷配電箱的開關要不要扳動——具體怎麼走過去、怎麼避障、怎麼執行完全由機器人自主完成。這是把人的判斷和機器的執行能力結合,不是完全代替機器人思考。
— 熊友軍國家隊的KPI是開源,不是營收
熊友軍形容自己從優必選CTO轉到創新中心一把手,是從公司的小我切換到國家和行業的大我:不再以最大化商業化為目標,而是站在全產業角度找共性痛點,把天工本體、慧思開悟等研發成果儘量開源開放,讓商業公司避免底層重複造輪子、浪費社會資源。創新中心的早期股東——優必選、小米、亦莊國投等——投的也不是商業回報,而是認可這個技術創新方向。
— 熊友軍機器人的最後一公里輸在信號損耗
有嘉賓在WRC的場合提出一個卡點:語言模型的輸入輸出是純數字編碼,嚴格限制在固定向量空間裡,幾乎沒有損耗;但機器人每一次輸入輸出——尤其是觸覺這類細微信號——都會引入偏差,幾乎無法修正,精度因此隨之暴跌。熊友軍認同這個判斷,稱團隊正在做的解法是把語言、視覺、觸覺等不同模態統一表徵進同一個向量空間再推理決策,這就是他們正在探索的大一統模型Pelican Unified。
— 熊友軍原話 · 已逐字校驗
故意是把他肩關節的轉動角度 做了一些限制 然後機器他為了跑那麼快 他自己需要保持平衡 然後自己訓練出跑制 所以他確確實實是自我學習 自我進化的一個結果
他們故意限制了機器人肩關節的轉動角度作為懲罰項,機器人為了跑得更快,自己需要保持平衡,於是自己訓練出了這種跑姿——這確確實實是它自我學習、自我進化的結果。
熊友軍2:01
我們一直覺得完全靠數據去逮集的話 這可能不一定是一個正確的一個方式
我們一直認為,完全靠堆數據,這可能不一定是正確的方式。
熊友軍10:04
今天我們的數據採集量其實已經非常大了 連採集的採集量快接近20萬小時了 而且這是高質量的數據
今天我們的數據採集量已經非常大了,採集量快接近20萬小時,而且這是高質量的數據。
熊友軍18:11
不同的模態的信號 信息的這個表徵 會帶來一些損耗 所以其實我們現在也在追求 對多模態的這個信息進行統一的表徵
不同模態的信號在做信息表徵時會帶來損耗,所以我們現在也在追求把多模態信息進行統一表徵。
熊友軍1:09:47
你機器人達不到安全的標準是不允許銷售的 否則的話可能會對社會對人的用戶造成一些不必要的一些意外 這是一個底線的問題
如果機器人達不到安全標準,是不允許銷售的,否則可能會對社會、對用戶造成不必要的意外——這是一個底線問題。
熊友軍1:20:56
數字與實體
| 天工Omni百米決賽成績 | 8秒64 | 5:01 |
| 天工Omni百米彩排成績 | 9秒44 | 5:01 |
| 天工通用運動控制器訓練數據量 | 幾百小時人類動作數據 | 8:04 |
| 英偉達Sonic控制器訓練數據量 | 700多小時人類數據 | 8:04 |
| 創新中心開源數據採集量 | 接近20萬小時 | 18:11 |
| 京東物流分揀人類最快速度 | 2000多件/小時 | 57:34 |
| 國內機器人物流分揀速度 | 1200-1300多件/小時 | 57:34 |
術語
- VLA視覺-語言-動作模型
- 把視覺感知、語言理解和動作輸出統一在一個模型裡做端到端控制
- Ego第一視角數據採集
- 頭戴攝像頭拍下人類第一視角操作畫面,用來低成本訓練機器人模仿學習
- World Model世界模型
- 讓機器人對物理世界的變化和因果關係做內部預測、推理的模型
- Unified Model大一統模型
- 把VLA、多模態大模型和世界模型的能力融合進同一套統一表徵空間的模型
- Scaling Law規模法則
- 模型性能隨數據和算力規模增長而提升的規律,大模型領域已驗證,具身智能領域仍未驗證
收聽指南
關注具身智能/機器人賽道的投資人、創業者,以及想搞清楚『國家隊』和商業公司開源博弈邏輯的從業者。
開場0:00-2:01是內容簡介與寒暄,可直接跳到無臉跑的技術解讀部分。