機器人單模型開箱打平微調專才,組合泛化已有強證據
機器人單模型開箱追平微調專才,尤其能在從未見過的機械臂上組合泛化,這都依賴用提示詞馴服低質異構數據;瓶頸正在轉向可靠性、速度和物理分發。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
物理 AI 沒有人糾錯的第二次機會
過去能在現實世界裡賺錢的 ML 應用——推薦、廣告、ChatGPT、coding agent——最終決策大都是人做的:AI 給出建議,錯了人也能識別並糾正。物理 AI 不一樣,它是在真實世界直接做決定、直接對物理結果負責,所以要求的是低得多的錯誤率,而不是「可以犯錯」。Chelsea 給出的證據是 Waymo:一年前每週 25 萬次完全無人駕駛行程,說明這種完全自主的基於學習的系統物理可行;但同一個標尺放到機器人上,意味著像做意式濃縮這種需要力控、時序和搬杯不灑的任務,目標是 90% 以上成功率和連續長時間不失誤。這個「沒有人類兜底」的設定貫穿了後半段所有設計。
— Chelsea Finn真機 RL 撞的是機器人天,不是算力牆
PPO、GRPO 這些 RL 算法在語言模型上能 scale,是因為每次嘗試只是數據中心裡的一次推理,可以堆幾百萬次;機器人不行,它要真的用硬件在世界裡跑。粗算:把 LLM 式 RL 照搬到機器人——不做百萬或千萬次,只算一百萬條一分鐘任務軌跡——也要 700 個機器人天,而且這個任務比做咖啡還短。因此她做了兩個繞行設計:一、檢測到死衚衕軌跡就及時截斷,必要時讓人遠程干預機器人並示範恢復動作,避免真機時間浪費在無法帶來學習價值的錯誤路徑上;二、不再像 PPO 那樣對同一條 prompt 重複 rollout 很多次來估計好壞,而是訓練一個跨任務共享的通用 value function,用「距成功還有多久」給不同狀態打分,把採樣成本攤到多個任務上。
— Chelsea Finn機器人沒記憶,是因為視頻 token 太貴
目前多數機器人基礎模型根本沒有 memory/context——只看當前幀傳感器畫面。簡單重複動作能靠這種反射扛過去,但多步驟廚房清理這種長任務,機器人必須知道自己做到哪一步。為什麼不加 context?因為視頻進模型的 token 成本爆炸:10 秒、50Hz 控制頻率、四路相機、每幀約 256 tokens,直接拼進去就是約 50 萬 tokens;就算把採樣壓到每秒 1 幀,仍有 1 萬 tokens。Physical Intelligence 的做法是分時間尺度記憶:約 10 秒的短視頻記憶用更高效的方式編碼,長程部分壓成文字摘要再輸入。有了這套記憶,機器人才能連續 10-15 分鐘做「擦檯面、扔紙巾、把芥末放回冰箱、收碗、洗碗」的非重複流程,全程不需人。
— Chelsea Finn單模型開箱就打平專門微調的專才
機器人通用化對標語言模型,目標是從「預訓練後必須微調」走向「開箱即用」。對比實驗把單模型 PIO7 和前面為咖啡、紙箱構建等任務用 RL 後訓練專門調過的 PIO6 放在一起;結果是單模型零樣本的吞吐和成功率在各任務上持平或超過那些 specialists。這意味著過去每個機器人任務都要單獨跑 RL 後訓練的團隊,現在多了一個先不微調的選擇。PIO7 能做到這一點,技術關鍵是:把記憶、指令、子任務、數據質量元數據和可選的 subgoal 圖像全部打包成 prompt,把高度異構的數據混進同一個訓練配方。
— Chelsea Finn換個身體也會折衣,才叫真泛化
他們最看重的能力是 compositional generalization——把技能平移並重組成新任務。最初的測試是空氣炸鍋這種幾乎不在訓練集出現過的電器,機器人能執行「開鍋—放紅薯—關鍋」。真正的時刻發生在泛化到機器人本體時:摺疊數據全部來自左側小機器人,部署卻換到尺寸、連桿長度和關節配置都完全不同的雙臂 Biarm UR5E 上,沒有任何該平臺折衣訓練數據。第一次跑通的瞬間團隊說都被震撼到了;視頻是原速,它也會試錯、靠 subgoal image 自我糾正,最後把襯衫疊好。定量結果也很接近 human teleop 水平。這已不是任務匹配,而是概念理解。
— Chelsea Finn低質數據不是廢料,缺的是元數據
對數據配方的消融可能比結果本身更值得記。移走數據集裡最多樣化的子集時,模型在 held-out 任務上的性能大幅下跌;隨機刪掉 20% 不那麼關鍵的數據,性能只小幅下降——多樣性是泛化的主要燃料。更反直覺的一層在低質數據:不加 metadata 提示時,把數據從 80% 加到 100%(新增的都是低質量樣本),性能反而下降;但加了質量、時長等元數據提示後,同一批低質數據會把性能繼續推高。這也是她說的「能從低質數據裡榨出更多 juice」。這提醒所有做機器人數據的團隊:任務不是只收集高質量演示,而是把每一條數據的來源、質量和內容結構標註清楚。
— Chelsea Finn看費德勒打球學不會網球,機器人也一樣
被反覆問機器人沒有互聯網規模數據怎麼辦時,Chelsea 給出了清晰的邊界。人類視頻、帶字幕的網頁圖和 YouTube 能提供常識與任務知識,但它不是 robot 的 internet-scale dataset,原因是學習需要 train 和 test 分布一致:機器人在部署時要輸出自己平臺上的動作,它就需要自己平臺的 experience。她用的比喻很直接:看羅傑·費德勒打球不會讓我也會打網球;機器人看人幹活,也不能直接學會自己怎麼幹。未來數據的主體是已部署的機器人自主嘗試產生的經驗,冷啟動會靠遠程操作數據,但最終不能只依賴人類視頻。
— Chelsea Finn原話 · 已逐字校驗
Waymo passed the quarter of a million weekly autonomous rides, suggesting that it is really possible to develop a machine learning based system that can operate in a trustworthy and autonomous way directly in the physical world.
Waymo 達到了每週 25 萬次完全無人駕駛行程,說明開發一個基於機器學習、能在物理世界中以可信且自主方式運行的系統,是真正可能的。
Chelsea Finn5:09
say we had maybe not millions or tens of millions, but just one million trajectories of a one-minute robot task, this is even shorter than the espresso task that I talked about, this would correspond to 700 robot days to get high reliability for that task.
就算不做百萬或千萬次,只做一百萬條一分鐘的機器人軌跡——這比我剛才說的意式濃縮任務還短——也相當於 700 個機器人天,才能換來該任務的高可靠性。
Chelsea Finn8:14
And you feed in all four camera streams on the robot. And you use around kind of 256 tokens per image. This corresponds to passing in half a million tokens into your model, which is a lot of tokens.
把機器人上四路相機畫面都喂進去,每張圖大約 256 個 token,這等於一次性向模型輸入五十萬個 token——量非常大。
Chelsea Finn19:24
The first time we saw the robot do this, we were like floored because we, like there was no training data for this task.
我們第一次看到機器人完成這個任務時都震驚了,因為對這個任務,我們完全沒有訓練數據。
Chelsea Finn33:30
with the metadata prompting, the performance actually increases when you add that low quality data.
加上元數據提示之後,當低質量數據被加入時,性能反而會提升。
Chelsea Finn36:31
I don't know if we'll have a single moment that has the distribution that chat GPT had.
我不確定會出現一個像 ChatGPT 那樣獲得海量分發的單點時刻。
Chelsea Finn40:31
if I watch Roger Federer play tennis, it doesn't mean I can play tennis as well as him, unfortunately. And likewise, robots can't, like, watch a person doing something and then figure out how to do it themselves directly.
如果我看羅傑·費德勒打網球,並不意味著我也能打得和他一樣好;機器人也一樣,看著人做一件事,不等於它就能自己直接做出來。
Chelsea Finn47:32
數字與實體
| ChatGPT 達到 100 萬用戶用時 | 5 天 | 3:05 |
| 把 LLM 式 RL 照搬到 1 分鐘機器人任務的估算 | 100 萬條軌跡 ≈ 700 個機器人天 | 8:14 |
| 機器人連續做拿鐵的評估時長 | 13 小時 | 14:21 |
| RL 後訓練階段帶來的吞吐提升 | 約 2 倍 | 16:23 |
| 意式濃縮任務最終成功率 | 90% 以上 | 16:23 |
| PIO7 帶記憶自主完成非重複長任務時長 | 10-15 分鐘 | 20:25 |
| PIO7 與微調專才 PIO6 的對比 | 零樣本均匹配或超過後者 | 30:28 |
術語
- compositional generalization組合泛化
- 把已學會的技能或概念重組為沒見過的新組合,是模型具備概念理解和數據效率的標誌。
- subgoal image子目標圖像
- 模型生成一小段未來應達到的畫面,作為機器人下一步動作的視覺條件輸入。
- time-to-success距成功時間
- 一個標量價值估計:離任務成功還剩多久;越短表示當前狀態越好。
- RL post-training強化學習後訓練
- 在基礎模型預訓練後,針對具體任務用強化學習繼續優化,以提高可靠性與吞吐。
收聽指南
意圖自己訓練機器人的具身智能創業者和工程師、選機器人數據策略的人、判斷通用機器人落地節奏的投資人。
末尾談 PhD 和跨行求職的問答可跳過;其餘圍繞模型、數據與落地。