世界太吵,來原聲聽播客

十字路口Crossing

機器人還在 GPT-1 階段,真正的信號是成功率不是 Loss

具身智能的 Scaling Law 信號已經出現,但測的指標錯了:Loss 低不等於成功率低,中間 17 步不接觸物體的擬合毫無意義。

具身智能機器人世界模型In-Context LearningScaling Law
清華叉院助理教授徐夢迪講具身智能的數據、世界模型與 In-Context Learning,中後段關於數據閉環和 Loss 陷阱的判斷最值錢。

核心論點 · 點時間戳可跳到原聲

12:15

預訓練不是全部,適應才是

徐夢迪的 CMU 最佳博士論文叫 Building Adaptable Generalist Robots,核心主張是:預訓練非常有用,但不能寄希望於機器人只靠預訓練就 100% 成功。開放世界的特點是任務不斷變化——家裡今天 20 個物體,一週後變 30 個且種類不同,人的偏好也在變。所以機器人必須能在部署環境裡適應變化並提升自己。她探索了兩條路:In-Context Learning 和 test-time training,後者只改 0.5% 的 adapter 參數,但改多了會遺忘預訓練知識。

— 徐夢迪
19:22

Adaptation 為什麼現在才變重要

人的泛化強有兩個原因:極強的先驗知識,以及學東西非常快。之前主流做法是 scale 數據和模型,讓 multi-task 和 instruction following 能力變強,相當於先讓模型有足夠強的 prior。但徐夢迪指出,這不代表 adaptation 不重要——只是大家最近才意識到。而且 adaptation 對 base 模型有要求:不希望機器人到了實際場景自己學的過程非常可怕,比如把杯子打碎。所以從預訓練做起是合理的。

— 徐夢迪
49:46

Loss 低不等於成功率高

這是全篇最反常識的技術判斷。機器人裡有一個很 tricky 的點:Loss 跟成功率不是直接掛鉤的,Loss 很低但 Final Success Rate 不一定低,會有很多震盪。她舉的例子是:一個任務可能一共花 20 個 step,前 17 步都跟物體沒有接觸,即使這 17 步 fit 得非常好,第 18 步真正接觸物體時誤差比較大,任務就很容易失敗。這是時序上的不平衡。所以真正有意義的 Scaling Law 應該是:數據逐漸增多、模型逐漸變大,在沒見過任務上的 success rate 逐漸升高。

— 徐夢迪
50:47

機器人還在 GPT-1 時刻

現在主流的具身模型還是「預訓練 + 根據 target domain 做 fine-tuning」,這可以類比成 language model 的 GPT-1 階段——GPT-1 本身也需要有針對性的後訓練才能解決相應任務。徐夢迪真正希望做到的是 GPT-3 時刻:通過 ICL、通過 prompting 給模型任務信息,不需要 fine-tuning,只通過 context 告訴模型要做什麼。這樣 fine-tuning 的比重降得更弱,更容易 scale 到更多場景、完成更多任務,普通人也能用起來。

— 徐夢迪
58:49

數據閉環是雞生蛋難題

最難的點是能不能讓模型有一個穩定的數據閉環。這需要把機器人放到終端家庭或服務場景,有合適的 mentor 來教,並且機器人在被教了半小時之後要有顯而易見的進展,終端用戶才願意用,數據閉環才能轉起來。但這裡有個雞生蛋問題:base 模型需要足夠好、學習速度足夠快,可模型又需要先進入場景讓用戶開始用,才能把 base 能力激發出來。所以能不能跑通數據閉環是最 risky 的一個點。

— 徐夢迪
1:03:52

數據定義靠模型能力反推

數據本身會被餵給模型,但數據的定義不是憑空定出來的,是靠模型的能力定出來的。大家在定數據時,本身在做的事就是:模型到底需要什麼樣的能力,反推出來數據應該怎麼採集。比如需要動作更平滑,數據就要是平滑類型的;需要 fail recovery 能力,數據就要採集有 fail、有修正的。而現在大家對模型能力的定義還比較模糊,所以數據需求也模糊。

— 徐夢迪
1:05:54

四種數據各有各的位置

徐夢迪的主張是融合派,因為不同數據讓模型學到的東西不一樣。遙操作數據最接近機器人本體,適合訓練後階段,讓模型跟 target domain 更直接相關。仿真數據容易造出位置泛化和 texture 泛化,讓模型對 visual 變化更魯棒,適合預訓練或 mid-training 前端。UMI 數據在中間,更像機器人數據但採集成本低。人類數據成本最低,可以大量鋪到不同場景,學的是場景變化和任務相關信息,跟 morphology 具體形狀不那麼相關。

— 徐夢迪
1:19:02

AI 寫的論文一眼能看出來

Robotics 論文最近在翻倍增長,徐夢迪的應對方式是刷自己關注的 researcher 宣傳的文章,因為作者 list 本身已經做了一層篩選。她能明顯看到有些文章 AI 寫的成分非常多。她的判斷是:AI 寫的文章可能能通過審稿、真的中一些會議,但 quality 整體上還是不會有人寫的更高,因為看起來相識,實際有很多論證漏洞百出,內容並沒有很多。發現是 AI 寫的,她對這篇文章的興趣就會打折扣。

— 徐夢迪

原話 · 已逐字校驗

最難的點其實是 嗯 能不能讓這個模型 有一個穩定的數據的閉環

最難的點其實是,能不能讓這個模型有一個穩定的數據閉環。

徐夢迪58:49

數據本身它是會被餵給模型的對吧 但數據的定義其實不是憑空定出來的 數據定義是靠模型的能力定出來的

數據本身是會被餵給模型的,對吧?但數據的定義其實不是憑空定出來的,數據定義是靠模型的能力定出來的。

徐夢迪1:03:52

數字與實體

adapter 參數佔比0.5%15:16
機器人任務 step 數示例20 個 step49:46
預訓練數據規模信號10 萬小時到 100 萬小時48:44
具身馬拉松進度10 公里 / 四分之一1:19:02
徐夢迪年齡30.5 歲0:00

術語

In-Context Learning上下文學習
不改模型參數,只通過 prompt 裡的上下文讓模型適應新任務。
VLA視覺-語言-動作模型
把視覺、語言指令直接映射到機器人動作的模型。
UMI通用操作接口數據
介於機器人數據和人類數據之間的採集方式,成本較低。
MAML模型無關元學習
讓模型學會快速適應沒見過的任務,徐夢迪入行的契機。
algorithm distillation算法蒸餾
DeepMind 工作,主張模型參數等價於一個 RL 算法。
no free lunch沒有免費的午餐
選了一個決定就要承擔它較弱的層面。

收聽指南

誰該聽

做具身智能的創業者、研究員和投資人,尤其是正在糾結數據採集路線、世界模型 vs VLA、以及怎麼評估模型進展的人。

可跳過

開頭快問快答和衡水中學經歷可跳過,直接聽 44 分後的具身創業與數據部分。