機器人學會用手,靠的不是機器人數據,而是電腦操作數據
通用大模型正在把編程、操作電腦、認識空間的能力打包遷移到機器人身上,業內預計兩年內就會出現能聽懂任何指令、幹活像稱職青少年的通用機器人。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
機器人動作輸出也曾沒有思維鏈
RT2這類早期VLA模型是把語言模型微調後直接輸出動作座標(末端執行器位姿),中間沒有思考步驟,就像GSM8K早期模型只能直接吐出答案、不能展開推理。現在編程智能體可以先思考、寫代碼、調用工具,再決定動作,這被認為是機器人控制版的「思維鏈時刻」——能給任務分配的計算量不再固定,複雜任務可以想得更久。
— Jay瓶頸也許從來不是模型架構
VLA架構本身就建立在語言模型之上,理論上也能推理、寫代碼。真正的瓶頸可能不是要不要用專門的機器人架構,而是用什麼數據訓練——機器人專用數據長期稀缺,進展緩慢。既然代碼、網頁文本這類數據是模型的「分布內」強項,一個思路是想辦法把機器人這種「分布外」任務,轉化成能用這些已有數據解決的問題。
上下文學習撐不起真正的規模化
Francois做過一個實驗:把某項任務從訓練集中剔除,只靠上下文示例(不更新權重)看模型能提升多少。結果提升是非單調的,忽好忽壞;更關鍵的是大概20到40個示例後就基本見頂,再往上下文裡塞例子也不再有用,而且一旦超過訓練時上下文長度的一半左右,表現反而變差。像Tesla這種手握海量數據的公司,不可能靠這種方式做自動駕駛。
— Francois把臨場學到的東西蒸餾成技能庫
Waddle Labs把「harness」(智能體的工具與流程包裝)理解為一種領域專精的載體:機器人第一次進入新環境時靠上下文現學現賣,但學到的東西可以打包成具體的代碼或技能,留給以後的智能體直接調用,相當於把過去的經驗蒸餾成固定資產。這也呼應了元學習的思路——一個大模型負責給小模型「編程」,小模型只需要在上下文裡執行,可以做得更小更快。
延遲每月減半,年底或有實時機器人
演示中Astra直接操控機械臂時動作明顯偏慢,因為整套系統被大模型自身的推理延遲卡住了。但據他們觀察,前沿級大模型的延遲大約每個月能減半,如果這個趨勢不變,到今年年底就有可能實現真正意義上的實時機器人控制——今天看起來卡頓的demo可能很快就不是問題。
語言學得越強,機器人也就學得越強
引用Philip Isola的「柏拉圖式表徵假說」:不同模型在足夠大的數據和規模下,會收斂到對世界同一種底層表徵。如果這成立,一個足夠強的語言模型必然對應一個足夠強的機器人模型,因為兩者在學習同一套關於物理世界的映射。這被認為是「苦澀的教訓」最徹底的體現——架構不重要,重要的是有沒有一個真正強的通用模型。
Blender裡拖動光標,教會了模型認識空間
Astra在空間推理上的突破被認為很大程度上來自海量電腦操作和CAD數據的預訓練——比如在Blender裡拖動光標環繞一個三維物體做設計,本質上就是在學習「上下左右」這類空間概念,恰好是控制機器人手臂需要的能力。有意思的是,1980年代Xerox PARC把圖形界面設計得像物理世界方便人類操作,如今這套「擬物」環境反過來成了訓練AI操作真實物理世界的數據。
兩年內或更早,通用機器人就會出現
前沿實驗室和機器人基礎模型公司內部普遍認為,兩年內甚至更早就會出現真正的通用機器人:給出任意自然語言指令,它就能完成一個稱職青少年用雙手能做到的事,這被類比為機器人領域的ChatGPT時刻。剩下的主要障礙是怎麼把大模型實時推理的慢速過程,壓縮成能高頻重複調用的快速技能——這被類比成「睡眠」:像大腦靠睡眠把白天的經歷壓縮進記憶,模型也需要一個離線階段,把上下文裡的經驗蒸餾進權重或不斷增長的技能庫。
原話 · 已逐字校驗
instead of outputting English, for example, they just output what we call an end-effector pose. Which is the coordinates that you can then translate into join commands that can control the robots.
它不像輸出英文那樣,輸出的是我們稱為「末端執行器位姿」的東西——也就是可以轉換成關節指令、用來控制機器人的座標。
Jay2:05
We want to be bidderless and pill, right? We want to benefit from all kinds of data. We want to pour in computer use data into our robot models. We want to pour in coding data into our robot models.
我們想徹底服膺「苦澀的教訓」,對吧?我們想從各種數據裡獲益——把電腦操作數據灌進我們的機器人模型,把編程數據也灌進去。
Han Mei6:09
one is non-monotonic improvement which is wild so it gets worse it gets better it gets worse it gets better like pretty grass aggressively number two is that it caps out very quickly and so after like 20 30 maybe 40 examples it is basically saturated
第一點是非單調式提升,很離譜——它一會兒變差一會兒變好,一會兒變差一會兒變好,波動很劇烈;第二點是它很快就見頂,大概20、30甚至40個示例之後基本就飽和了。
Francois12:16
So one thing that we saw is that for Fable class LLMs, their latency is improving by around 2x per month, which is very, very fast.
我們觀察到的一點是,前沿級LLM的延遲正以每月約2倍的速度在改善,這非常非常快。
There's some consensus within the Frontier Labs and also in the Robotics Foundation models companies that we will have general purpose robots within the next two years or even earlier.
前沿實驗室和機器人基礎模型公司內部有一種共識:我們將在未來兩年內、甚至更早,擁有通用機器人。
when we say general purpose robots, we mean something like if you give any natural language instruction, it can do what a competent teenager could do with their hands.
我們說的通用機器人,是指只要給出任何自然語言指令,它就能完成一個稱職的青少年用雙手能做到的事。
like almost everything that is intelligent sleeps. Like tell me an intelligent system that doesn't sleep, right, in some way. And then during sleep, compression happens.
幾乎所有智能系統都需要睡眠——你說說看,有哪個智能系統是完全不睡覺的?而壓縮正是在睡眠中發生的。
數字與實體
| 上下文學習(ICL)見頂所需示例數 | 約20-40個示例後基本飽和 | 12:16 |
| 前沿級LLM推理延遲改善速度 | 約每月減半(2倍) | 17:22 |
| 業內對通用機器人出現時間的共識 | 兩年內或更早 | 25:32 |
術語
- VLA (Vision-Language-Action Model)視覺-語言-動作模型
- 直接輸出動作座標而非文字的機器人控制模型
- end-effector pose末端執行器位姿
- 機械臂末端在空間中的座標與朝向
- code as policies代碼即策略
- 讓編程智能體直接寫代碼來控制機器人完成任務
- in-context learning (ICL)上下文學習
- 不更新模型權重,只靠提示裡的示例即時改善表現
- platonic representation hypothesis柏拉圖式表徵假說
- 不同模型訓練到足夠強後會收斂到同一種世界表徵
- bitter lesson苦澀的教訓
- Rich Sutton提出:通用算力方法長期勝過人工設計的領域知識
收聽指南
關注機器人、具身智能或通用大模型應用邊界的創業者、投資人和工程師,想提前判斷下一波機器人公司會長什麼樣。
12-14分鐘關於上下文學習理論的細節偏學術、語言也較口語化,趕時間可跳過。