機器人不需要等到 aha moment 才落地
機器人領域還沒出現大模型那種 aha moment,但能力提升的斜率已經起來了,每一年每一個月的能力增長都會沿途解鎖新的商業機會,不用等通用智能成熟再找應用。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
這輪機器人熱的最大變量是大模型
陳建宇把這一輪和過去十年的機器人熱潮區分開:真正的變量是大模型的出現。23 年上半年大模型火了半年之後,開始輻射到機器人。此前 AI for Robotics 的脈絡是 Deep Learning 先進入 Computer Vision 做感知,AlphaGo 代表深度強化學習讓神經網絡能做連續空間的行為決策,但都不夠通用。直到 ChatGPT 出現,大家才看到「有某種 AI 方法能夠做到足夠的通用」,於是不用再為 100 種場景開發 100 種專用模型——那種做法完全沒法 scale。
— 陳建宇最棘手的問題是能 scale 的架構還沒找到
被問到通用機器人最棘手、一旦解決就可能爆發的問題,陳建宇的答案是「能夠去 scale 的這樣的一個模型的架構」。他認為整個行業正在往這個方向快速進展,但暫時還沒找到。這個問題既是科學問題也是工程問題:架構本身很大程度是科學問題,因為做具身要思考人是怎麼思考、怎麼學習的——「人就是一個標準的通用的 VOA 模型大佬,人就是一個 AGI」。他還判斷未來 AGI 的最終形態就是具身的,語言、自動駕駛、機器人這些大模型最終都會 unify 起來。
— 陳建宇Say Can 把「可以做」和「能做的」匹配起來
Google 22 年的 Say Can 解決的是語言模型規劃與機器人實際能力不吻合的問題。方法是一邊讓語言模型給出完成目標需要做哪些事並打分,另一邊用單獨訓練的 Value Function 判斷當前機器人狀態下哪些事真的能做,兩邊做匹配,最終規劃出既有助於完成目標、機器人又能達成的任務。陳建宇指出它的侷限:一開始就規劃完 12345 步,中間如果失敗,沒有重新規劃和糾正的機制。
— 陳建宇Inner Monologue 之後,反饋要更及時
Inner Monologue 的改進是讓機器人執行動作後獲得環境反饋再推理修正,比如鑰匙插不進去就換一把。但陳建宇團隊 23 年的工作指出它的問題:如果中間某個子任務執行時間較長,要等任務做完才給高層反饋,中間這段時間就被浪費了。他們的做法是用 VLM 做實時 detector,大約 10 赫茲的頻率觀測當前任務有沒有異常,比如搬箱子途中箱子掉了能立刻發現並重規劃,而 Inner Monologue 可能要走到目的地才發現箱子沒了。
— 陳建宇數據多樣性比數據量重要得多
RT-1 用 130k episode、700 個任務、13 臺機器人、17 個月收集的數據訓練,在見過的任務上接近百分之百成功率,沒見過的任務也有約百分之五十。它給出的重要 insight 是 diversity is all:橫軸是數據量、縱軸是成功率,單純加量是平滑提升,但把多樣性去掉,performance 會下降得很厲害。陳建宇用自動駕駛類比:人類司機大多開在道路中間,數據趨同,corner case 數據極少,diversity 不夠就很難 generalize。
— 陳建宇VLM 直接輸出動作太慢,缺動作處理
陳建宇團隊復現 RT-2 後發現這類 VLA 的侷限:本質是拿一個 VLM 直接 decode token 成動作,太缺少對 Action 層面的專門處理,而且 VLM 運行慢,RT-2 基本只有 1 到 3 赫茲,對機器人來說頻率非常低,動態任務上效果和精度都受影響。他們的 HiRT 加了一個專門的 Action Policy 模塊做動作解碼,並做分頻處理:VLM 低頻運行,參數只有幾十 M 的 Action Policy 高頻運行,同時接收視覺反饋形成閉環。結果是 performance 與 RT-2 相當甚至略好,推理速度明顯更高。
— 陳建宇統一動作空間不如分開加小腦
RDT 把 Diffusion Policy scale 到 B 量級,預訓練量大概 1M,大量用到 RT-X 數據。它的一個創新是 Unified Action Space:所有本體共用一個統一向量,把向量不同區段分配給單臂、雙臂、輪式等。陳建宇明確表示自己更傾向 CrossFormer 那種不同 Action Head 的方式,因為很難預判未來會有多少種本體,統一向量可能長到沒法準備,或者訓練完發現向量不夠用。他的判斷是「加小腦更好」,共享大部分大腦,小腦部分只需較少數據去 finetune。
— 陳建宇強化學習直接訓整個 VLA 會越訓越差
陳建宇團隊嘗試用強化學習增強 VLA,發現標準 PPO 直接訓練整個網絡不 work,甚至會越訓越差。他們找到的間接辦法是分兩步:第一步凍結 VLM,只訓練 action head,強化學習能訓上去;然後把成功的 trajectory 存下來,再放開 VLM,用監督學習的方式去訓。效果上純模仿學習不到 50 分,他們的方法能接近 100 分,在沒見過的任務上優勢更明顯。他認為未來還是希望強化學習能直接端到端訓練整個模型。
— 陳建宇原話 · 已逐字校驗
之前的機器人是什麼 是100種場景 100個任務 我要重新開發100種機器人
之前的機器人是什麼?是 100 種場景、100 個任務,我要重新開發 100 種機器人。
陳建宇8:06
人就是一個標準的通用的VOA模型大佬 人就是一個AGI
人就是一個標準的、通用的 VLA 模型大佬,人就是一個 AGI。
陳建宇14:09
diversity is only 就是說對數據來說它的diversity 會比數據的size要重要很多
diversity is all,就是說對數據來說,它的 diversity 會比數據的 size 重要很多。
陳建宇57:25
我明顯是找到了這樣一種方式 可以持續快速的提升機器人的能力 這個能力的提升可以會持續好幾年
我明顯是找到了這樣一種方式,可以持續快速地提升機器人的能力,這個能力的提升會持續好幾年。
陳建宇2:24:59
現在用起來的機器 包括工業裡面的工業機械臂 或者等等它的智能幾乎為零 但是也有萬臺級別這些出貨量
現在用起來的機器,包括工業裡面的工業機械臂等等,它的智能幾乎為零,但也有萬臺級別的出貨量。
陳建宇2:25:59
數字與實體
| RT-1 見過任務成功率 | 接近百分之百 | 56:23 |
| RT-1 未見任務成功率 | 約百分之五十 | 56:23 |
| RT-2 推理頻率 | 1 到 3 赫茲 | 1:33:21 |
| HiRT 中 Action Policy 參數量 | 幾十個 M | 1:35:23 |
| 陳建宇團隊實時 detector 頻率 | 約 10 赫茲 | 30:15 |
| 陳建宇團隊強化學習效果對比 | 純模仿學習不到 50 分,其方法接近 100 分 | 2:05:48 |
術語
- VLA視覺-語言-動作模型
- 端到端處理 Vision、Language、Action 三種模態的機器人模型。
- Action Chunking Transformer動作分塊 Transformer
- Aloha 提出的架構,一次輸出未來一段動作序列,並對歷史規劃做加權平均使軌跡更平滑。
- Model Predictive Control模型預測控制
- 每時刻規劃未來一段動作軌跡,只執行第一步,下一步重新規劃。
- Co-Fine Tuning聯合微調
- RT-2 在機器人數據微調時同時混入原 VLM 數據,避免過擬合到動作而丟失視覺語言理解。
- Diffusion Policy擴散策略
- 用擴散模型的加噪去噪方式生成機器人動作軌跡的訓練方法。
- Unified Action Space統一動作空間
- RDT 把不同本體的動作映射到同一個長向量,按區段分配給單臂、雙臂、輪式等。
收聽指南
做機器人或具身智能的工程師、創業者,以及想搞清 VLA 技術脈絡和落地節奏的投資人。
1:15:02 到 1:20:02 的 PaLM-E 部分偏基礎,可快進。