世界太吵,來原聲聽播客

張小珺·商業訪談錄

機器人不需要等到 aha moment 才落地

機器人領域還沒出現大模型那種 aha moment,但能力提升的斜率已經起來了,每一年每一個月的能力增長都會沿途解鎖新的商業機會,不用等通用智能成熟再找應用。

機器人VLA具身智能論文精讀人形機器人
兩小時半逐篇講 VLA 論文,信息密度高但偏學術;想搞清機器人基座模型技術脈絡的人值得聽,只關心商業結論的可以只聽開頭和結尾。

核心論點 · 點時間戳可跳到原聲

5:04

這輪機器人熱的最大變量是大模型

陳建宇把這一輪和過去十年的機器人熱潮區分開:真正的變量是大模型的出現。23 年上半年大模型火了半年之後,開始輻射到機器人。此前 AI for Robotics 的脈絡是 Deep Learning 先進入 Computer Vision 做感知,AlphaGo 代表深度強化學習讓神經網絡能做連續空間的行為決策,但都不夠通用。直到 ChatGPT 出現,大家才看到「有某種 AI 方法能夠做到足夠的通用」,於是不用再為 100 種場景開發 100 種專用模型——那種做法完全沒法 scale。

— 陳建宇
13:08

最棘手的問題是能 scale 的架構還沒找到

被問到通用機器人最棘手、一旦解決就可能爆發的問題,陳建宇的答案是「能夠去 scale 的這樣的一個模型的架構」。他認為整個行業正在往這個方向快速進展,但暫時還沒找到。這個問題既是科學問題也是工程問題:架構本身很大程度是科學問題,因為做具身要思考人是怎麼思考、怎麼學習的——「人就是一個標準的通用的 VOA 模型大佬,人就是一個 AGI」。他還判斷未來 AGI 的最終形態就是具身的,語言、自動駕駛、機器人這些大模型最終都會 unify 起來。

— 陳建宇
24:14

Say Can 把「可以做」和「能做的」匹配起來

Google 22 年的 Say Can 解決的是語言模型規劃與機器人實際能力不吻合的問題。方法是一邊讓語言模型給出完成目標需要做哪些事並打分,另一邊用單獨訓練的 Value Function 判斷當前機器人狀態下哪些事真的能做,兩邊做匹配,最終規劃出既有助於完成目標、機器人又能達成的任務。陳建宇指出它的侷限:一開始就規劃完 12345 步,中間如果失敗,沒有重新規劃和糾正的機制。

— 陳建宇
29:51

Inner Monologue 之後,反饋要更及時

Inner Monologue 的改進是讓機器人執行動作後獲得環境反饋再推理修正,比如鑰匙插不進去就換一把。但陳建宇團隊 23 年的工作指出它的問題:如果中間某個子任務執行時間較長,要等任務做完才給高層反饋,中間這段時間就被浪費了。他們的做法是用 VLM 做實時 detector,大約 10 赫茲的頻率觀測當前任務有沒有異常,比如搬箱子途中箱子掉了能立刻發現並重規劃,而 Inner Monologue 可能要走到目的地才發現箱子沒了。

— 陳建宇
56:23

數據多樣性比數據量重要得多

RT-1 用 130k episode、700 個任務、13 臺機器人、17 個月收集的數據訓練,在見過的任務上接近百分之百成功率,沒見過的任務也有約百分之五十。它給出的重要 insight 是 diversity is all:橫軸是數據量、縱軸是成功率,單純加量是平滑提升,但把多樣性去掉,performance 會下降得很厲害。陳建宇用自動駕駛類比:人類司機大多開在道路中間,數據趨同,corner case 數據極少,diversity 不夠就很難 generalize。

— 陳建宇
1:33:21

VLM 直接輸出動作太慢,缺動作處理

陳建宇團隊復現 RT-2 後發現這類 VLA 的侷限:本質是拿一個 VLM 直接 decode token 成動作,太缺少對 Action 層面的專門處理,而且 VLM 運行慢,RT-2 基本只有 1 到 3 赫茲,對機器人來說頻率非常低,動態任務上效果和精度都受影響。他們的 HiRT 加了一個專門的 Action Policy 模塊做動作解碼,並做分頻處理:VLM 低頻運行,參數只有幾十 M 的 Action Policy 高頻運行,同時接收視覺反饋形成閉環。結果是 performance 與 RT-2 相當甚至略好,推理速度明顯更高。

— 陳建宇
1:48:33

統一動作空間不如分開加小腦

RDT 把 Diffusion Policy scale 到 B 量級,預訓練量大概 1M,大量用到 RT-X 數據。它的一個創新是 Unified Action Space:所有本體共用一個統一向量,把向量不同區段分配給單臂、雙臂、輪式等。陳建宇明確表示自己更傾向 CrossFormer 那種不同 Action Head 的方式,因為很難預判未來會有多少種本體,統一向量可能長到沒法準備,或者訓練完發現向量不夠用。他的判斷是「加小腦更好」,共享大部分大腦,小腦部分只需較少數據去 finetune。

— 陳建宇
2:06:49

強化學習直接訓整個 VLA 會越訓越差

陳建宇團隊嘗試用強化學習增強 VLA,發現標準 PPO 直接訓練整個網絡不 work,甚至會越訓越差。他們找到的間接辦法是分兩步:第一步凍結 VLM,只訓練 action head,強化學習能訓上去;然後把成功的 trajectory 存下來,再放開 VLM,用監督學習的方式去訓。效果上純模仿學習不到 50 分,他們的方法能接近 100 分,在沒見過的任務上優勢更明顯。他認為未來還是希望強化學習能直接端到端訓練整個模型。

— 陳建宇

原話 · 已逐字校驗

之前的機器人是什麼 是100種場景 100個任務 我要重新開發100種機器人

之前的機器人是什麼?是 100 種場景、100 個任務,我要重新開發 100 種機器人。

陳建宇8:06

人就是一個標準的通用的VOA模型大佬 人就是一個AGI

人就是一個標準的、通用的 VLA 模型大佬,人就是一個 AGI。

陳建宇14:09

diversity is only 就是說對數據來說它的diversity 會比數據的size要重要很多

diversity is all,就是說對數據來說,它的 diversity 會比數據的 size 重要很多。

陳建宇57:25

我明顯是找到了這樣一種方式 可以持續快速的提升機器人的能力 這個能力的提升可以會持續好幾年

我明顯是找到了這樣一種方式,可以持續快速地提升機器人的能力,這個能力的提升會持續好幾年。

陳建宇2:24:59

現在用起來的機器 包括工業裡面的工業機械臂 或者等等它的智能幾乎為零 但是也有萬臺級別這些出貨量

現在用起來的機器,包括工業裡面的工業機械臂等等,它的智能幾乎為零,但也有萬臺級別的出貨量。

陳建宇2:25:59

數字與實體

RT-1 見過任務成功率接近百分之百56:23
RT-1 未見任務成功率約百分之五十56:23
RT-2 推理頻率1 到 3 赫茲1:33:21
HiRT 中 Action Policy 參數量幾十個 M1:35:23
陳建宇團隊實時 detector 頻率約 10 赫茲30:15
陳建宇團隊強化學習效果對比純模仿學習不到 50 分,其方法接近 100 分2:05:48

術語

VLA視覺-語言-動作模型
端到端處理 Vision、Language、Action 三種模態的機器人模型。
Action Chunking Transformer動作分塊 Transformer
Aloha 提出的架構,一次輸出未來一段動作序列,並對歷史規劃做加權平均使軌跡更平滑。
Model Predictive Control模型預測控制
每時刻規劃未來一段動作軌跡,只執行第一步,下一步重新規劃。
Co-Fine Tuning聯合微調
RT-2 在機器人數據微調時同時混入原 VLM 數據,避免過擬合到動作而丟失視覺語言理解。
Diffusion Policy擴散策略
用擴散模型的加噪去噪方式生成機器人動作軌跡的訓練方法。
Unified Action Space統一動作空間
RDT 把不同本體的動作映射到同一個長向量,按區段分配給單臂、雙臂、輪式等。

收聽指南

誰該聽

做機器人或具身智能的工程師、創業者,以及想搞清 VLA 技術脈絡和落地節奏的投資人。

可跳過

1:15:02 到 1:20:02 的 PaLM-E 部分偏基礎,可快進。