世界太吵,來原聲聽播客

張小珺·商業訪談錄

機器人最大的瓶頸不是算法,是數據

譚捷在 Google DeepMind 做了十年機器人,他的判斷是:機器人基座模型至今還不是獨立學科,只是多模態大模型的微調;真正的瓶頸是數據,而搖操採數據不是終局。

機器人具身智能世界模型數據Google DeepMind
信息密度高,中後段關於數據金字塔、motion transfer、世界模型定義和硅谷 996 的部分最值錢。前 20 分鐘嘉賓小傳可快進。

核心論點 · 點時間戳可跳到原聲

13:06

機器人基座模型還不是獨立學科

國內有觀點認為聚生智能基座模型不該被視作大模型的延伸,而是一個獨立方向。譚捷的回應很直接:so far not yet。他的理由是,現在絕大多數做 VLA、做機器人大模型的,本質上還是在多模態大模型上做 finetuning——多模態模型能輸入圖像和語言,輸出文本,但缺 robot action 的輸出,所以大家做的事就是補全這個輸出能力。他認為只有當碰到各種瓶頸、需要不一樣的 data format、需要更完善的 world model 時,它才可能變成更獨立的學科,但至今沒有質的改變。

— 譚捷
23:44

語言模型撞數據牆,機器人是沒有數據

譚捷把機器人最大的問題定為數據。語言模型的數據是 free 的,網上已有海量語言數據,wikipedia、書本都可以 digitalize,而且語言相對 robotics 是一個 narrow domain。但 robotics 是在非常複雜的 unstructured environment 裡,可以發生任何事情,需要極大量、非常 diverse 的數據,而這個數據現在不存在。他確信現在的數據量完全沒有辦法 saturate 模型的能力,所以第二個瓶頸——比如模型 architecture——還沒被發現。他描述了一個數據金字塔:最底層是互聯網數據,往上是 egocentric video,再往上是 simulation 數據,最頂端是 robot specific 數據;預訓練需要大量低質數據學物理直覺,後訓練才需要少量高質量數據。

— 譚捷
29:21

跨本體遷移解決的是數據量不夠

Gemini Robotics 1.5 的第二個突破是 cross embodiment transfer。譚捷說機器人數據稀缺,機器人 A 採的數據只能學 A 上的 task,A 升級換了 camera 位置或多一個自由度,之前採的就都沒用了;不同構型的機器人數據也不能互用。他們測了三個機器人——簡單的雙臂 Aloha、更工業級的 Biarm Franca、Optimus 人形——把數據放在一起,又開發了 motion transfer 技術,使得在機器人 A 上見過的任務機器人 B 也能執行。他舉的例子是:假設你學會了開車,我從來沒學過,但我也學會了開車。這從根本上解決數據量不夠的問題,因為任何機器人採的數據都能被其他機器人利用。

— 譚捷
34:22

快慢雙模型是過渡,不是終局

Gemini Robotics 1.5 把系統拆成一個 ER(embody reasoning,慢思考)和一個 VLA(快思考、出 robot action)。譚捷認為這是過渡方式,不是終極方式。原因是現在受制於算力和模型大小:慢思考要做 reasoning、要 web search,需要非常大的模型,很難在每秒做五到十次決策;小模型才能做五到十次決策。要 unify 成一個模型,它必須非常大,因為要做 reasoning,而現在算力不足以支持。他還指出兩個模型之間現在用語言交流,而語言不是 high bandwidth 的交流方式,會丟掉很多信息,所以理想是一個模型內部不需要額外 interface,沒有信息損失。

— 譚捷
52:41

仿真數據的定義正在被生成模型改寫

譚捷說仿真的定義越來越模糊。以前仿真指物理仿真,Bullet、MojoCo、Isaac Gym,在計算機裡解物理方程算運動軌跡。現在因為 Video Generation Model 興起,很多人認為仿真就是生成一段視頻,只要看上去物理正確,也是一種新意義上的仿真。他判斷不遠的將來,傳統物理模擬的仿真會慢慢被生成式模型的仿真取代。經濟性上他反而說生成視頻可能更貴,因為需要算力成本,但它解決了場景生成問題:傳統仿真要 500 個家庭場景得一個個手建,生成模型只要 500 個不同 prompt。他也指出當前瓶頸是幻覺和非物理現象,比如人生成做體操時不知道會生成出多少條腿。

— 譚捷
56:45

能玩的才是世界模型,靜態視頻不是

譚捷給出世界模型的定義:如果給上前一幀,再給上機器人的動作,你可以預測下一幀。按這個標準,現在絕大多數視頻生成模型都不是世界模型,因為它們不能通過輸入一個機器人動作或人的動作來改變下一幀結果。他舉了對比:VIO 是一個視頻生成模型,但 Genie 更像世界模型,因為 Genie 是可以玩的,你可以通過按鍵改變生成的下一幀,可以駕駛一隻龍左轉右轉,每一幀都有輸入改變下一幀。他說這個方向 Google DeepMind 做得最好,Sora 做得也不錯,OpenAI 也不錯,還有很多小公司在做。

— 譚捷
1:09:57

靈巧手出現後觸覺才變得必要

譚捷講了自己對觸覺判斷的心路歷程。他一直相信 tactile sensing 重要,因為人每天有皮膚感受觸摸。但 Stanford 的 Aloha 論文讓他第一次看到人可以通過純視覺遙操機器人做非常複雜的事,包括從皮包裡拿出很薄的信用卡,他以為這種事只有觸覺才能做成,Aloha 狠狠打了他的臉,於是他 hold 住這個 believe 一段時間,覺得視覺能做 95% 的事。直到靈巧手普及,他去用遙操控制靈巧手用剪刀——手往兩個環裡一套就能用剪刀,但沒有觸覺反饋時他不知道什麼時候開什麼時候關,因為環很大,不恰當的時間開關只是手在環裡動,並沒有控制剪刀。他才意識到有靈巧手時觸覺非常重要,之前覺得不重要是受限於當時的硬件。

— 譚捷
1:24:14

Google Robotics 從十人鬆散到集團軍

譚捷九年前加入時團隊只有十個人,Google Brain 也就幾十個人,管理非常鬆散,每個進來的 researcher 獨當一面,想做什麼就做什麼,資源分配不是問題。他形容那時候自己像一個 very well paid 的 PhD 或 assistant professor,有自主權,但個人 impact 非常有限,很難聚一撥人做一件大事。現在 Robotics 有 150 個人,Gemini Robotics 第一代 3 月版本 author list 上可能已經 120 人,這次可能 160 到 180 人。他說 Google 意識到不想只是一個 academic lab but very costly,於是從 promotion、performance review、incentive、structure 上創造環境,讓更多人一起解決更大的事。他自己是隨著團隊變化,所以沒有 culture shock。

— 譚捷

原話 · 已逐字校驗

它到底是不是一個非常獨立的單獨的學科 so far not yet

它到底是不是一個非常獨立的單獨的學科,so far not yet。

譚捷13:06

就舉個例子 就是說假設你學會了開車 我從來沒有學過開車這個任務 但我也學會了開車 它可以跨本體

舉個例子,假設你學會了開車,我從來沒有學過開車這個任務,但我也學會了開車,它可以跨本體。

譚捷30:21

他們相信在機器人行業 很快會有一個質的變革 巨大的變革 如果這個變革發生 I'm on a wrong ship 我一定要at the right ship

他們相信在機器人行業很快會有一個質的變革、巨大的變革,如果這個變革發生,I'm on a wrong ship,我一定要 at the right ship。

譚捷1:36:24

但是我覺得這個在大模型時代 你真的需要燒很多錢 你才能看到結果

但是我覺得這個在大模型時代,你真的需要燒很多錢,你才能看到結果。

譚捷1:46:33

我覺得絕大數的絕大多數的人 尤其是不是在機器人行業裡的人 對機器人的發展是overestimate的

我覺得絕大多數的、絕大多數的人,尤其是不是在機器人行業裡的人,對機器人的發展是 overestimate 的。

譚捷2:00:46

數字與實體

Google Robotics 團隊人數(九年前)10 人1:24:14
Google Robotics 團隊人數(現在)150 人1:24:14
Gemini Robotics 第一代 3 月版本 author list 人數約 120 人1:26:14
Gemini Robotics 1.5 author list 人數160 到 180 人1:26:14
譚捷每週工作時長70 到 80 小時1:29:15
精細操作任務(拉拉鏈)成功率30% 到 40%16:06
簡單 pick and place 成功率90% 幾到 100%16:06
機器人達到 GPT-3/GPT-4 水平預計時間兩三年17:08
機器人真正落地預計時間額外的五到十年17:08
MSR researcher 帶來的未見設備任務完成數25 個任務完成 10 個1:54:37

術語

VLA視覺-語言-動作模型
輸入圖像和語言、直接輸出機器人動作的模型,是當前機器人大腦的主流形態。
cross embodiment transfer跨本體遷移
把一個機器人上採的數據和學到的技能遷移到構型不同的另一個機器人上。
motion transfer動作遷移
Gemini Robotics 1.5 中讓不同本體數據互用的技術,譚捷稱其為 secret sauce。
sim to real仿真到真實
在仿真裡訓練策略再部署到真實機器人,譚捷第一篇 Google 論文即用此方法。
egocentric video第一人稱視頻
從人的視角拍攝的操作視頻,戴眼鏡或相機即可採集,量大但與機器人形態有 gap。
embodiment gap本體差距
兩個機器人形態差異的程度,差距越大跨構型遷移越難。

收聽指南

誰該聽

做機器人或具身智能的創業者、工程師和投資人;想知道 Google DeepMind 內部對數據、架構、世界模型真實判斷的人。

可跳過

前 20 分鐘嘉賓小傳和圖形學轉機器人經歷,可快進到 23:44 數據部分。