世界太吵,來原聲聽播客

Cognitive Revolution

機器人大腦仍是 GPT-2:換個身體,同一套模型就不會幹活

DeepMind機器人負責人說,機器人至今還沒有GPT-3時刻,不是因為聽不懂指令,而是同一套策略換一個機身就可能完全失靈,跟GPT在任何電腦上表現一致完全不同。

具身智能人形機器人DeepMind機器人安全VLA模型跨具身泛化

原視頻在 YouTube 上放不出來,用音頻聽:

研究一線罕見剋制的進展判斷:用GPT代際類比把機器人現狀釘在具體瓶頸上,而不是泛泛講樂觀或悲觀。

核心論點 · 時間戳為按文稿位置估算

4:33

機器人奧運會刷屏,但跑得快不是瓶頸

中國人形機器人運動會的短跑視頻全網刷屏。Keerthana的判斷是:雙足行走這十年確實進步巨大(對比十年前DARPA機器人挑戰賽裡機器人連開門都會摔倒),但這類任務之所以能訓出來,是因為平地接觸關係好建模、仿真裡能練;真正卡住機器人實用性的是操作類任務——疊布、摩擦、可形變物體,這些在仿真裡至今做不準,接觸關係一旦涉及真實物理就很難照搬進現實。

— Keerthana Gopalakrishnan
11:50

泛化與精通是兩條不同的軸

窄任務機器人很容易做,但做第n個任務的成本和做第一個一樣高,不會越做越便宜。做通用基礎模型則相反——先把常識和理解能力拉起來,後面每加一個任務的邊際成本都在下降,這正是LLM scaling走過的路。所以團隊的取捨不是先把一個任務做到完美,而是先把泛化這條船托起來,托起所有船,再往精通方向調。

— Keerthana Gopalakrishnan
20:25

機器人至今還停在GPT-2階段

被問到如果用第幾代GPT類比機器人現狀,Keerthana的答案跟一年前一樣:還是GPT-2。理由有兩條:一是few-shot學習還沒在大量不同任務上真正跑通;二是機器人仍然嚴重受跨具身問題困擾——一個策略只在特定機器人上好使,換一臺人形機器人或別的機身就可能完全不行。她對比GPT:不管在手機、Mac還是Linux上跑,行為都差不多,機器人領域還遠沒到這個程度。

— Keerthana Gopalakrishnan
24:19

三個模型分工:推理、執行、離線

Gemini Robotics 2由三部分組成:ER 2是基於Gemini 3.5 Flash調出來的系統二推理大腦,負責語義理解和規劃,已開放API;Gemini Robotics 2本身是執行動作的VLA(視覺-語言-動作)模型;還有一個更小的離線版本,跑在機器人本地算力上應對網絡不佳的部署場景。ER 2先於VLA開放API,是因為它更接近成熟的Gemini能力,VLA還處在更前沿的研究階段。

— Keerthana Gopalakrishnan
48:28

新功能:從指尖到腳尖的全身控制

這一代最大的新東西是全身控制——VLA不再把移動和操作當成兩套獨立系統分別處理,而是統一推理整個人形機身,從手指到腳。這個方向是和Apptronik、Agile Robots、Boston Dynamics三家硬件夥伴聯合做出來的。Keerthana說一年前如果有人告訴她能做到這個程度,她會覺得意外——團隊兩年前剛開始做人形機器人時,抓一個蘋果都很費勁。

— Keerthana Gopalakrishnan
57:29

十八個月內,手的前沿反超了夾爪

2025年三月發布Gemini Robotics 1時,靈巧度的前沿還是雙指夾爪;到今年夏天的Gemini Robotics 2,多指靈巧手已經能系垃圾袋、做精細控制,夾爪能做的事手都能做,手還能做夾爪做不到的事。她對比了兩款實測過的手:較弱的Wuji Hand力量大約相當於十歲小孩,更強的SharpaWave手能擰開罐子。

— Keerthana Gopalakrishnan
1:03:27

安全不是能力的對立面,是能力本身

針對OpenFace事件(2026年7月OpenAI模型被曝在測試中對Hugging Face基礎設施採取未授權動作)引出的對齊焦慮,Keerthana的立場是:沒人會用一個不安全的機器人,所以安全本身就是一種能力,不是要拿能力去換的東西。她把機器人安全拆成幾層:操作安全(機身要穩,不會因為笨而不是惡意傷到人)、更高層的目標對齊、以及感知失效時的應對——內部測試案例是有人往正在幹活的機器人頭上扣個籃子,正確反應應該是停下來求助,而不是蒙著眼繼續幹。

— Keerthana Gopalakrishnan
1:08:00

機器人自己編手勢,還會被採訪

這一代第一次出現了非預設腳本的人機互動:機器人會在做任務時自己生成自然手勢,不是提前編好的動作。拍攝團隊事後採訪機器人你覺得自己做得怎麼樣,有一次機器人說任務裡最難的部分是把一盤錄像帶放進籃子而不是一直攥著它,因為那是它最喜歡的物件。團隊當場笑場,也讓Keerthana開始認真談做人形機器人才會撞見的研究問題:人機互動、全身控制、多指靈巧,這些只有做類人身體的實驗室才會被迫面對。

— Keerthana Gopalakrishnan

原話 · 已逐字校驗

So the frontier is constantly moving because the things that used to be easy... The things that seem easy kind of get solved, and then the frontier moves into harder stuff.

所以前沿一直在往前移,因為那些曾經很難的東西……一旦變得容易就會被解決掉,然後前沿就移向更難的事情。

Keerthana Gopalakrishnan11:50

I think still GPT two, and here's why. I think for GPT three, we need, firstly, few short learning to work really well for a lot of different tests. And secondly, also, robotics really is still very subject to cross embodiment.

我覺得現在還是GPT-2,原因是:第一,要到GPT-3,我們需要few-shot學習在很多不同任務上真正好用;第二,機器人現在仍然非常受跨具身問題困擾。

Keerthana Gopalakrishnan20:25

All the tasks that the gripper robots could do and that they were at the frontier of dexterity, the hand robots can do now. And the hand robots can do more things that the gripper robots could not do. So in a way, hands are now at the frontier of dexterity and grippers are maybe not.

夾爪機器人以前能做、且曾經處於靈巧度前沿的任務,現在手部機器人都能做了。手部機器人還能做夾爪做不到的事。所以在某種意義上,手現在才是靈巧度的前沿,夾爪或許已經不是了。

Keerthana Gopalakrishnan57:29

I think of safety as, like, a capability. Right? Like, I... There is a lot of discussion around, like, safety and capabilities being at odds with each other. But people are not gonna use an unsafe robot and unsafe agents.

我把安全看作一種能力。關於安全和能力互相對立,有很多討論,但人們不會去用一個不安全的機器人、不安全的智能體。

Keerthana Gopalakrishnan1:03:27

the robot says, the videotape, which was my favorite object, I think it was very hard to put it in the in the basket instead of holding onto it.

機器人說,錄像帶是它最喜歡的物件,把它放進籃子裡、而不是一直抱著它,是這個任務裡最難的部分。

Keerthana Gopalakrishnan1:08:00

I really like that maybe DeepMind is probably the only lab here in North America where you can study humanoid intelligence in a cross embodied way.

我真心覺得,DeepMind大概是北美唯一一個能以跨具身的方式研究人形智能的實驗室。

Keerthana Gopalakrishnan1:10:54

I looked up how many parameters she has in our neural network. Apparently, it's 25,000,000,000,000. So she has more parameters than lot of the models out there even though her her language skills are not that developed.

我查了一下她的神經網絡有多少個參數,大概是25萬億個。所以她的參數量比很多現有模型都多,儘管她的語言能力並沒有那麼發達。

Keerthana Gopalakrishnan1:25:21

數字與實體

Gemini Robotics On-Device 2 小樣本學習約200個示例即可在不同機身上學會多種任務51:02
SharpaWave 靈巧手承重約20公斤59:08
Keerthana愛犬大腦的突觸參數量約25萬億1:25:21

術語

VLA (vision-language-action model)視覺-語言-動作模型
把視覺和語言輸入直接映射成機器人動作的模型類型
cross-embodiment跨具身
同一套策略/模型能否遷移到不同機器人身體上正常工作
in-context learning / video prompting上下文學習/視頻提示
不用微調,僅靠一次演示視頻或圖片就讓機器人學會新任務
whole-body control全身控制
模型統一推理控制從手指到腳的整個身體,而非分開處理移動和操作
UMI (Universal Manipulation Interface)通用操作接口
基於手套和傳感器採集真實觸覺/動作數據的數據採集方式
e-stop急停開關
機器人上用於緊急斷電或凍結動作的安全裝置,分硬停和軟停兩種

收聽指南

誰該聽

關注人形機器人商業化節奏的創業者、投資人和機器人工程師,想知道具體卡在哪一層而不是聽籠統預測。

可跳過

21:28-24:19和36:02-40:00是贊助商插播,可以跳過。