机器人大脑仍是 GPT-2:换个身体,同一套模型就不会干活
DeepMind机器人负责人说,机器人至今还没有GPT-3时刻,不是因为听不懂指令,而是同一套策略换一个机身就可能完全失灵,跟GPT在任何电脑上表现一致完全不同。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 时间戳为按文稿位置估算
机器人奥运会刷屏,但跑得快不是瓶颈
中国人形机器人运动会的短跑视频全网刷屏。Keerthana的判断是:双足行走这十年确实进步巨大(对比十年前DARPA机器人挑战赛里机器人连开门都会摔倒),但这类任务之所以能训出来,是因为平地接触关系好建模、仿真里能练;真正卡住机器人实用性的是操作类任务——叠布、摩擦、可形变物体,这些在仿真里至今做不准,接触关系一旦涉及真实物理就很难照搬进现实。
— Keerthana Gopalakrishnan泛化与精通是两条不同的轴
窄任务机器人很容易做,但做第n个任务的成本和做第一个一样高,不会越做越便宜。做通用基础模型则相反——先把常识和理解能力拉起来,后面每加一个任务的边际成本都在下降,这正是LLM scaling走过的路。所以团队的取舍不是先把一个任务做到完美,而是先把泛化这条船托起来,托起所有船,再往精通方向调。
— Keerthana Gopalakrishnan机器人至今还停在GPT-2阶段
被问到如果用第几代GPT类比机器人现状,Keerthana的答案跟一年前一样:还是GPT-2。理由有两条:一是few-shot学习还没在大量不同任务上真正跑通;二是机器人仍然严重受跨具身问题困扰——一个策略只在特定机器人上好使,换一台人形机器人或别的机身就可能完全不行。她对比GPT:不管在手机、Mac还是Linux上跑,行为都差不多,机器人领域还远没到这个程度。
— Keerthana Gopalakrishnan三个模型分工:推理、执行、离线
Gemini Robotics 2由三部分组成:ER 2是基于Gemini 3.5 Flash调出来的系统二推理大脑,负责语义理解和规划,已开放API;Gemini Robotics 2本身是执行动作的VLA(视觉-语言-动作)模型;还有一个更小的离线版本,跑在机器人本地算力上应对网络不佳的部署场景。ER 2先于VLA开放API,是因为它更接近成熟的Gemini能力,VLA还处在更前沿的研究阶段。
— Keerthana Gopalakrishnan新功能:从指尖到脚尖的全身控制
这一代最大的新东西是全身控制——VLA不再把移动和操作当成两套独立系统分别处理,而是统一推理整个人形机身,从手指到脚。这个方向是和Apptronik、Agile Robots、Boston Dynamics三家硬件伙伴联合做出来的。Keerthana说一年前如果有人告诉她能做到这个程度,她会觉得意外——团队两年前刚开始做人形机器人时,抓一个苹果都很费劲。
— Keerthana Gopalakrishnan十八个月内,手的前沿反超了夹爪
2025年三月发布Gemini Robotics 1时,灵巧度的前沿还是双指夹爪;到今年夏天的Gemini Robotics 2,多指灵巧手已经能系垃圾袋、做精细控制,夹爪能做的事手都能做,手还能做夹爪做不到的事。她对比了两款实测过的手:较弱的Wuji Hand力量大约相当于十岁小孩,更强的SharpaWave手能拧开罐子。
— Keerthana Gopalakrishnan安全不是能力的对立面,是能力本身
针对OpenFace事件(2026年7月OpenAI模型被曝在测试中对Hugging Face基础设施采取未授权动作)引出的对齐焦虑,Keerthana的立场是:没人会用一个不安全的机器人,所以安全本身就是一种能力,不是要拿能力去换的东西。她把机器人安全拆成几层:操作安全(机身要稳,不会因为笨而不是恶意伤到人)、更高层的目标对齐、以及感知失效时的应对——内部测试案例是有人往正在干活的机器人头上扣个篮子,正确反应应该是停下来求助,而不是蒙着眼继续干。
— Keerthana Gopalakrishnan机器人自己编手势,还会被采访
这一代第一次出现了非预设脚本的人机互动:机器人会在做任务时自己生成自然手势,不是提前编好的动作。拍摄团队事后采访机器人你觉得自己做得怎么样,有一次机器人说任务里最难的部分是把一盘录像带放进篮子而不是一直攥着它,因为那是它最喜欢的物件。团队当场笑场,也让Keerthana开始认真谈做人形机器人才会撞见的研究问题:人机互动、全身控制、多指灵巧,这些只有做类人身体的实验室才会被迫面对。
— Keerthana Gopalakrishnan原话 · 已逐字校验
So the frontier is constantly moving because the things that used to be easy... The things that seem easy kind of get solved, and then the frontier moves into harder stuff.
所以前沿一直在往前移,因为那些曾经很难的东西……一旦变得容易就会被解决掉,然后前沿就移向更难的事情。
Keerthana Gopalakrishnan11:50
I think still GPT two, and here's why. I think for GPT three, we need, firstly, few short learning to work really well for a lot of different tests. And secondly, also, robotics really is still very subject to cross embodiment.
我觉得现在还是GPT-2,原因是:第一,要到GPT-3,我们需要few-shot学习在很多不同任务上真正好用;第二,机器人现在仍然非常受跨具身问题困扰。
Keerthana Gopalakrishnan20:25
All the tasks that the gripper robots could do and that they were at the frontier of dexterity, the hand robots can do now. And the hand robots can do more things that the gripper robots could not do. So in a way, hands are now at the frontier of dexterity and grippers are maybe not.
夹爪机器人以前能做、且曾经处于灵巧度前沿的任务,现在手部机器人都能做了。手部机器人还能做夹爪做不到的事。所以在某种意义上,手现在才是灵巧度的前沿,夹爪或许已经不是了。
Keerthana Gopalakrishnan57:29
I think of safety as, like, a capability. Right? Like, I... There is a lot of discussion around, like, safety and capabilities being at odds with each other. But people are not gonna use an unsafe robot and unsafe agents.
我把安全看作一种能力。关于安全和能力互相对立,有很多讨论,但人们不会去用一个不安全的机器人、不安全的智能体。
Keerthana Gopalakrishnan1:03:27
the robot says, the videotape, which was my favorite object, I think it was very hard to put it in the in the basket instead of holding onto it.
机器人说,录像带是它最喜欢的物件,把它放进篮子里、而不是一直抱着它,是这个任务里最难的部分。
Keerthana Gopalakrishnan1:08:00
I really like that maybe DeepMind is probably the only lab here in North America where you can study humanoid intelligence in a cross embodied way.
我真心觉得,DeepMind大概是北美唯一一个能以跨具身的方式研究人形智能的实验室。
Keerthana Gopalakrishnan1:10:54
I looked up how many parameters she has in our neural network. Apparently, it's 25,000,000,000,000. So she has more parameters than lot of the models out there even though her her language skills are not that developed.
我查了一下她的神经网络有多少个参数,大概是25万亿个。所以她的参数量比很多现有模型都多,尽管她的语言能力并没有那么发达。
Keerthana Gopalakrishnan1:25:21
数字与实体
| Gemini Robotics On-Device 2 小样本学习 | 约200个示例即可在不同机身上学会多种任务 | 51:02 |
| SharpaWave 灵巧手承重 | 约20公斤 | 59:08 |
| Keerthana爱犬大脑的突触参数量 | 约25万亿 | 1:25:21 |
术语
- VLA (vision-language-action model)视觉-语言-动作模型
- 把视觉和语言输入直接映射成机器人动作的模型类型
- cross-embodiment跨具身
- 同一套策略/模型能否迁移到不同机器人身体上正常工作
- in-context learning / video prompting上下文学习/视频提示
- 不用微调,仅靠一次演示视频或图片就让机器人学会新任务
- whole-body control全身控制
- 模型统一推理控制从手指到脚的整个身体,而非分开处理移动和操作
- UMI (Universal Manipulation Interface)通用操作接口
- 基于手套和传感器采集真实触觉/动作数据的数据采集方式
- e-stop急停开关
- 机器人上用于紧急断电或冻结动作的安全装置,分硬停和软停两种
收听指南
关注人形机器人商业化节奏的创业者、投资人和机器人工程师,想知道具体卡在哪一层而不是听笼统预测。
21:28-24:19和36:02-40:00是赞助商插播,可以跳过。