世界太吵,来原声听播客

漫谈Light the Star

无脸跑不是丑,是强化学习自己选出的最优解

天工Omni为了跑得更快,自动放弃人类靠摆臂平衡的直觉,改用腰部扭动完成同样功能——机器学到的解法未必好看,却服从物理约束下的最优解。

人形机器人具身智能强化学习开源国家队供应链

原视频在 YouTube 上放不出来,用音频听:

想知道具身智能公司嘴上说的『涌现』『开源』『国家队』到底是什么意思,这集有一线从业者的实话,不是公关话术。

核心论点 · 点时间戳可跳到原声

2:01

无脸跑是惩罚函数逼出的产物

天工Omni的招牌动作「无脸跑」不是团队设计出来的,是强化学习自己学出来的结果。训练时团队给肩关节转动角度设了惩罚函数,不让机器人靠挥动上肢来保持平衡,机器人自己找到了用腰部扭动代替摆臂的方案。团队一度觉得这个跑姿不够漂亮,还想重新训练一套更美观的,但因为这就是跑得最快的解,最终直接拿去参赛。熊友军把这称作具身智能领域少见的涌现时刻。

— 熊友军
8:04

没人知道Scaling Law要多少数据

天工的通用运动控制器用了几百小时人类动作数据训练,英伟达同类模型Sonic用了700多小时,量级相近。但被问到具身智能的Scaling Law何时兑现时,熊友军直言现在都还不知道,千万小时级的数据量可能是需要的,但现在的数据还有几个数量级的差距。他更明确怀疑单纯堆数据是否是正确路径:大模型能堆数据是因为互联网上有海量文本可用,具身智能未必有这个条件,更可能需要类似人类小孩试错探索的新学习范式。

— 熊友军
15:08

去年独家自主,今年全员自主

去年的马拉松比赛,全场200多台机器人里只有天工是完全自主参赛,其余队伍都要靠人遥操跟跑;今年除了障碍赛偶尔需要遥控,其余项目已经普遍实现全自主。熊友军认为这个变化不是靠时间堆出来的,而是过去一年整个行业把资源和人才集中投向了机器人大脑——感知、决策、认知学习——的直接结果。

— 熊友军
18:11

真正做脑的公司不到5家

主持人抛出行业里的一个说法:不依托政府和大厂、真正有足够算力训练大脑模型的独立创业公司不超过5家。熊友军没有反驳这个判断,只说自己没做过统计,但认同训练大脑对算力要求极高——他们靠百度的云端算力和自建数据采集中心支撑,目前开源的数据采集量已接近20万小时,是高质量数据。

— 熊友军
27:16

本田P2点燃梦想,也提前预告了它的落幕

熊友军对机器人的热爱始于2002年读博时看到的一段视频:本田的P2(阿西莫前身)带着中国总理参观工厂产线,那个画面让他确信人机共融的未来会到来。但本田当年的技术路线完全基于数学模型求解,战略处理和视觉能力都很弱,背着巨大的外置计算机背包;深度学习和大模型出现后,这套范式被整体颠覆,本田就像诺基亚错过智能手机时代一样,失去了人形机器人领域的领先地位。

— 熊友军
42:23

任务级遥操不是作弊,是分工

这届运动会有队伍因谎称自主、实际靠遥操而被取消参赛资格,但遥操本身在规则里被保留,原因是遥操分好几个层级:普通人想象的是逐帧操控的傀儡式遥操;而更高级的任务级遥操,是人只给机器人一个复杂目标——比如判断配电箱的开关要不要扳动——具体怎么走过去、怎么避障、怎么执行完全由机器人自主完成。这是把人的判断和机器的执行能力结合,不是完全代替机器人思考。

— 熊友军
58:44

国家队的KPI是开源,不是营收

熊友军形容自己从优必选CTO转到创新中心一把手,是从公司的小我切换到国家和行业的大我:不再以最大化商业化为目标,而是站在全产业角度找共性痛点,把天工本体、慧思开悟等研发成果尽量开源开放,让商业公司避免底层重复造轮子、浪费社会资源。创新中心的早期股东——优必选、小米、亦庄国投等——投的也不是商业回报,而是认可这个技术创新方向。

— 熊友军
1:09:47

机器人的最后一公里输在信号损耗

有嘉宾在WRC的场合提出一个卡点:语言模型的输入输出是纯数字编码,严格限制在固定向量空间里,几乎没有损耗;但机器人每一次输入输出——尤其是触觉这类细微信号——都会引入偏差,几乎无法修正,精度因此随之暴跌。熊友军认同这个判断,称团队正在做的解法是把语言、视觉、触觉等不同模态统一表征进同一个向量空间再推理决策,这就是他们正在探索的大一统模型Pelican Unified。

— 熊友军

原话 · 已逐字校验

故意是把他肩关节的转动角度 做了一些限制 然后机器他为了跑那么快 他自己需要保持平衡 然后自己训练出跑制 所以他确确实实是自我学习 自我进化的一个结果

他们故意限制了机器人肩关节的转动角度作为惩罚项,机器人为了跑得更快,自己需要保持平衡,于是自己训练出了这种跑姿——这确确实实是它自我学习、自我进化的结果。

熊友军2:01

我们一直觉得完全靠数据去逮集的话 这可能不一定是一个正确的一个方式

我们一直认为,完全靠堆数据,这可能不一定是正确的方式。

熊友军10:04

今天我们的数据采集量其实已经非常大了 连采集的采集量快接近20万小时了 而且这是高质量的数据

今天我们的数据采集量已经非常大了,采集量快接近20万小时,而且这是高质量的数据。

熊友军18:11

不同的模态的信号 信息的这个表征 会带来一些损耗 所以其实我们现在也在追求 对多模态的这个信息进行统一的表征

不同模态的信号在做信息表征时会带来损耗,所以我们现在也在追求把多模态信息进行统一表征。

熊友军1:09:47

你机器人达不到安全的标准是不允许销售的 否则的话可能会对社会对人的用户造成一些不必要的一些意外 这是一个底线的问题

如果机器人达不到安全标准,是不允许销售的,否则可能会对社会、对用户造成不必要的意外——这是一个底线问题。

熊友军1:20:56

数字与实体

天工Omni百米决赛成绩8秒645:01
天工Omni百米彩排成绩9秒445:01
天工通用运动控制器训练数据量几百小时人类动作数据8:04
英伟达Sonic控制器训练数据量700多小时人类数据8:04
创新中心开源数据采集量接近20万小时18:11
京东物流分拣人类最快速度2000多件/小时57:34
国内机器人物流分拣速度1200-1300多件/小时57:34

术语

VLA视觉-语言-动作模型
把视觉感知、语言理解和动作输出统一在一个模型里做端到端控制
Ego第一视角数据采集
头戴摄像头拍下人类第一视角操作画面,用来低成本训练机器人模仿学习
World Model世界模型
让机器人对物理世界的变化和因果关系做内部预测、推理的模型
Unified Model大一统模型
把VLA、多模态大模型和世界模型的能力融合进同一套统一表征空间的模型
Scaling Law规模法则
模型性能随数据和算力规模增长而提升的规律,大模型领域已验证,具身智能领域仍未验证

收听指南

谁该听

关注具身智能/机器人赛道的投资人、创业者,以及想搞清楚『国家队』和商业公司开源博弈逻辑的从业者。

可跳过

开场0:00-2:01是内容简介与寒暄,可直接跳到无脸跑的技术解读部分。