世界太吵,来原声听播客

漫谈Light the Star

两万台出货九成吃灰:具身行业进入算ROI的实战期

WRC的热浪之下,真正做预训练的创业公司可能只有一两家,真实落地需求可能只有出货量的10%,行业已从秀demo进入算ROI的实战阶段。

具身智能人形机器人WRC世界模型数据管线机器人投资
14年从业者给出可复制的逛展鉴别清单,敢说真做预训练的公司可能只有一两家;后半段对数据痛点、总线神经的拆解最扎实。

核心论点 · 点时间戳可跳到原声

3:18

展会含金量鉴别法

叶阳生教了一组逛展鉴别法:先看demo是否定时——定时演出可能是对成功率不自信,需要人盯着守,也可能是硬件撑不住长时间运行;再看双臂是否同时做独立动作,摇操通常一只手做完再做另一只,两手不同轨迹大概率是自主规划;还要看失败后能否自恢复、换个光线或放纯白物体还认不认得。他建议搭展期间进场馆看,很多公司其实在现场补采数据再训练,只有宇树走纯仿真路线不需要这一步。

— 叶阳生
14:31

头条是采购日:央企进场

本届WRC和以往最大的区别是设立了采购日,央企和大型企业直接带采购项目进场,这才是真正的头条。叶阳生展出的是配送机器人加机械臂重做酒店送外卖场景:机器人自己取外卖、按电梯、送到房门口。为什么不用上一代改造电梯的方案?因为海外基本走不通,可能涉及安全法规,改造成本是国内好几倍;国内电梯是特种设备,报备施工有周期,无改造方案能加快交付。他认为人形机器人的定义是形态和行为接近人的机器,能使用为人类准备的设施,但不一定非得两条手臂。

— 叶阳生
18:10

2.2万台里的出货水分

主持人播报了一组出货数据:2026上半年全球人形机器人出货突破2.2万台,中国厂商占约97%;智元9700台排第一,宇树7000多台,银河通用1100台,前五家合计占全球86%。叶阳生认为中国在整机上有支配性地位,靠的是制造业基础,国外模型强但在本体上完全没法打。但把跳舞表演类出货排掉后,他认为真实落地需求能到10%已经非常非常好了;太空舱零售那种场景ROI算不过来,环境单一、动作固定,也产生不了能提升泛化能力的数据。

— 师杰、叶阳生
25:55

世界模型热但难展示

资本市场的热度在世界模型,但现场真正展示demo的很少。李飞飞说的三个方向里,生成和仿真评测还能演示;第三种是潜空间里的规划式世界模型,预测物体未来一段时间的潜向量变化,很难可视化,放出来的视频和VLA demo没有差别。被问及每家都自称VLA加世界模型加全栈自研有没有水分,叶阳生说水分非常大:真正买了万卡集群、持续买数据做预训练的创业公司可能只有一两家,很多公司拿着几十亿在账上,等国外把路趟出来再砸钱,避免为人作嫁。

— 叶阳生
37:57

宇树上市与收入审计红线

宇树上市是本届最大场外热点,叶阳生说标杆市值对行业是好事,证明具身公司上得去,市值越高对大家越好。但排队上市的20多家公司要过严格审计:机器人发到工厂但没在用,不能确认收入;签了验收单但实际不运行,不行;卖给代理商但没到终端用户,不行;卖给数据厂再把数据买回来,相当于体内循环,也不行。叶阳生说自己公司经历过这种审计,审计员会去工厂实地看机器人有没有在跑。

— 叶阳生
40:11

大脑、小脑与神经三层水位

叶阳生把技术栈分成大脑、小脑、神经三层:大脑层面真正做预训练的公司极少,模型高度同质化,基本是follow国外最前沿,新方向是用agent调度多个专家模型来完成长任务;小脑运控各家进步都大,但动作速度离人还差一个数量级;神经是今年真正的增量——机器人传感器和执行器越来越多,需要高速稳定、支持硬件对时的总线协议,但现在还没有一套标准定义,干这种活的其实是芯片厂和底软公司。

— 叶阳生
44:53

数据痛点的四个维度

数据痛点拆成四层:数据格式没有行业规范,各家自定一套,别人拿来用要先做转换,量大时成本很高;时序要求几十纳秒级的时间同步,传感器如果只支持软件对时精度不够,而不同厂家的硬件对时协议还不一样;标注规范没有共识,除了标杯子,要不要标透明度、速度都在试;再往上采集口径取决于本体的设计和大脑的训法,整条链路无法归一化。叶阳生说他们做数据子公司的思路,是把当年做控制器做到全球第一的底层逻辑再做一遍——尽可能适配更多家,用事实标准去统一。

— 叶阳生
55:30

行业进步由后训练驱动

被问到今年行业进展由什么带来,叶阳生说不是世界模型,是后训练:强化学习本身就是一种后训练,加上数据质量变高、AI coding带来的工程能力变强。但他承认行业整体焦虑,还没看到真正能落地的产品;谈及ROI,他现场观察没看到与工业机器人的差距在明显缩小,但认同会随时间收敛。他预期明年数据和世界模型会出惊喜,因为今年大家在高质量低成本数据获取和管线基建上投入非常大。他明年只看两个指标:动作快不快,以及是否从开展到结束一直在跑而不是定时演示。

— 叶阳生

原话 · 已逐字校验

很多其他展商,他们的demo可能是要定时的。比如说整点可以去演示一下。这我很好奇,作为行家来分析一下,就是为什么要定时,可能一个是对成功率不太自信,他得一直在旁边有人盯着守着

很多展商的demo是定时演示的。我很好奇,作为行家来分析,为什么要定时?可能是对成功率不自信,得有人一直盯着守着。

叶阳生3:18

这是自主的,还是后面有人要操要操台藏在哪的。因为我去看展啊,就每个展位我还是会仔细观察,嗯他这个集成人的一些。比较细微的动作。

这是自主的,还是后面有人在遥操、操作台藏在哪儿?我每个展位都会仔细观察操作者的细微动作。

师杰、叶阳生9:44

那你不说那种跳舞表演,算把那些把那些排掉排掉,我认为可能有有10%已经非常非常好了。

把跳舞表演这类场景排掉之后,我认为真实需求能占到10%就已经非常非常好了。

叶阳生20:19

李飞菲说的世界模型其实三个方向,第一个是。第一个是生成,第二个就是仿真评测。第三个就是规划吧。

李飞飞说世界模型有三个方向:第一是生成,第二是仿真评测,第三是规划。

叶阳生26:55

我可以透露一些行业内容,就是就是目前可能真正的在做预训练的公司,可能只有1到2家1到2家对,1到2家。然后大家可能拿着几十亿在账上都固化

可以透露一个行业信息:目前真正在做预训练的公司可能只有一两家,其他人可能拿着几十亿在账上放着不动。

叶阳生29:02

那对于机成也是的,其实呃还没有一个对于机器人这个呃总线或者说协议这样的一套比较标准的定义,可以去快速方便大家去接入这接入到你的小脑,或者说你的大脑中去。

对机器人也一样,目前还没有一套标准的机器人总线或协议定义,让各家能方便地接入小脑或大脑。

叶阳生41:37

其实大家定义的这个场景,你真的要去讲,其实也没有太复杂,还是有限的场景下,并且很多我们能看到这些场景,它的移动范围都比较小。所以VLA完全是够用的。

大家定义的这个应用场景,认真讲其实没有多复杂,还是有限场景,而且能看到demo的移动范围都比较小,所以VLA完全够用。

叶阳生57:54

数字与实体

2026上半年全球人形机器人出货量突破2.2万台18:10
中国厂商占全球出货比例约97%18:10
智元机器人出货量(全球第一)9700台18:10
宇树科技出货量7000多台18:10
前五家厂商合计全球份额86%18:10
真实落地需求占出货量比例约10%(叶阳生估计)20:19
真正在做预训练的创业公司数量1-2家29:02
排队IPO的具身智能公司数量20多家30:07
头部具身公司现金与利息(「永续公司」说法)账上几十亿,年利息小几个亿,可覆盖数百研发人员工资31:09
人形机器人整机成本已低于10万元59:58

术语

VLA视觉-语言-行动模型
把视觉、语言输入直接映射为机器人动作的端到端模型,是本届demo的主流技术栈。
World Model世界模型
让模型在内部模拟物理世界演变,用于生成场景、仿真评测或规划,分可视化和潜空间两种。
Teleoperation遥操作
由人实时远程操控机器人,常用于采集数据或远程演示,从动作连续性可分辨。
EMG肌电信号
腕带采集肌肉放电的生物电信号,与视觉/触觉双重验证手部姿态,是今年传感器新趋势。
Data Pipeline数据管线
从采集、标注、格式转换到喂给模型前的一系列处理流程,行业尚无统一标准。
Post-training后训练
预训练之后用强化学习、高质量数据继续调整模型的阶段,业内认为今年进步主要由此驱动。

收听指南

谁该听

想判断国内人形机器人公司真实成色的投资人,以及正在选机器人方案、想绕过PR话术的制造企业技术负责人。

可跳过

前2分半是节目导语与嘉宾公司介绍,可跳过;其余全程高密。