兩萬臺出貨九成吃灰:具身行業進入算ROI的實戰期
WRC的熱浪之下,真正做預訓練的創業公司可能只有一兩家,真實落地需求可能只有出貨量的10%,行業已從秀demo進入算ROI的實戰階段。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
定時演出的 demo,值得懷疑成功率
葉陽生教了一組逛展鑑別法:先看demo是否定時——定時演出可能是對成功率不自信,需要人盯著守,也可能是硬件撐不住長時間運行;再看雙臂是否同時做獨立動作,搖操通常一隻手做完再做另一隻,兩手不同軌跡大概率是自主規劃;還要看失敗後能否自恢復、換個光線或放純白物體還認不認得。他建議搭展期間進場館看,很多公司其實在現場補採數據再訓練,只有宇樹走純仿真路線不需要這一步。
— 葉陽生真正的頭條不是新機器人,是採購日
本屆WRC和以往最大的區別是設立了採購日,央企和大型企業直接帶採購項目進場,這才是真正的頭條。葉陽生展出的是配送機器人加機械臂重做酒店送外賣場景:機器人自己取外賣、按電梯、送到房門口。為什麼不用上一代改造電梯的方案?因為海外基本走不通,可能涉及安全法規,改造成本是國內好幾倍;國內電梯是特種設備,報備施工有周期,無改造方案能加快交付。他認為人形機器人的定義是形態和行為接近人的機器,能使用為人類準備的設施,但不一定非得兩條手臂。
— 葉陽生排掉跳舞表演,真落地能有一成就不錯
主持人播報了一組出貨數據:2026上半年全球人形機器人出貨突破2.2萬臺,中國廠商佔約97%;智元9700臺排第一,宇樹7000多臺,銀河通用1100臺,前五家合計佔全球86%。葉陽生認為中國在整機上有支配性地位,靠的是製造業基礎,國外模型強但在本體上完全沒法打。但把跳舞表演類出貨排掉後,他認為真實落地需求能到10%已經非常非常好了;太空艙零售那種場景ROI算不過來,環境單一、動作固定,也產生不了能提升泛化能力的數據。
— 師傑、葉陽生都自稱世界模型全棧自研,水分非常大
資本市場的熱度在世界模型,但現場真正展示demo的很少。李飛飛說的三個方向裡,生成和仿真評測還能演示;第三種是潛空間裡的規劃式世界模型,預測物體未來一段時間的潛向量變化,很難可視化,放出來的視頻和VLA demo沒有差別。被問及每家都自稱VLA加世界模型加全棧自研有沒有水分,葉陽生說水分非常大:真正買了萬卡集群、持續買數據做預訓練的創業公司可能只有一兩家,很多公司拿著幾十億在賬上,等國外把路趟出來再砸錢,避免為人作嫁。
— 葉陽生機器人發到工廠沒在跑,收入不能確認
宇樹上市是本屆最大場外熱點,葉陽生說標杆市值對行業是好事,證明具身公司上得去,市值越高對大家越好。但排隊上市的20多家公司要過嚴格審計:機器人發到工廠但沒在用,不能確認收入;簽了驗收單但實際不運行,不行;賣給代理商但沒到終端用戶,不行;賣給數據廠再把數據買回來,相當於體內循環,也不行。葉陽生說自己公司經歷過這種審計,審計員會去工廠實地看機器人有沒有在跑。
— 葉陽生今年真正的增量在神經層,不在大腦
葉陽生把技術棧分成大腦、小腦、神經三層:大腦層面真正做預訓練的公司極少,模型高度同質化,基本是follow國外最前沿,新方向是用agent調度多個專家模型來完成長任務;小腦運控各家進步都大,但動作速度離人還差一個數量級;神經是今年真正的增量——機器人傳感器和執行器越來越多,需要高速穩定、支持硬件對時的總線協議,但現在還沒有一套標準定義,幹這種活的其實是芯片廠和底軟公司。
— 葉陽生數據的標準不會被定義出來,只能被打出來
數據痛點拆成四層:數據格式沒有行業規範,各家自定一套,別人拿來用要先做轉換,量大時成本很高;時序要求幾十納秒級的時間同步,傳感器如果只支持軟件對時精度不夠,而不同廠家的硬件對時協議還不一樣;標註規範沒有共識,除了標杯子,要不要標透明度、速度都在試;再往上採集口徑取決於本體的設計和大腦的訓法,整條鏈路無法歸一化。葉陽生說他們做數據子公司的思路,是把當年做控制器做到全球第一的底層邏輯再做一遍——儘可能適配更多家,用事實標準去統一。
— 葉陽生今年的進步不來自世界模型,來自後訓練
被問到今年行業進展由什麼帶來,葉陽生說不是世界模型,是後訓練:強化學習本身就是一種後訓練,加上數據質量變高、AI coding帶來的工程能力變強。但他承認行業整體焦慮,還沒看到真正能落地的產品;談及ROI,他現場觀察沒看到與工業機器人的差距在明顯縮小,但認同會隨時間收斂。他預期明年數據和世界模型會出驚喜,因為今年大家在高質量低成本數據獲取和管線基建上投入非常大。他明年只看兩個指標:動作快不快,以及是否從開展到結束一直在跑而不是定時演示。
— 葉陽生原話 · 已逐字校驗
很多其他展商,他們的demo可能是要定時的。比如說整點可以去演示一下。這我很好奇,作為行家來分析一下,就是為什麼要定時,可能一個是對成功率不太自信,他得一直在旁邊有人盯著守著
很多展商的demo是定時演示的。我很好奇,作為行家來分析,為什麼要定時?可能是對成功率不自信,得有人一直盯著守著。
葉陽生3:18
這是自主的,還是後面有人要操要操臺藏在哪的。因為我去看展啊,就每個展位我還是會仔細觀察,嗯他這個集成人的一些。比較細微的動作。
這是自主的,還是後面有人在遙操、操作檯藏在哪兒?我每個展位都會仔細觀察操作者的細微動作。
師傑、葉陽生9:44
那你不說那種跳舞表演,算把那些把那些排掉排掉,我認為可能有有10%已經非常非常好了。
把跳舞表演這類場景排掉之後,我認為真實需求能佔到10%就已經非常非常好了。
葉陽生20:19
李飛菲說的世界模型其實三個方向,第一個是。第一個是生成,第二個就是仿真評測。第三個就是規劃吧。
李飛飛說世界模型有三個方向:第一是生成,第二是仿真評測,第三是規劃。
葉陽生26:55
我可以透露一些行業內容,就是就是目前可能真正的在做預訓練的公司,可能只有1到2家1到2家對,1到2家。然後大家可能拿著幾十億在賬上都固化
可以透露一個行業信息:目前真正在做預訓練的公司可能只有一兩家,其他人可能拿著幾十億在賬上放著不動。
葉陽生29:02
那對於機成也是的,其實呃還沒有一個對於機器人這個呃總線或者說協議這樣的一套比較標準的定義,可以去快速方便大家去接入這接入到你的小腦,或者說你的大腦中去。
對機器人也一樣,目前還沒有一套標準的機器人總線或協議定義,讓各家能方便地接入小腦或大腦。
葉陽生41:37
其實大家定義的這個場景,你真的要去講,其實也沒有太複雜,還是有限的場景下,並且很多我們能看到這些場景,它的移動範圍都比較小。所以VLA完全是夠用的。
大家定義的這個應用場景,認真講其實沒有多複雜,還是有限場景,而且能看到demo的移動範圍都比較小,所以VLA完全夠用。
葉陽生57:54
數字與實體
| 2026上半年全球人形機器人出貨量 | 突破2.2萬臺 | 18:10 |
| 中國廠商佔全球出貨比例 | 約97% | 18:10 |
| 智元機器人出貨量(全球第一) | 9700臺 | 18:10 |
| 宇樹科技出貨量 | 7000多臺 | 18:10 |
| 前五家廠商合計全球份額 | 86% | 18:10 |
| 真實落地需求佔出貨量比例 | 約10%(葉陽生估計) | 20:19 |
| 真正在做預訓練的創業公司數量 | 1-2家 | 29:02 |
| 排隊IPO的具身智能公司數量 | 20多家 | 30:07 |
| 頭部具身公司現金與利息(「永續公司」說法) | 賬上幾十億,年利息小几個億,可覆蓋數百研發人員工資 | 31:09 |
| 人形機器人整機成本 | 已低於10萬元 | 59:58 |
術語
- VLA視覺-語言-行動模型
- 把視覺、語言輸入直接映射為機器人動作的端到端模型,是本屆demo的主流技術棧。
- World Model世界模型
- 讓模型在內部模擬物理世界演變,用於生成場景、仿真評測或規劃,分可視化和潛空間兩種。
- Teleoperation遙操作
- 由人實時遠程操控機器人,常用於採集數據或遠程演示,從動作連續性可分辨。
- EMG肌電信號
- 腕帶採集肌肉放電的生物電信號,與視覺/觸覺雙重驗證手部姿態,是今年傳感器新趨勢。
- Data Pipeline數據管線
- 從採集、標註、格式轉換到餵給模型前的一系列處理流程,行業尚無統一標準。
- Post-training後訓練
- 預訓練之後用強化學習、高質量數據繼續調整模型的階段,業內認為今年進步主要由此驅動。
收聽指南
想判斷國內人形機器人公司真實成色的投資人,以及正在選機器人方案、想繞過PR話術的製造企業技術負責人。
前2分半是節目導語與嘉賓公司介紹,可跳過;其餘全程高密。