世界太吵,來原聲聽播客

張小珺·商業訪談錄

機器人不需要人形,也能疊衣服做咖啡

Pi 用三篇主線論文把機器人大腦從能力推到泛化再到表現,柯麗一鳴認為人形不是現階段最該解的問題,真機數據不可取代,機器人自己跑出來的體驗數據才是下一步。

具身智能機器人大腦強化學習真機數據Pi中美硬件
四小時訪談信息密度高,前半段成長與派系梳理可快進,中後段 Pi 三篇論文的技術邏輯和真機數據之爭值得細讀。

核心論點 · 點時間戳可跳到原聲

1:54:43

Pi 三篇主線論文各回答一個問題

柯麗一鳴把 Pi 的主線發表拆成三個關鍵詞:π0 是能力,π0.5 是泛化,π*0.6 是表現。π0 做了疊衣服、疊箱子、桌面抓放三個任務,2024 年 11 月的疊衣服是當時沒人見過的級別。π0.5 要回答的是 in domain 和 out of domain 的問題——如果模型只在訓練過的房子裡表現好,影響力就很有限,所以他們去一百個 Airbnb 收數據,發現數據量到一個尺寸後,到新房子裡的表現會放緩,不需要收遍全世界所有人的家。π*0.6 回到「什麼都能做但什麼都做不好」的質疑,強調方法簡潔性,讓智能體在真實世界裡收集自己的體驗數據放回訓練池。

— 柯麗一鳴
2:00:12

機器人自己跑出來的數據比人遙操作便宜

真機數據貴,柯麗一鳴拆成幾塊:要有真機平臺、要放到人家裡、要維護、要找人做任務、還要跟這個人交流做規劃,最複雜的是管理這個人。但如果把數據操縱源換成已經訓好的大模型,讓模型自己 roll out,數據成本能降很多。他比較 bullish 地堅信將來機器人價格應該又便宜又方便,現在很多人對數據的擔憂在時間長河裡其實都不重要,因為部署過程中這麼多機器人收的數據都能為我所用。這也是 π*0.6 星號的含義:把成品數據放回模型之中。

— 柯麗一鳴
2:03:15

錯誤數據是好數據,但也可以讓機器人自己跑

模仿學習有個嚴重問題叫積累的錯誤:每一步微小錯誤不斷放大,機器人會到達一個完全沒想過、人收集數據時不會碰到的糟糕情況,一旦進去就不知道怎麼修正路線。所以收數據時不光要收完美的人的數據,還要收機器人進入不好情況後怎麼修復、怎麼繼續完成任務的修正數據。但柯麗一鳴再次強調,修正數據也可以通過機器人自己跑來說,這就是強化學習比較本質的東西。在真機數據和仿真數據之爭上,他是黑貓白貓抓到老鼠就是好貓,但本源上相信真機數據,因為疊衣服這種柔性、摩擦力、粘性複雜的任務,仿真器可能根本搞不出來。

— 柯麗一鳴
2:09:17

評估是機器人前沿最難定義的原因

NLP 當年生成一段話讓人打分已經不容易,機器人更糟:你得在機器人上跑才能知道他做了什麼,才能打分,還要受機械物理限制,一些變化你自己不知道就會影響模型表現。拿杯子這個任務,杯子放在桌子任何地方、不同光照、不同背景、桌子高度、甚至不是桌子而是柱子、杯子自己的角度,無窮盡的初始條件都會影響最終表現。評估難直接導致機器人領域不像其他領域有英雄榜,發一個超大數據集每個模型跑一跑看誰是第一名。所以現在前沿很難定義,大家方向分散,都在朝不同方向發展,不知道哪條線是那條大道。

— 柯麗一鳴
2:32:30

如果 Pi 做人形,他就不來了

柯麗一鳴 2024 年 Pi 剛創立一週內去聊,問他們先做人形嗎、要做什麼商業化。他感受到的氛圍是確實不做人形。他說如果他們說做人形他就不來了,因為他擔心不同背景的人做人形,研究重心會變成如何做一個更好的人形機器人,而他的研究重心是做更好的任務。他非常相信不需要人形就能做出很好的任務,而且不需要人形就能更快做出來——疊衣服、疊箱子、做咖啡都是先做好了,不需要人形就可以做。他覺得這是 Taste 的問題,還有很多無窮無盡的任務等著做。

— 柯麗一鳴
2:46:33

強化學習本質是巴甫洛夫的狗

柯麗一鳴說強化學習解釋起來就是巴甫洛夫的狗:狗做了一個事情你給它獎勵,它從此知道這個事情是好事情要多做,通過獎勵和懲罰讓智能體做更好的動作。它跟人的自我提升有很多關係,追求極致是強化學習非常強烈的因素,就是不停去練。另一個重要部分是探索,可大可小,可能是肌肉往左移一下網球表現更好,也可能是研究方向的切換。還有歸因:寵物做了一系列事情你最後給一個獎賞,它需要知道到底哪個事情是這次得到好獎賞的決定性因素。π*0.6 裡就有探索,收集這麼多部署數據,究竟哪一條數據裡哪個步驟做得好,讓整條數據得到關鍵性獎賞。

— 柯麗一鳴
3:16:50

中國硬件統治力讓美國不知道怎麼追

柯麗一鳴說一兩年前想看到春晚那種級別的 demo 只是想想而已,能看到真的做出來非常激動,背後有算法提升也有硬件實力。現階段看中美產業對比,最直觀的感受是中國在硬件上有領導力、統治力,很難想像有一家機器人公司組裝好一臺機器人,裡面沒有一個零件是中國的。中國有產業鏈製造業的優勢實在太大,他甚至不知道美國人要追的話該怎麼追。同時硬件迭代讓現有算法距離商業落地端也有一些優勢。但他也承認,缺少產業鏈製造業這一環,會讓美國公司的迭代速度變慢。

— 柯麗一鳴
3:17:50

過早商業化讓 Covariant 失去通用泛化性

柯麗一鳴解釋 Pi 為什麼暫時完全不考慮商業化,說這是有歷史原因的。Peter Abell 是 Sergey Levine 的導師,有過兩次創業經歷,一次做給學生作業打分的系統,現在美國大學基本都在用;另一次 2015 或 2016 年創立了機器人公司 Covariant,要做機器人通用的機器學習方案。但公司在發展過程中某個時間點開始深耕物流倉儲機器人,從大模型開發角度回頭看,這其實是對開發大模型的分心——因為過早商業化而失去了通用泛化性,把精力放在很多商業化相關事情上,沒有真的去追溯本源問題。所以 Pi 受到這段經歷影響,強調不要太想商業化的事情,大家很純粹地說要做一個研究,把它表現做得最好。

— 柯麗一鳴

原話 · 已逐字校驗

第一篇是派靈 它的關鍵詞應該就是能力 第二篇是派0.5 它的關鍵詞是泛化 然後最近的這篇是派0.6星 它的關鍵詞是表現

第一篇是 π0,它的關鍵詞是能力;第二篇是 π0.5,它的關鍵詞是泛化;最近的這篇是 π*0.6,它的關鍵詞是表現。

柯麗一鳴1:55:10

但我覺得 就是如果機械的價格 降下來的話 就在這個過程中 我個人認為 現在的比較大的大頭 其實是管這個人 去收到你想像的這個數據 但如果你可以把 就是數據的操縱源 這個給放在一邊 而是換上你 已經訓好的一個大模型 讓大模型在這裡跑 其實你數據的成本 應該是能降很多

但我覺得,如果機械的價格降下來的話,在這個過程中,我個人認為現在比較大的大頭其實是管這個人去收到你想像的這個數據。但如果你可以把數據的操縱源放在一邊,換上你已經訓好的一個大模型,讓大模型在這裡跑,其實你數據的成本應該是能降很多。

柯麗一鳴2:02:14

所以現在這個frontier 還是很難定義的 我覺得可以看到一些算法 可以看到一些算法的表現 就是怎麼說呢 可能是 就是一個最核心的部分 大家都看得見 然後隨著它向著 更前沿的方向邁進以後 就變得越來越有些亂 就需要你能從分亂中 找到一個清晰的線

所以現在這個 frontier 還是很難定義的。我覺得可以看到一些算法,可以看到一些算法的表現,就是怎麼說呢,可能就是一個最核心的部分大家都看得見,然後隨著它向著更前沿的方向邁進以後,就變得越來越有些亂,就需要你能從紛亂中找到一個清晰的線。

柯麗一鳴2:09:17

我當時感受到的氛圍 就是確實我們不做人型 因為他們要說做人型 我就不來了 你知道吧

我當時感受到的氛圍就是,確實我們不做人形,因為他們要說做人形,我就不來了,你知道吧。

柯麗一鳴2:32:30

我覺得強化學習是一個非常本質的一類問題 也就是說一個人如何通過體驗變得更好 這個問題從最傳統教科書上來說 解釋強化學習 其實就是解釋這個巴布洛夫的狗

我覺得強化學習是非常本質的一類問題,也就是說一個人如何通過體驗變得更好。這個問題從最傳統的教科書上來說,解釋強化學習其實就是解釋巴甫洛夫的狗。

柯麗一鳴2:47:33

就是很難想像 有一家機器人公司 它 組裝好了一臺機器人 然這裡面沒有一個零件 是中國的 我覺得是不太可能

就是很難想像有一家機器人公司,它組裝好了一臺機器人,裡面沒有一個零件是中國的,我覺得是不太可能。

柯麗一鳴3:16:50

就因為過早的去商業化 而失去了就是這種通用繁華性 反而把精力放在了很多 這種商業化的相關事情上 嗯 沒有真的去追溯本源的問題

就因為過早地去商業化,而失去了這種通用泛化性,反而把精力放在了很多商業化相關的事情上,沒有真的去追溯本源的問題。

柯麗一鳴3:17:50

數字與實體

Pi 估值超過 50 億美元0:00
π0.5 數據收集房屋數約 100 個家1:58:12
Pi 員工數約 70 人2:28:29
柯麗一鳴博士時長7 年2:42:32
華大博士畢業記錄9 年2:43:33
Cloud Agent 帶來的工作效率提升約 3-4 倍2:31:30
安徽省每萬人上清華北大比例約 3-4 人25:22
大城市每萬人上清華北大比例約 80 人25:22
2017 年 ShadowHand 價格50 萬到 100 萬美金51:45
2017 年 Franka 價格幾萬美金52:46

術語

VLA視覺-語言-動作模型
把視覺、語言和動作統一到一個模型裡的機器人架構。
in domain / out of domain數據內 / 數據外
模型在訓練數據覆蓋範圍內和範圍外的表現差異。
Diffusion Policy擴散策略
用擴散模型生成機器人動作的一種方法。
sim2real仿真到真機遷移
把仿真器裡訓練的策略遷移到真實機器人上。
throughput固定時間內成功的量
π*0.6 提出的評估指標,衡量單位時間內完成任務的成功量。
FAST動作表達空間
Pi 的一篇論文,研究如何學一種更優的動作表達方式供大模型預測。

收聽指南

誰該聽

關注具身智能和機器人大腦的創業者、投資人、工程師,尤其是想了解 Pi 技術路線、真機數據之爭和中美硬件差距的人。

可跳過

前 40 分鐘的成長、寫小說和武俠遊戲經歷可以快進,直接從中段的機器人派系和 Pi 研究聽起。