世界太吵,來原聲聽播客

張小珺·商業訪談錄

特斯拉那套數據閉環,在機器人身上走不通

特斯拉能收到最多數據,是因為它部署了最多自己的車,靠的是本體。但具身領域沒有上百萬臺機器人,最多的數據必然來自仿真和人的第一視角,本體商當不成最好的大腦商。

數據具身智能仿真機器人大模型數據定價
數據被講成石油講了很久,這集給的是可以下判斷的機制:誰出數據、誰評數據、誰定價,以及為什麼大模型派和真機派會分道。

核心論點 · 點時間戳可跳到原聲

21:18

數據不是數據集,是教育系統

謝晨給數據的定義不是數據集,而是「能夠幫助你去學習的信號,以及相應的這些經驗的傳授」。他把數據產業三個階段跟教育類比:ImageNet 是靜態數據集,相當於一次性的填鴨式教育,買一批教材發給學生;Scale AI 把數據變成工廠式流程,相當於量販式教育;到了大模型時代,預訓練吃完了互聯網,重點轉到後訓練和評測,要靠能力很強的工程師、物理學家、數學金牌、律師、醫生來出題、給評價標準,再根據評價因材施教,這才到了「師者所以傳道授業解惑也」。所以數據是從靜態數據集慢慢變成一個教育系統。

— 謝晨
33:26

最有效的數據是先失敗再成功

客戶最早給光輪智能的需求是提供完全正確、完美的仿真長程任務數據,比如機器人做披薩:從冰箱拿出餅,放調料,放烤箱,按鍵,每個動作都不能出錯。但客戶和他們一起迭代後發現,最有效的數據是先失敗再成功的數據——蘑菇沒抓牢掉到桌上,撿起來再放回披薩上。這類被稱作副樣本或糾正數據的樣本反而更貴、更有價值。謝晨的解釋是,當模型的泛化能力提升以後,它更能從錯誤裡把認知學回來,這更接近人的學習過程:失敗了以後再成功的經驗往往是最寶貴的。

— 謝晨
44:46

用機械臂,恰恰因為不想碰硬件

大模型團隊做 VLA 時選的是最簡單的機械臂,而不做人形或輪式底盤,原因恰恰是他們不想做硬件相關的事——人形的維護和每個本體的調試都複雜得多。他們要的是零樣本泛化:在十種、一百種任務上訓練過,另外五個沒見過的任務也能做出來。同時兩邊的基礎設施差一個數量級:機器人公司有幾千張卡已經很多了,大模型團隊通常是大幾萬張;大規模並行的強化學習基礎設施很難為了具身模型自研,而大模型團隊已經有現成的,只是從大語言模型場景遷移去微調 VLA。

— 謝晨
51:55

特斯拉的數據閉環在具身不成立

特斯拉的數據引擎本質是本體相關的邏輯:它在全世界部署了最多的車,收回最多的數據,訓出最好的大腦,所以 OEM 自己就是最大的大腦商。謝晨認為這個邏輯在具身會被顛覆——世界上並不具備上百萬臺機器人部署在端側執行任務,靠人搖操作成本又過高、無法規模化。所以具身的數據架構一定符合數據金字塔:最貴的真機數據量最小、最難規模化,中間是仿真,下面是互聯網和人的第一視角數據。這意味著最多的具身數據一定不是本體提供的,不會有一個本體商既是最廣泛應用的硬件、又是全世界最好的大腦——Optimus 的大腦就是交給 xAI 提供的。

— 謝晨
1:18:13

頂級真機派過去三個月集體掉頭

光輪智能最早服務的客戶都是強的仿真 believer,而最頂級的 frontier lab、最頂級的大模型團隊曾經是真實流派,絕對不願意嘗試任何仿真。但過去三個月,這些團隊基本都成了客戶。他們共同遇到的問題是沒辦法規模化自己的評測:真機數據或者學術界的 benchmark 打不出真正的 industry 意義,因為太簡單、不夠規模化。做家庭場景的大腦團隊疊衣服、做家務已經做得很好,但他們需要一千個不同的家居場景和成千上萬個任務隨時評價自己,這個只能通過仿真拿到。

— 謝晨
1:50:45

真機被高估,仿真評測被低估

謝晨的判斷是:真實的機器人數據肯定被高估了,過去幾個月連原來真機派的公司和大模型團隊都在大規模採購仿真數據、仿真評測和人類數據。仿真整體還處於被低估的狀態,而被低估得最厲害的是仿真的評測——大模型團隊完全看到了這一點,因為沒有仿真就做不了大規模評測;很多機器人公司因為規模還沒那麼大,等任務數量和開放場景上來才會越來越感到這個痛點,繞不開仿真。人類數據同樣被低估,它補充和增強以仿真為中心的這條閉環,而不是替代它。

— 謝晨
2:12:55

扯皮解決不了,只能靠共生

數據公司和模型公司之間的經典扯皮——數據方說你們模型沒訓好,模型方說你們數據採得不行——謝晨承認客觀存在,並把它類比成 Scale AI 和 OpenAI 在 GPT 階段的處境:大家其實在共同找尋數據的配方,大方向已經明確,差別在細節,比如從最早要完美的數據,到後來要副樣本、糾錯數據,再到要求分布更廣,拿瓶子的方式不能每次都一樣。解法是跟最領先的客戶共生迭代。他說全世界真正能對大規模預訓練級數據產生認知的團隊極少,可能也就五個左右,光輪基本都跟他們有合作。

— 謝晨
2:31:05

只解決一個數據問題就是評測

如果數據裡只能解決一個最關鍵的問題就能實現大幅躍升,謝晨的答案是評測。理由是本體無關的數據的預訓練通路和 scaling law 已經出現,評測成了真正的卡口——解決不了,大家就很難衡量自己智能的提升。對具身而言,必須把真正規模化的仿真評測做出來,這是所有人都會需要的能力。大模型那邊同樣卡在評測和後訓練上,而且是魔高一尺道高一丈:模型能力提升以後,需要更牛的人去提供更好的反饋、制定更難的考題和更有效的評測指標。

— 謝晨

原話 · 已逐字校驗

但是後來 我們的客戶包括我們一塊通過迭代發現 其實最有效的數據是 先失敗再成功的數據

但後來,客戶和我們一起迭代發現,其實最有效的數據是先失敗、再成功的數據。

謝晨33:26

比如說自動駕駛或者大圓模型 為什麼他們的模型提升會那麼快 自動駕駛本質上來講 是因為他的評價是免費的

比如自動駕駛或者大語言模型,為什麼它們的模型提升那麼快?自動駕駛本質上是因為它的評價是免費的。

謝晨58:58

他們就是真實流派的 他們絕對不願意去嘗試 任何的仿真 但是其實咱們再看 我們過去的可能三個月的時間 過去的三個月時間 基本上他們都成為我們的客戶

他們是真實流派,絕對不願意嘗試任何仿真;但過去三個月裡,他們基本都成了我們的客戶。

謝晨1:17:12

我認為仿真的話 我認為他更多的是需要 在一個足夠物理準確的 一個環境中 可以可復現的 就以及可以可修正的 去產生相應的行動 並且觀測到其結果 我認為這個才需要是一個仿真

仿真更多的是需要在足夠物理準確的環境中,可復現、可修正地產生相應的行動,並且觀測到結果——我覺得這才算一個仿真。

謝晨1:27:22

我現在觀點是我認為智能越強 其實它對於知識的飢渴程度會越高 對於數據的飢渴程度會越高 但它可能就不想向外學習 它可能是自我學習

我現在的觀點是,智能越強,它對知識的飢渴程度會越高,對數據的飢渴程度會越高;但它可能就不再向外學習,而是自我學習。

謝晨2:33:09

數字與實體

自動駕駛人工標註從業規模估計十萬人、幾十萬人29:25
大模型後訓練數據專家時薪100 美金以上30:25
大模型團隊與機器人公司的卡數差距機器人公司幾千張卡已算很多,大模型團隊大幾萬張44:46
大模型與具身的數據成熟度打分大模型 60 分,具身 0.6 分都不到1:02:59
Behavior 評測集最高成功率100 道題,最高 26%1:06:01
Generalist 使用的夾爪數據量27 萬小時1:45:39
具身數據定價區間一小時從幾十人民幣到上千人民幣;做披薩這類數據幾十到幾千人民幣不等,高質量數據在幾百到上千人民幣1:58:46
光輪智能全職人數一百來個,以工程技術方向為主2:09:52
驗證數據金字塔所需算力幾萬張卡2:14:56

術語

Sim-to-Real仿真到真實的遷移
仿真裡訓出來的能力遷到真實機器人上時的性能落差,是仿真派被質疑的核心問題
Shadow Mode影子模式
算法在車端只輸出信號、不執行動作,與人的操作對比,差異就是免費的評價信號
Data Engine數據引擎
評測反饋驅動、以系統而非人力為核心的數據生產閉環,區別於流水線式的 Data Factory
Behavior具身智能評測集
李飛飛團隊基於仿真打造的具身評測集,都是難的長程任務;後來還有用同一體系評測世界模型的 Enact
VLA視覺-語言-動作模型
以基礎大模型為底座的機器人行動模型,輸入視覺和語言,輸出動作
Zero-shot零樣本
沒見過的任務也能做出來;謝晨認為不具備這種泛化能力的模型,不是通往通用智能的模型

收聽指南

誰該聽

做具身智能和 AI 數據基礎設施的創業者、看機器人賽道的投資人,以及大模型和機器人團隊裡管數據的人。

可跳過

開頭 12 分鐘的求學與早期創業履歷可以跳過,從 20 分鐘的數據綜述開始聽。