張亞勤:信息智能五年到頂,人形機器人還要十年
他把 AGI 拆成信息、物理、生物三層:信息智能五年內達到人類水平,但那是大腦的智商;讀萬卷書仍不會游泳,物理智能才剛開場。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
一流研究院沒法量化考核
張亞勤回憶微軟中國研究院定目標時,顧問、諾獎得主 Rodger Ely 給了一個反直覺的答案:怎麼衡量我們是不是一流?「當你們在不為這個問題的時候,不講這個問題的時候,你變一流了。」他後來在 ChatGPT 上又碰到同一句話——圖靈測試什麼時候算通過?「當你通過的時候你就知道了。」他由此推出研究院的三個目標:招到一流人才、定長遠方向、培養一流科研人才,而前兩三年 80% 的時間都在找人。
— 張亞勤今天做研究院,難的不是招人而是選題
張亞勤說,和 98 年相比,現在做 AIR 反而「比較容易」——中國已有世界級的科研成果和人才,在清華的環境裡招好老師好學生不是問題。真正的難點換了位置:過去微軟研究院是找到什麼樣的人就做什麼事,「他們愛幹嘛幹嘛」,沒有領域人物就做不起來;現在哪個方向都能找到人,所以必須自己選方向。AIR 因此選了三個垂直方向:智能交通、IoT、AI 加生命科學,用今天的語言就是機器人、具身智能、生物智能、邊緣智能和智能體。
— 張亞勤基礎大模型是公司的事,不是學校的事
為什麼 AIR 不做基層通用大模型?張亞勤的理由是資源結構:基礎大模型需要大量算力、數據、場景,要砸錢,還要具體場景,學校很難做。他把它比作生態的操作系統,橫向鋪開。更關鍵的是創新性質——他認為基礎大模型的創新「不是零到一的創新,更多的是一到一百,甚至一百到 N 的創新」,裡面有算法創新,但很多是工程創新,這是公司該做的事,美國也是公司做的。AIR 的做法是和企業合作,用企業的資源去做。
— 張亞勤信息智能是智商,讀再多書也不會游泳
張亞勤用一個人打比方:信息智能就是一個人腦袋特別聰明,讀萬卷書,什麼都懂,能解題、能發明公式、能寫文章、能畫畫,在每個領域都比一般人懂——這是大腦的智商,他判斷五年之內就能達到。但「你讀再多書,怎麼游泳你還是不會遊」,你還要再游泳,這就是物理智能。他進一步說,愛喝酒的人怎麼看書怎麼聰明,不喝還是不行,物理世界的東西必須和那個世界交互。物理智能裡第一個落地的是自動駕駛,因為它是 close problem,人形機器人是 open problem,還需要十年。
— 張亞勤機器人分三類,家庭機器人最難
張亞勤自己把機器人分成三種場景:家庭機器人、工業機器人、社會機器人。家庭最容易理解——照顧老人、做家務,但任務太複雜且碎片,還牽扯人的安全和家裡的習慣,他認為這是最難的一類。社會機器人是警察、保安、送外賣、開車,在街上跑、和大家有很多交互。工業機器人最好定義,因為目標確定、場景固定。他希望三類機器人後臺的技術是通用的,70% 到 80% 的後臺一樣,上面接不同的前端,後臺就是一個巨大的多模態大模型。
— 張亞勤人形是為了能用人類的基礎設施
為什麼家庭機器人最好是人形?張亞勤給了兩個理由。一是交互:人形機器人外形做得像人,你可能看都看不出來,溝通方式不一樣,可以跟他談心,他變成伴侶、管家,也可以幫你照顧老人。二是基礎設施:我們現在的社會、樓梯、按鈕,全都是給人做的,人形機器人可以直接利用現有基礎設施,爬樓梯、按按鈕。他補充說這更多是一種選擇,社會機器人也一樣——警察太小或太大你看了都不舒服,人形可以避免恐怖谷效應。他還說十年之內機器人可能比人都多,每個人有一個自己的 copy、一個分身。
— 張亞勤大模型一次性緩解了自動駕駛的三個老問題
張亞勤把自動駕駛十幾年的困難歸成三條:測試數據量不夠;corner case 太多,安全場景碰不到;技術碎片化——地圖一個模型、視覺一個模型、激光雷達一個模型,感知、融合、規劃、決策一塊塊拼,還混著規則和神經網絡算法。大模型出來之後三條同時被緩解:生成式可以造數據,仿真速度變快;大模型自帶常識,沒碰到的場景也能解決;端到端把所有模型裝進一個箱子,一個輸入一個輸出,頂多用規則兜底。他說馬斯克的端到端模型是讓大家看到曙光的重要產品。
— 張亞勤過去換場景就換算法,現在都是 Transformer
張亞勤指出這一代和上一代深度學習的根本區別:過去一會兒用 Convolution 的 Cover,一會兒用 RNN,不同輸入用不同算法,輸出再去融合;現在不管是什麼,都是同樣的 Transformer,tokenized、token based。這個統一性讓機器人的問題也變了性質。機器人過去用強化學習,一個環境一個智能體學策略,用到實體上經常不 work,real to sim 不 work。他們自己做的方法叫 RS2,把真實世界和物理世界連在一塊,先在數字空間學,再補回真實世界,解決數據不足。更關鍵的是大模型給了機器人一個腦子——過去機器人聽得懂字但不懂後面什麼意思,沒有常識、沒有理解力、不會推理,現在可以指揮它把「把髒衣服送到乾洗店」這種任務分解成動作。
— 張亞勤生物智能二十年,但意識不會從硅里長出來
張亞勤認為生物智能需要更長時間,二十年之內可以實現。路徑上他更看好非植入式的傳感器和腦機接口,先用於治病——盲人刺激 neuron、聽不見的刺激 hearing 的 neuron、殘疾人修復中樞神經,以及阿爾茨海默、多動症、自閉症,之後才拓展正常人的智能。但他明確劃了一條線:他不認為人工智能目前可以產生意識,也不相信會有一個新的自我意識、新的靈魂。理由是「我們人怎麼產生意識我們都不知道」,而且「我們沒有辦法去創造我們不懂的東西」。他引用 Richard Feynman 的說法支撐這一點。
— 張亞勤未來是新物種,但控制權還在人手裡
張亞勤的物種觀:未來就是一個新的物種,只是這個物種變得十分智能、能力很大,但它還是人類的延伸,被人類所控制。他拿三萬年前的山頂洞人做參照——那時人類已經有工具、有火,但工具很 primitive;再過一百年看今天的手機、互聯網、PC,就像我們今天看三萬年前的石器。他特別強調進化速度的變化:人類從狩獵到農業社會兩三千年沒什麼變化,真正的大變化是工業革命之後的三百年,蒸汽機出來之後人類進化就不再是達爾文式的自然進化,而是非線性、指數性的進化。所以他講一百年,也許三十年,看今天的人類就會覺得很簡單。
— 張亞勤三十年後開車像今天在紐約坐馬車
張亞勤對十年後的具體想像:很多車是無人駕駛的,很多機器人進入家庭,像今天的冰箱、電視一樣,你不在家時它幫你看窗戶關沒關、有沒有人闖入。開車的人會變得很少,很多人選擇不開車,買車的錢可能花在買機器人上。三十年後,看到人開車就像今天在紐約看到馬車一樣新奇,人開車可能需要特殊批准、拿特殊牌照。他舉電梯做類比:三十年前電梯裡還坐著人幫你按樓層,現在幾乎沒有了,但英國某些地方還保留人工電梯,反而變成一種高端服務。
— 張亞勤壽命拉長會先改變工作周,再改變人口結構
張亞勤判斷三十年後人的壽命會大幅度增加,可能不會永生,但一百歲成為常態,有些人到一百五十歲。他推演的社會後果是:工作時間越來越少——工業革命後一週工作七天,後來六天,他出國時還是六天,回來是五天,現在歐洲一些地方已經四天,以後人可能一週工作一天,別的時間做自己喜歡的事。他強調這不是失業敘事,而是社會生產力大幅度提高、社會結構變化:人類壽命變長,自然出生率降低,新出生的人數變少,發達國家的入口已經在變少。他還說以後八十歲的人可能還是青年、壯年。
— 張亞勤原話 · 已逐字校驗
他說當你們在不為這個問題的時候,不講這個問題的時候,你變一流了
他說,當你們不再為這個問題糾結、不再談論這個問題的時候,你們就成一流的了。
張亞勤4:04
你讀再多書,怎麼游泳,你還是不會遊,你還要再游泳
你讀再多書,也還是不會游泳,你還是得下水去遊。
張亞勤13:08
機器人,他是個open problem,自動駕駛,他是個close problem
機器人是一個開放問題,自動駕駛是一個封閉問題。
張亞勤14:08
他聽得懂你那字,他不知道後面什麼意思,沒有這個常識,沒有理解力
他聽得懂你說的字,但不知道背後的意思,沒有常識,沒有理解力。
張亞勤31:16
三十年之後可能,你看到有人開車,就像現在以後,開馬車一樣,變成新型的東西了
三十年後你看到有人開車,就像現在看到有人趕馬車一樣,變成一種新奇的東西。
張亞勤46:22
數字與實體
| 信息智能達到人類水平的時間判斷 | 五年之內 | 11:08 |
| 人形機器人(物理智能高等級)所需時間 | 十年 | 14:08 |
| 生物智能實現時間 | 二十年之內 | 39:17 |
| 三類機器人後臺通用比例 | 70% 到 80% | 17:14 |
| 微軟研究院早期找人佔用的時間比例 | 80% | 5:04 |
| 三十年後常態壽命預期 | 100 歲,有些人到 150 歲 | 48:22 |
| 未來每週工作時間推演 | 一週工作一天 | 48:22 |
術語
- RS2真實到仿真再回到真實
- 張亞勤團隊的方法,把真實場景轉成數字世界訓練,再回到真實世界落地。
- corner case極端場景
- 自動駕駛測試中難以碰到、卻決定安全性的罕見場景。
- end-to-end端到端
- 把感知、規劃等模塊合成一個模型,一個輸入直接出一個輸出。
- world model世界模型
- 在數字空間裡構建並模擬物理世界的模型,用於訓練具身智能。
收聽指南
關注 AGI 路線圖、自動駕駛與具身智能落地節奏的創業者和投資人,想聽一位院士給出時間表和分類框架的人。
51:27 之後薦書部分可跳過,與主線判斷無關。