世界太吵,来原声听播客

张小珺·商业访谈录

张亚勤:信息智能五年到顶,人形机器人还要十年

他把 AGI 拆成信息、物理、生物三层:信息智能五年内达到人类水平,但那是大脑的智商;读万卷书仍不会游泳,物理智能才刚开场。

AGI具身智能自动驾驶脑机接口机器人
一位院士给出的时间表和分类框架,信息密度中等,后半段关于寿命与物种延伸的推演比前半段更有意思。

核心论点 · 点时间戳可跳到原声

4:04

一流研究院没法量化考核

张亚勤回忆微软中国研究院定目标时,顾问、诺奖得主 Rodger Ely 给了一个反直觉的答案:怎么衡量我们是不是一流?「当你们在不为这个问题的时候,不讲这个问题的时候,你变一流了。」他后来在 ChatGPT 上又碰到同一句话——图灵测试什么时候算通过?「当你通过的时候你就知道了。」他由此推出研究院的三个目标:招到一流人才、定长远方向、培养一流科研人才,而前两三年 80% 的时间都在找人。

— 张亚勤
6:05

今天做研究院,难的不是招人而是选题

张亚勤说,和 98 年相比,现在做 AIR 反而「比较容易」——中国已有世界级的科研成果和人才,在清华的环境里招好老师好学生不是问题。真正的难点换了位置:过去微软研究院是找到什么样的人就做什么事,「他们爱干嘛干嘛」,没有领域人物就做不起来;现在哪个方向都能找到人,所以必须自己选方向。AIR 因此选了三个垂直方向:智能交通、IoT、AI 加生命科学,用今天的语言就是机器人、具身智能、生物智能、边缘智能和智能体。

— 张亚勤
7:06

基础大模型是公司的事,不是学校的事

为什么 AIR 不做基层通用大模型?张亚勤的理由是资源结构:基础大模型需要大量算力、数据、场景,要砸钱,还要具体场景,学校很难做。他把它比作生态的操作系统,横向铺开。更关键的是创新性质——他认为基础大模型的创新「不是零到一的创新,更多的是一到一百,甚至一百到 N 的创新」,里面有算法创新,但很多是工程创新,这是公司该做的事,美国也是公司做的。AIR 的做法是和企业合作,用企业的资源去做。

— 张亚勤
13:08

信息智能是智商,读再多书也不会游泳

张亚勤用一个人打比方:信息智能就是一个人脑袋特别聪明,读万卷书,什么都懂,能解题、能发明公式、能写文章、能画画,在每个领域都比一般人懂——这是大脑的智商,他判断五年之内就能达到。但「你读再多书,怎么游泳你还是不会游」,你还要再游泳,这就是物理智能。他进一步说,爱喝酒的人怎么看书怎么聪明,不喝还是不行,物理世界的东西必须和那个世界交互。物理智能里第一个落地的是自动驾驶,因为它是 close problem,人形机器人是 open problem,还需要十年。

— 张亚勤
15:14

机器人分三类,家庭机器人最难

张亚勤自己把机器人分成三种场景:家庭机器人、工业机器人、社会机器人。家庭最容易理解——照顾老人、做家务,但任务太复杂且碎片,还牵扯人的安全和家里的习惯,他认为这是最难的一类。社会机器人是警察、保安、送外卖、开车,在街上跑、和大家有很多交互。工业机器人最好定义,因为目标确定、场景固定。他希望三类机器人后台的技术是通用的,70% 到 80% 的后台一样,上面接不同的前端,后台就是一个巨大的多模态大模型。

— 张亚勤
20:15

人形是为了能用人类的基础设施

为什么家庭机器人最好是人形?张亚勤给了两个理由。一是交互:人形机器人外形做得像人,你可能看都看不出来,沟通方式不一样,可以跟他谈心,他变成伴侣、管家,也可以帮你照顾老人。二是基础设施:我们现在的社会、楼梯、按钮,全都是给人做的,人形机器人可以直接利用现有基础设施,爬楼梯、按按钮。他补充说这更多是一种选择,社会机器人也一样——警察太小或太大你看了都不舒服,人形可以避免恐怖谷效应。他还说十年之内机器人可能比人都多,每个人有一个自己的 copy、一个分身。

— 张亚勤
26:15

大模型一次性缓解了自动驾驶的三个老问题

张亚勤把自动驾驶十几年的困难归成三条:测试数据量不够;corner case 太多,安全场景碰不到;技术碎片化——地图一个模型、视觉一个模型、激光雷达一个模型,感知、融合、规划、决策一块块拼,还混着规则和神经网络算法。大模型出来之后三条同时被缓解:生成式可以造数据,仿真速度变快;大模型自带常识,没碰到的场景也能解决;端到端把所有模型装进一个箱子,一个输入一个输出,顶多用规则兜底。他说马斯克的端到端模型是让大家看到曙光的重要产品。

— 张亚勤
29:16

过去换场景就换算法,现在都是 Transformer

张亚勤指出这一代和上一代深度学习的根本区别:过去一会儿用 Convolution 的 Cover,一会儿用 RNN,不同输入用不同算法,输出再去融合;现在不管是什么,都是同样的 Transformer,tokenized、token based。这个统一性让机器人的问题也变了性质。机器人过去用强化学习,一个环境一个智能体学策略,用到实体上经常不 work,real to sim 不 work。他们自己做的方法叫 RS2,把真实世界和物理世界连在一块,先在数字空间学,再补回真实世界,解决数据不足。更关键的是大模型给了机器人一个脑子——过去机器人听得懂字但不懂后面什么意思,没有常识、没有理解力、不会推理,现在可以指挥它把「把脏衣服送到干洗店」这种任务分解成动作。

— 张亚勤
39:17

生物智能二十年,但意识不会从硅里长出来

张亚勤认为生物智能需要更长时间,二十年之内可以实现。路径上他更看好非植入式的传感器和脑机接口,先用于治病——盲人刺激 neuron、听不见的刺激 hearing 的 neuron、残疾人修复中枢神经,以及阿尔茨海默、多动症、自闭症,之后才拓展正常人的智能。但他明确划了一条线:他不认为人工智能目前可以产生意识,也不相信会有一个新的自我意识、新的灵魂。理由是「我们人怎么产生意识我们都不知道」,而且「我们没有办法去创造我们不懂的东西」。他引用 Richard Feynman 的说法支撑这一点。

— 张亚勤
43:21

未来是新物种,但控制权还在人手里

张亚勤的物种观:未来就是一个新的物种,只是这个物种变得十分智能、能力很大,但它还是人类的延伸,被人类所控制。他拿三万年前的山顶洞人做参照——那时人类已经有工具、有火,但工具很 primitive;再过一百年看今天的手机、互联网、PC,就像我们今天看三万年前的石器。他特别强调进化速度的变化:人类从狩猎到农业社会两三千年没什么变化,真正的大变化是工业革命之后的三百年,蒸汽机出来之后人类进化就不再是达尔文式的自然进化,而是非线性、指数性的进化。所以他讲一百年,也许三十年,看今天的人类就会觉得很简单。

— 张亚勤
47:22

三十年后开车像今天在纽约坐马车

张亚勤对十年后的具体想象:很多车是无人驾驶的,很多机器人进入家庭,像今天的冰箱、电视一样,你不在家时它帮你看窗户关没关、有没有人闯入。开车的人会变得很少,很多人选择不开车,买车的钱可能花在买机器人上。三十年后,看到人开车就像今天在纽约看到马车一样新奇,人开车可能需要特殊批准、拿特殊牌照。他举电梯做类比:三十年前电梯里还坐着人帮你按楼层,现在几乎没有了,但英国某些地方还保留人工电梯,反而变成一种高端服务。

— 张亚勤
48:22

寿命拉长会先改变工作周,再改变人口结构

张亚勤判断三十年后人的寿命会大幅度增加,可能不会永生,但一百岁成为常态,有些人到一百五十岁。他推演的社会后果是:工作时间越来越少——工业革命后一周工作七天,后来六天,他出国时还是六天,回来是五天,现在欧洲一些地方已经四天,以后人可能一周工作一天,别的时间做自己喜欢的事。他强调这不是失业叙事,而是社会生产力大幅度提高、社会结构变化:人类寿命变长,自然出生率降低,新出生的人数变少,发达国家的入口已经在变少。他还说以后八十岁的人可能还是青年、壮年。

— 张亚勤

原话 · 已逐字校验

他说当你们在不为这个问题的时候,不讲这个问题的时候,你变一流了

他说,当你们不再为这个问题纠结、不再谈论这个问题的时候,你们就成一流的了。

张亚勤4:04

你读再多书,怎么游泳,你还是不会游,你还要再游泳

你读再多书,也还是不会游泳,你还是得下水去游。

张亚勤13:08

机器人,他是个open problem,自动驾驶,他是个close problem

机器人是一个开放问题,自动驾驶是一个封闭问题。

张亚勤14:08

他听得懂你那字,他不知道后面什么意思,没有这个常识,没有理解力

他听得懂你说的字,但不知道背后的意思,没有常识,没有理解力。

张亚勤31:16

三十年之后可能,你看到有人开车,就像现在以后,开马车一样,变成新型的东西了

三十年后你看到有人开车,就像现在看到有人赶马车一样,变成一种新奇的东西。

张亚勤46:22

数字与实体

信息智能达到人类水平的时间判断五年之内11:08
人形机器人(物理智能高等级)所需时间十年14:08
生物智能实现时间二十年之内39:17
三类机器人后台通用比例70% 到 80%17:14
微软研究院早期找人占用的时间比例80%5:04
三十年后常态寿命预期100 岁,有些人到 150 岁48:22
未来每周工作时间推演一周工作一天48:22

术语

RS2真实到仿真再回到真实
张亚勤团队的方法,把真实场景转成数字世界训练,再回到真实世界落地。
corner case极端场景
自动驾驶测试中难以碰到、却决定安全性的罕见场景。
end-to-end端到端
把感知、规划等模块合成一个模型,一个输入直接出一个输出。
world model世界模型
在数字空间里构建并模拟物理世界的模型,用于训练具身智能。

收听指南

谁该听

关注 AGI 路线图、自动驾驶与具身智能落地节奏的创业者和投资人,想听一位院士给出时间表和分类框架的人。

可跳过

51:27 之后荐书部分可跳过,与主线判断无关。