世界太吵,来原声听播客

张小珺·商业访谈录

Agent 的瓶颈不是智能,是它学不会成为专家

通用智能已经够用且廉价,真正稀缺的是 specialized intelligence——让 agent 像实习生变成老师傅那样,持续学会某个小世界的 world model。

Agent持续学习World Model创业人机交互
技术史脉络清晰,后半段关于持续学习、world model 和 GUI 不会消失的论证密度最高,适合想搞清 agent 下一步往哪走的工程师和创业者。

核心论点 · 点时间戳可跳到原声

6:08

逻辑智能体死于知识获取瓶颈

苏煜把 1950 到 1990 年代的专家系统叫 logical agent:把领域专家的知识写成逻辑语言,配一个推理引擎,新问题来了就做逻辑推演。它的 memory 只是一个有限集的 logical statement,表达能力被逻辑语言本身 bound 住,世界上绝大部分东西没法用简单逻辑表达。autonomy 也只剩「接一个问题、推一个答案」。真正压垮它的是 knowledge acquisition bottleneck——靠工程师去采访专家再翻译成逻辑形式,过程痛苦、低效、效果有限,直接导致 80 到 90 年代那波 AI winter。

— 苏煜
13:17

深度强化学习的智能体只有一次前向传播

2000 年后 neural agent 在 deep reinforcement learning 里出了 AlphaGo 这类代表作,但从 memory 和 autonomy 两个角度看仍然很受限:主体就是一个很小的神经网络,几十 million 到顶 100 million parameter,只玩一个或一类游戏,输入是画面、输出是动作。它的推理是隐式的,就藏在一次 forward pass 里,不管情况多复杂,能用到的 compute 就是一次前向传播。人不是这样——情况复杂度不同,推理的计算量显然不同。另一个硬伤是 sample efficiency 极差,一个简单游戏可能要玩几百万盘才学会。

— 苏煜
21:27

语言是这一代 agent 的脚手架

苏煜和杨迪、姚顺宇、于涛在 2024 年专门做 tutorial 定义 language agent。这一代 agent 基于 LLM,最大的不同是可以用 language 作为 scaffold:perception 用 language understanding,交互形式灵活得多;reasoning 用 chain of thoughts,任务复杂就多产生 token,每个 token 都是一次 forward pass、一定量的 compute,于是达到 adaptive computing。语言同时是 take action 的媒介,包括 formal language 和 machine language,能在 digital world 里做各种事。从 memory 角度,大模型训练本身就是以语言为脚手架、通过 compression 形成对世界的 representation 的过程。

— 苏煜
48:56

OpenClaw 时刻和 ChatGPT 时刻是同一种时刻

苏煜认为两者高度相似:底层技术其实早就 ready。ChatGPT 之前 LM 已经发展好几年,从 BERT、ELMo、GPT-1 到 GPT-3,ChatGPT 只是把模型 finetune 得更像 chatterbot 再直接 release 给公众,底层技术没大变化,变的是交互形式,而这个变化成了导火索。OpenClaw 也一样,大部分做 agent 的人看它的 code base 会有 nothing is new here 的感觉,但它是交互形式的深刻变化:可以在即时通讯软件里交互、有独立环境、24 小时 always on,而且它开源、不管 permission 和 safety,所有东西都打开。他相信再过两年看,OpenClaw 的影响力可能也是类似规模。

— 苏煜
57:23

基础模型智能已越过临界点,缺的是抓价值的人

苏煜引用 Google 前 CEO Eric Schmidt 的观察:美国在应用层一般慢很多,中国一向在前端技术应用上动作很快,而这在 AI 时代是很大的优势。原因是基础模型的 intelligence 已经超过临界点,对很多有用的事情来说 it's good enough。很多事以前没人做,是因为摩擦太高、经济账算不过来;现在 AI 能力可以极大降低这些摩擦,很多事情从不值得做变成值得做,就有了商业价值。缺的是有足够洞察和执行力去发现、抓住这些价值的人。他承认过程会有浪费,比如先花钱装 OpenClaw 发现没用、又花钱找人卸载,但对社会整体仍是积极发展。

— 苏煜
1:03:26

通用智能变廉价后,差异化来自 specialization

苏煜说现在 AI 到了通用智能很强的阶段,在 digital world 里随便给 Cloud Code、OpenClaw 一个问题,只要不是高度专业、且有必要信息,大概有百分之六七十的概率能做对。所以缺的是 specialized intelligence:当通用智能变成标配,differentiation 来自 specialization。世界不是一整个世界,是由几百万个小世界组成,每个职业、每个 domain、每个公司、每个软件、每个网站都是一个小世界,这些世界的 entropy 加起来几乎无限,不可能有单一 agent 或单一模型 capture 全部,必然有 adaptation 和 specialization 的过程。

— 苏煜
1:14:48

World model 不只是视频预测,是实习生变成专家

苏煜对 world model 的定义比多数人宽。大家提到 world model 通常指 vision based、做 next frame prediction 或 3D reconstruction 的模型,他认为这很重要、也是 LM 欠缺的能力,但 world model 是整个 human intelligence 最重要的概念。他举例:大学刚毕业进公司实习,第一天完全不知道工作内容,但能在 learning on the job 中持续学习——公司的 org chart 表面和实际是什么样、谁说话管事、找谁批准、软件怎么用、工作流是什么、人与人之间的 theory of mind,这些全是 world model 的一部分。这个 microworld 的 model 显然不是 video model,很多部分天然是符号化的。

— 苏煜
1:44:05

CLI 不会全面取代 GUI

苏煜认为 GUI 不会消失:人是 visual animal,大脑就是这么编码的,HCI 研究显示同样的东西可视化后大脑理解速度快零点几秒,GUI 还有 validation、win trust、auditing 的实际好处。agent 要不要 GUI 则是另一回事,但 GUI 是整个 digital world 的 de facto interface,99% 的东西已经有 GUI 可交互,而且 GUI 在设计过程中已经 encode 了大量 knowledge、constraint、business logic,agent 用好 GUI 就能 piggy back on all of this accumulated knowledge,而不是重造一套 CLI 或 API 的轮子,这样才能 immediately reach all corners of human society,尤其是 long tail 场景。他还举 semantic web 的例子:Tim Berners-Lee 推了二十几年,adoption 依然非常低,因为社会不是那么 work 的。

— 苏煜
2:06:19

真正的风险是失业速度超过新岗位产生速度

苏煜看不到可预见未来里 AI 快速自我迭代、消灭人类的可能性,因为那不只是 intelligence 问题,而是 innate goals、intention、生存压力这些更高层面能力的缺失,现在所有目的都是人赋予的。他真正的 concern 是 job displacement:如果 AI agent 大规模取代 knowledge worker,一方面不能产生足够多新岗位承载 displaced workforce,另一方面没有好的收益再分配机制给社会兜底,而大部分收益被几家头部公司或资本获得,就会对社会产生极大影响。他认为 AI researcher 每个人都有责任,自己能做的重要事情是 democratize access to frontier agent capabilities。

— 苏煜

原话 · 已逐字校验

但At the end of the day 就是最后这些东西都是在快速的converge 最后At the end of the day 大家想要的就是一个Universal Digital Agent

但归根结底,最后这些东西都在快速收敛,大家想要的就是一个通用数字智能体。

苏煜41:09

就大部分做agent的人去看open cloud的这个code base的话 可能会有一种nothing is new here 就这地方没有什么创新的这种感觉 但实际上它是一个也是一个交互形式的一个深刻的一个变化

大部分做 agent 的人去看 OpenClaw 的代码库,可能会有一种「这里没什么新东西」的感觉,但实际上它是一个交互形式的深刻变化。

苏煜51:15

这个model它显然不是一个video model 但vision当然是里面很重要的一部分 但显然也有更多的部分 它是天然就是符号化的 symbolic的

这个 model 显然不是一个 video model,vision 当然是里面很重要的一部分,但显然也有更多的部分天然就是符号化的。

苏煜1:16:50

这种individual thought doesn't need a language 但是civilization needs a language

个体的思考不需要语言,但文明需要语言。

苏煜1:36:01

但你现在 比如说我就先出来一个标准叫mcp 或者我出来一个标准 就是让大家都农进去写cli 然后你指望所有的行业都 在未来几年去adopt这个事情 这是几乎不可能的

但你现在比如先出来一个标准叫 MCP,或者出来一个标准让大家都去写 CLI,然后指望所有行业在未来几年 adopt 这件事,这是几乎不可能的。

苏煜1:43:05

因为他没有学过 他即使做过 他也没有一个有效的方式 把他给像人一样去学会 成为一个part of my expertise 所以他才会导致这些不稳定

因为他没学过,即使做过,他也没有一个有效的方式像人一样把它学会、变成自己 expertise 的一部分,所以才会导致这些不稳定。

苏煜1:52:13

那就是 All the way continue learning All the way word modeling

那就是一路走持续学习,一路走 world modeling。

苏煜2:15:23

数字与实体

AutoGPT GitHub Stars约 18 万34:03
Neocortex 占大脑比例约 70%1:21:53
人脑皮质柱数量约 15 万个1:24:54
OpenAI 与 Anthropic 融资占市场比例约 30% 到 50%1:07:38

术语

semantic parsing语义解析
把人说的话转成机器能读懂的 formal meaning representation,如知识图谱、数据库、网站可执行的形式。
language agent语言智能体
以语言为脚手架做 perception、reasoning 和 action 的智能体,苏煜等人在 2024 年 tutorial 中定义。
world model世界模型
智能体对所处小世界的内部表示,苏煜认为不限于视频预测,也包括组织架构、工作流、theory of mind 等。
continual learning持续学习
模型在部署后继续学习新任务或新环境,同时不遗忘已有能力,苏煜认为其学习目标应是 world model。
cortical column皮质柱
新皮层中重复出现的单元结构,人脑约有 15 万个,Jeff Hawkins 理论认为每个皮质柱在学习 world model。
non-parametric learning非参数化学习
不改模型参数、通过写 MD 文件或 harness 等方式让 agent 获得新能力,OpenClaw 的 skills 属于此类。

收听指南

谁该听

想搞清 agent 技术脉络和下一步瓶颈的工程师、创业者与投资人,尤其是关心持续学习、world model 和 agent 产品形态的人。

可跳过

2:10 之后的快问快答可跳过,前面 2:00 左右的自我介绍也可快进。