世界太吵,来原声听播客

张小珺·商业访谈录

AI 下半场:通用方法已经有了,难的是找任务

姚顺雨说 AI 主线已从「造武器」进入「选战场」——方法终于通用了,但真正的瓶颈不是推理能力,而是模型拿不到人脑子里的 context。

Agent强化学习交互方式OpenAIAI 创业
前半段是个人研究史,信息密度一般;从 37 分钟起的「下半场」、reward 设计和交互方式之争才是真正值钱的部分。

核心论点 · 点时间戳可跳到原声

9:09

从 vertical thinking 回到 general thinking

姚顺雨把 AI 史讲成一条碎片化的曲线:从 Newell 和 Simon 1960 年代想直接造一个 agent 开始,因为太难,学界不断把问题切小——先切 vision,再切 language,再切 translation,越切越 vertical。他认为 2015 年之后 scaling law 和一批 research breakthrough 的意义,是让这件事重新反过来:从细分思维回到构建一个更通用系统的思维。这也是他判断自己该做什么的底层坐标。

— 姚顺雨
19:18

语言 agent 的本质区别是能推理

他给了一个很具体的对照:AlphaGo 只能下围棋,换个游戏就得重训;而人第一次玩一个新游戏就能上手。他的解释是人会思考——看到灯是黑的,推断可能有危险,再结合上下文判断灯在身后,于是先向后走。语言模型提供的足够强的先验让推理成为可能,而推理能在不同环境间泛化。所以语言 agent 与之前所有 agent 的本质区别不是接口,是推理能力带来的泛化。

— 姚顺雨
39:37

reward 要基于结果、基于规则

他做任何 RL task 都坚持两条:reward 基于结果而非过程,且是白盒的、能清晰算出来的,而不是基于人或模型的偏好。理由是只要基于过程或基于偏好,就会出现 hacking——你可能得到一段非常优美的代码,但它不解决问题。他举数学为例:答案是 3 就是 3,不是 3 就是错,没有解释空间。他说做 webshop 时最难的部分不是搭环境,而是设计一个既有难度、又有真实价值、reward 又不 noisy 的任务。

— 姚顺雨
46:44

客服要的是 pass^k,不是 pass@k

coding 界传统指标是 pass@k:同一个任务跑 k 次,至少成功一次的概率,所以有人报 pass@100。但客服这类任务需要正好相反的指标,他们去年发的工作把它定义为 pass^k——k 次全部成功的概率。他判断现在大家更重视 success rate 或 pass@100,是因为还在做 benchmark 而不是做实际应用;一旦接受这个转变,就会意识到有些应用必须去优化 robustness,而这方面的进步空间还很大。

— 姚顺雨
48:44

创业公司的机会是设计新的交互方式

他反过来说创业公司该担心的不是模型能力溢出,而是模型不再溢出——那才真的什么都做不了。他的框架是:模型公司的产品都是 ChatGPT 式的、像人一样的交互;创业公司最大的机会是用模型的通用能力去创造不同的交互方式。Cursor 就是例子——人和人之间不会那样交互。他补了一句关键约束:做新交互方式、同时模型持续溢出,两者缺一不可;如果你的交互方式很像 ChatGPT,那你有什么理由不被 ChatGPT 取代。

— 姚顺雨
59:50

模型缺的不是智能,是 context

这是他解释「为什么模型推理这么强、考试这么强,却没创造足够经济价值」的核心答案:模型没有 context。人类社会里大量 context 永远只存在人的大脑中,是分布式维护的——比如你老板的行为习惯,很难用语言总结下来。所以一个二本毕业、数学不如 O3 的人,进公司七天积累的 context 就能让他比 O3 做得更好。他认为这个问题解决了,utility 问题就能很大程度解决。

— 姚顺雨
1:41:18

环境是 memory hierarchy 的最外层

他引冯诺依曼死前最后一本书 The Brain and the Computer 里的一句话:environment is always the most outer part of the memory hierarchy。类比电脑从 CPU 缓存到内存到硬盘,最外层永远是外部世界——插一个 U 盘、把东西上传到互联网、刻一张光盘。对人来说,最外层的长期记忆就是你的笔记本、Google Doc、Notion。他由此把 MCP 也归入同一逻辑:本质上是 hack 你的 context 的一种方法。

— 姚顺雨
1:45:18

能被定义成考试的任务,离被解决就不远

他提出一个他认为最该被推翻的基本假设:现在评估一个东西是基于 500 个任务、每个跑 500 次,把平行数据加总成 reward。但人上班重要的是 30 天、一年之后变得多好,而不是在 100 个平行宇宙里把你放到公司第一天能做多好。他的推论是:一旦你能定义一个考试或游戏,离它被解决就不远了;真实世界之所以难,正是因为它没有被设计好的 reward 和标准答案。

— 姚顺雨

原话 · 已逐字校验

我们之前是就有点像我有很多怪兽 那我需要去为了不同怪兽去造各种各样的武器 去来打这些怪兽 现在我有一个通用的武器了 就我有把机关枪 那现在我要思考的问题是我要朝哪里去开枪

以前像是有很多怪兽,我得为不同的怪兽造不同的武器去打;现在我有了一件通用武器——一把机关枪,那我要思考的问题变成:我要朝哪里开枪。

姚顺雨38:36

实际上我认为做任何的RL task 最难的部分其实是怎么定义reward

我认为做任何 RL 任务,最难的部分其实是怎么定义 reward。

姚顺雨40:40

如果你的交互方式很像chatGPT 那你有什么理由 不被chatGPT取代

如果你的交互方式很像 ChatGPT,那你有什么理由不被 ChatGPT 取代。

姚顺雨49:44

虽然你没有O3聪明 但是你有这些context 所以你做的比O3好

虽然你没有 O3 聪明,但你有这些 context,所以你做得比 O3 好。

姚顺雨1:00:51

Essentially environment is always the most outer part of the memory hierarchy

本质上,环境永远是记忆层级的最外层。

姚顺雨1:42:18

因为我们发现 一旦你可以定义考试或者一个游戏 那离它被解决也不远了

因为我们发现,一旦你可以定义一场考试或一个游戏,那离它被解决也不远了。

姚顺雨1:45:18

If someone else can do it it's okay to let them do it

如果别人也能做这件事,那让他们做也没关系。

姚顺雨2:25:53

数字与实体

姚顺雨做 agent 研究的年数6 年7:06
coding 任务常报的指标pass@10046:44
agent 单用户 token 消耗相对 chatbot 的倍数500 到 1000 倍1:23:01
姚顺雨重写 The Second Half 博文耗时约 2 小时2:10:37
姚顺雨竞赛成绩全国银牌2:20:48

术语

pass@kk 次至少成功一次
同一任务跑 k 次,至少成功一次的概率,coding 常用指标。
pass^kk 次全部成功
同一任务跑 k 次全部成功的概率,衡量可靠性,客服类任务需要。
affordance可供性
环境提供给行动者的可操作接口;姚顺雨说 code 是 AI 最重要的 affordance。
memory hierarchy记忆层级
从缓存到内存到硬盘的分层存储结构,姚顺雨把外部环境放在最外层。
intrinsic reward内在奖励
没有外部激励时系统自给的反馈,姚顺雨认为这是创新者的核心机制。

收听指南

谁该听

做 agent 应用的创业者、关注 AI 产品形态的投资人,以及想知道「模型能力溢出后还剩什么机会」的工程师。

可跳过

2:58–17:50 的个人成长与研究史,可只听结论。