AI 下半场:通用方法已经有了,难的是找任务
姚顺雨说 AI 主线已从「造武器」进入「选战场」——方法终于通用了,但真正的瓶颈不是推理能力,而是模型拿不到人脑子里的 context。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
从 vertical thinking 回到 general thinking
姚顺雨把 AI 史讲成一条碎片化的曲线:从 Newell 和 Simon 1960 年代想直接造一个 agent 开始,因为太难,学界不断把问题切小——先切 vision,再切 language,再切 translation,越切越 vertical。他认为 2015 年之后 scaling law 和一批 research breakthrough 的意义,是让这件事重新反过来:从细分思维回到构建一个更通用系统的思维。这也是他判断自己该做什么的底层坐标。
— 姚顺雨语言 agent 的本质区别是能推理
他给了一个很具体的对照:AlphaGo 只能下围棋,换个游戏就得重训;而人第一次玩一个新游戏就能上手。他的解释是人会思考——看到灯是黑的,推断可能有危险,再结合上下文判断灯在身后,于是先向后走。语言模型提供的足够强的先验让推理成为可能,而推理能在不同环境间泛化。所以语言 agent 与之前所有 agent 的本质区别不是接口,是推理能力带来的泛化。
— 姚顺雨reward 要基于结果、基于规则
他做任何 RL task 都坚持两条:reward 基于结果而非过程,且是白盒的、能清晰算出来的,而不是基于人或模型的偏好。理由是只要基于过程或基于偏好,就会出现 hacking——你可能得到一段非常优美的代码,但它不解决问题。他举数学为例:答案是 3 就是 3,不是 3 就是错,没有解释空间。他说做 webshop 时最难的部分不是搭环境,而是设计一个既有难度、又有真实价值、reward 又不 noisy 的任务。
— 姚顺雨客服要的是 pass^k,不是 pass@k
coding 界传统指标是 pass@k:同一个任务跑 k 次,至少成功一次的概率,所以有人报 pass@100。但客服这类任务需要正好相反的指标,他们去年发的工作把它定义为 pass^k——k 次全部成功的概率。他判断现在大家更重视 success rate 或 pass@100,是因为还在做 benchmark 而不是做实际应用;一旦接受这个转变,就会意识到有些应用必须去优化 robustness,而这方面的进步空间还很大。
— 姚顺雨创业公司的机会是设计新的交互方式
他反过来说创业公司该担心的不是模型能力溢出,而是模型不再溢出——那才真的什么都做不了。他的框架是:模型公司的产品都是 ChatGPT 式的、像人一样的交互;创业公司最大的机会是用模型的通用能力去创造不同的交互方式。Cursor 就是例子——人和人之间不会那样交互。他补了一句关键约束:做新交互方式、同时模型持续溢出,两者缺一不可;如果你的交互方式很像 ChatGPT,那你有什么理由不被 ChatGPT 取代。
— 姚顺雨模型缺的不是智能,是 context
这是他解释「为什么模型推理这么强、考试这么强,却没创造足够经济价值」的核心答案:模型没有 context。人类社会里大量 context 永远只存在人的大脑中,是分布式维护的——比如你老板的行为习惯,很难用语言总结下来。所以一个二本毕业、数学不如 O3 的人,进公司七天积累的 context 就能让他比 O3 做得更好。他认为这个问题解决了,utility 问题就能很大程度解决。
— 姚顺雨环境是 memory hierarchy 的最外层
他引冯诺依曼死前最后一本书 The Brain and the Computer 里的一句话:environment is always the most outer part of the memory hierarchy。类比电脑从 CPU 缓存到内存到硬盘,最外层永远是外部世界——插一个 U 盘、把东西上传到互联网、刻一张光盘。对人来说,最外层的长期记忆就是你的笔记本、Google Doc、Notion。他由此把 MCP 也归入同一逻辑:本质上是 hack 你的 context 的一种方法。
— 姚顺雨能被定义成考试的任务,离被解决就不远
他提出一个他认为最该被推翻的基本假设:现在评估一个东西是基于 500 个任务、每个跑 500 次,把平行数据加总成 reward。但人上班重要的是 30 天、一年之后变得多好,而不是在 100 个平行宇宙里把你放到公司第一天能做多好。他的推论是:一旦你能定义一个考试或游戏,离它被解决就不远了;真实世界之所以难,正是因为它没有被设计好的 reward 和标准答案。
— 姚顺雨原话 · 已逐字校验
我们之前是就有点像我有很多怪兽 那我需要去为了不同怪兽去造各种各样的武器 去来打这些怪兽 现在我有一个通用的武器了 就我有把机关枪 那现在我要思考的问题是我要朝哪里去开枪
以前像是有很多怪兽,我得为不同的怪兽造不同的武器去打;现在我有了一件通用武器——一把机关枪,那我要思考的问题变成:我要朝哪里开枪。
姚顺雨38:36
实际上我认为做任何的RL task 最难的部分其实是怎么定义reward
我认为做任何 RL 任务,最难的部分其实是怎么定义 reward。
姚顺雨40:40
如果你的交互方式很像chatGPT 那你有什么理由 不被chatGPT取代
如果你的交互方式很像 ChatGPT,那你有什么理由不被 ChatGPT 取代。
姚顺雨49:44
虽然你没有O3聪明 但是你有这些context 所以你做的比O3好
虽然你没有 O3 聪明,但你有这些 context,所以你做得比 O3 好。
姚顺雨1:00:51
Essentially environment is always the most outer part of the memory hierarchy
本质上,环境永远是记忆层级的最外层。
姚顺雨1:42:18
因为我们发现 一旦你可以定义考试或者一个游戏 那离它被解决也不远了
因为我们发现,一旦你可以定义一场考试或一个游戏,那离它被解决也不远了。
姚顺雨1:45:18
If someone else can do it it's okay to let them do it
如果别人也能做这件事,那让他们做也没关系。
姚顺雨2:25:53
数字与实体
| 姚顺雨做 agent 研究的年数 | 6 年 | 7:06 |
| coding 任务常报的指标 | pass@100 | 46:44 |
| agent 单用户 token 消耗相对 chatbot 的倍数 | 500 到 1000 倍 | 1:23:01 |
| 姚顺雨重写 The Second Half 博文耗时 | 约 2 小时 | 2:10:37 |
| 姚顺雨竞赛成绩 | 全国银牌 | 2:20:48 |
术语
- pass@kk 次至少成功一次
- 同一任务跑 k 次,至少成功一次的概率,coding 常用指标。
- pass^kk 次全部成功
- 同一任务跑 k 次全部成功的概率,衡量可靠性,客服类任务需要。
- affordance可供性
- 环境提供给行动者的可操作接口;姚顺雨说 code 是 AI 最重要的 affordance。
- memory hierarchy记忆层级
- 从缓存到内存到硬盘的分层存储结构,姚顺雨把外部环境放在最外层。
- intrinsic reward内在奖励
- 没有外部激励时系统自给的反馈,姚顺雨认为这是创新者的核心机制。
收听指南
做 agent 应用的创业者、关注 AI 产品形态的投资人,以及想知道「模型能力溢出后还剩什么机会」的工程师。
2:58–17:50 的个人成长与研究史,可只听结论。