世界太吵,來原聲聽播客

張小珺·商業訪談錄

AI 下半場:通用方法已經有了,難的是找任務

姚順雨說 AI 主線已從「造武器」進入「選戰場」——方法終於通用了,但真正的瓶頸不是推理能力,而是模型拿不到人腦子裡的 context。

Agent強化學習交互方式OpenAIAI 創業
前半段是個人研究史,信息密度一般;從 37 分鐘起的「下半場」、reward 設計和交互方式之爭才是真正值錢的部分。

核心論點 · 點時間戳可跳到原聲

9:09

從 vertical thinking 回到 general thinking

姚順雨把 AI 史講成一條碎片化的曲線:從 Newell 和 Simon 1960 年代想直接造一個 agent 開始,因為太難,學界不斷把問題切小——先切 vision,再切 language,再切 translation,越切越 vertical。他認為 2015 年之後 scaling law 和一批 research breakthrough 的意義,是讓這件事重新反過來:從細分思維回到構建一個更通用系統的思維。這也是他判斷自己該做什麼的底層座標。

— 姚順雨
19:18

語言 agent 的本質區別是能推理

他給了一個很具體的對照:AlphaGo 只能下圍棋,換個遊戲就得重訓;而人第一次玩一個新遊戲就能上手。他的解釋是人會思考——看到燈是黑的,推斷可能有危險,再結合上下文判斷燈在身後,於是先向後走。語言模型提供的足夠強的先驗讓推理成為可能,而推理能在不同環境間泛化。所以語言 agent 與之前所有 agent 的本質區別不是接口,是推理能力帶來的泛化。

— 姚順雨
39:37

reward 要基於結果、基於規則

他做任何 RL task 都堅持兩條:reward 基於結果而非過程,且是白盒的、能清晰算出來的,而不是基於人或模型的偏好。理由是只要基於過程或基於偏好,就會出現 hacking——你可能得到一段非常優美的代碼,但它不解決問題。他舉數學為例:答案是 3 就是 3,不是 3 就是錯,沒有解釋空間。他說做 webshop 時最難的部分不是搭環境,而是設計一個既有難度、又有真實價值、reward 又不 noisy 的任務。

— 姚順雨
46:44

客服要的是 pass^k,不是 pass@k

coding 界傳統指標是 pass@k:同一個任務跑 k 次,至少成功一次的概率,所以有人報 pass@100。但客服這類任務需要正好相反的指標,他們去年發的工作把它定義為 pass^k——k 次全部成功的概率。他判斷現在大家更重視 success rate 或 pass@100,是因為還在做 benchmark 而不是做實際應用;一旦接受這個轉變,就會意識到有些應用必須去優化 robustness,而這方面的進步空間還很大。

— 姚順雨
48:44

創業公司的機會是設計新的交互方式

他反過來說創業公司該擔心的不是模型能力溢出,而是模型不再溢出——那才真的什麼都做不了。他的框架是:模型公司的產品都是 ChatGPT 式的、像人一樣的交互;創業公司最大的機會是用模型的通用能力去創造不同的交互方式。Cursor 就是例子——人和人之間不會那樣交互。他補了一句關鍵約束:做新交互方式、同時模型持續溢出,兩者缺一不可;如果你的交互方式很像 ChatGPT,那你有什麼理由不被 ChatGPT 取代。

— 姚順雨
59:50

模型缺的不是智能,是 context

這是他解釋「為什麼模型推理這麼強、考試這麼強,卻沒創造足夠經濟價值」的核心答案:模型沒有 context。人類社會裡大量 context 永遠只存在人的大腦中,是分布式維護的——比如你老闆的行為習慣,很難用語言總結下來。所以一個二本畢業、數學不如 O3 的人,進公司七天積累的 context 就能讓他比 O3 做得更好。他認為這個問題解決了,utility 問題就能很大程度解決。

— 姚順雨
1:41:18

環境是 memory hierarchy 的最外層

他引馮諾依曼死前最後一本書 The Brain and the Computer 裡的一句話:environment is always the most outer part of the memory hierarchy。類比電腦從 CPU 緩存到內存到硬盤,最外層永遠是外部世界——插一個 U 盤、把東西上傳到互聯網、刻一張光盤。對人來說,最外層的長期記憶就是你的筆記本、Google Doc、Notion。他由此把 MCP 也歸入同一邏輯:本質上是 hack 你的 context 的一種方法。

— 姚順雨
1:45:18

能被定義成考試的任務,離被解決就不遠

他提出一個他認為最該被推翻的基本假設:現在評估一個東西是基於 500 個任務、每個跑 500 次,把平行數據加總成 reward。但人上班重要的是 30 天、一年之後變得多好,而不是在 100 個平行宇宙裡把你放到公司第一天能做多好。他的推論是:一旦你能定義一個考試或遊戲,離它被解決就不遠了;真實世界之所以難,正是因為它沒有被設計好的 reward 和標準答案。

— 姚順雨

原話 · 已逐字校驗

我們之前是就有點像我有很多怪獸 那我需要去為了不同怪獸去造各種各樣的武器 去來打這些怪獸 現在我有一個通用的武器了 就我有把機關槍 那現在我要思考的問題是我要朝哪裡去開槍

以前像是有很多怪獸,我得為不同的怪獸造不同的武器去打;現在我有了一件通用武器——一把機關槍,那我要思考的問題變成:我要朝哪裡開槍。

姚順雨38:36

實際上我認為做任何的RL task 最難的部分其實是怎麼定義reward

我認為做任何 RL 任務,最難的部分其實是怎麼定義 reward。

姚順雨40:40

如果你的交互方式很像chatGPT 那你有什麼理由 不被chatGPT取代

如果你的交互方式很像 ChatGPT,那你有什麼理由不被 ChatGPT 取代。

姚順雨49:44

雖然你沒有O3聰明 但是你有這些context 所以你做的比O3好

雖然你沒有 O3 聰明,但你有這些 context,所以你做得比 O3 好。

姚順雨1:00:51

Essentially environment is always the most outer part of the memory hierarchy

本質上,環境永遠是記憶層級的最外層。

姚順雨1:42:18

因為我們發現 一旦你可以定義考試或者一個遊戲 那離它被解決也不遠了

因為我們發現,一旦你可以定義一場考試或一個遊戲,那離它被解決也不遠了。

姚順雨1:45:18

If someone else can do it it's okay to let them do it

如果別人也能做這件事,那讓他們做也沒關係。

姚順雨2:25:53

數字與實體

姚順雨做 agent 研究的年數6 年7:06
coding 任務常報的指標pass@10046:44
agent 單用戶 token 消耗相對 chatbot 的倍數500 到 1000 倍1:23:01
姚順雨重寫 The Second Half 博文耗時約 2 小時2:10:37
姚順雨競賽成績全國銀牌2:20:48

術語

pass@kk 次至少成功一次
同一任務跑 k 次,至少成功一次的概率,coding 常用指標。
pass^kk 次全部成功
同一任務跑 k 次全部成功的概率,衡量可靠性,客服類任務需要。
affordance可供性
環境提供給行動者的可操作接口;姚順雨說 code 是 AI 最重要的 affordance。
memory hierarchy記憶層級
從緩存到內存到硬盤的分層存儲結構,姚順雨把外部環境放在最外層。
intrinsic reward內在獎勵
沒有外部激勵時系統自給的反饋,姚順雨認為這是創新者的核心機制。

收聽指南

誰該聽

做 agent 應用的創業者、關注 AI 產品形態的投資人,以及想知道「模型能力溢出後還剩什麼機會」的工程師。

可跳過

2:58–17:50 的個人成長與研究史,可只聽結論。