世界太吵,來原聲聽播客

張小珺·商業訪談錄

Agent 的瓶頸不是智能,是它學不會成為專家

通用智能已經夠用且廉價,真正稀缺的是 specialized intelligence——讓 agent 像實習生變成老師傅那樣,持續學會某個小世界的 world model。

Agent持續學習World Model創業人機交互
技術史脈絡清晰,後半段關於持續學習、world model 和 GUI 不會消失的論證密度最高,適合想搞清 agent 下一步往哪走的工程師和創業者。

核心論點 · 點時間戳可跳到原聲

6:08

邏輯智能體死於知識獲取瓶頸

蘇煜把 1950 到 1990 年代的專家系統叫 logical agent:把領域專家的知識寫成邏輯語言,配一個推理引擎,新問題來了就做邏輯推演。它的 memory 只是一個有限集的 logical statement,表達能力被邏輯語言本身 bound 住,世界上絕大部分東西沒法用簡單邏輯表達。autonomy 也只剩「接一個問題、推一個答案」。真正壓垮它的是 knowledge acquisition bottleneck——靠工程師去採訪專家再翻譯成邏輯形式,過程痛苦、低效、效果有限,直接導致 80 到 90 年代那波 AI winter。

— 蘇煜
13:17

深度強化學習的智能體只有一次前向傳播

2000 年後 neural agent 在 deep reinforcement learning 裡出了 AlphaGo 這類代表作,但從 memory 和 autonomy 兩個角度看仍然很受限:主體就是一個很小的神經網絡,幾十 million 到頂 100 million parameter,只玩一個或一類遊戲,輸入是畫面、輸出是動作。它的推理是隱式的,就藏在一次 forward pass 裡,不管情況多複雜,能用到的 compute 就是一次前向傳播。人不是這樣——情況複雜度不同,推理的計算量顯然不同。另一個硬傷是 sample efficiency 極差,一個簡單遊戲可能要玩幾百萬盤才學會。

— 蘇煜
21:27

語言是這一代 agent 的腳手架

蘇煜和楊迪、姚順宇、于濤在 2024 年專門做 tutorial 定義 language agent。這一代 agent 基於 LLM,最大的不同是可以用 language 作為 scaffold:perception 用 language understanding,交互形式靈活得多;reasoning 用 chain of thoughts,任務複雜就多產生 token,每個 token 都是一次 forward pass、一定量的 compute,於是達到 adaptive computing。語言同時是 take action 的媒介,包括 formal language 和 machine language,能在 digital world 裡做各種事。從 memory 角度,大模型訓練本身就是以語言為腳手架、通過 compression 形成對世界的 representation 的過程。

— 蘇煜
48:56

OpenClaw 時刻和 ChatGPT 時刻是同一種時刻

蘇煜認為兩者高度相似:底層技術其實早就 ready。ChatGPT 之前 LM 已經發展好幾年,從 BERT、ELMo、GPT-1 到 GPT-3,ChatGPT 只是把模型 finetune 得更像 chatterbot 再直接 release 給公眾,底層技術沒大變化,變的是交互形式,而這個變化成了導火索。OpenClaw 也一樣,大部分做 agent 的人看它的 code base 會有 nothing is new here 的感覺,但它是交互形式的深刻變化:可以在即時通訊軟件裡交互、有獨立環境、24 小時 always on,而且它開源、不管 permission 和 safety,所有東西都打開。他相信再過兩年看,OpenClaw 的影響力可能也是類似規模。

— 蘇煜
57:23

基礎模型智能已越過臨界點,缺的是抓價值的人

蘇煜引用 Google 前 CEO Eric Schmidt 的觀察:美國在應用層一般慢很多,中國一向在前端技術應用上動作很快,而這在 AI 時代是很大的優勢。原因是基礎模型的 intelligence 已經超過臨界點,對很多有用的事情來說 it's good enough。很多事以前沒人做,是因為摩擦太高、經濟賬算不過來;現在 AI 能力可以極大降低這些摩擦,很多事情從不值得做變成值得做,就有了商業價值。缺的是有足夠洞察和執行力去發現、抓住這些價值的人。他承認過程會有浪費,比如先花錢裝 OpenClaw 發現沒用、又花錢找人卸載,但對社會整體仍是積極發展。

— 蘇煜
1:03:26

通用智能變廉價後,差異化來自 specialization

蘇煜說現在 AI 到了通用智能很強的階段,在 digital world 裡隨便給 Cloud Code、OpenClaw 一個問題,只要不是高度專業、且有必要信息,大概有百分之六七十的概率能做對。所以缺的是 specialized intelligence:當通用智能變成標配,differentiation 來自 specialization。世界不是一整個世界,是由幾百萬個小世界組成,每個職業、每個 domain、每個公司、每個軟件、每個網站都是一個小世界,這些世界的 entropy 加起來幾乎無限,不可能有單一 agent 或單一模型 capture 全部,必然有 adaptation 和 specialization 的過程。

— 蘇煜
1:14:48

World model 不只是視頻預測,是實習生變成專家

蘇煜對 world model 的定義比多數人寬。大家提到 world model 通常指 vision based、做 next frame prediction 或 3D reconstruction 的模型,他認為這很重要、也是 LM 欠缺的能力,但 world model 是整個 human intelligence 最重要的概念。他舉例:大學剛畢業進公司實習,第一天完全不知道工作內容,但能在 learning on the job 中持續學習——公司的 org chart 表面和實際是什麼樣、誰說話管事、找誰批准、軟件怎麼用、工作流是什麼、人與人之間的 theory of mind,這些全是 world model 的一部分。這個 microworld 的 model 顯然不是 video model,很多部分天然是符號化的。

— 蘇煜
1:44:05

CLI 不會全面取代 GUI

蘇煜認為 GUI 不會消失:人是 visual animal,大腦就是這麼編碼的,HCI 研究顯示同樣的東西可視化後大腦理解速度快零點幾秒,GUI 還有 validation、win trust、auditing 的實際好處。agent 要不要 GUI 則是另一回事,但 GUI 是整個 digital world 的 de facto interface,99% 的東西已經有 GUI 可交互,而且 GUI 在設計過程中已經 encode 了大量 knowledge、constraint、business logic,agent 用好 GUI 就能 piggy back on all of this accumulated knowledge,而不是重造一套 CLI 或 API 的輪子,這樣才能 immediately reach all corners of human society,尤其是 long tail 場景。他還舉 semantic web 的例子:Tim Berners-Lee 推了二十幾年,adoption 依然非常低,因為社會不是那麼 work 的。

— 蘇煜
2:06:19

真正的風險是失業速度超過新崗位產生速度

蘇煜看不到可預見未來裡 AI 快速自我迭代、消滅人類的可能性,因為那不只是 intelligence 問題,而是 innate goals、intention、生存壓力這些更高層面能力的缺失,現在所有目的都是人賦予的。他真正的 concern 是 job displacement:如果 AI agent 大規模取代 knowledge worker,一方面不能產生足夠多新崗位承載 displaced workforce,另一方面沒有好的收益再分配機制給社會兜底,而大部分收益被幾家頭部公司或資本獲得,就會對社會產生極大影響。他認為 AI researcher 每個人都有責任,自己能做的重要事情是 democratize access to frontier agent capabilities。

— 蘇煜

原話 · 已逐字校驗

但At the end of the day 就是最後這些東西都是在快速的converge 最後At the end of the day 大家想要的就是一個Universal Digital Agent

但歸根結底,最後這些東西都在快速收斂,大家想要的就是一個通用數字智能體。

蘇煜41:09

就大部分做agent的人去看open cloud的這個code base的話 可能會有一種nothing is new here 就這地方沒有什麼創新的這種感覺 但實際上它是一個也是一個交互形式的一個深刻的一個變化

大部分做 agent 的人去看 OpenClaw 的代碼庫,可能會有一種「這裡沒什麼新東西」的感覺,但實際上它是一個交互形式的深刻變化。

蘇煜51:15

這個model它顯然不是一個video model 但vision當然是裡面很重要的一部分 但顯然也有更多的部分 它是天然就是符號化的 symbolic的

這個 model 顯然不是一個 video model,vision 當然是裡面很重要的一部分,但顯然也有更多的部分天然就是符號化的。

蘇煜1:16:50

這種individual thought doesn't need a language 但是civilization needs a language

個體的思考不需要語言,但文明需要語言。

蘇煜1:36:01

但你現在 比如說我就先出來一個標準叫mcp 或者我出來一個標準 就是讓大家都農進去寫cli 然後你指望所有的行業都 在未來幾年去adopt這個事情 這是幾乎不可能的

但你現在比如先出來一個標準叫 MCP,或者出來一個標準讓大家都去寫 CLI,然後指望所有行業在未來幾年 adopt 這件事,這是幾乎不可能的。

蘇煜1:43:05

因為他沒有學過 他即使做過 他也沒有一個有效的方式 把他給像人一樣去學會 成為一個part of my expertise 所以他才會導致這些不穩定

因為他沒學過,即使做過,他也沒有一個有效的方式像人一樣把它學會、變成自己 expertise 的一部分,所以才會導致這些不穩定。

蘇煜1:52:13

那就是 All the way continue learning All the way word modeling

那就是一路走持續學習,一路走 world modeling。

蘇煜2:15:23

數字與實體

AutoGPT GitHub Stars約 18 萬34:03
Neocortex 佔大腦比例約 70%1:21:53
人腦皮質柱數量約 15 萬個1:24:54
OpenAI 與 Anthropic 融資佔市場比例約 30% 到 50%1:07:38

術語

semantic parsing語義解析
把人說的話轉成機器能讀懂的 formal meaning representation,如知識圖譜、數據庫、網站可執行的形式。
language agent語言智能體
以語言為腳手架做 perception、reasoning 和 action 的智能體,蘇煜等人在 2024 年 tutorial 中定義。
world model世界模型
智能體對所處小世界的內部表示,蘇煜認為不限於視頻預測,也包括組織架構、工作流、theory of mind 等。
continual learning持續學習
模型在部署後繼續學習新任務或新環境,同時不遺忘已有能力,蘇煜認為其學習目標應是 world model。
cortical column皮質柱
新皮層中重複出現的單元結構,人腦約有 15 萬個,Jeff Hawkins 理論認為每個皮質柱在學習 world model。
non-parametric learning非參數化學習
不改模型參數、通過寫 MD 文件或 harness 等方式讓 agent 獲得新能力,OpenClaw 的 skills 屬於此類。

收聽指南

誰該聽

想搞清 agent 技術脈絡和下一步瓶頸的工程師、創業者與投資人,尤其是關心持續學習、world model 和 agent 產品形態的人。

可跳過

2:10 之後的快問快答可跳過,前面 2:00 左右的自我介紹也可快進。