個人 Agent 的勝負手不是模型,是記憶和主動
Today 團隊認為模型已接近 AGI、成本每年降十倍,瓶頸轉移到記憶與主動性;而主動做不好的產品,只會變成又一個騷擾推送。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
模型不再是瓶頸,成本才是
高策此前做模型基礎設施和向量數據庫,一直手寫代碼,直到今年 2 月某家模型發布後感到智能有一次躍升,甚至認為在 coding 上已到 AGI 水平。他的推論是:coding 每年還能提升十倍八倍,成本每年降十倍也遵循 scaling law,那麼一兩年後手機上就有一個比普通人更強的廉價智能。所以做 Personal Agent 缺的不是模型能力,而是怎麼用。這個判斷決定了 Today 的產品重心不在模型,而在 harness 和產品設計。
— 高策先服務數字資產多的人,是不得不做的取捨
高策解釋為什麼早期用戶總是特別忙、願意折騰的人:Personal Agent 要產生價值,前提是你在賽博世界裡留下足夠多的上下文。一個平時不用郵件、網上沒有足跡的人,Agent 無法快速瞭解你的 profile,只能讓你一點點告訴它,上手門檻極高。所以 OpenClaw 最早從程序員群體起來,因為他們每天對著電腦、留下大量上下文。只服務高淨值人群產品沒法 scale,但處理物理世界與線上上下文如何統一之前,只能先從這裡開始。
— 高策Personal AI 的對立面不是辦公,是高委託成本
Suki 反駁「你們做個人 agent 怎麼還做辦公」的質疑:Personal AI 的對立面並不是工作,也不是辦公 agent,而是高委託成本。過去你跟 agent 委託事情要給它大量上下文,而這一代產品直接進入你的生活、連接你的應用、知道你的同事和關係網絡,很多時候一句話就能把事情幹完。高策補充,絕大多數人尤其是中國人的生活和工作很難分開,越忙界限越模糊,所以從生活泛化到工作比反過來更容易。
— Suki大廠擅長高舉高打,不擅長看見和堅持
Suki 說據她所知,千問和豆包在年中就看見 OpenClaw 這個方向並探索過一段時間,很快放棄了。她的 learning 是大廠最擅長的不是看見某個東西並堅信它,而是高舉高打、拿資源燒錢。而此刻這個方向還沒有 PMF,TAM 非常小,哪怕付費轉化到 15%,用戶體量在大廠眼裡也是小市場——去年釘釘 40 億、飛書 30 億、企微 30 億左右,三個加起來不到 100 億。所以大廠通常等 TAM 足夠大才不計成本投入。
— Suki養一堆 Agent 是情緒價值,不是效率
高策去年 12 月自己養過設計總管、產品總管、項目總管三個 agent,最後只願意跟項目總管聊天,因為上下文都在一個地方,不需要反覆交代給三個角色。他認為多 agent 在 C 端可能是偽需求,很多人養一堆小龍蝦更多是「我有一堆小弟幹活」的情緒價值,實際用起來是在浪費 token——不同角色之間協同也要花你的 token 和錢。多 agent 真正的價值在於兩個大腦互相監督,比如 evo 和測試場景,但大多數 personal agent 的日常用不到。
— 高策發件箱比收件箱信息密度更高
Suki 講記憶構建的一個具體 rubrics:Town 拿到郵件授權後,樸素做法是掃一遍收件箱發件箱找線索,但核心觀察是——你發出去的郵件帶著更高的信息密度,因為發出去是帶著意圖的,你會對自己的意圖做清晰描述,比如要跟人合作會先介紹自己。收件箱是別人對你的意圖,發件箱是你對別人的意圖。郵件是 1960 年代就產生的協議,背後有大量 protocol 和 side channel 信號,能不能在產品上拿到這些信號,就是記憶質量的差異。
— Suki主動性是開放場景,沒法做 AB 實驗
高策對比工作場景和主動性:工作場景是封閉問題,像 Workbody 開源的那個 benchmark,給你一個 workspace 處理完就完事,很好評估對錯。但 proactive 是開放場景,要用到你大量增量信息,目標非常主觀、個性化、多維度,跟推送頻率、質量甚至你當天心情都相關。產品前期沒法做 GSP 或 AB 實驗來驗證主動性效果,未來也很困難,所以它非常考驗產品負責人對世界和信息架構的理解,是工程和產品 co-design 的東西。
— 高策前面疊意圖模型在工程上是災難
高策談意圖識別:傳統做法是在前面疊一個意圖小模型,再分發到不同意圖的大模型,比如識別出問天氣就用很小的模型。但缺點是意圖維護越來越難,產品橫向擴展各種意圖,最後可能疊出幾千個意圖,豆包、元寶、Workbody 這種泛化性強的產品尤其難維護。而且疊了意圖模型之後,下面看到的上下文是割裂的,message 怎麼在多個子模型之間分享是個大問題,對工程來說是挺災難的東西。Manus 二五年七月發過博客講上下文感知的狀態機,但沒講實現細節。
— 高策原話 · 已逐字校驗
personal AI 他的對立面並不是工作 並不是辦公agent personal AI的對立面是高委託成本
Personal AI 的對立面並不是工作,並不是辦公 agent,Personal AI 的對立面是高委託成本。
Suki26:27
我聽到很多人 養一堆小龍蝦 其實更多的是看到 他們幹活的 一種情緒價值的感受 就是我有一堆小弟 給我幹活 但實際上 如果真的用起來 你會發現 它其實是在浪費你的token
我聽到很多人養一堆小龍蝦,其實更多是看到他們幹活的一種情緒價值的感受,就是我有一堆小弟給我幹活。但實際上如果真的用起來,你會發現它其實是在浪費你的 token。
高策38:33
我現在的感受是說模型泛化性沒有想像中那麼強 就是產品經理的價值是非常大的 以及模型其實現在它的同質化其實是越來越重的 就模型未來成為基建以後 產品的價值或者說產品經理的價值 我覺得是越來越大的
我現在的感受是模型泛化性沒有想像中那麼強,產品經理的價值是非常大的。而且模型現在同質化越來越重,模型未來成為基建以後,產品的價值或者說產品經理的價值我覺得是越來越大的。
高策58:46
我覺得是短時間內 大家確實是高估這個領域的 但是長時間 他可能是被低估的 但短時間我覺得是非常被高估的
我覺得短時間內大家確實高估了這個領域,但長時間它可能是被低估的,短時間我覺得是非常被高估的。
高策1:22:04
數字與實體
| Today 立項到上線時間線 | 去年 10 月有想法,2 月組建團隊,4 月開始內測 | 2:02 |
| 釘釘、飛書、企微年收入 | 釘釘 40 億、飛書 30 億、企微 30 億左右,三個加起來不到 100 億 | 30:30 |
| Suki 未讀郵件數 | 四千多份未讀郵件 | 57:45 |
| 模型訓練數據配比 | 小米 RL 訓練過程開放,數據配比百分之六七十是 coding,百分之三點五是 chat | 1:17:02 |
術語
- Personal Agent個人智能體
- 能記住你、主動替你辦事的 AI 助理,區別於需要你發起任務的工具。
- harness智能體框架
- 圍繞模型搭建的工具調用、上下文管理和任務執行框架。
- proactive主動性
- Agent 不等你提問就主動推送信息或執行任務的能力。
- KVCache鍵值緩存
- 大模型多輪對話中複用前面計算結果以降低成本的機制。
- rubrics評分規則
- 人工設計的判斷標準,用來引導模型在特定場景下做出更準確的判斷。
收聽指南
做 AI 應用和 Agent 產品的創業者與產品經理,尤其是正在糾結記憶架構、主動性設計和意圖路由方案的人。
1:36:16 之後的收尾感想和告別,信息量低。