世界太吵,来原声听播客

乱翻书

个人 Agent 的胜负手不是模型,是记忆和主动

Today 团队认为模型已接近 AGI、成本每年降十倍,瓶颈转移到记忆与主动性;而主动做不好的产品,只会变成又一个骚扰推送。

Personal Agent记忆系统主动性产品设计Agent 框架

原视频在 YouTube 上放不出来,用音频听:

两位创始人把 Personal Agent 的工程细节讲得很实:记忆怎么存、主动怎么评、意图路由为什么是灾难。信息密度高,但产品尚未验证。

核心论点 · 点时间戳可跳到原声

14:15

模型不再是瓶颈,成本才是

高策此前做模型基础设施和向量数据库,一直手写代码,直到今年 2 月某家模型发布后感到智能有一次跃升,甚至认为在 coding 上已到 AGI 水平。他的推论是:coding 每年还能提升十倍八倍,成本每年降十倍也遵循 scaling law,那么一两年后手机上就有一个比普通人更强的廉价智能。所以做 Personal Agent 缺的不是模型能力,而是怎么用。这个判断决定了 Today 的产品重心不在模型,而在 harness 和产品设计。

— 高策
20:16

先服务数字资产多的人,是不得不做的取舍

高策解释为什么早期用户总是特别忙、愿意折腾的人:Personal Agent 要产生价值,前提是你在赛博世界里留下足够多的上下文。一个平时不用邮件、网上没有足迹的人,Agent 无法快速了解你的 profile,只能让你一点点告诉它,上手门槛极高。所以 OpenClaw 最早从程序员群体起来,因为他们每天对着电脑、留下大量上下文。只服务高净值人群产品没法 scale,但处理物理世界与线上上下文如何统一之前,只能先从这里开始。

— 高策
26:27

Personal AI 的对立面不是办公,是高委托成本

Suki 反驳「你们做个人 agent 怎么还做办公」的质疑:Personal AI 的对立面并不是工作,也不是办公 agent,而是高委托成本。过去你跟 agent 委托事情要给它大量上下文,而这一代产品直接进入你的生活、连接你的应用、知道你的同事和关系网络,很多时候一句话就能把事情干完。高策补充,绝大多数人尤其是中国人的生活和工作很难分开,越忙界限越模糊,所以从生活泛化到工作比反过来更容易。

— Suki
29:29

大厂擅长高举高打,不擅长看见和坚持

Suki 说据她所知,千问和豆包在年中就看见 OpenClaw 这个方向并探索过一段时间,很快放弃了。她的 learning 是大厂最擅长的不是看见某个东西并坚信它,而是高举高打、拿资源烧钱。而此刻这个方向还没有 PMF,TAM 非常小,哪怕付费转化到 15%,用户体量在大厂眼里也是小市场——去年钉钉 40 亿、飞书 30 亿、企微 30 亿左右,三个加起来不到 100 亿。所以大厂通常等 TAM 足够大才不计成本投入。

— Suki
35:33

养一堆 Agent 是情绪价值,不是效率

高策去年 12 月自己养过设计总管、产品总管、项目总管三个 agent,最后只愿意跟项目总管聊天,因为上下文都在一个地方,不需要反复交代给三个角色。他认为多 agent 在 C 端可能是伪需求,很多人养一堆小龙虾更多是「我有一堆小弟干活」的情绪价值,实际用起来是在浪费 token——不同角色之间协同也要花你的 token 和钱。多 agent 真正的价值在于两个大脑互相监督,比如 evo 和测试场景,但大多数 personal agent 的日常用不到。

— 高策
44:38

发件箱比收件箱信息密度更高

Suki 讲记忆构建的一个具体 rubrics:Town 拿到邮件授权后,朴素做法是扫一遍收件箱发件箱找线索,但核心观察是——你发出去的邮件带着更高的信息密度,因为发出去是带着意图的,你会对自己的意图做清晰描述,比如要跟人合作会先介绍自己。收件箱是别人对你的意图,发件箱是你对别人的意图。邮件是 1960 年代就产生的协议,背后有大量 protocol 和 side channel 信号,能不能在产品上拿到这些信号,就是记忆质量的差异。

— Suki
47:38

主动性是开放场景,没法做 AB 实验

高策对比工作场景和主动性:工作场景是封闭问题,像 Workbody 开源的那个 benchmark,给你一个 workspace 处理完就完事,很好评估对错。但 proactive 是开放场景,要用到你大量增量信息,目标非常主观、个性化、多维度,跟推送频率、质量甚至你当天心情都相关。产品前期没法做 GSP 或 AB 实验来验证主动性效果,未来也很困难,所以它非常考验产品负责人对世界和信息架构的理解,是工程和产品 co-design 的东西。

— 高策
1:02:50

前面叠意图模型在工程上是灾难

高策谈意图识别:传统做法是在前面叠一个意图小模型,再分发到不同意图的大模型,比如识别出问天气就用很小的模型。但缺点是意图维护越来越难,产品横向扩展各种意图,最后可能叠出几千个意图,豆包、元宝、Workbody 这种泛化性强的产品尤其难维护。而且叠了意图模型之后,下面看到的上下文是割裂的,message 怎么在多个子模型之间分享是个大问题,对工程来说是挺灾难的东西。Manus 二五年七月发过博客讲上下文感知的状态机,但没讲实现细节。

— 高策

原话 · 已逐字校验

personal AI 他的对立面并不是工作 并不是办公agent personal AI的对立面是高委托成本

Personal AI 的对立面并不是工作,并不是办公 agent,Personal AI 的对立面是高委托成本。

Suki26:27

我听到很多人 养一堆小龙虾 其实更多的是看到 他们干活的 一种情绪价值的感受 就是我有一堆小弟 给我干活 但实际上 如果真的用起来 你会发现 它其实是在浪费你的token

我听到很多人养一堆小龙虾,其实更多是看到他们干活的一种情绪价值的感受,就是我有一堆小弟给我干活。但实际上如果真的用起来,你会发现它其实是在浪费你的 token。

高策38:33

我现在的感受是说模型泛化性没有想象中那么强 就是产品经理的价值是非常大的 以及模型其实现在它的同质化其实是越来越重的 就模型未来成为基建以后 产品的价值或者说产品经理的价值 我觉得是越来越大的

我现在的感受是模型泛化性没有想象中那么强,产品经理的价值是非常大的。而且模型现在同质化越来越重,模型未来成为基建以后,产品的价值或者说产品经理的价值我觉得是越来越大的。

高策58:46

我觉得是短时间内 大家确实是高估这个领域的 但是长时间 他可能是被低估的 但短时间我觉得是非常被高估的

我觉得短时间内大家确实高估了这个领域,但长时间它可能是被低估的,短时间我觉得是非常被高估的。

高策1:22:04

数字与实体

Today 立项到上线时间线去年 10 月有想法,2 月组建团队,4 月开始内测2:02
钉钉、飞书、企微年收入钉钉 40 亿、飞书 30 亿、企微 30 亿左右,三个加起来不到 100 亿30:30
Suki 未读邮件数四千多份未读邮件57:45
模型训练数据配比小米 RL 训练过程开放,数据配比百分之六七十是 coding,百分之三点五是 chat1:17:02

术语

Personal Agent个人智能体
能记住你、主动替你办事的 AI 助理,区别于需要你发起任务的工具。
harness智能体框架
围绕模型搭建的工具调用、上下文管理和任务执行框架。
proactive主动性
Agent 不等你提问就主动推送信息或执行任务的能力。
KVCache键值缓存
大模型多轮对话中复用前面计算结果以降低成本的机制。
rubrics评分规则
人工设计的判断标准,用来引导模型在特定场景下做出更准确的判断。

收听指南

谁该听

做 AI 应用和 Agent 产品的创业者与产品经理,尤其是正在纠结记忆架构、主动性设计和意图路由方案的人。

可跳过

1:36:16 之后的收尾感想和告别,信息量低。