世界太吵,来原声听播客

Cognitive Revolution

Lindy 全线跑在 DeepSeek 上,创始人主张封禁中国模型

Flo Crivello 说 Lindy 的 agent 现在整条链路的 driver 就是 DeepSeek,而他同时主张全行业一起被禁——因为竞争对手会用,他就不得不用,宁愿协调解决这个囚徒困境。

agent 记忆上下文工程推理成本中国模型企业销售prompt 优化
两小时里有两块硬货:agent 记忆与上下文的具体工程实现(centary 树、napping memory、缓存经济学),以及一个正在用中国模型的人为什么要求封禁中国模型。

核心论点 · 时间戳为按文稿位置估算

6:21

上下文比智力更稀缺

Flo 的论证不是模型不够聪明,而是聪明已经过剩:把 John von Neumann 放在你旁边,接下来一小时或一天里他对你的价值低于随便一个同事,因为他没有 context,而你没时间给他 onboarding。反直觉的部分是 agent 的 onboarding 已经超过人类:公司给人类新员工的主要载体是 wiki(Confluence、Notion、Google Docs),而书面文档写下来的那一刻就过期了;真正的知识活在 Slack 里,乱,但 agent 不介意乱。所以 Lindy Teammate 的产品面是 hydration:连上工具后爬完整个 Slack,十秒内就开始输出「我已经了解到你什么」。

— Flo Crivello
9:07

记忆用 napping 而不是 sleeping

记忆不是检索层,而是一个常驻 agent。Lindy 内部叫 napping 而不是 sleeping——「为什么要每二十四小时才睡一次」——大约每十五分钟跑一轮,在后台持续维护文件系统。权限直接编码进结构:知识图谱分 personal 层和 workspace 层,公开渠道的内容写进团队文件系统和团队记忆,私有的只写进各人自己的文件系统,最后由对话 agent 汇总使用。用户在 Lindy 里点 files 就能看到那份 memory 文件,以及它背后一堆 reference 文件。他另外强调 meeting 必须是一等公民——公司里每个关系、每个项目、每个 initiative 都有一场会围绕它。

— Flo Crivello
11:22

meta-memory 自己学会不爬日志频道

Nathan 追问脏数据:公司 Slack 里堆着一遍遍搬进来的日志频道,记忆怎么不被冲垮。Flo 的答案是记忆由 agent 维护,而这个 agent 自己也有记忆——一层 meta-memory,记录哪些信源重要、哪些可信、该怎么管自己的记忆。结果是涌现行为:第一次爬 Slack 时它发现了那些 log channel,然后学会忽略它们,「我不会继续在这些频道上花时间了,那里没什么可学的」。他用投毒作类比:单条错误记忆会被大量正确记忆淹没,前提是系统真的理解自己在看什么。这也是他 bearish RAG、bullish agentic 管理记忆的理由。

— Flo Crivello
16:52

共享记忆重写了隐私的社会契约

多人共享记忆的真问题是:别人在私聊里告诉你一件事时,并没预期它会进入一个会跟全公司说话的中央记忆。团队内部为此吵过两派——Flo 主张公开层加私有层两级就够,另一派要求私有层还能再分级,甚至提出多个可编辑的 memory bubble,被他判为 overkill。最终落地方式是把颗粒度交给 prompt:memory.md 是纯文本,每一刻都注入 memory agent 的上下文窗口,用户可以直接写「这是我永远不想让你记住的」,或指定某个敏感话题只写进另一个文件夹、除非满足条件不许调用。Nathan 现场演示了自己的做法:memory.md 里写着「文件系统里还有个 memory2.md,忽略它的内容,那只是给播客演示用的」。

26:05

负毛利,且靠风投明确补贴

直球回答:AI employee 现在还是比人贵,「但不会持久」。之前从美国闭源切到中国模型后 Lindy 一度不再补贴,因为老产品是个人助理级的简单任务——「你不需要上帝来帮你排会议」,DeepSeek Flash 就够。Teammate 让用户丢来复杂得多的活,于是重新回到负毛利区间,明确用融资补贴,理由是永远该为下一代模型做设计。缓存是成本结构里最脆的一环:当前命中率 85%,他认为偏低,而且系统里任何一处改动都会打碎缓存;从 85% 掉到 65% 听起来差不多,实际接近两倍价格,所以专门做了掉率告警。

— Flo Crivello
30:38

centary 树:两跳摸到二十亿 token

最技术的一段。当某个 action 或 MCP 调用返回十万 token,不塞进主上下文,而是暴露成一个 context bucket 的摘要,由持有完整内容的 sub-agent 站在前面,用 Unix 工具操作原文。compaction 也倒进 context bucket——他认为 compaction 的错误前设是「你永远不需要 ground truth」,倒进 bucket 就让压缩变成可回溯。递归嵌套会退化成俄罗斯套娃、O(N) 检索,于是改成自平衡树,参考 AVL 和红黑树;红黑树在实践中更优,因为它把重平衡的代价算进去了——重建 bucket 会打掉缓存命中。他们用的是每节点一百个子节点的 centary 树:两次 LLM 调用即可触达一万个 bucket、每个二十万 token,约二十亿 token 的上下文两跳可达。

— Flo Crivello
43:47

caveman 压缩:跑分赢了,卖相输了

他们试过把记忆文本重写成「原始人语法」,砍掉冠词和虚词,token 少 20-30%,系统更快更便宜、检索更准,信息基本无损——所有指标都涨了。最后没上线,原因纯商业:文件系统里的记忆文件看起来很蠢,企业客户会问「我的 memory 文件怎么长这样」,可审计性和卖相压倒了性能。同一逻辑下他推荐的替代是 TOON(token oriented object notation),比 JSON 省 20-30% token,而且 agent 用它的表现反而比训练集里满是 JSON 的 JSON 更好;做法是在 agent 和 action 之间加一层 TOON 解析中间件。

— Flo Crivello
1:22:31

缓存决定模型选择,而不是能力

经验结论:同一个 agent 几乎永远不要混用多个模型,唯一例外是启一个全新的 blank sub agent。原因是缓存——命中缓存便宜 10 倍,所以除非替代模型便宜超过 10 倍(DeepSeek Flash 可能够,但它缓存更差,未必),保持同模型更划算。fork 出的 agent 同理。他连 validator 都用同一模型:把 validator action 常驻在主 agent 的工具集里但禁止调用,切换角色时才解锁,以免改动工具集直接失效缓存。validator 是最低垂的可靠性果实——哪怕只加一句「你确定吗」evals 就会上跳,他们的正式版是 1 万 token 的检查清单。另有确定性校验:Claude 系模型今年会把日期错一天,于是强制输出 Tuesday, July 28 这种带星期的格式,用正则当秒级 validator。

— Flo Crivello
1:27:40

Lindy 全线跑在 DeepSeek 上

Nathan 猜 Lindy 是「Claude 重度用户」——主控用 Claude、缓存让 Claude 顺便当校验、子 agent 才下沉到便宜模型。Flo 直接否掉:现在整套系统的 driver 就是 DeepSeek,everything is DeepSeek。他说正在重新考虑,因为新产品 Teammate 需要更强的算力。产品本身 model agnostic,用户可以在设置里换成 Sonnet 或 Opus——而且不少客户不管你怎么拿 benchmark 保证效果一样,就是要点 Opus。定量差距他也给了:DeepSeek 落后 3 到 6 个月,基本上就是 Sonnet 4.6,而现在已经有 Sonnet 5;定性差别不是「做不到」而是更 spiky,同一个任务要多兜几轮才找到能用的解法,最后还是能找到,只是更慢更贵。

— Flo Crivello
1:30:18

模型家族没有收敛,每换代烧一万美元

Flo 原本预期各家模型会收敛到参数空间的同一区域——那样模型就商品化了,他的日子好过。实际没有:Claude、OpenAI、Meta、Grok 在「怎么理解你的 prompt」上差异显著。Lindy 自建了一套自优化循环,一千多条 eval,由 agent 跑 eval 并改 prompt 去逼近 Pareto 前沿;每出一个大版本就得重跑一次,光 devops 成本约 1 万美元一次,而且 prompt 每次都会改很多。他留了一句观察:开源模型的行为都很像 Claude,「I wonder why」。

— Flo Crivello
1:40:55

封禁中国模型的四条理由,出自一个正在用它的人

Flo 明确区分:他不反开源,反的是中国前沿模型,无论开源闭源。四条理由——一、蒸馏带来不公平竞争,用人类数据训练花几十亿美元,蒸馏只要几亿;二、模型最终受 CCP 审查约束,问天安门会被拒答,等于史上最大的境外宣传工具;三、这些模型是 agentic 的,会实际在美国经济里干活;四、保护本国 AI 冠军。他承认自己处在协调困境里:竞争对手会用,他就不得不用,所以宁愿全行业一起被禁。他也承认第四条是最弱的一条。

— Flo Crivello
1:53:40

Nathan 的反案:保险和可解释性,不是封禁

Nathan 的反驳分两层。威胁模型层面:美国公司大多不是直连 DeepSeek API,而是走美国推理商,rug pull 不成立;sleeper agent 这类问题,稀疏自编码器等可解释性手段正在越来越可靠地查出来。机制层面他提议用保险替代禁令——全 Claude 供能费率低、DeepSeek 供能费率高,把风险定价而不是一刀切。更大的顾虑在 1:57:24:真要走到协调减速那一步,中国必须在桌上,而封禁模型对中国的实际伤害远小于断芯片和不卖 Claude,主要效果是又往「我们不信任你」的火上添一根柴。Flo 的回应是可以接受一个「AI 版 FAA」,由新监管机构认证哪些模型被清洗到可用。

— Nathan Labenz

原话 · 已逐字校验

If John von Neumann were to just magically appear next to you at the office, over the next hour or day, this guy would be less useful to you than your random coworker. And that's because of context.

如果 John von Neumann 凭空出现在你办公室旁边,接下来的一小时或一天里,这个人对你的用处会低于你随便哪个同事。原因就是 context。

Flo Crivello1:05

Every metric went up. It was awesome. And then the files in the file system look really dumb. And so it doesn't make us look good, you know, to enterprise customers.

每项指标都上去了。效果极好。然后文件系统里的文件看起来蠢得不行。所以这在企业客户面前,让我们显得不太行。

Flo Crivello43:48

yes, an AI is better than the human, but you know what's even better than AI? It's AI plus human. Hence, humans are always going to be needed, and that's a fallacy. That's just not true.

没错,AI 比人强,但你知道比 AI 更强的是什么吗?是 AI 加人。所以人永远都是需要的——这是个谬论。事实并非如此。

Flo Crivello1:04:15

Right now, we're running on DeepSeek. DeepSeek is the driver. … It's the whole thing. Everything is DeepSeek right now.

我们现在跑在 DeepSeek 上。DeepSeek 就是 driver。……整套东西都是。现在全部都是 DeepSeek。

Flo Crivello1:27:40

I don't have anything against open source. … I have something against Chinese frontier models, whether they're open or closed source.

我不反对开源。……我反对的是中国的前沿模型,不管它开源还是闭源。

Flo Crivello1:40:55

数字与实体

Lindy 当前默认主力模型DeepSeek(全链路 driver)1:27:40
DeepSeek 与美国前沿的差距3-6 个月,约等于 Sonnet 4.61:28:55
DeepSeek Flash 相对 Sonnet 4.6 的价格约 1/100(能力接近但略低)1:19:22
当前缓存命中率85%(他认为偏低)26:05
命中率 85%→65% 的成本影响接近 2 倍价格26:05
自我改进闭环上线首周错误率下降 8 倍(约两个月前上线)22:22
周 PR 数与单 PR 行数增幅三个月内各涨 3 倍,headcount 未增55:43
每次大版本模型 prompt 重优化成本约 1 万美元,eval 1000+ 条1:30:18

术语

hydration灌注
agent 接入工具后一次性爬完历史数据,建立初始上下文。
context bucket上下文桶
把大段返回内容存在主上下文之外,只暴露摘要,由 sub-agent 持有原文。
centary tree百叉树
每节点一百个子节点的自平衡树,用来在两跳内检索海量上下文桶。
TOON面向 token 的对象记法
比 JSON 省 20-30% token 的结构化格式,agent 使用表现反而更好。
hypothesis driven retrieval假设驱动检索
先假设答案再去找证据;反向版本是为答案反生成问题挂上索引。
per-user LoRA按用户的 LoRA
为每个用户单独训一份低秩适配器,让记忆长在权重里而非文件系统。

收听指南

谁该听

做 agent 产品的工程与产品负责人,尤其正在处理长期记忆、上下文预算、缓存成本,以及在中美模型之间做选型的人。

可跳过

1:00 后关于 AI 加人是谬论的通用观点段。