世界太吵,来原声听播客

Cognitive Revolution

Agent 瓶颈不在上下文,在记忆的写改召回遗忘

Uber 13 周烧光 token 预算证明塞上下文是错的;MongoDB 把 Agent 性能瓶颈指向记忆——写、改、召回、遗忘,并建议落地从员工用例和人在环开始。

Agent 记忆向量检索嵌入模型RAG企业 AIMongoDB

原视频在 YouTube 上放不出来,用音频听:

这集给做 Agent 工程的人扫障碍:块大小怎么设、10 万向量阈值、记忆谁写谁删;对只想听模型进展的人价值不大。

核心论点 · 时间戳为按文稿位置估算

6:32

从为存储省钱到为省时间

Pete 把 1970 年 E.F. Codd 的关系模型论文当作起点:当时存储最贵,规范化表格是理性选择。2007 年 MongoDB 诞生时稀缺资源变成时间,所以文档模型故意反规范化,用 JSON/BSON 减少磁盘读取。他还纠正一个被反复误读的定位:MongoDB 不是「无模式」,而是「模式灵活」——同一集合可以装不同形状的文档,让 schema 随产品一起演进。这套设计逻辑说明:数据库模式应该跟着当时最稀缺的资源走。

— Pete Johnson
16:38

塞满上下文不等于更好

Uber 13 周烧光 2026 年 token 预算的新闻,被当成 token maxing 战略失败的样本。把大量数据塞进上下文,成本只是一半问题,质量也会下降:研究表明窗口首尾几千 token 最重要,中间部分基本是噪音。这条路把行业推向「分类记忆」——每轮只选与当前 agent loop 相关的少数术语,而不是把所有历史都倒回去。这里的关键不是省钱,而是上下文内部的注意力衰减让选择性检索成为性能问题。

— Nathan Labenz
23:21

搜索能力是逐层长出来的

MongoDB 的搜索能力是按客户痛点一层层长出来的:2020 年先做词法搜索,因为很多客户在自建 Lucene;随后做向量搜索,因为向量本质是浮点数组,天然能当一个文档字段;再把词法、向量和元数据预过滤做进同一个混合搜索。2025 年干脆收购 Voyage AI,把嵌入模型也收进来,形成「更好一起」的方案。这个顺序本身就说明:基础设施公司碰 AI 功能,通常是从客户已经疼的地方开始,而不是先买模型再造场景。

— Pete Johnson
40:10

上下文分块解决调块困境

RAG 的第一个磨人问题是块大小:块太小,上下文不够,检索质量差;块太大,存储涨、精度反而掉,只能靠人工反复试。Voyage 的「上下文分块」把句子和额外上下文作为两个字符串分别送进模型,由模型自动判断最优块大小,最终只返回一个向量。这样可以用很小的块拿到接近完整上下文的检索质量,存储成本也更低,目前已到第四版。这是把工程师反复调参的过程搬进模型权重里的一个具体例子。

— Pete Johnson
48:20

十万向量才需要认真调参

Pete 给了两个选型阈值:规模上,向量量级到 10 万左右才真正开始难受;质量上,Voyage 在 Hugging Face RTEB 基准上领先,比别的嵌入模型最高改善 14%,这个差距可能直接表现为有没有幻觉。他还提醒,嵌入模型没有被商品化——Anthropic 自己不做 embedding model,所以他的建议是直接用 Voyage。对很多团队来说,嵌入模型的选型长期被低估;这段把它重新放回性能和幻觉的中心。

— Pete Johnson
1:01:05

记忆维护是 agent 最难问题

记忆为什么难?Pete 的比喻是:行业建数据库已有六十年,做 agent 大约只有十八个月。长期上下文策略已经不再是把整段会话塞回去,而是查询时召回最佳上下文,回答后把新事实写回记忆;企业系统还会用 RBAC 控制记忆的共享与隔离。他用同事的话概括整个循环:Write, change, recall, forget。记忆有半衰期,近期信息比几周甚至几个月前的信息更重要。这意味着 agent 记忆必须被当成一等公民,要有意的写入、更新和淘汰。

— Pete Johnson
1:13:10

Fortune 500 先做员工场景

Pete 接触的大多数 Fortune 500 公司都在做员工面向的用例,并且保留人类在环。原因有两层:ROI 更好算,这些岗位本来就有 KPI;数据安全后果更轻,员工数据泄露比客户数据泄露好处理。反过来,客户可以面对的完全自主 Agent 是当下风险回报比更差的赌注。这段给企业 AI 的预算判断提供了一个坐标:第一波落地更可能发生在内部效率工具,而不是替客户做最终决定的机器人。

— Pete Johnson
1:24:24

复杂客户不止在美国

Pete 在墨西哥城和圣保罗遇到了今年最复杂的客户,而这群客户通常预设美国竞争对手更先进。他说自己看到的正好相反。原因被归结为超大规模数据中心和 AI 服务的普及,地理障碍比云时代更不重要,全球企业获取技术的能力被拉平。这个观察说明,判断一家公司能不能用上前沿 AI,国别标签已经越来越不可靠。

— Pete Johnson

原话 · 已逐字校验

Most people think that we're schemaless, and that's not actually true. It's not that we're schemaless, it's that we're schema flexible

大多数人以为我们是无模式的,那不是事实。我们不是无模式的,而是模式灵活的。

Pete Johnson23:21

There's no lamp stack for agents yet in the way that we have with web development. We will get there. Having lived through that having lived through that life cycle, we'll eventually get there. But, like, there's there's no React in Angular. There's no LAMP stack for agents right now.

现在还没有像 Web 开发那样的 agent LAMP 栈。我们会走到那一步。我经历过那个生命周期,最终会走到。但现在 agent 没有 React 或 Angular,也没有 LAMP 栈。

Pete Johnson1:10:04

Most of Fortune five hundreds that I talked to are Dewey employee facing use cases with human in the loop for exactly the reasons that you just laid out and for some of the ROI reasons that I laid out before.

我接触的大多数财富 500 强公司都在做员工面向的用例,并保留人类在环,原因正是你说的那些,再加上我之前讲的 ROI 原因。

Pete Johnson1:13:10

there's a presumption in other countries that The US is ahead and doing things that other people are not, and I found the opposite to be true.

其他国家有一种预设,认为美国领先、在做别人没做的事,但我发现事实正相反。

Pete Johnson1:24:24

every other embedding model is gonna force you to pay tokens during your development cycle to hit against their embedding model.

其他嵌入模型都会迫使你在开发周期里为调用它们的嵌入模型支付 token 费用。

Pete Johnson1:28:08

数字与实体

MongoDB 占数据库市场份额约 3%12:24
Uber 烧光 2026 年 token 预算的时间13 周16:38
Voyage 上下文分块版本第三版去年夏天发布,第四版最近六周发布40:10
Voyage 相比其他嵌入模型的检索质量提升最高 14%48:20
使用重排序器可带来的检索质量提升5-10%1:03:40
MongoDB 收购 Voyage AI 的价格2.2 亿美元1:17:00
Voyage 收购价占 MongoDB 市值比例小于 1%1:17:20

术语

token maxing塞满上下文
把预算内 token 全部塞进上下文的做法,成本高且中段质量衰减。
contextual chunking上下文分块
把句子与额外上下文作为两条输入送进模型,自动决定最优块大小并返回单向量。
Matryoshka embedding套娃式嵌入
支持高维向量截断降维的嵌入模型,可免去重新 embed 整个语料。
agent skills代理技能
MongoDB 提供的精选系统提示,以 markdown 文件覆盖数据建模、运维等主题。

收听指南

谁该听

做 Agent/RAG 应用的工程师、帮企业选数据栈的技术负责人、关注嵌入模型和向量数据库赛道的投资人。

可跳过

前 30 分钟偏产品宣传,可从 16:38 开始;31:51 附近是发布功能,可快进。