世界太吵,来原声听播客

Training Data

人类点击数据是 Bug,Agent 搜索重建网络经济

当搜索的客户从人变成 Agent,点击数据失效,索引、定价与商业模式都要重来;Parag 用质量/成本/延迟三角和 Shapley 给出新框架。

Agent 搜索网络经济Shapley 值Google Cloud数据定价基础设施
Parag 从 Twitter CEO 转身做 Agent 搜索基础设施,前半段讲工程取舍,后半段讲 Web 经济学和 Shapley 定价,信息密度高。

核心论点 · 点时间戳可跳到原声

1:00

Agent 搜索是 1000 倍增量

Parag 创办 Parallel 的前提是:Agent 未来会用 Web 完成工作的次数是人类的一千倍以上。因此不能只把浏览器和搜索引擎的旧模式搬给 Agent,而要从索引、排序到商业模型重做一套面向 Agent 的搜索基础设施。他认为很多以前的护城河正在失效。

— Parag Agrawal
7:18

先做搜索 Agent 再养索引

Parallel 没有第一天做全量索引,而是先发布 search agent 产品,用一到十分钟的深度研究弥补索引覆盖不足。选择的对手是「雇人人工整理网页数据」,而不是 Google 的索引规模。早期客户用它做保险核保、索赔流程、销售数据清洗和金融建模数据采集,逐步把索引建起来。

— Parag Agrawal
14:46

输出是模型的放大器

Parag 不把 Parallel 叫 neo lab,因为输出不是模型,而是模型的补充层。核心问题把一万亿网页浓缩成正确的 1000 个 token,需要在检索、排序、记忆层级上做大量研究,最后压成很小的 ranking model。每个模型能力进步都会解锁更多 Parallel 可服务的场景,而不是让 Parallel 白做。

— Parag Agrawal
26:06

Google Cloud 合作打破 Google 垄断

模型公司可以直接拥有搜索,也可以买。Parag 不认为预训练爬虫天然等于实时索引:模型公司会跳过慢速 JavaScript 页面,因为 token 收益不划算,而 Parallel 是 completionist,愿意补齐这些边角。今天 Parallel 与 Google Cloud 合作,成为 Gemini/GCP 企业 Agent 的 search 与 grounding 供应商之一,企业可在 Google search 和 Parallel search 之间选择。

— Parag Agrawal
28:19

Agent 把搜索量放大千倍

典型 search agent 即使几秒内回答,也会做 5–20 次搜索;ChatGPT 每轮 prompt 在 medium 档就会触发 5–10 次搜索,调高后是几百上千次。更快的乘数来自开发者:一个管理一万家小企业信贷组合的客户,把每月一次的人工风险评估改成每周自动跑,搜索量的乘数达到几十万到一百万次。

— Parag Agrawal
34:49

广告经济学正在失效

Google 大多数查询是亏钱的,少数查询把利润拉回来,靠的是对有限人类注意力的差别定价。Agent 代替人类上网后,这个前提开始崩塌:agent 没有转化率统计,内容方还按「人类访问」设商业模式,会想方设法不让 agent 抓取。若 AI 推理量两年各涨 7 倍,而固定价格授权合同不涨,现有内容生意会在续约时受损。

— Parag Agrawal
42:55

用 Shapley 值给内容分钱

要决定一个内容源值多少钱,可以把它从语料里拿掉,跑 agent 看输出质量掉多少;如果多花一分钱算力就能补回质量,这个源的价值就接近一分钱。Shapley 值是把这种直觉形式化的数学框架,但完整计算成本极高——为了分配 1 美元可能要烧好几美元。Parallel 的做法是用数据和模型训练出好的估计,而不是做穷举模拟。

— Parag Agrawal
53:11

Web 从 pull 变成 push

Parag 的终局是三层递进:第一层 agent 把 web 当工具调;第二层是多 agent 和 subagent 协作,处理长时间运行、高算力的任务;第三层是 web 从「我来查」变成「你来叫我」。未来很多工作是响应世界变化而触发:卫星影像变了、客户评论变了、另一个 agent 算完了,Parallel 的角色就是持续把算力分配给整个 web,替所有客户盯住变化。

— Parag Agrawal

原话 · 已逐字校验

human click data is a.Bug.An agent.Doing work with search should rely on agent feedback, not human feedback.

人类点击数据是一个 bug。用搜索做事的 Agent,应该依赖 Agent 反馈,而不是人类反馈。

Parag Agrawal6:16

we announced today, actually, that we are working with Google Cloud

我们今天刚刚宣布,我们正在与 Google Cloud 合作。

Parag Agrawal26:06

It'll do somewhere between 5 to 20 searches, even if it answers within a few seconds

即使几秒内就能回答,它也会做 5 到 20 次搜索。

Parag Agrawal28:19

Google search wouldn't be free without ads, Twitter wouldn't be free without ads.

没有广告,Google 搜索不会是免费的;没有广告,Twitter 也不会是免费的。

Parag Agrawal34:49

their deal size is not growing 50 x

他们的交易规模不会跟着增长 50 倍。

Parag Agrawal40:00

And Shaly values is a mathematical way of effectively answering this question

Shapley 值就是有效回答这个问题的数学方法。

Parag Agrawal42:55

We will do tomorrow work in response.To something that circles through either another agent's work.Or something changes in the world.

我们明天要做的工作,是对另一项 Agent 工作的响应,或对世界上某个变化的响应。

Parag Agrawal53:11

数字与实体

Parallel 对成本压缩的目标保留大部分效果,成本降到十分之一14:46
典型 search agent 单次任务的搜索次数5–20 次28:19
Google 查询的利润结构(Parag 说法)大部分查询亏钱,少数查询赚回利润35:49
AI 推理需求两年增长(Parag 假设)每年 7 倍,合计约 50 倍40:00
为内容源计算完整 Shapley 值的成本数美元,远超要分配的 1 美元42:55

术语

Shapley valueShapley 值
合作博弈中按边际贡献分配总价值的方法;在内容定价中用来估算某个内容源的增量价值。
grounding事实锚定
把模型输出链接到外部可靠数据源,减少幻觉并补充实时信息。
fresh index新鲜索引
单独索引新发布和变化快的网页,避免与全量离线索引混在一起。
memory hierarchy记忆层级
按访问速度与成本分层存储索引,用有限算力在延迟预算内命中结果。

收听指南

谁该听

做 AI 搜索、Agent 基础设施、数据授权与内容商业化的人;想理解搜索经济如何被 Agent 改写的创业者/投资人。

可跳过

前 12 分钟的搜索基础定义和产品起源可快进,重点在后半段广告经济学与 Shapley 定价。