世界太吵,來原聲聽播客

Training Data

人類點擊數據是 Bug:Agent 搜索要重做索引與定價

當搜索的客戶從人變成 Agent,點擊數據失效,索引、定價與商業模式都要重來;Parag 用質量/成本/延遲三角和 Shapley 給出新框架。

Agent 搜索網絡經濟Shapley 值Google Cloud數據定價基礎設施
Parag 從 Twitter CEO 轉身做 Agent 搜索基礎設施,前半段講工程取捨,後半段講 Web 經濟學和 Shapley 定價,信息密度高。

核心論點 · 點時間戳可跳到原聲

1:00

不能把人用的搜索直接搬給 Agent

Parag 創辦 Parallel 的前提是:Agent 未來會用 Web 完成工作的次數是人類的一千倍以上。因此不能只把瀏覽器和搜索引擎的舊模式搬給 Agent,而要從索引、排序到商業模型重做一套面向 Agent 的搜索基礎設施。他認為很多以前的護城河正在失效。

— Parag Agrawal
7:18

對手不是 Google,是人工整理網頁的人

Parallel 沒有第一天做全量索引,而是先發布 search agent 產品,用一到十分鐘的深度研究彌補索引覆蓋不足。選擇的對手是「僱人人工整理網頁數據」,而不是 Google 的索引規模。早期客戶用它做保險核保、索賠流程、銷售數據清洗和金融建模數據採集,逐步把索引建起來。

— Parag Agrawal
14:46

難的不是抓網頁,是壓成 1000 個 token

Parag 不把 Parallel 叫 neo lab,因為輸出不是模型,而是模型的補充層。核心問題把一萬億網頁濃縮成正確的 1000 個 token,需要在檢索、排序、記憶層級上做大量研究,最後壓成很小的 ranking model。每個模型能力進步都會解鎖更多 Parallel 可服務的場景,而不是讓 Parallel 白做。

— Parag Agrawal
26:06

模型公司的預訓練爬蟲成不了實時索引

模型公司可以直接擁有搜索,也可以買。Parag 不認為預訓練爬蟲天然等於實時索引:模型公司會跳過慢速 JavaScript 頁面,因為 token 收益不划算,而 Parallel 是 completionist,願意補齊這些邊角。今天 Parallel 與 Google Cloud 合作,成為 Gemini/GCP 企業 Agent 的 search 與 grounding 供應商之一,企業可在 Google search 和 Parallel search 之間選擇。

— Parag Agrawal
28:19

搜索量的乘數在開發者,不在聊天框

典型 search agent 即使幾秒內回答,也會做 5–20 次搜索;ChatGPT 每輪 prompt 在 medium 檔就會觸發 5–10 次搜索,調高後是幾百上千次。更快的乘數來自開發者:一個管理一萬家小企業信貸組合的客戶,把每月一次的人工風險評估改成每週自動跑,搜索量的乘數達到幾十萬到一百萬次。

— Parag Agrawal
34:49

Agent 沒有轉化率,廣告定價就失去地基

Google 大多數查詢是虧錢的,少數查詢把利潤拉回來,靠的是對有限人類注意力的差別定價。Agent 代替人類上網後,這個前提開始崩塌:agent 沒有轉化率統計,內容方還按「人類訪問」設商業模式,會想方設法不讓 agent 抓取。若 AI 推理量兩年各漲 7 倍,而固定價格授權合同不漲,現有內容生意會在續約時受損。

— Parag Agrawal
42:55

內容值多少錢,拿掉它再跑一遍就知道

要決定一個內容源值多少錢,可以把它從語料裡拿掉,跑 agent 看輸出質量掉多少;如果多花一分錢算力就能補回質量,這個源的價值就接近一分錢。Shapley 值是把這種直覺形式化的數學框架,但完整計算成本極高——為了分配 1 美元可能要燒好幾美元。Parallel 的做法是用數據和模型訓練出好的估計,而不是做窮舉模擬。

— Parag Agrawal
53:11

Web 的終局是你來叫我,不是我去查

Parag 的終局是三層遞進:第一層 agent 把 web 當工具調;第二層是多 agent 和 subagent 協作,處理長時間運行、高算力的任務;第三層是 web 從「我來查」變成「你來叫我」。未來很多工作是響應世界變化而觸發:衛星影像變了、客戶評論變了、另一個 agent 算完了,Parallel 的角色就是持續把算力分配給整個 web,替所有客戶盯住變化。

— Parag Agrawal

原話 · 已逐字校驗

human click data is a.Bug.An agent.Doing work with search should rely on agent feedback, not human feedback.

人類點擊數據是一個 bug。用搜索做事的 Agent,應該依賴 Agent 反饋,而不是人類反饋。

Parag Agrawal6:16

we announced today, actually, that we are working with Google Cloud

我們今天剛剛宣布,我們正在與 Google Cloud 合作。

Parag Agrawal26:06

It'll do somewhere between 5 to 20 searches, even if it answers within a few seconds

即使幾秒內就能回答,它也會做 5 到 20 次搜索。

Parag Agrawal28:19

Google search wouldn't be free without ads, Twitter wouldn't be free without ads.

沒有廣告,Google 搜索不會是免費的;沒有廣告,Twitter 也不會是免費的。

Parag Agrawal34:49

their deal size is not growing 50 x

他們的交易規模不會跟著增長 50 倍。

Parag Agrawal40:00

And Shaly values is a mathematical way of effectively answering this question

Shapley 值就是有效回答這個問題的數學方法。

Parag Agrawal42:55

We will do tomorrow work in response.To something that circles through either another agent's work.Or something changes in the world.

我們明天要做的工作,是對另一項 Agent 工作的響應,或對世界上某個變化的響應。

Parag Agrawal53:11

數字與實體

Parallel 對成本壓縮的目標保留大部分效果,成本降到十分之一14:46
典型 search agent 單次任務的搜索次數5–20 次28:19
Google 查詢的利潤結構(Parag 說法)大部分查詢虧錢,少數查詢賺回利潤35:49
AI 推理需求兩年增長(Parag 假設)每年 7 倍,合計約 50 倍40:00
為內容源計算完整 Shapley 值的成本數美元,遠超要分配的 1 美元42:55

術語

Shapley valueShapley 值
合作博弈中按邊際貢獻分配總價值的方法;在內容定價中用來估算某個內容源的增量價值。
grounding事實錨定
把模型輸出鏈接到外部可靠數據源,減少幻覺並補充實時信息。
fresh index新鮮索引
單獨索引新發布和變化快的網頁,避免與全量離線索引混在一起。
memory hierarchy記憶層級
按訪問速度與成本分層存儲索引,用有限算力在延遲預算內命中結果。

收聽指南

誰該聽

做 AI 搜索、Agent 基礎設施、數據授權與內容商業化的人;想理解搜索經濟如何被 Agent 改寫的創業者/投資人。

可跳過

前 12 分鐘的搜索基礎定義和產品起源可快進,重點在後半段廣告經濟學與 Shapley 定價。