人類點擊數據是 Bug:Agent 搜索要重做索引與定價
當搜索的客戶從人變成 Agent,點擊數據失效,索引、定價與商業模式都要重來;Parag 用質量/成本/延遲三角和 Shapley 給出新框架。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
不能把人用的搜索直接搬給 Agent
Parag 創辦 Parallel 的前提是:Agent 未來會用 Web 完成工作的次數是人類的一千倍以上。因此不能只把瀏覽器和搜索引擎的舊模式搬給 Agent,而要從索引、排序到商業模型重做一套面向 Agent 的搜索基礎設施。他認為很多以前的護城河正在失效。
— Parag Agrawal對手不是 Google,是人工整理網頁的人
Parallel 沒有第一天做全量索引,而是先發布 search agent 產品,用一到十分鐘的深度研究彌補索引覆蓋不足。選擇的對手是「僱人人工整理網頁數據」,而不是 Google 的索引規模。早期客戶用它做保險核保、索賠流程、銷售數據清洗和金融建模數據採集,逐步把索引建起來。
— Parag Agrawal難的不是抓網頁,是壓成 1000 個 token
Parag 不把 Parallel 叫 neo lab,因為輸出不是模型,而是模型的補充層。核心問題把一萬億網頁濃縮成正確的 1000 個 token,需要在檢索、排序、記憶層級上做大量研究,最後壓成很小的 ranking model。每個模型能力進步都會解鎖更多 Parallel 可服務的場景,而不是讓 Parallel 白做。
— Parag Agrawal模型公司的預訓練爬蟲成不了實時索引
模型公司可以直接擁有搜索,也可以買。Parag 不認為預訓練爬蟲天然等於實時索引:模型公司會跳過慢速 JavaScript 頁面,因為 token 收益不划算,而 Parallel 是 completionist,願意補齊這些邊角。今天 Parallel 與 Google Cloud 合作,成為 Gemini/GCP 企業 Agent 的 search 與 grounding 供應商之一,企業可在 Google search 和 Parallel search 之間選擇。
— Parag Agrawal搜索量的乘數在開發者,不在聊天框
典型 search agent 即使幾秒內回答,也會做 5–20 次搜索;ChatGPT 每輪 prompt 在 medium 檔就會觸發 5–10 次搜索,調高後是幾百上千次。更快的乘數來自開發者:一個管理一萬家小企業信貸組合的客戶,把每月一次的人工風險評估改成每週自動跑,搜索量的乘數達到幾十萬到一百萬次。
— Parag AgrawalAgent 沒有轉化率,廣告定價就失去地基
Google 大多數查詢是虧錢的,少數查詢把利潤拉回來,靠的是對有限人類注意力的差別定價。Agent 代替人類上網後,這個前提開始崩塌:agent 沒有轉化率統計,內容方還按「人類訪問」設商業模式,會想方設法不讓 agent 抓取。若 AI 推理量兩年各漲 7 倍,而固定價格授權合同不漲,現有內容生意會在續約時受損。
— Parag Agrawal內容值多少錢,拿掉它再跑一遍就知道
要決定一個內容源值多少錢,可以把它從語料裡拿掉,跑 agent 看輸出質量掉多少;如果多花一分錢算力就能補回質量,這個源的價值就接近一分錢。Shapley 值是把這種直覺形式化的數學框架,但完整計算成本極高——為了分配 1 美元可能要燒好幾美元。Parallel 的做法是用數據和模型訓練出好的估計,而不是做窮舉模擬。
— Parag AgrawalWeb 的終局是你來叫我,不是我去查
Parag 的終局是三層遞進:第一層 agent 把 web 當工具調;第二層是多 agent 和 subagent 協作,處理長時間運行、高算力的任務;第三層是 web 從「我來查」變成「你來叫我」。未來很多工作是響應世界變化而觸發:衛星影像變了、客戶評論變了、另一個 agent 算完了,Parallel 的角色就是持續把算力分配給整個 web,替所有客戶盯住變化。
— Parag Agrawal原話 · 已逐字校驗
human click data is a.Bug.An agent.Doing work with search should rely on agent feedback, not human feedback.
人類點擊數據是一個 bug。用搜索做事的 Agent,應該依賴 Agent 反饋,而不是人類反饋。
Parag Agrawal6:16
we announced today, actually, that we are working with Google Cloud
我們今天剛剛宣布,我們正在與 Google Cloud 合作。
Parag Agrawal26:06
It'll do somewhere between 5 to 20 searches, even if it answers within a few seconds
即使幾秒內就能回答,它也會做 5 到 20 次搜索。
Parag Agrawal28:19
Google search wouldn't be free without ads, Twitter wouldn't be free without ads.
沒有廣告,Google 搜索不會是免費的;沒有廣告,Twitter 也不會是免費的。
Parag Agrawal34:49
their deal size is not growing 50 x
他們的交易規模不會跟著增長 50 倍。
Parag Agrawal40:00
And Shaly values is a mathematical way of effectively answering this question
Shapley 值就是有效回答這個問題的數學方法。
Parag Agrawal42:55
We will do tomorrow work in response.To something that circles through either another agent's work.Or something changes in the world.
我們明天要做的工作,是對另一項 Agent 工作的響應,或對世界上某個變化的響應。
Parag Agrawal53:11
數字與實體
| Parallel 對成本壓縮的目標 | 保留大部分效果,成本降到十分之一 | 14:46 |
| 典型 search agent 單次任務的搜索次數 | 5–20 次 | 28:19 |
| Google 查詢的利潤結構(Parag 說法) | 大部分查詢虧錢,少數查詢賺回利潤 | 35:49 |
| AI 推理需求兩年增長(Parag 假設) | 每年 7 倍,合計約 50 倍 | 40:00 |
| 為內容源計算完整 Shapley 值的成本 | 數美元,遠超要分配的 1 美元 | 42:55 |
術語
- Shapley valueShapley 值
- 合作博弈中按邊際貢獻分配總價值的方法;在內容定價中用來估算某個內容源的增量價值。
- grounding事實錨定
- 把模型輸出鏈接到外部可靠數據源,減少幻覺並補充實時信息。
- fresh index新鮮索引
- 單獨索引新發布和變化快的網頁,避免與全量離線索引混在一起。
- memory hierarchy記憶層級
- 按訪問速度與成本分層存儲索引,用有限算力在延遲預算內命中結果。
收聽指南
做 AI 搜索、Agent 基礎設施、數據授權與內容商業化的人;想理解搜索經濟如何被 Agent 改寫的創業者/投資人。
前 12 分鐘的搜索基礎定義和產品起源可快進,重點在後半段廣告經濟學與 Shapley 定價。