世界太吵,來原聲聽播客

Latent Space

模擬真人不是推理問題:前沿模型只有 20–30% 準確率

Joon Sung Park 的判斷:把人當作可訓練對象,需要的不是更強的推理模型,而是會犯和人一樣錯誤的模型——前沿模型在小眾人群行為預測上只有 20–30% 準確率,Simile 用兩小時深訪加 RCT 數據把它做到 85%。

模擬後訓練行為數據合成樣本scaling law市場研究

原視頻在 YouTube 上放不出來,用音頻聽:

值得聽。它給出了一條和 coding/reasoning 完全不同的後訓練路線,以及一個已有付費客戶、但 TAM 說不清的市場結構。

核心論點 · 點時間戳可跳到原聲

5:59

agent 做不好,是因為它不懂你是誰

2022 年做 time machine 推演時,simulation 和「極度個性化的個人助理」是並列的前兩名。Joon 選 simulation 不只是因為科幻情結,而是一個順序判斷:你讓模型去買晚飯,它點了夏威夷披薩,而你不吃菠蘿——這次失敗無法靠更強的執行能力修復,只能靠對「我是誰」的深層理解。他的賭注是,對人的準確表徵在因果上先於自動化 agent。他的 hot take 是,至今沒有一個真正達到那條線野心的個人助理;ChatGPT、Claude 確實知道不少關於用戶的事,生成也更貼合,但關鍵成分還沒齊。

— Joon Sung Park
9:50

公開模型沒學到人類的 social physics

他給了一條判據:如果模型需要學習它所處世界的底層物理——新的 social physics——就必須訓練或後訓練;如果物理已經在模型裡,只是要它對環境做出反應,prompt 就夠。他認為公開模型還沒有學到人類 social physics 的完整映射,原因在數據構成:web data 本質是人「自我暴露的態度數據」,行為數據只是零星散落其間。人在網上說自己做什麼,和人在現實中真正做什麼,之間那塊空白他稱為人類的 dark knowledge,必須重新採集並進入建模過程。OpenClaw 那套 Markdown 記憶和 2022 年 generative agents 的直覺一致,聰明但有天花板。

— Joon Sung Park
11:21

描述為什麼的數據最稀缺,也最值錢

第一桶是深訪:直接問「講講你的人生故事」,童年記憶、創傷、初戀,這類長尾信息給「人作為模型」提供質地,且以難以預測的方式起作用。第二桶是觀察性行為數據:交易數據、可抓取的網絡數據,提供行為的 base statistics,也是最容易拿到的。第三桶他認為最重要——描述因果機制、描述「為什麼」的數據,主要來自 RCT:同一套設定,只動一個變量,看行為怎麼變。這類數據既稀缺又關鍵,因為世界是 ground truth,但它只發生一次。Simile 自己跑大量 RCT,並把「決策有真實代價」作為區分態度與行為的分界線:實驗裡買的東西會真的寄到你家。

— Joon Sung Park
14:08

告訴客戶兩季後會崩,等於什麼都沒說

「你的銷售額兩個季度後會崩」對決策者毫無用處,他們只會說「那真糟」。他們要知道的是現在做什麼能避開那個未來——這就是因果機制,也是 simulation 與 prediction 的分界。最高形態的 simulation 輸入的不是問題,而是目標:像 Foundation 裡那樣,「把動亂壓縮到一千年」,然後輸出每一步。而那些步驟常常反直覺——第一步竟是把預警的科學家流放到 Terminus。落到商業上:一家車企想知道怎麼營銷 EV 才能推高股價,模擬可能給出「這樣營銷會改變消費者對你非 EV 車型的認知,反而拉低總銷量」這種只盯 EV 銷量絕對得不出的結論。

— Joon Sung Park
26:02

85% 的分母是本人復現自己

《Generative Agent Simulations of 1000 People》的方法:招募 1000 名美國代表性抽樣人群進虛擬實驗室,兩小時採集數據(深訪腳本取自 American Voices Project,加上儘可能多的行為數據),送走兩週,期間用這批數據造數字孿生;兩週後把真人叫回來做一整套行為經濟學博弈、Big Five、General Social Survey 以及 PNAS 上發表過的 RCT,讓孿生預測本人會怎麼做。結果是復現準確度達到「本人復現自己」的 85%。分母是人自身的重測一致性,而不是絕對正確率——這是這個數字唯一正確的讀法。

— Joon Sung Park
28:24

前沿模型越理性,越模擬不出真人

前沿模型正在往「超理性、客觀的機器」方向走:從 Mercor、Scale 拿數據,找職業程序員和科學家標註,做推理能力。Simile 的訓練目標是反的——要造和他一樣會犯錯的模型,他犯什麼錯,模型就得犯什麼錯。這是完全不同的數據和訓練目標,也解釋了性能落差:前沿模型在客戶真正關心的小眾人群和話題上,行為預測準確率會掉到 20–30%,在 gen pop 上大約 50–60%,不足以據此決策。另一條後訓練路線是從 Open Science Framework 抓預註冊研究——數萬個帶假設、防 p-hacking 的高質量 RCT——用它們顯著提升行為預測能力;這個模型是開放科學的一部分,不商業化。

— Joon Sung Park
37:30

組合 prompt 只是在檢索模型已有的知識

面對騰訊的 billion persona 論文(把職業、背景做笛卡爾積當 prompt),他先肯定規模,然後給出反駁的核心:那套做法重度依賴已經進入模型參數的統計量,你只是在檢索模型裡已有的知識。如果這條路成立,simulation 就已經被解決了——而市場上看到的不是這樣。真實的人身上有大量細緻且小眾的知識,單看一條平平無奇,拼起來卻極其豐富,這部分只能靠 bespoke 的數據採集。同一邏輯也決定了他們最想要的社交數據是 Facebook 而非 LinkedIn 或 Twitter:LinkedIn 上人有職業防備,Twitter 上人有人設,Facebook 更接近人的 base state。

— Joon Sung Park
40:04

規模不是為了顯著性,是為了篩子人群

他說 Simile 已經看到 simulation 裡 scaling law 的早期跡象:吃進越多關於人的數據和算力,模擬人的性能就得到可預測的增益。但規模的意義要看清——今天他們每週採集數萬人的數據,panel 合作覆蓋全球數千萬人,實際部署只用到數萬至數十萬人,因為客戶要的不是更強的統計顯著性,而是能篩出自己關心的子人群。而且同一個人可以複用到後續所有研究,因為模型是 domain-agnostic 的,學的是這個人的 social physics,像風險偏好這類特質本來就不隨時間變。往前看,他判斷未來若干年會出現造價等同於訓練一個基礎模型的模擬;如果一次模擬能解決氣候變化,他今天就去融這筆錢。

— Joon Sung Park

原話 · 已逐字校驗

I don’t think the models that are out in the open have yet learned the complete mapping of social physics of humanity. … it has yet to learn the really deep behavioral nature of people, not just what people say they do online, but what they do in real life.

我不認為公開可得的這些模型已經學到了人類 social physics 的完整映射。……它還沒有學到人真正深層的行為本性——不是人在網上說自己做什麼,而是他們在現實生活裡做什麼。

Joon Sung Park9:50

Simile doesn’t care about any of this. The models that we’re talking about here, what we’re trying to create are models that are as dumb as I am, right? So if I make some mistakes, the model has to make the same mistake.

這些 Simile 一概不關心。我們要造的模型,是和我一樣笨的模型——我犯什麼錯,模型就得犯同樣的錯。

Joon Sung Park28:24

The thing that we’re seeing is the early glimpse of scaling law in simulations. The more data about humans and more compute you ingest, you start to get predictive and predictable gains of the model performance in simulating it, simulating people.

我們看到的是模擬領域 scaling law 的早期跡象:你吃進越多關於人的數據、越多算力,模型在模擬人這件事上的性能就開始出現可預測的增益。

Joon Sung Park40:04

I do think in the next some number of years, we will start creating simulations that will cost as much as training a foundation model. But perhaps it’s going to be so valuable to the society that it would be a no-brainer.

我確實認為未來若干年內,我們會開始做造價等同於訓練一個基礎模型的模擬。但它對社會的價值可能大到讓這件事根本不需要猶豫。

Joon Sung Park48:35

So market research is a $100 billion industry. … But the thing about simulation is not a tool for market research. Simulation is a tool for human decision-making.

市場研究是一個 1000 億美元的行業。……但 simulation 不是一個市場研究工具,simulation 是一個用於人類決策的工具。

Joon Sung Park55:01

數字與實體

generative agents(Smallville)論文 Google Scholar 引用數7,2001:46
數字孿生復現本人行為與態度的準確度(以本人復現自己為分母)85%26:02
1000 人研究的數據採集與回訪設計每人 2 小時數據採集,2 周後回訪做全套測驗26:02
前沿模型在小眾人群/客戶關心話題上的行為預測準確度20–30%28:24
前沿模型在 gen pop 上的行為預測準確度50–60%28:24
Simile 每週新採集數據的人數規模 / panel 合作覆蓋每週數萬人;panel 覆蓋全球數千萬人45:31
市場研究行業規模1000 億美元55:01
Simile 團隊規模及聯合創始人數約 60 人,4 位聯合創始人1:05:16

術語

social physics社會物理
支配人群行為的底層規律;模型缺它就必須訓練,有它就只需 prompt。
attitudinal vs. behavioral態度數據 vs 行為數據
分界在於決策是否有真實代價——買了會真寄到你家的才算行為。
concept testing概念測試
營銷側做法:把不同信息、產品或點子拿去測人群反應。
synthetic panel合成樣本庫
用模型生成、可反覆提問的虛擬受訪人群,替代真人樣本庫。
agent-based modeling基於主體的建模
Schelling 1970s 起的方法:給每個主體一條簡單規則,看群體湧現。
Open Science Framework 預註冊研究預註冊平臺
實驗前公開假設、防止事後改假設,沉澱了數萬個高質量 RCT。

收聽指南

誰該聽

做消費產品、增長和用戶研究的人;投 AI 應用層、想找非 coding 後訓練路線的投資人;關心多智能體模擬成本結構的工程師。

可跳過

58:27–1:03:03 繪畫與人生哲學閒聊,無判斷增量。