世界太吵,来原声听播客

Latent Space

前沿模型太聪明,反而模拟不了真人

Joon Sung Park 的判断:把人当作可训练对象,需要的不是更强的推理模型,而是会犯和人一样错误的模型——前沿模型在小众人群行为预测上只有 20–30% 准确率,Simile 用两小时深访加 RCT 数据把它做到 85%。

模拟后训练行为数据合成样本scaling law市场研究
值得听。它给出了一条和 coding/reasoning 完全不同的后训练路线,以及一个已有付费客户、但 TAM 说不清的市场结构。

核心论点 · 点时间戳可跳到原声

5:59

先建人的模型,再做 agent

2022 年做 time machine 推演时,simulation 和「极度个性化的个人助理」是并列的前两名。Joon 选 simulation 不只是因为科幻情结,而是一个顺序判断:你让模型去买晚饭,它点了夏威夷披萨,而你不吃菠萝——这次失败无法靠更强的执行能力修复,只能靠对「我是谁」的深层理解。他的赌注是,对人的准确表征在因果上先于自动化 agent。他的 hot take 是,至今没有一个真正达到那条线野心的个人助理;ChatGPT、Claude 确实知道不少关于用户的事,生成也更贴合,但关键成分还没齐。

— Joon Sung Park
9:50

什么时候必须动参数

他给了一条判据:如果模型需要学习它所处世界的底层物理——新的 social physics——就必须训练或后训练;如果物理已经在模型里,只是要它对环境做出反应,prompt 就够。他认为公开模型还没有学到人类 social physics 的完整映射,原因在数据构成:web data 本质是人「自我暴露的态度数据」,行为数据只是零星散落其间。人在网上说自己做什么,和人在现实中真正做什么,之间那块空白他称为人类的 dark knowledge,必须重新采集并进入建模过程。OpenClaw 那套 Markdown 记忆和 2022 年 generative agents 的直觉一致,聪明但有天花板。

— Joon Sung Park
11:21

三桶数据,最贵的是因果

第一桶是深访:直接问「讲讲你的人生故事」,童年记忆、创伤、初恋,这类长尾信息给「人作为模型」提供质地,且以难以预测的方式起作用。第二桶是观察性行为数据:交易数据、可抓取的网络数据,提供行为的 base statistics,也是最容易拿到的。第三桶他认为最重要——描述因果机制、描述「为什么」的数据,主要来自 RCT:同一套设定,只动一个变量,看行为怎么变。这类数据既稀缺又关键,因为世界是 ground truth,但它只发生一次。Simile 自己跑大量 RCT,并把「决策有真实代价」作为区分态度与行为的分界线:实验里买的东西会真的寄到你家。

— Joon Sung Park
14:08

决策者要的不是预测,是路径

「你的销售额两个季度后会崩」对决策者毫无用处,他们只会说「那真糟」。他们要知道的是现在做什么能避开那个未来——这就是因果机制,也是 simulation 与 prediction 的分界。最高形态的 simulation 输入的不是问题,而是目标:像 Foundation 里那样,「把动乱压缩到一千年」,然后输出每一步。而那些步骤常常反直觉——第一步竟是把预警的科学家流放到 Terminus。落到商业上:一家车企想知道怎么营销 EV 才能推高股价,模拟可能给出「这样营销会改变消费者对你非 EV 车型的认知,反而拉低总销量」这种只盯 EV 销量绝对得不出的结论。

— Joon Sung Park
26:02

85% 这个数字怎么来的

《Generative Agent Simulations of 1000 People》的方法:招募 1000 名美国代表性抽样人群进虚拟实验室,两小时采集数据(深访脚本取自 American Voices Project,加上尽可能多的行为数据),送走两周,期间用这批数据造数字孪生;两周后把真人叫回来做一整套行为经济学博弈、Big Five、General Social Survey 以及 PNAS 上发表过的 RCT,让孪生预测本人会怎么做。结果是复现准确度达到「本人复现自己」的 85%。分母是人自身的重测一致性,而不是绝对正确率——这是这个数字唯一正确的读法。

— Joon Sung Park
28:24

目标函数和前沿实验室相反

前沿模型正在往「超理性、客观的机器」方向走:从 Mercor、Scale 拿数据,找职业程序员和科学家标注,做推理能力。Simile 的训练目标是反的——要造和他一样会犯错的模型,他犯什么错,模型就得犯什么错。这是完全不同的数据和训练目标,也解释了性能落差:前沿模型在客户真正关心的小众人群和话题上,行为预测准确率会掉到 20–30%,在 gen pop 上大约 50–60%,不足以据此决策。另一条后训练路线是从 Open Science Framework 抓预注册研究——数万个带假设、防 p-hacking 的高质量 RCT——用它们显著提升行为预测能力;这个模型是开放科学的一部分,不商业化。

— Joon Sung Park
37:30

为什么组合爆炸造不出人群

面对腾讯的 billion persona 论文(把职业、背景做笛卡尔积当 prompt),他先肯定规模,然后给出反驳的核心:那套做法重度依赖已经进入模型参数的统计量,你只是在检索模型里已有的知识。如果这条路成立,simulation 就已经被解决了——而市场上看到的不是这样。真实的人身上有大量细致且小众的知识,单看一条平平无奇,拼起来却极其丰富,这部分只能靠 bespoke 的数据采集。同一逻辑也决定了他们最想要的社交数据是 Facebook 而非 LinkedIn 或 Twitter:LinkedIn 上人有职业防备,Twitter 上人有人设,Facebook 更接近人的 base state。

— Joon Sung Park
40:04

模拟的 scaling law 与成本终局

他说 Simile 已经看到 simulation 里 scaling law 的早期迹象:吃进越多关于人的数据和算力,模拟人的性能就得到可预测的增益。但规模的意义要看清——今天他们每周采集数万人的数据,panel 合作覆盖全球数千万人,实际部署只用到数万至数十万人,因为客户要的不是更强的统计显著性,而是能筛出自己关心的子人群。而且同一个人可以复用到后续所有研究,因为模型是 domain-agnostic 的,学的是这个人的 social physics,像风险偏好这类特质本来就不随时间变。往前看,他判断未来若干年会出现造价等同于训练一个基础模型的模拟;如果一次模拟能解决气候变化,他今天就去融这笔钱。

— Joon Sung Park

原话 · 已逐字校验

I don’t think the models that are out in the open have yet learned the complete mapping of social physics of humanity. … it has yet to learn the really deep behavioral nature of people, not just what people say they do online, but what they do in real life.

我不认为公开可得的这些模型已经学到了人类 social physics 的完整映射。……它还没有学到人真正深层的行为本性——不是人在网上说自己做什么,而是他们在现实生活里做什么。

Joon Sung Park9:50

Simile doesn’t care about any of this. The models that we’re talking about here, what we’re trying to create are models that are as dumb as I am, right? So if I make some mistakes, the model has to make the same mistake.

这些 Simile 一概不关心。我们要造的模型,是和我一样笨的模型——我犯什么错,模型就得犯同样的错。

Joon Sung Park28:24

The thing that we’re seeing is the early glimpse of scaling law in simulations. The more data about humans and more compute you ingest, you start to get predictive and predictable gains of the model performance in simulating it, simulating people.

我们看到的是模拟领域 scaling law 的早期迹象:你吃进越多关于人的数据、越多算力,模型在模拟人这件事上的性能就开始出现可预测的增益。

Joon Sung Park40:04

I do think in the next some number of years, we will start creating simulations that will cost as much as training a foundation model. But perhaps it’s going to be so valuable to the society that it would be a no-brainer.

我确实认为未来若干年内,我们会开始做造价等同于训练一个基础模型的模拟。但它对社会的价值可能大到让这件事根本不需要犹豫。

Joon Sung Park48:35

So market research is a $100 billion industry. … But the thing about simulation is not a tool for market research. Simulation is a tool for human decision-making.

市场研究是一个 1000 亿美元的行业。……但 simulation 不是一个市场研究工具,simulation 是一个用于人类决策的工具。

Joon Sung Park55:01

数字与实体

generative agents(Smallville)论文 Google Scholar 引用数7,2001:46
数字孪生复现本人行为与态度的准确度(以本人复现自己为分母)85%26:02
1000 人研究的数据采集与回访设计每人 2 小时数据采集,2 周后回访做全套测验26:02
前沿模型在小众人群/客户关心话题上的行为预测准确度20–30%28:24
前沿模型在 gen pop 上的行为预测准确度50–60%28:24
Simile 每周新采集数据的人数规模 / panel 合作覆盖每周数万人;panel 覆盖全球数千万人45:31
市场研究行业规模1000 亿美元55:01
Simile 团队规模及联合创始人数约 60 人,4 位联合创始人1:05:16

术语

social physics社会物理
支配人群行为的底层规律;模型缺它就必须训练,有它就只需 prompt。
attitudinal vs. behavioral态度数据 vs 行为数据
分界在于决策是否有真实代价——买了会真寄到你家的才算行为。
concept testing概念测试
营销侧做法:把不同信息、产品或点子拿去测人群反应。
synthetic panel合成样本库
用模型生成、可反复提问的虚拟受访人群,替代真人样本库。
agent-based modeling基于主体的建模
Schelling 1970s 起的方法:给每个主体一条简单规则,看群体涌现。
Open Science Framework 预注册研究预注册平台
实验前公开假设、防止事后改假设,沉淀了数万个高质量 RCT。

收听指南

谁该听

做消费产品、增长和用户研究的人;投 AI 应用层、想找非 coding 后训练路线的投资人;关心多智能体模拟成本结构的工程师。

可跳过

58:27–1:03:03 绘画与人生哲学闲聊,无判断增量。