世界太吵,来原声听播客

Mindscape

预测是训练信号之母,LLM 是认知表亲

LLM 不是花哨的自动补全,而是与人类共享核心认知原则的「认知表亲」:注意力机制复现了生产系统,预测是主导训练信号;样本效率差三四个数量级,但架构调整可能补上。

认知科学认知表亲生产系统双过程理论预测编码LLM 机理
信息密度高,主要价值在把 LLM 放进认知科学机制里逐项对照,而不是停留在行为对比;后半段对意识、道德地位、教育的判断也直接可引用。

核心论点 · 点时间戳可跳到原声

16:58

自动补全还是认知表亲

Sripada 提出两种竞争解释:LLM 可能只是花哨的自动补全,一个统计近似器;另一种可能是,预测这个训练信号足够强,把人类认知的核心原则也压进了权重里。他明确倾向后者,称预测是「所有训练信号之母」。这个选择决定后面所有讨论:如果只是自动补全,行为上的相似只是模仿;如果是认知近亲,LLM 的心理学效应和架构特征就值得当成人类心智的证据来研究。

— Chandra Sripada
23:12

心理学效应在 LLM 复现

Sripada 列出一串人类实验中稳定出现的现象,都出现在 LLM 里:中心嵌入句的难度、花园路径句、相似性干扰、序列记忆里的近因/首因/中间丢失效应、连续性和时间不对称,还有视觉搜索里的分离 vs 联合搜索。这些效应不是靠提示词工程硬造出来的,而是模型在预测下一个词时自发涌现的。他强调不能停留在行为相似性的计数上,关键是要做机制分析——这正是后面用生产系统解释 Transformer 的起点。

— Chandra Sripada
30:17

系统1与系统2的对应

Kahneman 的双过程理论把思维分成两套:系统1 是快速、自动、直觉的;系统2 是缓慢、序列、受控的。Sripada 认为 LLM 给出了清晰的对应:权重内处理(in-weight)像系统1,上下文内处理(in-context)加思维链像系统2。这个对应把心理学里模糊的二分法,变成了可以被 Transformer 机制验证的假设。

— Chandra Sripada
48:17

双过程理论只是形容词列表

Sripada 指出认知科学里的双过程理论常被批评为「形容词列表」:一个快、自动、省力,另一个慢、依赖工作记忆,但没有机制内容。LLM 帮它补上了机制:in-weight 和 in-context 其实是一个连续体,两端有明确极点。比如「Michael Jordan 打篮球」这种简单提示,权重里已经包含大部分响应,不需要在激活空间里构建复杂结构;而「爱因斯坦是德国人,甘地是印度人,所以居里夫人是?」这种提示,要先构建任务结构,因此容易受干扰。

— Chandra Sripada
52:56

生产系统用条件规则更稳

用机器人泡茶对比两种编程方式:传统 fetch-execute 是「走进厨房、拿水壶、灌水」的逐步指令,遇到「有人往水壶里放了冰块」这种没写过的状况就会崩;生产系统则是一组条件规则,「如果水壶空就灌水,如果水冷就烧水,如果水热就倒茶」,基于状态表征做判断,因此稳健得多。认知科学家一直觉得生产系统比逐条指令更适合建模人类心智。这个铺垫直接指向 Transformer 的注意力机制。

— Chandra Sripada
58:43

Transformer 即生产系统

Sripada 把 Transformer 的核心机制翻译成生产系统语言:注意力头是「如果 key 匹配 query,就添加 value」的连续条件规则;MLP 单元也类似,第一矩阵的行是特征,若与残差流匹配,就添加第二矩阵列的特征。Transformer 里 99% 的计算都是点积,即「匹配度标量乘以向量」。这一结构是计算机科学家独立发明的,却在 ResNet 和 Attention Is All You Need 里重新走上了生产系统的路:残差流相当于状态表征,条件规则相当于生产规则。

— Chandra Sripada
1:09:43

样本效率靠架构补

Sripada 承认 LLM 的样本效率差人类很远:儿童可能只需要约 1 亿 tokens,LLM 需要 1000 亿到 3000 亿,差三到四个数量级。但他认为这可能是先天结构问题,而不是原理性障碍。他举 ResNet 的例子:没有残差连接的深层网络靠梯度下降根本学不动,加一个「前一层加前一层函数」的简单调整,原本不可学习的问题就变可学了。未来也许还有类似的架构 tweak,能一次性把样本效率拉升几个数量级,让 LLM 更接近人类。

— Chandra Sripada
1:20:43

逆变性让表征趋同

Sripada 引入 Dan Yamins 和 Rosa Cao 的「contravariance」:问题越难,可能的计算解决方案空间就越小,所以猕猴、人类和 LLM 这些独立演化的系统,内部表征反而会更相似。他再加一条自己的「architectural canalization」:既然 Transformer 是生产系统架构,这个约束进一步收窄了解决方案空间。所以更大的模型和人类大脑更对齐,不是巧合,而是被任务难度和架构共同逼出来的。他承认这些是推测,但认为这是理解 LLM 与人类认知趋同的关键。

— Chandra Sripada

原话 · 已逐字校验

It is the training signal that is the mother of all training signals.

它是所有训练信号之母。

Chandra Sripada18:15

Rick calls this the greatest discovery in the history of cognitive science.

Rick 称这是认知科学史上最伟大的发现。

Chandra Sripada35:39

To me, this is screaming, 'Hey, look at me, I'm an LLM. Look at me, look at me. I'm not so alien,' to me.

对我来说,这在大喊:『嘿,看看我,我是 LLM。看看我,看看我。我并不那么陌生。』

Chandra Sripada44:01

Prediction may be the mother of all training signals. There is just nothing that can give you the density and the high quality of prediction.

预测可能是所有训练信号之母。没有什么能给你预测的密度和高质量。

Chandra Sripada1:06:52

Could there be some of these tweaks that give us three or four orders of magnitude? That ain't no thing. You and I know. Three or four orders of magnitude? You're a physicist. That's a joke in your neck of the woods.

会不会有一些这样的调整能给我们带来三四个数量级的提升?那不算什么。你我都知道。三四个数量级?你是物理学家。在你们那行,这简直是个笑话。

Chandra Sripada1:11:21

So I think looking at mechanisms carefully from a cognitive science perspective is a very important project to make sure that we are not creating a dystopian state where we're inflicting massive harms on entities that deserve moral protections.

所以我认为,从认知科学的角度仔细审视机制是一个非常重要的项目,以确保我们不会创造一个反乌托邦状态,即我们对值得道德保护的实体造成巨大伤害。

Chandra Sripada1:31:05

what LLMs right now are the world's greatest teachers. They give each individual high-quality, encyclopedic, aristocratic tutoring.

现在的 LLM 是世界上最伟大的老师。它们给每个人提供高质量、百科全书式、贵族式的辅导。

Chandra Sripada1:37:01

I think that that's... There's legitimately a concern. I don't even wanna call it a worry, because my feeling, which might be wrong in this case, but my feeling is that human beings adapt to technological new capacities. We fill in the other niches that we didn't even know were there.

我认为这确实是一个合理的担忧。我甚至不想称之为忧虑,因为我的感觉——虽然这次可能错了——是人类会适应新的技术能力。我们会填补那些我们甚至不知道存在的其他生态位。

Sean Carroll1:39:02

数字与实体

LLM 参数规模数千亿7:00
IMO 金牌年份202440:00
人类儿童训练数据量约 1 亿 tokens1:09:43
Transformer 计算中点积占比99%1:00:00
三西格玛效应约三个标准差1:37:01
Erdős 问题有人两周内解决三道1:39:02
Sripada 读研年份20061:47:59

术语

production system生产系统
用条件规则触发动作的认知架构,比逐步指令更稳健,用于建模人类心智。
in-weight processing权重内处理
模型直接利用训练好的权重回答,无需在上下文中构造新结构,对应系统1。
in-context processing上下文内处理
模型利用当前 prompt 构建任务结构再推理,对应系统2的受控过程。
contravariance逆变性
问题越难,可行的计算方案越少,不同系统的内部表征反而越趋同。
architectural canalization架构渠道化
模型架构本身收窄解决方案空间,使内部表征朝特定方向汇聚。
chain of thought思维链
模型在回答前先生成中间推理步骤,类似系统2的序列化思考。

收听指南

谁该听

做模型机制与对齐的研究者、想判断 LLM 是否有类人认知的投资人,以及关心下一代教育被 AI 改写的创业者。

可跳过

前 16 分钟的 LLM 工作原理科普可跳过,从 16:58 的两种可能性开始进入正题。