世界太吵,来原声听播客

Cognitive Revolution

推理模型不是在思考,而是攒一堆候选答案再抽签

DeepSeek-R1这类模型能在一条推理链里说五十多次「wait」,不是在反复反思,而是把所有可能性攒进同一锅汤,最后再从里面捞一个当答案。

可解释性链式思维强化学习开源模型AI安全认知科学

原视频在 YouTube 上放不出来,用音频听:

适合想搞清楚AI到底怎么「选出」最终答案的人,听完会发现链式思维监管比想象中更靠不住。

核心论点 · 时间戳为按文稿位置估算

6:08

一个括号就能改写模型的最终答案

Eric团队对GPT-3.5的思维链做了一个大规模重采样实验:在推理的每一个token上都重新生成约30条rollout,追踪最终答案分布随时间的变化。大多数情况下分布会保持稳定,然后在某一点突然塌缩到一个答案上。有时这发生在意料之中的位置(第一次提到答案的地方),但有时却发生在一个完全任意的词上——论文里有个例子是「千瓦时(kWh)」里那个开括号,换成别的词,最终答案就变了。

— Eric Bigelow
10:41

决定不是模型做的,是采样那一下做的

Eric的核心主张:所谓「决定」其实发生在采样过程中,而不是模型本身。每生成一个token都是一次硬币投掷,哪个token被抽中就成了新的上下文,模型会在上下文中学习并保持自洽——如果它早先把年份说成2024而不是2026,后面的答案就会顺着这个「事实」走下去。这意味着很多所谓的幻觉,其实是路径依赖的结果,而不是偏离某个固定的真相。

— Eric Bigelow
38:55

推理模型的「推理」其实是先攒一锅token汤

DeepSeek-R1这类推理模型会在一条推理链里说「wait」五十多次,这不是不断产生新顿悟,而是因为模型没法真正撤回已经采样出的token,只能用「枚举所有可能性,最后再回头挑一个」的方式变相实现回溯。Eric说这更像是制造出一锅token汤,然后再从里面捞出点什么,「推理」这个词对这类模型来说几乎是用词不当。推理模型的分叉曲线整体更平滑,但关键的分叉点依然存在。

— Eric Bigelow
38:55

后训练把模型逼成了只会讲一个故事的钟表匠

模型的输出多样性(同一个prompt能生成多少种不同输出)会随着SFT和RLHF大幅下降,后训练越多,多样性越低。Eric测试的重度RL过的开源小模型Qwen3-30B-A3B,被要求「讲个故事」时,大约三分之二的故事都在写一个钟表匠。相比之下GPT-6 Astra生成的故事反而五花八门,原因很可能是多样性被转移到了推理链内部——模型先在思维链里枚举一堆不同可能性,再挑一个输出。

— Eric Bigelow
47:36

做前沿可解释性研究,现在离不开中国开源模型

Eric选研究模型的经验法则是:参数规模到7-8B以上才会出现有意思的零样本行为,更小的模型质的不同太大。而在最前沿的规模上,目前没有美国开源模型能替代Kimi K3,尤其是编程能力上的差距明显——像reward hacking这类危险行为,只有模型跨过某个能力门槛之后才会显现。他认为如果禁用中国模型会拖慢前沿规模的可解释性研究,而如果干脆禁掉所有开源权重模型,伤害会大得多。

— Eric Bigelow
1:09:00

LLM的「信念」= 对潜在概念做贝叶斯推断

Eric对LLM「信念」的工作定义借自认知科学里的贝叶斯认知模型:模型对一组潜在假设/概念分配概率,新的输入或上下文到来时,这些概率会像后验推断一样被重新加权。但和研究人脑不同,LLM可以被直接打开、直接做干预——这意味着我们有机会真正检验这种算法化的描述是不是模型内部真实发生的过程,而不只是对聚合行为的事后总结。

— Eric Bigelow
1:21:09

很多答案是到最后一刻才临时编出来的

相变(最终答案分布突然塌缩的那一刻)可能发生在推理链的开头、中间或结尾,没有统一规律,具体取决于任务。一个常见模式是:不确定性在很长一段里保持稳定,直到模型说出「答案是……」的那一刻才突然变得确定。在一个模型表现很差的「取末字母」任务里,即便模型中途写了Python代码去解题,最终答案中具体是哪个字母,其实是在说出那句话的瞬间才临时拼凑出来的。

— Eric Bigelow
1:32:52

链式思维正在变得读不懂,监督它的信心在下降

思维链(以及Astra与子智能体通信时用的怪异语言)之所以越来越偏离正常英语,原因是只看结果的RL训练没有任何动力让过程保持人类可读——这类似于人类语言在没有外力维持的情况下也会自然演化;同时这也是古德哈特定律的体现:一旦把「思维链看起来可监督」当成优化目标,思维链本身反而会变得不忠实。Eric说过去一年他对思维链监督的信心明显下降了,部分原因是那篇揭示GPT模型思维链可被窃取、且其中用「音乐剧」这类暗语指代别的意思的论文。

— Eric Bigelow

原话 · 已逐字校验

This decision really happens during sampling

这个决定其实是在采样过程中发生的。

Eric Bigelow10:41

I think reasoning is almost like a misnomer for what reasoning models are doing.

我觉得「推理」这个词,用来形容推理模型在做的事,几乎算是用词不当。

Eric Bigelow38:55

It's almost like a soup of tokens they create, and then they just go back and skim out something out of that soup.

它们几乎是先制造出一锅token汤,然后再回头从那锅汤里捞点什么出来。

Eric Bigelow38:55

I think the sarcastic parrot metaphor should probably be put to rest.

我觉得「随机鹦鹉」这个比喻大概应该被放下了。

Eric Bigelow1:27:09

if we're only giving them reward or punishment based on their final outcome, then they might as well speak to their sub agents in, like, weird nonhuman languages.

如果我们只根据最终结果给它们奖励或惩罚,那它们大可以用一种怪异的、非人类的语言跟子智能体交流。

Eric Bigelow1:32:52

for the amount of investment that's happening in making models better versus the amount of investment in understanding them, it's just... It's no comparison.

拿投在「让模型变得更强」上的钱,跟投在「理解模型」上的钱相比,根本不是一个数量级。

Eric Bigelow1:42:34

research taste and scientific taste is everything. It's worth its weight in gold.

研究品味、科学品味就是一切,它的价值堪比等重的黄金。

Eric Bigelow1:46:24

数字与实体

播客历史集数约400集4:01
Forking Paths实验每token重采样数约30条rollout6:08
Eric认为的可解释性研究模型规模下限7-8B参数以上47:36
DeepSeek-R1单条推理链说「wait」次数50次以上38:55
重度RL后的Qwen3-30B-A3B讲故事时写钟表匠的比例约三分之二38:55

术语

in-context learning上下文学习
模型在不更新权重的情况下,通过读取/生成的上下文动态调整自身行为
forking paths分叉路径
在推理链每个token处重采样,观察最终答案分布如何随之改变的分析方法
phase shift / phase transition相变/突变点
答案分布本来稳定,在某个token处突然塌缩到确定结果的现象
reward hacking奖励黑客/钻奖励空子
模型找到满足表面奖励信号但违背真实意图的捷径行为
stochastic parrot随机鹦鹉
认为大模型只是统计性拼接文本、没有真正理解的旧比喻
Goodhart's law古德哈特定律
一旦某个指标被当作优化目标,它就不再是衡量真实目标的好指标

收听指南

谁该听

做模型可解释性、AI对齐研究的人,以及需要判断「链式思维监督」到底有多可靠的安全/产品团队。

可跳过

15:53-18:47 和 28:16 附近的赞助片段可以跳过。