世界太吵,来原声听播客

Google DeepMind

AI 的下一步不是更大模型,而是学会承认不确定

DeepMind 研究员 Zubin 用 30 年研究证明:当前大模型「自信地胡诌」源于缺少显式概率表示;贝叶斯更新、预测集成和校准才是可靠 AI 与 AGI 的关键。

不确定性贝叶斯校准LLM持续学习AGI
这集把「不确定性」从哲学拉回数学:校准、语义熵、贝叶斯更新都有明确机制。适合想理解 LLM 胡说根源的人。

核心论点 · 点时间戳可跳到原声

1:10

决策必须处理不确定性

智能的核心是决策,而现实中的感知有限、未来不可预测,所以任何智能系统都必须能表示不确定性、更新不确定性,并据此行动。不确定性分两类:一类是世界固有的随机性,比如行人下一步往哪转;另一类是没见过的情况,比如自动驾驶车遇到冰雹中突然跳出来的马。数学上两类都可以归结为概率,用概率论规则统一操作。若系统能感知自己身处陌生情景,它就该减速——这是自我意识式的不确定性。

— Zoubin Ghahramani
8:15

正确率不等于置信度

对图片分类,我们既关心正确性也关心置信度。十多年前人们发现,把校车图片微调几个像素,人眼看还是校车,神经网络却以 99% 的置信度说它是猎豹。对抗样本说明系统可以「过度自信地错」。我们不想看到被轻易欺骗的系统。面对 LLM,你提问它会自信回答,一质疑就改口,这种过度自信让人无法信任。要让 AI 有对自己局限的感知,这正是 AGI 需要补上的。

— Zoubin Ghahramani
16:10

贝叶斯更新是理性学习

贝叶斯规则很简洁:观察证据前你有先验信念,用概率分布表示;看到证据后,把先验乘以似然再归一化,得到后验信念。这个后验又成为下一轮的先验,不断重复。侦探故事中的「原先怀疑他,新证据来了所以改变判断」,就是贝叶斯更新的一句话描述。学习也是这样:模型未知参数先验,数据依次进入,逐步更新参数。这为累积知识、避免无依据地来回摇摆提供了严格框架。更好的 AI 甚至应该比人类更理性,像计算器擅长乘法一样擅长处理概率。

— Zoubin Ghahramani
20:26

LLM 的不确定性是装的

现在的大语言模型不会显式表示自己对答案的置信度。你问它多确定,它只是做下一个 token 预测,并没有在算贝叶斯。它可能在万亿 token 上学到了模仿推理痕迹,所以看起来会「认错」——你一推就说「哦对不起我错了」,它不会坚持立场。这是因为训练范式没有优先考虑置信度:数据是人类各种信念的混合,学出来只是一锅汤。真正要造自动驾驶、机器人,系统必须能对真实世界做因果推理,并诚实评估自己的不确定性。

— Zoubin Ghahramani
27:05

GenCast 用概率集成预报天气

天气是贝叶斯式的成功案例。DeepMind 的 GenCast 预报 15 天天气,几分钟就能跑完,比超级计算机快得多。它用扩散模型操纵概率分布,并生成一组预报集合,而不是单一答案。追踪飓风时,你对未来的轨迹有整条概率分布,反复运行模型,几小时后新观测数据进来再更新集合——这就是贝叶斯更新。加入不确定性反而让预测更准:你诚实地承认传感器不准、模型假设可能错,才能得到校准良好的预报。不确定性不是噪声,是信息。

— Zoubin Ghahramani
31:38

校准:70% 说下雨就 70% 下

对可重复事件,不确定性要校准:我说下雨概率 70%,那么所有说过 70% 的日子里,实际下雨的比例应该正好是 70%,剩下 30% 不下。这是可靠概率的定义。对一次性事件,比如人类第一次登陆火星的日期,贝叶斯统计认为也可以用概率表达信念,它会在发生时自然解开。难点在于把不确定性传达给人类而不引起过度信任或忽略。比如医疗 AI 辅助诊断,系统说出的每个概率都直接影响治疗方案,可能是生死决策,所以必须让不确定性可见。

— Zoubin Ghahramani
38:28

未来需要持续学习和新架构

纯靠规模的第一条路已有巨大进展,但还不够。三个突破方向:持续学习——现在模型几个月重训一次,人类则持续从数据流中学习,贝叶斯更新在理论上不会灾难性遗忘,许多持续学习尝试正是它的近似;能效——人脑功耗约 20 瓦,而大模型训练耗电高出多个数量级;新架构——transformer 和扩散模型是两大主力,但可能有软件与硬件共设计的新架构,如稀疏神经网络。贝叶斯方法看来神奇,但代价是计算极慢,不过当年 80 年代大家也说神经网络太慢。也许该用今天的算力重新审视这些旧想法。

— Zoubin Ghahramani

原话 · 已逐字校验

What's missing is we're not really doing what I said, which is the careful representational probabilities

缺失的是,我们并没有真的在做我所说的「谨慎地表示概率」。

Zoubin Ghahramani14:51

You want a calculator that actually calculates.

你想要的是一台真正会算的计算器。

Zoubin Ghahramani24:53

what you're doing is you're being honest about the fact that, you know, your sensors are inaccurate

你所做的,是诚实地面对「你的传感器不精确」这个事实。

Zoubin Ghahramani29:25

if I'm calibrated, then on 70% of those days, it actually rained

如果我是校准过的,那么在我预报 70% 下雨的那些日子里,实际真的下雨的比例就是 70%。

Zoubin Ghahramani31:38

I would rather have an AI system that knows when it doesn't know, than an AI system that is arrogant

我宁愿要一个知道自己不知道的 AI,也不要一个傲慢的 AI。

Zoubin Ghahramani44:01

数字与实体

GenCast 预报时长15 天27:05
GenCast 单次预报耗时约 8 分钟27:05
校准下的降雨概率例子70%31:38
人脑功耗约 20 瓦38:28

术语

aleatoric uncertainty偶然不确定性
来自世界固有随机性的不确定性,例如掷硬币或行人随机转向。
semantic entropy语义熵
通过比较模型生成的不同语义等价回答的熵来估计置信度的方法。
posterior beliefs后验信念
贝叶斯更新后,结合先验与证据得到的更新概率分布。
calibration校准
预测概率与实际事件发生频率相一致的性质。

收听指南

谁该听

做 LLM 应用、AI 产品与决策系统的工程师和研究员;关注 AGI 技术路线争论的投资人。

可跳过

9:40–16:00 的 80 年代个人回顾与贝叶斯入门解释,若已熟悉可快进。