AI 的下一步不是更大模型,而是学会承认不确定
DeepMind 研究员 Zubin 用 30 年研究证明:当前大模型「自信地胡诌」源于缺少显式概率表示;贝叶斯更新、预测集成和校准才是可靠 AI 与 AGI 的关键。
核心论点 · 点时间戳可跳到原声
决策必须处理不确定性
智能的核心是决策,而现实中的感知有限、未来不可预测,所以任何智能系统都必须能表示不确定性、更新不确定性,并据此行动。不确定性分两类:一类是世界固有的随机性,比如行人下一步往哪转;另一类是没见过的情况,比如自动驾驶车遇到冰雹中突然跳出来的马。数学上两类都可以归结为概率,用概率论规则统一操作。若系统能感知自己身处陌生情景,它就该减速——这是自我意识式的不确定性。
— Zoubin Ghahramani正确率不等于置信度
对图片分类,我们既关心正确性也关心置信度。十多年前人们发现,把校车图片微调几个像素,人眼看还是校车,神经网络却以 99% 的置信度说它是猎豹。对抗样本说明系统可以「过度自信地错」。我们不想看到被轻易欺骗的系统。面对 LLM,你提问它会自信回答,一质疑就改口,这种过度自信让人无法信任。要让 AI 有对自己局限的感知,这正是 AGI 需要补上的。
— Zoubin Ghahramani贝叶斯更新是理性学习
贝叶斯规则很简洁:观察证据前你有先验信念,用概率分布表示;看到证据后,把先验乘以似然再归一化,得到后验信念。这个后验又成为下一轮的先验,不断重复。侦探故事中的「原先怀疑他,新证据来了所以改变判断」,就是贝叶斯更新的一句话描述。学习也是这样:模型未知参数先验,数据依次进入,逐步更新参数。这为累积知识、避免无依据地来回摇摆提供了严格框架。更好的 AI 甚至应该比人类更理性,像计算器擅长乘法一样擅长处理概率。
— Zoubin GhahramaniLLM 的不确定性是装的
现在的大语言模型不会显式表示自己对答案的置信度。你问它多确定,它只是做下一个 token 预测,并没有在算贝叶斯。它可能在万亿 token 上学到了模仿推理痕迹,所以看起来会「认错」——你一推就说「哦对不起我错了」,它不会坚持立场。这是因为训练范式没有优先考虑置信度:数据是人类各种信念的混合,学出来只是一锅汤。真正要造自动驾驶、机器人,系统必须能对真实世界做因果推理,并诚实评估自己的不确定性。
— Zoubin GhahramaniGenCast 用概率集成预报天气
天气是贝叶斯式的成功案例。DeepMind 的 GenCast 预报 15 天天气,几分钟就能跑完,比超级计算机快得多。它用扩散模型操纵概率分布,并生成一组预报集合,而不是单一答案。追踪飓风时,你对未来的轨迹有整条概率分布,反复运行模型,几小时后新观测数据进来再更新集合——这就是贝叶斯更新。加入不确定性反而让预测更准:你诚实地承认传感器不准、模型假设可能错,才能得到校准良好的预报。不确定性不是噪声,是信息。
— Zoubin Ghahramani校准:70% 说下雨就 70% 下
对可重复事件,不确定性要校准:我说下雨概率 70%,那么所有说过 70% 的日子里,实际下雨的比例应该正好是 70%,剩下 30% 不下。这是可靠概率的定义。对一次性事件,比如人类第一次登陆火星的日期,贝叶斯统计认为也可以用概率表达信念,它会在发生时自然解开。难点在于把不确定性传达给人类而不引起过度信任或忽略。比如医疗 AI 辅助诊断,系统说出的每个概率都直接影响治疗方案,可能是生死决策,所以必须让不确定性可见。
— Zoubin Ghahramani未来需要持续学习和新架构
纯靠规模的第一条路已有巨大进展,但还不够。三个突破方向:持续学习——现在模型几个月重训一次,人类则持续从数据流中学习,贝叶斯更新在理论上不会灾难性遗忘,许多持续学习尝试正是它的近似;能效——人脑功耗约 20 瓦,而大模型训练耗电高出多个数量级;新架构——transformer 和扩散模型是两大主力,但可能有软件与硬件共设计的新架构,如稀疏神经网络。贝叶斯方法看来神奇,但代价是计算极慢,不过当年 80 年代大家也说神经网络太慢。也许该用今天的算力重新审视这些旧想法。
— Zoubin Ghahramani原话 · 已逐字校验
What's missing is we're not really doing what I said, which is the careful representational probabilities
缺失的是,我们并没有真的在做我所说的「谨慎地表示概率」。
Zoubin Ghahramani14:51
You want a calculator that actually calculates.
你想要的是一台真正会算的计算器。
Zoubin Ghahramani24:53
what you're doing is you're being honest about the fact that, you know, your sensors are inaccurate
你所做的,是诚实地面对「你的传感器不精确」这个事实。
Zoubin Ghahramani29:25
if I'm calibrated, then on 70% of those days, it actually rained
如果我是校准过的,那么在我预报 70% 下雨的那些日子里,实际真的下雨的比例就是 70%。
Zoubin Ghahramani31:38
I would rather have an AI system that knows when it doesn't know, than an AI system that is arrogant
我宁愿要一个知道自己不知道的 AI,也不要一个傲慢的 AI。
Zoubin Ghahramani44:01
数字与实体
| GenCast 预报时长 | 15 天 | 27:05 |
| GenCast 单次预报耗时 | 约 8 分钟 | 27:05 |
| 校准下的降雨概率例子 | 70% | 31:38 |
| 人脑功耗 | 约 20 瓦 | 38:28 |
术语
- aleatoric uncertainty偶然不确定性
- 来自世界固有随机性的不确定性,例如掷硬币或行人随机转向。
- semantic entropy语义熵
- 通过比较模型生成的不同语义等价回答的熵来估计置信度的方法。
- posterior beliefs后验信念
- 贝叶斯更新后,结合先验与证据得到的更新概率分布。
- calibration校准
- 预测概率与实际事件发生频率相一致的性质。
收听指南
做 LLM 应用、AI 产品与决策系统的工程师和研究员;关注 AGI 技术路线争论的投资人。
9:40–16:00 的 80 年代个人回顾与贝叶斯入门解释,若已熟悉可快进。