AI 真正缺的不是算力,是自我怀疑
大模型不是没有概率,它每一步都在预测概率,但它没有把「不确定」当作看清自己边界的工具;要做出真决策,先得把自我怀疑写进架构。
核心论点 · 点时间戳可跳到原声
智能的核心是决策,而不是死记知识
从细菌到人类再到机器人,智能最重要的部分是决策,而真实世界感知有限、未来不可预测,所以所有系统都得在不确定性下决策。嘉宾把不确定性分成两类:一类是行人下一步往哪走的固有随机性;另一类是从未见过的场景,比如训练数据里没有的冰雹中突然跳出马。真正智能的系统需要自我觉知,知道眼下的情况不寻常,从而像自动驾驶一样放慢车速。数学上各种不确定性都可以化成概率,再用概率论规则统一更新。
— Zoubin Ghahramani模型能 99% 自信地把校车认成猎豹
给一张校车图片改动几处人眼察觉不到的像素,人类看仍是校车,神经网络却以 99% 的置信度说那是猎豹,而且可以对任意类别做类似欺骗。这个经典对抗样本说明,正确率不是唯一指标,系统还必须不犯「过度自信的错误」。嘉宾指出,今天的系统依然能被这样骗过,意味着我们需要的不是单纯正确性,而是「正确且知道自己正确」。
— Zoubin Ghahramani大模型的不确定感是装出来的
你问一个大模型有多确定,它会给你一个答案,但那只是下一个 token 的预测,并不是对自身信念的概率计算。只要你说「我觉得你错了」,它就可能立刻道歉改口,不会站稳立场。嘉宾说模型从互联网数据和人类推理痕迹中模仿出「不确定」的样子,但真正的系统应该能够对任意陈述给出自己的置信度估计,而不是被训练成只顾模仿数据的混合体。
— Zoubin Ghahramani语义熵能从内部探出模型的底气
嘉宾学生提出的语义熵思路是:大模型在吐出每一个 token 前,内部都有一个对所有可能 token 的概率分布。分布尖而集中代表确定,散而平均代表没把握。比如问埃菲尔铁塔在哪,「巴黎」会形成一个大尖峰,而拉斯维加斯、纽约只占小概率尾巴。但嘉宾提醒,依赖语料共现抓出来的信心本质上仍是装模作样:你想要的不是见过很多例子的假计算器,而是真正会计算的计算器。
— Zoubin Ghahramani给天气预报加不确定性,反而更准
Google DeepMind 的天气模型 GenCast 通过扩散模型生成一组预报集合,而不是跑一次给出唯一答案。追踪飓风路径时,它会反复运行,得到可能轨迹的概率分布,几小时后把新观测再汇进去,做一次贝叶斯更新。嘉宾说关键点在于:加不确定性不是随意加噪声,而是诚实地承认传感器不精确、模型假设可能有错;正是这种诚实让预测校准得更好。
— Zoubin Ghahramani校准是检验「70% 概率下雨」的标准
如果模型告诉你下雨概率是 70%,那么在它给出 70% 的所有日子里,应当真的在 70% 的天数下雨,这叫校准。对「人类第一次登陆火星是哪一天」这种不会重复发生的事件,贝叶斯思想同样允许用概率表达你的信念,而不是退化成 50% 的二分。嘉宾说,医生依赖 AI 做生死决策时,模型必须用可见的方式传达不确定性,否则人类要么过度依赖、要么全盘怀疑。
— Zoubin Ghahramani每次从零重训模型,等于丢弃持续学习
行业做法是每隔几个月重新训练一个更大的模型,而人和动物是在持续的数据流里不断更新自身参数。现有神经网络容易灾难性遗忘,贝叶斯更新则在理论上天然支持持续学习:后验变成下一次更新的先验。嘉宾还列出另外两个瓶颈:能耗上人脑大约只有 20 瓦,而训练大模型差出好几个数量级;以及数据效率远低于人类学习。
— Zoubin Ghahramani贝叶斯的「魔法」代价是计算太慢
用贝叶斯做理想 AI 在教科书里很美,但精确计算往往是 NP-hard 级别的问题,所以业界一度放弃它、转向纯粹从数据训练。嘉宾说上世纪 80 年代人们也嫌神经网络太慢,如今他读书时用的超级并行计算机 Connection Machine 还没有他口袋里的 Pixel 手机快。算力进步加几十年的近似方法积累,让「旧想法」值得重新被拿出来试。
— Zoubin Ghahramani原话 · 已逐字校验
We don't want systems that can be overconfidently wrong.
我们不想要那种可能过度自信地犯错的系统。
Zoubin Ghahramani8:14
It's not going to stand its ground.
它不会站稳自己的立场。
Zoubin Ghahramani20:19
sometimes we want our models to hallucinate.
有时候我们恰恰希望模型产生幻觉。
Zoubin Ghahramani22:21
You want a calculator that actually calculates.
你要的是一台真正会计算的计算器,而不是假装会算的计算器。
Zoubin Ghahramani25:22
The curse here is that to do all of this is computationally very slow.
诅咒在于:要做到这一切,计算上非常慢。
Zoubin Ghahramani40:32
I would rather have an AI system that knows when it doesn't know than an AI system that is arrogant and overconfident.
在所有重要的问题上,我更想要一个知道自己不知道什么的 AI,而不是一个傲慢、过度自信的 AI。
Zoubin Ghahramani43:33
数字与实体
| Connection Machine 处理器数量 | 65,000 个 | 12:15 |
| 人脑功耗 | 约 20 瓦 | 38:31 |
术语
- Bayesian updating贝叶斯更新
- 用先验概率乘以观测似然,得到后验概率并作为下一次更新的先验。
- aleatoric uncertainty偶然不确定性
- 来自世界固有随机性的不确定性,例如抛硬币和行人转向。
- semantic entropy语义熵
- 对模型输出中语义层面的概率分布求熵,用来衡量回答的确定性。
- calibration校准
- 概率预测与长期实际频率一致,例如 70% 的下雨概率当真在 70% 的天数下雨。
- catastrophic forgetting灾难性遗忘
- 神经网络学习新数据后,会剧烈遗忘此前学到知识的现象。
收听指南
做 AI 产品的工程师、研究模型可信度的学者,以及负责采购或审查大模型能力的决策者。
开头的嘉宾个人史回忆(约 9:14–14:16)可跳读,不影响主线论证。