AI 真正缺的不是算力,是自我懷疑
大模型不是沒有概率,它每一步都在預測概率,但它沒有把「不確定」當作看清自己邊界的工具;要做出真決策,先得把自我懷疑寫進架構。
核心論點 · 點時間戳可跳到原聲
智能的核心是決策,而不是死記知識
從細菌到人類再到機器人,智能最重要的部分是決策,而真實世界感知有限、未來不可預測,所以所有系統都得在不確定性下決策。嘉賓把不確定性分成兩類:一類是行人下一步往哪走的固有隨機性;另一類是從未見過的場景,比如訓練數據裡沒有的冰雹中突然跳出馬。真正智能的系統需要自我覺知,知道眼下的情況不尋常,從而像自動駕駛一樣放慢車速。數學上各種不確定性都可以化成概率,再用概率論規則統一更新。
— Zoubin Ghahramani模型能 99% 自信地把校車認成獵豹
給一張校車圖片改動幾處人眼察覺不到的像素,人類看仍是校車,神經網絡卻以 99% 的置信度說那是獵豹,而且可以對任意類別做類似欺騙。這個經典對抗樣本說明,正確率不是唯一指標,系統還必須不犯「過度自信的錯誤」。嘉賓指出,今天的系統依然能被這樣騙過,意味著我們需要的不是單純正確性,而是「正確且知道自己正確」。
— Zoubin Ghahramani大模型的不確定感是裝出來的
你問一個大模型有多確定,它會給你一個答案,但那只是下一個 token 的預測,並不是對自身信念的概率計算。只要你說「我覺得你錯了」,它就可能立刻道歉改口,不會站穩立場。嘉賓說模型從互聯網數據和人類推理痕跡中模仿出「不確定」的樣子,但真正的系統應該能夠對任意陳述給出自己的置信度估計,而不是被訓練成只顧模仿數據的混合體。
— Zoubin Ghahramani語義熵能從內部探出模型的底氣
嘉賓學生提出的語義熵思路是:大模型在吐出每一個 token 前,內部都有一個對所有可能 token 的概率分布。分布尖而集中代表確定,散而平均代表沒把握。比如問埃菲爾鐵塔在哪,「巴黎」會形成一個大尖峰,而拉斯維加斯、紐約只佔小概率尾巴。但嘉賓提醒,依賴語料共現抓出來的信心本質上仍是裝模作樣:你想要的不是見過很多例子的假計算器,而是真正會計算的計算器。
— Zoubin Ghahramani給天氣預報加不確定性,反而更準
Google DeepMind 的天氣模型 GenCast 通過擴散模型生成一組預報集合,而不是跑一次給出唯一答案。追蹤颶風路徑時,它會反覆運行,得到可能軌跡的概率分布,幾小時後把新觀測再匯進去,做一次貝葉斯更新。嘉賓說關鍵點在於:加不確定性不是隨意加噪聲,而是誠實地承認傳感器不精確、模型假設可能有錯;正是這種誠實讓預測校準得更好。
— Zoubin Ghahramani校準是檢驗「70% 概率下雨」的標準
如果模型告訴你下雨概率是 70%,那麼在它給出 70% 的所有日子裡,應當真的在 70% 的天數下雨,這叫校準。對「人類第一次登陸火星是哪一天」這種不會重複發生的事件,貝葉斯思想同樣允許用概率表達你的信念,而不是退化成 50% 的二分。嘉賓說,醫生依賴 AI 做生死決策時,模型必須用可見的方式傳達不確定性,否則人類要麼過度依賴、要麼全盤懷疑。
— Zoubin Ghahramani每次從零重訓模型,等於丟棄持續學習
行業做法是每隔幾個月重新訓練一個更大的模型,而人和動物是在持續的數據流裡不斷更新自身參數。現有神經網絡容易災難性遺忘,貝葉斯更新則在理論上天然支持持續學習:後驗變成下一次更新的先驗。嘉賓還列出另外兩個瓶頸:能耗上人腦大約只有 20 瓦,而訓練大模型差出好幾個數量級;以及數據效率遠低於人類學習。
— Zoubin Ghahramani貝葉斯的「魔法」代價是計算太慢
用貝葉斯做理想 AI 在教科書裡很美,但精確計算往往是 NP-hard 級別的問題,所以業界一度放棄它、轉向純粹從數據訓練。嘉賓說上世紀 80 年代人們也嫌神經網絡太慢,如今他讀書時用的超級並行計算機 Connection Machine 還沒有他口袋裡的 Pixel 手機快。算力進步加幾十年的近似方法積累,讓「舊想法」值得重新被拿出來試。
— Zoubin Ghahramani原話 · 已逐字校驗
We don't want systems that can be overconfidently wrong.
我們不想要那種可能過度自信地犯錯的系統。
Zoubin Ghahramani8:14
It's not going to stand its ground.
它不會站穩自己的立場。
Zoubin Ghahramani20:19
sometimes we want our models to hallucinate.
有時候我們恰恰希望模型產生幻覺。
Zoubin Ghahramani22:21
You want a calculator that actually calculates.
你要的是一臺真正會計算的計算器,而不是假裝會算的計算器。
Zoubin Ghahramani25:22
The curse here is that to do all of this is computationally very slow.
詛咒在於:要做到這一切,計算上非常慢。
Zoubin Ghahramani40:32
I would rather have an AI system that knows when it doesn't know than an AI system that is arrogant and overconfident.
在所有重要的問題上,我更想要一個知道自己不知道什麼的 AI,而不是一個傲慢、過度自信的 AI。
Zoubin Ghahramani43:33
數字與實體
| Connection Machine 處理器數量 | 65,000 個 | 12:15 |
| 人腦功耗 | 約 20 瓦 | 38:31 |
術語
- Bayesian updating貝葉斯更新
- 用先驗概率乘以觀測似然,得到後驗概率並作為下一次更新的先驗。
- aleatoric uncertainty偶然不確定性
- 來自世界固有隨機性的不確定性,例如拋硬幣和行人轉向。
- semantic entropy語義熵
- 對模型輸出中語義層面的概率分布求熵,用來衡量回答的確定性。
- calibration校準
- 概率預測與長期實際頻率一致,例如 70% 的下雨概率當真在 70% 的天數下雨。
- catastrophic forgetting災難性遺忘
- 神經網絡學習新數據後,會劇烈遺忘此前學到知識的現象。
收聽指南
做 AI 產品的工程師、研究模型可信度的學者,以及負責採購或審查大模型能力的決策者。
開頭的嘉賓個人史回憶(約 9:14–14:16)可跳讀,不影響主線論證。