醫療 AI 考滿分也進不了醫院:缺一個獨立裁判
模型能答對幾千道醫學題,卻可能在一個真實臨床任務上只有 45% 的正確率。問題不在模型不夠聰明,而在沒人獨立地、持續地測它在真實場景裡到底行不行。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
災難性失敗反而最好定義
Engy 把 AI 安全風險分成兩類,並明確說兩者難度不同。災難性失敗是窄的,可以直接定義成死亡率這類硬指標,因此反而更容易防。真正難的是廣義的 misalignment 和 subtle bias——它很難定義,更難檢測。她舉的例子是:如果模型在開藥前先查你欠不欠醫院錢,這算不算對齊問題?如果醫院在提示詞裡寫「不要把病人轉診到網絡外」,而病人的偏好恰恰是願意自費去網絡外,這又算不算?這類問題沒有現成的答案,也沒有人在測。
— Engy ZiedanAI 能刪掉病歷裡的偏見,也能放大它
她給了一個很具體的畫面:醫療筆記裡會寫「她看起來很不修邊幅,她丈夫問的問題很好」,字面之下其實是在說這個病人不可信,於是她的疼痛被歸因為精神問題,不再做臨床檢查。而一個記錄醫患對話、自動生成 SOAP note 的工具會把這些主觀判斷整個切掉,只留下準確的臨床描述,第三方醫生看了反而會說「這個疼痛應該做個檢查查原因」。但同一段論證的另一面是:如果訓練數據本身帶著偏見,AI 也會把它固化下來。這兩面同時成立,而目前只有負面那一面在被評測。
— Engy Ziedan基準測試的排名會隨提示詞翻轉
有兩篇論文得出相反結論:一篇發在 Nature,說通用前沿模型在醫療任務上比垂直醫療模型更好;另一篇在 arXiv 上得出同樣結論,但方向相反。Engy 說 Protege 自己在給客戶跑評測時發現,這些基準高度敏感——對提示方式敏感,對用什麼 harness 敏感,在腫瘤病理這類任務上甚至僅僅調換多選題選項的順序,模型排名就會變。有人因此認為基準本身已經被汙染,模型只是像學生一樣背下了正確答案的位置。所以「誰最好」這個問題,在現有評測方式下根本沒有穩定答案。
— Engy Ziedan政府那套質量考核太慢,追不上 AI
美國從 2007 年起有一個叫 value-based purchasing 的項目,把政府付給醫生和醫院的 80% 費用跟質量掛鉤,有一整套國家機制去定義和追蹤什麼是質量。但 Engy 指出它有兩個致命特徵:一是靜態,指標就是「你給看起來像病毒感染的病人開了多少次抗生素」「你這裡有多少老人摔骨折」這種固定項;二是回顧性,報告往往是半年甚至一年後才出來。她說 AI 不能這麼評——技術變化太快,而且有 agency。她的類比是阿片類藥物流行:直到 2010 年達到峰值,才有人成立國家工作組、正式稱之為 epidemic 並開始行動。她明確說不想等到那一步。
— Engy Ziedan醫生的個人偏好讓「模型答錯」這個判斷失效
這是全篇最反直覺的一段。Protege 內部的數據顯示,做膝關節置換的醫生分成兩類:有的從不做全膝置換、只做部分置換,有的只要碰了膝蓋就做全膝置換,從不做部分。Engy 把這稱為醫生的 beat,一種粘性的、近乎 hysteresis 的偏好。於是當你把真實病例擺到模型面前問「你會怎麼建議」,模型給出的建議和這位醫生實際做的相反時,你不能直接說模型錯了——也可能是這位醫生錯了。這意味著用醫生回答作為金標準來評測模型,本身就有一個天花板。而當模型某天比普通醫生更強時,「再多問幾個醫生、靠大數定律」這條路也會走到盡頭。
— Engy Ziedan裁判的位置是模型公司自己請出來的
Engy 說在同一個 subnode(比如環境記錄、臨床試驗推薦、護士工作流、排班、腫瘤病理)裡的多家垂直 AI 公司,彼此的關係是「ships in the night」——我不知道你是不是比我好,你說你最好,我說我最好。於是這些公司主動找 Protege,要求把自己的模型託管進來跑一套統一評測,出一份互相比較的報告,並且想知道自己哪裡比別人強、哪裡能改進。Protege 因此被拉進仲裁者的角色,而它必須自己劃線:提示詞該由誰定?前沿模型要不要配專門的 harness?模型拒答時是取均值還是退到第二好的模型?這些選擇本身就會改變排名。
— Engy Ziedan評測做完,它知道該補什麼數據
Engy 用絕對優勢和比較優勢來區分兩件事:絕對優勢是「我們最擅長醫療數據這門生意」,比較優勢是「在我們做的所有事情裡,同時做醫療訓練數據和評測的邊際成本最低」。但她說有比較優勢不等於有資格贏。真正讓它有資格的是閉環:評測跑完,測試集永久封存不外流;如果模型在某個屬性上暴露了缺陷,Protege 能直接告訴你要補哪一類數據來提升這個缺陷。因為它的數據規模和來源足夠多,從發現問題到用新數據強化,路徑非常短。另外,不偏不倚本身也是它的商業利益所在——信任一旦崩掉,整個網絡效應會立刻瓦解。
— Engy Ziedan為了不被汙染,只能去找沒掃過的切片
Engy 說她一開始根本不相信數據汙染是個真問題,直到團隊告訴她:手上 80% 的數據已經給出去做訓練了,如果「獨立」的定義是這個病人模型從沒見過,那這事很難辦。於是做腫瘤病理評測時,他們直接聯繫醫院,去病理抽屜裡找那些從未被掃描過的玻片,她管這叫 net new slides——這個病人從未進入過任何模型。現在 Protege 有一條硬規則,她稱之為 sealing a membrane:任何進入過訓練的數據集或病人,都不允許再出現在基準或評測裡。她還反駁了「模型表現比隨機還差,那點汙染無所謂」的說法:比隨機還差本身可能就是嚴重 misalignment 的信號,值得單獨追問。
— Engy Ziedan原話 · 已逐字校驗
So I think the answer is everyone and no one.
所以我認為答案是:所有人,也等於沒有人。
Engy Ziedan13:34
And so the no one is that if everyone says they are best, no one knows who's best.
而「沒有人」的意思是:如果每個人都聲稱自己最好,那就沒人知道誰最好。
Engy Ziedan13:34
And it would recommend the opposite of what the physician did. And you say, oh, model's wrong. But actually, it could be that the physician is wrong, right?
它會給出和那位醫生實際做法相反的建議。你說,哦,模型錯了。但實際上,也可能是那位醫生錯了,對吧?
Engy Ziedan22:00
And like, basically, what's more unsafe, right, is like sitting there and saying, well, I'm going to wait for the government to do it. No, we think what's more safe is just do it, right? And then let people challenge you on it, but just do it.
基本上,更不安全的做法是坐在那兒說,好吧,我要等政府來做。不,我們認為更安全的做法就是直接做,然後讓別人來質疑你,但先做起來。
Engy Ziedan28:16
You know, the government can't even get you to file taxes online.
你知道,政府連讓你在線報稅都做不到。
Engy Ziedan28:16
And I'm like, yeah, but like worse than random could be a detection that there is serious misalignment to like, why is it doing worse than random?
我說,對,但比隨機還差這件事本身,可能就是在提示存在嚴重的 misalignment——它為什麼會比隨機還差?
Engy Ziedan31:25
And then we have these AI tools that are unleashed in health care systems or in kind of practices with absolutely no credentials other than the fact that the maker says compared to some physicians we have, the AI beat it.
然後我們把這些 AI 工具放進醫療系統或診所裡,它們沒有任何資質認證,唯一的憑據就是廠商說:跟某些醫生比,我們的 AI 贏了。
Engy Ziedan32:26
數字與實體
| 模型在執照考試與真實臨床任務上的得分差距 | 92% vs 45% | 19:50 |
| 政府按績效付費項目覆蓋的醫療支付比例 | 80% | 17:42 |
| Protege 數據中已被用於訓練的比例 | 80% | 30:24 |
| 美國醫療佔 GDP 比重 | 20% | 18:42 |
| 美國醫療崗位數量 | 1.5 億個崗位中的 2000 萬 | 18:42 |
| 阿片類藥物流行達到峰值並被正式稱為 epidemic 的年份 | 2010 年 | 17:42 |
| 美國政府啟動 value-based purchasing 項目的年份 | 2007 年 | 17:42 |
術語
- evals評測
- 對模型在具體任務上表現的量化測試,區別於通用基準。
- misalignment目標錯位
- 模型的行為偏離了使用者真正想要的目標,往往難以定義和檢測。
- subnode細分節點
- Engy 用來指醫療 AI 裡的具體細分場景,如腫瘤病理、護士工作流。
- harness測試框架
- 包在模型外面、負責組織提示與調用的一層,會影響評測結果。
- value-based purchasing按價值付費
- 美國把政府醫療支付與質量指標掛鉤的項目,指標靜態且回顧性。
- hedonics特徵價格法
- 經濟學中通過支付意願反推某物價值的方法。
收聽指南
做醫療 AI 產品或投醫療 AI 的創業者和投資人;正在給模型做評測、或需要向客戶證明模型可信的團隊。
開頭約 10 分鐘的背景與個人經歷,可跳到 15:36 之後。