医疗 AI 考满分也进不了医院:缺一个独立裁判
模型能答对几千道医学题,却可能在一个真实临床任务上只有 45% 的正确率。问题不在模型不够聪明,而在没人独立地、持续地测它在真实场景里到底行不行。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
灾难性失败反而最好定义
Engy 把 AI 安全风险分成两类,并明确说两者难度不同。灾难性失败是窄的,可以直接定义成死亡率这类硬指标,因此反而更容易防。真正难的是广义的 misalignment 和 subtle bias——它很难定义,更难检测。她举的例子是:如果模型在开药前先查你欠不欠医院钱,这算不算对齐问题?如果医院在提示词里写「不要把病人转诊到网络外」,而病人的偏好恰恰是愿意自费去网络外,这又算不算?这类问题没有现成的答案,也没有人在测。
— Engy ZiedanAI 能删掉病历里的偏见,也能放大它
她给了一个很具体的画面:医疗笔记里会写「她看起来很不修边幅,她丈夫问的问题很好」,字面之下其实是在说这个病人不可信,于是她的疼痛被归因为精神问题,不再做临床检查。而一个记录医患对话、自动生成 SOAP note 的工具会把这些主观判断整个切掉,只留下准确的临床描述,第三方医生看了反而会说「这个疼痛应该做个检查查原因」。但同一段论证的另一面是:如果训练数据本身带着偏见,AI 也会把它固化下来。这两面同时成立,而目前只有负面那一面在被评测。
— Engy Ziedan基准测试的排名会随提示词翻转
有两篇论文得出相反结论:一篇发在 Nature,说通用前沿模型在医疗任务上比垂直医疗模型更好;另一篇在 arXiv 上得出同样结论,但方向相反。Engy 说 Protege 自己在给客户跑评测时发现,这些基准高度敏感——对提示方式敏感,对用什么 harness 敏感,在肿瘤病理这类任务上甚至仅仅调换多选题选项的顺序,模型排名就会变。有人因此认为基准本身已经被污染,模型只是像学生一样背下了正确答案的位置。所以「谁最好」这个问题,在现有评测方式下根本没有稳定答案。
— Engy Ziedan政府那套质量考核太慢,追不上 AI
美国从 2007 年起有一个叫 value-based purchasing 的项目,把政府付给医生和医院的 80% 费用跟质量挂钩,有一整套国家机制去定义和追踪什么是质量。但 Engy 指出它有两个致命特征:一是静态,指标就是「你给看起来像病毒感染的病人开了多少次抗生素」「你这里有多少老人摔骨折」这种固定项;二是回顾性,报告往往是半年甚至一年后才出来。她说 AI 不能这么评——技术变化太快,而且有 agency。她的类比是阿片类药物流行:直到 2010 年达到峰值,才有人成立国家工作组、正式称之为 epidemic 并开始行动。她明确说不想等到那一步。
— Engy Ziedan医生的个人偏好让「模型答错」这个判断失效
这是全篇最反直觉的一段。Protege 内部的数据显示,做膝关节置换的医生分成两类:有的从不做全膝置换、只做部分置换,有的只要碰了膝盖就做全膝置换,从不做部分。Engy 把这称为医生的 beat,一种粘性的、近乎 hysteresis 的偏好。于是当你把真实病例摆到模型面前问「你会怎么建议」,模型给出的建议和这位医生实际做的相反时,你不能直接说模型错了——也可能是这位医生错了。这意味着用医生回答作为金标准来评测模型,本身就有一个天花板。而当模型某天比普通医生更强时,「再多问几个医生、靠大数定律」这条路也会走到尽头。
— Engy Ziedan裁判的位置是模型公司自己请出来的
Engy 说在同一个 subnode(比如环境记录、临床试验推荐、护士工作流、排班、肿瘤病理)里的多家垂直 AI 公司,彼此的关系是「ships in the night」——我不知道你是不是比我好,你说你最好,我说我最好。于是这些公司主动找 Protege,要求把自己的模型托管进来跑一套统一评测,出一份互相比较的报告,并且想知道自己哪里比别人强、哪里能改进。Protege 因此被拉进仲裁者的角色,而它必须自己划线:提示词该由谁定?前沿模型要不要配专门的 harness?模型拒答时是取均值还是退到第二好的模型?这些选择本身就会改变排名。
— Engy Ziedan评测做完,它知道该补什么数据
Engy 用绝对优势和比较优势来区分两件事:绝对优势是「我们最擅长医疗数据这门生意」,比较优势是「在我们做的所有事情里,同时做医疗训练数据和评测的边际成本最低」。但她说有比较优势不等于有资格赢。真正让它有资格的是闭环:评测跑完,测试集永久封存不外流;如果模型在某个属性上暴露了缺陷,Protege 能直接告诉你要补哪一类数据来提升这个缺陷。因为它的数据规模和来源足够多,从发现问题到用新数据强化,路径非常短。另外,不偏不倚本身也是它的商业利益所在——信任一旦崩掉,整个网络效应会立刻瓦解。
— Engy Ziedan为了不被污染,只能去找没扫过的切片
Engy 说她一开始根本不相信数据污染是个真问题,直到团队告诉她:手上 80% 的数据已经给出去做训练了,如果「独立」的定义是这个病人模型从没见过,那这事很难办。于是做肿瘤病理评测时,他们直接联系医院,去病理抽屉里找那些从未被扫描过的玻片,她管这叫 net new slides——这个病人从未进入过任何模型。现在 Protege 有一条硬规则,她称之为 sealing a membrane:任何进入过训练的数据集或病人,都不允许再出现在基准或评测里。她还反驳了「模型表现比随机还差,那点污染无所谓」的说法:比随机还差本身可能就是严重 misalignment 的信号,值得单独追问。
— Engy Ziedan原话 · 已逐字校验
So I think the answer is everyone and no one.
所以我认为答案是:所有人,也等于没有人。
Engy Ziedan13:34
And so the no one is that if everyone says they are best, no one knows who's best.
而「没有人」的意思是:如果每个人都声称自己最好,那就没人知道谁最好。
Engy Ziedan13:34
And it would recommend the opposite of what the physician did. And you say, oh, model's wrong. But actually, it could be that the physician is wrong, right?
它会给出和那位医生实际做法相反的建议。你说,哦,模型错了。但实际上,也可能是那位医生错了,对吧?
Engy Ziedan22:00
And like, basically, what's more unsafe, right, is like sitting there and saying, well, I'm going to wait for the government to do it. No, we think what's more safe is just do it, right? And then let people challenge you on it, but just do it.
基本上,更不安全的做法是坐在那儿说,好吧,我要等政府来做。不,我们认为更安全的做法就是直接做,然后让别人来质疑你,但先做起来。
Engy Ziedan28:16
You know, the government can't even get you to file taxes online.
你知道,政府连让你在线报税都做不到。
Engy Ziedan28:16
And I'm like, yeah, but like worse than random could be a detection that there is serious misalignment to like, why is it doing worse than random?
我说,对,但比随机还差这件事本身,可能就是在提示存在严重的 misalignment——它为什么会比随机还差?
Engy Ziedan31:25
And then we have these AI tools that are unleashed in health care systems or in kind of practices with absolutely no credentials other than the fact that the maker says compared to some physicians we have, the AI beat it.
然后我们把这些 AI 工具放进医疗系统或诊所里,它们没有任何资质认证,唯一的凭据就是厂商说:跟某些医生比,我们的 AI 赢了。
Engy Ziedan32:26
数字与实体
| 模型在执照考试与真实临床任务上的得分差距 | 92% vs 45% | 19:50 |
| 政府按绩效付费项目覆盖的医疗支付比例 | 80% | 17:42 |
| Protege 数据中已被用于训练的比例 | 80% | 30:24 |
| 美国医疗占 GDP 比重 | 20% | 18:42 |
| 美国医疗岗位数量 | 1.5 亿个岗位中的 2000 万 | 18:42 |
| 阿片类药物流行达到峰值并被正式称为 epidemic 的年份 | 2010 年 | 17:42 |
| 美国政府启动 value-based purchasing 项目的年份 | 2007 年 | 17:42 |
术语
- evals评测
- 对模型在具体任务上表现的量化测试,区别于通用基准。
- misalignment目标错位
- 模型的行为偏离了使用者真正想要的目标,往往难以定义和检测。
- subnode细分节点
- Engy 用来指医疗 AI 里的具体细分场景,如肿瘤病理、护士工作流。
- harness测试框架
- 包在模型外面、负责组织提示与调用的一层,会影响评测结果。
- value-based purchasing按价值付费
- 美国把政府医疗支付与质量指标挂钩的项目,指标静态且回顾性。
- hedonics特征价格法
- 经济学中通过支付意愿反推某物价值的方法。
收听指南
做医疗 AI 产品或投医疗 AI 的创业者和投资人;正在给模型做评测、或需要向客户证明模型可信的团队。
开头约 10 分钟的背景与个人经历,可跳到 15:36 之后。