世界太吵,来原声听播客

NEJM AI Grand Rounds

AI 评估的混乱不是技术问题,是透明度问题

2019 年那篇系统综述里,只有不到 5% 的医学影像 AI 论文达到了其他医学领域早已确立的严谨标准,而表现最好的模型也只是与放射科医生持平。

医疗 AI临床验证报告指南监管大模型

原视频在 YouTube 上放不出来,用音频听:

这集信息密度中等,但前半段关于医学 AI 证据标准如何从混乱走向规范的一手叙述,对做医疗 AI 产品的人有直接参考价值。

核心论点 · 点时间戳可跳到原声

11:22

顶级期刊上的 AI 论文,不到 5% 经得起推敲

2019 年前后,每周都有新论文宣称「AI 和放射科医生一样好」或「AI 在肺炎检测上击败放射科医生」,但这些结论互相矛盾。Xiao Liu 和合作者做了一件当时没人做的事:把诊断测试评估领域已经用了很多年的严谨标准,套用到这些 AI 论文上,只保留做了外部验证、做了同类比较、有有意义对照组的。结果论文数量被砍掉一大截——不到 5% 真正达到了其他医学领域早已确立的标准。而在这一小撮里,模型表现最好也只是与放射科医生持平。这不是坏消息,是说明已发表文献里噪音太多。

— Xiao Liu
16:28

报告指南不教你怎么做研究,只逼你说清楚做了什么

CONSORT、SPIRIT、PRISMA、STARD、TRIPOD 这些报告指南本质是一份清单,规定论文里必须报告哪些条目。它不告诉你研究方法该怎么做——它不是方法学指南,是透明度指南。哪怕你方法好或坏,都要写得透明清楚。它的作用是让作者、期刊编辑、同行评审站在同一个信息平面上,没有烟雾弹,不能躲在含糊的细节后面。Xiao Liu 还补了一个副作用:当作者知道自己必须报告某项内容时,会反过来倒逼方法学严谨度上升,虽然很难测量。

— Xiao Liu
18:33

指南靠 Delphi 投票产生,共识不出来的条目直接砍掉

CONSORT AI 和 SPIRIT AI 不是几个人关起门写出来的,而是走 Delphi 流程:先通过文献综述和专家意见提出一套候选条目,然后多轮多利益相关方投票,最后以一场线下讨论收尾。线下那场讨论往往最有价值,因为大家会互相学习。拿不到共识的条目会被排除,拿到共识的才保留。Xiao Liu 说,要做好这类共识项目,至少需要六个月;她试过压缩到三个月的加急版,但参与者都是免费贡献时间,要拿到高质量反馈和多轮参与,时间和触达范围都省不了。

— Xiao Liu
20:36

可解释性该不该写进报告指南,会上吵翻了

Andy Beam 回忆,Delphi 讨论中有一个问题是:临床试验里要不要加可解释性要求,或者至少报告你做过的可解释性评估。他和 Lauren Oakden-Rayner 当场站上小讲台说「不,根本不该做,原因如下」。这场争论后来被 Lancet Digital Health 的编辑 Rupa 约稿写成了论文,成了 Andy 被引最多的论文之一。Xiao Liu 在闪电问答里也明确站「不」这一边:她认为应该先问为什么想要 AI 可解释,往下追问到底,最终想要的只是有益效果。

— Andy Beam
26:43

做监管顾问却从没在产业里待过,让她觉得不真诚

Xiao Liu 当时一边做学术 AI 研究一边做临床眼科,同时越来越多地给监管机构做咨询。她开始觉得自己从没站在被监管的那一边,做咨询有点不真诚。于是她加入 Apple 做健康科学家,主要工作是设计可穿戴设备算法的验证研究,比如 Apple Watch 的传感算法,其中高血压通知功能今年发布。她说 Apple 有一套运转良好的产品出货机器,这正是她想要的体验。待了一年多后她回 Birmingham 全职建实验室,随后又加入 Microsoft AI 新组建的医学前沿 LLM 团队。

— Xiao Liu
32:49

短期由计算机科学家决定方向,长期由临床医生把关

被问到医学 AI 会更多由计算机科学家还是临床医生驱动,Xiao Liu 先反问「驱动」是什么意思,确认是「改变」之后给出判断:短期是计算机科学家和工程师,长期是临床医生。机制是——处理数据、选择指标、选择基准的人,在短期内决定了进展往哪个方向走;但如果终点是真正用在病人身上,临床医生会在更靠后的环节扮演守门人角色。

— Xiao Liu
33:50

五年内医生工作不会大变,十年后应该变

Xiao Liu 认为五年内医生的工作不会看起来有戏剧性变化,但十年及以后很可能会,而且她希望会。她设想的路径是:如果医学智能和模型继续按现在的速度推进,医疗职业不必再是关于积累知识、甚至不必是医学院教的那种医学推理,重心会转向做「经验的陪伴者」——陪伴 deteriorating health、突发健康事件、日常 wellbeing 波动、改变人生的诊断、治疗失败和并发症,也许还有康复,也许没有。她认为这段旅程里人们会持续需要一种深度人际的东西:能调用知识但不一定自己承载知识,而是把它翻译成人的语言。

— Xiao Liu
40:00

最乐观的是拆解旧医学概念,最悲观的是我们不敢拆

Xiao Liu 说自己乐观多于悲观。最让她兴奋的是把医学世界里所有知识聚合起来后,可能发现我们对生物标志物、疾病表型聚类、现有医学知识框架的理解有偏差。她举了自己博士研究的眼科炎症性疾病为例:有一堆病被松散地叫作「white dot syndromes」,只因为它们在眼底产生白点,但很可能由完全不同的机制驱动。她希望新智能的一种出现方式,就是拆解医学里这些旧概念。悲观的一面是:这个领域天生谨慎,可能因为不熟悉而抗拒这种拆解,在新技术变革期仍然僵化地沿用过去一二十年的评估方法和指南,错失发现的机会。

— Xiao Liu

原话 · 已逐字校验

Less than 5% of the papers actually really met that very standard bar in other areas of medicine.

不到 5% 的论文真正达到了其他医学领域早已确立的那个标准线。

Xiao Liu13:23

we found that the performance of those models within that cohort was at best equivalent to radiologists.

我们发现,那一小撮模型的表现最好也只是与放射科医生持平。

Xiao Liu14:23

What reporting guidelines don't do is tell you how you should do your study. So, they're not methodological guidelines, they're transparency guidelines.

报告指南不告诉你怎么做研究。它们不是方法学指南,是透明度指南。

Xiao Liu16:28

it supplies enough information that brings the authors, the editors of a journal, and the peer reviewers on a level playing field.

它提供足够的信息,让作者、期刊编辑和同行评审站在同一个平面上。

Xiao Liu17:30

I think we should ask why we want AI or anything to be explainable, and I think if we drill down far enough, ultimately, we just want stuff to have beneficial effect.

我认为我们应该问,为什么想要 AI 或任何东西可解释;如果往下追问得足够深,最终我们想要的只是它产生有益效果。

Xiao Liu30:48

the computer scientists and the people who are handling the data, choosing the metrics, choosing the benchmarks, get to decide in the short term which direction progress happens.

计算机科学家,以及那些处理数据、选择指标、选择基准的人,在短期内决定了进展往哪个方向走。

Xiao Liu32:49

there's something deeply interpersonal that we will continue to want as part of that journey, which someone that can leverage the knowledge but not necessarily embody it but translate it into human terms.

在那段旅程里,我们会持续需要某种深度人际的东西:一个能调用知识、但不一定自己承载知识,而是把它翻译成人的语言的人。

Xiao Liu34:53

数字与实体

达到其他医学领域严谨标准的 AI 论文比例不到 5%13:23
CONSORT AI 与 SPIRIT AI 合计被引次数超过 4000 次(2024 年发表以来)18:33
做好共识项目所需最短时间至少 6 个月(加急版曾压缩到 3 个月)22:39
Xiao Liu 在 Apple 的任职时长一年多26:43
Xiao Liu 在 Microsoft AI 的任职时长一年半27:44

术语

Delphi study德尔菲研究
多轮匿名投票加线下讨论,用来在专家间就哪些条目重要达成共识。
CONSORTCONSORT 报告指南
随机对照试验论文必须报告哪些条目的国际清单,AI 版为 CONSORT AI。
SPIRITSPIRIT 报告指南
临床试验方案论文的报告清单,AI 版为 SPIRIT AI。
white dot syndromes白点综合征
一类眼底出现白点的炎症性眼病的松散统称,可能由不同机制驱动。

收听指南

谁该听

做医疗 AI 产品、临床验证或监管申报的工程师和创业者,以及关心医学 AI 证据标准如何建立的研究者。

可跳过

闪电问答里的个人经历部分(第一份工作、最喜欢的论文)可跳过。