世界太吵,來原聲聽播客

NEJM AI Grand Rounds

AI 評估的混亂不是技術問題,是透明度問題

2019 年那篇系統綜述裡,只有不到 5% 的醫學影像 AI 論文達到了其他醫學領域早已確立的嚴謹標準,而表現最好的模型也只是與放射科醫生持平。

醫療 AI臨床驗證報告指南監管大模型

原視頻在 YouTube 上放不出來,用音頻聽:

這集信息密度中等,但前半段關於醫學 AI 證據標準如何從混亂走向規範的一手敘述,對做醫療 AI 產品的人有直接參考價值。

核心論點 · 點時間戳可跳到原聲

11:22

頂級期刊上的 AI 論文,不到 5% 經得起推敲

2019 年前後,每週都有新論文宣稱「AI 和放射科醫生一樣好」或「AI 在肺炎檢測上擊敗放射科醫生」,但這些結論互相矛盾。Xiao Liu 和合作者做了一件當時沒人做的事:把診斷測試評估領域已經用了很多年的嚴謹標準,套用到這些 AI 論文上,只保留做了外部驗證、做了同類比較、有有意義對照組的。結果論文數量被砍掉一大截——不到 5% 真正達到了其他醫學領域早已確立的標準。而在這一小撮裡,模型表現最好也只是與放射科醫生持平。這不是壞消息,是說明已發表文獻裡噪音太多。

— Xiao Liu
16:28

報告指南不教你怎麼做研究,只逼你說清楚做了什麼

CONSORT、SPIRIT、PRISMA、STARD、TRIPOD 這些報告指南本質是一份清單,規定論文裡必須報告哪些條目。它不告訴你研究方法該怎麼做——它不是方法學指南,是透明度指南。哪怕你方法好或壞,都要寫得透明清楚。它的作用是讓作者、期刊編輯、同行評審站在同一個信息平面上,沒有煙霧彈,不能躲在含糊的細節後面。Xiao Liu 還補了一個副作用:當作者知道自己必須報告某項內容時,會反過來倒逼方法學嚴謹度上升,雖然很難測量。

— Xiao Liu
18:33

指南靠 Delphi 投票產生,共識不出來的條目直接砍掉

CONSORT AI 和 SPIRIT AI 不是幾個人關起門寫出來的,而是走 Delphi 流程:先通過文獻綜述和專家意見提出一套候選條目,然後多輪多利益相關方投票,最後以一場線下討論收尾。線下那場討論往往最有價值,因為大家會互相學習。拿不到共識的條目會被排除,拿到共識的才保留。Xiao Liu 說,要做好這類共識項目,至少需要六個月;她試過壓縮到三個月的加急版,但參與者都是免費貢獻時間,要拿到高質量反饋和多輪參與,時間和觸達範圍都省不了。

— Xiao Liu
20:36

可解釋性該不該寫進報告指南,會上吵翻了

Andy Beam 回憶,Delphi 討論中有一個問題是:臨床試驗裡要不要加可解釋性要求,或者至少報告你做過的可解釋性評估。他和 Lauren Oakden-Rayner 當場站上小講臺說「不,根本不該做,原因如下」。這場爭論後來被 Lancet Digital Health 的編輯 Rupa 約稿寫成了論文,成了 Andy 被引最多的論文之一。Xiao Liu 在閃電問答裡也明確站「不」這一邊:她認為應該先問為什麼想要 AI 可解釋,往下追問到底,最終想要的只是有益效果。

— Andy Beam
26:43

做監管顧問卻從沒在產業裡待過,讓她覺得不真誠

Xiao Liu 當時一邊做學術 AI 研究一邊做臨床眼科,同時越來越多地給監管機構做諮詢。她開始覺得自己從沒站在被監管的那一邊,做諮詢有點不真誠。於是她加入 Apple 做健康科學家,主要工作是設計可穿戴設備算法的驗證研究,比如 Apple Watch 的傳感算法,其中高血壓通知功能今年發布。她說 Apple 有一套運轉良好的產品出貨機器,這正是她想要的體驗。待了一年多後她回 Birmingham 全職建實驗室,隨後又加入 Microsoft AI 新組建的醫學前沿 LLM 團隊。

— Xiao Liu
32:49

短期由計算機科學家決定方向,長期由臨床醫生把關

被問到醫學 AI 會更多由計算機科學家還是臨床醫生驅動,Xiao Liu 先反問「驅動」是什麼意思,確認是「改變」之後給出判斷:短期是計算機科學家和工程師,長期是臨床醫生。機制是——處理數據、選擇指標、選擇基準的人,在短期內決定了進展往哪個方向走;但如果終點是真正用在病人身上,臨床醫生會在更靠後的環節扮演守門人角色。

— Xiao Liu
33:50

五年內醫生工作不會大變,十年後應該變

Xiao Liu 認為五年內醫生的工作不會看起來有戲劇性變化,但十年及以後很可能會,而且她希望會。她設想的路徑是:如果醫學智能和模型繼續按現在的速度推進,醫療職業不必再是關於積累知識、甚至不必是醫學院教的那種醫學推理,重心會轉向做「經驗的陪伴者」——陪伴 deteriorating health、突發健康事件、日常 wellbeing 波動、改變人生的診斷、治療失敗和併發症,也許還有康復,也許沒有。她認為這段旅程里人們會持續需要一種深度人際的東西:能調用知識但不一定自己承載知識,而是把它翻譯成人的語言。

— Xiao Liu
40:00

最樂觀的是拆解舊醫學概念,最悲觀的是我們不敢拆

Xiao Liu 說自己樂觀多於悲觀。最讓她興奮的是把醫學世界裡所有知識聚合起來後,可能發現我們對生物標誌物、疾病表型聚類、現有醫學知識框架的理解有偏差。她舉了自己博士研究的眼科炎症性疾病為例:有一堆病被鬆散地叫作「white dot syndromes」,只因為它們在眼底產生白點,但很可能由完全不同的機制驅動。她希望新智能的一種出現方式,就是拆解醫學裡這些舊概念。悲觀的一面是:這個領域天生謹慎,可能因為不熟悉而抗拒這種拆解,在新技術變革期仍然僵化地沿用過去一二十年的評估方法和指南,錯失發現的機會。

— Xiao Liu

原話 · 已逐字校驗

Less than 5% of the papers actually really met that very standard bar in other areas of medicine.

不到 5% 的論文真正達到了其他醫學領域早已確立的那個標準線。

Xiao Liu13:23

we found that the performance of those models within that cohort was at best equivalent to radiologists.

我們發現,那一小撮模型的表現最好也只是與放射科醫生持平。

Xiao Liu14:23

What reporting guidelines don't do is tell you how you should do your study. So, they're not methodological guidelines, they're transparency guidelines.

報告指南不告訴你怎麼做研究。它們不是方法學指南,是透明度指南。

Xiao Liu16:28

it supplies enough information that brings the authors, the editors of a journal, and the peer reviewers on a level playing field.

它提供足夠的信息,讓作者、期刊編輯和同行評審站在同一個平面上。

Xiao Liu17:30

I think we should ask why we want AI or anything to be explainable, and I think if we drill down far enough, ultimately, we just want stuff to have beneficial effect.

我認為我們應該問,為什麼想要 AI 或任何東西可解釋;如果往下追問得足夠深,最終我們想要的只是它產生有益效果。

Xiao Liu30:48

the computer scientists and the people who are handling the data, choosing the metrics, choosing the benchmarks, get to decide in the short term which direction progress happens.

計算機科學家,以及那些處理數據、選擇指標、選擇基準的人,在短期內決定了進展往哪個方向走。

Xiao Liu32:49

there's something deeply interpersonal that we will continue to want as part of that journey, which someone that can leverage the knowledge but not necessarily embody it but translate it into human terms.

在那段旅程裡,我們會持續需要某種深度人際的東西:一個能調用知識、但不一定自己承載知識,而是把它翻譯成人的語言的人。

Xiao Liu34:53

數字與實體

達到其他醫學領域嚴謹標準的 AI 論文比例不到 5%13:23
CONSORT AI 與 SPIRIT AI 合計被引次數超過 4000 次(2024 年發表以來)18:33
做好共識項目所需最短時間至少 6 個月(加急版曾壓縮到 3 個月)22:39
Xiao Liu 在 Apple 的任職時長一年多26:43
Xiao Liu 在 Microsoft AI 的任職時長一年半27:44

術語

Delphi study德爾菲研究
多輪匿名投票加線下討論,用來在專家間就哪些條目重要達成共識。
CONSORTCONSORT 報告指南
隨機對照試驗論文必須報告哪些條目的國際清單,AI 版為 CONSORT AI。
SPIRITSPIRIT 報告指南
臨床試驗方案論文的報告清單,AI 版為 SPIRIT AI。
white dot syndromes白點綜合徵
一類眼底出現白點的炎症性眼病的鬆散統稱,可能由不同機制驅動。

收聽指南

誰該聽

做醫療 AI 產品、臨床驗證或監管申報的工程師和創業者,以及關心醫學 AI 證據標準如何建立的研究者。

可跳過

閃電問答裡的個人經歷部分(第一份工作、最喜歡的論文)可跳過。