AlphaFold沒解決蛋白質摺疊:複製的是沉積的靜態結構
AlphaFold復刻的只是PDB里人類已解出、沉積的那一個蛋白質構象,它從未學到真實的動態分布、無序區和摺疊路徑,這離科學上的「解決」還很遠。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 時間戳為按文稿位置估算
規模定律不是現成的,要自己去找
Sal 糾正了一個常見誤解——規模定律(scaling law)不是放之四海而皆準的東西,大部分工作其實是去找出「往裡面加算力、加數據真的會變好」的那個情境。一旦找到,問題就變成工程問題,可以一直擰螺絲。他舉例:用質量很差、甚至很多條根本不是完整蛋白質的元基因組序列訓練蛋白質語言模型,反而能提升模型設計真實蛋白質的能力——這說明髒數據也能在正確的規模定律下發揮作用,但前提是先找對那條定律,而不是盲目堆數據。
— Sal Candido苦澀的教訓不是數據比建模更重要
Pushmeet 重新解釋了 Rich Sutton 的 bitter lesson——它說的不是數據比建模更重要,而是反對「我是建模的人」或「我是做數據的人」這種宗教式立場。真正的做法是先搞清楚要解決的問題,再決定該投入建模、算力還是數據收集。做 AlphaFold 時,團隊沒有資源把 PDB 數據庫規模級地擴充,所以把賭注壓在建模上;但在追求「虛擬細胞」時,團隊發現現有的細胞基因數據根本不夠支撐那個野心,於是承認數據還沒準備好。
— Pushmeet KohliAlphaFold的手工架構裡藏著生物學直覺
AlphaFold2 那些精心設計的特徵不是拍腦袋,而是把生物物理學的科學直覺直接寫進模型——氨基酸殘基不是各自獨立的,會相互影響,把這條先驗知識餵給模型,就給了它一個不公平的優勢,讓它不需要從零學起,數據利用效率因此大幅提高。Pushmeet 同時強調,策劃好數據本身就是一門手藝:簡單複製同樣的數據毫無意義,關鍵不是數據量大,而是數據覆蓋面是否足夠支撐進步。
— Pushmeet Kohli蛋白質根本不是積木,摺疊問題沒解決
媒體說蛋白質摺疊問題已經解決,但 Pushmeet 直言這是誤導。他常說蛋白質是生命的積木,但自己並不真的相信——蛋白質極其複雜,會無序,形狀會隨上下文改變。他和 John Jumper 曾討論過:AlphaFold 其實從未學到蛋白質真實的基態或構象分布,它做的只是復刻某個被解出並存入 PDB 數據庫的那一個結構。這恰好有用,但不代表人類理解了蛋白質動力學——對外宣傳「解決了」很容易,蛋白質結構預測和動力學研究才剛剛開始。
— Pushmeet Kohli想繞過PDB,直接用冷凍電鏡原始數據建模
如果能許一個願,Pushmeet 想要的是能直接在冷凍電鏡(cryo-EM)顯微圖像上運行、並提取出動態和分布信息的模型,而不是依賴已經被人工處理、存入 PDB 的靜態結構——他懷疑現在用的 PDB 結構在處理過程中已經丟失了大量原始信息。他自己試過,但承認這需要更多工作才能做成,也許需要比他更厲害的人來接手,才能真正打開這條路。
— Pushmeet Kohli該造的是整輛自行車,不是一根輻條
Sal 用一個比喻指出現在模型的侷限:現在的蛋白質模型就像有人想理解自行車怎麼運轉,卻只在建模一根輻條——模型會越做越好,但人們真正想理解的是輪子乃至整輛車怎麼運作,甚至想用這輛自行車的模型去設計一個皮卡零件。要做到這一點,需要把蛋白質放回它實際運作的生物系統語境裡建模,而不是孤立地研究單個蛋白質。他同時強調摺疊模型本身仍值得繼續投入,因為它們還會持續變好。
— Sal Candido可信比可解釋更重要,校準失敗才真危險
Pushmeet 認為「理解模型」該分兩層看。AlphaFold2 在當時那套數據上的 GDT 分數大約是90分,但他說即便分數做到95,如果置信度指標 pLDDT 完全沒校準好,沒人敢信——想像模型給出好答案卻宣稱自己很自信,結果你照著做了一年才發現全錯。校準不確定性這件事,他們確實做到了,也理解了 AlphaFold2 的行為邊界。但「內部怎麼算出答案」這種可解釋性是另一個問題——可解釋給誰看?人腦未必能懂,但也許未來更強大的模型可以反過來解釋 AlphaFold2 是怎麼工作的。
— Pushmeet Kohli治癒所有疾病,得從10倍而非10%去想
Sal 回憶在 Google 的經歷:面對一個問題,有時候問「怎麼做到10倍提升」反而比問「怎麼做到10%提升」更容易找到答案——不是因為10倍這條路更簡單,而是它逼著你跳出現有框架、回到第一性原理去想到底該怎麼做。10%和10倍兩種路徑都有價值,應該都做。但 Biohub 的使命是治癒所有疾病,這種目標註定了必須去找那個10倍的突破口,而不是滿足於漸進式改進。
— Sal Candido原話 · 已逐字校驗
One misconception of scaling laws is that scaling laws are everywhere and they always exist.
關於規模定律有個常見誤解,以為它無處不在、永遠成立。
Sal Candido1:00
A concrete example is training a protein language model on metagenomic sequences, which are not the highest-quality data.
一個具體例子是用元基因組序列訓練蛋白質語言模型,而這些數據質量並不算高。
Sal Candido2:32
Sometimes when we’re looking at problems, we think about solutions in a very religious way: “I’m a modeler,” or “I’m a data generation person.” I think that is the bitter lesson.
有時候我們看問題時,會用一種近乎宗教式的立場去想解法:「我是搞建模的」,或者「我是做數據的」。我認為這才是那個苦澀的教訓。
Pushmeet Kohli4:54
Proteins aren’t blocks, and they don’t act as blocks. I say proteins are the building blocks all the time, but I don’t actually believe it.
蛋白質根本不是積木,它們的表現也不像積木。我老說蛋白質是生命的積木,但其實我自己並不真的相信這句話。
Pushmeet Kohli15:28
So when you ask me that question, the computer vision researcher in me gets very excited about cryo-EM micrographs.
所以你問我這個問題時,我內心那個做計算機視覺出身的人,一聽到冷凍電鏡顯微圖像就很興奮。
Pushmeet Kohli17:54
I think of the models we’re building now as someone who’s trying to understand how a bicycle works, but is modeling a spoke on it.
我覺得我們現在做的這些模型,就像一個人想弄懂自行車怎麼運轉,結果卻只在給一根輻條建模。
Sal Candido19:09
But even if it had a GDT score of 95, if its pLDDT score were completely uncalibrated, who would trust it?
但就算它的GDT分數做到95分,如果pLDDT置信度完全沒校準好,誰又會相信它呢?
Pushmeet Kohli23:53
sometimes it’s easier to approach a problem by asking what it would take to make a 10x improvement rather than a 10% improvement.
有時候,問「要做到10倍提升需要什麼」反而比問「要做到10%提升需要什麼」更容易找到解法。
Sal Candido29:47
數字與實體
| AlphaFold2 GDT分數 | 約90分 | 23:53 |
術語
- GDT scoreGDT分數
- 衡量預測結構與真實結構接近程度的標準評分(Global Distance Test)。
- pLDDTpLDDT置信度分數
- AlphaFold給每個殘基預測結果打出的自信程度指標。
- cryo-EM micrographs冷凍電鏡顯微圖像
- 解析蛋白質結構用的原始顯微成像數據,未經處理為結構模型。
- metagenomic data元基因組數據
- 直接從環境樣本測序得到的基因序列集合,未必對應完整已知蛋白質。
- bitter lesson苦澀的教訓
- Rich Sutton提出的論斷:依賴算力和數據規模的通用方法長期會勝過人工設計的專業知識。
- inductive bias歸納偏置
- 把先驗知識預先寫進模型結構,讓模型在數據較少時也能有效學習。
收聽指南
做蛋白質設計、藥物研發或AI for science的研究者,想弄清下一步該投建模還是投數據。
0:00開場寒暄可跳過,正文從1:00才真正開始。