AI 能造出病毒了,防禦方還停在序列比對
生成致病序列的模型和判別序列是否致病的模型本質上是同一批模型,所以做設計的團隊最適合做防禦——但防禦側現在遠遠落後,基線還停在序列比對。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
做設計的團隊最適合做防禦
Eric 給 Radical Numerics 定的雙使命不是公關姿態,而是一個技術判斷:能生成致病序列的模型,和能判別序列是否致病的模型,本質上是同一批模型。所以做設計的團隊天然最適合做防禦,而不是把防禦外包給另一撥人。他承認這裡存在軍備競賽式的動態,且防守方一直遠遠落後,公司要做的是把防守方拉到同一水平線。
— Eric NguyenAI 從零造出第一個基因組
Evo 生成 CRISPR-Cas 系統的工作上了 Science 雜誌,Eric 後來還做了 TED Talk。更關鍵的是去年科學家展示的:用生成式 DNA 模型從零生成第一個基因組。人類以往只能複製粘貼已知功能的片段,從未在基因組層面從零構建。Evo 生成的是一個有功能的噬菌體,也就是病毒。Eric 說這是科學界和公司的轉折點——既能造出自然界不存在的完整生物體,也意味著相應的潛在危害。
— Eric NguyenOmni 的突破來自對齊,不是預訓練
Evo 展示了預訓練的潛力,但在人類遺傳學上仍打不過專門的 DNA 模型,社區質疑為何要用大模型。Omni 的差別在於中訓練與後訓練:把任務以科學家真正想要的問答形式呈現,比如給定野生型和突變序列,幫我找因果變異。Eric 說這類形式不會從預訓練裡自然湧現。結果讓他們意外——Omni 不只是像 Evo 那樣在多個任務上有競爭力,而是開始在每個細分領域推進前沿,尤其是變異效應預測。
— Eric Nguyen真正的疾病變異大多在非編碼區
傳統生物信息工具和統計方法主要盯著編碼區,而編碼區只佔基因組約 1.5% 到 2%。Eric 說很多、甚至大多數疾病其實落在非編碼的調控區,那裡的變異更難判斷是否致病。Omni 的強項恰在這裡:能在非編碼區、尤其是長程區域區分致病突變。這正是長期用不上傳統工具的遺傳學家想要的東西。
— Eric Nguyen生物實驗本身在做篩選
SOLEX 實驗的機制值得記住:生成大量隨機序列,做成 aptamer 開關,用 NGS 高通量讀出——結合得越多,讀數越多,fitness 越高;然後對勝出序列再突變、再迭代。這次實驗並行探索了大約 10 的 11 次方量級的序列。關鍵在於「the biology of the experiment is actually doing the filtering」——溼實驗負責篩選,模型負責在 in silico 裡復現這個過程。這個範式可以推廣到任何「漸進式精煉」的生物實驗,只要你能捕捉中間狀態。
— Eric Nguyen斯坦福科學家說生成 DNA 是蠢主意
Eric 為 Evo 的「生成 DNA」這個想法在斯坦福跑了六個月,幾乎每個他聊過的科學家都覺得這是個 stupid idea。反對理由很具體:人類自己都不懂 DNA 的規則,憑什麼指望 AI 學會;你甚至沒法判斷生成得對不對,怎麼給模型反饋;DNA 裡重複序列太多、分布太噪、沒有真正的規則、全是 junk。他承認自己就是 stubborn,覺得「it just feels right」,但當時說不出用例是什麼。第一次訓練 Evo 時完全不知道會不會 work。
— Eric Nguyen生物防禦的四個支柱
他們把 biodefense 拆成四層:detection and surveillance(從機場鼻拭子、汙水系統等環境樣本里檢測病原序列)、attribution(判斷來源是自然、境外還是某國實驗室人為工程)、countermeasures(做抗病毒或抗菌劑)、deterrence(政府層面)。他們主攻前三層。核心批評是:現有生物防禦社區主要靠 sequence matching——把序列比對到已知病原數據庫。這擋不住兩件事:數據庫裡沒有的新東西,以及被故意混淆、在序列空間上不匹配但功能相同的設計。
— Eric Nguyen人不能打補丁
主持人指出生物安全和網絡安全的關鍵差異:網絡安全裡,足夠強的模型原則上可以抓出每一個漏洞並打補丁,只要人們保持更新就安全;但基因組是固定的,「你不能給人類打補丁」(you can't patch a human),所以防禦面更難。反過來也有兩個緩衝:發動進攻的動機強度可能低得多,而且從打印出任意 DNA 到造出一個成功病毒、尤其是不會先殺死設計者本人的病毒,門檻其實相當大。
— 主持人原話 · 已逐字校驗
We felt it was important as a lab that a team that was both building the design capabilities is actually also best suited for building the defense capabilities because they're basically the same models.
我們認為,作為一個實驗室,既在構建設計能力的團隊,其實也最適合構建防禦能力,因為它們本質上是同一批模型。
Eric Nguyen0:00
to build something from scratch and ground up had not been done before at the genome level
從零開始、從底層構建出某個東西,在基因組層面此前從未做到過。
Eric Nguyen8:12
it turns out many, if not most of the diseases, are in these non-coding regions
事實證明,很多、甚至大多數疾病,都位於這些非編碼區域。
Eric Nguyen23:50
But the key is the biology of the experiment is actually doing the filtering, right?
但關鍵在於,實驗裡的生物學過程本身在做篩選,對吧?
Eric Nguyen45:44
And crazy enough, most, almost every scientist at Stanford I talked to thought it was a stupid idea.
瘋狂的是,我在斯坦福聊過的幾乎每一位科學家都覺得這是個蠢主意。
Eric Nguyen58:15
And I remember when the first result came back and it kind of gave us chills over like, oh, maybe there's something going on
我記得第一個結果回來的時候,我們有點起雞皮疙瘩,心想,哦,也許這裡面真有點東西。
Eric Nguyen1:00:25
And if you don't have a tool, then you can't do anything.
而如果你連一個工具都沒有,那你就什麼都做不了。
Eric Nguyen1:22:11
We have fixed genomes, right? So you can't patch a human.
我們的基因組是固定的,對吧?所以你沒法給人類打補丁。
主持人1:25:15
數字與實體
| HyenaDNA 支持的最大上下文長度 | 一百萬 | 3:02 |
| 編碼區佔基因組比例 | 約 1.5% 到 2% | 23:50 |
| 全球細菌感染年死亡人數 | 約 200 萬 | 41:42 |
| SOLEX 實驗並行探索序列數 | 約 10 的 11 次方 | 45:44 |
| Evo 噬菌體基因組長度 | 約 6000 鹼基對 | 54:07 |
| 人類基因組長度 | 約 30 億鹼基對 | 57:11 |
| 生物防禦現狀基線 | 基於序列的匹配、比對匹配 | 1:22:11 |
| 防禦側相對位置 | far, far lagging(遠遠落後) | 1:24:13 |
術語
- GLM (Genome Language Model)基因組語言模型
- 在 DNA 序列上訓練的大語言模型,能讀也能寫 DNA。
- HyenaDNAHyenaDNA
- 用卷積替代注意力、把上下文拉到百萬級的 DNA 語言模型。
- EvoEvo
- Radical Numerics 的生成式基因組模型,曾從零生成有功能的噬菌體。
- OmniOmni
- Evo 的後續模型,靠中訓練與後訓練在變異效應預測上推進前沿。
- biodefense生物防禦
- 檢測監測、溯源、對策、威懾四層構成的防禦體系。
- sequence matching序列匹配
- 把序列比對到已知病原數據庫的現有防禦基線,擋不住新設計。
收聽指南
做 AI for science、生物安全或基因組模型的創業者和投資人,以及關心 AI 前沿如何落到人類健康的研究者。
1:30:31 結尾的聽眾寄語偏泛,可跳過。