世界太吵,来原声听播客

Latent Space

AI 能造出病毒了,防御方还停在序列比对

生成致病序列的模型和判别序列是否致病的模型本质上是同一批模型,所以做设计的团队最适合做防御——但防御侧现在远远落后,基线还停在序列比对。

生物安全基因组模型AI for Science军备竞赛DNA 合成

原视频在 YouTube 上放不出来,用音频听:

信息密度高,中后段关于生物防御四层结构、DNA 合成管道和「人不能打补丁」的讨论最值钱。

核心论点 · 点时间戳可跳到原声

0:00

做设计的团队最适合做防御

Eric 给 Radical Numerics 定的双使命不是公关姿态,而是一个技术判断:能生成致病序列的模型,和能判别序列是否致病的模型,本质上是同一批模型。所以做设计的团队天然最适合做防御,而不是把防御外包给另一拨人。他承认这里存在军备竞赛式的动态,且防守方一直远远落后,公司要做的是把防守方拉到同一水平线。

— Eric Nguyen
8:12

AI 从零造出第一个基因组

Evo 生成 CRISPR-Cas 系统的工作上了 Science 杂志,Eric 后来还做了 TED Talk。更关键的是去年科学家展示的:用生成式 DNA 模型从零生成第一个基因组。人类以往只能复制粘贴已知功能的片段,从未在基因组层面从零构建。Evo 生成的是一个有功能的噬菌体,也就是病毒。Eric 说这是科学界和公司的转折点——既能造出自然界不存在的完整生物体,也意味着相应的潜在危害。

— Eric Nguyen
12:16

Omni 的突破来自对齐,不是预训练

Evo 展示了预训练的潜力,但在人类遗传学上仍打不过专门的 DNA 模型,社区质疑为何要用大模型。Omni 的差别在于中训练与后训练:把任务以科学家真正想要的问答形式呈现,比如给定野生型和突变序列,帮我找因果变异。Eric 说这类形式不会从预训练里自然涌现。结果让他们意外——Omni 不只是像 Evo 那样在多个任务上有竞争力,而是开始在每个细分领域推进前沿,尤其是变异效应预测。

— Eric Nguyen
23:50

真正的疾病变异大多在非编码区

传统生物信息工具和统计方法主要盯着编码区,而编码区只占基因组约 1.5% 到 2%。Eric 说很多、甚至大多数疾病其实落在非编码的调控区,那里的变异更难判断是否致病。Omni 的强项恰在这里:能在非编码区、尤其是长程区域区分致病突变。这正是长期用不上传统工具的遗传学家想要的东西。

— Eric Nguyen
45:44

生物实验本身在做筛选

SOLEX 实验的机制值得记住:生成大量随机序列,做成 aptamer 开关,用 NGS 高通量读出——结合得越多,读数越多,fitness 越高;然后对胜出序列再突变、再迭代。这次实验并行探索了大约 10 的 11 次方量级的序列。关键在于「the biology of the experiment is actually doing the filtering」——湿实验负责筛选,模型负责在 in silico 里复现这个过程。这个范式可以推广到任何「渐进式精炼」的生物实验,只要你能捕捉中间状态。

— Eric Nguyen
58:15

斯坦福科学家说生成 DNA 是蠢主意

Eric 为 Evo 的「生成 DNA」这个想法在斯坦福跑了六个月,几乎每个他聊过的科学家都觉得这是个 stupid idea。反对理由很具体:人类自己都不懂 DNA 的规则,凭什么指望 AI 学会;你甚至没法判断生成得对不对,怎么给模型反馈;DNA 里重复序列太多、分布太噪、没有真正的规则、全是 junk。他承认自己就是 stubborn,觉得「it just feels right」,但当时说不出用例是什么。第一次训练 Evo 时完全不知道会不会 work。

— Eric Nguyen
1:12:48

生物防御的四个支柱

他们把 biodefense 拆成四层:detection and surveillance(从机场鼻拭子、污水系统等环境样本里检测病原序列)、attribution(判断来源是自然、境外还是某国实验室人为工程)、countermeasures(做抗病毒或抗菌剂)、deterrence(政府层面)。他们主攻前三层。核心批评是:现有生物防御社区主要靠 sequence matching——把序列比对到已知病原数据库。这挡不住两件事:数据库里没有的新东西,以及被故意混淆、在序列空间上不匹配但功能相同的设计。

— Eric Nguyen
1:25:15

人不能打补丁

主持人指出生物安全和网络安全的关键差异:网络安全里,足够强的模型原则上可以抓出每一个漏洞并打补丁,只要人们保持更新就安全;但基因组是固定的,「你不能给人类打补丁」(you can't patch a human),所以防御面更难。反过来也有两个缓冲:发动进攻的动机强度可能低得多,而且从打印出任意 DNA 到造出一个成功病毒、尤其是不会先杀死设计者本人的病毒,门槛其实相当大。

— 主持人

原话 · 已逐字校验

We felt it was important as a lab that a team that was both building the design capabilities is actually also best suited for building the defense capabilities because they're basically the same models.

我们认为,作为一个实验室,既在构建设计能力的团队,其实也最适合构建防御能力,因为它们本质上是同一批模型。

Eric Nguyen0:00

to build something from scratch and ground up had not been done before at the genome level

从零开始、从底层构建出某个东西,在基因组层面此前从未做到过。

Eric Nguyen8:12

it turns out many, if not most of the diseases, are in these non-coding regions

事实证明,很多、甚至大多数疾病,都位于这些非编码区域。

Eric Nguyen23:50

But the key is the biology of the experiment is actually doing the filtering, right?

但关键在于,实验里的生物学过程本身在做筛选,对吧?

Eric Nguyen45:44

And crazy enough, most, almost every scientist at Stanford I talked to thought it was a stupid idea.

疯狂的是,我在斯坦福聊过的几乎每一位科学家都觉得这是个蠢主意。

Eric Nguyen58:15

And I remember when the first result came back and it kind of gave us chills over like, oh, maybe there's something going on

我记得第一个结果回来的时候,我们有点起鸡皮疙瘩,心想,哦,也许这里面真有点东西。

Eric Nguyen1:00:25

And if you don't have a tool, then you can't do anything.

而如果你连一个工具都没有,那你就什么都做不了。

Eric Nguyen1:22:11

We have fixed genomes, right? So you can't patch a human.

我们的基因组是固定的,对吧?所以你没法给人类打补丁。

主持人1:25:15

数字与实体

HyenaDNA 支持的最大上下文长度一百万3:02
编码区占基因组比例约 1.5% 到 2%23:50
全球细菌感染年死亡人数约 200 万41:42
SOLEX 实验并行探索序列数约 10 的 11 次方45:44
Evo 噬菌体基因组长度约 6000 碱基对54:07
人类基因组长度约 30 亿碱基对57:11
生物防御现状基线基于序列的匹配、比对匹配1:22:11
防御侧相对位置far, far lagging(远远落后)1:24:13

术语

GLM (Genome Language Model)基因组语言模型
在 DNA 序列上训练的大语言模型,能读也能写 DNA。
HyenaDNAHyenaDNA
用卷积替代注意力、把上下文拉到百万级的 DNA 语言模型。
EvoEvo
Radical Numerics 的生成式基因组模型,曾从零生成有功能的噬菌体。
OmniOmni
Evo 的后续模型,靠中训练与后训练在变异效应预测上推进前沿。
biodefense生物防御
检测监测、溯源、对策、威慑四层构成的防御体系。
sequence matching序列匹配
把序列比对到已知病原数据库的现有防御基线,挡不住新设计。

收听指南

谁该听

做 AI for science、生物安全或基因组模型的创业者和投资人,以及关心 AI 前沿如何落到人类健康的研究者。

可跳过

1:30:31 结尾的听众寄语偏泛,可跳过。