AlphaFold没解决蛋白质折叠:复制的是沉积的静态结构
AlphaFold复刻的只是PDB里人类已解出、沉积的那一个蛋白质构象,它从未学到真实的动态分布、无序区和折叠路径,这离科学上的「解决」还很远。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 时间戳为按文稿位置估算
规模定律不是现成的,要自己去找
Sal 纠正了一个常见误解——规模定律(scaling law)不是放之四海而皆准的东西,大部分工作其实是去找出「往里面加算力、加数据真的会变好」的那个情境。一旦找到,问题就变成工程问题,可以一直拧螺丝。他举例:用质量很差、甚至很多条根本不是完整蛋白质的元基因组序列训练蛋白质语言模型,反而能提升模型设计真实蛋白质的能力——这说明脏数据也能在正确的规模定律下发挥作用,但前提是先找对那条定律,而不是盲目堆数据。
— Sal Candido苦涩的教训不是数据比建模更重要
Pushmeet 重新解释了 Rich Sutton 的 bitter lesson——它说的不是数据比建模更重要,而是反对「我是建模的人」或「我是做数据的人」这种宗教式立场。真正的做法是先搞清楚要解决的问题,再决定该投入建模、算力还是数据收集。做 AlphaFold 时,团队没有资源把 PDB 数据库规模级地扩充,所以把赌注压在建模上;但在追求「虚拟细胞」时,团队发现现有的细胞基因数据根本不够支撑那个野心,于是承认数据还没准备好。
— Pushmeet KohliAlphaFold的手工架构里藏着生物学直觉
AlphaFold2 那些精心设计的特征不是拍脑袋,而是把生物物理学的科学直觉直接写进模型——氨基酸残基不是各自独立的,会相互影响,把这条先验知识喂给模型,就给了它一个不公平的优势,让它不需要从零学起,数据利用效率因此大幅提高。Pushmeet 同时强调,策划好数据本身就是一门手艺:简单复制同样的数据毫无意义,关键不是数据量大,而是数据覆盖面是否足够支撑进步。
— Pushmeet Kohli蛋白质根本不是积木,折叠问题没解决
媒体说蛋白质折叠问题已经解决,但 Pushmeet 直言这是误导。他常说蛋白质是生命的积木,但自己并不真的相信——蛋白质极其复杂,会无序,形状会随上下文改变。他和 John Jumper 曾讨论过:AlphaFold 其实从未学到蛋白质真实的基态或构象分布,它做的只是复刻某个被解出并存入 PDB 数据库的那一个结构。这恰好有用,但不代表人类理解了蛋白质动力学——对外宣传「解决了」很容易,蛋白质结构预测和动力学研究才刚刚开始。
— Pushmeet Kohli想绕过PDB,直接用冷冻电镜原始数据建模
如果能许一个愿,Pushmeet 想要的是能直接在冷冻电镜(cryo-EM)显微图像上运行、并提取出动态和分布信息的模型,而不是依赖已经被人工处理、存入 PDB 的静态结构——他怀疑现在用的 PDB 结构在处理过程中已经丢失了大量原始信息。他自己试过,但承认这需要更多工作才能做成,也许需要比他更厉害的人来接手,才能真正打开这条路。
— Pushmeet Kohli该造的是整辆自行车,不是一根辐条
Sal 用一个比喻指出现在模型的局限:现在的蛋白质模型就像有人想理解自行车怎么运转,却只在建模一根辐条——模型会越做越好,但人们真正想理解的是轮子乃至整辆车怎么运作,甚至想用这辆自行车的模型去设计一个皮卡零件。要做到这一点,需要把蛋白质放回它实际运作的生物系统语境里建模,而不是孤立地研究单个蛋白质。他同时强调折叠模型本身仍值得继续投入,因为它们还会持续变好。
— Sal Candido可信比可解释更重要,校准失败才真危险
Pushmeet 认为「理解模型」该分两层看。AlphaFold2 在当时那套数据上的 GDT 分数大约是90分,但他说即便分数做到95,如果置信度指标 pLDDT 完全没校准好,没人敢信——想象模型给出好答案却宣称自己很自信,结果你照着做了一年才发现全错。校准不确定性这件事,他们确实做到了,也理解了 AlphaFold2 的行为边界。但「内部怎么算出答案」这种可解释性是另一个问题——可解释给谁看?人脑未必能懂,但也许未来更强大的模型可以反过来解释 AlphaFold2 是怎么工作的。
— Pushmeet Kohli治愈所有疾病,得从10倍而非10%去想
Sal 回忆在 Google 的经历:面对一个问题,有时候问「怎么做到10倍提升」反而比问「怎么做到10%提升」更容易找到答案——不是因为10倍这条路更简单,而是它逼着你跳出现有框架、回到第一性原理去想到底该怎么做。10%和10倍两种路径都有价值,应该都做。但 Biohub 的使命是治愈所有疾病,这种目标注定了必须去找那个10倍的突破口,而不是满足于渐进式改进。
— Sal Candido原话 · 已逐字校验
One misconception of scaling laws is that scaling laws are everywhere and they always exist.
关于规模定律有个常见误解,以为它无处不在、永远成立。
Sal Candido1:00
A concrete example is training a protein language model on metagenomic sequences, which are not the highest-quality data.
一个具体例子是用元基因组序列训练蛋白质语言模型,而这些数据质量并不算高。
Sal Candido2:32
Sometimes when we’re looking at problems, we think about solutions in a very religious way: “I’m a modeler,” or “I’m a data generation person.” I think that is the bitter lesson.
有时候我们看问题时,会用一种近乎宗教式的立场去想解法:「我是搞建模的」,或者「我是做数据的」。我认为这才是那个苦涩的教训。
Pushmeet Kohli4:54
Proteins aren’t blocks, and they don’t act as blocks. I say proteins are the building blocks all the time, but I don’t actually believe it.
蛋白质根本不是积木,它们的表现也不像积木。我老说蛋白质是生命的积木,但其实我自己并不真的相信这句话。
Pushmeet Kohli15:28
So when you ask me that question, the computer vision researcher in me gets very excited about cryo-EM micrographs.
所以你问我这个问题时,我内心那个做计算机视觉出身的人,一听到冷冻电镜显微图像就很兴奋。
Pushmeet Kohli17:54
I think of the models we’re building now as someone who’s trying to understand how a bicycle works, but is modeling a spoke on it.
我觉得我们现在做的这些模型,就像一个人想弄懂自行车怎么运转,结果却只在给一根辐条建模。
Sal Candido19:09
But even if it had a GDT score of 95, if its pLDDT score were completely uncalibrated, who would trust it?
但就算它的GDT分数做到95分,如果pLDDT置信度完全没校准好,谁又会相信它呢?
Pushmeet Kohli23:53
sometimes it’s easier to approach a problem by asking what it would take to make a 10x improvement rather than a 10% improvement.
有时候,问「要做到10倍提升需要什么」反而比问「要做到10%提升需要什么」更容易找到解法。
Sal Candido29:47
数字与实体
| AlphaFold2 GDT分数 | 约90分 | 23:53 |
术语
- GDT scoreGDT分数
- 衡量预测结构与真实结构接近程度的标准评分(Global Distance Test)。
- pLDDTpLDDT置信度分数
- AlphaFold给每个残基预测结果打出的自信程度指标。
- cryo-EM micrographs冷冻电镜显微图像
- 解析蛋白质结构用的原始显微成像数据,未经处理为结构模型。
- metagenomic data元基因组数据
- 直接从环境样本测序得到的基因序列集合,未必对应完整已知蛋白质。
- bitter lesson苦涩的教训
- Rich Sutton提出的论断:依赖算力和数据规模的通用方法长期会胜过人工设计的专业知识。
- inductive bias归纳偏置
- 把先验知识预先写进模型结构,让模型在数据较少时也能有效学习。
收听指南
做蛋白质设计、药物研发或AI for science的研究者,想弄清下一步该投建模还是投数据。
0:00开场寒暄可跳过,正文从1:00才真正开始。