外观
AlphaFold 与 AI for Science
AlphaFold 是 DeepMind 开发的蛋白质结构预测系统:它用深度学习把"由氨基酸序列推断蛋白质三维结构"这个困扰生物学半个世纪的问题,从依赖昂贵实验的科学难题,变成了可在几分钟内自动完成的计算任务。2020 年 12 月,AlphaFold2 在蛋白质结构预测领域最权威的双盲竞赛 CASP14 中以约 92.4 的中位 GDT 分数大幅胜出,其成果于 2021 年 7 月以《Nature》封面论文形式刊发;2024 年 5 月,AlphaFold3 把预测范围从蛋白质单体扩展到蛋白质-配体、蛋白质-核酸等生物分子复合物。围绕 AlphaFold 建立的方法、开源代码、开放数据库与随之而来的诺奖级认可,共同定义了"AI for Science"这一研究范式最典型的样本。
为什么这件事如此重要?蛋白质是生命活动的执行者——酶催化反应、抗体识别病原、受体传递信号,而这一切功能都取决于蛋白质在三维空间折叠出的形状。结构决定功能,但结构测定长期是高成本、低通量的实验工作。AlphaFold 的价值不在于"预测准了一个蛋白",而在于把结构获取的边际成本压低了若干个数量级,并让"先预测、后验证"成为生物学可执行的工作流。今天,结构生物学家、药物研发团队、合成生物学家都在使用它——它已经从一个模型变成一个基础设施。
这篇文章沿着一条从"是什么"到"为什么"的线索展开:先回顾 CASP14 那个改写教科书的时刻,再讲清楚蛋白质折叠问题为什么难、AlphaFold 的技术路线如何拆解,然后把它放回 AI for Science 与生成式 AI 的大图景中,最后讨论它的影响与对科研范式的启示。如果对相关基础概念不熟,可以先读什么是 AI 热门概念建立全景,再回来。
一、CASP14:一次改写教科书式的胜利
CASP(Critical Assessment of protein Structure Prediction,蛋白质结构预测关键评估)是 1994 年创办的两年一届双盲竞赛:组委会把尚未公布结构的蛋白质序列发给参赛者,参赛者只能凭序列提交预测结构,最后由独立团队与实验测定结构比对打分。核心指标 GDT(Global Distance Test,全局距离测试)衡量预测结构与真实结构的接近程度,满分 100,越高越好。
- 2018 年 CASP13:DeepMind 的初代 AlphaFold 首次参赛即排名第一,但预测精度与实验测定仍有明显差距;
- 2020 年 12 月 CASP14:AlphaFold2 在所有目标上的中位 GDT 达到约 92.4,把"接近实验精度"从口号变成了成绩单;在公认最难的"自由建模"目标上同样大幅超越历史最佳水平,与其他参赛团队之间出现了断崖式的差距。
92.4 意味着什么
GDT 92.4 意味着平均每个残基的预测位置与实验结构几乎重合——在许多目标上,AlphaFold2 的预测与实验测定结构肉眼难以区分。结构生物学家打过一个比方:AlphaFold2 把"可能需要数月到数年、耗资数万美元的实验测定",压缩成了"GPU 上跑几十分钟的推理"。
《Nature》在 2021 年 7 月以封面论文刊发了 AlphaFold2(Jumper et al., 2021),同期评论把蛋白质折叠称为"生物学 50 年难题"。这个问题的源头可以追溯到 1972 年诺贝尔化学奖得主 Christian Anfinsen 的论断——"氨基酸序列决定三维结构";半个世纪里无数团队试图计算这条映射,AlphaFold 是第一个把精度推到接近实验水平的方法。回看这个节点,AlphaFold 不是一次孤立的算法胜利,而是深度学习在科学计算领域"从围观到主力"的标志性事件,也构成了演进简史里"AI 走向科研纵深"的注脚。
二、问题定义:蛋白质折叠为什么难
蛋白质是 20 种氨基酸连接成的长链。这条链在细胞里会自发折叠成特定三维构象——这个"序列→结构"的映射就是蛋白质折叠问题(protein folding problem)。它难在三点:
- 化学的复杂:蛋白质由数千个原子组成,势能面极其崎岖,理论上存在天文数字级别的可能构象(即著名的 Levinthal 悖论);
- 功能的载体:结构决定功能,酶的活性位点、抗体的结合面、膜蛋白的通道,都是三维结构的具体表现;
- 序列的多样性:自然界蛋白质序列海量,已测序序列与已测结构之间相差几个数量级——结构永远是瓶颈。
在 AlphaFold 之前,获取结构主要靠实验与模板建模,成本差异巨大:
| 方法 | 原理 | 成本 | 限制 |
|---|---|---|---|
| X 射线晶体学 | 让蛋白结晶,用 X 射线衍射重建电子密度 | 数月到数年;需要高质量晶体 | 很多蛋白无法结晶,通量极低 |
| 冷冻电镜(cryo-EM) | 冷冻样品后电镜成像、三维重构 | 设备昂贵、纯化要求高 | 对构象异质性敏感 |
| 核磁共振(NMR) | 测溶液中原子核磁信号 | 中等 | 只适合小蛋白 |
| 同源建模 | 借用同源蛋白的已知结构做模板 | 分钟级 | 没有同源模板时几乎失效 |
| AlphaFold | 深度学习直接学"序列→结构"映射 | GPU 上分钟级 | 动态构象、复杂复合物仍需实验 |
传统计算路线有两支:基于模板的同源建模(template-based modeling)和从头预测(ab initio)。前者在"有同源结构可用"时表现不错,但遇到全新折叠就无能为力;后者在数学上极其困难,长期以来只对小蛋白有效。AlphaFold 的创新在于:它不硬解物理方程,而是从海量已知结构与进化信息里"学习"折叠规律——这本质上是大语言模型式的数据驱动思路,只不过它的"语言"是蛋白质序列与结构。
三、技术拆解:从序列到结构
AlphaFold2 的输入是一条氨基酸序列,输出是每个原子的三维坐标。中间分三大步:构造多序列比对(MSA)→ Evoformer 双流编码 → 结构模块解码坐标。
1. 多序列比对(MSA):引入进化信息
蛋白质在演化中容忍大量突变,同源序列在不同物种间相似又不相同。把目标序列与数据库里的同源序列做多序列比对(Multiple Sequence Alignment, MSA),就得到一张"序列 × 残基位置"的矩阵。MSA 蕴含的进化共变异信息极其宝贵:两个残基在演化中总是协同突变(一个变了另一个必须跟着变),往往意味着它们在三维空间中直接接触。AlphaFold 把 MSA 作为核心输入特征——这等于把数亿年的进化实验"压缩"进了网络。
2. Evoformer:蛋白质版的注意力网络
Evoformer 是 AlphaFold2 的编码核心,可以理解为对Transformer 与注意力机制的领域化改造。它同时维护两条信息流:
- MSA 表示:处理"哪些残基对之间存在共进化关系";
- 残基对(pair)表示:维护"任意两个残基之间相对位置关系"的稠密矩阵。
Evoformer 的关键设计是三角更新(triangle update):每个残基对的信息只能通过"i-j 的边 + j-k 的边 影响 i-k 的边"这类三角约束路径更新。这个几何感应偏置让网络在训练数据相对有限时也能学到正确的结构约束,是 AlphaFold 相对通用 transformer 最重要的领域知识注入。Evoformer 在结构生物信息学中常被称作"蛋白质语言的 BERT",但它的任务不是生成,而是把 MSA 信息编码成用于坐标预测的表示。
3. 结构模块:把表示变成坐标
编码完成后,结构模块(structure module)把 pair 表示解码为骨架原子的三维坐标。它使用 SE(3) 等变的注意力层,保证网络输出对整体旋转、平移保持不变——这是物理定律天然要求的几何约束。训练损失使用 FAPE(Frame Aligned Point Error),按局部坐标系度量每个原子的误差,等价于把"全局位置误差"拆成"局部坐标误差",让网络先学对局部几何,再学全局拼接。最终网络还通过循环精化(recycling)把输出坐标再喂回网络迭代几轮,逐步修正。
几何约束为什么重要
AlphaFold 输出的必须是"合法"的三维坐标:键长、键角合理,原子不穿透。把 SE(3) 等变性和 FAPE 损失写进模型结构,等于把这些物理约束内建到网络里,而不是靠网络"碰运气"学出来——这是 AlphaFold 与许多"把问题当纯回归"的深度学习方法的根本区别。
4. 预测置信度:模型自己说"我多确定"
AlphaFold2 会随结构一起输出两类置信度分数:pLDDT(每个残基 0-100 的局部置信度,低于 50 通常表示该区域为无序区)和 PAE(predicted aligned error,残基对之间的预测对齐误差,用于判断两个结构域的相对位置是否可靠)。这两份输出让使用者不需要盲目相信结构:低置信度区域就是"留给实验验证的作业"。用置信度引导判断,本质上就是模型评估与验证里"不确定性量化"在科学计算中的应用——好的模型不止给出答案,还给出答案的可信区间。
python
# AlphaFold2 推理逻辑(概念示意,非真实 API)
msa = build_msa(sequence, sequence_db) # ① 同源检索 + 多序列比对
repr_msa, repr_pair = evoformer(msa, targets) # ② 双流注意力编码
coords, conf = structure_module(repr_pair) # ③ 等变解码 → 坐标 + 置信度
# conf.plddt 每残基置信度;conf.pae 成对误差矩阵四、AlphaFold 是"生成"吗?它和 LLM 什么关系
需要先做一个概念澄清:AlphaFold 做的是"结构预测",不是"生成"。它输入一条已知序列,输出该序列对应的三维结构——是判别式的"映射",而不是生成式模型那样"从分布里采样新样本"。AlphaFold 不能凭空设计新蛋白,也不会写蛋白质序列。这一区分对应概念边界里"判别 vs 生成"的分类。
但两者在技术血缘上高度同源:
- 都受益于深度学习、注意力机制与大规模数据;
- Evoformer 是 transformer 家族的领域化变体;
- 都在"端到端学表示、大规模预训练"的范式下获得泛化能力。
区别也很鲜明:LLM 的"语言"是离散 token,任务是建模序列分布;AlphaFold 的"语言"是蛋白质序列与结构,任务是回归三维坐标。用大语言模型的分类学来看,AlphaFold 更像一个"专用科学模型"而非通用语言模型——这也是为什么它没有变成"蛋白质版 GPT",而是一台结构解析机器。
AI for Science 的版图远比 AlphaFold 大,而且其中相当一部分是真正的生成式:
| 方向 | 代表工作 | 是否生成 | 链接 |
|---|---|---|---|
| 蛋白质结构预测 | AlphaFold2 / AlphaFold3 | 否(预测) | 本文 |
| 蛋白质设计 | RFdiffusion(Baker 实验室,2023) | 是(扩散模型) | 扩散模型 |
| 材料发现 | GNoME(DeepMind,2023) | 否(筛选+预测) | — |
| 天气预报 | GraphCast(DeepMind,2023) | 否(GNN 预测) | — |
| 生物分子复合物 | AlphaFold3(2024) | 否(预测) | 本文 |
- RFdiffusion:把扩散模型从图像搬到蛋白质,从噪声中"扩散"出全新蛋白质骨架,再配合序列设计器生成对应氨基酸序列——与图像生成里的"去噪采样"是同一套数学,是"生成式 AI for Science"的代表。
- GraphCast:用图神经网络做中期天气预报,10 天预报精度超越欧洲中期天气预报中心(ECMWF)的高分辨率业务系统,是 AI 科学计算在气象领域的标志性工作。
- GNoME:用图网络筛选晶体材料,预测出上百万个潜在稳定结构,把材料发现从"大海捞针"变成"定向搜索"。
五、影响:从数据库到诺贝尔奖
**AlphaFold 数据库(AlphaFold DB)**由欧洲生物信息学研究所(EBI)托管,截至 dataAsOf 已收录超过 2 亿个蛋白质结构,覆盖超过 100 万个物种。对大量没有实验结构的蛋白(尤其是微生物组、深海生物、病原体蛋白),这是人类第一次有了可检索的结构资产。这类开放数据基础设施也可以在数据集与工具档案与模型与榜单速查里继续探索。
DeepMind 于 2021 年开源 AlphaFold2 完整代码;随后的 AlphaFold3 提供在线服务与 API,但训练代码至今未完整开源——这引发了 AI for Science 领域关于"结果公开 vs 方法公开"的持续讨论,与AI 安全与治理里对前沿模型开源策略的争论同构。
2024 年诺贝尔化学奖授予了"计算蛋白质科学"方向,按诺贝尔奖官方口径:一半授予 David Baker(计算蛋白质设计),另一半联合授予 Demis Hassabis 与 John M. Jumper(因 AlphaFold 的蛋白质结构预测)。这是深度学习进入科学领域后获得的最高级别认可。
产业侧,DeepMind 于 2021 年成立 Isomorphic Labs,把 AlphaFold 用于药物研发;AlphaFold3 预测蛋白质-配体、蛋白质-核酸相互作用的扩展能力,也让"AI 辅助药物发现"从概念走向管线。但需要保持清醒:预测结构 ≠ 实验验证,AlphaFold 对动态构象、无序区以及某些复合物相互作用的精度仍有明确上限——这一点在任何严肃的科研应用中都不能省略。
关于 AlphaFold3 的边界
AlphaFold3 面向"生物分子复合物"大幅扩展了预测能力,但对许多蛋白质-配体亲和力的定量预测仍与实验有差距,业界普遍认为它"提高了结构预测的上限,而不是替代了实验"。引用其结论前,务必阅读其置信度输出与方法的适用范围。
六、启示:AI 如何改变科研范式
预测-实验-验证闭环。传统科研是"实验试错":做实验、看结果、调假设。AlphaFold 示范了新闭环——先由 AI 给出高置信度预测,再让实验聚焦验证与修正。结构生物学从此可以把精力放在"AI 拿不准的地方"(低 pLDDT 区域、动态构象),而不是从零测定每个蛋白。这个"预测-实验-验证"的循环正在扩散到材料、气象、药物、基因组学。
科学发现加速。当结构获取从"数月"变成"分钟",药物对接、酶工程、疫苗设计等下游任务的时间表被整体压缩。速度本身不是目的,但速度把"研究者能试多少次"放大了一两个数量级——科学发现本质是搜索,而 AI 把搜索空间变大了、把单次搜索成本压低了。
三要素缺一不可。AI for Science 的成功依赖高质量数据 × 领域知识 × 强大算力三者的结合。AlphaFold 的配方里,MSA 提供了领域知识,PDB(蛋白质数据库)提供了数十年积累的结构数据,GPU 提供了算力。对想入局的团队,这三点是比模型结构更值得先想清楚的事。
边界与批判。AlphaFold 验证了数据驱动科学计算的威力,但也提醒我们:模型的高置信度不等于物理正确;预测与实验之间需要新的工作流、新的评估协议。这与评估与基准中"指标与目标错位"的教训一脉相承。
从一个竞赛冠军,到 2 亿+ 结构的公共数据库,再到诺贝尔化学奖,AlphaFold 用几年时间走完了传统科研范式可能需要几十年的路径。它给"AI for Science"留下一句可复制的经验:当领域问题可以被干净地定义、数据可以被大规模地收集、映射可以被深度学习直接学习时,AI 可以成为科学发现的第一引擎,而不是辅助工具。
七、延伸阅读
- 基础全景:什么是 AI 热门概念、概念边界:AI vs ML vs DL vs GenAI vs Agent
- 技术上游:Transformer 与注意力机制、大语言模型
- 相邻方法:扩散模型与生成式 AI(RFdiffusion 的数学基础)、图像生成
- 评估与治理:模型评估与验证、AI 安全与治理
- 资源:数据集与工具档案、模型与榜单速查
参考资料
- Jumper et al. Highly accurate protein structure prediction with AlphaFold. Nature 596 (2021) —— AlphaFold2 的 Nature 封面论文
- CASP14 官方网站 —— CASP14 双盲竞赛官方站点与结果
- DeepMind: AlphaFold — a solution to a 50-year-old grand challenge in biology —— 官方公告,92.4 分数出处
- Abramson et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature 630 (2024) —— AlphaFold3 论文
- AlphaFold Protein Structure Database —— EBI 托管的 2 亿+ 结构开放数据库
- Watson et al. De novo design of protein structure and function with RFdiffusion. Nature 620 (2023) —— 扩散模型蛋白质设计的代表工作
- Lam et al. GraphCast: Learning skillful medium-range global weather forecasting. Science 2023 —— GraphCast 天气预报系统论文
- Merchant et al. Scaling deep learning for materials discovery. Nature 624 (2023) —— GNoME 材料发现论文
- The Nobel Prize in Chemistry 2024 —— 2024 年诺贝尔化学奖官方页面