跳转到内容
← 返回研究前沿
结构生物学2020s17 分钟阅读

蛋白质结构预测与从头设计革命

The Protein Design Revolution — AlphaFold to De Novo Design

2024 年 10 月,斯德哥尔摩宣布诺贝尔化学奖授予三位研究者:David Baker 因"计算蛋白质设计"获得一半奖金,Demis Hassabis 与 John Jumper 因"蛋白质结构预测"共享另一半。 这是生物学在 21 世纪的第一次真正意义上的"相变"——不是对已有知识的精炼,而是对整个领域作业方式的彻…

蛋白质折叠AlphaFold从头设计计算生物学诺贝尔奖

2024 年 10 月,斯德哥尔摩宣布诺贝尔化学奖授予三位研究者:David Baker 因"计算蛋白质设计"获得一半奖金,Demis Hassabis 与 John Jumper 因"蛋白质结构预测"共享另一半。

这是生物学在 21 世纪的第一次真正意义上的"相变"——不是对已有知识的精炼,而是对整个领域作业方式的彻底重写。

破除误解:不只是"预测"这一件事

公众通常把这场革命简化为 AlphaFold 解决了蛋白质折叠问题。这种理解的麻烦在于:它把两件截然不同的事混在一起了。

预测是给定氨基酸序列,推断蛋白质会折叠成什么三维形状。这是理解现有生命的工具。

设计是从无到有,创造出自然界从未存在过的蛋白质,让它折叠成研究者指定的形状,执行研究者指定的功能。这是改写生命的工具。

AlphaFold2 在预测方向上划了一道分水岭。David Baker 的 RFdiffusion 则在设计方向上做到了同样的事。两者都是真正的革命,但机制、影响和风险各不相同。

现场:折叠问题为什么难了五十年

蛋白质是氨基酸串成的长链。人体内约有 2 万种蛋白质,每种都由几十到数千个氨基酸组成。链一离开核糖体,就会在毫秒内折叠成特定的三维形状——正是这个形状决定了蛋白质的全部功能。

问题在于:序列→结构的映射关系极为复杂。一条 100 个氨基酸的链,理论上可能的构象空间大得荒唐,暴力搜索根本不可行。Cyrus Levinthal 在 1969 年就注意到这个悖论:如果蛋白质逐一尝试每种构象,宇宙的年龄也不够用。但蛋白质自己折叠只需数毫秒。大自然知道捷径,我们不知道。

这一问题悬而未决了五十年。每两年一次的 CASP(蛋白质结构预测关键评估)竞赛跟踪进展,2018 年前后各方方法误差仍在 5Å 以上——这个精度不足以指导药物设计。

AlphaFold2:2021 年的雷击

2021 年 7 月,DeepMind 在《自然》发表 AlphaFold2 论文,同时开放代码和预测数据库[af2]。CASP14 的中位误差降至约 0.96Å——与实验测量几乎相当。

AlphaFold2 的核心是 Evoformer 模块:通过分析数百万蛋白质的进化关系(多序列比对,MSA),推断哪些位置一起进化(共进化),从而推断它们在空间上相互靠近。本质上,Evoformer 在学习进化历史中隐藏的几何约束。

2022 年,DeepMind 与 EMBL-EBI 联合发布的 AlphaFold Protein Structure Database 覆盖了超过 2 亿条蛋白质序列的结构预测——地球上几乎所有已知生物的整个蛋白质组[afdb]。研究者可以下载任意物种的完整蛋白质结构,这在两年前还是数百实验室数十年才能完成的工作量。

2024 年 5 月,DeepMind 发布 AlphaFold3,进一步将预测范围从蛋白质单体扩展至蛋白质-蛋白质复合体、蛋白质-DNA、蛋白质-RNA、蛋白质-小分子配体的全套相互作用[af3]。这对药物设计意义重大:了解一个药物候选分子如何结合靶点蛋白,过去需要昂贵的 X 射线晶体学或冷冻电镜,现在首步可以在计算机上完成。

RFdiffusion:从预测到设计

预测是被动的;设计是主动的。Baker 实验室的转折点是将扩散模型(diffusion model)引入蛋白质设计。

2023 年,Baker 团队在《自然》发表了 RFdiffusion 论文[rfd]。其核心思路来自图像生成领域:从随机噪声开始,逐步"去噪",最终生成一个满足指定约束的蛋白质骨架结构,再由另一模块填入氨基酸序列。研究者可以指定:我需要一个能结合这个靶点的蛋白质、我需要一个具有这种对称性的环状寡聚体、我需要一个具有特定酶活性位点的支架——然后让 RFdiffusion 生成候选结构。

早期结果令人震惊:团队报告设计出了皮摩尔(101210^{-12} M)亲和力的结合蛋白——比传统方法最优结果强几个数量级——且只需筛选少数几个候选就能成功,而传统方法需要筛选数千甚至数万个[rfd]

更重要的是,这些蛋白质在自然界中不存在。这不是优化已有蛋白质,而是在蛋白质空间里打开了新的维度。

谁在做、做到了哪一步

路线代表团队核心工具近期里程碑
结构预测Google DeepMindAlphaFold2/32亿+蛋白质数据库;全分子相互作用预测(2024)
扩散设计Baker Lab(UW)RFdiffusion皮摩尔结合蛋白;对称组装体;酶活性位点设计(2023)
序列设计Baker Lab / EvolutionaryScaleProteinMPNN、ESM3给定骨架生成多样序列;语言模型设计(2024)
药物应用Isomorphic Labs(DeepMind分拆)AlphaFold+内部工具与多家制药公司签协议开展 AI 驱动药物发现
疫苗抗原Baker Lab / 合作机构RFdiffusion + 实验验证设计针对呼吸道合胞病毒(RSV)等靶点的纳米颗粒疫苗抗原

2024 年,EvolutionaryScale 发布了 ESM3,一种蛋白质语言模型,能同时在序列、结构和功能三个维度上生成和理解蛋白质[esm3]。这被视为蛋白质设计向"蛋白质 GPT"方向迈进的标志。

下游应用:药物、疫苗与工业酶

2024 年 1 月,Isomorphic Labs(DeepMind 2021 年分拆的药物研发公司)与 Eli Lilly 和 Novartis 同时宣布合作协议,合同总价值接近 30 亿美元,目标是多个靶点的小分子药物发现项目。2025 年 3 月,Isomorphic Labs 完成 6 亿美元融资,由 Thrive Capital 领投——这是 AI 驱动药物发现赛道迄今最大的单轮融资之一[isomorphic]

在工具层面,Baker 实验室 2025 年发布了 RFdiffusion2(发表于《自然》和《自然·方法》),在包含 41 种不同催化机制的酶设计基准测试中全部成功设计出功能性支架;测试候选蛋白数量从此前的数千个压缩到不超过 96 个,极大降低了实验验证成本[rfd2]。这是蛋白质设计从"能设计出结合蛋白"向"能可靠设计出催化功能蛋白"跨越的关键一步。

EvolutionaryScale 的 ESM3 模型(2024 年 6 月正式发布,发表于《科学》)证明了一个更广的可能性:该模型被用于生成一种全新的荧光蛋白,与已知荧光蛋白序列相似度仅 58%——研究者把这描述为"模拟了 5 亿年的进化"[esm3]。这类极度新颖的蛋白质设计,用传统实验方法几乎不可能找到。

代价与争议

局限一:"幻觉"问题。 AlphaFold 对结构良好的蛋白质预测置信度高(pLDDT 分值),但对本征无序区域(IDR)——这类区域在真实生物功能中极为重要——预测质量较差,可能给出虚假的"确定结构"。一份 2025 年的 arXiv 预印本对 AlphaFold3 在无序蛋白上的"幻觉"现象提出了系统性批评。

局限二:设计≠功能。 RFdiffusion 设计的蛋白质能折叠到目标结构,并不意味着在细胞环境里按预期工作。细胞内的分子伴侣、翻译后修饰、区室化……都会影响最终行为。从计算设计到真正的细胞内功能验证,仍是一段不短的距离。

局限三:静态结构 vs 动态过程。 蛋白质在发挥功能时是动态的——构象变化、别构效应、折叠-解折叠的平衡。当前大多数方法预测的是"基态结构",对动态过程的理解仍然有限。

争议:开放性与商业化。 AlphaFold 数据库向全球研究者免费开放,是科学开放性的典范。但 AlphaFold3 的代码初期不对外开放(只提供网页服务器),限制了学术界的深度使用,直到 2024 年 11 月才部分开放学术权重——但附带商业限制,且权重下载需单独申请,每日免费预测次数有上限。这一决定在科学界引发了关于 AI 工具公共属性的讨论:AlphaFold 的核心训练数据来自公共数据库(PDB、UniProt),其商业化边界划在哪里,是一个尚未有公认答案的问题。

未知的边界

  • 蛋白质设计能否可靠地实现催化功能?现有酶设计的催化效率通常远低于进化出的天然酶——几个数量级的差距仍然存在,尽管 2024 年有若干改进报告。
  • 对于多个蛋白质组成的大型复合体(如核糖体、剪接体),AlphaFold 的精度是否足够指导功能研究?这是当前活跃的测试领域。
  • 膜蛋白(约占人类蛋白质组的 30%,同时是约 60% 药物的靶点)的预测和设计,因疏水性和膜环境的复杂性,至今仍是特殊挑战。
  • 能否用计算设计出全新的酶催化化学——催化自然界不存在的反应?这是合成生物学与蛋白质设计交汇的前沿。

诺贝尔奖之后:一场范式转变的系统性意义

2024 年诺贝尔化学奖委员会的颁奖词明确指出,AlphaFold 已经预测了几乎所有已知蛋白质的结构,"与人类手动确定这些结构所需的时间相比,相当于缩短了数百年"。这不是比喻——蛋白质数据库(PDB)自 1971 年建立以来积累了约 22 万个实验测定结构,而 AlphaFold 数据库在 2022–2024 年间完成了超过 2 亿条预测。

这一数量级的变化正在重塑多个学科:

结构基因组学:以往一个物种的蛋白质结构图谱需要数十年实验积累,现在研究者可以在几天内获得任何已测序生物的全蛋白质组预测结构,大规模开展跨物种比较研究。

理性药物设计:AlphaFold3 将预测范围扩展到蛋白质-小分子配体相互作用,意味着筛选药物候选分子的第一步——判断分子是否能结合目标靶点——可以在计算机上以极低成本完成,把有限的实验资源集中到最有希望的候选者上。

合成生物学代谢工程:RFdiffusion2 设计的高效酶正在进入工业生物技术管道。能催化非天然化学反应的设计酶,将扩展生物合成可以触达的化学空间。

跨域连接

  • 蛋白质折叠: Levinthal悖论指出,逐一枚举构象连宇宙年龄都不够用,蛋白质却在毫秒内完成折叠——大自然走的是能量漏斗式的捷径,而不是搜索。推论:若折叠沿漏斗进行,序列的微小扰动大多不改变终态结构;这正是"从序列学结构"的模型能够被训练出来的前提。
  • 大语言模型:蛋白质语言模型把序列当"文本"、把共进化统计当"语料",生成的新荧光蛋白与已知序列的相似度只有一半多一点。推论:若模型真学到了折叠的"语法",生成物就应能在实验室折叠并工作——这种低相似度蛋白真的发光,是支持方最硬的证据;反例则会证伪"语法"说。
  • 蒙特卡洛方法:扩散式设计从随机噪声出发、逐步去噪生成满足约束的骨架——把"在构象空间采样"转化为迭代局部修正。推论:采样效率应远超随机突变加筛选;设计基准中候选蛋白从数万个压缩到不足一百个即获得活性分子,正是采样效率的直接量度。
  • 酶催化:从头设计已在数十种催化机制的基准上造出功能性支架,但设计酶的催化效率仍落后天然酶几个数量级。推论:差距主要来自活性位点的动态预组织而非静态几何——若如此,把动力学信息纳入训练,应能显著缩小与天然酶的差距。
  • 中文房间:结构预测的高精度是否等于模型"理解"了物理化学?这是中文房间式的质问——也可能只是高维插值。推论:若只是插值,面对训练分布之外的全新折叠拓扑应系统性失效;分布外基准测试,是区分"理解"与"背答案"的可检验标准。

参考文献

  • Jumper, J. et al. "Highly accurate protein structure prediction with AlphaFold." Nature 596, 583–589 (2021). DOI: 10.1038/s41586-021-03819-2.
  • Abramson, J. et al. (Google DeepMind). "Accurate structure prediction of biomolecular interactions with AlphaFold 3." Nature 630, 493–500 (2024). DOI: 10.1038/s41586-024-07487-w.
  • Watson, J.L. et al. "De novo design of protein structure and function with RFdiffusion." Nature 620, 1089–1100 (2023). DOI: 10.1038/s41586-023-06415-8.
  • Hayes, T. et al. (EvolutionaryScale). "Simulating 500 million years of evolution with a language model." Science 385, eado9336 (2024). DOI: 10.1126/science.ado9336.
  • The Nobel Prize in Chemistry 2024 — Popular Science Background. NobelPrize.org (2024). https://www.nobelprize.org/prizes/chemistry/2024/popular-information/.
  • Varadi, M. et al. "AlphaFold Protein Structure Database in 2024: providing structure coverage for over 214 million protein sequences." Nucleic Acids Research 52, D368–D375 (2024). DOI: 10.1093/nar/gkad1011.

脚注

  1. [af2]Jumper et al., Nature 596 (2021):CASP14 中 AlphaFold2 的中位 GDT_TS 分值约 92.4,远超此前最佳方法的约 75。
  2. [afdb]Varadi et al., Nucleic Acids Research 52 (2024):截至 2024 年初,数据库覆盖超过 2.14 亿蛋白质序列的预测结构。
  3. [af3]Abramson et al., Nature 630 (2024):AlphaFold3 使用扩散架构,将 Evoformer 替换为 Pairformer,降低约 38% 计算复杂度。
  4. [rfd]Watson et al., Nature 620 (2023):报告设计出 K_D 低至 pM 级别的蛋白质结合体,实验筛选成功率显著高于此前方法。
  5. [esm3]Hayes et al., Science 385 (2024):ESM3 通过序列-结构-功能的多轨道学习,模拟了"5 亿年进化"的蛋白质语言模型。设计的新型荧光蛋白与已知序列相似度仅 58%(正式发表:DOI: 10.1126/science.ads0018,2024 年 6 月)。
  6. [isomorphic]Isomorphic Labs 2024 年 1 月公告:与 Eli Lilly 达成约 17 亿美元合同(含里程碑付款)、与 Novartis 达成约 12 亿美元合同,用于多靶点 AI 药物发现。2025 年 3 月完成 6 亿美元 A 轮融资,Thrive Capital 领投。
  7. [rfd2]Baker Lab,2025 年:RFdiffusion2,发表于《自然》及《自然·方法》,在 41 种酶设计基准上全部成功,每次筛选候选少于 96 个序列即可找到活性候选。