单位 5 / 11

蛋白质结构和 AlphaFold:人工智能在生物学中的胜利

收益:

  • 了解蛋白质结构水平以及 AlphaFold 从序列中预测的结构
  • 能够正确读取 pLDDT 和 PAE 置信度得分,并将低置信度区域解释为“不确定/灵活”而不是“不正确”
  • 了解在重大决策中用实验证据(PDB、活性测试)验证结构预测的必要性。

蛋白质是细胞的工作分子:酶加速反应,转运蛋白移动分子,结构蛋白保持细胞运转。蛋白质的作用是由其三维折叠形状(结构)决定的。几十年来,从蛋白质序列预测蛋白质结构一直是生物学中最困难的问题之一。 2021 年,DeepMind 名为 AlphaFold 的人工智能系统在这个问题上取得了历史性的飞跃,以接近实验的精度预测了数亿种蛋白质的结构。在本单元中,我们将从生物学家的角度讨论如何使用 AlphaFold 和类似工具,以及您可以在多大程度上信任其输出。

这是人工智能在生物学领域最具体的成果;但即使是预测工具也有其局限性并且需要验证。

蛋白质结构水平

  • 一级结构:氨基酸序列(字母顺序)。
  • 二级结构:局部褶皱;例如α螺旋和β折叠。
  • 三级结构:整个链条的3D形状。
  • 四级结构:多个链的组合。

AlphaFold 根据一级结构(序列)预测三级结构(3D 形状)。它通过从进化相关序列的比对 (MSA) 中学习到的模式来实现这一点。

读取 AlphaFold 输出

AlphaFold 不只是给出一个结构;它还给出了一个结构。它还给出每个预测的置信度分数。了解这些是不盲目相信的关键:

  • pLDDT:每个氨基酸的局部置信度得分在 0-100 之间。 90以上是非常可靠的,70-90是可靠的,50-70是不确定的,50以下很可能是无序区域。
  • PAE(Predicted Aligned Error):域间相对位置置信度;它显示了大型多结构域蛋白质中结构域相对放置的可靠性。
提示:当您在 AlphaFold 模型上看到低 pLDDT 区域(非蓝色、橙色/红色)时,请将其解读为“模糊或灵活”,而不是“不正确”。这些区域通常是真正无序的蛋白质片段,具有生物学意义。

一步一步:用 AlphaFold 检查蛋白质

  1. 查找序列:从 UniProt 获取蛋白质序列。
  2. 获取结构:在 AlphaFold DB 中搜索(适用于大多数蛋白质)或使用 ColabFold 运行。
  3. 评估信心:查看 pLDDT 和 PAE;哪些地区靠谱?
  4. 可视化:使用 PyMOL 或 py3Dmol 进行 3D 检查。
  5. 解释:评估功能区域,例如活性位点、结合口袋。
  6. 验证:比较实验结构(PDB 中的 X 射线/冷冻电镜)(如果可用)。

人工智能(LLM)在这些步骤中编写代码(使用 py3Dmol 进行可视化,总结分数)并解释概念。 AlphaFold本身是一个离散结构预测模型; LLM 可以帮助您解释其结果。

可复制的提示模板

角色:您是一名结构生物学助理。任务:向研究生解释 AlphaFold pLDDT 和 PAE 分数。解释每个分数的衡量标准、哪些阈值被认为是可靠的,以及应如何解释低分区域。

如何在 ColabFold 中运行从 UniProt 收到的蛋白质序列?解释我需要注意的步骤和资源/时间限制。序列长度:[N]个氨基酸。

编写一个 Python 代码,以 3D 形式可视化 PDB 文件 (predicted.pdb),并使用 py3Dmol 根据 pLDDT 分数为其着色。让它在 Jupyter 中运行,并带有注释。

我有来自 PDB 的 AlphaFold 预测和实验结构。给出将两者对齐并计算 RMSD(均方差)的代码和注释。解释低于 RMSD 多少埃被认为是好的。

弱提示/强提示

弱者:“告诉我这种蛋白质的形状。”

Strong:“我检查了 UniProt P04637(人 p53)蛋白的 AlphaFold 模型。DNA 结合域是高 pLDDT (>90),N 末端和 C 末端是低 pLDDT (<50)。我应该如何解释这种模式?解释低分末端是无序区域的可能性及其功能意义;但没有做出明确的结构声明。”

区别:强大的提示有真实的蛋白质、真实的评分模式和评论请求。该模型解释您提供的数据,而不是“记住”它。

三个迷你箱子

案例 1 — 将无序区域误认为是错误:一名学生消除了蛋白质末端的低 pLDDT 区域,因为“AlphaFold 猜错了”。然而,那个区域在实验上也是一个不规则激活的区域。当模型解释低 pLDDT 通常反映真实弹性时,学生正确解释了该区域。

案例2——突变效应夸大:一位研究人员声称,单个氨基酸的变化在AlphaFold模式中产生了“巨大的差异”。然而,AlphaFold并不能可靠地预测单点突变的稳定性效应;差异可能是模型噪声。该模型回顾了这一限制并产生了特定的工具(例如稳定性预测工具)。

案例 3 — 通过验证获得收益:一个团队将 AlphaFold 预测与 PDB 中的实验结构对齐; RMSD 结果为 1.2 埃(非常合适)。这使他们能够依赖预测并假设结合口袋,并相应地设计实验。验证合理的信任。

对比图

分数/概念

采取什么措施

可靠阈值

LDDT

本地建立信任(0-100)

>90 非常好,<50 不规则

PAE

跨域位置信任

低(暗)好

均方根偏差

与实验的一致性(angström)

<2 Å 通常较好

常见错误

  • 将低 pLDDT 视为“故障”:它通常是无序/灵活区域,请勿删除它。
  • 使用 AlphaFold 确保单突变效果:不是适合这项工作的工具。
  • 忽略置信度分数:假设整个模型同样可靠。
  • 跳过实验结构:如果PDB中有真实的结构,一定要进行比较。
  • 将复杂/多个链解释为单链:交互需要特殊模式(AlphaFold-Multimer)。
注意:AlphaFold 是一个非凡的工具,但它只是一个猜测,而不是经验现实。在没有实验证据(结构、活性测试)支持预测的情况下,不应做出特别重大的决定,例如新药靶点、结合位点或突变效应。

从结构到功能:看到口袋就够了吗?

获得蛋白质的 3D 结构令人兴奋,但结构本身并不能告诉您其功能。您可以看到酶的活性位点(底物结合的口袋);然而,该结构并没有表明它结合的是哪个分子,它的作用速度有多快,或者它在细胞中的位置。 AlphaFold 是一个起点:它生成一个假设(“这个口袋可能结合 ATP”),并通过实验对其进行测试。人工智能可以帮助您制定这些假设并编写分析结构的代码,但功能声明需要经验证据。

另一个强大的用途是结构比较:即使两种蛋白质的序列非常不同,它们的结构也可以相似;这是远距离进化相关性或共享功能的线索。 Foldseek 等工具可以快速查找结构相似性。该模型可帮助您解释这些工具的输出并编写比较代码。

将两种蛋白质的 AlphaFold 结构与 Bio.PDB 对齐,计算 RMSD,并报告哪些区域重叠、哪些区域分歧。评论说结构相似性是功能相关性的线索,但不是证据。

复合体、相互作用和边界

蛋白质并不是单独发挥作用,而是经常与伙伴(其他蛋白质、DNA、小分子)一起发挥作用。 AlphaFold-Multimer可以预测蛋白质-蛋白质复合物;但仅凭这一点还不足以体现互动的力量和现实。当模型预测“两种蛋白质相互作用”时,这是一个初步假设;应通过免疫共沉淀(co-IP)等实验来证实。使用人工智能了解这些工具的适用范围并评估输出的置信度;在复杂的预测中,置信度得分(尤其是界面 PAE)比以往任何时候都更加重要。

AlphaFold 不是唯一的选择

虽然 AlphaFold 是先驱,但它并不是唯一的工具。 ESMFold (Meta) 从单个序列执行快速预测,无需进化比对;它适合扫描大量序列,但通常比 AlphaFold 精确度稍低。 RoseTTAFold 是另一个强大的替代方案。 AlphaFold3 和类似的更新版本还包括蛋白质-配体和蛋白质-核酸复合物。你可以咨询AI哪种工具适合某个构建问题(速度还是精度,单链还是复杂);但请记住,要按照各自的标准来阅读每种工具的信任指标:一种工具中被视为“良好”的分数在另一种工具中的解释会有所不同。

综上所述

AlphaFold 通过从序列预测蛋白质结构,彻底改变了生物学。然而,其输出应与置信度分数(pLDDT、PAE)一起阅读;低置信度区域应解释为“不确定/灵活”而不是“不正确”。人工智能 (LLM) 可帮助您解释这些分数、编写可视化代码并将其与实验结构进行比较。对于后果严重的决策,预测必须得到经验证据的支持。

应用任务

选择一种蛋白质(例如您感兴趣的酶)。从 UniProt 中找到它的数组,从 AlphaFold DB 中找到它的结构。让 AI 使用 py3Dmol 编写并运行代码,根据 pLDDT 为结构着色。确定高安全区和低安全区。让模型解释低置信度区域可能的生物学意义并检查 PDB 中的实验结构。

清单

  • [ ] 我将结构与 pLDDT/PAE 分数一起评估。
  • [ ] 我将低置信区域解释为“不确定/灵活”,而不是“错误”。
  • [ ] 我对AlphaFold的单突变效果没有太大信心。
  • [ ] 我将它与实验结构(PDB)(如果有的话)进行了比较。
  • [ ] 我考虑了适合多链/复合体的工具。
  • [ ] 我用经验证据支持了这一后果严重的决定。