Unité 5 / 11

Structure des protéines et AlphaFold : le triomphe de l’intelligence artificielle en biologie

Gains :

  • Comprendre les niveaux de structure des protéines et quelle structure AlphaFold prédit à partir de la séquence
  • Capacité à lire correctement les scores de confiance pLDDT et PAE et à interpréter les zones de faible confiance comme « incertaines/flexibles » plutôt que « incorrectes »
  • Comprendre la nécessité de valider la prédiction de la structure avec des preuves expérimentales (PDB, test d'activité) dans les décisions à fortes conséquences.

Les protéines sont les molécules actives de la cellule : les enzymes accélèrent les réactions, les transporteurs déplacent les molécules, les protéines structurelles maintiennent la cellule en activité. Le rôle d’une protéine est déterminé par sa forme pliée tridimensionnelle (structure). Pendant des décennies, prédire la structure d’une protéine à partir de sa séquence a été l’un des problèmes les plus difficiles en biologie. En 2021, le système d'intelligence artificielle de DeepMind appelé AlphaFold a fait un bond historique dans ce problème, prédisant la structure de centaines de millions de protéines avec une précision proche de celle expérimentale. Dans cette unité, nous verrons comment utiliser AlphaFold et des outils similaires du point de vue d'un biologiste et dans quelle mesure vous pouvez faire confiance à ses résultats.

Il s’agit de la réalisation la plus concrète de l’intelligence artificielle en biologie ; Mais même un outil prédictif a ses limites et nécessite une validation.

Niveaux de structure des protéines

  • Structure primaire : Séquence d'acides aminés (ordre des lettres).
  • Structure secondaire : Plis locaux ; comme l'hélice alpha et la feuille bêta.
  • Structure tertiaire : forme 3D de l’ensemble de la chaîne.
  • Structure quaternaire : Combinaison de plusieurs chaînes.

AlphaFold prédit la structure tertiaire (forme 3D) à partir de la structure primaire (séquence). Il le fait grâce à des modèles qu'il apprend de l'alignement (MSA) de séquences liées à l'évolution.

Lecture de la sortie AlphaFold

AlphaFold ne donne pas seulement une structure ; Il donne également des scores de confiance pour chaque prédiction. Les comprendre est la clé pour ne pas faire aveuglément confiance :

  • pLDDT : score de confiance local compris entre 0 et 100 pour chaque acide aminé. Au-dessus de 90 est très fiable, 70-90 est fiable, 50-70 est incertain, en dessous de 50 est très probablement une région désordonnée.
  • PAE (Predicted Aligned Error) : confiance de position relative inter-domaines ; Cela montre à quel point le placement des domaines les uns par rapport aux autres est fiable dans les grandes protéines multidomaines.
Astuce : lorsque vous voyez des zones de faible pLDDT (non bleu, orange/rouge) sur un modèle AlphaFold, lisez-les comme « vagues ou flexibles » plutôt que « incorrectes ». Ces régions sont souvent des fragments protéiques véritablement désordonnés et ont une signification biologique.

Pas à pas : examiner une protéine avec AlphaFold

  1. Trouvez la séquence : obtenez la séquence de votre protéine auprès d'UniProt.
  2. Obtenez la structure : recherchez dans AlphaFold DB (prêt pour la plupart des protéines) ou exécutez avec ColabFold.
  3. Évaluez la confiance : regardez pLDDT et PAE ; Quelles régions sont fiables ?
  4. Visualiser : Inspectez en 3D avec PyMOL ou py3Dmol.
  5. Interpréter : Évaluer les régions fonctionnelles telles que le site actif, la poche de liaison.
  6. Vérifier : comparer la structure expérimentale (rayons X/cryo-EM dans PDB) si disponible.

L'intelligence artificielle (LLM) écrit le code dans ces étapes (visualisation avec py3Dmol, synthèse des scores) et explique les concepts. AlphaFold lui-même est un modèle de prédiction de structure discrète ; LLM vous aide à interpréter ses résultats.

Modèles d'invite copiables

Rôle : Vous êtes assistant en biologie structurale. Tâche : Expliquez les scores AlphaFold pLDDT et PAE à un étudiant diplômé. Expliquez ce que mesure chaque score, quels seuils sont considérés comme fiables et comment les régions à faible score doivent être interprétées.

Comment puis-je exécuter la séquence protéique que j'ai reçue d'UniProt dans ColabFold ? Expliquez les étapes et les limites de ressources/temps dont je dois être conscient. Longueur de la séquence : [N] acides aminés.

Écrivez un code Python qui visualise un fichier PDB (predicted.pdb) en 3D et le colore selon le score pLDDT avec py3Dmol. Laissez-le fonctionner dans Jupyter, avec des commentaires.

J'ai la prédiction AlphaFold et la structure expérimentale du PDB. Donnez le code et le commentaire qui aligne les deux et calcule le RMSD (écart carré moyen). Expliquez combien d'angströms en dessous du RMSD sont considérés comme bons.

Invite faible/Invite forte

Faible : "Dites-moi la forme de cette protéine."

Strong : "J'ai examiné le modèle AlphaFold de la protéine UniProt P04637 (p53 humaine). Le domaine de liaison à l'ADN est un pLDDT élevé (> 90), les extrémités N-terminale et C-terminale sont un faible pLDDT (<50). Comment dois-je interpréter ce modèle ? Expliquez la possibilité que les extrémités à faible score soient des régions désordonnées et la signification fonctionnelle de cela ; sans faire d'affirmation définitive sur la structure. "

Différence : l'invite puissante contient la vraie protéine, le modèle de score réel et la demande de commentaire. Le modèle interprète les données que vous fournissez plutôt que de les « mémoriser ».

trois mini-cases

Cas 1 — Confondre la région désordonnée avec une erreur : un étudiant a éliminé la région pLDDT faible à la fin de sa protéine parce que "AlphaFold l'a mal deviné". Cependant, cette région était également une zone d’activation irrégulière expérimentalement. L'étudiant a interprété correctement la région lorsque le modèle a expliqué qu'un faible pLDDT reflète souvent une véritable élasticité.

Cas 2 — Exagération de l'effet de mutation : Un chercheur a affirmé qu'un seul changement d'acide aminé faisait une « énorme différence » dans le modèle AlphaFold. Cependant, AlphaFold ne prédit pas de manière fiable l’effet de stabilité des mutations ponctuelles ; les différences peuvent être dues au bruit du modèle. Le modèle a rappelé cette limite et a conduit à des outils spécifiques (par exemple des outils de prédiction de stabilité).

Cas 3 — Gain par validation : Une équipe a aligné la prédiction AlphaFold avec la structure expérimentale du PDB ; Le RMSD s'est avéré être de 1,2 angströms (très bon ajustement). Cela leur a permis de s’appuyer sur la prédiction et d’émettre l’hypothèse d’une poche contraignante, et de concevoir l’expérience en conséquence. La vérification a justifié la confiance.

tableau comparatif

Partition/concept

Quelles mesures

Seuil fiable

pLDDT

Construire une confiance locale (0-100)

>90 très bon, <50 irrégulier

PAE

Confiance de localisation entre domaines

Faible (sombre) bon

RMSD

Accord avec l'expérience (angström)

<2 Å est généralement bon

Erreurs courantes

  • Considérer un pLDDT faible comme un « défaut » : Il s'agit généralement d'une région désordonnée/flexible, ne la supprimez pas.
  • Assurer un effet de mutation unique avec AlphaFold : ce n'est pas le bon outil pour ce travail.
  • Ignorer les scores de confiance : en supposant que l'ensemble du modèle est également fiable.
  • Ignorer la structure expérimentale : s'il existe la structure réelle dans le PDB, assurez-vous de la comparer.
  • Interprétation de chaînes complexes/multiples comme une chaîne unique : les interactions nécessitent des modes spéciaux (AlphaFold-Multimer).
Attention : AlphaFold est un outil remarquable, mais il s'agit d'une supposition et non d'une réalité empirique. Les décisions à conséquences particulièrement importantes, telles que la nouvelle cible d'un médicament, le site de liaison ou l'effet de mutation, ne doivent pas être prises sans étayer la prédiction par des preuves expérimentales (structure, test d'activité).

De la structure à la fonction : voir la poche suffit-il ?

Obtenir la structure 3D d’une protéine est passionnant, mais la structure à elle seule ne vous indique pas son fonctionnement. Vous pouvez voir le site actif (la poche où le substrat se lie) d’une enzyme ; Cependant, la structure n’indique pas à quelle molécule elle se lie, à quelle vitesse elle agit ni où elle se trouve dans la cellule. AlphaFold est un point de départ : il génère une hypothèse (« cette poche pourrait lier un ATP »), l’expérience la teste. L'IA vous aide à formuler ces hypothèses et à écrire du code qui analyse la structure, mais une affirmation de fonction nécessite des preuves empiriques.

Une autre utilisation puissante est la comparaison structurelle : même si les séquences de deux protéines sont très différentes, leurs structures peuvent être similaires ; c'est un indice d'une relation évolutive lointaine ou d'une fonction partagée. Des outils comme Foldseek recherchent rapidement des similitudes de structure. Le modèle vous aide à interpréter les résultats de ces outils et à écrire le code de comparaison.

Alignez la structure AlphaFold de deux protéines avec Bio.PDB, calculez le RMSD et indiquez quelles régions se chevauchent et lesquelles divergent. Commentez que la similarité structurelle est un indice d’une relation fonctionnelle, mais pas une preuve.

Complexes, interactions et frontières

Les protéines ne fonctionnent pas seules, mais souvent avec des partenaires (autres protéines, ADN, petites molécules). AlphaFold-Multimer peut prédire les complexes protéine-protéine ; mais cela ne suffit pas à lui seul à donner la puissance et la réalité des interactions. Lorsque le modèle prédit que « deux protéines interagissent », il s’agit d’une hypothèse préliminaire ; doit être confirmée par des expériences telles que la co-immunoprécipitation (co-IP). Utiliser l’IA pour comprendre où ces outils sont appropriés et évaluer la confiance dans les résultats ; Les scores de confiance (en particulier le PAE d’interface) sont plus importants que jamais dans les prédictions complexes.

AlphaFold n'est pas la seule option

Si AlphaFold est un pionnier, ce n’est pas le seul outil. ESMFold (Meta) effectue une prédiction rapide à partir d'une seule séquence, sans nécessiter d'alignement évolutif ; Il convient à l’analyse de grands ensembles de séquences, mais est généralement légèrement moins précis qu’AlphaFold. RoseTTAFold est une autre alternative puissante. AlphaFold3 et les versions similaires plus récentes incluent également des complexes protéine-ligand et protéine-acide nucléique. Vous pouvez consulter l'IA quel outil est adapté à un problème de construction (vitesse ou précision, chaîne unique ou complexe) ; Mais n'oubliez pas de lire la mesure de confiance de chaque outil sur sa propre échelle : ce qui est considéré comme un « bon » score dans un outil est interprété différemment dans un autre.

En résumé

AlphaFold a révolutionné la biologie en prédisant la structure des protéines à partir de leur séquence. Cependant, ses résultats doivent être lus conjointement avec les scores de confiance (pLDDT, PAE) ; les zones de faible confiance doivent être interprétées comme « incertaines/flexibles » plutôt que « incorrectes ». L'intelligence artificielle (LLM) vous aide à expliquer ces scores, à écrire du code de visualisation et à les comparer à la structure expérimentale. Pour les décisions à conséquences élevées, la prédiction doit être étayée par des preuves empiriques.

Tâche de candidature

Choisissez une protéine (par exemple une enzyme qui vous intéresse). Trouvez son tableau depuis UniProt et sa structure depuis AlphaFold DB. Demandez à l'IA d'écrire et d'exécuter du code avec py3Dmol qui colore la structure selon pLDDT. Identifiez les zones de sécurité hautes et basses. Demandez au modèle d'interpréter la signification biologique possible des régions à faible confiance et de vérifier les structures expérimentales dans le PDB.

liste de contrôle

  • [ ] J'ai évalué la structure avec les scores pLDDT/PAE.
  • [ ] J'ai interprété les zones de faible confiance comme « incertaines/flexibles », et non comme « erreur ».
  • [ ] Je n'avais pas beaucoup confiance en AlphaFold pour l'effet de mutation unique.
  • [ ] Je l'ai comparé avec la structure expérimentale (PDB), si disponible.
  • [ ] J'ai réfléchi au bon outil pour la polychaîne/complexe.
  • [ ] J'ai soutenu la décision aux conséquences élevées avec des preuves empiriques.