Unité 3 / 11

Analyse de séquences et bioinformatique : ADN, ARN et protéines

Gains :

  • Capacité à imprimer le code des opérations d'analyse de séquence de base telles que la lecture, la traduction, l'alignement et BLAST FASTA et à interpréter les résultats
  • Capacité à éviter des conclusions erronées en interprétant correctement des concepts tels que la valeur électronique, le taux de couverture et le cadre de lecture
  • Capacité à comprendre la nécessité de confirmer la revendication fonctionnelle d'une séquence auprès des bases de données officielles (NCBI, UniProt, Ensembl).

La donnée la plus fondamentale de la biologie est la séquence : la séquence d'ADN constituée des lettres A, T, G, C ; Séquence A, U, G, C de l'ARN ; chaîne de 20 lettres d’acides aminés de protéine. Nous comprenons ce qu'est un gène, à quel point deux espèces sont liées et la relation entre une mutation (changement de séquence) et une maladie grâce à ces séquences. Dans cette unité, nous apprendrons à utiliser l'intelligence artificielle comme assistant de code et d'interprétation pour l'analyse de séquences : lecture de fichiers FASTA, traduction de séquences, alignement (alignement : comparer deux séquences lettre par lettre et voir leurs similitudes) et comprendre des outils tels que BLAST.

Mise en garde critique dès le départ : l'IA ne « connaît » pas la fonction réelle d'une séquence ; Seules les bases de données officielles (NCBI, UniProt, Ensembl) et les preuves empiriques le disent.

Concepts et outils de base

  • FASTA : format de texte qui stocke les chaînes ; Chaque tableau se compose d'une ligne d'en-tête commençant par > et de lignes de sous-tableau en dessous.
  • BLAST (Basic Local Alignment Search Tool) : Un outil qui compare une séquence que vous avez avec des millions de séquences dans une base de données géante et trouve les plus similaires. "A quoi ressemble cette série ?" réponse standard à la question.
  • Alignement : Disposer deux ou plusieurs tableaux de manière à ce que des régions similaires soient placées les unes sous les autres. Il peut s'agir d'un alignement par paires ou par séquences multiples (MSA).
  • Traduction : Conversion de la séquence codante ADN/ARN en une séquence d'acides aminés via des groupes de trois lettres (codons).
  • Motif : un bref motif récurrent dans la séquence qui a une signification fonctionnelle (par exemple, un site de liaison).
Astuce : vous ne pouvez pas dire à l'IA de « BLASTer cette série » ; Le modèle ne peut pas accéder à la base de données BLAST. Mais "Comment interpréter mon résultat BLAST, que signifie la valeur e (E-value) ?" Vous pouvez demander et même écrire du code qui appelle BLAST par programmation avec Biopython.

Étape par étape : enquêter sur l’identité d’un tableau

  1. Obtenez la séquence : enregistrez-la dans un fichier sous FASTA.
  2. Vérification de base : longueur, contenu des lettres (s'agit-il uniquement de A/T/G/C ou y a-t-il un « N » inconnu), rapport GC (pourcentage de guanine-cytosine : varie selon les espèces et les régions).
  3. BLAST : recherchez dans l'interface Web NCBI ou par programme.
  4. Commentaire : examinez la valeur e de la meilleure correspondance (plus elle est petite, moins il est probable qu'il s'agisse d'une coïncidence) et la couverture de la requête.
  5. Confirmation : ouvrez le gène/la protéine correspondant dans UniProt ou NCBI et vérifiez qu'il correspond réellement à la fonction que vous recherchez.

L'IA vous aide à coder à l'étape 2 et à commenter à l'étape 4 ; mais les données réelles des étapes 3 et 5 sont fournies par les outils eux-mêmes et par vous.

Modèles d'invite copiables

Rôle : Vous êtes assistant en bioinformatique. Tâche : Lire un fichier FASTA (sequences.fasta) avec Biopython. Je veux : écrire le nom, la longueur et le rapport GC de chaque séquence dans un tableau ; enregistrez le résultat au format CSV. Donnez du code Python fonctionnel avec des commentaires.

Traduisez la séquence d’ADN que j’ai en une séquence protéique. Utilisez Biopython Seq.translate ; afficher le codon d'arrêt (*); indiquer le cadre de lecture. Donnez le code, expliquez. Séquence : [FASTA]

Interprétez mon résultat BLAST. Vous trouverez ci-dessous la valeur-valeur, le pourcentage d'identité et le taux de couverture des 5 meilleures correspondances. Expliquez-moi quelle correspondance est fiable et pourquoi, ne faites pas de déclarations de fonction exactes, dites-moi les étapes que je dois vérifier. Tableau : [données]

Alignez deux séquences de protéines par paires et trouvez le pourcentage de similarité. Utilisez Biopython par paires2 ou Bio.Align ; imprimer l'alignement de manière lisible. Donnez le code et expliquez le système de notation.

Invite faible/Invite forte

Faible : « De quel gène correspond cette séquence ? »

Strong : "J'ai une séquence d'ADN humain de 1 140 paires de bases (FASTA ci-dessous). J'ai moi-même explosé cette séquence ; la meilleure correspondance est TP53, valeur e 0,0, identité 99,8 %, couverture 100 %. Expliquez pourquoi ce résultat constitue une preuve solide ; cependant, dites-moi quelles sont les 2 vérifications que je dois effectuer avant de vérifier sa fonction. "

Différence : dans l'invite forte, les données réelles (longueur, résultat BLAST) sont fournies au modèle ; Vous demandez au modèle d'interpréter les preuves que vous fournissez, et non de « s'en souvenir ». Il est obligé de créer un modèle sur une base faible.

trois mini-cases

Cas 1 — Cadre de lecture incorrect : Un étudiant a traduit la séquence d'ADN en protéine, mais depuis le début, sans trouver le bon codon d'initiation (ATG). Le résultat était une protéine dénuée de sens et à arrêt précoce. Lorsque le modèle a essayé les trois cadres de lecture et a écrit le code qui a trouvé le cadre de lecture ouvert (ORF) le plus long commençant par ATG, la bonne protéine de 380 acides aminés a émergé.

Cas 2 — Erreur de valeur E : un technicien a signalé une correspondance BLAST avec une valeur E de 2,0 comme « trouvée ». Alors qu’une valeur e supérieure à 1 indique que la correspondance est très probablement une coïncidence. Le modèle explique cela et rappelle que e < 1e-5 est généralement utilisé comme seuil fiable.

Cas 3 — Contamination : Un BLAST d'une séquence bactérienne dans un laboratoire a révélé que l'ADN humain était la meilleure correspondance. C'était un signe de contamination de l'échantillon. L’IA a éveillé de justes soupçons en déclarant que « un type de correspondance inattendu pourrait être révélateur d’une contamination » ; Le technicien a répété l'exemple.

Comparaison : le rôle de l’intelligence artificielle

Quête

intelligence artificielle

Outil/base de données

humain

Lecture FASTA, GC/longueur

écrit du code

Contrôle la sortie

Traduction, découverte ORF

écrit du code

Exécute Biopython

Valide le cadre

identifiant du tableau

Commentaires

BLAST/NCBI trouve

confirme

Revendication de fonction

propose des suggestions

UniProt en donne la preuve

décide

Erreurs courantes

  • Demander au modèle de « se souvenir » de l'ID de chaîne : le modèle ne mémorise pas les chaînes ; Utilisez BLAST.
  • Interprétation erronée de la valeur électronique : petit c'est bien, grand c'est mal ; Rappelez-vous le seuil.
  • Ne pas vérifier le cadre de lecture : un mauvais cadre produit une protéine absurde.
  • Ignorer la couverture : une identité élevée mais une faible couverture signifie une correspondance partielle.
  • Contamination manquante : une correspondance inattendue entre les espèces est un avertissement sérieux.
Attention : Ce n'est pas parce qu'une séquence est "similaire à 99 % à TP53" que cette séquence porte la fonction TP53 ; C'est une hypothèse forte. La fonction doit être étayée par des preuves empiriques et des descriptions de bases de données. Il ne suffit pas que l’IA dise simplement « c’est un suppresseur de tumeur ».

Alignement de séquences multiples et base de la phylogénie

Aligner des dizaines de séquences ensemble plutôt que deux seulement est appelé alignement de séquences multiples (MSA) et constitue la base de nombreuses analyses : recherche de régions conservées (parties restées inchangées au cours de l'évolution et donc fonctionnellement importantes), construction d'arbres phylogénétiques, identification de familles de protéines. Des outils comme MAFFT, MUSCLE et Clustal font ce travail. L'IA écrit le code qui appelle ces outils depuis Python (via Biopython, par exemple) et vous aide à interpréter le résultat ; mais l'alignement lui-même fait l'outil, pas le modèle "par cœur".

Lors de l'interprétation d'un MSA, faites attention aux colonnes conservées : un acide aminé qui reste le même dans toutes les séquences est très probablement essentiel au fonctionnement de la protéine (par exemple, le site actif d'une enzyme). Cela donne une bonne idée de la raison pour laquelle une mutation pourrait être nocive. Mais « préservé = significatif » est une hypothèse ; nécessite une vérification expérimentale.

Lisez mon fichier d'alignement multiple (aligned.fasta), qui est la sortie MAFFT, avec Biopython. Calculer le taux de rétention pour chaque colonne ; Répertoriez plus de 90 % des positions protégées. Expliquez pourquoi ces postes peuvent avoir une importance fonctionnelle, sans revendiquer une fonction définitive.

Piège à mutation et à interprétation des variantes

Lorsque vous voyez un changement de lettre (variante) dans une chaîne, c'est un grand pas de dire que c'est "nuisible". La plupart des variantes sont neutres (inefficaces). Lors de l'interprétation de l'impact d'une variante, il faut examiner des bases de données dédiées aux variantes (comme ClinVar) et des données sur la fréquence de la population (comme gnomAD), et non le mot de l'IA. Si le modèle affirme qu’un variant est « pathogène », n’écrivez jamais cela dans une conclusion clinique ou de recherche sans le confirmer auprès de ces sources.

Bases de données de base pour vérification

Connaître les sources officielles pour confirmer chaque affirmation de l’analyse de la série est votre meilleur bouclier contre les fabrications de l’intelligence artificielle. Les plus fréquemment utilisés :

base de données

pour quoi

Confirmation typique

NCBI GenBank/RefSeq

Séquences ADN/ARN, enregistrements génétiques

ID de chaîne, longueur

UniProt

Séquences et fonctions des protéines

Fonction, nombre d'acides aminés

ensemble

Annotation du génome, emplacements des gènes

Cartographie gène-chromosome

ClinVar

Signification clinique des variantes

Décision pathogène/neutre

gnomAD

Fréquence des variantes dans la population

variante rare/commune

L’IA peut suggérer laquelle de ces bases vous devriez examiner ; Mais vous faites la requête et vous lisez le résultat. "Le modèle a dit que c'est ce que dit UniProt" n'est pas une confirmation ; La confirmation ouvre vous-même la page UniProt.

En résumé

L'analyse de séquences est au cœur de la bioinformatique ; FASTA, BLAST, alignement et translation sont les opérations de base. L'IA écrit le code de ces opérations et vous aide à interpréter leurs résultats, mais des outils (BLAST) et des bases de données (NCBI, UniProt) fournissent l'identification réelle de la séquence. Comprendre correctement des concepts tels que la valeur électronique, la couverture et le cadre de lecture est essentiel pour éviter les mauvaises conclusions. Une revendication de fonction nécessite toujours des preuves indépendantes.

Tâche de candidature

Prenez un échantillon de séquence d'ADN (ou un gène que vous avez téléchargé depuis NCBI). Demandez à l'IA de calculer la longueur et le rapport GC avec Biopython, puis traduisez-le dans les trois cadres de lecture et imprimez le code qui trouve l'ORF le plus long. Exécutez le résultat. Recherchez ensuite vous-même cette séquence dans NCBI BLAST et demandez au modèle d'interpréter la valeur e et le taux de couverture de la meilleure correspondance. Confirmez la revendication fonctionnelle du modèle dans UniProt.

liste de contrôle

  • [ ] J'ai vérifié la longueur et le contenu des lettres avant de traiter la chaîne.
  • [ ] J'ai utilisé le cadre de lecture correct dans la traduction.
  • [ ] J'ai moi-même exécuté BLAST, je n'ai pas "rappelé" le modèle.
  • [ ] J'ai correctement interprété la valeur e et le taux de couverture.
  • [ ] J'ai évalué la correspondance inattendue des espèces pour la contamination.
  • [ ] J'ai confirmé la revendication de fonction avec la base de données officielle.