Enota 3 / 11

Analiza zaporedja in bioinformatika: DNA, RNA in proteini

Dobički:

  • Sposobnost tiskanja kode osnovnih operacij analize zaporedja, kot so branje FASTA, prevajanje, poravnava in BLAST, ter interpretacija rezultatov
  • Sposobnost izogibanja napačnim sklepom s pravilno interpretacijo konceptov, kot so e-vrednost, stopnja pokritosti in bralni okvir
  • Sposobnost razumevanja nujnosti potrditve funkcijske trditve zaporedja z uradnimi podatkovnimi bazami (NCBI, UniProt, Ensembl).

Najosnovnejši podatek biologije je zaporedje: zaporedje DNK, sestavljeno iz črk A, T, G, C; A, U, G, C zaporedje RNA; veriga 20 aminokislinskih črk beljakovin. Razumemo, kaj je gen, kako povezani sta dve vrsti in odnos med mutacijo (spremembo zaporedja) in boleznijo prek teh zaporedij. V tej enoti se bomo naučili uporabljati umetno inteligenco kot pomočnika kode in interpretacije za analizo zaporedja: branje datotek FASTA, prevajanje zaporedij, poravnavanje (poravnava: primerjava dveh zaporedij črko za črko in ogled njunih podobnosti) in razumevanje orodij, kot je BLAST.

Kritično opozorilo že na začetku: AI ne "pozna" dejanske funkcije zaporedja; To govorijo samo uradne podatkovne baze (NCBI, UniProt, Ensembl) in empirični dokazi.

Osnovni pojmi in orodja

  • FASTA: Oblika besedila, ki shranjuje nize; Vsaka matrika je sestavljena iz vrstice glave, ki se začne z >, in vrstic podmatrike pod njo.
  • BLAST (Basic Local Alignment Search Tool): Orodje, ki primerja zaporedje, ki ga imate, z milijoni zaporedij v ogromni bazi podatkov in najde najbolj podobna. "Kako izgleda ta serija?" standardni odgovor na vprašanje.
  • Poravnava: Razporeditev dveh ali več nizov tako, da so podobna področja postavljena eno pod drugim. Lahko je poravnava po parih ali več sekvenc (MSA).
  • Prevod: Pretvarjanje kodirajočega zaporedja DNA/RNA v zaporedje aminokislin prek trojnih črkovnih skupin (kodonov).
  • Motiv: Kratek ponavljajoči se vzorec v zaporedju, ki ima funkcionalni pomen (npr. mesto vezave).
Namig: umetni inteligenci ne morete reči, naj "IZBRAZI to serijo"; Model ne more dostopati do baze podatkov BLAST. Toda "Kako si razlagam svoj rezultat BLAST, kaj pomeni e-vrednost (E-vrednost)?" Lahko vprašate in celo napišete kodo, ki kliče BLAST programsko z Biopythonom.

Korak za korakom: preiskovanje identitete polja

  1. Pridobite zaporedje: shranite v datoteko kot FASTA.
  2. Osnovno preverjanje: dolžina, vsebina črk (ali je samo A/T/G/C ali je neznano »N«), GC razmerje (odstotek gvanin-citozin: razlikuje se glede na vrsto in regijo).
  3. BLAST: Iskanje v spletnem vmesniku NCBI ali programsko.
  4. Komentar: Poglejte e-vrednost najboljšega ujemanja (manjša kot je, manjša je verjetnost, da gre za naključje) in pokritost poizvedbe.
  5. Potrditev: Odprite ujemajoči se gen/protein v UniProt ali NCBI in preverite, ali se dejansko ujema s funkcijo, ki jo iščete.

AI vam pomaga kodirati v 2. koraku in komentirati v 4. koraku; vendar prave podatke v 3. in 5. koraku zagotovijo orodja sama in vi.

Kopirane predloge pozivov

Vloga: Ste asistent bioinformatike. Naloga: Preberite datoteko FASTA (sequences.fasta) z Biopythonom. Želim: zapisati ime, dolžino in GC razmerje za vsako zaporedje v tabelo; shranite rezultat kot CSV. Podajte delujočo kodo Python s komentarji.

Prevedi zaporedje DNK, ki ga imam, v zaporedje proteinov. Uporabite Biopython Seq.translate; pokaži stop kodon (*); označuje okvir za branje. Podajte kodo, razložite. Zaporedje: [FASTA]

Interpretirajte moj rezultat BLAST. Spodaj so vrednost-vrednost, odstotek identitete in stopnja pokritosti najboljših 5 ujemanj. Pojasnite mi, katero ujemanje je zanesljivo in zakaj, ne podajajte natančnih trditev o funkciji, povejte mi korake, ki jih moram preveriti. Tabela: [podatki]

Poravnajte dve beljakovinski zaporedji po parih in poiščite odstotek podobnosti. Uporabite Biopython pairwise2 ali Bio.Align; natisnite poravnavo berljivo. Podajte kodo in razložite shemo točkovanja.

Šibek poziv/močan poziv

Slabo: "Kateri gen je to zaporedje?"

Strong: "Imam zaporedje človeške DNK s 1140 baznimi pari (spodaj FASTA). Sam sem razstrelil to zaporedje; najboljše ujemanje je TP53, e-vrednost 0,0, identiteta 99,8 %, pokritost 100%. Pojasnite, zakaj je ta rezultat močan dokaz; vendar mi povejte, kateri 2 preveritvi moram opraviti, preden ugotovim njegovo delovanje."

Razlika: V močnem pozivu so dejanski podatki (dolžina, rezultat BLAST) zagotovljeni modelu; Od modela zahtevate, da interpretira dokaze, ki jih zagotovite, ne pa naj si jih "zapomni". Prisiljen je izdelati model na šibak poziv.

trije mini kovčki

Primer 1 – Napačen bralni okvir: Študent je prevedel zaporedje DNK v beljakovino, vendar od začetka, ne da bi našel pravilni začetni kodon (ATG). Rezultat je bila nesmiselna beljakovina, ki se je zgodaj ustavila. Ko je model preizkusil vse tri bralne okvire in napisal kodo, ki je našla najdaljši odprti bralni okvir (ORF), ki se začne z ATG, se je pojavila pravilna beljakovina s 380 aminokislinami.

Primer 2 – Zmota E-vrednosti: Tehnik je prijavil ujemanje BLAST z e-vrednostjo 2,0 kot "najdeno". Medtem ko e-vrednost, večja od 1, pomeni, da je ujemanje najverjetneje naključje. Model je to pojasnil in spomnil, da se e < 1e-5 običajno uporablja kot zanesljiv prag.

Primer 3 – Kontaminacija: EKSPLORAT bakterijskega zaporedja v laboratoriju je pokazal, da se človeška DNK najbolje ujema. To je bil znak kontaminacije vzorca. Umetna inteligenca je vzbudila upravičen sum z izjavo, da bi "nepričakovana vrsta ujemanja lahko kazala na kontaminacijo"; Tehnik je ponovil primer.

Primerjava: vloga umetne inteligence

Iskanje

umetna inteligenca

Orodje/baza podatkov

človeški

HITRO branje, GC/dolžina

piše kodo

Nadzoruje izhod

Prevod, ORF najdba

piše kodo

Poganja Biopython

Potrjuje okvir

id polja

Komentarji

Najdbe BLAST/NCBI

potrdi

Funkcijska trditev

ponuja predloge

UniProt daje dokaz

odloča

Pogoste napake

  • Prosimo model, naj si »zapomni« ID niza: Model si ne zapomni nizov; Uporabite BLAST.
  • Napačna razlaga e-vrednosti: majhno je dobro, veliko je slabo; Ne pozabite na prag.
  • Ne preverjanje bralnega okvirja: Napačen okvir proizvaja nesmiselne beljakovine.
  • Ignoriranje pokritosti: visoka identiteta, vendar nizka pokritost pomeni delno ujemanje.
  • Manjkajoča kontaminacija: Nepričakovano ujemanje vrst je resno opozorilo.
Pozor: samo zato, ker je zaporedje "99% podobno TP53", ne dokazuje, da to zaporedje nosi funkcijo TP53; To je močna hipoteza. Funkcija mora biti podprta z empiričnimi dokazi in opisi baze podatkov. Ni dovolj, da AI preprosto reče "to je tumor supresor."

Poravnava več zaporedij in osnova filogenije

Poravnava več deset zaporedij skupaj namesto le dveh se imenuje poravnava več zaporedij (MSA) in je osnova številnih analiz: iskanje ohranjenih regij (deli, ki so ostali nespremenjeni v evoluciji in so zato funkcionalno pomembni), gradnja filogenetskih dreves, prepoznavanje beljakovinskih družin. Orodja, kot so MAFFT, MUSCLE in Clustal, opravijo to delo. Umetna inteligenca napiše kodo, ki kliče ta orodja iz Pythona (na primer prek Biopythona) in vam pomaga interpretirati izhod; ampak poravnava sama naredi orodje, ne model "na pamet".

Pri razlagi MSA bodite pozorni na ohranjene stolpce: aminokislina, ki ostane enaka v vseh sekvencah, je najverjetneje kritična za delovanje proteina (npr. aktivno mesto encima). To daje močan namig o tem, zakaj je mutacija lahko škodljiva. Toda "ohranjeno = pomembno" je hipoteza; zahteva eksperimentalno preverjanje.

Preberite mojo datoteko za večkratno poravnavo (aligned.fasta), ki je izhod MAFFT, z Biopythonom. Izračunajte stopnjo zadrževanja za vsak stolpec; Seznam več kot 90% zaščitenih položajev. Pojasnite, zakaj so lahko ti položaji funkcionalnega pomena, ne zahtevajo dokončne funkcije.

Past mutacije in variantne interpretacije

Ko vidite spremembo črke (različico) v nizu, je velik preskok reči, da je "škodljiva". Večina variant je nevtralnih (neučinkovitih). Pri razlagi vpliva različice je treba pogledati namenske zbirke podatkov o različicah (kot je ClinVar) in podatke o pogostnosti prebivalstva (kot je gnomAD), ne pa besede AI. Če model trdi, da je različica "patogena", tega nikoli ne zapišite v klinični ali raziskovalni zaključek, ne da bi to potrdili s temi viri.

Baze podatkov za preverjanje

Poznavanje uradnih virov za potrditev vsake trditve v analizi serije je vaš najmočnejši ščit pred izmišljotinami umetne inteligence. Najpogosteje uporabljeni:

zbirka podatkov

za kaj

Tipična potrditev

NCBI GenBank/RefSeq

Sekvence DNA/RNA, genski zapisi

ID niza, dolžina

UniProt

Proteinska zaporedja in funkcije

Funkcija, število aminokislin

ansambel

Anotacija genoma, lokacije genov

Kartiranje genov in kromosomov

ClinVar

Klinični pomen variant

Patogena/nevtralna odločitev

gnomAD

Različna pogostnost v populaciji

redka/pogosta različica

AI lahko predlaga, katero od teh baz si morate ogledati; Toda naredite poizvedbo in preberete rezultat. "Model je rekel, da to pravi UniProt" ni potrditev; Potrditev je samostojno odpiranje strani UniProt.

Če povzamem

Analiza zaporedja je srce bioinformatike; FASTA, BLAST, poravnava in prevajanje so osnovne operacije. AI napiše kodo za te operacije in vam pomaga interpretirati njihove rezultate, vendar orodja (BLAST) in baze podatkov (NCBI, UniProt) zagotavljajo dejansko identifikacijo zaporedja. Pravilno razumevanje konceptov, kot so e-vrednost, pokritost in bralni okvir, je ključnega pomena za izogibanje napačnim sklepom. Trditev o funkciji vedno zahteva neodvisne dokaze.

Aplikacijska naloga

Vzemite vzorec zaporedja DNK (ali gen, ki ste ga prenesli iz NCBI). Naj AI izračuna dolžino in GC razmerje z Biopythonom, nato ga prevede v vseh treh bralnih okvirih in natisne kodo, ki najde najdaljši ORF. Zaženite rezultat. Nato sami poiščite to zaporedje v NCBI BLAST in naj model interpretira e-vrednost in stopnjo pokritosti najboljšega ujemanja. Potrdite trditev o funkciji modela v UniProtu.

kontrolni seznam

  • [ ] Pred obdelavo niza sem preveril dolžino in vsebino črk.
  • [ ] Pri prevodu sem uporabil pravilen bralni okvir.
  • [ ] Sam sem zagnal BLAST, nisem "opomnil" modela.
  • [ ] E-vrednost in razmerje pokritosti sem pravilno interpretiral.
  • [ ] Ocenil sem nepričakovano ujemanje vrst glede kontaminacije.
  • [ ] Trditev o funkciji sem potrdil z uradno bazo podatkov.