Jedinica 3 / 11

Analiza sekvenci i bioinformatika: DNK, RNK i proteini

Dobici:

  • Mogućnost štampanja koda osnovnih operacija analize sekvence kao što su FASTA čitanje, prevođenje, poravnanje i BLAST i interpretacija rezultata
  • Sposobnost izbjegavanja pogrešnih zaključaka pravilnim tumačenjem pojmova kao što su e-vrijednost, stopa pokrivenosti i okvir čitanja
  • Sposobnost razumevanja neophodnosti potvrđivanja zahteva funkcije sekvence sa zvaničnim bazama podataka (NCBI, UniProt, Ensembl).

Najosnovniji podatak biologije je sekvenca: sekvenca DNK koja se sastoji od slova A, T, G, C; A, U, G, C sekvenca RNK; lanac od 20 aminokiselinskih slova proteina. Razumijemo šta je gen, koliko su dvije vrste povezane i odnos između mutacije (promjene u sekvenci) i bolesti kroz ove sekvence. U ovoj cjelini naučit ćemo koristiti umjetnu inteligenciju kao pomoćnik koda i interpretacije za analizu sekvenci: čitanje FASTA datoteka, prevođenje sekvenci, poravnanje (poravnanje: upoređivanje dvije sekvence slovo po slovo i uočavanje njihovih sličnosti) i razumijevanje alata kao što je BLAST.

Kritično upozorenje od samog početka: AI ne "zna" stvarnu funkciju sekvence; To govore samo službene baze podataka (NCBI, UniProt, Ensembl) i empirijski dokazi.

Osnovni koncepti i alati

  • FASTA: Format teksta koji pohranjuje nizove; Svaki niz se sastoji od reda zaglavlja koji počinje sa > i linija podniza ispod njega.
  • BLAST (Basic Local Alignment Search Tool): Alat koji poredi sekvencu koju imate sa milionima sekvenci u ogromnoj bazi podataka i pronalazi one najsličnije. “Kako izgleda ova serija?” standardni odgovor na pitanje.
  • Poravnanje: Raspoređivanje dva ili više nizova tako da su slične regije postavljene jedna ispod druge. To može biti parno ili višestruko poravnanje sekvenci (MSA).
  • Prevod: Pretvaranje DNK/RNA kodirajuće sekvence u sekvencu aminokiselina preko trostrukih grupa slova (kodona).
  • Motiv: Kratak obrazac koji se ponavlja u nizu koji ima funkcionalno značenje (npr. mjesto vezivanja).
Savjet: Ne možete reći AI-u da "RASTUDI tu seriju"; Model ne može pristupiti bazi podataka BLAST. Ali "Kako da protumačim svoj BLAST rezultat, šta znači e-vrijednost (E-vrijednost)?" Možete pitati, pa čak i napisati kod koji poziva BLAST programski uz Biopython.

Korak po korak: istraživanje identiteta niza

  1. Dobijte sekvencu: sačuvajte u datoteku kao FASTA.
  2. Osnovna provjera: dužina, sadržaj slova (da li je to samo A/T/G/C ili postoji nepoznato “N”), GC omjer (procenat guanin-citozina: varira od vrste i regije).
  3. BLAST: Pretraživanje u NCBI web interfejsu ili programski.
  4. Komentar: Pogledajte e-vrijednost najboljeg podudaranja (što je manja, manja je vjerovatnoća da je slučajnost) i pokrivenost upita.
  5. Potvrda: Otvorite odgovarajući gen/protein u UniProt ili NCBI i provjerite da li stvarno odgovara funkciji koju tražite.

AI vam pomaže kodirati u koraku 2 i komentirati u koraku 4; ali prave podatke u koracima 3 i 5 daju sami alati i vi.

Predlošci upita koji se mogu kopirati

Uloga: Vi ste asistent za bioinformatiku. Zadatak: Pročitajte FASTA fajl (sequences.fasta) sa Biopython-om. Želim: upisati ime, dužinu i GC omjer za svaku sekvencu u tabelu; sačuvajte rezultat kao CSV. Dajte radni Python kod sa komentarima.

Prevedite DNK sekvencu koju imam u sekvencu proteina. Koristite Biopython Seq.translate; prikaži stop kodon (*); označi okvir za čitanje. Dajte kod, objasnite. Sekvenca: [FASTA]

Protumačite moj BLAST rezultat. Ispod su vrijednost-vrijednost, postotak identiteta i stopa pokrivenosti 5 najboljih utakmica. Objasnite mi koje je podudaranje pouzdano i zašto, nemojte tvrditi točne funkcije, recite mi korake koje moram provjeriti. Tabela: [podaci]

Poravnajte dvije proteinske sekvence u paru i pronađite postotak sličnosti. Koristite Biopython pairwise2 ili Bio.Align; odštampajte čitljivo poravnanje. Dajte kod i objasnite shemu bodovanja.

Slaba prompt / Jaka prompt

Slabo: "Koji je gen ovaj niz?"

Snažan: "Imam ljudsku DNK sekvencu od 1140 parova baza (FASTA ispod). Sam sam BLASTirao ovu sekvencu; najbolje podudaranje je TP53, e-vrijednost 0,0, identitet 99,8%, pokrivenost 100%. Objasnite zašto je ovaj rezultat jak dokaz; međutim, recite mi koje dvije provjere trebam izvršiti prije nego što izvršim njegovu funkciju."

Razlika: U jakom promptu, stvarni podaci (dužina, BLAST rezultat) se daju modelu; Tražite od modela da protumači dokaze koje dajete, a ne da ih se "sećaju". On je primoran da izmisli model na slabom pozivu.

tri mini kofera

Slučaj 1 — Netačan okvir za čitanje: Učenik je preveo DNK sekvencu u protein, ali od početka, bez pronalaženja ispravnog startnog kodona (ATG). Rezultat je bio besmislen protein koji se rano zaustavlja. Kada je model isprobao sva tri okvira čitanja i napisao kod koji je pronašao najduži otvoreni okvir čitanja (ORF) počevši od ATG, pojavio se ispravan protein od 380 aminokiselina.

Slučaj 2 — Zabluda E-vrednosti: Tehničar je prijavio BLAST podudaranje sa e-vrednošću 2,0 kao "pronađeno". Dok e-vrijednost veća od 1 ukazuje da je podudaranje najvjerovatnije slučajnost. Model je to objasnio i podsjetio da se e < 1e-5 općenito koristi kao pouzdan prag.

Slučaj 3 — Kontaminacija: BLAST bakterijske sekvence u laboratoriji pokazao je ljudski DNK kao najbolji spoj. Ovo je bio znak kontaminacije uzorka. AI je izazvao pravu sumnju navodeći da „neočekivani tip podudaranja može ukazivati ​​na kontaminaciju“; Tehničar je ponovio primjer.

Poređenje: uloga umjetne inteligencije

Quest

umjetna inteligencija

Alat/baza podataka

ljudski

FASTA čitanje, GC/dužina

piše kod

Kontrolira izlaz

Prevod, ORF nalaz

piše kod

Pokreće Biopython

Potvrđuje okvir

array id

Komentari

BLAST/NCBI nalazi

potvrđuje

Zahtjev za funkciju

nudi prijedloge

UniProt daje dokaz

odlučuje

Uobičajene greške

  • Traženje od modela da "zapamti" ID niza: Model ne pamti žice; Koristite BLAST.
  • Pogrešno tumačenje e-vrijednosti: malo je dobro, veliko je loše; Zapamtite prag.
  • Ne provjeravam okvir za čitanje: Pogrešan okvir proizvodi besmisleni protein.
  • Zanemarivanje pokrivenosti: visok identitet, ali niska pokrivenost znači djelomično podudaranje.
  • Nedostaje kontaminacija: Neočekivano podudaranje vrsta je ozbiljno upozorenje.
Oprez: Samo zato što je sekvenca "99% slična TP53" ne dokazuje da ta sekvenca nosi funkciju TP53; To je jaka hipoteza. Funkcija mora biti podržana empirijskim dokazima i opisima baze podataka. Nije dovoljno da AI jednostavno kaže „ovo je supresor tumora“.

Višestruko poravnanje sekvenci i osnova filogenije

Poravnavanje desetina sekvenci zajedno, a ne samo dvije, naziva se višestruko poravnanje sekvenci (MSA) i osnova je mnogih analiza: pronalaženje očuvanih regija (dijelova koji su ostali nepromijenjeni u evoluciji i stoga funkcionalno važni), izgradnja filogenetskih stabala, identifikacija proteinskih porodica. Alati kao što su MAFFT, MUSCLE i Clustal rade ovaj posao. AI piše kod koji poziva ove alate iz Pythona (preko Biopythona, na primjer) i pomaže vam da tumačite izlaz; ali samo poravnanje čini alat, a ne model "napamet".

Kada tumačite MSA, obratite pažnju na očuvane kolone: ​​aminokiselina koja ostaje ista u svim sekvencama je najvjerovatnije kritična za funkciju proteina (npr. aktivno mjesto enzima). Ovo daje snažan nagovještaj zašto bi mutacija mogla biti štetna. Ali "očuvan = značajan" je hipoteza; zahtijeva eksperimentalnu provjeru.

Pročitajte moj fajl višestrukog poravnanja (aligned.fasta), koji je MAFFT izlaz, sa Biopython-om. Izračunajte stopu zadržavanja za svaku kolonu; Navedite preko 90% zaštićenih pozicija. Objasnite zašto ovi položaji mogu biti od funkcionalnog značaja, ne pretendujte na definitivnu funkciju.

Zamka mutacije i interpretacije varijanti

Kada vidite promjenu slova (varijantu) u nizu, veliki je skok reći da je "štetno". Većina varijanti je neutralna (neefikasna). Kada se tumači uticaj varijante, potrebno je pogledati namenske baze podataka varijanti (kao što je ClinVar) i podatke o učestalosti populacije (kao gnomAD), a ne reč veštačke inteligencije. Ako model tvrdi da je varijanta "patogena", nikada to ne upišite u klinički ili istraživački zaključak, a da to ne potvrdite ovim izvorima.

Baze baze podataka za verifikaciju

Poznavanje zvaničnih izvora za potvrdu svake tvrdnje u analizi serije vaš je najjači štit od izmišljotina umjetne inteligencije. Najčešće korišteni:

baza podataka

za šta

Tipična potvrda

NCBI GenBank/RefSeq

DNK/RNA sekvence, genski zapisi

ID niza, dužina

UniProt

Proteinske sekvence i funkcije

Funkcija, broj aminokiselina

ansambl

Oznaka genoma, lokacije gena

Mapiranje gena i hromozoma

ClinVar

Klinički značaj varijanti

Patogena/neutralna odluka

gnomAD

Učestalost varijanti u populaciji

rijetka/česta varijanta

AI može predložiti koju od ovih baza trebate pogledati; Ali vi postavljate upit i čitate rezultat. „Model je rekao da je to ono što UniProt kaže“ nije potvrda; Potvrda je otvaranje UniProt stranice.

Ukratko

Analiza sekvenci je srce bioinformatike; FASTA, BLAST, poravnanje i prevođenje su osnovne operacije. AI piše kod za ove operacije i pomaže vam da interpretirate njihove rezultate, ali alati (BLAST) i baze podataka (NCBI, UniProt) pružaju stvarnu identifikaciju sekvence. Ispravno razumijevanje koncepata kao što su e-vrijednost, pokrivenost i okvir za čitanje ključno je za izbjegavanje pogrešnog zaključka. Zahtjev funkcije uvijek zahtijeva nezavisan dokaz.

Zadatak aplikacije

Uzmite uzorak DNK sekvence (ili gen koji ste preuzeli sa NCBI). Neka AI izračuna dužinu i GC omjer s Biopythonom, zatim ga prevede u sva tri okvira čitanja i ispiše kod koji pronađe najduži ORF. Pokrenite rezultat. Zatim sami potražite ovu sekvencu u NCBI BLAST-u i neka model interpretira e-vrijednost i stopu pokrivenosti najboljeg podudaranja. Potvrdite funkcionalnu tvrdnju modela u UniProtu.

kontrolna lista

  • [ ] Provjerio sam dužinu i sadržaj slova prije obrade niza.
  • [ ] Koristio sam ispravan okvir za čitanje u prijevodu.
  • [ ] Sam sam pokrenuo BLAST, nisam "podsjetio" modela.
  • [ ] Ispravno sam protumačio e-vrijednost i omjer pokrivenosti.
  • [ ] Procijenio sam neočekivane vrste koje odgovaraju kontaminaciji.
  • [ ] Potvrdio sam zahtjev za funkciju sa službenom bazom podataka.