Jedinica 3 / 11

Analiza sekvenci i bioinformatika: DNA, RNA i proteini

Dobici:

  • Sposobnost ispisa koda osnovnih operacija analize sekvenci kao što su FASTA čitanje, prevođenje, poravnanje i BLAST i tumačenje rezultata
  • Sposobnost izbjegavanja netočnih zaključaka ispravnim tumačenjem pojmova kao što su e-vrijednost, stopa pokrivenosti i okvir čitanja
  • Sposobnost razumijevanja nužnosti potvrđivanja tvrdnje o funkciji niza službenim bazama podataka (NCBI, UniProt, Ensembl).

Najosnovniji podatak biologije je niz: niz DNK koji se sastoji od slova A, T, G, C; A, U, G, C sekvenca RNA; lanac od 20 slova aminokiselina proteina. Razumijemo što je gen, koliko su dvije vrste povezane i odnos između mutacije (promjene sekvence) i bolesti kroz te sekvence. U ovoj jedinici naučit ćemo koristiti umjetnu inteligenciju kao pomoćnika koda i tumačenja za analizu sekvenci: čitanje FASTA datoteka, prevođenje sekvenci, poravnanje (usklađivanje: usporedba dvije sekvence slovo po slovo i uočavanje njihovih sličnosti) i razumijevanje alata kao što je BLAST.

Kritično upozorenje od početka: umjetna inteligencija ne "zna" stvarnu funkciju niza; To govore samo službene baze (NCBI, UniProt, Ensembl) i empirijski dokazi.

Osnovni pojmovi i alati

  • FASTA: Format teksta koji pohranjuje nizove; Svaki niz sastoji se od retka zaglavlja koji počinje s > i redaka podniza ispod njega.
  • BLAST (Basic Local Alignment Search Tool): Alat koji uspoređuje niz koji imate s milijunima nizova u ogromnoj bazi podataka i pronalazi one najsličnije. “Kako izgleda ova serija?” standardni odgovor na pitanje.
  • Poravnanje: raspoređivanje dva ili više nizova tako da se slična područja nalaze jedno ispod drugog. To može biti parno ili višestruko poravnanje sekvenci (MSA).
  • Prijevod: Pretvaranje kodirajuće sekvence DNA/RNA u sekvencu aminokiselina putem trostrukih skupina slova (kodona).
  • Motiv: Kratki ponavljajući uzorak u nizu koji ima funkcionalno značenje (npr. mjesto vezivanja).
Savjet: Ne možete reći umjetnoj inteligenciji da "BLOSTI tu seriju"; Model ne može pristupiti bazi podataka BLAST. Ali "Kako da protumačim svoj BLAST rezultat, što znači e-vrijednost (E-vrijednost)?" Možete pitati, pa čak i napisati kod koji poziva BLAST programski s Biopythonom.

Korak po korak: istraživanje identiteta niza

  1. Dobijte slijed: spremite u datoteku kao FASTA.
  2. Osnovna provjera: duljina, sadržaj slova (je li to samo A/T/G/C ili postoji nepoznato "N"), GC omjer (postotak gvanin-citozina: varira ovisno o vrsti i regiji).
  3. BLAST: Pretraživanje u NCBI web sučelju ili programski.
  4. Komentar: Pogledajte e-vrijednost najboljeg podudaranja (što je manja, manja je vjerojatnost da se radi o slučajnosti) i pokrivenost upita.
  5. Potvrda: Otvorite odgovarajući gen/protein u UniProtu ili NCBI-u i provjerite odgovara li stvarno funkciji koju tražite.

AI vam pomaže kodirati u koraku 2 i komentirati u koraku 4; ali prave podatke u koracima 3 i 5 daju sami alati i vi.

Predlošci upita koji se mogu kopirati

Uloga: Vi ste asistent bioinformatike. Zadatak: Pročitajte FASTA datoteku (sequences.fasta) s Biopythonom. Želim: u tablicu upisati naziv, duljinu i GC omjer za svaki niz; spremite rezultat kao CSV. Dajte radni Python kod s komentarima.

Prevedi sekvencu DNK koju imam u sekvencu proteina. Koristite Biopython Seq.translate; pokazati stop kodon (*); označavaju okvir za čitanje. Navedite kod, objasnite. Redoslijed: [FASTA]

Protumačite moj BLAST rezultat. Ispod su vrijednost-vrijednost, postotak identiteta i stopa pokrivenosti 5 najboljih podudaranja. Objasnite mi koje je podudaranje pouzdano i zašto, nemojte iznositi točne tvrdnje o funkciji, recite mi korake koje trebam provjeriti. Tablica: [podaci]

Poravnajte dvije proteinske sekvence u paru i pronađite postotak sličnosti. Koristite Biopython pairwise2 ili Bio.Align; ispišite poravnanje čitljivo. Navedite šifru i objasnite shemu bodovanja.

Slab upit / Jak upit

Slab: "Koji je gen ovaj niz?"

Strong: "Imam ljudski DNK slijed od 1140 parova baza (FASTA u nastavku). Sam sam BLASTirao ovaj slijed; najbolje podudaranje je TP53, e-vrijednost 0,0, identitet 99,8%, pokrivenost 100%. Objasnite zašto je ovaj rezultat snažan dokaz; međutim, recite mi koje 2 provjere moram napraviti prije nego što utvrdim njegovu funkciju."

Razlika: u snažnom upitu stvarni podaci (dužina, BLAST rezultat) daju se modelu; Od modela tražite da protumači dokaze koje pružate, a ne da ih se "sjeća". Prisiljen je izmisliti model na slab poticaj.

tri mini kućišta

Slučaj 1 — Neispravan okvir za čitanje: Student je preveo sekvencu DNK u protein, ali ispočetka, bez pronalaska ispravnog početnog kodona (ATG). Rezultat je bio besmislen, rano prestajući protein. Kada je model isprobao sva tri okvira čitanja i napisao kod koji je pronašao najdulji otvoreni okvir čitanja (ORF) počevši s ATG, pojavio se točan protein od 380 aminokiselina.

Slučaj 2 — Pogreška E-vrijednosti: tehničar je prijavio BLAST podudaranje s e-vrijednošću 2,0 kao "pronađeno". S druge strane, e-vrijednost veća od 1 označava da je podudaranje najvjerojatnije slučajnost. Model je to objasnio i podsjetio da se e < 1e-5 općenito koristi kao pouzdani prag.

Slučaj 3 — Kontaminacija: EKSPLOATACIJA bakterijske sekvence u laboratoriju pokazala je ljudsku DNK kao najbolju podudarnost. To je bio znak kontaminacije uzorka. AI je pobudio opravdanu sumnju izjavom da bi "neočekivana vrsta podudaranja mogla biti indikacija kontaminacije"; Tehničar je ponovio primjer.

Usporedba: uloga umjetne inteligencije

Potraga

umjetna inteligencija

Alat/baza podataka

ljudski

BRZO čitanje, GC/duljina

piše kod

Kontrolira izlaz

Prijevod, ORF nalaz

piše kod

Pokreće Biopython

Potvrđuje okvir

ID polja

Komentari

BLAST/NCBI nalazi

potvrđuje

Zahtjev za funkciju

nudi prijedloge

UniProt daje dokaz

odlučuje

Uobičajene greške

  • Traženje od modela da "zapamti" ID niza: Model ne pamti nizove; Koristite BLAST.
  • Pogrešno tumačenje e-vrijednosti: malo je dobro, veliko je loše; Zapamtite prag.
  • Ne provjerava okvir za čitanje: pogrešan okvir proizvodi besmisleni protein.
  • Ignoriranje pokrivenosti: Visok identitet, ali niska pokrivenost znači djelomično podudaranje.
  • Nedostatak kontaminacije: Neočekivano podudaranje vrsta ozbiljno je upozorenje.
Oprez: Samo zato što je niz "99% sličan TP53" ne dokazuje da taj niz nosi funkciju TP53; To je jaka hipoteza. Funkcija mora biti potkrijepljena empirijskim dokazima i opisima baze podataka. Nije dovoljno da AI jednostavno kaže "ovo je supresor tumora."

Poravnanje više sekvenci i osnova filogenije

Usklađivanje desetaka sekvenci zajedno umjesto samo dvije naziva se višestruka sekvencija (MSA) i osnova je mnogih analiza: pronalaženje očuvanih regija (dijelova koji su ostali nepromijenjeni u evoluciji i stoga funkcionalno važni), izgradnja filogenetskih stabala, identificiranje obitelji proteina. Alati kao što su MAFFT, MUSCLE i Clustal obavljaju ovaj posao. AI ​​piše kod koji poziva te alate iz Pythona (putem Biopythona, na primjer) i pomaže vam u tumačenju rezultata; ali samo poravnanje čini alat, a ne model "napamet".

Kada tumačite MSA, obratite pozornost na očuvane stupce: aminokiselina koja ostaje ista u svim sekvencama najvjerojatnije je kritična za funkciju proteina (npr. aktivno mjesto enzima). To daje snažan trag zašto bi mutacija mogla biti štetna. Ali "sačuvano = značajno" je hipoteza; zahtijeva eksperimentalnu provjeru.

Pročitajte moju datoteku višestrukog poravnanja (aligned.fasta), koja je MAFFT izlaz, s Biopythonom. Izračunajte stopu zadržavanja za svaki stupac; Popis preko 90% zaštićenih pozicija. Objasnite zašto ti položaji mogu biti od funkcionalne važnosti, ne zahtijevaju konačnu funkciju.

Zamka mutacije i varijante interpretacije

Kada vidite promjenu slova (varijantu) u nizu, veliki je skok reći da je to "štetno". Većina varijanti je neutralna (neučinkovita). Pri tumačenju utjecaja varijante potrebno je pogledati namjenske baze podataka varijanti (kao što je ClinVar) i podatke o učestalosti populacije (kao što je gnomAD), a ne riječ umjetne inteligencije. Ako model tvrdi da je varijanta "patogena", nikada to ne upišite u klinički ili istraživački zaključak bez potvrde ovim izvorima.

Baze podataka za provjeru

Poznavanje službenih izvora za potvrdu svake tvrdnje u seriji analiza vaš je najjači štit od izmišljotina umjetne inteligencije. Najčešće korišteni:

baza podataka

za što

Tipična potvrda

NCBI GenBank/RefSeq

DNA/RNA sekvence, genski zapisi

ID niza, duljina

UniProt

Sekvence i funkcije proteina

Funkcija, broj aminokiselina

ansambl

Anotacija genoma, lokacije gena

Mapiranje gena i kromosoma

ClinVar

Klinički značaj varijanti

Patogena/neutralna odluka

gnomAD

Učestalost varijante u populaciji

rijetka/česta varijanta

AI može predložiti koju od ovih baza trebate pogledati; Ali postavite upit i pročitate rezultat. "Model je rekao da ovo kaže UniProt" nije potvrda; Potvrda je samostalno otvaranje UniProt stranice.

Ukratko

Analiza sekvenci srce je bioinformatike; FASTA, BLAST, poravnanje i prevođenje su osnovne operacije. AI piše kod za te operacije i pomaže vam u interpretaciji njihovih rezultata, ali alati (BLAST) i baze podataka (NCBI, UniProt) pružaju stvarnu identifikaciju sekvence. Ispravno razumijevanje koncepata kao što su e-vrijednost, pokrivenost i okvir čitanja ključno je za izbjegavanje pogrešnog zaključka. Tvrdnja o funkciji uvijek zahtijeva neovisne dokaze.

Zadatak aplikacije

Uzmite uzorak DNK sekvence (ili gen koji ste preuzeli s NCBI-a). Neka AI izračuna duljinu i GC omjer s Biopythonom, zatim ga prevede u sva tri okvira čitanja i ispiše kod koji pronalazi najduži ORF. Pokrenite rezultat. Zatim sami potražite ovaj niz u NCBI BLAST-u i neka model protumači e-vrijednost i stopu pokrivenosti najboljeg podudaranja. Potvrdite tvrdnju o funkcionalnosti modela u UniProtu.

popis za provjeru

  • [ ] Provjerio sam duljinu i sadržaj slova prije obrade niza.
  • [ ] Koristio sam ispravan okvir za čitanje u prijevodu.
  • [ ] Sam sam pokrenuo BLAST, nisam "podsjetio" model.
  • [ ] Ispravno sam protumačio e-vrijednost i omjer pokrivenosti.
  • [ ] Ocijenio sam neočekivano podudaranje vrste za kontaminaciju.
  • [ ] Potvrdio sam tvrdnju o funkciji u službenoj bazi podataka.