Jedinica 2 / 11

Analiza DNK/RNA sekvence: poravnanje, motiv, otvoreni okvir za čitanje i osnovna bioinformatika

Dobici:

  • Shvatite koncepte poravnanja sekvenci, pretraživanja motiva i otvorenog okvira za čitanje (ORF) i neka umjetna inteligencija proizvede izvršni, provjerljivi Biopython/analitički kod.
  • Sposobnost provjere okvira, lanca i verzije genoma pretpostavki u sekvenci i kodu proizvedenom umjetnom inteligencijom i upoređivanje rezultata s poznatom referencom
  • Sposobnost primjene discipline nekorištenja sekvenci koje je dala umjetna inteligencija iz glave i potvrđivanja svake sekvence iz primarnog izvora kao što je NCBI / Ensembl

Analiza sekvence je najosnovniji zadatak molekularne biologije: čitanje lanca DNK (ili U u RNK) koji se sastoji od slova A, T, G, C, upoređivanje i pronalaženje značajnih regija (geni, motivi, regulatorni nizovi) unutar njega. U ovoj jedinici ćete naučiti kako koristiti umjetnu inteligenciju (AI) kao partnera za pisanje i tumačenje koda u ovim radovima; ali ćete naučiti zašto uvijek trebate provjeriti rezultat pomoću izvršnog koda i primarnog izvora. Naš osnovni skup alata biće Biopython (Python biblioteka napisana za rad sa biološkim sekvencama) i zvanični alati za poravnanje.

Prvo upozorenje: LLM može proizvesti greške iz memorije, čak i kratak niz. Može pomiješati slovo kada se od njega traži da izračuna obrnuti komplement sekvence direktno. Stoga, nikada nemojte izvoditi operacije sa stringovima oslanjajući se na tekstualni odgovor AI, već s kodom koji AI piše i vi pokrećete.

Osnovni koncepti: sa čime radimo?

  • Osnovni par (bp): slovna jedinica DNK. Ljudski genom je otprilike 3,2 milijarde bp.
  • Niz: DNK je dvostruka spirala; Ove dvije niti su jedna drugoj antikomplement. Važno je u kojoj niti je deklarirana varijanta.
  • Kodon: Grupa od tri baze; svaki kodon odgovara aminokiselini (građevinski blok proteina). Na primjer, ATG je obično početni kodon (metionin).
  • Otvoreni okvir čitanja (ORF): Regija sekvence koja može kodirati protein, proteže se od startnog kodona do stop kodona (TAA, TAG, TGA).
  • Motiv: Ponavljajući uzorak kratke sekvence koji ima specifičnu funkciju; na primjer, regija za koju se veže transkripcijski faktor.
  • Poravnanje: Raspoređivanje dvije ili više sekvenci jedna ispod druge kako bi se uočile njihove sličnosti.

Korak po korak: radni tok analize sekvence

1. Nabavite seriju iz pouzdanog izvora. Nemojte terati AI da kaže "podsjeti" sekvencu; Preuzmite ga kao FASTA (standardni tekstualni format koji pohranjuje sekvence) iz izvora kao što je NCBI, Ensembl, itd. i dajte ovu sekvencu AI.

2. Obavite transakciju sa kodom. Neka operacije kao što su obrnuti komplement, transkripcija (DNK→RNA), translacija (RNA→protein), GC omjer obavljaju Biopython kod i pokrenite kod sami.

3. Provjerite okvir i pretpostavke niti. Zamolite ga/nju da jasno navede u redu za komentare koja nit i u kom okviru za čitanje kod se pokreće.

4. Uporedite rezultat sa poznatom referencom. Spojite protein ili ORF koji ste proizveli sa poznatim zapisom u bazi podataka. Dužina i početna neusklađenost obuhvataju najčešće greške.

5. Potvrdite poravnanje službenim alatom. Ne dozvolite da AI "očne jabučice" uvidi sličnost dvije serije; Dobijte numerički rezultat pomoću BLAST-a (alatka za pretraživanje sličnosti sekvenci) ili biblioteke poravnanja.

Savjet: Uvijek neka vam dužina žice bude prva provjera. Broj aminokiselina proteina je otprilike jedna trećina broja baza kodirajuće sekvence (isključujući stop kodon). Ako dužina ne odgovara, okvir ili konac nisu u redu.

tri mini kofera

Slučaj 1 — Inverzna greška komplementa. Student je pitao AI o obrnutom komplementu sekvence 5'-GATTACA-3'; AI je dao "TGTAATC" (tačno). Međutim, u dužem nizu od 20 baza, AI je preskočio bazu i rezultat je bio 19 baza. Kada ga je učenik pokrenuo sa Seq("...").reverse_complement() u Biopythonu, trebalo je 20 baza i uhvatio grešku. Izgubljeno vrijeme: 2 minute.

Slučaj 2 — Pomak okvira. Istraživač je imao kodirajuću sekvencu od 900 baza prevedenu u protein; AI je tekstom "čitao" protein od 280 aminokiselina. Očekivano je bilo 299 aminokiselina (900/3 − 1 stop). Razlika je bila u tome što je AI započeo od drugog nukleotida. Tačna dužina je dobijena kada je kod pokrenut od prvog okvira.

Slučaj 3 — Potvrda dobijena. Laboratorijski tehničar je ispitao sekvence 16S rRNA dva bakterijska soja pitajući "da li su isti?" pitao je AI; "Najvjerovatnije isto", rekao je AI. Kada je tehničar pokrenuo BLAST, vidio je 97,8% sličnosti i 12 osnovnih razlika - kritičnu razliku za diskriminaciju na nivou vrste. Da nije bilo brojčanog rezultata, u izvještaj bi se unio pogrešan "isti" rezultat.

Primjer: Biopython stream koji se može provjeriti

from Bio.Seq import Seq# Uvezite sekvencu iz FASTA koji ste preuzeli sa NCBI; Nemojte terati AI da kaže "podsjeti me". dna = Seq("ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG")print("Dužina (bp):", len(dna))print("GC stopa (%):", round(100 * (dna.count("G") + dna.count("C")) / verz)led(dna), 1 dna.reverse_complement())# Prijevod iz okvira 1; do stop kodonprotein = dna.translate(to_stop=True)print("Protein:", protein, "| Dužina (mm):", len(protein))

Iako AI piše ovaj kod, vidite točnost izlaza tako što ćete ga pokrenuti. Dužina, GC odnos i protein su uporedivi sa poznatom referencom.

Četiri šablona za kopiranje

1) Provjerljivi rad niza:

Napišite izvršni Biopython kod za sljedeću FASTA sekvencu: [sekvenca/zadatak]. Izračunajte dužinu, GC omjer, obrnuti komplement i prijevod iz okvira 1. Komentirajte koji se konac i okvir pretpostavljaju. Nemojte proizvoditi sekvencu; Samo koristi sekvencu koju sam ti dao.

2) ORF skrining:

Napišite Python kod koji pronalazi sve otvorene okvire čitanja u datom nizu (i sva tri na opcionalnom obrnutom nizu). Izvijestite o početnoj poziciji, dužini i prevedenom proteinu za svaki ORF. Također označite najduži ORF.

3) Potvrda poravnanja:

Želim da uporedim dva niza. "Slično?" Ne sudite po oku; napisati kod za poravnanje u paru i brojčano prijaviti procenat sličnosti i broj razlike. Izvor: [serija 1], [serija 2].

4) Pretraga motiva:

Potražite sljedeći motiv (također kao regularni izraz) u datom nizu: [motiv]. Navedite lokaciju (na bazi 1) svih utakmica. Napišite i specificirajte podudaranja koja se preklapaju.

Slaba prompt / Jaka prompt

Slabo: "Napišite protein ove sekvence: ATGGCC..."

Problem: AI prevodi s tekstom, može zbuniti okvir/nit, ne može provjeriti dužinu.

Snažno: "Napišite izvršni Biopython kod koji prevodi sljedeću sekvencu iz okvira 1, javlja dužinu i stop kodon; nemojte mijenjati sekvencu, samo koristite onaj koji sam dao: ATGGCC..."

Zašto je moćan: Obrada se vrši u kodu, okvir je jasan, izlaz se može verifikovati numerički.

Quest

pogrešan pristup

pravi pristup

obrnuti komplement

Neka AI piše tekstom

Biopython reverse_complement()

prevod

Neka AI prevodi iz memorije

Kod, specificirajući okvir

sličnost

"Slično?" odluka oka

BLAST/skor poravnanja

motiv

Neka AI broji rukom

Šifra, sa listom lokacija

Izvor niza

Neka AI zapamti

FASTA iz NCBI/Ensembl

Uobičajene greške

  • Ne specificirajući okvir. Prevođenje iz pogrešnog okvira daje kratak ili neispravan protein.
  • Zapetljavanje pređe. Varijanta ili motiv može biti u obrnutom niti; pretpostavku teme treba napisati.
  • Natjerati AI da zapamti sekvencu. LLM ne može proizvesti dugačak niz bez grešaka; Vi uvek dajete seriju.
  • Sudeći po oku za sličnost. Nemojte reći "isto/slično" bez brojčane ocjene.
  • RNA/DNK mješavina. Miješanje U sa T ometa translaciju; razjasniti vrstu unosa.
Oprez: Čak i visok postotak sličnosti u BLAST-u i sličnim alatima ne znači nužno biološki "identičan"; E-vrijednost (mogućnost vjerovatnoće) i dužina usklađenog regiona treba procijeniti zajedno.

Dubina: ispravno očitavanje BLAST izlaza

AI interpretacija BLAST rezultata štedi vrijeme; Ali nemojte donositi nikakve odluke dok sami ne pročitate tri izdanja. Prva je e-vrijednost (očekivana vrijednost): očekivani broj puta da se ovaj rezultat može dogoditi slučajno; Vrlo mala vrijednost kao što je 1e-50 znači jaka, vrijednost poput 0,1 je skoro šum. Drugi je pokrivenost upita: koji procenat sekvence upita pokriva podudaranje; 98% sličnosti, ali samo 20% pokrivenosti znači da je mali dio niza sličan i obmanjujući. Treći je postotak identiteta. Bez ova tri čitanja zajedno, visok procenat sam po sebi ne dokazuje ništa.

Konkretan primjer: istraživač je BLAST UKLJUČIO fragment gena koji je upravo sekvencirao; "99% podudaranja sa ljudskim BRCA2, isti gen", rekao je AI. Kada je istraživač pogledao izlaz, vidio je da je pokrivenost bila samo 15% — odgovarajući dio je bio samo kratka regija koja se ponavlja od hiljada baza BRCA2. Ispravno tumačenje nije bilo "isti gen" već "dijeli zajednički motiv ponavljanja". Čitanje opsega spriječilo je potpunu pogrešnu identifikaciju.

BLAST kolona

šta kaže

trap

E-vrijednost

verovatnoća slučajnosti

Ako je visoka, utakmica može biti besmislena

Pokrivenost upita

Pokrivena stopa upita

Ako je nizak, postotak je pogrešan

procenat identiteta

Odgovarajuća osnovna stopa

sama nije dovoljna

bitscore

Normalizovana snaga poravnanja

Tumačeno prema dužini

5) BLAST izlazni predložak interpretacije:

Protumačite sljedeću BLAST tabelu, ali nemojte odlučivati: sumirajte e-vrijednost, pokrivenost upita i postotak identiteta za svaki red posebno i naznačite koje pragove treba ispuniti prije nego što se donese zaključak poput "isti gen". Tabela: [paste].

Ukratko

  • Operacije sekvence (obrnuto dopunjavanje, prevod, ORF, GC odnos) treba da se rade sa kodom koji AI piše i koji vi pokrećete, a ne sa tekstualnim odgovorom AI.
  • Pretpostavke okvira i niti uvijek trebaju biti eksplicitno navedene; provjera dužine je najbrži alat za hvatanje grešaka.
  • Uvek uzmite sekvencu iz pouzdanog izvora (NCBI, Ensembl); Nemojte terati AI da ga zapamti.
  • Sličnost i usklađenost se procjenjuju službenim alatima i brojčanim ocjenama, a ne očima.

Zadatak aplikacije

Preuzmite kratku sekvencu kodiranja iz pouzdanog izvora (npr. NCBI). Sa predlošcima 1 i 2 iznad, zatražite od AI Biopython kod, pokrenite kod; Uporedite dužinu i sekvencu proteina koji ste proizveli sa poznatim zapisom u bazi podataka. Ako pronađete neusklađenost, pokušajte je popraviti promjenom okvira/pretpostavke niti i zabilježite proces.

kontrolna lista

  • [ ] Dobio sam sekvencu iz pouzdanog izvora, nisam imao AI da je zapamti.
  • [ ] Izveo sam operacije niza sa izvršnim kodom.
  • [ ] Jasno sam precizirao okvir i pretpostavku niti.
  • [ ] Uporedio sam protein/ORF dužinu sa referencom.
  • [ ] Procijenio sam sličnost sa službenim alatom i brojčanim rezultatom.
  • [ ] Provjerio sam razdvajanje RNA/DNK i U/T.