Jednotka 2 / 11

DNA/RNA sekvenčná analýza: zarovnanie, motív, otvorený čítací rámec a základná bioinformatika

zisky:

  • Pochopte koncepty zarovnania sekvencií, vyhľadávania motívov a otvoreného čítacieho rámca (ORF) a nechajte umelú inteligenciu vytvoriť spustiteľný, overiteľný kód Biopython/analýzu.
  • Schopnosť skontrolovať predpoklady verzie rámca, vlákna a genómu v sekvencii a kóde vytvorenom umelou inteligenciou a porovnať výsledok so známou referenciou
  • Schopnosť uplatniť disciplínu nepoužívať žiadne sekvencie dané umelou inteligenciou z hlavy a potvrdiť každú sekvenciu z primárneho zdroja, ako je NCBI / Ensembl

Sekvenčná analýza je najzákladnejšou úlohou molekulárnej biológie: čítať reťazec DNA (alebo U v RNA) pozostávajúci z písmen A, T, G, C, porovnávať ho a nájsť v ňom zmysluplné oblasti (gény, motívy, regulačné sekvencie). V tejto lekcii sa naučíte používať umelú inteligenciu (AI) ako partnera na písanie a interpretáciu kódu v týchto prácach; ale dozviete sa, prečo by ste mali vždy overiť výsledok pomocou spustiteľného kódu a primárneho zdroja. Našou základnou súpravou nástrojov bude Biopython (knižnica Pythonu napísaná na prácu s biologickými sekvenciami) a oficiálne nástroje na zarovnávanie.

Najprv varovanie: LLM môže produkovať chyby z pamäte, dokonca aj krátke sekvencie. Môže zamieňať písmeno, keď je požiadaný o výpočet opačného doplnku sekvencie priamo na mieste. Preto nikdy nevykonávajte reťazcové operácie spoliehaním sa na textovú odpoveď AI, ale s kódom, ktorý AI napíše a spustíte.

Základné pojmy: s čím pracujeme?

  • Pár báz (bp): Písmenová jednotka DNA. Ľudský genóm má približne 3,2 miliardy bp.
  • Vlákno: DNA je dvojitá špirála; Tieto dve vlákna sú vzájomným antikomplementom. Je dôležité, v akom vlákne je variant deklarovaný.
  • kodón: skupina troch báz; každý kodón zodpovedá aminokyseline (stavebnému bloku proteínu). Napríklad ATG je zvyčajne štartovací kodón (metionín).
  • Otvorený čítací rámec (ORF): Oblasť sekvencie, ktorá môže kódovať proteín, siahajúca od štartovacieho kodónu po stop kodón (TAA, TAG, TGA).
  • Motív: Opakujúci sa vzor krátkej sekvencie, ktorý má špecifickú funkciu; napríklad oblasť, na ktorú sa viaže transkripčný faktor.
  • Zarovnanie: Usporiadanie dvoch alebo viacerých sekvencií pod sebou, aby ste videli ich podobnosti.

Krok za krokom: pracovný postup sekvenčnej analýzy

1. Získajte sériu zo spoľahlivého zdroja. Nenechajte AI povedať „pripomenúť“ sekvenciu; Stiahnite si ju ako FASTA (štandardný textový formát, ktorý ukladá sekvencie) zo zdroja, ako je NCBI, Ensembl atď. a dajte túto sekvenciu AI.

2. Nechajte transakciu vykonať pomocou kódu. Nechajte si vykonať operácie ako reverzný komplement, transkripciu (DNA→RNA), transláciu (RNA→proteín), pomer GC pomocou kódu Biopython a spustite kód sami.

3. Skontrolujte predpoklady rámca a vlákna. Požiadajte ho, aby do komentára jasne uviedol, ktoré vlákno a v akom čítacom rámci kód beží.

4. Porovnajte výsledok so známou referenciou. Porovnajte proteín alebo ORF, ktorý ste vytvorili, so známym záznamom v databáze. Dĺžka a počiatočný nesúlad zachytávajú najčastejšie chyby.

5. Potvrďte zarovnanie oficiálnym nástrojom. Nedovoľte, aby AI ​​„očná guľa“ pripomínala podobnosť dvoch sérií; Získajte číselné skóre pomocou BLAST (nástroj na vyhľadávanie podobnosti sekvencií) alebo knižnice zarovnania.

Tip: Vždy nechajte dĺžku šnúrky ako prvú kontrolu. Počet aminokyselín proteínu je približne jedna tretina počtu báz kódujúcej sekvencie (okrem stop kodónu). Ak dĺžka nesedí, rám alebo závit sú nesprávne.

tri mini prípady

Prípad 1 – Chyba inverzného doplnku. Študent sa opýtal AI na reverzný komplement sekvencie 5'-GATTACA-3'; Umelá inteligencia dala „TGTAATC“ (správne). Avšak v dlhšej sekvencii 20 báz AI preskočila bázu a výsledkom bolo 19 báz. Keď to študent spustil pomocou Seq("...").reverse_complement() v Biopythone, trvalo to 20 báz a zachytilo chybu. Strata času: 2 minúty.

Prípad 2 – Posun rámu. Výskumník mal 900-bázovú kódujúcu sekvenciu preloženú do proteínu; AI „prečíta“ 280 aminokyselinový proteín textom. Očakávaných bolo 299 aminokyselín (900/3 − 1 stop). Rozdiel bol v tom, že AI začala od druhého nukleotidu. Správna dĺžka bola získaná pri spustení kódu od prvého rámca.

Prípad 3 – Získané potvrdenie. Laboratórny technik skúmal sekvencie 16S rRNA dvoch bakteriálnych kmeňov otázkou „sú rovnaké?“ spýtal sa AI; "S najväčšou pravdepodobnosťou to isté," povedala AI. Keď technik spustil BLAST, videl 97,8% podobnosť a 12 základných rozdielov - kritický rozdiel pre diskrimináciu na úrovni druhov. Ak by nebolo žiadne číselné skóre, do správy by sa zapísal nesprávny „rovnaký“ výsledok.

Príklad: overiteľný tok Biopython

z Bio.Seq import Seq# Importujte sekvenciu z FASTA, ktorú ste stiahli z NCBI; Nenechajte AI hovoriť „pripomeňte mi“. dna = Seq("ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG")print("Dĺžka (bp):", len(dna))print("GC rate (%):", round(100 * (dna.count("G") + dna.count("C")) / len(dna), 1)))print("Reverse frame"("Reverse)"print("Reverse") 1; až po stop kodónproteín = dna.translate(to_stop=True)print("Proteín:", proteín, "| Dĺžka (mm):", len(proteín))

Aj keď tento kód napíše AI, jeho spustením uvidíte presnosť výstupu. Dĺžka, pomer GC a proteín sú porovnateľné so známou referenciou.

Štyri kopírovateľné šablóny

1) Overiteľná operácia poľa:

Napíšte spustiteľný kód Biopython pre nasledujúcu sekvenciu FASTA: [sekvencia/úloha]. Vypočítajte dĺžku, pomer GC, reverzný doplnok a posun zo snímky 1. Do komentára uveďte, ktorý závit a rám sa predpokladá. Nevytvárajte sekvenciu; Stačí použiť postupnosť, ktorú som vám dal.

2) Skríning ORF:

Napíšte Python kód, ktorý nájde všetky otvorené čítacie rámce v danej sekvencii (a všetky tri na voliteľnom reverznom reťazci). Uveďte počiatočnú polohu, dĺžku a translatovaný proteín pre každý ORF. Označte aj najdlhší ORF.

3) Potvrdenie zarovnania:

Chcem porovnať dve polia. "Podobné?" Nesúď podľa očí; napíšte kód párového zarovnania a číselne uveďte percento podobnosti a číslo rozdielu. Zdroj: [1. séria], [2. séria].

4) Hľadanie motívu:

Vyhľadajte v zadanom reťazci nasledujúci motív (aj ako regulárny výraz): [motív]. Uveďte umiestnenie (na základe 1) všetkých zápasov. Napíšte a špecifikujte aj prekrývajúce sa zhody.

Slabá výzva / Silná výzva

Slabé: "Napíšte proteín tejto sekvencie: ATGGCC..."

Problém: AI prekladá text, môže zamieňať rámec/vlákno, nemôže overiť dĺžku.

Strong: "Napíšte spustiteľný kód Biopython, ktorý preloží nasledujúcu sekvenciu z rámca 1, oznámi dĺžku a stop kodón; nemeňte sekvenciu, použite len tú, ktorú som dal: ATGGCC..."

Prečo je výkonný: Spracovanie prebieha v kóde, framework je prehľadný, výstup je možné overiť numericky.

Quest

nesprávny prístup

správny prístup

spätný doplnok

Nechajte AI písať textom

Biopython reverse_complement()

preklad

Nechajte AI prekladať z pamäte

Kód, ktorý špecifikuje rámec

podobnosť

"Podobné?" očné rozhodnutie

BLAST/skóre zarovnania

motív

Nechajte AI počítať ručne

Kód so zoznamom miest

Zdroj poľa

Nech si AI pamätá

FASTA od NCBI/Ensembl

Časté chyby

  • Bez špecifikácie rámca. Translácia z nesprávneho rámca poskytuje krátky alebo chybný proteín.
  • Zamotanie priadze. Variant alebo motív môže byť obrátený; vlákno predpoklad by mal byť napísaný.
  • Aby si AI zapamätala sekvenciu. LLM nemôže produkovať dlhý reťazec bez chýb; Vždy poskytujete sériu.
  • Súdiac podľa oka na podobnosť. Nehovorte „rovnaké/podobné“ bez číselného skóre.
  • Zmes RNA/DNA. Miešanie U s T narúša transláciu; objasnite typ vstupu.
Pozor: Ani vysoká percentuálna podobnosť v BLAST a podobných nástrojoch nemusí nutne znamenať biologicky „identické“; e-hodnota (pravdepodobnosť náhody) a dĺžka zarovnanej oblasti by sa mali vyhodnotiť spoločne.

Hĺbka: správne čítanie výstupu BLAST

To, že AI interpretuje výsledok BLAST, šetrí čas; Nerobte však žiadne rozhodnutia, kým si tri čísla sami neprečítate. Prvým je e-hodnota (očakávaná hodnota): očakávaný počet náhodných výskytov tohto skóre; Veľmi malá hodnota ako 1e-50 znamená silný, hodnota ako 0,1 je takmer šum. Druhým je pokrytie dopytu: aké percento sekvencie dopytu pokrýva zhoda; 98 % podobnosť, ale len 20 % pokrytie znamená, že malá časť sekvencie je podobná a je zavádzajúca. Tretím je percentuálna identita. Bez týchto troch prečítaných spolu vysoké percento samo osebe nič nedokazuje.

Konkrétny príklad: výskumník odpálil fragment génu, ktorý práve sekvenoval; "99% sa zhoduje s ľudským BRCA2, rovnaký gén," uviedla AI. Keď sa výskumník pozrel na výstup, videl, že pokrytie bolo iba 15 % – zodpovedajúca časť bola len krátka, opakujúca sa oblasť z tisícok báz BRCA2. Správna interpretácia nebola „rovnaký gén“, ale „zdieľa spoločný motív opakovania“. Prečítanie rozsahu zabránilo úplnej chybnej identifikácii.

stĺpec BLAST

čo to hovorí

pasca

E-hodnota

pravdepodobnosť náhody

Ak je vysoká, zápas môže byť bezvýznamný

Pokrytie dopytu

Miera pokrytých dopytov

Ak je nízka, percento je zavádzajúce

percent identity

Zodpovedajúca základná sadzba

sám nestačí

bitscore

Normalizovaná sila zarovnania

Interpretované podľa dĺžky

5) Šablóna interpretácie výstupu BLAST:

Interpretujte nasledujúcu tabuľku BLAST, ale nerozhodujte sa: zosumarizujte e-hodnotu, pokrytie dotazu a percentuálnu identitu pre každý riadok oddelene a uveďte, aké prahové hodnoty je potrebné splniť, kým sa dospeje k záveru ako „rovnaký gén“. Tabuľka: [prilepiť].

V súhrne

  • Sekvenčné operácie (reverzný doplnok, preklad, ORF, pomer GC) by sa mali vykonávať s kódom, ktorý AI napíše a spustíte, nie s textovou odpoveďou AI.
  • Rámcové a vláknové predpoklady by mali byť vždy výslovne uvedené; Kontrola dĺžky je najrýchlejší nástroj na zachytenie chýb.
  • Vždy získajte sekvenciu zo spoľahlivého zdroja (NCBI, Ensembl); Nenúťte AI, aby si to zapamätala.
  • Podobnosť a zarovnanie sú hodnotené oficiálnymi nástrojmi a numerickým skóre, nie okom.

Aplikačná úloha

Stiahnite si krátku kódovaciu sekvenciu zo spoľahlivého zdroja (napr. NCBI). So šablónami 1 a 2 vyššie požiadajte AI ​​o kód Biopython, spustite kód; Porovnajte dĺžku a sekvenciu proteínu, ktorý ste vyrobili, so známym záznamom v databáze. Ak zistíte nesúlad, pokúste sa ho opraviť zmenou predpokladu rámca/vlákna a poznačte si proces.

kontrolný zoznam

  • [ ] Sekvenciu mám zo spoľahlivého zdroja, AI si ju nezapamätala.
  • [ ] Vykonal som operácie poľa so spustiteľným kódom.
  • [ ] Jasne som špecifikoval rámec a predpoklad vlákna.
  • [ ] Porovnal som dĺžku proteínu/ORF s referenciou.
  • [ ] Vyhodnotil som podobnosť s oficiálnym nástrojom a číselným skóre.
  • [ ] Skontroloval som separáciu RNA/DNA a U/T.