Jednotka 3 / 11

Sekvenčná analýza a bioinformatika: DNA, RNA a proteíny

zisky:

  • Schopnosť vytlačiť kód základných operácií sekvenčnej analýzy, ako je čítanie FASTA, preklad, zarovnanie a BLAST a interpretovať výsledky
  • Schopnosť vyhnúť sa nesprávnym záverom správnou interpretáciou pojmov, ako sú e-hodnota, miera pokrytia a rámec čítania
  • Schopnosť porozumieť potrebe potvrdenia funkčného nároku sekvencie s oficiálnymi databázami (NCBI, UniProt, Ensembl).

Najzákladnejším údajom biológie je sekvencia: sekvencia DNA pozostávajúca z písmen A, T, G, C; A, U, G, C sekvencia RNA; reťazec 20 aminokyselinových písmen proteínu. Rozumieme, čo je gén, ako sú príbuzné dva druhy a vzťah medzi mutáciou (zmena v sekvencii) a chorobou prostredníctvom týchto sekvencií. V tejto lekcii sa naučíme používať umelú inteligenciu ako asistenta kódu a interpretácie pre sekvenčnú analýzu: čítanie súborov FASTA, preklad sekvencií, zarovnávanie (zarovnanie: porovnanie dvoch sekvencií písmeno po písmene a videnie ich podobností) a pochopenie nástrojov, ako je BLAST.

Kritické upozornenie od začiatku: AI „nepozná“ skutočnú funkciu sekvencie; Tvrdia to len oficiálne databázy (NCBI, UniProt, Ensembl) a empirické dôkazy.

Základné pojmy a nástroje

  • FASTA: Textový formát, ktorý ukladá reťazce; Každé pole pozostáva z riadku hlavičky začínajúceho znakom > a riadkov podpola pod ním.
  • BLAST (Basic Local Alignment Search Tool): Nástroj, ktorý porovnáva sekvenciu, ktorú máte, s miliónmi sekvencií v obrovskej databáze a nájde tie najpodobnejšie. "Ako vyzerá tento seriál?" štandardná odpoveď na otázku.
  • Zarovnanie: Usporiadanie dvoch alebo viacerých polí tak, aby boli podobné oblasti umiestnené jedna pod druhou. Môže ísť o párové alebo viacnásobné zarovnanie sekvencií (MSA).
  • Preklad: Konverzia DNA/RNA kódujúcej sekvencie na aminokyselinovú sekvenciu prostredníctvom trojpísmenových skupín (kodónov).
  • Motív: Krátky opakujúci sa vzor v sekvencii, ktorý má funkčný význam (napr. väzobné miesto).
Tip: Nemôžete povedať AI, aby „vystrelila tú sériu“; Model nemá prístup k databáze BLAST. Ale "Ako interpretujem svoj výsledok BLAST, čo znamená e-hodnota (E-hodnota)?" Môžete sa opýtať a dokonca napísať kód, ktorý programovo volá BLAST pomocou Biopythonu.

Krok za krokom: skúmanie identity poľa

  1. Získajte postupnosť: uložte do súboru ako FASTA.
  2. Základná kontrola: Dĺžka, obsah písmena (je to len A/T/G/C alebo je tam neznáme „N“), pomer GC (percento guanín-cytozín: líši sa podľa druhu a regiónu).
  3. BLAST: Hľadajte vo webovom rozhraní NCBI alebo programovo.
  4. Komentár: Pozrite sa na e-hodnotu najlepšej zhody (čím je menšia, tým je menšia pravdepodobnosť, že ide o náhodu) a pokrytie dopytu.
  5. Potvrdenie: Otvorte zodpovedajúci gén/proteín v UniProt alebo NCBI a overte, či sa skutočne zhoduje s funkciou, ktorú hľadáte.

AI vám pomáha kódovať v kroku 2 a komentovať v kroku 4; ale skutočné údaje v krokoch 3 a 5 poskytujú samotné nástroje a vy.

Kopírovateľné šablóny výziev

Úloha: Ste asistent bioinformatiky. Úloha: Prečítajte si súbor FASTA (sequences.fasta) pomocou Biopythonu. Chcem: napísať názov, dĺžku a pomer GC pre každú sekvenciu do tabuľky; uložiť výsledok ako CSV. Poskytnite funkčný kód Pythonu s komentármi.

Preložiť sekvenciu DNA, ktorú mám, do proteínovej sekvencie. Použite Biopython Seq.translate; zobraziť stop kodón (*); označujú čítací rámec. Zadajte kód, vysvetlite. Sekvencia: [FASTA]

Interpretujte môj výsledok BLAST. Nižšie je uvedená hodnota-hodnota, percento identity a miera pokrytia 5 najlepších zhôd. Vysvetlite mi, ktorá zhoda je spoľahlivá a prečo, neuvádzajte presné nároky na funkciu, povedzte mi kroky, ktoré potrebujem overiť. Tabuľka: [údaje]

Zarovnajte dve proteínové sekvencie párovo a nájdite percentuálnu podobnosť. Použite Biopython pairwise2 alebo Bio.Align; vytlačte zarovnanie čitateľne. Uveďte kód a vysvetlite schému bodovania.

Slabá výzva / Silná výzva

Slabý: "Ktorý gén je táto sekvencia?"

Strong: "Mám ľudskú DNA sekvenciu s 1 140 pármi báz (FASTA nižšie). Túto sekvenciu som odpálil sám; najlepšia zhoda je TP53, e-hodnota 0,0, identita 99,8%, pokrytie 100%. Vysvetlite, prečo je tento výsledok silným dôkazom; povedzte mi však, ktoré 2 overenia musím vykonať pred zistením jej funkcie."

Rozdiel: V silnej výzve sa modelu poskytnú skutočné údaje (dĺžka, výsledok BLAST); Od modela žiadate, aby interpretoval dôkazy, ktoré poskytujete, nie aby si ich „pamätal“. Je nútený vymyslieť modelku na slabú výzvu.

tri mini prípady

Prípad 1 — Nesprávny čítací rámec: Študent preložil sekvenciu DNA na proteín, ale od začiatku bez nájdenia správneho štartovacieho kodónu (ATG). Výsledkom bol nezmyselný, skoro zastavujúci proteín. Keď model vyskúšal všetky tri čítacie rámce a napísal kód, ktorý našiel najdlhší otvorený čítací rámec (ORF) začínajúci ATG, objavil sa správny proteín s 380 aminokyselinami.

Prípad 2 – omyl E-hodnoty: Technik nahlásil zhodu BLAST s e-hodnotou 2,0 ako „nájdenú“. Zatiaľ čo e-hodnota väčšia ako 1 znamená, že zhoda je s najväčšou pravdepodobnosťou náhoda. Model to vysvetlil a pripomenul, že e < 1e-5 sa vo všeobecnosti používa ako spoľahlivý prah.

Prípad 3 – Kontaminácia: Výbuch bakteriálnej sekvencie v laboratóriu ukázal, že ľudská DNA je najlepšia. Bol to znak kontaminácie vzorky. AI ​​vzbudila správne podozrenie vyhlásením, že „neočakávaný typ zhody by mohol naznačovať kontamináciu“; Technik zopakoval príklad.

Porovnanie: úloha umelej inteligencie

Quest

umelá inteligencia

Nástroj/databáza

človek

FASTA čítanie, GC/dĺžka

píše kód

Ovláda výstup

Preklad, ORF nález

píše kód

Spúšťa Biopython

Potvrdí rámec

ID poľa

Komentáre

BLAST/NCBI nájde

potvrdzuje

Funkčný nárok

ponúka návrhy

UniProt dáva dôkaz

rozhoduje

Časté chyby

  • Požiadanie modelu, aby si „zapamätal“ ID reťazca: Model si reťazce nezapamätá; Použite BLAST.
  • Nesprávna interpretácia e-hodnoty: Malé je dobré, veľké je zlé; Pamätajte na prah.
  • Nekontroluje sa čítací rámec: Nesprávny rámec vytvára nezmyselný proteín.
  • Ignorovanie pokrytia: Vysoká identita, ale nízke pokrytie znamená čiastočnú zhodu.
  • Chýbajúca kontaminácia: Neočakávaná zhoda druhov je vážnym varovaním.
Pozor: To, že sekvencia je „na 99 % podobná TP53“ nedokazuje, že táto sekvencia nesie funkciu TP53; Je to silná hypotéza. Funkcia musí byť podložená empirickými dôkazmi a popismi databázy. Nestačí, aby AI jednoducho povedala „toto je supresor nádorov“.

Viacnásobné zarovnanie sekvencií a základ fylogenézy

Zosúladenie desiatok sekvencií namiesto dvoch sa nazýva viacnásobné zarovnanie sekvencií (MSA) a je základom mnohých analýz: nájdenie konzervovaných oblastí (častí, ktoré zostali v evolúcii nezmenené, a preto sú funkčne dôležité), budovanie fylogenetických stromov, identifikácia proteínových rodín. Túto prácu vykonávajú nástroje ako MAFFT, MUSCLE a Clustal. AI ​​píše kód, ktorý volá tieto nástroje z Pythonu (napríklad cez Biopython) a pomáha vám interpretovať výstup; ale samotné zarovnanie robí nástroj, nie model "naspamäť".

Pri interpretácii MSA venujte pozornosť konzervovaným stĺpcom: aminokyselina, ktorá zostáva rovnaká vo všetkých sekvenciách, je s najväčšou pravdepodobnosťou rozhodujúca pre funkciu proteínu (napr. aktívne miesto enzýmu). To poskytuje silné vodítko, prečo môže byť mutácia škodlivá. Ale „zachované = významné“ je hypotéza; vyžaduje experimentálne overenie.

Prečítajte si môj súbor viacnásobného zarovnania (aligned.fasta), čo je výstup MAFFT, pomocou Biopythonu. Vypočítajte mieru retencie pre každý stĺpec; Uveďte viac ako 90 % chránených pozícií. Vysvetlite, prečo môžu mať tieto pozície funkčný význam, nenárokujte si definitívnu funkciu.

Mutačná a variantná interpretačná pasca

Keď vidíte zmenu písmena (variant) v reťazci, je to veľký skok povedať, že je to "škodlivé". Väčšina variantov je neutrálna (neefektívna). Pri interpretácii vplyvu variantu sa treba pozrieť na špecializované databázy variantov (ako ClinVar) a údaje o frekvencii populácie (ako gnomAD), nie na slová AI. Ak model tvrdí, že variant je „patogénny“, nikdy to nezapíšte do klinického alebo výskumného záveru bez toho, aby ste to potvrdili týmito zdrojmi.

Základné databázy na overenie

Poznanie oficiálnych zdrojov na potvrdenie každého tvrdenia v analýze série je vaším najsilnejším štítom proti výmyslom umelej inteligencie. Najčastejšie používané:

databázy

za čo

Typické potvrdenie

NCBI GenBank/RefSeq

DNA/RNA sekvencie, génové záznamy

ID reťazca, dĺžka

UniProt

Proteínové sekvencie a funkcie

Funkcia, počet aminokyselín

súbor

Anotácia genómu, umiestnenie génov

Mapovanie génov a chromozómov

ClinVar

Klinický význam variantov

Patogénne/neutrálne rozhodnutie

gnomAD

Variantná frekvencia v populácii

zriedkavý/bežný variant

AI vám môže navrhnúť, na ktoré z týchto základov by ste sa mali pozrieť; Ale vy zadáte dotaz a prečítate si výsledok. "Model povedal, že toto hovorí UniProt" nie je potvrdením; Potvrdením je, že si sami otvoríte stránku UniProt.

V súhrne

Sekvenčná analýza je srdcom bioinformatiky; FASTA, BLAST, zarovnanie a preklad sú základné operácie. AI píše kód pre tieto operácie a pomáha vám interpretovať ich výsledky, ale skutočnú sekvenčnú identifikáciu poskytujú nástroje (BLAST) a databázy (NCBI, UniProt). Správne pochopenie pojmov ako e-hodnota, pokrytie a čítací rámec je kľúčom k tomu, aby ste sa vyhli nesprávnym záverom. Funkčné tvrdenie vždy vyžaduje nezávislé dôkazy.

Aplikačná úloha

Vezmite vzorku DNA sekvencie (alebo génu, ktorý ste stiahli z NCBI). Nechajte AI ​​vypočítať dĺžku a pomer GC pomocou Biopythonu, potom to preložte do všetkých troch čítacích rámcov a vytlačte kód, ktorý nájde najdlhší ORF. Spustite výsledok. Potom sami vyhľadajte túto sekvenciu v NCBI BLAST a nechajte model interpretovať e-hodnotu a mieru pokrytia najlepšej zhody. Potvrďte funkčný nárok modelu v UniProt.

kontrolný zoznam

  • [ ] Pred spracovaním reťazca som skontroloval dĺžku a obsah písmen.
  • [ ] V preklade som použil správny čítací rámec.
  • [ ] BLAST som spustil sám, model som „nepripomínal“.
  • [ ] E-hodnotu a pomer pokrytia som interpretoval správne.
  • [ ] Nečakanú druhovú zhodu som vyhodnotil z hľadiska kontaminácie.
  • [ ] Potvrdil som nárok na funkciu s oficiálnou databázou.