Jednotka 3 / 11

Sekvenční analýza a bioinformatika: DNA, RNA a proteiny

zisky:

  • Schopnost vytisknout kód základních operací sekvenční analýzy, jako je čtení FASTA, translace, zarovnání a BLAST, a interpretovat výsledky
  • Schopnost vyhnout se nesprávným závěrům správnou interpretací pojmů, jako je e-hodnota, míra pokrytí a rámec čtení
  • Schopnost chápat nutnost potvrzování funkčního nároku sekvence s oficiálními databázemi (NCBI, UniProt, Ensembl).

Nejzákladnějším údajem biologie je sekvence: sekvence DNA sestávající z písmen A, T, G, C; A, U, G, C sekvence RNA; řetězec 20 aminokyselinových písmen proteinu. Prostřednictvím těchto sekvencí rozumíme tomu, co je gen, jak jsou dva druhy příbuzné, a vztahu mezi mutací (změnou sekvence) a nemocí. V této jednotce se naučíme používat umělou inteligenci jako asistenta kódu a interpretace pro sekvenční analýzu: čtení souborů FASTA, překlad sekvencí, zarovnání (zarovnání: porovnávání dvou sekvencí písmeno po písmenu a vidět jejich podobnosti) a porozumění nástrojům, jako je BLAST.

Kritické upozornění od začátku: AI „nezná“ skutečnou funkci sekvence; Tvrdí to pouze oficiální databáze (NCBI, UniProt, Ensembl) a empirické důkazy.

Základní pojmy a nástroje

  • FASTA: Textový formát, který ukládá řetězce; Každé pole se skládá z řádku záhlaví začínajícího znakem > a řádků podpole pod ním.
  • BLAST (Basic Local Alignment Search Tool): Nástroj, který porovná vaši sekvenci s miliony sekvencí v obří databázi a najde ty nejpodobnější. "Jak tato série vypadá?" standardní odpověď na otázku.
  • Zarovnání: Uspořádání dvou nebo více polí tak, aby byly podobné oblasti umístěny jedna pod druhou. Může to být párové nebo vícenásobné zarovnání sekvencí (MSA).
  • Překlad: Konverze DNA/RNA kódující sekvence na aminokyselinovou sekvenci prostřednictvím trojpísmenných skupin (kodonů).
  • Motiv: Krátký opakující se vzor v sekvenci, který má funkční význam (např. vazebné místo).
Tip: Nemůžete říct AI, aby "odpálila tu sérii"; Model nemá přístup k databázi BLAST. Ale "Jak mám interpretovat svůj výsledek BLAST, co znamená e-hodnota (E-hodnota)?" Můžete se ptát a dokonce psát kód, který programově volá BLAST pomocí Biopythonu.

Krok za krokem: zkoumání identity pole

  1. Získejte sekvenci: uložte do souboru jako FASTA.
  2. Základní kontrola: Délka, obsah písmen (je to jen A/T/G/C nebo je tam neznámé „N“), poměr GC (procento guanin-cytosinu: liší se podle druhu a regionu).
  3. BLAST: Hledejte ve webovém rozhraní NCBI nebo programově.
  4. Komentář: Podívejte se na e-hodnotu nejlepší shody (čím menší je, tím je menší pravděpodobnost, že jde o náhodu) a pokrytí dotazu.
  5. Potvrzení: Otevřete odpovídající gen/protein v UniProt nebo NCBI a ověřte, že skutečně odpovídá funkci, kterou hledáte.

AI vám pomůže kódovat v kroku 2 a komentovat v kroku 4; ale skutečná data v krocích 3 a 5 poskytují samotné nástroje a vy.

Kopírovatelné šablony výzev

Role: Jste asistent bioinformatiky. Úkol: Přečtěte si soubor FASTA (sequences.fasta) pomocí Biopythonu. Chci: napsat název, délku a poměr GC pro každou sekvenci do tabulky; uložit výsledek jako CSV. Poskytněte funkční kód Pythonu s komentáři.

Přeložte sekvenci DNA, kterou mám, do proteinové sekvence. Použijte Biopython Seq.translate; zobrazit stop kodon (*); označují čtecí rámec. Uveďte kód, vysvětlete. Sekvence: [FASTA]

Interpretujte můj výsledek BLAST. Níže je uvedena hodnota-hodnota, procento identity a míra pokrytí 5 nejlepších shod. Vysvětlete mi, která shoda je spolehlivá a proč, neuvádějte přesné nároky na funkci, řekněte mi kroky, které potřebuji ověřit. Tabulka: [data]

Porovnejte dvě proteinové sekvence a najděte procentuální podobnost. Použijte Biopython pairwise2 nebo Bio.Align; vytiskněte zarovnání čitelně. Uveďte kód a vysvětlete bodovací schéma.

Slabá výzva / Silná výzva

Slabý: "Který gen je tato sekvence?"

Strong: "Mám sekvenci lidské DNA o 1 140 párech bází (FASTA níže). Tuto sekvenci jsem odpálil sám; nejlepší shoda je TP53, e-hodnota 0,0, identita 99,8 %, pokrytí 100 %. Vysvětlete, proč je tento výsledek pádným důkazem; řekněte mi však, která 2 ověření musím provést, než zjistím její funkci."

Rozdíl: V silné výzvě jsou modelu poskytnuta skutečná data (délka, výsledek BLAST); Žádáte modelku, aby vámi poskytnuté důkazy interpretovala, ne aby si je „pamatovala“. Je nucen vytvořit model na slabé pobídce.

tři mini pouzdra

Případ 1 — Nesprávný čtecí rámec: Student přeložil sekvenci DNA na protein, ale od začátku, aniž by našel správný start kodon (ATG). Výsledkem byl nesmyslný, brzo zastavující protein. Když model vyzkoušel všechny tři čtecí rámce a napsal kód, který našel nejdelší otevřený čtecí rámec (ORF) počínaje ATG, objevil se správný protein s 380 aminokyselinami.

Případ 2 — Chyba E-hodnoty: Technik nahlásil shodu BLAST s e-hodnotou 2,0 jako „nalezen“. Zatímco e-hodnota větší než 1 znamená, že shoda je s největší pravděpodobností náhoda. Model to vysvětlil a připomněl, že e < 1e-5 se obecně používá jako spolehlivý práh.

Případ 3 – Kontaminace: Výbuch bakteriální sekvence v laboratoři ukázal, že lidská DNA se nejlépe shoduje. To byla známka kontaminace vzorku. AI ​​vzbudila správné podezření prohlášením, že „neočekávaný typ shody by mohl naznačovat kontaminaci“; Technik zopakoval příklad.

Srovnání: role umělé inteligence

Quest

umělá inteligence

Nástroj/databáze

člověk

FASTA čtení, GC/délka

píše kód

Ovládá výstup

Překlad, ORF nález

píše kód

Spouští Biopython

Ověřuje rámec

ID pole

Komentáře

BLAST/NCBI zjistí

potvrzuje

Funkční nárok

nabízí návrhy

UniProt dává důkaz

rozhoduje

Časté chyby

  • Požadavek na model, aby si „zapamatoval“ ID řetězce: Model si řetězce nepamatuje; Použijte BLAST.
  • Nesprávná interpretace e-hodnoty: Malé je dobré, velké je špatné; Pamatujte na práh.
  • Nekontroluje čtecí rámec: Špatný rámec vytváří nesmyslný protein.
  • Ignorování pokrytí: Vysoká identita, ale nízké pokrytí znamená částečnou shodu.
  • Chybějící kontaminace: Neočekávaná shoda druhů je vážným varováním.
Pozor: To, že je sekvence „na 99 % podobná TP53“, nedokazuje, že tato sekvence nese funkci TP53; Je to silná hypotéza. Funkce musí být podpořena empirickými důkazy a popisy databáze. Nestačí, aby umělá inteligence jednoduše řekla „toto je supresor nádorů“.

Vícenásobné zarovnání sekvencí a základ fylogeneze

Zarovnání desítek sekvencí dohromady spíše než jen dvou se nazývá zarovnání více sekvencí (MSA) a je základem mnoha analýz: hledání konzervovaných oblastí (částí, které zůstaly v evoluci nezměněny, a proto funkčně důležité), budování fylogenetických stromů, identifikace proteinových rodin. Tuto práci dělají nástroje jako MAFFT, MUSCLE a Clustal. Umělá inteligence píše kód, který volá tyto nástroje z Pythonu (například přes Biopython) a pomáhá vám interpretovat výstup; ale samotné zarovnání dělá nástroj, ne model "nazpaměť".

Při interpretaci MSA věnujte pozornost konzervovaným sloupcům: aminokyselina, která zůstává stejná ve všech sekvencích, je s největší pravděpodobností kritická pro funkci proteinu (např. aktivní místo enzymu). To poskytuje silné vodítko k tomu, proč by mutace mohla být škodlivá. Ale "zachovalý = významný" je hypotéza; vyžaduje experimentální ověření.

Přečtěte si můj soubor vícenásobného zarovnání (aligned.fasta), což je výstup MAFFT, pomocí Biopythonu. Vypočítejte retenční poměr pro každý sloupec; Seznam více než 90 % chráněných pozic. Vysvětlete, proč mohou mít tyto pozice funkční význam, nenárokujte si definitivní funkci.

Mutace a variantní interpretační past

Když vidíte změnu písmene (variantu) v řetězci, je to velký skok říct, že je to "škodlivé". Většina variant je neutrálních (neefektivních). Při interpretaci dopadu varianty je třeba se podívat na specializované databáze variant (jako ClinVar) a data o frekvenci populace (jako gnomAD), nikoli na slovo AI. Pokud model tvrdí, že varianta je „patogenní“, nikdy to nezapisujte do klinického nebo výzkumného závěru, aniž byste to potvrdili těmito zdroji.

Základní databáze pro ověření

Znalost oficiálních zdrojů pro potvrzení každého tvrzení v analýze série je vaším nejsilnějším štítem proti výmyslům umělé inteligence. Nejčastěji používané:

databáze

za co

Typické potvrzení

NCBI GenBank/RefSeq

DNA/RNA sekvence, genové záznamy

ID řetězce, délka

UniProt

Proteinové sekvence a funkce

Funkce, počet aminokyselin

soubor

Anotace genomu, umístění genů

Mapování genů a chromozomů

ClinVar

Klinický význam variant

Patogenní/neutrální rozhodnutí

gnomAD

Variantní frekvence v populaci

vzácná/běžná varianta

AI vám může navrhnout, na kterou z těchto základen byste se měli podívat; Ale uděláte dotaz a přečtete si výsledek. "Model řekl, že toto říká UniProt" není potvrzení; Potvrzením je vlastní otevření stránky UniProt.

V souhrnu

Sekvenční analýza je srdcem bioinformatiky; FASTA, BLAST, zarovnání a translace jsou základní operace. AI píše kód pro tyto operace a pomáhá vám interpretovat jejich výsledky, ale skutečnou identifikaci sekvence poskytují nástroje (BLAST) a databáze (NCBI, UniProt). Správné pochopení pojmů, jako je e-hodnota, pokrytí a rámec čtení, je klíčem k tomu, abyste se vyhnuli nesprávnému závěru. Funkční tvrzení vždy vyžaduje nezávislé důkazy.

Aplikační úkol

Vezměte vzorek sekvence DNA (nebo gen, který jste stáhli z NCBI). Nechte AI spočítat délku a poměr GC pomocí Biopythonu, poté to přeložte do všech tří čtecích rámců a vytiskněte kód, který najde nejdelší ORF. Spusťte výsledek. Pak sami vyhledejte tuto sekvenci v NCBI BLAST a nechte model interpretovat e-hodnotu a míru pokrytí nejlepší shody. Potvrďte funkční nárok modelu v UniProt.

kontrolní seznam

  • [ ] Před zpracováním řetězce jsem zkontroloval délku a obsah písmen.
  • [ ] V překladu jsem použil správný čtecí rámec.
  • [ ] BLAST jsem provozoval sám, model jsem "nepřipomínal".
  • [ ] Správně jsem interpretoval e-hodnotu a poměr pokrytí.
  • [ ] Nečekanou shodu druhů jsem vyhodnotil z hlediska kontaminace.
  • [ ] Potvrdil jsem nárok na funkci s oficiální databází.