Enhet 3 / 11

Sekvensanalyse og bioinformatikk: DNA, RNA og proteiner

Gevinster:

  • Evne til å skrive ut koden for grunnleggende sekvensanalyseoperasjoner som FASTA-lesing, oversettelse, justering og BLAST og tolke resultatene
  • Evne til å unngå feil konklusjoner ved å tolke begreper som e-verdi, dekningsgrad og leseramme korrekt
  • Evne til å forstå nødvendigheten av å bekrefte funksjonskravet til en sekvens med offisielle databaser (NCBI, UniProt, Ensembl).

De mest grunnleggende dataene for biologi er sekvensen: DNA-sekvensen som består av bokstavene A, T, G, C; A, U, G, C sekvens av RNA; kjede med 20 aminosyrebokstaver av protein. Vi forstår hva et gen er, hvor beslektede to arter er, og forholdet mellom en mutasjon (endring i sekvens) og sykdom gjennom disse sekvensene. I denne enheten skal vi lære å bruke kunstig intelligens som kode- og tolkningsassistent for sekvensanalyse: lesing av FASTA-filer, oversettelse av sekvenser, aligning (justering: sammenligne to sekvenser bokstav for bokstav og se likhetene deres), og forstå verktøy som BLAST.

Kritisk advarsel fra starten: AI "vet" ikke den faktiske funksjonen til en sekvens; Bare offisielle databaser (NCBI, UniProt, Ensembl) og empiriske bevis sier dette.

Grunnleggende konsepter og verktøy

  • FASTA: Tekstformat som lagrer strenger; Hver matrise består av en overskriftslinje som begynner med > og undermatriselinjer under den.
  • BLAST (Basic Local Alignment Search Tool): Et verktøy som sammenligner en sekvens du har med millioner av sekvenser i en gigantisk database og finner de mest like. "Hvordan ser denne serien ut?" standard svar på spørsmålet.
  • Justering: Ordne to eller flere arrays slik at lignende områder plasseres under hverandre. Det kan være parvis eller multippel sekvensjustering (MSA).
  • Oversettelse: Konvertering av DNA/RNA-kodende sekvensen til en aminosyresekvens via trebokstavsgrupper (kodoner).
  • Motiv: Et kort tilbakevendende mønster i sekvensen som har funksjonell betydning (f.eks. et bindingssted).
Tips: Du kan ikke fortelle AI å "BLAST den serien"; Modellen får ikke tilgang til BLAST-databasen. Men "Hvordan tolker jeg BLAST-resultatet mitt, hva betyr e-verdien (E-verdien)?" Du kan spørre, og til og med skrive kode som kaller BLAST programmatisk med Biopython.

Trinn for trinn: undersøke identiteten til en matrise

  1. Få sekvensen: lagre til fil som FASTA.
  2. Grunnleggende sjekk: Lengde, bokstavinnhold (er det bare A/T/G/C eller er det en ukjent "N"), GC-forhold (prosent av guanin-cytosin: varierer etter art og region).
  3. BLAST: Søk i NCBI-nettgrensesnittet eller programmatisk.
  4. Kommentar: Se på e-verdien til det beste samsvaret (jo mindre det er, jo mindre sannsynlig er det en tilfeldighet) og søkedekningen.
  5. Bekreftelse: Åpne det matchende genet/proteinet i UniProt eller NCBI og kontroller at det faktisk samsvarer med funksjonen du leter etter.

AI hjelper deg med å kode i trinn 2 og kommentere i trinn 4; men de virkelige dataene i trinn 3 og 5 leveres av verktøyene selv og deg.

Kopierbare spørsmålsmaler

Rolle: Du er bioinformatikkassistent. Oppgave: Les en FASTA-fil (sequences.fasta) med Biopython. Jeg vil: skrive navn, lengde og GC-forhold for hver sekvens i en tabell; lagre resultatet som CSV. Gi fungerende Python-kode med kommentarer.

Oversett DNA-sekvensen jeg har til en proteinsekvens. Bruk Biopython Seq.translate; vis stoppkodon (*); angi leseramme. Gi kode, forklar. Sekvens: [FASTA]

Tolk BLAST-resultatet mitt. Nedenfor er verdi-verdi, identitetsprosent og dekningsgrad for de 5 beste kampene. Forklar meg hvilket samsvar som er pålitelig og hvorfor, ikke kom med eksakte funksjonskrav, fortell meg trinnene jeg trenger for å bekrefte. Tabell: [data]

Juster to proteinsekvenser parvis og finn prosentvis likhet. Bruk Biopython pairwise2 eller Bio.Align; skrive ut justeringen lesbart. Gi koden og forklar poengskjemaet.

Svak forespørsel / Sterk forespørsel

Svak: "Hvilket gen er denne sekvensen?"

Sterkt: "Jeg har en menneskelig DNA-sekvens på 1140 basepar (FASTA nedenfor). Jeg BLASTET denne sekvensen selv; best match er TP53, e-verdi 0,0, identitet 99,8 %, dekning 100%. Forklar hvorfor dette resultatet er sterke bevis; men fortell meg hvilke 2 verifikasjoner jeg må gjøre før jeg kan fastslå funksjonen."

Forskjell: I den sterke ledeteksten blir de faktiske dataene (lengde, BLAST-resultat) gitt til modellen; Du ber modellen om å tolke bevisene du gir, ikke å "huske" det. Han blir tvunget til å lage en modell på en svak oppfordring.

tre minisaker

Case 1 — Feil leseramme: En student oversatte DNA-sekvensen til protein, men fra begynnelsen, uten å finne riktig startkodon (ATG). Resultatet var et meningsløst protein som stoppet tidlig. Da modellen prøvde alle tre leserammene og skrev kode som fant den lengste åpne leserammen (ORF) som startet med ATG, dukket det riktige proteinet på 380 aminosyrer opp.

Tilfelle 2 — E-verdi feilslutning: En tekniker rapporterte en BLAST-match med en e-verdi på 2,0 som "funnet". Mens en e-verdi større enn 1 indikerer at treffet mest sannsynlig er en tilfeldighet. Modellen forklarte dette og minnet om at e < 1e-5 generelt brukes som en pålitelig terskel.

Tilfelle 3 – Kontaminering: EN BLAST av en bakteriesekvens i et laboratorium viste frem menneskelig DNA som den beste matchen. Dette var et tegn på prøveforurensning. AI vakte den rette mistanken ved å si at "uventet type kamp kan være indikasjon på forurensning"; Teknikeren gjentok eksemplet.

Sammenligning: rollen til kunstig intelligens

Quest

kunstig intelligens

Verktøy/database

menneskelig

FASTA avlest, GC/lengde

skriver kode

Styrer utgangen

Oversettelse, ORF-funn

skriver kode

Kjører Biopython

Validerer rammen

array id

Kommentarer

BLAST/NCBI funn

bekrefter

Funksjonskrav

gir forslag

UniProt gir bevis

bestemmer

Vanlige feil

  • Be modellen om å "huske" streng-ID-en: Modellen husker ikke strengene; Bruk BLAST.
  • Feiltolkning av e-verdi: Lite er bra, stort er dårlig; Husk terskelen.
  • Ikke sjekke leserammen: Feil ramme produserer tullprotein.
  • Ignorerer dekning: Høy identitet, men lav dekning betyr delvis samsvar.
  • Manglende forurensning: Uventet artsmatching er en alvorlig advarsel.
Forsiktig: Bare fordi en sekvens er "99 % lik TP53", beviser ikke at den sekvensen har TP53-funksjon; Det er en sterk hypotese. Funksjonen må støttes av empiri og databasebeskrivelser. Det er ikke nok for AI å bare si "dette er en tumorundertrykker."

Multippel sekvensjustering og grunnlag for fylogeni

Å justere dusinvis av sekvenser sammen i stedet for bare to kalles multippelsekvensjustering (MSA) og er grunnlaget for mange analyser: finne konserverte regioner (deler som har holdt seg uendret i evolusjonen og derfor funksjonelt viktige), bygge fylogenetiske trær, identifisere proteinfamilier. Verktøy som MAFFT, MUSCLE og Clustal gjør denne jobben. AI skriver koden som kaller disse verktøyene fra Python (via Biopython, for eksempel) og hjelper deg med å tolke utdataene; men selve justeringen gjør verktøyet, ikke modellen "by rote".

Når du tolker en MSA, vær oppmerksom på konserverte kolonner: en aminosyre som forblir den samme på tvers av alle sekvenser er mest sannsynlig kritisk for funksjonen til proteinet (f.eks. det aktive stedet til et enzym). Dette gir en sterk pekepinn på hvorfor en mutasjon kan være skadelig. Men "bevart = signifikant" er en hypotese; krever eksperimentell verifisering.

Les min multiple alignment-fil (aligned.fasta), som er MAFFT-utgangen, med Biopython. Beregn retensjonsraten for hver kolonne; List over 90 % beskyttede stillinger. Forklar hvorfor disse posisjonene kan være av funksjonell betydning, ikke hevder definitiv funksjon.

Mutasjons- og varianttolkningsfelle

Når du ser en bokstavendring (variant) i en streng, er det et stort sprang å si at den er "skadelig". De fleste varianter er nøytrale (ineffektive). Når man tolker virkningen av en variant, må man se på dedikerte variantdatabaser (som ClinVar) og populasjonsfrekvensdata (som gnomAD), ikke AIs ord. Hvis modellen hevder at en variant er "patogen", aldri skriv dette inn i en klinisk eller forskningskonklusjon uten å bekrefte det med disse kildene.

Base databaser for verifisering

Å kjenne de offisielle kildene for å bekrefte alle påstandene i serieanalysen er ditt sterkeste skjold mot fabrikasjonen av kunstig intelligens. Mest brukt:

database

for hva

Typisk bekreftelse

NCBI GenBank/RefSeq

DNA/RNA-sekvenser, genregistreringer

Strenge-ID, lengde

UniProt

Proteinsekvenser og funksjoner

Funksjon, antall aminosyrer

ensemble

Genomannotering, genplasseringer

Gen-kromosomkartlegging

ClinVar

Klinisk betydning av varianter

Patogen/nøytral beslutning

GnomAD

Varierende frekvens i befolkningen

sjelden/vanlig variant

AI kan foreslå hvilke av disse basene du bør se på; Men du gjør spørringen og du leser resultatet. "Modellen sa at dette er det UniProt sier" er ikke en bekreftelse; Bekreftelse er å åpne UniProt-siden selv.

Oppsummert

Sekvensanalyse er hjertet i bioinformatikk; FASTA, BLAST, justering og oversettelse er de grunnleggende operasjonene. AI skriver koden for disse operasjonene og hjelper deg med å tolke resultatene deres, men verktøy (BLAST) og databaser (NCBI, UniProt) gir den faktiske sekvensidentifikasjonen. Riktig forståelse av begreper som e-verdi, dekning og leseramme er nøkkelen til å unngå feil konklusjon. En funksjonspåstand krever alltid uavhengig bevis.

Søknadsoppgave

Ta en prøve DNA-sekvens (eller et gen du lastet ned fra NCBI). Få AI til å beregne lengden og GC-forholdet med Biopython, oversett det deretter i alle tre leserammene og skriv ut koden som finner den lengste ORF. Kjør resultatet. Søk deretter etter denne sekvensen selv i NCBI BLAST og få modellen til å tolke e-verdien og dekningsgraden til den beste matchen. Bekreft modellens funksjonelle krav i UniProt.

sjekkliste

  • [ ] Jeg sjekket lengden og bokstavinnholdet før jeg behandlet strengen.
  • [ ] Jeg brukte riktig leseramme i oversettelsen.
  • [ ] Jeg løp BLAST selv, jeg "minnet" ikke på modellen.
  • [ ] Jeg tolket e-verdien og dekningsgraden riktig.
  • [ ] Jeg evaluerte den uventede artsmatchen for forurensning.
  • [ ] Jeg bekreftet funksjonskravet med den offisielle databasen.