Enhet 4 / 11

Proteinstruktur og AlphaFold: Prediksjon av lesestruktur, konfidenspoeng og validering

Gevinster:

  • Å kunne forstå arbeidet til AlphaFold, konfidensskårer som pLDDT og PAE, og at en struktur er en "prediksjon", og tolke strukturen riktig med kunstig intelligens
  • Evne til å gjenkjenne områder med lav konfidensscore (fleksibel/irregulær) og unngå overtolkning og sammenligne med eksperimentelle bevis
  • Evne til å anvende disiplinen med å behandle strukturprediksjon som en hypotese og koble funksjonelle påstander til eksperimentell verifikasjon.

For å forstå hva et protein gjør, er det ofte nødvendig å kjenne dens tredimensjonale foldede struktur; fordi funksjon oppstår fra struktur. I flere tiår ville det å bestemme proteinstruktur eksperimentelt (røntgenkrystallografi, kryo-elektronmikroskopi) ta måneder til år. AlphaFold (et kunstig intelligens-system utviklet av DeepMind som forutsier proteinstruktur fra aminosyresekvenser) reduserte dette til minutter og offentliggjorde de forutsagte strukturene til hundrevis av millioner av proteiner. I denne enheten lærer du hvordan du leser AlphaFold-utdata, hvordan du tolker konfidenspoeng og hvordan du trygt bruker en LLM i denne tolkningen.

Kritisk distinksjon: AlphaFold er et strukturprediksjonsverktøy og resultatet er en prediksjon, ikke en eksperimentell sannhet. LLM (en chat-modell som ChatGPT) er ikke AlphaFold i seg selv; Den kan ikke "huske" koordinatene til et protein. Bruk LLM til å tolke og forklare AlphaFold-utdata; hente selve strukturen fra AlphaFold-databasen eller verktøyet.

Grunnleggende konsepter

  • Primærstruktur: Aminosyresekvens (bokstavkjeden til proteinet).
  • Sekundær/tertiær struktur: Helix (alfa-helix), ark (beta-sheet) og tredimensjonal folding av kjeden.
  • pLDDT: AlphaFolds lokale konfidensscore for hver aminosyre, fra 0 til 100. 90+ betyr svært høy konfidens, 70-90 betyr god, 50-70 betyr lav, og under 50 betyr svært lav konfidens. Regioner med lav pLDDT er generelt "uordnet" regioner (uten en tydelig fold).
  • PAE (Predicted Aligned Error): Forutsagt feil i den relative posisjonen til to regioner; Den viser hvor pålitelig plassering av domener er i forhold til hverandre.
  • PDB: Database og filformat der eksperimentelle proteinstrukturer lagres.

Lese AlphaFold-utdata: trinn for trinn

1. Velg riktig protein og sekvens. Identifiser protein med UniProt (proteininformasjonsdatabase) nummer; Finn strukturen med dette nummeret i AlphaFold-databasen.

2. Se på pLDDT-kartet. Se hvilke deler av strukturen som er spådd med høy sikkerhet (blå) og hvilke som er spådd med lav sikkerhet (oransje/gul). Vær forsiktig med kommentarer i områder med lav tillit.

3. Les PAE-diagrammet. PAE viser om det relative arrangementet av domener i et multidomeneprotein er pålitelig. En høy PAE betyr at den relative plasseringen av feltene er usikker.

4. Sammenlign med den eksperimentelle strukturen. Match den eksperimentelle strukturen i PDB hvis tilgjengelig. Hvis AlphaFold-prediksjonen er nær eksperimentell, øker selvtilliten din.

5. Tolk varianteffekten. Når du tolker effekten av en aminosyreendring på strukturen, bør du vurdere pLDDT og funksjonell betydning av den regionen sammen (aktivt sted, bindingslomme).

Tips: Lav pLDDT betyr ikke alltid "feil gjetning"; Det er ofte et tegn på at området faktisk er uorden i seg selv. Så lav selvtillit gjenspeiler noen ganger et nøyaktig biologisk faktum. Sjekk også sekvensen med uregelmessighetsprediksjonsverktøy for å skille dette.

tre minisaker

Tilfelle 1 – Overtolkning av lavkonfidenssonen. En student hevdet at en "løkke" i AlphaFold-strukturen passet inn i en bestemt lomme, og AI-en bekreftet dette. Men da studenten så på pLDDT, så han at poengsummen for det sømmet var 42 (veldig lavt); så hans posisjon var upålitelig. Kravet ble trukket tilbake. Leksjon: sjekk alltid den lokale tillitspoengsummen før du kommenterer.

Tilfelle 2 — Sammenstilte koordinater. En forsker spurte LLM om 3D-koordinaten til en bestemt aminosyre i et protein; LLM ga overbevisende tall med tre desimaler. Da forskeren sammenlignet dem med de faktiske koordinatene i AlphaFold PDB-filen, så han at de var fullstendig fabrikkerte. LLM kan ikke "huske" koordinaten; koordinater må leses fra filen.

Sak 3 – Bekreftelse oppnådd. En doktorgradsstudent lurte på om en variant (p.Gly12Val) var nær det aktive stedet til proteinet. YZ minnet om at aktive stedsrester er spesifisert i UniProt; Studenten åpnet UniProt og fant det aktive stedet, og målte deretter med en strukturviser (PyMOL) at Gly12 var 8 ångstrøm unna dette stedet i AlphaFold-strukturen. Numerisk måling legemliggjorde "nær"-påstanden.

Eksempel: lesing av pLDDT fra en strukturfil

# I AlphaFold PDB-filen er pLDDT lagret i B-faktor-kolonnen. fra Bio.PDB import PDBParserimport numpy as npyapi = PDBParser(QUIET=True).get_structure("AF", "AF-P04637-F1.pdb")plddt = [atom.bfactor for atom in structure.get_atoms() if atom.name == "Average"]pLDDT(Average) round(np.mean(plddt), 1))print("Lav konfidens (<70) restrate (%):", round(100 * np.mean(np.array(plddt) < 70), 1))

Dette lar deg se numerisk den generelle påliteligheten til strukturen før du kommenterer.

Fire kopierbare maler

1) Strukturtolkning (med konfidenspoeng):

Din rolle: strukturell biologiassistent. Hjelp meg å tolke AlphaFold-strukturen til UniProt [nummer]-proteinet. Svar på disse spørsmålene, men koordiner/score PASSENDE: hvilke regioner forventer vi høy/lav pLDDT, hva viser PAE, er det en eksperimentell struktur (PDB), hvordan sammenligner jeg? Jeg vil lese verdiene fra filen.

2) Variantstruktureffekt:

Hjelp meg å tolke den mulige effekten av følgende variant på proteinstrukturen: [s. Gi meg hvilke bevis jeg skal se etter i stedet for den direkte "destruktive" påstanden.

3) pLDDT/PAE-beskrivelse:

Forklar med et eksempel forskjellen mellom pLDDT og PAE, hvilken bør jeg se på og når i en variantanalyse. Vurder enkelt-domene og multi-domene protein tilfeller separat.

4) Plan for struktursammenligning:

Jeg vil sammenligne AlphaFold-prediksjonen med den eksperimentelle PDB-strukturen. Hvordan beregne RMSD (gjennomsnittlig avvik mellom strukturer), hvilket verktøy gjør jeg det med (PyMOL,Biopython), hvilken terskel regnes som "god overlapping"? Gi en trinnvis plan.

Svak forespørsel / Sterk forespørsel

Svak: "Tegn strukturen til dette proteinet og fortell effekten av p.Arg273His."

Problem: LLM kan ikke tegne struktur/tilpasningskoordinater; konfidenspoeng er ikke tatt i betraktning; Påstanden om endelig virkning ville være ubegrunnet.

Sterk: "Jeg lastet ned AlphaFold-bygget for UniProt P04637 selv. Ser på pLDDT av p.Arg273His-resten og dens funksjonelle merknad i UniProt, fortell meg steg for steg hvordan jeg skal tolke effekten; gi meg hvilke bevis jeg skal se etter i stedet for den definitive påstanden."

Hvorfor det er kraftig: Strukturen er hentet fra kilden, tillitsskåren settes i sentrum, påstanden er knyttet til bevis.

Spørsmål

Leverer AlphaFold?

Hvor/hvordan bekreftes

3D fold prediksjon

Ja

AlphaFold DB / fil

lokal tillit

Ja (pLDDT)

B-faktor kolonne

Interdomene plassering

Ja (PAE)

PAE-diagram

Eksperimentell reell struktur

nei

PDB (eksperimentell)

Nøyaktig funksjonell effekt av varianten

nei

Funksjonsstudie + ekspert

Vanlige feil

  • Hopp over selvtillitsscore. Tolkning i lav pLDDT-regionen er upålitelig.
  • Ta feil av en prediksjon for empiriske fakta. AlphaFold-utdata er et estimat; Kritiske avgjørelser krever empirisk bevis.
  • Ber om koordinater fra LLM. Koordinater leses fra filen, ikke lagres.
  • Ignorerer PAE. I multidomeneproteiner kan den relative plasseringen av domenene være usikker.
  • Vurderer umiddelbart lav selvtillit som en "feil". Noen ganger er området veldig ujevnt.
Forsiktig: AlphaFold-bygg viser et "statisk" bilde; Husk at proteiner faktisk er mobile molekyler som kan gå inn i flere konformasjoner. Ingen enkelt struktur gjenspeiler dynamisk atferd fullt ut.

Dybde: Hvor AlphaFold er strukturelt stillegående

AlphaFold er kraftig, men å vite hva den ikke kan gjøre er halve kampen for å bruke den trygt. Først bretter standard AlphaFold et enkelt protein i rommet; Den modellerer ikke ligander, ioner, kofaktorer og medikamentmolekyler. Sinkionet i det aktive stedet til et enzym eller et substrat vises ikke i strukturen; Derfor kan en kommentar som «denne lommen er tom, dysfunksjonell» være misvisende. For det andre modellerer den ikke effekten av mutasjon direkte: selv om du introduserer to varianter nær samme sekvens, produserer AlphaFold vanligvis nesten samme struktur; Du kan ikke bevise påstanden "denne varianten bryter strukturen" ved å sammenligne to spådommer fra AlphaFold. For det tredje tar den ikke hensyn til post-translasjonelle modifikasjoner (som fosforylering, glykosylering) og det faktiske miljøet til membranproteiner i membranen.

Et eksempel: ett team hevdet fra et AlphaFold-bilde at en variant nær ATP-bindingslommen i et kinaseenzym "lukker lommen"; kunstig intelligens også bekreftet. Da en eksperimentell krystallstruktur (PDB) ble åpnet, så det ut til at en kofaktor i det området som AlphaFold ikke hadde modellert allerede formet lommen - variantens effekt var fra en helt annen mekanisme. Andre tilfelle: en forsker antok at en "løkke" mellom to felt forbinder de to feltene; PAE-kartet viste høy feil (uklar relativ posisjon) mellom disse to områdene, så koblingspåstanden var ubegrunnet. Å lese PAE forhindret en defekt mekanismehistorie.

5) AlphaFold grensekontrollmal:

Før du vurderer følgende strukturelle påstand, liste opp hvilke begrensninger av AlphaFold som spiller inn i dette spørsmålet: [krav]. Fortell meg hvilke tilleggsbevis (eksperimentell struktur, funksjonell studie) jeg trenger, spesielt når det gjelder mangel på ligand/ion/kofaktor, mangel på mutasjonsmodellering og PAE-usikkerhet.

Oppsummert

  • AlphaFold er et kraftig verktøy som forutsier struktur fra sekvens, men resultatet er en gjetning; bør leses sammen med konfidenspoeng.
  • pLDDT indikerer lokal tillit, PAE indikerer plasseringstillit på tvers av domener; Se på begge før du kommenterer.
  • LLM kan ikke "huske" koordinater eller struktur; få strukturen fra AlphaFold/PDB, bruk LLM i kommentarfeltet.
  • Empirisk bevis og ekspertvurdering er uunnværlig i kritiske avgjørelser.

Søknadsoppgave

Last ned AlphaFold-strukturen til et protein (f.eks. en godt studert tumorsuppressor) etter UniProt-nummer. Beregn gjennomsnittlig pLDDT og lavt trygt restforhold med kodebiten ovenfor. Velg deretter en variant og be AI om en tolkningsplan med den andre malen; Sjekk pLDDT- og UniProt-funksjonsmerknaden til resten selv. Knytt kravet ditt til en numerisk konfidensverdi.

sjekkliste

  • [ ] Jeg fikk strukturen fra AlphaFold/PDB med UniProt-nummeret.
  • [ ] Jeg leste pLDDT og PAE før jeg kommenterte.
  • [ ] Jeg ba ikke LLM om å gjøre opp koordinater/poeng.
  • [ ] Jeg koblet varianttolkningen til konfidenspoengsummen til den tilsvarende resten.
  • [ ] Jeg sammenlignet det med den eksperimentelle strukturen, hvis tilgjengelig.
  • [ ] Jeg støttet den kritiske avgjørelsen med ekspertvurderinger og empiriske bevis.