Jednotka 4 / 11

Štruktúra bielkovín a AlphaFold: Predikcia štruktúry čítania, skóre spoľahlivosti a validácia

zisky:

  • Byť schopný pochopiť prácu AlphaFold, skóre spoľahlivosti, ako sú pLDDT a PAE, a to, že štruktúra je „predpoveď“, a správne interpretovať štruktúru pomocou umelej inteligencie.
  • Schopnosť rozpoznať oblasti s nízkym skóre spoľahlivosti (flexibilné/nepravidelné) a vyhnúť sa nadmernej interpretácii a porovnávať s experimentálnymi dôkazmi
  • Schopnosť aplikovať disciplínu predikcie štruktúry ako hypotézu a spájať funkčné tvrdenia s experimentálnym overovaním.

Aby sme pochopili, čo proteín robí, je často potrebné poznať jeho trojrozmernú zloženú štruktúru; pretože funkcia vyplýva zo štruktúry. Experimentálne určovanie proteínovej štruktúry (röntgenová kryštalografia, kryoelektrónová mikroskopia) by po celé desaťročia trvalo mesiace až roky. AlphaFold (systém umelej inteligencie vyvinutý spoločnosťou DeepMind, ktorý predpovedá proteínovú štruktúru z aminokyselinových sekvencií) to zredukoval na minúty a zverejnil predpovedané štruktúry stoviek miliónov proteínov. V tejto lekcii sa naučíte, ako čítať výstup AlphaFold, ako interpretovať skóre spoľahlivosti a ako bezpečne používať LLM pri tejto interpretácii.

Kritický rozdiel: AlphaFold je nástroj na predpovedanie štruktúry a jeho výstupom je predpoveď, nie experimentálna pravda. LLM (model chatu ako ChatGPT) nie je samotný AlphaFold; Nemôže si „pamätať“ súradnice proteínu. Použite LLM na interpretáciu a vysvetlenie výstupu AlphaFold; získať samotnú štruktúru z databázy alebo nástroja AlphaFold.

Základné pojmy

  • Primárna štruktúra: Sekvencia aminokyselín (písmenový reťazec proteínu).
  • Sekundárna/terciárna štruktúra: Helix (alfa-helix), list (beta-sheet) a trojrozmerné skladanie reťaze.
  • pLDDT: Lokálne skóre spoľahlivosti AlphaFold pre každú aminokyselinu v rozsahu od 0 do 100. 90+ znamená veľmi vysokú spoľahlivosť, 70-90 znamená dobrú, 50-70 znamená nízku a pod 50 znamená veľmi nízku spoľahlivosť. Oblasti s nízkym pLDDT sú všeobecne "neusporiadané" oblasti (bez zreteľného záhybu).
  • PAE (Predicted Aligned Error): Predpovedaná chyba v relatívnej polohe dvoch oblastí; Ukazuje, aké spoľahlivé je umiestnenie domén voči sebe navzájom.
  • PDB: Formát databázy a súboru, v ktorom sú uložené experimentálne proteínové štruktúry.

Čítanie výstupu AlphaFold: krok za krokom

1. Vyberte správny proteín a sekvenciu. Identifikujte proteín pomocou čísla UniProt (databáza informácií o proteínoch); Nájdite štruktúru s týmto číslom v databáze AlphaFold.

2. Pozrite sa na mapu pLDDT. Pozrite sa, ktoré časti štruktúry sú predpovedané s vysokou istotou (modrá) a ktoré sú predpovedané s nízkou istotou (oranžová/žltá). Buďte opatrní pri komentároch v oblastiach s nízkou dôverou.

3. Prečítajte si tabuľku PAE. PAE ukazuje, či je relatívne usporiadanie domén vo viacdoménom proteíne spoľahlivé. Vysoká PAE znamená, že relatívna poloha polí je neistá.

4. Porovnajte s experimentálnou štruktúrou. Zosúladiť experimentálnu štruktúru v PNR, ak je k dispozícii. Ak sa predpoveď AlphaFold blíži experimentálnej hodnote, vaša dôvera sa zvýši.

5. Interpretujte variantný efekt. Pri interpretácii účinku zmeny aminokyseliny na štruktúru zvážte pLDDT a funkčný význam tejto oblasti spoločne (aktívne miesto, väzobné vrecko).

Tip: Nízke pLDDT nemusí vždy znamenať „nesprávny odhad“; Často je to znak toho, že oblasť je skutočne vnútorne neusporiadaná. Tak nízka dôvera niekedy odráža presný biologický fakt. Skontrolujte tiež postupnosť pomocou nástrojov na predikciu nepravidelností, aby ste to rozlíšili.

tri mini prípady

Prípad 1 – Nadmerná interpretácia zóny nízkej spoľahlivosti. Jeden študent tvrdil, že „slučka“ v štruktúre AlphaFold sa zmestí do konkrétneho vrecka a AI to potvrdila. Keď sa však študent pozrel na pLDDT, videl, že skóre tohto stehu bolo 42 (veľmi nízke); takže jeho pozícia bola nespoľahlivá. Nárok bol stiahnutý. Ponaučenie: Pred komentovaním si vždy skontrolujte miestne skóre dôveryhodnosti.

Prípad 2 – Vymyslená súradnica. Výskumník požiadal LLM o 3D súradnicu konkrétnej aminokyseliny proteínu; LLM uvádzala presvedčivé čísla na tri desatinné miesta. Keď ich výskumník porovnal so skutočnými súradnicami v súbore AlphaFold PDB, videl, že sú úplne vymyslené. LLM si nemôže „zapamätať“ súradnicu; súradnice sa musia načítať zo súboru.

Prípad 3 – Získané potvrdenie. Doktorand sa pýtal, či jeden variant (p.Gly12Val) bol blízko aktívneho miesta proteínu. YZ pripomenul, že zvyšky aktívneho miesta sú špecifikované v UniProt; Študent otvoril UniProt a našiel aktívne miesto, potom pomocou prehliadača štruktúry (PyMOL) zmeral, že Gly12 bol 8 angstromov od tohto miesta v štruktúre AlphaFold. Numerické meranie stelesňovalo tvrdenie „blízko“.

Príklad: čítanie pLDDT zo súboru štruktúry

# V súbore AlphaFold PDB je pLDDT uložený v stĺpci B-faktor. z Bio.PDB importovať PDBParserimport numpy ako npyapi = PDBParser(QUIET=True).get_structure("AF", "AF-P04637-F1.pdb")plddt = [atóm.bfaktor pre atóm v štruktúre.get_atoms() if atom.name == "CAverage"]print( round(np.mean(plddt), 1))print("Nízka spoľahlivosť (<70) miera zvyškov (%):", round(100 * np.mean(np.array(plddt) < 70), 1))

To vám umožňuje číselne vidieť celkovú spoľahlivosť štruktúry pred komentovaním.

Štyri kopírovateľné šablóny

1) Interpretácia štruktúry (so skóre spoľahlivosti):

Vaša úloha: asistent štrukturálnej biológie. Pomôžte mi interpretovať štruktúru AlphaFold proteínu UniProt [číslo]. Odpovedzte na tieto otázky, ale koordinujte/skóre FITTING: ktoré regióny očakávame vysoké/nízke pLDDT, čo ukazuje PAE, existuje experimentálna štruktúra (PDB), ako to môžem porovnať? Hodnoty prečítam zo súboru.

2) Efekt štruktúry variantu:

Pomôžte mi interpretovať možný vplyv nasledujúceho variantu na štruktúru proteínu: [s. Dajte mi, aké dôkazy mám hľadať namiesto vyslovene „deštruktívneho“ tvrdenia.

3) popis pLDDT/PAE:

Vysvetlite na príklade rozdiel medzi pLDDT a PAE, na ktorý sa mám pozrieť a kedy vo variantnej analýze. Zvážte prípady proteínov s jednou doménou a s viacerými doménami oddelene.

4) Plán porovnania štruktúr:

Chcem porovnať predpoveď AlphaFold s experimentálnou štruktúrou PDB. Ako vypočítať RMSD (priemernú odchýlku medzi štruktúrami), akým nástrojom to urobím (PyMOL,Biopython), aký prah sa počíta ako „dobré prekrytie“? Poskytnite plán krok za krokom.

Slabá výzva / Silná výzva

Slabý: "Nakreslite štruktúru tohto proteínu a povedzte účinok p.Arg273His."

Problém: LLM nemôže nakresliť súradnice štruktúry/prispôsobenia; skóre spoľahlivosti sa neberie do úvahy; Tvrdenie o definitívnom účinku by bolo neopodstatnené.

Strong: "Sám som si stiahol zostavu AlphaFold pre UniProt P04637. Pri pohľade na pLDDT zvyšku p.Arg273His a jeho funkčnú anotáciu v UniProt mi krok za krokom povedzte, ako by som mal interpretovať jeho účinok; dajte mi, aké dôkazy mám hľadať namiesto definitívneho tvrdenia."

Prečo je to silné: Štruktúra je prevzatá zo zdroja, skóre dôvery je umiestnené v strede, tvrdenie je spojené s dôkazmi.

Otázka

Poskytuje AlphaFold?

Kde/ako potvrdiť

Predikcia 3D záhybu

áno

AlphaFold DB / súbor

miestna dôvera

Áno (pLDDT)

B-faktorový stĺpec

Medzidoménové umiestnenie

Áno (PAE)

graf PAE

Experimentálna reálna štruktúra

č

PNR (experimentálne)

Presný funkčný dopad variantu

č

Funkčná štúdia + expert

Časté chyby

  • Preskočenie skóre dôvery. Interpretácia v oblasti nízkej pLDDT je ​​nespoľahlivá.
  • Zámena predpovede za empirický fakt. Výstup AlphaFold je odhad; Kritické rozhodnutia vyžadujú empirické dôkazy.
  • Žiadosť o súradnice od LLM. Súradnice sa čítajú zo súboru, neukladajú sa do pamäte.
  • Ignorovanie PAE. V multidoménových proteínoch môže byť relatívna poloha domén neistá.
  • Nízku dôveru okamžite považovať za „chybu“. Niekedy je táto oblasť naozaj nerovnomerná.
Upozornenie: Zostavy AlphaFold predstavujú „statický“ obrázok; Pamätajte, že proteíny sú vlastne mobilné molekuly, ktoré môžu vstúpiť do viacerých konformácií. Žiadna jednotlivá štruktúra plne neodráža dynamické správanie.

Hĺbka: AlphaFold je konštrukčne tichý

AlphaFold je výkonný, ale vedieť, čo nedokáže, je polovica úspechu pri jeho bezpečnom používaní. Po prvé, štandardný AlphaFold skladá jeden proteín v priestore; Nemodeluje ligandy, ióny, kofaktory a molekuly liečiv. Zinkový ión v aktívnom mieste enzýmu alebo substrátu sa v štruktúre neobjavuje; Preto komentár typu „toto vrecko je prázdne, nefunkčné“ môže byť zavádzajúci. Po druhé, priamo nemodeluje účinok mutácie: aj keď zavediete dva varianty blízke rovnakej sekvencii, AlphaFold zvyčajne vytvorí takmer rovnakú štruktúru; Tvrdenie „tento variant narúša štruktúru“ nemôžete dokázať porovnaním dvoch predpovedí z AlphaFold. Po tretie, neberie do úvahy posttranslačné modifikácie (ako je fosforylácia, glykozylácia) a skutočné prostredie membránových proteínov v membráne.

Príklad: jeden tím tvrdil na obrázku AlphaFold, že variant v blízkosti vrecka viažuceho ATP v enzýme kinázy „uzatvorí vrecko“; potvrdila aj umelá inteligencia. Keď bola otvorená experimentálna kryštálová štruktúra (PDB), zdalo sa, že kofaktor v tejto oblasti, ktorý AlphaFold nemodeloval, už formuje vrecko - efekt variantu bol z úplne iného mechanizmu. Druhý prípad: výskumník vyslovil hypotézu, že „slučka“ medzi dvoma poľami spája tieto dve polia; Mapa PAE vykazovala veľkú chybu (nejasnú relatívnu polohu) medzi týmito dvoma oblasťami, takže tvrdenie o spojení bolo neopodstatnené. Čítanie PAE zabránilo chybnému príbehu mechanizmu.

5) Šablóna kontroly hraníc AlphaFold:

Pred zvážením nasledujúceho štrukturálneho nároku uveďte, aké obmedzenia AlphaFold prichádzajú do hry v tejto otázke: [nárok]. Povedzte mi, aké ďalšie dôkazy (experimentálna štruktúra, funkčná štúdia) potrebujem, najmä pokiaľ ide o nedostatok ligandu/iónu/kofaktora, chýbajúce modelovanie mutácií a neistotu PAE.

V súhrne

  • AlphaFold je výkonný nástroj, ktorý predpovedá štruktúru zo sekvencie, ale jeho výstup je len odhad; by sa mali čítať spolu so skóre spoľahlivosti.
  • pLDDT označuje miestnu dôveru, PAE označuje dôveryhodnosť umiestnení medzi doménami; Pred komentovaním si pozrite obe.
  • LLM si nemôže „zapamätať“ súradnice alebo štruktúru; získajte štruktúru z AlphaFold/PDB, v komentári použite LLM.
  • Pri kritických rozhodnutiach sú nevyhnutné empirické dôkazy a odborný posudok.

Aplikačná úloha

Stiahnite si AlphaFold štruktúru proteínu (napr. dobre preštudovaného nádorového supresora) podľa čísla UniProt. Vypočítajte priemerný pLDDT a nízky pomer bezpečných zvyškov pomocou vyššie uvedeného útržku kódu. Potom vyberte variant a požiadajte AI o plán interpretácie s 2. šablónou; Skontrolujte funkčnú anotáciu pLDDT a UniProt tohto zvyšku sami. Spojte svoj nárok s číselnou hodnotou spoľahlivosti.

kontrolný zoznam

  • [ ] Dostal som štruktúru z AlphaFold/PDB s číslom UniProt.
  • [ ] Pred komentovaním som si prečítal pLDDT a PAE.
  • [ ] Nepožiadal som LLM, aby vytvoril súradnice/skóre.
  • [ ] Variantnú interpretáciu som spojil so skóre spoľahlivosti zodpovedajúceho zvyšku.
  • [ ] Porovnal som to s experimentálnou štruktúrou, ak je k dispozícii.
  • [ ] Kritické rozhodnutie som podporil odborným úsudkom a empirickými dôkazmi.