zisky:
- Být schopen porozumět práci AlphaFold, skóre spolehlivosti, jako je pLDDT a PAE, a tomu, že struktura je „předpověď“, a správně interpretovat strukturu pomocí umělé inteligence.
- Schopnost rozpoznat oblasti s nízkým skóre spolehlivosti (flexibilní/nepravidelné) a vyhnout se přílišné interpretaci a porovnat s experimentálními důkazy
- Schopnost aplikovat disciplínu zacházení s predikcí struktury jako hypotézu a propojení funkčních tvrzení s experimentální verifikací.
Abychom pochopili, co protein dělá, je často nutné znát jeho trojrozměrnou složenou strukturu; protože funkce vychází ze struktury. Po celá desetiletí by experimentální určování struktury proteinu (rentgenová krystalografie, kryo-elektronová mikroskopie) trvalo měsíce až roky. AlphaFold (systém umělé inteligence vyvinutý společností DeepMind, který předpovídá proteinovou strukturu z aminokyselinových sekvencí) to zredukoval na minuty a zveřejnil předpokládané struktury stovek milionů proteinů. V této lekci se naučíte, jak číst výstup AlphaFold, jak interpretovat skóre spolehlivosti a jak při této interpretaci bezpečně používat LLM.
Kritický rozdíl: AlphaFold je nástroj pro predikci struktury a jeho výstupem je předpověď, nikoli experimentální pravda. LLM (model chatu jako ChatGPT) není samotný AlphaFold; Nemůže si „pamatovat“ souřadnice proteinu. Použijte LLM k interpretaci a vysvětlení výstupu AlphaFold; načíst samotnou strukturu z databáze nebo nástroje AlphaFold.
Základní pojmy
- Primární struktura: Sekvence aminokyselin (písmenový řetězec proteinu).
- Sekundární/terciární struktura: Helix (alfa-helix), list (beta-list) a trojrozměrné skládání řetězce.
- pLDDT: Lokální skóre spolehlivosti AlphaFold pro každou aminokyselinu v rozmezí od 0 do 100. 90+ znamená velmi vysokou spolehlivost, 70-90 znamená dobrou, 50-70 znamená nízkou a pod 50 znamená velmi nízkou spolehlivost. Oblasti s nízkým pLDDT jsou obecně "neuspořádané" oblasti (bez zřetelného záhybu).
- PAE (Predicted Aligned Error): Předpokládaná chyba v relativní poloze dvou oblastí; Ukazuje, jak spolehlivé je umístění domén vůči sobě navzájem.
- PDB: Formát databáze a souboru, ve kterém jsou uloženy experimentální proteinové struktury.
Čtení výstupu AlphaFold: krok za krokem
1. Vyberte správný protein a sekvenci. Identifikujte protein pomocí čísla UniProt (databáze informací o proteinech); Najděte strukturu s tímto číslem v databázi AlphaFold.
2. Podívejte se na mapu pLDDT. Podívejte se, které části struktury jsou předpovídány s vysokou spolehlivostí (modrá) a které jsou předpovídány s nízkou spolehlivostí (oranžová/žlutá). Buďte opatrní ohledně komentářů v oblastech s nízkou důvěrou.
3. Přečtěte si tabulku PAE. PAE ukazuje, zda je relativní uspořádání domén ve vícedoménovém proteinu spolehlivé. Vysoká PAE znamená, že relativní poloha polí je nejistá.
4. Porovnejte s experimentální strukturou. Srovnejte experimentální strukturu v PNR, pokud je k dispozici. Pokud se předpověď AlphaFold blíží experimentální hodnotě, vaše sebevědomí se zvýší.
5. Interpretujte efekt varianty. Při interpretaci účinku změny aminokyseliny na strukturu zvažte společně pLDDT a funkční význam této oblasti (aktivní místo, vazebná kapsa).
Tip: Nízké pLDDT nemusí vždy znamenat „špatný odhad“; Často je to známka toho, že oblast je skutečně vnitřně neuspořádaná. Tak nízká důvěra někdy odráží přesný biologický fakt. Také zkontrolujte sekvenci pomocí nástrojů pro predikci nepravidelností, abyste to rozlišili.
tři mini pouzdra
Případ 1 – Nadměrná interpretace zóny nízké spolehlivosti. Jeden student tvrdil, že „smyčka“ ve struktuře AlphaFold se vejde do konkrétní kapsy, a AI to potvrdila. Když se však student podíval na pLDDT, viděl, že skóre tohoto stehu bylo 42 (velmi nízké); takže jeho pozice byla nespolehlivá. Nárok byl stažen. Ponaučení: Před komentováním vždy zkontrolujte místní skóre důvěryhodnosti.
Případ 2 – Vymyšlená souřadnice. Výzkumník se zeptal LLM na 3D souřadnice konkrétní aminokyseliny proteinu; LLM uváděla přesvědčivá čísla na tři desetinná místa. Když je výzkumník porovnal se skutečnými souřadnicemi v souboru AlphaFold PDB, viděl, že jsou zcela vymyšlené. LLM si nemůže "pamatovat" souřadnice; souřadnice musí být načteny ze souboru.
Případ 3 – Získané potvrzení. Doktorského studenta zajímalo, zda jedna varianta (p.Gly12Val) byla blízko aktivního místa proteinu. YZ připomněl, že zbytky aktivního místa jsou specifikovány v UniProt; Student otevřel UniProt a našel aktivní místo, poté pomocí prohlížeče struktury (PyMOL) změřil, že Gly12 byl ve struktuře AlphaFold od tohoto místa vzdálen 8 angstromů. Numerické měření ztělesňovalo tvrzení „blízko“.
Příklad: čtení pLDDT ze souboru struktury
# V souboru AlphaFold PDB je pLDDT uložen ve sloupci B-faktor. z Bio.PDB import PDBParserimport numpy as npyapi = PDBParser(QUIET=True).get_structure("AF", "AF-P04637-F1.pdb")plddt = [atom.bfaktor pro atom ve struktuře.get_atoms() if atom.name == "CAverage"]print( round(np.mean(plddt), 1))print("Nízká spolehlivost (<70) míra zbytků (%):", round(100 * np.mean(np.array(plddt) < 70), 1))
To vám umožní číselně vidět celkovou spolehlivost struktury před komentováním.
Čtyři kopírovatelné šablony
1) Interpretace struktury (se skóre spolehlivosti):
Vaše role: asistent strukturální biologie. Pomozte mi interpretovat AlphaFold strukturu proteinu UniProt [číslo]. Odpovězte na tyto otázky, ale koordinujte/skóre PŘIPOJENÍ: ve kterých regionech očekáváme vysoké/nízké pLDDT, co ukazuje PAE, existuje experimentální struktura (PDB), jak to mohu porovnat? Načtu hodnoty ze souboru.
2) Efekt struktury varianty:
Pomozte mi interpretovat možný vliv následující varianty na strukturu proteinu: [str. Dejte mi, jaké důkazy mám hledat místo vyloženě "destruktivního" tvrzení.
3) popis pLDDT/PAE:
Vysvětlete na příkladu rozdíl mezi pLDDT a PAE, na který se mám podívat a kdy ve variantní analýze. Zvažte případy proteinů s jednou doménou a více doménami samostatně.
4) Plán porovnání struktury:
Chci porovnat předpověď AlphaFold s experimentální strukturou PDB. Jak vypočítat RMSD (střední odchylku mezi strukturami), jakým nástrojem to udělám (PyMOL,Biopython), jaký práh se počítá jako „dobré překrytí“? Poskytněte plán krok za krokem.
Slabá výzva / Silná výzva
Slabý: "Nakreslete strukturu tohoto proteinu a řekněte účinek p.Arg273His."
Problém: LLM nemůže nakreslit souřadnice struktury/přizpůsobení; skóre spolehlivosti se nebere v úvahu; Tvrzení o definitivním účinku by bylo neopodstatněné.
Strong: "Sám jsem si stáhl sestavení AlphaFold pro UniProt P04637. Když se podíváte na pLDDT zbytku p.Arg273His a jeho funkční anotaci v UniProt, řekněte mi krok za krokem, jak bych měl interpretovat jeho účinek; dejte mi, jaké důkazy mám hledat místo definitivního tvrzení."
Proč je mocný: Struktura je převzata ze zdroje, do středu je kladeno skóre důvěry, tvrzení je spojeno s důkazy.
Otázka
Dodává AlphaFold?
Kde/jak potvrdit
3D předpověď ohybu
Ano
AlphaFold DB / soubor
místní důvěra
Ano (pLDDT)
Sloupec B-faktoru
Umístění mezi doménami
Ano (PAE)
PAE graf
Experimentální reálná struktura
ne
PNR (experimentální)
Přesný funkční dopad varianty
ne
Funkční studie + expert
Časté chyby
- Přeskakování skóre důvěry. Interpretace v oblasti nízkého pLDDT je nespolehlivá.
- Záměna předpovědi za empirický fakt. Výstup AlphaFold je odhad; Kritická rozhodnutí vyžadují empirické důkazy.
- Žádost o souřadnice od LLM. Souřadnice se čtou ze souboru, neukládají se do paměti.
- Ignorování PAE. U vícedoménových proteinů může být relativní poloha domén nejistá.
- Okamžitě považovat nízkou důvěru za "chybu". Někdy je ta oblast opravdu nerovná.
Upozornění: Sestavení AlphaFold představuje "statický" obraz; Pamatujte, že proteiny jsou ve skutečnosti mobilní molekuly, které mohou vstupovat do více konformací. Žádná jednotlivá struktura plně neodráží dynamické chování.
Hloubka: AlphaFold je konstrukčně tichý
AlphaFold je výkonný, ale vědět, co neumí, je polovina úspěchu k bezpečnému používání. Za prvé, standardní AlphaFold skládá jeden protein v prostoru; Nemodeluje ligandy, ionty, kofaktory a molekuly léčiv. Zinkový iont v aktivním místě enzymu nebo substrátu se ve struktuře neobjevuje; Proto může být komentář typu „tato kapsa je prázdná, nefunkční“ zavádějící. Za druhé, nemodeluje přímo účinek mutace: i když zavedete dvě varianty blízké stejné sekvenci, AlphaFold obvykle vytvoří téměř stejnou strukturu; Nemůžete dokázat tvrzení „tato varianta narušuje strukturu“ porovnáním dvou předpovědí z AlphaFold. Za třetí, nebere v úvahu posttranslační modifikace (jako je fosforylace, glykosylace) a aktuální prostředí membránových proteinů v membráně.
Příklad: jeden tým tvrdil ze snímku AlphaFold, že varianta v blízkosti kapsy vázající ATP v enzymu kinázy „uzavírá kapsu“; potvrdila i umělá inteligence. Když byla otevřena experimentální krystalová struktura (PDB), zdálo se, že kofaktor v této oblasti, který AlphaFold nemodeloval, již formoval kapsu – efekt varianty byl ze zcela jiného mechanismu. Druhý případ: výzkumník předpokládal, že „smyčka“ mezi dvěma poli tato dvě pole spojuje; Mapa PAE vykazovala vysokou chybu (nejasná relativní poloha) mezi těmito dvěma oblastmi, takže tvrzení o spojení bylo neopodstatněné. Čtení PAE zabránilo chybnému příběhu mechanismu.
5) Šablona ovládání hranic AlphaFold:
Než zvážíte následující strukturální tvrzení, uveďte, jaká omezení AlphaFold přicházejí v této otázce do hry: [nárok]. Řekněte mi, jaké další důkazy (experimentální struktura, funkční studie) potřebuji, zejména pokud jde o deficit ligandu/iontu/kofaktoru, chybějící modelování mutací a nejistotu PAE.
V souhrnu
- AlphaFold je mocný nástroj, který předpovídá strukturu ze sekvence, ale jeho výstup je jen odhad; je třeba číst společně se skóre spolehlivosti.
- pLDDT označuje místní důvěryhodnost, PAE označuje důvěryhodnost umístění mezi doménami; Než začnete komentovat, podívejte se na oba.
- LLM si nemůže "pamatovat" souřadnice nebo strukturu; získat strukturu z AlphaFold / PDB, použijte LLM v komentáři.
- Empirické důkazy a odborný úsudek jsou v kritických rozhodnutích nepostradatelné.
Aplikační úkol
Stáhněte si AlphaFold strukturu proteinu (např. dobře prostudovaný tumor supresor) podle čísla UniProt. Vypočítejte průměrnou hodnotu pLDDT a nízký poměr bezpečných reziduí pomocí výše uvedeného fragmentu kódu. Poté vyberte variantu a požádejte AI o plán interpretace s 2. šablonou; Zkontrolujte si sami funkční anotaci pLDDT a UniProt tohoto zbytku. Spojte svůj nárok s číselnou hodnotou spolehlivosti.
kontrolní seznam
- [ ] Strukturu jsem získal z AlphaFold/PDB s číslem UniProt.
- [ ] Před komentářem jsem četl pLDDT a PAE.
- [ ] Nežádal jsem LLM, aby vytvořil souřadnice/skóre.
- [ ] Variantní interpretaci jsem spojil se skóre spolehlivosti odpovídajícího zbytku.
- [ ] Porovnal jsem to s experimentální strukturou, pokud je k dispozici.
- [ ] Kritické rozhodnutí jsem podpořil odborným úsudkem a empirickými důkazy.