zisky:
- Schopnosť rozlišovať medzi deterministicky vypočítanými znakmi a štatisticky odhadnutými znakmi a určiť úrovne spoľahlivosti
- Schopnosť vyhodnotiť oblasť, v ktorej je model spoľahlivý, pomocou konceptu domény použiteľnosti
- Schopnosť pochopiť, že človek by mal používať predpovede vlastností na klasifikáciu kandidátov a urobiť konečné rozhodnutie prostredníctvom experimentovania.
Pred syntézou molekuly sa často pýtame: "Je rozpustná vo vode? Aká je kyslá? Prechádza cez bunkovú membránu? Je prijateľná ako kandidát na liečivo?" Predpovedanie odpovedí na tieto otázky pred experimentom ušetrí veľa času. AI a jej špecializované modely (najmä QSAR — Quantitative Structure-Activity Relationship, t.j. štatistický model, ktorý predpovedá vlastnosť zo štruktúrnych deskriptorov molekuly) sú v týchto predpovediach silné. Ale tieto predpovede sú predpovede pravdepodobnosti, nie merania. V tomto bloku sa dozvieme o predikcii funkcií, jej silných stránkach a najdôležitejšom koncepte, zóne použiteľnosti (región, v ktorom je model spoľahlivý).
Aké vlastnosti sú predpovedané?
- logP: rozdeľovací koeficient molekuly olej/voda; Vykazuje lipofilitu (obľuba tuku). Rozhodujúce pre absorpciu liečiva.
- Rozpustnosť (logS): Ako je rozpustný vo vode.
- pKa: kyslosť/zásaditosť; pH, pri ktorom sa skupina ionizuje.
- TPSA: topologická oblasť polárneho povrchu; Používa sa pri odhade priepustnosti.
- Lipinského „pravidlo piatich“: Praktické prahové hodnoty pre molekulovú hmotnosť, logP, počet donorov/akceptorov H-väzieb kandidátov na perorálne lieky.
Niektoré z týchto hodnôt sú vypočítané deterministicky (napr. TPSA, čísla H-väzieb) pomocou nástrojov, ako je RDKit; Niektoré z nich sú štatistické odhady (logS, biologická aktivita). Poznanie tohto rozdielu určuje, do akej miery si dôverujete.
Tip: Rozlišujte, či je funkcia „vypočítaná“ (na základe pravidiel, opakovateľná) alebo „predpovedaná“ (z modelu, neistá). Majte vysokú dôveru vo výpočty, opatrnú dôveru v predpovede a overujte predpovede experimentom.
Rozsah pôsobnosti: najdôležitejší pojem
Model QSAR funguje dobre na molekulách, ktoré sú podobné molekulám, na ktorých bol trénovaný. Ak zadáte molekulu, ktorá sa veľmi líši od trénovacích údajov (napríklad veľmi veľká, nezvyčajná kostra), model aj tak vytvorí číslo, ale toto číslo bude nespoľahlivé. Hovorí sa tomu „byť mimo rozsahu pôsobnosti“. Model vždy dáva odpoveď; Vašou úlohou je povedať, či je odpoveď spoľahlivá alebo nie.
Je to ešte riskantnejšie, keď jazykový model dáva hodnotu atribútu: vytvára číslo ako „pravdepodobne vyzerajúcu“ hodnotu bez akéhokoľvek základného výpočtu. Ak je to možné, získajte hodnoty funkcií z deterministického nástroja (RDKit) alebo modelu QSAR, ktorý poskytuje neistotu, nie z jazykového modelu.
Krok za krokom: predikcia bezpečných funkcií
- Overte molekulu: Analyzujte SMILES pomocou RDKit (jednotka 2).
- Vypočítajte deterministické: MA, logP (vypočítané), TPSA, čísla H-väzieb z RDKit.
- Predpovede označujte samostatne: Predpovede modelu, ako sú logS, aktivita atď., uchovávajte pomocou značky „predikcia“.
- Skontrolujte oblasť použiteľnosti: Vyzerá molekula ako tréningové dáta? Je extrémne veľký/neobvyklý?
- Použiť na hodnotenie, nie na rozhodnutie: Použite predpovede na hodnotenie kandidátov; Konečná voľba je experiment.
- Záver experimentu: Kritické vlastnosti (rozpustnosť, pKa) overte meraním.
Štyri kopírovateľné šablóny
1) Deterministické funkcie s RDKit:
from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (vypočítané):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond akceptor:", rdMolDescriptors.CalcNumHBA(mol))
2) Vyhodnotenie Lipinského pravidla:
Molekula (SMILES): [SMILES] Úloha: Vyhodnoťte súlad s Lipinského pravidlom piatich s hodnotami MA, logP, HBD, HBA, ktoré sa majú vypočítať z RDKit. Označte každé kritérium samostatne ako vyhovuje/nevyhovuje. Pravidlo: Čísla si nevymýšľajte; Dostanem to z RDKit, komentujte.
3) Odhad funkcie + požiadavka na neistotu:
Molekula (SMILES): [SMILES] Úloha: Uveďte kvalitatívny odhad rozpustnosti vo vode (logS) (vysoká/stredná/nízka) a vysvetlite dôvod pomocou štruktúrnych prvkov. Neuvádzajte presné číslo; Uveďte, že ide o PREDPOVEĎ a je potrebné ju potvrdiť experimentom. Upozornite, ak má molekula neobvyklú štruktúru (riziko použiteľnosti).
4) Poradie kandidátov (určenie priorít podľa predpovede):
Nižšie sú ÚSMEVY 5 molekúl. Úloha: Zoraďte ich z hľadiska rozpustnosti vo vode (najrozpustnejšie po najmenej) na základe štruktúrnych znakov (počet polárnych skupín, kruhov, lipofilita). Ku každému rozhodnutiu o poradí napíšte odôvodnenie. Poznámka: Toto je PREDBEŽNÉ zoradenie; Konečný výber sa uskutoční meraním.
Slabá výzva / Silná výzva
slabé:
Aká je rozpustnosť tejto molekuly?
AI vytvára číslo, ktoré pri výpočte neexistuje (napr. „12 mg/ml“); Dodáva dôveru, ale môže sa mýliť.
Silný:
Molekula (SMILES): [SMILES]. Úloha: 1) Dám logP, TPSA, HBD/HBA na výpočet pomocou RDKit: [hodnoty].2) Na základe týchto hodnôt interpretujte, či je rozlíšenie vysoké/stredné/nízke.3) Uveďte presné číslo; Uveďte, že ide o odhad a sú potrebné experimenty.
Rozdiel: zobrali sme deterministické hodnoty z vozidla a prinútili AI ich len interpretovať; Výslovne sme žiadali o neistotu a potrebu experimentovania.
Typy funkcií a úroveň dôveryhodnosti
vlastnosť
Ako získať
dôverovať
poznámka
molekulovej hmotnosti
RDKit (deterministický)
veľmi vysoká
Vystrihnite zo vzorca
TPSA, HBD/HBA
RDKit (deterministický)
vysoká
založené na pravidlách
logP (vypočítané)
Model RDKit
stredne vysoká
Môže sa líšiť od experimentálneho
logS (rozlíšenie)
odhad QSAR
stredná
Závisí od oblasti použitia
pKa
špeciálny model
stredná
Spadá do zložitej štruktúry
biologická aktivita
QSAR/ML
Variabilné
Určite otestujte a overte
mini prípady
Prípad 1 – Počet prispôsobených rozlíšení. Študent sa opýtal AI na rozpustnosť zlúčeniny; Dostal odpoveď „25 mg/ml“ a podľa toho nastavil experimentálny dizajn. Skutočná hodnota pri meraní bola ~2 mg/ml, čo je 10-násobný rozdiel. AI vymyslela číslo. Ponaučenie: neberte vlastnosti ako rozlíšenie ako čísla z jazykového modelu; kvalitatívna predpoveď + meranie.
Prípad 2 – Mimo rozsahu pôsobnosti. Model QSAR povedal, že „aktivita je vysoká“ pre veľkú makromolekulu, ktorá sa veľmi líšila od tréningovej sady. Používateľ si všimol, že molekula sa nepodobala trénovacím údajom a predikciu považoval za nespoľahlivú; Experiment vykazoval skutočne nízku aktivitu. Ponaučenie: model vždy reaguje; Ak je mimo rozsah, odpoveď je bezcenná.
Prípad 3 – Správne používanie Lipinského. Na jednej kandidátskej molekule AI vyhodnotila Lipinskiho hodnotami z RDKit: MA 512 (>500, hraničná hodnota), logP 4,8 (priaznivé), HBD 2, HBA 7. Používateľ správne interpretoval „jedno kritérium zostáva, ale pravidlo nie je absolútne“ a molekulu úplne nevylúčil. Ponaučenie: pravidlá sú usmernenia, nie prahové hodnoty; Interpretujte s kontextom.
Časté chyby
- Získanie počtu funkcií z jazykového modelu. Hodnoty, ktoré nie sú vypočítané, sú vyrobené; Použite deterministický nástroj alebo model s neistotou.
- Ignorovanie oblasti pôsobnosti. Model generuje čísla pre každú molekulu; nespoľahlivé mimo poľa.
- Berúc do úvahy odhadované meranie. logS je odhad; Nie je náhradou za experimentálne rozlíšenie.
- Považujúc Lipinského za absolútne pravidlo. Kandidát, ktorý je na hranici, nie je automaticky vyradený; Mnohé drogy porušujú toto pravidlo.
- Zamieňanie „vypočítaného“ s „odhadom“. TPSA je vypočítaná (spoľahlivá), aktivita je odhadnutá (neistá).
Upozornenie: Predpovede funkcií sú skvelé na hodnotenie a uprednostňovanie kandidátov; ale nie určovať rozhodnutie sám. "Model povedal rozpustný" je hypotéza; "Meral som, rozpúšťa sa" je výsledok.
V súhrne
- Molekulové vlastnosti sa dajú predpovedať pred experimentom a ušetria veľa času.
- Niektoré znaky sú vypočítané deterministicky (MA, TPSA, HBD/HBA), niektoré sú štatistické odhady (logS, aktivita).
- Oblasť použiteľnosti je najdôležitejším konceptom: model vždy odpovedá, ale mimo domény je nespoľahlivý.
- Získajte počet funkcií z RDKit alebo modelu nejednoznačnosti, nie z jazykového modelu.
- Použite predpovede na hodnotenie kandidátov; Urobte konečné rozhodnutie experimentovaním.
Aplikačná úloha
Vyberte päť molekúl (napr. sériu liekov). Vypočítajte MA, logP, TPSA, HBD, HBA pre každý s RDKit a vyhodnoťte Lipinského. Samostatne požiadajte AI o kvalitatívny odhad (nie číslo) rozpustnosti každej molekuly a pole varovania o použiteľnosti. Zhromažďujte deterministické hodnoty a predpovede AI do tabuľky. Ktorá molekula mala najpodobnejší profil lieku? Kde je najvyššia neistota?
kontrolný zoznam
- [ ] Rozlišujem deterministické vypočítané a predpovedané vlastnosti.
- [ ] Hodnoty vlastností získavam z RDKit/modelu, nie z jazykového modelu.
- [ ] Všimol som si molekuly mimo rozsahu použiteľnosti.
- [ ] Lipinského používam ako návod, nie absolútne pravidlo.
- [ ] Predpovede používam na hodnotenie a rozhodovanie na experimentovanie.
- [ ] Mám v pláne overiť kritické vlastnosti meraním.