Jednotka 7 / 11

Predikce molekulárních vlastností a QSAR: Rozlišení, pKa a limity modelu

zisky:

  • Schopnost rozlišovat mezi deterministicky vypočítanými znaky a statisticky odhadovanými znaky a určit úrovně spolehlivosti
  • Schopnost vyhodnotit oblast, ve které je model spolehlivý, pomocí konceptu domény použitelnosti
  • Schopnost pochopit, že by člověk měl používat předpovědi vlastností k seřazení kandidátů a učinit konečné rozhodnutí prostřednictvím experimentování.

Před syntézou molekuly se často ptáme: "Je rozpustná ve vodě? Jak je kyselá? Prochází buněčnou membránou? Je věrohodná jako kandidát na lék?" Předpovídání odpovědí na tyto otázky před experimentem ušetří spoustu času. AI a její specializované modely (zejména QSAR — Quantitative Structure-Activity Relationship, tj. statistický model, který předpovídá vlastnost ze strukturních deskriptorů molekuly) jsou v těchto předpovědích mocné. Ale tyto předpovědi jsou předpovědi pravděpodobnosti, nikoli měření. V této lekci se seznámíme s predikcí vlastností, jejími silnými stránkami a nejkritičtějším konceptem, zónou použitelnosti (oblast, kde je model spolehlivý).

Jaké vlastnosti se předpokládají?

  • logP: Rozdělovací koeficient molekuly olej/voda; Vykazuje lipofilitu (oblíbení si tuku). Rozhodující pro absorpci léčiva.
  • Rozpustnost (logS): Jak je rozpustný ve vodě.
  • pKa: kyselost/zásaditost; pH, při kterém se skupina ionizuje.
  • TPSA: topologická plocha polárního povrchu; Používá se při odhadu propustnosti.
  • Lipinského „pravidlo pěti“: Praktické prahové hodnoty pro molekulovou hmotnost, logP, počet donorů/akceptorů H-vazby kandidátů na perorální léky.

Některé z těchto hodnot se počítají deterministicky (např. TPSA, čísla H-vazeb) pomocí nástrojů, jako je RDKit; Některé z nich jsou statistické odhady (logS, biologická aktivita). Znalost tohoto rozdílu určuje, jak moc si důvěřujete.

Tip: Rozlišujte, zda je funkce „vypočítaná“ (na základě pravidel, opakovatelná) nebo „předpokládaná“ (z modelu, nejistá). Mějte vysokou důvěru ve výpočty, obezřetně důvěřujte předpovědím a ověřujte předpovědi experimentem.

Rozsah použitelnosti: nejdůležitější pojem

Model QSAR funguje dobře na molekulách, které jsou podobné molekulám, na kterých byl trénován. Pokud zadáte molekulu, která se velmi liší od trénovacích dat (například velmi velká, neobvyklá kostra), model bude stále vytvářet číslo, ale toto číslo bude nespolehlivé. Tomu se říká „být mimo rozsah použitelnosti“. Model vždy dává odpověď; Vaším úkolem je říci, zda je odpověď spolehlivá nebo ne.

Je to ještě riskantnější, když jazykový model udává hodnotu atributu: vytváří číslo jako „pravděpodobně vypadající“ hodnotu bez základního výpočtu. Pokud je to možné, získejte hodnoty funkcí z deterministického nástroje (RDKit) nebo modelu QSAR, který poskytuje nejistotu, nikoli z jazykového modelu.

Krok za krokem: predikce bezpečných funkcí

  1. Ověřte molekulu: Analyzujte SMILES pomocí RDKit (jednotka 2).
  2. Vypočítejte deterministické: MA, logP (vypočtené), TPSA, čísla H-vazeb z RDKit.
  3. Označte předpovědi samostatně: Předpovědi modelu, jako je logS, aktivita atd., uchovávejte pomocí značky „predikce“.
  4. Zkontrolujte oblast použitelnosti: Vypadá molekula jako tréninková data? Je extrémně velký/neobvyklý?
  5. Použití pro hodnocení, nikoli rozhodnutí: Použijte předpovědi k hodnocení kandidátů; Konečná volba je experiment.
  6. Závěr experimentu: Ověřte kritické vlastnosti (rozpustnost, pKa) měřením.

Čtyři kopírovatelné šablony

1) Deterministické funkce s RDKit:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (vypočteno):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond akceptor:", rdMolDescriptors.CalcNumHBA(mol))

2) Vyhodnocení Lipinského pravidla:

Molekula (SMILES): [SMILES] Úkol: Vyhodnoťte shodu s Lipinského pravidlem pěti s hodnotami MA, logP, HBD, HBA, které se mají vypočítat z RDKit. Označte každé kritérium samostatně jako vyhovující/nevyhovující. Pravidlo: NEVYMÝŠLEJTE čísla; Dostanu to z RDKit, komentuješ.

3) Odhad funkce + požadavek na nejistotu:

Molekula (SMILES): [SMILES] Úkol: Uveďte kvalitativní odhad rozpustnosti ve vodě (logS) (vysoká/střední/nízká) a vysvětlete zdůvodnění pomocí strukturních znaků. Neuvádějte přesné číslo; Uveďte, že se jedná o PŘEDPOVĚĎ a je třeba ji potvrdit experimentem. Upozorněte, pokud má molekula neobvyklou strukturu (riziko použitelnosti).

4) Pořadí kandidátů (upřednostnění podle předpovědi):

Níže jsou SMILES 5 molekul. Úkol: Seřaďte je z hlediska rozpustnosti ve vodě (nejrozpustnější až nejméně) na základě strukturních znaků (počet polárních skupin, kruhů, lipofilita). Ke každému rozhodnutí o hodnocení napište odůvodnění. Poznámka: Toto je PŘEDBĚŽNÉ třídění; Konečný výběr bude proveden měřením.

Slabá výzva / Silná výzva

slabé:

Jaká je rozpustnost této molekuly?

AI ​​vytváří číslo, které ve výpočtu neexistuje (např. „12 mg/ml“); Dává to důvěru, ale může se mýlit.

Silný:

Molekula (SMILES): [SMILES]. Úkol: 1) Dám logP, TPSA, HBD/HBA k výpočtu pomocí RDKit: [hodnoty].2) Na základě těchto hodnot interpretujte, zda je rozlišení vysoké/střední/nízké.3) Uveďte přesné číslo; Uveďte, že se jedná o odhad a jsou vyžadovány experimenty.

Rozdíl: vzali jsme deterministické hodnoty z vozidla a nechali je AI pouze interpretovat; Výslovně jsme žádali o nejistotu a potřebu experimentování.

Typy funkcí a úroveň důvěryhodnosti

funkce

Jak získat

důvěřovat

poznámka

molekulová hmotnost

RDKit (deterministický)

velmi vysoká

Vystřihněte ze vzorce

TPSA, HBD/HBA

RDKit (deterministický)

vysoká

založené na pravidlech

logP (vypočteno)

Model RDKit

středně vysoká

Může se odchýlit od experimentu

logS (rozlišení)

odhad QSAR

střední

Závisí na oblasti použití

pKa

speciální model

střední

Spadá do složité struktury

biologická aktivita

QSAR/ML

Variabilní

Určitě otestujte a ověřte

mini pouzdra

Případ 1 – Počet použitých rozlišení. Student se zeptal AI na rozpustnost sloučeniny; Dostal odpověď „25 mg/ml“ a podle toho nastavil experimentální design. Skutečná hodnota v měření byla ~2 mg/ml, což je 10násobný rozdíl. AI si číslo vymyslela. Poučení: neberte vlastnosti jako rozlišení jako čísla z jazykového modelu; kvalitativní predikce + měření.

Případ 2 – Mimo rozsah použitelnosti. Model QSAR řekl, že „aktivita je vysoká“ pro velkou makromolekulu, která se velmi lišila od tréninkové sady. Uživatel si všiml, že molekula se nepodobala trénovacím datům a považoval předpověď za nespolehlivou; Experiment vykazoval opravdu nízkou aktivitu. Poučení: model vždy odpovídá; Pokud je mimo rozsah, odpověď je bezcenná.

Případ 3 – Správné použití přípravku Lipinski. Na jedné kandidátní molekule AI vyhodnotila Lipinskiho hodnotami z RDKit: MA 512 (>500, hraniční), logP 4,8 (příznivé), HBD 2, HBA 7. Uživatel správně interpretoval „jedno kritérium zůstává, ale pravidlo není absolutní“ a molekulu zcela nevyloučil. Ponaučení: pravidla jsou pokyny, nikoli prahové hodnoty; Interpretujte s kontextem.

Časté chyby

  • Získání počtu funkcí z jazykového modelu. Hodnoty, které nejsou vypočteny, jsou vyrobeny; Použijte deterministický nástroj nebo model s nejistotou.
  • Ignorování oblasti působnosti. Model generuje čísla pro každou molekulu; mimo pole nespolehlivé.
  • S ohledem na odhadované měření. logS je odhad; Nenahrazuje experimentální rozlišení.
  • Považovat Lipinského za absolutní pravidlo. Kandidát, který je na hranici, není automaticky vyřazen; Mnoho léků toto pravidlo porušuje.
  • Záměna „vypočítaného“ s „odhadem“. TPSA se vypočítá (spolehlivá), aktivita se odhadne (nejistá).
Upozornění: Předpovědi funkcí jsou skvělé pro hodnocení a upřednostňování kandidátů; ale ne určovat rozhodnutí sám. "Model řekl rozpustný" je hypotéza; "Měřil jsem, rozpouští se" je výsledek.

V souhrnu

  • Molekulární vlastnosti lze předpovědět před experimentem a ušetří spoustu času.
  • Některé znaky jsou kalkulovány deterministicky (MA, TPSA, HBD/HBA), některé jsou statistické odhady (logS, aktivita).
  • Oblast použitelnosti je nejkritičtější koncept: model vždy odpovídá, ale mimo doménu je nespolehlivý.
  • Získejte počty funkcí z RDKit nebo z modelu nejednoznačnosti, nikoli z jazykového modelu.
  • Použijte předpovědi k hodnocení kandidátů; Udělejte konečné rozhodnutí experimentováním.

Aplikační úkol

Vyberte pět molekul (např. sérii léků). Vypočítejte MA, logP, TPSA, HBD, HBA pro každý pomocí RDKit a vyhodnoťte Lipinski. Samostatně požádejte AI ​​o kvalitativní odhad (nikoli číslo) rozpustnosti každé molekuly a pole pro varování o použitelnosti. Shromažďujte deterministické hodnoty a předpovědi AI do tabulky. Která molekula měla nejpodobnější profil léku? Kde je nejistota nejvyšší?

kontrolní seznam

  • [ ] Rozlišuji vlastnosti deterministické vypočítané a predikované.
  • [ ] Hodnoty vlastností získávám z RDKit/modelu, nikoli z jazykového modelu.
  • [ ] Všímám si molekul mimo rozsah použitelnosti.
  • [ ] Lipinského používám jako vodítko, ne jako absolutní pravidlo.
  • [ ] Předpovědi používám pro hodnocení a rozhodování pro experimentování.
  • [ ] Mám v plánu ověřit kritické vlastnosti měřením.