Yunit 7 / 11

Molecular Property Prediction at QSAR: Resolution, pKa at Mga Limitasyon ng Modelo

Mga nadagdag:

  • Kakayahang makilala sa pagitan ng mga deterministikong kalkuladong feature at mga feature na tinantyang ayon sa istatistika at matukoy ang mga antas ng kumpiyansa
  • Kakayahang suriin ang rehiyon kung saan maaasahan ang modelo sa pamamagitan ng paggamit ng konsepto ng domain ng pagkakalapat
  • Kakayahang maunawaan na ang isa ay dapat gumamit ng mga hula sa katangian upang iranggo ang mga kandidato at gawin ang pangwakas na desisyon sa pamamagitan ng eksperimento.

Bago mag-synthesize ng isang molekula, madalas nating itanong: "Nalulusaw ba ito sa tubig? Gaano ito ka acidic? Ito ba ay tumatawid sa lamad ng selula? Posible ba ito bilang isang kandidato sa droga?" Ang paghula ng mga sagot sa mga tanong na ito bago ang eksperimento ay nakakatipid ng maraming oras. Ang AI at ang mga dalubhasang modelo nito (lalo na ang QSAR — Quantitative Structure-Activity Relationship, i.e. statistical model na hinuhulaan ang isang property mula sa mga structural descriptor ng molecule) ay makapangyarihan sa mga hulang ito. Ngunit ang mga hulang ito ay mga hula ng posibilidad, hindi mga sukat. Sa unit na ito, malalaman natin ang tungkol sa feature prediction, ang mga lakas nito at ang pinaka kritikal na konsepto, ang applicability zone (ang rehiyon kung saan maaasahan ang modelo).

Anong mga tampok ang hinuhulaan?

  • logP: Oil/water partition coefficient ng molekula; Nagpapakita ito ng lipophilicity (pagkagusto sa taba). Kritikal sa pagsipsip ng droga.
  • Solubility (logS): Gaano ito natutunaw sa tubig.
  • pKa: Acidity/alkaliness; Ang pH kung saan nag-ionize ang isang grupo.
  • TPSA: Topological polar surface area; Ginagamit ito sa pagtatantya ng permeability.
  • Lipinski “rule of five”: Mga praktikal na threshold para sa molecular weight, logP, bilang ng mga donor/acceptor ng H-bond ng mga kandidato sa oral drug.

Ang ilan sa mga halagang ito ay deterministikong kinakalkula (hal. TPSA, H-bond number) gamit ang mga tool gaya ng RDKit; Ang ilan sa mga ito ay mga istatistikal na pagtatantya (logS, biological na aktibidad). Ang pag-alam sa pagkakaibang ito ay tumutukoy kung gaano ka nagtitiwala.

Tip: Tukuyin kung ang isang feature ay "kinakalkula" (batay sa panuntunan, nauulit) o ​​"hinulaan" (mula sa modelo, hindi sigurado). Magkaroon ng mataas na kumpiyansa sa mga kalkulasyon, maingat na kumpiyansa sa mga hula, at i-verify ang mga hula sa pamamagitan ng eksperimento.

Saklaw ng kakayahang magamit: ang pinakamahalagang konsepto

Ang isang modelo ng QSAR ay mahusay na gumagana sa mga molekula na katulad ng mga molekula kung saan ito sinanay. Kung magbibigay ka ng molekula na ibang-iba sa data ng pagsasanay (halimbawa, isang napakalaki, hindi pangkaraniwang balangkas), gagawa pa rin ang modelo ng isang numero, ngunit ang numerong iyon ay hindi mapagkakatiwalaan. Ito ay tinatawag na "pagiging nasa labas ng saklaw ng pagiging naaangkop." Ang modelo ay laging nagbibigay ng sagot; Trabaho mong sabihin kung maaasahan o hindi ang sagot.

Ito ay mas mapanganib kapag ang modelo ng wika ay nagbibigay ng isang attribute value: ito ay gumagawa ng numero bilang isang "probable-looking" na halaga, na walang pinagbabatayan na kalkulasyon. Kaya't kung maaari, kumuha ng mga halaga ng tampok mula sa isang deterministic na tool (RDKit) o ​​isang modelo ng QSAR na nagbibigay ng kawalan ng katiyakan, hindi mula sa modelo ng wika.

Hakbang-hakbang: hula sa ligtas na tampok

  1. I-verify ang molekula: I-parse ang SMILES gamit ang RDKit (unit 2).
  2. Kalkulahin ang mga deterministikong: MA, logP (kinakalkula), TPSA, mga numero ng H-bond mula sa RDKit.
  3. Markahan ang mga hula nang hiwalay: Panatilihin ang mga hula ng modelo gaya ng logS, aktibidad, atbp. gamit ang tag na "hula."
  4. Suriin ang domain ng kakayahang magamit: Ang molecule ba ay kamukha ng data ng pagsasanay? Ito ba ay napakalaki/hindi karaniwan?
  5. Gamitin para sa pagraranggo, hindi pagpapasya: Gumamit ng mga hula sa pagraranggo ng mga kandidato; Ang pinakahuling pagpipilian ay eksperimento.
  6. Isara sa pamamagitan ng eksperimento: I-verify ang mga kritikal na katangian (solubility, pKa) sa pamamagitan ng pagsukat.

Apat na maaaring kopyahin na mga template

1) Mga tampok na tiyak na may RDKit:

mula sa rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (kinakalkula):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond acceptor:", rdMolDescriptors.CalcNumHBA(mol))

2) Pagsusuri ng panuntunan ng Lipinski:

Molecule (SMILES): [SMILES]Task: Suriin ang pagsunod sa Lipinski rule of five na may MA, logP, HBD, HBA values na kakalkulahin mula sa RDKit. Markahan ang bawat criterion nang hiwalay bilang pass/fail. Panuntunan: HUWAG gumawa ng mga numero; Kukunin ko ito sa RDKit, komento mo.

3) Tinantyang tampok + kahilingan sa kawalan ng katiyakan:

Molecule (NAKAngiti): [NAKAngiti]Gawain: Magbigay ng qualitative na pagtatantya ng water solubility (logS) (high/medium/low) at ipaliwanag ang katwiran na may structural features. Huwag magbigay ng eksaktong numero; Sabihin na ito ay isang PREDICTION at kailangang kumpirmahin sa pamamagitan ng eksperimento. Magbabala kung ang molekula ay may hindi pangkaraniwang istraktura (panganib sa paggamit).

4) Ranggo ng kandidato (pag-prioritize ayon sa hula):

Nasa ibaba ang SMILES ng 5 molekula.Gawain: I-rank ang mga ito sa mga tuntunin ng water solubility (pinaka natutunaw hanggang sa pinakamaliit) batay sa mga tampok na istruktura (bilang ng mga polar group, singsing, lipophilicity). Sumulat ng katwiran para sa bawat desisyon sa pagraranggo. Tandaan: Ito ay isang PRELIMINARY na uri; Ang huling pagpili ay gagawin sa pamamagitan ng pagsukat.

Mahinang prompt / Malakas na prompt

mahina:

Ano ang solubility ng molekulang ito?

Ang AI ay bumubuo ng isang numero na hindi umiiral sa ilalim ng pagkalkula (hal. "12 mg/mL"); Nagbibigay ito ng kumpiyansa ngunit maaaring mali.

malakas:

Molecule (NAKAngiti): [NAKAngiti].Gawain: 1) Ibibigay ko ang logP, TPSA, HBD/HBA na kalkulahin gamit ang RDKit: [values].2) Batay sa mga value na ito, bigyang-kahulugan kung mataas/medium/mababa ang resolution.3) Pagbibigay ng eksaktong bilang; Sabihin na ito ay isang hula at kailangan ang mga eksperimento.

Ang pagkakaiba: kinuha namin ang mga deterministikong halaga mula sa sasakyan at ginawang interpretasyon lamang ng AI ang mga ito; Tahasang hiniling namin ang kawalan ng katiyakan at ang pangangailangan para sa eksperimento.

Mga uri ng feature at antas ng tiwala

tampok

Paano makukuha

magtiwala

tala

molekular na timbang

RDKit (deterministic)

napakataas

Gupitin mula sa formula

TPSA, HBD/HBA

RDKit (deterministic)

mataas

batay sa panuntunan

logP (kinakalkula)

Modelo ng RDKit

katamtaman-mataas

Maaaring lumihis mula sa eksperimental

logS (resolution)

pagtatantya ng QSAR

daluyan

Depende sa lugar ng applicability

pKa

espesyal na modelo

daluyan

Nahulog ito sa isang kumplikadong istraktura

biyolohikal na aktibidad

QSAR/ML

Variable

Tiyaking subukan at i-verify

maliit na kaso

Case 1 — Bilang ng mga resolusyon na nilagyan. Isang estudyante ang nagtanong sa AI tungkol sa solubility ng isang compound; Natanggap niya ang sagot na "25 mg/mL" at itinakda ang eksperimental na disenyo nang naaayon. Ang aktwal na halaga sa pagsukat ay ~2 mg/mL, isang 10-tiklop na pagkakaiba. Ang AI ang gumawa ng numero. Aralin: huwag kunin ang mga katangian tulad ng resolution bilang mga numero mula sa modelo ng wika; qualitative prediction + measurement.

Kaso 2 — Sa labas ng saklaw ng pagkakalapat. Sinabi ng isang modelo ng QSAR na "mataas ang aktibidad" para sa isang malaking macromolecule na ibang-iba sa set ng pagsasanay. Napansin ng gumagamit na ang molekula ay hindi katulad ng data ng pagsasanay at itinuring na ang hula ay hindi mapagkakatiwalaan; Ang eksperimento ay nagbigay ng talagang mababang aktibidad. Aralin: palaging tumutugon ang modelo; Kung ito ay wala sa saklaw, ang sagot ay walang halaga.

Kaso 3 — Tamang paggamit ng Lipinski. Sa isang kandidatong molekula, sinuri ng AI ang Lipinski na may mga halaga mula sa RDKit: MA 512 (>500, borderline), logP 4.8 (paborable), HBD 2, HBA 7. Tamang na-interpret ng user ang "isang criterion ay nananatili ngunit ang panuntunan ay hindi ganap" at hindi ganap na tinanggal ang molekula. Aralin: ang mga panuntunan ay mga patnubay, hindi mga limitasyon; Magbigay kahulugan gamit ang konteksto.

Mga karaniwang pagkakamali

  • Pagkuha ng bilang ng tampok mula sa modelo ng wika. Ang mga halaga na hindi kinakalkula ay gawa-gawa; Gumamit ng deterministikong tool o modelo na walang katiyakan.
  • Hindi pinapansin ang larangan ng pagkakalapat. Ang modelo ay bumubuo ng mga numero para sa bawat molekula; hindi maaasahan sa labas ng larangan.
  • Isinasaalang-alang ang isang tinantyang sukat. Ang logS ay isang pagtatantya; Ito ay hindi isang kapalit para sa pang-eksperimentong resolusyon.
  • Isinasaalang-alang ang Lipinski ang ganap na panuntunan. Ang kandidato na nasa hangganan ay hindi awtomatikong maalis; Maraming droga ang lumalabag sa panuntunan.
  • Nakalilito ang "kinakalkula" sa "tinantiya." Ang TPSA ay kinakalkula (maaasahan), ang aktibidad ay tinatantya (hindi tiyak).
Pag-iingat: Ang mga hula sa tampok ay mahusay para sa pagraranggo at pag-prioritize ng mga kandidato; ngunit hindi upang matukoy ang isang desisyon lamang. "Ang modelo ay sinabi natutunaw" ay isang hypothesis; "I measured, it dissolves" ang resulta.

Sa buod

  • Ang mga katangian ng molekular ay maaaring mahulaan bago ang eksperimento at nakakatipid ng maraming oras.
  • Ang ilang feature ay deterministikong kinakalkula (MA, TPSA, HBD/HBA), ang ilan ay mga istatistikal na pagtatantya (logS, aktibidad).
  • Ang domain ng applicability ay ang pinaka kritikal na konsepto: palaging sumasagot ang modelo, ngunit hindi mapagkakatiwalaan sa labas ng domain.
  • Kunin ang mga bilang ng tampok mula sa RDKit o ang modelo ng kalabuan, hindi ang modelo ng wika.
  • Gumamit ng mga hula sa pagraranggo ng mga kandidato; Gawin ang pangwakas na desisyon sa pamamagitan ng pag-eksperimento.

Gawain ng aplikasyon

Pumili ng limang molekula (hal. isang serye ng gamot). Kalkulahin ang MA, logP, TPSA, HBD, HBA para sa bawat isa na may RDKit at suriin ang Lipinski. Hiwalay, humingi sa AI ng isang qualitative na pagtatantya (hindi isang numero) ng solubility ng bawat molecule at isang field ng applicability warning. Kolektahin ang mga deterministikong halaga at mga hula ng AI sa isang talahanayan. Aling molekula ang nagbigay ng pinaka-tulad ng gamot na profile? Nasaan ang pinakamataas na kawalan ng katiyakan?

checklist

  • [ ] Tinutukoy ko ang pagkakaiba sa pagitan ng mga deterministikong kinakalkula at hinulaang mga katangian.
  • [ ] Nakukuha ko ang mga value ng property mula sa RDKit/modelo, hindi sa modelo ng wika.
  • [ ] Napansin ko ang mga molecule sa labas ng saklaw ng applicability.
  • [ ] Ginagamit ko ang Lipinski bilang gabay, hindi isang ganap na tuntunin.
  • [ ] Gumagamit ako ng mga hula para sa pagraranggo at desisyon para sa eksperimento.
  • [ ] Mayroon akong plano na i-verify ang mga kritikal na feature sa pamamagitan ng pagsukat.