യൂണിറ്റുകൾ
1. രസതന്ത്രത്തിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത 2. തന്മാത്രാ പ്രാതിനിധ്യവും രാസഘടനയും: SMILES, InChI, RDKit എന്നിവയ്‌ക്കൊപ്പം മൂല്യനിർണ്ണയം 3. പ്രതികരണ പ്രവചനവും മെക്കാനിസവും: ഉൽപ്പന്നം, അവസ്ഥ, പ്രതികൂല പ്രതികരണ പ്രവചനം 4. സ്പെക്ട്രം ഇൻ്റർപ്രെറ്റേഷൻ സപ്പോർട്ട്: എൻഎംആർ, ഐആർ, മാസ് സ്പെക്ട്രോമെട്രി 5. ലിറ്ററേച്ചർ റിവ്യൂ ആൻഡ് സിന്തസിസ് പ്ലാനിംഗ്: ഉറവിടം, നടപടിക്രമം, റോഡ്മാപ്പ് 6. കെമിക്കൽ ഡാറ്റ അനാലിസിസും പൈത്തണും: പാണ്ടകൾ, സ്റ്റോയ്ചിയോമെട്രി, കാലിബ്രേഷൻ 7. മോളിക്യുലാർ പ്രോപ്പർട്ടി പ്രവചനവും QSAR: റെസല്യൂഷൻ, pKa, മോഡൽ പരിധികൾ 8. ലബോറട്ടറി ഡോക്യുമെൻ്റേഷൻ: പരീക്ഷണ നോട്ട്ബുക്ക്, ELN, പുനരുൽപാദനക്ഷമത 9. സുരക്ഷയും അപകടസാധ്യതയും വിലയിരുത്തൽ: GHS, SDS, കൃത്രിമ ബുദ്ധിയുടെ പരിധികൾ 10. സ്ഥിരീകരണം, ഭ്രമാത്മകത, ശാസ്ത്രീയ സമഗ്രത 11. പരീക്ഷണത്തിൽ മനുഷ്യൻ: ധാർമ്മികത, സ്വകാര്യത, ഉത്തരവാദിത്തം, അവസാനം മുതൽ അവസാനം വരെ വർക്ക്ഫ്ലോ
യൂണിറ്റ് 7 / 11

മോളിക്യുലാർ പ്രോപ്പർട്ടി പ്രവചനവും QSAR: റെസല്യൂഷൻ, pKa, മോഡൽ പരിധികൾ

നേട്ടങ്ങൾ:

  • നിർണ്ണായകമായി കണക്കാക്കിയ സവിശേഷതകളും സ്ഥിതിവിവരക്കണക്കനുസരിച്ച് കണക്കാക്കിയ സവിശേഷതകളും തമ്മിൽ വേർതിരിച്ചറിയാനും ആത്മവിശ്വാസ നില നിർണ്ണയിക്കാനുമുള്ള കഴിവ്
  • പ്രയോഗക്ഷമത ഡൊമെയ്ൻ എന്ന ആശയം ഉപയോഗിച്ച് മോഡൽ വിശ്വസനീയമായ മേഖലയെ വിലയിരുത്താനുള്ള കഴിവ്
  • ഉദ്യോഗാർത്ഥികളെ റാങ്ക് ചെയ്യാനും പരീക്ഷണത്തിലൂടെ അന്തിമ തീരുമാനം എടുക്കാനും സ്വഭാവ പ്രവചനങ്ങൾ ഉപയോഗിക്കണമെന്ന് മനസ്സിലാക്കാനുള്ള കഴിവ്.

ഒരു തന്മാത്രയെ സമന്വയിപ്പിക്കുന്നതിന് മുമ്പ്, നമ്മൾ പലപ്പോഴും ചോദിക്കാറുണ്ട്: "ഇത് വെള്ളത്തിൽ ലയിക്കുന്നതാണോ? എത്ര അസിഡിറ്റി ഉള്ളതാണ്? അത് കോശ സ്തരത്തെ മറികടക്കുമോ? മയക്കുമരുന്ന് സ്ഥാനാർത്ഥി എന്ന നിലയിൽ ഇത് വിശ്വസനീയമാണോ?" പരീക്ഷണത്തിന് മുമ്പ് ഈ ചോദ്യങ്ങൾക്കുള്ള ഉത്തരം പ്രവചിക്കുന്നത് ധാരാളം സമയം ലാഭിക്കുന്നു. AI-യും അതിൻ്റെ പ്രത്യേക മോഡലുകളും (പ്രത്യേകിച്ച് QSAR - ക്വാണ്ടിറ്റേറ്റീവ് സ്ട്രക്ചർ-ആക്‌റ്റിവിറ്റി റിലേഷൻഷിപ്പ്, അതായത് തന്മാത്രയുടെ ഘടനാപരമായ വിവരണങ്ങളിൽ നിന്ന് ഒരു പ്രോപ്പർട്ടി പ്രവചിക്കുന്ന സ്റ്റാറ്റിസ്റ്റിക്കൽ മോഡൽ) ഈ പ്രവചനങ്ങളിൽ ശക്തമാണ്. എന്നാൽ ഈ പ്രവചനങ്ങൾ പ്രോബബിലിറ്റിയുടെ പ്രവചനങ്ങളാണ്, അളവുകളല്ല. ഈ യൂണിറ്റിൽ, ഫീച്ചർ പ്രവചനം, അതിൻ്റെ ശക്തികൾ, ഏറ്റവും നിർണായകമായ ആശയം, പ്രയോഗക്ഷമത മേഖല (മോഡൽ വിശ്വസനീയമായ പ്രദേശം) എന്നിവയെക്കുറിച്ച് നമ്മൾ പഠിക്കും.

എന്തൊക്കെ സവിശേഷതകൾ പ്രവചിക്കപ്പെടുന്നു?

  • logP: തന്മാത്രയുടെ എണ്ണ/ജല വിഭജന ഗുണകം; ഇത് ലിപ്പോഫിലിസിറ്റി (കൊഴുപ്പ് ഇഷ്ടം) കാണിക്കുന്നു. മയക്കുമരുന്ന് ആഗിരണം ചെയ്യുന്നതിൽ നിർണായകമാണ്.
  • സോളബിലിറ്റി (ലോഗ്എസ്): ഇത് വെള്ളത്തിൽ എത്രമാത്രം ലയിക്കുന്നു.
  • pKa: അസിഡിറ്റി/ക്ഷാരം; ഒരു ഗ്രൂപ്പ് അയണീകരിക്കപ്പെടുന്ന pH.
  • TPSA: ടോപ്പോളജിക്കൽ പോളാർ ഉപരിതല വിസ്തീർണ്ണം; പെർമിബിലിറ്റി എസ്റ്റിമേഷനിൽ ഇത് ഉപയോഗിക്കുന്നു.
  • ലിപിൻസ്കി "റൂൾ ഓഫ് ഫൈവ്": തന്മാത്രാ ഭാരം, ലോഗ്പി, എച്ച്-ബോണ്ട് ദാതാക്കളുടെ എണ്ണം/ഓറൽ ഡ്രഗ് കാൻഡിഡേറ്റുകളുടെ എണ്ണം എന്നിവയ്ക്കുള്ള പ്രായോഗിക പരിധി.

ഈ മൂല്യങ്ങളിൽ ചിലത് RDKit പോലുള്ള ഉപകരണങ്ങൾ ഉപയോഗിച്ച് നിർണ്ണായകമായി കണക്കാക്കുന്നു (ഉദാ. TPSA, H-ബോണ്ട് നമ്പറുകൾ); അവയിൽ ചിലത് സ്റ്റാറ്റിസ്റ്റിക്കൽ എസ്റ്റിമേറ്റുകളാണ് (ലോഗ്എസ്, ബയോളജിക്കൽ ആക്റ്റിവിറ്റി). ഈ വ്യത്യാസം അറിയുന്നത് നിങ്ങൾ എത്രത്തോളം വിശ്വസിക്കുന്നു എന്ന് നിർണ്ണയിക്കുന്നു.

നുറുങ്ങ്: ഒരു ഫീച്ചർ "കണക്കുകൂട്ടിയതാണോ" (നിയമം അടിസ്ഥാനമാക്കിയുള്ളത്, ആവർത്തിക്കാവുന്നത്) അല്ലെങ്കിൽ "പ്രവചനം" (മോഡലിൽ നിന്ന്, അനിശ്ചിതത്വത്തിൽ നിന്ന്) വേർതിരിക്കുക. കണക്കുകൂട്ടലുകളിൽ ഉയർന്ന ആത്മവിശ്വാസം പുലർത്തുക, പ്രവചനങ്ങളിൽ ജാഗ്രത പുലർത്തുക, പരീക്ഷണത്തിലൂടെ പ്രവചനങ്ങൾ പരിശോധിക്കുക.

പ്രയോഗത്തിൻ്റെ വ്യാപ്തി: ഏറ്റവും പ്രധാനപ്പെട്ട ആശയം

ഒരു QSAR മോഡൽ അത് പരിശീലിപ്പിച്ച തന്മാത്രകൾക്ക് സമാനമായ തന്മാത്രകളിൽ നന്നായി പ്രവർത്തിക്കുന്നു. പരിശീലന ഡാറ്റയിൽ നിന്ന് വളരെ വ്യത്യസ്തമായ ഒരു തന്മാത്ര നിങ്ങൾ നൽകിയാൽ (ഉദാഹരണത്തിന്, വളരെ വലിയ, അസാധാരണമായ അസ്ഥികൂടം), മോഡൽ ഇപ്പോഴും ഒരു സംഖ്യ ഉൽപ്പാദിപ്പിക്കും, എന്നാൽ ആ നമ്പർ വിശ്വസനീയമല്ല. ഇതിനെ "പ്രയോഗക്ഷമതയുടെ പരിധിക്ക് പുറത്തുള്ളത്" എന്ന് വിളിക്കുന്നു. മോഡൽ എപ്പോഴും ഉത്തരം നൽകുന്നു; ഉത്തരം വിശ്വസനീയമാണോ അല്ലയോ എന്ന് പറയേണ്ടത് നിങ്ങളുടെ ചുമതലയാണ്.

ഭാഷാ മോഡൽ ഒരു ആട്രിബ്യൂട്ട് മൂല്യം നൽകുമ്പോൾ അത് കൂടുതൽ അപകടകരമാണ്: അടിസ്ഥാനപരമായ കണക്കുകൂട്ടലുകളൊന്നുമില്ലാതെ, അത് "സാധ്യതയുള്ള" മൂല്യമായി സംഖ്യയെ നിർമ്മിക്കുന്നു. സാധ്യമെങ്കിൽ, ഭാഷാ മോഡലിൽ നിന്നല്ല, അനിശ്ചിതത്വം നൽകുന്ന ഒരു ഡിറ്റർമിനിസ്റ്റിക് ടൂളിൽ നിന്നോ (RDKit) അല്ലെങ്കിൽ QSAR മോഡലിൽ നിന്നോ ഫീച്ചർ മൂല്യങ്ങൾ നേടുക.

ഘട്ടം ഘട്ടമായി: സുരക്ഷിതമായ സവിശേഷത പ്രവചനം

  1. മോളിക്യൂൾ പരിശോധിച്ചുറപ്പിക്കുക: RDKit (യൂണിറ്റ് 2) ഉപയോഗിച്ച് സ്മൈലുകൾ പാഴ്‌സ് ചെയ്യുക.
  2. നിർണ്ണായകമായവ കണക്കാക്കുക: MA, logP (കണക്കുകൂട്ടിയത്), TPSA, RDKit-ൽ നിന്നുള്ള H-ബോണ്ട് നമ്പറുകൾ.
  3. പ്രവചനങ്ങൾ വെവ്വേറെ അടയാളപ്പെടുത്തുക: "പ്രവചനം" ടാഗ് ഉപയോഗിച്ച് ലോഗുകൾ, പ്രവർത്തനം മുതലായവ പോലുള്ള മോഡൽ പ്രവചനങ്ങൾ സൂക്ഷിക്കുക.
  4. പ്രയോഗക്ഷമത ഡൊമെയ്ൻ പരിശോധിക്കുക: തന്മാത്ര പരിശീലന ഡാറ്റ പോലെയാണോ? ഇത് വളരെ വലുതാണോ / അസാധാരണമാണോ?
  5. തീരുമാനത്തിനല്ല, റാങ്കിംഗിനായി ഉപയോഗിക്കുക: സ്ഥാനാർത്ഥികളെ റാങ്ക് ചെയ്യാൻ പ്രവചനങ്ങൾ ഉപയോഗിക്കുക; ആത്യന്തികമായ തിരഞ്ഞെടുപ്പ് പരീക്ഷണമാണ്.
  6. പരീക്ഷണം വഴി അടയ്ക്കുക: അളവെടുപ്പിലൂടെ നിർണ്ണായക ഗുണങ്ങൾ (ലയിക്കുന്ന, pKa) പരിശോധിക്കുക.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) RDKit ഉള്ള നിർണ്ണായക സവിശേഷതകൾ:

rdkit ഇറക്കുമതി Chemfrom rdkit.Chem ഇറക്കുമതി വിവരണങ്ങൾ, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1cccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),"2)) റൗണ്ട്(Descriptors.MolLogP(mol),2))പ്രിൻ്റ്("TPSA:", റൗണ്ട്(Descriptors.TPSA(mol),1))പ്രിൻ്റ്("H-ബോണ്ട് ദാതാവ്:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond acceptor:", rdHBACMolDle)

2) ലിപിൻസ്കി റൂൾ മൂല്യനിർണ്ണയം:

തന്മാത്ര (പുഞ്ചിരി): [പുഞ്ചിരി] ടാസ്‌ക്: RDKit-ൽ നിന്ന് കണക്കാക്കേണ്ട MA, logP, HBD, HBA മൂല്യങ്ങളുള്ള അഞ്ചിൻ്റെ ലിപിൻസ്കി റൂൾ പാലിക്കുന്നത് വിലയിരുത്തുക. ഓരോ മാനദണ്ഡവും വെവ്വേറെ പാസ്/പരാജയമെന്ന് അടയാളപ്പെടുത്തുക. നിയമം: അക്കങ്ങൾ ഉണ്ടാക്കരുത്; ഞാൻ അത് RDKit-ൽ നിന്ന് ലഭിക്കും, നിങ്ങൾ അഭിപ്രായമിടൂ.

3) ഫീച്ചർ എസ്റ്റിമേറ്റ് + അനിശ്ചിതത്വ അഭ്യർത്ഥന:

തന്മാത്ര (പുഞ്ചിരി): [പുഞ്ചിരി] ടാസ്‌ക്: ജലലയിക്കുന്നതിൻ്റെ (ലോഗ്‌സ്) (ഉയർന്ന/ഇടത്തരം/താഴ്‌ന്ന) ഗുണപരമായ കണക്ക് നൽകുകയും ഘടനാപരമായ സവിശേഷതകളോടെ യുക്തി വിശദീകരിക്കുകയും ചെയ്യുക. കൃത്യമായ നമ്പർ നൽകരുത്; ഇതൊരു പ്രവചനമാണെന്നും പരീക്ഷണത്തിലൂടെ സ്ഥിരീകരിക്കേണ്ടതുണ്ടെന്നും പ്രസ്താവിക്കുക. തന്മാത്രയ്ക്ക് അസാധാരണമായ ഒരു ഘടനയുണ്ടെങ്കിൽ മുന്നറിയിപ്പ് നൽകുക (പ്രയോഗക്ഷമത അപകടസാധ്യത).

4) കാൻഡിഡേറ്റ് റാങ്കിംഗ് (പ്രവചനം അനുസരിച്ച് മുൻഗണന):

5 തന്മാത്രകളുടെ സ്‌മൈലുകൾ ചുവടെയുണ്ട്. ടാസ്‌ക്: ഘടനാപരമായ സവിശേഷതകളെ (ധ്രുവഗ്രൂപ്പുകളുടെ എണ്ണം, വളയങ്ങൾ, ലിപ്പോഫിലിസിറ്റി) അടിസ്ഥാനമാക്കി ജലലയിക്കുന്ന (ഏറ്റവും ലയിക്കുന്നതോ കുറഞ്ഞതോ ആയ) അടിസ്ഥാനത്തിൽ അവയെ റാങ്ക് ചെയ്യുക. ഓരോ റാങ്കിംഗ് തീരുമാനത്തിനും ന്യായീകരണം എഴുതുക. ശ്രദ്ധിക്കുക: ഇതൊരു പ്രാഥമിക തരം; അളവെടുപ്പിലൂടെയാണ് അന്തിമ തിരഞ്ഞെടുപ്പ് നടത്തുക.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബല:

ഈ തന്മാത്രയുടെ ലായകത എന്താണ്?

കണക്കുകൂട്ടലിന് കീഴിൽ നിലവിലില്ലാത്ത ഒരു സംഖ്യ AI ഉണ്ടാക്കുന്നു (ഉദാ: "12 mg/mL"); ഇത് ആത്മവിശ്വാസം നൽകുന്നു, പക്ഷേ തെറ്റായിരിക്കാം.

ശക്തമായ:

തന്മാത്ര (പുഞ്ചിരികൾ): [പുഞ്ചിരികൾ]. ടാസ്ക്: 1) RDKit ഉപയോഗിച്ച് കണക്കാക്കേണ്ട ലോഗ്പി, ടിപിഎസ്എ, എച്ച്ബിഡി/എച്ച്ബിഎ എന്നിവ ഞാൻ നൽകും: [മൂല്യങ്ങൾ].2) ഈ മൂല്യങ്ങളെ അടിസ്ഥാനമാക്കി, റെസല്യൂഷൻ ഉയർന്നതാണോ/ഇടത്തരം/താഴ്ന്നതാണോ എന്ന് വ്യാഖ്യാനിക്കുക.3) കൃത്യമായ സംഖ്യ നൽകുക; ഇതൊരു ഊഹമാണെന്നും പരീക്ഷണങ്ങൾ ആവശ്യമാണെന്നും പ്രസ്താവിക്കുക.

വ്യത്യാസം: ഞങ്ങൾ വാഹനത്തിൽ നിന്ന് നിർണ്ണായക മൂല്യങ്ങൾ എടുത്ത് അവയെ വ്യാഖ്യാനിക്കാൻ AI ഉണ്ടാക്കി; അനിശ്ചിതത്വവും പരീക്ഷണത്തിൻ്റെ ആവശ്യകതയും ഞങ്ങൾ വ്യക്തമായി ആവശ്യപ്പെട്ടു.

ഫീച്ചർ തരങ്ങളും ട്രസ്റ്റ് ലെവലും

സവിശേഷത

എങ്ങനെ ലഭിക്കും

വിശ്വസിക്കുക

കുറിപ്പ്

തന്മാത്രാ ഭാരം

RDKit (നിർണ്ണായക)

വളരെ ഉയർന്നത്

ഫോർമുലയിൽ നിന്ന് മുറിക്കുക

TPSA, HBD/HBA

RDKit (നിർണ്ണായക)

ഉയർന്നത്

ഭരണം അടിസ്ഥാനമാക്കിയുള്ളത്

logP (കണക്കെടുത്തത്)

RDKit മോഡൽ

ഇടത്തരം-ഉയരം

പരീക്ഷണങ്ങളിൽ നിന്ന് വ്യതിചലിച്ചേക്കാം

logS (റെസല്യൂഷൻ)

QSAR എസ്റ്റിമേറ്റ്

ഇടത്തരം

പ്രയോഗത്തിൻ്റെ മേഖലയെ ആശ്രയിച്ചിരിക്കുന്നു

pKa

പ്രത്യേക മാതൃക

ഇടത്തരം

ഇത് ഒരു സങ്കീർണ്ണ ഘടനയിൽ വീഴുന്നു

ജൈവ പ്രവർത്തനം

QSAR/ML

വേരിയബിൾ

പരിശോധിച്ച് സ്ഥിരീകരിക്കുന്നത് ഉറപ്പാക്കുക

മിനി കേസുകൾ

കേസ് 1 - ഫിറ്റ് ചെയ്ത റെസലൂഷനുകളുടെ എണ്ണം. ഒരു വിദ്യാർത്ഥി AI യോട് ഒരു സംയുക്തത്തിൻ്റെ ലയിക്കുന്നതിനെ കുറിച്ച് ചോദിച്ചു; അദ്ദേഹത്തിന് "25 mg/mL" എന്ന ഉത്തരം ലഭിക്കുകയും അതിനനുസരിച്ച് പരീക്ഷണാത്മക രൂപകല്പന സജ്ജമാക്കുകയും ചെയ്തു. അളവെടുപ്പിലെ യഥാർത്ഥ മൂല്യം ~2 mg/mL ആയിരുന്നു, 10 മടങ്ങ് വ്യത്യാസം. AI നമ്പർ ഉണ്ടാക്കി. പാഠം: റെസല്യൂഷൻ പോലുള്ള പ്രോപ്പർട്ടികൾ ഭാഷാ മാതൃകയിൽ നിന്ന് അക്കങ്ങളായി എടുക്കരുത്; ഗുണപരമായ പ്രവചനം + അളവ്.

കേസ് 2 - പ്രയോഗത്തിൻ്റെ പരിധിക്ക് പുറത്ത്. പരിശീലന സെറ്റിൽ നിന്ന് വളരെ വ്യത്യസ്തമായ ഒരു വലിയ മാക്രോമോളിക്യൂളിന് "പ്രവർത്തനം ഉയർന്നതാണ്" എന്ന് ഒരു QSAR മോഡൽ പറഞ്ഞു. തന്മാത്ര പരിശീലന ഡാറ്റയുമായി സാമ്യമുള്ളതല്ലെന്നും പ്രവചനം വിശ്വസനീയമല്ലെന്നും ഉപയോക്താവ് ശ്രദ്ധിച്ചു; പരീക്ഷണം വളരെ കുറഞ്ഞ പ്രവർത്തനമാണ് നൽകിയത്. പാഠം: മോഡൽ എപ്പോഴും പ്രതികരിക്കുന്നു; അത് പരിധിക്ക് പുറത്താണെങ്കിൽ, ഉത്തരം വിലപ്പോവില്ല.

കേസ് 3 - ലിപിൻസ്കിയുടെ ശരിയായ ഉപയോഗം. ഒരു കാൻഡിഡേറ്റ് മോളിക്യൂളിൽ, RDKit-ൽ നിന്നുള്ള മൂല്യങ്ങൾ ഉപയോഗിച്ച് AI ലിപിൻസ്കിയെ വിലയിരുത്തി: MA 512 (>500, ബോർഡർലൈൻ), logP 4.8 (അനുകൂലമായത്), HBD 2, HBA 7. ഉപയോക്താവ് "ഒരു മാനദണ്ഡം അവശേഷിക്കുന്നു, പക്ഷേ നിയമം കേവലമല്ല" എന്ന് ശരിയായി വ്യാഖ്യാനിക്കുകയും തന്മാത്രയെ ഇല്ലാതാക്കുകയും ചെയ്തില്ല. പാഠം: നിയമങ്ങൾ മാർഗ്ഗനിർദ്ദേശങ്ങളാണ്, പരിധികളല്ല; സന്ദർഭത്തിനനുസരിച്ച് വ്യാഖ്യാനിക്കുക.

സാധാരണ തെറ്റുകൾ

  • ഭാഷാ മോഡലിൽ നിന്ന് സവിശേഷതകളുടെ എണ്ണം ലഭിക്കുന്നു. കണക്കാക്കാത്ത മൂല്യങ്ങൾ കെട്ടിച്ചമച്ചതാണ്; അനിശ്ചിതത്വത്തോടെ ഡിറ്റർമിനിസ്റ്റിക് ടൂൾ അല്ലെങ്കിൽ മോഡൽ ഉപയോഗിക്കുക.
  • പ്രയോഗത്തിൻ്റെ മേഖലയെ അവഗണിക്കുന്നു. മോഡൽ ഓരോ തന്മാത്രയ്ക്കും സംഖ്യകൾ സൃഷ്ടിക്കുന്നു; ഫീൽഡിന് പുറത്ത് വിശ്വസനീയമല്ല.
  • കണക്കാക്കിയ അളവ് കണക്കിലെടുക്കുന്നു. logS ഒരു എസ്റ്റിമേറ്റ് ആണ്; ഇത് പരീക്ഷണാത്മക മിഴിവിന് പകരമല്ല.
  • ലിപിൻസ്കി ഒരു സമ്പൂർണ്ണ നിയമം പരിഗണിക്കുന്നു. അതിർത്തിയിലുള്ള സ്ഥാനാർത്ഥി യാന്ത്രികമായി ഒഴിവാക്കപ്പെടുന്നില്ല; പല മരുന്നുകളും നിയമം ലംഘിക്കുന്നു.
  • "കണക്കാക്കിയത്", "കണക്കാക്കിയത്" എന്നിവയെ ആശയക്കുഴപ്പത്തിലാക്കുന്നു. TPSA കണക്കാക്കുന്നു (വിശ്വസനീയമാണ്), പ്രവർത്തനം കണക്കാക്കുന്നു (അനിശ്ചിതത്വം).
മുന്നറിയിപ്പ്: സ്ഥാനാർത്ഥികളെ റാങ്ക് ചെയ്യുന്നതിനും മുൻഗണന നൽകുന്നതിനും ഫീച്ചർ പ്രവചനങ്ങൾ മികച്ചതാണ്; അല്ലാതെ ഒരു തീരുമാനം മാത്രം തീരുമാനിക്കാനല്ല. "മോഡൽ പറഞ്ഞു ലയിക്കുന്നു" എന്നത് ഒരു സിദ്ധാന്തമാണ്; "ഞാൻ അളന്നു, അത് ലയിക്കുന്നു" എന്നത് ഒരു ഫലമാണ്.

ചുരുക്കത്തിൽ

  • പരീക്ഷണത്തിന് മുമ്പ് തന്മാത്രാ ഗുണങ്ങൾ പ്രവചിക്കാനും ധാരാളം സമയം ലാഭിക്കാനും കഴിയും.
  • ചില സവിശേഷതകൾ നിർണ്ണായകമായി കണക്കാക്കുന്നു (MA, TPSA, HBD/HBA), ചിലത് സ്റ്റാറ്റിസ്റ്റിക്കൽ എസ്റ്റിമേറ്റുകളാണ് (ലോഗ്എസ്, പ്രവർത്തനം).
  • പ്രയോഗക്ഷമതയുടെ ഡൊമെയ്‌നാണ് ഏറ്റവും നിർണായകമായ ആശയം: മോഡൽ എല്ലായ്പ്പോഴും ഉത്തരം നൽകുന്നു, എന്നാൽ ഡൊമെയ്‌നിന് പുറത്ത് വിശ്വസനീയമല്ല.
  • RDKit-ൽ നിന്നോ അവ്യക്തത മോഡലിൽ നിന്നോ ഫീച്ചർ കൗണ്ടുകൾ നേടുക, ഭാഷാ മോഡലല്ല.
  • സ്ഥാനാർത്ഥികളെ റാങ്ക് ചെയ്യാൻ പ്രവചനങ്ങൾ ഉപയോഗിക്കുക; പരീക്ഷണത്തിലൂടെ അന്തിമ തീരുമാനം എടുക്കുക.

ആപ്ലിക്കേഷൻ ടാസ്ക്

അഞ്ച് തന്മാത്രകൾ തിരഞ്ഞെടുക്കുക (ഉദാ. മയക്കുമരുന്ന് പരമ്പര). RDKit ഉപയോഗിച്ച് ഓരോന്നിനും MA, logP, TPSA, HBD, HBA എന്നിവ കണക്കാക്കി ലിപിൻസ്കിയെ വിലയിരുത്തുക. വെവ്വേറെ, ഓരോ തന്മാത്രയുടെയും ലയിക്കുന്നതിൻ്റെ ഗുണപരമായ എസ്റ്റിമേറ്റും (ഒരു സംഖ്യയല്ല) പ്രയോഗികതാ മുന്നറിയിപ്പ് ഫീൽഡും AI-യോട് ആവശ്യപ്പെടുക. ഒരു പട്ടികയിൽ ഡിറ്റർമിനിസ്റ്റിക് മൂല്യങ്ങളും AI പ്രവചനങ്ങളും ശേഖരിക്കുക. ഏത് തന്മാത്രയാണ് ഏറ്റവും കൂടുതൽ മയക്കുമരുന്നിന് സമാനമായ പ്രൊഫൈൽ നൽകിയത്? എവിടെയാണ് അനിശ്ചിതത്വം ഏറ്റവും ഉയർന്നത്?

ചെക്ക്ലിസ്റ്റ്

  • [ ] ഞാൻ നിർണ്ണായകമായി കണക്കാക്കിയതും പ്രവചിച്ചതുമായ ഗുണങ്ങൾ തമ്മിൽ വേർതിരിക്കുന്നു.
  • [ ] എനിക്ക് പ്രോപ്പർട്ടി മൂല്യങ്ങൾ ലഭിക്കുന്നത് RDKit/മോഡലിൽ നിന്നാണ്, ഭാഷാ മോഡലിൽ നിന്നല്ല.
  • [ ] പ്രയോഗത്തിൻ്റെ പരിധിക്ക് പുറത്തുള്ള തന്മാത്രകൾ ഞാൻ ശ്രദ്ധിക്കുന്നു.
  • [ ] ഞാൻ ലിപിൻസ്കി ഒരു ഗൈഡ് ആയി ഉപയോഗിക്കുന്നു, ഒരു കേവല നിയമമല്ല.
  • [ ] ഞാൻ റാങ്കിംഗിനായി പ്രവചനങ്ങളും പരീക്ഷണത്തിനായി തീരുമാനവും ഉപയോഗിക്കുന്നു.
  • [ ] നിർണായക സവിശേഷതകൾ അളക്കുന്നതിലൂടെ പരിശോധിക്കാൻ എനിക്ക് ഒരു പ്ലാൻ ഉണ്ട്.