એકમો
1. રસાયણશાસ્ત્રમાં આર્ટિફિશિયલ ઇન્ટેલિજન્સનો પરિચય: ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર 2. પરમાણુ પ્રતિનિધિત્વ અને રાસાયણિક માળખું: સ્માઈલ્સ, InChI અને RDKit સાથે માન્યતા 3. પ્રતિક્રિયા આગાહી અને પદ્ધતિ: ઉત્પાદન, સ્થિતિ અને પ્રતિકૂળ પ્રતિક્રિયા આગાહી 4. સ્પેક્ટ્રમ અર્થઘટન સપોર્ટ: NMR, IR અને માસ સ્પેક્ટ્રોમેટ્રી 5. સાહિત્ય સમીક્ષા અને સંશ્લેષણ આયોજન: સ્ત્રોત, પ્રક્રિયા અને માર્ગમેપ 6. રાસાયણિક ડેટા વિશ્લેષણ અને પાયથોન: પાંડા, સ્ટોઇકોમેટ્રી અને કેલિબ્રેશન 7. મોલેક્યુલર પ્રોપર્ટી પ્રિડિક્શન અને QSAR: રિઝોલ્યુશન, pKa અને મોડલ લિમિટ્સ 8. લેબોરેટરી દસ્તાવેજીકરણ: પ્રયોગ નોટબુક, ELN અને પુનઃઉત્પાદનક્ષમતા 9. સલામતી અને જોખમનું મૂલ્યાંકન: GHS, SDS અને કૃત્રિમ બુદ્ધિની મર્યાદાઓ 10. પુષ્ટિકરણ, આભાસ અને વૈજ્ઞાનિક અખંડિતતા 11. પ્રયોગમાં માનવ: નૈતિકતા, ગોપનીયતા, જવાબદારી અને એન્ડ-ટુ-એન્ડ વર્કફ્લો
એકમ 7 / 11

મોલેક્યુલર પ્રોપર્ટી પ્રિડિક્શન અને QSAR: રિઝોલ્યુશન, pKa અને મોડલ લિમિટ્સ

નફો:

  • નિર્ધારિત રીતે ગણતરી કરેલ વિશેષતાઓ અને આંકડાકીય અંદાજિત વિશેષતાઓ વચ્ચે ભેદ પાડવાની અને આત્મવિશ્વાસના સ્તરો નક્કી કરવાની ક્ષમતા
  • લાગુ પડતી ડોમેનની વિભાવનાનો ઉપયોગ કરીને મોડેલ વિશ્વસનીય છે તે પ્રદેશનું મૂલ્યાંકન કરવાની ક્ષમતા
  • એ સમજવાની ક્ષમતા કે વ્યક્તિએ ઉમેદવારોને ક્રમાંકિત કરવા અને પ્રયોગો દ્વારા અંતિમ નિર્ણય લેવા માટે લક્ષણોની આગાહીઓનો ઉપયોગ કરવો જોઈએ.

પરમાણુનું સંશ્લેષણ કરતા પહેલા, અમે વારંવાર પૂછીએ છીએ: "શું તે પાણીમાં દ્રાવ્ય છે? તે કેટલું એસિડિક છે? શું તે કોષ પટલને પાર કરે છે? શું તે દવાના ઉમેદવાર તરીકે બુદ્ધિગમ્ય છે?" પ્રયોગ પહેલા આ પ્રશ્નોના જવાબોની આગાહી કરવાથી ઘણો સમય બચે છે. AI અને તેના વિશિષ્ટ મોડલ (ખાસ કરીને QSAR — ક્વોન્ટિટેટિવ ​​સ્ટ્રક્ચર-એક્ટિવિટી રિલેશનશિપ, એટલે કે આંકડાકીય મૉડલ કે જે પરમાણુના માળખાકીય વર્ણનકર્તાઓમાંથી મિલકતની આગાહી કરે છે) આ આગાહીઓમાં શક્તિશાળી છે. પરંતુ આ આગાહીઓ સંભાવનાની આગાહીઓ છે, માપન નથી. આ એકમમાં, આપણે લક્ષણ અનુમાન, તેની શક્તિઓ અને સૌથી નિર્ણાયક ખ્યાલ, લાગુ પાડવાનું ક્ષેત્ર (જે પ્રદેશ જ્યાં મોડેલ વિશ્વસનીય છે) વિશે શીખીશું.

કયા લક્ષણોની આગાહી કરવામાં આવે છે?

  • logP: પરમાણુનું તેલ/પાણી પાર્ટીશન ગુણાંક; તે લિપોફિલિસિટી (ચરબીને પસંદ) દર્શાવે છે. ડ્રગ શોષણમાં મહત્વપૂર્ણ.
  • દ્રાવ્યતા (logS): તે પાણીમાં કેટલું દ્રાવ્ય છે.
  • pKa: એસિડિટી/ક્ષારત્વ; pH કે જેના પર જૂથ આયનીકરણ કરે છે.
  • TPSA: ટોપોલોજીકલ ધ્રુવીય સપાટી વિસ્તાર; તેનો ઉપયોગ અભેદ્યતાના અંદાજમાં થાય છે.
  • લિપિન્સકી "પાંચનો નિયમ": પરમાણુ વજન, લોગપી, એચ-બોન્ડ દાતાઓ/ઓરલ ડ્રગ ઉમેદવારોના સ્વીકારકોની સંખ્યા માટે વ્યવહારુ થ્રેશોલ્ડ.

આમાંના કેટલાક મૂલ્યોની ગણતરી આરડીકિટ જેવા સાધનો વડે નિર્ધારિત રીતે કરવામાં આવે છે (દા.ત. TPSA, H-બોન્ડ નંબર્સ); તેમાંના કેટલાક આંકડાકીય અંદાજો (લોગએસ, જૈવિક પ્રવૃત્તિ) છે. આ ભેદને જાણવું એ નક્કી કરે છે કે તમે કેટલો વિશ્વાસ કરો છો.

ટીપ: વિશિષ્ટતા "ગણતરી" (નિયમ-આધારિત, પુનરાવર્તિત) અથવા "અનુમાનિત" (મોડેલ, અનિશ્ચિત) છે કે કેમ તે તફાવત કરો. ગણતરીઓમાં ઉચ્ચ આત્મવિશ્વાસ રાખો, આગાહીઓમાં સાવચેતીપૂર્વક વિશ્વાસ રાખો અને પ્રયોગો દ્વારા આગાહીઓને ચકાસો.

લાગુ પડવાનો અવકાશ: સૌથી મહત્વપૂર્ણ ખ્યાલ

QSAR મૉડલ એવા પરમાણુઓ પર સારી રીતે કામ કરે છે જે તેને તાલીમ આપવામાં આવી હતી તે પરમાણુઓ જેવા જ હોય છે. જો તમે એક પરમાણુ આપો છો જે તાલીમ ડેટાથી ખૂબ જ અલગ છે (ઉદાહરણ તરીકે, ખૂબ મોટું, અસામાન્ય હાડપિંજર), તો મોડેલ હજી પણ સંખ્યા પેદા કરશે, પરંતુ તે સંખ્યા અવિશ્વસનીય હશે. આને "લાગુપાત્રતાના અવકાશની બહાર હોવું" કહેવાય છે. મોડેલ હંમેશા જવાબ આપે છે; જવાબ વિશ્વસનીય છે કે નહીં તે જણાવવાનું તમારું કામ છે.

જ્યારે ભાષા મૉડલ એટ્રિબ્યુટ મૂલ્ય આપે છે ત્યારે તે વધુ જોખમી છે: તે સંખ્યાને "સંભવિત દેખાતા" મૂલ્ય તરીકે ઉત્પન્ન કરે છે, જેમાં કોઈ અંતર્ગત ગણતરી નથી. તેથી જો શક્ય હોય તો, ડિટરમિનિસ્ટિક ટૂલ (RDKit) અથવા QSAR મોડલમાંથી ફીચર વેલ્યુ મેળવો જે અનિશ્ચિતતા આપે છે, ભાષા મોડલમાંથી નહીં.

સ્ટેપ બાય સ્ટેપ: સુરક્ષિત ફીચરની આગાહી

  1. પરમાણુ ચકાસો: RDKit (યુનિટ 2) વડે સ્માઈલ્સનું વિશ્લેષણ કરો.
  2. નિર્ધારિત રાશિઓની ગણતરી કરો: MA, logP (ગણતરી કરેલ), TPSA, RDKitમાંથી H-બોન્ડ નંબરો.
  3. અનુમાનોને અલગથી ચિહ્નિત કરો: મોડલ અનુમાનો જેમ કે logS, પ્રવૃત્તિ વગેરેને "અનુમાન" ટેગ સાથે રાખો.
  4. લાગુ પડતું ડોમેન તપાસો: શું પરમાણુ તાલીમ ડેટા જેવો દેખાય છે? શું તે અત્યંત મોટું/અસામાન્ય છે?
  5. રેન્કિંગ માટે ઉપયોગ કરો, નિર્ણય નહીં: ઉમેદવારોને ક્રમ આપવા માટે અનુમાનોનો ઉપયોગ કરો; અંતિમ પસંદગી પ્રયોગ છે.
  6. પ્રયોગ દ્વારા બંધ કરો: માપન દ્વારા નિર્ણાયક ગુણધર્મો (દ્રાવ્યતા, pKa) ચકાસો.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) RDKit સાથે નિર્ણાયક લક્ષણો:

rdkit આયાત Chemfrom rdkit.Chem આયાત વર્ણનકર્તાઓ, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1cccc1C(=O)O") # એસ્પિરિનપ્રિન્ટ("MA:", રાઉન્ડ(વર્ણનકારો.MolWt(mol),2", calculated()) round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-બોન્ડ સ્વીકારનાર:", rdMolDescriptors(મોલબીએ))

2) લિપિન્સકી નિયમ મૂલ્યાંકન:

પરમાણુ (સ્માઇલ્સ): [સ્માઇલ્સ]કાર્ય: આરડીકિટમાંથી ગણતરી કરવા માટેના MA, logP, HBD, HBA મૂલ્યો સાથે પાંચના લિપિન્સકી નિયમના પાલનનું મૂલ્યાંકન કરો. દરેક માપદંડને પાસ/ફેલ તરીકે અલગથી ચિહ્નિત કરો. નિયમ: સંખ્યાઓ બનાવશો નહીં; હું તેને RDKit પરથી મેળવીશ, તમે ટિપ્પણી કરો.

3) લક્ષણ અંદાજ + અનિશ્ચિતતા વિનંતી:

પરમાણુ (સ્માઇલ્સ): [સ્માઇલ્સ]કાર્ય: પાણીની દ્રાવ્યતા (લોગએસ) (ઉચ્ચ/મધ્યમ/નીચી) નો ગુણાત્મક અંદાજ આપો અને માળખાકીય સુવિધાઓ સાથે તર્ક સમજાવો. ચોક્કસ નંબર આપશો નહીં; જણાવો કે આ એક આગાહી છે અને પ્રયોગ દ્વારા પુષ્ટિ કરવાની જરૂર છે. જો પરમાણુમાં અસામાન્ય માળખું હોય તો ચેતવણી આપો (લાગુ થવાનું જોખમ).

4) ઉમેદવાર રેન્કિંગ (અનુમાન દ્વારા પ્રાથમિકતા):

નીચે 5 અણુઓના સ્માઈલ્સ છે. કાર્ય: માળખાકીય વિશેષતાઓ (ધ્રુવીય જૂથોની સંખ્યા, રિંગ્સ, લિપોફિલિસિટી) ના આધારે તેમને પાણીની દ્રાવ્યતા (સૌથી ઓછા દ્રાવ્ય) ના સંદર્ભમાં રેન્ક આપો. દરેક રેન્કિંગ નિર્ણય માટે વાજબીતા લખો. નોંધ: આ એક પ્રારંભિક પ્રકાર છે; અંતિમ પસંદગી માપન દ્વારા કરવામાં આવશે.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા:

આ પરમાણુની દ્રાવ્યતા શું છે?

AI એવી સંખ્યા બનાવે છે જે ગણતરી હેઠળ અસ્તિત્વમાં નથી (દા.ત. "12 mg/mL"); તે આત્મવિશ્વાસ આપે છે પરંતુ ખોટું હોઈ શકે છે.

મજબૂત:

પરમાણુ (સ્માઇલ્સ): [સ્માઇલ્સ].ટાસ્ક: 1) હું RDKit સાથે ગણતરી કરવા માટે logP, TPSA, HBD/HBA આપીશ: [મૂલ્યો].2) આ મૂલ્યોના આધારે, રિઝોલ્યુશન ઊંચું/મધ્યમ/નીચું છે કે કેમ તે અર્થઘટન કરો.3) ચોક્કસ સંખ્યા આપવી; જણાવો કે તે અનુમાન છે અને પ્રયોગો જરૂરી છે.

તફાવત: અમે વાહનમાંથી નિર્ણાયક મૂલ્યો લીધા અને એઆઈને ફક્ત તેનું અર્થઘટન કર્યું; અમે સ્પષ્ટપણે અનિશ્ચિતતા અને પ્રયોગની જરૂરિયાત માટે પૂછ્યું.

લક્ષણ પ્રકારો અને વિશ્વાસ સ્તર

લક્ષણ

કેવી રીતે મેળવવું

વિશ્વાસ

નોંધ

પરમાણુ વજન

RDKit (નિર્ધારિત)

ખૂબ ઊંચા

સૂત્રમાંથી કાપો

TPSA, HBD/HBA

RDKit (નિર્ધારિત)

ઉચ્ચ

નિયમ આધારિત

logP (ગણતરી કરેલ)

RDKit મોડેલ

મધ્યમ-ઉચ્ચ

પ્રાયોગિક થી વિચલિત થઈ શકે છે

logS (ઠરાવ)

QSAR અંદાજ

મધ્યમ

લાગુ પડતા વિસ્તાર પર આધાર રાખે છે

pKa

ખાસ મોડેલ

મધ્યમ

તે એક જટિલ રચનામાં આવે છે

જૈવિક પ્રવૃત્તિ

QSAR/ML

ચલ

પરીક્ષણ અને ચકાસણી કરવાની ખાતરી કરો

નાના કેસો

કેસ 1 - ફીટ કરેલા ઠરાવોની સંખ્યા. એક વિદ્યાર્થીએ એઆઈને સંયોજનની દ્રાવ્યતા વિશે પૂછ્યું; તેને "25 mg/mL" જવાબ મળ્યો અને તે મુજબ પ્રાયોગિક ડિઝાઇન સેટ કરી. માપમાં વાસ્તવિક મૂલ્ય ~2 mg/mL હતું, જે 10-ગણો તફાવત હતો. એઆઈએ નંબર બનાવ્યો હતો. પાઠ: રીઝોલ્યુશન જેવા ગુણધર્મને ભાષાના નમૂનામાંથી સંખ્યા તરીકે ન લો; ગુણાત્મક અનુમાન + માપ.

કિસ્સો 2 - લાગુ પડવાના અવકાશની બહાર. એક QSAR મોડેલે જણાવ્યું હતું કે મોટા મેક્રોમોલેક્યુલ માટે "પ્રવૃત્તિ વધારે છે" જે પ્રશિક્ષણ સમૂહથી ખૂબ જ અલગ હતી. વપરાશકર્તાએ નોંધ્યું કે પરમાણુ તાલીમ ડેટાને મળતું નથી અને આગાહીને અવિશ્વસનીય માનવામાં આવે છે; પ્રયોગે ખરેખર ઓછી પ્રવૃત્તિ આપી. પાઠ: મોડેલ હંમેશા જવાબ આપે છે; જો તે અવકાશની બહાર છે, તો જવાબ નકામું છે.

કેસ 3 - લિપિન્સકીનો સાચો ઉપયોગ. એક ઉમેદવાર પરમાણુ પર, AI એ RDKit માંથી મૂલ્યો સાથે લિપિન્સકીનું મૂલ્યાંકન કર્યું: MA 512 (>500, સરહદરેખા), logP 4.8 (અનુકૂળ), HBD 2, HBA 7. વપરાશકર્તાએ "એક માપદંડ બાકી છે પરંતુ નિયમ નિરપેક્ષ નથી" તેનું યોગ્ય રીતે અર્થઘટન કર્યું છે અને અલ પરમાણુને દૂર કર્યું નથી. પાઠ: નિયમો માર્ગદર્શિકા છે, થ્રેશોલ્ડ નહીં; સંદર્ભ સાથે અર્થઘટન કરો.

સામાન્ય ભૂલો

  • ભાષા મોડેલમાંથી સુવિધાની ગણતરી મેળવવી. મૂલ્યો કે જેની ગણતરી કરવામાં આવી નથી તે બનાવટી છે; અનિશ્ચિતતા સાથે નિર્ધારિત સાધન અથવા મોડેલનો ઉપયોગ કરો.
  • લાગુ પાડવાના ક્ષેત્રને અવગણવું. મોડેલ દરેક પરમાણુ માટે સંખ્યાઓ બનાવે છે; ક્ષેત્રની બહાર અવિશ્વસનીય.
  • અંદાજિત માપને ધ્યાનમાં લેતા. logS એક અંદાજ છે; તે પ્રાયોગિક રીઝોલ્યુશનનો વિકલ્પ નથી.
  • લિપિન્સકીને સંપૂર્ણ નિયમ ધ્યાનમાં લેતા. જે ઉમેદવાર સરહદ પર છે તે આપોઆપ નાબૂદ થતો નથી; ઘણી દવાઓ નિયમનું ઉલ્લંઘન કરે છે.
  • "અંદાજિત" સાથે "ગણતરી" ને ગૂંચવણમાં મૂકે છે. TPSA ની ગણતરી કરવામાં આવે છે (વિશ્વસનીય), પ્રવૃત્તિ અંદાજિત છે (અનિશ્ચિત).
સાવધાન: ફીચરની આગાહીઓ ઉમેદવારોને રેન્કિંગ અને પ્રાથમિકતા આપવા માટે ઉત્તમ છે; પરંતુ એકલા નિર્ણય નક્કી કરવા માટે નહીં. "મોડેલ કહ્યું દ્રાવ્ય" એક પૂર્વધારણા છે; "મેં માપ્યું, તે ઓગળી જાય છે" એ પરિણામ છે.

સારાંશમાં

  • પ્રયોગ પહેલા મોલેક્યુલર પ્રોપર્ટીઝની આગાહી કરી શકાય છે અને ઘણો સમય બચાવે છે.
  • કેટલીક વિશેષતાઓની ગણતરી નિર્ધારિત રીતે કરવામાં આવે છે (MA, TPSA, HBD/HBA), કેટલીક આંકડાકીય અંદાજો (લોગએસ, પ્રવૃત્તિ) છે.
  • લાગુ પાડવાનું ડોમેન એ સૌથી જટિલ ખ્યાલ છે: મોડેલ હંમેશા જવાબ આપે છે, પરંતુ ડોમેનની બહાર અવિશ્વસનીય છે.
  • RDKit અથવા અસ્પષ્ટતા મૉડલમાંથી સુવિધાની ગણતરી મેળવો, ભાષા મૉડલમાંથી નહીં.
  • ઉમેદવારોને ક્રમ આપવા માટે આગાહીઓનો ઉપયોગ કરો; પ્રયોગ કરીને અંતિમ નિર્ણય લો.

એપ્લિકેશન કાર્ય

પાંચ પરમાણુ પસંદ કરો (દા.ત. દવાની શ્રેણી). RDKit વડે દરેક માટે MA, logP, TPSA, HBD, HBA ની ગણતરી કરો અને લિપિન્સકીનું મૂલ્યાંકન કરો. અલગથી, AI ને દરેક પરમાણુની દ્રાવ્યતાના ગુણાત્મક અંદાજ (સંખ્યા નહીં) અને લાગુ થવાની ચેતવણીના ક્ષેત્ર માટે પૂછો. કોષ્ટકમાં નિર્ધારિત મૂલ્યો અને AI આગાહીઓ એકત્રિત કરો. કયા પરમાણુએ સૌથી વધુ ડ્રગ જેવી પ્રોફાઇલ આપી? અનિશ્ચિતતા સૌથી વધુ ક્યાં છે?

ચેકલિસ્ટ

  • [ ] હું નિર્ધારિત ગણતરી અને અનુમાનિત ગુણધર્મો વચ્ચે તફાવત કરું છું.
  • [ ] હું RDKit/મોડલમાંથી પ્રોપર્ટી વેલ્યુ મેળવી રહ્યો છું, ભાષા મોડલથી નહીં.
  • [ ] મને લાગુ પડવાના અવકાશની બહારના અણુઓ દેખાય છે.
  • [ ] હું લિપિન્સકીનો ઉપયોગ માર્ગદર્શક તરીકે કરું છું, સંપૂર્ણ નિયમ નહીં.
  • [ ] હું રેન્કિંગ માટે અનુમાનો અને પ્રયોગ માટે નિર્ણયનો ઉપયોગ કરું છું.
  • [ ] મારી પાસે માપન દ્વારા નિર્ણાયક લક્ષણો ચકાસવાની યોજના છે.