નફો:
- નિર્ધારિત રીતે ગણતરી કરેલ વિશેષતાઓ અને આંકડાકીય અંદાજિત વિશેષતાઓ વચ્ચે ભેદ પાડવાની અને આત્મવિશ્વાસના સ્તરો નક્કી કરવાની ક્ષમતા
- લાગુ પડતી ડોમેનની વિભાવનાનો ઉપયોગ કરીને મોડેલ વિશ્વસનીય છે તે પ્રદેશનું મૂલ્યાંકન કરવાની ક્ષમતા
- એ સમજવાની ક્ષમતા કે વ્યક્તિએ ઉમેદવારોને ક્રમાંકિત કરવા અને પ્રયોગો દ્વારા અંતિમ નિર્ણય લેવા માટે લક્ષણોની આગાહીઓનો ઉપયોગ કરવો જોઈએ.
પરમાણુનું સંશ્લેષણ કરતા પહેલા, અમે વારંવાર પૂછીએ છીએ: "શું તે પાણીમાં દ્રાવ્ય છે? તે કેટલું એસિડિક છે? શું તે કોષ પટલને પાર કરે છે? શું તે દવાના ઉમેદવાર તરીકે બુદ્ધિગમ્ય છે?" પ્રયોગ પહેલા આ પ્રશ્નોના જવાબોની આગાહી કરવાથી ઘણો સમય બચે છે. AI અને તેના વિશિષ્ટ મોડલ (ખાસ કરીને QSAR — ક્વોન્ટિટેટિવ સ્ટ્રક્ચર-એક્ટિવિટી રિલેશનશિપ, એટલે કે આંકડાકીય મૉડલ કે જે પરમાણુના માળખાકીય વર્ણનકર્તાઓમાંથી મિલકતની આગાહી કરે છે) આ આગાહીઓમાં શક્તિશાળી છે. પરંતુ આ આગાહીઓ સંભાવનાની આગાહીઓ છે, માપન નથી. આ એકમમાં, આપણે લક્ષણ અનુમાન, તેની શક્તિઓ અને સૌથી નિર્ણાયક ખ્યાલ, લાગુ પાડવાનું ક્ષેત્ર (જે પ્રદેશ જ્યાં મોડેલ વિશ્વસનીય છે) વિશે શીખીશું.
કયા લક્ષણોની આગાહી કરવામાં આવે છે?
- logP: પરમાણુનું તેલ/પાણી પાર્ટીશન ગુણાંક; તે લિપોફિલિસિટી (ચરબીને પસંદ) દર્શાવે છે. ડ્રગ શોષણમાં મહત્વપૂર્ણ.
- દ્રાવ્યતા (logS): તે પાણીમાં કેટલું દ્રાવ્ય છે.
- pKa: એસિડિટી/ક્ષારત્વ; pH કે જેના પર જૂથ આયનીકરણ કરે છે.
- TPSA: ટોપોલોજીકલ ધ્રુવીય સપાટી વિસ્તાર; તેનો ઉપયોગ અભેદ્યતાના અંદાજમાં થાય છે.
- લિપિન્સકી "પાંચનો નિયમ": પરમાણુ વજન, લોગપી, એચ-બોન્ડ દાતાઓ/ઓરલ ડ્રગ ઉમેદવારોના સ્વીકારકોની સંખ્યા માટે વ્યવહારુ થ્રેશોલ્ડ.
આમાંના કેટલાક મૂલ્યોની ગણતરી આરડીકિટ જેવા સાધનો વડે નિર્ધારિત રીતે કરવામાં આવે છે (દા.ત. TPSA, H-બોન્ડ નંબર્સ); તેમાંના કેટલાક આંકડાકીય અંદાજો (લોગએસ, જૈવિક પ્રવૃત્તિ) છે. આ ભેદને જાણવું એ નક્કી કરે છે કે તમે કેટલો વિશ્વાસ કરો છો.
ટીપ: વિશિષ્ટતા "ગણતરી" (નિયમ-આધારિત, પુનરાવર્તિત) અથવા "અનુમાનિત" (મોડેલ, અનિશ્ચિત) છે કે કેમ તે તફાવત કરો. ગણતરીઓમાં ઉચ્ચ આત્મવિશ્વાસ રાખો, આગાહીઓમાં સાવચેતીપૂર્વક વિશ્વાસ રાખો અને પ્રયોગો દ્વારા આગાહીઓને ચકાસો.
લાગુ પડવાનો અવકાશ: સૌથી મહત્વપૂર્ણ ખ્યાલ
QSAR મૉડલ એવા પરમાણુઓ પર સારી રીતે કામ કરે છે જે તેને તાલીમ આપવામાં આવી હતી તે પરમાણુઓ જેવા જ હોય છે. જો તમે એક પરમાણુ આપો છો જે તાલીમ ડેટાથી ખૂબ જ અલગ છે (ઉદાહરણ તરીકે, ખૂબ મોટું, અસામાન્ય હાડપિંજર), તો મોડેલ હજી પણ સંખ્યા પેદા કરશે, પરંતુ તે સંખ્યા અવિશ્વસનીય હશે. આને "લાગુપાત્રતાના અવકાશની બહાર હોવું" કહેવાય છે. મોડેલ હંમેશા જવાબ આપે છે; જવાબ વિશ્વસનીય છે કે નહીં તે જણાવવાનું તમારું કામ છે.
જ્યારે ભાષા મૉડલ એટ્રિબ્યુટ મૂલ્ય આપે છે ત્યારે તે વધુ જોખમી છે: તે સંખ્યાને "સંભવિત દેખાતા" મૂલ્ય તરીકે ઉત્પન્ન કરે છે, જેમાં કોઈ અંતર્ગત ગણતરી નથી. તેથી જો શક્ય હોય તો, ડિટરમિનિસ્ટિક ટૂલ (RDKit) અથવા QSAR મોડલમાંથી ફીચર વેલ્યુ મેળવો જે અનિશ્ચિતતા આપે છે, ભાષા મોડલમાંથી નહીં.
સ્ટેપ બાય સ્ટેપ: સુરક્ષિત ફીચરની આગાહી
- પરમાણુ ચકાસો: RDKit (યુનિટ 2) વડે સ્માઈલ્સનું વિશ્લેષણ કરો.
- નિર્ધારિત રાશિઓની ગણતરી કરો: MA, logP (ગણતરી કરેલ), TPSA, RDKitમાંથી H-બોન્ડ નંબરો.
- અનુમાનોને અલગથી ચિહ્નિત કરો: મોડલ અનુમાનો જેમ કે logS, પ્રવૃત્તિ વગેરેને "અનુમાન" ટેગ સાથે રાખો.
- લાગુ પડતું ડોમેન તપાસો: શું પરમાણુ તાલીમ ડેટા જેવો દેખાય છે? શું તે અત્યંત મોટું/અસામાન્ય છે?
- રેન્કિંગ માટે ઉપયોગ કરો, નિર્ણય નહીં: ઉમેદવારોને ક્રમ આપવા માટે અનુમાનોનો ઉપયોગ કરો; અંતિમ પસંદગી પ્રયોગ છે.
- પ્રયોગ દ્વારા બંધ કરો: માપન દ્વારા નિર્ણાયક ગુણધર્મો (દ્રાવ્યતા, pKa) ચકાસો.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) RDKit સાથે નિર્ણાયક લક્ષણો:
rdkit આયાત Chemfrom rdkit.Chem આયાત વર્ણનકર્તાઓ, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1cccc1C(=O)O") # એસ્પિરિનપ્રિન્ટ("MA:", રાઉન્ડ(વર્ણનકારો.MolWt(mol),2", calculated()) round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-બોન્ડ સ્વીકારનાર:", rdMolDescriptors(મોલબીએ))
2) લિપિન્સકી નિયમ મૂલ્યાંકન:
પરમાણુ (સ્માઇલ્સ): [સ્માઇલ્સ]કાર્ય: આરડીકિટમાંથી ગણતરી કરવા માટેના MA, logP, HBD, HBA મૂલ્યો સાથે પાંચના લિપિન્સકી નિયમના પાલનનું મૂલ્યાંકન કરો. દરેક માપદંડને પાસ/ફેલ તરીકે અલગથી ચિહ્નિત કરો. નિયમ: સંખ્યાઓ બનાવશો નહીં; હું તેને RDKit પરથી મેળવીશ, તમે ટિપ્પણી કરો.
3) લક્ષણ અંદાજ + અનિશ્ચિતતા વિનંતી:
પરમાણુ (સ્માઇલ્સ): [સ્માઇલ્સ]કાર્ય: પાણીની દ્રાવ્યતા (લોગએસ) (ઉચ્ચ/મધ્યમ/નીચી) નો ગુણાત્મક અંદાજ આપો અને માળખાકીય સુવિધાઓ સાથે તર્ક સમજાવો. ચોક્કસ નંબર આપશો નહીં; જણાવો કે આ એક આગાહી છે અને પ્રયોગ દ્વારા પુષ્ટિ કરવાની જરૂર છે. જો પરમાણુમાં અસામાન્ય માળખું હોય તો ચેતવણી આપો (લાગુ થવાનું જોખમ).
4) ઉમેદવાર રેન્કિંગ (અનુમાન દ્વારા પ્રાથમિકતા):
નીચે 5 અણુઓના સ્માઈલ્સ છે. કાર્ય: માળખાકીય વિશેષતાઓ (ધ્રુવીય જૂથોની સંખ્યા, રિંગ્સ, લિપોફિલિસિટી) ના આધારે તેમને પાણીની દ્રાવ્યતા (સૌથી ઓછા દ્રાવ્ય) ના સંદર્ભમાં રેન્ક આપો. દરેક રેન્કિંગ નિર્ણય માટે વાજબીતા લખો. નોંધ: આ એક પ્રારંભિક પ્રકાર છે; અંતિમ પસંદગી માપન દ્વારા કરવામાં આવશે.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા:
આ પરમાણુની દ્રાવ્યતા શું છે?
AI એવી સંખ્યા બનાવે છે જે ગણતરી હેઠળ અસ્તિત્વમાં નથી (દા.ત. "12 mg/mL"); તે આત્મવિશ્વાસ આપે છે પરંતુ ખોટું હોઈ શકે છે.
મજબૂત:
પરમાણુ (સ્માઇલ્સ): [સ્માઇલ્સ].ટાસ્ક: 1) હું RDKit સાથે ગણતરી કરવા માટે logP, TPSA, HBD/HBA આપીશ: [મૂલ્યો].2) આ મૂલ્યોના આધારે, રિઝોલ્યુશન ઊંચું/મધ્યમ/નીચું છે કે કેમ તે અર્થઘટન કરો.3) ચોક્કસ સંખ્યા આપવી; જણાવો કે તે અનુમાન છે અને પ્રયોગો જરૂરી છે.
તફાવત: અમે વાહનમાંથી નિર્ણાયક મૂલ્યો લીધા અને એઆઈને ફક્ત તેનું અર્થઘટન કર્યું; અમે સ્પષ્ટપણે અનિશ્ચિતતા અને પ્રયોગની જરૂરિયાત માટે પૂછ્યું.
લક્ષણ પ્રકારો અને વિશ્વાસ સ્તર
લક્ષણ
કેવી રીતે મેળવવું
વિશ્વાસ
નોંધ
પરમાણુ વજન
RDKit (નિર્ધારિત)
ખૂબ ઊંચા
સૂત્રમાંથી કાપો
TPSA, HBD/HBA
RDKit (નિર્ધારિત)
ઉચ્ચ
નિયમ આધારિત
logP (ગણતરી કરેલ)
RDKit મોડેલ
મધ્યમ-ઉચ્ચ
પ્રાયોગિક થી વિચલિત થઈ શકે છે
logS (ઠરાવ)
QSAR અંદાજ
મધ્યમ
લાગુ પડતા વિસ્તાર પર આધાર રાખે છે
pKa
ખાસ મોડેલ
મધ્યમ
તે એક જટિલ રચનામાં આવે છે
જૈવિક પ્રવૃત્તિ
QSAR/ML
ચલ
પરીક્ષણ અને ચકાસણી કરવાની ખાતરી કરો
નાના કેસો
કેસ 1 - ફીટ કરેલા ઠરાવોની સંખ્યા. એક વિદ્યાર્થીએ એઆઈને સંયોજનની દ્રાવ્યતા વિશે પૂછ્યું; તેને "25 mg/mL" જવાબ મળ્યો અને તે મુજબ પ્રાયોગિક ડિઝાઇન સેટ કરી. માપમાં વાસ્તવિક મૂલ્ય ~2 mg/mL હતું, જે 10-ગણો તફાવત હતો. એઆઈએ નંબર બનાવ્યો હતો. પાઠ: રીઝોલ્યુશન જેવા ગુણધર્મને ભાષાના નમૂનામાંથી સંખ્યા તરીકે ન લો; ગુણાત્મક અનુમાન + માપ.
કિસ્સો 2 - લાગુ પડવાના અવકાશની બહાર. એક QSAR મોડેલે જણાવ્યું હતું કે મોટા મેક્રોમોલેક્યુલ માટે "પ્રવૃત્તિ વધારે છે" જે પ્રશિક્ષણ સમૂહથી ખૂબ જ અલગ હતી. વપરાશકર્તાએ નોંધ્યું કે પરમાણુ તાલીમ ડેટાને મળતું નથી અને આગાહીને અવિશ્વસનીય માનવામાં આવે છે; પ્રયોગે ખરેખર ઓછી પ્રવૃત્તિ આપી. પાઠ: મોડેલ હંમેશા જવાબ આપે છે; જો તે અવકાશની બહાર છે, તો જવાબ નકામું છે.
કેસ 3 - લિપિન્સકીનો સાચો ઉપયોગ. એક ઉમેદવાર પરમાણુ પર, AI એ RDKit માંથી મૂલ્યો સાથે લિપિન્સકીનું મૂલ્યાંકન કર્યું: MA 512 (>500, સરહદરેખા), logP 4.8 (અનુકૂળ), HBD 2, HBA 7. વપરાશકર્તાએ "એક માપદંડ બાકી છે પરંતુ નિયમ નિરપેક્ષ નથી" તેનું યોગ્ય રીતે અર્થઘટન કર્યું છે અને અલ પરમાણુને દૂર કર્યું નથી. પાઠ: નિયમો માર્ગદર્શિકા છે, થ્રેશોલ્ડ નહીં; સંદર્ભ સાથે અર્થઘટન કરો.
સામાન્ય ભૂલો
- ભાષા મોડેલમાંથી સુવિધાની ગણતરી મેળવવી. મૂલ્યો કે જેની ગણતરી કરવામાં આવી નથી તે બનાવટી છે; અનિશ્ચિતતા સાથે નિર્ધારિત સાધન અથવા મોડેલનો ઉપયોગ કરો.
- લાગુ પાડવાના ક્ષેત્રને અવગણવું. મોડેલ દરેક પરમાણુ માટે સંખ્યાઓ બનાવે છે; ક્ષેત્રની બહાર અવિશ્વસનીય.
- અંદાજિત માપને ધ્યાનમાં લેતા. logS એક અંદાજ છે; તે પ્રાયોગિક રીઝોલ્યુશનનો વિકલ્પ નથી.
- લિપિન્સકીને સંપૂર્ણ નિયમ ધ્યાનમાં લેતા. જે ઉમેદવાર સરહદ પર છે તે આપોઆપ નાબૂદ થતો નથી; ઘણી દવાઓ નિયમનું ઉલ્લંઘન કરે છે.
- "અંદાજિત" સાથે "ગણતરી" ને ગૂંચવણમાં મૂકે છે. TPSA ની ગણતરી કરવામાં આવે છે (વિશ્વસનીય), પ્રવૃત્તિ અંદાજિત છે (અનિશ્ચિત).
સાવધાન: ફીચરની આગાહીઓ ઉમેદવારોને રેન્કિંગ અને પ્રાથમિકતા આપવા માટે ઉત્તમ છે; પરંતુ એકલા નિર્ણય નક્કી કરવા માટે નહીં. "મોડેલ કહ્યું દ્રાવ્ય" એક પૂર્વધારણા છે; "મેં માપ્યું, તે ઓગળી જાય છે" એ પરિણામ છે.
સારાંશમાં
- પ્રયોગ પહેલા મોલેક્યુલર પ્રોપર્ટીઝની આગાહી કરી શકાય છે અને ઘણો સમય બચાવે છે.
- કેટલીક વિશેષતાઓની ગણતરી નિર્ધારિત રીતે કરવામાં આવે છે (MA, TPSA, HBD/HBA), કેટલીક આંકડાકીય અંદાજો (લોગએસ, પ્રવૃત્તિ) છે.
- લાગુ પાડવાનું ડોમેન એ સૌથી જટિલ ખ્યાલ છે: મોડેલ હંમેશા જવાબ આપે છે, પરંતુ ડોમેનની બહાર અવિશ્વસનીય છે.
- RDKit અથવા અસ્પષ્ટતા મૉડલમાંથી સુવિધાની ગણતરી મેળવો, ભાષા મૉડલમાંથી નહીં.
- ઉમેદવારોને ક્રમ આપવા માટે આગાહીઓનો ઉપયોગ કરો; પ્રયોગ કરીને અંતિમ નિર્ણય લો.
એપ્લિકેશન કાર્ય
પાંચ પરમાણુ પસંદ કરો (દા.ત. દવાની શ્રેણી). RDKit વડે દરેક માટે MA, logP, TPSA, HBD, HBA ની ગણતરી કરો અને લિપિન્સકીનું મૂલ્યાંકન કરો. અલગથી, AI ને દરેક પરમાણુની દ્રાવ્યતાના ગુણાત્મક અંદાજ (સંખ્યા નહીં) અને લાગુ થવાની ચેતવણીના ક્ષેત્ર માટે પૂછો. કોષ્ટકમાં નિર્ધારિત મૂલ્યો અને AI આગાહીઓ એકત્રિત કરો. કયા પરમાણુએ સૌથી વધુ ડ્રગ જેવી પ્રોફાઇલ આપી? અનિશ્ચિતતા સૌથી વધુ ક્યાં છે?
ચેકલિસ્ટ
- [ ] હું નિર્ધારિત ગણતરી અને અનુમાનિત ગુણધર્મો વચ્ચે તફાવત કરું છું.
- [ ] હું RDKit/મોડલમાંથી પ્રોપર્ટી વેલ્યુ મેળવી રહ્યો છું, ભાષા મોડલથી નહીં.
- [ ] મને લાગુ પડવાના અવકાશની બહારના અણુઓ દેખાય છે.
- [ ] હું લિપિન્સકીનો ઉપયોગ માર્ગદર્શક તરીકે કરું છું, સંપૂર્ણ નિયમ નહીં.
- [ ] હું રેન્કિંગ માટે અનુમાનો અને પ્રયોગ માટે નિર્ણયનો ઉપયોગ કરું છું.
- [ ] મારી પાસે માપન દ્વારા નિર્ણાયક લક્ષણો ચકાસવાની યોજના છે.