ஆதாயங்கள்:
- உறுதியான முறையில் கணக்கிடப்பட்ட அம்சங்கள் மற்றும் புள்ளிவிவர ரீதியாக மதிப்பிடப்பட்ட அம்சங்கள் ஆகியவற்றை வேறுபடுத்தி, நம்பிக்கை நிலைகளை தீர்மானிக்கும் திறன்
- பொருந்தக்கூடிய டொமைன் என்ற கருத்தைப் பயன்படுத்தி மாதிரி நம்பகமானதாக இருக்கும் பகுதியை மதிப்பிடும் திறன்
- வேட்பாளர்களை தரவரிசைப்படுத்தவும், பரிசோதனையின் மூலம் இறுதி முடிவை எடுக்கவும் பண்புக் கணிப்புகளைப் பயன்படுத்த வேண்டும் என்பதைப் புரிந்துகொள்ளும் திறன்.
ஒரு மூலக்கூறை ஒருங்கிணைக்கும் முன், நாம் அடிக்கடி கேட்கிறோம்: "இது தண்ணீரில் கரையக்கூடியதா? அது எவ்வளவு அமிலமானது? அது செல் சவ்வைக் கடக்கிறதா? இது ஒரு மருந்து வேட்பாளராக நம்பக்கூடியதா?" சோதனைக்கு முன் இந்தக் கேள்விகளுக்கான பதில்களைக் கணிப்பது நிறைய நேரத்தை மிச்சப்படுத்துகிறது. AI மற்றும் அதன் சிறப்பு மாதிரிகள் (குறிப்பாக QSAR - அளவு கட்டமைப்பு-செயல்பாட்டு உறவு, அதாவது மூலக்கூறின் கட்டமைப்பு விளக்கங்களிலிருந்து ஒரு சொத்தை முன்னறிவிக்கும் புள்ளிவிவர மாதிரி) இந்த கணிப்புகளில் சக்திவாய்ந்தவை. ஆனால் இந்த கணிப்புகள் நிகழ்தகவு பற்றிய கணிப்புகள், அளவீடுகள் அல்ல. இந்த அலகில், அம்சக் கணிப்பு, அதன் பலம் மற்றும் மிகவும் முக்கியமான கருத்து, பொருந்தக்கூடிய மண்டலம் (மாதிரி நம்பகமான பகுதி) பற்றி அறிந்துகொள்வோம்.
என்ன அம்சங்கள் கணிக்கப்படுகின்றன?
- logP: மூலக்கூறின் எண்ணெய்/நீர் பகிர்வு குணகம்; இது லிபோபிலிசிட்டி (கொழுப்பு விருப்பம்) காட்டுகிறது. மருந்து உறிஞ்சுதலில் முக்கியமானது.
- கரைதிறன் (logS): இது தண்ணீரில் எவ்வளவு கரையக்கூடியது.
- pKa: அமிலத்தன்மை/காரத்தன்மை; ஒரு குழு அயனியாக்கும் pH.
- TPSA: இடவியல் துருவ மேற்பரப்பு பகுதி; இது ஊடுருவல் மதிப்பீட்டில் பயன்படுத்தப்படுகிறது.
- லிபின்ஸ்கி "ஐந்தின் விதி": மூலக்கூறு எடை, logP, H-பத்திர நன்கொடையாளர்கள்/வாய்வழி மருந்து விண்ணப்பதாரர்களின் எண்ணிக்கை ஆகியவற்றின் நடைமுறை வரம்புகள்.
இந்த மதிப்புகளில் சில, RDKit போன்ற கருவிகளைக் கொண்டு (எ.கா. TPSA, H-பத்திர எண்கள்) தீர்மானமாக கணக்கிடப்படுகின்றன; அவற்றில் சில புள்ளிவிவர மதிப்பீடுகள் (பதிவுகள், உயிரியல் செயல்பாடு). இந்த வேறுபாட்டை அறிவது நீங்கள் எவ்வளவு நம்புகிறீர்கள் என்பதை தீர்மானிக்கிறது.
உதவிக்குறிப்பு: ஒரு அம்சம் "கணக்கிடப்பட்டதா" (விதி அடிப்படையிலானது, மீண்டும் செய்யக்கூடியது) அல்லது "கணிக்கப்பட்டதா" (மாதிரியிலிருந்து, நிச்சயமற்றது) என்பதை வேறுபடுத்திப் பார்க்கவும். கணக்கீடுகளில் அதிக நம்பிக்கை, கணிப்புகளில் எச்சரிக்கையான நம்பிக்கை மற்றும் பரிசோதனை மூலம் கணிப்புகளைச் சரிபார்க்கவும்.
பொருந்தக்கூடிய நோக்கம்: மிக முக்கியமான கருத்து
ஒரு QSAR மாதிரியானது அது பயிற்சியளிக்கப்பட்ட மூலக்கூறுகளைப் போன்ற மூலக்கூறுகளில் நன்றாக வேலை செய்கிறது. பயிற்சி தரவிலிருந்து மிகவும் வித்தியாசமான ஒரு மூலக்கூறை நீங்கள் வழங்கினால் (உதாரணமாக, மிகப் பெரிய, அசாதாரண எலும்புக்கூடு), மாதிரி இன்னும் ஒரு எண்ணை உருவாக்கும், ஆனால் அந்த எண் நம்பகத்தன்மையற்றதாக இருக்கும். இது "பயன்படுத்தும் எல்லைக்கு வெளியே இருப்பது" என்று அழைக்கப்படுகிறது. மாதிரி எப்போதும் ஒரு பதில் கொடுக்கிறது; பதில் நம்பகமானதா இல்லையா என்பதைச் சொல்வது உங்கள் வேலை.
மொழி மாதிரியானது ஒரு பண்புக்கூறு மதிப்பைக் கொடுக்கும் போது இது மிகவும் ஆபத்தானது: இது எண்ணை "சாத்தியமான தோற்றமுடைய" மதிப்பாக உருவாக்குகிறது, எந்த அடிப்படைக் கணக்கீடும் இல்லை. எனவே முடிந்தால், மொழி மாதிரியிலிருந்து அல்லாமல், நிச்சயமற்ற தன்மையை அளிக்கும் ஒரு நிர்ணய கருவி (RDKit) அல்லது QSAR மாதிரியிலிருந்து அம்ச மதிப்புகளைப் பெறுங்கள்.
படிப்படியாக: பாதுகாப்பான அம்சம் கணிப்பு
- மூலக்கூறைச் சரிபார்க்கவும்: RDKit (அலகு 2) மூலம் ஸ்மைல்களை அலசவும்.
- உறுதியானவற்றைக் கணக்கிடுக: MA, logP (கணக்கிடப்பட்டது), TPSA, RDKit இலிருந்து H-பத்திர எண்கள்.
- கணிப்புகளைத் தனித்தனியாகக் குறிக்கவும்: பதிவுகள், செயல்பாடு போன்ற மாதிரி கணிப்புகளை "கணிப்பு" குறிச்சொல்லுடன் வைத்திருங்கள்.
- பொருந்தக்கூடிய டொமைனைச் சரிபார்க்கவும்: மூலக்கூறு பயிற்சித் தரவைப் போல் உள்ளதா? இது மிகவும் பெரியதா/அசாதாரணமா?
- தரவரிசைக்கு பயன்படுத்தவும், முடிவு அல்ல: வேட்பாளர்களை தரவரிசைப்படுத்த கணிப்புகளைப் பயன்படுத்தவும்; இறுதி தேர்வு பரிசோதனை.
- சோதனை மூலம் மூடவும்: முக்கிய பண்புகளை (கரைதிறன், pKa) அளவீடு மூலம் சரிபார்க்கவும்.
நகலெடுக்கக்கூடிய நான்கு வார்ப்புருக்கள்
1) RDKit உடன் தீர்மானிக்கும் அம்சங்கள்:
rdkit இலிருந்து இறக்குமதி Chemfrom rdkit.Chem இறக்குமதி விளக்கங்கள், rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1cccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2)) round(Descriptors.MolLogP(mol),2))அச்சு("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-பாண்ட் ஏற்பி:", rd.HBACmolDe)
2) லிபின்ஸ்கி விதி மதிப்பீடு:
மூலக்கூறு (புன்னகைகள்): [புன்னகைகள்] பணி: RDKit இலிருந்து கணக்கிடப்பட வேண்டிய MA, logP, HBD, HBA மதிப்புகளுடன் ஐந்து லிபின்ஸ்கி விதிக்கு இணங்குவதை மதிப்பிடவும். ஒவ்வொரு அளவுகோலையும் தனித்தனியாக தேர்ச்சி/தோல்வி எனக் குறிக்கவும். விதி: எண்களை உருவாக்க வேண்டாம்; நான் அதை RDKit இலிருந்து பெறுகிறேன், நீங்கள் கருத்து தெரிவிக்கவும்.
3) அம்ச மதிப்பீடு + நிச்சயமற்ற கோரிக்கை:
மூலக்கூறு (புன்னகைகள்): [புன்னகைகள்] பணி: நீர் கரைதிறன் (logS) (உயர்/நடுத்தர/குறைவு) ஆகியவற்றின் தர மதிப்பீட்டைக் கொடுத்து, கட்டமைப்பு அம்சங்களுடன் பகுத்தறிவை விளக்கவும். சரியான எண்ணைக் கொடுக்க வேண்டாம்; இது ஒரு கணிப்பு என்றும் பரிசோதனை மூலம் உறுதிப்படுத்தப்பட வேண்டும் என்றும் கூறவும். மூலக்கூறில் அசாதாரண அமைப்பு இருந்தால் எச்சரிக்கவும் (பயன்படுத்தும் ஆபத்து).
4) வேட்பாளர் தரவரிசை (கணிப்பின் மூலம் முன்னுரிமை):
கீழே 5 மூலக்கூறுகளின் ஸ்மைல்கள் உள்ளன. பணி: கட்டமைப்பு அம்சங்களின் (துருவக் குழுக்களின் எண்ணிக்கை, மோதிரங்கள், லிபோபிலிசிட்டி) அடிப்படையில் நீரில் கரையும் தன்மை (மிகவும் கரையக்கூடியது முதல் குறைந்தது) அடிப்படையில் அவற்றை வரிசைப்படுத்தவும். ஒவ்வொரு தரவரிசை முடிவுக்கும் நியாயத்தை எழுதவும். குறிப்பு: இது ஒரு ஆரம்ப வகை; இறுதி தேர்வு அளவீடு மூலம் செய்யப்படும்.
பலவீனமான வரியில் / வலுவான வரியில்
பலவீனமான:
இந்த மூலக்கூறின் கரைதிறன் என்ன?
கணக்கீட்டின் கீழ் இல்லாத எண்ணை AI உருவாக்குகிறது (எ.கா. "12 mg/mL"); இது நம்பிக்கையைத் தருகிறது ஆனால் தவறாக இருக்கலாம்.
வலுவான:
மூலக்கூறு (புன்னகைகள்): [புன்னகைகள்].பணி: 1) RDKit மூலம் கணக்கிடப்படும் logP, TPSA, HBD/HBA ஐ தருகிறேன்: [மதிப்புகள்].2) இந்த மதிப்புகளின் அடிப்படையில், தெளிவுத்திறன் அதிகமாக/நடுத்தரமாக/குறைவாக உள்ளதா என்பதை விளக்கவும்.3) சரியான எண்ணைக் கொடுத்தல்; இது ஒரு யூகம் மற்றும் பரிசோதனைகள் தேவை என்று குறிப்பிடவும்.
வித்தியாசம்: நாங்கள் வாகனத்திலிருந்து நிர்ணயிக்கும் மதிப்புகளை எடுத்து, AI ஐ அவற்றை விளக்கினோம்; நிச்சயமற்ற தன்மை மற்றும் பரிசோதனையின் அவசியத்தை நாங்கள் வெளிப்படையாகக் கேட்டோம்.
அம்ச வகைகள் மற்றும் நம்பிக்கை நிலை
அம்சம்
எப்படி பெறுவது
நம்பிக்கை
குறிப்பு
மூலக்கூறு எடை
RDKit (தீர்மானம்)
மிக உயர்ந்தது
சூத்திரத்தில் இருந்து வெட்டு
TPSA, HBD/HBA
RDKit (தீர்மானம்)
உயர்
விதி அடிப்படையிலானது
logP (கணக்கிடப்பட்டது)
RDKit மாதிரி
நடுத்தர உயர்
பரிசோதனையில் இருந்து விலகலாம்
பதிவுகள் (தீர்மானம்)
QSAR மதிப்பீடு
நடுத்தர
பொருந்தக்கூடிய பகுதியைப் பொறுத்தது
pKa
சிறப்பு மாதிரி
நடுத்தர
இது ஒரு சிக்கலான கட்டமைப்பில் விழுகிறது
உயிரியல் செயல்பாடு
QSAR/ML
மாறி
சோதித்து சரிபார்க்கவும்
சிறிய வழக்குகள்
வழக்கு 1 - பொருத்தப்பட்ட தீர்மானங்களின் எண்ணிக்கை. ஒரு மாணவர் AI யிடம் ஒரு கலவையின் கரைதிறன் பற்றி கேட்டார்; அவர் "25 mg/mL" என்ற பதிலைப் பெற்று அதற்கேற்ப சோதனை வடிவமைப்பை அமைத்தார். அளவீட்டின் உண்மையான மதிப்பு ~2 mg/mL, 10 மடங்கு வித்தியாசம். AI எண்ணை உருவாக்கியது. பாடம்: மொழி மாதிரியிலிருந்து தீர்மானம் போன்ற பண்புகளை எண்களாக எடுத்துக்கொள்ளாதீர்கள்; தரமான கணிப்பு + அளவீடு.
வழக்கு 2 - பொருந்தக்கூடிய எல்லைக்கு வெளியே. ஒரு QSAR மாதிரியானது பயிற்சித் தொகுப்பிலிருந்து மிகவும் வித்தியாசமான ஒரு பெரிய மேக்ரோமாலிகுலுக்கு "செயல்பாடு அதிகமாக உள்ளது" என்று கூறியது. மூலக்கூறு பயிற்சித் தரவை ஒத்திருக்கவில்லை என்பதை பயனர் கவனித்தார் மற்றும் கணிப்பு நம்பமுடியாததாகக் கருதினார்; சோதனை மிகவும் குறைந்த செயல்பாட்டைக் கொடுத்தது. பாடம்: மாதிரி எப்போதும் பதிலளிக்கிறது; அது எல்லைக்கு அப்பாற்பட்டதாக இருந்தால், பதில் பயனற்றது.
வழக்கு 3 - லிபின்ஸ்கியின் சரியான பயன்பாடு. ஒரு வேட்பாளர் மூலக்கூறில், AI ஆனது RDKit இலிருந்து மதிப்புகளுடன் லிபின்ஸ்கியை மதிப்பீடு செய்தது: MA 512 (>500, எல்லைக்கோடு), logP 4.8 (சாதகமானது), HBD 2, HBA 7. பயனர் "ஒரு அளவுகோல் உள்ளது, ஆனால் விதி முழுமையடையாது" மற்றும் மூலக்கூறை நீக்கவில்லை. பாடம்: விதிகள் வழிகாட்டுதல்கள், வரம்புகள் அல்ல; சூழலுடன் விளக்கவும்.
பொதுவான தவறுகள்
- மொழி மாதிரியிலிருந்து அம்ச எண்ணிக்கையைப் பெறுதல். கணக்கிடப்படாத மதிப்புகள் புனையப்பட்டவை; உறுதியற்ற கருவி அல்லது மாதிரியைப் பயன்படுத்தவும்.
- பொருந்தக்கூடிய துறையைப் புறக்கணித்தல். மாதிரி ஒவ்வொரு மூலக்கூறுக்கும் எண்களை உருவாக்குகிறது; களத்திற்கு வெளியே நம்பகத்தன்மையற்றது.
- மதிப்பிடப்பட்ட அளவீட்டைக் கருத்தில் கொண்டு. logS என்பது ஒரு மதிப்பீடு; இது சோதனைத் தீர்மானத்திற்கு மாற்றாக இல்லை.
- லிபின்ஸ்கியை முழுமையான விதியாகக் கருதுகிறது. எல்லையில் இருக்கும் வேட்பாளர் தானாகவே நீக்கப்படுவதில்லை; பல மருந்துகள் விதியை மீறுகின்றன.
- "கணக்கிடப்பட்டது" மற்றும் "மதிப்பிடப்பட்டது" என்று குழப்புகிறது. TPSA கணக்கிடப்படுகிறது (நம்பகமானது), செயல்பாடு மதிப்பிடப்படுகிறது (நிச்சயமற்றது).
எச்சரிக்கை: தரவரிசைப்படுத்துவதற்கும், வேட்பாளர்களுக்கு முன்னுரிமை அளிப்பதற்கும் அம்சக் கணிப்புகள் சிறந்தவை; ஆனால் ஒரு முடிவை மட்டும் தீர்மானிக்க முடியாது. "மாடல் கூறினார் கரையக்கூடியது" என்பது ஒரு கருதுகோள்; "நான் அளந்தேன், அது கரைகிறது" என்பது ஒரு முடிவு.
சுருக்கமாக
- சோதனைக்கு முன்பே மூலக்கூறு பண்புகளை கணிக்க முடியும் மற்றும் நிறைய நேரத்தை மிச்சப்படுத்துகிறது.
- சில அம்சங்கள் உறுதியான முறையில் கணக்கிடப்படுகின்றன (MA, TPSA, HBD/HBA), சில புள்ளிவிவர மதிப்பீடுகள் (logS, செயல்பாடு).
- பொருந்தக்கூடிய டொமைன் மிகவும் முக்கியமான கருத்தாகும்: மாதிரி எப்போதும் பதிலளிக்கிறது, ஆனால் டொமைனுக்கு வெளியே நம்பகத்தன்மையற்றது.
- RDKit அல்லது தெளிவின்மை மாதிரியிலிருந்து அம்சங்களின் எண்ணிக்கையைப் பெறுங்கள், மொழி மாதிரி அல்ல.
- வேட்பாளர்களை வரிசைப்படுத்த கணிப்புகளைப் பயன்படுத்தவும்; பரிசோதனை மூலம் இறுதி முடிவை எடுங்கள்.
விண்ணப்ப பணி
ஐந்து மூலக்கூறுகளைத் தேர்ந்தெடுக்கவும் (எ.கா. மருந்துத் தொடர்). RDKit மூலம் ஒவ்வொன்றிற்கும் MA, logP, TPSA, HBD, HBA ஆகியவற்றைக் கணக்கிட்டு லிபின்ஸ்கியை மதிப்பிடவும். தனித்தனியாக, ஒவ்வொரு மூலக்கூறின் கரைதிறன் மற்றும் பொருந்தக்கூடிய எச்சரிக்கையின் ஒரு தரமான மதிப்பீட்டை (எண் அல்ல) AIயிடம் கேட்கவும். ஒரு அட்டவணையில் நிர்ணயிக்கும் மதிப்புகள் மற்றும் AI கணிப்புகளை சேகரிக்கவும். எந்த மூலக்கூறு அதிக மருந்து போன்ற சுயவிவரத்தைக் கொடுத்தது? நிச்சயமற்ற தன்மை எங்கு அதிகமாக உள்ளது?
சரிபார்ப்பு பட்டியல்
- [ ] நான் தீர்மானிக்கும் கணக்கிடப்பட்ட மற்றும் கணிக்கப்பட்ட பண்புகளை வேறுபடுத்துகிறேன்.
- [ ] நான் சொத்து மதிப்புகளை RDKit/மாடலில் இருந்து பெறுகிறேன், மொழி மாதிரி அல்ல.
- [ ] பொருந்தக்கூடிய தன்மைக்கு வெளியே உள்ள மூலக்கூறுகளை நான் கவனிக்கிறேன்.
- [ ] நான் லிபின்ஸ்கியை வழிகாட்டியாகப் பயன்படுத்துகிறேன், முழுமையான விதி அல்ல.
- [ ] நான் தரவரிசைக்கு கணிப்புகளையும் பரிசோதனைக்கான முடிவையும் பயன்படுத்துகிறேன்.
- [ ] முக்கியமான அம்சங்களை அளவீடு மூலம் சரிபார்க்கும் திட்டம் என்னிடம் உள்ளது.