ඒකක
1. රසායන විද්‍යාවේ කෘත්‍රිම බුද්ධිය හැඳින්වීම: භූමිකාවන්, සීමා මායිම්, වලංගුකරණය සහ ආචාර ධර්ම 2. අණුක නිරූපණය සහ රසායනික ව්‍යුහය: SMILES, InChI සහ RDKit සමඟ වලංගු කිරීම 3. ප්‍රතික්‍රියා පුරෝකථනය සහ යාන්ත්‍රණය: නිෂ්පාදනය, තත්ත්වය සහ අහිතකර ප්‍රතික්‍රියා පුරෝකථනය 4. වර්ණාවලි පරිවර්ථන සහාය: NMR, IR සහ Mass Spectrometry 5. සාහිත්‍ය සමාලෝචනය සහ සංශ්ලේෂණ සැලසුම්: මූලාශ්‍රය, ක්‍රියා පටිපාටිය සහ මාර්ග සිතියම 6. රසායනික දත්ත විශ්ලේෂණය සහ පයිතන්: pandas, Stoichiometry සහ ක්රමාංකනය 7. අණුක දේපල පුරෝකථනය සහ QSAR: විභේදනය, pKa සහ ආදර්ශ සීමාවන් 8. රසායනාගාර ලේඛනගත කිරීම: පරීක්ෂණ සටහන් පොත, ELN සහ ප්රතිනිෂ්පාදනය 9. ආරක්ෂාව සහ උපද්‍රව තක්සේරුව: GHS, SDS සහ කෘතිම බුද්ධියේ සීමාවන් 10. තහවුරු කිරීම, මායාව සහ විද්‍යාත්මක අඛණ්ඩතාව 11. අත්හදා බැලීමේ මිනිසා: ආචාර ධර්ම, පෞද්ගලිකත්වය, වගකීම සහ අවසානය දක්වා වැඩ ප්‍රවාහය
ඒකකය 7 / 11

අණුක දේපල පුරෝකථනය සහ QSAR: විභේදනය, pKa සහ ආදර්ශ සීමාවන්

ලාභ:

  • අධිෂ්ඨානශීලීව ගණනය කරන ලද ලක්ෂණ සහ සංඛ්‍යානමය වශයෙන් ඇස්තමේන්තු කළ ලක්ෂණ අතර වෙනස හඳුනා ගැනීමට සහ විශ්වාස මට්ටම් තීරණය කිරීමට ඇති හැකියාව
  • යෙදවුම් වසම යන සංකල්පය භාවිතා කරමින් ආකෘතිය විශ්වාසදායක කලාපයක් ඇගයීමේ හැකියාව
  • අපේක්ෂකයින් ශ්‍රේණිගත කිරීමට සහ අත්හදා බැලීම් තුළින් අවසාන තීරණය ගැනීමට කෙනෙකු ගතිලක්ෂණ අනාවැකි භාවිතා කළ යුතු බව තේරුම් ගැනීමේ හැකියාව.

අණුවක් සංස්ලේෂණය කිරීමට පෙර, අපි බොහෝ විට අසන්නෙමු: "එය ජලයේ ද්‍රාව්‍යද? එය කෙතරම් ආම්ලිකද? එය සෛල පටලය හරහා ගමන් කරයිද? එය මත්ද්‍රව්‍ය අපේක්ෂකයෙකු ලෙස පිළිගත හැකිද?" අත්හදා බැලීමට පෙර මෙම ප්‍රශ්නවලට පිළිතුරු අනාවැකි කීම බොහෝ කාලයක් ඉතිරි කරයි. AI සහ එහි විශේෂිත මාදිලි (විශේෂයෙන් QSAR — ප්‍රමාණාත්මක ව්‍යුහය-ක්‍රියාකාරකම් සම්බන්ධතාවය, එනම් අණුවේ ව්‍යුහාත්මක විස්තර වලින් ගුණයක් පුරෝකථනය කරන සංඛ්‍යානමය ආකෘතිය) මෙම අනාවැකිවල බලවත් වේ. නමුත් මෙම අනාවැකි සම්භාවිතාව පිළිබඳ අනාවැකි මිස මිනුම් නොවේ. මෙම ඒකකය තුළ, අපි විශේෂාංග අනාවැකිය, එහි ශක්තීන් සහ වඩාත්ම විවේචනාත්මක සංකල්පය, යෙදවුම් කලාපය (ආකෘතිය විශ්වාසදායක කලාපය) ගැන ඉගෙන ගනිමු.

පුරෝකථනය කර ඇති ලක්ෂණ මොනවාද?

  • logP: අණුවේ තෙල්/ජල කොටස් සංගුණකය; එය lipophilicity (මේදය රුචිය) පෙන්නුම් කරයි. ඖෂධ අවශෝෂණය කිරීමේදී තීරණාත්මකයි.
  • ද්‍රාව්‍යතාව (logS): එය ජලයේ කෙතරම් ද්‍රාව්‍ය වේද.
  • pKa: ආම්ලිකතාවය / ක්ෂාරීය බව; කණ්ඩායමක් අයනීකරණය වන pH අගය.
  • TPSA: ස්ථානීය ධ්‍රැවීය මතුපිට ප්‍රදේශය; එය පාරගම්යතාව තක්සේරු කිරීමේදී භාවිතා වේ.
  • Lipinski "පහේ රීතිය": අණුක බර සඳහා ප්‍රායෝගික සීමාවන්, logP, H-බන්ධන පරිත්‍යාගශීලීන්/මුඛ ඖෂධ අපේක්ෂකයින් පිළිගන්නා සංඛ්‍යාව.

මෙම අගයන් සමහරක් RDKit වැනි මෙවලම් සමඟින් (උදා: TPSA, H-bond numbers) අධිෂ්ඨානශීලීව ගණනය කෙරේ; ඒවායින් සමහරක් සංඛ්‍යානමය ඇස්තමේන්තු (logS, ජීව විද්‍යාත්මක ක්‍රියාකාරකම්) වේ. මෙම වෙනස දැන ගැනීමෙන් ඔබ කොතරම් විශ්වාස කරනවාද යන්න තීරණය කරයි.

ඉඟිය: විශේෂාංගයක් "ගණනය කරන ලද" (නීතිය මත පදනම් වූ, පුනරාවර්තනය කළ හැකි) හෝ "පුරෝකථනය කරන ලද" (ආකෘතියෙන්, අවිනිශ්චිත) යන්න වෙන්කර හඳුනා ගන්න. ගණනය කිරීම් කෙරෙහි ඉහළ විශ්වාසයක් තබා ගන්න, අනාවැකි ගැන ප්‍රවේශමෙන් විශ්වාස කරන්න, සහ අත්හදා බැලීම් මගින් අනාවැකි සත්‍යාපනය කරන්න.

අදාළ වීමේ විෂය පථය: වඩාත්ම වැදගත් සංකල්පය

QSAR ආකෘතියක් එය පුහුණු කරන ලද අණු වලට සමාන අණු මත හොඳින් ක්රියා කරයි. ඔබ පුහුණු දත්ත වලට වඩා බෙහෙවින් වෙනස් අණුවක් ලබා දෙන්නේ නම් (උදාහරණයක් ලෙස, ඉතා විශාල, අසාමාන්ය ඇටසැකිල්ලක්), ආකෘතිය තවමත් අංකයක් නිපදවනු ඇත, නමුත් එම සංඛ්යාව විශ්වාස කළ නොහැකි වනු ඇත. මෙය "අදාළ වීමේ විෂය පථයෙන් පිටත සිටීම" ලෙස හැඳින්වේ. ආකෘතිය සෑම විටම පිළිතුරක් ලබා දෙයි; පිළිතුර විශ්වාසදායකද නැද්ද යන්න පැවසීම ඔබේ කාර්යයයි.

භාෂා ආකෘතිය උපලක්ෂණ අගයක් ලබා දෙන විට එය වඩාත් අවදානම් වේ: එය පාදක ගණනය කිරීමකින් තොරව, "විය හැකි-පෙනෙන" අගයක් ලෙස අංකය නිපදවයි. එබැවින් හැකි නම්, භාෂා ආකෘතියෙන් නොව, අවිනිශ්චිතතාවය ලබා දෙන නියතිවාදී මෙවලමකින් (RDKit) හෝ QSAR ආකෘතියකින් විශේෂාංග අගයන් ලබා ගන්න.

පියවරෙන් පියවර: ආරක්ෂිත විශේෂාංග අනාවැකි

  1. අණුව සත්‍යාපනය කරන්න: RDKit (ඒකක 2) සමඟින් SMILES විග්‍රහ කරන්න.
  2. අධිෂ්ඨානශීලී ඒවා ගණනය කරන්න: MA, logP (ගණනය කළ), TPSA, RDKit වෙතින් H-බන්ධන අංක.
  3. අනාවැකි වෙන වෙනම සලකුණු කරන්න: logS, ක්‍රියාකාරකම් යනාදී ආකෘති අනාවැකි "අනාවැකි" ටැගය සමඟ තබා ගන්න.
  4. අදාළ වසම පරීක්ෂා කරන්න: අණුව පුහුණු දත්ත මෙන් පෙනෙනවාද? එය අතිශයින් විශාල / අසාමාන්ය ද?
  5. තීරණය සඳහා නොව ශ්‍රේණිගත කිරීම සඳහා භාවිතා කරන්න: අපේක්ෂකයින් ශ්‍රේණිගත කිරීමට අනාවැකි භාවිතා කරන්න; අවසාන තේරීම අත්හදා බැලීමයි.
  6. අත්හදා බැලීමෙන් වසන්න: තීරනාත්මක ගුණාංග (ද්රාව්යතාව, pKa) මැනීම මගින් තහවුරු කරන්න.

පිටපත් කළ හැකි සැකිලි හතරක්

1) RDKit සමඟ නිර්ණායක ලක්ෂණ:

rdkit ආයාතයෙන් Chemfrom rdkit.Chem ආනයන විස්තර, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1cccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),"2)) වටය(Descriptors.MolLogP(mol),2))මුද්‍රණය("TPSA:", වටය(Descriptors.TPSA(mol),1))මුද්‍රණය("H-බන්ධන දායකයා:", rdMolDescriptors.CalcNumHBD(mol))මුද්‍රණය("H-බන්ධන ප්‍රතිග්‍රාහක:", rdHBACMolDle)

2) Lipinski රීති ඇගයීම:

අණු (SMILES): [SMILES] කාර්යය: RDKit වෙතින් ගණනය කළ යුතු MA, logP, HBD, HBA අගයන් සමඟ පහේ Lipinski රීතියට අනුකූල වීම තක්සේරු කරන්න. සෑම නිර්ණායකයක්ම සමත්/අසමත් ලෙස වෙන වෙනම සලකුණු කරන්න. රීතිය: ඉලක්කම් සාදන්න එපා; මම ඒක RDKit එකෙන් ගන්නම්, ඔබ අදහස් දක්වන්න.

3) විශේෂාංග ඇස්තමේන්තුව + අවිනිශ්චිත ඉල්ලීම:

අණු (SMILES): [SMILES]කාර්යය: ජල ද්‍රාව්‍යතාව (logS) (ඉහළ/මධ්‍යම/අඩු) පිළිබඳ ගුණාත්මක ඇස්තමේන්තුවක් ලබා දී ව්‍යුහාත්මක ලක්ෂණ සමඟ තාර්කිකත්වය පැහැදිලි කරන්න. නිශ්චිත අංකයක් දෙන්න එපා; මෙය අනාවැකියක් වන අතර එය අත්හදා බැලීමෙන් තහවුරු කළ යුතු බව සඳහන් කරන්න. අණුවෙහි අසාමාන්‍ය ව්‍යුහයක් තිබේ නම් (අදාළ වීමේ අවදානම) අනතුරු අඟවන්න.

4) අපේක්ෂක ශ්‍රේණිගත කිරීම (පුරෝකථනය අනුව ප්‍රමුඛත්වය):

පහත දැක්වෙන්නේ අණු 5 ක SMILES ය. කාර්යය: ව්‍යුහාත්මක ලක්ෂණ (ධ්‍රැවීය කණ්ඩායම් ගණන, මුදු, lipophilicity) මත පදනම්ව ජල ද්‍රාව්‍යතාව අනුව (වඩාත් ද්‍රාව්‍යයේ සිට අවම වශයෙන්) ඒවා ශ්‍රේණිගත කරන්න. එක් එක් ශ්‍රේණිගත කිරීමේ තීරණය සඳහා සාධාරණීකරණය ලියන්න. සටහන: මෙය පූර්ව වර්ගයකි; අවසාන තේරීම මිනුම් මගින් සිදු කෙරේ.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල:

මෙම අණුවේ ද්‍රාව්‍යතාව කුමක්ද?

AI ගණනය කිරීම යටතේ නොපවතින අංකයක් සෑදෙයි (උදා: "12 mg/mL"); එය විශ්වාසයක් ලබා දෙන නමුත් වැරදි විය හැක.

ශක්තිමත්:

අණු (SMILES): [SMILES].කාර්යය: 1) මම RDKit සමඟ ගණනය කිරීමට logP, TPSA, HBD/HBA ලබා දෙමි: [අගය].2) මෙම අගයන් මත පදනම්ව, විභේදනය ඉහළ/මධ්‍යම/අඩුද යන්න අර්ථකථනය කරන්න.3) නිශ්චිත අංකය ලබා දීම; එය අනුමානයක් බවත් අත්හදා බැලීම් අවශ්‍ය බවත් සඳහන් කරන්න.

වෙනස: අපි වාහනයේ නිර්ණායක අගයන් ගෙන AI ඒවා අර්ථකථනය කළෙමු; අපි පැහැදිලිවම අවිනිශ්චිතභාවය සහ අත්හදා බැලීමේ අවශ්‍යතාවය ඉල්ලා සිටියෙමු.

විශේෂාංග වර්ග සහ විශ්වාස මට්ටම

ලක්ෂණය

ලබා ගන්නේ කෙසේද

විශ්වාසය

සටහන

අණුක බර

RDKit (නිශ්චිත)

ඉතා ඉහළ

සූත්රයෙන් කපා

TPSA, HBD/HBA

RDKit (නිශ්චිත)

ඉහළ

රීති මත පදනම් වූ

logP (ගණනය කළ)

RDKit ආකෘතිය

මධ්යම-ඉහළ

අත්හදා බැලීම් වලින් බැහැර විය හැක

logS (විභේදනය)

QSAR ඇස්තමේන්තුව

මධ්යම

අදාළ වන ප්රදේශය මත රඳා පවතී

pKa

විශේෂ ආකෘතිය

මධ්යම

එය සංකීර්ණ ව්යුහයක් තුළ වැටේ

ජීව විද්යාත්මක ක්රියාකාරිත්වය

QSAR/ML

විචල්ය

පරීක්ෂා කර තහවුරු කිරීමට වග බලා ගන්න

කුඩා නඩු

නඩුව 1 - සවි කර ඇති විභේදන ගණන. ශිෂ්‍යයෙක් සංයෝගයක ද්‍රාව්‍යතාව ගැන AI ගෙන් විමසීය; ඔහුට "25 mg/mL" යන පිළිතුර ලැබුණු අතර ඒ අනුව පර්යේෂණාත්මක සැලසුම සකස් කළේය. මිනුම්වල සැබෑ අගය ~2 mg/mL, 10 ගුණයක වෙනසක්. AI විසින් අංකය සකසා තිබුණි. පාඩම: විභේදනය වැනි ගුණාංග භාෂා ආකෘතියෙන් අංක ලෙස නොගන්න; ගුණාත්මක අනාවැකි + මැනීම.

නඩුව 2 - අදාළ විෂය පථයෙන් පිටත. QSAR ආකෘතියක් පැවසුවේ පුහුණු කට්ටලයට වඩා බෙහෙවින් වෙනස් වූ විශාල සාර්ව අණුවක් සඳහා "ක්‍රියාකාරීත්වය ඉහළයි" යනුවෙනි. අණුව පුහුණු දත්තවලට සමාන නොවන බව පරිශීලකයා දුටු අතර අනාවැකිය විශ්වාස කළ නොහැකි යැයි සැලකේ; අත්හදා බැලීම ඇත්තෙන්ම අඩු ක්රියාකාරිත්වයක් ලබා දුන්නේය. පාඩම: ආකෘතිය සෑම විටම ප්රතිචාර දක්වයි; එය විෂය පථයෙන් බැහැර නම්, පිළිතුර නිෂ්ඵල ය.

නඩුව 3 - Lipinski නිවැරදි භාවිතය. එක් අපේක්ෂක අණුවක් මත, AI විසින් RDKit වෙතින් අගයන් සමඟ Lipinski ඇගයීමට ලක් කරන ලදී: MA 512 (>500, මායිම් රේඛාව), logP 4.8 (හිතකර), HBD 2, HBA 7. පරිශීලකයා නිවැරදිව අර්ථකථනය කළේ "එක් නිර්ණායකයක් ඉතිරිව ඇති නමුත් රීතිය නිරපේක්ෂ නොවේ" සහ අණුක අණු ඉවත් නොකළේය. පාඩම: රීති යනු මාර්ගෝපදේශ මිස එළිපත්ත නොවේ; සන්දර්භය සමඟ අර්ථ නිරූපණය කරන්න.

පොදු වැරදි

  • භාෂා ආකෘතියෙන් විශේෂාංග ගණන ලබා ගැනීම. ගණනය නොකළ අගයන් සකස් කර ඇත; අවිනිශ්චිතතාවයෙන් යුත් නියතිවාදී මෙවලමක් හෝ ආකෘතියක් භාවිතා කරන්න.
  • අදාළ ක්ෂේත්‍රය නොසලකා හැරීම. ආකෘතිය එක් එක් අණු සඳහා සංඛ්යා උත්පාදනය කරයි; පිටියෙන් පිටත විශ්වාස කළ නොහැක.
  • ඇස්තමේන්තුගත මිණුමක් සලකා බලමින්. logS යනු ඇස්තමේන්තුවකි; එය පර්යේෂණාත්මක විභේදනය සඳහා ආදේශකයක් නොවේ.
  • Lipinski නිරපේක්ෂ රීතිය සලකා බැලීම. මායිමේ සිටින අපේක්ෂකයා ස්වයංක්‍රීයව ඉවත් නොකෙරේ; බොහෝ ඖෂධ රීතිය උල්ලංඝනය කරයි.
  • "ගණනය කරන ලද" "ඇස්තමේන්තු" සමග ව්යාකූල කිරීම. TPSA ගණනය කරනු ලැබේ (විශ්වසනීය), ක්‍රියාකාරකම් ඇස්තමේන්තු කර ඇත (අවිනිශ්චිත).
අවවාදයයි: අපේක්ෂකයින් ශ්‍රේණිගත කිරීම සහ ප්‍රමුඛත්වය දීම සඳහා විශේෂාංග අනාවැකි විශිෂ්ටයි; නමුත් තනියම තීරණයක් තීරණය කිරීමට නොවේ. "ආදර්ශය ද්‍රාව්‍ය යයි කීවේය" යනු උපකල්පනයකි; "මම මැන බැලුවා, එය විසුරුවා හරිනවා" යනු ප්රතිඵලයකි.

සාරාංශයක් ලෙස

  • අත්හදා බැලීමට පෙර අණුක ගුණ පුරෝකථනය කළ හැකි අතර බොහෝ කාලයක් ඉතිරි වේ.
  • සමහර විශේෂාංග නිර්ණායක ලෙස ගණනය කෙරේ (MA, TPSA, HBD/HBA), සමහරක් සංඛ්‍යානමය ඇස්තමේන්තු (logS, ක්‍රියාකාරකම්) වේ.
  • අදාළත්වයේ වසම වඩාත්ම විවේචනාත්මක සංකල්පයයි: ආකෘතිය සෑම විටම පිළිතුරු දෙයි, නමුත් වසමෙන් පිටත විශ්වාස කළ නොහැකිය.
  • භාෂා ආකෘතියෙන් නොව RDKit හෝ අපැහැදිලි ආකෘතියෙන් විශේෂාංග ගණන් ලබා ගන්න.
  • අපේක්ෂකයින් ශ්‍රේණිගත කිරීමට අනාවැකි භාවිතා කරන්න; අත්හදා බැලීමෙන් අවසාන තීරණය ගන්න.

යෙදුම් කාර්යය

අණු පහක් තෝරන්න (උදා: ඖෂධ මාලාවක්). RDKit සමඟ එක් එක් සඳහා MA, logP, TPSA, HBD, HBA ගණනය කර Lipinski ඇගයීම. වෙන වෙනම, එක් එක් අණුවල ද්‍රාව්‍යතාව පිළිබඳ ගුණාත්මක ඇස්තමේන්තුවක් (සංඛ්‍යාවක් නොවේ) සහ අදාළ වන අනතුරු ඇඟවීමේ ක්ෂේත්‍රයක් සඳහා AI වෙතින් විමසන්න. Collect deterministic values ​​and AI predictions in a table. වඩාත්ම ඖෂධ වැනි පැතිකඩ ලබා දුන්නේ කුමන අණුව ද? අවිනිශ්චිතතාවය ඉහළම කොහෙද?

පිරික්සුම් ලැයිස්තුව

  • [ ] මම නිර්ණායක ගණනය කළ සහ පුරෝකථනය කළ ගුණාංග අතර වෙනස හඳුනා ගනිමි.
  • [ ] මම දේපල අගයන් ලබා ගන්නේ RDKit/model එකෙන් මිස භාෂා ආකෘතියෙන් නොවේ.
  • [ ] මම අදාළත්වයේ විෂය පථයෙන් පිටත අණු දකිමි.
  • [ ] මම Lipinski භාවිතා කරන්නේ මාර්ගෝපදේශයක් ලෙස මිස නිරපේක්ෂ රීතියක් ලෙස නොවේ.
  • [ ] මම ශ්‍රේණිගත කිරීම සඳහා අනාවැකි සහ අත්හදා බැලීම් සඳහා තීරණය භාවිතා කරමි.
  • [ ] මට තීරනාත්මක ලක්ෂණ මිනුම් මගින් සත්‍යාපනය කිරීමට සැලසුමක් ඇත.