Добивки:
- Способност да се направи разлика помеѓу детерминистички пресметаните карактеристики и статистички проценетите карактеристики и да се одредат нивоата на доверба
- Способност да се оцени регионот во кој моделот е доверлив со користење на концептот на домен на применливост
- Способност да се разбере дека треба да се користат предвидувања на особини за да се рангираат кандидатите и да се донесе конечната одлука преку експериментирање.
Пред да синтетизираме молекула, честопати прашуваме: "Дали е растворлив во вода? Колку е кисел? Дали ја преминува клеточната мембрана? Дали е веродостојно како кандидат за лек?" Предвидувањето на одговорите на овие прашања пред експериментот заштедува многу време. Вештачката интелигенција и нејзините специјализирани модели (особено QSAR - Квантитативна врска структура-активност, т.е. статистички модел што предвидува својство од структурните дескриптори на молекулата) се моќни во овие предвидувања. Но, овие предвидувања се предвидувања на веројатност, а не мерења. Во оваа единица, ќе научиме за предвидувањето на карактеристиките, неговите силни страни и најкритичниот концепт, зоната на применливост (регионот каде што моделот е сигурен).
Кои карактеристики се предвидуваат?
- logP: Коефициент на поделба на масло/вода на молекулата; Покажува липофилност (сакање маснотии). Критично во апсорпцијата на лекот.
- Растворливост (logS): Колку е растворлив во вода.
- pKa: Киселост/алкалност; рН на која група јонизира.
- TPSA: Тополошка поларна површина; Се користи за проценка на пропустливоста.
- Липински „правило на пет“: Практични прагови за молекуларна тежина, logP, број на донатори/прифаќачи на H-врска на кандидати за орални лекови.
Некои од овие вредности се пресметуваат детерминистички (на пр. TPSA, броеви на H-обврзници) со алатки како што е RDKit; Некои од нив се статистички проценки (logS, биолошка активност). Познавањето на оваа разлика одредува колку имате доверба.
Совет: разликувајте дали карактеристиката е „пресметана“ (заснована на правила, повторлива) или „предвидена“ (од модел, неизвесна). Имајте голема доверба во пресметките, внимателна доверба во предвидувањата и проверувајте ги предвидувањата со експеримент.
Опсег на применливост: најважниот концепт
Моделот QSAR добро функционира на молекули кои се слични на молекулите на кои бил обучен. Ако дадете молекула која е многу различна од податоците за обука (на пример, многу голем, необичен скелет), моделот сепак ќе произведе број, но тој број ќе биде несигурен. Ова се нарекува „да се биде надвор од опсегот на применливост“. Моделот секогаш дава одговор; Ваша задача е да кажете дали одговорот е сигурен или не.
Уште поризично е кога јазичниот модел дава вредност на атрибутот: го произведува бројот како вредност со „веројатен изглед“, без основна пресметка. Значи, ако е можно, добијте ги вредностите на карактеристиките од детерминистичка алатка (RDKit) или модел QSAR што дава несигурност, а не од јазичниот модел.
Чекор по чекор: безбедно предвидување карактеристики
- Потврдете ја молекулата: Анализирајте ги SMILES со RDKit (единица 2).
- Пресметајте ги детерминистичките: MA, logP (пресметано), TPSA, броевите на H-врска од RDKit.
- Обележете ги предвидувањата одделно: чувајте ги предвидувањата на моделите како што се logS, активност итн. со ознаката „предвидување“.
- Проверете го доменот за применливост: Дали молекулата личи на податоците за обука? Дали е екстремно голем/невообичаен?
- Користете за рангирање, а не за одлука: Користете предвидувања за рангирање на кандидатите; Крајниот избор е експериментот.
- Затвори со експеримент: Потврдете ги критичните својства (растворливост, pKa) со мерење.
Четири шаблони за копирање
1) Детерминистички карактеристики со RDKit:
од rdkit увоз Chemfrom rdkit.Chem увоз дескриптори, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", круг(Описници.MolWt(mol),2))пресметано("", (P round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donator:", rdMolDescriptors.CalcNumHBD(mol))print("H-обврзници акцептор:", rdMolDescriptors.Calc(mol)NumH
2) Евалуација на правилата на Липински:
Молекула (SMILES): [SMILES]Задача: Оценете ја усогласеноста со правилото на Липински од пет со вредностите MA, logP, HBD, HBA кои треба да се пресметаат од RDKit. Обележете го секој критериум посебно како помина/неуспешно. Правило: НЕ составувајте ги броевите; Ќе го земам од RDKit, вие коментирајте.
3) Проценка на карактеристики + барање за несигурност:
Молекула (SMILES): [SMILES]Задача: Дајте квалитативна проценка на растворливоста во вода (logS) (висока/средна/ниска) и објаснете го образложението со структурните карактеристики. Не давајте точен број; Наведете дека ова е ПРЕДВИДУВАЊЕ и треба да се потврди со експеримент. Предупредете ако молекулата има невообичаена структура (ризик за применливост).
4) Рангирање на кандидатите (приоритизација по предвидување):
Подолу се насмевки од 5 молекули. Задача: Рангирајте ги во однос на растворливоста во вода (најрастворливи до најмалку) врз основа на структурните карактеристики (број на поларни групи, прстени, липофилност). Напишете оправдување за секоја одлука за рангирање. Забелешка: Ова е ПРЕЛИМИНАРЕН сортирање; Конечниот избор ќе се направи со мерење.
Слаб промпт / Силен промпт
Слаб:
Која е растворливоста на оваа молекула?
АИ сочинува број што не постои во пресметката (на пр. „12 mg/mL“); Тоа дава самодоверба, но можеби е погрешно.
Силно:
Молекула (НАСМЕВКИ): [НАСМЕВКИ].Задача: 1) Ќе ги дадам logP, TPSA, HBD/HBA да се пресметаат со RDKit: [вредности].2) Врз основа на овие вредности протолкува дали резолуцијата е висока/средна/ниска.3) Давање на точниот број; Наведете дека тоа е претпоставка и потребни се експерименти.
Разликата: ги зедовме детерминистичките вредности од возилото и ја натеравме вештачката интелигенција само да ги толкува; Експлицитно побаравме неизвесност и потреба од експериментирање.
Видови карактеристики и ниво на доверба
карактеристика
Како да се добие
доверба
забелешка
молекуларна тежина
RDKit (детерминистички)
многу високо
Исечете од формулата
TPSA, HBD/HBA
RDKit (детерминистички)
високо
врз основа на правила
logP (пресметано)
RDKit модел
средно-висока
Може да отстапи од експерименталното
logS (резолуција)
Проценка на QSAR
средно
Зависи од областа на применливост
pKa
посебен модел
средно
Спаѓа во сложена структура
биолошка активност
QSAR/ML
Променлива
Задолжително тестирајте и потврдете
мини случаи
Случај 1 - Број на поставени резолуции. Еден студент го праша AI за растворливоста на соединението; Тој го доби одговорот „25 mg/mL“ и соодветно го постави експерименталниот дизајн. Вистинската вредност во мерењето беше ~2 mg/mL, што е 10-кратна разлика. Вештачката интелигенција го сочинуваше бројот. Лекција: не земајте својства како резолуција како броеви од јазичниот модел; квалитативно предвидување + мерење.
Случај 2 - Надвор од опсегот на применливост. Моделот QSAR рече дека „активноста е висока“ за голема макромолекула која многу се разликува од комплетот за обука. Корисникот забележал дека молекулата не наликува на податоците за обука и смета дека предвидувањето е неверодостојно; Експериментот даде навистина мала активност. Поука: моделот секогаш одговара; Ако е надвор од опсегот, одговорот е безвреден.
Случај 3 - Правилна употреба на Липински. На една кандидатска молекула, вештачката интелигенција го оцени Липински со вредности од RDKit: MA 512 (>500, гранична), logP 4.8 (поволна), HBD 2, HBA 7. Корисникот правилно протолкуваше „еден критериум останува, но правилото не е апсолутно“ и не ја елиминираше молекулата целосно. Лекција: правилата се насоки, а не прагови; Толкувајте со контекст.
Вообичаени грешки
- Добивање на бројот на карактеристики од јазичниот модел. Вредностите што не се пресметани се фабрикувани; Користете детерминистичка алатка или модел со несигурност.
- Игнорирање на полето на применливост. Моделот генерира броеви за секоја молекула; несигурни надвор од теренот.
- Со оглед на проценетото мерење. logS е проценка; Не е замена за експериментална резолуција.
- Сметајќи го Липински за апсолутно правило. Кандидатот кој е на граница не е автоматски елиминиран; Многу лекови го прекршуваат правилото.
- Збунувачки „пресметано“ со „проценето“. TPSA се пресметува (сигурен), активноста се проценува (неизвесна).
Внимание: предвидувањата на карактеристиките се одлични за рангирање и приоритизирање на кандидатите; но не и сама да определи одлука. „Моделот рече растворлив“ е хипотеза; „Мерев, се раствора“ е резултат.
Сумирано
- Молекуларните својства може да се предвидат пред експериментот и заштедува многу време.
- Некои карактеристики се пресметуваат детерминистички (MA, TPSA, HBD/HBA), некои се статистички проценки (logS, активност).
- Доменот на применливост е најкритичниот концепт: моделот секогаш одговара, но е несигурен надвор од доменот.
- Добијте ги броевите на функциите од RDKit или од моделот на двосмисленост, а не од јазичниот модел.
- Користете предвидувања за рангирање на кандидатите; Донесете ја конечната одлука со експериментирање.
Задача за апликација
Изберете пет молекули (на пр. серија лекови). Пресметајте MA, logP, TPSA, HBD, HBA за секој со RDKit и проценете го Липински. Посебно, побарајте од вештачката интелигенција квалитативна проценка (не бројка) на растворливоста на секоја молекула и предупредување за полето за применливост. Соберете детерминистички вредности и предвидувања за вештачка интелигенција во табела. Која молекула даде најмногу профил на дрога? Каде е најголемата неизвесност?
листа за проверка
- [ ] Разликувам помеѓу детерминистички пресметани и предвидени својства.
- [ ] Ги добивам вредностите на својствата од RDKit/моделот, а не од јазичниот модел.
- [ ] Забележувам молекули надвор од опсегот на применливост.
- [ ] Липински го користам како водич, а не апсолутно правило.
- [ ] Користам предвидувања за рангирање и одлука за експериментирање.
- [ ] Имам план да ги проверам критичните карактеристики со мерење.