Единицы
1. Введение в искусственный интеллект в химии: роли, границы, валидация и этика 2. Молекулярное представление и химическая структура: проверка с помощью SMILES, InChI и RDKit 3. Прогнозирование и механизм реакции: прогноз продукта, состояния и побочных реакций 4. Поддержка интерпретации спектра: ЯМР, ИК и масс-спектрометрия 5. Обзор литературы и планирование обобщения: источник, процедура и дорожная карта 6. Химический анализ данных и Python: панды, стехиометрия и калибровка 7. Прогнозирование молекулярных свойств и QSAR: разрешение, pKa и пределы модели 8. Лабораторная документация: журнал экспериментов, ELN и воспроизводимость. 9. Оценка безопасности и опасностей: GHS, SDS и пределы искусственного интеллекта 10. Подтверждение, галлюцинация и научная честность 11. Человек в эксперименте: этика, конфиденциальность, ответственность и сквозной рабочий процесс
Единица 7 / 11

Прогнозирование молекулярных свойств и QSAR: разрешение, pKa и пределы модели

Прибыль:

  • Способность различать детерминистически рассчитанные функции и статистически оцененные функции и определять уровни достоверности.
  • Способность оценить область, в которой модель надежна, используя концепцию области применимости.
  • Способность понимать, что для ранжирования кандидатов и принятия окончательного решения путем экспериментов следует использовать прогнозы по характеристикам.

Прежде чем синтезировать молекулу, мы часто спрашиваем: «Растворима ли она в воде? Насколько она кислая? Проникает ли она через клеточную мембрану? Можно ли считать ее кандидатом на лекарственное средство?» Предсказание ответов на эти вопросы до начала эксперимента экономит много времени. ИИ и его специализированные модели (особенно QSAR — количественная связь структура-активность, то есть статистическая модель, которая предсказывает свойство на основе структурных дескрипторов молекулы) являются мощными в этих прогнозах. Но эти предсказания являются предсказаниями вероятности, а не измерениями. В этом разделе мы узнаем о прогнозировании функций, их сильных сторонах и наиболее важной концепции — зоне применимости (области, в которой модель надежна).

Какие особенности прогнозируются?

  • logP: коэффициент распределения масла/воды в молекуле; Проявляет липофильность (пристрастие к жиру). Имеет решающее значение для абсорбции лекарств.
  • Растворимость (logS): насколько он растворим в воде.
  • pKa: кислотность/щелочность; pH, при котором группа ионизируется.
  • TPSA: Топологическая площадь полярной поверхности; Он используется при оценке проницаемости.
  • «Правило пяти» Липинского: Практические пороги для молекулярной массы, logP, количества доноров/акцепторов Н-связей кандидатов на пероральные препараты.

Некоторые из этих значений рассчитываются детерминированно (например, TPSA, числа H-связей) с помощью таких инструментов, как RDKit; Некоторые из них являются статистическими оценками (logS, биологическая активность). Знание этого различия определяет, насколько вы доверяете.

Совет: определите, является ли функция «расчетной» (основанной на правилах, повторяемой) или «прогнозируемой» (на основе модели, неопределенной). Иметь высокую уверенность в расчетах, осторожную уверенность в прогнозах и проверять прогнозы экспериментальным путем.

Область применения: важнейшее понятие

Модель QSAR хорошо работает на молекулах, похожих на молекулы, на которых она обучалась. Если вы дадите молекулу, которая сильно отличается от обучающих данных (например, очень большой необычный скелет), модель все равно выдаст число, но это число будет ненадежным. Это называется «нахождение за пределами применимости». Модель всегда дает ответ; Ваша задача — определить, достоверен ответ или нет.

Еще более рискованно, когда языковая модель дает значение атрибута: она выдает число как «вероятное» значение без каких-либо вычислений. Поэтому, если возможно, получайте значения признаков из детерминированного инструмента (RDKit) или модели QSAR, дающей неопределенность, а не из языковой модели.

Шаг за шагом: безопасное прогнозирование функций

  1. Проверка молекулы: анализ SMILES с помощью RDKit (блок 2).
  2. Рассчитать детерминированные: MA, logP (расчетный), TPSA, числа H-связей из RDKit.
  3. Отмечайте прогнозы отдельно. Сохраняйте прогнозы модели, такие как logS, активность и т. д., с помощью тега «прогноз».
  4. Проверьте область применимости: похожа ли молекула на данные обучения? Он очень большой/необычный?
  5. Используйте для ранжирования, а не для принятия решений: используйте прогнозы для ранжирования кандидатов; Окончательный выбор – эксперимент.
  6. Завершение экспериментом: проверьте критические свойства (растворимость, pKa) путем измерения.

Четыре копируемых шаблона

1) Детерминированные функции с RDKit:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculated):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Донор H-связи:", rdMolDescriptors.CalcNumHBD(mol))print("Ацептор H-связи:", rdMolDescriptors.CalcNumHBA(mol))

2) Оценка правила Липинского:

Молекула (SMILES): [SMILES]Задание: оценить соответствие правилу пяти Липинского с помощью значений MA, logP, HBD, HBA, которые будут рассчитаны из RDKit. Отметьте каждый критерий отдельно как «пройден/не пройден». Правило: НЕ придумывайте числа; Я получу это из RDKit, — комментируете вы.

3) Оценка функции + запрос неопределенности:

Молекула (SMILES): [SMILES]Задание: Дать качественную оценку растворимости в воде (logS) (высокая/средняя/низкая) и объяснить это с помощью структурных особенностей. Не указывайте точное число; Укажите, что это ПРЕДСКАЗАНИЕ и его необходимо подтвердить экспериментом. Предупредить, если молекула имеет необычную структуру (риск применимости).

4) Рейтинг кандидатов (приоритизация по прогнозу):

Ниже представлены УЛЫБКИ 5 молекул. Задание: Проранжируйте их по растворимости в воде (от наиболее растворимых до наименее растворимых) на основании структурных особенностей (количества полярных групп, колец, липофильности). Напишите обоснование каждого решения о ранжировании. Примечание. Это ПРЕДВАРИТЕЛЬНАЯ сортировка; Окончательный выбор будет сделан путем замеров.

Слабая подсказка / Сильная подсказка

Слабый:

Какова растворимость этой молекулы?

ИИ составляет число, которого не существует при расчете (например, «12 мг/мл»); Это вселяет уверенность, но может быть ошибочным.

Сильный:

Молекула (SMILES): [SMILES]. Задача: 1) Я дам logP, TPSA, HBD/HBA для расчета с помощью RDKit: [значения]. 2) На основе этих значений определите, является ли разрешение высоким/средним/низким. 3) Укажите точное число; Укажите, что это предположение и необходимы эксперименты.

Разница: мы взяли детерминированные значения с автомобиля и заставили ИИ просто интерпретировать их; Мы открыто просили о неопределенности и необходимости экспериментировать.

Типы функций и уровень доверия

особенность

Как получить

доверие

Примечание

молекулярная масса

RDKit (детерминированный)

очень высокий

Вырезать из формулы

TPSA, HBD/HBA

RDKit (детерминированный)

высокий

основанный на правилах

logP (расчетный)

Модель РДКит

средне-высокий

Может отличаться от экспериментального

logS (разрешение)

Оценка QSAR

средний

Зависит от области применения

пКа

специальная модель

средний

Он представляет собой сложную структуру

биологическая активность

КСАР/МЛ

Переменная

Обязательно протестируйте и убедитесь

мини-чехлы

Случай 1. Количество установленных резолюций. Студент спросил ИИ о растворимости соединения; Он получил ответ «25 мг/мл» и соответствующим образом разработал схему эксперимента. Фактическое значение измерения составило ~2 мг/мл, разница в 10 раз. ИИ составил число. Урок: не принимайте такие свойства, как разрешение, как числа из языковой модели; качественный прогноз + измерение.

Случай 2. Выходит за рамки применимости. Модель QSAR показала, что «активность высока» для большой макромолекулы, которая сильно отличалась от обучающего набора. Пользователь заметил, что молекула не похожа на обучающие данные, и посчитал прогноз недостоверным; Эксперимент дал действительно низкую активность. Урок: модель всегда реагирует; Если это выходит за рамки, ответ бесполезен.

Случай 3 — Правильное использование Липинского. На одной молекуле-кандидате ИИ оценил Липински со значениями из RDKit: MA 512 (>500, пограничный уровень), logP 4,8 (благоприятный), HBD 2, HBA 7. Пользователь правильно интерпретировал «один критерий остается, но правило не является абсолютным» и не исключил молекулу полностью. Урок: правила — это рекомендации, а не пороговые значения; Интерпретируйте с учетом контекста.

Распространенные ошибки

  • Получение количества функций из языковой модели. Значения, которые не рассчитаны, являются сфабрикованными; Используйте детерминированный инструмент или модель с неопределенностью.
  • Игнорирование области применения. Модель генерирует числа для каждой молекулы; ненадежен за пределами поля.
  • Учитывая предполагаемый размер. logS — оценка; Это не замена экспериментального разрешения.
  • Считать Липински абсолютным правилом. Кандидат, находящийся на границе, не отсеивается автоматически; Многие лекарства нарушают это правило.
  • Путаница между «расчетным» и «оценочным». TPSA рассчитывается (достоверно), активность оценивается (неопределенно).
Внимание: прогнозы по функциям отлично подходят для ранжирования и определения приоритетов кандидатов; но не для принятия решения в одиночку. «Модель сказала, что растворима» — это гипотеза; «Я измерил, оно растворяется» — это результат.

В заключение

  • Молекулярные свойства можно предсказать еще до эксперимента, что экономит много времени.
  • Некоторые характеристики рассчитываются детерминированно (MA, TPSA, HBD/HBA), некоторые являются статистическими оценками (logS, активность).
  • Область применимости является наиболее важной концепцией: модель всегда дает ответ, но вне этой области она ненадежна.
  • Получите количество функций из RDKit или модели неоднозначности, а не языковой модели.
  • Используйте прогнозы для ранжирования кандидатов; Примите окончательное решение, экспериментируя.

Задача приложения

Выберите пять молекул (например, серию лекарств). Рассчитайте MA, logP, TPSA, HBD, HBA для каждого с помощью RDKit и оцените Липински. Отдельно запросите у ИИ качественную оценку (не число) растворимости каждой молекулы и предупреждение о области применимости. Соберите детерминированные значения и прогнозы ИИ в таблицу. Какая молекула имела наиболее сходный с лекарством профиль? Где неопределенность выше всего?

контрольный список

  • [ ] Я различаю детерминированные расчетные и прогнозируемые свойства.
  • [ ] Я получаю значения свойств из RDKit/модели, а не из языковой модели.
  • [ ] Я замечаю молекулы за пределами применимости.
  • [ ] Я использую Липински как руководство, а не как абсолютное правило.
  • [ ] Я использую прогнозы для ранжирования и принятия решений для экспериментов.
  • [ ] У меня есть план по проверке критических характеристик путем измерений.