одиниці
1. Вступ до штучного інтелекту в хімії: ролі, межі, перевірка та етика 2. Молекулярне представлення та хімічна структура: перевірка за допомогою SMILES, InChI та RDKit 3. Прогнозування реакції та механізм: прогнозування продукту, стану та побічної реакції 4. Підтримка інтерпретації спектру: ЯМР, ІЧ та мас-спектрометрія 5. Огляд літератури та планування узагальнення: Джерело, процедура та дорожня карта 6. Аналіз хімічних даних і Python: pandas, стехіометрія та калібрування 7. Прогнозування молекулярних властивостей і QSAR: роздільна здатність, pKa та межі моделі 8. Лабораторна документація: Блокнот для експериментів, ELN і відтворюваність 9. Оцінка безпеки та небезпеки: GHS, SDS та межі штучного інтелекту 10. Підтвердження, галюцинація та наукова чесність 11. Людина в експерименті: етика, конфіденційність, відповідальність і наскрізний робочий процес
одиниця 7 / 11

Прогнозування молекулярних властивостей і QSAR: роздільна здатність, pKa та межі моделі

Прибуток:

  • Здатність розрізняти детерміновано обчислені характеристики та статистично оцінені ознаки та визначати рівні достовірності
  • Можливість оцінити регіон, в якому модель надійна, використовуючи концепцію області застосовності
  • Здатність розуміти, що для ранжування кандидатів і прийняття остаточного рішення шляхом експериментування слід використовувати передбачення рис.

Перш ніж синтезувати молекулу, ми часто запитуємо: «Чи вона розчинна у воді? Наскільки вона кисла? Чи проходить вона через клітинну мембрану? Чи є вона правдоподібною як кандидат на ліки?» Прогнозування відповідей на ці питання до експерименту економить багато часу. Штучний інтелект та його спеціалізовані моделі (особливо QSAR — кількісний зв’язок між структурою та активністю, тобто статистична модель, яка передбачає властивість на основі структурних дескрипторів молекули) є потужними в цих прогнозах. Але ці прогнози є прогнозами ймовірності, а не вимірюваннями. У цьому розділі ми дізнаємося про передбачення ознак, його сильні сторони та найважливішу концепцію, зону застосовності (регіон, де модель надійна).

Які особливості прогнозуються?

  • logP: коефіцієнт розподілу нафта/вода молекули; Виявляє ліпофільність (любов до жиру). Критичний у всмоктуванні ліків.
  • Розчинність (logS): наскільки він розчинний у воді.
  • pKa: кислотність/лужність; РН, при якому група іонізується.
  • TPSA: площа топологічної полярної поверхні; Використовується для оцінки проникності.
  • «Правило п’яти» Ліпінського: практичні порогові значення молекулярної маси, logP, кількості донорів/акцепторів Н-зв’язків пероральних препаратів-кандидатів.

Деякі з цих значень обчислюються детермінованим способом (наприклад, TPSA, числа Н-зв’язків) за допомогою таких інструментів, як RDKit; Деякі з них є статистичними оцінками (logS, біологічна активність). Знання цієї різниці визначає, наскільки ви довіряєте.

Порада: розрізняйте, чи є функція «обчисленою» (на основі правил, повторюваною) чи «передбаченою» (з моделі, невизначена). Майте високу впевненість у розрахунках, обережну впевненість у прогнозах і перевіряйте прогнози експериментом.

Сфера застосування: найважливіше поняття

Модель QSAR добре працює на молекулах, подібних до молекул, на яких її було навчено. Якщо ви надасте молекулу, яка сильно відрізняється від даних навчання (наприклад, дуже великий, незвичайний скелет), модель все одно дасть число, але це число буде ненадійним. Це називається «перебування поза сферою застосування». Модель завжди дає відповідь; Ваше завдання — визначити, надійна відповідь чи ні.

Це ще ризикованіше, коли мовна модель надає значення атрибута: вона створює число як «імовірне» значення без базових обчислень. Тому, якщо можливо, отримайте значення ознак із детермінованого інструменту (RDKit) або моделі QSAR, яка дає невизначеність, а не з мовної моделі.

Крок за кроком: безпечне прогнозування функцій

  1. Перевірте молекулу: проаналізуйте SMILES за допомогою RDKit (блок 2).
  2. Обчисліть детерміновані: MA, logP (розрахований), TPSA, числа H-зв'язку з RDKit.
  3. Позначайте прогнози окремо: зберігайте прогнози моделі, такі як logS, діяльність тощо, з тегом «передбачення».
  4. Перевірте область застосовності: чи схожа молекула на навчальні дані? Він надзвичайно великий/незвичайний?
  5. Використовуйте для ранжування, а не для прийняття рішень: використовуйте прогнози для ранжування кандидатів; Остаточний вибір – експеримент.
  6. Під час експерименту: перевірте критичні властивості (розчинність, pKa) шляхом вимірювання.

Чотири шаблони, які можна копіювати

1) Детерміновані функції з RDKit:

from rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculated):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("Донор H-зв'язку:", rdMolDescriptors.CalcNumHBD(mol))print("Акцептор H-зв'язку:", rdMolDescriptors.CalcNumHBA(mol))

2) Оцінка правила Ліпінського:

Молекула (ПОСМІХАЄТЬСЯ): [ПОСМІХАЄТЬСЯ] Завдання: Оцініть відповідність правилу п’яти Ліпінського за допомогою значень MA, logP, HBD, HBA, які потрібно обчислити з RDKit. Позначте кожен критерій окремо як склав/не склав. Правило: НЕ складайте цифри; Я отримаю це з RDKit, ви коментуйте.

3) Оцінка функції + запит на невизначеність:

Молекула (ПОСМІХАЄТЬСЯ): [ПОСМІХАЄТЬСЯ] Завдання: Дайте якісну оцінку розчинності у воді (logS) (висока/середня/низька) і поясніть обґрунтування структурними особливостями. Не називайте точного числа; Зазначте, що це ПЕРЕДБАЧЕННЯ та потребує підтвердження експериментом. Попередити, якщо молекула має незвичайну структуру (ризик застосовності).

4) Рейтинг кандидатів (пріоритезація за прогнозом):

Нижче наведено SMILES 5 молекул. Завдання: ранжуйте їх за розчинністю у воді (від найбільшої до найменшої) на основі структурних особливостей (кількість полярних груп, кілець, ліпофільність). Напишіть обґрунтування для кожного рішення щодо ранжування. Примітка: Це ПОПЕРЕДНЄ сортування; Остаточний вибір буде зроблено шляхом вимірювання.

Слабка підказка / Сильна підказка

Слабкий:

Яка розчинність цієї молекули?

ШІ створює число, яке не існує під час розрахунку (наприклад, «12 мг/мл»); Це дає впевненість, але може бути помилковим.

Сильний:

Молекула (ПОСМІХАЄТЬСЯ): [ПОСМІХАЄТЬСЯ]. Завдання: 1) Я дам logP, TPSA, HBD/HBA для розрахунку за допомогою RDKit: [значення]. 2) На основі цих значень інтерпретуйте, чи є роздільна здатність високою/середньою/низькою. 3) Зазначення точного числа; Зазначте, що це припущення та необхідні експерименти.

Різниця: ми взяли детерміновані значення з транспортного засобу та змусили штучний інтелект просто інтерпретувати їх; Ми чітко просили невизначеність і необхідність експериментів.

Типи функцій і рівень довіри

функція

Як отримати

довіра

примітка

молекулярна маса

RDKit (детермінований)

дуже високий

Вирізати з формули

TPSA, HBD/HBA

RDKit (детермінований)

висока

на основі правил

logP (розрахований)

Модель RDKit

середньо-високий

Може відрізнятися від експериментального

logS (роздільна здатність)

Оцінка QSAR

середній

Залежить від області застосування

pKa

спеціальна модель

середній

Він складається зі складної структури

біологічна активність

QSAR/ML

змінна

Обов'язково протестуйте та перевірте

міні-чохли

Випадок 1 — кількість встановлених роздільних здатностей. Студент запитав ШІ про розчинність сполуки; Він отримав відповідь «25 мг/мл» і відповідно розробив план експерименту. Фактичне значення вимірювання становило ~2 мг/мл, 10-кратна різниця. ШІ склав число. Урок: не сприймайте такі властивості, як роздільна здатність, як числа з моделі мови; якісний прогноз + вимірювання.

Випадок 2 — поза сферою застосування. Модель QSAR сказала, що «активність висока» для великої макромолекули, яка сильно відрізнялася від навчального набору. Користувач помітив, що молекула не схожа на дані навчання, і визнав прогноз недостовірним; Експеримент дав дійсно низьку активність. Урок: модель завжди відповідає; Якщо він виходить за рамки, відповідь не має значення.

Випадок 3 — Правильне використання Lipinski. Для однієї молекули-кандидата штучний інтелект оцінив Ліпінський зі значеннями з RDKit: MA 512 (>500, межа), logP 4,8 (сприятливий), HBD 2, HBA 7. Користувач правильно інтерпретував «один критерій залишається, але правило не є абсолютним» і не виключив молекулу взагалі. Урок: правила є орієнтирами, а не порогами; Інтерпретуйте з контекстом.

Поширені помилки

  • Отримання кількості функцій з мовної моделі. Значення, які не розраховуються, вигадуються; Використовуйте детермінований інструмент або модель із невизначеністю.
  • Ігнорування сфери застосування. Модель генерує числа для кожної молекули; ненадійний за межами поля.
  • Враховуючи приблизне вимірювання. logS – оцінка; Це не є заміною експериментальної роздільної здатності.
  • Вважаючи Ліпінського абсолютним правилом. Кандидат, який перебуває на кордоні, не вибуває автоматично; Багато препаратів порушують правило.
  • Плутання «розрахованого» з «приблизним». TPSA розраховується (надійно), активність оцінюється (невизначено).
Застереження: передбачення функцій чудово підходять для ранжування та пріоритетності кандидатів; але не для прийняття рішення самостійно. «Модель, яка розв’язується», є гіпотезою; «Поміряв, розчиняється» — результат.

Підсумовуючи

  • Молекулярні властивості можна передбачити до експерименту, що економить багато часу.
  • Деякі характеристики розраховуються детерміновано (MA, TPSA, HBD/HBA), деякі є статистичними оцінками (logS, активність).
  • Область застосовності є найбільш критичною концепцією: модель завжди відповідає, але є ненадійною за межами області.
  • Отримайте кількість функцій із RDKit або моделі неоднозначності, а не мовної моделі.
  • Використовуйте прогнози для ранжирування кандидатів; Прийміть остаточне рішення, експериментуючи.

Аплікаційне завдання

Виберіть п’ять молекул (наприклад, ряд ліків). Обчисліть MA, logP, TPSA, HBD, HBA для кожного за допомогою RDKit і оцініть Lipinski. Окремо попросіть ШІ отримати якісну оцінку (а не число) розчинності кожної молекули та попередження щодо області застосування. Зберіть детерміновані значення та прогнози ШІ в таблицю. Яка молекула давала найбільш схожий на наркотик профіль? Де найбільша невизначеність?

контрольний список

  • [ ] Я розрізняю детерміновані обчислені та прогнозовані властивості.
  • [ ] Я отримую значення властивостей із RDKit/model, а не з мовної моделі.
  • [ ] Я помічаю молекули поза сферою застосування.
  • [ ] Я використовую Ліпінського як орієнтир, а не як абсолютне правило.
  • [ ] Я використовую прогнози для рейтингу та рішення для експериментів.
  • [ ] У мене є план перевірки критичних функцій шляхом вимірювання.