единици
1. Въведение в изкуствения интелект в химията: роли, граници, валидиране и етика 2. Молекулярно представяне и химическа структура: Валидиране със SMILES, InChI и RDKit 3. Прогноза за реакцията и механизъм: Прогноза за продукт, състояние и нежелана реакция 4. Поддръжка на спектрална интерпретация: NMR, IR и мас спектрометрия 5. Преглед на литературата и планиране на синтез: източник, процедура и пътна карта 6. Анализ на химически данни и Python: pandas, стехиометрия и калибриране 7. Прогноза за молекулярни свойства и QSAR: разделителна способност, pKa и граници на модела 8. Лабораторна документация: Тетрадка за експерименти, ELN и възпроизводимост 9. Оценка на безопасността и опасността: GHS, SDS и границите на изкуствения интелект 10. Потвърждение, халюцинация и научна почтеност 11. Човекът в експеримента: етика, поверителност, отговорност и работен процес от край до край
единица 7 / 11

Прогноза за молекулярни свойства и QSAR: разделителна способност, pKa и граници на модела

Печалби:

  • Способност за разграничаване между детерминистично изчислени характеристики и статистически оценени характеристики и определяне на нивата на доверие
  • Възможност за оценка на региона, в който моделът е надежден, като се използва концепцията за домейн на приложимост
  • Способност да се разбере, че човек трябва да използва прогнози за черти, за да класира кандидатите и да вземе окончателното решение чрез експериментиране.

Преди да синтезираме молекула, ние често питаме: "Водоразтворима ли е? Колко кисела е? Преминава ли клетъчната мембрана? Приемлива ли е като кандидат за лекарство?" Прогнозирането на отговорите на тези въпроси преди експеримента спестява много време. AI и неговите специализирани модели (особено QSAR — количествена връзка структура-активност, т.е. статистически модел, който предвижда свойство от структурните дескриптори на молекулата) са мощни в тези прогнози. Но тези прогнози са прогнози за вероятност, а не измервания. В тази част ще научим за предвиждането на характеристиките, силните му страни и най-критичната концепция, зоната на приложимост (регионът, където моделът е надежден).

Какви характеристики се предвиждат?

  • logP: коефициент на разпределение масло/вода на молекулата; Показва липофилност (харесване на мазнини). Критичен при усвояването на лекарства.
  • Разтворимост (logS): Колко е разтворим във вода.
  • pKa: киселинност/алкалност; pH, при което дадена група се йонизира.
  • TPSA: Топологична полярна площ на повърхността; Използва се при оценка на пропускливостта.
  • „Правило на петте“ на Липински: Практически прагове за молекулно тегло, logP, брой донори/акцептори на Н-връзка на кандидати за орални лекарства.

Някои от тези стойности се изчисляват детерминистично (напр. TPSA, номера на Н-връзката) с инструменти като RDKit; Някои от тях са статистически оценки (logS, биологична активност). Познаването на това разграничение определя колко имате доверие.

Съвет: Разграничете дали дадена характеристика е „изчислена“ (базирана на правила, повторяема) или „предвидена“ (от модел, несигурна). Имайте висока увереност в изчисленията, предпазлива увереност в прогнозите и потвърждавайте прогнозите чрез експеримент.

Обхват на приложимост: най-важната концепция

Моделът QSAR работи добре върху молекули, които са подобни на молекулите, върху които е обучен. Ако дадете молекула, която е много различна от данните за обучение (например много голям, необичаен скелет), моделът пак ще произведе число, но това число ще бъде ненадеждно. Това се нарича „да бъдеш извън обхвата на приложимост“. Моделът винаги дава отговор; Ваша работа е да определите дали отговорът е надежден или не.

Още по-рисковано е, когато езиковият модел дава стойност на атрибут: той произвежда числото като „вероятна“ стойност, без основно изчисление. Така че, ако е възможно, вземете стойности на характеристиките от детерминистичен инструмент (RDKit) или QSAR модел, който дава несигурност, а не от езиковия модел.

Стъпка по стъпка: прогнозиране на безопасни функции

  1. Проверете молекулата: Анализирайте SMILES с RDKit (единица 2).
  2. Изчислете детерминистични такива: MA, logP (изчислен), TPSA, числа на H-връзките от RDKit.
  3. Маркирайте прогнозите отделно: Съхранявайте прогнозите на модела като logS, активност и т.н. с етикета „предсказание“.
  4. Проверете домейна на приложимост: Прилича ли молекулата на данните за обучение? Изключително голям/необичаен ли е?
  5. Използвайте за класиране, а не за решение: Използвайте прогнози за класиране на кандидатите; Крайният избор е експериментът.
  6. Близък експеримент: Проверете критичните свойства (разтворимост, pKa) чрез измерване.

Четири копируеми шаблона

1) Детерминистични характеристики с RDKit:

от rdkit import Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))print("logP (calculated):", round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donor:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond acceptor:", rdMolDescriptors.CalcNumHBA(mol))

2) Оценка на правилото на Липински:

Молекула (SMILES): [SMILES] Задача: Оценете съответствието с правилото на пет на Липински със стойности MA, logP, HBD, HBA, които трябва да бъдат изчислени от RDKit. Маркирайте всеки критерий поотделно като издържан/неуспешен. Правило: НЕ измисляйте числата; Ще го взема от RDKit, вие коментирайте.

3) Оценка на характеристиките + заявка за несигурност:

Молекула (SMILES): [SMILES] Задача: Дайте качествена оценка на разтворимостта във вода (logS) (висока/средна/ниска) и обяснете обосновката със структурни характеристики. Не давайте точна цифра; Посочете, че това е ПРОГНОЗА и трябва да бъде потвърдено чрез експеримент. Предупреждавайте, ако молекулата има необичайна структура (риск за приложимост).

4) Класиране на кандидатите (приоритетизиране по прогноза):

По-долу са УСМИВКИ на 5 молекули. Задача: Класирайте ги по отношение на разтворимост във вода (от най-малко разтворими до най-малко) въз основа на структурни характеристики (брой полярни групи, пръстени, липофилност). Напишете обосновка за всяко решение за класиране. Забележка: Това е ПРЕДВАРИТЕЛНО сортиране; Окончателният избор ще бъде направен чрез измерване.

Слаба подкана / Силна подкана

Слаб:

Каква е разтворимостта на тази молекула?

AI съставя число, което не съществува при изчислението (напр. "12 mg/mL"); Това дава увереност, но може да е грешно.

Силен:

Молекула (УСМИВКИ): [УСМИВКИ]. Задача: 1) Ще дам logP, TPSA, HBD/HBA, които да бъдат изчислени с RDKit: [стойности]. 2) Въз основа на тези стойности интерпретирайте дали разделителната способност е висока/средна/ниска. 3) Посочване на точното число; Заявете, че това е предположение и са необходими експерименти.

Разликата: взехме детерминистичните стойности от превозното средство и накарахме AI просто да ги интерпретира; Ние изрично поискахме несигурност и необходимост от експериментиране.

Типове функции и ниво на доверие

функция

Как да получите

доверие

бележка

molecular weight

RDKit (deterministic)

много високо

Cut from the formula

TPSA, HBD/HBA

RDKit (deterministic)

високо

rule based

logP (calculated)

RDKit модел

средно-висока

Може да се отклонява от експерименталното

logS (resolution)

QSAR estimate

среден

Зависи от областта на приложение

pKa

специален модел

среден

Попада в сложна структура

биологична активност

QSAR/ML

Променлива

Не забравяйте да тествате и проверите

мини калъфи

Случай 1 — Брой монтирани разделителни способности. Студент попита AI за разтворимостта на съединение; Той получи отговора „25 mg/mL“ и съобразно това създаде експерименталния дизайн. Действителната стойност при измерването беше ~2 mg/mL, 10-кратна разлика. AI беше измислил числото. Урок: не приемайте свойства като резолюция като числа от езиковия модел; качествена прогноза + измерване.

Случай 2 — Извън обхвата на приложимост. QSAR модел каза, че „активността е висока“ за голяма макромолекула, която е много различна от набора за обучение. Потребителят забеляза, че молекулата не прилича на данните от обучението и счете прогнозата за ненадеждна; Експериментът даде наистина ниска активност. Поука: моделът винаги отговаря; Ако е извън обхвата, отговорът е безполезен.

Случай 3 — Правилно използване на Lipinski. На една кандидат-молекула AI оцени Lipinski със стойности от RDKit: MA 512 (>500, граница), logP 4.8 (благоприятно), HBD 2, HBA 7. Потребителят правилно интерпретира „един критерий остава, но правилото не е абсолютно“ и не елиминира молекулата напълно. Урок: правилата са насоки, а не прагове; Interpret with context.

Често срещани грешки

  • Получаване на броя на функциите от езиковия модел. Стойностите, които не са изчислени, са измислени; Използвайте детерминистичен инструмент или модел с несигурност.
  • Игнориране на полето на приложение. Моделът генерира числа за всяка молекула; ненадежден извън терена.
  • Като се има предвид приблизително измерване. logS is an estimate; Не е заместител на експерименталната резолюция.
  • Считайки Липински за абсолютно правило. Кандидатът, който е на границата, не се елиминира автоматично; Много лекарства нарушават правилото.
  • Объркване на „изчислено“ с „приблизително“. TPSA се изчислява (надеждно), активността се оценява (несигурно).
Внимание: Прогнозите за функции са чудесни за класиране и приоритизиране на кандидати; но не и за вземане на решение самостоятелно. „Моделът каза, че е разтворим“ е хипотеза; „Измерих, разтваря се“ е резултат.

В обобщение

  • Молекулните свойства могат да бъдат предвидени преди експеримента и спестяват много време.
  • Някои характеристики се изчисляват детерминистично (MA, TPSA, HBD/HBA), някои са статистически оценки (logS, активност).
  • Домейнът на приложимостта е най-критичната концепция: моделът винаги отговаря, но е ненадежден извън домейна.
  • Вземете броя на функциите от RDKit или от модела на двусмислието, а не от езиковия модел.
  • Използвайте прогнози за класиране на кандидатите; Вземете окончателното решение, като експериментирате.

Задача за приложение

Изберете пет молекули (напр. серия лекарства). Изчислете MA, logP, TPSA, HBD, HBA за всеки с RDKit и оценете Lipinski. Отделно попитайте AI за качествена оценка (а не число) на разтворимостта на всяка молекула и предупреждение за област на приложимост. Съберете детерминистични стойности и AI прогнози в таблица. Коя молекула дава най-подобен на лекарство профил? Къде несигурността е най-висока?

контролен списък

  • [ ] Правя разлика между детерминистични изчислени и прогнозирани свойства.
  • [ ] Получавам стойностите на свойствата от RDKit/модела, а не от езиковия модел.
  • [ ] Забелязвам молекули извън обхвата на приложимост.
  • [ ] Използвам Lipinski като ръководство, а не като абсолютно правило.
  • [ ] Използвам прогнози за класиране и решение за експериментиране.
  • [ ] Имам план да проверя критичните характеристики чрез измерване.