Единицы
1. Введение в искусственный интеллект в химии: роли, границы, валидация и этика 2. Молекулярное представление и химическая структура: проверка с помощью SMILES, InChI и RDKit 3. Прогнозирование и механизм реакции: прогноз продукта, состояния и побочных реакций 4. Поддержка интерпретации спектра: ЯМР, ИК и масс-спектрометрия 5. Обзор литературы и планирование обобщения: источник, процедура и дорожная карта 6. Химический анализ данных и Python: панды, стехиометрия и калибровка 7. Прогнозирование молекулярных свойств и QSAR: разрешение, pKa и пределы модели 8. Лабораторная документация: журнал экспериментов, ELN и воспроизводимость. 9. Оценка безопасности и опасностей: GHS, SDS и пределы искусственного интеллекта 10. Подтверждение, галлюцинация и научная честность 11. Человек в эксперименте: этика, конфиденциальность, ответственность и сквозной рабочий процесс
Единица 1 / 11

Введение в искусственный интеллект в химии: роли, границы, валидация и этика

Прибыль:

  • Возможность различать, где искусственный интеллект экономит время в рабочем процессе по химии (идея, проектирование, анализ, отчетность), а где решения о структуре, количестве, ресурсах и безопасности оставляются на усмотрение людей, в зависимости от уровня риска.
  • Способность применять дисциплину, которая независимо проверяет каждый результат с помощью четырех этапов: Структура-Номер-Ресурс-Безопасность.
  • Поймите, почему вымышленные соединения и числа, ложные ссылки и заблуждения о безопасности представляют собой риски для этой профессии, которые необходимо учитывать с самого начала.

Химия – экспериментальная наука, изучающая строение, превращения и свойства вещества. Химик взвешивает, растворяет, нагревает и измеряет в лаборатории; За своим столом он рисует молекулы, планирует реакции, интерпретирует спектры, просматривает литературу и пишет отчеты. Искусственный интеллект (сокращенно ИИ, в данном случае это программное обеспечение, которое генерирует текст, предсказывая «следующее наиболее вероятное слово», обученное на большой языковой модели, то есть на огромных текстовых данных) может значительно ускорить многие из этих офисных задач. Но он не строит лабораторию сам, не читает весы и, самое главное: не проверяет никакие цифры, формулы или цитаты, которые выдает от вашего имени. Этот модуль учит, как использовать искусственный интеллект в химии комплексно, но ответственно.

В этом первом разделе я хочу внушить вам одну идею: ИИ — помощник в химии, а не химик. Пишет код, создает схемы, создает структуру ретросинтеза, помогает интерпретировать пики спектра, обобщает литературу. Однако именно компетентный химик решает, можно ли на самом деле синтезировать молекулу, безопасна ли реакция или нет, является ли ссылка подлинной или нет, и несет окончательную ответственность.

Как ИИ вписывается в рабочий процесс химии?

Давайте грубо разделим химический проект на пять этапов: (1) идея и литература, (2) разработка молекул и реакций, (3) лабораторное применение, (4) анализ и характеристика, (5) отчетность. На этих этапах ИИ несет в себе совсем другие ценности.

  • Идеи и литература: ИИ быстро обобщает тему, объясняет ключевые понятия, генерирует условия поиска. Но он может придумать атрибуцию; Мы увидим это через мгновение.
  • Дизайн: генерирует УЛЫБКИ (форма записи молекулы в виде текстовой строки; подробнее об этом позже), предлагает этапы ретросинтеза, перечисляет реактивные альтернативы. Предложение — это хорошо, но не гарантия.
  • Лаборатория: ИИ здесь ничего не делает. Взвешивание, нагрев и меры безопасности осуществляются людьми. ИИ только помогает написать процедуру; Перед выполнением этой процедуры человек должен проконтролировать ее безопасность.
  • Анализ: при интерпретации ЯМР, ИК, масс-спектра (это методы измерения, показывающие структуру молекулы) YZ помогает сгруппировать пики и составить список возможных структур. Последнее задание за вами.
  • Отчетность: Создает экспериментальный блокнот, черновик статьи, черновой вариант бланка безопасности. Это очень мощно; но цифры должны совпадать с вашими.
Совет: самое безопасное место для использования ИИ — это области «если что-то пойдет не так, это будет немедленно замечено и исправлено»: черновой текст, скелет кода, описание термина. Самыми рискованными местами являются области «если ложь распространяется бесшумно»: константы, ссылки, утверждения безопасности, числовые результаты.

Почему мы должны быть осторожны? Три структурных риска

Большая языковая модель — это не калькулятор и не химическая машина. Создает текст, который статистически «выглядит вероятным». Это приводит к трем конкретным рискам в химии:

  1. Выдуманный (галлюцинация): может уверенно записать соединение, которое не является моделью, реакцию, которой не существует, или неверную молекулярную массу. Например, там написано: «Молекулярная масса соединения X составляет 154,2 г/моль», тогда как правильное значение — 168,2.
  2. Ложная цитата: может указываться источник, который выглядит реалистично, но вообще не существует, например «Смит и др., 2019, Журнал органической химии». Он даже может придумать номер DOI.
  3. Ошибка безопасности: опасная комбинация реагентов (например, окислителя и органического растворителя в ненадлежащем соотношении) может представляться как «нет проблем».

Эти три риска будут появляться снова и снова в каждом разделе этого модуля. Решение состоит не в том, чтобы уйти от ИИ, а в том, чтобы установить дисциплину проверки каждого результата с помощью независимого источника.

мини-чехлы

Случай 1 — Установленная молекулярная масса. Аспирант спросил у А.И. молекулярную массу пара-нитрофенола. «139,11 г/моль», — сказал ИИ. Студент был уверен в себе и планировал весить 6,96 г на 0,05 моль. Однако молекулярная масса пара-нитрофенола составляет 139,11 г/моль, и на этот раз это было правильно — но студент ни разу не проверял. По следующему соединению (парааминофенол, фактическое значение 109,13 г/моль) YZ сказал «123,15»; На этот раз студент поймал его, рассчитав вручную по формуле (C6H7NO2): 6×12,011 + 7×1,008 + 14,007 + 2×15,999 = 109,13. Урок: рассчитайте каждую молекулярную массу без формулы.

Случай 2 — Поддельный DOI. Исследователь попросил у AI 5 источников в своем обзоре литературы. При нажатии DOI двух из пяти возвращался как «не найден»; Заголовки были основаны на фактах, а статьи — нет. Пустая трата времени 40 минут. Урок: не каждую цитату следует использовать без проверки в базах данных (DOI, PubMed, Reaxys).

Случай 3 — Опасность, которая кажется безопасной. Пользователь спросил ИИ о процедуре очистки; ИИ косвенно выдвинул предложение смешать раствор, содержащий гипохлорит, с кислым раствором — комбинация, которая может выделять газообразный хлор. К счастью, пользователь посмотрел паспорт безопасности (SDS) и остановился. Урок: перед внедрением каждая процедура проверяется человеком на предмет SDS и опасностей.

Слабая подсказка / Сильная подсказка

Слабая подсказка:

Синтезируйте эту молекулу.

Это утверждение расплывчато: какая молекула, какие исходные материалы, какой масштаб, какие ограничения? ИИ восполняет пробелы.

Мощная подсказка:

Роль: Вы опытный помощник в области органического синтеза. Целевая молекула: 4-метоксиацетофенон (УЛЫБКА: COc1ccc(cc1)C(C)=O). В качестве исходного материала у нас есть анизол. Задание: Дайте предложение по двухэтапному ретросинтезу. Для каждого этапа: реагенты, условия (температура, растворитель) и ВОЗМОЖНЫЕ побочные реакции. Ограничение: отметьте «ПОДВЕРИТЬ», если вы не уверены в подгонке. Результат: пронумерованные шаги + список точек, подлежащих проверке.

Разница: роль, точная цель (с УЛЫБКАМИ), контекст, количество шагов, формат вывода и ограничение «подгонки». Это пять компонентов хорошей подсказки по химии: роль, точное представление структуры, контекст, задача, ограничение проверки.

Типы инструментов ИИ: языковая модель или химический инструмент?

В химии встречаются два разных «ИИ», и важно их не путать:

Жанр

Что значит

надежность

Пример использования

Общая языковая модель

Генерирует текст/код, объясняет, пишет черновики

Мало цифр, много языка

Краткое описание процедуры, объяснение терминологии

Библиотека химии (RDKit и т. д.)

Детерминированно обрабатывает молекулу, рассчитывает молекулярную массу

Высокий (на основе правил)

SMILES верификация, аккаунт MA

Пользовательская модель прогнозирования (ретросинтез, функция)

Дает прогноз, обученный на данных

Средний, в зависимости от региона

Ретросинтез, оценка растворимости

Литература/инструмент поиска

Реальные запросы к базе данных

Высокий в зависимости от источника

Подтверждение авторства, поиск реакции

Самый надежный рабочий процесс объединяет их: языковая модель генерирует идею, химическая библиотека детерминированно вычисляет число, литературный инструмент проверяет атрибуцию, человек подтверждает. Эту цепочку мы установим в следующих подразделениях.

Дисциплина проверки: ЧЕТЫРЕ шага

Проведите каждый результат ИИ через следующие четыре шага, прежде чем вносить его в лабораторию или в отчет:

  1. Структура: Действительно ли обозначение молекулы/реакции (SMILES/InChI)? Можно ли его проанализировать с помощью инструмента (RDKit)?
  2. Число: Была ли молекулярная масса, стехиометрия, расчет выхода проверены независимо (вручную или в библиотеке)?
  3. Источник: Были ли все утверждения и приписывания проверены в реальной базе данных?
  4. Безопасность: Прочитаны ли паспорта безопасности каждого реагента в процедуре, существуют ли опасные комбинации?
Примечание. Эти четыре шага применимы «всегда», а не «иногда». 20 ситуаций, в которых ИИ прав, не оправдывают 1 ситуацию, в которой он неправ; потому что в химии такой ситуацией может быть взрыв, отравление или отзыв статьи.

Распространенные ошибки

  • Принятие вывода ИИ за «ресурс». ИИ — это не ресурс, а генератор, который пытается запомнить ресурсы (иногда неправильно). Это исходная база данных.
  • Доверие к номеру. Использование таких чисел, как молекулярная масса, рКа, температура кипения, без их проверки. Их можно вычислять/искать детерминированно; Запрос языковой модели — самый слабый способ.
  • Аутсорсинг безопасности ИИ. «ИИ не говорил, что это опасно» не означает, что это безопасно. Оценка опасности – это работа человека и SDS.
  • Неясная подсказка. Не давая молекуле название, а ее структуру (SMILES/InChI); Это приводит к появлению неправильных молекул из-за путаницы в названиях.
  • Полагаясь только на одну попытку. Задавать тот же вопрос еще раз, но по-другому и не проверять последовательность.

В заключение

  • ИИ — мощный настольный помощник в химии: он создает коды, схемы, описания, сканирует скелеты; но лаборатория этого не делает и не проверяет свои результаты.
  • Существует три неотъемлемых риска: поддельное соединение/число, поддельная атрибуция, ошибка безопасности.
  • Разделяйте и объединяйте общеязыковую модель и инструменты детерминированной химии (RDKit, базы данных).
  • Пройдите каждый выход через четыре этапа Структура-Число-Источник-Безопасность.
  • Хорошая подсказка: включает роль, явное представление структуры, контекст, задачу, ограничение проверки.

Задача приложения

Выберите молекулу, которую вы изучили самостоятельно (например, аспирин, SMILES: CC(=O)Oc1ccccc1C(=O)O). Задайте ИИ три вопроса: (1) молекулярная масса, (2) две справочные статьи, (3) этап синтеза. Затем проверяйте каждый по отдельности: вручную рассчитайте молекулярную массу по формуле, подтвердите цитаты DOI, проверьте этап синтеза проверочным глазом. Какой вывод оказался правильным, а какой потребовал коррекции? Ведите «журнал проверок» на полстраницы.

контрольный список

  • [ ] Я понял, что ИИ — помощник, а не химик.
  • [ ] Я признаю риски фальсификации, ложной атрибуции и недоверия к примерам.
  • [ ] Я могу отличить языковую модель от инструментов детерминированной химии.
  • [ ] Я применю четыре шага «Структура–Номер–Источник–Безопасность» к каждому выходу.
  • [ ] Я описываю молекулы с помощью структурных обозначений (SMILES/InChI), а не по названию.
  • [ ] Я сохранил как минимум один журнал проверок.