единици
1. Въведение в изкуствения интелект в химията: роли, граници, валидиране и етика 2. Молекулярно представяне и химическа структура: Валидиране със SMILES, InChI и RDKit 3. Прогноза за реакцията и механизъм: Прогноза за продукт, състояние и нежелана реакция 4. Поддръжка на спектрална интерпретация: NMR, IR и мас спектрометрия 5. Преглед на литературата и планиране на синтез: източник, процедура и пътна карта 6. Анализ на химически данни и Python: pandas, стехиометрия и калибриране 7. Прогноза за молекулярни свойства и QSAR: разделителна способност, pKa и граници на модела 8. Лабораторна документация: Тетрадка за експерименти, ELN и възпроизводимост 9. Оценка на безопасността и опасността: GHS, SDS и границите на изкуствения интелект 10. Потвърждение, халюцинация и научна почтеност 11. Човекът в експеримента: етика, поверителност, отговорност и работен процес от край до край
единица 1 / 11

Въведение в изкуствения интелект в химията: роли, граници, валидиране и етика

Печалби:

  • Да можеш да разграничиш къде изкуственият интелект спестява време в работния процес по химия (идея, дизайн, анализ, докладване) и къде решенията за структура, брой, ресурси и безопасност са оставени на хората, в зависимост от нивото на риск.
  • Възможност за прилагане на дисциплина, която независимо проверява всеки изход с четирите стъпки на структура-номер-ресурс-сигурност
  • Разберете защо измислените съединения и числа, фалшивите препратки и погрешните схващания за сигурността са рискове за тази професия, които трябва да се вземат предвид от самото начало.

Химията е експериментална наука, която изучава структурата, трансформацията и свойствата на материята. Химик претегля, разтваря, нагрява и измерва в лабораторията; На бюрото си той рисува молекули, планира реакции, интерпретира спектри, сканира литературата и пише доклади. Изкуственият интелект (накратко AI, тук конкретно софтуер, който генерира текст чрез предсказване на „следващата най-вероятна дума“, обучен на голям езиков модел, т.е. масивни текстови данни) може драстично да ускори много от тези работни места на бюро. Но той не изгражда самата лаборатория, не чете скалите и най-важното: не проверява никакви числа, формули или цитати, които произвежда от ваше име. Този модул учи как да използвате AI в химията от край до край, но отговорно.

В тази първа част искам да внедря в ума ви една идея: AI е асистент в химията, а не химик. Пише код, създава очертания, изгражда рамка за ретросинтез, помага при интерпретирането на пиковете на спектъра, обобщава литературата. Компетентният химик обаче е този, който решава дали молекулата действително може да бъде синтезирана, дали реакцията е безопасна или не, дали препратката е автентична или не и крайната отговорност.

Къде се вписва AI в работния процес по химия?

Нека грубо разделим проект по химия на пет фази: (1) идея и литература, (2) дизайн на молекула и реакция, (3) лабораторно приложение, (4) анализ и характеризиране, (5) докладване. AI носи много различни стойности на тези етапи.

  • Идеи и литература: AI бързо обобщава дадена тема, обяснява ключови понятия, генерира думи за търсене. Но той може да измисли приписване; Ще видим това след малко.
  • Дизайн: Генерира SMILES (форма на писане на молекулата като текстов низ; повече за това по-късно), предлага стъпки за ретросинтеза, изброява реактивни алтернативи. Предложението е добро, не е гаранция.
  • Лаборатория: AI не прави нищо тук. Мерките за претегляне, отопление и сигурност се извършват от хора. AI само помага при написването на процедурата; Преди да извърши тази процедура, човек трябва да я наблюдава за безопасност.
  • Анализ: При интерпретирането на NMR, IR, масспектър (това са техники за измерване, които показват структурата на молекулата), YZ помага да се групират пиковете и да се изброят възможните структури. Последната задача е ваша.
  • Докладване: Създава експериментална тетрадка, чернова на статия, чернова на формуляр за безопасност. Той е много мощен; но числата трябва да съвпадат с вашите.
Съвет: Най-безопасното място за използване на AI е в областите „ако нещо се обърка, ще бъде забелязано и поправено веднага“: чернова на текст, скелет на кода, описание на термина. Най-рисковите места са областите „ако е невярно, разпространява се тихо“: константи, препратки, твърдения за сигурност, числени резултати.

Защо трябва да внимаваме? Три структурни риска

Големият езиков модел не е калкулатор или химическа машина. Създава текст, който статистически "изглежда вероятно". Това води до три конкретни риска в химията:

  1. Измислено (халюцинация): Може уверено да запише съединение, което не е модел, реакция, която не съществува, или неправилно молекулно тегло. Например, пише "Молекулното тегло на съединение X е 154,2 g/mol", докато правилната стойност е 168,2.
  2. Фалшив цитат: Може да даде източник, който изглежда реалистичен, но изобщо не съществува, като например „Smith et al., 2019, Journal of Organic Chemistry“. Той дори може да състави DOI номер.
  3. Грешка относно безопасността: Може да представи опасна комбинация от реагенти (напр. окислител и органичен разтворител в неподходящо съотношение) като „няма проблем“.

Тези три риска ще се появяват отново и отново във всяка част от този модул. Решението не е да се избяга от AI, а да се установи дисциплината за проверка на всеки изход с независим източник.

мини калъфи

Случай 1 — Установено молекулно тегло. Завършил студент попита AI за молекулното тегло на пара-нитрофенола. „139,11 g/mol“, каза AI. Ученикът беше уверен и планира да претегли 6,96 g за 0,05 mol. Молекулното тегло на пара-нитрофенола обаче е 139,11 g/mol и този път е правилно - но ученикът никога не е проверявал. На следващото съединение (пара-аминофенол, действителна стойност 109,13 g/mol) YZ каза "123,15"; Този път ученикът го е хванал, като го е изчислил на ръка по формулата (C6H7NO2): 6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13. Урок: изчислете всяко молекулно тегло без формула.

Случай 2 — Фалшив DOI. Изследовател поиска от AI 5 източника в своя преглед на литературата. DOI на две от петте върна „не е намерено“ при щракване; Заглавията бяха фактически, но статиите не бяха. Загуба на време 40 минути. Урок: не всеки цитат трябва да се използва без проверка в базата данни (DOI, PubMed, Reaxys).

Случай 3 — Опасност, която изглежда безопасна. Потребител попита AI за процедура за почистване; AI индиректно създаде предложение за смесване на разтвор, съдържащ хипохлорит, с киселинен разтвор - комбинация, която може да освободи хлорен газ. За щастие потребителят погледна информационния лист за безопасност (SDS) и спря. Урок: всяка процедура се проверява от хора за SDS и опасност, преди да бъде приложена.

Слаба подкана / Силна подкана

Слаба подкана:

Синтезирайте тази молекула.

Това твърдение е неясно: каква молекула, какви изходни материали, какъв мащаб, какви ограничения? AI компенсира пропуските.

Мощна подкана:

Роля: Вие сте опитен асистент в органичния синтез. Целева молекула: 4-метоксиацетофенон (УСМИВКИ: COc1ccc(cc1)C(C)=O). Имаме анизол като изходен материал. Задача: Дайте предложение за ретросинтез в 2 стъпки. За всяка стъпка: реагенти, условия (температура, разтворител) и ВЪЗМОЖНИ странични реакции. Ограничение: Маркирайте „ПРОВЕРИ“, където не сте сигурни, пасва. Резултат: номерирани стъпки + списък с точки за проверка.

Разлика: роля, точна цел (със SMILES), контекст, брой стъпки, изходен формат и ограничение за "напасване". Това са петте компонента на доброто подсказване в химията: роля, прецизно представяне на структурата, контекст, задача, ограничение за проверка.

Видове AI инструменти: езиков модел или инструмент за химия?

В химията срещате два различни „AI“ и е изключително важно да не ги бъркате:

Жанр

Какво прави

надеждност

Примерна употреба

Общ езиков модел

Генерира текст/код, обяснява, пише чернови

Ниско количество, много език

Описание на процедурата, обяснение на терминологията

Библиотека по химия (RDKit и др.)

Обработва молекулата детерминистично, изчислява молекулното тегло

Висока (базирана на правила)

SMILES проверка, MA акаунт

Персонализиран модел за прогнозиране (ретросинтез, функция)

Дава обучени с данни прогнози

Средно, в зависимост от района

Ретросинтез, оценка на разтворимостта

Литература/инструмент за търсене

Реални заявки към база данни

Високо в зависимост от източника

Потвърждение на приписването, търсене на реакция

Най-стабилният работен процес съчетава тези: езиковият модел генерира идеята, библиотеката по химия изчислява детерминистично числото, инструментът за литература проверява приписването, човекът потвърждава. Ще установим тази верига в следващите единици.

Дисциплина за проверка: ЧЕТИРИ стъпки

Преминете всеки AI изход през тези четири стъпки, преди да го въведете в лабораторията или да докладвате:

  1. Структура: Валидна ли е нотацията молекула/реакция (SMILES/InChI)? Може ли да се анализира с инструмент (RDKit)?
  2. Номер: Молекулното тегло, стехиометрията, изчислението на добива проверени ли са независимо (на ръка или в библиотека)?
  3. Източник: Всяко твърдение и приписване проверено ли е в реална база данни?
  4. Безопасност: Прочетен ли е SDS за всеки реагент в процедурата, има ли опасни комбинации?
Забележка: Тези четири стъпки се прилагат „винаги“, а не „понякога“. 20 ситуации, в които AI е правилен, не извиняват 1 ситуация, в която е неправилен; защото в химията тази 1 ситуация може да бъде експлозия, отравяне или оттеглена статия.

Често срещани грешки

  • Погрешно приемане на AI изхода като „ресурс“. AI не е ресурс, а генератор, който се опитва да запомни ресурсите (понякога неправилно). Това е изходната база данни.
  • Доверете се на номера. Използвайки числа като молекулно тегло, pKa, точка на кипене, без да ги проверявате. Те могат да бъдат изчислени/търсени детерминистично; Питането на езиковия модел е най-слабият начин.
  • Аутсорсване на сигурността към AI. „ИИ не е казал, че е опасно“ не означава, че е безопасно. Оценката на опасността е работа на човека и SDS.
  • Неясна подкана. Не посочваме молекулата по нейното име, а по нейната структура (SMILES/InChI); Това води до неправилни молекули поради объркване на имената.
  • Доверете се само на един опит. Задаване на същия въпрос отново по различен начин и без проверка на последователността.

В обобщение

  • AI е мощен настолен помощник в химията: създава код, очертания, описания, сканира скелети; но лабораторията не го прави и не проверява изхода си.
  • Има три присъщи риска: фалшиво съединение/номер, фалшиво приписване, грешка в сигурността.
  • Разделете и комбинирайте общ езиков модел и инструменти за детерминирана химия (RDKit, бази данни).
  • Преминете всеки изход през четирите стъпки на структура–номер–източник–сигурност.
  • Добра подкана: включва роля, изрично представяне на структура, контекст, задача, ограничение за валидиране.

Задача за приложение

Изберете молекула, която сте изучавали сами (напр. аспирин, SMILES: CC(=O)Oc1ccccc1C(=O)O). Попитайте AI три неща: (1) молекулно тегло, (2) две справочни статии, (3) стъпка на синтез. След това проверете всеки поотделно: ръчно изчислете молекулното тегло от формулата, потвърдете цитиранията с DOI, проверете стъпката на синтез с защитно око. Кой изход е правилен и кой изисква корекция? Съхранявайте „дневник за проверка“ от половин страница.

контролен списък

  • [ ] Разбрах, че AI е асистент, а не химик.
  • [ ] Разпознавам рисковете от измислици, фалшиво приписване и недоверие с примери.
  • [ ] Мога да правя разлика между езиков модел и инструменти за детерминирана химия.
  • [ ] Ще приложа четирите стъпки на структура–номер–източник–сигурност към всеки изход.
  • [ ] Описвам молекулите чрез нотация на структурата (SMILES/InChI), а не по име.
  • [ ] Водих поне един дневник за проверка.