единици
1. Въведение в изкуствения интелект в химията: роли, граници, валидиране и етика 2. Молекулярно представяне и химическа структура: Валидиране със SMILES, InChI и RDKit 3. Прогноза за реакцията и механизъм: Прогноза за продукт, състояние и нежелана реакция 4. Поддръжка на спектрална интерпретация: NMR, IR и мас спектрометрия 5. Преглед на литературата и планиране на синтез: източник, процедура и пътна карта 6. Анализ на химически данни и Python: pandas, стехиометрия и калибриране 7. Прогноза за молекулярни свойства и QSAR: разделителна способност, pKa и граници на модела 8. Лабораторна документация: Тетрадка за експерименти, ELN и възпроизводимост 9. Оценка на безопасността и опасността: GHS, SDS и границите на изкуствения интелект 10. Потвърждение, халюцинация и научна почтеност 11. Човекът в експеримента: етика, поверителност, отговорност и работен процес от край до край
единица 11 / 11

Човекът в експеримента: етика, поверителност, отговорност и работен процес от край до край

Печалби:

  • Интегриране на човешкия принцип в работния процес от край до край в експеримента и възможност за разделяне на изкуствения интелект/човешките роли на всеки етап
  • Възможност за работа с общи прокси примери, без да се предоставя поверителна структура и данни на общия изкуствен интелект
  • Възможност за поставяне на врати за одобрение от хора в критични точки и поемане на крайната отговорност с прозрачност и проследимост

В тази последна единица ние комбинираме целия модул в една рамка: човек в цикъла. Този принцип казва, че без значение колко способен е AI, човекът трябва да разбира, контролира и одобрява всяка критична точка на химическо решение. В този модул първо ще изясним етичните аспекти и аспектите на поверителността, след това ще установим работен процес от край до край, който отвежда молекула от идеята до доклада, и ще видим как AI и хората си разделят работата на всеки етап. Целта е да превърнете всичко, което сте научили, в система, която се вписва в ежедневната работа.

Поверителност: какво да не даваме на AI?

Химията често работи с поверителна информация: непатентовани молекули, фирмени секретни пътища за синтез, непубликувани данни, проби от пациенти. Текстът, който въвеждате в публична AI услуга, може да се съхранява или обработва в съответствие с политиката на услугата. Следователно:

  • Проверете вашата институционална политика, преди да пуснете непубликувани оригинални структури (молекули преди патента) на публичен AI.
  • Никога не въвеждайте лични/пациентски данни (клинични проби) в разпознаваема форма.
  • Прегледайте споразуменията за поверителност, преди да споделите пътища за синтез на търговска тайна.
  • Изберете инструменти за изкуствен интелект за вътрешно/персонализирано внедряване, когато е необходимо.
Внимание: Задаването на общ AI за дадена молекула може да означава разкриване на структурата на тази молекула. За уникална структура, която не е патентована, това може да застраши вашия приоритет (право на патент). Поискайте скрити структури с общи/сурогатни примери.

Етика: четири принципа

  1. Прозрачност: Не крийте къде използвате AI; Спазвайте публикациите и институционалните политики.
  2. Отговорност: Човекът е отговорен за крайното решение; „Предложен AI“ не извинява нарушение на сигурността или целостта.
  3. Безвредност: Не използвайте AI за опасен/незаконен синтез, приложения с двойна употреба (оръжеен потенциал).
  4. Коректност и честност: Не изкривявайте данните, не украсявайте резултатите, не си измисляйте приписвания.

Работен процес от край до край: молекула → отчет

Сега нека комбинираме целия модул в един поток. На всеки етап обръщайте внимание на разграничението между това, което прави AI и това, което прави човекът.

Етап

Роля на AI

(Критична) роля на хората

1. Идея/литература

Резюме на концепцията, дума за търсене

Намиране на истинския източник, потвърждение на приписването

2. Описание на структурата

генериране на УСМИВКИ

Удостоверяване с RDKit, InChIKey

3. План за синтез

Ретросинтез, алтернативи

Литературно потвърждение, избор на път

4. Сигурност

Резюме на ИЛБ, предварително несъответствие

Четене на SDS, одобрение, решение за ЛПС

5. Приложение

(няма)

Цялата лабораторна работа

6. Анализ

Поддръжка за коментари на Spectrum

Окончателно задание на структурата

7. Обработка на данни

писане на код

Стартирайте кода, проверете резултата

8. Документация

Форматиране, контрол

Наблюдение, отклонение, подпис

9. Докладване

чернова на текст

Проверка на номер/цитат, отчетност

Тази таблица показва как 11-те единици на модула са подредени в едно задание. AI ускорява; хората проверяват и притежават.

Стъпка по стъпка: настройка на работния процес

  1. Изяснете ролите: За всяка задача „ИИ или човекът решава?“ определи от самото начало.
  2. Настройте филтър за поверителност: Без да давате нещо на AI ​​можете да попитате „това частно/частно ли е?“ попитайте.
  3. Поставете врати за проверка: Стъпка за проверка в края на всеки етап (таблица в раздел 10).
  4. Поддържайте проследимостта: Какъв резултат идва от AI, как е проверен, кой го е одобрил.
  5. Задайте точки на одобрение: Човешкото одобрение е задължително в критични точки като сигурност и краен резултат.
  6. Обратна връзка: Записвайте всяка открита грешка и подобрете работния процес.

Четири копируеми шаблона

1) Предварителен филтър за поверителност:

Преди да зададете въпрос, помислете за това: Съдържание: [КАКВО ПИТАМ] Задача: Това съдържание съдържа ли непубликувани оригинални артефакти, лични данни или търговски тайни? Ако е така, предложете как мога да пренапиша въпроса с общ/сурогатен пример, който ще скрие структурата.

2) Портал за проверка на края на фазата:

Завърших следната фаза: [ФАЗА, напр. план за синтез]. Задача: Избройте всички елементи, които трябва да бъдат проверени, излизайки от този етап (брой, цитат, структура, претенция за сигурност). За всеки напишете метода за проверка и кой трябва да го потвърди. Маркирайте всички отворени елементи, които трябва да бъдат затворени, преди да преминете към следващата стъпка.

3) План за разпределение на ролите човек-AI:

Моят проект: [КРАТКО ОПИСАНИЕ]. Задача: Разделете този проект на фази. За всеки етап разграничете: - Какво може да направи AI (чернова, код, резюме) - Какво трябва да реши човекът (сигурност, последствия, одобрение). Маркирайте критичните точки, където крайната отговорност е на човека.

4) Проверка на целостта на отчета:

По-долу е моята чернова на доклада: [ЧЕРНОВА] Задача: Проверете и маркирайте следното: 1) Има ли някакви непроверени числа/цитати? 2) Прозрачно ли е посочено използването на AI? 3) Данните изглеждат ли „разкрасени“ (скриване на извънредно положение)? 4) Има ли някакви пропуски в сигурността/етика? [ПРОВЕРЕТЕ] където не сте сигурни.

Слаба подкана / Силна подкана

Слаб:

Кой е най-добрият начин за синтезиране на новата тайна молекула на нашата компания? [действителна оригинална структура]

Това излага оригиналната предпатентна структура на обща услуга; Това излага на риск приоритета и поверителността.

Силен:

Бих искал да науча общата стратегия за ретросинтеза за подобна структура на клас ароматни кетони. Обяснете чрез общ пример (производно на ацетофенон), без да давате конкретната оригинална структура. Ще приложа стратегията към собствената си молекула вътрешно.

Разлика: без да се разкрива латентната структура, беше постигнато същото учене, както с общия сурогатен пример.

мини калъфи

Случай 1 — Разкрита оригинална структура. Екип попита общ AI за уникална молекула, преди да кандидатства за патент. Правното звено заяви, че това може да постави под въпрос приоритета; Процесът се забави. Урок: поискайте уникални структури с общ прокси, спазвайте правилата за поверителност.

Случай 2 — Човешкото съгласие предотврати инцидента. В автоматизиран работен процес AI изготви чернова на процедура и трябваше да бъде внедрена директно; Но опитен химик хвана несъвместима двойка реагенти на пропускащия "безопасен клирънс" порта. Поука: в критични точки портите за одобрение от хора спасяват животи.

Случай 3 — Дисциплина от край до край. Магистър внедри целия модул в един проект: резюме на литературата + действителна проверка на цитиране с AI, проверка на структура с RDKit, анализ на данни с код, сигурност с SDS, честна документация, прозрачно отчитане. Резултатът беше едновременно по-бърз и по-стабилен; в защитата на дисертация "Как проверихте AI?" Той отговори ясно на въпроса. Урок: AI + дисциплината за проверка работят най-добре заедно.

Често срещани грешки

  • Придаване на скритата структура на общия AI. Това компрометира патентния приоритет и търговската тайна.
  • Въвеждане на идентифициращи лични/пациентски данни. Нарушение на поверителността и правен риск.
  • Заобикаляне на вратите за одобрение. Сигурност и в крайна сметка движение напред без човешко одобрение.
  • Прехвърляне на отговорност към AI. „ИИ предложи“ не извинява никакви грешки.
  • Избягване на прозрачност. Прикриването на използването на AI подкопава почтеността.
  • Игнориране на риска от двойна употреба. Неетично е да се използва AI за вредни приложения.
Съвет: Проектирайте своя работен процес с „всяко критично решение, което човек спира и одобрява“. Направете AI връзка, която ускорява веригата, а възелът, който държи веригата, винаги е човек.

В обобщение

  • Човешки принцип в експериментирането: във всяко критично химическо решение човек разбира, контролира и одобрява.
  • Поверителност: не предоставяйте уникални артефакти, лични данни и търговски тайни на обществен AI; Използвайте общ прокси.
  • Етика: прозрачност, отговорност, безвредност, честност са четирите основни принципа.
  • В работен процес от край до край AI се ускорява на всеки етап; хората проверяват и притежават.
  • Поставете пропуски за одобрение от хора в критични точки (сигурност, краен резултат) и поддържайте проследимост.

Задача за приложение

Изберете свой собствен проект (реален или хипотетичен) и проектирайте AI-човешки работен процес от началото до края. Адаптирайте таблицата с 9 етапа по-горе към вашия собствен проект: какво ще прави AI на всеки етап, какво ще одобри човекът? Прилагане на предварителен филтър за поверителност: каква информация не давате на AI, как я генеризирате? Определете поне две врати за одобрение от хора и един метод за проследяване. Напишете „план за работен процес и проверка“ от една страница.

контролен списък

  • [ ] В експеримента схванах човешкия принцип и защо е необходим.
  • [ ] Генеризирам скритата структура/данни, без да я давам на общия AI.
  • [ ] Спазвам принципите на прозрачност, отговорност, безвредност и честност.
  • [ ] Разделих ролите AI/човек в работния процес от край до край.
  • [ ] Поставих врати за одобрение от хора в критични точки.
  • [ ] Проследявам какъв резултат идва от AI ​​и как се проверява.

Изпит по модул

1. Кое от следните е най-точното позициониране на изкуствения интелект в химията?

  • A) Изкуственият интелект е помощник за код, чернова и редактиране; Отговорността за структурата, броя, ресурсите, сигурността и етичните решения се носи от хората ✔
  • B) Изкуственият интелект е химическа машина и молекулните тегла, които дава, винаги са точни.
  • В) Изкуственият интелект работи само при преглед на литература, няма нищо общо с анализа и сигурността
  • Г) Тъй като изкуственият интелект е по-безпристрастен от хората, решенията за сигурността трябва да бъдат оставени на него

Описание: Изкуствен интелект; Това е асистент, който пише код, създава чернови, изгражда скелет за ретросинтез, помага и организира интерпретацията на спектъра. Въпреки това детерминистичното изчисляване на молекулното тегло и стехиометрията, проверката на структурата с RDKit, потвърждаването на цитирания в базата данни, решението за безопасност с SDS/GHS и крайната отговорност принадлежат на компетентния химик. Големият езиков модел не е калкулатор или химическа машина; Това е текстов генератор, който произвежда „следващата най-вероятна дума“ и неговият непроверен изход може да доведе до неправилна структура, число или опасност.

2. Кой е най-надеждният начин за описание на молекула на изкуствения интелект?

  • А) Писане само на общото турско име
  • B) Представяне на структура като SMILES и потвърждаване на самоличността с InChIKey ✔
  • В) Просто казвам молекулното тегло
  • Г) Достатъчно е да изпишете търговската марка

Обяснение: Имената (особено търговските и синонимните имена) са двусмислени и могат да доведат до грешна молекула. Даването на структурна нотация на молекулата като SMILES осигурява прецизност; Самоличността му е потвърдена в базата данни с InChIKey. В допълнение, SMILES, дадени от изкуствения интелект, трябва да бъдат анализирани с RDKit и проверени чрез канонизиране.

3. Как трябва да използвате молекулно тегло, дадено от изкуствения интелект?

  • A) Използвайки го директно, защото AI е надежден в числа
  • B) Изчислете и проверете независимо от формулата ръчно или с RDKit ✔
  • В) Достатъчно е просто да попитате друг изкуствен интелект и да сравните
  • D) Молекулното тегло не е важно, няма нужда от проверка

Обяснение: Молекулното тегло е количество, изчислено детерминистично от молекулната формула. Така че питането за езиковия модел е най-слабият начин; Трябва да се провери независимо с инструмент като RDKit или чрез изчисляване ръчно от формула. Езиковият модел може да побере такива числа с „вероятно изглеждаща“ стойност.

4. Какво трябва да се направи, преди да се използва литературен цитат (статия/DOI), върнат от изкуствения интелект?

  • А) Нищо; Ако изкуственият интелект дава справка, тя е реална
  • Б) Достатъчно е само да погледнете заглавието, за да изглежда убедително.
  • C) Потвърждаване на всеки цитат и DOI чрез декодирането им в база данни (doi.org, Crossref) ✔
  • Г) Дългият DOI номер доказва, че е реален.

Описание: Езиковият модел може да генерира статии, автори и DOI, които изглеждат реалистични, но не съществуват (фалшив цитат). Само защото дава DOI не означава, че е валиден. Всеки цитат трябва да бъде проверен чрез резолюция в база данни като doi.org, Crossref или сайта на издателя; Най-безопасният поток е човек да намери истинската статия и текстът да бъде резюмиран от изкуствен интелект.

5. В коя област изкуственият интелект е най-слаб и изисква потвърждение при планирането на реакцията?

  • А) При разпознаване към кой общ клас принадлежи реакцията
  • B) Точни номера на условията, стойности на добива и имена на реагенти/катализатори ✔
  • В) Обяснение на механизъм на разбираем език
  • Г) Мозъчна атака за алтернативни маршрути

Обяснение: AI обикновено прогнозира добре вида на реакцията и основния продукт на добре документираните реакции. Въпреки това, точните числа на условията (температура, време, еквивалент), стойностите на добива, редките реакции и имената на реагентите/катализаторите са най-слабите и най-склонни към производство; те трябва да бъдат потвърдени с литература и каталози.

6. Кой е най-надеждният начин за използване на изкуствения интелект при интерпретацията на спектъра?

  • А) Просто дайте няколко пика и попитайте „какъв спектър е това?“ да питам
  • B) Предоставяне на очакваната структура и пълни необработени данни и проверка на съгласуваност (тестване на хипотези) ✔
  • C) Записване само на стойностите на отместване без извършване на интегриране и деление
  • D) Наличие на окончателно присвояване на структура, извършено с една техника (само IR)

Описание: Попитайте AI „кое съединение е този спектър?“ Питането от нулата увеличава процента на грешки. Най-надеждният начин е да дадете очакваната структура (SMILES) и необработените данни (интегриране, разделяне, решаване, списък с пикове) заедно и да попитате „съгласувани ли са тези данни с тази структура?“ е да попитам; тоест използване на изкуствен интелект като тестер на хипотези. Последната задача е за химика, който изследва експерименталния спектър.

7. Кой е най-надеждният начин за получаване на резултата от химическо изчисление (напр. процентен добив)?

  • А) Изискване на резултата директно от изкуствения интелект устно
  • B) Отпечатайте и стартирайте Python кода на акаунта и го тествайте с известен пример ✔
  • В) Задайте един и същи въпрос няколко пъти и получете числото, което се появява най-често
  • Г) Бързо оценяване без посочване на единицата

Обяснение: Езиковият модел извършва аритметика чрез „предсказване на вероятния резултат“ и може да бъде грешен дори при много прости умножения. Най-надеждният начин е AI да напише своя КОД (напр. Python), а не самия акаунт, и да изпълни този код; кодът е детерминистичен и може да се проверява. Кодът също трябва да бъде тестван с малка извадка, чийто отговор е известен.

8. Какво означава понятието „домейн на приложимост“ при прогнозиране на свойствата на молекулите?

  • A) Процесорна мощност на компютъра, на който работи моделът
  • B) Молекулярна област, подобна на данните за обучение, където моделът дава надеждни прогнози ✔
  • C) Област на сигурност, където номерът, даден от модела, винаги е точен
  • D) Температурен диапазон, в който молекулата може да бъде синтезирана в лаборатория

Обяснение: QSAR/моделът за прогнозиране работи добре върху молекули, които са подобни на молекулите, върху които е обучен. Като се има предвид молекула, която е много различна от данните за обучение, моделът все още произвежда число, но това е ненадеждно; това се нарича „да бъдеш извън обхвата на приложимост“. Моделът винаги дава отговор; От човека зависи да прецени дали отговорът е надежден или не.

9. Какъв е правилният подход за работа с наблюденията в експерименталната документация?

  • A) Писане на наблюдения към изкуствения интелект, за да спестите време
  • B) Лицето, което прави експеримента, записва наблюденията; Само AI форматира и проверява ✔
  • C) Достатъчно е да не записвате наблюденията, просто да напишете крайния добив
  • Г) Скриване на отклонения от плана, за да изглежда отчетът добре

Обяснение: Изкуственият интелект не знае какво е; Вписването на наблюдения (промяна на цвета, отделяне на газ и т.н.) в него създава записи, които изглеждат правдоподобни, но не са се случили, и това е научна измама. AI форматира записа, извиква липсващите полета и проверява за повторяемост; но човекът експериментатор трябва да предостави наблюденията и фактите. Отклоненията от плана също трябва да бъдат записани.

10. Каква е ролята на изкуствения интелект в лабораторната безопасност и източникът на истината?

  • A) Ако изкуственият интелект казва „безопасно“, няма нужда от друг източник
  • B) Източникът на истината е SDS и GHS; AI е полезен, но не може да има последната дума ✔
  • В) Решенията за сигурност могат да бъдат изцяло делегирани на изкуствения интелект
  • D) SDS е ненужен; Интернет форумите предоставят достатъчно информация.

Описание: Безопасността е най-високият приоритет в химията и изкуственият интелект никога не може да има последната дума тук. Източникът на действителна информация за безопасност е SDS (информационен лист за безопасност) и GHS класификация, предоставени от производителя. AI може да обобщи текста на SDS, да генерира чернови на формуляри и да извърши предварителен скрининг за несъответствие; Въпреки това, всички твърдения трябва да бъдат проверени с SDS и процедурата трябва да бъде одобрена от опитен човек/служител по сигурността.

11. Коя от следните комбинации от реагенти е известно опасно (несъвместимо) съвпадение?

  • А) Смесване на вода и готварска сол
  • B) Смесване на кисел разтвор с разтвор, съдържащ хипохлорит (риск от хлорен газ) ✔
  • В) Смесване на етанол и вода
  • Г) Разтваряне на захар и вода

Обяснение: Докато някои химикали са относително безопасни поотделно, те са опасни заедно. Смесването на киселина и хипохлорит освобождава хлорен газ; Окислител + органичен представлява риск от пожар/експлозия, вода + реактивна метална топлина/водород. Въпреки че AI знае повечето от тези комбинации, той не гарантира всички от тях и понякога може да представи опасно предложение на невинен език; всяка процедура трябва да бъде проверена за несъответствие с ИЛБ.

12. Кой е най-точният израз за „халюцинация“ (изкуствен интелект, произвеждащ изфабрикувана информация)?

  • A) Това е рядка софтуерна грешка и се елиминира напълно с актуализация.
  • Б) Това е поведение, присъщо на езиковия модел; Решението е да проверите независимо всеки изход ✔
  • В) Появява се само в неправилно написани подкани, никога в правилни подкани.
  • Г) Ако изкуственият интелект говори на безопасен език, това не е халюцинация

Обяснение: Халюцинацията не е неизправност, а резултат от природата на езиковия модел, който произвежда „следващата най-вероятна дума“; Моделът цели възможното, а не истинското. Най-коварната част е, че представя невярна информация на същия уверен език като истината. Решението не е да се опитваме да коригираме модела, а да изградим подходяща за типа обвивка за валидиране около всеки изход; плавността никога не е доказателство за точност.

13. Какво означава „триангулация“ за проверка на критична стойност (напр. молекулно тегло)?

  • А) Задаване на един и същи въпрос на един и същ изкуствен интелект три пъти
  • B) Сравняване и достигане до едно и също заключение по повече от един независим начин ✔
  • В) Изчисляване на теглото на три различни молекули едновременно
  • Г) Закръгляване на резултата до третия знак след десетичната запетая

Обяснение: Триангулацията е достигане до едно и също заключение чрез множество независими пътища; Например сравняване на молекулното тегло според изкуствения интелект, RDKit изчисление и ръчно изчисление. Ако два независими пътя се припокриват, доверието е високо; Ако някой се отклони, той се спира и се разследва. Вместо да се разчита на един източник, трябва да се търсят поне два независими метода.

14. Какъв е правилният начин да попитате обща AI услуга за уникална молекула, която не е патентована?

  • A) Даване на оригиналната структура директно, защото скоростта е важна
  • B) Изучаване на стратегия чрез общ/сурогатен пример без разкриване на оригиналната структура ✔
  • В) Даването на структура не е проблем, AI никога не крие информация
  • Г) Непосочването на името на молекулата, а само споделянето на нейните УСМИВКИ е достатъчна защита.

Описание: Съдържание, въведено в обща услуга за изкуствен интелект, може да се съхранява или обработва в съответствие с политиката на услугата; Даването на оригинална структура рискува поверителността и патентния приоритет. Правилният подход е да научите стратегията от общ/сурогатен пример (подобен клас структури) и да я приложите към нейната собствена молекула вътрешно, без да разкривате оригиналната структура. Личните/пациентските данни също не трябва да се въвеждат в разпознаваема форма.