одиниці
1. Вступ до штучного інтелекту в хімії: ролі, межі, перевірка та етика 2. Молекулярне представлення та хімічна структура: перевірка за допомогою SMILES, InChI та RDKit 3. Прогнозування реакції та механізм: прогнозування продукту, стану та побічної реакції 4. Підтримка інтерпретації спектру: ЯМР, ІЧ та мас-спектрометрія 5. Огляд літератури та планування узагальнення: Джерело, процедура та дорожня карта 6. Аналіз хімічних даних і Python: pandas, стехіометрія та калібрування 7. Прогнозування молекулярних властивостей і QSAR: роздільна здатність, pKa та межі моделі 8. Лабораторна документація: Блокнот для експериментів, ELN і відтворюваність 9. Оцінка безпеки та небезпеки: GHS, SDS та межі штучного інтелекту 10. Підтвердження, галюцинація та наукова чесність 11. Людина в експерименті: етика, конфіденційність, відповідальність і наскрізний робочий процес
одиниця 11 / 11

Людина в експерименті: етика, конфіденційність, відповідальність і наскрізний робочий процес

Прибуток:

  • Інтеграція людського принципу в наскрізний робочий процес в експерименті та можливість розділяти ролі штучного інтелекту/людини на кожному етапі
  • Можливість працювати із загальними проксі-прикладами без надання конфіденційної структури та даних загальному штучному інтелекту
  • Здатність розміщувати шлюзи схвалення людини в критичних точках і брати на себе повну відповідальність із прозорістю та можливістю відстеження

У цьому останньому блоці ми об’єднуємо весь модуль в єдину структуру: людина в циклі. Цей принцип говорить, що незалежно від того, наскільки здатний ШІ, людина повинна розуміти, контролювати та схвалювати кожну критичну точку хімічного рішення. У цьому розділі ми спочатку роз’яснимо етичні аспекти та аспекти конфіденційності, потім створимо наскрізний робочий процес, який веде молекулу від ідеї до звіту, і побачимо, як штучний інтелект і люди розподіляють роботу на кожному етапі. Мета полягає в тому, щоб перетворити все, що ви навчилися, у систему, яка підходить для щоденної роботи.

Конфіденційність: що не можна давати ШІ?

Хімія часто працює з конфіденційною інформацією: незапатентованими молекулами, секретними шляхами синтезу компанії, неопублікованими даними, зразками пацієнтів. Текст, який ви вводите в загальнодоступну службу ШІ, може зберігатися або оброблятися відповідно до політики служби. Тому:

  • Перевірте свою інституційну політику, перш ніж випускати неопубліковані оригінальні структури (молекули до патенту) для публічного ШІ.
  • Ніколи не вводьте персональні дані/дані пацієнта (клінічні зразки) в ідентифікаційній формі.
  • Перегляньте угоди про конфіденційність, перш ніж ділитися шляхами синтезу комерційної таємниці.
  • За потреби вибирайте власні/власні інструменти штучного інтелекту.
Застереження: запитати загального ШІ про молекулу може означати розкриття структури цієї молекули. Для унікальної структури, яка не була запатентована, це може поставити під загрозу ваш пріоритет (право на патент). Попросіть приховані структури з загальними/сурогатними прикладами.

Етика: чотири принципи

  1. Прозорість: не приховуйте, де ви використовуєте ШІ; Дотримуватися правил публікації та інституційної політики.
  2. Відповідальність: людина несе відповідальність за остаточне рішення; «Запропонував ШІ» не виправдовує порушення безпеки чи цілісності.
  3. Незловмисність: не використовуйте штучний інтелект для небезпечного/незаконного синтезу, подвійного використання (потенціал зброї).
  4. Справедливість і чесність: не спотворюйте дані, не прикрашайте результати, не вигадуйте приписів.

Наскрізний робочий процес: молекула → звіт

Тепер давайте об’єднаємо весь модуль в єдиний потік. На кожному етапі звертайте увагу на різницю між тим, що робить ШІ, і тим, що робить людина.

етап

Роль ШІ

(Критична) роль людини

1. Ідея/література

Короткий зміст поняття, термін пошуку

Пошук справжнього джерела, підтвердження авторства

2. Опис структури

породжуючи УСМІШКИ

Автентифікація за допомогою RDKit, InChIKey

3. План синтезу

Ретросинтез, альтернативи

Підтвердження літератури, вибір шляху

4. Безпека

Резюме SDS, попередня невідповідність

Ознайомлення з паспортом безпеки, затвердження, рішення щодо ЗІЗ

5. Застосування

(Жодного)

Всі лабораторні роботи

6. Аналіз

Підтримка коментарів Spectrum

Остаточне призначення структури

7. Обробка даних

написання коду

Запустіть код, перевірте результат

8. Документація

Форматування, контроль

Спостереження, відхилення, підпис

9. Звітність

проект тексту

Перевірка номера/цитати, звітність

У цій таблиці показано, як 11 одиниць модуля впорядковано в одній роботі. ШІ прискорює; люди перевіряють і володіють.

Крок за кроком: налаштування робочого процесу

  1. Уточніть ролі: для кожного завдання «Вирішує ШІ чи людина?» визначити з самого початку.
  2. Налаштуйте фільтр конфіденційності: не надаючи нічого ШІ, ви можете запитати "це приватне/приватне?" запитати.
  3. Поставте верифікаційні ворота: крок перевірки в кінці кожного етапу (таблиця в блоці 10).
  4. Зберігайте відстежуваність: який результат надійшов від ШІ, як він був перевірений, хто його схвалив.
  5. Установіть точки схвалення: схвалення людини є обов’язковим у критичних точках, таких як безпека та кінцевий результат.
  6. Зворотній зв’язок: записуйте кожну виявлену помилку та покращуйте робочий процес.

Чотири шаблони, які можна копіювати

1) Попередній фільтр конфіденційності:

Перш ніж поставити запитання, подумайте про це: Вміст: [ЩО Я ЗАДАЮ] Завдання: чи містить цей вміст неопубліковані оригінальні артефакти, особисті дані чи комерційну таємницю? Якщо так, запропонуйте, як я можу переписати запитання за допомогою загального/сурогатного прикладу, який приховає структуру.

2) Ворота перевірки кінця фази:

Я завершив наступний етап: [ФАЗА, напр. план синтезу]. Завдання: перелічіть усі елементи, які необхідно перевірити, виходячи з цього етапу (кількість, цитування, структура, вимога безпеки). Для кожного напишіть спосіб перевірки та хто має це підтвердити. Позначте всі відкриті елементи, які потрібно закрити, перш ніж переходити до наступного кроку.

3) План розподілу ролей між людиною та ШІ:

Мій проект: [КОРОТКИЙ ОПИС]. Завдання: розділіть цей проект на етапи. Для кожного етапу розрізняйте: - Що може робити штучний інтелект (чернетка, код, зведення) - Що має вирішити людина (безпека, наслідки, схвалення). Позначте критичні точки, де основна відповідальність лежить на людині.

4) Перевірка цілісності звіту:

Нижче наведено чернетку мого звіту: [ЧЕРНЕТКА] Завдання: перевірте та позначте наступне: 1) Чи є якісь неперевірені цифри/цитати? 2) Чи прозоро вказано використання штучного інтелекту? 3) Чи виглядають дані "прикрашеними" (приховування викидів)? 4) Чи є якісь недоліки безпеки/етики? [ПЕРЕВІРТЕ], де ви не впевнені.

Слабка підказка / Сильна підказка

Слабкий:

Який найкращий спосіб синтезувати нову секретну молекулу нашої компанії? [справжня оригінальна структура]

Це надає вихідну передпатентну структуру загальному обслуговуванню; Це ставить під загрозу пріоритет і конфіденційність.

Сильний:

Я хотів би дізнатися загальну стратегію ретросинтезу для подібної структури класу ароматичних кетонів. Поясніть на загальному прикладі (похідна ацетофенону), не даючи конкретної оригінальної структури. Я застосую стратегію до своєї власної молекули.

Відмінність: без виявлення прихованої структури було досягнуто таке ж навчання, як і з загальним сурогатним прикладом.

міні-чохли

Випадок 1 — Розкрита оригінальна структура. Команда запитала головного ШІ про унікальну молекулу перед тим, як подати заявку на патент. Юридичний підрозділ заявив, що це може поставити під сумнів пріоритет; Процес затягнувся. Урок: вимагайте унікальних структур із загальним проксі, дотримуйтеся політики конфіденційності.

Випадок 2 — Згода людини запобігла аварії. В автоматизованому робочому процесі штучний інтелект виробляв проект процедури, який мав бути реалізований безпосередньо; Але досвідчений хімік зловив несумісну пару реагентів біля проточного «запобіжного зазору». Урок: у критичних точках ворота схвалення людей рятують життя.

Кейс 3 — Наскрізна дисципліна. Магістр реалізував весь модуль в одному проекті: резюме літератури + перевірка фактичних цитат за допомогою AI, перевірка структури за допомогою RDKit, аналіз даних за допомогою коду, безпека за допомогою SDS, чесна документація, прозора звітність. Результат був швидшим і надійнішим; на захисті дипломної роботи "Як ви перевіряли ШІ?" Він чітко відповів на запитання. Урок: ШІ та дисципліна перевірки найкраще працюють разом.

Поширені помилки

  • Надання прихованої структури загальному ШІ. Це порушує патентний пріоритет і комерційну таємницю.
  • Введення ідентифікаційних персональних даних/даних пацієнта. Порушення конфіденційності та юридичний ризик.
  • Обхід воріт затвердження. Безпека та, зрештою, рух вперед без людського схвалення.
  • Передача відповідальності ШІ. «ШІ запропонував» не виправдовує жодних помилок.
  • Уникнення прозорості. Приховування використання ШІ підриває цілісність.
  • Ігнорування ризику подвійного використання. Неетично використовувати ШІ для шкідливих програм.
Порада. Створіть свій робочий процес таким чином, щоб «кожне критичне рішення зупиняла та схвалювала людина». Зробіть штучний інтелект ланкою, яка прискорює ланцюг, а вузол, який утримує ланцюг, завжди буде людиною.

Підсумовуючи

  • Людський принцип в експерименті: у кожному критичному хімічному рішенні людина розуміє, контролює та схвалює.
  • Конфіденційність: не надавайте унікальні артефакти, особисті дані та комерційну таємницю публічному ШІ; Використовуйте загальний проксі.
  • Етика: прозорість, відповідальність, непорушність, чесність – чотири основні принципи.
  • У наскрізному робочому процесі ШІ прискорюється на кожному етапі; люди перевіряють і володіють.
  • Встановіть шлюзи схвалення людини в критичних точках (безпека, кінцевий результат) і підтримуйте відстежуваність.

Аплікаційне завдання

Виберіть власний проект (реальний чи гіпотетичний) і розробіть робочий процес ШІ-людини від початку до кінця. Адаптуйте наведену вище таблицю з 9 етапів до свого власного проекту: що робитиме AI на кожному етапі, що схвалюватиме людина? Застосувати попередній фільтр конфіденційності: яку інформацію ви не надаєте ШІ, як її узагальнити? Визначте щонайменше дві перевірки з боку людини та один метод відстеження. Напишіть «робочий процес і план перевірки» на одній сторінці.

контрольний список

  • [ ] Під час експерименту я зрозумів людський принцип і чому це було необхідно.
  • [ ] Я узагальнюю приховану структуру/дані, не передаючи їх загальному ШІ.
  • [ ] Я дотримуюсь принципів прозорості, відповідальності, незловмисності та чесності.
  • [ ] Я розділив ролі ШІ/людини в наскрізному робочому процесі.
  • [ ] Я ставлю ворота схвалення людей у ​​критичних точках.
  • [ ] Я відстежую, який результат надходить від ШІ та як він перевіряється.

Модульний екзамен

1. Що з наведеного нижче є найточнішим позиціонуванням штучного інтелекту в хімії?

  • A) Штучний інтелект – це код, чернетка та помічник у редагуванні; Відповідальність за структуру, кількість, ресурси, безпеку та етичні рішення лежить на людях ✔
  • B) Штучний інтелект — це хімічний механізм, і молекулярні ваги, які він надає, завжди точні.
  • C) Штучний інтелект працює лише в огляді літератури, він не має нічого спільного з аналізом і безпекою
  • D) Оскільки штучний інтелект є більш неупередженим, ніж люди, рішення щодо безпеки слід залишити йому

Опис: Штучний інтелект; Це помічник, який пише код, створює чернетки, будує скелет ретросинтезу, допомагає та організовує інтерпретацію спектру. Однак детермінований розрахунок молекулярної маси та стехіометрії, перевірка структури за допомогою RDKit, підтвердження цитат у базі даних, рішення про безпеку за допомогою SDS/GHS та остаточна відповідальність належать компетентному хіміку. Велика мовна модель — це не калькулятор чи хімічний механізм; Це текстовий генератор, який створює «наступне найбільш імовірне слово», і його неперевірений результат може призвести до неправильної структури, числа або небезпеки.

2. Який найнадійніший спосіб описати молекулу для штучного інтелекту?

  • А) Написання лише звичайного турецького імені
  • B) Представлення структури, наприклад SMILES, і підтвердження ідентичності за допомогою InChIKey ✔
  • C) Просто назвати молекулярну масу
  • Г) Досить написати товарний знак

Пояснення: назви (особливо комерційні назви та назви-синоніми) неоднозначні та можуть призвести до неправильної молекули. Надання молекулі нотації структури, наприклад SMILES, забезпечує точність; Його особу підтверджено в базі даних InChIKey. Крім того, SMILES, надані штучним інтелектом, повинні бути проаналізовані за допомогою RDKit і перевірені шляхом канонізації.

3. Як слід використовувати молекулярну масу, задану штучним інтелектом?

  • A) Використовуючи його безпосередньо, тому що ШІ надійний у цифрах
  • B) Обчислити та перевірити незалежно від формули вручну або за допомогою RDKit ✔
  • В) Досить просто запитати інший штучний інтелект і порівняти
  • D) Молекулярна маса неважлива, перевірка не потрібна

Пояснення: Молекулярна маса — це величина, яка детерміновано обчислюється за молекулярною формулою. Отже, запитати мовну модель є найслабшим способом; Його слід перевірити незалежно за допомогою такого інструменту, як RDKit, або шляхом обчислення вручну за формулою. Мовна модель може відповідати таким числам зі значенням «імовірного вигляду».

4. Що слід зробити перед використанням цитат з літератури (статей/DOI), отриманих штучним інтелектом?

  • А) Нічого; Якщо штучний інтелект дає довідку, то вона справжня
  • B) Досить просто поглянути на назву, щоб вона виглядала переконливо.
  • C) Підтвердження кожної цитати та DOI шляхом їх декодування в базі даних (doi.org, Crossref) ✔
  • D) Довгий номер DOI доводить, що він справжній.

Опис: мовна модель може створювати статті, авторів і DOI, які виглядають реалістично, але не існують (фальшиве цитування). Те, що він дає DOI, не означає, що він дійсний. Кожне цитування має бути перевірено резолюцією в базі даних, такій як doi.org, Crossref або на сайті видавця; Найбезпечнішим є те, щоб людина знайшла справжню статтю й узагальнила текст штучним інтелектом.

5. У якій сфері штучний інтелект найслабший і потребує підтвердження в плануванні реакції?

  • А) У розпізнаванні, до якого загального класу належить реакція
  • B) Точні номери умов, значення виходу та назви реагентів/каталізаторів ✔
  • C) Пояснення механізму простою мовою
  • D) Мозковий штурм щодо альтернативних маршрутів

Пояснення: ШІ зазвичай добре прогнозує тип реакції та основний продукт добре задокументованих реакцій. Однак точні номери умов (температура, час, еквівалент), значення виходу, рідкісні реакції та назви реагентів/каталізаторів є найслабшими та найбільш схильними до виготовлення; вони повинні бути підтверджені літературою та каталогами.

6. Який найнадійніший спосіб використання штучного інтелекту в інтерпретації спектру?

  • A) Просто дайте кілька піків і запитайте, "що це за спектр?" просити
  • B) Надання очікуваної структури та повних необроблених даних, а також перевірка узгодженості (перевірка гіпотези) ✔
  • C) Запис лише значень зсуву без виконання інтегрування та ділення
  • D) Наявність остаточного призначення структури за допомогою однієї техніки (тільки ІР)

Опис: Запитайте ШІ, яка сполука є цим спектром? Запитування з нуля підвищує рівень помилок. Найнадійніший спосіб — надати очікувану структуру (SMILES) і необроблені дані (інтегрування, розбиття, розв’язувач, список піків) разом і запитати «чи ці дані відповідають цій структурі?» є просити; тобто використання штучного інтелекту як тестера гіпотез. Остаточне завдання для хіміка, який вивчає експериментальний спектр.

7. Який найнадійніший спосіб отримати результат хімічного розрахунку (наприклад, відсоток виходу)?

  • A) Запит результату безпосередньо у штучного інтелекту усно
  • B) Роздрукуйте та запустіть код Python облікового запису та протестуйте його на відомому прикладі ✔
  • C) Поставте те саме запитання кілька разів і отримайте число, яке з’являється найчастіше
  • D) Швидка оцінка без вказівки одиниці

Пояснення: мовна модель виконує арифметику, «передбачаючи ймовірний результат», і може помилятися навіть у дуже простих множеннях. Найнадійніший спосіб полягає в тому, щоб ШІ написав свій КОД (наприклад, Python), а не сам обліковий запис, і запустив цей код; код детермінований і піддається перевірці. Код також слід протестувати на невеликому зразку, відповідь якого відома.

8. Що означає поняття «область застосовності» у передбаченні молекулярних властивостей?

  • A) Обчислювальна потужність комп’ютера, на якому працює модель
  • B) Молекулярна область, подібна до даних навчання, де модель дає надійні прогнози ✔
  • C) Область достовірності, де число, задане моделлю, завжди є точним
  • D) Діапазон температур, у якому молекула може бути синтезована в лабораторії

Пояснення: модель QSAR/прогнозування добре працює на молекулах, подібних до молекул, на яких її було навчено. Враховуючи молекулу, яка сильно відрізняється від даних навчання, модель все одно видає число, але це ненадійно; це називається «перебування поза сферою застосування». Модель завжди дає відповідь; Людина сама оцінює, надійна відповідь чи ні.

9. Який правильний підхід до роботи зі спостереженнями в документації експерименту?

  • А) Написання спостережень до штучного інтелекту, щоб заощадити час
  • B) Особа, яка проводить експеримент, записує спостереження; Тільки AI форматує та перевіряє ✔
  • C) Досить не записувати спостереження, просто написати кінцевий результат
  • Г) Приховування відхилень від плану, щоб звіт виглядав красиво

Пояснення: штучний інтелект не знає, що це таке; Внесення спостережень (зміна кольору, виділення газу тощо) до нього створює записи, які здаються правдоподібними, але не відбулися, і це наукове шахрайство. AI форматує запис, викликає пропущені поля та перевіряє повторюваність; але людина-експериментатор має надати спостереження та факти. Відхилення від плану також повинні бути зафіксовані.

10. Яка роль штучного інтелекту в лабораторній безпеці та джерело правди?

  • А) Якщо штучний інтелект каже «безпечно», немає потреби в іншому джерелі
  • B) Джерелом істини є SDS і GHS; ШІ корисний, але не може мати останнє слово ✔
  • C) Рішення щодо безпеки можна повністю делегувати штучному інтелекту
  • D) SDS непотрібний; Інтернет-форуми надають достатньо інформації.

Опис: Безпека є найвищим пріоритетом у хімії, і штучний інтелект ніколи не може мати останнє слово тут. Джерелом фактичної інформації про безпеку є SDS (паспорт безпеки) та класифікація GHS, надані виробником. AI може підсумовувати текст паспорту безпеки, генерувати чернетки форм і проводити попередній відбір невідповідності; Однак усі претензії мають бути перевірені за допомогою SDS, а процедура має бути схвалена досвідченою особою/офіцером служби безпеки.

11. Яка з наступних комбінацій реагентів є відомою небезпечною (несумісною) відповідністю?

  • А) Змішування води та кухонної солі
  • B) Змішування кислого розчину з розчином, що містить гіпохлорит (ризик газоподібного хлору) ✔
  • В) Змішування етанолу і води
  • Г) Розчинення цукру і води

Пояснення: хоча деякі хімікати відносно безпечні окремо, разом вони небезпечні. Змішування кислоти та гіпохлориту виділяє газоподібний хлор; Окисник + органіка становить ризик пожежі/вибуху, вода + реактивний метал, тепло/водень. Хоча штучний інтелект знає більшість цих комбінацій, він не гарантує їх усіх і іноді може надати небезпечну пропозицію невинною мовою; кожна процедура повинна бути перевірена на невідповідність SDS.

12. Який найточніший вислів для «галюцинації» (штучний інтелект, що створює сфабриковану інформацію)?

  • A) Це рідкісна програмна помилка, яка повністю усувається після оновлення.
  • B) Це поведінка, властива мовній моделі; Рішення полягає в тому, щоб незалежно перевірити кожен результат ✔
  • C) Він з’являється лише в неправильно написаних підказках, ніколи в правильних підказках.
  • Г) Якщо штучний інтелект говорить безпечною мовою, це не галюцинація

Пояснення: галюцинація не є збоєм, а результатом природи мовної моделі, яка створює «наступне найбільш імовірне слово»; Модель націлена на можливе, а не на істинне. Найпідступніша частина полягає в тому, що вона подає неправдиву інформацію тією ж впевненою мовою, що й правда. Рішення полягає не в тому, щоб намагатися виправити модель, а в тому, щоб побудувати оболонку перевірки, що відповідає типу, навколо кожного виходу; вільне мовлення ніколи не є доказом точності.

13. Що означає «тріангуляція» для перевірки критичного значення (наприклад, молекулярної маси)?

  • А) Поставити одне й те саме запитання одному штучному інтелекту тричі
  • B) Порівняння та досягнення одного висновку більш ніж одним незалежним способом ✔
  • В) Обчислення маси трьох різних молекул одночасно
  • Г) Округлення результату до трьох знаків після коми

Пояснення: тріангуляція — це досягнення одного висновку кількома незалежними шляхами; Наприклад, порівняння молекулярної маси за даними штучного інтелекту, розрахунок RDKit і розрахунок вручну. Якщо два незалежні шляхи перетинаються, довіра висока; Якщо хтось відхиляється, його зупиняють і розслідують. Замість того, щоб покладатися на одне джерело, слід шукати принаймні два незалежні методи.

14. Який правильний спосіб запитати загальну службу ШІ про унікальну молекулу, яка не була запатентована?

  • A) Пряме надання оригінальної структури, тому що швидкість важлива
  • B) Вивчення стратегії через загальний/сурогатний приклад без розкриття оригінальної структури ✔
  • C) Надати структуру не проблема, ШІ ніколи не приховує інформацію
  • D) Достатнім захистом є не вказувати назву молекули, а лише ділитися її повними SMILES.

Опис: Вміст, введений у загальну службу штучного інтелекту, може зберігатися або оброблятися відповідно до політики служби; Надання оригінальної структури ризикує конфіденційністю та патентним пріоритетом. Правильний підхід полягає в тому, щоб вивчити стратегію на загальному/сурогатному прикладі (подібний клас структур) і застосувати її до власної молекули всередині компанії, не розкриваючи оригінальну структуру. Особисті дані/дані пацієнта також не слід вводити в ідентифікаційній формі.