единици
1. Въведение в изкуствения интелект в химията: роли, граници, валидиране и етика 2. Молекулярно представяне и химическа структура: Валидиране със SMILES, InChI и RDKit 3. Прогноза за реакцията и механизъм: Прогноза за продукт, състояние и нежелана реакция 4. Поддръжка на спектрална интерпретация: NMR, IR и мас спектрометрия 5. Преглед на литературата и планиране на синтез: източник, процедура и пътна карта 6. Анализ на химически данни и Python: pandas, стехиометрия и калибриране 7. Прогноза за молекулярни свойства и QSAR: разделителна способност, pKa и граници на модела 8. Лабораторна документация: Тетрадка за експерименти, ELN и възпроизводимост 9. Оценка на безопасността и опасността: GHS, SDS и границите на изкуствения интелект 10. Потвърждение, халюцинация и научна почтеност 11. Човекът в експеримента: етика, поверителност, отговорност и работен процес от край до край
единица 10 / 11

Потвърждение, халюцинация и научна почтеност

Печалби:

  • Способност да се разбере, че халюцинациите са присъщи на езиковия модел и да се избере подходящ метод за проверка за всеки тип изход.
  • Проверете критичните стойности по два независими начина с триангулация и не бъркайте плавността с точността
  • Способност за прилагане на прозрачност, проследимост, интегритет на данните и човешка отговорност като основа на научната почтеност

Една единствена фраза се връща отново и отново в този модул: „AI произвежда, хората проверяват.“ В тази част ние превръщаме това изречение в система. Целта е да се разпознае халюцинацията (произвеждане на невярна/измислена информация с уверен език), което е най-опасното поведение на ИИ, да се установи конкретен метод за проверка за всеки тип изход и да се постави всичко това в рамките на научната почтеност (честност, прозрачност, проследимост). Непроверен резултат от ИИ в химията не е просто грешка; Може да е експлозия на експеримент, отравяне на човек или прибиране на хартия.

Защо халюцинациите са неизбежни?

Големият езиков модел произвежда „следващата най-вероятна дума“; Цели това, което е възможно, а не това, което е истина. Така той може да попълни молекулно тегло, DOI или точка на кипене със стойност, която „изглежда разумна“ – без да проверява дали е реална. Халюцинацията не е неизправност, а следствие от естеството на тази технология. Решението не е да се "опитвате да поправите" модела, а да изградите обвивка за валидиране около всеки изход.

Най-коварният аспект на халюцинацията е нейният уверен език. Неправилното молекулно тегло се представя с абсолютно същата увереност като правилното. Така че „изглежда уверено“ никога не означава „правилно“.

Внимание: доколко плавно и уверено AI говори по темата не е свързано с точността на тази информация. Плавността убеждава; Само независимият източник определя точността.

Валидиране по тип изход в химията

Всеки тип изход има свой собствен метод за проверка. Вместо да запомняте едно правило, използвайте подходящия инструмент за изхода:

Тип изход

Метод за проверка

превозно средство

Молекулно тегло, формула

Преизчислете от формулата

RDKit / ръчно

УСМИВКИ/структура

Анализирайте + канонизирайте

RDKit

Цитиране/DOI

Решете в база данни

doi.org, Crossref

Физическа константа (kn, pKa)

Справочна база данни

PubChem, наръчник

числено изчисление

Напиши+изпълни код

Python

реакция/състояние

Литературно потвърждение

Reaxys, статия

иск за обезпечение

SDS/GHS

Официален SDS

Присвояване на спектъра

Мултитехнически + човешки

Експериментален спектър

Тази таблица всъщност е обобщение на този модул: всяка единица е един ред.

Триангулация: три независими пътя

Най-мощната техника за проверка е "триангулацията": достигане до едно и също заключение по три независими начина. Например за молекулно тегло: (1) какво казва YZ, (2) изчисление на RDKit, (3) изчисление на ръка от формулата. Ако трите се припокриват, доверието е високо; Ако някой се отклонява, спрете и проучете. Никога не разчитайте на един единствен източник в химията; Търсете поне два независими пътя.

Стъпка по стъпка: работен процес за проверка

  1. Класифицирайте изхода: Това число ли е, структура, приписване, твърдение за сигурност?
  2. Изберете подходящ инструмент: Вземете подходящия път за потвърждение за типа изход от таблицата по-горе.
  3. Изчислете/търсете независимо: управлявайте превозното средство независимо от AI; сравнете резултата.
  4. Ако има отклонение, спрете: Ако стойностите не съвпадат, не продължавайте без да проучите коя е правилната.
  5. Оставете своя отпечатък: Запишете какво сте проверили и как (научна почтеност).
  6. Посочете несигурност: Маркирайте нещо, което не може да бъде проверено като „непотвърдено“, не го крийте.

Четири копируеми шаблона

1) Самопроверка:

Току-що дадохте следния изход: [OUTPUT]. Задача: Избройте всяко числово/фактическо твърдение на този резултат на отделен ред. За всяко твърдение: "как да го проверя независимо?" метод за запис (кой инструмент/база данни). НЕ ТВЪРДЕТЕ, че твърдението е вярно; просто дайте начин да го проверите.

2) Триангулационен контрол:

Искам да проверя теглото на следната молекула по три начина: [УСМИХВА СЕ]. Задача: 1) Изведете молекулната формула. 2) Покажете изчислението на молекулното тегло атом по атом (принос на всеки елемент). Забележка: Аз също ще го изчисля в RDKit и трето ще го сравня с даденото от вас. Ако трите не се припокриват, предупредете.

3) Маркировка за двусмислие:

В следния текст има множество фактически твърдения:[TEXT]Задача: Поставете етикет за ниво на достоверност до всяко твърдение:[ПРОВЕРЕН] / [ПРОВЕРЕН] / [НЕСИГУРЕН].Не маркирайте нищо [ПРОВЕРЕН], ако не сте сигурни.

4) Кръстосана заявка за съгласуваност:

Ще задам един и същи въпрос по два различни начина; Вижте дали отговорите ви са последователни. Въпрос А: Каква е молекулната формула на съединението

Слаба подкана / Силна подкана

Слаб:

Запишете всичко, което знаете за това съединение.

AI безразборно смесва проверима и изфабрикувана информация; Не е ясно кой е истинският.

Силен:

Предоставете информация за това съединение, но етикетирайте всяко твърдение като: [ДЕТЕРМИНИСТИЧНО - потвърдено с инструмент], напр. молекулна формула, [ЕКСПЕРИМЕНТАЛЕН - необходимо е цитиране] напр. точка на топене, [НЕСИГУРНО - не съм сигурен]. Не пишете твърдения без етикет.

Разлика: Принудихме AI да маркира собствената си несигурност; Направихме работата по проверката планируема.

Научна почтеност: честност и проследимост

Проверката не е просто техническа стъпка, тя е етичен въпрос. Научната почтеност изисква:

  • Прозрачност: Не крийте, че използвате AI; Посочете според вашата политика за публикуване/отчет.
  • Проследяемост: Запишете какъв резултат идва от AI и как е проверен.
  • Целостта на данните: „Подобряването“ на резултатите с AI, отхвърлянето на отклонения без обосновка е измама.
  • Отговорност: Вие носите отговорност за крайния резултат; „ИИ каза така“ не е извинение.
Съвет: Приемете от самото начало, че никога не можете да използвате фразата „ИИ каза така“ в доклад или защита. Това приемане автоматично носи навика за проверка на всеки изход.

мини калъфи

Случай 1 — Триангулацията е уловила грешка. Студент провери молекулното тегло по три начина: YZ каза 178,2, ръчното изчисление даде 180,16, RDKit даде 180,16. Два независими пътя се припокриха и елиминираха ИИ. Урок: две независими проверки безшумно побеждават един фалшив резултат.

Случай 2 — Безопасен език, грешна информация. AI пише много уверено, че реакцията "тече спонтанно при стайна температура". Литературата показва, че това изисква отопление и катализатор. Студентът се довери на източника, а не на безопасния език. Урок: плавността не е точност.

Случай 3 — Постигната прозрачност. В раздела за метода на своята статия един изследовател ясно посочи в кои стъпки е използвал AI (редактиране на текст, изготвяне на код) и написа, че независимо е проверил всички числени резултати. Съдийският процес премина гладко. Поука: прозрачността изгражда доверие, прикриването създава риск.

Често срещани грешки

  • Доверете се на безопасния език. Увереният тон на AI не е показател за точност.
  • Разчитайки на един източник. Приемане на един изход без триангулация.
  • Без разделяне на изходния тип. Мислейки си, че „проверих“ номера, приписването и твърдението за сигурност със същия метод.
  • Скриване на несигурност. Докладване на нещо, което не може да бъде проверено, сякаш е сигурно.
  • Скриване на използването на AI. Липсата на прозрачност подкопава научната почтеност.
  • Делегиране на отговорност. Извинението „AI каза така“ е невалидно; Отговорността е на човека.

В обобщение

  • Халюцинацията е присъща на езиковия модел; Решението е да се изгради обвивка за валидиране около всеки изход.
  • Всеки тип изход има свой собствен метод за проверка; класифицирайте изхода и използвайте подходящия инструмент.
  • Триангулацията (два независими пътя) е най-силният контрол; Не се доверявайте на един източник.
  • Плавността и увереният език не са свързани с точността.
  • Научната почтеност изисква прозрачност, проследимост, почтеност на данните и човешка отговорност.

Задача за приложение

Умишлено произвеждайте различни резултати в сесия на AI: молекулно тегло, справка, физическа константа, претенция за сигурност, числено изчисление. Проверете всеки поотделно с правилния метод (вижте таблицата). Опитайте се да уловите поне една халюцинация. След това подгответе „матрица за валидиране“: редове изходи, колони (AI стойност / независима стойност / припокрива ли се / как го проверих). Как бихте отчетли тази сесия от гледна точка на научната почтеност?

контролен списък

  • [ ] Разбирам защо халюцинациите са неизбежни.
  • [ ] Класифицирам всеки изход според неговия тип и го проверявам с подходящия метод.
  • [ ] Правя триангулация (два независими пътя) на критични стойности.
  • [ ] Вярвам на източника, не на безопасния език.
  • [ ] Отбелязвам това, което не може да бъде потвърдено като „несигурно“.
  • [ ] Аз съм прозрачен при използването на AI и се държа отговорен за резултата.