Единици
1. Вовед во вештачката интелигенција во хемијата: улоги, граници, валидација и етика 2. Молекуларна претстава и хемиска структура: валидација со SMILES, InChI и RDKit 3. Предвидување и механизам на реакции: Предвидување на производот, состојбата и несаканите реакции 4. Поддршка за интерпретација на спектарот: NMR, IR и масовна спектрометрија 5. Преглед на литература и планирање на синтезата: извор, процедура и патоказ 6. Хемиска анализа на податоци и Пајтон: панди, стехиометрија и калибрација 7. Предвидување на молекуларни својства и QSAR: Резолуција, pKa и граници на моделот 8. Лабораториска документација: тетратка за експеримент, ELN и репродуктивност 9. Проценка на безбедност и опасност: GHS, SDS и границите на вештачката интелигенција 10. Потврда, халуцинација и научен интегритет 11. Човек во експериментот: етика, приватност, одговорност и работен тек од крај до крај
Единица 10 / 11

Потврда, халуцинација и научен интегритет

Добивки:

  • Способност да се разбере дека халуцинацијата е вродена во јазичниот модел и да се избере соодветен метод за верификација за секој тип на излез.
  • Потврдете ги критичните вредности на два независни начини со триангулација и не мешајте ја флуентноста со точноста
  • Способност за примена на транспарентноста, следливоста, интегритетот на податоците и човечката одговорност како основа на научниот интегритет

Една фраза се враќа одново и одново низ овој модул: „Ви произведува, луѓето проверуваат“. Во оваа единица, таа реченица ја претвораме во систем. Целта е да се препознае халуцинацијата (произведување лажни/фабрикувани информации со сигурен јазик), што е најопасното однесување на вештачката интелигенција, да се воспостави конкретен метод за верификација за секој тип на излез и сето тоа да се стави во рамките на научниот интегритет (чесност, транспарентност, следливост). Непроверениот излез на ВИ во хемијата не е само грешка; Тоа може да биде експлозија на експеримент, отруена личност или повлечена хартија.

Зошто халуцинацијата е неизбежна?

Големиот јазичен модел го произведува „следниот најверојатен збор“; Таа има за цел она што е можно, а не она што е вистина. Така, тој може да пополни молекуларна тежина, DOI или точка на вриење со вредност што „изгледа разумна“ - без да провери дали е вистинска. Халуцинацијата не е дефект, туку последица на природата на оваа технологија. Решението не е да се „обидиме да го поправиме“ моделот, туку да изградиме школка за валидација околу секој излез.

Најподмолниот аспект на халуцинацијата е неговиот самоуверен јазик. Неточната молекуларна тежина е претставена со точно иста сигурност како и точната. Значи, „изгледа самоуверено“ никогаш не значи „точно“.

Внимание: Колку течно и самоуверено вештачката интелигенција зборува на тема, не е поврзано со точноста на таа информација. Флуентност убедува; Само независниот извор ја одредува точноста.

Валидација по тип на излез во хемијата

Секој излезен тип има свој метод за верификација. Наместо да меморирате едно правило, користете ја соодветната алатка за излезот:

Тип на излез

Метод на верификација

возилото

Молекуларна тежина, формула

Пресметајте од формулата

RDKit / рачно

НАСМЕВКИ/структура

Анализирај + канонизирај

RDKit

Цитат/DOI

Решете во базата на податоци

doi.org, Crossref

Физичка константа (kn, pKa)

Референтна база на податоци

PubChem, прирачник

нумеричка пресметка

Напиши + стартувај код

Пајтон

реакција/состојба

Потврда за литература

Реаксис, статија

безбедносно барање

СДС/ГХС

Официјален СДС

Доделување на спектарот

Мулти-технички + човечки

Експериментален спектар

Оваа табела е всушност резиме на овој модул: секоја единица е еден ред.

Триангулација: три независни патеки

Најмоќната техника за верификација е „триангулацијата“: доаѓање до истиот заклучок на три независни начини. На пример, за молекуларна тежина: (1) што вели YZ, (2) пресметка на RDKit, (3) рачна пресметка од формулата. Ако трите се преклопуваат, довербата е висока; Ако некој залута, застанете и истражете. Никогаш не се потпирајте на еден извор во хемијата; Побарајте најмалку две независни патеки.

Чекор по чекор: работен тек на проверка

  1. Класифицирајте го излезот: Дали е тоа број, структура, атрибуција, безбедносно тврдење?
  2. Изберете соодветна алатка: Добијте ја соодветната патека за потврда за типот на излез од табелата погоре.
  3. Пресметај/пребарувај независно: Стартувај го возилото независно од вештачката интелигенција; споредете го резултатот.
  4. Ако има отстапување, застанете: ако вредностите не се совпаѓаат, не продолжувајте без да испитате која е точна.
  5. Оставете белег: запишете што сте потврдиле и како (научен интегритет).
  6. Наведете несигурност: Означете нешто што не може да се потврди како „непотврдено“, не кријте го.

Четири шаблони за копирање

1) Самопроверка:

Само што го дадовте следниов излез: [ИЗЛЕЗ]. Задача: Наведете го секое нумеричко/факто тврдење на овој излез на посебна линија. За секое тврдење: "како самостојно да се потврди?" метод за пишување (која алатка/база на податоци). НЕ ТРИДИ дека тврдењето е точно; само дајте начин да го потврдите.

2) Контрола на триаголник:

Сакам да ја проверам тежината на следната молекула на три начини: [НАСМЕВКИ].Задача: 1) Изведете ја молекуларната формула.2) Покажете ја пресметката на молекулската тежина атом по атом (придонес на секој елемент).Забелешка: Ќе ја пресметам и во RDKit и трето ќе ја споредам со таа што ја дадовте. Ако трите не се преклопуваат, предупредете.

3) Означување на нејасност:

Во следниот текст има повеќе фактички тврдења:[TEXT]Задача: Ставете ознака за ниво на доверба до секое тврдење:[ПОВЕРЕНО] / [ПОВЕРЕНО] / [НЕИЗВЕРЕНО]. Не означувајте ништо [ПОВЕРЕНО] ако не сте сигурни.

4) Вкрстено барање за конзистентност:

Ќе го поставам истото прашање на два различни начини; Погледнете дали вашите одговори се конзистентни. Прашање А: Која е молекуларната формула на соединението

Слаб промпт / Силен промпт

Слаб:

Запишете сè што знаете за ова соединение.

ВИ неселективно меша проверливи и фабрикувани информации; Не е јасно која е вистинската.

Силно:

Обезбедете информации за ова соединение, но означете го секое тврдење како:[ДЕТЕРМИНИСТИЧКО - потврдено со инструмент] на пр. молекуларна формула,[ЕКСПЕРИМЕНТАЛНО - потребен е цитат] на пр. точка на топење,[НЕИЗВЕРЕНО - не сум сигурен]. Не пишувајте никакви неозначени тврдења.

Разлика: Ја принудивме вештачката интелигенција да ја означи сопствената неизвесност; Работата за верификација ја направивме планирана.

Научен интегритет: чесност и следливост

Верификацијата не е само технички чекор, тоа е етичко прашање. Научниот интегритет бара:

  • Транспарентност: Не кријте дека користите вештачка интелигенција; Наведете според вашата политика за објавување/извештај.
  • Следливост: запишете каков излез доаѓа од вештачката интелигенција и како е потврдена.
  • Интегритет на податоците: „разубавувањето“ на резултатите со вештачка интелигенција, отфрлањето на оддалечените без оправдување е измама.
  • Одговорност: Вие сте одговорни за конечниот исход; „Вештачката интелигенција рече така“ не е изговор.
Совет: Прифатете од самиот почеток дека никогаш не можете да ја користите фразата „Ви го кажа тоа“ во извештај или одбрана. Ова прифаќање автоматски носи навика за проверка на секој излез.

мини случаи

Случај 1 - Триангулацијата фати грешка. Еден студент ја провери молекуларната тежина на три начини: YZ рече 178,2, рачната пресметка даде 180,16, RDKit даде 180,16. Две независни патеки се преклопија и ја елиминираа вештачката интелигенција. Лекција: две независни проверки тивко го поразуваат еден лажен излез.

Случај 2 — Безбеден јазик, погрешни информации. АИ многу самоуверено напиша дека реакцијата „тече спонтано на собна температура“. Литературата покажа дека ова бара греење и катализатор. Студентот му веруваше на изворот, а не на безбедниот јазик. Поука: флуентноста не е точност.

Случај 3 - Добиена транспарентност. Во делот за методи од неговиот труд, еден истражувач јасно кажа во кои чекори користел вештачка интелигенција (уредување текст, изготвување код) и напишал дека независно ги проверувал сите нумерички резултати. Судискиот процес помина без проблеми. Поука: транспарентноста гради доверба, прикривањето создава ризик.

Вообичаени грешки

  • Верување на безбеден јазик. Самоуверениот тон на вештачката интелигенција не е показател за точноста.
  • Потпирајќи се на еден единствен извор. Прифаќање на единечен излез без триангулација.
  • Не се одвојува излезниот тип. Мислејќи дека ги „проверив“ бројот, атрибуцијата и безбедносното тврдење со истиот метод.
  • Криење на неизвесноста. Пријавување на нешто што не може да се потврди како да е сигурно.
  • Сокривање на употребата на вештачка интелигенција. Недостатокот на транспарентност го поткопува научниот интегритет.
  • Делегирање на одговорност. Изговорот „ВИ рече така“ е неважечки; Одговорноста е кај личноста.

Сумирано

  • Халуцинацијата е вродена во јазичниот модел; Решението е да се изгради школка за валидација околу секој излез.
  • Секој излезен тип има свој метод за верификација; класифицирајте го излезот и користете ја соодветната алатка.
  • Триангулацијата (две независни патеки) е најсилната контрола; Не верувајте на ниту еден извор.
  • Течноста и самоуверениот јазик не се поврзани со точноста.
  • Научниот интегритет бара транспарентност, следливост, интегритет на податоците и човечка одговорност.

Задача за апликација

Намерно произведуваат различни излези во сесија на вештачка интелигенција: молекуларна тежина, референца, физичка константа, безбедносно тврдење, нумеричка пресметка. Потврдете го секој независно со правилниот метод (види табела). Обидете се да фатите барем една халуцинација. Потоа подгответе „матрица за валидација“: излези од редови, колони (вредност на ВИ / независна вредност / дали се преклопуваше / како го потврдив). Како би ја пријавиле оваа сесија од аспект на научен интегритет?

листа за проверка

  • [ ] Разбирам зошто халуцинацијата е неизбежна.
  • [ ] Го класифицирам секој излез според неговиот тип и го потврдувам со соодветен метод.
  • [ ] Правам триангулација (две независни патеки) на критичните вредности.
  • [ ] Му верувам на изворот, а не на безбедниот јазик.
  • [ ] Она што не може да се потврди го означувам како „неизвесно“.
  • [ ] Јас сум транспарентен во мојата употреба на вештачката интелигенција и се сметам себеси за одговорен за исходот.