Jednotka 1 / 11

Úvod do umělé inteligence v chemii: Role, hranice, validace a etika

zisky:

  • Schopnost rozlišit, kde umělá inteligence šetří čas v chemickém pracovním postupu (nápad, návrh, analýza, reportování) a kde jsou rozhodnutí o struktuře, počtu, zdrojích a bezpečnosti ponechána na lidech, v závislosti na míře rizika.
  • Schopnost aplikovat disciplínu, která nezávisle kontroluje každý výstup pomocí čtyř kroků Struktura-Číslo-Zdroj-Zabezpečení
  • Pochopte, proč jsou vymyšlené sloučeniny a čísla, falešné odkazy a bezpečnostní mylné představy pro tuto profesi rizika, která je třeba brát v úvahu od samého začátku.

Chemie je experimentální věda, která studuje strukturu, přeměnu a vlastnosti hmoty. Chemik v laboratoři váží, rozpouští, zahřívá a měří; U svého stolu kreslí molekuly, plánuje reakce, interpretuje spektra, skenuje literaturu a píše zprávy. Umělá inteligence (zkráceně AI, zde konkrétně software, který generuje text předpovídáním „dalšího nejpravděpodobnějšího slova“, trénovaný na velkém jazykovém modelu, tedy masivních textových datech) může dramaticky urychlit mnoho z těchto pracovních míst. Sama si ale nevybuduje laboratoř, nečte stupnice a hlavně: neověřuje žádná čísla, vzorce ani citace, které za vás vyrábí. Tento modul učí, jak používat AI v chemii od začátku do konce, ale zodpovědně.

V této první jednotce vám chci zasadit jednu myšlenku: AI je asistent v chemii, ne chemik. Píše kód, vytváří obrysy, staví rámec retrosyntézy, pomáhá interpretovat vrcholy spektra, shrnuje literaturu. Je to však kompetentní chemik, kdo rozhoduje o tom, zda lze molekulu skutečně syntetizovat, zda je reakce bezpečná nebo ne, zda je odkaz pravý nebo ne, a konečnou odpovědnost.

Kde zapadá umělá inteligence do pracovního postupu chemie?

Rozdělme zhruba chemický projekt do pěti fází: (1) myšlenka a literatura, (2) návrh molekuly a reakce, (3) laboratorní aplikace, (4) analýza a charakterizace, (5) reportování. AI nese v těchto fázích velmi odlišné hodnoty.

  • Nápady a literatura: Umělá inteligence rychle shrnuje téma, vysvětluje klíčové pojmy, generuje hledané výrazy. Ale umí si připisování vymyslet; To uvidíme za chvíli.
  • Design: Generuje SMILES (forma zápisu molekuly jako textového řetězce; o tom později), navrhuje kroky retrosyntézy, uvádí reaktivní alternativy. Návrh je dobrý, není zárukou.
  • Laboratoř: AI zde nic nedělá. Vážení, ohřev a bezpečnostní opatření provádějí lidé. AI pouze pomáhá napsat proceduru; Před provedením tohoto postupu na něj musí člověk z důvodu bezpečnosti dohlížet.
  • Analýza: Při interpretaci NMR, IR, hmotnostního spektra (to jsou techniky měření, které ukazují strukturu molekuly), YZ pomáhá seskupit píky a vyjmenovat možné struktury. Konečný úkol je na vás.
  • Hlášení: Vytváří experimentální zápisník, návrh článku, návrh bezpečnostního formuláře. Je velmi silný; ale čísla by se měla shodovat s vašimi.
Tip: Nejbezpečnější místo pro použití umělé inteligence je v oblastech „pokud se něco pokazí, bude to okamžitě zaznamenáno a opraveno“: text konceptu, kostra kódu, popis termínu. Nejrizikovějšími místy jsou oblasti „pokud je nepravda, šíří se tiše“: konstanty, reference, bezpečnostní tvrzení, numerické výsledky.

Proč musíme být opatrní? Tři strukturální rizika

Velký jazykový model není kalkulačka ani motor chemie. Vytváří text, který statisticky „vypadá pravděpodobně“. To vede ke třem konkrétním rizikům v chemii:

  1. Vymyšlené (halucinace): Dokáže s jistotou zapsat sloučeninu, která není modelem, reakci, která neexistuje, nebo nesprávnou molekulovou hmotnost. Například říká „Moleková hmotnost sloučeniny X je 154,2 g/mol“, zatímco správná hodnota je 168,2.
  2. Falešná citace: Může uvést zdroj, který vypadá realisticky, ale vůbec neexistuje, jako například „Smith et al., 2019, Journal of Organic Chemistry.“ Dokáže si dokonce vymyslet číslo DOI.
  3. Bezpečnostní omyl: Může představovat nebezpečnou kombinaci činidel (např. oxidační činidlo a organické rozpouštědlo v nevhodném poměru) jako „žádný problém“.

Tato tři rizika se budou znovu a znovu objevovat v každé jednotce tohoto modulu. Řešením není uniknout před umělou inteligencí, ale zavést disciplínu ověřování každého výstupu u nezávislého zdroje.

mini pouzdra

Případ 1 – Přizpůsobená molekulová hmotnost. Postgraduální student se zeptal AI na molekulovou hmotnost para-nitrofenolu. "139,11 g/mol," řekla AI. Student si byl jistý a plánoval vážit 6,96 g na 0,05 mol. Molekulová hmotnost para-nitrofenolu je však 139,11 g/mol a tentokrát to bylo správné – ale student to nikdy nezkontroloval. Na další sloučenině (para-aminofenol, skutečná hodnota 109,13 g/mol) YZ řekl „123,15“; Tentokrát to student chytil tak, že to vypočítal ručně ze vzorce (C6H7NO2): 6×12,011 + 7×1,008 + 14,007 + 2×15,999 = 109,13. Lekce: vypočítejte každou molekulovou hmotnost bez vzorce.

Případ 2 – Falešný DOI. Výzkumník požádal AI o 5 zdrojů ve svém přehledu literatury. DOI dvou z pěti se po kliknutí vrátilo jako „nenalezeno“; Titulky byly věcné, ale články nikoli. Ztráta času 40 minut. Poučení: ne každá citace by měla být použita bez ověření v databázi (DOI, PubMed, Reaxys).

Případ 3 – Nebezpečí, které se zdá být bezpečné. Uživatel se zeptal AI na postup čištění; AI nepřímo navrhla smíchání roztoku obsahujícího chlornan s kyselým roztokem - kombinace, která by mohla uvolňovat plynný chlór. Naštěstí se uživatel podíval na bezpečnostní list (SDS) a přestal. Poučení: každý postup je před implementací zkontrolován člověkem z hlediska BL a nebezpečí.

Slabá výzva / Silná výzva

Slabá výzva:

Syntetizujte tuto molekulu.

Toto tvrzení je vágní: jaká molekula, jaké výchozí materiály, jaké měřítko, jaká omezení? AI vyrovnává mezery.

Výkonná výzva:

Role: Jste zkušeným asistentem v organické syntéze. Cílová molekula: 4-methoxyacetofenon (SMILES: COc1ccc(cc1)C(C)=O). Jako výchozí materiál máme anisol. Úkol: Uveďte návrh 2krokové retrosyntézy. Pro každý krok: činidla, podmínky (teplota, rozpouštědlo) a MOŽNÉ vedlejší reakce. Omezení: Označte "VERIFY" tam, kde si nejste jisti, vyhovuje. Výstup: číslované kroky + seznam bodů k ověření.

Rozdíl: role, přesný cíl (s SMILES), kontext, počet kroků, výstupní formát a omezení "přizpůsobení". Toto je pět složek dobrého nabádání v chemii: role, přesná reprezentace struktury, kontext, úkol, verifikační omezení.

Typy nástrojů AI: jazykový model nebo chemický nástroj?

V chemii se setkáváte se dvěma různými „AI“ a je důležité je nezaměňovat:

Žánr

Co dělá

spolehlivost

Příklad použití

Obecný jazykový model

Generuje text/kód, vysvětluje, píše koncepty

Nízký počet, vysoký jazyk

Nástin postupu, vysvětlení terminologie

Chemická knihovna (RDKit atd.)

Zpracuje molekulu deterministicky, vypočítá molekulovou hmotnost

High (rule-based)

Ověření SMILES, MA účet

Vlastní predikční model (retrosyntéza, funkce)

Poskytuje predikci natrénovanou na základě dat

Střední, v závislosti na oblasti

Retrosyntéza, odhad rozpustnosti

Literatura/vyhledávací nástroj

Real database queries

High depending on source

Potvrzení atribuce, vyhledávání reakcí

Nejrobustnější pracovní postup kombinuje tyto: jazykový model generuje myšlenku, chemická knihovna vypočítává číslo deterministicky, literární nástroj ověřuje atribuci, člověk ověřuje. Tento řetězec založíme v dalších jednotkách.

Ověřovací disciplína: ČTYŘI kroky

Než vstoupíte do laboratoře nebo do zprávy, proveďte každý výstup AI těmito čtyřmi kroky:

  1. Struktura: Je zápis molekuly/reakce (SMILES/InChI) platný? Lze to analyzovat pomocí nástroje (RDKit)?
  2. Číslo: Byly molekulová hmotnost, stechiometrie, výpočet výtěžku ověřeny nezávisle (ručně nebo knihovnou)?
  3. Zdroj: Bylo každé tvrzení a připsání ověřeno ve skutečné databázi?
  4. Bezpečnost: Byly přečteny bezpečnostní listy pro každé činidlo v postupu, existují nějaké nebezpečné kombinace?
Poznámka: Tyto čtyři kroky platí „vždy“, nikoli „někdy“. 20 situací, ve kterých je AI správná, neomlouvá 1 situace, ve které je nesprávná; protože v chemii by tou situací mohl být výbuch, otrava nebo zasunutý článek.

Časté chyby

  • Záměna výstupu AI za „zdroj“. AI není zdroj, ale generátor, který se snaží pamatovat zdroje (někdy nesprávně). Je to zdrojová databáze.
  • Důvěřovat číslu. Použití čísel, jako je molekulová hmotnost, pKa, bod varu bez jejich ověření. Ty lze vypočítat/prohledávat deterministicky; Ptát se na jazykový model je nejslabší způsob.
  • Outsourcing zabezpečení na AI. „AI neřekla, že je to nebezpečné“ neznamená, že je to bezpečné. Posouzení nebezpečí je úkolem člověka a BL.
  • Nejasná výzva. Neuvádí molekulu jejím jménem, ​​ale její strukturou (SMILES/InChI); To vede k nesprávným molekulám kvůli záměně názvu.
  • Důvěřovat pouze jednomu pokusu. Znovu položit stejnou otázku jiným způsobem a nekontrolovat konzistenci.

V souhrnu

  • Umělá inteligence je výkonný pomocník na stole v chemii: vytváří kód, obrysy, popisy, skenuje kostry; ale laboratoř to nedělá a svůj výstup neověřuje.
  • Existují tři základní rizika: falešná sloučenina/číslo, falešná atribuce, bezpečnostní omyl.
  • Oddělovat a kombinovat obecný jazykový model a nástroje deterministické chemie (RDKit, databáze).
  • Proveďte každý výstup čtyřmi kroky Struktura – Číslo – Zdroj – Zabezpečení.
  • Dobrá výzva: zahrnuje roli, explicitní reprezentaci struktury, kontext, úkol, omezení ověření.

Aplikační úkol

Vyberte molekulu, kterou jste sami studovali (např. aspirin, SMILES: CC(=O)Oc1ccccc1C(=O)O). Zeptejte se AI na tři věci: (1) molekulovou hmotnost, (2) dva referenční články, (3) krok syntézy. Poté ověřte každý nezávisle: ručně vypočítejte molekulovou hmotnost ze vzorce, potvrďte citace pomocí DOI, prozkoumejte krok syntézy bezpečnostním okem. Který výstup vyšel správně a který vyžadoval opravu? Veďte si půlstránkový „protokol o ověření“.

kontrolní seznam

  • [ ] Uvědomil jsem si, že AI je asistent, ne chemik.
  • [ ] Uvědomuji si rizika výmyslů, falešného připisování a nedůvěry s příklady.
  • [ ] Dokážu rozlišit jazykový model a nástroje deterministické chemie.
  • [ ] Na každý výstup použiji čtyři kroky Struktura – Číslo – Zdroj – Zabezpečení.
  • [ ] Molekuly popisuji strukturním zápisem (SMILES/InChI), nikoli jménem.
  • [ ] Uchoval jsem si alespoň jeden ověřovací protokol.