Enhed 1 / 11

Introduktion til kunstig intelligens i kemi: roller, grænser, validering og etik

Gevinster:

  • At kunne skelne, hvor kunstig intelligens sparer tid i kemiens arbejdsgang (idé, design, analyse, rapportering), og hvor struktur, antal, ressource og sikkerhedsbeslutninger overlades til mennesker, afhængigt af risikoniveauet.
  • Evne til at anvende en disciplin, der uafhængigt kontrollerer hvert output med de fire trin af Struktur-Number-Resource-Sikkerhed
  • Forstå hvorfor sammensatte sammensætninger og tal, falske referencer og sikkerhedsmisforståelser er risici for denne profession, som skal overvejes fra begyndelsen.

Kemi er en eksperimentel videnskab, der studerer stofs struktur, transformation og egenskaber. En kemiker vejer, opløser, opvarmer og måler i laboratoriet; Ved sit skrivebord tegner han molekyler, planlægger reaktioner, fortolker spektre, scanner litteraturen og skriver rapporter. Kunstig intelligens (forkortet AI, her specifikt software, der genererer tekst ved at forudsige det "næste mest sandsynlige ord", trænet på en stor sprogmodel, dvs. massive tekstdata) kan dramatisk fremskynde mange af disse skrivebordsjob. Men det bygger ikke selve laboratoriet, det læser ikke skalaerne, og vigtigst af alt: det verificerer ikke nogen tal, formler eller citater, det producerer på dine vegne. Dette modul lærer, hvordan man bruger AI i kemi ende-til-ende, men ansvarligt.

I denne første enhed vil jeg plante én idé i dit sind: AI er en assistent i kemi, ikke en kemiker. Skriver kode, producerer konturer, bygger retrosyntese-ramme, hjælper med at fortolke spektrumtoppe, opsummerer litteratur. Det er dog den kompetente kemiker, der afgør, om molekylet rent faktisk kan syntetiseres, om en reaktion er sikker eller ej, om en reference er ægte eller ej, og det endelige ansvar.

Hvor passer AI ind i kemi-arbejdsgangen?

Lad os groft opdele et kemiprojekt i fem faser: (1) idé og litteratur, (2) molekyle- og reaktionsdesign, (3) laboratorieanvendelse, (4) analyse og karakterisering, (5) rapportering. AI har meget forskellige værdier på disse stadier.

  • Idéer og litteratur: AI opsummerer hurtigt et emne, forklarer nøglebegreber, genererer søgetermer. Men han kan finde på tilskrivning; Vi vil se dette om et øjeblik.
  • Design: Genererer SMILES (en form for at skrive molekylet som en tekststreng; mere om det senere), foreslår retrosyntesetrin, lister reaktive alternativer. Forslaget er godt, ikke en garanti.
  • Laboratorium: AI gør intet her. Vejning, opvarmning og sikkerhedsforanstaltninger udføres af mennesker. AI hjælper kun med at skrive proceduren; Før man udfører denne procedure, skal et menneske overvåge det for en sikkerheds skyld.
  • Analyse: Ved fortolkning af NMR, IR, massespektrum (disse er måleteknikker, der viser molekylets struktur), hjælper YZ med at gruppere toppene og liste mulige strukturer. Den endelige opgave er din.
  • Rapportering: Producerer eksperimentel notesbog, artikeludkast, sikkerhedsformularudkast. Den er meget kraftfuld; men tallene skal matche dine.
Tip: Det sikreste sted at bruge AI er i "hvis noget går galt, vil det blive bemærket og rettet med det samme" områder: udkast til tekst, kodeskelet, termbeskrivelse. De mest risikable steder er områderne "hvis falske, spredes det lydløst": konstanter, referencer, sikkerhedspåstande, numeriske resultater.

Hvorfor skal vi være forsigtige? Tre strukturelle risici

Den store sprogmodel er ikke en lommeregner eller en kemimotor. Producerer tekst, der statistisk set "ser sandsynlig ud". Dette fører til tre konkrete risici i kemi:

  1. Sammensat (hallucination): Kan trygt nedskrive en forbindelse, der ikke er en model, en reaktion, der ikke eksisterer, eller en forkert molekylvægt. For eksempel står der "Molekylvægten af ​​forbindelse X er 154,2 g/mol", hvorimod den korrekte værdi er 168,2.
  2. Falsk citat: Kan give en kilde, der ser realistisk ud, men som slet ikke eksisterer, såsom "Smith et al., 2019, Journal of Organic Chemistry." Han kan endda lave et DOI-nummer.
  3. Sikkerhedsfejl: Kan præsentere en farlig kombination af reagenser (f.eks. et oxidationsmiddel og et organisk opløsningsmiddel i et uhensigtsmæssigt forhold) som "intet problem".

Disse tre risici vil dukke op igen og igen i hver enhed af dette modul. Løsningen er ikke at flygte fra AI, men at etablere disciplinen med at verificere hvert output med en uafhængig kilde.

mini sager

Tilfælde 1 — Monteret molekylvægt. En kandidatstuderende spurgte AI om molekylvægten for para-nitrophenol. "139,11 g/mol," sagde AI. Eleven var selvsikker og planlagde at veje 6,96 g for 0,05 mol. Para-nitrophenols molekylvægt er dog 139,11 g/mol, og denne gang var det korrekt - men eleven havde aldrig tjekket. På den næste forbindelse (para-aminophenol, faktisk værdi 109,13 g/mol) sagde YZ "123,15"; Denne gang fangede eleven det ved at regne det ud i hånden ud fra formlen (C6H7NO2): 6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13. Lektion: beregn hver molekylvægt uden formel.

Sag 2 - Falsk DOI. En forsker bad AI om 5 kilder i sin litteraturgennemgang. DOI for to af de fem returnerede "ikke fundet", når der blev klikket; Overskrifterne var faktuelle, men det var artiklerne ikke. Spild af tid 40 minutter. Lektion: ikke alle citater bør bruges uden verifikation i databasen (DOI, PubMed, Reaxys).

Tilfælde 3 — Fare, der virker sikker. En bruger spurgte AI om en rengøringsprocedure; AI frembragte indirekte et forslag om at blande en hypokloritholdig opløsning med en sur opløsning - en kombination, der kunne frigive klorgas. Heldigvis kiggede brugeren på sikkerhedsdatabladet (SDS) og stoppede. Lektion: hver procedure er menneskeinspiceret for SDS og fare, før den implementeres.

Svag prompt / Stærk prompt

Svag prompt:

Syntetiser dette molekyle.

Denne påstand er vag: hvilket molekyle, hvilke udgangsmaterialer, hvilken skala, hvilke begrænsninger? AI udgør hullerne.

Kraftig prompt:

Rolle: Du er en erfaren assistent i organisk syntese. Målmolekyle: 4-methoxyacetophenon (SMIL: COc1ccc(cc1)C(C)=O). Vi har anisol som udgangsmateriale. Opgave: Giv et 2-trins retrosynteseforslag. For hvert trin: reagenser, betingelser (temperatur, opløsningsmiddel) og MULIGE sidereaktioner. Begrænsning: Marker "VERIFY" hvor du ikke er sikker, passende. Output: nummererede trin + liste over punkter, der skal verificeres.

Forskel: rolle, nøjagtigt mål (med SMILES), kontekst, antal trin, outputformat og "tilpasnings"-begrænsning. Disse er de fem komponenter af god tilskyndelse i kemi: rolle, præcis strukturrepræsentation, kontekst, opgave, verifikationsbegrænsning.

Typer af AI-værktøjer: sprogmodel eller kemiværktøj?

I kemi støder du på to forskellige "AI", og det er vigtigt ikke at forveksle dem:

Genre

Hvad gør

pålidelighed

Eksempel på brug

Generel sprogmodel

Generer tekst/kode, forklarer, skriver kladder

Lavt på tal, højt på sprog

Procedureoversigt, terminologiforklaring

Kemibibliotek (RDKit osv.)

Behandler molekylet deterministisk, beregner molekylvægten

Høj (regelbaseret)

SMILES-bekræftelse, MA-konto

Brugerdefineret forudsigelsesmodel (retrosyntese, funktion)

Giver datatrænet forudsigelse

Medium, afhængig af område

Retrosyntese, opløselighedsvurdering

Litteratur/søgeværktøj

Rigtige databaseforespørgsler

Høj afhængig af kilde

Attributionsbekræftelse, reaktionssøgning

Den mest robuste arbejdsgang kombinerer disse: sprogmodellen genererer ideen, kemibiblioteket beregner antallet deterministisk, litteraturværktøjet verificerer tilskrivningen, mennesket validerer. Vi vil etablere denne kæde i de næste enheder.

Verifikationsdisciplin: FIRE trin

Tag hvert AI-output gennem disse fire trin, før du indtaster det i laboratoriet eller rapporten:

  1. Struktur: Er molekyle/reaktionsnotationen (SMILES/InChI) gyldig? Kan det parses med et værktøj (RDKit)?
  2. Antal: Er molekylvægt, støkiometri, udbytteberegning blevet verificeret uafhængigt (i hånden eller bibliotek)?
  3. Kilde: Er enhver påstand og tilskrivning blevet verificeret i en rigtig database?
  4. Sikkerhed: Er sikkerhedsdatabladet blevet læst for hvert reagens i proceduren, er der nogen farlige kombinationer?
Bemærk: Disse fire trin gælder "altid", ikke "sommetider". 20 situationer, hvor AI er korrekt, undskylder ikke 1 situation, hvor den er forkert; fordi i kemi, at 1 situation kunne være en eksplosion, forgiftning eller en tilbagetrukket artikel.

Almindelige fejl

  • At tage fejl af AI-output som en "ressource". AI er ikke en ressource, men en generator, der forsøger at huske ressourcer (nogle gange forkert). Det er kildedatabasen.
  • Stoler på nummeret. Brug af tal som molekylvægt, pKa, kogepunkt uden at verificere dem. Disse kan beregnes/søges deterministisk; At spørge sprogmodellen er den svageste måde.
  • Outsourcing af sikkerhed til AI. "AI sagde ikke, at det er farligt" betyder ikke, at det er sikkert. Farevurdering er menneskets og SDS's opgave.
  • Uklar prompt. Ikke at give molekylet ved dets navn, men ved dets struktur (SMILES/InChI); Dette fører til forkerte molekyler på grund af navneforvirring.
  • Tillid til kun et forsøg. At stille det samme spørgsmål igen på en anden måde og ikke kontrollere konsistensen.

Sammenfattende

  • AI er en kraftfuld skrivebordsassistent inden for kemi: den producerer kode, konturer, beskrivelser, scanningsskeletter; men laboratoriet gør det ikke og verificerer ikke dets output.
  • Der er tre iboende risici: falsk sammensætning/nummer, falsk tilskrivning, sikkerhedsfejl.
  • Adskil og kombiner generel sprogmodel og deterministiske kemiværktøjer (RDKit, databaser).
  • Tag hvert output gennem de fire trin i Struktur – Antal – Kilde – Sikkerhed.
  • God prompt: inkluderer rolle, eksplicit strukturrepræsentation, kontekst, opgave, valideringsbegrænsning.

Ansøgningsopgave

Vælg et molekyle, som du selv har undersøgt (f.eks. aspirin, SMILES: CC(=O)Oc1ccccc1C(=O)O). Spørg AI om tre ting: (1) molekylvægt, (2) to referencepapirer, (3) et syntesetrin. Bekræft derefter hver enkelt uafhængigt: beregn manuelt molekylvægten ud fra formlen, bekræft citater med DOI, undersøg syntesetrinnet med et sikkerhedsøje. Hvilket output kom korrekt ud, og hvilket krævede korrektion? Før en halvsides "bekræftelseslog."

tjekliste

  • [ ] Jeg indså, at AI er en assistent, ikke en kemiker.
  • [ ] Jeg genkender risikoen ved fremstilling, falsk tilskrivning og mistillid med eksempler.
  • [ ] Jeg kan skelne mellem sprogmodel og deterministiske kemiværktøjer.
  • [ ] Jeg vil anvende de fire trin Struktur – Antal – Kilde – Sikkerhed på hvert output.
  • [ ] Jeg beskriver molekyler ved strukturnotation (SMILES/InChI), ikke ved navn.
  • [ ] Jeg førte mindst én verifikationslog.