Enhet 1 / 11

Introduksjon til kunstig intelligens i kjemi: roller, grenser, validering og etikk

Gevinster:

  • Å kunne skille hvor kunstig intelligens sparer tid i kjemiarbeidsflyten (idé, design, analyse, rapportering) og hvor struktur, antall, ressurs- og sikkerhetsbeslutninger overlates til mennesker, avhengig av risikonivå.
  • Evne til å bruke en disiplin som uavhengig kontrollerer hver utgang med de fire trinnene Structure-Number-Resource-Security
  • Forstå hvorfor sammensatte forbindelser og tall, falske referanser og sikkerhetsmisoppfatninger er risikoer for dette yrket som må vurderes helt fra begynnelsen.

Kjemi er en eksperimentell vitenskap som studerer strukturen, transformasjonen og egenskapene til materie. En kjemiker veier, løser opp, varmer og måler i laboratoriet; Ved skrivebordet tegner han molekyler, planlegger reaksjoner, tolker spektre, skanner litteraturen og skriver rapporter. Kunstig intelligens (forkortet AI, her spesifikt programvare som genererer tekst ved å forutsi det "neste mest sannsynlige ordet", trent på en stor språkmodell, det vil si massive tekstdata) kan dramatisk fremskynde mange av disse skrivebordsjobbene. Men den bygger ikke selve laboratoriet, den leser ikke skalaene, og viktigst av alt: den bekrefter ikke noen tall, formler eller sitater den produserer på dine vegne. Denne modulen lærer hvordan du bruker AI i kjemi ende-til-ende, men ansvarlig.

I denne første enheten vil jeg plante én idé i tankene dine: AI er en assistent i kjemi, ikke en kjemiker. Skriver kode, produserer konturer, bygger retrosyntese-rammeverk, hjelper til med å tolke spektertopper, oppsummerer litteratur. Det er imidlertid den kompetente kjemikeren som bestemmer om molekylet faktisk kan syntetiseres, om en reaksjon er trygg eller ikke, om en referanse er ekte eller ikke, og det endelige ansvaret.

Hvor passer AI inn i arbeidsflyten for kjemi?

La oss grovt dele et kjemiprosjekt inn i fem faser: (1) idé og litteratur, (2) molekyl- og reaksjonsdesign, (3) laboratorieapplikasjon, (4) analyse og karakterisering, (5) rapportering. AI har svært forskjellige verdier på disse stadiene.

  • Ideer og litteratur: AI oppsummerer raskt et emne, forklarer nøkkelbegreper, genererer søkeord. Men han kan finne på attribusjon; Vi vil se dette om et øyeblikk.
  • Design: Genererer SMILES (en form for å skrive molekylet som en tekststreng; mer om det senere), foreslår retrosyntesetrinn, viser reaktive alternativer. Forslaget er bra, ingen garanti.
  • Laboratorium: AI gjør ingenting her. Veiing, oppvarming og sikkerhetstiltak utføres av mennesker. AI hjelper bare med å skrive prosedyren; Før du utfører denne prosedyren, må et menneske overvåke det for sikkerhets skyld.
  • Analyse: Ved tolkning av NMR, IR, massespektrum (dette er måleteknikker som viser strukturen til molekylet), hjelper YZ med å gruppere toppene og liste opp mulige strukturer. Den siste oppgaven er din.
  • Rapportering: Produserer eksperimentell notatbok, artikkelutkast, sikkerhetsskjemautkast. Den er veldig kraftig; men tallene bør samsvare med dine.
Tips: Det sikreste stedet å bruke AI er i "hvis noe går galt, vil det bli lagt merke til og fikset umiddelbart": tekstutkast, kodeskjelett, termbeskrivelse. De mest risikofylte stedene er områdene "hvis det er usant, sprer det seg stille": konstanter, referanser, sikkerhetspåstander, numeriske resultater.

Hvorfor må vi være forsiktige? Tre strukturelle risikoer

Den store språkmodellen er ikke en kalkulator eller en kjemimotor. Produserer tekst som statistisk "ser sannsynlig ut". Dette fører til tre konkrete risikoer innen kjemi:

  1. Laget opp (hallusinasjon): Kan trygt skrive ned en forbindelse som ikke er en modell, en reaksjon som ikke eksisterer eller en feil molekylvekt. For eksempel står det "Molekylvekten til forbindelse X er 154,2 g/mol", mens den riktige verdien er 168,2.
  2. Falsk sitering: Kan gi en kilde som ser realistisk ut, men som ikke eksisterer i det hele tatt, for eksempel "Smith et al., 2019, Journal of Organic Chemistry." Han kan til og med lage et DOI-nummer.
  3. Sikkerhetsfeil: Kan presentere en farlig kombinasjon av reagenser (f.eks. et oksidasjonsmiddel og et organisk løsningsmiddel i et upassende forhold) som "ikke noe problem".

Disse tre risikoene vil dukke opp igjen og igjen i hver enhet i denne modulen. Løsningen er ikke å flykte fra AI, men å etablere disiplinen med å verifisere hver utgang med en uavhengig kilde.

minisaker

Tilfelle 1 — Tilpasset molekylvekt. En doktorgradsstudent spurte AI om molekylvekten for para-nitrofenol. "139,11 g/mol," sa AI. Eleven var selvsikker og planla å veie 6,96 g for 0,05 mol. Imidlertid er molekylvekten til para-nitrofenol 139,11 g/mol, og denne gangen var det riktig - men studenten hadde aldri sjekket. På den neste forbindelsen (para-aminofenol, faktisk verdi 109,13 g/mol) sa YZ "123,15"; Denne gangen fanget studenten det ved å regne det ut for hånd fra formelen (C6H7NO2): 6×12.011 + 7×1.008 + 14.007 + 2×15.999 = 109.13. Leksjon: beregn hver molekylvekt uten formel.

Sak 2 – Falsk DOI. En forsker ba AI om 5 kilder i sin litteraturgjennomgang. DOI-en til to av de fem returnerte "ikke funnet" når den ble klikket; Overskriftene var saklige, men artiklene var det ikke. Bortkastet tid 40 minutter. Leksjon: ikke hver sitering skal brukes uten verifisering i databasen (DOI, PubMed, Reaxys).

Tilfelle 3 — Fare som virker trygg. En bruker spurte AI om en rengjøringsprosedyre; AI ga indirekte et forslag om å blande en hypoklorittholdig løsning med en sur løsning - en kombinasjon som kunne frigjøre klorgass. Heldigvis så brukeren på sikkerhetsdatabladet (SDS) og stoppet. Leksjon: hver prosedyre er menneskeinspisert for SDS og fare før den implementeres.

Svak forespørsel / Sterk forespørsel

Svak melding:

Syntetiser dette molekylet.

Denne påstanden er vag: hvilket molekyl, hvilke utgangsmaterialer, hvilken skala, hvilke begrensninger? AI utgjør hullene.

Kraftig ledetekst:

Rolle: Du er en erfaren assistent innen organisk syntese. Målmolekyl: 4-metoksyacetofenon (SMIL: COc1ccc(cc1)C(C)=O). Vi har anisol som utgangsmateriale. Oppgave: Gi et 2-trinns retrosynteseforslag. For hvert trinn: reagenser, forhold (temperatur, løsemiddel) og MULIG sidereaksjoner. Begrensning: Merk "VERIFY" der du ikke er sikker, passende. Utgang: nummererte trinn + liste over punkter som skal verifiseres.

Forskjell: rolle, eksakt mål (med SMILES), kontekst, antall trinn, utdataformat og "tilpasning"-begrensning. Dette er de fem komponentene for god tilskyndelse i kjemi: rolle, presis strukturrepresentasjon, kontekst, oppgave, verifikasjonsbegrensning.

Typer AI-verktøy: språkmodell eller kjemiverktøy?

I kjemi møter du to forskjellige "AI", og det er viktig å ikke forveksle dem:

Sjanger

Hva gjør

pålitelighet

Eksempel på bruk

Generell språkmodell

Generer tekst/kode, forklarer, skriver utkast

Lavt på tall, høyt på språk

Prosedyreoversikt, terminologiforklaring

Kjemibibliotek (RDKit etc.)

Behandler molekylet deterministisk, beregner molekylvekten

Høy (regelbasert)

SMILES-verifisering, MA-konto

Egendefinert prediksjonsmodell (retrosyntese, funksjon)

Gir datatrent prediksjon

Middels, avhengig av område

Retrosyntese, estimering av løselighet

Litteratur/søkeverktøy

Ekte databasespørringer

Høy avhengig av kilde

Attribusjonsbekreftelse, reaksjonssøk

Den mest robuste arbeidsflyten kombinerer disse: språkmodellen genererer ideen, kjemibiblioteket beregner antallet deterministisk, litteraturverktøyet verifiserer attribusjonen, mennesket validerer. Vi vil etablere denne kjeden i de neste enhetene.

Verifikasjonsdisiplin: FIRE trinn

Ta hver AI-utgang gjennom disse fire trinnene før du går inn i laboratoriet eller rapporten:

  1. Struktur: Er molekyl-/reaksjonsnotasjonen (SMILES/InChI) gyldig? Kan det analyseres med et verktøy (RDKit)?
  2. Antall: Er molekylvekt, støkiometri, utbytteberegning verifisert uavhengig (for hånd eller bibliotek)?
  3. Kilde: Har hver påstand og attribusjon blitt verifisert i en ekte database?
  4. Sikkerhet: Har SDS blitt lest for hver reagens i prosedyren, er det noen farlige kombinasjoner?
Merk: Disse fire trinnene gjelder "alltid", ikke "noen ganger". 20 situasjoner der AI er riktig, unnskylder ikke 1 situasjon der den er feil; fordi i kjemi kan den ene situasjonen være en eksplosjon, forgiftning eller en tilbaketrukket artikkel.

Vanlige feil

  • Å ta feil av AI-utgangen som en "ressurs". AI er ikke en ressurs, men en generator som prøver å huske ressurser (noen ganger feil). Det er kildedatabasen.
  • Stoler på nummeret. Bruke tall som molekylvekt, pKa, kokepunkt uten å verifisere dem. Disse kan beregnes/søkes deterministisk; Å spørre språkmodellen er den svakeste måten.
  • Outsourcing av sikkerhet til AI. "AI sa ikke at det er farlig" betyr ikke at det er trygt. Farevurdering er jobben til mennesket og SDS.
  • Uklar spørsmål. Ikke gi molekylet ved navn, men ved struktur (SMILES/InChI); Dette fører til feil molekyler på grunn av navneforvirring.
  • Stoler på bare ett forsøk. Stille det samme spørsmålet igjen på en annen måte og ikke sjekke konsistensen.

Oppsummert

  • AI er en kraftig skrivebordsassistent innen kjemi: den produserer kode, konturer, beskrivelser, skanner skjeletter; men laboratoriet gjør det ikke og verifiserer ikke resultatet.
  • Det er tre iboende risikoer: falsk sammensetning/nummer, falsk attribusjon, sikkerhetsfeil.
  • Skill og kombiner generell språkmodell og deterministiske kjemiverktøy (RDKit, databaser).
  • Ta hver utgang gjennom de fire trinnene Struktur – Antall – Kilde – Sikkerhet.
  • God forespørsel: inkluderer rolle, eksplisitt strukturrepresentasjon, kontekst, oppgave, valideringsbegrensning.

Søknadsoppgave

Velg et molekyl du har studert selv (f.eks. aspirin, SMILES: CC(=O)Oc1ccccc1C(=O)O). Spør AI om tre ting: (1) molekylvekt, (2) to referansepapirer, (3) et syntesetrinn. Bekreft deretter hver enkelt uavhengig: beregn manuelt molekylvekten fra formelen, bekreft siteringer med DOI, undersøk syntesetrinnet med et sikkerhetsøye. Hvilken utgang kom riktig ut og hvilken krevde korrigering? Hold en halvsides «verifiseringslogg».

sjekkliste

  • [ ] Jeg innså at AI er en assistent, ikke en kjemiker.
  • [ ] Jeg gjenkjenner risikoen for fabrikasjon, falsk tilskrivning og mistillit med eksempler.
  • [ ] Jeg kan skille mellom språkmodell og deterministiske kjemiverktøy.
  • [ ] Jeg vil bruke de fire trinnene Struktur – Antall – Kilde – Sikkerhet på hver utgang.
  • [ ] Jeg beskriver molekyler ved strukturnotasjon (SMILES/InChI), ikke ved navn.
  • [ ] Jeg førte minst én bekreftelseslogg.