Enhet 9 / 11

Hallusinasjon, vanlige matematiske feil og verifiseringsdisiplinen

Gevinster:

  • Kunne gjenkjenne hvorfor kunstig intelligens gjør feil i matematikk (å være en språkmodell, ikke sjekke logikk) og de syv hovedtypene av feil
  • Evne til å forklare hvorfor det er viktig å verifisere hvert trinn ved å forstå at feil spres og nøyaktigheten er binær i matematikk.
  • Evne til å anvende en flerlags verifiseringsdisiplin gjennom sunn fornuftstesting, kontroll av størrelsesorden, sjekksummer, krysssjekking og uavhengige metoder

Denne enheten utdyper ideen i hjertet av modulen: hvorfor og hvordan gjør AI feil i matematikk, hva er typene av disse feilene og hvordan fanger vi dem systematisk? I tidligere enheter har vi sett verifiseringsmetoder for hvert emne; Her samler vi anatomien til feil under ett tak. Poenget er at når du ser på en AI-utgang lurer du på "hva kan være en feil her?" Det er å få en valideringsmentalitet som refleksivt tenker.

Påminnelse: en hallusinasjon er når en kunstig intelligens produserer informasjon som ikke er sann. I matematikk vises hallusinasjoner ofte i form av «overbevisende, men falsk». Hvorfor gjør AI feil? Fordi det er en språkmodell, ikke en logisk motor - det vil si at den produserer tekst med statistiske mønstre, kontrollerer den ikke den logiske gyldigheten til trinnene. En «3-sifret multiplikasjon» og et «gyldig bevis» er for ham oppgaven med å produsere samme type tekst; Den har ingen intern mekanisme for å garantere nøyaktighet.

Anatomi av matematiske feil: syv typer

Følgende liste over typer oppsummerer de vanligste feilene du vil støte på i AI-utdata og motgiften for hver.

Feiltype

Hvordan ser det ut

motgift

aritmetisk feil

Tallfeil som 7×8=54

Kalkulator/SymPy

tegn feil

−(a−b)=−a−b

Åpne navnet mitt manuelt

Oppdiktet teorem

ikke-eksisterende teoremnavn

Bekreftelse fra kilde

Regel feilanvendelse

Ikke glem kjederegelen

"Hvilken regel?" spørsmål

Hoppet over status

Ignorer den negative roten

Vis alle statuser

bevishull

«Derfor» uten begrunnelse

Stiller spørsmål ved hvert pass

Gamle/feil data

utdatert informasjon

innkjøp

Hvorfor krever matematikk spesiell oppmerksomhet?

På de fleste områder har en liten feil en liten konsekvens. I matematikk sprer feil seg og vokser. En tegnfeil i den første linjen i en ligning gjør de neste ti linjene og sluttresultatet helt feil. Et gap i midten av et bevis gjør hele beviset ugyldig. Denne "skjørheten" gjør det nødvendig å verifisere hvert trinn i matematikk - "generelt sett virker sant" er ikke nok.

Dessuten er sannhet i matematikk binær: et resultat er enten sant eller usant, det er ingen i mellom. "Åtti prosent nøyaktig" kan anses som akseptabelt i et tekstsammendrag; Det er ikke noe slikt som "åtti prosent riktig" i en integral - enten er det riktig resultat eller ikke. Denne doble naturen gjør verifisering både mer kritisk og (heldigvis) mer mulig: resultatet består enten verifisering eller ikke.

Trinn for trinn: disiplinen for systematisk verifisering

1. Bekreft hvert numerisk resultat med et verktøy. Forlat aldri aritmetikk for å stole på AI; SymPy, kalkulator eller for hånd.

2. Sjekk hvert symbolsk resultat med SymPy. Integral, derivert, forenkle, ligning – alle kan verifiseres med SymPy.

3. Bekreft hver teorem/formel fra kilden. Er navn og uttrykk korrekt? Oppdiktede teoremer er den mest lumske fellen.

4. Still spørsmål ved hver forekomst i hvert bevis. "Følger dette virkelig fra forrige trinn?" Grunntilfelle, implisitt antakelse, gap check.

5. Sjekk og motsjekk. Invers operasjon, substitusjon, grensetilstander, dimensjonsanalyse.

6. Sett den på sunn fornuftsprøve. Er resultatet rimelig? Hvis en sannsynlighet er større enn 1, er det en feil hvis en lengde er negativ.

Hint: Den raskeste sunn fornuftstesten er "orden av størrelsesorden"-sjekken. Er resultatet omtrent innenfor det forventede området? Hvis et klassegjennomsnitt er 250 (av 100), eller en sannsynlighet er 3,5, vil du vite at det er en feil uten å se på detaljene. Denne 5-sekunders sjekken eliminerer mange latterlige resultater i begynnelsen.

tre minisaker

Tilfelle 1 — Kjedetegnfeil. En student fant at i en 8-linjers algebraisk forenkling, forplantet en tegnfeil AI laget i linje 2 til de neste 6 linjene. Sluttresultatet var helt feil, men AI presenterte det med full selvtillit. Da studenten forenklet det fra bunnen av med SymPy, ble det riktige resultatet oppnådd og tillot AI å finne feilen i 2. linje. Et enkelt skilt tilbakeviste 6 linjer.

Sak 2 - Sunn fornuft reddet testen. En lærer fikk en AI til å løse et sannsynlighetsproblem; Resultatet ble 1,4. Uten å se på detaljene sa læreren "sannsynligheten kan ikke være større enn 1" og så etter feilen: AI hadde samlet ikke-diskrete hendelser som om de var diskrete. En sunn fornuftstest påpekte feilen i løpet av sekunder.

Tilfelle 3 — Sammensatt formel. En ingeniør ba AI om en "lukket formel" for en seriesum. AI har gitt en overbevisende formel. Ingeniøren testet formelen for en liten verdi på n (n=3) både ved formel og manuelt addisjon; Resultatene stemte ikke. Formelen ble laget. En liten justering forhindret timevis med misbruk.

Fire kopierbare maler

1) Flerlags bekreftelsesforespørsel:

Du fant: [resultat]. Bekreft nå dette på TRE forskjellige måter: (1) hash det i revers, (2) testing av en enkel egendefinert verdi, (3) litt kode for å sjekke med SymPy (jeg skal se utdataene). Fortell meg om alle tre måtene er konsistente; Hvis ikke, vis hvilket trinn som har en feil.

2) Sunn fornuft/rang test:

Du fant: [resultat]. Sett den på sunn fornuftstesten for å se om dette resultatet er RIMMELIG: hva er forventet størrelsesorden, er tegnet riktig, er det innenfor grensene (f.eks. sannsynlighet 0-1)? Hvis det ikke er rimelig, undersøk hvor det kan være en feil.

3) Bekreftelse av teorem/formel:

Er [setningen/formelen] du bruker virkelig standard og korrekt? Skriv standarduttrykket og betingelsene. Vis en konto som tester dette med et lite utvalg (f.eks. n=3). Hvis det er en sammensatt formel eller noe du ikke er sikker på, si det tydelig.

4) Feilmodusdiagnose:

Jeg vet at det er en feil i løsningen nedenfor. Sjekk disse feiltypene én etter én: aritmetikk, tegn, feil regel, hoppet over tilstand, domene. Fortell meg hvilken type feil det er og på hvilket trinn. Løsning: [her]

Svak forespørsel / Sterk forespørsel

Svak: "Er denne konklusjonen riktig?" [lim inn resultatet]
Resultat: AI sier ofte "yeah right" (tendens til å bekrefte sin egen produksjon); upålitelig fordi det ikke er noen uavhengig revisjon.
Sterkt: "SJEKK dette resultatet på en uavhengig måte: bruk en annen løsning eller sjekk med SymPy-kode (jeg kjører koden). Ikke bare si 'true/false'; vis hvilken sjekk du gjorde og resultatet. Hvis sjekksummen mislykkes, finn feilen."
Resultat: En uavhengig kontrollmetode utfordres; AI er forhindret fra blindt å godkjenne sin egen produksjon.

Vanlige feil

  • Få AI til å validere sin egen utgang. "Er dette sant?" AI bekrefter ofte sin egen feil; Uavhengig metode er nødvendig.
  • Hopp over sunn fornuftstesten. Tull som sannsynlighet større enn 1 og lengde som er negativ kan fanges opp uten å se på detaljene.
  • Stoler på én enkelt verifisering. Bruk flere uavhengige baner (hasher + SymPy + egendefinert verdi) på kritiske resultater.
  • Ikke tester formler med små prøver. Sammensatte formler kollapser umiddelbart ved små verdier som n=2, n=3.
  • Glemmer at feilen er forplantet. En feil i den første linjen ødelegger hele resultatet; Hvis du finner en feil, sjekk den fra begynnelsen.
Forsiktig: Det er ingen sammenheng mellom AIs selvtillit og nøyaktigheten. Den setningen som virker mest bestemt, den mest flytende, den mest "sikre" kan meget vel være helt feil. Stol på uavhengig verifisering, ikke tone. Vurder bare et resultat som "sant" når du bekrefter det for hånd eller med et deterministisk verktøy - ikke fordi AI-en sier "sikkert."

Oppsummert

AI gjør feil i matematikk fordi det er en språkmodell som statistisk produserer tekst, ikke en motor som styrer logikken. Feil faller inn i syv hovedtyper: aritmetikk, tegn, sammensatt teorem, regelfeilanvendelse, utelatt kasus, bevisgap, foreldede data. I matematikk, feil sprer seg og vokser, sannheten er binær - så hvert trinn må verifiseres. Systematisk disiplin: verifiser hvert numerisk verktøy, hvert symbolske resultat med SymPy, hvert teorem fra kilden, hvert bevis passerer ved avhør; Bruk sjekk, motsjekk og sunn fornuftstesting. AIs selvtillit er ikke bevis på nøyaktighet.

Søknadsoppgave

Velg et problem med en løsning av middels lengde (minst 6-8 trinn) og få AI til å løse det. Utfør deretter flerlagsverifisering ved å bruke mønster 1 og 4 fra denne enheten: (a) testing av sunn fornuft/rangering, (b) sjekk med SymPy, (c) testing på en spesiell verdi. Gå deretter gjennom løsningen linje for linje med et bevisst "bug hunt"-øye og sjekk hvilken av de syv typene feil som kan oppstå. Registrer hver feil du finner sammen med typen.

sjekkliste

  • [ ] Jeg bekreftet hvert numerisk resultat med et deterministisk verktøy.
  • [ ] Jeg sjekket hvert symbolske resultat med SymPy.
  • [ ] Jeg bekreftet teoremet/formelen som ble brukt fra kilden eller med et lite eksempel.
  • [ ] Jeg brukte sunn fornuft/størrelsesorden-testen.
  • [ ] Jeg reviderte det på en uavhengig måte (uten å stole på AIs egen godkjenning).
  • [ ] Da jeg fant en feil, sjekket jeg løsningen på nytt fra begynnelsen.