Gevinster:
- Kunne genkende, hvorfor kunstig intelligens laver fejl i matematik (at være en sprogmodel, ikke kontrollere logik) og de syv hovedtyper af fejl
- Evne til at forklare, hvorfor det er bydende nødvendigt at verificere hvert trin ved at forstå, at fejl udbredes, og nøjagtigheden er binær i matematik.
- Evne til at anvende en flerlags verifikationsdisciplin gennem test af sund fornuft, kontrol af størrelsesorden, kontrolsummer, krydstjek og uafhængige metoder
Denne enhed uddyber ideen i hjertet af modulet: hvorfor og hvordan laver AI fejl i matematik, hvad er typerne af disse fejl, og hvordan fanger vi dem systematisk? I tidligere enheder har vi set verifikationsmetoder for hvert emne; Her samler vi anatomien af fejl under ét tag. Pointen er, at når du ser på et AI-output, undrer du dig over "hvad kan være en fejl her?" Det er at få en valideringsmentalitet, der tænker refleksivt.
Påmindelse: en hallucination er, når en kunstig intelligens med tillid producerer information, der faktisk ikke er sand. I matematik optræder hallucinationer ofte i form af "overbevisende, men falsk". Hvorfor laver AI fejl? Fordi det er en sprogmodel, ikke en logisk motor - det vil sige, den producerer tekst med statistiske mønstre, kontrollerer den ikke den logiske gyldighed af trinene. En "3-cifret multiplikation" og et "gyldigt bevis" er for ham opgaven at fremstille den samme slags tekst; Den har ingen intern mekanisme til at garantere nøjagtighed.
Anatomi af matematiske fejl: syv typer
Den følgende liste over typer opsummerer de mest almindelige fejl, du vil støde på i AI-output, og modgiften for hver.
Fejltype
Hvordan ser det ud
modgift
regnefejl
Talfejl som 7×8=54
Lommeregner/SymPy
tegn fejl
−(a−b)=−a−b
Åbn mit navn manuelt
Opfundet sætning
ikke-eksisterende teoremnavn
Bekræftelse fra kilde
Regel forkert anvendelse
Glem ikke kædereglen
"Hvilken regel?" spørgsmål
Overspringet status
Ignorer den negative rod
Liste over alle statusser
bevisgab
"Derfor" uden begrundelse
Stiller spørgsmålstegn ved hvert pas
Gamle/forkerte data
forældede oplysninger
indkøb
Hvorfor kræver matematik særlig opmærksomhed?
På de fleste områder har en lille fejl en lille konsekvens. I matematik spreder fejl sig og vokser. En fortegnsfejl i den første linje i en ligning gør de næste ti linjer og det endelige resultat helt forkert. Et hul i midten af et bevis gør hele beviset ugyldigt. Denne "skrøbelighed" gør det nødvendigt at verificere hvert trin i matematikken - "generelt set virker sandt" er ikke nok.
Desuden er sandhed i matematik binær: et resultat er enten sandt eller falsk, der er ingen imellem. "80 procent nøjagtig" kan anses for acceptabel i et tekstresumé; Der er ikke sådan noget som "firs procent korrekt" i et integral – enten er det det korrekte resultat, eller også er det ikke. Denne dobbelte natur gør verifikation både mere kritisk og (heldigvis) mere mulig: enten består resultatet verifikation, eller også gør det ikke.
Trin for trin: disciplinen systematisk verifikation
1. Bekræft hvert numerisk resultat med et værktøj. Forlad aldrig aritmetik for at stole på AI; SymPy, lommeregner eller i hånden.
2. Tjek hvert symbolsk resultat med SymPy. Integral, afledt, forenklet, ligning - alle kan verificeres med SymPy.
3. Bekræft hver sætning/formel fra kilden. Er navn og udtryk korrekt? Opdigtede teoremer er den mest lumske fælde.
4. Sæt spørgsmålstegn ved enhver forekomst i hvert bevis. "Følger dette virkelig af det forrige trin?" Base case, implicit antagelse, gap check.
5. Tjek og modtjek. Invers drift, substitution, grænsetilstande, dimensionsanalyse.
6. Sæt det på prøve med sund fornuft. Er resultatet rimeligt? Hvis en sandsynlighed er større end 1, er der en fejl, hvis en længde er negativ.
Tip: Den hurtigste sunde fornuftstest er "orden af størrelsesorden" check. Er resultatet nogenlunde inden for det forventede interval? Hvis et klassegennemsnit er 250 (ud af 100), eller en sandsynlighed er 3,5, vil du vide, at der er en fejl uden at se på detaljerne. Denne 5-sekunders kontrol eliminerer mange latterlige resultater i opløbet.
tre minisager
Tilfælde 1 — Kædetegnsfejl. En elev fandt ud af, at i en 8-linjers algebraisk forenkling forplantede en tegnfejl, som AI’en lavede i linje 2, sig til de næste 6 linjer. Det endelige resultat var helt forkert, men AI præsenterede det med fuld tillid. Da eleven forenklede det fra bunden med SymPy, blev det korrekte resultat opnået og gjorde det muligt for AI at finde fejlen i 2. linje. Et enkelt skilt afviste 6 linjer.
Case 2 — Sund fornuft reddede testen. En lærer fik en AI til at løse et sandsynlighedsproblem; Resultatet blev 1,4. Uden at se på detaljerne sagde læreren "sandsynligheden kan ikke være større end 1" og ledte efter fejlen: AI'en havde indsamlet ikke-diskrete hændelser, som om de var diskrete. En sund fornuftstest påpegede fejlen inden for få sekunder.
Case 3 — Sammensat formel. En ingeniør bad AI om en "lukket formel" for en seriesum. AI har givet en overbevisende formel. Ingeniøren testede formlen for en lille værdi på n (n=3) både ved formel og ved håndtilsætning; Resultaterne stemte ikke overens. Formlen blev lavet. En lille justering forhindrede timers misbrug.
Fire kopierbare skabeloner
1) Anmodning om flerlagsbekræftelse:
Du fandt: [resultat]. Bekræft nu dette på TRE forskellige måder: (1) hash det omvendt, (2) test af en simpel brugerdefineret værdi, (3) noget kode for at tjekke med SymPy (jeg vil se output). Fortæl mig, om alle tre måder er konsekvente; Hvis ikke, så vis hvilket trin der har en fejl.
2) Sund fornuft/rangtest:
Du fandt: [resultat]. Sæt det på en sund fornuftstest for at se, om dette resultat er RIMELIGT: Hvad er den forventede størrelsesorden, er tegnet korrekt, er det inden for grænserne (f.eks. sandsynlighed 0-1)? Hvis det ikke er rimeligt, skal du undersøge, hvor der kan være en fejl.
3) Bekræftelse af sætning/formel:
Er den [sætning/formel], du bruger, virkelig standard og korrekt? Skriv dets standardudtryk og betingelser. Vis en konto, der tester dette med en lille stikprøve (f.eks. n=3). Hvis det er en sammensat formel eller noget, du ikke er sikker på, så sig det tydeligt.
4) Fejltilstandsdiagnose:
Jeg ved, at der er en fejl i løsningen nedenfor. Tjek disse fejltyper én efter én: aritmetik, tegn, forkert regel, oversprunget tilstand, domæne. Fortæl mig, hvilken type fejl det er, og på hvilket trin. Løsning: [her]
Svag prompt / Stærk prompt
Svag: "Er denne konklusion korrekt?" [indsæt resultatet]
Resultat: AI siger ofte "yeah right" (tendens til at bekræfte sit eget output); upålidelig, fordi der ikke er nogen uafhængig revision.
Stærkt: "TJEK dette resultat på en uafhængig måde: brug en anden løsning eller tjek med SymPy-kode (jeg kører koden). Sig ikke bare 'sandt/falsk'; vis hvilken kontrol du foretog, og resultatet. Hvis kontrolsummen mislykkes, så find fejlen."
Resultat: En uafhængig kontrolmetode udfordres; AI forhindres i blindt at godkende sit eget output.
Almindelige fejl
- At få AI til at validere sit eget output. "Er dette sandt?" AI bekræfter ofte sin egen fejl; Uafhængig metode er påkrævet.
- Springer testen over for sund fornuft over. Nonsens som sandsynlighed større end 1 og længde er negativ kan fanges uden at se på detaljerne.
- Stoler på en enkelt verifikation. Brug flere uafhængige stier (hashes + SymPy + tilpasset værdi) på kritiske resultater.
- Tester ikke formler med små prøver. Opfindte formler kollapser straks ved små værdier som n=2, n=3.
- Glemte at fejlen er spredt. En fejl i den første linje ødelægger hele resultatet; Hvis du finder en fejl, så tjek den fra begyndelsen.
Forsigtig: Der er ingen sammenhæng mellem AI'ens selvtillid og dens nøjagtighed. Den sætning, der virker mest bestemt, den mest flydende, den mest "sikre" kan meget vel være helt forkert. Stol på uafhængig verifikation, ikke tone. Overvej kun et resultat som "sandt", når du bekræfter det i hånden eller med et deterministisk værktøj - ikke fordi AI siger "sikker".
Sammenfattende
AI laver fejl i matematik, fordi det er en sprogmodel, der statistisk producerer tekst, ikke en motor, der styrer logikken. Fejl falder i syv hovedtyper: aritmetik, fortegn, sammensat sætning, fejlanvendelse af regler, udeladt kasus, bevisgab, forældede data. I matematik spredes fejl og vokser, sandheden er binær - så hvert trin skal verificeres. Systematisk disciplin: verificer hvert numerisk værktøj, hvert symbolsk resultat med SymPy, hvert sætning fra kilden, hvert bevis passerer ved at stille spørgsmål; Anvend kontrol, modkontrol og sund fornuftstest. AI's tillid er ikke bevis på nøjagtighed.
Ansøgningsopgave
Vælg et problem med en løsning af mellemlængde (mindst 6-8 trin), og få AI til at løse det. Foretag derefter flerlagsverifikation ved hjælp af mønster 1 og 4 fra denne enhed: (a) test af sund fornuft/rang, (b) kontrol med SymPy, (c) test på en speciel værdi. Gå derefter gennem løsningen linje for linje med et bevidst "bug hunt"-øje og tjek, hvilken af de syv typer fejl, der kan opstå. Registrer hver fejl, du finder, sammen med dens type.
tjekliste
- [ ] Jeg bekræftede hvert numerisk resultat med et deterministisk værktøj.
- [ ] Jeg tjekkede hvert symbolsk resultat med SymPy.
- [ ] Jeg bekræftede sætningen/formlen brugt fra kilden eller med et lille eksempel.
- [ ] Jeg anvendte testen af sund fornuft/størrelsesorden.
- [ ] Jeg reviderede det på en uafhængig måde (uden at stole på AI'ens egen godkendelse).
- [ ] Da jeg fandt en fejl, tjekkede jeg løsningen igen fra begyndelsen.