Vinster:
- Kunna känna igen varför artificiell intelligens gör misstag i matematik (att vara en språkmodell, inte kontrollera logik) och de sju huvudtyperna av fel
- Förmåga att förklara varför det är absolut nödvändigt att verifiera varje steg genom att förstå att fel sprids och att noggrannheten är binär i matematik.
- Förmåga att tillämpa en mångskiktad verifieringsdisciplin genom testning av sunt förnuft, kontroll av storleksordning, kontrollsummor, korskontroll och oberoende metoder
Denna enhet fördjupar idén i hjärtat av modulen: varför och hur gör AI misstag i matematik, vilka typer av dessa misstag finns och hur fångar vi dem systematiskt? I tidigare enheter har vi sett verifieringsmetoder för varje ämne; Här samlar vi anatomin av fel under ett tak. Poängen är att när du tittar på en AI-utgång undrar du "vad kan vara ett misstag här?" Det är att få en valideringsmentalitet som reflexmässigt tänker.
Påminnelse: en hallucination är när en AI med tillförsikt producerar information som faktiskt inte är sann. Inom matematiken uppträder hallucinationer ofta i form av "övertygande men falskt". Varför gör AI misstag? Eftersom det är en språkmodell, inte en logisk motor - det vill säga att den producerar text med statistiska mönster, kontrollerar den inte den logiska giltigheten av stegen. En "3-siffrig multiplikation" och ett "giltigt bevis" är för honom uppgiften att producera samma typ av text; Den har ingen intern mekanism för att garantera noggrannhet.
Anatomi av matematiska fel: sju typer
Följande lista över typer sammanfattar de vanligaste felen du kommer att stöta på i AI-utdata och motgiften för var och en.
Typ av fel
Hur ser det ut
motgift
räknefel
Talfel som 7×8=54
Miniräknare/SymPy
teckenfel
−(a−b)=−a−b
Öppna mitt namn manuellt
Påhittad teorem
icke-existerande satsnamn
Bekräftelse från källa
Regel felaktig tillämpning
Glöm inte kedjeregeln
"Vilken regel?" fråga
Överhoppad status
Ignorera den negativa roten
Lista alla statusar
bevisglapp
"Därför" utan motivering
Ifrågasätter varje pass
Gamla/felaktiga uppgifter
föråldrad information
inköp
Varför kräver matematik särskild uppmärksamhet?
På de flesta områden har ett litet misstag en liten konsekvens. I matematik sprider sig fel och växer. Ett teckenfel i den första raden i en ekvation gör de följande tio raderna och slutresultatet helt fel. En lucka i mitten av ett bevis gör hela beviset ogiltigt. Denna "bräcklighet" gör det nödvändigt att verifiera varje steg i matematiken - "allmänt sett verkar sant" är inte tillräckligt.
Dessutom är sanningen i matematik binär: ett resultat är antingen sant eller falskt, det finns inget däremellan. "Åttio procent korrekt" kan anses acceptabelt i en textsammanfattning; Det finns inget som heter "åttio procent korrekt" i en integral – antingen är det det korrekta resultatet eller så är det inte det. Denna dubbla natur gör verifiering både mer kritisk och (lyckligtvis) mer möjlig: resultatet antingen klarar verifieringen eller så gör det inte det.
Steg för steg: disciplinen systematisk verifiering
1. Bekräfta varje numeriskt resultat med ett verktyg. Lämna aldrig aritmetik för att lita på AI; SymPy, miniräknare eller för hand.
2. Kontrollera varje symboliskt resultat med SymPy. Integral, derivativ, förenkla, ekvation – allt kan verifieras med SymPy.
3. Bekräfta varje sats/formel från källan. Stämmer namnet och uttrycket? Påhittade satser är den mest lömska fällan.
4. Ifrågasätt varje händelse i varje bevis. "Följer detta verkligen från föregående steg?" Basfall, implicit antagande, gapkontroll.
5. Kontrollera och motkontroll. Omvänd operation, substitution, gränstillstånd, dimensionsanalys.
6. Sätt det på provet för sunt förnuft. Är resultatet rimligt? Om en sannolikhet är större än 1, finns det ett fel om en längd är negativ.
Tips: Det snabbaste sunt förnuftstestet är "orden av storleksordning"-kontrollen. Är resultatet ungefär inom det förväntade intervallet? Om ett klassmedelvärde är 250 (av 100), eller en sannolikhet är 3,5, vet du att det finns ett fel utan att titta på detaljerna. Denna 5-sekunderskontroll eliminerar många löjliga resultat i sin linda.
tre minifodral
Fall 1 — Kedjeteckenfel. En elev fann att i en 8-rads algebraisk förenkling spred sig ett teckenfel som AI gjorde i rad 2 till de nästa 6 raderna. Slutresultatet var helt fel, men AI presenterade det med fullständigt självförtroende. När eleven förenklade det från grunden med SymPy, erhölls det korrekta resultatet och tillät AI att hitta felet på den andra raden. En enda skylt motbevisade 6 rader.
Fall 2 – Sunt förnuft räddade testet. En lärare fick en AI att lösa ett sannolikhetsproblem; Resultatet blev 1,4. Utan att titta på detaljerna sa läraren "sannolikheten kan inte vara större än 1" och letade efter felet: AI:n hade samlat in icke-diskreta händelser som om de var diskreta. Ett sunt förnuftstest påpekade felet inom några sekunder.
Fall 3 — Sammanställd formel. En ingenjör bad AI om en "sluten formel" för en seriesumma. AI har gett en övertygande formel. Ingenjören testade formeln för ett litet värde på n (n=3) både genom formel och manuell addition; Resultaten stämde inte. Formeln var påhittad. Lite justeringar förhindrade timmar av missbruk.
Fyra kopierbara mallar
1) Begäran om flerskiktsverifiering:
Du hittade: [resultat]. Verifiera nu detta på TRE olika sätt: (1) hasha det omvänt, (2) testa ett enkelt anpassat värde, (3) lite kod för att kontrollera med SymPy (jag kommer att se resultatet). Berätta om alla tre sätten är konsekventa; Om inte, visa vilket steg som har ett fel.
2) Sunt förnuft/rank test:
Du hittade: [resultat]. Testa sunt förnuft för att se om detta resultat är RIMLIGT: vad är den förväntade storleksordningen, är tecknet korrekt, är det inom gränserna (t.ex. sannolikhet 0-1)? Om det inte är rimligt, undersök var det kan vara fel.
3) Bekräftelse av sats/formel:
Är [satsen/formeln] du använder verkligen standard och korrekt? Skriv dess standarduttryck och villkor. Visa ett konto som testar detta med ett litet urval (t.ex. n=3). Om det är en påhittad formel eller något du inte är säker på, säg det tydligt.
4) Diagnos av felläge:
Jag vet att det finns en bugg i lösningen nedan. Kontrollera dessa feltyper en efter en: aritmetik, tecken, fel regel, överhoppat villkor, domän. Berätta för mig vilken typ av fel det är och i vilket steg. Lösning: [här]
Svag prompt / Stark prompt
Svag: "Är denna slutsats korrekt?" [klistra in resultatet]
Resultat: AI säger ofta "yeah right" (tendens att bekräfta sin egen produktion); opålitliga eftersom det inte finns någon oberoende revision.
Starkt: "KONTROLLERA det här resultatet på ett oberoende sätt: använd en annan lösning eller kontrollera med SymPy-kod (jag kör koden). Säg inte bara 'sant/falskt'; visa vilken kontroll du gjorde och resultatet. Om kontrollsumman misslyckas, hitta felet."
Resultat: En oberoende kontrollmetod utmanas; AI hindras från att blint godkänna sin egen produktion.
Vanliga misstag
- Få AI:n att validera sin egen utdata. "Är detta sant?" AI bekräftar ofta sitt eget misstag; Oberoende metod krävs.
- Hoppa över sunt förnuftstestet. Nonsens som att sannolikheten är större än 1 och att längden är negativ kan fångas utan att titta på detaljerna.
- Förlitar sig på en enda verifiering. Använd flera oberoende sökvägar (hashar + SymPy + anpassat värde) för kritiska resultat.
- Testar inte formler med små prover. Påhittade formler kollapsar omedelbart vid små värden som n=2, n=3.
- Att glömma att buggen sprids. Ett fel i den första raden förstör hela resultatet; Om du hittar ett fel, kontrollera det från början.
Varning: Det finns ingen korrelation mellan AI:s självförtroende och dess noggrannhet. Den mening som verkar mest bestämd, mest flytande, mest "säkra" kan mycket väl vara helt fel. Lita på oberoende verifiering, inte ton. Betrakta endast ett resultat som "sant" när du bekräftar det för hand eller med ett deterministiskt verktyg - inte för att AI:n säger "säker".
Sammanfattningsvis
AI gör misstag i matematik eftersom det är en språkmodell som statistiskt producerar text, inte en motor som styr logiken. Fel delas in i sju huvudtyper: aritmetik, tecken, påhittad sats, felaktig tillämpning av regeln, utelämnad kasus, bevisglapp, inaktuella data. I matematik sprider sig och växer fel, sanningen är binär - så varje steg måste verifieras. Systematisk disciplin: verifiera varje numeriskt verktyg, varje symboliskt resultat med SymPy, varje teorem från källan, varje bevis passerar genom att ifrågasätta; Tillämpa kontroll, motkontroll och test av sunt förnuft. AI:s självförtroende är inte bevis på riktighet.
Applikationsuppgift
Välj ett problem med en lösning av medellängd (minst 6-8 steg) och låt AI:n lösa det. Gör sedan flerskiktsverifiering med hjälp av mönster 1 och 4 från denna enhet: (a) sunt förnuft/rank test, (b) kontrollera med SymPy, (c) testa på ett speciellt värde. Gå sedan igenom lösningen rad för rad med ett avsiktligt "buggjakt"-öga och kontrollera vilka av de sju typerna av fel som kan uppstå. Registrera varje fel du hittar tillsammans med dess typ.
checklista
- [ ] Jag bekräftade varje numeriskt resultat med ett deterministiskt verktyg.
- [ ] Jag kontrollerade varje symboliskt resultat med SymPy.
- [ ] Jag verifierade satsen/formeln från källan eller med ett litet exempel.
- [ ] Jag tillämpade testet för sunt förnuft/storleksordning.
- [ ] Jag granskade det på ett oberoende sätt (utan att förlita mig på AI:s eget godkännande).
- [ ] När jag hittade ett fel, kollade jag om lösningen från början.