Eenheid 9 / 11

Hallucinatie, veelvoorkomende wiskundige fouten en de discipline van verificatie

Winst:

  • In staat zijn te herkennen waarom kunstmatige intelligentie fouten maakt in de wiskunde (een taalmodel zijn, geen logica controleren) en de zeven belangrijkste soorten fouten
  • Vermogen om uit te leggen waarom het absoluut noodzakelijk is om elke stap te verifiëren door te begrijpen dat fouten zich voortplanten en nauwkeurigheid binair is in de wiskunde.
  • Vermogen om een ​​meerlaagse verificatiediscipline toe te passen door middel van gezond verstand testen, controle van de orde van grootte, checksums, kruiscontroles en onafhankelijke methoden

Deze unit verdiept het idee dat de kern van de module vormt: waarom en hoe maakt AI fouten in de wiskunde, wat zijn de soorten van deze fouten en hoe kunnen we ze systematisch opvangen? In eerdere eenheden hebben we voor elk onderwerp verificatiemethoden gezien; Hier verzamelen we de anatomie van fouten onder één dak. Het punt is dat als je naar een AI-uitvoer kijkt, je je afvraagt: "Wat zou hier een fout kunnen zijn?" Het is het verkrijgen van een validatiementaliteit die reflexief denkt.

Ter herinnering: er is sprake van een hallucinatie wanneer een AI zelfverzekerd informatie produceert die niet echt waar is. In de wiskunde komt hallucinatie vaak voor in de vorm van 'overtuigend maar vals'. Waarom maakt AI fouten? Omdat het een taalmodel is en geen logische motor (dat wil zeggen: het produceert tekst met statistische patronen), controleert het de logische geldigheid van de stappen niet. Een "driecijferige vermenigvuldiging" en een "geldig bewijs" zijn voor hem de taak om hetzelfde soort tekst te produceren; Het heeft geen intern mechanisme om nauwkeurigheid te garanderen.

Anatomie van wiskundige fouten: zeven typen

De volgende lijst met typen vat de meest voorkomende fouten samen die u tegenkomt in AI-uitvoer en het tegengif voor elke fout.

Fouttype

Hoe ziet het eruit

tegengif

rekenkundige fout

Getalfout zoals 7×8=54

Rekenmachine/SymPy

tekenfout

−(a−b)=−a−b

Open mijn naam handmatig

Verzonnen stelling

niet-bestaande stellingnaam

Bevestiging van de bron

Verkeerde toepassing van regels

Vergeet de kettingregel niet

"Welke regel?" vraag

Status overgeslagen

Negeer de negatieve wortel

Lijst met alle statussen

bewijslacune

"Daarom" zonder rechtvaardiging

Elke pas in twijfel trekken

Oude/onjuiste gegevens

verouderde informatie

inkoop

Waarom heeft wiskunde speciale aandacht nodig?

Op de meeste gebieden heeft een kleine fout een klein gevolg. In de wiskunde verspreiden en groeien fouten. Een tekenfout in de eerste regel van een vergelijking zorgt ervoor dat de volgende tien regels en het eindresultaat volledig verkeerd zijn. Een gat in het midden van een bewijs maakt het hele bewijs ongeldig. Deze ‘fragiliteit’ maakt het noodzakelijk om elke stap in de wiskunde te verifiëren – ‘lijkt in het algemeen waar’ is niet genoeg.

Bovendien is de waarheid in de wiskunde binair: een resultaat is waar of onwaar, er is geen tussenweg. "Tachtig procent nauwkeurig" kan in een tekstsamenvatting als acceptabel worden beschouwd; Er bestaat niet zoiets als 'tachtig procent correct' in een integraal: het is het juiste resultaat, of het is het niet. Deze tweeledige aard maakt verificatie zowel kritischer als (gelukkig) beter mogelijk: het resultaat voldoet aan de verificatie of niet.

Stap voor stap: de discipline van systematische verificatie

1. Bevestig elk numeriek resultaat met een hulpmiddel. Laat de rekenkunde nooit over aan AI; SymPy, rekenmachine of met de hand.

2. Controleer elk symbolisch resultaat met SymPy. Integraal, afgeleid, vereenvoudigd, vergelijking: alles kan worden geverifieerd met SymPy.

3. Bevestig elke stelling/formule uit de bron. Zijn de naam en uitdrukking correct? Verzonnen stellingen zijn de meest verraderlijke valstrik.

4. Trek elke gebeurtenis in elk bewijs in twijfel. “Volgt dit werkelijk uit de vorige stap?” Basisscenario, impliciete aanname, gap-check.

5. Controle en tegencontrole. Omgekeerde werking, substitutie, grenstoestanden, dimensionale analyse.

6. Stel het op de proef met het gezond verstand. Is het resultaat redelijk? Als een waarschijnlijkheid groter is dan 1, is er sprake van een fout als een lengte negatief is.

Tip: De snelste test op gezond verstand is de controle van de "orde van grootte". Ligt het resultaat ongeveer binnen het verwachte bereik? Als het klassegemiddelde 250 (van de 100) is, of de waarschijnlijkheid 3,5, weet je dat er een fout is zonder naar de details te kijken. Deze controle van 5 seconden elimineert veel belachelijke resultaten in de kiem.

drie minikoffers

Geval 1 — Kettingtekenfout. Eén student ontdekte dat bij een algebraïsche vereenvoudiging van 8 regels een tekenfout die de AI in regel 2 maakte, zich voortplantte naar de volgende 6 regels. Het eindresultaat was volkomen verkeerd, maar de AI presenteerde het met het volste vertrouwen. Toen de student het helemaal opnieuw vereenvoudigde met SymPy, werd het juiste resultaat verkregen en kon de AI de fout in de 2e regel vinden. Eén enkel bord weerlegde 6 regels.

Geval 2 – Gezond verstand redde de test. Een leraar liet een AI een waarschijnlijkheidsprobleem oplossen; Het resultaat was 1,4. Zonder naar de details te kijken, zei de leraar "de waarschijnlijkheid kan niet groter zijn dan 1" en zocht naar de fout: de AI had niet-discrete gebeurtenissen verzameld alsof ze discreet waren. Een test met gezond verstand bracht de fout binnen enkele seconden aan het licht.

Geval 3 — Samengestelde formule. Een ingenieur vroeg de AI om een ​​‘gesloten formule’ voor een seriebedrag. AI heeft een overtuigende formule gegeven. De ingenieur testte de formule voor een kleine waarde van n (n=3), zowel door formule als door handmatige optelling; De resultaten kwamen niet overeen. De formule was verzonnen. Een kleine aanpassing voorkwam urenlang misbruik.

Vier kopieerbare sjablonen

1) Verzoek om meerlaagse verificatie:

Je hebt gevonden: [resultaat]. Controleer dit nu op DRIE verschillende manieren: (1) het in omgekeerde volgorde hashen, (2) het testen van een eenvoudige aangepaste waarde, (3) een code om te controleren met SymPy (ik zal de uitvoer zien). Vertel me of alle drie de manieren consistent zijn; Zo niet, laat dan zien welke stap een fout bevat.

2) Gezond verstand/rangtest:

Je hebt gevonden: [resultaat]. Test het met gezond verstand om te zien of dit resultaat REDELIJK is: wat is de verwachte orde van grootte, klopt het teken, ligt het binnen de grenzen (bijvoorbeeld waarschijnlijkheid 0-1)? Als het niet redelijk is, onderzoek dan waar er mogelijk een fout is gemaakt.

3) Bevestiging van stelling/formule:

Is de [stelling/formule] die je gebruikt echt standaard en correct? Schrijf de standaardexpressie en voorwaarden ervan. Laat een account zien dat dit test met een kleine steekproef (bijvoorbeeld n=3). Als het een verzonnen formule is of iets waar je niet zeker van bent, zeg het dan duidelijk.

4) Diagnose van de foutmodus:

Ik weet dat er een bug zit in de onderstaande oplossing. Controleer deze fouttypen één voor één: rekenkunde, teken, verkeerde regel, overgeslagen voorwaarde, domein. Vertel me wat voor soort fout het is en bij welke stap. Oplossing: [hier]

Zwakke prompt/sterke prompt

Zwak: "Is deze conclusie juist?" [plak het resultaat]
Resultaat: AI zegt vaak ‘ja, goed’ (neiging om zijn eigen output te bevestigen); onbetrouwbaar omdat er geen onafhankelijke audit is.
Strong: "CHECK dit resultaat op een onafhankelijke manier: gebruik een andere oplossing of controleer het met SymPy-code (ik voer de code uit). Zeg niet alleen 'waar/onwaar'; laat zien welke controle je hebt gedaan en wat het resultaat is. Als de controlesom mislukt, zoek dan de fout."
Resultaat: Een onafhankelijke controlemethode wordt uitgedaagd; Er wordt voorkomen dat de AI blindelings haar eigen output goedkeurt.

Veel voorkomende fouten

  • De AI zover krijgen dat hij zijn eigen output valideert. "Is dit waar?" AI bevestigt vaak zijn eigen fout; Een onafhankelijke methode is vereist.
  • De gezond verstand-test overslaan. Onzin zoals een waarschijnlijkheid groter dan 1 en een negatieve lengte kunnen worden opgemerkt zonder naar de details te kijken.
  • Vertrouwend op één enkele verificatie. Gebruik meerdere onafhankelijke paden (hashes + SymPy + aangepaste waarde) voor kritieke resultaten.
  • Formules niet testen met kleine monsters. Verzonnen formules vallen onmiddellijk uiteen bij kleine waarden zoals n=2, n=3.
  • Vergeten dat de bug wordt verspreid. Een fout in de eerste regel bederft het hele resultaat; Als u een fout ontdekt, controleer deze dan vanaf het begin.
Let op: er is geen correlatie tussen het vertrouwen van de AI en de nauwkeurigheid ervan. De zin die het meest vastberaden, het meest vloeiend en het meest 'zeker' lijkt, kan heel goed volkomen verkeerd zijn. Vertrouw op onafhankelijke verificatie, niet op toon. Beschouw een resultaat alleen als ‘waar’ als je het met de hand of met een deterministisch hulpmiddel bevestigt – niet omdat de AI ‘zeker’ zegt.

Samengevat

AI maakt fouten in de wiskunde omdat het een taalmodel is dat statistisch tekst produceert, en niet een motor die de logica controleert. Er zijn zeven hoofdtypen fouten: rekenkunde, teken, verzonnen stelling, onjuiste toepassing van regels, weggelaten hoofdlettergebruik, bewijshiaat, verouderde gegevens. In de wiskunde verspreiden en groeien fouten, de waarheid is binair – dus elke stap moet worden geverifieerd. Systematische discipline: verifieer elk numeriek hulpmiddel, elk symbolisch resultaat met SymPy, elke stelling uit de bron, elk bewijs dat voorbijgaat door vragen te stellen; Pas controle, tegencontrole en gezond verstand testen toe. Het vertrouwen van AI is geen bewijs van nauwkeurigheid.

Applicatie taak

Kies een probleem met een oplossing van gemiddelde lengte (minstens 6-8 stappen) en laat de AI het oplossen. Voer vervolgens meerlaagse verificatie uit met behulp van de patronen 1 en 4 uit dit blok: (a) testen op basis van gezond verstand/rangschikking, (b) controleren met SymPy, (c) testen op een speciale waarde. Bekijk vervolgens de oplossing regel voor regel met een doelbewust “bug-hunt”-oog en controleer welke van de zeven soorten fouten kunnen optreden. Noteer elke fout die u tegenkomt, samen met het type ervan.

controlelijst

  • [ ] Ik bevestigde elk numeriek resultaat met een deterministisch hulpmiddel.
  • [ ] Ik controleerde elk symbolisch resultaat met SymPy.
  • [ ] Ik heb de gebruikte stelling/formule geverifieerd vanuit de bron of met een klein voorbeeld.
  • [ ] Ik heb de test van het gezond verstand/de orde van grootte toegepast.
  • [ ] Ik heb het op een onafhankelijke manier gecontroleerd (zonder te vertrouwen op de eigen goedkeuring van de AI).
  • [ ] Toen ik een fout ontdekte, heb ik de oplossing vanaf het begin opnieuw gecontroleerd.