Einheit 9 / 11

Halluzination, häufige mathematische Fehler und die Disziplin der Verifikation

Gewinne:

  • Erkennen Sie, warum künstliche Intelligenz in der Mathematik Fehler macht (da sie ein Sprachmodell ist und nicht die Logik überprüft) und welche sieben Hauptfehlertypen es gibt
  • Fähigkeit zu erklären, warum es unbedingt erforderlich ist, jeden Schritt zu überprüfen, indem man versteht, dass sich Fehler ausbreiten und Genauigkeit in der Mathematik binär ist.
  • Fähigkeit, eine mehrschichtige Verifizierungsdisziplin durch Tests mit gesundem Menschenverstand, Größenordnungsprüfung, Prüfsummen, Gegenprüfungen und unabhängige Methoden anzuwenden

Diese Einheit vertieft die Idee, die dem Modul zugrunde liegt: Warum und wie macht KI Fehler in der Mathematik, welche Arten dieser Fehler gibt es und wie erkennen wir sie systematisch? In den vorherigen Einheiten haben wir Verifizierungsmethoden für jedes Thema gesehen; Hier fassen wir die Anatomie von Fehlern unter einem Dach zusammen. Der Punkt ist, wenn man sich eine KI-Ausgabe ansieht, fragt man sich: „Was könnte hier ein Fehler sein?“ Es geht darum, eine Validierungsmentalität zu erlangen, die reflexiv denkt.

Zur Erinnerung: Von einer Halluzination spricht man, wenn eine KI selbstbewusst Informationen produziert, die eigentlich nicht wahr sind. In der Mathematik erscheint Halluzination oft in der Form „überzeugend, aber falsch“. Warum macht KI Fehler? Da es sich um ein Sprachmodell und nicht um eine Logikmaschine handelt – das heißt, es erzeugt Text mit statistischen Mustern – prüft es nicht die logische Gültigkeit der Schritte. Eine „dreistellige Multiplikation“ und ein „gültiger Beweis“ sind für ihn die Aufgabe, einen gleichartigen Text herzustellen; Es gibt keinen internen Mechanismus, der die Genauigkeit garantiert.

Anatomie mathematischer Fehler: sieben Arten

Die folgende Typenliste fasst die häufigsten Fehler zusammen, die bei der KI-Ausgabe auftreten, sowie die entsprechenden Gegenmittel.

Fehlertyp

Wie sieht es aus?

Gegenmittel

Rechenfehler

Zahlenfehler wie 7×8=54

Rechner/SymPy

Vorzeichenfehler

−(a−b)=−a−b

Öffnen Sie meinen Namen manuell

Erfundener Satz

nicht existierender Theoremname

Bestätigung der Quelle

Falsche Anwendung der Regeln

Vergessen Sie nicht die Kettenregel

„Welche Regel?“ Frage

Übersprungener Status

Ignorieren Sie die negative Wurzel

Listen Sie alle Status auf

Beweislücke

„Daher“ ohne Begründung

Hinterfrage jeden Durchgang

Alte/falsche Daten

veraltete Informationen

Beschaffung

Warum erfordert Mathematik besondere Aufmerksamkeit?

In den meisten Bereichen hat ein kleiner Fehler eine kleine Konsequenz. In der Mathematik breiten sich Fehler aus und nehmen zu. Ein Vorzeichenfehler in der ersten Zeile einer Gleichung führt dazu, dass die nächsten zehn Zeilen und das Endergebnis völlig falsch sind. Eine Lücke in der Mitte eines Beweises macht den gesamten Beweis ungültig. Diese „Zerbrechlichkeit“ macht es notwendig, jeden Schritt in der Mathematik zu überprüfen – „im Großen und Ganzen scheint es wahr“ reicht nicht aus.

Darüber hinaus ist die Wahrheit in der Mathematik binär: Ein Ergebnis ist entweder wahr oder falsch, es gibt kein Dazwischen. „Achtzig Prozent genau“ kann in einer Textzusammenfassung als akzeptabel angesehen werden; So etwas wie „achtzig Prozent richtig“ gibt es bei einem Integral nicht – entweder ist es das richtige Ergebnis oder es ist es nicht. Diese Doppelnatur macht die Überprüfung sowohl kritischer als auch (glücklicherweise) möglicher: Entweder besteht das Ergebnis die Überprüfung oder nicht.

Schritt für Schritt: die Disziplin der systematischen Verifikation

1. Bestätigen Sie jedes numerische Ergebnis mit einem Werkzeug. Überlassen Sie die Arithmetik niemals der KI; SymPy, Taschenrechner oder von Hand.

2. Überprüfen Sie jedes symbolische Ergebnis mit SymPy. Integral, Ableitung, Vereinfachung, Gleichung – alles kann mit SymPy verifiziert werden.

3. Bestätigen Sie jeden Satz/jede Formel aus der Quelle. Sind Name und Ausdruck korrekt? Erfundene Theoreme sind die heimtückischste Falle.

4. Stellen Sie jedes Vorkommen in jedem Beweis in Frage. „Folgt das wirklich aus dem vorherigen Schritt?“ Basisfall, implizite Annahme, Lückenprüfung.

5. Kontrolle und Gegenkontrolle. Inverse Operation, Substitution, Grenzzustände, Dimensionsanalyse.

6. Stellen Sie den gesunden Menschenverstand auf die Probe. Ist das Ergebnis angemessen? Ist eine Wahrscheinlichkeit größer als 1, liegt ein Fehler vor, wenn eine Länge negativ ist.

Hinweis: Der schnellste Test des gesunden Menschenverstandes ist der „Größenordnungstest“. Liegt das Ergebnis in etwa im erwarteten Bereich? Wenn der Klassendurchschnitt 250 (von 100) oder die Wahrscheinlichkeit 3,5 beträgt, wissen Sie, dass ein Fehler vorliegt, ohne sich die Details anzusehen. Dieser 5-Sekunden-Check beseitigt viele lächerliche Ergebnisse im Keim.

drei Mini-Koffer

Fall 1 – Kettenzeichenfehler. Ein Student fand heraus, dass sich bei einer algebraischen Vereinfachung mit 8 Zeilen ein Vorzeichenfehler, den die KI in Zeile 2 machte, auf die nächsten 6 Zeilen ausbreitete. Das Endergebnis war völlig falsch, aber die KI präsentierte es mit völliger Sicherheit. Als der Student es mit SymPy von Grund auf vereinfachte, erhielt er das richtige Ergebnis und ermöglichte es der KI, den Fehler in der 2. Zeile zu finden. Ein einzelnes Zeichen widerlegte 6 Zeilen.

Fall 2 – Der gesunde Menschenverstand hat den Test gerettet. Ein Lehrer ließ eine KI ein Wahrscheinlichkeitsproblem lösen; Das Ergebnis war 1,4. Ohne auf die Details zu achten, sagte der Lehrer: „Die Wahrscheinlichkeit kann nicht größer als 1 sein“ und suchte nach dem Fehler: Die KI hatte nicht-diskrete Ereignisse gesammelt, als wären sie diskret. Ein gesunder Menschenverstandstest zeigte den Fehler innerhalb von Sekunden auf.

Fall 3 – erfundene Formel. Ein Ingenieur bat die KI um eine „geschlossene Formel“ für eine Seriensumme. KI hat eine überzeugende Formel geliefert. Der Ingenieur testete die Formel für einen kleinen Wert von n (n=3) sowohl durch Formel als auch durch manuelle Addition; Die Ergebnisse stimmten nicht überein. Die Formel wurde erfunden. Eine kleine Optimierung verhinderte stundenlangen Missbrauch.

Vier kopierbare Vorlagen

1) Mehrschichtige Verifizierungsanfrage:

Sie haben gefunden: [Ergebnis]. Überprüfen Sie dies nun auf DREI verschiedene Arten: (1) umgekehrtes Hashing, (2) Testen eines einfachen benutzerdefinierten Werts, (3) etwas Code zur Überprüfung mit SymPy (ich werde die Ausgabe sehen). Sagen Sie mir, ob alle drei Möglichkeiten konsistent sind. Wenn nicht, zeigen Sie an, bei welchem ​​Schritt ein Fehler vorliegt.

2) Gesunder Menschenverstand/Rangtest:

Sie haben gefunden: [Ergebnis]. Stellen Sie den gesunden Menschenverstand auf die Probe, um zu sehen, ob dieses Ergebnis VERNÜNDLICH ist: Was ist die erwartete Größenordnung, ist das Vorzeichen korrekt, liegt es innerhalb der Grenzen (z. B. Wahrscheinlichkeit 0-1)? Wenn dies nicht sinnvoll ist, untersuchen Sie, wo möglicherweise ein Fehler vorliegt.

3) Satz-/Formelbestätigung:

Ist der [Satz/die Formel], den Sie verwenden, wirklich standardisiert und korrekt? Schreiben Sie den Standardausdruck und die Standardbedingungen. Zeigen Sie ein Konto an, das dies mit einer kleinen Stichprobe testet (z. B. n=3). Wenn es sich um eine erfundene Formel oder um etwas handelt, bei dem Sie sich nicht sicher sind, sagen Sie es deutlich.

4) Diagnose des Fehlermodus:

Ich weiß, dass die Lösung unten einen Fehler enthält. Überprüfen Sie nacheinander diese Fehlertypen: Arithmetik, Vorzeichen, falsche Regel, übersprungene Bedingung, Domäne. Sagen Sie mir, um welche Art von Fehler es sich handelt und bei welchem ​​Schritt. Lösung: [hier]

Schwache Eingabeaufforderung / Starke Eingabeaufforderung

Schwach: „Ist diese Schlussfolgerung richtig?“ [Ergebnis einfügen]
Ergebnis: KI sagt oft „Ja, richtig“ (Tendenz, die eigene Ausgabe zu bestätigen); unzuverlässig, da es keine unabhängige Prüfung gibt.
Strong: „ÜBERPRÜFEN Sie dieses Ergebnis auf unabhängige Weise: Verwenden Sie eine andere Problemumgehung oder überprüfen Sie es mit SymPy-Code (ich führe den Code aus). Sagen Sie nicht einfach „wahr/falsch“, sondern zeigen Sie, welche Prüfung Sie durchgeführt haben, und das Ergebnis. Wenn die Prüfsumme fehlschlägt, suchen Sie den Fehler.“
Ergebnis: Eine unabhängige Kontrollmethode wird in Frage gestellt; Die KI wird daran gehindert, ihre eigene Ausgabe blind zu genehmigen.

Häufige Fehler

  • Die KI dazu bringen, ihre eigene Ausgabe zu validieren. „Ist das wahr?“ KI bestätigt oft ihren eigenen Fehler; Eine unabhängige Methode ist erforderlich.
  • Den gesunden Menschenverstandstest überspringen. Unsinn wie Wahrscheinlichkeit größer als 1 und negative Länge können erkannt werden, ohne auf die Details zu achten.
  • Verlassen Sie sich auf eine einzige Überprüfung. Verwenden Sie für kritische Ergebnisse mehrere unabhängige Pfade (Hashes + SymPy + benutzerdefinierter Wert).
  • Formeln nicht mit kleinen Stichproben testen. Erfundene Formeln brechen bei kleinen Werten wie n=2, n=3 sofort zusammen.
  • Vergessen, dass der Fehler verbreitet wird. Ein Fehler in der ersten Zeile verfälscht das gesamte Ergebnis; Wenn Sie einen Fehler finden, überprüfen Sie ihn von Anfang an.
Achtung: Es besteht kein Zusammenhang zwischen der Zuverlässigkeit der KI und ihrer Genauigkeit. Der Satz, der am entschlossensten, fließendsten und „sichersten“ erscheint, kann durchaus völlig falsch sein. Vertrauen Sie unabhängiger Verifizierung, nicht dem Ton. Betrachten Sie ein Ergebnis nur dann als „wahr“, wenn Sie es manuell oder mit einem deterministischen Tool bestätigen – nicht, weil die KI „sicher“ sagt.

Zusammenfassend

KI macht Fehler in der Mathematik, weil es sich um ein Sprachmodell handelt, das statistisch Text erzeugt, und nicht um eine Engine, die die Logik steuert. Es gibt sieben Haupttypen von Fehlern: Arithmetikfehler, Vorzeichenfehler, erfundene Theoreme, falsche Regelanwendung, ausgelassene Groß- und Kleinschreibung, Beweislücke, veraltete Daten. In der Mathematik breiten sich Fehler aus und wachsen, die Wahrheit ist binär – daher muss jeder Schritt überprüft werden. Systematische Disziplin: Überprüfen Sie jedes numerische Werkzeug, jedes symbolische Ergebnis mit SymPy, jeden Satz aus der Quelle, jeden Beweis durch Befragung; Wenden Sie Kontrolle, Gegenkontrolle und Tests des gesunden Menschenverstandes an. Das Vertrauen der KI ist kein Beweis für Genauigkeit.

Anwendungsaufgabe

Wählen Sie ein Problem mit einer Lösung mittlerer Länge (mindestens 6-8 Schritte) und lassen Sie es von der KI lösen. Führen Sie dann eine mehrschichtige Verifizierung mit den Mustern 1 und 4 aus dieser Einheit durch: (a) Prüfung auf gesunden Menschenverstand/Rang, (b) Prüfung mit SymPy, (c) Prüfung auf einen speziellen Wert. Gehen Sie dann die Lösung Zeile für Zeile mit einem bewussten „Bug-Jagd“-Auge durch und prüfen Sie, welche der sieben Fehlerarten auftreten könnten. Notieren Sie jeden Fehler, den Sie finden, zusammen mit seinem Typ.

Checkliste

  • [ ] Ich habe jedes numerische Ergebnis mit einem deterministischen Werkzeug bestätigt.
  • [ ] Ich habe jedes symbolische Ergebnis mit SymPy überprüft.
  • [ ] Ich habe den verwendeten Satz/die verwendete Formel anhand der Quelle oder anhand eines kleinen Beispiels überprüft.
  • [ ] Ich habe den gesunden Menschenverstand/Größenordnungstest angewendet.
  • [ ] Ich habe es unabhängig geprüft (ohne mich auf die Zustimmung der KI selbst zu verlassen).
  • [ ] Als ich einen Fehler fand, überprüfte ich die Lösung noch einmal von Anfang an.