Unité 9 / 11

Hallucination, erreurs mathématiques courantes et discipline de vérification

Gains :

  • Être capable de reconnaître pourquoi l'intelligence artificielle fait des erreurs en mathématiques (être un modèle de langage, pas vérifier la logique) et les sept principaux types d'erreurs
  • Capacité à expliquer pourquoi il est impératif de vérifier chaque étape en comprenant que l'erreur se propage et que la précision est binaire en mathématiques.
  • Capacité à appliquer une discipline de vérification à plusieurs niveaux grâce à des tests de bon sens, une vérification d'ordre de grandeur, des sommes de contrôle, des vérifications croisées et des méthodes indépendantes.

Cette unité approfondit l'idée au cœur du module : pourquoi et comment l'IA fait-elle des erreurs en mathématiques, quels sont les types de ces erreurs et comment les détecter systématiquement ? Dans les unités précédentes, nous avons vu des méthodes de vérification pour chaque sujet ; Nous rassemblons ici l’anatomie des erreurs sous un même toit. Le fait est que lorsque vous regardez une sortie d’IA, vous vous demandez « qu’est-ce qui pourrait être une erreur ici ? » Il s’agit d’acquérir une mentalité de validation qui pense de manière réflexive.

Rappel : une hallucination, c'est lorsqu'une IA produit en toute confiance des informations qui ne sont pas réellement vraies. En mathématiques, l'hallucination apparaît souvent sous la forme de « convaincant mais faux ». Pourquoi l’IA fait-elle des erreurs ? Parce qu'il s'agit d'un modèle de langage et non d'un moteur logique — c'est-à-dire qu'il produit du texte avec des modèles statistiques, il ne vérifie pas la validité logique des étapes. Une « multiplication à 3 chiffres » et une « preuve valable » sont pour lui la tâche de produire le même genre de texte ; Il ne dispose d’aucun mécanisme interne pour garantir l’exactitude.

Anatomie des erreurs mathématiques : sept types

La liste de types suivante résume les erreurs les plus courantes que vous rencontrerez dans la sortie AI et l'antidote pour chacune.

Type d'erreur

A quoi ça ressemble

antidote

erreur arithmétique

Erreur numérique comme 7×8=54

Calculatrice/SymPy

erreur de signe

−(une−b)=−une−b

Ouvrir mon nom manuellement

Théorème inventé

nom du théorème inexistant

Confirmation de la source

Mauvaise application des règles

N'oubliez pas la règle de la chaîne

"Quelle règle ?" question

Statut ignoré

Ignorer la racine négative

Lister tous les statuts

lacune de preuve

"Donc" sans justification

Remettre en question chaque passe

Données anciennes/incorrectes

informations obsolètes

approvisionnement

Pourquoi les mathématiques nécessitent-elles une attention particulière ?

Dans la plupart des domaines, une petite erreur a de petites conséquences. En mathématiques, l’erreur se propage et augmente. Une erreur de signe dans la première ligne d’une équation rend les dix lignes suivantes et le résultat final complètement faux. Un espace au milieu d’une preuve rend la preuve entière invalide. Cette « fragilité » rend nécessaire de vérifier chaque étape des mathématiques – « d’une manière générale semble vrai » ne suffit pas.

De plus, la vérité en mathématiques est binaire : un résultat est soit vrai, soit faux, il n’y a pas d’entre les deux. « Précision à 80 % » peut être considéré comme acceptable dans un résumé textuel ; Il n’existe pas de « quatre-vingts pour cent corrects » dans une intégrale : soit le résultat est correct, soit il ne l’est pas. Cette double nature rend la vérification à la fois plus critique et (heureusement) plus possible : soit le résultat passe la vérification, soit il ne la passe pas.

Pas à pas : la discipline de la vérification systématique

1. Confirmez chaque résultat numérique avec un outil. Ne laissez jamais l’arithmétique s’appuyer sur l’IA ; SymPy, calculatrice ou à la main.

2. Vérifiez chaque résultat symbolique avec SymPy. Intégrale, dérivée, simplifiée, équation : tout peut être vérifié avec SymPy.

3. Confirmez chaque théorème/formule à partir de la source. Le nom et l'expression sont-ils corrects ? Les théorèmes inventés constituent le piège le plus insidieux.

4. Remettez en question chaque occurrence de chaque preuve. « Est-ce que cela découle vraiment de l’étape précédente ? Cas de base, hypothèse implicite, vérification des écarts.

5. Vérifiez et contre-vérifiez. Fonctionnement inverse, substitution, états limites, analyse dimensionnelle.

6. Mettez-le au test du bon sens. Le résultat est-il raisonnable ? Si une probabilité est supérieure à 1, il y a une erreur si une longueur est négative.

Astuce : Le test de bon sens le plus rapide est la vérification de « l’ordre de grandeur ». Le résultat est-il à peu près dans la fourchette attendue ? Si la moyenne d'une classe est de 250 (sur 100) ou si la probabilité est de 3,5, vous saurez qu'il y a une erreur sans regarder les détails. Cette vérification de 5 secondes élimine dans l’œuf de nombreux résultats ridicules.

trois mini-cases

Cas 1 — Erreur de signe de chaîne. Un étudiant a découvert que dans une simplification algébrique à 8 lignes, une erreur de signe commise par l'IA à la ligne 2 se propageait aux 6 lignes suivantes. Le résultat final était complètement faux, mais l'IA l'a présenté en toute confiance. Lorsque l'étudiant l'a simplifié de zéro avec SymPy, le résultat correct a été obtenu et a permis à l'IA de trouver l'erreur dans la 2ème ligne. Un seul signe réfutait 6 lignes.

Cas 2 — Le bon sens a sauvé le test. Un enseignant a demandé à une IA de résoudre un problème de probabilité ; Le résultat était de 1,4. Sans regarder les détails, l'enseignant a déclaré "la probabilité ne peut pas être supérieure à 1" et a cherché l'erreur : l'IA avait collecté les événements non discrets comme s'ils étaient discrets. Un test de bon sens a révélé l’erreur en quelques secondes.

Cas 3 — Formule inventée. Un ingénieur a demandé à l'IA une « formule fermée » pour une somme en série. L’IA a donné une formule convaincante. L'ingénieur a testé la formule pour une petite valeur de n (n=3) à la fois par formule et par addition manuelle ; Les résultats ne correspondaient pas. La formule était inventée. Un petit ajustement a évité des heures d’utilisation abusive.

Quatre modèles copiables

1) Demande de vérification multicouche :

Vous avez trouvé : [résultat]. Vérifiez maintenant TROIS manières différentes : (1) en le hachant à l'envers, (2) en testant une simple valeur personnalisée, (3) du code à vérifier avec SymPy (je verrai le résultat). Dites-moi si les trois méthodes sont cohérentes ; Sinon, indiquez quelle étape comporte une erreur.

2) Test de bon sens/rang :

Vous avez trouvé : [résultat]. Mettez-le au test du bon sens pour voir si ce résultat est RAISONNABLE : quel est l'ordre de grandeur attendu, le signe est-il correct, est-il dans des limites (par exemple probabilité 0-1) ? Si ce n’est pas raisonnable, recherchez où il pourrait y avoir une erreur.

3) Confirmation du théorème/formule :

Le [théorème/formule] que vous utilisez est-il vraiment standard et correct ? Écrivez son expression standard et ses conditions. Montrez un compte qui teste cela avec un petit échantillon (par exemple n = 3). S'il s'agit d'une formule inventée ou de quelque chose dont vous n'êtes pas sûr, dites-le clairement.

4) Diagnostic du mode erreur :

Je sais qu'il y a un bug dans la solution ci-dessous. Vérifiez ces types d'erreurs un par un : arithmétique, signe, règle erronée, condition ignorée, domaine. Dites-moi de quel type d'erreur il s'agit et à quelle étape. Solution : [ici]

Invite faible/Invite forte

Faible : « Cette conclusion est-elle correcte ? [coller le résultat]
Résultat : l’IA dit souvent « ouais, c’est vrai » (tendance à confirmer sa propre sortie) ; peu fiable car il n’y a pas d’audit indépendant.
Strong : "VÉRIFIEZ ce résultat de manière indépendante : utilisez une solution de contournement différente ou vérifiez avec le code SymPy (je vais exécuter le code). Ne vous contentez pas de dire "vrai/faux" ; montrez quelle vérification vous avez effectuée et le résultat. Si la somme de contrôle échoue, recherchez l'erreur. "
Résultat : Une méthode de contrôle indépendante est remise en cause ; L’IA ne peut pas approuver aveuglément sa propre sortie.

Erreurs courantes

  • Amener l'IA à valider sa propre sortie. « Est-ce vrai ? L’IA confirme souvent sa propre erreur ; Une méthode indépendante est requise.
  • Sauter le test de bon sens. Des absurdités telles qu'une probabilité supérieure à 1 et une longueur négative peuvent être détectées sans regarder les détails.
  • S'appuyer sur une seule vérification. Utilisez plusieurs chemins indépendants (hachages + SymPy + valeur personnalisée) sur les résultats critiques.
  • Ne pas tester les formules avec de petits échantillons. Les formules inventées s'effondrent immédiatement à de petites valeurs telles que n=2, n=3.
  • Oublier que le bug se propage. Une erreur dans la première ligne corrompt tout le résultat ; Si vous trouvez une erreur, vérifiez-la depuis le début.
Attention : il n'y a aucune corrélation entre la confiance de l'IA et sa précision. La phrase qui semble la plus déterminée, la plus fluide, la plus « sûre » peut très bien être complètement fausse. Faites confiance à une vérification indépendante, pas au ton. Considérez un résultat comme « vrai » uniquement lorsque vous le confirmez à la main ou avec un outil déterministe – pas parce que l’IA dit « bien sûr ».

En résumé

L’IA fait des erreurs en mathématiques parce qu’il s’agit d’un modèle de langage qui produit statistiquement du texte, et non d’un moteur qui contrôle la logique. Les erreurs se répartissent en sept types principaux : arithmétique, signe, théorème inventé, mauvaise application des règles, cas omis, faille de preuve, données périmées. En mathématiques, l’erreur se propage et grandit, la vérité est binaire – donc chaque étape doit être vérifiée. Discipline systématique : vérifier chaque outil numérique, chaque résultat symbolique avec SymPy, chaque théorème à la source, chaque preuve passée par questionnement ; Appliquer des tests de contrôle, de contre-contrôle et de bon sens. La confiance de l’IA ne constitue pas une preuve d’exactitude.

Tâche de candidature

Choisissez un problème avec une solution de longueur moyenne (au moins 6 à 8 étapes) et demandez à l'IA de le résoudre. Effectuez ensuite une vérification multicouche en utilisant les modèles 1 et 4 de cette unité : (a) tests de bon sens/rang, (b) vérification avec SymPy, (c) test sur une valeur spéciale. Parcourez ensuite la solution ligne par ligne avec une « chasse aux bugs » délibérée et vérifiez laquelle des sept types d’erreurs pourrait se produire. Enregistrez chaque erreur que vous trouvez avec son type.

liste de contrôle

  • [ ] J'ai confirmé chaque résultat numérique avec un outil déterministe.
  • [ ] J'ai vérifié chaque résultat symbolique avec SymPy.
  • [ ] J'ai vérifié le théorème/formule utilisé à partir de la source ou avec un petit exemple.
  • [ ] J'ai appliqué le test du bon sens/ordre de grandeur.
  • [ ] Je l'ai audité de manière indépendante (sans compter sur la propre approbation de l'IA).
  • [ ] Lorsque j'ai trouvé une erreur, j'ai revérifié la solution depuis le début.