Gains :
- Capacité à mesurer et à signaler l'incertitude avec un ensemble, une analyse de sensibilité, une validation croisée et des tests aveugles
- Capacité à empêcher les fuites de données en les séparant sur une base puits/champ et à garantir que l'exactitude rapportée reflète une véritable généralisation.
- Capacité à calibrer le score de confiance de l'intelligence artificielle avec le diagramme de fiabilité et à appliquer la discipline consistant à ne pas utiliser un score non calibré comme probabilité
Il y a un thème récurrent dans chaque unité de ce module : il n'y a pas de « réponses sûres » en géophysique, seulement des modèles limités par l'incertitude. Cette unité transforme ce thème en discipline. L'incertitude du modèle est l'existence de différents modèles souterrains qui peuvent expliquer les mêmes données et chaque modèle comporte un intervalle de confiance. La validation consiste à tester avec des preuves indépendantes si un modèle ou un résultat de l'IA est réellement valide. L'étalonnage consiste à garantir que les valeurs de confiance/probabilité données par un modèle correspondent aux résultats réels. Dans cette unité, nous examinerons comment l'intelligence artificielle (IA) peut à la fois mesurer et masquer l'incertitude ; et nous verrons pourquoi un solide cadre de vérification-calibrage rend l’IA fiable.
Sources d'incertitude
L’incertitude géophysique provient de plusieurs niveaux :
- Incertitude des données : bruit de mesure, couverture limitée, erreur d’étalonnage.
- Incertitude du modèle (polysémie) : Ajustement de plusieurs structures souterraines aux mêmes données.
- Incertitude de la méthode/des paramètres : les choix de traitement, d'inversion et de régularisation modifient le résultat.
- Incertitude propre à l'IA : Capacité du modèle à rester confiant mais à échouer lorsqu'il sort de la distribution de formation (changement de distribution).
Le travail d’un bon géophysicien n’est pas d’éliminer cette incertitude, mais de la mesurer, de la communiquer et de la réduire. L’IA peut rendre cela facile (en générant plusieurs scénarios), mais peut aussi facilement le cacher en produisant une seule réponse fiable.
Façons de mesurer l’incertitude
Quelques outils pratiques :
- Ensemble : plusieurs exécutions avec différents démarrages, paramètres ou modèles ; La dispersion des résultats donne lieu à de l'incertitude.
- Analyse de sensibilité : modifier une entrée (paramètre, sous-ensemble de données) et voir dans quelle mesure le résultat change.
- Validation croisée : diviser les données en morceaux, former avec une partie et tester avec l'autre ; Mesure le pouvoir de généralisation.
- Test à l'aveugle : tester le modèle avec un puits/champ indépendant qu'il n'a jamais vu en formation.
- Sortie probabiliste : fournir le résultat sous la forme d'un intervalle de distribution/confiance, et non d'une valeur unique.
Astuce : Lorsque l'IA donne un résultat, demandez toujours : « Que dois-je déplacer et de combien dans l'entrée pour modifier ce résultat ? Si le résultat s’inverse avec un petit changement de paramètre, ce résultat est fragile et l’incertitude est élevée.
Calibrage : le score de confiance est-il vrai ?
Les modèles d’IA donnent souvent une confiance/probabilité (« 90 % de faute »). Mais ce chiffre est trompeur s'il n'est pas calibré : le modèle est en fait correct dans peut-être 60 % des cas qu'il dit être « 90 % ». L'étalonnage consiste à aligner ce nombre sur le taux de résultat réel. En pratique, un diagramme de fiabilité est tracé : un modèle bien calibré a vraiment raison à 90 % lorsqu'il dit « 90 % ». En géophysique, il est essentiel de calibrer le score de confiance de l’IA avec des données indépendantes avant d’en faire la base d’une décision.
Attention : Une haute précision n’est pas synonyme d’un bon étalonnage. Un modèle peut être généralement précis mais trop confiant ; L'important dans les décisions critiques est qu'il soit vraiment fiable lorsqu'il est indiqué « 95 % ». Ne considérez pas un score de confiance non calibré comme une probabilité.
Règles d'or de la vérification
Pour une vérification robuste : (1) Indépendance — les données de test ne doivent pas du tout interférer avec le processus de formation/réglage (fuite de données — gonfle le résultat). (2) Test aveugle — champ/puits que le modèle ne voit pas. (3) Cohérence physique — le résultat ne doit pas contredire la physique et la géologie. (4) Reproductibilité — le même résultat avec la même entrée et peut être produit par quelqu'un d'autre. (5) Documentation — enregistrement des données, des paramètres et de la version du modèle utilisés.
trois mini-cases
Cas 1 — Erreur de fuite de données. Une équipe a rapporté que le classificateur de faciès donnait une précision de 94 %. L'enquête a montré que des échantillons voisins provenant du même puits étaient impliqués à la fois dans la formation et dans les tests (fuite de données). Une fois décomposée par puits, la précision est tombée à 71 % – c'était la véritable généralisation. La fuite a rendu le modèle plus beau qu’il ne l’était en réalité.
Cas 2 — Modèle trop confiant. Un détecteur de défauts a donné « 95 % de confiance » dans ses signes. Le diagramme de fiabilité a montré que les notes « 95 % » étaient en réalité exactes à 70 %. Une fois le modèle calibré, les scores de confiance sont devenus réalistes et les commentateurs ont correctement ajusté le degré de confiance qu'ils accorderaient à chaque signe.
Cas 3 — Inversion fragile. Un modèle gravitationnel semblait très convaincant. L'analyse de sensibilité a montré que la structure principale disparaissait lorsque le poids de régularisation changeait de 20 % : la structure ne provenait pas des données, mais de la sélection des paramètres. L’équipe a signalé la structure comme « faible confiance » et a demandé des données supplémentaires.
Quatre modèles copiables
1) Plan de mesure de l'incertitude :
Votre rôle : consultant en incertitude géophysique. J'ai un résultat [inversion / classification / prédiction]. Quelles méthodes (ensemble, sensibilité, validation croisée, blindtest) dois-je appliquer pour mesurer l'incertitude et dans quel ordre ? Expliquez ce que chacun me dit et comment rapporter le résultat.
2) Contrôle d'étalonnage :
Mon modèle d'IA donne un score de confiance/probabilité. Comment tester si ce score est calibré ? Comment puis-je construire un diagramme de fiabilité, reconnaître « l'excès de confiance » ou « l'excès de prudence » et aligner le score sur le taux de résultats réel ?
3) Audit de fuite de données :
J'ai formé un classificateur géophysique. Comment détecter et prévenir le risque de fuite de données (les mêmes échantillons de puits/champ entrant à la fois dans la formation et dans les tests) ? Comment mettre en place une séparation par puits/champ ? Comment puis-je savoir si l’exactitude rapportée reflète une véritable généralisation ?
4) Résultat des tests de fragilité :
J'ai un résultat d'inversion/modèle. Je veux comprendre à quel point ce résultat est fragile. En modifiant quels paramètres et dans quelle mesure la structure principale change-t-elle ? Comment puis-je distinguer si la structure provient de données ou de paramètres/prémisses ? Donnez un protocole de sensibilité.
Invite faible/Invite forte
Invite faible :
Voyez si mon modèle a une grande précision.
Un seul numéro de vérité ; les fuites cachent l’étalonnage et la généralisation, donnant une fausse confiance.
Invite puissante :
Votre rôle : expert en validation de modèles. Entrée : [le classificateur génère N bien, scores de confiance]. Tâche : (1) proposer une allocation bien basée contre les fuites de données ; (2) installer des tests de puits aveugles ; (3) calibrer le score de confiance avec le diagramme de fiabilité ; (4) tester la sensibilité du résultat au paramètre. Réduction à un seul nombre de vérité ; Signaler séparément la généralisation, l’étalonnage et la fragilité.
Les fuites, les tests aveugles, les demandes d’étalonnage et de sensibilité rendent la vérification honnête.
Outils d'incertitude
véhicule
Que mesure-t-il ?
Risque principal
sortie
ensemble
Propagation du modèle
Coût du compte
Gamme/distribution
Sensibilité
Effet de paramètre
Saisie manquée
Fragilité
validation croisée
généralisation
fuite de données
précision réaliste
test à l'aveugle
succès indépendant
Ensemble de tests insuffisant
confiance
Calibrage
faire confiance à la réalité
excès de confiance
probabilité alignée
Erreurs courantes
- Ne pas remarquer la fuite de données. Cela gonfle la justice ; Séparé par puits/champ.
- Utiliser le score de confiance sans le calibrer. « 90 % » n'est peut-être pas en réalité 90 %.
- S'appuyer sur le seul chiffre de vérité. La généralisation et le calibrage sont deux choses différentes.
- Je ne teste pas la vulnérabilité. La structure perdue par le paramètre n'est pas une véritable information.
- Ne pas signaler l’incertitude. Présenter le résultat sans intervalle de confiance est trompeur.
En résumé
L'incertitude est le fait indéracinable de la géophysique ; le travail consiste à le mesurer, à le communiquer et à le affiner. L’IA facilite cela grâce à des résultats d’ensemble, de sensibilité et de probabilité, mais peut également le dissimuler avec une seule réponse confiante. Un cadre solide ; prévenir les fuites de données, mesurer la généralisation avec des tests aveugles, calibrer le score de confiance et tester la fragilité du résultat. Une confiance non calibrée, une véracité non vérifiée et une incertitude dissimulée sont les trois illusions les plus dangereuses. Une géophysique fiable est une géophysique qui démontre honnêtement son incertitude.
Tâche de candidature
Sélectionnez un résultat géophysique IA (classification, inversion ou prédiction). Planifiez les étapes de tests d'ensemble/sensibilité/aveugle avec le modèle « Plan de mesure d'incertitude ». Testez ensuite votre distinction train-test avec le modèle « Audit de fuite de données ». Si le modèle donne un score de confiance, évaluez si le score est réaliste avec le modèle « Contrôle de calibrage » et écrivez votre résultat avec un intervalle de confiance.
liste de contrôle
- [ ] J'ai mesuré l'incertitude avec ensemble/sensibilité.
- [ ] J'ai évité les fuites de données en les séparant sur une base puits/champ.
- [ ] J'ai testé la généralisation avec un test aveugle.
- [ ] J'ai calibré le score de confiance et vérifié son réalisme.
- [ ] J'ai rapporté le résultat avec un intervalle de confiance, pas une seule valeur.