Gains :
- Comprenez que le p-hacking, le HARKing, les rapports sélectifs et le jardin des chemins qui bifurquent produisent de fausses découvertes et voyez comment l'intelligence artificielle peut accélérer ces pièges.
- Capacité à établir des défenses telles que le pré-enregistrement, le plan d'analyse, la discipline de comparaison multiple et l'analyse de sensibilité avec le support de l'intelligence artificielle
- Être capable d'internaliser la conception honnête des demandes qui permettra à l'intelligence artificielle de rejeter les demandes de type « trouver le résultat significatif » et que la responsabilité finale incombe au chercheur.
Dans l’unité précédente, nous avons vu ce qu’est la valeur p et ce qu’elle n’est pas. Dans cette unité, nous aborderons un sujet plus sombre, celui des pièges systématiques qui menacent l’intégrité statistique. La plupart d’entre eux ne sont pas des tricheries intentionnelles ; Il s’agit de mécanismes insidieux dans lesquels même des chercheurs bien intentionnés tombent sans s’en rendre compte. Et l’intelligence artificielle (IA) rend ces pièges à la fois plus faciles et plus rapides, car elle permet d’effectuer des dizaines d’analyses en quelques secondes. L'objectif de cette unité est d'établir la discipline qui transformera l'IA d'une « machine à trouver des résultats significatifs » en un assistant honnête.
Pièges fondamentaux
p-hacking (p-value hunting) : il s'agit de réessayer l'analyse de différentes manières jusqu'à ce qu'un résultat significatif (p<0,05) soit obtenu. Ajouter et supprimer des variables, sélectionner des sous-échantillons, modifier la définition des valeurs aberrantes, essayer différentes transformations, utiliser différentes variables de résultat, arrêter la collecte de données lorsqu'elle devient significative... Chaque tentative donne une nouvelle « chance » ; Si vous faites suffisamment d’efforts, l’un d’entre eux s’avérera significatif, même s’il n’a en réalité aucun effet. Le résultat : des résultats fallacieux qui ont été publiés mais non reproductibles.
HARKing (Hypothesizing After the Results are Known) : Faire une hypothèse après avoir vu les résultats et la présenter comme "Je l'avais prédit comme ça depuis le début". Vous examinez les données et trouvez la relation la plus frappante, puis rédigez l'article comme s'il était conçu pour tester cette hypothèse. Cela induit le lecteur en erreur en faisant passer la découverte pour une confirmation.
Rapports sélectifs (cherry-picking) : signaler uniquement les « bons » parmi des dizaines d’analyses et enterrer silencieusement le reste. C'est ce qu'on appelle également le « problème du tiroir-classeur » : des résultats dénués de sens restent dans le tiroir, ce qui rend la littérature systématiquement biaisée.
Jardin des sentiers qui bifurquent : le terme d'Andrew Gelman. Même sans un seul p-piratage intentionnel, le chercheur fait de nombreux choix raisonnables en fonction des données (quelle variable, quel seuil, quel sous-groupe, quelle transformation). Ces degrés de liberté d’investigation sont si nombreux que vous choisissez effectivement celui qui a du sens parmi une multitude d’analyses, même sans aucune mauvaise intention. Le résultat est encore une fois une augmentation du taux de faux positifs.
Attention : la plupart de ces pièges ne sont pas des astuces délibérées. La somme d'étapes apparemment innocentes telles que « Je viens d'essayer quelques modèles supplémentaires », « C'était plus propre lorsque j'ai supprimé la valeur aberrante », « L'effet est plus clair dans ce sous-groupe » peut produire un résultat fallacieux. L'honnêteté est une question de méthode, pas d'intention.
Pourquoi l’IA agrandit-elle ces pièges ?
Essayer 3 modèles à la main prend du temps ; YZ produit 50 variantes de modèles, 10 conversions différentes, 8 sous-groupes en quelques minutes. Ce pouvoir est désastreux sans un plan honnête : une requête comme « trouver une relation significative dans ces données » ou « construire un modèle qui supporte cette hypothèse » transforme l’IA directement en un moteur de p-piratage. L’IA veut également être utile ; a tendance à trouver un résultat « significatif » qui vous satisfera. C'est pourquoi votre conception d'invite constitue la première ligne de défense de l'honnêteté.
Défense : bonne marche des affaires
1. Pré-inscription : Il s'agit d'enregistrer par écrit (éventuellement sur une plateforme horodatée) votre hypothèse, vos variables, votre modèle et vos tests avant d'effectuer l'analyse. Ainsi, la découverte est séparée de la confirmation ; tout ce que vous modifiez par la suite est étiqueté « explorateur ».
2. Plan d'analyse : Même si vous ne pouvez pas pré-enregistrer, rédigez un plan d'analyse avant de plonger dans les données : hypothèse principale, variable de résultat principale, modèle principal. Établir dès le début la distinction entre « analyse principale » et « analyse complémentaire/exploratoire » et la maintenir dans le rapport.
3. Signalez tout : Ne cachez pas les modèles que vous avez essayés. Dans la section « Analyse de sensibilité » (vérification de robustesse), montrez comment différentes spécifications modifient le résultat. La conclusion n’est solide que si elle résiste à de nombreux choix plausibles.
4. Discipline de comparaison multiple : Si vous avez fait trop de tests, corrigez-les (unité 6). Répondez à la question « Combien de tests ai-je effectué ? » honnêtement.
5. Analyse de sensibilité : répétez votre résultat principal avec un échantillon différent, un ensemble de contrôles différent et une transformation différente. Si le résultat change, ne le cachez pas, signalez-le.
Tableau comparatif : honnête contre piège
Demande
forme du piège
Equivalent honnête
Sélection du modèle
Essayer jusqu'à ce que cela ait du sens (p-hacking)
Modèle maître pré-planifié
hypothèse
Ajustement après coup (HARKing)
Préenregistré, avant les données
Rapports
Ne montre pas seulement les plus belles
Toutes spécifications + sensibilité
sous-groupe
Choisir le plus marquant
Prédéfini, corrigible
collecte de données
Arrêtez-vous quand cela a du sens
échantillon prédéterminé
Quatre invites copiables
1. Cadre de réclamation honnête :
Votre rôle : un assistant statistique honnête. Mon objectif n’est PAS de trouver un résultat significatif, mais de trouver le bon résultat. RÈGLES : - NE me donnez PAS de suggestions de type « essayez les modèles jusqu'à ce que cela ait du sens », - dites-moi si vous suggérez plusieurs spécifications, elles doivent toutes être signalées, - prévenez-moi de toute étape pouvant conduire à un piratage informatique. Aidez-moi d'abord à clarifier mon modèle principal, en séparant la découverte de la confirmation.
2. Projet de plan d'analyse :
Aidez-moi à rédiger un plan d'analyse préliminaire pour une étude : hypothèse principale, variable de résultat principale, spécification du modèle principal, sous-groupes prédéfinis, stratégie de comparaison multiple. Mettez les analyses « exploratoires » et « confirmatoires » dans des rubriques distinctes. Rappelez-moi de remplir ceci SANS REGARDER les données.
3. Analyse de sensibilité :
Ma principale conclusion est d'écrire un code d'analyse de sensibilité (R) pour Mon objectif est de VOIR à quel point le résultat est solide, PAS de choisir le meilleur ; afficher tous les résultats.
4. Autosurveillance :
Je vais vous expliquer mon processus d'analyse ; Donnez-moi une liste de contrôle pour le p-hacking / HARKing / reporting sélectif et marquez lesquelles de mes étapes sont risquées. Demandez-moi combien de modèles/tests j'ai essayés et lesquels je prévois de signaler.
Invite faible/Invite forte
Invite faible :
Quelles variables montrent des relations significatives dans ces données, trouvez le meilleur modèle.
Cette invite est une instruction directe de p-hacking : l'IA essaie des dizaines de combinaisons et présente celle qui « a le plus de sens ». Le résultat est presque certainement une fausse découverte qui ne peut pas être reproduite.
Invite puissante :
Votre rôle : un assistant honnête. Le modèle PRINCIPAL que j'ai prédéterminé est : Y ~ X + commandes. Écrivez du code qui prédit ce modèle. NE cherchez PAS un autre modèle « plus significatif ». Suggérez également une analyse de sensibilité afin que je puisse voir la robustesse du résultat, mais sachez que je rapporterai TOUS les résultats, pas le meilleur. Ne me laissez pas considérer les résultats exploratoires comme « confirmés ».
Différence : une forte volonté corrige le modèle principal, interdit la recherche et exige que tous les résultats soient rapportés.
trois mini-cases
Cas 1 — Chasse aux sous-groupes. Un chercheur n’a trouvé aucun effet dans l’échantillon global ; Il a demandé à l'IA "dans quel sous-groupe est-ce significatif ?" YZ a analysé les combinaisons d'âge, de sexe et de région et a trouvé « p = 0,03 chez les femmes urbaines âgées de 35 à 44 ans ». L'article était basé sur ce sous-groupe. Sa réplication n’a trouvé aucun effet : c’était le résultat du hasard parmi des dizaines de sous-groupes. Leçon : le sous-groupe sélectionné après l'écoute des données, sans confirmation.
Cas 2 — Chasse aux conversions. La relation qui s’avère dénuée de sens au niveau de l’étudiant ; je l'ai essayé sous forme de log, de racine carrée, de carré et de décalage ; Il a trouvé p = 0,048 sous forme de log-log et n'a rapporté que cela. Heureusement, une des 5 formes essayées a franchi le seuil. La bonne méthode était la suivante : présélectionner le formulaire avec la théorie et afficher le résultat de tous les formulaires dans le tableau de sensibilité. Leçon : les rapports sélectifs produisent de fausses significations.
Cas 3 – Comment fonctionne un cadrage honnête. Une équipe pré-enregistrée avant analyse : une seule hypothèse primaire, un seul modèle principal, deux sous-groupes prédéfinis, correction de Bonferroni. L’effet principal n’était pas significatif, mais l’équipe l’a signalé honnêtement ; L'individu exploratoire a signalé une découverte comme « devant être testée à l'avenir ». L'étude était reproductible et fiable. Leçon : une planification honnête fait que même l’échec en vaut la peine.
Erreurs courantes
- Dire à l’IA de « trouver des résultats significatifs ». C’est carrément du p-piratage ; Placez l’IA dans un cadre honnête, en exigeant de la précision et non des résultats.
- Présentation de la découverte comme confirmation (HARKing). Il est trompeur d'écrire l'hypothèse établie après les données comme « je l'avais prédit depuis le début » ; Étiquetez la découverte exploratoire.
- Je rapporte juste de bons résultats. Afficher toutes les spécifications testées ; Cacher l’analyse des sentiments compromet l’intégrité.
- Dépistage de sous-groupes/conversions. Choisir le plus significatif parmi des dizaines de sous-groupes ou de transformations produit des résultats fallacieux ; identifier et corriger à l’avance.
- Oublier combien de tests vous avez fait. Gardez une trace du nombre total de tentatives ; Aucune valeur p ne peut être interprétée honnêtement sans connaître ce nombre.
Astuce : avant d'écrire une découverte, demandez-vous : "Combien de méthodes ai-je essayées en silence jusqu'à ce que je trouve ce résultat, et est-ce que je les rapporte toutes ?" Si certains essais restent dans le tiroir, votre rapport semble plus solide qu'il ne l'est.
En résumé
p-hacking, HARKing, reportages sélectifs et le jardin des chemins qui bifurquent ; Beaucoup sont des pièges qui fonctionnent involontairement mais produisent des résultats fallacieux et non reproductibles. L’IA accélère ces pièges car elle peut tenter des dizaines d’analyses instantanément ; Les requêtes de type « trouver des résultats significatifs » transforment l’IA en un moteur de p-hacking. Défense; séparer la découverte de la confirmation avec un plan de pré-enregistrement et d'analyse, rapporter toutes les spécifications et analyses de sensibilité, corriger les comparaisons multiples et placer l'IA dans un cadre honnête qui exige le « résultat correct ». La responsabilité finale incombe toujours au chercheur.
Tâche de candidature
Choisissez une question de recherche et rédigez un bref plan d'analyse avant d'examiner les données : hypothèse principale, modèle principal, variable de résultat principale, sous-groupes prédéfinis, stratégie de comparaison multiple. Estimez ensuite le modèle principal. Effectuez ensuite une analyse de sensibilité (différents contrôles, valeur aberrante incluse/exclue, forme de fonction différente) et affichez tous les résultats dans un seul tableau. En un paragraphe, évaluez quelles étapes présentent un risque de piratage informatique et comment votre cadre honnête les limite.
liste de contrôle
- [ ] J'ai rédigé le plan d'analyse/modèle maître avant de plonger dans les données.
- [ ] J'ai étiqueté séparément les analyses exploratoires et confirmatoires ; Je n'écoutais pas.
- [ ] J'ai rapporté toutes les spécifications que j'ai essayées ; Je n'ai pas seulement choisi la belle.
- [ ] J'ai défini les sous-groupes et les transformations au préalable, je ne les ai pas scannés après les données.
- [ ] J'ai gardé une trace du nombre de tests que j'avais effectués et appliqué les corrections nécessaires.
- [ ] J'ai utilisé l'IA dans le contexte de « trouver la vérité » plutôt que de « la trouver significative » ; J'ai pris mes responsabilités.