Unité 6 / 11

Tests d'hypothèses et valeur p : signification, puissance et comparaisons multiples

Gains :

  • Capacité à définir correctement l'hypothèse nulle, la valeur p, l'intervalle de confiance et la puissance statistique et à utiliser l'intelligence artificielle dans la sélection et l'interprétation des tests.
  • Capacité à distinguer ce qui est et n'est pas une valeur p (pas l'ampleur de l'effet, ni la probabilité d'exactitude) et à comprendre pourquoi une correction par comparaison multiple est nécessaire
  • Capacité à reconnaître les commentaires formulés par l'intelligence artificielle qui confondent signification et matérialité et à les signaler avec l'ampleur de l'effet et l'incertitude

L’outil statistique le plus utilisé et le plus mal compris est le test d’hypothèse. L’idée de base est simple : nous avons une affirmation (par exemple « la moyenne de ces deux groupes est différente ») et son opposé, une hypothèse nulle (H0 — « il n’y a en fait aucune différence »). Le test mesure dans quelle mesure les données sont en accord avec l'hypothèse nulle. Dans cette unité, nous verrons comment l'intelligence artificielle (IA) facilite la sélection et l'interprétation des tests, mais pourquoi les pièges autour de la valeur p sont si courants et dangereux. Commençons par le début : l'IA sait quelle syntaxe de test écrire ; mais il vous appartient d'interpréter si l'hypothèse du test est satisfaite et ce que signifie réellement le résultat.

Quelle est réellement la valeur p ?

La valeur p est la probabilité que le résultat que vous observez, ou un résultat plus extrême, se produise par hasard lorsque l'hypothèse nulle est vraie (c'est-à-dire qu'il n'y a en réalité aucun effet). Une petite valeur p (0,05 est le seuil traditionnel) signifie « qu'il serait surprenant de voir de telles données s'il n'y avait vraiment aucun effet » ; Ceci est considéré comme une preuve contre l’hypothèse nulle.

Précisons maintenant ce que la valeur p n'est pas - ce que l'IA confond souvent :

  • La valeur p n'est pas la probabilité que l'hypothèse nulle soit vraie. p = 0,03 ne signifie pas « il y a une probabilité de 3 % qu'il n'y ait aucun effet ».
  • La valeur p n’indique pas l’ampleur de l’effet. Un très petit effet peut donner une infime valeur p dans un grand échantillon.
  • La valeur p ne prouve pas que le résultat soit significatif ou réel. « significatif » est un terme statistique, « significatif » est un jugement.
  • p>0,05 ne signifie pas « aucun effet » ; Cela signifie "nous n'avons pas pu montrer l'effet avec ces données". L’absence de preuve n’est pas une preuve d’absence.
Attention : l'erreur d'interprétation la plus courante de l'IA consiste à présenter le mot « significatif » comme « impact significatif/fort/majeur ». La signification statistique et la signification pratique sont deux choses différentes ; Signalez toujours les deux séparément.

Intervalle de confiance et taille de l’effet : des informations plus riches

Au lieu d'une seule valeur p, un intervalle de confiance est beaucoup plus informatif : il donne la plage plausible de valeurs pour votre estimation. La phrase « Effet 1 200, intervalle de confiance à 95 % [300, 2 100] » indique à la fois la direction, l'ampleur et l'incertitude ; "p<0,05" dit simplement "loin de zéro". La pratique statistique moderne n’utilise pas uniquement la valeur p ; recommande de produire des rapports avec le trio taille de l'effet + intervalle de confiance + valeur p.

Puissance statistique et échantillon

La puissance statistique est la probabilité de détecter un effet qui existe réellement (1 moins la probabilité d'une erreur de type II, c'est-à-dire « rater l'effet réel »). Une étude de faible puissance est sensible à deux risques : (1) elle passe à côté de véritables effets (faux négatifs) ; (2) les quelques résultats qui s'avèrent significatifs comportent des ampleurs exagérées – ce que l'on appelle la malédiction du vainqueur, car seules les prédictions exagérées peuvent franchir le seuil. Par conséquent, il est recommandé de calculer la puissance/échantillon avant l’analyse. L'IA génère le code de ce compte ; Vous déterminez la taille de l’effet cible avec la théorie.

Problème de comparaison multiple

Lors de la réalisation d'un test, un seuil de 0,05 signifie « 5 % de risque de faux positifs ». Mais si vous effectuez 20 tests, on s’attendrait en moyenne à ce que l’un d’entre eux donne p < 0,05 par hasard, même si tous sont en réalité inefficaces. C’est ce qu’on appelle le problème des comparaisons multiples. La probabilité de faux positifs augmente rapidement lorsqu’un grand nombre de variables, de sous-groupes ou de variables de résultat sont testés. La solution est de corriger le seuil : méthodes Bonferroni (divisant le seuil par le nombre de tests – strict), Holm ou Benjamini-Hochberg qui contrôlent le taux de fausses découvertes (FDR). Ce risque devient encore plus grand à l’ère de l’IA, car l’IA peut produire des dizaines de tests en quelques secondes – c’est le sujet direct de l’unité suivante (p-hacking).

Tableau comparatif : ce que dit et ce qu'elle ne dit pas

expressions

Est-ce vrai ?

Descriptif

"p=0,02, la probabilité d'absence d'effet est de 2 %"

faux

p n'est pas la probabilité de H0

"p<0,05, l'effet est important"

faux

p n'indique pas la taille

"p=0,20, aucun effet"

faux

Ne pas pouvoir montrer n'est pas une absence

"p<0,05, il existe des preuves contre H0"

Vrai

Prudent et ponctuel

"Effet 1,200 [300;2,100], p=0,01"

meilleur

Taille + incertitude + preuves

Quatre invites copiables

1. Choisir le bon test :

Votre rôle : assistant aux tests statistiques. Je veux comparer la moyenne de deux groupes indépendants (variable continue). Donnez-moi : quel test est approprié (avec ses hypothèses : normalité, égalité de variance), l'alternative si l'hypothèse n'est pas remplie (par exemple Welch, Mann-Whitney) et le code R. Je vais exécuter le résultat et vérifier les hypothèses.

2. Signaler correctement la valeur p :

Rapportez le résultat du test ci-dessous, mais RÈGLES : - NE PAS présenter la valeur de p comme "probabilité de H0" ou "taille de l'effet",- assurez-vous d'inclure la taille de l'effet et l'intervalle de confiance à 95 %,- écrivez "significatif" et "significatif" séparément,- si p>0,05, NE dites PAS "aucun effet", dites "nous n'avons pas pu le montrer". Résultat : [coller]

3. Calcul de puissance/échantillon :

Je prévois une expérience : deux groupes, taille d'effet attendue (d de Cohen) ~ 0,4, puissance 0,80, alpha 0,05. Écrivez du code R qui calcule la taille d'échantillon requise (package pwr) et expliquez les risques d'une étude de faible puissance (malédiction du gagnant).

4. Correction de comparaison multiple :

J'ai fait 15 tests d'hypothèses distincts et j'ai des valeurs p. Écrivez du code R qui applique les corrections de Bonferroni et Benjamin-Hochberg (FDR), expliquez la différence entre les deux méthodes et résumez en une phrase pourquoi je ne devrais pas faire confiance au simple p<0,05.

Invite faible/Invite forte

Invite faible :

Le résultat de ce test est-il significatif ? Commentez le résultat.

Cette affirmation enferme l’IA dans le binaire « significatif/non significatif » ; produit très probablement une phrase qui confond ampleur et signification, telle que « oui, c'est significatif, l'effet est fort ».

Invite puissante :

Votre rôle : assistant statistique attentif. Interprétez le résultat mais : (1) donnez ensemble la taille de l'effet + l'intervalle de confiance à 95 % + la valeur p, (2) séparez la signification de la signification, (3) p>0,05 dans "ne pouvait pas montrer", (4) demandez combien de tests j'ai effectués ; S'il y en a plusieurs, suggérer une correction par comparaison multiple, (5) rappeler que les hypothèses du test doivent être vérifiées.

Différence : une invite forte applique des rapports riches et protège contre les pièges de valeur p.

trois mini-cases

Cas 1 — « signification » non significative dans un grand échantillon. Un analyste a trouvé la différence moyenne entre les deux groupes « hautement significative » à p < 0,001 dans des données comprenant 500 000 observations. Mais la différence n’était que de 0,3 point (sur 100) et n’avait pratiquement aucune signification. L'énorme échantillon rendait même la petite différence « significative ». Lorsque l’ampleur de l’effet a été rapportée, le résultat s’est révélé insignifiant. Leçon : l'importance n'est pas l'ampleur ; Si n est grand, toute différence est significative.

Cas 2 — Illusion de tests multiples. Une équipe a testé 22 variables de résultats ; L'un d'eux a montré p=0,04 et a été annoncé comme "nous avons trouvé l'effet". Avec la correction de Bonferroni, le seuil a diminué à 0,05/22 = 0,0023 ; 0,04 n’a pas dépassé ce seuil. Le seul résultat « significatif » aurait été le fruit du hasard sur 22 essais. Leçon : quand on teste beaucoup, une correction est nécessaire.

Cas 3 — Sous-puissance et malédiction du vainqueur. Une petite étude pilote (n=15 par groupe) a révélé un effet très important (d=0,9) et significatif. Une vaste étude de réplication a réduit l'effet à d = 0,2. Le petit échantillon n’avait permis qu’à une surestimation de franchir le seuil. Leçon : on ne peut pas faire confiance à des tailles d'effet significatives à faible puissance.

Erreurs courantes

  • Confondre signification et importance/ampleur. L’effet n’est pas important simplement parce que p est petit ; Déclarez la taille de l’effet séparément.
  • Confondre la valeur p avec la probabilité de H0. p n'est pas la « probabilité d'absence d'effet » ; est conceptuellement différent.
  • Lire p>0,05 comme "aucun effet". Le défaut de présentation ne constitue pas une preuve d’absence ; Énoncez l’incertitude.
  • Pas de correction pour les tests multiples. Trop de tests produisent des faux positifs ; Appliquer Bonferroni/FDR.
  • Ignorer le pouvoir. L’effet significatif dans le petit échantillon est exagéré ; Calculer la puissance avant l'analyse.
Astuce : Avant de qualifier un résultat de « significatif », posez deux questions : « L’effet est-il pratiquement significatif (ampleur) ? et "Combien de tests ai-je passé avant de trouver ce résultat ?" La deuxième question est le test décisif de l’honnêteté.

En résumé

Les tests d’hypothèses et la valeur p sont des outils puissants mais mal compris. La valeur p est la probabilité de voir les données lorsque l'hypothèse nulle est vraie ; La probabilité de H0 ne correspond pas à l’ampleur de l’effet ou à la signification du résultat. Indiquez toujours l'importance ainsi que l'ampleur de l'effet et l'intervalle de confiance ; Ne lisez pas p>0,05 comme « aucun effet » ; appliquez une correction de comparaison multiple si vous avez effectué de nombreux tests ; Soyez conscient du risque d’effets exagérés liés aux études de faible puissance. L'IA produit du code et un plan de test ; Il est de votre responsabilité de faire la distinction entre le caractère significatif et le caractère significatif et de vérifier les hypothèses.

Tâche de candidature

Faites une comparaison des moyennes entre deux groupes dans un ensemble de données. Demandez à l'IA le test (avec ses hypothèses) et le code appropriés, exécutez-le et vérifiez les hypothèses. Rapportez le résultat avec trois composantes : taille de l'effet, intervalle de confiance à 95 %, valeur p. Pensez ensuite au nombre de comparaisons différentes que vous pouvez effectuer sur les mêmes données ; Si vous avez effectué plusieurs tests, appliquez la correction Bonferroni ou FDR et signalez si le résultat est toujours valable. Enfin, rédigez une évaluation approximative de la puissance pour votre analyse.

liste de contrôle

  • [ ] J'ai sélectionné le test avec ses hypothèses et vérifié les hypothèses.
  • [ ] J'ai rapporté le résultat sous forme de taille d'effet + intervalle de confiance + valeur p.
  • [ ] J'ai séparé « significatif » et « important » ; Je ne pensais pas que p était la probabilité de H0.
  • [ ] J'ai écrit p>0,05 comme "nous ne pouvions pas le montrer" plutôt que "aucun effet".
  • [ ] J'ai appliqué une correction de comparaison multiple si j'ai effectué plusieurs tests.
  • [ ] J'ai évalué la puissance d'échantillonnage ; J'étais prudent quant à la taille de l'effet à faible puissance.