Enhed 6 / 11

Hypotesetestning og p-værdi: Signifikans, Power og Multiple Comparisons

Gevinster:

  • Evne til korrekt at definere nulhypotesen, p-værdien, konfidensinterval og statistisk styrke og bruge kunstig intelligens i testudvælgelse og -fortolkning.
  • Evne til at skelne, hvad der er og ikke er en p-værdi (ikke effektstørrelse, ikke sandsynlighed for nøjagtighed) og forstå, hvorfor multiple sammenligningskorrektion er nødvendig
  • Evne til at genkende kommentarer fremsat af kunstig intelligens, der forveksler meningsfuldhed med væsentlighed og rapportere dem med effektstørrelse og usikkerhed

Det mest brugte og mest misforståede værktøj til statistik er hypotesetestning. Grundideen er enkel: Vi har en påstand (f.eks. "middelværdien af ​​disse to grupper er forskellig") og dens modsætning, en nulhypotese (H0 - "der er faktisk ingen forskel"). Testen måler, hvor godt dataene stemmer overens med nulhypotesen. I denne enhed vil vi se, hvordan kunstig intelligens (AI) gør testvalg og fortolkning lettere, men hvorfor faldgruberne omkring p-værdien er så almindelige og farlige. Lad os starte fra begyndelsen: AI ved, hvilken testsyntaks der skal skrives; men det er din opgave at fortolke, om testens antagelse er opfyldt, og hvad resultatet egentlig betyder.

Hvad er p-værdien egentlig?

P-værdien er sandsynligheden for, at det udfald, du observerer, eller et mere ekstremt udfald, ville opstå ved et tilfælde, når nulhypotesen er sand (dvs. der er faktisk ingen effekt). En lille p-værdi (0,05 er den traditionelle tærskel) betyder "det ville være overraskende at se sådanne data, hvis der virkelig ikke var nogen effekt"; Dette betragtes som bevis mod nulhypotesen.

Lad os nu afklare, hvad p-værdien ikke er - hvilket AI ofte forveksler:

  • P-værdien er ikke sandsynligheden for, at nulhypotesen er sand. p=0,03 betyder ikke "der er 3% sandsynlighed for ingen effekt".
  • P-værdien angiver ikke størrelsen af ​​effekten. En meget lille effekt kan give en lille p-værdi i en stor prøve.
  • P-værdien beviser ikke, at fundet er signifikant eller reelt. "signifikant" er et statistisk udtryk, "signifikant" er en dom.
  • p>0,05 betyder ikke "ingen effekt"; Det betyder "vi kunne ikke vise effekten med disse data." Fravær af beviser er ikke bevis for fravær.
Forsigtig: Den mest almindelige AI-fortolkningsfejl er at præsentere ordet "betydelig" som "betydelig/stærk/større indvirkning." Statistisk signifikans og praktisk signifikans er to forskellige ting; Rapporter altid de to separat.

Konfidensinterval og effektstørrelse: rigere information

I stedet for en enkelt p-værdi er et konfidensinterval meget mere informativt: det giver det plausible værdiområde for dit estimat. Sætningen "Effekt 1.200, 95 % konfidensinterval [300, 2.100]" viser både retning, størrelse og usikkerhed; "p<0,05" siger bare "langt fra nul". Moderne statistisk praksis bruger ikke p-værdien alene; anbefaler at rapportere med trioen effektstørrelse + konfidensinterval + p-værdi.

Statistisk styrke og stikprøve

Statistisk styrke er sandsynligheden for at opdage en effekt, der faktisk eksisterer (1 minus sandsynligheden for type II fejl, dvs. "mangler den reelle effekt"). En undersøgt undersøgelse er følsom over for to risici: (1) den går glip af sande effekter (falsk negativ); (2) de få resultater, der viser sig at være signifikante, har oppustede størrelser - den såkaldte vinderforbandelse, fordi kun oppustede forudsigelser kan krydse tærsklen. Derfor er det god praksis at beregne effekt/prøve før analyse. AI genererer koden til denne konto; Du bestemmer måleffektstørrelsen med teori.

Problem med flere sammenligninger

Når man laver en test, betyder en tærskel på 0,05 "5 % risiko for falske positive". Men hvis du laver 20 tests, ville man i gennemsnit forvente at give p<0,05 tilfældigt, selv når de alle faktisk er ineffektive. Dette kaldes problemet med flere sammenligninger. Sandsynligheden for falske positiver stiger hurtigt, når et stort antal variabler, undergrupper eller udfaldsvariable testes. Løsningen er at korrigere tærsklen: Bonferroni (at dividere tærsklen med antallet af tests — streng), Holm eller Benjamini-Hochberg metoder, der kontrollerer den falske opdagelsesrate (FDR). Denne risiko bliver endnu større i AI-alderen, da AI kan producere dusinvis af tests på få sekunder - dette er det direkte emne for den næste enhed (p-hacking).

Sammenligningstabel: hvad p-værdien siger og hvad siger den ikke

udtryk

Er det sandt?

Beskrivelse

"p=0,02, sandsynligheden for ingen effekt er 2%"

forkert

p er ikke sandsynligheden for H0

"p<0,05, effekten er stor"

forkert

p angiver ikke størrelse

"p=0,20, ingen effekt"

forkert

Ikke at kunne vise er ikke fravær

"p<0,05, der er beviser mod H0"

Sandt

Forsigtig og på punkt

"Effekt 1.200 [300;2.100], p=0.01"

bedste

Størrelse + usikkerhed + beviser

Fire kopierbare prompter

1. Valg af den rigtige test:

Din rolle: statistisk testassistent. Jeg vil sammenligne middelværdien af ​​to uafhængige grupper (kontinuerlig variabel). Giv mig: hvilken test er passende (med dens antagelser: normalitet, varianslighed), alternativet, hvis antagelsen ikke er opfyldt (f.eks. Welch, Mann-Whitney), og R-koden. Jeg vil køre resultatet og tjekke antagelserne.

2. Rapportering af p-værdien korrekt:

Rapporter testresultatet nedenfor, men REGLER:- P-værdien MÅ IKKE præsenteres som "sandsynlighed for H0" eller "effektstørrelse",- sørg for at inkludere effektstørrelsen og 95 % konfidensinterval, - skriv "signifikant" og "signifikant" separat,- hvis p>0,05, Sig IKKE "ingen effekt", sig "vi kunne ikke vise". Output: [indsæt]

3. Effekt/prøveberegning:

Jeg planlægger et eksperiment: to grupper, forventet effektstørrelse (Cohens d) ~0,4, potens 0,80, alfa 0,05. Skriv R-kode, der beregner den nødvendige stikprøvestørrelse (pwr-pakke) og forklar risiciene ved en lav-powered undersøgelse (vinderens forbandelse).

4. Korrektion af flere sammenligninger:

Jeg har lavet 15 separate hypotesetest, og jeg har p-værdier. Skriv R-kode, der anvender Bonferroni og Benjamin-Hochberg (FDR) korrektionerne, forklar forskellen mellem de to metoder, og opsummer i én sætning, hvorfor jeg ikke skal stole på den blotte p<0,05.

Svag prompt / Stærk prompt

Svag prompt:

Er resultatet af denne test meningsfuldt? Kommenter resultatet.

Denne påstand fanger AI i "meningsfuld/ikke-meningsfuld" binær; producerer højst sandsynligt en sætning, der forveksler størrelse med betydning, såsom "ja, det er signifikant, effekten er stærk."

Kraftig prompt:

Din rolle: opmærksom statistisk assistent. Fortolk resultatet, men: (1) giv effektstørrelsen + 95 % konfidensinterval + p-værdi sammen, (2) adskil signifikans fra signifikans, (3) p>0,05 i "kunne ikke vise", (4) spørg, hvor mange tests jeg lavede; Hvis mere end én, foreslå flere sammenligningskorrektion, (5) minde om, at antagelserne for testen bør kontrolleres.

Forskel: stærk prompt håndhæver omfattende rapportering og beskytter mod p-værdifælder.

tre minisager

Case 1 — Ikke-signifikant "signifikans" i stor stikprøve. En analytiker fandt den gennemsnitlige forskel mellem de to grupper "meget signifikant" ved p<0,001 i data med 500.000 observationer. Men forskellen var kun 0,3 point (ud af 100) og var praktisk talt meningsløs. Den enorme prøve gjorde selv den lille forskel "betydelig". Da effektstørrelsen blev rapporteret, fandtes resultatet at være ubetydeligt. Lektion: betydning er ikke størrelse; Hvis n er stor, er enhver forskel signifikant.

Case 2 - Multiple test illusion. Et hold testede 22 udfaldsvariable; En af dem viste p=0,04 og blev annonceret som "vi fandt effekten". Med Bonferroni-korrektion faldt tærsklen til 0,05/22 = 0,0023; 0,04 nåede ikke denne grænse. Det eneste "meningsfulde" resultat ville have været tilfældigt ud af 22 forsøg. Lektion: når man tester meget, er korrektion nødvendig.

Case 3 - Underpower og vinderens forbandelse. En lille pilotundersøgelse (n=15 pr. gruppe) fandt en effekt meget stor (d=0,9) og signifikant. Et stort replikationsstudie reducerede effekten til d = 0,2. Den lille stikprøve havde kun tilladt en overvurdering at krydse tærsklen. Lektion: Betydelige effektstørrelser ved lav effekt kan ikke stoles på.

Almindelige fejl

  • Forveksler meningsfuldhed med vigtighed/størrelse. Effekten er ikke stor, bare fordi p er lille; Rapporter effektstørrelse separat.
  • Forveksler p-værdien med sandsynligheden for H0. p er ikke "sandsynligheden for ingen effekt"; er konceptuelt anderledes.
  • Læser p>0,05 som "ingen effekt". Manglende fremvisning er ikke bevis på fravær; Angiv usikkerheden.
  • Korrigerer ikke for multitest. For mange tests giver falske positiver; Anvend Bonferroni/FDR.
  • Ignorerer magt. Den signifikante effekt i den lille prøve er overdrevet; Beregn effekt før analyse.
Tip: Før du afskriver et resultat som "signifikant", skal du stille to spørgsmål: "Er effekten praktisk talt signifikant (størrelse)?" og "Hvor mange tests tog jeg, før jeg fandt dette resultat?" Det andet spørgsmål er lakmusprøven for ærlighed.

Sammenfattende

Hypotesetestning og p-værdi er kraftfulde, men misforståede værktøjer. P-værdien er sandsynligheden for at se dataene, når nulhypotesen er sand; Sandsynligheden for H0 er ikke størrelsen af ​​effekten eller betydningen af ​​fundet. Rapportér altid betydning sammen med effektstørrelsen og konfidensintervallet; Læs ikke p>0,05 som "ingen effekt"; anvende flere sammenligningskorrektion, hvis du har udført mange tests; Vær opmærksom på risikoen for overdrevne effekter fra undersøgelser med lav effekt. AI producerer testkode og blueprint; Det er dit ansvar at skelne mellem meningsfuldhed og væsentlighed og at kontrollere antagelser.

Ansøgningsopgave

Foretag en sammenligning af middelværdier mellem to grupper i et datasæt. Bed AI om den passende test (med dens antagelser) og kode, kør den og kontroller antagelserne. Rapportér resultatet med tre komponenter: effektstørrelse, 95 % konfidensinterval, p-værdi. Tænk så over, hvor mange forskellige sammenligninger du kan lave på samme data; Hvis du har kørt flere test, skal du anvende Bonferroni- eller FDR-korrektion og rapportere, om resultatet stadig holder. Skriv endelig en grov effektvurdering til din analyse.

tjekliste

  • [ ] Jeg valgte testen med dens antagelser og kontrollerede antagelserne.
  • [ ] Jeg rapporterede resultatet som effektstørrelse + konfidensinterval + p-værdi.
  • [ ] Jeg holdt "betydeligt" og "vigtigt" adskilt; Jeg troede ikke p var sandsynligheden for H0.
  • [ ] Jeg skrev p>0,05 som "vi kunne ikke vise det" i stedet for "ingen effekt".
  • [ ] Jeg anvendte flere sammenligningskorrektion, hvis jeg kørte flere test.
  • [ ] Jeg evaluerede prøveudtagningskraften; Jeg var forsigtig med effektstørrelsen ved lav effekt.