Enhet 6 / 11

Hypotesetesting og p-verdi: betydning, kraft og flere sammenligninger

Gevinster:

  • Evne til å korrekt definere nullhypotesen, p-verdien, konfidensintervallet og statistisk kraft og bruke kunstig intelligens i testvalg og tolkning.
  • Evne til å skille hva som er og ikke er en p-verdi (ikke effektstørrelse, ikke sannsynlighet for nøyaktighet) og forstå hvorfor multiple sammenligningskorreksjon er nødvendig
  • Evne til å gjenkjenne kommentarer laget av kunstig intelligens som forveksler meningsfullhet med vesentlighet og rapportere dem med effektstørrelse og usikkerhet

Det mest brukte og mest misforståtte verktøyet for statistikk er hypotesetesting. Grunnideen er enkel: vi har en påstand (f.eks. "gjennomsnittet av disse to gruppene er forskjellig") og det motsatte, en nullhypotese (H0 - "det er faktisk ingen forskjell"). Testen måler hvor godt dataene stemmer overens med nullhypotesen. I denne enheten skal vi se hvordan kunstig intelligens (AI) gjør testvalg og tolkning enklere, men hvorfor fallgruvene rundt p-verdien er så vanlige og farlige. La oss starte fra begynnelsen: AI vet hvilken testsyntaks som skal skrives; men det er din oppgave å tolke om testens forutsetning er oppfylt og hva resultatet egentlig betyr.

Hva er egentlig p-verdien?

P-verdien er sannsynligheten for at utfallet du observerer, eller et mer ekstremt utfall, ville oppstå ved en tilfeldighet når nullhypotesen er sann (dvs. det er faktisk ingen effekt). En liten p-verdi (0,05 er den tradisjonelle terskelen) betyr "det ville være overraskende å se slike data hvis det virkelig ikke var noen effekt"; Dette anses som bevis mot nullhypotesen.

La oss nå avklare hva p-verdien ikke er - som AI ofte forvirrer:

  • P-verdien er ikke sannsynligheten for at nullhypotesen er sann. p=0,03 betyr ikke "det er 3 % sannsynlighet for ingen effekt".
  • P-verdien angir ikke størrelsen på effekten. En veldig liten effekt kan gi en liten p-verdi i en stor prøve.
  • P-verdien beviser ikke at funnet er signifikant eller reelt. "Significant" er et statistisk begrep, "signifikant" er en dom.
  • p>0,05 betyr ikke "ingen effekt"; Det betyr "vi kunne ikke vise effekten med disse dataene." Fravær av bevis er ikke bevis på fravær.
Forsiktig: Den vanligste AI-tolkningsfeilen er å presentere ordet «betydelig» som «betydelig/sterk/stor innvirkning». Statistisk signifikans og praktisk signifikans er to forskjellige ting; Rapporter alltid de to separat.

Konfidensintervall og effektstørrelse: rikere informasjon

I stedet for en enkelt p-verdi, er et konfidensintervall mye mer informativt: det gir det plausible spekteret av verdier for estimatet ditt. Setningen "Effekt 1200, 95 % konfidensintervall [300, 2100]" viser både retning, størrelse og usikkerhet; "p<0,05" sier bare "langt fra null". Moderne statistisk praksis bruker p-verdien ikke alene; anbefaler rapportering med trioen effektstørrelse + konfidensintervall + p-verdi.

Statistisk kraft og utvalg

Statistisk styrke er sannsynligheten for å oppdage en effekt som faktisk eksisterer (1 minus sannsynligheten for type II feil, dvs. "mangler den virkelige effekten"). En undersøkt studie er utsatt for to risikoer: (1) den går glipp av sanne effekter (falsk negativ); (2) de få resultatene som viser seg å være signifikante har oppblåste størrelser – den såkalte vinnerens forbannelse fordi bare oppblåste spådommer kan krysse terskelen. Derfor er det god praksis å beregne effekt/prøve før analyse. AI genererer koden for denne kontoen; Du bestemmer måleffektstørrelsen med teori.

Problem med flere sammenligninger

Når du gjør en test betyr en terskel på 0,05 "5 % risiko for falske positive". Men hvis du gjør 20 tester, vil man i gjennomsnitt forvente at en gir p<0,05 ved en tilfeldighet, selv når alle faktisk er ineffektive. Dette kalles problemet med flere sammenligninger. Sannsynligheten for falske positiver øker raskt når et stort antall variabler, undergrupper eller utfallsvariabler testes. Løsningen er å korrigere terskelen: Bonferroni (deler terskelen med antall tester — strenge), Holm eller Benjamini-Hochberg-metoder som kontrollerer den falske oppdagelsesraten (FDR). Denne risikoen blir enda større i AI-alderen, ettersom AI kan produsere dusinvis av tester på sekunder – dette er det direkte emnet for neste enhet (p-hacking).

Sammenligningstabell: hva p-verdien sier og hva den ikke sier

uttrykk

Er det sant?

Beskrivelse

"p=0,02, sannsynligheten for ingen effekt er 2%"

feil

p er ikke sannsynligheten for H0

"p<0,05, effekten er stor"

feil

p indikerer ikke størrelse

"p=0,20, ingen effekt"

feil

Å ikke kunne vise er ikke fravær

"p<0,05, det er bevis mot H0"

Sant

Forsiktig og på punkt

"Effekt 1.200 [300;2.100], p=0.01"

best

Størrelse + usikkerhet + bevis

Fire kopierbare spørsmål

1. Velg riktig test:

Din rolle: assistent for statistisk testing. Jeg ønsker å sammenligne gjennomsnittet av to uavhengige grupper (kontinuerlig variabel). Gi meg: hvilken test er passende (med dens forutsetninger: normalitet, varianslikhet), alternativet hvis forutsetningen ikke er oppfylt (f.eks. Welch, Mann-Whitney), og R-koden. Jeg skal kjøre resultatet og sjekke forutsetningene.

2. Rapporter p-verdien riktig:

Rapporter testresultatet nedenfor, men REGLER:- IKKE presenter p-verdien som "sannsynlighet for H0" eller "effektstørrelse",- pass på å inkludere effektstørrelsen og 95 % konfidensintervall,- skriv "signifikant" og "signifikant" hver for seg,- hvis p>0,05, IKKE si "ingen effekt", si "vi kunne ikke vise". Utdata: [lim inn]

3. Effekt/prøveberegning:

Jeg planlegger et eksperiment: to grupper, forventet effektstørrelse (Cohens d) ~0,4, kraft 0,80, alfa 0,05. Skriv R-kode som beregner den nødvendige prøvestørrelsen (pwr-pakke) og forklar risikoen ved en lavkraftig studie (vinnerens forbannelse).

4. Korreksjon av flere sammenligninger:

Jeg har gjort 15 separate hypotesetester og jeg har p-verdier. Skriv R-kode som bruker Bonferroni og Benjamin-Hochberg (FDR) korreksjonene, forklar forskjellen mellom de to metodene, og oppsummer i én setning hvorfor jeg ikke bør stole på den bare p<0,05.

Svak forespørsel / Sterk forespørsel

Svak melding:

Er resultatet av denne testen meningsfylt? Kommenter resultatet.

Denne påstanden fanger AI i "meningsfull/ikke-meningsfull" binær; produserer mest sannsynlig en setning som forveksler størrelse med betydning, for eksempel "ja, det er betydelig, effekten er sterk."

Kraftig ledetekst:

Din rolle: oppmerksom statistikkassistent. Tolk resultatet men: (1) gi effektstørrelsen + 95 % konfidensintervall + p-verdi sammen, (2) skille signifikans fra signifikans, (3) p>0,05 i "kunne ikke vise", (4) spør hvor mange tester jeg gjorde; Hvis mer enn én, foreslå flere sammenligningskorreksjon, (5) påminn om at antakelsene for testen bør kontrolleres.

Forskjell: sterk melding fremtvinger rik rapportering og beskytter mot p-verdifeller.

tre minisaker

Tilfelle 1 – Ikke-signifikant "signifikans" i stort utvalg. En analytiker fant den gjennomsnittlige forskjellen mellom de to gruppene "høyt signifikant" ved p<0,001 i data med 500 000 observasjoner. Men forskjellen var bare 0,3 poeng (av 100) og var praktisk talt meningsløs. Det enorme utvalget gjorde selv den lille forskjellen "betydelig". Da effektstørrelsen ble rapportert, ble funnet å være ubetydelig. Leksjon: betydning er ikke størrelse; Hvis n er stor, er hver forskjell signifikant.

Tilfelle 2 - Multiple testing illusjon. Ett team testet 22 utfallsvariabler; En av dem viste p=0,04 og ble annonsert som "vi fant effekten". Med Bonferroni-korreksjon sank terskelen til 0,05/22 = 0,0023; 0,04 passerte ikke denne terskelen. Det eneste "meningsfulle" resultatet ville vært tilfeldig av 22 forsøk. Leksjon: når du tester mye, er korrigering nødvendig.

Case 3 - Underpower og vinnerens forbannelse. En liten pilotstudie (n=15 per gruppe) fant en effekt som var veldig stor (d=0,9) og signifikant. En stor replikasjonsstudie reduserte effekten til d = 0,2. Det lille utvalget hadde bare tillatt en overvurdering å krysse terskelen. Leksjon: Betydelige effektstørrelser ved lav effekt kan ikke stoles på.

Vanlige feil

  • Forveksler meningsfullhet med viktighet/størrelse. Effekten er ikke stor bare fordi p er liten; Rapporter effektstørrelse separat.
  • Forveksler p-verdien med sannsynligheten for H0. p er ikke "sannsynligheten for ingen effekt"; er konseptuelt annerledes.
  • Leser p>0,05 som "ingen effekt". Unnlatelse av å vise er ikke bevis på fravær; Angi usikkerheten.
  • Korrigerer ikke for multitesting. For mange tester gir falske positiver; Påfør Bonferroni/FDR.
  • Ignorerer makt. Den signifikante effekten i det lille utvalget er overdrevet; Beregn effekt før analyse.
Tips: Før du skriver av et resultat som "signifikant", still to spørsmål: "Er effekten praktisk talt signifikant (størrelse)?" og "Hvor mange tester tok jeg før jeg fant dette resultatet?" Det andre spørsmålet er lakmustesten for ærlighet.

Oppsummert

Hypotesetesting og p-verdi er kraftige, men misforståtte verktøy. P-verdien er sannsynligheten for å se dataene når nullhypotesen er sann; Sannsynligheten for H0 er ikke størrelsen på effekten eller betydningen av funnet. Rapporter alltid betydning sammen med effektstørrelsen og konfidensintervallet; Ikke les p>0,05 som "ingen effekt"; bruk flere sammenligningskorreksjon hvis du har gjort mange tester; Vær oppmerksom på risikoen for overdrevne effekter fra studier med lav effekt. AI produserer testkode og blåkopi; Det er ditt ansvar å skille mellom meningsfullhet og vesentlighet og å kontrollere forutsetninger.

Søknadsoppgave

Foreta en sammenligning av midler mellom to grupper i et datasett. Spør AI om riktig test (med forutsetninger) og kode, kjør den og kontroller forutsetningene. Rapporter resultatet med tre komponenter: effektstørrelse, 95 % konfidensintervall, p-verdi. Tenk så over hvor mange forskjellige sammenligninger du kan gjøre på samme data; Hvis du har kjørt flere tester, bruk Bonferroni- eller FDR-korreksjon og rapporter om resultatet fortsatt holder. Skriv til slutt en grov effektvurdering for analysen din.

sjekkliste

  • [ ] Jeg valgte testen med dens forutsetninger og sjekket forutsetningene.
  • [ ] Jeg rapporterte resultatet som effektstørrelse + konfidensintervall + p-verdi.
  • [ ] Jeg holdt "betydelig" og "viktig" adskilt; Jeg trodde ikke p var sannsynligheten for H0.
  • [ ] Jeg skrev p>0,05 som "vi kunne ikke vise det" i stedet for "ingen effekt".
  • [ ] Jeg brukte flere sammenligningskorreksjon hvis jeg kjørte flere tester.
  • [ ] Jeg evaluerte samplingskraften; Jeg var forsiktig med effektstørrelsen ved lav effekt.