Enhet 6 / 11

Hypotestestning och p-värde: Signifikans, Power och Multiple Comparisons

Vinster:

  • Förmåga att korrekt definiera nollhypotes, p-värde, konfidensintervall och statistisk styrka samt använda artificiell intelligens i testval och tolkning.
  • Förmåga att särskilja vad som är och inte är ett p-värde (inte effektstorlek, inte sannolikhet för noggrannhet) och förstå varför multipel jämförelsekorrigering är nödvändig
  • Förmåga att känna igen kommentarer från artificiell intelligens som blandar ihop meningsfullhet med väsentlighet och rapportera dem med effektstorlek och osäkerhet

Det mest använda och mest missförstådda verktyget för statistik är hypotestestning. Grundidén är enkel: vi har ett påstående (t.ex. "medelvärdet för dessa två grupper är olika") och dess motsats, en nollhypotes (H0 - "det finns faktiskt ingen skillnad"). Testet mäter hur väl data överensstämmer med nollhypotesen. I den här enheten kommer vi att se hur artificiell intelligens (AI) gör testval och tolkning lättare, men varför fallgroparna kring p-värdet är så vanliga och farliga. Låt oss börja från början: AI vet vilken testsyntax som ska skrivas; men det är din uppgift att tolka om antagandet om testet är uppfyllt och vad resultatet egentligen betyder.

Vad är egentligen p-värdet?

P-värdet är sannolikheten att det utfall du observerar, eller ett mer extremt utfall, skulle inträffa av en slump när nollhypotesen är sann (dvs det finns faktiskt ingen effekt). Ett litet p-värde (0,05 är den traditionella tröskeln) betyder "det skulle vara förvånande att se sådana data om det verkligen inte fanns någon effekt"; Detta anses vara bevis mot nollhypotesen.

Låt oss nu klargöra vad p-värdet inte är - vilket AI ofta förväxlar:

  • P-värdet är inte sannolikheten för att nollhypotesen är sann. p=0,03 betyder inte "det finns en 3% sannolikhet för ingen effekt".
  • P-värdet anger inte storleken på effekten. En mycket liten effekt kan ge ett litet p-värde i ett stort urval.
  • P-värdet bevisar inte att fyndet är signifikant eller verkligt. "Betydande" är en statistisk term, "signifikant" är en bedömning.
  • p>0,05 betyder inte "ingen effekt"; Det betyder "vi kunde inte visa effekten med dessa data." Frånvaro av bevis är inte bevis på frånvaro.
Varning: Det vanligaste AI-tolkningsfelet är att presentera ordet "signifikant" som "signifikant/stark/stor påverkan." Statistisk signifikans och praktisk signifikans är två olika saker; Rapportera alltid de två separat.

Konfidensintervall och effektstorlek: rikare information

Istället för ett enda p-värde är ett konfidensintervall mycket mer informativt: det ger det rimliga intervallet av värden för din uppskattning. Meningen "Effekt 1 200, 95 % konfidensintervall [300, 2 100]" visar både riktning, magnitud och osäkerhet; "p<0,05" säger bara "långt ifrån noll". Modern statistisk praxis använder inte p-värdet ensam; rekommenderar rapportering med trion effektstorlek + konfidensintervall + p-värde.

Statistisk kraft och urval

Statistisk styrka är sannolikheten att upptäcka en effekt som faktiskt existerar (1 minus sannolikheten för typ II-fel, d.v.s. "missar den verkliga effekten"). En underdriven studie är mottaglig för två risker: (1) den missar sanna effekter (falsk negativ); (2) de få resultat som visar sig vara signifikanta bär uppblåsta magnituder – den så kallade vinnarens förbannelse eftersom endast uppblåsta förutsägelser kan passera tröskeln. Därför är det god praxis att beräkna effekt/prov före analys. AI genererar koden för detta konto; Du bestämmer måleffektstorleken med teori.

Problem med flera jämförelser

När man gör ett test betyder ett tröskelvärde på 0,05 "5% risk för falska positiva". Men om du gör 20 tester skulle i genomsnitt en förväntas ge p<0,05 av en slump, även när alla faktiskt är ineffektiva. Detta kallas problemet med flera jämförelser. Sannolikheten för falska positiva resultat ökar snabbt när ett stort antal variabler, undergrupper eller utfallsvariabler testas. Lösningen är att korrigera tröskeln: Bonferroni (dividera tröskeln med antalet tester — strikt), Holm eller Benjamini-Hochberg metoder som kontrollerar den falska upptäcktsfrekvensen (FDR). Denna risk blir ännu större i AI-åldern, eftersom AI kan producera dussintals tester på några sekunder - detta är det direkta ämnet för nästa enhet (p-hacking).

Jämförelsetabell: vad p-värdet säger och vad det inte säger

uttryck

Är det sant?

Beskrivning

"p=0,02, sannolikheten för ingen effekt är 2%"

fel

p är inte sannolikheten för H0

"p<0,05, effekten är stor"

fel

p anger inte storlek

"p=0,20, ingen effekt"

fel

Att inte kunna visa är inte frånvaro

"p<0,05, det finns bevis mot H0"

Sant

Försiktig och på punkt

"Effekt 1.200 [300;2.100], p=0.01"

bäst

Storlek + osäkerhet + bevis

Fyra kopierbara uppmaningar

1. Att välja rätt test:

Din roll: statistisk testassistent. Jag vill jämföra medelvärdet av två oberoende grupper (kontinuerlig variabel). Ge mig: vilket test är lämpligt (med dess antaganden: normalitet, varianslikhet), alternativet om antagandet inte är uppfyllt (t.ex. Welch, Mann-Whitney) och R-koden. Jag kör resultatet och kontrollerar antagandena.

2. Rapportera p-värdet korrekt:

Rapportera testresultatet nedan, men REGLER:- Presentera INTE p-värdet som "sannolikhet för H0" eller "effektstorlek",- var noga med att inkludera effektstorleken och 95% konfidensintervall,- skriv "signifikant" och "signifikant" separat,- om p>0,05, Säg INTE "ingen effekt", säg "vi kunde inte visa". Utdata: [klistra in]

3. Effekt/provberäkning:

Jag planerar ett experiment: två grupper, förväntad effektstorlek (Cohens d) ~0,4, effekt 0,80, alfa 0,05. Skriv R-kod som beräknar den erforderliga provstorleken (pwr-paketet) och förklara riskerna med en lågeffektsstudie (vinnarens förbannelse).

4. Korrigering av flera jämförelser:

Jag har gjort 15 separata hypotestest och jag har p-värden. Skriv R-kod som tillämpar Bonferroni- och Benjamin-Hochberg (FDR)-korrigeringarna, förklara skillnaden mellan de två metoderna och sammanfatta i en mening varför jag inte ska lita på den blotta p<0,05.

Svag prompt / Stark prompt

Svag uppmaning:

Är resultatet av detta test meningsfullt? Kommentera resultatet.

Detta påstående fångar AI i "meningsfull/icke-meningsfull" binär; producerar troligen en mening som blandar ihop magnitud med signifikans, som "ja, det är signifikant, effekten är stark."

Kraftfull uppmaning:

Din roll: uppmärksam statistikassistent. Tolka resultatet men: (1) ge effektstorleken + 95 % konfidensintervall + p-värde tillsammans, (2) separera signifikans från signifikans, (3) p>0,05 i "kunde inte visa", (4) fråga hur många tester jag gjorde; Om fler än en, föreslå flera jämförelsekorrigeringar, (5) påminn om att antagandena för testet bör kontrolleras.

Skillnad: stark uppmaning tvingar fram rik rapportering och skyddar mot p-värdesfällor.

tre minifodral

Fall 1 — Obetydlig ”signifikans” i stort urval. En analytiker fann medelskillnaden mellan de två grupperna "mycket signifikant" vid p<0,001 i data med 500 000 observationer. Men skillnaden var bara 0,3 poäng (av 100) och var praktiskt taget meningslös. Det enorma urvalet gjorde även den lilla skillnaden "betydande". När effektstorleken rapporterades visade sig fyndet vara obetydligt. Lektion: signifikans är inte magnitud; Om n är stort är varje skillnad signifikant.

Fall 2 – Multipel testning illusion. Ett team testade 22 utfallsvariabler; En av dem visade p=0,04 och tillkännagavs som "vi hittade effekten". Med Bonferroni-korrigering minskade tröskeln till 0,05/22 = 0,0023; 0,04 passerade inte denna tröskel. Det enda "meningsfulla" resultatet skulle ha varit en slump av 22 försök. Lärdom: när man testar mycket är korrigering nödvändig.

Fall 3 — Undermakt och vinnarens förbannelse. En liten pilotstudie (n=15 per grupp) fann en effekt som var mycket stor (d=0,9) och signifikant. En stor replikationsstudie reducerade effekten till d = 0,2. Det lilla urvalet hade bara låtit en överskattning passera tröskeln. Lektion: Betydande effektstorlekar vid låg effekt går inte att lita på.

Vanliga misstag

  • Att blanda ihop meningsfullhet med betydelse/storlek. Effekten är inte stor bara för att p är liten; Rapportera effektstorlek separat.
  • Misstar p-värdet för sannolikheten för H0. p är inte "sannolikheten för ingen effekt"; är begreppsmässigt annorlunda.
  • Läser p>0,05 som "ingen effekt". Underlåtenhet att visa är inget bevis på frånvaro; Ange osäkerheten.
  • Korrigerar inte för multitestning. För många tester ger falska positiva resultat; Applicera Bonferroni/FDR.
  • Ignorera makt. Den signifikanta effekten i det lilla urvalet är överdriven; Beräkna effekt före analys.
Tips: Innan du skriver av ett resultat som "signifikant", ställ två frågor: "Är effekten praktiskt taget signifikant (omfattning)?" och "Hur många tester tog jag innan jag hittade det här resultatet?" Den andra frågan är lackmustestet för ärlighet.

Sammanfattningsvis

Hypotestestning och p-värde är kraftfulla men missförstådda verktyg. P-värdet är sannolikheten att se data när nollhypotesen är sann; Sannolikheten för H0 är inte storleken på effekten eller betydelsen av fyndet. Rapportera alltid signifikans tillsammans med effektstorlek och konfidensintervall; Läs inte p>0,05 som "ingen effekt"; tillämpa multipel jämförelsekorrigering om du har gjort många tester; Var medveten om risken för överdrivna effekter från lågeffektsstudier. AI producerar testkod och ritning; Det är ditt ansvar att skilja mellan meningsfullhet och väsentlighet och att kontrollera antaganden.

Applikationsuppgift

Gör en jämförelse av medelvärden mellan två grupper i en datamängd. Be AI om lämpligt test (med dess antaganden) och kod, kör det och kontrollera antagandena. Rapportera resultatet med tre komponenter: effektstorlek, 95 % konfidensintervall, p-värde. Fundera sedan på hur många olika jämförelser du kan göra på samma data; Om du har kört flera tester, använd Bonferroni- eller FDR-korrigering och rapportera om resultatet fortfarande håller. Skriv till sist en grov effektbedömning för din analys.

checklista

  • [ ] Jag valde testet med dess antaganden och kontrollerade antagandena.
  • [ ] Jag rapporterade resultatet som effektstorlek + konfidensintervall + p-värde.
  • [ ] Jag höll "betydande" och "viktigt" åtskilda; Jag trodde inte att p var sannolikheten för H0.
  • [ ] Jag skrev p>0,05 som "vi kunde inte visa det" snarare än "ingen effekt".
  • [ ] Jag tillämpade flera jämförelsekorrigeringar om jag körde flera tester.
  • [ ] Jag utvärderade samplingsförmågan; Jag var försiktig med effektstorleken vid låg effekt.