Enota 6 / 11

Preizkušanje hipotez in p-vrednost: pomembnost, moč in več primerjav

Dobički:

  • Sposobnost pravilnega definiranja ničelne hipoteze, p-vrednosti, intervala zaupanja in statistične moči ter uporabe umetne inteligence pri izbiri in interpretaciji testov.
  • Sposobnost razlikovati, kaj je in kaj ni p-vrednost (ne velikost učinka, ne verjetnost natančnosti) in razumeti, zakaj je potreben popravek večkratne primerjave
  • Sposobnost prepoznavanja komentarjev umetne inteligence, ki zamenjujejo smiselnost z materialnostjo, in poročanja o njih z velikostjo učinka in negotovostjo

Najbolj uporabljeno in najbolj napačno razumljeno orodje statistike je testiranje hipotez. Osnovna ideja je preprosta: imamo trditev (npr. »srednja vrednost teh dveh skupin je različna«) in njeno nasprotje, ničelno hipotezo (H0 — »pravzaprav ni razlike«). Test meri, kako dobro se podatki ujemajo z ničelno hipotezo. V tej enoti bomo videli, kako umetna inteligenca (AI) olajša izbiro in interpretacijo testov, a zakaj so pasti okoli p-vrednosti tako pogoste in nevarne. Začnimo od začetka: umetna inteligenca ve, katero testno sintakso naj napiše; vaša naloga pa je, da razložite, ali je predpostavka testa izpolnjena in kaj rezultat v resnici pomeni.

Kaj je pravzaprav p-vrednost?

P-vrednost je verjetnost, da bi se izid, ki ga opazujete, ali bolj skrajni izid zgodil po naključju, ko je ničelna hipoteza resnična (tj. dejansko ni učinka). Majhna p-vrednost (0,05 je tradicionalni prag) pomeni, da "bi bilo presenetljivo videti takšne podatke, če res ne bi bilo učinka"; To velja za dokaz proti ničelni hipotezi.

Zdaj pa razjasnimo, kaj p-vrednost ni – kar AI pogosto zamenjuje:

  • P-vrednost ni verjetnost, da je ničelna hipoteza resnična. p=0,03 ne pomeni, da "obstaja 3% verjetnost brez učinka".
  • P-vrednost ne označuje velikosti učinka. Zelo majhen učinek lahko povzroči majhno p-vrednost v velikem vzorcu.
  • P-vrednost ne dokazuje, da je ugotovitev pomembna ali resnična. »Pomembno« je statistični izraz, »pomembno« je presoja.
  • p>0,05 ne pomeni "ni učinka"; To pomeni, da "s temi podatki nismo mogli prikazati učinka." Odsotnost dokazov ni dokaz odsotnosti.
Pozor: najpogostejša napaka pri interpretaciji umetne inteligence je predstavitev besede »pomemben« kot »pomemben/močan/velik vpliv«. Statistična pomembnost in praktična pomembnost sta dve različni stvari; Vedno poročajte o obeh ločeno.

Interval zaupanja in velikost učinka: bogatejše informacije

Namesto ene same p-vrednosti je interval zaupanja veliko bolj informativen: daje verjeten obseg vrednosti za vašo oceno. Stavek "Učinek 1.200, 95-odstotni interval zaupanja [300, 2.100]" prikazuje smer, velikost in negotovost; "p<0,05" pravi samo "daleč od nič". Sodobna statistična praksa ne uporablja samo p-vrednosti; priporoča poročanje s trojico velikosti učinka + intervala zaupanja + p-vrednosti.

Statistična moč in vzorec

Statistična moč je verjetnost zaznavanja učinka, ki dejansko obstaja (1 minus verjetnost napake tipa II, tj. "zmanjka dejanskega učinka"). Premalo zmogljiva študija je dovzetna za dve nevarnosti: (1) zgreši prave učinke (lažno negativen); (2) nekaj rezultatov, ki se izkažejo za pomembne, nosijo napihnjene vrednosti – tako imenovano zmagovalčevo prekletstvo, ker lahko samo napihnjene napovedi presežejo prag. Zato je dobra praksa izračunati moč/vzorec pred analizo. AI ustvari kodo za ta račun; Ciljno velikost učinka določite s teorijo.

Problem večkratne primerjave

Pri izvajanju testa prag 0,05 pomeni "5-odstotno tveganje lažno pozitivnih rezultatov". Toda če naredite 20 testov, bi v povprečju pričakovali, da bo eden po naključju dal p<0,05, tudi če so vsi dejansko neučinkoviti. To se imenuje problem večkratne primerjave. Verjetnost lažno pozitivnih rezultatov se hitro poveča, ko se testira veliko število spremenljivk, podskupin ali spremenljivk izida. Rešitev je popravek praga: Bonferroni (deljenje praga s številom testov — strogi), Holmove ali Benjamini-Hochbergove metode, ki nadzorujejo stopnjo lažnih odkritij (FDR). To tveganje postane v dobi umetne inteligence še večje, saj lahko umetna inteligenca v nekaj sekundah izvede na desetine testov – to je neposredni predmet naslednje enote (p-hekanje).

Primerjalna tabela: kaj p-vrednost pove in česa ne pove

izražanje

Je res?

Opis

"p=0,02, verjetnost brez učinka je 2%"

narobe

p ni verjetnost H0

"p<0,05, učinek je velik"

narobe

p ne označuje velikosti

"p=0,20, brez učinka"

narobe

Nezmožnost pokazati ni odsotnost

"p<0,05, obstajajo dokazi proti H0"

res

Previdno in na mestu

"Učinek 1,200 [300;2,100], p=0,01"

najboljši

Velikost + negotovost + dokazi

Štirje pozivi za kopiranje

1. Izbira pravega testa:

Vaša vloga: pomočnik pri statističnem testiranju. Želim primerjati povprečje dveh neodvisnih skupin (zvezna spremenljivka). Povej mi: kateri test je primeren (s svojimi predpostavkami: normalnost, enakost variance), alternativo, če predpostavka ni izpolnjena (npr. Welch, Mann-Whitney) in kodo R. Izvedel bom rezultat in preveril predpostavke.

2. Pravilno poročanje o p-vrednosti:

Spodaj poročajte o rezultatih testa, vendar PRAVILA:- NE predstavite p-vrednosti kot "verjetnost H0" ali "velikost učinka", - obvezno vključite velikost učinka in 95-odstotni interval zaupanja, - napišite "pomemben" in "pomemben" ločeno, - če je p>0,05, NE recite "ni učinka", recite "nismo mogli pokazati". Izhod: [prilepi]

3. Izračun moči/vzorca:

Načrtujem poskus: dve skupini, pričakovana velikost učinka (Cohenov d) ~0,4, moč 0,80, alfa 0,05. Napišite kodo R, ki izračuna zahtevano velikost vzorca (paket pwr) in razložite tveganja študije z nizko močjo (prekletstvo zmagovalca).

4. Popravek večkratne primerjave:

Opravil sem 15 ločenih preizkusov hipotez in imam p-vrednosti. Napišite kodo R, ki uporablja popravke Bonferroni in Benjamin-Hochberg (FDR), razložite razliko med obema metodama in v enem stavku povzamete, zakaj ne smem zaupati golemu p<0,05.

Šibek poziv/močan poziv

Šibek poziv:

Je rezultat tega testa smiseln? Komentiraj rezultat.

Ta trditev ujame umetno inteligenco v binarni sistem »smiselno/nepomembno«; najverjetneje proizvede stavek, ki zamenjuje velikost s pomenom, na primer "da, pomembno je, učinek je močan."

Močan poziv:

Vaša vloga: pozoren statistični pomočnik. Interpretirajte rezultat, vendar: (1) navedite velikost učinka + 95-odstotni interval zaupanja + p-vrednost skupaj, (2) ločite pomembnost od pomembnosti, (3) p>0,05 v "ni bilo mogoče pokazati", (4) vprašajte, koliko testov sem opravil; Če jih je več, predlagajte večkratni primerjalni popravek, (5) opomnite, da je treba predpostavke testa preveriti.

Razlika: močan poziv uveljavlja bogato poročanje in ščiti pred pastmi p-vrednosti.

trije mini kovčki

Primer 1 – nepomembna „pomembnost“ v velikem vzorcu. En analitik je ugotovil, da je povprečna razlika med obema skupinama "zelo pomembna" pri p<0,001 v podatkih s 500.000 opazovanji. Toda razlika je bila le 0,3 točke (od 100) in je bila praktično brez pomena. Zaradi velikega vzorca je bila celo majhna razlika "pomembna". Ko so poročali o velikosti učinka, je bilo ugotovljeno, da je ugotovitev nepomembna. Lekcija: pomen ni velikost; Če je n velik, je vsaka razlika pomembna.

Primer 2 – Iluzija večkratnega testiranja. Ena ekipa je testirala 22 spremenljivk rezultatov; Ena izmed njih je pokazala p=0,04 in je bila objavljena kot "ugotovili smo učinek". Z Bonferronijevim popravkom se je prag znižal na 0,05/22 = 0,0023; 0,04 ni preseglo tega praga. Edini "smiseln" rezultat bi bil slučajno iz 22 poskusov. Nauk: pri velikem testiranju je popravek nujen.

Primer 3 — Premajhna moč in prekletstvo zmagovalca. Majhna pilotna študija (n=15 na skupino) je pokazala, da je učinek zelo velik (d=0,9) in pomemben. Velika replikacijska študija je zmanjšala učinek na d = 0,2. Majhen vzorec je dovoljeval le, da je precenjevanje preseglo prag. Lekcija: Pomembnim velikostim učinka pri nizki moči ni mogoče zaupati.

Pogoste napake

  • Zamenjevanje smisla s pomembnostjo/razsežnostjo. Učinek ni velik samo zato, ker je p majhen; Ločeno poročajte o velikosti učinka.
  • Zamenjali p-vrednost za verjetnost H0. p ni "verjetnost brez učinka"; je konceptualno drugačen.
  • Odčitek p>0,05 kot "brez učinka". Neprikaz ni dokaz odsotnosti; Navedite negotovost.
  • Ne popravlja za večkratno testiranje. Preveč testov povzroči lažno pozitivne rezultate; Nanesite Bonferroni/FDR.
  • Ignoriranje moči. Pomemben učinek v majhnem vzorcu je pretiran; Pred analizo izračunajte moč.
Nasvet: Preden rezultat odpišete kot "pomemben", postavite dve vprašanji: "Ali je učinek praktično pomemben (magnituda)?" in "Koliko testov sem opravil, preden sem našel ta rezultat?" Drugo vprašanje je lakmusov test poštenosti.

Če povzamem

Preizkušanje hipotez in p-vrednost sta močna, a napačno razumljena orodja. P-vrednost je verjetnost, da vidimo podatke, ko je ničelna hipoteza resnična; Verjetnost H0 ni velikost učinka ali pomen ugotovitve. Vedno poročajte o pomembnosti skupaj z velikostjo učinka in intervalom zaupanja; Ne berite p>0,05 kot "brez učinka"; uporabite popravek večkratne primerjave, če ste opravili veliko testov; Zavedajte se tveganja pretiranih učinkov študij nizke moči. AI izdela testno kodo in načrt; Vaša odgovornost je razlikovati med smiselnostjo in pomembnostjo ter preveriti predpostavke.

Aplikacijska naloga

Primerjajte povprečja med dvema skupinama v nizu podatkov. Prosite AI za ustrezen test (z njegovimi predpostavkami) in kodo, zaženite ga in preverite predpostavke. Poročajte o rezultatu s tremi komponentami: velikost učinka, 95-odstotni interval zaupanja, p-vrednost. Nato pomislite, koliko različnih primerjav lahko naredite na istih podatkih; Če ste izvedli več testov, uporabite korekcijo Bonferroni ali FDR in poročajte, če rezultat še vedno drži. Na koncu napišite grobo oceno moči za svojo analizo.

kontrolni seznam

  • [ ] Izbral sem test s predpostavkami in preveril predpostavke.
  • [ ] Rezultat sem prijavil kot velikost učinka + interval zaupanja + p-vrednost.
  • [ ] »Pomembno« in »pomembno« sem ločil; Nisem mislil, da je p verjetnost H0.
  • [ ] P>0,05 sem napisal kot "nismo ga mogli prikazati" in ne kot "ni učinka".
  • [ ] Uporabil sem popravek večkratne primerjave, če sem izvedel več testov.
  • [ ] Ocenil sem moč vzorčenja; Bil sem previden glede velikosti učinka pri nizki moči.