Jedinica 6 / 11

Testiranje hipoteza i p-vrijednost: značajnost, snaga i višestruka poređenja

Dobici:

  • Sposobnost ispravnog definiranja nulte hipoteze, p-vrijednosti, intervala povjerenja i statističke moći i korištenja umjetne inteligencije u odabiru i interpretaciji testa.
  • Sposobnost razlikovanja šta je, a šta nije p-vrijednost (ne veličina efekta, ne vjerovatnoća tačnosti) i razumijevanje zašto je potrebna višestruka korekcija poređenja
  • Sposobnost prepoznavanja komentara umjetne inteligencije koji brkaju smisao sa materijalnošću i prijavljuju ih s veličinom efekta i nesigurnošću

Najčešći i najčešće neshvaćeni alat statistike je testiranje hipoteza. Osnovna ideja je jednostavna: imamo tvrdnju (npr. „srednja vrednost ove dve grupe je različita“) i njenu suprotnost, nultu hipotezu (H0 — „zapravo nema razlike“). Test mjeri koliko se podaci slažu s nultom hipotezom. U ovoj jedinici ćemo vidjeti kako umjetna inteligencija (AI) olakšava odabir i interpretaciju testa, ali zašto su zamke oko p-vrijednosti tako česte i opasne. Počnimo od početka: AI zna koju sintaksu testa da napiše; ali vaš je posao da protumačite da li je pretpostavka testa zadovoljena i šta rezultat zaista znači.

Šta je zapravo p-vrijednost?

P-vrijednost je vjerovatnoća da će se ishod koji promatrate, ili ekstremniji ishod, dogoditi slučajno kada je nulta hipoteza tačna (tj. zapravo nema efekta). Mala p-vrijednost (0,05 je tradicionalni prag) znači "bilo bi iznenađujuće vidjeti takve podatke da zaista nije bilo efekta"; Ovo se smatra dokazom protiv nulte hipoteze.

Sada razjasnimo šta p-vrijednost nije - što AI često zbunjuje:

  • P-vrijednost nije vjerovatnoća da je nulta hipoteza tačna. p=0,03 ne znači "postoji 3% vjerovatnoće da nema efekta".
  • P-vrijednost ne ukazuje na veličinu efekta. Vrlo mali efekat može dati malu p-vrijednost u velikom uzorku.
  • P-vrijednost ne dokazuje da je nalaz značajan ili stvaran. “Značajno” je statistički termin, “značajno” je sud.
  • p>0,05 ne znači "bez efekta"; To znači "ne bismo mogli pokazati učinak s ovim podacima." Odsustvo dokaza nije dokaz odsustva.
Oprez: Najčešća greška u tumačenju AI je predstavljanje riječi „značajan“ kao „značajan/snažan/veliki utjecaj“. Statistički značaj i praktični značaj su dvije različite stvari; Uvijek prijavite to dvoje odvojeno.

Interval pouzdanosti i veličina efekta: bogatije informacije

Umjesto jedne p-vrijednosti, interval povjerenja je mnogo informativniji: daje vjerodostojan raspon vrijednosti za vašu procjenu. Rečenica "Efekat 1.200, 95% interval pouzdanosti [300, 2.100]" pokazuje i pravac, veličinu i nesigurnost; "p<0,05" samo kaže "daleko od nule". Moderna statistička praksa ne koristi samo p-vrijednost; preporučuje izvještavanje s triom veličina efekta + interval povjerenja + p-vrijednost.

Statistička snaga i uzorak

Statistička snaga je vjerovatnoća otkrivanja efekta koji stvarno postoji (1 minus vjerovatnoća greške tipa II, tj. „propuštanja stvarnog efekta“). Nedovoljna studija podložna je dvama rizicima: (1) propušta prave efekte (lažno negativan); (2) nekoliko rezultata za koje se ispostavi da su značajni nose naduvane veličine – takozvano prokletstvo pobednika jer samo naduvana predviđanja mogu preći prag. Stoga je dobra praksa izračunati snagu/uzorak prije analize. AI generiše kod za ovaj nalog; Veličinu ciljanog efekta određujete teorijom.

Problem višestrukog poređenja

Kada se radi test, prag od 0,05 znači "5% rizika od lažnih pozitivnih rezultata". Ali ako uradite 20 testova, u prosjeku bi se očekivalo da će jedan slučajno dati p<0,05, čak i kada su svi zapravo neefikasni. To se zove problem višestrukog poređenja. Vjerovatnoća lažno pozitivnih rezultata se brzo povećava kada se testira veliki broj varijabli, podgrupa ili varijabli ishoda. Rješenje je da se ispravi prag: Bonferroni (dijeleći prag brojem testova - strogi), Holm ili Benjamini-Hochberg metode koje kontroliraju stopu lažnog otkrivanja (FDR). Ovaj rizik postaje još veći u doba AI, jer AI može proizvesti desetine testova u sekundi — to je direktna tema sljedeće jedinice (p-hacking).

Tabela poređenja: šta p-vrijednost govori i šta ne govori

izraz

Da li je to istina?

Opis

"p=0,02, vjerovatnoća da nema efekta je 2%"

pogrešno

p nije vjerovatnoća H0

"p<0,05, efekat je veliki"

pogrešno

p ne označava veličinu

"p=0,20, nema efekta"

pogrešno

Nemogućnost pokazati nije odsustvo

"p<0,05, postoje dokazi protiv H0"

Istina

Oprezno i tačno

"Efekat 1.200 [300;2.100], p=0.01"

najbolje

Veličina + nesigurnost + dokaz

Četiri upita za kopiranje

1. Odabir pravog testa:

Vaša uloga: pomoćnik u statističkom testiranju. Želim uporediti srednju vrijednost dvije nezavisne grupe (kontinuirana varijabla). Dajte mi: koji je test prikladan (sa svojim pretpostavkama: normalnost, jednakost varijanse), alternativu ako pretpostavka nije ispunjena (npr. Welch, Mann-Whitney) i R kod. Pokrenut ću rezultat i provjeriti pretpostavke.

2. Ispravno izvještavanje o p-vrijednosti:

Izvještaj o rezultatu testa u nastavku, ali PRAVILA:- NEMOJTE predstavljati p-vrijednost kao "vjerovatnost H0" ili "veličinu efekta",- obavezno uključite veličinu efekta i 95% interval pouzdanosti,- napišite "značajno" i "značajno" odvojeno,- ako je p>0,05, NEMOJTE reći "bez efekta", recite "ne bismo mogli pokazati". Izlaz: [zalijepi]

3. Izračun snage/uzorka:

Planiram eksperiment: dvije grupe, očekivana veličina efekta (Cohenov d) ~0,4, snaga 0,80, alfa 0,05. Napišite R kod koji izračunava potrebnu veličinu uzorka (pwr paket) i objasni rizike studije male snage (prokletstvo pobjednika).

4. Korekcija višestrukog poređenja:

Uradio sam 15 odvojenih testova hipoteza i imam p-vrijednosti. Napišite R kod koji primjenjuje Bonferronijeve i Benjamin-Hochbergove (FDR) korekcije, objasnite razliku između ove dvije metode i u jednoj rečenici sažmite zašto ne bih trebao vjerovati golom p<0,05.

Slaba prompt / Jaka prompt

Slab upit:

Je li rezultat ovog testa smislen? Komentirajte rezultat.

Ova tvrdnja zarobljava AI u binarnom sistemu „smisleno/ne-smisleno“; najvjerovatnije proizvodi rečenicu koja brka veličinu sa značajem, kao što je "da, značajno je, efekat je jak".

Snažan upit:

Vaša uloga: pažljiv statistički asistent. Interpretirajte rezultat, ali: (1) dajte veličinu efekta + 95% interval pouzdanosti + p-vrijednost zajedno, (2) odvojite značajnost od značaja, (3) p>0,05 u "ne mogu pokazati", (4) pitajte koliko sam testova uradio; Ako je više od jedne, predložite višestruku korekciju poređenja, (5) podsjetite da treba provjeriti pretpostavke testa.

Razlika: jak prompt nameće bogato izveštavanje i štiti od zamki p-vrednosti.

tri mini kofera

Slučaj 1 — Beznačajan „značaj“ u velikom uzorku. Jedan analitičar je u podacima sa 500.000 zapažanja otkrio da je srednja razlika između dvije grupe "veoma značajna" na p<0,001. Ali razlika je bila samo 0,3 poena (od 100) i bila je praktično besmislena. Ogroman uzorak je čak i malu razliku učinio "značajnom". Kada je objavljena veličina efekta, nalaz je bio beznačajan. Pouka: značaj nije veličina; Ako je n veliko, svaka razlika je značajna.

Slučaj 2 — Višestruka iluzija testiranja. Jedan tim je testirao 22 varijable ishoda; Jedan od njih je pokazao p=0,04 i bio je najavljen kao "pronašli smo efekat". Sa Bonferronijevom korekcijom, prag se smanjio na 0,05/22 = 0,0023; 0,04 nije prešlo ovaj prag. Jedini "smisleni" rezultat bio bi slučajan od 22 suđenja. Pouka: kada se puno testira, neophodna je korekcija.

Slučaj 3 — Underpower i prokletstvo pobjednika. Mala pilot studija (n=15 po grupi) otkrila je da je efekat veoma velik (d=0,9) i značajan. Velika studija replikacije smanjila je učinak na d = 0,2. Mali uzorak je samo dozvolio precenjivanje da pređe prag. Pouka: Ne može se vjerovati značajnim veličinama efekta pri maloj snazi.

Uobičajene greške

  • Brkanje smislenosti sa važnošću/veličinom. Efekat nije veliki samo zato što je p mali; Zasebno prijavite veličinu efekta.
  • Rješenje p-vrijednosti za vjerovatnoću H0. p nije "vjerovatnoća da nema efekta"; je konceptualno drugačija.
  • Čitanje p>0,05 kao "bez efekta". Neprikazivanje nije dokaz odsustva; Navedite nesigurnost.
  • Ne ispravljam za višestruko testiranje. Previše testova daje lažne pozitivne rezultate; Primijenite Bonferroni/FDR.
  • Ignorisanje moći. Značajan efekat u malom uzorku je preuveličan; Izračunajte snagu prije analize.
Savjet: Prije nego što otpišete rezultat kao „značajan“, postavite dva pitanja: „Da li je učinak praktično značajan (veličina)?“ i "Koliko sam testova napravio prije nego što sam pronašao ovaj rezultat?" Drugo pitanje je lakmus test poštenja.

Ukratko

Testiranje hipoteza i p-vrijednost su moćni, ali pogrešno shvaćeni alati. P-vrijednost je vjerovatnoća da se podaci vide kada je nulta hipoteza tačna; Vjerovatnoća H0 nije veličina efekta ili značaj nalaza. Uvijek prijavite značaj zajedno sa veličinom efekta i intervalom povjerenja; Nemojte čitati p>0,05 kao "bez efekta"; primenite višestruku korekciju poređenja ako ste uradili mnogo testova; Budite svjesni rizika od pretjeranih efekata studija male snage. AI proizvodi testni kod i plan; Vaša je odgovornost da napravite razliku između smislenosti i materijalnosti i da provjerite pretpostavke.

Zadatak aplikacije

Napravite poređenje srednjih vrijednosti između dvije grupe u skupu podataka. Zatražite od AI odgovarajući test (sa njegovim pretpostavkama) i kod, pokrenite ga i provjerite pretpostavke. Izvještaj o rezultatu sa tri komponente: veličina efekta, 95% interval pouzdanosti, p-vrijednost. Zatim razmislite o tome koliko različitih poređenja možete napraviti na istim podacima; Ako ste izvršili više testova, primijenite Bonferroni ili FDR korekciju i prijavite ako rezultat još uvijek vrijedi. Na kraju, napišite grubu procjenu snage za svoju analizu.

kontrolna lista

  • [ ] Odabrao sam test sa njegovim pretpostavkama i provjerio pretpostavke.
  • [ ] Rezultat sam prijavio kao veličinu efekta + interval povjerenja + p-vrijednost.
  • [ ] Držao sam “značajno” i “važno” odvojeno; Nisam mislio da je p vjerovatnoća za H0.
  • [ ] Napisao sam p>0,05 kao "ne možemo to pokazati" umjesto "bez efekta".
  • [ ] Primijenio sam višestruku korekciju poređenja ako sam pokrenuo više testova.
  • [ ] Procijenio sam snagu uzorkovanja; Bio sam oprezan u pogledu veličine efekta pri maloj snazi.