Jedinica 6 / 11

Testiranje hipoteza i p-vrijednost: značaj, snaga i višestruke usporedbe

Dobici:

  • Sposobnost ispravnog definiranja nulte hipoteze, p-vrijednosti, intervala pouzdanosti i statističke snage te korištenja umjetne inteligencije u odabiru i interpretaciji testa.
  • Sposobnost razlikovanja što je p-vrijednost, a što nije (ne veličina učinka, ne vjerojatnost točnosti) i razumijevanje zašto je potrebna korekcija višestruke usporedbe
  • Sposobnost prepoznavanja komentara umjetne inteligencije koji brkaju smislenost s materijalnošću i izvještavanja o njima s veličinom učinka i nesigurnošću

Najčešće korišteni i najčešće pogrešno shvaćeni alat statistike je testiranje hipoteza. Osnovna ideja je jednostavna: imamo tvrdnju (npr. "srednja vrijednost ovih dviju grupa je različita") i njenu suprotnost, nultu hipotezu (H0 — "zapravo nema razlike"). Test mjeri koliko se podaci slažu s nultom hipotezom. U ovoj jedinici vidjet ćemo kako umjetna inteligencija (AI) olakšava odabir testa i tumačenje, ali zašto su zamke oko p-vrijednosti tako česte i opasne. Krenimo od početka: AI zna koju sintaksu testa napisati; ali vaš je posao protumačiti je li pretpostavka testa zadovoljena i što rezultat stvarno znači.

Što je zapravo p-vrijednost?

P-vrijednost je vjerojatnost da će se ishod koji promatrate, ili ekstremniji ishod, dogoditi slučajno kada je nulta hipoteza istinita (tj. zapravo nema učinka). Mala p-vrijednost (0,05 je tradicionalni prag) znači "bilo bi iznenađujuće vidjeti takve podatke da stvarno nema učinka"; Ovo se smatra dokazom protiv nulte hipoteze.

Sada razjasnimo što p-vrijednost nije - koju AI često zbunjuje:

  • P-vrijednost nije vjerojatnost da je nulta hipoteza istinita. p=0,03 ne znači da "postoji 3% vjerojatnosti da nema učinka".
  • P-vrijednost ne označava veličinu učinka. Vrlo mali učinak može dati malu p-vrijednost u velikom uzorku.
  • P-vrijednost ne dokazuje da je nalaz značajan ili stvaran. "Značajno" je statistički pojam, "značajno" je prosudba.
  • p>0,05 ne znači "bez učinka"; To znači "nismo mogli pokazati učinak s ovim podacima." Odsutnost dokaza nije dokaz odsutnosti.
Oprez: najčešća pogreška u tumačenju umjetne inteligencije je predstavljanje riječi "značajan" kao "značajan/jak/veliki utjecaj". Statistički značaj i praktični značaj dvije su različite stvari; Uvijek prijavite to dvoje odvojeno.

Interval pouzdanosti i veličina učinka: bogatije informacije

Umjesto jedne p-vrijednosti, interval pouzdanosti mnogo je informativniji: on daje prihvatljiv raspon vrijednosti za vašu procjenu. Rečenica "Učinak 1200, 95% interval pouzdanosti [300, 2100]" pokazuje i smjer, veličinu i nesigurnost; "p<0,05" samo kaže "daleko od nule". Moderna statistička praksa ne koristi samo p-vrijednost; preporučuje izvješćivanje s triom veličine učinka + intervala pouzdanosti + p-vrijednosti.

Statistička snaga i uzorak

Statistička snaga je vjerojatnost otkrivanja učinka koji stvarno postoji (1 minus vjerojatnost pogreške tipa II, tj. "nedostajanje stvarnog učinka"). Studija s nedostatkom snage podložna je dvama rizicima: (1) propušta prave učinke (lažno negativno); (2) nekoliko rezultata koji se pokažu značajnima nose napuhane veličine - takozvano pobjedničko prokletstvo jer samo napuhana predviđanja mogu prijeći prag. Stoga je dobra praksa izračunati snagu/uzorak prije analize. AI generira kod za ovaj račun; Ciljnu veličinu učinka određujete teorijom.

Problem višestruke usporedbe

Kada se provodi test, prag od 0,05 znači "5% rizika od lažno pozitivnih rezultata". Ali ako napravite 20 testova, u prosjeku bi se očekivalo da će jedan slučajno dati p<0,05, čak i kada su svi zapravo neučinkoviti. To se zove problem višestruke usporedbe. Vjerojatnost lažno pozitivnih rezultata naglo raste kada se testira veliki broj varijabli, podskupina ili varijabli ishoda. Rješenje je ispraviti prag: Bonferroni (dijeljenje praga s brojem testova — strogi), Holm ili Benjamini-Hochberg metode koje kontroliraju stopu lažnog otkrivanja (FDR). Ovaj rizik postaje još veći u doba umjetne inteligencije, budući da umjetna inteligencija može proizvesti desetke testova u sekundi — to je izravan predmet sljedeće jedinice (p-hakiranje).

Tablica usporedbe: što p-vrijednost govori, a što ne govori

izražavanje

Je li istina?

Opis

"p=0,02, vjerojatnost da nema učinka je 2%"

pogrešno

p nije vjerojatnost H0

"p<0,05, učinak je velik"

pogrešno

p ne označava veličinu

"p=0,20, nema učinka"

pogrešno

Nemogućnost pokazivanja nije odsutnost

"p<0,05, postoje dokazi protiv H0"

istina

Oprezno i na mjestu

"Učinak 1,200 [300;2,100], p=0,01"

najbolji

Veličina + neizvjesnost + dokaz

Četiri upita za kopiranje

1. Odabir pravog testa:

Vaša uloga: pomoćnik u statističkom testiranju. Želim usporediti srednju vrijednost dviju neovisnih grupa (kontinuirana varijabla). Daj mi: koji je test prikladan (sa svojim pretpostavkama: normalnost, jednakost varijance), alternativu ako pretpostavka nije ispunjena (npr. Welch, Mann-Whitney) i R kod. Pokrenut ću rezultat i provjeriti pretpostavke.

2. Ispravno prijavljivanje p-vrijednosti:

Prijavite rezultat testa u nastavku, ali PRAVILA:- NE predstavljajte p-vrijednost kao "vjerojatnost H0" ili "veličinu učinka", - obavezno uključite veličinu učinka i 95% interval pouzdanosti, - napišite "značajno" i "značajno" odvojeno, - ako je p>0,05, NEMOJTE reći "bez učinka", recite "nismo mogli pokazati". Izlaz: [zalijepi]

3. Izračun snage/uzorka:

Planiram eksperiment: dvije grupe, očekivana veličina učinka (Cohenov d) ~0,4, snaga 0,80, alfa 0,05. Napišite R kod koji izračunava potrebnu veličinu uzorka (paket pwr) i objasnite rizike studije niske snage (prokletstvo pobjednika).

4. Ispravak višestruke usporedbe:

Napravio sam 15 zasebnih testova hipoteza i imam p-vrijednosti. Napišite R kod koji primjenjuje korekcije Bonferroni i Benjamin-Hochberg (FDR), objasnite razliku između te dvije metode i u jednoj rečenici sažmite zašto ne bih trebao vjerovati golom p<0,05.

Slab upit / Jak upit

Slab upit:

Je li rezultat ovog testa značajan? Komentirajte rezultat.

Ova tvrdnja zarobljava umjetnu inteligenciju u binarnom odnosu "značajno/bez smisla"; najvjerojatnije proizvodi rečenicu koja brka veličinu sa značajem, kao što je "da, značajno je, učinak je jak."

Snažan upit:

Vaša uloga: pažljivi statistički pomoćnik. Protumačite rezultat ali: (1) dajte veličinu učinka + 95% interval pouzdanosti + p-vrijednost zajedno, (2) odvojite značaj od značajnosti, (3) p>0,05 u "nije moguće pokazati", (4) pitajte koliko sam testova napravio; Ako ih je više, predložiti višestruku usporednu korekciju, (5) podsjetiti da treba provjeriti pretpostavke testa.

Razlika: snažan prompt nameće bogato izvješćivanje i štiti od zamki p-vrijednosti.

tri mini kućišta

Slučaj 1 — Neznačajna "značajnost" u velikom uzorku. Jedan je analitičar pronašao srednju razliku između dvije skupine "vrlo značajnu" na p<0,001 u podacima s 500.000 promatranja. Ali razlika je bila samo 0,3 boda (od 100) i bila je praktički besmislena. Ogroman uzorak učinio je čak i malu razliku "značajnom". Kada je objavljena veličina učinka, utvrđeno je da je nalaz beznačajan. Lekcija: značaj nije veličina; Ako je n velik, svaka razlika je značajna.

Slučaj 2 — Iluzija višestrukog testiranja. Jedan tim je testirao 22 varijable ishoda; Jedan od njih pokazao je p=0,04 i najavljen je kao "našli smo učinak". Uz Bonferronijevu korekciju, prag se smanjio na 0,05/22 = 0,0023; 0,04 nije prešao ovaj prag. Jedini "značajan" rezultat bio bi slučajno iz 22 ispitivanja. Pouka: kada se puno testira, korekcija je neophodna.

Slučaj 3 — Nedovoljna moć i pobjednikovo prokletstvo. Mala pilot studija (n=15 po skupini) otkrila je učinak vrlo velik (d=0,9) i značajan. Velika replikacijska studija smanjila je učinak na d = 0,2. Mali uzorak samo je dopustio da precijenjena vrijednost prijeđe prag. Lekcija: Ne može se vjerovati značajnim veličinama učinka pri niskoj snazi.

Uobičajene greške

  • Brkanje smisla s važnošću/veličinom. Učinak nije velik samo zato što je p mali; Odvojeno prijavite veličinu učinka.
  • Zamjena p-vrijednosti za vjerojatnost H0. p nije "vjerojatnost bez učinka"; koncepcijski je drugačiji.
  • Očitavanje p>0,05 kao "bez učinka". Nepojavljivanje nije dokaz odsutnosti; Navedite nesigurnost.
  • Ne ispravlja se za višestruko testiranje. Previše testova daje lažno pozitivne rezultate; Nanesite Bonferroni/FDR.
  • Ignoriranje moći. Značajan učinak u malom uzorku je preuveličan; Izračunajte snagu prije analize.
Savjet: Prije nego što rezultat otpišete kao "značajan", postavite dva pitanja: "Je li učinak praktično značajan (magnituda)?" i "Koliko sam testova poduzeo prije nego što sam dobio ovaj rezultat?" Drugo pitanje je lakmus test poštenja.

Ukratko

Testiranje hipoteza i p-vrijednost moćni su, ali pogrešno shvaćeni alati. P-vrijednost je vjerojatnost da se podaci vide kada je nulta hipoteza istinita; Vjerojatnost H0 nije veličina učinka ili značaj nalaza. Uvijek navedite značaj zajedno s veličinom učinka i intervalom pouzdanosti; Nemojte čitati p>0,05 kao "bez učinka"; primijeniti korekciju višestruke usporedbe ako ste napravili mnogo testova; Budite svjesni rizika od pretjeranih učinaka studija niske snage. AI proizvodi testni kod i nacrt; Vaša je odgovornost razlikovati između smislenosti i materijalnosti te provjeriti pretpostavke.

Zadatak aplikacije

Napravite usporedbu srednjih vrijednosti između dvije skupine u skupu podataka. Zamolite AI za odgovarajući test (sa svojim pretpostavkama) i kod, pokrenite ga i provjerite pretpostavke. Izvijestite o rezultatu s tri komponente: veličina učinka, 95% interval pouzdanosti, p-vrijednost. Zatim razmislite o tome koliko različitih usporedbi možete napraviti na istim podacima; Ako ste proveli više testova, primijenite korekciju Bonferroni ili FDR i prijavite ako rezultat još uvijek stoji. Na kraju, napišite grubu procjenu snage za svoju analizu.

popis za provjeru

  • [ ] Odabrao sam test sa svojim pretpostavkama i provjerio pretpostavke.
  • [ ] Rezultat sam prijavio kao veličinu učinka + interval pouzdanosti + p-vrijednost.
  • [ ] Odvojeno sam držao “značajno” i “važno”; Nisam mislio da je p vjerojatnost H0.
  • [ ] Napisao sam p>0,05 kao "nismo mogli pokazati" umjesto "bez učinka".
  • [ ] Primijenio sam korekciju višestruke usporedbe ako sam proveo više testova.
  • [ ] Procijenio sam snagu uzorkovanja; Bio sam oprezan u pogledu veličine učinka pri niskoj snazi.