Yksikkö 6 / 11

Hypoteesin testaus ja p-arvo: merkitys, teho ja useat vertailut

Voitot:

  • Kyky määritellä oikein nollahypoteesi, p-arvo, luottamusväli ja tilastollinen teho sekä käyttää tekoälyä testin valinnassa ja tulkinnassa.
  • Kyky erottaa mikä on ja mikä ei ole p-arvo (ei vaikutuksen kokoa, ei tarkkuuden todennäköisyyttä) ja ymmärtää miksi moninkertainen vertailukorjaus on tarpeen
  • Kyky tunnistaa tekoälyn kommentit, jotka sekoittavat mielekkyyden olennaisuuteen ja raportoida niistä vaikutuksen koon ja epävarmuuden kanssa

Eniten käytetty ja väärinymmärretty tilaston työkalu on hypoteesien testaus. Perusidea on yksinkertainen: meillä on väite (esim. "näiden kahden ryhmän keskiarvo on erilainen") ja sen vastakohta, nollahypoteesi (H0 - "ei itse asiassa ole eroa"). Testi mittaa kuinka hyvin data on nollahypoteesin mukainen. Tässä osiossa näemme kuinka tekoäly (AI) helpottaa testien valintaa ja tulkintaa, mutta miksi p-arvon ympärillä olevat sudenkuopat ovat niin yleisiä ja vaarallisia. Aloitetaan alusta: AI tietää, mikä testisyntaksi kirjoittaa; mutta sinun tehtäväsi on tulkita, täyttyykö testin oletus ja mitä tulos todella tarkoittaa.

Mikä p-arvo oikeastaan ​​on?

P-arvo on todennäköisyys, että havaitsemasi lopputulos tai äärimmäisempi tulos sattuisi sattumalta, kun nollahypoteesi on totta (eli vaikutusta ei ole). Pieni p-arvo (0,05 on perinteinen kynnys) tarkoittaa, että "olisi yllättävää nähdä tällaiset tiedot, jos vaikutusta ei todellakaan olisi"; Tätä pidetään todisteena nollahypoteesia vastaan.

Selvitetään nyt, mikä p-arvo ei ole - minkä tekoäly usein sekoittaa:

  • P-arvo ei ole todennäköisyys sille, että nollahypoteesi pitää paikkansa. p=0,03 ei tarkoita, että "ei vaikutusta on 3 %:n todennäköisyydellä".
  • P-arvo ei kerro vaikutuksen kokoa. Hyvin pieni vaikutus voi tuottaa pienen p-arvon suuressa näytteessä.
  • P-arvo ei todista löydön olevan merkittävä tai todellinen. "Merkittävä" on tilastollinen termi, "merkittävä" on tuomio.
  • p>0,05 ei tarkoita "ei vaikutusta"; Se tarkoittaa, että "emme voineet näyttää vaikutusta näillä tiedoilla". Todisteiden puuttuminen ei ole todiste puuttumisesta.
Varoitus: Yleisin tekoälyn tulkintavirhe on sanan "merkittävä" esittäminen muodossa "merkittävä/vahva/suuri vaikutus". Tilastollinen merkitys ja käytännön merkitys ovat kaksi eri asiaa; Ilmoita aina erikseen.

Luottamusväli ja tehosteen koko: monipuolisempi tieto

Yhden p-arvon sijaan luottamusväli on paljon informatiivisempi: se antaa uskottavan arvoalueen arviollesi. Lause "Vaikutus 1 200, 95 % luottamusväli [300, 2 100]" osoittaa sekä suunnan, suuruuden ja epävarmuuden; "p<0,05" sanoo vain "kaukana nollasta". Nykyaikainen tilastokäytäntö ei käytä p-arvoa yksin; suosittelee raportointia triolla vaikutuskoko + luottamusväli + p-arvo.

Tilastollinen teho ja näyte

Tilastollinen teho on todennäköisyys havaita todella olemassa oleva vaikutus (1 miinus tyypin II virheen todennäköisyys, eli "todellinen vaikutus puuttuu"). Alivoimainen tutkimus on alttiina kahdelle riskille: (1) se jättää huomiotta todelliset vaikutukset (väärä negatiivinen); (2) ne harvat tulokset, jotka osoittautuvat merkittäviksi, kantavat paisutettuja magnitudeja – niin kutsuttu voittajan kirous, koska vain paisutetut ennusteet voivat ylittää kynnyksen. Siksi on hyvä käytäntö laskea teho/näyte ennen analyysiä. AI luo koodin tälle tilille; Voit määrittää tavoitevaikutuksen koon teorian avulla.

Monipuolinen vertailuongelma

Testiä tehtäessä kynnys 0,05 tarkoittaa "5 %:n riskiä vääriin positiivisiin tuloksiin". Mutta jos teet 20 testiä, keskimäärin yhden odotetaan antavan p<0,05 sattumalta, vaikka ne kaikki olisivatkin tehottomia. Tätä kutsutaan moninkertaisen vertailun ongelmaksi. Väärien positiivisten tulosten todennäköisyys kasvaa nopeasti, kun testataan suuria määriä muuttujia, alaryhmiä tai tulosmuuttujia. Ratkaisu on korjata kynnys: Bonferroni (jakamalla kynnyksen testien määrällä - tiukka), Holmin tai Benjamini-Hochbergin menetelmät, jotka ohjaavat vääriä havaitsemisprosenttia (FDR). Tämä riski kasvaa entisestään tekoälyn aikakaudella, koska tekoäly voi tuottaa kymmeniä testejä sekunneissa – tämä on seuraavan yksikön (p-hakkerointi) suora aihe.

Vertailutaulukko: mitä p-arvo sanoo ja mitä se ei kerro

ilmaisua

Onko se totta?

Kuvaus

"p = 0,02, todennäköisyys, ettei vaikutusta ole, on 2 %"

väärin

p ei ole H0:n todennäköisyys

"p<0,05, vaikutus on suuri"

väärin

p ei osoita kokoa

"p=0,20, ei vaikutusta"

väärin

Se, että ei pysty näyttämään, ei ole poissaoloa

"p<0,05, on todisteita H0:ta vastaan"

Totta

Varovainen ja asiallinen

"Vaikutus 1.200 [300;2.100], p=0.01"

paras

Koko + epävarmuus + todisteet

Neljä kopioitavaa kehotetta

1. Oikean testin valitseminen:

Tehtäväsi: tilastollinen testausassistentti. Haluan verrata kahden itsenäisen ryhmän keskiarvoa (jatkuva muuttuja). Kerro minulle: mikä testi on sopiva (oletuksineen: normaalius, varianssin yhtäläisyys), vaihtoehto, jos oletus ei täyty (esim. Welch, Mann-Whitney) ja R-koodi. Ajan tuloksen ja tarkistan oletukset.

2. Ilmoita p-arvo oikein:

Ilmoita testitulos alla, mutta SÄÄNNÖT:- ÄLÄ esitä p-arvoa "todennäköisyys H0" tai "vaikutuksen koko",- muista sisällyttää vaikutuksen koko ja 95 %:n luottamusväli,- kirjoita "merkittävä" ja "merkittävä" erikseen,- jos p>0,05, ÄLÄ sano "ei vaikutusta", sano "emme voineet näyttää". Tulos: [liitä]

3. Teho/näytelaskenta:

Suunnittelen kokeilua: kaksi ryhmää, odotetun vaikutuksen koko (Cohenin d) ~0,4, teho 0,80, alfa 0,05. Kirjoita R-koodi, joka laskee vaaditun otoskoon (pwr-paketti) ja selitä vähätehoisen tutkimuksen riskit (voittajan kirous).

4. Usean vertailun korjaus:

Olen tehnyt 15 erillistä hypoteesitestiä ja minulla on p-arvot. Kirjoita R-koodi, joka käyttää Bonferroni- ja Benjamin-Hochberg (FDR) -korjauksia, selitä näiden kahden menetelmän ero ja tiivistä yhteen lauseeseen, miksi en luota paljaaseen p<0,05:een.

Heikko kehote / Vahva kehote

Heikko kehote:

Onko tämän testin tulos merkityksellinen? Kommentoi tulosta.

Tämä väite vangitsee tekoälyn "merkityksellisessä/merkittämättömässä" binäärissä; tuottaa todennäköisesti lauseen, joka sekoittaa suuruuden merkitykseen, kuten "kyllä, se on merkittävää, vaikutus on voimakas".

Tehokas kehotus:

Tehtäväsi: tarkkaavainen tilastoavustaja. Tulkitse tulos, mutta: (1) anna vaikutuksen koko + 95 % luottamusväli + p-arvo yhdessä, (2) erota merkitsevyys merkitsevyydestä, (3) p>0,05 "ei voinut näyttää", (4) kysy kuinka monta testiä tein; Jos useampi kuin yksi, ehdota useita vertailukorjauksia, (5) muistuta, että testin oletukset tulee tarkistaa.

Ero: vahva kehote varmistaa monipuolisen raportoinnin ja suojaa p-arvoloukuilta.

kolme minilaukkua

Tapaus 1 – Ei-merkittävä ”merkitys” suuressa otoksessa. Eräs analyytikko havaitsi keskimääräisen eron kahden ryhmän välillä "erittäin merkitseväksi" arvolla p < 0,001 500 000 havainnon tiedoissa. Mutta ero oli vain 0,3 pistettä (100:sta) ja se oli käytännössä merkityksetön. Valtava näyte teki pienestäkin erosta "merkittävän". Kun vaikutuksen koko ilmoitettiin, löydöksen todettiin olevan merkityksetön. Oppitunti: merkitys ei ole suuruus; Jos n on suuri, jokainen ero on merkitsevä.

Tapaus 2 – Usean testauksen illuusio. Yksi tiimi testasi 22 tulosmuuttujaa; Yksi niistä osoitti p=0,04 ja ilmoitettiin "löysimme vaikutuksen". Bonferroni-korjauksella kynnys laski arvoon 0,05/22 = 0,0023; 0,04 ei ylittänyt tätä kynnystä. Ainoa "merkittävä" tulos olisi ollut sattuma 22 kokeesta. Oppitunti: kun testataan paljon, korjaus on tarpeen.

Tapaus 3 – Underpower ja voittajan kirous. Pienessä pilottitutkimuksessa (n = 15 ryhmää kohti) havaittiin, että vaikutus on erittäin suuri (d = 0,9) ja merkittävä. Laaja replikaatiotutkimus vähensi vaikutuksen arvoon d = 0,2. Pieni otos oli sallinut vain yliarvioinnin ylittää kynnyksen. Oppitunti: Merkittäviä tehosteita pienellä teholla ei voi luottaa.

Yleisiä virheitä

  • Sekoita mielekkyys tärkeyteen/suuruuteen. Vaikutus ei ole suuri vain siksi, että p on pieni; Ilmoita tehosteen koko erikseen.
  • P-arvon sekoittaminen H0:n todennäköisyyteen. p ei ole "vaikutuksen puuttumisen todennäköisyys"; on käsitteellisesti erilainen.
  • Luetaan p>0,05 "ei vaikutusta". Esittämättä jättäminen ei ole todiste poissaolosta; Ilmoita epävarmuus.
  • Ei korjausta monitestaukseen. Liian monet testit tuottavat vääriä positiivisia tuloksia; Käytä Bonferroni/FDR.
  • Voiman huomioimatta jättäminen. Merkittävä vaikutus pienessä otoksessa on liioiteltu; Laske teho ennen analysointia.
Vinkki: Ennen kuin kirjoitat tuloksen "merkittäväksi", kysy kaksi kysymystä: "Onko vaikutus käytännössä merkittävä (suuruus)?" ja "Kuinka monta testiä tein ennen kuin sain tämän tuloksen?" Toinen kysymys on rehellisyyden lakmuskoe.

Yhteenvetona

Hypoteesin testaus ja p-arvo ovat tehokkaita, mutta väärinymmärrettyjä työkaluja. p-arvo on todennäköisyys nähdä data, kun nollahypoteesi on totta; H0:n todennäköisyys ei ole vaikutuksen suuruus tai löydön merkitys. Ilmoita aina merkitys sekä vaikutuksen koko ja luottamusväli; Älä lue p>0,05 "ei vaikutusta"; käytä useita vertailukorjauksia, jos olet tehnyt useita testejä; Ole tietoinen vähätehoisten tutkimusten liioiteltujen vaikutusten riskistä. AI tuottaa testikoodia ja suunnitelmaa; Sinun vastuullasi on erottaa merkityksellisyys ja olennaisuus ja tarkistaa olettamukset.

Sovellustehtävä

Vertaile tietojoukon kahden ryhmän keskiarvoja. Pyydä tekoälyltä sopiva testi (oletuksineen) ja koodi, suorita se ja tarkista oletukset. Raportoi tulos kolmella komponentilla: vaikutuksen koko, 95 %:n luottamusväli, p-arvo. Mieti sitten, kuinka monta erilaista vertailua voit tehdä samoista tiedoista; Jos olet suorittanut useita testejä, käytä Bonferroni- tai FDR-korjausta ja ilmoita, onko tulos edelleen voimassa. Kirjoita lopuksi karkea tehoarvio analyysiäsi varten.

tarkistuslista

  • [ ] Valitsin testin sen oletuksineen ja tarkistin oletukset.
  • [ ] Raportoin tulokseksi efektin koko + luottamusväli + p-arvo.
  • [ ] Pidin "merkittävän" ja "tärkeän" erillään; En uskonut, että p oli H0:n todennäköisyys.
  • [ ] Kirjoitin p>0,05:ksi "emme voineet näyttää sitä" eikä "ei vaikutusta".
  • [ ] Käytin useita vertailukorjauksia, jos suoritin useita testejä.
  • [ ] Arvioin näytteenottotehon; Olin varovainen tehosteen koon suhteen pienellä teholla.