Kitengo 6 / 11

Upimaji wa Dhana na thamani ya p: Umuhimu, Nguvu, na Milinganisho Nyingi

Faida:

  • Uwezo wa kufafanua kwa usahihi dhana potofu, thamani ya p, muda wa kujiamini na nguvu ya takwimu na kutumia akili ya bandia katika uteuzi wa majaribio na tafsiri.
  • Uwezo wa kutofautisha ni nini na sio thamani ya p (sio saizi ya athari, sio uwezekano wa usahihi) na kuelewa kwa nini urekebishaji wa kulinganisha nyingi ni muhimu.
  • Uwezo wa kutambua maoni yaliyotolewa na akili ya bandia ambayo huchanganya maana na nyenzo na kuyaripoti kwa ukubwa wa athari na kutokuwa na uhakika.

Chombo kinachotumiwa zaidi na kisichoeleweka zaidi cha takwimu ni upimaji wa nadharia. Wazo la msingi ni rahisi: tuna dai (k.m. "maana ya vikundi hivi viwili ni tofauti") na kinyume chake, nadharia tupu (H0 - "kwa kweli hakuna tofauti"). Jaribio hupima jinsi data inavyokubaliana na nadharia tupu. Katika kitengo hiki tutaona jinsi akili bandia (AI) inavyorahisisha uteuzi na ukalimani wa jaribio, lakini kwa nini mitego inayozunguka thamani ya p ni ya kawaida na hatari. Wacha tuanze kutoka mwanzo: AI inajua ni syntax gani ya mtihani ya kuandika; lakini ni kazi yako kutafsiri ikiwa dhana ya mtihani imeridhika na matokeo yake yanamaanisha nini.

Thamani ya p ni nini hasa?

Thamani ya p ni uwezekano kwamba matokeo unayoona, au matokeo mabaya zaidi, yangetokea kwa bahati wakati nadharia isiyofaa ni kweli (yaani, hakuna athari). Thamani ndogo ya p (0.05 ndio kizingiti cha jadi) inamaanisha "itashangaza kuona data kama hiyo ikiwa hakuna athari"; Huu unachukuliwa kuwa ushahidi dhidi ya nadharia tupu.

Sasa hebu tufafanue ni nini thamani ya p sio - ambayo AI mara nyingi huchanganya:

  • Thamani ya p sio uwezekano kwamba nadharia tupu ni kweli. p=0.03 haimaanishi "kuna uwezekano wa 3% wa kutokuwa na athari".
  • Thamani ya p haionyeshi ukubwa wa athari. Athari ndogo sana inaweza kutoa thamani ndogo ya p katika sampuli kubwa.
  • Thamani ya p haithibitishi kuwa matokeo ni muhimu au halisi. "Muhimu" ni neno la kitakwimu, "muhimu" ni hukumu.
  • p>0.05 haimaanishi "hakuna athari"; Inamaanisha "hatukuweza kuonyesha athari na data hii." Kutokuwepo kwa ushahidi sio ushahidi wa kutokuwepo.
Tahadhari: Hitilafu ya kawaida ya tafsiri ya AI ni kuwasilisha neno "muhimu" kama "athari kubwa/nguvu/kubwa." Umuhimu wa kitakwimu na umuhimu wa kiutendaji ni vitu viwili tofauti; Daima ripoti hizo mbili tofauti.

Muda wa kujiamini na saizi ya athari: habari tajiri

Badala ya p-thamani moja, muda wa kujiamini ni wa kuelimisha zaidi: inatoa anuwai ya thamani inayowezekana kwa makadirio yako. Sentensi "Athari 1,200, 95% ya muda wa kujiamini [300, 2,100]" inaonyesha mwelekeo, ukubwa, na kutokuwa na uhakika; "p<0.05" inasema tu "mbali na sifuri". Mazoezi ya kisasa ya takwimu hutumia p-thamani sio peke yake; inapendekeza kuripoti kwa utatu wa ukubwa wa athari + muda wa kujiamini + thamani ya p.

Nguvu ya takwimu na sampuli

Nguvu ya takwimu ni uwezekano wa kugundua athari ambayo ipo (1 ukiondoa uwezekano wa hitilafu ya aina ya II, yaani "kukosa athari halisi"). Utafiti usio na nguvu unaweza kukabiliwa na hatari mbili: (1) hukosa athari za kweli (hasi za uwongo); (2) matokeo machache ambayo yanageuka kuwa muhimu hubeba ukubwa wa umechangiwa—aitwaye laana ya mshindi kwa sababu ni ubashiri uliokithiri pekee ndio unaweza kuvuka kizingiti. Kwa hivyo, ni mazoezi mazuri kukokotoa nguvu/sampuli kabla ya uchanganuzi. AI hutengeneza msimbo wa akaunti hii; Unaamua ukubwa wa athari inayolengwa kwa nadharia.

Tatizo la kulinganisha nyingi

Wakati wa kufanya mtihani, kizingiti cha 0.05 kinamaanisha "hatari ya 5% ya chanya za uwongo". Lakini ikiwa utafanya majaribio 20, kwa wastani moja inaweza kutarajiwa kutoa p<0.05 kwa bahati, hata wakati zote hazifanyi kazi. Hii inaitwa shida ya kulinganisha nyingi. Uwezekano wa chanya za uwongo huongezeka haraka wakati idadi kubwa ya vigeu, vikundi vidogo, au vigeu vya matokeo vinapojaribiwa. Suluhisho ni kurekebisha kizingiti: Bonferroni (kugawanya kizingiti kwa idadi ya vipimo - kali), mbinu za Holm au Benjamini-Hochberg zinazodhibiti kiwango cha ugunduzi wa uongo (FDR). Hatari hii inakuwa kubwa zaidi katika umri wa AI, kwani AI inaweza kutoa majaribio kadhaa kwa sekunde - hili ndilo somo la moja kwa moja la kitengo kinachofuata (p-hacking).

Jedwali la kulinganisha: thamani ya p inasema nini na haisemi

kujieleza

Je, ni kweli?

Maelezo

"p=0.02, uwezekano wa kutokuwa na athari ni 2%"

vibaya

p sio uwezekano wa H0

"p<0.05, athari ni kubwa"

vibaya

p haionyeshi ukubwa

"p=0.20, hakuna athari"

vibaya

Kutokuwa na uwezo wa kuonyesha sio kutokuwepo

"p<0.05, kuna ushahidi dhidi ya H0"

Kweli

Tahadhari na kwa uhakika

"Athari 1.200 [300;2.100], p=0.01"

bora zaidi

Ukubwa + kutokuwa na uhakika + ushahidi

Vidokezo vinne vinavyoweza kunakiliwa

1. Kuchagua mtihani sahihi:

Jukumu lako: msaidizi wa majaribio ya takwimu. Ninataka kulinganisha maana ya vikundi viwili vya kujitegemea (kutofautisha kwa kuendelea). Nipe: ni jaribio gani linafaa (pamoja na mawazo yake: hali ya kawaida, usawa wa tofauti), mbadala ikiwa dhana haijafikiwa (k.m. Welch, Mann-Whitney), na msimbo wa R. Nitaendesha matokeo na kuangalia mawazo.

2. Kuripoti thamani ya p kwa usahihi:

Ripoti matokeo ya jaribio hapa chini, lakini KANUNI:- USIWASILISHE thamani ya p kama "uwezekano wa H0" au "ukubwa wa athari",- hakikisha kuwa unajumuisha ukubwa wa athari na muda wa 95% wa kujiamini, - andika "muhimu" na "muhimu" kando,- ikiwa p>0.05, USISEME "hakuna athari", sema "hatukuweza kuonyesha". Pato: [bandika]

3. Hesabu ya nguvu/sampuli:

Ninapanga jaribio: vikundi viwili, saizi ya athari inayotarajiwa (Cohen's d) ~0.4, nguvu 0.80, alpha 0.05. Andika msimbo R unaokokotoa saizi ya sampuli inayohitajika (kifurushi cha pwr) na ueleze hatari za utafiti usio na uwezo wa chini (laana ya mshindi).

4. Marekebisho mengi ya kulinganisha:

Nimefanya majaribio 15 tofauti ya nadharia na nina maadili ya p. Andika msimbo R unaotumia masahihisho ya Bonferroni na Benjamin-Hochberg (FDR), eleza tofauti kati ya mbinu hizo mbili, na ufupishe katika sentensi moja kwa nini nisiamini p<0.05.

Mwongozo dhaifu / Mwongozo thabiti

Agizo dhaifu:

Je, matokeo ya mtihani huu yana maana? Maoni juu ya matokeo.

Dai hili linanasa AI katika jozi "yenye maana/isiyo na maana"; uwezekano mkubwa hutoa sentensi inayochanganya ukubwa na umuhimu, kama vile "ndiyo, ni muhimu, athari ni kali."

Agizo lenye nguvu:

Jukumu lako: msaidizi wa takwimu makini. Tafsiri matokeo lakini: (1) toa ukubwa wa athari + 95% muda wa kujiamini + p-thamani pamoja, (2) tenganisha umuhimu na umuhimu, (3) p>0.05 katika "haikuweza kuonyesha", (4) uliza ni majaribio ngapi niliyofanya; Ikiwa zaidi ya moja, pendekeza marekebisho mengi ya kulinganisha, (5) kumbusha kwamba mawazo ya jaribio yanapaswa kuangaliwa.

Tofauti: arifu kali hutekeleza utoaji wa taarifa bora na hulinda dhidi ya mitego ya p-thamani.

kesi tatu ndogo

Kesi ya 1 - "Umuhimu" usio na maana katika sampuli kubwa. Mchambuzi mmoja alipata tofauti ya wastani kati ya vikundi viwili "muhimu sana" katika p<0.001 katika data na uchunguzi 500,000. Lakini tofauti ilikuwa pointi 0.3 tu (kati ya 100) na haikuwa na maana yoyote. Sampuli kubwa ilifanya hata tofauti ndogo kuwa "muhimu". Wakati ukubwa wa athari uliporipotiwa, ugunduzi ulionekana kuwa mdogo. Somo: umuhimu sio ukubwa; Ikiwa n ni kubwa, kila tofauti ni muhimu.

Kesi ya 2 - Udanganyifu wa majaribio mengi. Timu moja ilijaribu vigezo 22 vya matokeo; Mmoja wao alionyesha p=0.04 na alitangazwa kama "tumepata athari". Kwa marekebisho ya Bonferroni, kizingiti kilipungua hadi 0.05/22 = 0.0023; 0.04 haikupita kizingiti hiki. Matokeo pekee "ya maana" yangekuwa kwa bahati kati ya majaribio 22. Somo: wakati wa kupima sana, marekebisho ni muhimu.

Kesi ya 3 - Underpower na laana ya mshindi. Utafiti mdogo wa majaribio (n=15 kwa kila kikundi) ulipata athari kubwa sana (d=0.9) na muhimu. Utafiti mkubwa wa urudufishaji ulipunguza athari hadi d = 0.2. Sampuli ndogo ilikuwa imeruhusu tu kukadiria kupita kiasi kuvuka kizingiti. Somo: Ukubwa wa athari kubwa kwa nishati ya chini hauwezi kuaminiwa.

Makosa ya kawaida

  • Kuchanganya maana na umuhimu/ukubwa. Athari si kubwa kwa sababu tu p ni ndogo; Ripoti ukubwa wa athari kando.
  • Kukosea thamani ya p kwa uwezekano wa H0. p sio "uwezekano wa kutokuwa na athari"; ni tofauti kimawazo.
  • Kusoma p>0.05 kama "hakuna athari". Kushindwa kuonyesha sio ushahidi wa kutokuwepo; Eleza kutokuwa na uhakika.
  • Sio kusahihisha kwa majaribio mengi. Vipimo vingi sana hutoa chanya za uwongo; Tumia Bonferroni/FDR.
  • Kupuuza nguvu. Athari kubwa katika sampuli ndogo imezidishwa; Kuhesabu nguvu kabla ya uchambuzi.
Kidokezo: Kabla ya kufuta tokeo kama "muhimu," uliza maswali mawili: "Je, athari ni muhimu kivitendo (ukubwa)?" na "Nilifanya vipimo vingapi kabla sijapata matokeo haya?" Swali la pili ni mtihani wa litmus wa uaminifu.

Kwa muhtasari

Majaribio ya dhana na thamani ya p ni zana zenye nguvu lakini hazieleweki. Thamani ya p ni uwezekano wa kuona data wakati hypothesis isiyofaa ni ya kweli; Uwezekano wa H0 sio ukubwa wa athari au umuhimu wa kupatikana. Ripoti umuhimu kila wakati pamoja na ukubwa wa athari na muda wa kujiamini; Usisome p>0.05 kama "hakuna athari"; tumia marekebisho mengi ya kulinganisha ikiwa umefanya majaribio mengi; Jihadharini na hatari ya madhara yaliyokithiri kutoka kwa masomo ya chini ya nguvu. AI hutoa msimbo wa mtihani na mwongozo; Ni wajibu wako kutofautisha kati ya maana na mali na kuangalia mawazo.

Jukumu la maombi

Fanya ulinganisho wa njia kati ya vikundi viwili katika seti ya data. Uliza AI kwa jaribio linalofaa (na mawazo yake) na nambari, iendeshe na uangalie mawazo. Ripoti matokeo kwa kutumia vipengele vitatu: ukubwa wa athari, muda wa kutegemewa wa 95%, thamani ya p. Kisha fikiria juu ya kulinganisha ngapi tofauti unaweza kufanya kwenye data sawa; Ikiwa umeendesha majaribio mengi, tumia masahihisho ya Bonferroni au FDR na uripoti ikiwa matokeo bado yanashikilia. Mwishowe, andika tathmini mbaya ya nguvu kwa uchambuzi wako.

orodha ya ukaguzi

  • [ ] Nilichagua mtihani na mawazo yake na kuangalia mawazo.
  • [ ] Niliripoti matokeo kama saizi ya athari + muda wa kujiamini + thamani ya p.
  • [ ] Nilitenga “muhimu” na “muhimu”; Sikufikiria p ilikuwa uwezekano wa H0.
  • [ ] Niliandika p>0.05 kama "hatukuweza kuionyesha" badala ya "hakuna athari".
  • [ ] Nilitumia masahihisho mengi ya ulinganisho ikiwa nilifanya majaribio mengi.
  • [ ] Nilitathmini uwezo wa sampuli; Nilikuwa mwangalifu kuhusu saizi ya athari kwa nguvu ndogo.