Vienetas 6 / 11

Hipotezių tikrinimas ir p reikšmė: reikšmė, galia ir keli palyginimai

Pelnas:

  • Gebėjimas teisingai apibrėžti nulinę hipotezę, p reikšmę, pasikliautinąjį intervalą ir statistinę galią bei naudoti dirbtinį intelektą testų atrankoje ir interpretacijoje.
  • Gebėjimas atskirti, kas yra ir nėra p reikšmė (ne efekto dydis, ne tikslumo tikimybė) ir suprasti, kodėl reikalinga daugkartinė palyginimo korekcija
  • Gebėjimas atpažinti dirbtinio intelekto komentarus, painiojančius prasmingumą su reikšmingumu, ir pranešti apie juos su poveikio dydžiu ir neapibrėžtumu

Dažniausiai naudojamas ir labiausiai nesuprantamas statistikos įrankis yra hipotezių tikrinimas. Pagrindinė mintis paprasta: turime teiginį (pvz., „šių dviejų grupių vidurkis skiriasi“) ir jo priešingybę, nulinę hipotezę (H0 – „skirtumo iš tikrųjų nėra“). Testas įvertina, kaip gerai duomenys atitinka nulinę hipotezę. Šiame skyriuje pamatysime, kaip dirbtinis intelektas (AI) palengvina testų pasirinkimą ir interpretavimą, tačiau kodėl p-reikšmės spąstai yra tokie dažni ir pavojingi. Pradėkime nuo pradžių: AI žino, kurią bandymo sintaksę rašyti; bet jūsų darbas yra interpretuoti, ar testo prielaida tenkinama ir ką iš tikrųjų reiškia rezultatas.

Kas iš tikrųjų yra p reikšmė?

P reikšmė yra tikimybė, kad jūsų stebimas rezultatas arba ekstremalesnis rezultatas atsiras atsitiktinai, kai nulinė hipotezė yra teisinga (t. y. efekto iš tikrųjų nėra). Maža p reikšmė (0,05 yra tradicinė slenkstis) reiškia, kad „būtų nuostabu pamatyti tokius duomenis, jei tikrai nebūtų jokio poveikio“; Tai laikoma įrodymu, paneigiančiu nulinę hipotezę.

Dabar išsiaiškinkime, kas nėra p reikšmė, kurią AI dažnai painioja:

  • P reikšmė nėra tikimybė, kad nulinė hipotezė yra teisinga. p=0,03 nereiškia „yra 3% tikimybė, kad nebus jokio poveikio“.
  • P reikšmė nenurodo efekto dydžio. Labai mažas efektas gali duoti mažą p reikšmę dideliame mėginyje.
  • P reikšmė neįrodo, kad radinys yra reikšmingas ar tikras. „Svarbus“ yra statistinis terminas, „reikšmingas“ yra sprendimas.
  • p>0,05 nereiškia „nėra efekto“; Tai reiškia, kad „negalėjome parodyti poveikio šiais duomenimis“. Įrodymų nebuvimas nėra nebuvimo įrodymas.
Atsargiai: dažniausia AI aiškinimo klaida yra žodžio „reikšmingas“ pateikimas kaip „reikšmingas / stiprus / didelis poveikis“. Statistinis reikšmingumas ir praktinė reikšmė yra du skirtingi dalykai; Visada praneškite apie juos atskirai.

Pasitikėjimo intervalas ir efekto dydis: turtingesnė informacija

Vietoj vienos p reikšmės pasikliautinasis intervalas yra daug informatyvesnis: jis pateikia tikėtiną jūsų įvertinimo verčių diapazoną. Sakinys „Efektas 1 200, 95 % pasikliautinasis intervalas [300, 2 100]“ parodo ir kryptį, dydį ir neapibrėžtį; „p<0,05“ tiesiog sako „toli nuo nulio“. Šiuolaikinėje statistinėje praktikoje p reikšmė naudojama ne viena; rekomenduoja teikti ataskaitas naudojant efekto dydžio + pasikliautinojo intervalo + p vertės trejetą.

Statistinė galia ir imtis

Statistinė galia – tai tikimybė aptikti iš tikrųjų egzistuojantį efektą (1 atėmus II tipo klaidos tikimybę, t. y. „neprarasti tikrojo efekto“). Nepakankamas tyrimas yra linkęs į dvi rizikas: (1) jis nepastebi tikrojo poveikio (klaidingai neigiamas); (2) keli rezultatai, kurie pasirodo esą reikšmingi, turi išpūstus dydžius – tai vadinamasis nugalėtojo prakeiksmas, nes tik išpūstos prognozės gali peržengti slenkstį. Todėl gera praktika prieš analizę apskaičiuoti galią/imtį. AI sugeneruoja šios paskyros kodą; Tikslinio efekto dydį nustatote pagal teoriją.

Daugybinė palyginimo problema

Atliekant testą 0,05 riba reiškia „5% klaidingų teigiamų rezultatų rizika“. Bet jei atliktumėte 20 testų, vidutiniškai vienas atsitiktinai duos p<0,05, net jei visi jie iš tikrųjų yra neveiksmingi. Tai vadinama daugialypio palyginimo problema. Klaidingų teigiamų rezultatų tikimybė greitai didėja, kai tikrinama daug kintamųjų, pogrupių ar rezultatų kintamųjų. Sprendimas yra pataisyti slenkstį: Bonferroni (slenkstį padalijus iš testų skaičiaus – griežtas), Holmo arba Benjamini-Hochberg metodais, kurie kontroliuoja klaidingą aptikimo dažnį (FDR). Ši rizika tampa dar didesnė AI amžiuje, nes AI gali atlikti dešimtis testų per kelias sekundes – tai yra tiesioginis kito įrenginio (p-hacking) objektas.

Palyginimo lentelė: ką sako p reikšmė ir ko ne

išraiška

Ar tai tiesa?

Aprašymas

"p = 0,02, jokio poveikio tikimybė yra 2 %"

negerai

p nėra H0 tikimybė

„p<0,05, efektas didelis“

negerai

p nenurodo dydžio

"p = 0,20, jokio poveikio"

negerai

Negalėjimas parodyti nėra nebuvimas

"p<0,05, yra įrodymų prieš H0"

Tiesa

Atsargus ir tikslus

"Efektas 1.200 [300;2.100], p=0.01"

geriausia

Dydis + neapibrėžtumas + įrodymai

Keturi nukopijuoti raginimai

1. Tinkamo testo pasirinkimas:

Jūsų vaidmuo: statistinio testavimo asistentas. Noriu palyginti dviejų nepriklausomų grupių vidurkį (nuolatinis kintamasis). Pateikite man: kuris testas yra tinkamas (su jo prielaidomis: normalumas, dispersijos lygybė), alternatyvą, jei prielaida nesilaikoma (pvz., Welch, Mann-Whitney) ir R kodą. Aš pateiksiu rezultatą ir patikrinsiu prielaidas.

2. Teisingai nurodykite p reikšmę:

Žemiau nurodykite testo išvestį, bet TAISYKLĖS:- NENAUDOKITE p reikšmės kaip "H0 tikimybės" arba "efekto dydžio", - būtinai įtraukite efekto dydį ir 95% pasikliautinąjį intervalą, - atskirai parašykite "reikšmingas" ir "reikšmingas", - jei p>0,05, NEsakykite "nėra efekto", sakykite "negalėjome parodyti". Išvestis: [įklijuoti]

3. Galios / mėginio skaičiavimas:

Planuoju eksperimentą: dvi grupės, laukiamo efekto dydis (Coheno d) ~0,4, galia 0,80, alfa 0,05. Parašykite R kodą, kuris apskaičiuoja reikiamą imties dydį (pwr paketas) ir paaiškinkite mažai galios tyrimo riziką (laimėtojo prakeiksmas).

4. Daugkartinė palyginimo pataisa:

Atlikau 15 atskirų hipotezių testų ir turiu p reikšmes. Parašykite R kodą, kuris taiko Bonferroni ir Benjamin-Hochberg (FDR) pataisymus, paaiškinkite skirtumą tarp dviejų metodų ir vienu sakiniu apibendrinkite, kodėl neturėčiau pasitikėti tuščiu p<0,05.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Ar šio testo rezultatas prasmingas? Komentuokite rezultatą.

Šis teiginys sulaiko AI dvejetainėje „prasminga/neprasminga“; greičiausiai sukuria sakinį, kuris painioja dydį su reikšmingumu, pvz., „taip, tai reikšminga, poveikis stiprus“.

Galingas raginimas:

Jūsų vaidmuo: dėmesingas statistinis asistentas. Interpretuokite rezultatą, bet: (1) nurodykite efekto dydį + 95% pasikliautinąjį intervalą + p reikšmę kartu, (2) atskirkite reikšmingumą nuo reikšmingumo, (3) p>0,05 „neparodė“, (4) paklauskite, kiek testų atlikau; Jei daugiau nei vienas, pasiūlykite daugkartinę palyginimo pataisą, (5) priminkite, kad reikia patikrinti testo prielaidas.

Skirtumas: stiprus raginimas užtikrina turtingą ataskaitų teikimą ir apsaugo nuo p-reikšmių spąstų.

trys mini dėklai

1 atvejis – didelėje imtyje nereikšminga „reikšmė“. Vienas analitikas nustatė, kad vidutinis skirtumas tarp dviejų grupių yra „labai reikšmingas“ esant p<0,001 duomenims su 500 000 stebėjimų. Tačiau skirtumas buvo tik 0,3 balo (iš 100) ir praktiškai beprasmis. Didžiulė imtis net ir mažytį skirtumą padarė „reikšmingu“. Kai buvo pranešta apie poveikio dydį, buvo nustatyta, kad radinys yra nereikšmingas. Pamoka: reikšmingumas nėra dydis; Jei n yra didelis, kiekvienas skirtumas yra reikšmingas.

2 atvejis – kelių bandymų iliuzija. Viena komanda išbandė 22 rezultatų kintamuosius; Vienas iš jų rodė p=0,04 ir buvo paskelbtas kaip „radome efektą“. Taikant Bonferroni korekciją, riba sumažėjo iki 0,05/22 = 0,0023; 0,04 šios ribos neperžengė. Vienintelis „prasmingas“ rezultatas būtų buvęs atsitiktinis iš 22 bandymų. Pamoka: kai bandoma daug, būtina pataisyti.

3 atvejis – Underpower ir nugalėtojo prakeiksmas. Nedidelis bandomasis tyrimas (n=15 vienai grupei) nustatė, kad poveikis labai didelis (d=0,9) ir reikšmingas. Didelis replikacijos tyrimas sumažino poveikį iki d = 0,2. Maža imtis leido tik pervertinimui peržengti slenkstį. Pamoka: Negalima pasitikėti reikšmingais efektų dydžiais esant mažai galiai.

Dažnos klaidos

  • Prasmingumo supainiojimas su svarba/dydžiu. Poveikis nėra didelis vien todėl, kad p yra mažas; Atskirai praneškite apie efekto dydį.
  • Sumaišyti p reikšmę su H0 tikimybe. p nėra „neefektyvumo tikimybė“; yra konceptualiai kitoks.
  • Skaityti p>0,05 kaip „jokio poveikio“. Nepateikimas nėra neatvykimo įrodymas; Nurodykite neapibrėžtumą.
  • Netaisoma kelių bandymų. Per daug testų duoda klaidingus teigiamus rezultatus; Taikykite Bonferroni / FDR.
  • Galios ignoravimas. Reikšmingas poveikis mažoje imtyje yra perdėtas; Prieš analizę apskaičiuokite galią.
Patarimas: prieš nurašydami rezultatą kaip „reikšmingą“, užduokite du klausimus: „Ar poveikis praktiškai reikšmingas (didis)? ir „Kiek testų atlikau, kol radau šį rezultatą? Antrasis klausimas – sąžiningumo lakmuso popierėlis.

Apibendrinant

Hipotezių tikrinimas ir p vertė yra galingi, bet neteisingai suprantami įrankiai. P reikšmė yra tikimybė pamatyti duomenis, kai nulinė hipotezė yra teisinga; H0 tikimybė nėra poveikio dydis ar radinio reikšmingumas. Visada praneškite apie reikšmingumą kartu su poveikio dydžiu ir pasikliautinuoju intervalu; Neskaityti p>0,05 kaip „nėra efekto“; taikyti daugkartinę palyginimo pataisą, jei atlikote daug testų; Žinokite apie per didelio mažos galios tyrimų poveikio riziką. AI gamina bandomąjį kodą ir planą; Jūsų pareiga yra atskirti prasmingumą nuo reikšmingumo ir patikrinti prielaidas.

Taikymo užduotis

Palyginkite dviejų duomenų rinkinio grupių vidurkius. Paprašykite AI atlikti atitinkamą testą (su jo prielaidomis) ir kodą, paleiskite jį ir patikrinkite prielaidas. Praneškite apie rezultatą trimis komponentais: efekto dydis, 95 % pasikliautinasis intervalas, p reikšmė. Tada pagalvokite, kiek skirtingų palyginimų galite atlikti tuos pačius duomenis; Jei atlikote kelis bandymus, taikykite Bonferroni arba FDR pataisą ir praneškite, ar rezultatas vis dar galioja. Galiausiai parašykite apytikslį savo analizės galios įvertinimą.

kontrolinis sąrašas

  • [ ] Aš pasirinkau testą su jo prielaidomis ir patikrinau prielaidas.
  • [ ] Pateikiau rezultatą kaip efekto dydį + pasikliautinąjį intervalą + p reikšmę.
  • [ ] „Svarbų“ ir „svarbų“ laikiau atskirai; Nemaniau, kad p yra H0 tikimybė.
  • [ ] Parašiau p>0,05 kaip „negalėjome parodyti“, o ne „nėra efekto“.
  • [ ] Taikiau daugkartinę palyginimo pataisą, jei atlikau kelis testus.
  • [ ] Įvertinau atrankos galią; Aš buvau atsargus dėl efekto dydžio esant mažai galiai.