Yunit 6 / 11

Pagsusuri sa Hypothesis at p-value: Kahalagahan, Kapangyarihan, at Maramihang Paghahambing

Mga nadagdag:

  • Kakayahang wastong tukuyin ang null hypothesis, p-value, confidence interval at statistical power at gumamit ng artificial intelligence sa pagpili at interpretasyon ng pagsusulit.
  • Kakayahang makilala kung ano ang at hindi isang p-value (hindi laki ng epekto, hindi probabilidad ng katumpakan) at maunawaan kung bakit kailangan ang maramihang pagwawasto ng paghahambing
  • Kakayahang kilalanin ang mga komentong ginawa ng artipisyal na katalinuhan na nalilito ang kahalagahan sa materyalidad at iulat ang mga ito nang may sukat at kawalan ng katiyakan.

Ang pinakaginagamit at pinaka-hindi nauunawaang tool ng istatistika ay ang pagsubok sa hypothesis. Ang pangunahing ideya ay simple: mayroon kaming isang claim (hal. "ang ibig sabihin ng dalawang pangkat na ito ay magkaiba") at ang kabaligtaran nito, isang null hypothesis (H0 - "talagang walang pagkakaiba"). Ang pagsubok ay sumusukat kung gaano kahusay ang data ay sumasang-ayon sa null hypothesis. Sa unit na ito, makikita natin kung paano ginagawang mas madali ng artificial intelligence (AI) ang pagpili at interpretasyon ng pagsubok, ngunit bakit karaniwan at mapanganib ang mga pitfalls sa paligid ng p-value. Magsimula tayo sa simula: Alam ng AI kung aling test syntax ang isusulat; ngunit ito ay ang iyong trabaho upang bigyang-kahulugan kung ang palagay ng pagsubok ay nasiyahan at kung ano ang tunay na kahulugan ng resulta.

Ano ba talaga ang p-value?

Ang p-value ay ang posibilidad na ang kinalabasan na iyong naobserbahan, o isang mas matinding kinalabasan, ay mangyayari nang nagkataon kapag ang null hypothesis ay totoo (ibig sabihin, wala talagang epekto). Ang isang maliit na p-value (0.05 ay ang tradisyonal na threshold) ay nangangahulugang "makapagtataka na makita ang naturang data kung talagang walang epekto"; Ito ay itinuturing na ebidensya laban sa null hypothesis.

Ngayon linawin natin kung ano ang hindi p-value - na kadalasang nalilito ng AI:

  • Ang p-value ay hindi ang posibilidad na ang null hypothesis ay totoo. Ang p=0.03 ay hindi nangangahulugang "may 3% na posibilidad na walang epekto".
  • Ang p-value ay hindi nagpapahiwatig ng laki ng epekto. Ang isang napakaliit na epekto ay maaaring magbunga ng isang maliit na p-value sa isang malaking sample.
  • Ang p-value ay hindi nagpapatunay na ang paghahanap ay makabuluhan o totoo. Ang "Mahalaga" ay isang istatistikal na termino, ang "mahalaga" ay isang paghatol.
  • p>0.05 ay hindi nangangahulugang "walang epekto"; Nangangahulugan ito na "hindi namin maipakita ang epekto sa data na ito." Ang kawalan ng ebidensya ay hindi katibayan ng kawalan.
Babala: Ang pinakakaraniwang error sa interpretasyon ng AI ay ang pagpapakita ng salitang "mahalaga" bilang "mahalaga/malakas/malaking epekto." Ang istatistikal na kahalagahan at praktikal na kahalagahan ay dalawang magkaibang bagay; Laging iulat ang dalawa nang magkahiwalay.

Ang pagitan ng kumpiyansa at laki ng epekto: mas mayamang impormasyon

Sa halip na isang solong p-value, ang isang agwat ng kumpiyansa ay higit na nagbibigay-kaalaman: nagbibigay ito ng posibleng hanay ng mga halaga para sa iyong pagtatantya. Ang pangungusap na "Epekto 1,200, 95% agwat ng kumpiyansa [300, 2,100]" ay nagpapakita ng parehong direksyon, magnitude, at kawalan ng katiyakan; "p<0.05" lang ang sinasabing "far from zero". Ang modernong istatistikal na kasanayan ay gumagamit ng p-value hindi nag-iisa; Inirerekomenda ang pag-uulat kasama ang trio ng laki ng epekto + agwat ng kumpiyansa + p-value.

Kapangyarihan at sample ng istatistika

Ang statistic power ay ang posibilidad ng pag-detect ng isang epekto na aktwal na umiiral (1 minus ang posibilidad ng type II error, ibig sabihin, "nawawala ang tunay na epekto"). Ang isang underpowered na pag-aaral ay madaling kapitan sa dalawang panganib: (1) nakakaligtaan nito ang mga tunay na epekto (false negative); (2) ang ilang mga resulta na lumalabas na makabuluhang nagdadala ng napalaki na magnitude—ang tinatawag na sumpa ng nagwagi dahil ang mga napalaki na hula lamang ang maaaring tumawid sa threshold. Samakatuwid, magandang kasanayan ang pagkalkula ng kapangyarihan/sample bago ang pagsusuri. Binubuo ng AI ang code para sa account na ito; Tinutukoy mo ang laki ng target na epekto gamit ang teorya.

Problema sa maramihang paghahambing

Kapag gumagawa ng pagsubok, ang threshold na 0.05 ay nangangahulugang "5% na panganib ng mga maling positibo." Ngunit kung gagawa ka ng 20 pagsusulit, sa karaniwan, ang isa ay inaasahang magbibigay ng p<0.05 kapag nagkataon, kahit na ang lahat ng mga ito ay talagang hindi epektibo. Ito ay tinatawag na multiple comparison problem. Mabilis na tumataas ang posibilidad ng mga maling positibo kapag nasubok ang malaking bilang ng mga variable, subgroup, o mga variable ng resulta. Ang solusyon ay upang itama ang threshold: Bonferroni (hinahati ang threshold sa bilang ng mga pagsubok — mahigpit), Holm o Benjamini-Hochberg na mga pamamaraan na kumokontrol sa false discovery rate (FDR). Ang panganib na ito ay nagiging mas malaki sa edad ng AI, dahil ang AI ay makakagawa ng dose-dosenang mga pagsubok sa loob ng ilang segundo — ito ang direktang paksa ng susunod na yunit (p-hacking).

Talahanayan ng paghahambing: kung ano ang sinasabi ng p-value at kung ano ang hindi sinasabi nito

pagpapahayag

totoo ba?

Paglalarawan

"p=0.02, ang posibilidad na walang epekto ay 2%"

mali

Ang p ay hindi ang posibilidad ng H0

"p<0.05, malaki ang epekto"

mali

p ay hindi nagpapahiwatig ng laki

"p=0.20, walang epekto"

mali

Ang hindi makapagpakita ay hindi kawalan

"p<0.05, may ebidensya laban sa H0"

totoo

Maingat at on point

"Epekto 1.200 [300;2.100], p=0.01"

pinakamahusay

Sukat + kawalan ng katiyakan + katibayan

Apat na makokopya na prompt

1. Pagpili ng tamang pagsubok:

Ang iyong tungkulin: statistical testing assistant. Gusto kong ihambing ang ibig sabihin ng dalawang independiyenteng grupo (continuous variable). Bigyan mo ako: aling pagsubok ang naaangkop (kasama ang mga pagpapalagay nito: normalidad, pagkakapantay-pantay ng pagkakaiba-iba), ang kahalili kung hindi natutugunan ang pagpapalagay (hal. Welch, Mann-Whitney), at ang R code. Patakbuhin ko ang resulta at suriin ang mga pagpapalagay.

2. Pag-uulat ng p-value nang tama:

Iulat ang test output sa ibaba, ngunit PANUNTUNAN:- HUWAG ipakita ang p-value bilang "probability ng H0" o "effect size",- siguraduhing isama ang effect size at 95% confidence interval,- isulat ang "significant" at "significant" nang hiwalay,- kung p>0.05, HUWAG sabihin ang "no effect", sabihin ang "we could not show". Output: [i-paste]

3. Power/sample na pagkalkula:

Nagpaplano ako ng eksperimento: dalawang grupo, inaasahang laki ng epekto (Cohen's d) ~0.4, power 0.80, alpha 0.05. Sumulat ng R code na kinakalkula ang kinakailangang laki ng sample (pwr package) at ipaliwanag ang mga panganib ng isang low-powered na pag-aaral (sumpa ng nanalo).

4. Pagwawasto ng maramihang paghahambing:

Nakagawa na ako ng 15 magkahiwalay na pagsubok sa hypothesis at mayroon akong mga p-values. Sumulat ng R code na naglalapat ng mga pagwawasto ng Bonferroni at Benjamin-Hochberg (FDR), ipaliwanag ang pagkakaiba sa pagitan ng dalawang pamamaraan, at ibuod sa isang pangungusap kung bakit hindi ako dapat magtiwala sa walang laman na p<0.05.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Makahulugan ba ang resulta ng pagsusulit na ito? Magkomento sa resulta.

Kinulong ng claim na ito ang AI sa binary na "meaningful/non-meaningful"; malamang na gumagawa ng isang pangungusap na nakalilito sa magnitude sa kahalagahan, tulad ng "oo, ito ay makabuluhan, ang epekto ay malakas."

Napakahusay na prompt:

Ang iyong tungkulin: matulungin na katulong sa istatistika. Bigyang-kahulugan ang resulta ngunit: (1) ibigay ang laki ng epekto + 95% agwat ng kumpiyansa + p-halaga nang sama-sama, (2) ihiwalay ang kahalagahan mula sa kahalagahan, (3) p>0.05 sa "hindi maipakita", (4) itanong kung ilang pagsubok ang ginawa ko; Kung higit sa isa, magmungkahi ng maramihang paghahambing na pagwawasto, (5) ipaalala na ang mga pagpapalagay ng pagsusulit ay dapat suriin.

Pagkakaiba: ang malakas na prompt ay nagpapatupad ng masaganang pag-uulat at nagpoprotekta laban sa mga p-value traps.

tatlong mini case

Kaso 1 — Hindi gaanong "kabuluhan" sa malaking sample. Natuklasan ng isang analyst ang ibig sabihin ng pagkakaiba sa pagitan ng dalawang grupo na "highly significant" sa p<0.001 sa data na may 500,000 obserbasyon. Ngunit ang pagkakaiba ay 0.3 puntos lamang (sa 100) at halos walang kahulugan. Ang malaking sample ay ginawa kahit na ang maliit na pagkakaiba ay "makabuluhan". Kapag ang laki ng epekto ay iniulat, ang paghahanap ay natagpuan na hindi gaanong mahalaga. Aral: ang kahalagahan ay hindi magnitude; Kung malaki ang n, ang bawat pagkakaiba ay makabuluhan.

Kaso 2 — Maramihang pagsubok na ilusyon. Sinubukan ng isang koponan ang 22 na mga variable ng kinalabasan; Ang isa sa kanila ay nagpakita ng p=0.04 at inihayag bilang "nahanap namin ang epekto". Sa pagwawasto ng Bonferroni, bumaba ang threshold sa 0.05/22 = 0.0023; 0.04 ay hindi pumasa sa threshold na ito. Ang tanging "makabuluhang" resulta ay nagkataon sa 22 na pagsubok. Aral: kapag maraming pagsubok, kailangan ang pagwawasto.

Case 3 — Underpower at sumpa ng nanalo. Ang isang maliit na pag-aaral ng piloto (n=15 bawat grupo) ay nakakita ng isang epekto na napakalaki (d=0.9) at makabuluhan. Ang isang malaking pag-aaral ng pagtitiklop ay nagbawas ng epekto sa d = 0.2. Ang maliit na sample ay pinahintulutan lamang ang labis na pagtatantya na tumawid sa threshold. Aralin: Ang mga makabuluhang laki ng epekto sa mababang kapangyarihan ay hindi mapagkakatiwalaan.

Mga karaniwang pagkakamali

  • Nakalilito ang kahulugan sa kahalagahan/magnitude. Ang epekto ay hindi malaki dahil lamang sa p ay maliit; Iulat ang laki ng epekto nang hiwalay.
  • Napagkamalan ang p-value para sa posibilidad ng H0. ang p ay hindi ang "probability of no effect"; ay magkaiba sa konsepto.
  • Binabasa ang p>0.05 bilang "walang epekto". Ang hindi pagpapakita ay hindi katibayan ng pagliban; Sabihin ang kawalan ng katiyakan.
  • Hindi pagwawasto para sa multi-testing. Masyadong maraming mga pagsubok ang gumagawa ng mga maling positibo; Ilapat ang Bonferroni/FDR.
  • Hindi pinapansin ang kapangyarihan. Ang makabuluhang epekto sa maliit na sample ay pinalaki; Kalkulahin ang kapangyarihan bago ang pagsusuri.
Tip: Bago isulat ang isang resulta bilang "mahalaga," magtanong ng dalawang tanong: "Ang epekto ba ay praktikal na makabuluhan (magnitude)?" at "Ilang pagsubok ang ginawa ko bago ko mahanap ang resultang ito?" Ang pangalawang tanong ay ang litmus test ng katapatan.

Sa buod

Ang pagsusuri sa hypothesis at p-value ay makapangyarihan ngunit hindi nauunawaan na mga tool. Ang p-value ay ang posibilidad na makita ang data kapag ang null hypothesis ay totoo; Ang posibilidad ng H0 ay hindi ang laki ng epekto o ang kahalagahan ng paghahanap. Palaging iulat ang kahalagahan kasama ang laki ng epekto at agwat ng kumpiyansa; Huwag basahin ang p>0.05 bilang "walang epekto"; ilapat ang maramihang pagwawasto ng paghahambing kung nakagawa ka ng maraming pagsubok; Magkaroon ng kamalayan sa panganib ng labis na mga epekto mula sa mga pag-aaral na may mababang kapangyarihan. Gumagawa ang AI ng test code at blueprint; Responsibilidad mong tukuyin ang pagkakaiba sa pagitan ng pagiging makabuluhan at materyalidad at suriin ang mga pagpapalagay.

Gawain ng aplikasyon

Gumawa ng paghahambing ng mga paraan sa pagitan ng dalawang pangkat sa isang set ng data. Tanungin ang AI para sa naaangkop na pagsubok (kasama ang mga pagpapalagay nito) at code, patakbuhin ito at suriin ang mga pagpapalagay. Iulat ang resulta na may tatlong bahagi: laki ng epekto, 95% agwat ng kumpiyansa, p-value. Pagkatapos ay isipin kung gaano karaming iba't ibang mga paghahambing ang maaari mong gawin sa parehong data; Kung nagpatakbo ka ng maraming pagsubok, ilapat ang Bonferroni o FDR correction at iulat kung nananatili pa rin ang resulta. Panghuli, sumulat ng isang magaspang na pagtatasa ng kapangyarihan para sa iyong pagsusuri.

checklist

  • [ ] Pinili ko ang pagsubok kasama ang mga pagpapalagay nito at sinuri ang mga pagpapalagay.
  • [ ] Iniulat ko ang resulta bilang laki ng epekto + pagitan ng kumpiyansa + p-value.
  • [ ] Pinili kong hiwalay ang "mahalaga" at "mahalaga"; Hindi ko akalain na p ang posibilidad ng H0.
  • [ ] Isinulat ko ang p>0.05 bilang "hindi namin maipakita ito" sa halip na "walang epekto".
  • [ ] Naglapat ako ng maraming pagwawasto ng paghahambing kung nagpatakbo ako ng maraming pagsubok.
  • [ ] Sinuri ko ang sampling power; Nag-ingat ako tungkol sa laki ng epekto sa mababang kapangyarihan.