Fitimet:
- Aftësia për të përcaktuar saktë hipotezën zero, vlerën p, intervalin e besimit dhe fuqinë statistikore dhe përdorimin e inteligjencës artificiale në përzgjedhjen dhe interpretimin e testeve.
- Aftësia për të dalluar se çfarë është dhe çfarë nuk është një vlerë p (jo madhësia e efektit, jo probabiliteti i saktësisë) dhe për të kuptuar pse është i nevojshëm korrigjimi i shumëfishtë i krahasimit
- Aftësia për të njohur komentet e bëra nga inteligjenca artificiale që ngatërrojnë kuptimin me materialitetin dhe i raportojnë ato me madhësinë e efektit dhe pasigurinë
Mjeti më i përdorur dhe më i keqkuptuar i statistikave është testimi i hipotezave. Ideja bazë është e thjeshtë: ne kemi një pretendim (p.sh. "mesatarja e këtyre dy grupeve është e ndryshme") dhe e kundërta e tij, një hipotezë zero (H0 - "në fakt nuk ka dallim"). Testi mat se sa mirë përputhen të dhënat me hipotezën zero. Në këtë njësi do të shohim se si inteligjenca artificiale (AI) po e bën më të lehtë përzgjedhjen dhe interpretimin e testeve, por pse kurthet rreth vlerës p janë kaq të zakonshme dhe të rrezikshme. Le të fillojmë nga fillimi: AI e di se cilën sintaksë provë të shkruajë; por është detyra juaj të interpretoni nëse supozimi i testit është i kënaqur dhe çfarë do të thotë vërtet rezultati.
Cila është në të vërtetë vlera p?
Vlera p është probabiliteti që rezultati që vëzhgoni, ose një rezultat më ekstrem, do të ndodhte rastësisht kur hipoteza zero është e vërtetë (d.m.th., në fakt nuk ka asnjë efekt). Një vlerë e vogël p (0.05 është pragu tradicional) do të thotë "do të ishte befasuese të shihje të dhëna të tilla nëse vërtet nuk do të kishte efekt"; Kjo konsiderohet si provë kundër hipotezës zero.
Tani le të sqarojmë se çfarë nuk është vlera p - të cilën AI shpesh e ngatërron:
- Vlera p nuk është probabiliteti që hipoteza zero të jetë e vërtetë. p=0.03 nuk do të thotë "ka një probabilitet prej 3% të mos efektit".
- Vlera p nuk tregon madhësinë e efektit. Një efekt shumë i vogël mund të japë një vlerë të vogël p në një mostër të madhe.
- Vlera p nuk vërteton se gjetja është domethënëse apo reale. "i rëndësishëm" është një term statistikor, "i rëndësishëm" është një gjykim.
- p>0.05 nuk do të thotë "pa efekt"; Do të thotë "ne nuk mund të tregonim efektin me këto të dhëna." Mungesa e provave nuk është dëshmi e mungesës.
Kujdes: Gabimi më i zakonshëm i interpretimit të AI është paraqitja e fjalës "i rëndësishëm" si "ndikim i rëndësishëm/i fortë/i madh". Rëndësia statistikore dhe rëndësia praktike janë dy gjëra të ndryshme; Gjithmonë raportoni të dyja veçmas.
Intervali i besimit dhe madhësia e efektit: informacion më i pasur
Në vend të një vlere të vetme p, një interval besimi është shumë më informues: ai jep gamën e besueshme të vlerave për vlerësimin tuaj. Fjalia "Efekti 1,200, 95% intervali i besimit [300, 2,100]" tregon drejtimin, madhësinë dhe pasigurinë; "p<0.05" thjesht thotë "larg nga zero". Praktika moderne statistikore përdor vlerën p jo vetëm; rekomandon raportimin me treshen e madhësisë së efektit + intervalit të besimit + vlerës p.
Fuqia statistikore dhe mostra
Fuqia statistikore është probabiliteti i zbulimit të një efekti që ekziston në të vërtetë (1 minus probabilitetin e gabimit të tipit II, d.m.th. "të mungojë efekti real"). Një studim i pafuqishëm është i ndjeshëm ndaj dy rreziqeve: (1) humbet efektet e vërteta (negativ i rremë); (2) rezultatet e pakta që rezultojnë të jenë domethënëse bartin përmasa të fryra—i ashtuquajturi mallkim i fituesit, sepse vetëm parashikimet e fryra mund ta kalojnë pragun. Prandaj, është praktikë e mirë të llogaritet fuqia/kampioni përpara analizës. AI gjeneron kodin për këtë llogari; Ju përcaktoni madhësinë e efektit të synuar me teori.
Problemi i krahasimit të shumëfishtë
Kur bëni një test, një prag prej 0.05 do të thotë "5% rrezik për pozitive false". Por nëse bëni 20 teste, mesatarisht pritet që një të japë p<0.05 rastësisht, edhe kur të gjitha janë në të vërtetë joefektive. Ky quhet problemi i krahasimit të shumëfishtë. Probabiliteti i rezultateve false rritet me shpejtësi kur testohen një numër i madh i variablave, nëngrupeve ose variablave të rezultateve. Zgjidhja është korrigjimi i pragut: Bonferroni (duke e ndarë pragun me numrin e testeve — strikte), metodat Holm ose Benjamini-Hochberg që kontrollojnë shkallën e zbulimit të rremë (FDR). Ky rrezik bëhet edhe më i madh në epokën e AI, pasi AI mund të prodhojë dhjetëra teste në sekonda - ky është subjekti i drejtpërdrejtë i njësisë së ardhshme (p-hacking).
Tabela e krahasimit: çfarë thotë vlera p dhe çfarë nuk thotë
shprehje
A është e vërtetë?
Përshkrimi
"p=0.02, probabiliteti i mungesës së efektit është 2%"
gabim
p nuk është probabiliteti i H0
"p<0.05, efekti është i madh"
gabim
p nuk tregon madhësinë
"p=0.20, pa efekt"
gabim
Të mos jesh në gjendje të tregosh nuk është mungesë
"p<0.05, ka prova kundër H0"
E vërtetë
I kujdesshëm dhe i vëmendshëm
"Efekti 1.200 [300;2.100], p=0.01"
më e mira
Madhësia + pasiguria + dëshmia
Katër kërkesa të kopjueshme
1. Zgjedhja e testit të duhur:
Roli juaj: asistent i testimit statistikor. Dua të krahasoj mesataren e dy grupeve të pavarura (ndryshore e vazhdueshme). Më jepni: cili test është i përshtatshëm (me supozimet e tij: normaliteti, barazia e variancës), alternativa nëse supozimi nuk përmbushet (p.sh. Welch, Mann-Whitney) dhe kodin R. Unë do të ekzekutoj rezultatin dhe do të kontrolloj supozimet.
2. Raportimi i saktë i vlerës p:
Raportoni rezultatin e testit më poshtë, por RREGULLAT:- MOS e paraqisni vlerën p si "probabilitet i H0" ose "madhësia e efektit", - sigurohuni që të përfshini madhësinë e efektit dhe intervalin e besueshmërisë 95%, - shkruani "i rëndësishëm" dhe "i rëndësishëm" veçmas, - nëse p>0.05, MOS thoni "nuk mund të tregojmë". Prodhimi: [ngjit]
3. Llogaritja e fuqisë/kampionit:
Po planifikoj një eksperiment: dy grupe, madhësia e efektit të pritur (d të Cohen) ~ 0,4, fuqia 0,80, alfa 0,05. Shkruani kodin R që llogarit madhësinë e kërkuar të mostrës (paketë pwr) dhe shpjegoni rreziqet e një studimi me fuqi të ulët (mallkimi i fituesit).
4. Korrigjimi i krahasimit të shumëfishtë:
Unë kam bërë 15 teste të veçanta hipotezash dhe kam vlerat p. Shkruani kodin R që zbaton korrigjimet e Bonferroni dhe Benjamin-Hochberg (FDR), shpjegoni ndryshimin midis dy metodave dhe përmblidhni në një fjali pse nuk duhet t'i besoj p<0.05.
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
A është rezultati i këtij testi kuptimplotë? Komentoni rezultatin.
Ky pretendim e fut në kurth AI në binarin "kuptimplotë/jo kuptimplotë"; me shumë mundësi prodhon një fjali që ngatërron madhësinë me rëndësinë, si p.sh. "po, është domethënëse, efekti është i fortë".
Njoftim i fuqishëm:
Roli juaj: asistent i vëmendshëm statistikor. Interpretoni rezultatin por: (1) jepni madhësinë e efektit + 95% intervalin e besimit + vlerën p së bashku, (2) ndani rëndësinë nga rëndësia, (3) p>0.05 në "nuk mund të tregoja", (4) pyesni sa teste bëra; Nëse më shumë se një, sugjeroni korrigjim të shumëfishtë krahasimi, (5) kujtoni se supozimet e testit duhet të kontrollohen.
Dallimi: urdhri i fortë zbaton raportim të pasur dhe mbron nga kurthe të vlerave p.
tre mini kuti
Rasti 1 - "Rëndësia" e parëndësishme në mostrën e madhe. Një analist gjeti ndryshimin mesatar midis dy grupeve "shumë domethënës" në p<0.001 në të dhënat me 500,000 vëzhgime. Por diferenca ishte vetëm 0.3 pikë (nga 100) dhe ishte praktikisht e pakuptimtë. Mostra e madhe e bëri edhe ndryshimin e vogël "të rëndësishëm". Kur u raportua madhësia e efektit, gjetja u zbulua të ishte e parëndësishme. Mësimi: rëndësia nuk është madhësia; Nëse n është i madh, çdo ndryshim është i rëndësishëm.
Rasti 2 - Iluzioni i shumëfishtë i testimit. Një ekip testoi 22 variabla të rezultateve; Njëri prej tyre tregoi p=0.04 dhe u shpall si “e gjetëm efektin”. Me korrigjimin Bonferroni, pragu u ul në 0.05/22 = 0.0023; 0.04 nuk e kaloi këtë prag. I vetmi rezultat "domethënës" do të ishte rastësisht nga 22 prova. Mësimi: kur testoni shumë, korrigjimi është i nevojshëm.
Rasti 3 - Nënfuqi dhe mallkimi i fituesit. Një studim i vogël pilot (n=15 për grup) gjeti një efekt shumë të madh (d=0.9) dhe domethënës. Një studim i madh i përsëritjes e zvogëloi efektin në d = 0.2. Mostra e vogël kishte lejuar vetëm një mbivlerësim për të kaluar pragun. Mësimi: Madhësitë e rëndësishme të efekteve me fuqi të ulët nuk mund të besohen.
Gabimet e zakonshme
- Ngatërrimi i kuptimit me rëndësinë/madhësinë. Efekti nuk është i madh vetëm sepse p është i vogël; Raporto madhësinë e efektit veçmas.
- Gabimi i vlerës p për probabilitetin e H0. p nuk është "probabiliteti i mungesës së efektit"; është konceptualisht i ndryshëm.
- Leximi i p>0.05 si "pa efekt". Dështimi për të paraqitur nuk është dëshmi e mungesës; Tregoni pasigurinë.
- Nuk korrigjohet për shumë testime. Shumë teste japin rezultate false; Aplikoni Bonferroni/FDR.
- Injorimi i pushtetit. Efekti i rëndësishëm në kampionin e vogël është i ekzagjeruar; Llogaritni fuqinë para analizës.
Këshillë: Para se të shkruani një rezultat si "të rëndësishëm", bëni dy pyetje: "A është efekti praktikisht i rëndësishëm (madhësia)?" dhe "Sa teste bëra përpara se të gjeja këtë rezultat?" Pyetja e dytë është testi i lakmusit i ndershmërisë.
Në përmbledhje
Testimi i hipotezave dhe vlera p janë mjete të fuqishme, por të keqkuptuara. Vlera p është probabiliteti për të parë të dhënat kur hipoteza zero është e vërtetë; Probabiliteti i H0 nuk është madhësia e efektit ose rëndësia e gjetjes. Gjithmonë raportoni rëndësinë së bashku me madhësinë e efektit dhe intervalin e besimit; Mos e lexoni p>0.05 si "pa efekt"; aplikoni korrigjimin e krahasimit të shumëfishtë nëse keni bërë shumë teste; Jini të vetëdijshëm për rrezikun e efekteve të ekzagjeruara nga studimet me fuqi të ulët. AI prodhon kodin dhe planin e testimit; Është përgjegjësia juaj të bëni dallimin midis kuptimësisë dhe materialitetit dhe të kontrolloni supozimet.
Detyra e aplikimit
Bëni një krahasim të mesatareve midis dy grupeve në një grup të dhënash. Kërkoni nga AI testin e duhur (me supozimet e tij) dhe kodin, ekzekutoni atë dhe kontrolloni supozimet. Raportoni rezultatin me tre komponentë: madhësia e efektit, intervali i besueshmërisë 95%, vlera p. Pastaj mendoni se sa krahasime të ndryshme mund të bëni në të njëjtat të dhëna; Nëse keni kryer teste të shumta, aplikoni korrigjimin Bonferroni ose FDR dhe raportoni nëse rezultati vazhdon ende. Së fundi, shkruani një vlerësim të përafërt të fuqisë për analizën tuaj.
listë kontrolli
- [ ] Zgjodha testin me supozimet e tij dhe kontrollova supozimet.
- [ ] Unë raportova rezultatin si madhësia e efektit + intervali i besimit + vlera p.
- [ ] I mbajta veçmas "të rëndësishme" dhe "të rëndësishme"; Nuk mendoja se p ishte probabiliteti i H0.
- [ ] Unë shkrova p>0.05 si "nuk mund ta tregonim" dhe jo "pa efekt".
- [ ] Kam aplikuar korrigjim të shumëfishtë krahasimi nëse kam kryer teste të shumta.
- [ ] Kam vlerësuar fuqinë e kampionimit; Unë isha i kujdesshëm në lidhje me madhësinë e efektit në fuqi të ulët.