zisky:
- Schopnosť správne definovať nulovú hypotézu, p-hodnotu, interval spoľahlivosti a štatistickú silu a využívať umelú inteligenciu pri výbere a interpretácii testov.
- Schopnosť rozlíšiť, čo je a čo nie je p-hodnota (nie veľkosť účinku, nie pravdepodobnosť presnosti) a pochopiť, prečo je potrebná korekcia viacnásobného porovnania
- Schopnosť rozpoznať komentáre umelej inteligencie, ktoré si mýlia zmysluplnosť s významnosťou, a nahlásiť ich s veľkosťou účinku a neistotou
Najpoužívanejším a najviac nepochopeným nástrojom štatistiky je testovanie hypotéz. Základná myšlienka je jednoduchá: máme nárok (napr. „priemer týchto dvoch skupín je odlišný“) a jeho opak, nulovú hypotézu (H0 — „v skutočnosti neexistuje žiadny rozdiel“). Test meria, ako dobre údaje súhlasia s nulovou hypotézou. V tejto časti uvidíme, ako umelá inteligencia (AI) uľahčuje výber a interpretáciu testov, ale prečo sú úskalia okolo hodnoty p také bežné a nebezpečné. Začnime od začiatku: AI vie, ktorú testovaciu syntax má napísať; ale je vašou úlohou interpretovať, či je predpoklad testu splnený a čo výsledok skutočne znamená.
Čo je vlastne p-hodnota?
Hodnota p je pravdepodobnosť, že k výsledku, ktorý pozorujete, alebo k extrémnejšiemu výsledku dôjde náhodou, keď je pravdivá nulová hypotéza (t. j. v skutočnosti neexistuje žiadny účinok). Malá p-hodnota (0,05 je tradičná prahová hodnota) znamená „bolo by prekvapujúce vidieť takéto údaje, ak by skutočne neprišlo k žiadnemu účinku“; Toto sa považuje za dôkaz proti nulovej hypotéze.
Teraz si objasnime, čo nie je p-hodnota – ktorú AI často zamieňa:
- P-hodnota nie je pravdepodobnosť, že nulová hypotéza je pravdivá. p = 0,03 neznamená "existuje 3% pravdepodobnosť, že účinok nebude".
- Hodnota p neudáva veľkosť účinku. Veľmi malý účinok môže poskytnúť malú hodnotu p vo veľkej vzorke.
- P-hodnota nedokazuje, že nález je významný alebo skutočný. „Významný“ je štatistický výraz, „významný“ je úsudok.
- p>0,05 neznamená "žiadny účinok"; Znamená to „nemohli sme ukázať účinok s týmito údajmi“. Absencia dôkazov nie je dôkazom neprítomnosti.
Upozornenie: Najčastejšou chybou interpretácie AI je prezentovanie slova „významný“ ako „významný/silný/veľký vplyv“. Štatistický význam a praktický význam sú dve rôzne veci; Vždy hláste tieto dva oddelene.
Interval spoľahlivosti a veľkosť účinku: bohatšie informácie
Namiesto jedinej p-hodnoty je interval spoľahlivosti oveľa informatívnejší: poskytuje prijateľný rozsah hodnôt pre váš odhad. Veta „Účinok 1 200, 95 % interval spoľahlivosti [300, 2 100]“ ukazuje smer, veľkosť aj neistotu; "p<0,05" len hovorí "ďaleko od nuly". Moderná štatistická prax používa nielen p-hodnotu; odporúča vykazovanie s trojicou veľkosť účinku + interval spoľahlivosti + p-hodnota.
Štatistická sila a vzorka
Štatistická sila je pravdepodobnosť zistenia efektu, ktorý skutočne existuje (1 mínus pravdepodobnosť chyby typu II, t. j. „vynechanie skutočného efektu“). Nedostatočná štúdia je náchylná na dve riziká: (1) chýba jej skutočné účinky (falošne negatívna); (2) tých niekoľko výsledkov, ktoré sa ukážu ako významné, má nafúknuté hodnoty – takzvané prekliatie víťaza, pretože prah môžu prekročiť iba nafúknuté predpovede. Preto je dobrou praxou vypočítať výkon/vzorku pred analýzou. AI vygeneruje kód pre tento účet; Veľkosť cieľového účinku určíte teóriou.
Problém viacnásobného porovnania
Pri vykonávaní testu prahová hodnota 0,05 znamená „5 % riziko falošných pozitívnych výsledkov“. Ale ak urobíte 20 testov, v priemere by sa dalo očakávať, že jeden dá p<0,05 náhodou, aj keď sú všetky v skutočnosti neúčinné. Toto sa nazýva problém viacnásobného porovnania. Pravdepodobnosť falošne pozitívnych výsledkov sa rýchlo zvyšuje, keď sa testuje veľké množstvo premenných, podskupín alebo výsledných premenných. Riešením je korekcia prahu: Bonferroniho (delenie prahu počtom testov — prísne), Holmove alebo Benjaminiho-Hochbergove metódy, ktoré kontrolujú mieru falošných objavov (FDR). Toto riziko je ešte väčšie vo veku AI, pretože AI dokáže vyrobiť desiatky testov za pár sekúnd – to je priamy predmet ďalšej jednotky (p-hacking).
Porovnávacia tabuľka: čo hovorí p-hodnota a čo nehovorí
výraz
je to pravda?
Popis
"p=0,02, pravdepodobnosť žiadneho účinku je 2%"
nesprávne
p nie je pravdepodobnosť H0
"p<0,05, efekt je veľký"
nesprávne
p neudáva veľkosť
"p=0,20, žiadny účinok"
nesprávne
Neschopnosť ukázať nie je absencia
"p<0,05, existujú dôkazy proti H0"
Pravda
Opatrne a na mieste
"Efekt 1,200 [300;2,100], p=0,01"
najlepšie
Veľkosť + neistota + dôkazy
Štyri kopírovateľné výzvy
1. Výber správneho testu:
Vaša úloha: asistent štatistického testovania. Chcem porovnať priemer dvoch nezávislých skupín (kontinuálna premenná). Dajte mi: ktorý test je vhodný (s jeho predpokladmi: normalita, rovnosť rozptylu), alternatíva, ak predpoklad nie je splnený (napr. Welch, Mann-Whitney) a R kód. Výsledok spustím a skontrolujem predpoklady.
2. Správne vykazovanie p-hodnoty:
Nižšie nahláste výstup testu, ale PRAVIDLÁ:- NEUVÁDZAJTE p-hodnotu ako „pravdepodobnosť H0“ alebo „veľkosť účinku“,- nezabudnite uviesť veľkosť účinku a 95% interval spoľahlivosti,- „významné“ a „významné“ napíšte oddelene,- ak p>0,05, NEhovorte „žiadny účinok“, povedzte „nemohli sme ukázať“. Výstup: [prilepiť]
3. Výpočet výkonu/vzorky:
Plánujem experiment: dve skupiny, očakávaná veľkosť účinku (Cohenovo d) ~0,4, sila 0,80, alfa 0,05. Napíšte R kód, ktorý vypočíta požadovanú veľkosť vzorky (balenie pwr) a vysvetlite riziká štúdie s nízkym výkonom (prekliatie víťaza).
4. Oprava viacnásobného porovnania:
Urobil som 15 samostatných testov hypotéz a mám p-hodnoty. Napíšte R kód, ktorý aplikuje korekcie Bonferroniho a Benjamina-Hochberga (FDR), vysvetlite rozdiel medzi týmito dvoma metódami a zhrňte v jednej vete, prečo by som nemal dôverovať holému p<0,05.
Slabá výzva / Silná výzva
Slabá výzva:
Je výsledok tohto testu zmysluplný? Komentujte výsledok.
Toto tvrdenie uväzňuje AI v binárnom systéme „zmysluplný/nezmysluplný“; s najväčšou pravdepodobnosťou vytvára vetu, ktorá si mýli veľkosť s významom, ako napríklad „áno, je to významné, účinok je silný“.
Výkonná výzva:
Vaša úloha: pozorný štatistický asistent. Interpretujte výsledok, ale: (1) dajte dohromady veľkosť účinku + 95 % interval spoľahlivosti + p-hodnotu, (2) oddeľte významnosť od významnosti, (3) p>0,05 v „nemôžem ukázať“, (4) opýtajte sa, koľko testov som vykonal; Ak je viac ako jeden, navrhnite opravu viacnásobného porovnania, (5) pripomeňte, že by sa mali skontrolovať predpoklady testu.
Rozdiel: silná výzva vynucuje bohaté hlásenie a chráni pred pascami p-hodnoty.
tri mini prípady
Prípad 1 – Nevýznamná „významnosť“ vo veľkej vzorke. Jeden analytik zistil, že priemerný rozdiel medzi týmito dvoma skupinami je „vysoko významný“ pri p<0,001 v údajoch s 500 000 pozorovaniami. Ale rozdiel bol len 0,3 bodu (zo 100) a bol prakticky nezmyselný. Obrovská vzorka urobila aj ten nepatrný rozdiel "významným". Keď bola hlásená veľkosť účinku, zistilo sa, že nález je nevýznamný. Poučenie: význam nie je veľkosť; Ak je n veľké, každý rozdiel je významný.
Prípad 2 – Ilúzia viacerých testov. Jeden tím testoval 22 výstupných premenných; Jeden z nich ukázal p=0,04 a bol vyhlásený ako „našli sme účinok“. S Bonferroniho korekciou sa prah znížil na 0,05/22 = 0,0023; 0,04 neprekročilo túto hranicu. Jediný „zmysluplný“ výsledok by bol náhodou z 22 pokusov. Ponaučenie: pri testovaní veľa je potrebná korekcia.
Prípad 3 – Podstata a prekliatie víťaza. Malá pilotná štúdia (n=15 na skupinu) zistila veľmi veľký účinok (d=0,9) a významný. Veľká replikačná štúdia znížila účinok na d = 0,2. Malá vzorka umožnila prekročenie prahu iba nadhodnoteniu. Poučenie: Významným veľkostiam efektov pri nízkom výkone sa nedá veriť.
Časté chyby
- Zamieňanie zmysluplnosti s dôležitosťou/veľkosťou. Účinok nie je veľký len preto, že p je malé; Veľkosť efektu nahláste samostatne.
- Zámena p-hodnoty s pravdepodobnosťou H0. p nie je "pravdepodobnosť bez účinku"; je koncepčne odlišný.
- Čítanie p>0,05 ako "žiadny účinok". Neukázanie nie je dôkazom neprítomnosti; Uveďte neistotu.
- Neopravuje sa pre viacnásobné testovanie. Príliš veľa testov vedie k falošne pozitívnym výsledkom; Aplikujte Bonferroni/FDR.
- Ignorovanie moci. Významný účinok v malej vzorke je prehnaný; Pred analýzou vypočítajte výkon.
Tip: Pred odpísaním výsledku ako „významný“ si položte dve otázky: „Je účinok prakticky významný (veľkosť)?“ a "Koľko testov som absolvoval, kým som našiel tento výsledok?" Druhá otázka je lakmusovým papierikom poctivosti.
V súhrne
Testovanie hypotéz a p-hodnota sú silné, ale nepochopené nástroje. p-hodnota je pravdepodobnosť zobrazenia údajov, keď je nulová hypotéza pravdivá; Pravdepodobnosť H0 nie je veľkosť účinku alebo významnosť nálezu. Vždy uveďte význam spolu s veľkosťou účinku a intervalom spoľahlivosti; Nečítajte p>0,05 ako „žiadny účinok“; aplikujte korekciu viacnásobného porovnania, ak ste vykonali veľa testov; Buďte si vedomí rizika prehnaných účinkov zo štúdií s nízkym výkonom. AI vytvára testovací kód a plán; Je vašou zodpovednosťou rozlišovať medzi zmysluplnosťou a vecnosťou a kontrolovať predpoklady.
Aplikačná úloha
Vykonajte porovnanie priemerov medzi dvoma skupinami v súbore údajov. Požiadajte AI o príslušný test (s jeho predpokladmi) a kód, spustite ho a skontrolujte predpoklady. Uveďte výsledok s tromi komponentmi: veľkosť účinku, 95 % interval spoľahlivosti, p-hodnota. Potom premýšľajte o tom, koľko rôznych porovnaní môžete urobiť na rovnakých údajoch; Ak ste vykonali viacero testov, použite korekciu Bonferroni alebo FDR a nahláste, či výsledok stále platí. Nakoniec napíšte hrubý odhad výkonu pre vašu analýzu.
kontrolný zoznam
- [ ] Vybral som test s jeho predpokladmi a skontroloval som predpoklady.
- [ ] Výsledok som uviedol ako veľkosť účinku + interval spoľahlivosti + p-hodnota.
- [ ] Ponechal som „významné“ a „dôležité“ oddelene; Nemyslel som si, že p je pravdepodobnosť H0.
- [ ] Napísal som p>0,05 ako „nemohli sme to ukázať“ namiesto „žiadny efekt“.
- [ ] Použil som viacnásobnú opravu porovnania, ak som vykonal viacero testov.
- [ ] Vyhodnotil som silu vzorkovania; Bol som opatrný ohľadom veľkosti efektu pri nízkom výkone.