zisky:
- Schopnost správně definovat nulovou hypotézu, p-hodnotu, interval spolehlivosti a statistickou sílu a využívat umělou inteligenci při výběru a interpretaci testů.
- Schopnost rozlišit, co je a co není p-hodnota (nikoli velikost účinku, nikoli pravděpodobnost přesnosti) a pochopit, proč je nutná oprava vícenásobného srovnání
- Schopnost rozpoznat komentáře umělé inteligence, které zaměňují smysluplnost s významností, a hlásit je s velikostí účinku a nejistotou
Nejpoužívanějším a nejvíce nepochopeným nástrojem statistiky je testování hypotéz. Základní myšlenka je jednoduchá: máme tvrzení (např. „průměr těchto dvou skupin je různý“) a jeho opak, nulovou hypotézu (H0 — „ve skutečnosti neexistuje žádný rozdíl“). Test měří, jak dobře data souhlasí s nulovou hypotézou. V této jednotce uvidíme, jak umělá inteligence (AI) usnadňuje výběr a interpretaci testů, ale proč jsou úskalí kolem hodnoty p tak běžné a nebezpečné. Začněme od začátku: AI ví, jakou testovací syntaxi má napsat; ale je vaším úkolem interpretovat, zda je předpoklad testu splněn a co výsledek skutečně znamená.
Co je vlastně p-hodnota?
Hodnota p je pravděpodobnost, že k výsledku, který pozorujete, nebo k extrémnějšímu výsledku dojde náhodou, když je pravdivá nulová hypotéza (tj. ve skutečnosti neexistuje žádný účinek). Malá p-hodnota (0,05 je tradiční práh) znamená „bylo by překvapivé vidět taková data, pokud by skutečně nebyl žádný účinek“; To je považováno za důkaz proti nulové hypotéze.
Nyní si ujasněme, co není p-hodnota – kterou AI často pletou:
- P-hodnota není pravděpodobnost, že nulová hypotéza je pravdivá. p=0,03 neznamená "existuje 3% pravděpodobnost žádného účinku".
- Hodnota p neudává velikost efektu. Velmi malý účinek může ve velkém vzorku poskytnout malou hodnotu p.
- P-hodnota nedokazuje, že nález je významný nebo skutečný. „Významný“ je statistický termín, „významný“ je úsudek.
- p>0,05 neznamená "žádný účinek"; Znamená to "nemohli jsme ukázat účinek s těmito daty." Absence důkazů není důkazem nepřítomnosti.
Upozornění: Nejčastější chybou při interpretaci umělé inteligence je uvádění slova „významný“ jako „významný/silný/velký dopad“. Statistická významnost a praktická významnost jsou dvě různé věci; Vždy nahlaste oba zvlášť.
Interval spolehlivosti a velikost účinku: bohatší informace
Namísto jediné p-hodnoty je interval spolehlivosti mnohem informativnější: poskytuje věrohodný rozsah hodnot pro váš odhad. Věta „Účinek 1 200, 95% interval spolehlivosti [300, 2 100]“ ukazuje jak směr, tak velikost i nejistotu; "p<0,05" jen říká "daleko od nuly". Moderní statistická praxe používá nejen p-hodnotu; doporučuje vykazování pomocí trojice velikost účinku + interval spolehlivosti + p-hodnota.
Statistická síla a vzorek
Statistická síla je pravděpodobnost detekce efektu, který skutečně existuje (1 minus pravděpodobnost chyby typu II, tedy „chybění skutečného efektu“). Studie s nedostatečným potenciálem je náchylná ke dvěma rizikům: (1) postrádá skutečné účinky (falešně negativní); (2) těch několik výsledků, které se ukáží jako významné, nese nafouknuté hodnoty – takzvané prokletí vítěze, protože pouze nafouknuté předpovědi mohou překročit práh. Proto je dobrou praxí vypočítat výkon/vzorek před analýzou. AI vygeneruje kód pro tento účet; Velikost cílového účinku určíte pomocí teorie.
Problém vícenásobného srovnání
Při provádění testu prahová hodnota 0,05 znamená „5% riziko falešně pozitivních výsledků“. Ale pokud uděláte 20 testů, v průměru by jeden náhodně dal p<0,05, i když jsou všechny ve skutečnosti neúčinné. Tomu se říká problém vícenásobného srovnání. Pravděpodobnost falešně pozitivních výsledků se rychle zvyšuje, když je testováno velké množství proměnných, podskupin nebo výsledných proměnných. Řešením je korekce prahu: Bonferroniho (dělení prahu počtem testů — přísné), Holmovy nebo Benjamini-Hochbergovy metody, které kontrolují míru falešných objevů (FDR). Toto riziko se ve věku umělé inteligence ještě zvyšuje, protože umělá inteligence dokáže vyrobit desítky testů během několika sekund – to je přímý předmět další jednotky (p-hacking).
Srovnávací tabulka: co říká p-hodnota a co neříká
výraz
je to pravda?
Popis
"p=0,02, pravděpodobnost žádného účinku je 2%"
špatně
p není pravděpodobnost H0
"p<0,05, efekt je velký"
špatně
p neudává velikost
"p=0,20, žádný účinek"
špatně
Neschopnost ukázat není nepřítomnost
"p<0,05, existují důkazy proti H0"
Pravda
Opatrně a na místě
"Efekt 1,200 [300;2,100], p=0,01"
nejlepší
Velikost + nejistota + důkazy
Čtyři kopírovatelné výzvy
1. Výběr správného testu:
Vaše role: asistent statistického testování. Chci porovnat průměr dvou nezávislých skupin (spojitá proměnná). Dejte mi: který test je vhodný (s jeho předpoklady: normalita, rovnost rozptylu), alternativa, pokud předpoklad není splněn (např. Welch, Mann-Whitney) a R kód. Výsledek spustím a zkontroluji předpoklady.
2. Správné vykazování p-hodnoty:
Níže uveďte výstup testu, ale PRAVIDLA:- NEUVÁDĚJTE p-hodnotu jako „pravděpodobnost H0“ nebo „velikost účinku“,- nezapomeňte uvést velikost účinku a 95% interval spolehlivosti,- napište „významné“ a „významné“ odděleně,- pokud p>0,05, NEŘÍKEJTE „žádný účinek“, řekněte „nemohli jsme ukázat“. Výstup: [vložit]
3. Výpočet výkonu/vzorku:
Plánuji experiment: dvě skupiny, očekávaná velikost účinku (Cohenovo d) ~0,4, síla 0,80, alfa 0,05. Napište R kód, který vypočítá požadovanou velikost vzorku (balíček pwr) a vysvětlete rizika studie s nízkým výkonem (prokletí vítěze).
4. Oprava vícenásobného srovnání:
Udělal jsem 15 samostatných testů hypotéz a mám p-hodnoty. Napište R kód, který aplikuje Bonferroniho a Benjamin-Hochbergovy (FDR) korekce, vysvětlete rozdíl mezi těmito dvěma metodami a shrňte do jedné věty, proč bych neměl důvěřovat holému p<0,05.
Slabá výzva / Silná výzva
Slabá výzva:
Je výsledek tohoto testu smysluplný? Komentář k výsledku.
Toto tvrzení uvězňuje AI v binárním systému „smysluplný/nesmysluplný“; s největší pravděpodobností vytváří větu, která zaměňuje velikost s významem, například „ano, je to významné, účinek je silný“.
Výkonná výzva:
Vaše role: pozorný statistický asistent. Interpretujte výsledek, ale: (1) dejte dohromady velikost účinku + 95% interval spolehlivosti + p-hodnotu, (2) oddělte významnost od významnosti, (3) p>0,05 v „nelze ukázat“, (4) zeptejte se, kolik testů jsem provedl; Pokud je více než jeden, navrhněte opravu vícenásobného srovnání, (5) připomeňte, že by měly být zkontrolovány předpoklady testu.
Rozdíl: silná výzva vynucuje bohaté hlášení a chrání před pastmi p-hodnoty.
tři mini pouzdra
Případ 1 — Nevýznamná „významnost“ ve velkém vzorku. Jeden analytik zjistil průměrný rozdíl mezi těmito dvěma skupinami "vysoce významný" na p<0,001 v datech s 500 000 pozorováními. Rozdíl byl ale jen 0,3 bodu (ze 100) a byl prakticky nesmyslný. Obrovský vzorek učinil i ten nepatrný rozdíl "významným". Když byla hlášena velikost účinku, bylo zjištěno, že nález je nevýznamný. Poučení: význam není velikost; Je-li n velké, je každý rozdíl významný.
Případ 2 – Iluze vícenásobného testování. Jeden tým testoval 22 výstupních proměnných; Jeden z nich ukázal p=0,04 a byl oznámen jako „našli jsme účinek“. S Bonferroniho korekcí se práh snížil na 0,05/22 = 0,0023; 0,04 tuto hranici nepřekročilo. Jediný "smysluplný" výsledek by byl náhodou z 22 pokusů. Poučení: při velkém testování je nutná korekce.
Případ 3 — Síla a prokletí vítěze. Malá pilotní studie (n=15 na skupinu) zjistila efekt velmi velký (d=0,9) a významný. Velká replikační studie snížila účinek na d = 0,2. Malý vzorek umožnil překročit práh pouze nadhodnocení. Poučení: Významným velikostem efektů při nízkém výkonu nelze věřit.
Časté chyby
- Záměna smysluplnosti s důležitostí/velikost. Efekt není velký jen proto, že p je malé; Velikost efektu nahlaste samostatně.
- Záměna p-hodnoty za pravděpodobnost H0. p není "pravděpodobnost žádného účinku"; je koncepčně odlišná.
- Čtení p>0,05 jako "žádný účinek". Neukázání není důkazem nepřítomnosti; Uveďte nejistotu.
- Neopravuje se pro vícenásobné testování. Příliš mnoho testů vytváří falešně pozitivní výsledky; Aplikujte Bonferroni/FDR.
- Ignorování moci. Významný účinek u malého vzorku je přehnaný; Před analýzou vypočítejte výkon.
Tip: Než odepíšete výsledek jako „významný“, položte si dvě otázky: „Je účinek prakticky významný (velikost)? a "Kolik testů jsem podstoupil, než jsem našel tento výsledek?" Druhá otázka je lakmusovým papírkem poctivosti.
V souhrnu
Testování hypotéz a p-hodnota jsou mocné, ale nepochopené nástroje. P-hodnota je pravděpodobnost zobrazení dat, když je nulová hypotéza pravdivá; Pravděpodobnost H0 není velikostí účinku nebo významností nálezu. Vždy uvádějte význam spolu s velikostí účinku a intervalem spolehlivosti; Nečtěte p>0,05 jako "žádný účinek"; použijte korekci vícenásobného srovnání, pokud jste provedli mnoho testů; Buďte si vědomi rizika přehnaných účinků ze studií s nízkým výkonem. AI vytváří testovací kód a plán; Je vaší odpovědností rozlišovat mezi smysluplností a významností a kontrolovat předpoklady.
Aplikační úkol
Proveďte srovnání průměrů mezi dvěma skupinami v souboru dat. Požádejte AI o příslušný test (s jeho předpoklady) a kód, spusťte jej a zkontrolujte předpoklady. Uveďte výsledek se třemi složkami: velikost účinku, 95% interval spolehlivosti, p-hodnota. Pak přemýšlejte o tom, kolik různých srovnání můžete provést na stejných datech; Pokud jste provedli více testů, použijte korekci Bonferroni nebo FDR a nahlaste, zda výsledek stále platí. Nakonec napište hrubý odhad výkonu pro vaši analýzu.
kontrolní seznam
- [ ] Vybral jsem test s jeho předpoklady a zkontroloval jsem předpoklady.
- [ ] Výsledek jsem uvedl jako velikost účinku + interval spolehlivosti + p-hodnota.
- [ ] Ponechal jsem „významné“ a „důležité“ odděleně; Nemyslel jsem si, že p je pravděpodobnost H0.
- [ ] Napsal jsem p>0,05 jako "nemohli jsme to ukázat" spíše než "žádný účinek".
- [ ] Pokud jsem provedl více testů, použil jsem vícenásobnou korekci srovnání.
- [ ] Vyhodnotil jsem vzorkovací výkon; Byl jsem opatrný ohledně velikosti efektu při nízkém výkonu.