zisky:
- Pochopte, že p-hacking, HARKing, selektívne nahlasovanie a záhrada rozvetvených ciest vytvárajú falošné zistenia a uvidíte, ako môže umelá inteligencia urýchliť tieto pasce
- Schopnosť vytvoriť obranu, ako je predbežná registrácia, plán analýzy, disciplína viacnásobného porovnávania a analýza citlivosti s podporou umelej inteligencie
- Byť schopný internalizovať poctivý návrh požiadaviek, ktorý umožní umelej inteligencii odmietnuť požiadavky typu „nájsť zmysluplný výsledok“ a že konečná zodpovednosť leží na výskumníkovi.
V predchádzajúcej časti sme videli, čo p-hodnota je a čo nie je. V tejto časti sa pozrieme na temnejšiu tému, systematické pasce, ktoré ohrozujú štatistickú integritu. Väčšina z nich nie je úmyselné podvádzanie; Sú to zákerné mechanizmy, do ktorých spadajú aj výskumníci s dobrými úmyslami bez toho, aby si to uvedomovali. A umelá inteligencia (AI) robí tieto úskalia jednoduchším a rýchlejším, pretože umožňuje spustiť desiatky analýz v priebehu niekoľkých sekúnd. Cieľom tejto jednotky je zaviesť disciplínu, ktorá premení AI zo „stroja na hľadanie zmysluplných výsledkov“ na poctivého pomocníka.
Základné úskalia
p-hacking (hľadanie p-hodnoty): Skúša znova analýzu rôznymi spôsobmi, kým sa nedosiahne významný výsledok (p<0,05). Pridávanie a odstraňovanie premenných, výber podvzoriek, zmena definície odľahlých hodnôt, skúšanie rôznych transformácií, používanie rôznych výsledných premenných, zastavenie zberu údajov, keď to začne mať zmysel... Každý pokus dáva novú „šancu“; Ak sa dostatočne pokúsite, jeden z nich sa ukáže ako zmysluplný, aj keď v skutočnosti nemá žiadny účinok. Výsledok: falošné zistenia, ktoré boli publikované, ale nereprodukovateľné.
HARKing (Hypothesizing After the Results are Known): Vytvorenie hypotézy po zhliadnutí výsledkov a jej prezentovanie ako „Takto som to predpovedal od začiatku“. Pozeráte sa na údaje a nájdete najvýraznejší vzťah, potom napíšte papier, ako keby bol navrhnutý na testovanie tejto hypotézy. To zavádza čitateľa tým, že objav vyzerá ako potvrdenie.
Selektívne spravodajstvo (čerešnička): Hlásenie len tých „dobrých“ z desiatok analýz a tiché pochovávanie ostatných. Toto je tiež známe ako „problém so zásuvkou súboru“: nezmyselné výsledky zostávajú v zásuvke, čo robí literatúru systematicky neobjektívnou.
Záhrada rozvetvených chodníkov: termín Andrewa Gelmana. Dokonca aj bez jediného zámerného p-hackingu výskumník robí veľa rozumných rozhodnutí na základe údajov (ktorá premenná, ktorá prahová hodnota, ktorá podskupina, ktorá transformácia). Tieto vyšetrovacie stupne voľnosti sú také početné, že si z množstva analýz efektívne vyberáte tú zmysluplnú – dokonca bez akéhokoľvek zlého úmyslu. Výsledkom je opäť stúpajúca miera falošne pozitívnych výsledkov.
Pozor: Väčšina z týchto pascí nie sú premyslené triky. Súčet zdanlivo nevinných krokov ako „práve som vyskúšal niekoľko ďalších modelov“, „bolo čistejšie, keď som odstránil odľahlé hodnoty“, „efekt je v tejto podskupine jasnejší“, môže priniesť falošné zistenie. Úprimnosť je vec metódy, nie zámeru.
Prečo AI zväčšuje tieto pasce?
Ručné vyskúšanie 3 modelov si vyžaduje čas; YZ vyrába 50 modelových variantov, 10 rôznych konverzií, 8 podskupín za pár minút. Táto sila je katastrofálna bez poctivého plánu: požiadavka ako „nájdite zmysluplný vzťah v týchto údajoch“ alebo „vytvorte model, ktorý podporuje túto hypotézu“ premení AI priamo na p-hackingový motor. AI chce byť tiež nápomocná; má tendenciu nájsť „zmysluplný“ výsledok, ktorý vás uspokojí. Preto je váš pohotový návrh prvou obrannou líniou poctivosti.
Obrana: férový obchod
1. Predregistrácia: Znamená to písomné zaznamenanie vašej hypotézy, premenných, modelu a testov (prípadne na platforme s časovou pečiatkou) pred vykonaním analýzy. Objav je teda oddelený od potvrdenia; všetko, čo potom zmeníte, je označené ako „prieskumník“.
2. Plán analýzy: Aj keď nemôžete vykonať predbežný záznam, napíšte plán analýzy skôr, ako sa ponoríte do údajov: primárna hypotéza, primárna výsledná premenná, hlavný model. Od začiatku rozlišujte medzi „hlavnou analýzou“ a „doplnkovou/prieskumnou analýzou“ a zachovajte ho v správe.
3. Všetko nahláste: Neskrývajte modely, ktoré ste vyskúšali. V časti „analýza citlivosti“ (kontrola robustnosti) ukážte, ako rôzne špecifikácie menia výsledok. Zistenie je silné iba vtedy, ak obstojí pri mnohých možných rozhodnutiach.
4. Disciplína viacnásobného porovnávania: Ak ste urobili príliš veľa testov, opravte ich (jednotka 6). Odpovedzte na otázku "Koľko testov som urobil?" úprimne.
5. Analýza citlivosti: Zopakujte svoje hlavné zistenie s inou vzorkou, inou kontrolnou sadou a inou transformáciou. Ak sa výsledok zmení, neskrývajte to, nahláste to.
Porovnávacia tabuľka: čestný vs
Aplikácia
tvar pasce
Úprimný ekvivalent
Výber modelu
Skúšať, kým to nedáva zmysel (p-hacking)
Vopred naplánovaný hlavný model
hypotéza
Fitting after fact (HARKing)
Vopred nahrané, pred údajmi
Nahlasovanie
Neukazujte len tie krásne
Všetky špecifikácie + citlivosť
podskupina
Výber najvýraznejšieho
Preddefinované, opraviteľné
zber údajov
Zastav sa, keď to dáva zmysel
vopred určená vzorka
Štyri kopírovateľné výzvy
1. Rámec čestného nároku:
Vaša úloha: čestný asistent štatistiky. Mojím cieľom NIE JE nájsť zmysluplný výsledok, ale nájsť ten správny výsledok. PRAVIDLÁ:- NEDÁVAJTE mi návrhy typu „skúste modely, kým to nebude mať zmysel“,- povedzte mi, ak navrhujete viacero špecifikácií, všetky musia byť nahlásené,- upozornite ma na akékoľvek kroky, ktoré by mohli viesť k p-hackingu. Pomôžte mi najprv objasniť môj hlavný model, oddeľte objav od potvrdenia.
2. Návrh plánu analýzy:
Pomôžte mi navrhnúť predbežný plán analýzy pre štúdiu: primárna hypotéza, primárna výsledná premenná, špecifikácia hlavného modelu, vopred definované podskupiny, stratégia viacnásobného porovnávania. Uveďte „prieskumné“ a „potvrdzujúce“ analýzy do samostatných nadpisov. Pripomeň mi, aby som to vyplnil BEZ POZRITE SA na údaje.
3. Analýza citlivosti:
Mojím hlavným zistením je napísať kód analýzy citlivosti (R) pre Mojím cieľom je VIDIEŤ, aký solídny je výsledok, NIE vybrať ten najlepší; zobraziť všetky výsledky.
4. Vlastné monitorovanie:
Vysvetlím môj proces analýzy; Dajte mi kontrolný zoznam pre p-hacking / HARKing / selektívne nahlasovanie a označte, ktoré z mojich krokov sú riskantné. Opýtajte sa ma, koľko modelov/testov som vyskúšal a ktoré plánujem nahlásiť.
Slabá výzva / Silná výzva
Slabá výzva:
Ktoré premenné vykazujú významné vzťahy v týchto údajoch, nájdite najlepší model.
Táto výzva je priamou inštrukciou p-hackingu: AI skúša desiatky kombinácií a predstavuje tú, ktorá „dáva najväčší zmysel“. Výsledkom je takmer určite falošný nález, ktorý sa nedá zopakovať.
Výkonná výzva:
Vaša úloha: čestný asistent. HLAVNÝ model, ktorý som vopred určil, je: Y ~ X + ovládacie prvky. Napíšte kód, ktorý predpovedá tento model. Nehľadajte iný „zmysluplnejší“ model. Navrhnite tiež analýzu citlivosti, aby som mohol vidieť robustnosť výsledku, ale vedzte, že budem hlásiť VŠETKY výsledky, nie vybrať ten najlepší. Nedovoľte mi odpísať akékoľvek prieskumné zistenia ako „potvrdené“.
Rozdiel: silná vôľa opraví hlavný model, zakáže vyhľadávanie a vyžaduje nahlásenie všetkých výsledkov.
tri mini prípady
Prípad 1 – Podskupinový lov. Jeden výskumník nezistil žiadny účinok v celkovej vzorke; Spýtal sa AI "v ktorej podskupine je to významné?" YZ skenovala kombinácie veku, pohlavia a regiónu a zistila "p = 0,03 u mestských žien vo veku 35-44 rokov". Článok bol založený na tejto podskupine. Jeho replikácia nemala žiadny účinok: bol to výsledok náhody z desiatok podskupín. Ponaučenie: vybratá podskupina po HARKOVANÍ, nepotvrdzovaní údajov.
Prípad 2 – Lov na konverziu. Vzťah, ktorý sa ukazuje ako nezmyselný vo forme študentskej úrovne; vyskúšali to v logaritmickom, odmocninom, štvorcovom a oneskorenom tvare; Zistil p = 0,048 vo forme log-log a uviedol len to. Našťastie jedna z 5 skúšaných foriem prekročila prah. Správny spôsob bol: vopred vybrať formulár s teóriou a zobraziť výsledok všetkých formulárov v tabuľke citlivosti. Ponaučenie: selektívne vykazovanie vytvára falošný význam.
Prípad 3 – Ako funguje poctivé rámovanie. Pred analýzou sa vopred zaregistroval jeden tím: jedna primárna hypotéza, jeden hlavný model, dve preddefinované podskupiny, Bonferroniho korekcia. Hlavný efekt nebol významný, ale tím o tom úprimne informoval; Prieskumný jedinec označil jedno zistenie ako „potrebné otestovať v budúcnosti“. Štúdia bola reprodukovateľná a spoľahlivá. Ponaučenie: vďaka poctivému plánovaniu stojí za to aj výsledok „neúspech“.
Časté chyby
- Povedať AI, aby „nášla zmysluplné výsledky“. Toto je priamy p-hacking; Umiestnite AI do čestného rámca a žiadajte presnosť, nie výsledky.
- Prezentácia objavu ako potvrdenie (HARKing). Je zavádzajúce písať hypotézu stanovenú za údajmi ako „predpovedal som to od začiatku“; Označte prieskumný nález.
- Len hlási dobré výsledky. Zobraziť všetky testované špecifikácie; Skrytie analýzy sentimentu ohrozuje integritu.
- Skríning podskupiny/konverzie. Výber najvýznamnejších z desiatok podskupín alebo transformácií vedie k falošným zisteniam; vopred identifikovať a opraviť.
- Zabudli ste, koľko testov ste urobili. Sledujte celkový počet pokusov; Žiadna p-hodnota nemôže byť interpretovaná čestne bez znalosti tohto čísla.
Tip: Pred zapísaním nálezu si položte otázku: „Koľko spôsobov som v tichosti vyskúšal, kým som nenašiel tento výsledok, a hlásim ich všetky?“ Ak niektoré eseje zostanú v zásuvke, vaša správa vyzerá silnejšie, než je.
V súhrne
p-hacking, HARKing, selektívne podávanie správ a záhrada rozvetvených ciest; Mnohé z nich sú pasce, ktoré fungujú neúmyselne, ale produkujú falošné, nereprodukovateľné nálezy. AI urýchľuje tieto úskalia, pretože môže okamžite vyskúšať desiatky analýz; Žiadosti typu „nájsť zmysluplné výsledky“ premenia AI na motor p-hackingu. Obrana; oddelenie objavu od potvrdenia pomocou plánu predbežnej registrácie a analýzy, nahlásenie všetkých špecifikácií a analýzy citlivosti, oprava viacerých porovnaní a začlenenie AI do poctivého rámca, ktorý vyžaduje „správny výsledok“. Konečná zodpovednosť je vždy na výskumníkovi.
Aplikačná úloha
Zvoľte si výskumnú otázku a napíšte si stručný plán analýzy predtým, ako sa pozriete na údaje: primárna hypotéza, hlavný model, primárna výsledná premenná, vopred definované podskupiny, stratégia viacnásobného porovnávania. Potom odhadnite hlavný model. Potom vykonajte analýzu citlivosti (rôzne kontroly, zahrnutá/vylúčená odľahlá hodnota, iný funkčný formulár) a všetky výsledky zobrazte v jedinej tabuľke. V jednom odseku zhodnoťte, ktoré kroky predstavujú riziko p-hackingu a ako ich váš poctivý rámec obmedzuje.
kontrolný zoznam
- [ ] Pred ponorením sa do údajov som napísal plán analýzy/hlavný model.
- [ ] Prieskumnú a potvrdzujúcu analýzu som označil samostatne; Nenapočúval som sa.
- [ ] Nahlásil som všetky špecifikácie, ktoré som vyskúšal; Nevybrala som si len tú krásnu.
- [ ] Podskupiny a transformácie som definoval vopred, neskenoval som ich po dátach.
- [ ] Sledoval som, koľko testov som vykonal, a použil som potrebnú korekciu.
- [ ] AI som použil skôr v kontexte „nájdi pravdu“ ako „nájdi to zmysluplné“; Zobral som na seba zodpovednosť.