Enota 7 / 11

p-hacking, HARKing in statistična integriteta: pasti v dobi umetne inteligence

Dobički:

  • Razumite, da p-hekanje, HARKing, selektivno poročanje in vrt razcepljenih poti ustvarjajo napačne ugotovitve, in poglejte, kako lahko umetna inteligenca pospeši te pasti
  • Sposobnost vzpostavitve obrambe, kot so predregistracija, načrt analize, disciplina večkratne primerjave in analiza občutljivosti s podporo umetne inteligence
  • Biti sposoben ponotranjiti zasnovo poštene zahteve, ki bo umetni inteligenci omogočila, da zavrne zahteve tipa 'najdi pomemben rezultat' in da končno odgovornost nosi raziskovalec.

V prejšnji enoti smo videli, kaj p-vrednost je in kaj ni. V tej enoti si bomo ogledali temnejšo temo, sistematične pasti, ki ogrožajo statistično celovitost. Večina teh ni namerno goljufanje; To so zahrbtni mehanizmi, v katere pademo tudi dobronamerni raziskovalci, ne da bi se tega zavedali. In umetna inteligenca (AI) olajša in pospeši te pasti, saj omogoča izvajanje več deset analiz v nekaj sekundah. Cilj te enote je vzpostaviti disciplino, ki bo AI spremenila iz "stroja za iskanje pomembnih rezultatov" v poštenega pomočnika.

Osnovne pasti

p-hacking (lov na p-vrednost): Ponovno poskuša analizo na različne načine, dokler ne dobi pomembnega rezultata (p<0,05). Dodajanje in odstranjevanje spremenljivk, izbiranje podvzorcev, spreminjanje definicije izstopajočih vrednosti, preizkušanje različnih transformacij, uporaba različnih izhodnih spremenljivk, ustavitev zbiranja podatkov, ko postanejo smiselni ... Vsak poskus daje novo »priložnost«; Če se boste dovolj potrudili, se bo ena izmed njih izkazala za smiselno, tudi če dejansko nima učinka. Rezultat: lažne ugotovitve, ki so bile objavljene, a jih ni bilo mogoče ponoviti.

HARKing (postavljanje hipoteze po tem, ko so rezultati znani): Postavitev hipoteze po ogledu rezultatov in jo predstavi kot "Tako sem napovedal že od začetka". Pogledate podatke in najdete najbolj presenetljivo razmerje, nato pa napišete prispevek, kot da bi bil zasnovan za preverjanje te hipoteze. To bralca zavede, tako da je odkritje videti kot potrditev.

Selektivno poročanje (izbiranje češenj): poročanje le o "dobrih" iz desetin analiz in tiho zakopavanje preostalih. To je znano tudi kot "problem predala datotek": nesmiselni rezultati ostanejo v predalu, zaradi česar je literatura sistematično pristranska.

Vrt razcepljenih poti: izraz Andrewa Gelmana. Tudi brez enega samega namernega p-hackinga raziskovalec na podlagi podatkov naredi veliko razumnih odločitev (katera spremenljivka, kateri prag, katera podskupina, katera transformacija). Teh preiskovalnih stopenj svobode je tako veliko, da med množico analiz dejansko izberete tisto, ki je smiselna – tudi brez kakršnega koli slabega namena. Rezultat je spet naraščajoča lažno pozitivna stopnja.

Pozor: večina teh pasti ni namernih trikov. Seštevek na videz nedolžnih korakov, kot so "pravkar sem poskusil še nekaj modelov", "bilo je čistejše, ko sem odstranil odstopanje", "učinek je jasnejši v tej podskupini", lahko povzroči lažno ugotovitev. Iskrenost je stvar metode, ne namena.

Zakaj umetna inteligenca poveča te pasti?

Ročno preizkušanje 3 modelov zahteva čas; YZ proizvede 50 različic modelov, 10 različnih predelav, 8 podskupin v minutah. Ta moč je katastrofalna brez poštenega načrta: zahteva, kot je »poišči smiselno razmerje v teh podatkih« ali »zgradi model, ki podpira to hipotezo«, spremeni AI neposredno v mehanizem p-hekinga. AI želi biti tudi v pomoč; teži k iskanju "smiselnega" rezultata, ki vas bo zadovoljil. Zato je vaša hitra zasnova prva obrambna linija poštenosti.

Obrambe: pošteno poslovanje

1. Vnaprejšnja registracija: Pomeni pisni zapis vaše hipoteze, spremenljivk, modela in testov (po možnosti na platformi s časovnim žigom) pred izvedbo analize. Tako je odkritje ločeno od potrditve; vse, kar spremenite pozneje, je označeno kot "raziskovalec".

2. Načrt analize: tudi če ne morete vnaprej posneti, napišite načrt analize, preden se poglobite v podatke: primarna hipoteza, primarna spremenljivka izida, glavni model. Vzpostavite razliko med »glavno analizo« in »dodatno/raziskovalno analizo« že na začetku in jo ohranite v poročilu.

3. Prijavite vse: Ne skrivajte modelov, ki ste jih preizkusili. V razdelku »analiza občutljivosti« (preverjanje robustnosti) pokažite, kako različne specifikacije spremenijo rezultat. Ugotovitev je močna le, če zdrži pri številnih verjetnih odločitvah.

4. Disciplina večkratne primerjave: Če ste naredili preveč testov, jih popravite (enota 6). Odgovorite na vprašanje "Koliko testov sem opravil?" iskreno.

5. Analiza občutljivosti: Ponovite svojo glavno ugotovitev z drugim vzorcem, drugačnim kontrolnim nizom in drugačno transformacijo. Če se rezultat spremeni, tega ne skrivajte, sporočite.

Primerjalna tabela: pošten proti pasti

Aplikacija

oblika pasti

Pošten ekvivalent

Izbira modela

Poskušam, dokler ni smiselno (p-hekanje)

Vnaprej načrtovan glavni model

hipoteza

Prilagajanje po dejstvu (HARKing)

Vnaprej posneto, pred podatki

Poročanje

Ne pokažite samo lepih

Vse specifikacije + občutljivost

podskupina

Izbira najbolj presenetljivega

Vnaprej določeno, popravljivo

zbiranje podatkov

Ustavite se, ko je smiselno

vnaprej določen vzorec

Štirje pozivi za kopiranje

1. Okvir poštenih zahtevkov:

Vaša vloga: pošten pomočnik statistike. Moj cilj NI najti smiselnega rezultata, ampak najti pravi rezultat. PRAVILA:- NE dajajte mi predlogov tipa "poskušajte modele, dokler ni smiselno",- povejte mi, če predlagate več specifikacij, ki jih je treba prijaviti,- opozorite me na vse korake, ki bi lahko vodili do p-hekanja. Najprej mi pomagajte razjasniti moj glavni model, ločite odkritje od potrditve.

2. Osnutek načrta analize:

Pomagajte mi pripraviti predhodni načrt analize za študijo: primarna hipoteza, primarna spremenljivka izida, glavna specifikacija modela, vnaprej določene podskupine, strategija večkratne primerjave. Raziskovalne in potrditvene analize postavite v ločena naslova. Opomni me, da to izpolnim, BREZ POGLEDA na podatke.

3. Analiza občutljivosti:

Moja glavna ugotovitev je pisanje kode analize občutljivosti (R) za Moj cilj je VIDETI, kako trden je rezultat, NE pa izbrati najboljšega; prikaži vse rezultate.

4. Samonadzor:

Razložil bom svoj postopek analize; Daj mi kontrolni seznam za p-hekanje / HARKing / selektivno poročanje in označi, kateri od mojih korakov je tvegan. Vprašaj me nazaj, koliko modelov/testov sem preizkusil in katere nameravam prijaviti.

Šibek poziv/močan poziv

Šibek poziv:

Katere spremenljivke kažejo pomembna razmerja v teh podatkih, poiščite najboljši model.

Ta poziv je neposredno navodilo p-hackinga: AI preizkuša na desetine kombinacij in predstavi tisto, ki je "najbolj smiselna." Rezultat je skoraj zagotovo lažna ugotovitev, ki je ni mogoče ponoviti.

Močan poziv:

Vaša vloga: pošten pomočnik. GLAVNI model, ki sem ga vnaprej določil, je: Y ~ X + kontrole. Napišite kodo, ki predvideva ta model. NE iščite drugega "bolj smiselnega" modela. Predlagajte tudi analizo občutljivosti, da lahko vidim robustnost rezultata, vendar vedite, da bom poročal o VSEH rezultatih, ne pa da bom izbral najboljšega. Ne dovolite mi, da kakršnih koli raziskovalnih ugotovitev odpišem kot "potrjene".

Razlika: močna volja popravi glavni model, prepoveduje iskanje in zahteva poročanje vseh rezultatov.

trije mini kovčki

Primer 1 – podskupinski lov. En raziskovalec ni ugotovil nobenega učinka v celotnem vzorcu; Vprašal je AI ​​"v kateri podskupini je pomembno?" YZ je skeniral kombinacije starosti, spola in regije ter ugotovil "p = 0,03 pri urbanih ženskah, starih 35-44 let". Članek je temeljil na tej podskupini. Njegova replikacija ni našla nobenega učinka: to je bila posledica naključja več deset podskupin. Lekcija: izbrana podskupina po podatkih je HARKing, ne potrditev.

Primer 2 – Lov na konverzijo. Odnos, ki se v obliki študentske ravni izkaže za nesmiselnega; poskusil v obliki loga, kvadratnega korena, kvadrata in zamika; Ugotovil je p=0,048 v obliki log-log in poročal samo o tem. Na srečo je ena od 5 preizkušenih form prestopila prag. Pravilen način je bil: predhodno izbrati obrazec s teorijo in prikazati rezultat vseh obrazcev v tabeli občutljivosti. Nauk: selektivno poročanje ustvarja lažen pomen.

Primer 3 – Kako deluje pošteno uokvirjanje. Ena ekipa, predhodno registrirana pred analizo: ena primarna hipoteza, en sam glavni model, dve vnaprej določeni podskupini, Bonferronijev popravek. Glavni učinek ni bil pomemben, vendar je ekipa o njem poročala pošteno; Raziskovalni posameznik je eno ugotovitev označil kot "ki jo je treba testirati v prihodnosti." Študija je bila ponovljiva in zanesljiva. Nauk: zaradi poštenega načrtovanja je vreden truda celo "neuspeh".

Pogoste napake

  • Naročiti AI, naj "najde pomembne rezultate". To je naravnost p-hekanje; Postavite AI v pošten okvir, zahtevajte natančnost, ne rezultate.
  • Predstavitev odkritja kot potrditve (HARKing). Hipotezo, postavljeno po podatkih, je zavajajoče zapisati kot "napovedoval sem že od začetka"; Označite raziskovalno ugotovitev.
  • Samo poročam o dobrih rezultatih. Pokaži vse preizkušene specifikacije; Skrivanje analize razpoloženja ogroža integriteto.
  • Preverjanje podskupine/pretvorbe. Izbira najpomembnejše izmed desetin podskupin ali transformacij povzroči lažne ugotovitve; identificirati in popraviti vnaprej.
  • Pozabili ste, koliko testov ste opravili. Spremljajte skupno število poskusov; Nobene p-vrednosti ni mogoče pošteno interpretirati brez poznavanja te številke.
Nasvet: Preden ugotovitev zapišete, se vprašajte: "Koliko načinov sem tiho poskusil, dokler nisem našel tega rezultata, in ali vse poročam?" Če nekateri eseji ostanejo v predalu, je vaše poročilo videti močnejše, kot je.

Če povzamem

p-hekanje, HARKing, selektivno poročanje in vrt razcepljenih poti; Mnoge so pasti, ki delujejo nenamerno, vendar proizvajajo lažne, neponovljive ugotovitve. AI pospeši te pasti, ker lahko v trenutku preizkusi na desetine analiz; Zahteve tipa »poišči pomembne rezultate« spremenijo umetno inteligenco v mehanizem p-hekanja. obramba; ločevanje odkritja od potrditve z načrtom predregistracije in analize, poročanje o vseh specifikacijah in analiza občutljivosti, popravljanje več primerjav in postavitev AI v pošten okvir, ki zahteva "pravilen rezultat". Končno odgovornost vedno nosi raziskovalec.

Aplikacijska naloga

Izberite raziskovalno vprašanje in napišite kratek načrt analize, preden si ogledate podatke: primarna hipoteza, glavni model, primarna spremenljivka izida, vnaprej določene podskupine, strategija večkratne primerjave. Nato ocenite glavni model. Nato izvedite analizo občutljivosti (različni kontrolniki, vključeni/izključeni izstopi, drugačna oblika funkcije) in prikažite vse rezultate v eni tabeli. V enem odstavku ocenite, kateri koraki predstavljajo tveganje za p-hekanje in kako jih vaš pošten okvir omejuje.

kontrolni seznam

  • [ ] Napisal sem načrt analize/glavni model, preden sem se poglobil v podatke.
  • [ ] Raziskovalno in potrditveno analizo sem označil ločeno; Nisem HARKAL.
  • [ ] Prijavil sem vse specifikacije, ki sem jih preizkusil; Nisem izbral le lepega.
  • [ ] Podskupine in transformacije sem določil vnaprej, nisem jih skeniral po podatkih.
  • [ ] Spremljal sem, koliko testov sem opravil in uporabil potrebne popravke.
  • [ ] Umetno inteligenco sem uporabil v kontekstu »najti resnico« in ne »najti smiselno«; Prevzel sem odgovornost.