Jedinica 7 / 11

p-hakiranje, HARKing i statistički integritet: Zamke u doba umjetne inteligencije

Dobici:

  • Shvatite da p-hakiranje, HARKing, selektivno izvještavanje i vrt račvanja stvaraju lažne nalaze i pogledajte kako umjetna inteligencija može ubrzati te zamke
  • Sposobnost uspostavljanja obrane kao što je predregistracija, plan analize, disciplina višestruke usporedbe i analiza osjetljivosti uz podršku umjetne inteligencije
  • Biti u stanju internalizirati dizajn poštenog zahtjeva koji će omogućiti umjetnoj inteligenciji da odbije zahtjeve tipa 'pronađi smislen rezultat' i da konačna odgovornost leži na istraživaču.

U prethodnoj cjelini vidjeli smo što je p-vrijednost, a što nije. U ovoj jedinici bavit ćemo se mračnijom temom, sustavnim zamkama koje prijete statističkom integritetu. Većina njih nije namjerno varanje; To su podmukli mehanizmi na koje čak i dobronamjerni istraživači upadaju, a da toga nisu svjesni. A umjetna inteligencija (AI) olakšava i ubrzava ove zamke jer omogućuje izvođenje desetaka analiza u nekoliko sekundi. Cilj ove jedinice je uspostaviti disciplinu koja će transformirati AI iz "stroja za pronalaženje značajnih rezultata" u poštenog pomoćnika.

Osnovne zamke

p-hakiranje (traženje p-vrijednosti): ponovno pokušava analizu na različite načine dok se ne dobije značajan rezultat (p<0,05). Dodavanje i uklanjanje varijabli, odabir poduzoraka, mijenjanje definicije outliera, isprobavanje različitih transformacija, korištenje različitih varijabli ishoda, zaustavljanje prikupljanja podataka kada to postane smisleno... Svaki pokušaj daje novu "šansu"; Ako se dovoljno potrudite, jedan od njih će se pokazati smislenim, čak i ako zapravo nema učinka. Rezultat: lažni nalazi koji su objavljeni, ali se ne mogu ponoviti.

HARKing (Postavljanje hipoteze nakon što su rezultati poznati): Izrada hipoteze nakon što se vide rezultati i predstavljanje kao "Ovako sam predvidio od početka". Pogledate podatke i nađete najupečatljiviji odnos, a zatim napišete rad kao da je osmišljen da testira tu hipotezu. To dovodi čitatelja u zabludu tako što otkriće izgleda kao potvrda.

Selektivno izvješćivanje (biranje trešnji): Izvještavanje samo o "dobrima" iz desetaka analiza i tiho zakopavanje ostalih. Ovo je također poznato kao "problem ladice datoteke": besmisleni rezultati ostaju u ladici, čineći literaturu sustavno pristranom.

Vrt račvanja staza: termin Andrewa Gelmana. Čak i bez ijednog namjernog p-hakiranja, istraživač donosi mnogo razumnih izbora na temelju podataka (koja varijabla, koji prag, koja podskupina, koja transformacija). Ovi istraživački stupnjevi slobode toliko su brojni da učinkovito odabirete smislenu iz mnoštva analiza – čak i bez ikakve loše namjere. Rezultat je ponovno rastuća stopa lažno pozitivnih rezultata.

Oprez: Većina ovih zamki nisu namjerni trikovi. Zbroj naizgled nevinih koraka poput "upravo sam isprobao još nekoliko modela", "bilo je čišće kad sam uklonio outlier", "učinak je jasniji u ovoj podskupini" može proizvesti lažan nalaz. Iskrenost je stvar metode, a ne namjere.

Zašto AI povećava ove zamke?

Ručno isprobavanje 3 modela zahtijeva vrijeme; YZ proizvodi 50 varijanti modela, 10 različitih konverzija, 8 podgrupa u nekoliko minuta. Ova moć je katastrofalna bez poštenog plana: zahtjev poput "pronađi smislenu vezu u ovim podacima" ili "izradi model koji podržava ovu hipotezu" pretvara AI izravno u p-hacking motor. AI također želi biti od pomoći; nastoji pronaći "smislen" ishod koji će vas zadovoljiti. Zato je vaš brzi dizajn prva linija obrane poštenja.

Obrane: pošteno poslovanje

1. Predregistracija: To znači bilježenje vaše hipoteze, varijabli, modela i testova u pisanom obliku (po mogućnosti na platformi s vremenskim žigom) prije izvođenja analize. Dakle, otkriće je odvojeno od potvrde; sve što promijenite nakon toga je označeno kao "istraživač".

2. Plan analize: Čak i ako ne možete unaprijed zabilježiti, napišite plan analize prije nego što zaronite u podatke: primarna hipoteza, primarna varijabla ishoda, glavni model. Uspostavite razliku između "glavne analize" i "dodatne/istraživačke analize" od početka i zadržite je u izvješću.

3. Prijavite sve: Ne skrivajte modele koje ste isprobali. U odjeljku "analiza osjetljivosti" (provjera robusnosti) pokažite kako različite specifikacije mijenjaju rezultat. Nalaz je jak samo ako se drži pod mnogim vjerojatnim izborima.

4. Disciplina višestruke usporedbe: Ako ste napravili previše testova, ispravite ih (jedinica 6). Odgovorite na pitanje "Koliko sam testova napravio?" iskreno.

5. Analiza osjetljivosti: Ponovite svoj glavni nalaz s drugim uzorkom, drugim kontrolnim skupom i različitom transformacijom. Ako se rezultat promijeni, nemojte to skrivati, prijavite.

Tablica usporedbe: pošteni protiv zamke

Primjena

oblik zamke

Pošteni ekvivalent

Izbor modela

Pokušavam dok ne bude imalo smisla (p-hakiranje)

Unaprijed planirani glavni model

hipoteza

Uklapanje nakon činjenice (HARKing)

Unaprijed snimljeno, prije podataka

Izvještavanje

Nemojte samo pokazati one lijepe

Sve specifikacije + osjetljivost

podskupina

Odabir najupečatljivijeg

Predefinirano, ispravljivo

prikupljanje podataka

Prestanite kad ima smisla

unaprijed određeni uzorak

Četiri upita za kopiranje

1. Pošteni okvir zahtjeva:

Vaša uloga: pošteni asistent statistike. Moj cilj NIJE pronaći smislen rezultat, već pronaći pravi rezultat. PRAVILA:- NEMOJTE mi davati prijedloge tipa "isprobajte modele dok ne postane logično",- recite mi ako predložite više specifikacija, sve ih treba prijaviti,- upozorite me na sve korake koji bi mogli dovesti do p-hakiranja. Prvo mi pomozite razjasniti moj glavni model, odvojite otkriće od potvrde.

2. Nacrt plana analize:

Pomozite mi da sastavim preliminarni plan analize za studiju: primarna hipoteza, primarna varijabla ishoda, glavna specifikacija modela, unaprijed definirane podskupine, strategija višestruke usporedbe. Stavite "istraživačke" i "potvrdne" analize u zasebne naslove. Podsjeti me da ovo ispunim BEZ GLEDANJA u podatke.

3. Analiza osjetljivosti:

Moje glavno otkriće je pisanje koda analize osjetljivosti (R) za Moj cilj je VIDJETI koliko je solidan rezultat, NE odabrati najbolji; prikaži sve rezultate.

4. Samokontrola:

Objasnit ću svoj proces analize; Dajte mi kontrolni popis za p-hakiranje / HARKing / selektivno izvještavanje i označite koji su moji koraci rizični. Pitajte me koliko sam modela/testova isprobao i koje planiram prijaviti.

Slab upit / Jak upit

Slab upit:

Koje varijable pokazuju značajne odnose u ovim podacima, pronađite najbolji model.

Ovaj upit je izravna uputa za p-hakiranje: AI iskušava desetke kombinacija i predstavlja onu koja "ima najviše smisla". Rezultat je gotovo sigurno lažni nalaz koji se ne može ponoviti.

Snažan upit:

Vaša uloga: iskreni pomoćnik. GLAVNI model koji sam unaprijed odredio je: Y ~ X + kontrole. Napišite kod koji predviđa ovaj model. NEMOJTE tražiti drugi "smisleniji" model. Također predložite analizu osjetljivosti kako bih mogao vidjeti robusnost rezultata, ali znajte da ću prijaviti SVE rezultate, a ne odabrati najbolji. Nemojte mi dopustiti da bilo koja otkrića istraživanja otpišem kao 'potvrđena'.

Razlika: snažna volja popravlja glavni model, zabranjuje pretraživanje i zahtijeva da se svi rezultati prijave.

tri mini kućišta

Slučaj 1 — Podskupinski lov. Jedan istraživač nije pronašao nikakav učinak u ukupnom uzorku; Pitao je AI ​​"u kojoj je podskupini značajan?" YZ je skenirao kombinacije dobi, spola i regije i pronašao "p = 0,03 kod urbanih žena u dobi od 35 do 44 godine". Članak se temeljio na ovoj podskupini. Njegovo ponavljanje nije pronašlo nikakav učinak: to je bio rezultat slučajnosti desetaka podskupina. Lekcija: odabrana podskupina nakon podataka je HARKing, a ne potvrđivanje.

Slučaj 2 — Lov na konverziju. Odnos koji se pokazuje besmislenim u formi na studentskoj razini; isprobao u oblicima logaritam, kvadratni korijen, kvadrat i lag; Pronašao je p=0,048 u log-log obliku i izvijestio samo o tome. Srećom, jedan od 5 isprobanih obrazaca prešao je prag. Ispravan način je bio: unaprijed odabrati formu s teorijom i prikazati rezultat svih formi u tablici osjetljivosti. Lekcija: selektivno izvještavanje proizvodi lažnu važnost.

Slučaj 3 — Kako funkcionira pošteno uokvirivanje. Jedan tim se unaprijed registrirao prije analize: jedna primarna hipoteza, jedan glavni model, dvije unaprijed definirane podskupine, Bonferronijeva korekcija. Glavni učinak nije bio značajan, ali tim ga je iskreno izvijestio; Istraživački pojedinac označio je jedno otkriće kao "treba testirati u budućnosti". Studija je bila ponovljiva i pouzdana. Lekcija: pošteno planiranje čini čak i ishod "neuspjeha" vrijednim truda.

Uobičajene greške

  • Reći AI da "pronađe značajne rezultate". Ovo je pravo p-hakiranje; Stavite AI u pošten okvir, tražeći točnost, a ne rezultate.
  • Predstavljanje otkrića kao potvrde (HARKing). Pogrešno je napisati hipotezu postavljenu nakon podataka kao "predvidio sam to od početka"; Označite istraživački nalaz.
  • Javljam samo dobre rezultate. Prikaži sve testirane specifikacije; Skrivanje analize raspoloženja ugrožava integritet.
  • Probir podskupina/pretvorbe. Odabir najznačajnije od desetaka podskupina ili transformacija proizvodi lažne nalaze; identificirati i popraviti unaprijed.
  • Zaboravljate koliko ste testova napravili. Pratite ukupan broj pokušaja; Nijedna p-vrijednost ne može se pošteno protumačiti bez poznavanja ovog broja.
Savjet: Prije nego što zapišete nalaz, zapitajte se: "Koliko sam načina u tišini pokušao dok nisam došao do ovog rezultata i prijavljujem li ih sve?" Ako neki od eseja ostanu u ladici, vaše izvješće izgleda jače nego što jest.

Ukratko

p-hakiranje, HARKing, selektivno izvještavanje i vrt račvanja staza; Mnoge su zamke koje djeluju nenamjerno, ali proizvode lažne, neponovljive nalaze. AI ubrzava ove zamke jer može odmah isprobati desetke analiza; Zahtjevi tipa "pronađi značajne rezultate" pretvaraju AI u motor za p-hakiranje. Obrana; odvajanje otkrića od potvrde s planom predregistracije i analize, izvješćivanje o svim specifikacijama i analiza osjetljivosti, ispravljanje višestrukih usporedbi i stavljanje umjetne inteligencije u pošten okvir koji zahtijeva "točan rezultat". Konačna odgovornost uvijek leži na istraživaču.

Zadatak aplikacije

Odaberite istraživačko pitanje i napišite kratak plan analize prije nego što pogledate podatke: primarna hipoteza, glavni model, primarna varijabla ishoda, unaprijed definirane podskupine, strategija višestruke usporedbe. Zatim procijenite glavni model. Zatim napravite analizu osjetljivosti (različite kontrole, outlier uključen/isključen, drugačiji oblik funkcije) i prikažite sve rezultate u jednoj tablici. U jednom odlomku procijenite koji koraci predstavljaju rizik od p-hakiranja i kako ih vaš pošteni okvir ograničava.

popis za provjeru

  • [ ] Napisao sam plan analize/glavni model prije nego što sam zaronio u podatke.
  • [ ] Odvojeno sam označio eksplorativne i potvrdne analize; Nisam HARKING.
  • [ ] Prijavio sam sve specifikacije koje sam isprobao; Nisam odabrala samo onu lijepu.
  • [ ] Podskupine i transformacije definirao sam unaprijed, nisam ih skenirao nakon podataka.
  • [ ] Pratio sam koliko sam testova proveo i primijenio potrebne ispravke.
  • [ ] Koristio sam AI u kontekstu "pronaći istinu" radije nego "smatrati da ima smisla"; Preuzeo sam odgovornost.