Dobici:
- Shvatite da p-hakiranje, HARKing, selektivno izvještavanje i vrt račvanja stvaraju lažne nalaze i pogledajte kako umjetna inteligencija može ubrzati te zamke
- Sposobnost uspostavljanja obrane kao što je predregistracija, plan analize, disciplina višestruke usporedbe i analiza osjetljivosti uz podršku umjetne inteligencije
- Biti u stanju internalizirati dizajn poštenog zahtjeva koji će omogućiti umjetnoj inteligenciji da odbije zahtjeve tipa 'pronađi smislen rezultat' i da konačna odgovornost leži na istraživaču.
U prethodnoj cjelini vidjeli smo što je p-vrijednost, a što nije. U ovoj jedinici bavit ćemo se mračnijom temom, sustavnim zamkama koje prijete statističkom integritetu. Većina njih nije namjerno varanje; To su podmukli mehanizmi na koje čak i dobronamjerni istraživači upadaju, a da toga nisu svjesni. A umjetna inteligencija (AI) olakšava i ubrzava ove zamke jer omogućuje izvođenje desetaka analiza u nekoliko sekundi. Cilj ove jedinice je uspostaviti disciplinu koja će transformirati AI iz "stroja za pronalaženje značajnih rezultata" u poštenog pomoćnika.
Osnovne zamke
p-hakiranje (traženje p-vrijednosti): ponovno pokušava analizu na različite načine dok se ne dobije značajan rezultat (p<0,05). Dodavanje i uklanjanje varijabli, odabir poduzoraka, mijenjanje definicije outliera, isprobavanje različitih transformacija, korištenje različitih varijabli ishoda, zaustavljanje prikupljanja podataka kada to postane smisleno... Svaki pokušaj daje novu "šansu"; Ako se dovoljno potrudite, jedan od njih će se pokazati smislenim, čak i ako zapravo nema učinka. Rezultat: lažni nalazi koji su objavljeni, ali se ne mogu ponoviti.
HARKing (Postavljanje hipoteze nakon što su rezultati poznati): Izrada hipoteze nakon što se vide rezultati i predstavljanje kao "Ovako sam predvidio od početka". Pogledate podatke i nađete najupečatljiviji odnos, a zatim napišete rad kao da je osmišljen da testira tu hipotezu. To dovodi čitatelja u zabludu tako što otkriće izgleda kao potvrda.
Selektivno izvješćivanje (biranje trešnji): Izvještavanje samo o "dobrima" iz desetaka analiza i tiho zakopavanje ostalih. Ovo je također poznato kao "problem ladice datoteke": besmisleni rezultati ostaju u ladici, čineći literaturu sustavno pristranom.
Vrt račvanja staza: termin Andrewa Gelmana. Čak i bez ijednog namjernog p-hakiranja, istraživač donosi mnogo razumnih izbora na temelju podataka (koja varijabla, koji prag, koja podskupina, koja transformacija). Ovi istraživački stupnjevi slobode toliko su brojni da učinkovito odabirete smislenu iz mnoštva analiza – čak i bez ikakve loše namjere. Rezultat je ponovno rastuća stopa lažno pozitivnih rezultata.
Oprez: Većina ovih zamki nisu namjerni trikovi. Zbroj naizgled nevinih koraka poput "upravo sam isprobao još nekoliko modela", "bilo je čišće kad sam uklonio outlier", "učinak je jasniji u ovoj podskupini" može proizvesti lažan nalaz. Iskrenost je stvar metode, a ne namjere.
Zašto AI povećava ove zamke?
Ručno isprobavanje 3 modela zahtijeva vrijeme; YZ proizvodi 50 varijanti modela, 10 različitih konverzija, 8 podgrupa u nekoliko minuta. Ova moć je katastrofalna bez poštenog plana: zahtjev poput "pronađi smislenu vezu u ovim podacima" ili "izradi model koji podržava ovu hipotezu" pretvara AI izravno u p-hacking motor. AI također želi biti od pomoći; nastoji pronaći "smislen" ishod koji će vas zadovoljiti. Zato je vaš brzi dizajn prva linija obrane poštenja.
Obrane: pošteno poslovanje
1. Predregistracija: To znači bilježenje vaše hipoteze, varijabli, modela i testova u pisanom obliku (po mogućnosti na platformi s vremenskim žigom) prije izvođenja analize. Dakle, otkriće je odvojeno od potvrde; sve što promijenite nakon toga je označeno kao "istraživač".
2. Plan analize: Čak i ako ne možete unaprijed zabilježiti, napišite plan analize prije nego što zaronite u podatke: primarna hipoteza, primarna varijabla ishoda, glavni model. Uspostavite razliku između "glavne analize" i "dodatne/istraživačke analize" od početka i zadržite je u izvješću.
3. Prijavite sve: Ne skrivajte modele koje ste isprobali. U odjeljku "analiza osjetljivosti" (provjera robusnosti) pokažite kako različite specifikacije mijenjaju rezultat. Nalaz je jak samo ako se drži pod mnogim vjerojatnim izborima.
4. Disciplina višestruke usporedbe: Ako ste napravili previše testova, ispravite ih (jedinica 6). Odgovorite na pitanje "Koliko sam testova napravio?" iskreno.
5. Analiza osjetljivosti: Ponovite svoj glavni nalaz s drugim uzorkom, drugim kontrolnim skupom i različitom transformacijom. Ako se rezultat promijeni, nemojte to skrivati, prijavite.
Tablica usporedbe: pošteni protiv zamke
Primjena
oblik zamke
Pošteni ekvivalent
Izbor modela
Pokušavam dok ne bude imalo smisla (p-hakiranje)
Unaprijed planirani glavni model
hipoteza
Uklapanje nakon činjenice (HARKing)
Unaprijed snimljeno, prije podataka
Izvještavanje
Nemojte samo pokazati one lijepe
Sve specifikacije + osjetljivost
podskupina
Odabir najupečatljivijeg
Predefinirano, ispravljivo
prikupljanje podataka
Prestanite kad ima smisla
unaprijed određeni uzorak
Četiri upita za kopiranje
1. Pošteni okvir zahtjeva:
Vaša uloga: pošteni asistent statistike. Moj cilj NIJE pronaći smislen rezultat, već pronaći pravi rezultat. PRAVILA:- NEMOJTE mi davati prijedloge tipa "isprobajte modele dok ne postane logično",- recite mi ako predložite više specifikacija, sve ih treba prijaviti,- upozorite me na sve korake koji bi mogli dovesti do p-hakiranja. Prvo mi pomozite razjasniti moj glavni model, odvojite otkriće od potvrde.
2. Nacrt plana analize:
Pomozite mi da sastavim preliminarni plan analize za studiju: primarna hipoteza, primarna varijabla ishoda, glavna specifikacija modela, unaprijed definirane podskupine, strategija višestruke usporedbe. Stavite "istraživačke" i "potvrdne" analize u zasebne naslove. Podsjeti me da ovo ispunim BEZ GLEDANJA u podatke.
3. Analiza osjetljivosti:
Moje glavno otkriće je pisanje koda analize osjetljivosti (R) za Moj cilj je VIDJETI koliko je solidan rezultat, NE odabrati najbolji; prikaži sve rezultate.
4. Samokontrola:
Objasnit ću svoj proces analize; Dajte mi kontrolni popis za p-hakiranje / HARKing / selektivno izvještavanje i označite koji su moji koraci rizični. Pitajte me koliko sam modela/testova isprobao i koje planiram prijaviti.
Slab upit / Jak upit
Slab upit:
Koje varijable pokazuju značajne odnose u ovim podacima, pronađite najbolji model.
Ovaj upit je izravna uputa za p-hakiranje: AI iskušava desetke kombinacija i predstavlja onu koja "ima najviše smisla". Rezultat je gotovo sigurno lažni nalaz koji se ne može ponoviti.
Snažan upit:
Vaša uloga: iskreni pomoćnik. GLAVNI model koji sam unaprijed odredio je: Y ~ X + kontrole. Napišite kod koji predviđa ovaj model. NEMOJTE tražiti drugi "smisleniji" model. Također predložite analizu osjetljivosti kako bih mogao vidjeti robusnost rezultata, ali znajte da ću prijaviti SVE rezultate, a ne odabrati najbolji. Nemojte mi dopustiti da bilo koja otkrića istraživanja otpišem kao 'potvrđena'.
Razlika: snažna volja popravlja glavni model, zabranjuje pretraživanje i zahtijeva da se svi rezultati prijave.
tri mini kućišta
Slučaj 1 — Podskupinski lov. Jedan istraživač nije pronašao nikakav učinak u ukupnom uzorku; Pitao je AI "u kojoj je podskupini značajan?" YZ je skenirao kombinacije dobi, spola i regije i pronašao "p = 0,03 kod urbanih žena u dobi od 35 do 44 godine". Članak se temeljio na ovoj podskupini. Njegovo ponavljanje nije pronašlo nikakav učinak: to je bio rezultat slučajnosti desetaka podskupina. Lekcija: odabrana podskupina nakon podataka je HARKing, a ne potvrđivanje.
Slučaj 2 — Lov na konverziju. Odnos koji se pokazuje besmislenim u formi na studentskoj razini; isprobao u oblicima logaritam, kvadratni korijen, kvadrat i lag; Pronašao je p=0,048 u log-log obliku i izvijestio samo o tome. Srećom, jedan od 5 isprobanih obrazaca prešao je prag. Ispravan način je bio: unaprijed odabrati formu s teorijom i prikazati rezultat svih formi u tablici osjetljivosti. Lekcija: selektivno izvještavanje proizvodi lažnu važnost.
Slučaj 3 — Kako funkcionira pošteno uokvirivanje. Jedan tim se unaprijed registrirao prije analize: jedna primarna hipoteza, jedan glavni model, dvije unaprijed definirane podskupine, Bonferronijeva korekcija. Glavni učinak nije bio značajan, ali tim ga je iskreno izvijestio; Istraživački pojedinac označio je jedno otkriće kao "treba testirati u budućnosti". Studija je bila ponovljiva i pouzdana. Lekcija: pošteno planiranje čini čak i ishod "neuspjeha" vrijednim truda.
Uobičajene greške
- Reći AI da "pronađe značajne rezultate". Ovo je pravo p-hakiranje; Stavite AI u pošten okvir, tražeći točnost, a ne rezultate.
- Predstavljanje otkrića kao potvrde (HARKing). Pogrešno je napisati hipotezu postavljenu nakon podataka kao "predvidio sam to od početka"; Označite istraživački nalaz.
- Javljam samo dobre rezultate. Prikaži sve testirane specifikacije; Skrivanje analize raspoloženja ugrožava integritet.
- Probir podskupina/pretvorbe. Odabir najznačajnije od desetaka podskupina ili transformacija proizvodi lažne nalaze; identificirati i popraviti unaprijed.
- Zaboravljate koliko ste testova napravili. Pratite ukupan broj pokušaja; Nijedna p-vrijednost ne može se pošteno protumačiti bez poznavanja ovog broja.
Savjet: Prije nego što zapišete nalaz, zapitajte se: "Koliko sam načina u tišini pokušao dok nisam došao do ovog rezultata i prijavljujem li ih sve?" Ako neki od eseja ostanu u ladici, vaše izvješće izgleda jače nego što jest.
Ukratko
p-hakiranje, HARKing, selektivno izvještavanje i vrt račvanja staza; Mnoge su zamke koje djeluju nenamjerno, ali proizvode lažne, neponovljive nalaze. AI ubrzava ove zamke jer može odmah isprobati desetke analiza; Zahtjevi tipa "pronađi značajne rezultate" pretvaraju AI u motor za p-hakiranje. Obrana; odvajanje otkrića od potvrde s planom predregistracije i analize, izvješćivanje o svim specifikacijama i analiza osjetljivosti, ispravljanje višestrukih usporedbi i stavljanje umjetne inteligencije u pošten okvir koji zahtijeva "točan rezultat". Konačna odgovornost uvijek leži na istraživaču.
Zadatak aplikacije
Odaberite istraživačko pitanje i napišite kratak plan analize prije nego što pogledate podatke: primarna hipoteza, glavni model, primarna varijabla ishoda, unaprijed definirane podskupine, strategija višestruke usporedbe. Zatim procijenite glavni model. Zatim napravite analizu osjetljivosti (različite kontrole, outlier uključen/isključen, drugačiji oblik funkcije) i prikažite sve rezultate u jednoj tablici. U jednom odlomku procijenite koji koraci predstavljaju rizik od p-hakiranja i kako ih vaš pošteni okvir ograničava.
popis za provjeru
- [ ] Napisao sam plan analize/glavni model prije nego što sam zaronio u podatke.
- [ ] Odvojeno sam označio eksplorativne i potvrdne analize; Nisam HARKING.
- [ ] Prijavio sam sve specifikacije koje sam isprobao; Nisam odabrala samo onu lijepu.
- [ ] Podskupine i transformacije definirao sam unaprijed, nisam ih skenirao nakon podataka.
- [ ] Pratio sam koliko sam testova proveo i primijenio potrebne ispravke.
- [ ] Koristio sam AI u kontekstu "pronaći istinu" radije nego "smatrati da ima smisla"; Preuzeo sam odgovornost.