Dobici:
- Shvatite da p-hacking, HARKing, selektivno izvještavanje i vrt račvaćih staza proizvode lažne nalaze i pogledajte kako umjetna inteligencija može ubrzati ove zamke
- Sposobnost uspostavljanja odbrane kao što su predregistracija, plan analize, disciplina višestrukog poređenja i analiza osjetljivosti uz podršku umjetne inteligencije
- Biti u stanju da internalizuje iskren dizajn zahteva koji će omogućiti veštačkoj inteligenciji da odbije zahteve tipa 'pronađi smisleni rezultat' i da konačna odgovornost leži na istraživaču.
U prethodnoj cjelini vidjeli smo šta je p-vrijednost, a šta nije. U ovoj jedinici ćemo se osvrnuti na mračniju temu, sistematske zamke koje ugrožavaju statistički integritet. Većina njih nije namjerno varanje; To su podmukli mehanizmi u koje čak i dobronamjerni istraživači upadaju a da toga nisu svjesni. A umjetna inteligencija (AI) čini ove zamke i lakšim i bržim, jer omogućava izvođenje desetina analiza u sekundi. Cilj ove jedinice je uspostaviti disciplinu koja će pretvoriti AI iz "mašine za pronalaženje smislenih rezultata" u poštenog asistenta.
Osnovne zamke
p-hakiranje (lov na p-vrijednosti): Ponovo pokušava analizu na različite načine dok se ne dobije značajan rezultat (p<0,05). Dodavanje i uklanjanje varijabli, odabir poduzoraka, mijenjanje definicije outliera, isprobavanje različitih transformacija, korištenje različitih varijabli ishoda, zaustavljanje prikupljanja podataka kada postane smisleno... Svaki pokušaj daje novu "šansu"; Ako se dovoljno potrudite, jedan od njih će se pokazati smislenim, čak i ako zapravo nema efekta. Rezultat: lažni nalazi koji su objavljeni, ali nisu reproducirani.
HARKing (Hipoteza nakon što se saznaju rezultati): Izrada hipoteze nakon što se vide rezultati i predstavljanje kao "Ovako sam to predvidio od početka". Gledate podatke i pronalazite najupečatljiviju vezu, a zatim pišete rad kao da je dizajniran da testira tu hipotezu. Ovo dovodi čitatelja u zabludu tako što otkriće izgleda kao potvrda.
Selektivno izvještavanje (branje trešanja): Izvještavanje samo o "dobrima" iz desetina analiza i tiho zakopavanje ostalih. Ovo je takođe poznato kao "problem sa ladicama datoteka": besmisleni rezultati ostaju u ladici, čineći literaturu sistematski pristrasnom.
Vrt staza koje se račvaju: termin Andrewa Gelmana. Čak i bez jednog namjernog p-hakiranja, istraživač donosi mnoge razumne izbore na osnovu podataka (koja varijabla, koji prag, koja podgrupa, koja transformacija). Ovi istraživački stepeni slobode su toliko brojni da efektivno birate onaj koji ima smisla iz mnoštva analiza – čak i bez ikakve zle namjere. Rezultat je opet rastuća stopa lažnih pozitivnih rezultata.
Oprez: Većina ovih zamki nisu namjerni trikovi. Zbir naizgled nevinih koraka kao što su "upravo sam isprobao još nekoliko modela", "bilo je čistije kada sam uklonio graničnik", "efekat je jasniji u ovoj podgrupi" može proizvesti lažan nalaz. Iskrenost je stvar metode, a ne namjere.
Zašto AI povećava ove zamke?
Za ručno isprobavanje 3 modela potrebno je vrijeme; YZ proizvodi 50 varijanti modela, 10 različitih konverzija, 8 podgrupa u minutima. Ova moć je katastrofalna bez poštenog plana: zahtjev poput "pronađi smislenu vezu u ovim podacima" ili "izgradi model koji podržava ovu hipotezu" pretvara AI direktno u p-hacking motor. AI takođe želi da bude od pomoći; teži pronalaženju "smislenog" ishoda koji će vas zadovoljiti. Zato je vaš brz dizajn prva linija odbrane poštenja.
Odbrana: pošteno poslovanje
1. Prethodna registracija: To znači zapisivanje vaše hipoteze, varijabli, modela i testova u pisanoj formi (moguće na platformi s vremenskim žigom) prije izvođenja analize. Dakle, otkriće je odvojeno od potvrde; sve što kasnije promijenite označeno je kao "istraživač".
2. Plan analize: Čak i ako ne možete unaprijed snimiti, napišite plan analize prije nego što uđete u podatke: primarna hipoteza, primarna varijabla ishoda, glavni model. Uspostavite razliku između “glavne analize” i “dodatne/istraživačke analize” od početka i održavajte je u izvještaju.
3. Prijavite sve: Ne skrivajte modele koje ste isprobali. U odjeljku “analiza osjetljivosti” (provjera robusnosti) pokažite kako različite specifikacije mijenjaju rezultat. Nalaz je jak samo ako se izdrži pod mnogim vjerojatnim izborima.
4. Disciplina višestrukog poređenja: Ako ste uradili previše testova, ispravite ih (jedinica 6). Odgovorite na pitanje "Koliko sam testova uradio?" iskreno.
5. Analiza osjetljivosti: Ponovite svoj glavni nalaz s drugim uzorkom, različitim kontrolnim skupom i različitom transformacijom. Ako se rezultat promijeni, nemojte ga skrivati, prijavite ga.
Uporedni grafikon: pošten vs. zamka
Aplikacija
oblik zamke
Iskren ekvivalent
Izbor modela
Pokušavam dok nema smisla (p-hakovanje)
Unaprijed planirani master model
hipoteza
Montaža nakon činjenice (HARKing)
Unaprijed snimljeno, prije podataka
Izvještavanje
Nemojte samo pokazati lijepe
Sve specifikacije + osjetljivost
podgrupa
Odabir najupečatljivijih
Unaprijed definirano, popravljivo
prikupljanje podataka
Stani kad ima smisla
unapred određen uzorak
Četiri upita za kopiranje
1. Pošteni okvir zahtjeva:
Vaša uloga: asistent za poštenu statistiku. Moj cilj NIJE pronaći smislen rezultat, nego pronaći pravi rezultat. PRAVILA:- NEMOJTE mi davati prijedloge tipa "probajte modele dok ne dobijete smisla",- recite mi ako predlažete više specifikacija koje sve treba prijaviti,- upozorite me na sve korake koji bi mogli dovesti do p-hakiranja. Pomozite mi da prvo razjasnim moj glavni model, odvojite otkriće od potvrde.
2. Nacrt plana analize:
Pomozite mi da izradim preliminarni plan analize za studiju: primarna hipoteza, primarna varijabla ishoda, glavna specifikacija modela, unaprijed definirane podgrupe, strategija višestrukog poređenja. Stavite "istraživačke" i "potvrdne" analize u odvojene naslove. Podsjeti me da ovo ispunim BEZ GLEDANJA podataka.
3. Analiza osjetljivosti:
Moj glavni nalaz je pisanje koda za analizu osjetljivosti (R) za Moj cilj je VIDJETI koliko je rezultat solidan, A NE odabrati najbolji; prikaži sve rezultate.
4. Samokontrola:
Objasniću svoj proces analize; Dajte mi kontrolnu listu za p-hacking / HARKing / selektivno izvještavanje i označite koji od mojih koraka su rizični. Pitajte me koliko sam modela/testova isprobao i koje planiram prijaviti.
Slaba prompt / Jaka prompt
Slab upit:
Koje varijable pokazuju značajne odnose u ovim podacima, pronađite najbolji model.
Ovaj prompt je direktna instrukcija p-hakiranja: AI isprobava desetke kombinacija i predstavlja onu koja "ima najviše smisla". Rezultat je gotovo sigurno lažan nalaz koji se ne može ponoviti.
Snažan upit:
Vaša uloga: pošteni asistent. GLAVNI model koji sam unaprijed odredio je: Y ~ X + kontrole. Napišite kod koji predviđa ovaj model. NEMOJTE tražiti drugi "smisleniji" model. Predložite i analizu osjetljivosti kako bih mogao vidjeti robusnost rezultata, ali znajte da ću prijaviti SVE rezultate, a ne odabrati najbolji. Nemojte mi dozvoliti da bilo kakve istraživačke nalaze otpišem kao "potvrđene".
Razlika: jaka volja popravlja glavni model, zabranjuje pretraživanje i zahtijeva da se svi rezultati prijave.
tri mini kofera
Slučaj 1 — Lov podgrupa. Jedan istraživač nije našao nikakav efekat u ukupnom uzorku; Pitao je AI "u kojoj je podgrupi značajan?" YZ je skenirao kombinacije starosti, pola i regiona i pronašao "p = 0,03 kod urbanih žena starosti 35-44 godine". Članak je zasnovan na ovoj podgrupi. Njegova replikacija nije naišla na nikakav učinak: to je bila slučajnost desetina podgrupa. Lekcija: odabrana podgrupa nakon podataka je HARKing, ne potvrđuje.
Slučaj 2 — Traženje konverzije. Odnos koji se ispostavlja besmislenim u obliku studentskog nivoa; isprobao u obliku dnevnika, kvadratnog korijena, kvadrata i oblika zaostajanja; Našao je p=0,048 u log-log formi i prijavio samo to. Srećom, jedan od 5 isprobanih formi je prešao prag. Ispravan način je bio: unaprijed odabrati formu sa teorijom i prikazati rezultat svih oblika u tablici osjetljivosti. Pouka: selektivno izvještavanje proizvodi lažni značaj.
Slučaj 3 — Kako funkcioniše pošteno uokvirivanje. Jedan tim je prethodno registrovan prije analize: jedna primarna hipoteza, jedan glavni model, dvije unaprijed definirane podgrupe, Bonferronijeva korekcija. Glavni efekat nije bio značajan, ali tim je to iskreno prijavio; Istraživačka osoba je označila jedan nalaz kao "treba da bude testiran u budućnosti". Studija je bila ponovljiva i pouzdana. Pouka: pošteno planiranje čini čak i "neuspješan" ishod vrijednim.
Uobičajene greške
- Reći AI da "pronađe smislene rezultate". Ovo je direktno p-hakovanje; Stavite AI u pošten okvir, tražeći tačnost, a ne rezultate.
- Predstavljanje otkrića kao potvrde (HARKing). Pogrešno je pisati hipotezu uspostavljenu nakon podataka kao "predvidio sam je od početka"; Označite istraživački nalaz.
- Samo izvještavam o dobrim rezultatima. Prikaži sve testirane specifikacije; Skrivanje analize osjećaja ugrožava integritet.
- Skrining podgrupe/konverzije. Odabir najznačajnije od desetina podgrupa ili transformacija proizvodi lažne nalaze; identificirati i popraviti unaprijed.
- Zaboravljate koliko ste testova uradili. Pratite ukupan broj pokušaja; Nijedna p-vrijednost ne može se tumačiti iskreno bez poznavanja ovog broja.
Savjet: Prije nego što zapišete nalaz, zapitajte se: "Koliko sam načina u tišini pokušao dok nisam našao ovaj rezultat i da li ih sve prijavljujem?" Ako neki od eseja ostanu u ladici, vaš izvještaj izgleda jače nego što jeste.
Ukratko
p-hacking, HARKing, selektivno izvještavanje i vrt račvaćih staza; Mnoge su zamke koje rade nenamjerno, ali daju lažne, neponovljive nalaze. AI ubrzava ove zamke jer može odmah isprobati desetine analiza; Zahtjevi tipa „pronađi smislene rezultate“ pretvaraju AI u motor za p-hakovanje. odbrana; odvajanje otkrića od potvrde sa planom predregistracije i analize, izvještavanje o svim specifikacijama i analizama osjetljivosti, ispravljanje višestrukih poređenja i stavljanje AI u pošten okvir koji zahtijeva "tačan rezultat". Konačna odgovornost uvijek leži na istraživaču.
Zadatak aplikacije
Odaberite istraživačko pitanje i napišite kratak plan analize prije nego što pogledate podatke: primarna hipoteza, glavni model, primarna varijabla ishoda, unaprijed definirane podgrupe, strategija višestrukog poređenja. Zatim procijenite glavni model. Zatim uradite analizu osjetljivosti (različite kontrole, izuzetak uključen/isključen, različit oblik funkcije) i prikažite sve rezultate u jednoj tabeli. U jednom paragrafu procijenite koji koraci predstavljaju rizik od p-hakiranja i kako ih vaš pošten okvir ograničava.
kontrolna lista
- [ ] Napisao sam plan analize/master model prije nego što sam uronio u podatke.
- [ ] Označio sam istraživačke i potvrdne analize odvojeno; Nisam HARKING.
- [ ] Prijavio sam sve specifikacije koje sam isprobao; Nisam odabrala samo onu prelijepu.
- [ ] Podgrupe i transformacije sam definirao unaprijed, nisam ih skenirao nakon podataka.
- [ ] Pratio sam koliko sam testova uradio i primenio potrebnu korekciju.
- [ ] Koristio sam AI u kontekstu “pronađi istinu” umjesto “nađi je smislenom”; Ja sam preuzeo odgovornost.