Enhet 7 / 11

p-hacking, HARKing og statistisk integritet: fallgruver i en tidsalder av kunstig intelligens

Gevinster:

  • Forstå at p-hacking, HARKing, selektiv rapportering og hagen med gaffelstier produserer falske funn og se hvordan kunstig intelligens kan akselerere disse fellene
  • Evne til å etablere forsvar som forhåndsregistrering, analyseplan, multippel sammenligningsdisiplin og sensitivitetsanalyse med støtte for kunstig intelligens
  • Å kunne internalisere det ærlige forespørselsdesignet som vil gjøre det mulig for den kunstige intelligensen å avvise forespørsler av typen "finn det meningsfulle resultatet", og at det endelige ansvaret ligger hos forskeren.

I forrige enhet så vi hva p-verdi er og hva den ikke er. I denne enheten skal vi se på et mørkere tema, de systematiske fellene som truer statistisk integritet. De fleste av disse er ikke forsettlig juks; Dette er lumske mekanismer som selv velmenende forskere faller inn i uten å være klar over det. Og kunstig intelligens (AI) gjør disse fallgruvene både enklere og raskere, siden den gjør det mulig å kjøre dusinvis av analyser på sekunder. Målet med denne enheten er å etablere disiplinen som vil forvandle AI fra en "meningsfull resultatsøkende maskin" til en ærlig assistent.

Grunnleggende fallgruver

p-hacking (p-verdijakt): Det er å prøve analysen på nytt på forskjellige måter inntil et signifikant resultat (p<0,05) er oppnådd. Legge til og fjerne variabler, velge delprøver, endre definisjonen av uteliggere, prøve forskjellige transformasjoner, bruke forskjellige utfallsvariabler, stoppe datainnsamlingen når det blir meningsfullt... Hvert forsøk gir en ny "sjanse"; Hvis du prøver hardt nok, vil en av dem vise seg å være meningsfull, selv om det faktisk ikke har noen effekt. Resultatet: falske funn som ble publisert, men ikke reproduserbare.

HARKing (hypotesering etter at resultatene er kjent): Lag en hypotese etter å ha sett resultatene og presentert den som "Jeg spådde det slik fra begynnelsen". Du ser på dataene og finner det mest slående forholdet, og skriver deretter papiret som om det var laget for å teste den hypotesen. Dette villeder leseren ved å få funnet til å virke som en bekreftelse.

Selektiv rapportering (cherry-picking): Rapporterer bare de "gode" fra dusinvis av analyser og begraver resten i stillhet. Dette er også kjent som "filskuffproblemet": meningsløse resultater forblir i skuffen, noe som gjør litteraturen systematisk partisk.

Hage med gaffelstier: Andrew Gelmans begrep. Selv uten en eneste tilsiktet p-hacking, gjør forskeren mange fornuftige valg basert på dataene (hvilken variabel, hvilken terskel, hvilken undergruppe, hvilken transformasjon). Disse undersøkende frihetsgradene er så mange at du effektivt velger den meningsfulle fra en rekke analyser – selv uten dårlige hensikter. Resultatet er igjen en stigende falsk positiv rate.

Forsiktig: De fleste av disse fellene er ikke bevisste triks. Summen av tilsynelatende uskyldige trinn som "Jeg prøvde akkurat noen flere modeller", "det var renere da jeg fjernet utstikkeren", "effekten er tydeligere i denne undergruppen" kan gi et falskt funn. Ærlighet er et spørsmål om metode, ikke intensjon.

Hvorfor forstørrer AI disse fellene?

Å prøve 3 modeller for hånd tar tid; YZ produserer 50 modellvarianter, 10 forskjellige konverteringer, 8 undergrupper på minutter. Denne kraften er katastrofal uten en ærlig plan: en forespørsel som "finn et meningsfullt forhold i disse dataene" eller "bygg en modell som støtter denne hypotesen" gjør AI direkte til en p-hacking-motor. AI ønsker også å være til hjelp; har en tendens til å finne et "meningsfullt" resultat som vil tilfredsstille deg. Det er derfor din raske design er ærlighetens første forsvarslinje.

Forsvar: rettferdig forretningsgang

1. Forhåndsregistrering: Det betyr å registrere hypotese, variabler, modell og tester skriftlig (eventuelt på en tidsstemplet plattform) før du utfører analysen. Dermed skilles oppdagelse fra bekreftelse; alt du endrer etterpå er merket som "utforsker".

2. Analyseplan: Selv om du ikke kan forhåndsregistrere, skriv en analyseplan før du dykker ned i dataene: primær hypotese, primær utfallsvariabel, hovedmodell. Etablere skillet mellom «hovedanalyse» og «tilleggs-/utforskende analyse» fra begynnelsen og opprettholde det i rapporten.

3. Rapporter alt: Ikke skjul modellene du har prøvd. I avsnittet "sensitivitetsanalyse" (robusthetssjekk) viser du hvordan ulike spesifikasjoner endrer resultatet. Funnet er sterkt bare hvis det holder seg under mange plausible valg.

4. Multiple sammenligningsdisiplin: Hvis du har gjort for mange tester, korriger dem (enhet 6). Svar på spørsmålet "Hvor mange tester har jeg gjort?" ærlig talt.

5. Sensitivitetsanalyse: Gjenta hovedfunnet med en annen prøve, et annet kontrollsett og en annen transformasjon. Hvis resultatet endres, ikke skjul det, rapporter det.

Sammenligningsdiagram: ærlig vs. felle

Søknad

felleform

Ærlig ekvivalent

Modellvalg

Prøver til det gir mening (p-hacking)

Forhåndsplanlagt mastermodell

hypotese

Passende etter faktum (HARKing)

Forhåndsinnspilt, før data

Rapportering

Ikke bare vis de vakre

Alle spesifikasjoner + følsomhet

undergruppe

Å velge det mest slående

Forhåndsdefinert, korrigerbar

datainnsamling

Stopp når det gir mening

forhåndsbestemt prøve

Fire kopierbare spørsmål

1. Ærlig kravramme:

Din rolle: ærlig statistikkassistent. Målet mitt er IKKE å finne et meningsfylt resultat, men å finne det riktige resultatet. REGLER:- IKKE gi meg forslag av typen "prøv modeller til det gir mening", - fortell meg hvis du foreslår flere spesifikasjoner som alle må rapporteres, - advar meg om trinn som kan føre til p-hacking. Hjelp meg med å avklare hovedmodellen min først, skille oppdagelse fra bekreftelse.

2. Utkast til analyseplan:

Hjelp meg med å utarbeide en foreløpig analyseplan for en studie: primær hypotese, primær utfallsvariabel, hovedmodellspesifikasjon, forhåndsdefinerte undergrupper, strategi for flere sammenligninger. Sett «utforskende» og «bekreftende» analyser i egne overskrifter. Minn meg på å fylle ut dette UTEN Å SE på dataene.

3. Sensitivitetsanalyse:

Mitt hovedfunn er å skrive sensitivitetsanalysekode (R) for Mitt mål er å SE hvor solid resultatet er, IKKE å velge den beste; vis alle resultater.

4. Egenkontroll:

Jeg vil forklare min analyseprosess; Gi meg en sjekkliste for p-hacking / HARKing / selektiv rapportering og merk hvilke av trinnene mine som er risikabelt. Spør meg tilbake hvor mange modeller/tester jeg har prøvd og hvilke jeg planlegger å rapportere.

Svak forespørsel / Sterk forespørsel

Svak melding:

Hvilke variabler som viser signifikante sammenhenger i disse dataene, finn den beste modellen.

Denne forespørselen er en direkte p-hacking-instruksjon: AI prøver dusinvis av kombinasjoner og presenterer den som "gir mest mening." Resultatet er nesten helt sikkert et falskt funn som ikke kan replikeres.

Kraftig ledetekst:

Din rolle: ærlig assistent. HOVEDmodellen jeg har forhåndsbestemt er: Y ~ X + kontroller. Skriv kode som forutsier denne modellen. IKKE se etter en annen "mer meningsfull" modell. Foreslå også en sensitivitetsanalyse slik at jeg kan se robustheten til resultatet, men vet at jeg vil rapportere ALLE resultater, ikke velge den beste. Ikke la meg avskrive noen utforskende funn som "bekreftet".

Forskjell: sterk vilje fikser hovedmodellen, forbyr søking og krever at alle resultater rapporteres.

tre minisaker

Sak 1 — Undergruppejakt. En forsker fant ingen effekt i det samlede utvalget; Han spurte AI "i hvilken undergruppe er det viktig?" YZ skannet alder, kjønn og regionkombinasjoner og fant "p = 0,03 hos urbane kvinner i alderen 35-44". Artikkelen var basert på denne undergruppen. Replikeringen hans fant ingen effekt: dette var et resultat av tilfeldigheter fra dusinvis av undergrupper. Leksjon: valgt undergruppe etter at data har HARK, bekrefter ikke.

Sak 2 — Konverteringsjakt. Forholdet som viser seg å være meningsløst i en form på elevnivå; prøvd det i logg-, kvadratrot-, kvadrat- og lag-former; Han fant p=0,048 i logg-loggform og rapporterte bare det. Heldigvis gikk en av de 5 skjemaene som ble prøvd over terskelen. Den riktige måten var: å forhåndsvelge skjemaet med teori og vise resultatet av alle skjemaene i sensitivitetstabellen. Leksjon: selektiv rapportering gir falsk betydning.

Case 3 – Hvordan ærlig innramming fungerer. Ett team forhåndsregistrert før analyse: enkelt primær hypotese, enkelt hovedmodell, to forhåndsdefinerte undergrupper, Bonferroni-korreksjon. Hovedeffekten var ikke signifikant, men teamet rapporterte det ærlig; Den utforskende personen flagget et funn som "trenger å bli testet i fremtiden." Studien var reproduserbar og pålitelig. Leksjon: ærlig planlegging gjør selv "mislykket"-resultatet verdt.

Vanlige feil

  • Å fortelle AI å "finne meningsfulle resultater". Dette er rett og slett p-hacking; Sett AI i en ærlig ramme, be om nøyaktighet, ikke resultater.
  • Presenterer funnet som bekreftelse (HARKing). Det er misvisende å skrive hypotesen etablert etter dataene som "Jeg spådde det fra begynnelsen"; Merk det utforskende funnet.
  • Bare rapporterer gode resultater. Vis alle testede spesifikasjoner; Å skjule sentimentanalyse kompromitterer integriteten.
  • Undergruppe/konverteringsscreening. Å velge den mest betydningsfulle av dusinvis av undergrupper eller transformasjoner produserer falske funn; identifisere og fikse på forhånd.
  • Glemte hvor mange tester du har tatt. Hold styr på det totale antallet forsøk; Ingen p-verdi kan tolkes ærlig uten å kjenne til dette tallet.
Tips: Før du skriver ned et funn, spør deg selv: "Hvor mange måter har jeg i stillhet prøvd før jeg fant dette resultatet, og rapporterer jeg dem alle?" Hvis noen av essayene blir liggende i skuffen, ser rapporten sterkere ut enn den er.

Oppsummert

p-hacking, HARKing, selektiv rapportering og hagen med gaffelstier; Mange er feller som opererer utilsiktet, men som produserer falske, ikke-reproduserbare funn. AI akselererer disse fallgruvene fordi den kan prøve dusinvis av analyser umiddelbart; Forespørsler av typen "finn meningsfulle resultater" gjør AI til en p-hacking-motor. Forsvar; skille oppdagelse fra bekreftelse med en forhåndsregistrering og analyseplan, rapportere alle spesifikasjoner og sensitivitetsanalyser, korrigere flere sammenligninger og sette AI i et ærlig rammeverk som krever "riktig resultat". Det endelige ansvaret ligger alltid hos forskeren.

Søknadsoppgave

Velg et forskningsspørsmål og skriv en kort analyseplan før du ser på dataene: primær hypotese, hovedmodell, primær utfallsvariabel, forhåndsdefinerte undergrupper, strategi for flere sammenligninger. Anslå deretter hovedmodellen. Gjør deretter en sensitivitetsanalyse (ulike kontroller, avvik inkludert/ekskludert, annen funksjonsform) og vis alle resultatene i en enkelt tabell. I ett avsnitt, evaluer hvilke trinn som utgjør en risiko for p-hacking og hvordan ditt ærlige rammeverk begrenser dem.

sjekkliste

  • [ ] Jeg skrev analyseplanen/mastermodellen før jeg dykket ned i dataene.
  • [ ] Jeg merket utforskende og bekreftende analyser separat; Jeg HARKET ikke.
  • [ ] Jeg har rapportert alle spesifikasjonene jeg har prøvd; Jeg valgte ikke bare den vakre.
  • [ ] Jeg definerte undergruppene og transformasjonene på forhånd, jeg skannet dem ikke etter dataene.
  • [ ] Jeg holdt styr på hvor mange tester jeg hadde kjørt og påførte nødvendig korreksjon.
  • [ ] Jeg brukte AI i sammenheng med "finn sannheten" i stedet for "finn den meningsfylt"; Jeg tok ansvar.