Enhed 7 / 11

p-hacking, HARKing og statistisk integritet: faldgruber i en tidsalder af kunstig intelligens

Gevinster:

  • Forstå, at p-hacking, HARKing, selektiv rapportering og gaffelstiernes have producerer falske fund, og se, hvordan kunstig intelligens kan fremskynde disse fælder
  • Evne til at etablere forsvar såsom forhåndsregistrering, analyseplan, multipel sammenligningsdisciplin og følsomhedsanalyse med støtte til kunstig intelligens
  • At være i stand til at internalisere det ærlige anmodningsdesign, der vil gøre det muligt for den kunstige intelligens at afvise 'find det meningsfulde resultat' type anmodninger, og at det endelige ansvar ligger hos forskeren.

I den forrige enhed så vi, hvad p-værdi er, og hvad den ikke er. I denne enhed vil vi se på et mørkere emne, de systematiske fælder, der truer statistisk integritet. De fleste af disse er ikke bevidst snyd; Det er lumske mekanismer, som selv velmenende forskere falder ind i uden at være klar over det. Og kunstig intelligens (AI) gør disse faldgruber både nemmere og hurtigere, da det gør det muligt at køre snesevis af analyser på få sekunder. Målet med denne enhed er at etablere den disciplin, der vil forvandle AI fra en "meningsfuld resultatfindingsmaskine" til en ærlig assistent.

Grundlæggende faldgruber

p-hacking (p-værdi jagt): Det er at prøve analysen igen på forskellige måder, indtil et signifikant resultat (p<0,05) er opnået. Tilføjelse og fjernelse af variabler, udvælgelse af understikprøver, ændring af definitionen af ​​outliers, afprøvning af forskellige transformationer, brug af forskellige udfaldsvariable, standsning af dataindsamling, når det bliver meningsfuldt... Hvert forsøg giver en ny "chance"; Hvis du prøver hårdt nok, vil en af ​​dem vise sig at være meningsfuld, selvom det faktisk ikke har nogen effekt. Resultatet: falske fund, der blev offentliggjort, men ikke reproducerbare.

HARKing (hypotesering efter at resultaterne er kendt): Lav en hypotese efter at have set resultaterne og præsenteret den som "Jeg forudsagde det sådan fra begyndelsen". Du ser på dataene og finder den mest slående sammenhæng, og skriv derefter papiret, som om det var designet til at teste den hypotese. Dette vildleder læseren ved at få opdagelsen til at virke som en bekræftelse.

Selektiv rapportering (cherry-picking): Rapporterer kun de "gode" fra snesevis af analyser og begraver stille resten. Dette er også kendt som "filskuffeproblemet": meningsløse resultater forbliver i skuffen, hvilket gør litteraturen systematisk partisk.

Gaffelstiernes have: Andrew Gelmans udtryk. Selv uden en eneste bevidst p-hacking træffer forskeren mange rimelige valg baseret på dataene (hvilken variabel, hvilken tærskel, hvilken undergruppe, hvilken transformation). Disse undersøgende frihedsgrader er så talrige, at du effektivt vælger den meningsfulde ud fra en lang række analyser – selv uden nogen dårlige hensigter. Resultatet er igen en stigende falsk positiv rate.

Forsigtig: De fleste af disse fælder er ikke bevidste tricks. Summen af ​​tilsyneladende uskyldige trin som "jeg har lige prøvet et par modeller mere", "det var renere, da jeg fjernede afvigeren", "effekten er tydeligere i denne undergruppe" kan give et falsk fund. Ærlighed er et spørgsmål om metode, ikke intention.

Hvorfor forstørrer AI disse fælder?

At prøve 3 modeller i hånden tager tid; YZ producerer 50 modelvarianter, 10 forskellige konverteringer, 8 undergrupper på få minutter. Denne magt er katastrofal uden en ærlig plan: en anmodning som "find et meningsfuldt forhold i disse data" eller "byg en model, der understøtter denne hypotese" gør AI direkte til en p-hacking-motor. AI ønsker også at være hjælpsom; har tendens til at finde et "meningsfuldt" resultat, der vil tilfredsstille dig. Derfor er dit hurtige design ærlighedens første forsvarslinje.

Forsvar: fair forretningsgang

1. Forhåndsregistrering: Det betyder, at du skriver din hypotese, variabler, model og tests skriftligt (evt. på en tidsstemplet platform), inden du udfører analysen. Således er opdagelse adskilt fra bekræftelse; alt, hvad du ændrer bagefter, er tagget som "udforsker".

2. Analyseplan: Selvom du ikke kan forhåndsregistrere, så skriv en analyseplan, før du dykker ned i dataene: primær hypotese, primær udfaldsvariabel, hovedmodel. Etabler sondringen mellem "hovedanalyse" og "supplerende/udforskende analyse" fra begyndelsen og fasthold den i rapporten.

3. Rapporter alt: Skjul ikke de modeller, du har prøvet. Vis i afsnittet "følsomhedsanalyse" (robusthedstjek) hvordan forskellige specifikationer ændrer resultatet. Fundet er kun stærkt, hvis det holder under mange plausible valg.

4. Multipel sammenligningsdisciplin: Hvis du har lavet for mange tests, skal du rette dem (enhed 6). Besvar spørgsmålet "Hvor mange tests har jeg lavet?" ærligt talt.

5. Følsomhedsanalyse: Gentag dit hovedresultat med en anden prøve, et andet kontrolsæt og en anden transformation. Hvis resultatet ændres, skal du ikke skjule det, men rapportere det.

Sammenligningsskema: ærlig vs. fælde

Ansøgning

fældeform

Ærlig ækvivalent

Modelvalg

Prøver indtil det giver mening (p-hacking)

Forud planlagt mastermodel

hypotese

Tilpas efter kendsgerningen (HARKing)

Forudindspillet før data

Indberetning

Vis ikke kun de smukke

Alle specifikationer + følsomhed

undergruppe

At vælge det mest slående

Foruddefineret, korrigerbar

dataindsamling

Stop når det giver mening

forudbestemt prøve

Fire kopierbare prompter

1. Ærlig kravramme:

Din rolle: ærlig statistikassistent. Mit mål er IKKE at finde et meningsfuldt resultat, men at finde det rigtige resultat. REGLER:- Giv mig IKKE forslag af typen "prøv modeller, indtil det giver mening", - fortæl mig, hvis du foreslår flere specifikationer, de skal alle rapporteres, - advar mig om trin, der kan føre til p-hacking. Hjælp mig med at afklare min hovedmodel først, adskil opdagelse fra bekræftelse.

2. Udkast til analyseplan:

Hjælp mig med at udarbejde en foreløbig analyseplan for en undersøgelse: primær hypotese, primær resultatvariabel, hovedmodelspecifikation, foruddefinerede undergrupper, multipel sammenligningsstrategi. Sæt "udforskende" og "bekræftende" analyser i separate overskrifter. Mind mig om at udfylde dette UDEN AT KIGGE på dataene.

3. Følsomhedsanalyse:

Mit hovedfund er at skrive følsomhedsanalysekode (R) for Mit mål er at SE hvor solidt resultatet er, IKKE at vælge den bedste; vise alle resultater.

4. Egenkontrol:

Jeg vil forklare min analyseproces; Giv mig en tjekliste til p-hacking / HARKing / selektiv rapportering og marker hvilke af mine trin der er risikable. Spørg mig tilbage, hvor mange modeller/tests jeg har prøvet, og hvilke jeg planlægger at rapportere.

Svag prompt / Stærk prompt

Svag prompt:

Hvilke variable viser signifikante sammenhænge i disse data, find den bedste model.

Denne prompt er en direkte p-hacking-instruktion: AI'en prøver dusinvis af kombinationer og præsenterer den, der "giver mest mening." Resultatet er næsten helt sikkert et falsk fund, som ikke kan gentages.

Kraftig prompt:

Din rolle: ærlig assistent. HOVEDmodellen, jeg har forudbestemt, er: Y ~ X + kontroller. Skriv kode, der forudsiger denne model. Kig IKKE efter en anden "mere meningsfuld" model. Foreslå også en følsomhedsanalyse, så jeg kan se robustheden af ​​resultatet, men ved, at jeg vil rapportere ALLE resultater, ikke vælge den bedste. Lad mig ikke afskrive eventuelle sonderende resultater som 'bekræftede'.

Forskel: stærk vilje løser hovedmodellen, forbyder søgning og kræver, at alle resultater rapporteres.

tre minisager

Sag 1 — Undergruppejagt. En forsker fandt ingen effekt i den samlede prøve; Han spurgte AI "i hvilken undergruppe er det signifikant?" YZ scannede kombinationerne af alder, køn og region og fandt "p = 0,03 hos kvinder i byerne i alderen 35-44". Artiklen var baseret på denne undergruppe. Hans replikation fandt ingen effekt: dette var et resultat af tilfældigheder fra snesevis af undergrupper. Lektion: valgt undergruppe efter data er HARKing, ikke bekræftende.

Sag 2 — Konverteringsjagt. Det forhold, der viser sig at være meningsløst i en elevniveauform; prøvet det i log, kvadratrod, kvadrat og lag former; Han fandt p=0,048 i log-log form og rapporterede kun det. Heldigvis krydsede en af ​​de 5 forsøgsformer tærsklen. Den korrekte måde var: at forhåndsvælge formen med teori og vise resultatet af alle former i følsomhedstabellen. Lektion: Selektiv rapportering giver falsk betydning.

Case 3 – Sådan fungerer ærlig indramning. Et hold præregistreret før analyse: enkelt primær hypotese, enkelt hovedmodel, to foruddefinerede undergrupper, Bonferroni korrektion. Hovedeffekten var ikke signifikant, men holdet rapporterede det ærligt; Den undersøgende person markerede et fund som "behov for at blive testet i fremtiden." Undersøgelsen var reproducerbar og pålidelig. Lektion: Ærlig planlægning gør selv det "mislykkede" resultat umagen værd.

Almindelige fejl

  • At fortælle AI at "finde meningsfulde resultater". Dette er ligefrem p-hacking; Sæt AI i en ærlig ramme, og bed om nøjagtighed, ikke resultater.
  • Præsenterer opdagelsen som bekræftelse (HARKing). Det er misvisende at skrive hypotesen etableret efter dataene som "Jeg forudsagde det fra begyndelsen"; Mærk det sonderende fund.
  • Bare rapporter om gode resultater. Vis alle testede specifikationer; At skjule sentimentanalyse kompromitterer integriteten.
  • Undergruppe/konverteringsscreening. At vælge den mest betydningsfulde af snesevis af undergrupper eller transformationer producerer falske fund; identificere og rette på forhånd.
  • Glemmer hvor mange test du har lavet. Hold styr på det samlede antal forsøg; Ingen p-værdi kan tolkes ærligt uden at kende dette tal.
Tip: Inden du skriver en konstatering ned, så spørg dig selv: "Hvor mange måder har jeg prøvet, indtil jeg fandt dette resultat, og rapporterer jeg dem alle?" Hvis nogle af essays bliver i skuffen, ser din rapport stærkere ud, end den er.

Sammenfattende

p-hacking, HARKing, selektiv rapportering og haven med gaffelstier; Mange er fælder, der virker utilsigtet, men som producerer falske, ikke-reproducerbare fund. AI accelererer disse faldgruber, fordi den kan prøve dusinvis af analyser med det samme; Anmodninger af typen "find meningsfulde resultater" gør AI til en p-hacking-motor. Forsvar; adskille opdagelse fra bekræftelse med en forhåndsregistrering og analyseplan, rapportere alle specifikationer og følsomhedsanalyser, korrigere flere sammenligninger og sætte AI i en ærlig ramme, der kræver det "korrekte resultat". Det endelige ansvar ligger altid hos forskeren.

Ansøgningsopgave

Vælg et forskningsspørgsmål og skriv en kort analyseplan, før du ser på dataene: primær hypotese, hovedmodel, primær udfaldsvariabel, foruddefinerede undergrupper, multipel sammenligningsstrategi. Anslå derefter hovedmodellen. Lav derefter en følsomhedsanalyse (forskellige kontroller, outlier inkluderet/udelukket, forskellig funktionsform) og vis alle resultaterne i en enkelt tabel. I et afsnit skal du evaluere, hvilke trin der udgør en risiko for p-hacking, og hvordan dine ærlige rammer begrænser dem.

tjekliste

  • [ ] Jeg skrev analyseplanen/mastermodellen, inden jeg dykkede ned i dataene.
  • [ ] Jeg mærkede eksplorative og bekræftende analyser separat; Jeg HARKede ikke.
  • [ ] Jeg har rapporteret alle de specifikationer, jeg har prøvet; Jeg valgte ikke bare den smukke.
  • [ ] Jeg definerede undergrupperne og transformationerne på forhånd, jeg scannede dem ikke efter dataene.
  • [ ] Jeg holdt styr på, hvor mange test jeg havde kørt og anvendte den nødvendige korrektion.
  • [ ] Jeg brugte AI i sammenhæng med "find sandheden" i stedet for "find den meningsfuld"; Jeg tog ansvar.