Vinster:
- Förstå att p-hacking, HARKing, selektiv rapportering och trädgården av gaffelstigar ger falska fynd och se hur artificiell intelligens kan påskynda dessa fällor
- Förmåga att etablera försvar såsom förhandsregistrering, analysplan, multipel jämförelsedisciplin och känslighetsanalys med stöd för artificiell intelligens
- Att kunna internalisera den ärliga förfrågningsdesignen som gör det möjligt för den artificiella intelligensen att avvisa förfrågningar av typen "hitta det meningsfulla resultatet" och att det slutliga ansvaret ligger hos forskaren.
I föregående enhet såg vi vad p-värde är och vad det inte är. I denna enhet kommer vi att titta på ett mörkare ämne, de systematiska fällorna som hotar statistisk integritet. De flesta av dessa är inte avsiktligt fusk; Det är lömska mekanismer som även välmenande forskare hamnar i utan att inse det. Och artificiell intelligens (AI) gör dessa fallgropar både enklare och snabbare, eftersom det gör det möjligt att köra dussintals analyser på några sekunder. Syftet med denna enhet är att etablera den disciplin som kommer att förvandla AI från en "meningsfull resultatsökningsmaskin" till en ärlig assistent.
Grundläggande fallgropar
p-hacking (p-värde jakt): Det är att pröva analysen igen på olika sätt tills ett signifikant resultat (p<0,05) erhålls. Lägga till och ta bort variabler, välja delprov, ändra definitionen av extremvärden, prova olika transformationer, använda olika utfallsvariabler, stoppa datainsamling när det blir meningsfullt... Varje försök ger en ny "chans"; Om du försöker tillräckligt hårt kommer en av dem att visa sig vara meningsfull, även om det faktiskt inte har någon effekt. Resultatet: falska fynd som publicerades men inte reproducerbara.
HARKing (hypotes efter att resultaten är kända): Gör en hypotes efter att ha sett resultaten och presenterat den som "Jag förutspådde det så här från början". Du tittar på data och hittar det mest slående sambandet, och skriver sedan uppsatsen som om den var utformad för att testa den hypotesen. Detta vilseleder läsaren genom att få upptäckten att verka som en bekräftelse.
Selektiv rapportering (cherry-picking): Rapporterar bara de "bra" från dussintals analyser och begraver i tysthet resten. Detta är också känt som "fillådans problem": meningslösa resultat ligger kvar i lådan, vilket gör litteraturen systematiskt partisk.
Gaffelstigarnas trädgård: Andrew Gelmans term. Även utan en enda avsiktlig p-hacking gör forskaren många rimliga val baserat på data (vilken variabel, vilken tröskel, vilken undergrupp, vilken transformation). Dessa undersökande frihetsgrader är så många att du på ett effektivt sätt väljer den meningsfulla bland en mängd analyser – även utan uppsåt. Resultatet är återigen en stigande falsk positiv ränta.
Varning: De flesta av dessa fällor är inte avsiktliga trick. Summan av till synes oskyldiga steg som "Jag har precis provat några fler modeller", "det var renare när jag tog bort avvikelsen", "effekten är tydligare i den här undergruppen" kan ge ett falskt fynd. Ärlighet är en fråga om metod, inte avsikt.
Varför förstorar AI dessa fällor?
Att prova 3 modeller för hand tar tid; YZ producerar 50 modellvarianter, 10 olika konverteringar, 8 undergrupper på några minuter. Denna kraft är katastrofal utan en ärlig plan: en begäran som "hitta en meningsfull relation i denna data" eller "bygg en modell som stöder denna hypotes" förvandlar AI direkt till en p-hackingmotor. AI vill också vara till hjälp; tenderar att hitta ett "meningsfullt" resultat som kommer att tillfredsställa dig. Det är därför din snabba design är ärlighetens första försvarslinje.
Försvar: rättvis verksamhet
1. Förhandsregistrering: Det innebär att du registrerar din hypotes, variabler, modell och tester skriftligt (eventuellt på en tidsstämplad plattform) innan du utför analysen. Således är upptäckten skild från bekräftelsen; allt du ändrar efteråt är taggat som "utforskare".
2. Analysplan: Även om du inte kan förregistrera, skriv en analysplan innan du dyker in i data: primär hypotes, primär utfallsvariabel, huvudmodell. Fastställ distinktionen mellan "huvudanalys" och "tilläggs-/utredande analys" från början och bibehåll den i rapporten.
3. Rapportera allt: Göm inte de modeller du har provat. I avsnittet "känslighetsanalys" (robusthetskontroll) visar du hur olika specifikationer förändrar resultatet. Fyndet är starkt bara om det håller för många rimliga val.
4. Multipel jämförelsedisciplin: Om du har gjort för många tester, korrigera dem (enhet 6). Svara på frågan "Hur många tester har jag gjort?" ärligt.
5. Känslighetsanalys: Upprepa ditt huvudresultat med ett annat prov, annan kontrolluppsättning och annan transformation. Om resultatet ändras, dölj det inte, rapportera det.
Jämförelsediagram: ärlig vs fälla
Ansökan
fällans form
Ärlig motsvarighet
Modellval
Försöker tills det är vettigt (p-hacking)
Förplanerad mastermodell
hypotes
Passande i efterhand (HARKING)
Förinspelad, före data
Rapportering
Visa inte bara de vackra
Alla specifikationer + känslighet
undergrupp
Att välja det mest slående
Fördefinierad, korrigerbar
datainsamling
Sluta när det är vettigt
förutbestämt prov
Fyra kopierbara uppmaningar
1. Ärligt ramverk för anspråk:
Din roll: ärlig statistikassistent. Mitt mål är INTE att hitta ett meningsfullt resultat, utan att hitta rätt resultat. REGLER:- Ge mig INTE "prova modeller tills det är vettigt"-förslag, - säg till mig om du föreslår flera specifikationer som alla måste rapporteras, - varna mig för eventuella steg som kan leda till p-hacking. Hjälp mig att klargöra min huvudmodell först, separera upptäckt från bekräftelse.
2. Utkast till analysplan:
Hjälp mig att utarbeta en preliminär analysplan för en studie: primär hypotes, primär utfallsvariabel, huvudmodellspecifikation, fördefinierade undergrupper, multipel jämförelsestrategi. Sätt "utredande" och "bekräftande" analyser i separata rubriker. Påminn mig om att fylla i detta UTAN ATT SE på uppgifterna.
3. Känslighetsanalys:
Mitt huvudsakliga fynd är att skriva känslighetsanalyskod (R) för Mitt mål är att SE hur solidt resultatet är, INTE att välja den bästa; visa alla resultat.
4. Egenkontroll:
Jag kommer att förklara min analysprocess; Ge mig en checklista för p-hacking / HARKing / selektiv rapportering och markera vilka av mina steg som är riskabla. Fråga mig tillbaka hur många modeller/tester jag har provat och vilka jag planerar att rapportera.
Svag prompt / Stark prompt
Svag uppmaning:
Vilka variabler som visar signifikanta samband i denna data, hitta den bästa modellen.
Denna prompt är en direkt p-hacking-instruktion: AI:n provar dussintals kombinationer och presenterar den som "gör mest meningsfullt." Resultatet är nästan säkert ett falskt fynd som inte kan replikeras.
Kraftfull uppmaning:
Din roll: ärlig assistent. HUVUDmodellen jag har förutbestämt är: Y ~ X + kontroller. Skriv kod som förutsäger denna modell. Leta INTE efter en annan "mer meningsfull" modell. Föreslå också en känslighetsanalys så att jag kan se robustheten i resultatet, men vet att jag kommer att rapportera ALLA resultat, inte välja det bästa. Låt mig inte skriva av några undersökande fynd som "bekräftade".
Skillnad: stark vilja fixar huvudmodellen, förbjuder sökning och kräver att alla resultat rapporteras.
tre minifodral
Fall 1 — Undergruppsjakt. En forskare fann ingen effekt i det totala urvalet; Han frågade AI: "i vilken undergrupp är det signifikant?" YZ skannade ålder, kön och regionkombinationer och fann "p = 0,03 i urbana kvinnor i åldern 35-44". Artikeln baserades på denna undergrupp. Hans replikering fann ingen effekt: detta var ett resultat av slumpen från dussintals undergrupper. Lektion: vald undergrupp efter att data HARKAR, inte bekräftar.
Fall 2 — Konverteringsjakt. Relationen som visar sig vara meningslös i en elevnivåform; provade det i log-, kvadratrot-, kvadrat- och lagformer; Han hittade p=0,048 i log-log form och rapporterade bara det. Lyckligtvis passerade en av de 5 formulären som prövats tröskeln. Det korrekta sättet var: att förvälja formuläret med teori och visa resultatet av alla formulär i känslighetstabellen. Lärdom: selektiv rapportering ger falsk betydelse.
Fall 3 – Hur ärlig inramning fungerar. Ett team förregistrerades före analys: enskild primär hypotes, enkel huvudmodell, två fördefinierade undergrupper, Bonferroni-korrigering. Den huvudsakliga effekten var inte signifikant, men teamet rapporterade det ärligt; Den utforskande individen flaggade ett fynd som "behöver testas i framtiden." Studien var reproducerbar och tillförlitlig. Lektion: ärlig planering gör till och med "misslyckande"-resultatet värt besväret.
Vanliga misstag
- Att säga till AI att "hitta meningsfulla resultat". Detta är direkt p-hacking; Sätt AI i en ärlig ram och be om noggrannhet, inte resultat.
- Presenterar upptäckten som bekräftelse (HARKing). Det är missvisande att skriva hypotesen etablerad efter data som "jag förutspådde det från början"; Märk det utforskande fyndet.
- Bara rapportera bra resultat. Visa alla testade specifikationer; Att dölja sentimentanalys äventyrar integriteten.
- Undergrupp/konverteringsscreening. Att välja den mest betydande av dussintals undergrupper eller transformationer ger falska fynd; identifiera och fixa i förväg.
- Att glömma hur många tester du har gjort. Håll reda på det totala antalet försök; Inget p-värde kan tolkas ärligt utan att känna till detta tal.
Tips: Innan du skriver ner ett fynd, fråga dig själv: "Hur många sätt har jag försökt i tysthet tills jag hittade det här resultatet, och rapporterar jag dem alla?" Om några av uppsatserna ligger kvar i byrålådan ser din rapport starkare ut än den är.
Sammanfattningsvis
p-hacking, HARKing, selektiv rapportering och trädgården av gaffelstigar; Många är fällor som fungerar oavsiktligt men ger falska, oreproducerbara fynd. AI accelererar dessa fallgropar eftersom den kan prova dussintals analyser direkt; Förfrågningar av typen "hitta meningsfulla resultat" gör AI till en p-hackingmotor. Försvar; skilja upptäckt från bekräftelse med en förregistrering och analysplan, rapportera alla specifikationer och känslighetsanalyser, korrigera flera jämförelser och sätta AI i ett ärligt ramverk som kräver det "korrekta resultatet". Det slutliga ansvaret ligger alltid på forskaren.
Applikationsuppgift
Välj en forskningsfråga och skriv en kort analysplan innan du tittar på data: primär hypotes, huvudmodell, primär utfallsvariabel, fördefinierade undergrupper, multipel jämförelsestrategi. Beräkna sedan huvudmodellen. Gör sedan en känslighetsanalys (olika kontroller, outlier inkluderad/exkluderad, annan funktionsform) och visa alla resultat i en enda tabell. I ett stycke, utvärdera vilka steg som utgör en risk för p-hacking och hur ditt ärliga ramverk begränsar dem.
checklista
- [ ] Jag skrev analysplanen/mastermodellen innan jag dök ner i datan.
- [ ] Jag märkte explorativa och bekräftande analyser separat; Jag HARKade inte.
- [ ] Jag har rapporterat alla specifikationer jag har provat; Jag valde inte bara den vackra.
- [ ] Jag definierade undergrupperna och transformationerna i förväg, jag skannade dem inte efter data.
- [ ] Jag höll reda på hur många tester jag hade kört och tillämpade den nödvändiga korrigeringen.
- [ ] Jag använde AI i sammanhanget "hitta sanningen" snarare än "finna det meningsfullt"; Jag tog ansvar.