Eenheid 7 / 11

p-hacking, HARKing en statistische integriteit: valkuilen in het tijdperk van kunstmatige intelligentie

Winst:

  • Begrijp dat p-hacking, HARKing, selectieve rapportage en de tuin van forking-paden valse bevindingen opleveren en zie hoe kunstmatige intelligentie deze vallen kan versnellen
  • Mogelijkheid om verdedigingen op te zetten zoals preregistratie, analyseplan, meervoudige vergelijkingsdiscipline en gevoeligheidsanalyse met ondersteuning voor kunstmatige intelligentie
  • Het kunnen internaliseren van het eerlijke verzoekontwerp dat de kunstmatige intelligentie in staat stelt verzoeken van het type 'vind het betekenisvolle resultaat' af te wijzen en waarbij de eindverantwoordelijkheid bij de onderzoeker ligt.

In de vorige unit hebben we gezien wat p-waarde is en wat niet. In deze unit zullen we naar een duisterder onderwerp kijken: de systematische vallen die de statistische integriteit bedreigen. De meeste hiervan zijn geen opzettelijk bedrog; Dit zijn verraderlijke mechanismen waar zelfs goedbedoelende onderzoekers in trappen zonder het te beseffen. En kunstmatige intelligentie (AI) maakt deze valkuilen eenvoudiger en sneller, omdat het mogelijk maakt om binnen enkele seconden tientallen analyses uit te voeren. Het doel van deze eenheid is om de discipline vast te stellen die AI zal transformeren van een ‘zinvolle resultatenzoekmachine’ in een eerlijke assistent.

Fundamentele valkuilen

p-hacking (p-waardejacht): Het probeert de analyse opnieuw op verschillende manieren totdat een significant resultaat (p<0,05) wordt verkregen. Variabelen toevoegen en verwijderen, substeekproeven selecteren, de definitie van uitschieters wijzigen, verschillende transformaties uitproberen, verschillende uitkomstvariabelen gebruiken, het verzamelen van gegevens stoppen wanneer het zinvol wordt... Elke poging geeft een nieuwe "kans"; Als je maar hard genoeg je best doet, zal een ervan zinvol blijken te zijn, ook al heeft het eigenlijk geen effect. Het resultaat: valse bevindingen die wel werden gepubliceerd, maar niet reproduceerbaar.

HARKing (Hypothetiseren nadat de resultaten bekend zijn): Een hypothese opstellen nadat je de resultaten hebt gezien en deze presenteren als "Ik heb het vanaf het begin zo voorspeld". Je kijkt naar de gegevens en vindt de meest opvallende relatie, en schrijft vervolgens het artikel alsof het bedoeld is om die hypothese te testen. Dit misleidt de lezer doordat de ontdekking op een bevestiging lijkt.

Selectieve rapportage (cherry-picking): alleen de ‘goede’ uit tientallen analyses rapporteren en de rest in stilte begraven. Dit staat ook wel bekend als het ‘dossierladeprobleem’: betekenisloze resultaten blijven in de lade achter, waardoor de literatuur systematisch vertekend raakt.

Tuin van splitsingspaden: de term van Andrew Gelman. Zelfs zonder een enkele opzettelijke p-hacking maakt de onderzoeker veel redelijke keuzes op basis van de gegevens (welke variabele, welke drempel, welke subgroep, welke transformatie). Deze onderzoeksvrijheidsgraden zijn zo talrijk dat je feitelijk de betekenisvolle kiest uit een veelheid aan analyses – zelfs zonder kwade bedoelingen. Het resultaat is opnieuw een stijgend aantal valse positieven.

Let op: de meeste van deze vallen zijn geen opzettelijke trucs. De som van ogenschijnlijk onschuldige stappen zoals "Ik heb net nog een paar modellen geprobeerd", "het was schoner toen ik de uitbijter verwijderde", "het effect is duidelijker in deze subgroep" kan een valse bevinding opleveren. Eerlijkheid is een kwestie van methode, niet van intentie.

Waarom vergroot AI deze vallen?

3 modellen met de hand uitproberen kost tijd; YZ produceert in enkele minuten 50 modelvarianten, 10 verschillende conversies, 8 subgroepen. Deze kracht is desastreus zonder een eerlijk plan: een verzoek als ‘vind een betekenisvolle relatie in deze data’ of ‘bouw een model dat deze hypothese ondersteunt’ verandert de AI direct in een p-hacking-engine. AI wil ook behulpzaam zijn; heeft de neiging een ‘betekenisvolle’ uitkomst te vinden die u tevreden zal stellen. Daarom is uw snelle ontwerp de eerste verdedigingslinie van eerlijkheid.

Verdediging: eerlijke gang van zaken

1. Pre-registratie: Dit betekent dat u uw hypothese, variabelen, model en tests schriftelijk vastlegt (eventueel op een platform met tijdstempel) voordat u de analyse uitvoert. Ontdekking is dus gescheiden van bevestiging; alles wat u daarna wijzigt, wordt getagd als "verkenner".

2. Analyseplan: Zelfs als u niet vooraf kunt opnemen, schrijf dan een analyseplan voordat u in de gegevens duikt: primaire hypothese, primaire uitkomstvariabele, hoofdmodel. Maak vanaf het begin het onderscheid tussen “hoofdanalyse” en “aanvullende/verkennende analyse” en handhaaf dit in het rapport.

3. Rapporteer alles: Verberg de modellen die u hebt geprobeerd niet. Laat in het gedeelte 'Gevoeligheidsanalyse' (robuustheidscontrole) zien hoe verschillende specificaties het resultaat veranderen. De bevinding is alleen sterk als deze stand houdt onder veel plausibele keuzes.

4. Meervoudige vergelijkingsdiscipline: Als je te veel tests hebt gedaan, corrigeer ze dan (unit 6). Beantwoord de vraag "Hoeveel tests heb ik gedaan?" eerlijk gezegd.

5. Gevoeligheidsanalyse: Herhaal uw belangrijkste bevinding met een ander monster, een andere controleset en een andere transformatie. Als het resultaat verandert, verberg het dan niet, maar rapporteer het.

Vergelijkingstabel: eerlijk versus valstrik

Toepassing

vorm van de val

Eerlijk gelijkwaardig

Modelselectie

Proberen totdat het zinvol is (p-hacking)

Vooraf gepland mastermodel

hypothese

Pas achteraf (HARKing)

Vooraf opgenomen, vóór data

Rapportage

Laat niet alleen de mooie zien

Alle specificaties + gevoeligheid

subgroep

Het kiezen van de meest opvallende

Vooraf gedefinieerd, corrigeerbaar

gegevensverzameling

Stop wanneer het zinvol is

vooraf bepaald monster

Vier kopieerbare aanwijzingen

1. Eerlijk claimkader:

Jouw rol: eerlijke statistiekassistent. Mijn doel is NIET om een ​​betekenisvol resultaat te vinden, maar om het juiste resultaat te vinden. REGELS: - Geef me GEEN "probeer modellen totdat het zinvol is" type suggesties, - vertel me als je meerdere specificaties voorstelt, ze moeten allemaal gerapporteerd worden, - waarschuw me voor stappen die tot p-hacking kunnen leiden. Help me eerst mijn hoofdmodel te verduidelijken, door ontdekking en bevestiging te scheiden.

2. Concept analyseplan:

Help me een voorlopig analyseplan voor een onderzoek op te stellen: primaire hypothese, primaire uitkomstvariabele, hoofdmodelspecificatie, vooraf gedefinieerde subgroepen, meervoudige vergelijkingsstrategie. Zet ‘verkennende’ en ‘bevestigende’ analyses in aparte kopjes. Herinner mij eraan dit in te vullen ZONDER naar de gegevens te kijken.

3. Gevoeligheidsanalyse:

Mijn belangrijkste bevinding is het schrijven van een gevoeligheidsanalysecode (R) voor Mijn doel is om te ZIEN hoe solide het resultaat is, NIET om de beste te kiezen; laat alle resultaten zien.

4. Zelfcontrole:

Ik zal mijn analyseproces uitleggen; Geef mij een checklist voor p-hacking / HARKing / selectieve rapportage en markeer welke van mijn stappen riskant zijn. Vraag me terug hoeveel modellen/tests ik heb geprobeerd en welke ik van plan ben te rapporteren.

Zwakke prompt/sterke prompt

Zwakke prompt:

Welke variabelen significante relaties vertonen in deze gegevens, vind het beste model.

Deze prompt is een directe p-hacking-instructie: de AI probeert tientallen combinaties en presenteert degene die 'het meest logisch is'. Het resultaat is vrijwel zeker een valse bevinding die niet kan worden gerepliceerd.

Krachtige prompt:

Jouw rol: eerlijke assistent. Het MAIN-model dat ik vooraf heb bepaald is: Y ~ X + bedieningselementen. Schrijf code die dit model voorspelt. Zoek NIET naar een ander "betekenisvoller" model. Stel ook een gevoeligheidsanalyse voor, zodat ik de robuustheid van het resultaat kan zien, maar weet dat ik ALLE resultaten zal rapporteren en niet de beste zal kiezen. Laat ik verkennende bevindingen niet als 'bevestigd' afschrijven.

Verschil: sterke wil repareert het hoofdmodel, verbiedt zoeken en vereist dat alle resultaten worden gerapporteerd.

drie minikoffers

Geval 1 – Jacht op subgroepen. Eén onderzoeker vond geen effect in de totale steekproef; Hij vroeg aan de AI "in welke subgroep is het significant?" YZ scande de combinaties van leeftijd, geslacht en regio en vond "p = 0,03 bij stedelijke vrouwen van 35-44 jaar". Het artikel was gebaseerd op deze subgroep. Zijn replicatie had geen effect: dit was het gevolg van toeval van tientallen subgroepen. Les: geselecteerde subgroep nadat gegevens HARKen, niet bevestigen.

Geval 2 — Conversiejacht. De relatie die op studentenniveau betekenisloos blijkt te zijn; probeerde het in log-, vierkantswortel-, vierkant- en lag-vormen; Hij vond p=0,048 in log-log-vorm en rapporteerde alleen dat. Gelukkig probeerde een van de vijf formulieren de drempel te overschrijden. De juiste manier was: de vorm vooraf selecteren met theorie en het resultaat van alle vormen laten zien in de gevoeligheidstabel. Les: selectieve berichtgeving levert valse betekenis op.

Casus 3 – Hoe eerlijk framen werkt. Eén team registreerde zich vooraf vóór de analyse: één primaire hypothese, één hoofdmodel, twee vooraf gedefinieerde subgroepen, Bonferroni-correctie. Het belangrijkste effect was niet significant, maar het team rapporteerde het eerlijk; De verkennende persoon markeerde één bevinding als ‘die in de toekomst getest moet worden’. Het onderzoek was reproduceerbaar en betrouwbaar. Les: eerlijke planning maakt zelfs de ‘mislukte’ uitkomst de moeite waard.

Veel voorkomende fouten

  • AI vertellen dat hij ‘betekenisvolle resultaten moet vinden’. Dit is regelrecht p-hacken; Plaats AI in een eerlijk kader en vraag om nauwkeurigheid, niet om resultaten.
  • Het presenteren van de ontdekking als bevestiging (HARKing). Het is misleidend om de hypothese die na de gegevens is opgesteld te schrijven als 'Ik heb het vanaf het begin voorspeld'; Benoem de verkennende bevinding.
  • Gewoon goede resultaten melden. Toon alle geteste specificaties; Het verbergen van sentimentanalyse brengt de integriteit in gevaar.
  • Subgroep-/conversiescreening. Het kiezen van de meest significante van tientallen subgroepen of transformaties levert valse bevindingen op; vooraf identificeren en oplossen.
  • Vergeten hoeveel tests je hebt gedaan. Houd het totaal aantal pogingen bij; Geen enkele p-waarde kan eerlijk worden geïnterpreteerd zonder dit getal te kennen.
Tip: Voordat u een bevinding opschrijft, moet u zich afvragen: "Hoeveel manieren heb ik in stilte geprobeerd totdat ik dit resultaat vond, en rapporteer ik ze allemaal?" Als een deel van de essays in de lade blijft liggen, ziet uw rapport er sterker uit dan het is.

Samengevat

p-hacking, HARKing, selectieve rapportage en de tuin van splitsingspaden; Velen zijn vallen die onbedoeld werken, maar valse, niet-reproduceerbare bevindingen opleveren. AI versnelt deze valkuilen omdat het tientallen analyses direct kan uitproberen; Verzoeken van het type “vind betekenisvolle resultaten” veranderen de AI in een p-hacking-engine. Verdediging; het scheiden van ontdekking van bevestiging met een preregistratie- en analyseplan, het rapporteren van alle specificaties en gevoeligheidsanalyses, het corrigeren van meerdere vergelijkingen en het plaatsen van AI in een eerlijk raamwerk dat het ‘juiste resultaat’ eist. De eindverantwoordelijkheid ligt altijd bij de onderzoeker.

Applicatie taak

Kies een onderzoeksvraag en schrijf een kort analyseplan voordat u naar de gegevens kijkt: primaire hypothese, hoofdmodel, primaire uitkomstvariabele, vooraf gedefinieerde subgroepen, meervoudige vergelijkingsstrategie. Schat vervolgens het hoofdmodel. Voer vervolgens een gevoeligheidsanalyse uit (verschillende controles, uitbijter inbegrepen/uitgesloten, andere functievorm) en toon alle resultaten in één tabel. Evalueer in één paragraaf welke stappen een risico op p-hacking vormen en hoe uw eerlijke raamwerk deze beperkt.

controlelijst

  • [ ] Ik schreef het analyseplan/mastermodel voordat ik in de data dook.
  • [ ] Ik heb verkennende en bevestigende analyses afzonderlijk gelabeld; Ik was niet aan het HARKen.
  • [ ] Ik heb alle specificaties gerapporteerd die ik heb geprobeerd; Ik heb niet alleen de mooie gekozen.
  • [ ] Ik heb de subgroepen en transformaties vooraf gedefinieerd, ik heb ze niet gescand na de gegevens.
  • [ ] Ik hield bij hoeveel tests ik had gedaan en paste de nodige correctie toe.
  • [ ] Ik gebruikte AI in de context van “vind de waarheid” in plaats van “vind het betekenisvol”; Ik nam de verantwoordelijkheid.