Egység 7 / 11

p-hacking, HARKing és statisztikai integritás: buktatók a mesterséges intelligencia korában

Nyereség:

  • Értsd meg, hogy a p-hackelés, a HARK, a szelektív jelentések és az elágazó utak kertje hamis megállapításokat eredményez, és nézd meg, hogyan tudja a mesterséges intelligencia felgyorsítani ezeket a csapdákat
  • Képes védekezni, mint például előzetes regisztráció, elemzési terv, többszörös összehasonlítási fegyelem és érzékenységi elemzés mesterséges intelligencia támogatással
  • Az őszinte kérés-tervezés belsővé tétele, amely lehetővé teszi a mesterséges intelligencia számára, hogy elutasítsa a „találd meg az értelmes eredményt” típusú kéréseket, és a végső felelősség a kutatóé.

Az előző egységben láttuk, hogy mi a p-érték és mi nem. Ebben az egységben egy sötétebb témát vizsgálunk meg, a statisztikai integritást veszélyeztető szisztematikus csapdákat. Ezek többsége nem szándékos csalás; Ezek alattomos mechanizmusok, amelyekbe még a jó szándékú kutatók is belebuknak anélkül, hogy észrevennének. A mesterséges intelligencia (AI) pedig egyszerűbbé és gyorsabbá teszi ezeket a buktatókat, mivel több tucat elemzést tesz lehetővé másodpercek alatt. Ennek az egységnek az a célja, hogy létrehozza azt a tudományágat, amely az AI-t "értelmes eredménykereső gépből" becsületes asszisztenssé alakítja.

Alapvető buktatók

p-hacking (p-érték vadászat): Különböző módokon próbálja újra az elemzést, amíg szignifikáns eredményt (p<0,05) nem kap. Változók hozzáadása és eltávolítása, részminták kiválasztása, a kiugró értékek definíciójának megváltoztatása, különböző transzformációk kipróbálása, különböző kimeneti változók használata, az adatgyűjtés leállítása, amikor értelmessé válik... Minden próbálkozás új "esélyt" ad; Ha elég keményen próbálkozol, az egyik értelmesnek bizonyul, még akkor is, ha valójában nincs hatása. Az eredmény: hamis eredmények, amelyeket publikáltak, de nem reprodukálhatók.

HARKing (hipotézis, miután az eredmények ismertek): hipotézis felállítása az eredmények láttán, és úgy prezentálása, hogy "a kezdetektől így jósoltam". Megnézi az adatokat, és megtalálja a legszembetűnőbb összefüggést, majd úgy írja meg a dolgozatot, mintha az a hipotézis tesztelésére készült volna. Ez félrevezeti az olvasót azáltal, hogy a felfedezés megerősítésnek tűnik.

Szelektív jelentéskészítés (cseresznyeszedés): több tucat elemzésből csak a "jó" jelentését, a többit pedig csendben eltemetni. Ezt "fájlfiók-problémának" is nevezik: az értelmetlen eredmények a fiókban maradnak, ami szisztematikusan elfogulttá teszi a szakirodalmat.

Elágazó utak kertje: Andrew Gelman kifejezése. Egyetlen szándékos p-hackelés nélkül is sok ésszerű választást hoz a kutató az adatok alapján (melyik változó, melyik küszöb, melyik alcsoport, melyik transzformáció). Ezek a nyomozási szabadságfok olyan sokrétű, hogy Ön hatékonyan választja ki az értelmeset az elemzések sokaságából – még rossz szándék nélkül is. Az eredmény ismét egy emelkedő téves pozitív arány.

Figyelem: A legtöbb ilyen csapda nem szándékos trükk. Az olyan ártatlannak tűnő lépések összege, mint például: „Épp most próbáltam még néhány modellt”, „tisztább volt, amikor eltávolítottam a kiugró értéket”, „ebben az alcsoportban a hatás egyértelműbb” téves megállapítást eredményezhet. Az őszinteség módszer kérdése, nem szándék.

Miért növeli az AI ezeket a csapdákat?

3 modell kézi kipróbálása időt vesz igénybe; Az YZ 50 modellváltozatot, 10 különböző átalakítást, 8 alcsoportot gyárt percek alatt. Ez az erő őszinte terv nélkül katasztrofális: egy olyan kérés, mint „találjon értelmes kapcsolatot ezekben az adatokban” vagy „építsen egy modellt, amely alátámasztja ezt a hipotézist”, az AI-t közvetlenül p-hacker motorná változtatja. Az AI is segítőkész akar lenni; hajlamos olyan "értelmes" eredményt találni, amely kielégíti Önt. Ezért az Ön gyors tervezése az őszinteség első védelmi vonala.

Védekezés: tisztességes üzletmenet

1. Előzetes regisztráció: Hipotézisének, változóinak, modelljének és tesztjeinek írásbeli rögzítését jelenti (esetleg időbélyegzett platformon) az elemzés elvégzése előtt. Így a felfedezés elválik a megerősítéstől; bármit, amit utólag változtat, az "explorer" címkével látja el.

2. Elemzési terv: Még ha nem is tud előre rögzíteni, írjon elemzési tervet, mielőtt belemerül az adatokba: elsődleges hipotézis, elsődleges eredményváltozó, fő modell. Kezdettől fogva tegyen különbséget a „főelemzés” és a „kiegészítő/feltáró elemzés” között, és tartsa meg azt a jelentésben.

3. Jelentsen mindent: Ne rejtse el a kipróbált modelleket. Az „érzékenységelemzés” (robusztussági ellenőrzés) részben mutassa meg, hogy a különböző specifikációk hogyan változtatják meg az eredményt. A megállapítás csak akkor erős, ha sok elfogadható választás mellett megállja a helyét.

4. Többszörös összehasonlítás: Ha túl sok tesztet végzett, javítsa ki azokat (6. egység). Válaszoljon a "Hány tesztet végeztem?" kérdésre. őszintén.

5. Érzékenységelemzés: Ismételje meg a fő megállapítást egy másik mintával, más vezérlőkészlettel és más transzformációval. Ha az eredmény megváltozik, ne rejtse el, jelentse.

Összehasonlító táblázat: őszinte vs. csapda

Alkalmazás

csapda alakja

Őszinte megfelelője

Modell kiválasztása

Addig próbálkozom, amíg nincs értelme (p-hackelés)

Előre tervezett mestermodell

hipotézis

Utólag illeszkedés (HARKing)

Előre rögzített, adatok előtt

Jelentés

Ne csak a szépeket mutasd

Minden specifikáció + érzékenység

alcsoport

A legszembetűnőbb kiválasztása

Előre meghatározott, javítható

adatgyűjtés

Állj le, amikor van értelme

előre meghatározott minta

Négy másolható felszólítás

1. Őszinte követelés kerete:

Az Ön szerepe: őszinte statisztikai asszisztens. NEM az a célom, hogy értelmes eredményt találjak, hanem a megfelelő eredményt. SZABÁLYOK:- NE adj "próbáld ki a modelleket, amíg nincs értelme" típusú javaslatokat, - mondd meg, ha több specifikációt javasolsz, mindegyiket jelenteni kell, - figyelmeztess minden olyan lépésre, amely p-hackeléshez vezethet. Segíts nekem először tisztázni a fő modellemet, különválasztva a felfedezést a megerősítéstől.

2. Elemzési terv tervezet:

Segítsen egy vizsgálat előzetes elemzési tervének elkészítésében: elsődleges hipotézis, elsődleges eredményváltozó, fő modell specifikáció, előre meghatározott alcsoportok, többszörös összehasonlítási stratégia. A "feltáró" és a "megerősítő" elemzéseket külön címsorokba helyezze. Emlékeztessen, hogy az adatok NÉLKÜL töltse ki.

3. Érzékenységi elemzés:

A fő megállapításom az érzékenységelemző kód (R) írása. A célom az, hogy LÁTJA, mennyire szilárd az eredmény, NEM az, hogy a legjobbat válasszam; mutasd meg az összes eredményt.

4. Önellenőrzés:

Elmagyarázom az elemzési folyamatomat; Adjon nekem egy ellenőrzőlistát a p-hackeléshez / HARK-hoz / szelektív jelentésekhez, és jelölje meg, melyik lépésem kockázatos. Kérdezz vissza, hány modellt/tesztet próbáltam ki, és melyekről tervezek beszámolni.

Gyenge felszólítás / Erős felszólítás

Gyenge felszólítás:

Mely változók mutatnak szignifikáns összefüggéseket ezekben az adatokban, keresse meg a legjobb modellt.

Ez a prompt egy közvetlen p-hackelési utasítás: az AI több tucat kombinációt próbál ki, és bemutatja azt, amelyik "legértelmesebb". Az eredmény szinte biztosan egy hamis lelet, amelyet nem lehet megismételni.

Erőteljes felszólítás:

Az Ön szerepe: becsületes asszisztens. Az általam előre meghatározott FŐ modell: Y ~ X + vezérlők. Írjon kódot, amely megjósolja ezt a modellt. NE keress másik "értelmesebb" modellt. Javasoljon érzékenységi elemzést is, hogy lássam az eredmény robusztusságát, de tudd, hogy az ÖSSZES eredményt jelentem, nem pedig a legjobbat választom ki. Ne írjak le egyetlen feltáró megállapítást sem „megerősítettnek”.

Különbség: az erős akarat rögzíti a fő modellt, tiltja a keresést, és megköveteli az összes eredmény jelentését.

három mini tok

1. eset – Alcsoportos vadászat. Egy kutató nem talált hatást a teljes mintában; Megkérdezte az AI-t, hogy "melyik alcsoportban van jelentősége?" Az YZ megvizsgálta az életkor, a nem és a régió kombinációit, és azt találta, hogy "p = 0,03 a 35-44 éves városi nőknél". A cikk ezen alcsoporton alapult. Replikációja nem talált hatást: ez több tucat alcsoport véletlen eredménye volt. Tanulság: kiválasztott alcsoport, miután az adatok HARKing, nem megerősítés.

2. eset – Áttérési vadászat. A hallgatói szintű formában értelmetlennek bizonyuló kapcsolat; kipróbálta log, négyzetgyök, négyzet és lag formában; P=0,048-at talált log-log formában, és csak ezt jelentette. Szerencsére az 5 kipróbált forma egyike átlépte a küszöböt. A helyes út a következő volt: előre kiválasztani a formát elmélettel, és az összes forma eredményét megjeleníteni az érzékenységi táblázatban. Tanulság: a szelektív jelentéstétel hamis jelentőséggel bír.

3. eset – Hogyan működik az őszinte keretezés? Egy csapat előzetesen regisztrált az elemzés előtt: egyetlen elsődleges hipotézis, egyetlen fő modell, két előre meghatározott alcsoport, Bonferroni-korrekció. A fő hatás nem volt jelentős, de a csapat őszintén beszámolt róla; A feltáró egyén megjelölte az egyik leletet, mint "a jövőben tesztelni kell". A tanulmány reprodukálható és megbízható volt. Tanulság: az őszinte tervezés még a „kudarc” eredményét is megéri.

Gyakori hibák

  • Az AI felszólítása, hogy „találjon értelmes eredményeket”. Ez egyenesen p-hackelés; Helyezze az AI-t egy őszinte keretbe, pontosságot kérve, nem eredményt.
  • A felfedezés megerősítésként történő bemutatása (HARKing). Félrevezető az adatok után felállított hipotézist úgy írni, hogy "eleve megjósoltam"; Jelölje meg a feltáró leletet.
  • Csak jó eredményekről számolok be. Az összes tesztelt specifikáció megjelenítése; A hangulatelemzés elrejtése veszélyezteti az integritást.
  • Alcsoport/konverzió szűrése. A több tucat alcsoport vagy transzformáció közül a legjelentősebb kiválasztása téves eredményeket eredményez; azonosítsa és javítsa előre.
  • Elfelejti, hány tesztet csinált. Kövesse nyomon a kísérletek teljes számát; Egyetlen p-érték sem értelmezhető őszintén e szám ismerete nélkül.
Tipp: Mielőtt leírna egy megállapítást, tedd fel magadnak a kérdést: "Hányféleképpen próbálkoztam csendben, amíg megtaláltam ezt az eredményt, és mindet jelentem?" Ha néhány esszé a fiókban marad, a jelentés erősebbnek tűnik, mint amilyen.

Összefoglalva

p-hacking, HARKing, szelektív riportok és az elágazó utak kertje; Sok olyan csapda, amely nem szándékosan működik, de hamis, megismételhetetlen eredményeket produkál. Az AI felgyorsítja ezeket a buktatókat, mert több tucat elemzést tud azonnal kipróbálni; A „találj értelmes eredményeket” típusú kérések az AI-t p-hacker motorná változtatják. Védelem; a felfedezés és a megerősítés elkülönítése előzetes regisztrációs és elemzési tervvel, minden specifikáció és érzékenységi elemzés jelentése, többszörös összehasonlítás javítása, és a mesterséges intelligencia becsületes keretbe helyezése, amely megköveteli a "helyes eredményt". A végső felelősség mindig a kutatót terheli.

Pályázati feladat

Válasszon egy kutatási kérdést, és írjon egy rövid elemzési tervet az adatok megtekintése előtt: elsődleges hipotézis, fő modell, elsődleges eredményváltozó, előre meghatározott alcsoportok, többszörös összehasonlítási stratégia. Ezután becsülje meg a fő modellt. Ezután végezzen érzékenységi elemzést (különböző vezérlők, kiugró értékek szerepelnek/kizárva, eltérő függvényforma), és mutasson be minden eredményt egyetlen táblázatban. Az egyik bekezdésben értékelje, mely lépések jelentenek p-hackelés kockázatát, és hogyan korlátozza őket az őszinte keretrendszer.

ellenőrző lista

  • [ ] Megírtam az elemzési tervet/főmodellt, mielőtt belemerültem volna az adatokba.
  • [ ] Külön jelöltem a feltáró és a megerősítő elemzéseket; Én nem HARKoltam.
  • [ ] Beszámoltam az összes kipróbált specifikációról; Nem csak a szépet választottam.
  • [ ] Az alcsoportokat, transzformációkat előzetesen definiáltam, az adatok után nem szkenneltem.
  • [ ] Nyomon követtem, hogy hány tesztet futtattam le, és elvégeztem a szükséges korrekciót.
  • [ ] Az AI-t a „találd meg az igazságot” kontextusban használtam a „találd értelmesnek” helyett; Vállaltam a felelősséget.