Nyereség:
- Értsd meg, hogy a p-hackelés, a HARK, a szelektív jelentések és az elágazó utak kertje hamis megállapításokat eredményez, és nézd meg, hogyan tudja a mesterséges intelligencia felgyorsítani ezeket a csapdákat
- Képes védekezni, mint például előzetes regisztráció, elemzési terv, többszörös összehasonlítási fegyelem és érzékenységi elemzés mesterséges intelligencia támogatással
- Az őszinte kérés-tervezés belsővé tétele, amely lehetővé teszi a mesterséges intelligencia számára, hogy elutasítsa a „találd meg az értelmes eredményt” típusú kéréseket, és a végső felelősség a kutatóé.
Az előző egységben láttuk, hogy mi a p-érték és mi nem. Ebben az egységben egy sötétebb témát vizsgálunk meg, a statisztikai integritást veszélyeztető szisztematikus csapdákat. Ezek többsége nem szándékos csalás; Ezek alattomos mechanizmusok, amelyekbe még a jó szándékú kutatók is belebuknak anélkül, hogy észrevennének. A mesterséges intelligencia (AI) pedig egyszerűbbé és gyorsabbá teszi ezeket a buktatókat, mivel több tucat elemzést tesz lehetővé másodpercek alatt. Ennek az egységnek az a célja, hogy létrehozza azt a tudományágat, amely az AI-t "értelmes eredménykereső gépből" becsületes asszisztenssé alakítja.
Alapvető buktatók
p-hacking (p-érték vadászat): Különböző módokon próbálja újra az elemzést, amíg szignifikáns eredményt (p<0,05) nem kap. Változók hozzáadása és eltávolítása, részminták kiválasztása, a kiugró értékek definíciójának megváltoztatása, különböző transzformációk kipróbálása, különböző kimeneti változók használata, az adatgyűjtés leállítása, amikor értelmessé válik... Minden próbálkozás új "esélyt" ad; Ha elég keményen próbálkozol, az egyik értelmesnek bizonyul, még akkor is, ha valójában nincs hatása. Az eredmény: hamis eredmények, amelyeket publikáltak, de nem reprodukálhatók.
HARKing (hipotézis, miután az eredmények ismertek): hipotézis felállítása az eredmények láttán, és úgy prezentálása, hogy "a kezdetektől így jósoltam". Megnézi az adatokat, és megtalálja a legszembetűnőbb összefüggést, majd úgy írja meg a dolgozatot, mintha az a hipotézis tesztelésére készült volna. Ez félrevezeti az olvasót azáltal, hogy a felfedezés megerősítésnek tűnik.
Szelektív jelentéskészítés (cseresznyeszedés): több tucat elemzésből csak a "jó" jelentését, a többit pedig csendben eltemetni. Ezt "fájlfiók-problémának" is nevezik: az értelmetlen eredmények a fiókban maradnak, ami szisztematikusan elfogulttá teszi a szakirodalmat.
Elágazó utak kertje: Andrew Gelman kifejezése. Egyetlen szándékos p-hackelés nélkül is sok ésszerű választást hoz a kutató az adatok alapján (melyik változó, melyik küszöb, melyik alcsoport, melyik transzformáció). Ezek a nyomozási szabadságfok olyan sokrétű, hogy Ön hatékonyan választja ki az értelmeset az elemzések sokaságából – még rossz szándék nélkül is. Az eredmény ismét egy emelkedő téves pozitív arány.
Figyelem: A legtöbb ilyen csapda nem szándékos trükk. Az olyan ártatlannak tűnő lépések összege, mint például: „Épp most próbáltam még néhány modellt”, „tisztább volt, amikor eltávolítottam a kiugró értéket”, „ebben az alcsoportban a hatás egyértelműbb” téves megállapítást eredményezhet. Az őszinteség módszer kérdése, nem szándék.
Miért növeli az AI ezeket a csapdákat?
3 modell kézi kipróbálása időt vesz igénybe; Az YZ 50 modellváltozatot, 10 különböző átalakítást, 8 alcsoportot gyárt percek alatt. Ez az erő őszinte terv nélkül katasztrofális: egy olyan kérés, mint „találjon értelmes kapcsolatot ezekben az adatokban” vagy „építsen egy modellt, amely alátámasztja ezt a hipotézist”, az AI-t közvetlenül p-hacker motorná változtatja. Az AI is segítőkész akar lenni; hajlamos olyan "értelmes" eredményt találni, amely kielégíti Önt. Ezért az Ön gyors tervezése az őszinteség első védelmi vonala.
Védekezés: tisztességes üzletmenet
1. Előzetes regisztráció: Hipotézisének, változóinak, modelljének és tesztjeinek írásbeli rögzítését jelenti (esetleg időbélyegzett platformon) az elemzés elvégzése előtt. Így a felfedezés elválik a megerősítéstől; bármit, amit utólag változtat, az "explorer" címkével látja el.
2. Elemzési terv: Még ha nem is tud előre rögzíteni, írjon elemzési tervet, mielőtt belemerül az adatokba: elsődleges hipotézis, elsődleges eredményváltozó, fő modell. Kezdettől fogva tegyen különbséget a „főelemzés” és a „kiegészítő/feltáró elemzés” között, és tartsa meg azt a jelentésben.
3. Jelentsen mindent: Ne rejtse el a kipróbált modelleket. Az „érzékenységelemzés” (robusztussági ellenőrzés) részben mutassa meg, hogy a különböző specifikációk hogyan változtatják meg az eredményt. A megállapítás csak akkor erős, ha sok elfogadható választás mellett megállja a helyét.
4. Többszörös összehasonlítás: Ha túl sok tesztet végzett, javítsa ki azokat (6. egység). Válaszoljon a "Hány tesztet végeztem?" kérdésre. őszintén.
5. Érzékenységelemzés: Ismételje meg a fő megállapítást egy másik mintával, más vezérlőkészlettel és más transzformációval. Ha az eredmény megváltozik, ne rejtse el, jelentse.
Összehasonlító táblázat: őszinte vs. csapda
Alkalmazás
csapda alakja
Őszinte megfelelője
Modell kiválasztása
Addig próbálkozom, amíg nincs értelme (p-hackelés)
Előre tervezett mestermodell
hipotézis
Utólag illeszkedés (HARKing)
Előre rögzített, adatok előtt
Jelentés
Ne csak a szépeket mutasd
Minden specifikáció + érzékenység
alcsoport
A legszembetűnőbb kiválasztása
Előre meghatározott, javítható
adatgyűjtés
Állj le, amikor van értelme
előre meghatározott minta
Négy másolható felszólítás
1. Őszinte követelés kerete:
Az Ön szerepe: őszinte statisztikai asszisztens. NEM az a célom, hogy értelmes eredményt találjak, hanem a megfelelő eredményt. SZABÁLYOK:- NE adj "próbáld ki a modelleket, amíg nincs értelme" típusú javaslatokat, - mondd meg, ha több specifikációt javasolsz, mindegyiket jelenteni kell, - figyelmeztess minden olyan lépésre, amely p-hackeléshez vezethet. Segíts nekem először tisztázni a fő modellemet, különválasztva a felfedezést a megerősítéstől.
2. Elemzési terv tervezet:
Segítsen egy vizsgálat előzetes elemzési tervének elkészítésében: elsődleges hipotézis, elsődleges eredményváltozó, fő modell specifikáció, előre meghatározott alcsoportok, többszörös összehasonlítási stratégia. A "feltáró" és a "megerősítő" elemzéseket külön címsorokba helyezze. Emlékeztessen, hogy az adatok NÉLKÜL töltse ki.
3. Érzékenységi elemzés:
A fő megállapításom az érzékenységelemző kód (R) írása. A célom az, hogy LÁTJA, mennyire szilárd az eredmény, NEM az, hogy a legjobbat válasszam; mutasd meg az összes eredményt.
4. Önellenőrzés:
Elmagyarázom az elemzési folyamatomat; Adjon nekem egy ellenőrzőlistát a p-hackeléshez / HARK-hoz / szelektív jelentésekhez, és jelölje meg, melyik lépésem kockázatos. Kérdezz vissza, hány modellt/tesztet próbáltam ki, és melyekről tervezek beszámolni.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Mely változók mutatnak szignifikáns összefüggéseket ezekben az adatokban, keresse meg a legjobb modellt.
Ez a prompt egy közvetlen p-hackelési utasítás: az AI több tucat kombinációt próbál ki, és bemutatja azt, amelyik "legértelmesebb". Az eredmény szinte biztosan egy hamis lelet, amelyet nem lehet megismételni.
Erőteljes felszólítás:
Az Ön szerepe: becsületes asszisztens. Az általam előre meghatározott FŐ modell: Y ~ X + vezérlők. Írjon kódot, amely megjósolja ezt a modellt. NE keress másik "értelmesebb" modellt. Javasoljon érzékenységi elemzést is, hogy lássam az eredmény robusztusságát, de tudd, hogy az ÖSSZES eredményt jelentem, nem pedig a legjobbat választom ki. Ne írjak le egyetlen feltáró megállapítást sem „megerősítettnek”.
Különbség: az erős akarat rögzíti a fő modellt, tiltja a keresést, és megköveteli az összes eredmény jelentését.
három mini tok
1. eset – Alcsoportos vadászat. Egy kutató nem talált hatást a teljes mintában; Megkérdezte az AI-t, hogy "melyik alcsoportban van jelentősége?" Az YZ megvizsgálta az életkor, a nem és a régió kombinációit, és azt találta, hogy "p = 0,03 a 35-44 éves városi nőknél". A cikk ezen alcsoporton alapult. Replikációja nem talált hatást: ez több tucat alcsoport véletlen eredménye volt. Tanulság: kiválasztott alcsoport, miután az adatok HARKing, nem megerősítés.
2. eset – Áttérési vadászat. A hallgatói szintű formában értelmetlennek bizonyuló kapcsolat; kipróbálta log, négyzetgyök, négyzet és lag formában; P=0,048-at talált log-log formában, és csak ezt jelentette. Szerencsére az 5 kipróbált forma egyike átlépte a küszöböt. A helyes út a következő volt: előre kiválasztani a formát elmélettel, és az összes forma eredményét megjeleníteni az érzékenységi táblázatban. Tanulság: a szelektív jelentéstétel hamis jelentőséggel bír.
3. eset – Hogyan működik az őszinte keretezés? Egy csapat előzetesen regisztrált az elemzés előtt: egyetlen elsődleges hipotézis, egyetlen fő modell, két előre meghatározott alcsoport, Bonferroni-korrekció. A fő hatás nem volt jelentős, de a csapat őszintén beszámolt róla; A feltáró egyén megjelölte az egyik leletet, mint "a jövőben tesztelni kell". A tanulmány reprodukálható és megbízható volt. Tanulság: az őszinte tervezés még a „kudarc” eredményét is megéri.
Gyakori hibák
- Az AI felszólítása, hogy „találjon értelmes eredményeket”. Ez egyenesen p-hackelés; Helyezze az AI-t egy őszinte keretbe, pontosságot kérve, nem eredményt.
- A felfedezés megerősítésként történő bemutatása (HARKing). Félrevezető az adatok után felállított hipotézist úgy írni, hogy "eleve megjósoltam"; Jelölje meg a feltáró leletet.
- Csak jó eredményekről számolok be. Az összes tesztelt specifikáció megjelenítése; A hangulatelemzés elrejtése veszélyezteti az integritást.
- Alcsoport/konverzió szűrése. A több tucat alcsoport vagy transzformáció közül a legjelentősebb kiválasztása téves eredményeket eredményez; azonosítsa és javítsa előre.
- Elfelejti, hány tesztet csinált. Kövesse nyomon a kísérletek teljes számát; Egyetlen p-érték sem értelmezhető őszintén e szám ismerete nélkül.
Tipp: Mielőtt leírna egy megállapítást, tedd fel magadnak a kérdést: "Hányféleképpen próbálkoztam csendben, amíg megtaláltam ezt az eredményt, és mindet jelentem?" Ha néhány esszé a fiókban marad, a jelentés erősebbnek tűnik, mint amilyen.
Összefoglalva
p-hacking, HARKing, szelektív riportok és az elágazó utak kertje; Sok olyan csapda, amely nem szándékosan működik, de hamis, megismételhetetlen eredményeket produkál. Az AI felgyorsítja ezeket a buktatókat, mert több tucat elemzést tud azonnal kipróbálni; A „találj értelmes eredményeket” típusú kérések az AI-t p-hacker motorná változtatják. Védelem; a felfedezés és a megerősítés elkülönítése előzetes regisztrációs és elemzési tervvel, minden specifikáció és érzékenységi elemzés jelentése, többszörös összehasonlítás javítása, és a mesterséges intelligencia becsületes keretbe helyezése, amely megköveteli a "helyes eredményt". A végső felelősség mindig a kutatót terheli.
Pályázati feladat
Válasszon egy kutatási kérdést, és írjon egy rövid elemzési tervet az adatok megtekintése előtt: elsődleges hipotézis, fő modell, elsődleges eredményváltozó, előre meghatározott alcsoportok, többszörös összehasonlítási stratégia. Ezután becsülje meg a fő modellt. Ezután végezzen érzékenységi elemzést (különböző vezérlők, kiugró értékek szerepelnek/kizárva, eltérő függvényforma), és mutasson be minden eredményt egyetlen táblázatban. Az egyik bekezdésben értékelje, mely lépések jelentenek p-hackelés kockázatát, és hogyan korlátozza őket az őszinte keretrendszer.
ellenőrző lista
- [ ] Megírtam az elemzési tervet/főmodellt, mielőtt belemerültem volna az adatokba.
- [ ] Külön jelöltem a feltáró és a megerősítő elemzéseket; Én nem HARKoltam.
- [ ] Beszámoltam az összes kipróbált specifikációról; Nem csak a szépet választottam.
- [ ] Az alcsoportokat, transzformációkat előzetesen definiáltam, az adatok után nem szkenneltem.
- [ ] Nyomon követtem, hogy hány tesztet futtattam le, és elvégeztem a szükséges korrekciót.
- [ ] Az AI-t a „találd meg az igazságot” kontextusban használtam a „találd értelmesnek” helyett; Vállaltam a felelősséget.