Ieguvumi:
- Saprotiet, ka uzlaušana, HARK, selektīva ziņošana un sazaroto ceļu dārzs rada nepatiesus atklājumus, un uzziniet, kā mākslīgais intelekts var paātrināt šo slazdu darbību.
- Spēja izveidot aizsardzību, piemēram, iepriekšēju reģistrāciju, analīzes plānu, vairāku salīdzināšanas disciplīnu un jutīguma analīzi ar mākslīgā intelekta atbalstu
- Spēja internalizēt godīgu pieprasījuma dizainu, kas ļaus mākslīgajam intelektam noraidīt “atrast jēgpilnu rezultātu” tipa pieprasījumus un ka galīgā atbildība gulstas uz pētnieku.
Iepriekšējā vienībā mēs redzējām, kas ir p-vērtība un kas tā nav. Šajā nodaļā mēs aplūkosim tumšāku tēmu — sistemātiskus slazdus, kas apdraud statistikas integritāti. Lielākā daļa no tām nav tīša krāpšana; Tie ir mānīgi mehānismi, kuros iekrīt pat labi nodomi pētnieki, to neapzinoties. Un mākslīgais intelekts (AI) padara šīs nepilnības gan vienkāršākas, gan ātrākas, jo ļauj sekundēs veikt desmitiem analīžu. Šīs vienības mērķis ir izveidot disciplīnu, kas pārveidos AI no "jēgpilnu rezultātu meklēšanas mašīnas" par godīgu palīgu.
Pamata kļūmes
p-hacking (p-vērtību medības): tā mēģina atkārtoti veikt analīzi dažādos veidos, līdz tiek iegūts nozīmīgs rezultāts (p<0,05). Mainīgo pievienošana un noņemšana, apakšizlases atlase, izņēmumu definīcijas maiņa, dažādu transformāciju izmēģināšana, dažādu iznākuma mainīgo izmantošana, datu vākšanas apturēšana, kad tas kļūst jēgpilns... Katrs mēģinājums dod jaunu "iespēju"; Ja pietiekami centīsies, viens no tiem izrādīsies nozīmīgs, pat ja tam faktiski nav nekādas ietekmes. Rezultāts: viltus atklājumi, kas tika publicēti, bet nav atkārtojami.
HARKing (hipotēzes izvirzīšana pēc tam, kad rezultāti ir zināmi): hipotēzes izvirzīšana pēc rezultātu redzēšanas un tā uzrādīšana kā "es to paredzēju šādi no sākuma". Jūs aplūkojat datus un atrodat visspilgtākās attiecības, pēc tam uzrakstiet darbu tā, it kā tas būtu paredzēts šīs hipotēzes pārbaudei. Tas maldina lasītāju, liekot atklājumam šķist apstiprinājums.
Selektīvā ziņošana (izvēloties): ziņot tikai par "labajām" no desmitiem analīžu un klusi apglabāt pārējo. To sauc arī par "datņu atvilktnes problēmu": bezjēdzīgi rezultāti paliek atvilktnē, padarot literatūru sistemātiski neobjektīvu.
Sazaroto taku dārzs: Endrjū Gelmana termins. Pat bez vienas tīšas p-datorurķēšanas pētnieks izdara daudzas saprātīgas izvēles, pamatojoties uz datiem (kurš mainīgais, kurš slieksnis, kura apakšgrupa, kura transformācija). Šīs izmeklēšanas brīvības pakāpes ir tik daudz, ka jūs faktiski izvēlaties jēgpilno no daudzām analīzēm — pat bez jebkāda ļauna nolūka. Rezultāts atkal ir augošs viltus pozitīvu rezultātu rādītājs.
Uzmanību: lielākā daļa šo slazdu nav apzināti triki. Šķietami nevainīgu darbību summa, piemēram, "es tikko izmēģināju vēl dažus modeļus", "tas bija tīrāks, kad noņēmu nobīdi", "efekts ir skaidrāks šajā apakšgrupā", var radīt nepatiesu konstatējumu. Godīgums ir metodes, nevis nodoma jautājums.
Kāpēc AI palielina šos slazdus?
3 modeļu izmēģināšana ar rokām prasa laiku; YZ ražo 50 modeļu variantus, 10 dažādus reklāmguvumus, 8 apakšgrupas minūtēs. Šis spēks ir postošs bez godīga plāna: pieprasījums, piemēram, “atrast jēgpilnas attiecības šajos datos” vai “izveidot modeli, kas atbalsta šo hipotēzi”, pārvērš AI tieši par p-hacking dzinēju. AI arī vēlas būt noderīgs; mēdz atrast "jēgpilnu" iznākumu, kas jūs apmierinās. Tāpēc jūsu ātrais dizains ir godīguma pirmā aizsardzības līnija.
Aizstāvība: godīga biznesa gaita
1. Iepriekšēja reģistrācija: tas nozīmē, ka pirms analīzes veikšanas ir jāieraksta jūsu hipotēze, mainīgie lielumi, modelis un testi rakstiski (iespējams, uz platformas ar laika zīmogu). Tādējādi atklājums tiek atdalīts no apstiprināšanas; viss, ko pēc tam maināt, tiek atzīmēts kā "pētnieks".
2. Analīzes plāns. Pat ja nevarat veikt iepriekšēju ierakstu, pirms iedziļināšanās datos uzrakstiet analīzes plānu: primārā hipotēze, primārā rezultāta mainīgais, galvenais modelis. No sākuma nosakiet atšķirību starp “galveno analīzi” un “papildu/izpētes analīzi” un saglabājiet to ziņojumā.
3. Ziņojiet par visu: neslēpiet modeļus, kurus esat izmēģinājis. Sadaļā “Jūtības analīze” (noturības pārbaude) parādiet, kā dažādas specifikācijas maina rezultātu. Atklājums ir spēcīgs tikai tad, ja tas atbilst daudzām ticamām izvēlēm.
4. Vairāku salīdzināšanas disciplīna: ja esat veicis pārāk daudz testu, izlabojiet tos (6. vienība). Atbildiet uz jautājumu "Cik testu esmu veicis?" godīgi sakot.
5. Jutīguma analīze: atkārtojiet savu galveno konstatējumu ar citu paraugu, citu vadības komplektu un atšķirīgu transformāciju. Ja rezultāts mainās, neslēpiet to, ziņojiet par to.
Salīdzinājuma diagramma: godīgs pret slazdu
Pieteikums
lamatas forma
Godīgs ekvivalents
Modeļa izvēle
Mēģināt, līdz ir jēga (p-uzlaušana)
Iepriekš plānots meistarmodelis
hipotēze
Pielāgošana pēc fakta (HARKing)
Iepriekš ierakstīts, pirms datiem
Ziņošana
Nerādi tikai skaistās
Visas specifikācijas + jutība
apakšgrupa
Izvēloties visspilgtāko
Iepriekš noteikts, labojams
datu vākšana
Apstājieties, kad tas ir loģiski
iepriekš noteikts paraugs
Četras kopējamas uzvednes
1. Godīgu prasību ietvars:
Jūsu loma: godīgs statistikas palīgs. Mans mērķis NAV atrast jēgpilnu rezultātu, bet gan atrast pareizo rezultātu. NOTEIKUMI:- NESNIEDZIET man veida ieteikumus "izmēģināt modeļus, līdz tas ir jēga", - sakiet man, ja iesakāt vairākas specifikācijas, par kurām ir jāziņo, - brīdiniet mani par jebkādām darbībām, kas var izraisīt p-uzlaušanu. Vispirms palīdziet man precizēt manu galveno modeli, atdaliet atklājumu no apstiprinājuma.
2. Analīzes plāna projekts:
Palīdziet man izveidot pētījuma provizorisku analīzes plānu: primārā hipotēze, primārā iznākuma mainīgais, galvenā modeļa specifikācija, iepriekš noteiktas apakšgrupas, vairāku salīdzināšanas stratēģija. Ievietojiet "izpētes" un "apstiprinājuma" analīzes atsevišķās pozīcijās. Atgādināt man to aizpildīt, NEAPSKATOT datus.
3. Jutīguma analīze:
Mans galvenais atklājums ir rakstīt jutīguma analīzes kodu (R) Mans mērķis ir REDZĒT, cik stabils ir rezultāts, NEVIS izvēlēties labāko; parādīt visus rezultātus.
4. Paškontrole:
Es izskaidrošu savu analīzes procesu; Sniedziet man kontrolsarakstu par uzlaušanu / HARK / selektīvu ziņošanu un atzīmējiet, kuri no maniem soļiem ir riskanti. Pajautājiet man, cik modeļus/testus esmu izmēģinājis un par kuriem plānoju ziņot.
Vāja uzvedne / spēcīga uzvedne
Vāja uzvedne:
Kuri mainīgie parāda būtiskas attiecības šajos datos, atrodiet labāko modeli.
Šī uzvedne ir tieša p-datorurķēšanas instrukcija: AI izmēģina desmitiem kombināciju un parāda to, kurai ir "visjēdzīgākā". Rezultāts gandrīz noteikti ir neīsts atklājums, ko nevar atkārtot.
Spēcīga uzvedne:
Jūsu loma: godīgs palīgs. GALVENAIS modelis, ko esmu iepriekš noteicis, ir: Y ~ X + vadīklas. Uzrakstiet kodu, kas paredz šo modeli. NEMEKLĒJIET citu "jēgpilnāku" modeli. Iesakiet arī jutīguma analīzi, lai es varētu redzēt rezultāta noturību, taču ziniet, ka ziņošu par VISIEM rezultātiem, nevis izvēlēšos labāko. Neļaujiet man norakstīt nekādus izpētes atklājumus kā “apstiprinātus”.
Atšķirība: spēcīga griba nosaka galveno modeli, aizliedz meklēšanu un pieprasa ziņot par visiem rezultātiem.
trīs mini futrāļi
1. gadījums — apakšgrupu medības. Viens pētnieks kopējā izlasē nekonstatēja nekādu ietekmi; Viņš jautāja AI "kurā apakšgrupā tas ir nozīmīgs?" YZ skenēja vecuma, dzimuma un reģiona kombinācijas un konstatēja "p = 0,03 pilsētas sievietēm vecumā no 35 līdz 44 gadiem". Raksta pamatā bija šī apakšgrupa. Viņa replikācija nekonstatēja nekādu efektu: tas bija nejaušības rezultāts no desmitiem apakšgrupu. Nodarbība: atlasītā apakšgrupa pēc datu HARKing, nevis apstiprināšanas.
2. gadījums — Konversijas medības. Attiecības, kas studenta līmenī izrādās bezjēdzīgas; izmēģināja baļķu, kvadrātsaknes, kvadrātveida un lag formās; Viņš konstatēja p=0,048 log-log formā un ziņoja tikai par to. Par laimi, viena no 5 izmēģinātajām formām šķērsoja slieksni. Pareizais veids bija: iepriekš atlasīt formu ar teoriju un parādīt visu formu rezultātu jutīguma tabulā. Nodarbība: selektīva ziņošana rada nepatiesu nozīmi.
3. gadījums — kā darbojas godīga kadrēšana. Viena komanda iepriekš reģistrējās pirms analīzes: viena primārā hipotēze, viens galvenais modelis, divas iepriekš noteiktas apakšgrupas, Bonferroni korekcija. Galvenais efekts nebija nozīmīgs, taču komanda par to ziņoja godīgi; Izpētes persona atzīmēja vienu atradumu kā "nepieciešams pārbaudīt nākotnē". Pētījums bija reproducējams un uzticams. Nodarbība: godīga plānošana padara pat “neveiksmīgu” rezultātu vērtīgu.
Biežas kļūdas
- Paziņojums AI "atrast nozīmīgus rezultātus". Tas ir tieši uz augšu p-hacking; Ievietojiet AI godīgā rāmī, prasot precizitāti, nevis rezultātus.
- Atklājuma uzrādīšana kā apstiprinājums (HARKing). Ir maldinoši rakstīt aiz datiem izvirzīto hipotēzi kā "es to paredzēju no sākuma"; Apzīmējiet izpētes atradumu.
- Vienkārši ziņo par labiem rezultātiem. Rādīt visas pārbaudītās specifikācijas; Sentimenta analīzes slēpšana apdraud integritāti.
- Apakšgrupu/reklāmguvumu pārbaude. Izvēloties nozīmīgāko no desmitiem apakšgrupu vai transformāciju, tiek iegūti viltus atklājumi; identificēt un labot iepriekš.
- Aizmirstot, cik daudz testu esat veicis. Sekojiet līdzi kopējam mēģinājumu skaitam; Nevienu p vērtību nevar interpretēt godīgi, nezinot šo skaitli.
Padoms. Pirms pierakstāt konstatējumu, pajautājiet sev: "Cik veidus es klusībā esmu izmēģinājis, līdz atradu šo rezultātu, un vai es ziņoju par tiem visiem?" Ja dažas esejas paliek atvilktnē, jūsu ziņojums izskatās spēcīgāks, nekā tas ir.
Rezumējot
p-hacking, HARKing, selektīva ziņošana un sazaroto taku dārzs; Daudzi ir slazdi, kas darbojas netīši, bet rada viltus, neatkārtojamus atradumus. AI paātrina šīs nepilnības, jo tas var uzreiz izmēģināt desmitiem analīžu; “Atrast jēgpilnus rezultātus” tipa pieprasījumi pārvērš AI par p-hacking dzinēju. Aizsardzība; atklājumu nošķiršana no apstiprināšanas ar iepriekšējas reģistrācijas un analīzes plānu, ziņošana par visām specifikācijām un jutīguma analīzi, vairāku salīdzinājumu labošana un AI iekļaušana godīgā sistēmā, kas prasa "pareizu rezultātu". Galīgā atbildība vienmēr gulstas uz pētnieku.
Lietojumprogrammas uzdevums
Izvēlieties pētījuma jautājumu un pirms datu aplūkošanas uzrakstiet īsu analīzes plānu: primārā hipotēze, galvenais modelis, primārā rezultāta mainīgais, iepriekš noteiktas apakšgrupas, vairāku salīdzināšanas stratēģija. Pēc tam novērtējiet galveno modeli. Pēc tam veiciet jutīguma analīzi (dažādas vadīklas, iekļautas/izslēgtas novirzes, atšķirīga funkciju forma) un parādiet visus rezultātus vienā tabulā. Vienā rindkopā novērtējiet, kuras darbības rada p-uzlaušanas risku un kā jūsu godīgā sistēma tos ierobežo.
kontrolsaraksts
- [ ] Pirms iedziļināšanās datos es uzrakstīju analīzes plānu/pamatmodeli.
- [ ] Izpētošo un apstiprinošo analīzi apzīmēju atsevišķi; Es nebiju HARKings.
- [ ] Esmu ziņojis par visām specifikācijām, kuras esmu izmēģinājis; Es neizvēlējos tikai skaisto.
- [ ] Apakšgrupas un transformācijas definēju iepriekš, pēc datiem neskenēju.
- [ ] Es sekoju līdzi, cik testu esmu izpildījis, un veicu nepieciešamo korekciju.
- [ ] Es izmantoju AI kontekstā “atrasti patiesību”, nevis “atrodi to jēgpilnu”; Es uzņēmos atbildību.