Vienetas 7 / 11

p-hacking, HARKing ir statistinis vientisumas: spąstai dirbtinio intelekto amžiuje

Pelnas:

  • Supraskite, kad p-hacking, HARKing, selektyvios ataskaitos ir išsišakojančių takų sodas sukuria klaidingus duomenis ir sužinokite, kaip dirbtinis intelektas gali pagreitinti šiuos spąstus.
  • Gebėjimas sukurti gynybą, pvz., išankstinę registraciją, analizės planą, daugkartinio palyginimo discipliną ir jautrumo analizę su dirbtinio intelekto palaikymu.
  • Gebėjimas internalizuoti sąžiningą užklausos dizainą, kuris leis dirbtiniam intelektui atmesti „rasti prasmingą rezultatą“ tipo užklausas ir kad galutinė atsakomybė tenka tyrėjui.

Ankstesniame vienete matėme, kas yra p reikšmė ir kas ne. Šiame skyriuje apžvelgsime tamsesnę temą – sistemingus spąstus, kurie kelia grėsmę statistiniam vientisumui. Dauguma jų nėra tyčinis sukčiavimas; Tai klastingi mechanizmai, į kuriuos patys to nesuvokdami patenka net gerai nusiteikę tyrinėtojai. O dirbtinis intelektas (DI) šias spąstus palengvina ir pagreitina, nes per kelias sekundes galima atlikti daugybę analizių. Šio skyriaus tikslas – sukurti discipliną, kuri pavers AI iš „prasmingo rezultato paieškos mašinos“ į sąžiningą asistentą.

Pagrindiniai spąstai

p-hacking (p-reikšmių medžioklė): ji bando analizę dar kartą įvairiais būdais, kol gaunamas reikšmingas rezultatas (p<0,05). Kintamųjų pridėjimas ir pašalinimas, subimčių parinkimas, iškrypėlių apibrėžimo keitimas, skirtingų transformacijų bandymas, skirtingų rezultatų kintamųjų naudojimas, duomenų rinkimo stabdymas, kai tai tampa prasminga... Kiekvienas bandymas suteikia naują "šansą"; Jei pakankamai stengsitės, vienas iš jų pasirodys prasmingas, net jei iš tikrųjų neturi jokio poveikio. Rezultatas: klaidingos išvados, kurios buvo paskelbtos, bet neatkuriamos.

HARKing (hipotezavimas po to, kai žinomi rezultatai): hipotezės iškėlimas pamačius rezultatus ir pristatymas kaip „taip numatiau nuo pat pradžių“. Pažiūri duomenis ir randi ryškiausią ryšį, tada parašai darbą taip, lyg jis būtų skirtas tai hipotezei patikrinti. Tai klaidina skaitytoją, nes atradimas atrodo kaip patvirtinimas.

Atrankinis ataskaitų teikimas (vyšnių rinkimas): pranešama tik apie „gerus“ iš daugybės analizių ir tyliai laidojama likusioji dalis. Tai taip pat žinoma kaip „bylų stalčiaus problema“: beprasmiai rezultatai lieka stalčiuje, todėl literatūra yra sistemingai šališka.

Išsišakojančių takų sodas: Andrew Gelman terminas. Net ir be vieno tyčinio p įsilaužimo tyrėjas, remdamasis duomenimis, daro daug pagrįstų pasirinkimų (kuris kintamasis, koks slenkstis, koks pogrupis, kokia transformacija). Šių tyrimo laisvės laipsnių yra tiek daug, kad jūs iš daugybės analizių renkatės prasmingą – net ir be jokių piktų ketinimų. Rezultatas vėl didėja klaidingai teigiamų rezultatų rodiklis.

Atsargiai: dauguma šių spąstų nėra tyčiniai triukai. Iš pažiūros nekaltų veiksmų suma, pvz., „Ką tik išbandžiau dar kelis modelius“, „buvo švaresnis, kai pašalinau nuokrypį“, „efektas aiškesnis šiame pogrupyje“, gali lemti klaidingą išvadą. Sąžiningumas yra metodo, o ne ketinimo reikalas.

Kodėl AI padidina šiuos spąstus?

3 modelių išbandymas rankomis užtrunka; YZ per kelias minutes gamina 50 modelių variantų, 10 skirtingų konversijų, 8 pogrupius. Ši galia yra pražūtinga be sąžiningo plano: prašymas, pavyzdžiui, „rasti reikšmingą ryšį šiuose duomenyse“ arba „sukurti modelį, kuris patvirtintų šią hipotezę“, AI tiesiogiai paverčia p-hacking varikliu. AI taip pat nori būti naudingas; linkęs rasti „prasmingą“ rezultatą, kuris jus tenkintų. Štai kodėl jūsų greitas dizainas yra pirmoji sąžiningumo gynybos linija.

Gynyba: sąžininga verslo eiga

1. Išankstinė registracija: tai reiškia hipotezės, kintamųjų, modelio ir testų įrašymą raštu (galbūt laiko žyme pažymėtoje platformoje) prieš atliekant analizę. Taigi atradimas yra atskirtas nuo patvirtinimo; viskas, ką vėliau pakeisite, pažymėta kaip „tyrėjas“.

2. Analizės planas: net jei negalite iš anksto įrašyti, prieš pasinerdami į duomenis parašykite analizės planą: pirminė hipotezė, pirminio rezultato kintamasis, pagrindinis modelis. Nuo pat pradžių nustatykite skirtumą tarp „pagrindinės analizės“ ir „papildomos / tiriamosios analizės“ ir išlaikykite jį ataskaitoje.

3. Praneškite apie viską: neslėpkite modelių, kuriuos bandėte. Skiltyje „Jautrumo analizė“ (tvirtumo patikra) parodykite, kaip skirtingos specifikacijos keičia rezultatą. Išvada yra stipri tik tada, jei ji pasitvirtina esant daugeliui tikėtinų pasirinkimų.

4. Daugkartinio palyginimo disciplina: jei atlikote per daug testų, pataisykite juos (6 skyrius). Atsakykite į klausimą „Kiek testų aš padariau? sąžiningai.

5. Jautrumo analizė: pakartokite savo pagrindinį radinį naudodami kitą pavyzdį, skirtingą valdymo rinkinį ir skirtingą transformaciją. Jei rezultatas pasikeičia, neslėpkite, praneškite.

Palyginimo diagrama: sąžiningas ir spąstai

Taikymas

spąstų forma

Sąžiningas atitikmuo

Modelio pasirinkimas

Bandoma, kol prasminga (p įsilaužimas)

Iš anksto suplanuotas pagrindinis modelis

hipotezė

Prisitaikymas po fakto (HARKing)

Iš anksto įrašyta, prieš duomenis

Ataskaitų teikimas

Nerodykite tik gražiųjų

Visos specifikacijos + jautrumas

pogrupis

Renkantis įspūdingiausią

Iš anksto nustatytas, taisomas

duomenų rinkimas

Sustokite, kai tai prasminga

iš anksto nustatytas pavyzdys

Keturi nukopijuoti raginimai

1. Sąžiningų reikalavimų sistema:

Jūsų vaidmuo: sąžiningas statistikos asistentas. Mano tikslas NE rasti prasmingą rezultatą, o rasti tinkamą rezultatą. TAISYKLĖS:- NENAUDOKITE man tipo „išbandyti modelius, kol nebus prasmės“ tipo pasiūlymų, - pasakykite man, jei siūlote kelias specifikacijas, apie kurias reikia pranešti, - įspėkite mane apie bet kokius veiksmus, galinčius sukelti p-įsilaužimą. Pirmiausia padėkite man išsiaiškinti pagrindinį modelį, atskirkite atradimą nuo patvirtinimo.

2. Analizės plano projektas:

Padėkite man parengti preliminarų tyrimo analizės planą: pirminė hipotezė, pirminio rezultato kintamasis, pagrindinės modelio specifikacijos, iš anksto apibrėžti pogrupiai, daugkartinio palyginimo strategija. Sudėkite „tiriamąją“ ir „patvirtinamąją“ analizes į atskiras antraštes. Priminkite man tai užpildyti NEPERŽIŪRĖJANT duomenų.

3. Jautrumo analizė:

Mano pagrindinis atradimas yra parašyti jautrumo analizės kodą (R), skirtas Mano tikslas yra PAŽYMĖTI, koks patikimas rezultatas, NE pasirinkti geriausią; rodyti visus rezultatus.

4. Savikontrolė:

Paaiškinsiu savo analizės procesą; Pateikite man įsilaužimo / HARK / atrankinio pranešimo kontrolinį sąrašą ir pažymėkite, kurie mano veiksmai yra rizikingi. Paklauskite, kiek modelių/testų išbandžiau ir apie kuriuos planuoju pranešti.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Kurie kintamieji rodo reikšmingus ryšius šiuose duomenyse, raskite geriausią modelį.

Šis raginimas yra tiesioginė p-įsilaužimo instrukcija: AI išbando daugybę derinių ir pateikia tą, kuris „prasmingiausias“. Rezultatas beveik neabejotinai yra klaidingas radinys, kurio negalima pakartoti.

Galingas raginimas:

Jūsų vaidmuo: sąžiningas asistentas. PAGRINDINIS modelis, kurį nusprendžiau iš anksto, yra: Y ~ X + valdikliai. Parašykite kodą, kuris numato šį modelį. NEIEŠKOK kito „prasmingesnio“ modelio. Taip pat pasiūlykite jautrumo analizę, kad galėčiau pamatyti rezultato patikimumą, tačiau žinokite, kad pranešiu VISUS rezultatus, o ne rinksiu geriausią. Neleiskite man nurašyti jokių tiriamųjų išvadų kaip „patvirtintų“.

Skirtumas: stipri valia pataiso pagrindinį modelį, draudžia ieškoti ir reikalauja, kad būtų pranešta apie visus rezultatus.

trys mini dėklai

1 atvejis. Pogrupinė medžioklė. Vienas tyrėjas nerado jokio poveikio bendroje imtyje; Jis paklausė AI „kuriame pogrupyje tai reikšminga? YZ nuskaitė amžiaus, lyties ir regiono derinius ir nustatė „p = 0,03 35–44 metų miesto moterims“. Straipsnis buvo parengtas remiantis šiuo pogrupiu. Jo replikacija nerado jokio poveikio: tai buvo dešimčių pogrupių atsitiktinumo rezultatas. Pamoka: pasirinktas pogrupis po duomenų HARKing, o ne patvirtinimo.

2 atvejis – Konversijos medžioklė. Santykis, kuris studento lygmens formoje pasirodo beprasmis; išbandė jį rąsto, kvadratinės šaknies, kvadrato ir atsilikimo formomis; Jis nustatė p=0,048 log-log formoje ir pranešė tik tai. Laimei, viena iš 5 bandytų formų peržengė slenkstį. Teisingas būdas buvo: iš anksto pasirinkti formą su teorija ir parodyti visų formų rezultatą jautrumo lentelėje. Pamoka: selektyvus ataskaitų teikimas suteikia klaidingą reikšmę.

3 atvejis. Kaip veikia sąžiningas kadravimas. Viena komanda iš anksto užsiregistravo prieš analizę: viena pirminė hipotezė, vienas pagrindinis modelis, du iš anksto nustatyti pogrupiai, Bonferroni korekcija. Pagrindinis poveikis nebuvo reikšmingas, tačiau komanda apie tai pranešė sąžiningai; Tyrinėjantis asmuo vieną radinį pažymėjo kaip „turi būti išbandytas ateityje“. Tyrimas buvo atkuriamas ir patikimas. Pamoka: nuoširdžiai planuojant net „nepavyksta“ rezultatas yra vertas.

Dažnos klaidos

  • Nurodykite AI „rasti prasmingų rezultatų“. Tai tiesioginis p įsilaužimas; Įdėkite dirbtinį intelektą į sąžiningą rėmą, prašydami tikslumo, o ne rezultatų.
  • Atradimo pateikimas kaip patvirtinimas (HARKing). Klaidinga po duomenimis iškeltą hipotezę rašyti „aš tai numatiau nuo pat pradžių“; Pažymėkite tiriamąjį radinį.
  • Tiesiog pranešame apie gerus rezultatus. Rodyti visas patikrintas specifikacijas; Sentimentų analizės slėpimas pažeidžia vientisumą.
  • Pogrupio/konversijos patikra. Pasirinkus reikšmingiausią iš dešimčių pogrupių ar transformacijų, gaunami klaidingi duomenys; iš anksto nustatyti ir pataisyti.
  • Pamiršote, kiek testų atlikote. Sekite bendrą bandymų skaičių; Nežinant šio skaičiaus, jokia p reikšmė negali būti interpretuojama sąžiningai.
Patarimas: prieš užrašydami radinį, paklauskite savęs: „Kiek būdų tyliai išbandžiau, kol radau šį rezultatą, ir ar apie juos visus pranešu? Jei kai kurie rašiniai lieka stalčiuje, jūsų pranešimas atrodo stipresnis nei yra.

Apibendrinant

p-hacking, HARKing, selektyvios ataskaitos ir išsišakojusių takų sodas; Daugelis yra spąstų, kurie veikia netyčia, bet sukuria klaidingus, neatkuriamus radinius. AI pagreitina šias spąstus, nes gali akimirksniu išbandyti daugybę analizių; „Rasti reikšmingų rezultatų“ tipo užklausos paverčia dirbtinį intelektą p-hacking varikliu. Gynyba; atskirti atradimą nuo patvirtinimo naudojant išankstinės registracijos ir analizės planą, pranešti apie visas specifikacijas ir jautrumo analizę, ištaisyti kelis palyginimus ir sukurti dirbtinį intelektą į sąžiningą sistemą, kuri reikalauja „teisingo rezultato“. Galutinė atsakomybė visada tenka tyrėjui.

Taikymo užduotis

Pasirinkite tyrimo klausimą ir prieš peržiūrėdami duomenis parašykite trumpą analizės planą: pirminė hipotezė, pagrindinis modelis, pirminis rezultato kintamasis, iš anksto apibrėžti pogrupiai, kelių palyginimo strategija. Tada įvertinkite pagrindinį modelį. Tada atlikite jautrumo analizę (skirtingi valdikliai, pašalinis įtraukimas / neįtrauktas, skirtinga funkcijos forma) ir parodykite visus rezultatus vienoje lentelėje. Vienoje pastraipoje įvertinkite, kurie veiksmai kelia p-įsilaužimo riziką ir kaip jūsų sąžininga sistema juos riboja.

kontrolinis sąrašas

  • [ ] Prieš pasinerdamas į duomenis, parašiau analizės planą / pagrindinį modelį.
  • [ ] Atskirai pažymėjau tiriamąją ir patvirtinamąją analizes; Aš ne HARKingas.
  • [ ] Pranešiau apie visas bandytas specifikacijas; Išsirinkau ne tik gražiąją.
  • [ ] Pogrupius ir transformacijas apibrėžiau iš anksto, po duomenų neskenavau.
  • [ ] Sekiau, kiek testų atlikau, ir pritaikiau reikiamą pataisą.
  • [ ] DI naudojau kontekste „rasti tiesą“, o ne „rasti tai prasmingą“; Prisiėmiau atsakomybę.