Kasu:
- Mõistke, et p-häkkimine, HARKimine, valikuline aruandlus ja hargnevate teede aed toovad välja valeandmeid ja vaadake, kuidas tehisintellekt võib neid lõkse kiirendada
- Võimalus luua tehisintellekti toega kaitsemehhanisme, nagu eelregistreerimine, analüüsiplaan, mitmekordse võrdluse distsipliin ja tundlikkusanalüüs
- Võimalus sisestada ausa taotluse kujundus, mis võimaldab tehisintellektil lükata tagasi „tähendusliku tulemuse leidmise” tüüpi taotlused ja et lõplik vastutus lasub teadlasel.
Eelmises ühikus nägime, mis on p-väärtus ja mis mitte. Selles üksuses vaatleme tumedamat teemat, süstemaatilisi lõkse, mis ohustavad statistilist terviklikkust. Enamik neist ei ole tahtlik petmine; Need on salakavalad mehhanismid, millesse satuvad isegi heade kavatsustega teadlased, ilma et nad sellest aru saaksid. Ja tehisintellekt (AI) muudab need lõksud nii lihtsamaks kui ka kiiremaks, kuna võimaldab sekunditega läbi viia kümneid analüüse. Selle üksuse eesmärk on luua distsipliin, mis muudab AI "tähendusliku tulemuse leidmise masinast" ausaks assistendiks.
Põhilised lõksud
p-häkkimine (p-väärtuse jaht): see proovib analüüsi uuesti erinevatel viisidel, kuni saadakse oluline tulemus (p<0,05). Muutujate lisamine ja eemaldamine, alamvalimite valimine, kõrvalekallete määratluse muutmine, erinevate teisenduste proovimine, erinevate tulemusmuutujate kasutamine, andmete kogumise peatamine, kui see muutub tähendusrikkaks... Iga katse annab uue "võimaluse"; Kui pingutate piisavalt, osutub üks neist tähendusrikkaks, isegi kui sellel pole tegelikult mingit mõju. Tulemus: võltsitud leiud, mis avaldati, kuid ei olnud reprodutseeritavad.
HARKing (Hypotesizing After the Results are Known): hüpoteesi püstitamine pärast tulemuste nägemist ja selle esitamine kui "Ma ennustasin seda algusest peale niimoodi". Vaatate andmeid ja leiate kõige silmatorkavama seose, seejärel kirjutate paberi nii, nagu see oleks mõeldud selle hüpoteesi kontrollimiseks. See eksitab lugejat, muutes avastuse kinnitusena.
Valikuline aruandlus (kirsikorjamine): kümnetest analüüsidest ainult "headest" teatamine ja ülejäänu vaikselt maha matmine. Seda nimetatakse ka "failisahtli probleemiks": mõttetud tulemused jäävad sahtlisse, muutes kirjanduse süstemaatiliselt kallutatud.
Hargnevate teede aed: Andrew Gelmani termin. Isegi ilma ühegi tahtliku p-häkkimiseta teeb uurija andmete põhjal palju mõistlikke valikuid (milline muutuja, mis lävi, milline alarühm, milline teisendus). Neid uurimisvabaduse astmeid on nii palju, et valite paljude analüüside hulgast sisuka – isegi ilma pahatahtliku kavatsuseta. Tulemuseks on taas valepositiivsete tulemuste tõus.
Ettevaatust: enamik neist püünistest ei ole tahtlikud trikid. Näiliselt süütute sammude summa, nagu "proovisin just veel mõnda mudelit", "see oli puhtam, kui ma kõrvalekalde eemaldasin", "mõju on selles alarühmas selgem" võib anda vale leiu. Ausus on meetodi, mitte kavatsuse küsimus.
Miks AI neid lõkse suurendab?
3 mudeli käsitsi proovimine võtab aega; YZ toodab minutitega 50 mudelivarianti, 10 erinevat teisendust, 8 alarühma. See jõud on hukatuslik ilma ausa plaanita: taotlus nagu "leidke nendest andmetest tähenduslik seos" või "ehitage seda hüpoteesi toetav mudel" muudab AI otse p-häkkimise mootoriks. AI tahab ka abiks olla; kipub leidma "tähendusliku" tulemuse, mis sind rahuldab. Seetõttu on teie kiire kujundus aususe esimene kaitseliin.
Kaitsmised: õiglane äritegevus
1. Eelregistreerimine: see tähendab hüpoteesi, muutujate, mudeli ja testide kirjalikku salvestamist (võimalik, et ajatempliga platvormil) enne analüüsi sooritamist. Seega on avastus kinnitusest eraldatud; kõik, mida hiljem muudate, märgitakse kui "uurija".
2. Analüüsiplaan: isegi kui te ei saa eelnevalt salvestada, kirjutage enne andmetesse sukeldumist analüüsiplaan: esmane hüpotees, esmase tulemuse muutuja, põhimudel. Tehke algusest peale vahe "põhianalüüsi" ja "täiendava/uuriva analüüsi" vahel ning säilitage see aruandes.
3. Teatage kõigest: ärge varjake mudeleid, mida olete proovinud. Näidake jaotises "tundlikkusanalüüs" (robustsuse kontroll), kuidas erinevad spetsifikatsioonid tulemust muudavad. Leid on tugev ainult siis, kui see püsib paljude usutavate valikute korral.
4. Mitme võrdluse distsipliin: kui olete teinud liiga palju teste, parandage neid (üksus 6). Vastake küsimusele "Mitu testi ma olen teinud?" ausalt.
5. Tundlikkuse analüüs: korrake oma peamist leidu erineva valimi, erineva juhtkomplekti ja erineva teisendusega. Kui tulemus muutub, ära varja seda, anna sellest teada.
Võrdluskaart: aus vs lõks
Rakendus
lõksu kuju
Aus vaste
Mudeli valik
Proovin seni, kuni sellel on mõtet (p-häkkimine)
Eelplaneeritud meistermudel
hüpotees
Tagantjärele sobitamine (HARKing)
Eelsalvestatud, enne andmeid
Aruandlus
Ärge näidake ainult ilusaid
Kõik andmed + tundlikkus
alarühm
Kõige silmatorkavama valimine
Eelmääratletud, parandatav
andmete kogumine
Lõpetage, kui see on mõistlik
etteantud proov
Neli kopeeritavat viipa
1. Ausa nõude raamistik:
Sinu roll: aus statistikaassistent. Minu eesmärk EI ole leida sisulist tulemust, vaid leida õige tulemus. REEGLID:- ÄRGE andke mulle "proovige mudeleid, kuni see on mõttekas" tüüpi soovitusi, - öelge mulle, kui soovitate mitut spetsifikatsiooni, millest kõigist tuleb teatada, - hoiatage mind mis tahes sammude eest, mis võivad viia p-häkkimiseni. Aidake mul kõigepealt selgitada oma põhimudelit, eraldage avastus kinnitusest.
2. Analüüsiplaani kavand:
Aidake mul koostada uuringu esialgne analüüsiplaan: esmane hüpotees, esmase tulemuse muutuja, põhimudeli spetsifikatsioon, eelnevalt määratletud alarühmad, mitme võrdlusstrateegia. Pange "uurivad" ja "kinnitavad" analüüsid eraldi rubriikidesse. Tuleta mulle meelde, et see täitke ILMA andmeid VAATAMA.
3. Tundlikkuse analüüs:
Minu peamine leid on kirjutada tundlikkusanalüüsi kood (R) Minu eesmärk on NÄHA, kui kindel tulemus on, MITTE valida parimat; näita kõiki tulemusi.
4. Enesekontroll:
Selgitan oma analüüsiprotsessi; Andke mulle p-häkkimise / HARKimise / valikulise aruandluse kontrollnimekiri ja märkige, millised minu sammud on riskantsed. Küsige tagasi, mitu mudelit/testi olen proovinud ja millistest kavatsen raporteerida.
Nõrk viip / Tugev viip
Nõrk viip:
Millised muutujad näitavad nendes andmetes olulisi seoseid, leidke parim mudel.
See viip on otsene p-häkkimise juhend: AI proovib kümneid kombinatsioone ja esitab selle, millel on "kõige mõistlikum". Tulemuseks on peaaegu kindlasti võlts leid, mida ei saa korrata.
Võimas viip:
Sinu roll: aus assistent. PÕHImudel, mille olen eelnevalt kindlaks määranud, on: Y ~ X + juhtnupud. Kirjutage kood, mis ennustab seda mudelit. ÄRGE otsige teist "tähenduslikumat" mudelit. Soovitage ka tundlikkuse analüüsi, et saaksin näha tulemuse tugevust, kuid teadke, et teatan KÕIKID tulemused, mitte ei vali parimat. Ärge lubage mul ühtegi uurimistulemust "kinnitatuks" maha kanda.
Erinevus: tugev tahe fikseerib põhimudeli, keelab otsimise ja nõuab kõigist tulemustest teatamist.
kolm minikarpi
Juhtum 1 – alarühmajaht. Üks teadlane ei leidnud üldvalimis mingit mõju; Ta küsis AI-lt "millises alarühmas on see oluline?" YZ skaneeris vanuse, soo ja piirkonna kombinatsioone ning leidis "p = 0,03 linnanaistel vanuses 35-44". Artikkel põhines sellel alarühmal. Tema replikatsioon ei leidnud mingit mõju: see oli kümnete alarühmade juhuse tulemus. Õppetund: valitud alarühm pärast andmete HARKimist, mitte kinnitamist.
Juhtum 2 – konversioonijaht. Suhe, mis õpilase tasandi vormis mõttetuks osutub; proovinud seda palgi, ruutjuure, ruudu ja lag vormis; Ta leidis p = 0,048 log-log kujul ja teatas ainult sellest. Õnneks ületas üks 5 proovitud vormist läve. Õige viis oli: valida vorm koos teooriaga ja näidata kõigi vormide tulemus tundlikkuse tabelis. Õppetund: valikuline aruandlus annab vale tähenduse.
3. juhtum – aus raamimine toimib. Üks meeskond oli enne analüüsi eelregistreeritud: üks esmane hüpotees, üks põhimudel, kaks eelnevalt määratletud alarühma, Bonferroni korrektsioon. Peamine mõju ei olnud märkimisväärne, kuid meeskond teatas sellest ausalt; Uuriv isik märkis ühe leiu kui "tulevikus testimist". Uuring oli reprodutseeritav ja usaldusväärne. Õppetund: aus planeerimine muudab isegi "ebaõnnestumise" tulemuse väärt.
Levinud vead
- AI käsk "leida tähenduslikke tulemusi". See on otsene p-häkkimine; Pange AI ausatesse raamidesse, nõudes täpsust, mitte tulemusi.
- Avastuse esitamine kinnitusena (HARKing). On eksitav kirjutada andmete järele püstitatud hüpoteesi sõnadega "Ma ennustasin seda algusest peale"; Märgistage uurimuslik leid.
- Lihtsalt teatan headest tulemustest. Kuva kõik testitud spetsifikatsioonid; Sentimentanalüüsi varjamine seab ohtu terviklikkuse.
- Alarühmade/konversioonide sõelumine. Kümnete alarühmade või teisenduste hulgast kõige olulisema valimine annab võltstulemusi; eelnevalt tuvastada ja parandada.
- Unustades, kui palju teste olete teinud. Jälgige katsete koguarvu; Ühtegi p-väärtust ei saa ausalt tõlgendada ilma seda arvu teadmata.
Näpunäide. Enne leiu üleskirjutamist küsige endalt: "Kui palju viise olen vaikselt proovinud, kuni selle tulemuse leidsin, ja kas ma teatan neist kõigist?" Kui mõned esseed jäävad sahtlisse, tundub teie aruanne tugevam kui see on.
Kokkuvõttes
p-häkkimine, HARKimine, valikuline aruandlus ja hargnevate teede aed; Paljud on püünised, mis töötavad tahtmatult, kuid annavad võltsitud, reprodutseerimata leide. Tehisintellekt kiirendab neid lõkse, kuna suudab kohe proovida kümneid analüüse; "Leidke tähenduslikke tulemusi" tüüpi päringud muudavad AI p-häkkimise mootoriks. Kaitse; avastuse ja kinnituse eraldamine eelregistreerimise ja analüüsiplaaniga, kõigi spetsifikatsioonide ja tundlikkusanalüüsi aruandlus, mitmete võrdluste parandamine ja tehisintellekti seadmine ausasse raamistikku, mis nõuab "õiget tulemust". Lõplik vastutus lasub alati uurijal.
Rakenduse ülesanne
Valige uurimisküsimus ja kirjutage enne andmete vaatamist lühike analüüsiplaan: esmane hüpotees, põhimudel, esmase tulemuse muutuja, eelnevalt määratletud alarühmad, mitme võrdlusstrateegia. Seejärel hinnake põhimudelit. Seejärel tehke tundlikkuse analüüs (erinevad juhtelemendid, kõrvalekalle kaasatud/välistatud, erinev funktsioonivorm) ja kuvage kõik tulemused ühes tabelis. Hinnake ühes lõigus, millised sammud kujutavad endast p-häkkimise ohtu ja kuidas teie aus raamistik neid piirab.
kontrollnimekiri
- [ ] Kirjutasin analüüsiplaani/põhimudeli enne andmetesse sukeldumist.
- [ ] Märgistasin uurimuslikud ja kinnitavad analüüsid eraldi; Ma ei olnud HARKing.
- [ ] Olen teatanud kõikidest spetsifikatsioonidest, mida olen proovinud; Ma ei valinud ainult ilusat.
- [ ] Alarühmad ja teisendused defineerisin eelnevalt, pärast andmeid ei skaneerinud.
- [ ] Jälgisin, kui palju teste olen teinud, ja rakendasin vajalikku parandust.
- [ ] Kasutasin tehisintellekti kontekstis "leida tõde" mitte "leida see tähendusrikkaks"; Võtsin vastutuse.