Voitot:
- Ymmärrä, että p-hakkerointi, HARKing, valikoiva raportointi ja haarautuvien polkujen puutarha tuottavat vääriä löydöksiä ja katso kuinka tekoäly voi nopeuttaa näitä ansoja
- Kyky luoda puolustuskeinoja, kuten ennakkorekisteröinti, analyysisuunnitelma, monivertailukuri ja herkkyysanalyysi tekoälyn tuella
- Kyky sisäistää rehellinen pyyntösuunnittelu, jonka avulla tekoäly voi hylätä "löydä mielekäs tulos" -tyyppiset pyynnöt ja että lopullinen vastuu on tutkijalla.
Edellisessä yksikössä näimme mikä p-arvo on ja mikä se ei ole. Tässä osiossa tarkastellaan synkempää aihetta, tilastollista eheyttä uhkaavia systemaattisia ansoja. Suurin osa näistä ei ole tahallista huijausta; Nämä ovat salakavalia mekanismeja, joihin jopa hyvää tarkoittavat tutkijat lankeavat huomaamattaan. Ja tekoäly (AI) tekee näistä sudenkuopista sekä helpompaa että nopeampaa, koska sen avulla on mahdollista suorittaa kymmeniä analyyseja sekunneissa. Tämän yksikön tavoitteena on luoda kurinalaisuus, joka muuttaa tekoälyn "merkityksestä tulostenhakukoneesta" rehelliseksi avustajaksi.
Perusongelmat
p-hakkerointi (p-arvon metsästys): Se yrittää analyysiä uudelleen eri tavoilla, kunnes saadaan merkittävä tulos (p<0,05). Muuttujien lisääminen ja poistaminen, alinäytteiden valinta, poikkeavien määritelmien muuttaminen, erilaisten muunnosten kokeilu, erilaisten tulosmuuttujien käyttö, tiedonkeruun lopettaminen, kun se tulee mielekkääksi... Jokainen yritys antaa uuden "mahdollisuuden"; Jos yrität tarpeeksi lujasti, yksi niistä osoittautuu merkitykselliseksi, vaikka sillä ei todellisuudessa olisikaan vaikutusta. Tulos: vääriä löydöksiä, jotka julkaistiin, mutta joita ei voida toistaa.
HARKing (hypoteesi, kun tulokset ovat tiedossa): Hypoteesin tekeminen tulosten nähtyään ja sen esittäminen "ennustin sen näin alusta asti". Katsot tietoja ja löydät silmiinpistävimmän suhteen ja kirjoitat sitten paperin ikään kuin se olisi suunniteltu testaamaan tätä hypoteesia. Tämä johtaa lukijaa harhaan saamalla löydön näyttämään vahvistukselta.
Valikoiva raportointi (kirsikkapoiminta): Raportoidaan vain "hyvät" kymmenistä analyyseistä ja haudataan hiljaa loput. Tätä kutsutaan myös "tiedostolaatikon ongelmaksi": merkityksettömät tulokset jäävät laatikkoon, mikä tekee kirjallisuudesta systemaattisesti puolueellista.
Haaroittuvien polkujen puutarha: Andrew Gelmanin termi. Jopa ilman yhtä tahallista p-hakkerointia, tutkija tekee monia järkeviä valintoja datan perusteella (mikä muuttuja, mikä kynnys, mikä alaryhmä, mikä muunnos). Näitä tutkivia vapausasteita on niin lukuisia, että valitset monien analyysien joukosta tehokkaasti merkityksellisen – jopa ilman mitään pahaa tarkoitusta. Tuloksena on jälleen nouseva väärien positiivisten määrä.
Varoitus: Useimmat näistä ansoista eivät ole tahallisia temppuja. Näennäisesti viattomien vaiheiden summa, kuten "kokeilin juuri muutamaa mallia lisää", "se oli puhtaampaa, kun poistin poikkeaman", "vaikutus on selkeämpi tässä alaryhmässä" voi tuottaa harhaanjohtavan havainnon. Rehellisyys on menetelmäkysymys, ei tarkoitus.
Miksi tekoäly suurentaa näitä ansoja?
Kolmen mallin kokeileminen käsin vie aikaa; YZ tuottaa 50 malliversiota, 10 eri muunnelmaa, 8 alaryhmää minuuteissa. Tämä voima on tuhoisa ilman rehellistä suunnitelmaa: pyyntö, kuten "löydä merkityksellinen suhde näistä tiedoista" tai "rakenta malli, joka tukee tätä hypoteesia", muuttaa tekoälyn suoraan p-hakkerointimoottoriksi. Tekoäly haluaa myös olla hyödyllinen; pyrkii löytämään "merkittävän" tuloksen, joka tyydyttää sinua. Siksi nopea suunnittelusi on rehellisyyden ensimmäinen puolustuslinja.
Puolustukset: reilua toimintaa
1. Ennakkoilmoittautuminen: Se tarkoittaa hypoteesien, muuttujien, mallin ja testien kirjaamista kirjallisesti (mahdollisesti aikaleimatulla alustalla) ennen analyysin suorittamista. Siten löytö erotetaan vahvistuksesta; kaikki mitä muutat myöhemmin, merkitään "tutkijaksi".
2. Analyysisuunnitelma: Vaikka et pystyisikään tallentamaan etukäteen, kirjoita analyysisuunnitelma ennen dataan sukeltamista: ensisijainen hypoteesi, ensisijainen tulosmuuttuja, päämalli. Tee ero "pääanalyysin" ja "lisä-/kartoitusanalyysin" välillä alusta alkaen ja säilytä se raportissa.
3. Ilmoita kaikesta: Älä piilota kokeilemiasi malleja. Näytä "herkkyysanalyysi" (lujuustarkastus) -osiossa, kuinka erilaiset spesifikaatiot muuttavat tulosta. Löytö on vahva vain, jos se kestää monia uskottavia valintoja.
4. Useita vertailuja: Jos olet tehnyt liian monta testiä, korjaa ne (yksikkö 6). Vastaa kysymykseen "Kuinka monta testiä olen tehnyt?" rehellisesti.
5. Herkkyysanalyysi: Toista päälöydös eri näytteellä, eri ohjaussarjalla ja erilaisella muunnolla. Jos tulos muuttuu, älä piilota sitä, vaan ilmoita siitä.
Vertailukaavio: rehellinen vs. ansa
Sovellus
ansa muoto
Rehellinen vastine
Mallin valinta
Yritetään, kunnes siinä on järkeä (p-hakkerointi)
Ennalta suunniteltu mestarimalli
hypoteesi
Sovittaminen jälkikäteen (HARKing)
Esitallennettu, ennen dataa
Raportointi
Älä näytä vain kauniita
Kaikki tekniset tiedot + herkkyys
alaryhmä
Valitsemalla silmiinpistävin
Ennalta määritetty, korjattavissa
tiedonkeruu
Lopeta, kun se on järkevää
ennalta määrätty näyte
Neljä kopioitavaa kehotetta
1. Rehellinen väitekehys:
Tehtäväsi: rehellinen tilastoavustaja. Tavoitteeni EI ole löytää mielekästä tulosta, vaan löytää oikea tulos. SÄÄNNÖT:- ÄLÄ anna minulle "kokeile malleja, kunnes se tekee järkevää" -tyyppisiä ehdotuksia - kerro minulle, jos ehdotat useita eritelmiä, ne kaikki on raportoitava - varoita minua kaikista vaiheista, jotka voivat johtaa p-hakkerointiin. Auta minua selventämään päämallini ensin, erota löytö vahvistuksesta.
2. Analyysisuunnitelmaluonnos:
Auta minua laatimaan alustava analyysisuunnitelma tutkimukselle: ensisijainen hypoteesi, ensisijainen tulosmuuttuja, päämallin spesifikaatio, ennalta määritetyt alaryhmät, usean vertailun strategia. Laita "tutkimukselliset" ja "vahvistavat" analyysit erillisiin otsikoihin. Muistuta minua täyttämään tämä ILMAN tietoja.
3. Herkkyysanalyysi:
Päähavaintoni on kirjoittaa herkkyysanalyysikoodi (R) tavoitteelleni. Tavoitteeni on NÄHDÄ kuinka vakaa tulos on, EI valita parasta; näytä kaikki tulokset.
4. Itsevalvonta:
Selitän analyysiprosessini; Anna minulle tarkistuslista p-hakkerointia / HARKIA / valikoivaa raportointia varten ja merkitse, mitkä vaiheistani ovat riskialttiita. Kysy minulta takaisin, kuinka monta mallia/testiä olen kokeillut ja mitkä aion raportoida.
Heikko kehote / Vahva kehote
Heikko kehote:
Mitkä muuttujat osoittavat merkittäviä suhteita näissä tiedoissa, etsi paras malli.
Tämä kehote on suora p-hakkerointiohje: tekoäly kokeilee kymmeniä yhdistelmiä ja esittää sen, joka on "järkevin". Tulos on lähes varmasti harhahavainto, jota ei voida toistaa.
Tehokas kehotus:
Roolisi: rehellinen avustaja. MAIN-malli, jonka olen ennalta määrittänyt, on: Y ~ X + -ohjaimet. Kirjoita koodi, joka ennustaa tämän mallin. ÄLÄ etsi toista "merkittävämpää" mallia. Ehdota myös herkkyysanalyysiä, jotta voin nähdä tuloksen kestävyyden, mutta tiedä, että raportoin KAIKKI tulokset, en valitse parasta. Älä anna minun kirjoittaa mitään tutkimushavaintoja "vahvistetuiksi".
Ero: vahva tahto korjaa päämallin, estää haun ja vaatii kaikkien tulosten raportoinnin.
kolme minilaukkua
Tapaus 1 – Alaryhmämetsästys. Yksi tutkija ei löytänyt vaikutusta kokonaisotoksesta; Hän kysyi tekoälyltä "missä alaryhmässä se on merkittävää?" YZ skannasi iän, sukupuolen ja alueen yhdistelmät ja löysi "p = 0,03 35-44-vuotiailla kaupunkinaisilla". Artikkeli perustui tähän alaryhmään. Hänen replikaationsa ei löytänyt vaikutusta: tämä johtui kymmenien alaryhmien sattumasta. Oppitunti: valittu alaryhmä, kun tiedot on HARKing, ei vahvista.
Tapaus 2 – Konversion metsästys. Suhde, joka osoittautuu opiskelijatason muodossa merkityksettömäksi; kokeillut sitä hirsi-, neliöjuuri-, neliö- ja viivemuodoissa; Hän löysi p = 0,048 log-log muodossa ja raportoi vain sen. Onneksi yksi viidestä kokeilusta muodosta ylitti kynnyksen. Oikea tapa oli: esivalita lomake teorialla ja näyttää kaikkien muotojen tulos herkkyystaulukossa. Oppitunti: valikoiva raportointi tuottaa väärän merkityksen.
Tapaus 3 – Kuinka rehellinen kehystys toimii. Yksi ryhmä esirekisteröityi ennen analyysiä: yksi ensisijainen hypoteesi, yksi päämalli, kaksi ennalta määritettyä alaryhmää, Bonferroni-korjaus. Päävaikutus ei ollut merkittävä, mutta tiimi raportoi sen rehellisesti; Tutkimushenkilö merkitsi yhden havainnon "tulevaisuudessa testattavaksi". Tutkimus oli toistettava ja luotettava. Oppitunti: rehellinen suunnittelu tekee jopa "epäonnistuneesta" tuloksesta kannattavan.
Yleisiä virheitä
- Tekoälyn käskeminen "löytää merkityksellisiä tuloksia". Tämä on suoraa p-hakkerointia; Aseta tekoäly rehelliseen kehykseen ja pyydä tarkkuutta, ei tuloksia.
- Löytön esittäminen vahvistuksena (HARKing). On harhaanjohtavaa kirjoittaa tietojen jälkeen asetettu hypoteesi "ennustin sen alusta asti"; Merkitse tutkimuslöydös.
- Vain raportoida hyvistä tuloksista. Näytä kaikki testatut tekniset tiedot; Tunneanalyysin piilottaminen vaarantaa eheyden.
- Alaryhmä/muunnosseulonta. Merkittävimmän valitseminen kymmenistä alaryhmistä tai transformaatioista tuottaa vääriä löydöksiä; tunnistaa ja korjata etukäteen.
- Unohdat kuinka monta testiä olet tehnyt. Pidä kirjaa yritysten kokonaismäärästä; Mitään p-arvoa ei voida tulkita rehellisesti ilman tätä lukua.
Vinkki: Ennen kuin kirjoitat löydön muistiin, kysy itseltäsi: "Kuinka monta tapaa olen hiljaa kokeillut, kunnes löysin tämän tuloksen, ja ilmoitanko niistä kaikista?" Jos osa esseistä jää laatikkoon, raporttisi näyttää vahvemmalta kuin se on.
Yhteenvetona
p-hakkerointi, HARKing, valikoiva raportointi ja haarautuvien polkujen puutarha; Monet ovat ansoja, jotka toimivat tahattomasti, mutta tuottavat vääriä, toistamattomia löydöksiä. Tekoäly nopeuttaa näitä sudenkuoppia, koska se voi kokeilla kymmeniä analyyseja välittömästi; "löydä merkityksellisiä tuloksia" -tyyppiset pyynnöt tekevät tekoälystä p-hakkerointimoottorin. Puolustus; löydön erottaminen vahvistuksesta esirekisteröinti- ja analyysisuunnitelmalla, kaikkien spesifikaatioiden ja herkkyysanalyysin raportoiminen, useiden vertailujen korjaaminen ja tekoälyn asettaminen rehelliseen kehykseen, joka vaatii "oikean tuloksen". Lopullinen vastuu on aina tutkijalla.
Sovellustehtävä
Valitse tutkimuskysymys ja kirjoita lyhyt analyysisuunnitelma ennen tietojen tarkastelua: ensisijainen hypoteesi, päämalli, ensisijainen tulosmuuttuja, ennalta määritellyt alaryhmät, monivertailustrategia. Arvioi sitten päämalli. Tee sitten herkkyysanalyysi (eri kontrollit, poikkeamat mukaan lukien/poissuljettu, eri funktiomuoto) ja näytä kaikki tulokset yhdessä taulukossa. Arvioi yhdessä kappaleessa, mitkä vaiheet aiheuttavat p-hakkeroinnin riskin ja kuinka rehellinen kehys rajoittaa niitä.
tarkistuslista
- [ ] Kirjoitin analyysisuunnitelman/päämallin ennen kuin sukelsin dataan.
- [ ] Merkitsin tutkivan ja vahvistavan analyysin erikseen; En ollut HARKING.
- [ ] Olen raportoinut kaikki kokeilemani tekniset tiedot; En valinnut vain kaunista.
- [ ] Määrittelin alaryhmät ja muunnokset etukäteen, en skannannut niitä tietojen jälkeen.
- [ ] Pidin kirjaa siitä, kuinka monta testiä olin suorittanut ja tein tarvittavat korjaukset.
- [ ] Käytin tekoälyä kontekstissa "löydä totuus" pikemminkin kuin "löydä se merkityksellisenä"; Otin vastuun.