Mga nadagdag:
- Unawain na ang p-hacking, HARKing, selective na pag-uulat, at ang hardin ng sawang mga landas ay gumagawa ng mga maling natuklasan at tingnan kung paano mapabilis ng artificial intelligence ang mga bitag na ito
- Kakayahang magtatag ng mga depensa gaya ng pre-registration, analysis plan, multiple comparison na disiplina at sensitivity analysis na may suporta sa artificial intelligence
- Kakayahang i-internalize ang tapat na disenyo ng kahilingan na magbibigay-daan sa artificial intelligence na tanggihan ang mga uri ng kahilingan sa 'hanapin ang makabuluhang resulta' at ang panghuling responsibilidad ay nasa mananaliksik.
Sa nakaraang unit nakita natin kung ano ang p-value at kung ano ang hindi. Sa yunit na ito titingnan natin ang isang mas madilim na paksa, ang mga sistematikong bitag na nagbabanta sa integridad ng istatistika. Karamihan sa mga ito ay hindi sinasadyang pandaraya; Ang mga ito ay mga mapanlinlang na mekanismo na kahit na ang mga mananaliksik na may mahusay na intensyon ay nahuhulog nang hindi namamalayan. At ginagawang mas madali at mas mabilis ng artificial intelligence (AI) ang mga pitfall na ito, dahil ginagawang posible na magpatakbo ng dose-dosenang pagsusuri sa loob ng ilang segundo. Ang layunin ng unit na ito ay itatag ang disiplina na magpapabago sa AI mula sa isang "meaningful result finding machine" tungo sa isang matapat na katulong.
Mga pangunahing pitfalls
p-hacking (p-value hunting): Sinusubukan nitong muli ang pagsusuri sa iba't ibang paraan hanggang sa magkaroon ng makabuluhang resulta (p<0.05). Pagdaragdag at pag-aalis ng mga variable, pagpili ng mga subsample, pagpapalit ng kahulugan ng mga outlier, pagsubok ng iba't ibang pagbabago, paggamit ng iba't ibang mga variable ng resulta, paghinto ng pagkolekta ng data kapag ito ay naging makabuluhan... Ang bawat pagtatangka ay nagbibigay ng bagong "pagkakataon"; Kung magsisikap ka nang husto, ang isa sa mga ito ay magiging makabuluhan, kahit na ito ay talagang walang epekto. Ang resulta: mga huwad na natuklasan na na-publish ngunit hindi maaaring kopyahin.
HARKing (Hypothesizing After the Results are Known): Paggawa ng hypothesis pagkatapos makita ang mga resulta at ipakita ito bilang "Hula ko itong ganito mula pa sa simula". Tinitingnan mo ang data at nakita ang pinakakapansin-pansing relasyon, pagkatapos ay isulat ang papel na parang idinisenyo upang subukan ang hypothesis na iyon. Nililinlang nito ang mambabasa sa pamamagitan ng paggawa ng pagtuklas na parang kumpirmasyon.
Selective reporting (cherry-picking): Ang pag-uulat lamang ng mga "magagaling" mula sa dose-dosenang pagsusuri at tahimik na ibinaon ang iba. Ito ay kilala rin bilang "problema sa file drawer": nananatili sa drawer ang walang kabuluhang mga resulta, na ginagawang sistematikong bias ang panitikan.
Hardin ng nagsasawang mga landas: Ang termino ni Andrew Gelman. Kahit na walang iisang sinadyang p-hacking, ang mananaliksik ay gumagawa ng maraming makatwirang mga pagpipilian batay sa data (aling variable, aling threshold, aling subgroup, aling pagbabago). Napakaraming antas ng kalayaan sa pagsisiyasat na ito na epektibong pinipili mo ang makabuluhan mula sa maraming pagsusuri—kahit na walang anumang masamang layunin. Ang resulta ay muling tumataas na false positive rate.
Babala: Karamihan sa mga bitag na ito ay hindi sinasadyang mga panlilinlang. Ang kabuuan ng mga tila inosenteng hakbang tulad ng "Subukan ko lang ang ilang higit pang mga modelo", "mas malinis kapag tinanggal ko ang outlier", "mas malinaw ang epekto sa subgroup na ito" ay maaaring makagawa ng isang huwad na paghahanap. Ang katapatan ay isang bagay ng pamamaraan, hindi intensyon.
Bakit pinalaki ng AI ang mga bitag na ito?
Ang pagsubok ng 3 modelo sa pamamagitan ng kamay ay nangangailangan ng oras; Gumagawa ang YZ ng 50 variant ng modelo, 10 iba't ibang conversion, 8 subgroup sa ilang minuto. Ang kapangyarihang ito ay nakapipinsala nang walang tapat na plano: isang kahilingan tulad ng "hanapin ang isang makabuluhang relasyon sa data na ito" o "bumuo ng isang modelo na sumusuporta sa hypothesis na ito" na direktang ginagawang p-hacking engine ang AI. Nais din ng AI na maging matulungin; ay may posibilidad na makahanap ng isang "makabuluhang" resulta na magbibigay-kasiyahan sa iyo. Iyon ang dahilan kung bakit ang iyong maagap na disenyo ay ang unang linya ng depensa ng katapatan.
Mga Depensa: patas na kurso ng negosyo
1. Pre-registration: Nangangahulugan ito ng pagtatala ng iyong hypothesis, variable, modelo at mga pagsubok nang nakasulat (maaaring sa isang time-stamped platform) bago isagawa ang pagsusuri. Kaya, ang pagtuklas ay nahiwalay sa kumpirmasyon; anumang babaguhin mo pagkatapos ay naka-tag bilang "explorer".
2. Plano ng pagsusuri: Kahit na hindi ka makapag-pre-record, magsulat ng plano ng pagsusuri bago sumisid sa data: pangunahing hypothesis, pangunahing variable ng resulta, pangunahing modelo. Itatag ang pagkakaiba sa pagitan ng "pangunahing pagsusuri" at "karagdagang/pagsusuri na pagsusuri" mula sa simula at panatilihin ito sa ulat.
3. Iulat ang lahat: Huwag itago ang mga modelong sinubukan mo. Sa seksyong "pagsusuri ng sensitivity" (pagsusuri ng katatagan), ipakita kung paano binabago ng iba't ibang mga detalye ang resulta. Ang paghahanap ay malakas lamang kung ito ay tumatagal sa ilalim ng maraming mga mapagpipiliang mapagpipilian.
4. Disiplina sa maraming paghahambing: Kung nakagawa ka ng napakaraming pagsusulit, iwasto ang mga ito (yunit 6). Sagutin ang tanong na "Ilang pagsubok na ang nagawa ko?" sa totoo lang.
5. Pagsusuri sa pagiging sensitibo: Ulitin ang iyong pangunahing paghahanap gamit ang ibang sample, ibang control set, at ibang pagbabago. Kung magbago ang resulta, huwag itago, iulat ito.
Tsart ng paghahambing: tapat kumpara sa bitag
Aplikasyon
hugis ng bitag
Matapat na katumbas
Pagpili ng modelo
Sinusubukan hanggang sa magkaroon ng kahulugan (p-hacking)
Pre-planned master model
hypothesis
Angkop pagkatapos ng katotohanan (HARKing)
Pre-recorded, bago ang data
Pag-uulat
Wag mo lang ipakita ang magaganda
Lahat ng mga pagtutukoy + sensitivity
subgroup
Pagpili ng pinaka-kapansin-pansin
Paunang natukoy, naitatama
pangongolekta ng datos
Itigil kapag ito ay may katuturan
paunang natukoy na sample
Apat na makokopya na prompt
1. Matapat na balangkas ng paghahabol:
Ang iyong tungkulin: tapat na katulong sa istatistika. Ang aking layunin ay HINDI upang makahanap ng isang makabuluhang resulta, ngunit upang mahanap ang tamang resulta. MGA PANUNTUNAN:- HUWAG akong bigyan ng "subukan ang mga modelo hanggang sa maging makabuluhan" ang uri ng mga mungkahi,- sabihin sa akin kung nagmumungkahi ka ng maramihang mga detalye na kailangan nilang lahat na iulat,- balaan ako sa anumang mga hakbang na maaaring humantong sa p-hacking. Tulungan akong linawin muna ang aking pangunahing modelo, ihiwalay ang pagtuklas sa kumpirmasyon.
2. Draft ng plano ng pagsusuri:
Tulungan akong mag-draft ng isang paunang plano sa pagsusuri para sa isang pag-aaral: pangunahing hypothesis, pangunahing variable ng resulta, pangunahing detalye ng modelo, mga paunang natukoy na subgroup, maramihang diskarte sa paghahambing. Ilagay ang "exploratory" at "confirmatory" na pagsusuri sa magkahiwalay na heading. Paalalahanan akong punan ito nang HINDI TINITINGIN ang data.
3. Pagsusuri sa pagiging sensitibo:
Ang aking pangunahing paghahanap ay isulat ang sensitivity analysis code (R) para sa Aking layunin ay TINGNAN kung gaano katibay ang resulta, HINDI ang piliin ang pinakamahusay; ipakita ang lahat ng mga resulta.
4. Pagsubaybay sa sarili:
Ipapaliwanag ko ang aking proseso ng pagsusuri; Bigyan mo ako ng checklist para sa p-hacking / HARKing / selective reporting at markahan kung alin sa aking mga hakbang ang delikado. Tanungin mo ako kung ilang modelo/pagsubok ang nasubukan ko at kung alin ang balak kong iulat.
Mahinang prompt / Malakas na prompt
Mahinang prompt:
Aling mga variable ang nagpapakita ng makabuluhang ugnayan sa data na ito, hanapin ang pinakamahusay na modelo.
Ang prompt na ito ay isang direktang p-hacking na pagtuturo: ang AI ay sumusubok ng dose-dosenang mga kumbinasyon at ipinapakita ang isa na "pinakamahusay." Ang resulta ay halos tiyak na isang huwad na paghahanap na hindi maaaring kopyahin.
Napakahusay na prompt:
Ang iyong tungkulin: matapat na katulong. Ang PANGUNAHING modelo na paunang natukoy ko ay: Y ~ X + na mga kontrol. Sumulat ng code na hinuhulaan ang modelong ito. HUWAG maghanap ng ibang "mas makabuluhang" modelo. Magmungkahi din ng sensitivity analysis para makita ko ang tibay ng resulta, ngunit alam kong iuulat ko ang LAHAT ng resulta, hindi pipiliin ang pinakamahusay. Huwag hayaang isulat ko ang anumang natuklasang eksplorasyon bilang 'nakumpirma'.
Pagkakaiba: inaayos ng malakas na kalooban ang pangunahing modelo, ipinagbabawal ang paghahanap, at hinihiling na iulat ang lahat ng resulta.
tatlong mini case
Kaso 1 — Pangangaso ng subgroup. Walang nakitang epekto ang isang mananaliksik sa kabuuang sample; Tinanong niya ang AI "sa aling subgroup ito makabuluhan?" Sinuri ng YZ ang mga kumbinasyon ng edad, kasarian at rehiyon at nakitang "p = 0.03 sa mga babaeng taga-lungsod na may edad 35-44". Ang artikulo ay batay sa subgroup na ito. Walang nakitang epekto ang kanyang pagtitiklop: resulta ito ng pagkakataon mula sa dose-dosenang mga subgroup. Aralin: napiling subgroup pagkatapos ng data ay HARKing, hindi nagkukumpirma.
Kaso 2 — Pangangaso ng conversion. Ang relasyon na lumalabas na walang kabuluhan sa anyo ng antas ng mag-aaral; sinubukan ito sa log, square root, square at lag form; Natagpuan niya ang p=0.048 sa log-log form at iniulat lamang iyon. Sa kabutihang-palad, isa sa 5 form na sinubukang tumawid sa threshold. Ang tamang paraan ay: paunang piliin ang form na may teorya at ipakita ang resulta ng lahat ng form sa sensitivity table. Aralin: ang piling pag-uulat ay nagdudulot ng maling kahalagahan.
Kaso 3 — Paano gumagana ang matapat na pag-frame. Isang koponan ang na-preregister bago ang pagsusuri: nag-iisang pangunahing hypothesis, nag-iisang pangunahing modelo, dalawang paunang natukoy na mga subgroup, pagwawasto ng Bonferroni. Ang pangunahing epekto ay hindi makabuluhan, ngunit ang koponan ay iniulat ito nang matapat; Na-flag ng explorer na indibidwal ang isang paghahanap bilang "kailangang masuri sa hinaharap." Ang pag-aaral ay maaaring kopyahin at maaasahan. Aral: ang matapat na pagpaplano ay ginagawang kahit na ang "fail" na kinalabasan ay sulit.
Mga karaniwang pagkakamali
- Pagsasabi sa AI na "maghanap ng mga makabuluhang resulta." Ito ay tuwid na p-hacking; Ilagay ang AI sa isang tapat na frame, humihingi ng katumpakan, hindi mga resulta.
- Ang pagtatanghal ng pagtuklas bilang kumpirmasyon (HARKing). Ito ay nakaliligaw na isulat ang hypothesis na itinatag pagkatapos ng data bilang "Hula ko ito mula sa simula"; Lagyan ng label ang natuklasang eksplorasyon.
- Nag-uulat lamang ng magagandang resulta. Ipakita ang lahat ng mga pagtutukoy na nasubok; Ang pagtatago ng pagsusuri ng damdamin ay nakompromiso ang integridad.
- Screening ng subgroup/conversion. Ang pagpili ng pinakamahalaga sa dose-dosenang mga subgroup o pagbabago ay nagbubunga ng mga huwad na natuklasan; kilalanin at ayusin nang maaga.
- Nakakalimutan mo na kung ilang pagsubok na ang nagawa mo. Subaybayan ang kabuuang bilang ng mga pagtatangka; Walang p-value ang mabibigyang kahulugan nang tapat nang hindi nalalaman ang numerong ito.
Tip: Bago isulat ang isang paghahanap, tanungin ang iyong sarili: "Ilang paraan ang tahimik kong sinubukan hanggang sa makita ko ang resultang ito, at iniuulat ko ba ang lahat ng ito?" Kung ang ilan sa mga sanaysay ay mananatili sa drawer, ang iyong ulat ay mukhang mas malakas kaysa ito.
Sa buod
p-hacking, HARKing, selective na pag-uulat, at ang hardin ng sawang mga landas; Marami ang mga bitag na kumikilos nang hindi sinasadya ngunit nagbubunga ng mga huwad, hindi maibabalik na mga natuklasan. Pinapabilis ng AI ang mga pitfalls na ito dahil maaari nitong subukan ang dose-dosenang pagsusuri kaagad; Ang mga kahilingan sa uri ng “hanapin ang mga makabuluhang resulta” ay ginagawang p-hacking engine ang AI. Depensa; paghihiwalay ng pagtuklas mula sa kumpirmasyon gamit ang isang pre-registration at analysis plan, pag-uulat ng lahat ng mga detalye at sensitivity analysis, pagwawasto ng maraming paghahambing, at paglalagay ng AI sa isang matapat na balangkas na humihiling ng "tamang resulta." Ang pangwakas na responsibilidad ay laging nasa mananaliksik.
Gawain ng aplikasyon
Pumili ng tanong sa pananaliksik at sumulat ng maikling plano sa pagsusuri bago tingnan ang data: pangunahing hypothesis, pangunahing modelo, pangunahing variable ng resulta, paunang natukoy na mga subgroup, maramihang diskarte sa paghahambing. Pagkatapos ay tantiyahin ang pangunahing modelo. Pagkatapos ay magsagawa ng pagsusuri sa sensitivity (iba't ibang mga kontrol, kasama/ibinukod na outlier, iba't ibang anyo ng pag-andar) at ipakita ang lahat ng mga resulta sa isang talahanayan. Sa isang talata, suriin kung aling mga hakbang ang nagdudulot ng panganib ng p-hacking at kung paano nililimitahan ng iyong matapat na balangkas ang mga ito.
checklist
- [ ] Sinulat ko ang analysis plan/master model bago sumabak sa data.
- [ ] Nilagyan ko ng label ang exploratory at confirmatory analysis nang hiwalay; Hindi ako nagha-HARK.
- [ ] Iniulat ko ang lahat ng mga pagtutukoy na sinubukan ko; Hindi lang maganda ang pinili ko.
- [ ] Tinukoy ko muna ang mga subgroup at pagbabago, hindi ko na-scan ang mga ito pagkatapos ng data.
- [ ] Sinusubaybayan ko kung gaano karaming mga pagsubok ang aking naisagawa at inilapat ang kinakailangang pagwawasto.
- [ ] Ginamit ko ang AI sa konteksto ng "hanapin ang katotohanan" sa halip na "hanapin itong makabuluhan"; Kinuha ko ang responsibilidad.