Fitimet:
- Kuptoni se hakimi p, HARKing, raportimi selektiv dhe kopshti i shtigjeve të forta prodhojnë gjetje të rreme dhe shikoni se si inteligjenca artificiale mund t'i përshpejtojë këto kurthe
- Aftësia për të vendosur mbrojtje të tilla si regjistrimi paraprak, plani i analizës, disiplina e krahasimit të shumëfishtë dhe analiza e ndjeshmërisë me mbështetjen e inteligjencës artificiale
- Të jesh në gjendje të brendësosh dizajnin e sinqertë të kërkesës që do t'i mundësojë inteligjencës artificiale të refuzojë kërkesat e tipit "të gjejë rezultatin kuptimplotë" dhe se përgjegjësia përfundimtare i takon studiuesit.
Në njësinë e mëparshme pamë se çfarë është vlera p dhe çfarë nuk është. Në këtë njësi do të shikojmë një temë më të errët, kurthe sistematike që kërcënojnë integritetin statistikor. Shumica e këtyre nuk janë mashtrime të qëllimshme; Këto janë mekanizma tinëzarë në të cilat bien edhe studiuesit me qëllime të mira pa e kuptuar. Dhe inteligjenca artificiale (AI) i bën këto gracka më të lehta dhe më të shpejta, pasi bën të mundur kryerjen e dhjetëra analizave në sekonda. Qëllimi i kësaj njësie është të vendosë disiplinën që do ta shndërrojë AI nga një "makinë e gjetjes së rezultateve kuptimplotë" në një asistent të ndershëm.
Grackat themelore
p-hacking (gjuetia p-value): Po provon sërish analizën në mënyra të ndryshme derisa të merret një rezultat domethënës (p<0.05). Shtimi dhe heqja e variablave, përzgjedhja e nën-kampionëve, ndryshimi i përkufizimit të outliers, testimi i transformimeve të ndryshme, përdorimi i variablave të ndryshëm të rezultateve, ndalimi i mbledhjes së të dhënave kur bëhet kuptimplotë... Çdo përpjekje jep një "shans" të ri; Nëse përpiqeni mjaftueshëm, njëra prej tyre do të jetë kuptimplotë, edhe nëse në të vërtetë nuk ka asnjë efekt. Rezultati: gjetje të rreme që u publikuan, por jo të riprodhueshme.
HARKing (Hypothesizing After the Results are Known): Bërja e një hipoteze pasi të keni parë rezultatet dhe ta paraqisni atë si "Unë e parashikova kështu që në fillim". Ju shikoni të dhënat dhe gjeni marrëdhënien më të habitshme, pastaj shkruani letrën sikur të ishte krijuar për të testuar atë hipotezë. Kjo e mashtron lexuesin duke e bërë zbulimin të duket si konfirmim.
Raportimi selektiv (mbledhja e qershisë): Raportimi i vetëm “të mirëve” nga dhjetëra analiza dhe varrosja në heshtje e pjesës tjetër. Ky njihet edhe si "problemi i sirtarit të skedarëve": rezultatet e pakuptimta mbeten në sirtar, duke e bërë literaturën sistematike të njëanshme.
Kopshti i shtigjeve të pirunëve: termi i Andrew Gelman. Edhe pa një hakim të vetëm p të qëllimshëm, studiuesi bën shumë zgjedhje të arsyeshme bazuar në të dhënat (cila variabël, cili prag, cili nëngrup, cili transformim). Këto shkallë hetuese lirie janë aq të shumta sa ju po zgjidhni në mënyrë efektive atë kuptimplotë nga një mori analizash – edhe pa ndonjë qëllim të keq. Rezultati është përsëri një normë false pozitive në rritje.
Kujdes: Shumica e këtyre kurtheve nuk janë truke të qëllimshme. Shuma e hapave në dukje të pafajshme si "sapo provova disa modele të tjera", "ishte më e pastër kur hoqa pjesën e jashtme", "efekti është më i qartë në këtë nëngrup" mund të prodhojë një gjetje të rreme. Ndershmëria është çështje metode, jo qëllimi.
Pse AI i zmadhon këto kurthe?
Të provosh 3 modele me dorë kërkon kohë; YZ prodhon 50 variante modeli, 10 konvertime të ndryshme, 8 nëngrupe në minuta. Kjo fuqi është katastrofike pa një plan të ndershëm: një kërkesë si "gjeni një marrëdhënie kuptimplotë në këto të dhëna" ose "ndërtoni një model që mbështet këtë hipotezë" e kthen AI drejtpërdrejt në një motor hakerimi p. AI gjithashtu dëshiron të jetë i dobishëm; priret të gjejë një rezultat "kuptimplotë" që do t'ju kënaqë. Kjo është arsyeja pse dizajni juaj i shpejtë është linja e parë e mbrojtjes së ndershmërisë.
Mbrojtjet: kurs i drejtë i biznesit
1. Regjistrim paraprak: Do të thotë të regjistroni hipotezën, variablat, modelin dhe testet tuaja me shkrim (mundësisht në një platformë të vulosur me kohë) përpara se të kryeni analizën. Kështu, zbulimi ndahet nga konfirmimi; çdo gjë që ndryshoni më pas është etiketuar si "eksplorues".
2. Plani i analizës: Edhe nëse nuk mund të regjistroni paraprakisht, shkruani një plan analize përpara se të zhyteni në të dhënat: hipoteza primare, variabli i rezultatit primar, modeli kryesor. Vendosni dallimin midis "analizës kryesore" dhe "analizës shtesë/eksploruese" që në fillim dhe ruajeni atë në raport.
3. Raportoni gjithçka: Mos i fshihni modelet që keni provuar. Në seksionin "Analiza e ndjeshmërisë" (kontrolli i qëndrueshmërisë), tregoni se si specifikime të ndryshme ndryshojnë rezultatin. Gjetja është e fortë vetëm nëse qëndron në shumë zgjedhje të besueshme.
4. Disiplina e krahasimit të shumëfishtë: Nëse keni bërë shumë teste, korrigjoni ato (njësia 6). Përgjigjuni pyetjes "Sa teste kam bërë?" sinqerisht.
5. Analiza e ndjeshmërisë: Përsëritni gjetjen tuaj kryesore me një kampion të ndryshëm, grup të ndryshëm kontrolli dhe transformime të ndryshme. Nëse rezultati ndryshon, mos e fshihni, raportojeni.
Grafiku krahasues: kurthi i ndershëm kundrejt
Aplikimi
formë kurthi
Ekuivalent i sinqertë
Zgjedhja e modelit
Duke u përpjekur derisa të ketë kuptim (p-hacking)
Model master i planifikuar paraprakisht
hipoteza
Përshtatja pas faktit (HARKing)
Para-regjistruar, përpara të dhënave
Raportimi
Mos trego vetëm ato të bukurat
Të gjitha specifikimet + ndjeshmëria
nëngrupi
Zgjedhja më e habitshme
E paracaktuar, e korrigjueshme
mbledhjen e të dhënave
Ndalo kur të ketë kuptim
mostra e paracaktuar
Katër kërkesa të kopjueshme
1. Korniza e ndershme e pretendimit:
Roli juaj: asistent i sinqertë i statistikave. Qëllimi im NUK është të gjej një rezultat kuptimplotë, por të gjej rezultatin e duhur. RREGULLAT:- MOS më jepni sugjerime të tipit "provoni modele derisa të ketë kuptim", - më tregoni nëse sugjeroni specifikime të shumta që të gjitha duhet të raportohen, - më paralajmëroni për çdo hap që mund të çojë në p-hacking. Më ndihmo të sqaroj së pari modelin tim kryesor, të ndaj zbulimin nga konfirmimi.
2. Drafti i planit të analizës:
Më ndihmo të hartoj një plan analize paraprake për një studim: hipoteza primare, variabli i rezultatit parësor, specifikimi i modelit kryesor, nëngrupet e paracaktuara, strategjia e krahasimit të shumëfishtë. Vendosni analizat "eksploruese" dhe "konfirmuese" në tituj të veçantë. Më kujto ta plotësoj këtë PA TË KËSHTUAR të dhënat.
3. Analiza e ndjeshmërisë:
Gjetja ime kryesore është të shkruaj kodin e analizës së ndjeshmërisë (R) për qëllimin tim është të shoh sa solid është rezultati, JO të zgjedh më të mirën; tregojnë të gjitha rezultatet.
4. Vetë-monitorimi:
Unë do të shpjegoj procesin tim të analizës; Më jep një listë kontrolli për p-hacking / HARKing / raportim selektiv dhe shëno cilët nga hapat e mi janë të rrezikshëm. Më pyesni sa modele/teste kam provuar dhe cilat prej tyre planifikoj të raportoj.
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
Cilat variabla tregojnë marrëdhënie domethënëse në këto të dhëna, gjeni modelin më të mirë.
Ky urdhër është një udhëzim i drejtpërdrejtë i hakerimit: AI provon dhjetëra kombinime dhe paraqet atë që "ka më shumë kuptim". Rezultati është pothuajse me siguri një zbulim i rremë që nuk mund të përsëritet.
Njoftim i fuqishëm:
Roli juaj: asistent i ndershëm. Modeli KRYESOR që kam paracaktuar është: Y ~ X + kontrollet. Shkruani kodin që parashikon këtë model. MOS kërkoni një model tjetër "më kuptimplotë". Gjithashtu sugjeroni një analizë të ndjeshmërisë në mënyrë që të mund të shoh qëndrueshmërinë e rezultatit, por dijeni se unë do të raportoj TË GJITHA rezultatet, jo të zgjedh më të mirën. Mos më lejoni të shkruaj asnjë gjetje eksploruese si 'të konfirmuar'.
Dallimi: vullneti i fortë rregullon modelin kryesor, ndalon kërkimin dhe kërkon që të gjitha rezultatet të raportohen.
tre mini kuti
Rasti 1 - Gjuetia në nëngrup. Një studiues nuk gjeti asnjë efekt në kampionin e përgjithshëm; Ai pyeti AI "në cilin nëngrup është i rëndësishëm?" YZ skanoi kombinimet e moshës, gjinisë dhe rajonit dhe gjeti "p = 0.03 në gratë urbane të moshës 35-44 vjeç". Artikulli u bazua në këtë nëngrup. Replikimi i tij nuk gjeti asnjë efekt: ky ishte rezultat i rastësisë nga dhjetëra nëngrupe. Mësimi: nëngrupi i zgjedhur pasi të dhënat po HARKohen, nuk konfirmohen.
Rasti 2 - Gjuetia e konvertimit. Marrëdhënia që rezulton e pakuptimtë në një formë studentore; e provoi në format log, rrënjë katrore, katrore dhe lag; Ai gjeti p=0.048 në formën log-log dhe raportoi vetëm atë. Për fat, një nga 5 format e provuara e kaloi pragun. Mënyra e saktë ishte: të para-zgjedhim formularin me teori dhe të tregojmë rezultatin e të gjitha formave në tabelën e ndjeshmërisë. Mësimi: raportimi selektiv prodhon rëndësi të rreme.
Rasti 3 - Si funksionon inkuadrimi i ndershëm. Një ekip i pararegjistruar përpara analizës: hipotezë e vetme primare, model i vetëm kryesor, dy nëngrupe të paracaktuara, korrigjim Bonferroni. Efekti kryesor nuk ishte i rëndësishëm, por ekipi e raportoi me ndershmëri; Individi hulumtues shënoi një gjetje si "duhet të testohet në të ardhmen". Studimi ishte i riprodhueshëm dhe i besueshëm. Mësimi: planifikimi i ndershëm e bën të vlefshëm edhe rezultatin "dështon".
Gabimet e zakonshme
- Duke i thënë AI që "të gjejë rezultate domethënëse". Kjo është e drejtë deri p-hacking; Vendoseni AI në një kornizë të sinqertë, duke kërkuar saktësi, jo rezultate.
- Paraqitja e zbulimit si konfirmim (HARKing). Është mashtruese të shkruhet hipoteza e krijuar pas të dhënave si “e kam parashikuar që në fillim”; Etiketoni gjetjen hulumtuese.
- Thjesht raportoni rezultate të mira. Trego të gjitha specifikimet e testuara; Fshehja e analizës së ndjenjave komprometon integritetin.
- Ekzaminimi i nëngrupit/konvertimit. Zgjedhja më e rëndësishme nga dhjetëra nëngrupe ose transformime prodhon gjetje të rreme; identifikoni dhe rregulloni paraprakisht.
- Duke harruar sa teste keni bërë. Mbani gjurmët e numrit të përgjithshëm të përpjekjeve; Asnjë vlerë p nuk mund të interpretohet sinqerisht pa e ditur këtë numër.
Këshillë: Përpara se të shkruani një gjetje, pyesni veten: "Sa mënyra kam provuar në heshtje derisa kam gjetur këtë rezultat dhe a po i raportoj të gjitha?" Nëse disa nga esetë qëndrojnë në sirtar, raporti juaj duket më i fortë se sa është.
Në përmbledhje
p-hacking, HARKing, raportim selektiv dhe kopshti i shtigjeve të degëzimit; Shumë prej tyre janë kurthe që funksionojnë pa dashje, por prodhojnë gjetje të rreme dhe të papërsëritshme. AI i përshpejton këto gracka sepse mund të provojë dhjetëra analiza në çast; Kërkesat e tipit "gjeni rezultate kuptimplote" e kthejnë AI në një motor p-hacking. Mbrojtja; ndarja e zbulimit nga konfirmimi me një plan pararegjistrimi dhe analize, raportimi i të gjitha specifikimeve dhe analizave të ndjeshmërisë, korrigjimi i krahasimeve të shumta dhe vendosja e AI në një kornizë të ndershme që kërkon "rezultatin e duhur". Përgjegjësia përfundimtare i takon gjithmonë studiuesit.
Detyra e aplikimit
Zgjidhni një pyetje kërkimore dhe shkruani një plan të shkurtër analize përpara se të shikoni të dhënat: hipoteza parësore, modeli kryesor, variabla e rezultatit parësor, nëngrupet e paracaktuara, strategjia e krahasimit të shumëfishtë. Pastaj vlerësoni modelin kryesor. Më pas bëni një analizë të ndjeshmërisë (kontrolle të ndryshme, të përfshira/të përjashtuara, forma të ndryshme funksioni) dhe tregoni të gjitha rezultatet në një tabelë të vetme. Në një paragraf, vlerësoni se cilët hapa paraqesin rrezik për hakimin p dhe se si korniza juaj e ndershme i kufizon ato.
listë kontrolli
- [ ] Kam shkruar planin e analizës/modelin kryesor përpara se të zhytesha në të dhënat.
- [ ] I etiketova veçmas analizat eksploruese dhe konfirmuese; Unë nuk isha HARKING.
- [ ] Kam raportuar të gjitha specifikimet që kam provuar; Nuk zgjodha vetëm të bukurën.
- [ ] Nëngrupet dhe transformimet i kam përcaktuar më parë, nuk i kam skanuar pas të dhënave.
- [ ] Kam mbajtur shënim se sa teste kisha bërë dhe aplikova korrigjimin e nevojshëm.
- [ ] Unë përdora AI në kontekstin e "gjeni të vërtetën" në vend që të "gjeni atë kuptimplotë"; Mora përgjegjësinë.