Vahid 7 / 11

p-hacking, HARKing və Statistik Dürüstlük: Süni İntellekt Çağının Tələləri

Qazanclar:

  • Anlayın ki, p-hacking, HARKing, selektiv hesabatlar və çəngəl yollar bağçası saxta tapıntılar yaradır və süni intellektin bu tələləri necə sürətləndirə biləcəyini görün.
  • Süni intellekt dəstəyi ilə əvvəlcədən qeydiyyat, analiz planı, çoxsaylı müqayisə intizamı və həssaslıq analizi kimi müdafiə vasitələri qurmaq bacarığı
  • Süni intellektin “mənalı nəticə tapmaq” tipli sorğuları rədd etməsinə imkan verəcək və son məsuliyyətin tədqiqatçının üzərinə düşməsinə imkan verəcək vicdanlı sorğu dizaynını mənimsəyə bilmək.

Əvvəlki bölmədə biz p-dəyərinin nə olduğunu və nəyin olmadığını gördük. Bu bölmədə biz daha qaranlıq bir mövzuya, statistik bütövlüyü təhdid edən sistematik tələlərə baxacağıq. Bunların əksəriyyəti qəsdən aldatma deyil; Bunlar hətta yaxşı niyyətli tədqiqatçıların da fərqinə varmadan düşdüyü məkrli mexanizmlərdir. Süni intellekt (AI) isə bu tələləri həm asanlaşdırır, həm də daha sürətli edir, çünki saniyələr ərzində onlarla analiz aparmağa imkan verir. Bu bölmənin məqsədi süni intizamı "mənalı nəticə axtaran maşından" dürüst köməkçiyə çevirəcək nizam-intizam yaratmaqdır.

Əsas tələlər

p-hacking (p-dəyəri ovu): Əhəmiyyətli bir nəticə (p<0.05) əldə edilənə qədər təhlili müxtəlif üsullarla yenidən sınayır. Dəyişənlərin əlavə edilməsi və çıxarılması, alt nümunələrin seçilməsi, kənar göstəricilərin tərifinin dəyişdirilməsi, müxtəlif transformasiyaların sınanması, müxtəlif nəticə dəyişənlərindən istifadə, məlumatların toplanması mənalı olduqda dayandırılması... Hər cəhd yeni bir “şans” verir; Əgər kifayət qədər cəhd etsəniz, əslində heç bir təsiri olmasa belə, onlardan biri mənalı olacaq. Nəticə: dərc edilmiş, lakin təkrarlana bilməyən saxta tapıntılar.

HARKing (Nəticələr məlum olduqdan sonra fərziyyə irəli sürmək): Nəticələri gördükdən sonra fərziyyə irəli sürmək və onu “əvvəldən belə proqnozlaşdırmışdım” kimi təqdim etmək. Siz məlumatlara baxırsınız və ən təəccüblü əlaqəni tapırsınız, sonra kağızı elə yazın ki, sanki bu fərziyyəni yoxlamaq üçün nəzərdə tutulub. Bu, kəşfin təsdiqi kimi görünməklə oxucunu çaşdırır.

Seçilmiş hesabat (albalı toplama): Onlarla təhlildən yalnız "yaxşı" olanları bildirmək və qalanlarını səssizcə basdırmaq. Bu, həm də "fayl çekmecesi problemi" kimi tanınır: mənasız nəticələr qutuda qalır və ədəbiyyatı sistematik olaraq qərəzli edir.

Yolların bağçası: Endryu Gelmanın termini. Tək bir qəsdən p-hacking olmasa belə, tədqiqatçı məlumatlara (hansı dəyişən, hansı həddi, hansı alt qrup, hansı transformasiya) əsaslanaraq bir çox ağlabatan seçimlər edir. Bu araşdırma azadlığı dərəcələri o qədər çoxdur ki, siz çoxlu təhlillər arasından mənalı olanı seçirsiniz - hətta heç bir pis niyyət olmadan. Nəticə yenə yüksələn yanlış müsbət nisbətdir.

Diqqət: Bu tələlərin əksəriyyəti qəsdən edilən hiylələr deyil. “Mən indicə daha bir neçə model sınamışam”, “Mən kənarı çıxaranda daha təmiz idi”, “Bu alt qrupda təsir daha aydındır” kimi zahirən günahsız addımların cəmi saxta tapıntı yarada bilər. Dürüstlük niyyət deyil, üsul məsələsidir.

AI niyə bu tələləri genişləndirir?

3 modeli əl ilə sınamaq vaxt tələb edir; YZ dəqiqə ərzində 50 model variantı, 10 müxtəlif dönüşüm, 8 alt qrup istehsal edir. Bu güc vicdanlı bir plan olmadan fəlakətlidir: "bu məlumatda mənalı əlaqə tapın" və ya "bu fərziyyəni dəstəkləyən bir model qurun" kimi bir sorğu AI-ni birbaşa p-hacking mühərrikinə çevirir. AI də faydalı olmaq istəyir; sizi qane edəcək "mənalı" nəticə tapmağa meyllidir. Buna görə də sizin çevik dizaynınız dürüstlüyün ilk müdafiə xəttidir.

Müdafiə: ədalətli iş kursu

1. Öncədən qeydiyyat: Təhlil etməzdən əvvəl hipotezinizi, dəyişənlərinizi, modelinizi və testlərinizi yazılı şəkildə (bəlkə də vaxt möhürlənmiş platformada) qeyd etmək deməkdir. Beləliklə, kəşf təsdiqdən ayrılır; sonra dəyişdirdiyiniz hər şey "kəşfiyyatçı" olaraq qeyd olunur.

2. Təhlil planı: Əvvəlcədən qeyd edə bilməsəniz belə, məlumatlara dalmadan əvvəl bir analiz planı yazın: ilkin fərziyyə, ilkin nəticə dəyişəni, əsas model. “Əsas təhlil” və “əlavə/kəşfiyyat xarakterli təhlil” arasındakı fərqi əvvəldən müəyyənləşdirin və hesabatda saxlayın.

3. Hər şeyi bildirin: Sınadığınız modelləri gizlətməyin. “Həssaslıq təhlili” (sağlamlığın yoxlanılması) bölməsində müxtəlif spesifikasiyaların nəticəni necə dəyişdiyini göstərin. Tapıntı yalnız bir çox inandırıcı seçimlər altında dayandığı təqdirdə güclüdür.

4. Çoxsaylı müqayisə intizamı: Əgər çoxlu testlər etmisinizsə, onları düzəldin (vahid 6). “Neçə test etmişəm?” sualına cavab verin. vicdanla.

5. Həssaslıq təhlili: Əsas tapıntınızı fərqli nümunə, fərqli nəzarət dəsti və fərqli transformasiya ilə təkrarlayın. Nəticə dəyişirsə, onu gizlətməyin, bildirin.

Müqayisə cədvəli: dürüst və tələ

Ərizə

tələ forması

Dürüst ekvivalent

Model seçimi

Məntiqli olana qədər cəhd edin (p-hacking)

Əvvəlcədən planlaşdırılmış master model

fərziyyə

Faktdan sonra uyğunlaşma (HARKing)

Əvvəlcədən qeydə alınmış, verilənlərdən əvvəl

Hesabat

Yalnız gözəl olanları göstərməyin

Bütün spesifikasiyalar + həssaslıq

alt qrup

Ən diqqət çəkəni seçmək

Əvvəlcədən təyin edilmiş, düzəldilə bilən

məlumatların toplanması

Məntiqi olanda dayan

əvvəlcədən müəyyən edilmiş nümunə

Dörd kopyalana bilən sorğu

1. Dürüst iddia çərçivəsi:

Sizin rolunuz: dürüst statistika köməkçisi. Məqsədim mənalı nəticə tapmaq deyil, düzgün nəticə tapmaqdır. QAYDALAR:- Mənə "məntiqi olana qədər modelləri sınayın" tipli təkliflər VERMƏYİN, - bir neçə spesifikasiya təklif edirsinizsə, onların hamısının bildirilməsi lazım olduğunu bildirin, - p-hackingə gətirib çıxara biləcək addımlar barədə məni xəbərdar edin. Əvvəlcə mənim əsas modelimi aydınlaşdırmağa kömək edin, kəşfi təsdiqdən ayırın.

2. Təhlil planının layihəsi:

Tədqiqat üçün ilkin təhlil planının hazırlanmasında mənə kömək edin: ilkin fərziyyə, əsas nəticə dəyişəni, əsas model spesifikasiyası, əvvəlcədən təyin edilmiş alt qruplar, çoxsaylı müqayisə strategiyası. "Kəşfiyyat" və "təsdiqedici" təhlilləri ayrı-ayrı başlıqlara qoyun. Məlumatlara BAXMADAN bunu doldurmağı mənə xatırlat.

3. Həssaslıq təhlili:

Mənim əsas tapıntım həssaslıq təhlili kodunu (R) yazmaqdır. Məqsədim nəticənin nə qədər möhkəm olduğunu GÖRMƏKdir, ən yaxşısını seçmək DEYİL; bütün nəticələri göstərin.

4. Özünə nəzarət:

Təhlil prosesimi izah edəcəyəm; Mənə p-hacking / HARKing / selektiv hesabat üçün yoxlama siyahısı verin və hansı addımlarımın riskli olduğunu qeyd edin. Məndən neçə model/test sınadığımı və hansıları bildirməyi planlaşdırdığımı soruşun.

Zəif məlumat / Güclü göstəriş

Zəif çağırış:

Hansı dəyişənlər bu məlumatda əhəmiyyətli əlaqələri göstərir, ən yaxşı modeli tapın.

Bu göstəriş birbaşa p-hacking təlimatıdır: AI onlarla birləşməni sınayır və "ən mənalı" olanı təqdim edir. Nəticə, demək olar ki, təkrarlana bilməyən saxta bir tapıntıdır.

Güclü göstəriş:

Sizin rolunuz: vicdanlı köməkçi. Əvvəlcədən təyin etdiyim ƏSAS model: Y ~ X + idarəediciləri. Bu modeli proqnozlaşdıran kodu yazın. Başqa "daha mənalı" model axtarmayın. Həssaslıq təhlilini də təklif edin ki, nəticənin möhkəmliyini görə bilim, amma bilin ki, ən yaxşısını seçməyərək, BÜTÜN nəticələri bildirəcəyəm. Heç bir kəşfiyyat tapıntısını “təsdiqlənmiş” kimi yazmağıma icazə verməyin.

Fərq: güclü iradə əsas modeli düzəldir, axtarışı qadağan edir və bütün nəticələrin bildirilməsini tələb edir.

üç mini qutu

1-ci hal – Alt qrup ovçuluğu. Bir tədqiqatçı ümumi nümunədə heç bir təsir tapmadı; O, AI-dən "hansı alt qrupda əhəmiyyətlidir?" YZ yaş, cins və bölgə birləşmələrini skan etdi və "35-44 yaşlı şəhər qadınlarında p = 0.03" tapdı. Məqalə bu alt qrupa əsaslanırdı. Onun təkrarlanması heç bir təsir göstərmədi: bu, onlarla alt qrupun təsadüfi nəticəsi idi. Dərs: məlumatlar HARKing edildikdən sonra seçilmiş alt qrup təsdiqlənmir.

2-ci hal - Konversiya ovçuluğu. Tələbə səviyyəli formada mənasız olduğu ortaya çıxan əlaqə; log, kvadrat kök, kvadrat və lag formalarında sınaqdan keçirdi; O, log-log şəklində p=0,048 tapdı və yalnız bunu bildirdi. Xoşbəxtlikdən, sınanan 5 formadan biri həddi keçdi. Düzgün yol bu idi: nəzəriyyə ilə formanı əvvəlcədən seçmək və həssaslıq cədvəlində bütün formaların nəticəsini göstərmək. Dərs: seçmə hesabat yanlış əhəmiyyət kəsb edir.

Məsələn 3 - Dürüst çərçivə necə işləyir. Təhlildən əvvəl əvvəlcədən qeydiyyatdan keçmiş bir komanda: tək əsas fərziyyə, tək əsas model, əvvəlcədən təyin edilmiş iki alt qrup, Bonferroni korreksiyası. Əsas təsir əhəmiyyətli deyildi, lakin komanda bunu vicdanla bildirdi; Kəşfiyyatçı şəxs bir tapıntını "gələcəkdə sınaqdan keçirilməlidir" kimi qeyd etdi. Tədqiqat təkrarlana bilən və etibarlı idi. Dərs: dürüst planlaşdırma hətta “uğursuz” nəticəni də dəyərli edir.

Ümumi səhvlər

  • AI-yə "mənalı nəticələr tapmağı" söyləmək. Bu birbaşa p-hackingdir; AI-ni dürüst bir çərçivəyə qoyun, nəticə yox, dəqiqlik tələb edin.
  • Tapıntının təsdiq kimi təqdim edilməsi (HARKing). Verilənlərdən sonra qurulan fərziyyəni “mən bunu əvvəldən proqnozlaşdırmışdım” kimi yazmaq yanlışdır; Kəşfiyyat tapıntısını etiketləyin.
  • Yalnız yaxşı nəticələr barədə məlumat verin. Test edilmiş bütün spesifikasiyaları göstərin; Hisslərin təhlilini gizlətmək dürüstlüyə xələl gətirir.
  • Alt qrup/çevirmə skrininqi. Onlarla alt qrup və ya çevrilmələrdən ən əhəmiyyətlisini seçmək saxta tapıntılar yaradır; əvvəlcədən müəyyənləşdirin və düzəldin.
  • Nə qədər test etdiyinizi unudursunuz. Cəhdlərin ümumi sayını izləyin; Bu rəqəmi bilmədən heç bir p-dəyəri vicdanla şərh edilə bilməz.
İpucu: Nəticəni yazmazdan əvvəl özünüzdən soruşun: "Bu nəticəni tapana qədər səssizcə neçə yol sınamışam və hamısını bildirirəmmi?" Bəzi esselər çekmecede qalırsa, hesabatınız olduğundan daha güclü görünür.

Xülasə

p-hacking, HARKing, selektiv hesabat və çəngəl yollar bağı; Bir çoxları təsadüfən işləyən, lakin saxta, təkrar olunmayan tapıntılar yaradan tələlərdir. Süni intellekt bu tələləri sürətləndirir, çünki o, dərhal onlarla analizi sınaya bilir; "Mənalı nəticələr tapın" tipli sorğular AI-ni p-hacking mühərrikinə çevirir. Müdafiə; əvvəlcədən qeydiyyat və təhlil planı ilə kəşfi təsdiqdən ayırmaq, bütün spesifikasiyaları və həssaslıq təhlilini bildirmək, çoxsaylı müqayisələri düzəltmək və AI-ni “düzgün nəticə” tələb edən dürüst bir çərçivəyə yerləşdirmək. Son məsuliyyət həmişə tədqiqatçının üzərinə düşür.

Tətbiq tapşırığı

Tədqiqat sualı seçin və məlumatlara baxmazdan əvvəl qısa təhlil planı yazın: ilkin fərziyyə, əsas model, ilkin nəticə dəyişəni, əvvəlcədən təyin edilmiş alt qruplar, çoxsaylı müqayisə strategiyası. Sonra əsas modeli qiymətləndirin. Sonra həssaslıq təhlili aparın (müxtəlif nəzarətlər, kənar göstəricilər daxil edilmiş/çıxarılmış, fərqli funksiya forması) və bütün nəticələri bir cədvəldə göstərin. Bir paraqrafda hansı addımların p-hacking riski yaratdığını və dürüst çərçivənizin onları necə məhdudlaşdırdığını qiymətləndirin.

yoxlama siyahısı

  • [ ] Mən məlumatlara dalmadan əvvəl analiz planını/master modeli yazdım.
  • [ ] Mən kəşfiyyat və təsdiqləyici analizləri ayrıca etiketlədim; Mən HARKing deyildim.
  • [ ] Mən cəhd etdiyim bütün spesifikasiyaları bildirdim; Mən sadəcə gözəl olanı seçməmişəm.
  • [ ] Mən alt qrupları və transformasiyaları əvvəlcədən müəyyən etdim, verilənlərdən sonra onları skan etmədim.
  • [ ] Mən neçə test keçirdiyimi qeyd etdim və lazımi düzəlişləri tətbiq etdim.
  • [ ] Mən süni intellektdən “mənalı tapmaq” əvəzinə “həqiqəti tapmaq” kontekstində istifadə etdim; Mən məsuliyyəti öz üzərimə götürdüm.