Ünite 7 / 11

p-hacking, HARKing ve İstatistiksel Dürüstlük: Yapay Zeka Çağında Tuzaklar

Kazanimlar:

  • p-hacking, HARKing, seçmeli raporlama ve araştırmacı serbestlik derecelerinin (garden of forking paths) sahte bulgular ürettiğini kavrayıp yapay zekanın bu tuzakları nasıl hızlandırabileceğini görebilme
  • Ön kayıt (pre-registration), analiz planı, çoklu karşılaştırma disiplini ve duyarlılık analizi gibi savunmaları yapay zeka desteğiyle kurabilme
  • Yapay zekanın 'anlamlı sonucu bul' türü isteklerini reddetmesini sağlayacak dürüst istem tasarımını ve son sorumluluğun araştırmacıda olduğunu içselleştirebilme

Bir önceki ünitede p-değerinin ne olduğunu ve ne olmadığını gördük. Bu ünitede daha karanlık bir konuya, istatistiksel dürüstlüğü tehdit eden sistematik tuzaklara bakacağız. Bunların çoğu kasıtlı hile değildir; iyi niyetli araştırmacıların bile farkında olmadan düştüğü sinsi mekanizmalardır. Ve yapay zeka (YZ), onlarca analizi saniyeler içinde denemeyi mümkün kıldığı için bu tuzakları hem kolaylaştırır hem de hızlandırır. Bu ünitenin amacı, YZ'yi bir "anlamlı sonuç bulma makinesi" olmaktan çıkarıp dürüst bir yardımcıya dönüştürecek disiplini kurmaktır.

Temel tuzaklar

p-hacking (p-değeri avcılığı): Anlamlı bir sonuç (p<0,05) çıkana kadar analizi farklı biçimlerde tekrar denemektir. Değişken ekleyip çıkarmak, alt örneklem seçmek, aykırı değer tanımını değiştirmek, farklı dönüşümler denemek, farklı sonuç değişkeni kullanmak, veri toplamayı anlamlı çıkınca durdurmak... Her deneme yeni bir "şans" verir; yeterince denerseniz gerçekte hiçbir etki olmasa bile bir tanesi anlamlı çıkar. Sonuç: yayımlanan ama tekrarlanamayan sahte bulgular.

HARKing (Hypothesizing After the Results are Known): Sonuçları gördükten sonra hipotez kurup onu "baştan böyle öngörmüştüm" gibi sunmaktır. Veriye bakıp en çarpıcı ilişkiyi bulur, sonra makaleyi sanki o hipotezi test etmek için tasarlanmış gibi yazarsınız. Bu, keşfi teyit gibi göstererek okuyucuyu yanıltır.

Seçmeli raporlama (selective/cherry-picking): Yapılan onlarca analizden yalnızca "güzel" çıkanları raporlamak, gerisini sessizce gömmektir. Bu, "dosya çekmecesi problemi" (file drawer) olarak da bilinir: anlamsız sonuçlar çekmecede kalır, literatür sistematik olarak yanlı hâle gelir.

Çatallanan yollar bahçesi (garden of forking paths): Andrew Gelman'ın terimi. Tek bir kasıtlı p-hacking olmasa bile, araştırmacı veriye göre birçok makul seçim yapar (hangi değişken, hangi eşik, hangi alt grup, hangi dönüşüm). Bu araştırmacı serbestlik dereceleri o kadar çoktur ki, fiilen çok sayıda analizden anlamlı olanı seçmiş olursunuz — hiç kötü niyet olmadan bile. Sonuç yine yükselen yanlış pozitif oranıdır.

Dikkat: Bu tuzakların çoğu bilinçli hile değildir. "Sadece birkaç model daha denedim", "aykırı değeri atınca daha temiz oldu", "bu alt grupta etki daha net" gibi masum görünen adımların toplamı, sahte bir bulgu üretebilir. Dürüstlük, niyet değil yöntem meselesidir.

YZ bu tuzakları neden büyütür?

Elle 3 model denemek zaman alır; YZ 50 model varyantını, 10 farklı dönüşümü, 8 alt grubu dakikalar içinde üretir. Bu güç, dürüst bir plan olmadan felakettir: "Bu veride anlamlı bir ilişki bul" veya "bu hipotezi destekleyen bir model kur" gibi bir istek, YZ'yi doğrudan p-hacking motoruna çevirir. YZ ayrıca yardımsever olmak ister; sizi memnun edecek "anlamlı" bir sonuç bulmaya eğilimlidir. Bu yüzden istem tasarımınız dürüstlüğün ilk savunma hattıdır.

Savunmalar: dürüst iş akışı

1. Ön kayıt (pre-registration): Analizi yapmadan önce hipotezinizi, değişkenlerinizi, modelinizi ve testlerinizi yazılı olarak (mümkünse bir zaman damgalı platformda) kaydetmektir. Böylece keşif ile teyit ayrılır; sonradan değiştirdiğiniz her şey "keşifçi" olarak etiketlenir.

2. Analiz planı: Ön kayıt yapamasanız bile, veriye derinlemesine dalmadan önce bir analiz planı yazın: birincil hipotez, birincil sonuç değişkeni, ana model. "Ana analiz" ile "ek/keşifçi analiz" ayrımını baştan koyun ve raporda koruyun.

3. Her şeyi raporla: Denediğiniz modelleri gizlemeyin. "Duyarlılık analizi" (robustness check) bölümünde farklı spesifikasyonların sonucu nasıl değiştirdiğini gösterin. Bulgu ancak birçok makul seçim altında ayakta kalıyorsa güçlüdür.

4. Çoklu karşılaştırma disiplini: Çok test yaptıysanız düzeltin (6. ünite). "Kaç test yaptım" sorusunu dürüstçe cevaplayın.

5. Duyarlılık analizi: Ana bulgunuzu farklı örneklem, farklı kontrol seti ve farklı dönüşümle tekrarlayın. Sonuç değişiyorsa bunu saklamayın, raporlayın.

Karşılaştırma tablosu: dürüst vs. tuzak

Uygulama

Tuzak biçimi

Dürüst karşılığı

Model seçimi

Anlamlı çıkana kadar deneme (p-hacking)

Önceden planlanmış ana model

Hipotez

Sonuçtan sonra uydurma (HARKing)

Ön kayıtlı, veriden önce

Raporlama

Sadece güzelleri gösterme

Tüm spesifikasyonlar + duyarlılık

Alt grup

En çarpıcıyı seçme

Önceden tanımlı, düzeltmeli

Veri toplama

Anlamlı olunca durdurma

Önceden belirlenmiş örneklem

Dört kopyalanabilir prompt

1. Dürüst istem çerçevesi:

Rolün: dürüst istatistik asistanı. Amacım anlamlı sonuç bulmak DEĞİL,doğru sonucu bulmak. KURALLAR:- Bana "anlamlı çıkana kadar model dene" türü öneriler VERME,- birden çok spesifikasyon önerirsen hepsinin raporlanması gerektiğini söyle,- p-hacking'e yol açabilecek her adımda beni uyar.Önce ana modelimi netleştirmeme yardım et, keşfi teyitten ayır.

2. Analiz planı taslağı:

Bir çalışma için ön analiz planı taslağı hazırlamama yardım et:birincil hipotez, birincil sonuç değişkeni, ana model spesifikasyonu,önceden tanımlı alt gruplar, çoklu karşılaştırma stratejisi."Keşifçi" ve "teyit edici" analizleri ayrı başlıklara koy.Bunu veriye BAKMADAN doldurmam gerektiğini hatırlat.

3. Duyarlılık analizi:

Ana bulgum X~Y için duyarlılık analizi kodu yaz (R): aynı ilişkiyi(a) farklı kontrol değişkeni setleriyle, (b) aykırı değerler dahil/hariç,(c) log ve düzey formunda tekrar tahmin et ve katsayıları tek tablodayan yana göster. Amacım sonucun ne kadar sağlam olduğunu GÖRMEK,en güzelini seçmek DEĞİL; tüm sonuçları göster.

4. Kendi kendini denetleme:

Analiz sürecimi anlatacağım; bana p-hacking / HARKing / seçmeli raporlamaaçısından bir denetim listesi uygula ve hangi adımlarımın riskli olduğunuişaretle. Kaç model/test denediğimi ve hangilerini raporlamayı planladığımısoru olarak bana geri sor.

Zayıf prompt / Güçlü prompt

Zayıf prompt:

Bu veride hangi değişkenler anlamlı ilişki gösteriyor, en iyi modeli bul.

Bu istem doğrudan bir p-hacking talimatıdır: YZ onlarca kombinasyon deneyip "en anlamlı" olanı sunar. Sonuç neredeyse kesinlikle tekrarlanamayan sahte bir bulgudur.

Güçlü prompt:

Rolün: dürüst asistan. Önceden belirlediğim ANA model şu: Y ~ X + kontroller.Bu modeli tahmin eden kodu yaz. Başka "daha anlamlı" model ARAMA.Ayrıca bir duyarlılık analizi öner ki sonucun sağlamlığını göreyim,ama sonuçların HEPSİNİ raporlayacağımı, en güzelini seçmeyeceğimi bil.Keşifçi hiçbir bulguyu 'teyit edilmiş' gibi yazmama izin verme.

Fark: güçlü istem ana modeli sabitler, aramayı yasaklar ve tüm sonuçların raporlanmasını şart koşar.

Üç mini vaka

Vaka 1 — Alt grup avcılığı. Bir araştırmacı genel örneklemde etki bulamadı; YZ'ye "hangi alt grupta anlamlı" diye sordu. YZ yaş, cinsiyet, bölge kombinasyonlarını tarayıp "35-44 yaş kentli kadınlarda p=0,03" buldu. Makale bu alt grup üzerine kuruldu. Tekrar çalışması etkiyi bulamadı: bu, düzinelerce alt gruptan şans eseri çıkan bir sonuçtu. Ders: veriden sonra seçilen alt grup teyit değil, HARKing'dir.

Vaka 2 — Dönüşüm avcılığı. Bir öğrenci düzey formunda anlamsız çıkan ilişkiyi; log, karekök, kare ve gecikmeli formlarda denedi; log-log formunda p=0,048 buldu ve yalnızca onu raporladı. Denenen 5 formdan biri şans eseri eşiği geçmişti. Doğru yol: form seçimini kuramla önceden yapmak ve tüm formların sonucunu duyarlılık tablosunda göstermekti. Ders: seçmeli raporlama sahte anlamlılık üretir.

Vaka 3 — Dürüst çerçevenin işe yaraması. Bir ekip analizden önce ön kayıt yaptı: tek birincil hipotez, tek ana model, önceden tanımlı iki alt grup, Bonferroni düzeltmesi. Ana etki anlamlı çıkmadı ama ekip bunu dürüstçe raporladı; keşifçi bir bulguyu "gelecekte test edilmeli" diye ayrı işaretledi. Çalışma tekrarlanabilir ve güvenilir oldu. Ders: dürüst plan, "başarısız" sonucu bile değerli kılar.

Sık yapılan hatalar

  • YZ'ye "anlamlı sonuç bul" demek. Bu doğrudan p-hacking'dir; YZ'yi dürüst çerçeveye sokun, sonuç değil doğruluk isteyin.
  • Keşfi teyit gibi sunmak (HARKing). Veriden sonra kurulan hipotezi "baştan öngördüm" diye yazmak yanıltıcıdır; keşifçi bulguyu etiketleyin.
  • Sadece güzel sonuçları raporlamak. Denenen tüm spesifikasyonları gösterin; duyarlılık analizini saklamak dürüstlüğü bozar.
  • Alt grup/dönüşüm taraması. Onlarca alt grup ya da dönüşümden en anlamlısını seçmek sahte bulgu üretir; önceden tanımlayın ve düzeltin.
  • Kaç test yaptığını unutmak. Toplam deneme sayısını takip edin; bu sayı bilinmeden hiçbir p-değeri dürüstçe yorumlanamaz.
İpucu: Bir bulguyu yazmadan önce kendinize sorun: "Bu sonucu bulana kadar sessizce kaç yol denedim ve hepsini raporluyor muyum?" Eğer denemelerin bir kısmı çekmecede kalıyorsa, raporunuz olduğundan daha güçlü görünüyordur.

Özetle

p-hacking, HARKing, seçmeli raporlama ve çatallanan yollar bahçesi; çoğu kasıt olmadan işleyen ama sahte, tekrarlanamayan bulgular üreten tuzaklardır. YZ, onlarca analizi anında deneyebildiği için bu tuzakları hızlandırır; "anlamlı sonuç bul" türü istekler YZ'yi bir p-hacking motoruna çevirir. Savunma; ön kayıt ve analiz planıyla keşfi teyitten ayırmak, tüm spesifikasyonları ve duyarlılık analizini raporlamak, çoklu karşılaştırmayı düzeltmek ve YZ'yi "doğru sonuç" isteyen dürüst bir çerçeveye sokmaktır. Son sorumluluk her zaman araştırmacıdadır.

Uygulama görevi

Bir araştırma sorusu seçin ve veriye bakmadan önce kısa bir analiz planı yazın: birincil hipotez, ana model, birincil sonuç değişkeni, önceden tanımlı alt gruplar, çoklu karşılaştırma stratejisi. Sonra ana modeli tahmin edin. Ardından bir duyarlılık analizi yapın (farklı kontroller, aykırı değer dahil/hariç, farklı fonksiyon formu) ve tüm sonuçları tek bir tabloda gösterin. Bir paragrafta, hangi adımların p-hacking riski taşıdığını ve dürüst çerçevenizin bunları nasıl sınırladığını değerlendirin.

Kontrol listesi

  • [ ] Analiz planını/ana modeli veriye dalmadan önce yazdım.
  • [ ] Keşifçi ve teyit edici analizleri ayrı etiketledim; HARKing yapmadım.
  • [ ] Denediğim tüm spesifikasyonları raporladım; sadece güzelini seçmedim.
  • [ ] Alt grup ve dönüşümleri önceden tanımladım, veriden sonra taramadım.
  • [ ] Kaç test yaptığımı takip ettim ve gerekli düzeltmeyi uyguladım.
  • [ ] YZ'yi "anlamlı bul" değil "doğruyu bul" çerçevesinde kullandım; sorumluluğu üstlendim.