Kazanimlar:
- Sıfır hipotezi, p-değeri, güven aralığı ve istatistiksel gücü doğru tanımlayıp yapay zekayı test seçimi ve yorumunda kullanabilme
- p-değerinin ne olduğunu ve olmadığını (etki büyüklüğü değil, doğruluk olasılığı değil) ayırt edip çoklu karşılaştırma düzeltmesinin neden gerektiğini kavrayabilme
- Yapay zekanın anlamlılık ile önemliliği karıştıran yorumlarını fark edip etki büyüklüğü ve belirsizlikle birlikte raporlayabilme
İstatistiğin en çok kullanılan ve en çok yanlış anlaşılan aracı hipotez testidir. Temel fikir basittir: elimizde bir iddia (örneğin "bu iki grubun ortalaması farklı") ve onun karşıtı olan bir sıfır hipotezi (H0 — "aslında fark yoktur") vardır. Test, verinin sıfır hipoteziyle ne kadar bağdaştığını ölçer. Bu ünitede yapay zekanın (YZ) test seçimini ve yorumunu nasıl kolaylaştırdığını, ama p-değeri etrafındaki tuzakların neden bu kadar yaygın ve tehlikeli olduğunu göreceğiz. Baştan koyalım: YZ hangi testin sözdizimini yazacağını bilir; ama testin varsayımının sağlanıp sağlanmadığını ve sonucun gerçekten ne anlama geldiğini yorumlamak sizin işinizdir.
p-değeri gerçekte nedir?
p-değeri, sıfır hipotezi doğruyken (yani gerçekte hiçbir etki yokken), gözlediğiniz sonucun ya da daha uç bir sonucun şans eseri ortaya çıkma olasılığıdır. Küçük bir p-değeri (geleneksel eşik 0,05), "eğer gerçekten etki yoksa böyle bir veri görmek şaşırtıcı olurdu" demektir; bu da sıfır hipotezine karşı bir kanıt sayılır.
Şimdi p-değerinin ne olmadığını — YZ'nin de sık karıştırdığı noktaları — netleştirelim:
- p-değeri, sıfır hipotezinin doğru olma olasılığı değildir. p=0,03, "etki yok ihtimali %3" demek değildir.
- p-değeri, etkinin büyüklüğünü göstermez. Çok küçük bir etki, büyük örneklemde minik bir p-değeri verebilir.
- p-değeri, bulgunun önemli ya da gerçek olduğunu kanıtlamaz. "Anlamlı" istatistiksel bir terimdir, "önemli" bir yargı.
- p>0,05, "etki yok" demek değildir; "bu veriyle etkiyi gösteremedik" demektir. Kanıt yokluğu, yokluğun kanıtı değildir.
Dikkat: YZ'nin en yaygın yorum hatası, "anlamlı" kelimesini "önemli/güçlü/büyük etki" gibi sunmasıdır. İstatistiksel anlamlılık ile pratik önem farklı şeylerdir; ikisini her zaman ayrı raporlayın.
Güven aralığı ve etki büyüklüğü: daha zengin bilgi
Tek bir p-değeri yerine güven aralığı (confidence interval) çok daha bilgilendiricidir: tahmininizin makul değer aralığını verir. "Etki 1.200, %95 güven aralığı [300, 2.100]" cümlesi hem yönü, hem büyüklüğü, hem belirsizliği bir arada gösterir; "p<0,05" ise yalnızca "sıfırdan uzak" der. Modern istatistik pratiği, p-değerini tek başına değil; etki büyüklüğü + güven aralığı + p-değeri üçlüsüyle raporlamayı önerir.
İstatistiksel güç ve örneklem
İstatistiksel güç (statistical power), gerçekten var olan bir etkiyi tespit edebilme olasılığıdır (1 eksi II. tip hata, yani "gerçek etkiyi kaçırma" olasılığı). Düşük güçlü bir çalışma iki riske açıktır: (1) gerçek etkileri kaçırır (yanlış negatif); (2) anlamlı çıkan az sayıdaki sonuç abartılı büyüklük taşır — buna kazananın laneti (winner's curse) denir, çünkü yalnızca şişkin tahminler eşiği geçebilir. Bu yüzden analiz öncesi güç/örneklem hesabı yapmak iyi uygulamadır. YZ bu hesabın kodunu üretir; hedef etki büyüklüğünü kuramla siz belirlersiniz.
Çoklu karşılaştırma sorunu
Bir test yaparken 0,05 eşiği "%5 yanlış pozitif riski" demektir. Ama 20 test yaparsanız, hepsi gerçekte etkisizken bile ortalama bir tanesinin şans eseri p<0,05 vermesi beklenir. Buna çoklu karşılaştırma problemi denir. Çok sayıda değişken, alt grup veya sonuç değişkeni test edildiğinde yanlış pozitif olasılığı hızla artar. Çözüm, eşiği düzeltmektir: Bonferroni (eşiği test sayısına bölmek — katı), Holm veya yanlış keşif oranını (FDR — false discovery rate) kontrol eden Benjamini-Hochberg yöntemleri. YZ onlarca testi saniyeler içinde üretebildiği için bu risk YZ çağında daha da büyür — bu, bir sonraki ünitenin (p-hacking) doğrudan konusudur.
Karşılaştırma tablosu: p-değeri ne der, ne demez
İfade
Doğru mu?
Açıklama
"p=0,02, etki yok ihtimali %2"
Yanlış
p, H0'ın olasılığı değildir
"p<0,05, etki büyük"
Yanlış
p büyüklük göstermez
"p=0,20, etki yok"
Yanlış
Gösterememek yokluk değildir
"p<0,05, H0'a karşı kanıt var"
Doğru
Temkinli ve yerinde
"Etki 1.200 [300;2.100], p=0,01"
En iyi
Büyüklük + belirsizlik + kanıt
Dört kopyalanabilir prompt
1. Doğru test seçimi:
Rolün: istatistik test asistanı. İki bağımsız grubun ortalamasınıkarşılaştırmak istiyorum (sürekli değişken). Bana: hangi testin uygunolduğunu (varsayımlarıyla: normallik, varyans eşitliği), varsayımsağlanmazsa alternatifini (ör. Welch, Mann-Whitney) ve R kodunu ver.Sonucu ben çalıştırıp varsayımları kontrol edeceğim.
2. p-değerini doğru raporlama:
Aşağıdaki test çıktısını raporla ama KURALLAR:- p-değerini "H0 olasılığı" ya da "etki büyüklüğü" gibi SUNMA,- etki büyüklüğünü ve %95 güven aralığını mutlaka ekle,- "anlamlı" ile "önemli"yi ayrı yaz,- p>0,05 ise "etki yok" DEME, "gösteremedik" de.Çıktı: [yapıştır]
3. Güç/örneklem hesabı:
Bir deney planlıyorum: iki grup, beklenen etki büyüklüğü (Cohen d) ~0,4,güç 0,80, alfa 0,05. Gerekli örneklem büyüklüğünü hesaplayan R kodu yaz(pwr paketi) ve düşük güçlü çalışmanın (winner's curse) risklerini açıkla.
4. Çoklu karşılaştırma düzeltmesi:
15 ayrı hipotez testi yaptım ve p-değerlerim var. Bonferroni veBenjamini-Hochberg (FDR) düzeltmelerini uygulayan R kodu yaz, ikiyöntemin farkını açıkla ve neden çıplak p<0,05'e güvenmemem gerektiğinibir cümleyle özetle.
Zayıf prompt / Güçlü prompt
Zayıf prompt:
Bu testin sonucu anlamlı mı, sonucu yorumla.
Bu istem YZ'yi "anlamlı/anlamsız" ikilisine sıkıştırır; büyük olasılıkla "evet anlamlı, etki güçlü" gibi büyüklük ile anlamlılığı karıştıran bir cümle üretir.
Güçlü prompt:
Rolün: dikkatli istatistik asistanı.Sonucu yorumla ama: (1) etki büyüklüğü + %95 güven aralığı + p-değerinibirlikte ver, (2) anlamlılık ile önemi ayır, (3) p>0,05 ise "gösteremedik"de, (4) kaç test yaptığımı sor; birden çoksa çoklu karşılaştırma düzeltmesiöner, (5) testin varsayımlarının kontrol edilmesi gerektiğini hatırlat.
Fark: güçlü istem zengin raporlamayı zorunlu kılar ve p-değeri tuzaklarına karşı korur.
Üç mini vaka
Vaka 1 — Büyük örneklemde anlamsız "anlamlılık". Bir analist 500.000 gözlemli veride iki grubun ortalama farkını p<0,001 ile "son derece anlamlı" buldu. Ama fark yalnızca 0,3 puandı (100 üzerinden) ve pratikte anlamsızdı. Devasa örneklem, minik farkı bile "anlamlı" yapmıştı. Etki büyüklüğü raporlanınca bulgunun önemsiz olduğu görüldü. Ders: anlamlılık büyüklük değildir; n büyükse her fark anlamlı çıkar.
Vaka 2 — Çoklu test yanılsaması. Bir ekip 22 sonuç değişkeni test etti; biri p=0,04 çıktı ve "etkiyi bulduk" diye duyuruldu. Bonferroni düzeltmesiyle eşik 0,05/22 = 0,0023'e indi; 0,04 bu eşiği geçemedi. Tek "anlamlı" sonuç, 22 denemeden şans eseri çıkmış olabilirdi. Ders: çok test yapıldığında düzeltme şart.
Vaka 3 — Düşük güç ve kazananın laneti. Küçük bir pilot çalışma (grup başına n=15) bir etkiyi çok büyük (d=0,9) ve anlamlı buldu. Büyük tekrar çalışması etkiyi d=0,2'ye düşürdü. Küçük örneklem yalnızca abartılı bir tahminin eşiği geçmesine izin vermişti. Ders: düşük güçte anlamlı çıkan etki büyüklüğüne güvenilmez.
Sık yapılan hatalar
- Anlamlılığı önemle/büyüklükle karıştırmak. p küçük diye etki büyük değildir; etki büyüklüğünü ayrı raporlayın.
- p-değerini H0'ın olasılığı sanmak. p, "etki yok ihtimali" değildir; kavramsal olarak farklıdır.
- p>0,05'i "etki yok" diye okumak. Gösterememek yokluğun kanıtı değildir; belirsizliği belirtin.
- Çoklu testi düzeltmemek. Çok sayıda test yanlış pozitif üretir; Bonferroni/FDR uygulayın.
- Gücü göz ardı etmek. Küçük örneklemde anlamlı çıkan etki abartılıdır; analiz öncesi güç hesabı yapın.
İpucu: Bir sonucu "anlamlı" diye yazmadan önce iki soru sorun: "Etki pratikte önemli mi (büyüklük)?" ve "Bu sonucu bulana kadar kaç test yaptım?" İkinci soru dürüstlüğün turnusol kâğıdıdır.
Özetle
Hipotez testi ve p-değeri güçlü ama yanlış anlaşılmaya çok açık araçlardır. p-değeri, sıfır hipotezi doğruyken veriyi görme olasılığıdır; H0'ın olasılığı, etkinin büyüklüğü ya da bulgunun önemi değildir. Anlamlılığı her zaman etki büyüklüğü ve güven aralığıyla birlikte raporlayın; p>0,05'i "etki yok" diye okumayın; çok sayıda test yaptıysanız çoklu karşılaştırma düzeltmesi uygulayın; düşük güçlü çalışmaların abartılı etki riskini unutmayın. YZ test kodunu ve taslağı üretir; anlamlılık ile önemliliği ayırt etmek ve varsayımları denetlemek sizin sorumluluğunuzdur.
Uygulama görevi
Bir veri setinde iki grup arasında bir ortalama karşılaştırması yapın. YZ'den uygun testi (varsayımlarıyla birlikte) ve kodunu isteyin, çalıştırın ve varsayımları kontrol edin. Sonucu üç bileşenle raporlayın: etki büyüklüğü, %95 güven aralığı, p-değeri. Ardından aynı veride kaç farklı karşılaştırma yapabileceğinizi düşünün; birden çok test yaptıysanız Bonferroni veya FDR düzeltmesi uygulayıp sonucun hâlâ ayakta kalıp kalmadığını raporlayın. Son olarak analiziniz için kaba bir güç değerlendirmesi yazın.
Kontrol listesi
- [ ] Testi varsayımlarıyla seçtim ve varsayımları kontrol ettim.
- [ ] Sonucu etki büyüklüğü + güven aralığı + p-değeri olarak raporladım.
- [ ] "Anlamlı" ile "önemli"yi ayrı tuttum; p'yi H0 olasılığı sanmadım.
- [ ] p>0,05'i "etki yok" diye değil "gösteremedik" diye yazdım.
- [ ] Birden çok test yaptıysam çoklu karşılaştırma düzeltmesi uyguladım.
- [ ] Örneklem gücünü değerlendirdim; düşük güçte etki büyüklüğüne temkinli yaklaştım.