Birlik 6 / 11

Gipoteza sinovi va p-qiymati: ahamiyat, kuch va bir nechta taqqoslash

Daromadlar:

  • Nol gipotezani, p-qiymatini, ishonch oralig'ini va statistik quvvatni to'g'ri aniqlash va test tanlash va sharhlashda sun'iy intellektdan foydalanish qobiliyati.
  • p-qiymati nima ekanligini va nima emasligini farqlash qobiliyati (ta'sir kattaligi emas, aniqlik ehtimoli emas) va nima uchun bir nechta taqqoslashni tuzatish zarurligini tushunish
  • Sun'iy intellekt tomonidan ma'noni muhimlik bilan chalkashtirib yuboradigan izohlarni tanib olish va ularni ta'sir hajmi va noaniqlik bilan bildirish qobiliyati

Statistikaning eng ko'p qo'llaniladigan va eng noto'g'ri tushunilgan vositasi gipotezalarni tekshirishdir. Asosiy g'oya oddiy: bizda da'vo (masalan, "bu ikki guruhning o'rtacha qiymati boshqacha") va uning teskarisi, nol gipoteza (H0 - "aslida farq yo'q") bor. Sinov ma'lumotlarning nol gipoteza bilan qanchalik mos kelishini o'lchaydi. Ushbu bo'limda biz sun'iy intellekt (AI) test tanlash va sharhlashni qanchalik osonlashtirayotganini ko'rib chiqamiz, lekin nima uchun p-qiymati atrofidagi tuzoqlar juda keng tarqalgan va xavfli. Boshidan boshlaylik: AI qaysi test sintaksisini yozishni biladi; ammo testning taxmini qanoatlantiriladimi yoki natija nimani anglatishini izohlash sizning vazifangizdir.

Aslida p-qiymati nima?

P-qiymati - bu nol gipoteza to'g'ri bo'lganda (ya'ni, aslida hech qanday ta'sir yo'q) siz kuzatayotgan natija yoki undan ham ekstremal natija tasodifan yuzaga kelishi ehtimoli. Kichik p-qiymati (0,05 - an'anaviy chegara) "agar haqiqatan ham ta'sir bo'lmasa, bunday ma'lumotlarni ko'rish hayratlanarli bo'lardi" degan ma'noni anglatadi; Bu nol gipotezaga qarshi dalil hisoblanadi.

Keling, p-qiymati nima emasligini aniqlaylik - bu AI ko'pincha chalkashtirib yuboradi:

  • p-qiymati nol gipotezaning to'g'ri bo'lish ehtimoli emas. p=0,03 "ta'sir qilmaslik ehtimoli 3%" degani emas.
  • P-qiymati effekt hajmini bildirmaydi. Juda kichik effekt katta namunada kichik p-qiymatini berishi mumkin.
  • P-qiymati topilmaning muhim yoki haqiqiy ekanligini isbotlamaydi. "Muhim" - statistik atama, "muhim" - hukm.
  • p>0,05 "ta'sir yo'q" degani emas; Bu "biz bu ma'lumotlar bilan effektni ko'rsata olmadik" degan ma'noni anglatadi. Dalillarning yo'qligi yo'qligining dalili emas.
Diqqat: AI talqinidagi eng keng tarqalgan xato bu "muhim" so'zini "muhim/kuchli/asosiy ta'sir" sifatida ko'rsatishdir. Statistik ahamiyatga egalik va amaliy ahamiyatga egalik ikki xil narsadir; Har doim ikkalasini alohida xabar qiling.

Ishonch oralig'i va effekt hajmi: boyroq ma'lumot

Bitta p-qiymati o'rniga, ishonch oralig'i ko'proq ma'lumot beradi: u sizning taxminlaringiz uchun maqbul qiymatlar oralig'ini beradi. "Effekt 1,200, 95% ishonch oralig'i [300, 2,100]" jumlasi ham yo'nalishni, kattalikni va noaniqlikni ko'rsatadi; "p<0.05" faqat "noldan uzoq" deydi. Zamonaviy statistik amaliyot faqat p-qiymatini ishlatmaydi; effekt hajmi + ishonch oralig'i + p-qiymati uchligi bilan hisobot berishni tavsiya qiladi.

Statistik quvvat va namuna

Statistik kuch - bu haqiqatda mavjud bo'lgan ta'sirni aniqlash ehtimoli (1 minus II turdagi xatolik ehtimoli, ya'ni "haqiqiy effektni yo'qotish"). Kam quvvatlangan tadqiqot ikkita xavfga moyil bo'ladi: (1) u haqiqiy ta'sirlarni o'tkazib yuboradi (noto'g'ri salbiy); (2) sezilarli bo'lib chiqadigan bir nechta natijalar oshirib yuborilgan kattaliklarga olib keladi - g'olibning la'nati deb ataladi, chunki faqat oshirilgan bashoratlar chegaradan o'tishi mumkin. Shuning uchun, tahlil qilishdan oldin quvvat/namuna hisoblash yaxshi amaliyotdir. AI ushbu hisob uchun kodni yaratadi; Maqsadli effekt hajmini nazariya bilan aniqlaysiz.

Bir nechta taqqoslash muammosi

Sinovni o'tkazishda 0,05 chegarasi "noto'g'ri musbatlarning 5% xavfi" degan ma'noni anglatadi. Ammo agar siz 20 ta test o'tkazsangiz, ularning barchasi samarasiz bo'lsa ham, o'rtacha bittasi tasodifan p<0,05 ni berishi kutiladi. Bu ko'p taqqoslash muammosi deb ataladi. Ko'p sonli o'zgaruvchilar, kichik guruhlar yoki natija o'zgaruvchilari sinovdan o'tkazilganda noto'g'ri musbatlar ehtimoli tez ortadi. Yechim chegarani to'g'rilashdan iborat: Bonferroni (eshikni sinovlar soniga bo'lish - qat'iy), yolg'on kashfiyot tezligini (FDR) nazorat qiluvchi Holm yoki Benjamini-Hochberg usullari. AI yoshida bu xavf yanada kuchayadi, chunki AI soniyalarda o'nlab testlarni ishlab chiqishi mumkin - bu keyingi birlikning bevosita mavzusi (p-hacking).

Taqqoslash jadvali: p-qiymati nimani aytadi va nima demaydi

ifoda

Bu rostmi?

Tavsif

"p=0,02, ta'sir qilmaslik ehtimoli 2%"

noto'g'ri

p H0 ning ehtimoli emas

"p<0,05, ta'siri katta"

noto'g'ri

p hajmini bildirmaydi

"p=0,20, ta'siri yo'q"

noto'g'ri

Ko'rsata olmaslik - yo'qlik emas

"p<0.05, H0 ga qarshi dalillar mavjud"

To'g'ri

Ehtiyotkor va to'g'ri

"Ta'sir 1.200 [300; 2.100], p = 0.01"

eng yaxshi

Hajmi + noaniqlik + dalil

To'rtta nusxa ko'chirish taklifi

1. To'g'ri testni tanlash:

Sizning rolingiz: statistik test yordamchisi. Men ikkita mustaqil guruhning o'rtacha qiymatini solishtirmoqchiman (doimiy o'zgaruvchi). Menga bering: qaysi test mos keladi (uning taxminlari bilan: normallik, dispersiya tengligi), agar taxmin bajarilmasa, alternativa (masalan, Welch, Mann-Whitney) va R kodini. Natijani ishga tushiraman va taxminlarni tekshiraman.

2. p-qiymatini to'g'ri xabar qilish:

Quyida sinov natijasi haqida xabar bering, lekin QOIDALAR:- p-qiymatini “H0 ehtimoli” yoki “taʼsir oʻlchami” sifatida koʻrsatmang, taʼsir hajmi va 95% ishonch oraligʻini kiritganingizga ishonch hosil qiling,- “muhim” va “muhim” ni alohida yozing,- agar p>0.05 boʻlsa, “taʼsiri yoʻq”, “koʻrsata olmadik” demang. Chiqish: [joylashtirish]

3. Quvvat/namuna hisoblash:

Men tajriba o'tkazishni rejalashtirmoqdaman: ikkita guruh, kutilgan effekt hajmi (Koen d) ~ 0,4, quvvat 0,80, alfa 0,05. Kerakli namuna hajmini (pwr to'plami) hisoblaydigan R kodini yozing va kam quvvatli tadqiqot xavfini tushuntiring (g'olibning la'nati).

4. Ko'p taqqoslashni tuzatish:

Men 15 ta alohida gipoteza testlarini o'tkazdim va menda p-qiymatlari bor. Bonferroni va Benjamin-Xochberg (FDR) tuzatishlarini qo'llaydigan R kodini yozing, ikkita usul o'rtasidagi farqni tushuntiring va nima uchun p<0,05 ga ishonmasligim kerakligini bir jumla bilan umumlashtiring.

Zaif taklif / Kuchli taklif

Zaif taklif:

Ushbu test natijasi mazmunlimi? Natija haqida fikr bildiring.

Ushbu da'vo AIni "ma'noli / ma'nosiz" ikkilikda tuzoqqa tushiradi; katta ehtimol bilan ahamiyatlilikni chalkashtirib yuboruvchi jumla hosil qiladi, masalan, "ha, bu muhim, ta'sir kuchli".

Kuchli so'rov:

Sizning rolingiz: ehtiyotkor statistik yordamchi. Natijani sharhlang, lekin: (1) ta'sir o'lchamini + 95% ishonch oralig'ini + p-qiymatini birga bering, (2) ahamiyatlilikdan alohida ahamiyat bering, (3) "ko'rsata olmadim"da p>0,05, (4) qancha test o'tkazganimni so'rang; Agar bir nechta bo'lsa, bir nechta taqqoslashni tuzatishni taklif qiling, (5) testning taxminlarini tekshirish kerakligini eslating.

Farqi: kuchli taklif boy hisobotlarni amalga oshiradi va p-qiymati tuzoqlaridan himoya qiladi.

uchta mini holat

1-holat - Katta namunadagi ahamiyatsiz "ahamiyat". Tahlilchilardan biri 500 000 kuzatuvi bo'lgan ma'lumotlarda p<0,001da ikki guruh o'rtasidagi o'rtacha farqni "juda muhim" deb topdi. Ammo farq atigi 0,3 ballni tashkil etdi (100 balldan) va amalda ma'nosiz edi. Katta namuna hatto eng kichik farqni ham "muhim" qildi. Ta'sir hajmi haqida xabar berilganda, topilma ahamiyatsiz deb topildi. Dars: ahamiyat kattalik emas; Agar n katta bo'lsa, har bir farq muhim bo'ladi.

2-holat - Ko'p sinov illyuziyasi. Bitta jamoa 22 ta natija o'zgaruvchisini sinab ko'rdi; Ulardan biri p=0,04 ni ko'rsatdi va "biz ta'sirni topdik" deb e'lon qilindi. Bonferroni tuzatish bilan chegara 0,05/22 = 0,0023 ga kamaydi; 0,04 bu chegaradan o'ta olmadi. Yagona "ma'noli" natija 22 ta sinovdan tasodifan bo'lishi mumkin edi. Dars: ko'p sinovdan o'tganda tuzatish kerak.

3-holat - Quvvatsizlik va g'olibning la'nati. Kichik tajriba tadqiqoti (guruh uchun n = 15) ta'sir juda katta (d = 0,9) va muhimligini aniqladi. Katta replikatsiya tadqiqoti ta'sirni d = 0,2 ga qisqartirdi. Kichik namuna faqat haddan tashqari baholashning chegaradan oshib ketishiga imkon berdi. Dars: Kam quvvatda sezilarli ta'sir o'lchamlariga ishonish mumkin emas.

Umumiy xatolar

  • Ma'nolilikni muhimlik/kattalik bilan chalkashtirib yuborish. Faqat p kichik bo'lgani uchun ta'sir katta emas; Effekt hajmini alohida xabar qiling.
  • P-qiymatini H0 ehtimoli bilan xato qilish. p - "ta'sir qilmaslik ehtimoli" emas; kontseptual jihatdan farq qiladi.
  • O'qish p>0,05 "ta'siri yo'q". Ko'rsatmaslik - yo'qligining dalili emas; Noaniqlikni bildiring.
  • Ko'p sinov uchun tuzatma. Juda ko'p testlar noto'g'ri ijobiy natijalar beradi; Bonferroni/FDR ilovasini qo'llang.
  • Quvvatni e'tiborsiz qoldirish. Kichik namunadagi sezilarli ta'sir abartılıdır; Tahlil qilishdan oldin quvvatni hisoblang.
Maslahat: Natijani "muhim" deb yozishdan oldin ikkita savol bering: "Ta'sir amalda muhimmi (kattalik)?" va "Ushbu natijani topishdan oldin qancha test o'tkazdim?" Ikkinchi savol - halollik lakmus testi.

qisqa bayoni; yakunida

Gipotezani tekshirish va p-qiymati kuchli, ammo noto'g'ri tushunilgan vositalardir. p-qiymati nol gipoteza to'g'ri bo'lganda ma'lumotlarni ko'rish ehtimoli; H0 ning ehtimoli ta'sirning kattaligi yoki topilmaning ahamiyati emas. Har doim ta'sir kattaligi va ishonch oralig'i bilan ahamiyatliligi haqida xabar bering; p>0,05ni "ta'siri yo'q" deb o'qimang; agar siz ko'plab testlarni o'tkazgan bo'lsangiz, bir nechta taqqoslashni tuzatishni qo'llang; Kam quvvatli tadqiqotlar natijasida bo'rttirilgan ta'sir xavfidan xabardor bo'ling. AI test kodi va chizmasini ishlab chiqaradi; Ma'nolilik va muhimlik o'rtasidagi farqni aniqlash va taxminlarni tekshirish sizning mas'uliyatingizdir.

Ilova vazifasi

Ma'lumotlar to'plamidagi ikkita guruh o'rtasidagi vositalarni taqqoslang. AIdan tegishli testni (taxminlari bilan) va kodni so'rang, uni ishga tushiring va taxminlarni tekshiring. Natijani uchta komponent bilan hisobot qiling: effekt hajmi, 95% ishonch oralig'i, p-qiymati. Keyin bir xil ma'lumotlar bo'yicha qancha turli xil taqqoslash mumkinligi haqida o'ylab ko'ring; Agar siz bir nechta testlarni o'tkazgan bo'lsangiz, Bonferroni yoki FDR tuzatishni qo'llang va natija saqlanib qolsa, xabar bering. Nihoyat, tahlilingiz uchun taxminiy quvvat bahosini yozing.

nazorat ro'yxati

  • [ ] Men testni taxminlari bilan tanladim va taxminlarni tekshirdim.
  • [ ] Natijani effekt hajmi + ishonch oralig'i + p-qiymati sifatida xabar qildim.
  • [ ] Men “muhim” va “muhim”ni alohida tutdim; Men p ni H0 ning ehtimoli deb o'ylamagan edim.
  • [ ] Men p>0,05 ni "ta'sir yo'q" emas, balki "ko'rsata olmadik" deb yozdim.
  • [ ] Agar bir nechta testlarni oʻtkazgan boʻlsam, bir nechta taqqoslash tuzatishlarini qoʻlladim.
  • [ ] Men namuna olish quvvatini baholadim; Men past quvvatda ta'sir hajmi haqida ehtiyot bo'ldim.