Keuntungan:
- Keupayaan untuk mentakrifkan hipotesis nol, nilai-p, selang keyakinan dan kuasa statistik dengan betul dan menggunakan kecerdasan buatan dalam pemilihan dan tafsiran ujian.
- Keupayaan untuk membezakan nilai p dan bukan nilai (bukan saiz kesan, bukan kebarangkalian ketepatan) dan memahami mengapa pembetulan perbandingan berganda diperlukan
- Keupayaan untuk mengenali komen yang dibuat oleh kecerdasan buatan yang mengelirukan kebermaknaan dengan materialiti dan melaporkannya dengan saiz kesan dan ketidakpastian
Alat statistik yang paling banyak digunakan dan paling salah faham ialah ujian hipotesis. Idea asasnya mudah: kami mempunyai tuntutan (cth. "min kedua-dua kumpulan ini berbeza") dan sebaliknya, hipotesis nol (H0 — "sebenarnya tiada perbezaan"). Ujian ini mengukur sejauh mana data bersetuju dengan hipotesis nol. Dalam unit ini kita akan melihat bagaimana kecerdasan buatan (AI) membuat pemilihan dan tafsiran ujian lebih mudah, tetapi mengapa perangkap di sekeliling nilai-p adalah sangat biasa dan berbahaya. Mari kita mulakan dari awal: AI tahu sintaks ujian yang hendak ditulis; tetapi tugas anda untuk mentafsir sama ada andaian ujian itu berpuas hati dan apakah maksud keputusan sebenarnya.
Apakah sebenarnya nilai p?
Nilai-p ialah kebarangkalian bahawa hasil yang anda perhatikan, atau hasil yang lebih ekstrem, akan berlaku secara kebetulan apabila hipotesis nol adalah benar (iaitu, sebenarnya tiada kesan). Nilai-p kecil (0.05 ialah ambang tradisional) bermaksud "memang mengejutkan untuk melihat data sedemikian jika benar-benar tiada kesan"; Ini dianggap sebagai bukti terhadap hipotesis nol.
Sekarang mari kita jelaskan apa yang bukan nilai p - yang sering dikelirukan oleh AI:
- Nilai-p bukanlah kebarangkalian bahawa hipotesis nol adalah benar. p=0.03 tidak bermaksud "terdapat 3% kebarangkalian tiada kesan".
- Nilai p tidak menunjukkan saiz kesan. Kesan yang sangat kecil mungkin menghasilkan nilai-p yang kecil dalam sampel yang besar.
- Nilai-p tidak membuktikan bahawa penemuan adalah signifikan atau nyata. "Signifikan" ialah istilah statistik, "signifikan" ialah penghakiman.
- p>0.05 tidak bermaksud "tiada kesan"; Ini bermaksud "kami tidak dapat menunjukkan kesan dengan data ini." Ketiadaan bukti bukan bukti ketiadaan.
Awas: Ralat tafsiran AI yang paling biasa ialah mempersembahkan perkataan "signifikan" sebagai "impak ketara/kuat/utama." Kepentingan statistik dan kepentingan praktikal adalah dua perkara yang berbeza; Sentiasa laporkan kedua-duanya secara berasingan.
Selang keyakinan dan saiz kesan: maklumat yang lebih kaya
Daripada nilai-p tunggal, selang keyakinan adalah lebih bermaklumat: ia memberikan julat nilai yang munasabah untuk anggaran anda. Ayat "Kesan 1,200, selang keyakinan 95% [300, 2,100]" menunjukkan kedua-dua arah, magnitud dan ketidakpastian; "p<0.05" hanya menyebut "jauh dari sifar". Amalan statistik moden menggunakan nilai-p bukan sahaja; mengesyorkan pelaporan dengan trio saiz kesan + selang keyakinan + nilai p.
Kuasa statistik dan sampel
Kuasa statistik ialah kebarangkalian untuk mengesan kesan yang sebenarnya wujud (1 tolak kebarangkalian ralat jenis II, iaitu "hilang kesan sebenar"). Kajian yang kurang berkuasa terdedah kepada dua risiko: (1) ia terlepas kesan sebenar (negatif palsu); (2) beberapa keputusan yang ternyata penting membawa magnitud melambung—yang dipanggil sumpahan pemenang kerana hanya ramalan melambung boleh melepasi ambang. Oleh itu, adalah amalan yang baik untuk mengira kuasa/sampel sebelum analisis. AI menjana kod untuk akaun ini; Anda menentukan saiz kesan sasaran dengan teori.
Masalah perbandingan berganda
Apabila melakukan ujian, ambang 0.05 bermaksud "5% risiko positif palsu". Tetapi jika anda melakukan 20 ujian, secara purata satu akan dijangka memberikan p<0.05 secara kebetulan, walaupun kesemuanya sebenarnya tidak berkesan. Ini dipanggil masalah perbandingan berganda. Kebarangkalian positif palsu meningkat dengan cepat apabila sejumlah besar pembolehubah, subkumpulan atau pembolehubah hasil diuji. Penyelesaiannya adalah untuk membetulkan ambang: Bonferroni (membahagikan ambang dengan bilangan ujian — ketat), kaedah Holm atau Benjamini-Hochberg yang mengawal kadar penemuan palsu (FDR). Risiko ini menjadi lebih besar pada zaman AI, kerana AI boleh menghasilkan berpuluh-puluh ujian dalam beberapa saat — ini adalah subjek langsung unit seterusnya (p-penggodaman).
Jadual perbandingan: apa yang dikatakan nilai-p dan perkara yang tidak dinyatakan
ungkapan
Adakah ia benar?
Penerangan
"p=0.02, kebarangkalian tiada kesan ialah 2%"
salah
p bukan kebarangkalian bagi H0
"p<0.05, kesannya besar"
salah
p tidak menunjukkan saiz
"p=0.20, tiada kesan"
salah
Tidak dapat menunjukkan bukan ketiadaan
"p<0.05, terdapat bukti terhadap H0"
betul
Berhati-hati dan on point
"Kesan 1.200 [300;2.100], p=0.01"
terbaik
Saiz + ketidakpastian + bukti
Empat gesaan yang boleh disalin
1. Memilih ujian yang betul:
Peranan anda: pembantu ujian statistik. Saya ingin membandingkan min dua kumpulan bebas (pembolehubah berterusan). Berikan saya: ujian manakah yang sesuai (dengan andaiannya: normaliti, kesamaan varians), alternatif jika andaian tidak dipenuhi (cth. Welch, Mann-Whitney), dan kod R. Saya akan menjalankan keputusan dan menyemak andaian.
2. Melaporkan nilai-p dengan betul:
Laporkan output ujian di bawah, tetapi PERATURAN:- JANGAN tunjukkan nilai-p sebagai "kebarangkalian H0" atau "saiz kesan",- pastikan anda memasukkan saiz kesan dan selang keyakinan 95%,- tulis "signifikan" dan "signifikan" secara berasingan,- jika p>0.05, JANGAN sebut "tiada kesan", sebut "kami tidak dapat tunjukkan". Keluaran: [tampal]
3. Pengiraan kuasa/sampel:
Saya merancang percubaan: dua kumpulan, saiz kesan yang dijangkakan (Cohen's d) ~0.4, kuasa 0.80, alpha 0.05. Tulis kod R yang mengira saiz sampel yang diperlukan (pakej pwr) dan terangkan risiko kajian berkuasa rendah (kutukan pemenang).
4. Pembetulan perbandingan berbilang:
Saya telah melakukan 15 ujian hipotesis berasingan dan saya mempunyai nilai-p. Tulis kod R yang menggunakan pembetulan Bonferroni dan Benjamin-Hochberg (FDR), terangkan perbezaan antara kedua-dua kaedah, dan rumuskan dalam satu ayat mengapa saya tidak boleh mempercayai p<0.05 kosong.
Gesaan lemah / Gesaan kuat
Gesaan yang lemah:
Adakah keputusan ujian ini bermakna? Komen pada keputusan.
Tuntutan ini memerangkap AI dalam binari "bermakna/tidak bermakna"; kemungkinan besar menghasilkan ayat yang mengelirukan magnitud dengan kepentingan, seperti "ya, ia penting, kesannya kuat."
Gesaan kuat:
Peranan anda: pembantu statistik yang prihatin. Tafsirkan keputusan tetapi: (1) berikan saiz kesan + selang keyakinan 95% + nilai p bersama-sama, (2) asingkan kepentingan daripada keertian, (3) p>0.05 dalam "tidak dapat menunjukkan", (4) tanya berapa banyak ujian yang saya lakukan; Jika lebih daripada satu, cadangkan pembetulan perbandingan berganda, (5) ingatkan bahawa andaian ujian perlu diperiksa.
Perbezaan: segera yang kuat menguatkuasakan pelaporan yang kaya dan melindungi daripada perangkap nilai-p.
tiga kes mini
Kes 1 — “Kepentingan” yang tidak ketara dalam sampel besar. Seorang penganalisis mendapati perbezaan min antara kedua-dua kumpulan "sangat signifikan" pada p<0.001 dalam data dengan 500,000 pemerhatian. Tetapi perbezaannya hanya 0.3 mata (daripada 100) dan boleh dikatakan tidak bermakna. Sampel yang besar menjadikan perbezaan kecil itu "ketara". Apabila saiz kesan dilaporkan, penemuan itu didapati tidak ketara. Pengajaran: kepentingan bukan magnitud; Jika n besar, setiap perbezaan adalah ketara.
Kes 2 — Ilusi ujian berbilang. Satu pasukan menguji 22 pembolehubah hasil; Salah seorang daripada mereka menunjukkan p=0.04 dan diumumkan sebagai "kami mendapati kesannya". Dengan pembetulan Bonferroni, ambang menurun kepada 0.05/22 = 0.0023; 0.04 tidak melepasi ambang ini. Satu-satunya keputusan yang "bermakna" adalah secara kebetulan daripada 22 percubaan. Pengajaran: apabila menguji banyak, pembetulan diperlukan.
Kes 3 — Kurang kuasa dan sumpahan pemenang. Kajian rintis kecil (n=15 setiap kumpulan) mendapati kesan yang sangat besar (d=0.9) dan ketara. Kajian replikasi yang besar mengurangkan kesan kepada d = 0.2. Sampel kecil hanya membenarkan anggaran berlebihan untuk melepasi ambang. Pelajaran: Saiz kesan ketara pada kuasa rendah tidak boleh dipercayai.
Kesilapan biasa
- Mengelirukan makna dengan kepentingan/magnitud. Kesannya tidak besar hanya kerana p kecil; Laporkan saiz kesan secara berasingan.
- Tersilap nilai p untuk kebarangkalian H0. p bukan "kebarangkalian tiada kesan"; adalah berbeza secara konsep.
- Membaca p>0.05 sebagai "tiada kesan". Kegagalan untuk menunjukkan bukan bukti ketidakhadiran; Nyatakan ketidakpastian.
- Tidak membetulkan untuk ujian berbilang. Terlalu banyak ujian menghasilkan positif palsu; Sapukan Bonferroni/FDR.
- Mengabaikan kuasa. Kesan ketara dalam sampel kecil dibesar-besarkan; Kira kuasa sebelum analisis.
Petua: Sebelum menghapuskan keputusan sebagai "ketara", tanya dua soalan: "Adakah kesannya boleh dikatakan ketara (magnitud)?" dan "Berapa banyak ujian yang saya ambil sebelum saya menemui keputusan ini?" Soalan kedua ialah ujian litmus kejujuran.
Secara ringkasnya
Pengujian hipotesis dan nilai p adalah alat yang berkuasa tetapi salah faham. Nilai-p ialah kebarangkalian untuk melihat data apabila hipotesis nol adalah benar; Kebarangkalian H0 bukanlah magnitud kesan atau kepentingan penemuan. Sentiasa laporkan kepentingan bersama-sama saiz kesan dan selang keyakinan; Jangan baca p>0.05 sebagai "tiada kesan"; gunakan pembetulan perbandingan berbilang jika anda telah melakukan banyak ujian; Berhati-hati dengan risiko kesan yang berlebihan daripada kajian berkuasa rendah. AI menghasilkan kod ujian dan pelan tindakan; Adalah menjadi tanggungjawab anda untuk membezakan antara kebermaknaan dan kebendaan serta menyemak andaian.
Tugasan permohonan
Buat perbandingan min antara dua kumpulan dalam set data. Minta AI untuk ujian yang sesuai (dengan andaian) dan kod, jalankannya dan semak andaian. Laporkan keputusan dengan tiga komponen: saiz kesan, selang keyakinan 95%, nilai p. Kemudian fikirkan tentang berapa banyak perbandingan berbeza yang boleh anda buat pada data yang sama; Jika anda telah menjalankan beberapa ujian, gunakan pembetulan Bonferroni atau FDR dan laporkan jika keputusan masih berlaku. Akhir sekali, tulis penilaian kuasa kasar untuk analisis anda.
senarai semak
- [ ] Saya memilih ujian dengan andaiannya dan menyemak andaian.
- [ ] Saya melaporkan hasilnya sebagai saiz kesan + selang keyakinan + nilai p.
- [ ] Saya menyimpan "penting" dan "penting" berasingan; Saya tidak fikir p ialah kebarangkalian H0.
- [ ] Saya menulis p>0.05 sebagai "kami tidak dapat menunjukkannya" dan bukannya "tiada kesan".
- [ ] Saya menggunakan berbilang pembetulan perbandingan jika saya menjalankan berbilang ujian.
- [ ] Saya menilai kuasa pensampelan; Saya berhati-hati tentang saiz kesan pada kuasa rendah.