Unit 7 / 11

p-hacking, HARKing dan Integriti Statistik: Perangkap dalam Zaman Kepintaran Buatan

Keuntungan:

  • Fahami bahawa p-hacking, HARKing, pelaporan terpilih dan taman laluan bercabang menghasilkan penemuan palsu dan lihat cara kecerdasan buatan boleh mempercepatkan perangkap ini
  • Keupayaan untuk mewujudkan pertahanan seperti prapendaftaran, pelan analisis, disiplin perbandingan berbilang dan analisis sensitiviti dengan sokongan kecerdasan buatan
  • Mampu menghayati reka bentuk permintaan jujur yang akan membolehkan kecerdasan buatan menolak permintaan jenis 'cari hasil yang bermakna' dan tanggungjawab akhir terletak pada penyelidik.

Dalam unit sebelumnya kita melihat apakah nilai-p dan apa yang tidak. Dalam unit ini kita akan melihat topik yang lebih gelap, perangkap sistematik yang mengancam integriti statistik. Kebanyakan ini bukan penipuan yang disengajakan; Ini adalah mekanisme berbahaya yang walaupun penyelidik yang berniat baik jatuh ke dalam tanpa menyedarinya. Dan kecerdasan buatan (AI) menjadikan perangkap ini lebih mudah dan lebih pantas, kerana ia memungkinkan untuk menjalankan berpuluh-puluh analisis dalam beberapa saat. Matlamat unit ini adalah untuk mewujudkan disiplin yang akan mengubah AI daripada "mesin mencari hasil yang bermakna" kepada pembantu yang jujur.

Perangkap asas

p-hacking (pemburuan nilai-p): Ia mencuba analisis sekali lagi dengan cara yang berbeza sehingga keputusan yang ketara (p<0.05) diperolehi. Menambah dan mengalih keluar pembolehubah, memilih subsampel, menukar definisi outlier, mencuba transformasi yang berbeza, menggunakan pembolehubah hasil yang berbeza, menghentikan pengumpulan data apabila ia menjadi bermakna... Setiap percubaan memberikan "peluang" baharu; Jika anda berusaha bersungguh-sungguh, salah satu daripadanya akan menjadi bermakna, walaupun ia sebenarnya tidak memberi kesan. Hasilnya: penemuan palsu yang diterbitkan tetapi tidak boleh diterbitkan semula.

HARKing (Menghipotesiskan Selepas Keputusan Diketahui): Membuat hipotesis selepas melihat keputusan dan membentangkannya sebagai "Saya meramalkannya seperti ini dari awal". Anda melihat data dan mencari hubungan yang paling menarik, kemudian tulis kertas itu seolah-olah ia direka untuk menguji hipotesis itu. Ini mengelirukan pembaca dengan menjadikan penemuan itu kelihatan seperti pengesahan.

Pelaporan terpilih (memetik ceri): Melaporkan hanya yang "baik" daripada berpuluh-puluh analisis dan menguburkan yang lain secara senyap. Ini juga dikenali sebagai "masalah laci fail": hasil yang tidak bermakna kekal dalam laci, menjadikan kesusasteraan secara sistematik berat sebelah.

Taman laluan bercabang: Istilah Andrew Gelman. Walaupun tanpa satu pun penggodaman p yang disengajakan, penyelidik membuat banyak pilihan yang munasabah berdasarkan data (pembolehubah mana, ambang mana, subkumpulan mana, transformasi mana). Darjah kebebasan penyiasatan ini sangat banyak sehingga anda memilih yang bermakna dengan berkesan daripada pelbagai analisis—walaupun tanpa sebarang niat jahat. Hasilnya sekali lagi ialah kadar positif palsu yang semakin meningkat.

Awas: Kebanyakan perangkap ini bukanlah helah yang disengajakan. Jumlah langkah yang kelihatan tidak bersalah seperti "Saya baru mencuba beberapa model lagi", "lebih bersih apabila saya mengeluarkan outlier", "kesannya lebih jelas dalam subkumpulan ini" boleh menghasilkan penemuan palsu. Kejujuran adalah soal kaedah, bukan niat.

Mengapa AI membesarkan perangkap ini?

Mencuba 3 model dengan tangan memerlukan masa; YZ menghasilkan 50 varian model, 10 penukaran berbeza, 8 subkumpulan dalam beberapa minit. Kuasa ini adalah malapetaka tanpa rancangan yang jujur: permintaan seperti "cari hubungan bermakna dalam data ini" atau "bina model yang menyokong hipotesis ini" menjadikan AI secara langsung menjadi enjin penggodam p. AI juga mahu membantu; cenderung untuk mencari hasil yang "bermakna" yang akan memuaskan hati anda. Itulah sebabnya reka bentuk segera anda adalah barisan pertahanan pertama kejujuran.

Pertahanan: perjalanan perniagaan yang adil

1. Prapendaftaran: Ini bermakna merekodkan hipotesis, pembolehubah, model dan ujian anda secara bertulis (mungkin pada platform bertanda masa) sebelum melakukan analisis. Oleh itu, penemuan dipisahkan daripada pengesahan; apa-apa yang anda ubah selepas itu ditandakan sebagai "penjelajah".

2. Pelan analisis: Walaupun anda tidak boleh merakam pra, tulis pelan analisis sebelum menyelami data: hipotesis utama, pembolehubah hasil utama, model utama. Wujudkan perbezaan antara "analisis utama" dan "analisis tambahan/penerokaan" dari awal dan mengekalkannya dalam laporan.

3. Laporkan segala-galanya: Jangan sembunyikan model yang anda telah cuba. Dalam bahagian "analisis sensitiviti" (semakan kekukuhan), tunjukkan cara spesifikasi berbeza mengubah keputusan. Penemuan itu kukuh hanya jika ia bertahan di bawah banyak pilihan yang munasabah.

4. Disiplin perbandingan berbilang: Jika anda telah melakukan terlalu banyak ujian, betulkan (unit 6). Jawab soalan "Berapa banyak ujian yang telah saya lakukan?" secara jujur.

5. Analisis sensitiviti: Ulangi penemuan utama anda dengan sampel yang berbeza, set kawalan yang berbeza dan transformasi yang berbeza. Jika keputusan berubah, jangan sembunyikannya, laporkannya.

Carta perbandingan: jujur vs perangkap

Permohonan

bentuk perangkap

Jujur setaraf

Pemilihan model

Mencuba sehingga masuk akal (p-hacking)

Model induk yang telah dirancang sebelumnya

hipotesis

Sesuai selepas fakta (HARKing)

Pra-rakam, sebelum data

Pelaporan

Jangan tunjuk yang cantik sahaja

Semua spesifikasi + sensitiviti

kumpulan kecil

Memilih yang paling menarik

Pratakrif, boleh diperbetulkan

pengumpulan data

Berhenti apabila ia masuk akal

sampel yang telah ditetapkan

Empat gesaan yang boleh disalin

1. Rangka kerja tuntutan jujur:

Peranan anda: pembantu statistik yang jujur. Matlamat saya BUKAN untuk mencari hasil yang bermakna, tetapi untuk mencari hasil yang betul. PERATURAN:- JANGAN beri saya cadangan jenis "cuba model sehingga masuk akal",- beritahu saya jika anda mencadangkan berbilang spesifikasi yang semuanya perlu dilaporkan,- beri amaran kepada saya tentang sebarang langkah yang boleh membawa kepada penggodaman p. Bantu saya menjelaskan model utama saya dahulu, pisahkan penemuan daripada pengesahan.

2. Draf rancangan analisis:

Bantu saya merangka pelan analisis awal untuk kajian: hipotesis utama, pembolehubah hasil utama, spesifikasi model utama, subkumpulan yang dipratentukan, strategi perbandingan berbilang. Letakkan analisis "penerokaan" dan "pengesahan" dalam tajuk berasingan. Ingatkan saya untuk mengisi ini TANPA LIHAT data.

3. Analisis sensitiviti:

Penemuan utama saya ialah menulis kod analisis sensitiviti (R) untuk Matlamat saya adalah untuk MELIHAT betapa kukuhnya hasilnya, BUKAN untuk memilih yang terbaik; tunjukkan semua keputusan.

4. Pemantauan kendiri:

Saya akan menerangkan proses analisis saya; Beri saya senarai semak untuk p-hacking / HARKing / pelaporan terpilih dan tandai langkah saya yang mana berisiko. Tanya saya kembali berapa banyak model/ujian yang telah saya cuba dan yang mana saya bercadang untuk melaporkan.

Gesaan lemah / Gesaan kuat

Gesaan yang lemah:

Pembolehubah yang manakah menunjukkan hubungan yang signifikan dalam data ini, cari model terbaik.

Gesaan ini ialah arahan p-penggodaman langsung: AI mencuba berpuluh-puluh kombinasi dan membentangkan kombinasi yang "paling masuk akal." Hasilnya hampir pasti penemuan palsu yang tidak boleh ditiru.

Gesaan kuat:

Peranan anda: pembantu yang jujur. Model UTAMA yang telah saya tentukan adalah: Y ~ X + kawalan. Tulis kod yang meramalkan model ini. JANGAN cari model lain yang "lebih bermakna". Cadangkan juga analisis sensitiviti supaya saya dapat melihat keteguhan keputusan, tetapi ketahui bahawa saya akan melaporkan SEMUA hasil, bukan memilih yang terbaik. Jangan biarkan saya menghapuskan sebarang penemuan penerokaan sebagai 'disahkan'.

Perbezaan: kemahuan kuat membetulkan model utama, melarang carian dan memerlukan semua hasil untuk dilaporkan.

tiga kes mini

Kes 1 — Memburu subkumpulan. Seorang penyelidik mendapati tiada kesan dalam sampel keseluruhan; Dia bertanya kepada AI "dalam subkumpulan mana yang penting?" YZ mengimbas gabungan umur, jantina dan wilayah dan mendapati "p = 0.03 dalam wanita bandar berumur 35-44". Artikel itu berdasarkan subkumpulan ini. Replikasinya tidak menemui kesan: ini adalah hasil peluang daripada berpuluh-puluh subkumpulan. Pelajaran: subkumpulan yang dipilih selepas data adalah HARKing, tidak mengesahkan.

Kes 2 — Memburu penukaran. Hubungan yang ternyata tidak bermakna dalam bentuk peringkat pelajar; mencubanya dalam bentuk log, punca kuasa dua, kuasa dua dan ketinggalan; Dia mendapati p=0.048 dalam bentuk log-log dan hanya melaporkan itu. Nasib baik, salah satu daripada 5 borang yang dicuba melepasi ambang. Cara yang betul ialah: untuk pra-memilih borang dengan teori dan menunjukkan hasil semua bentuk dalam jadual sensitiviti. Pengajaran: pelaporan terpilih menghasilkan kepentingan palsu.

Kes 3 — Cara pembingkaian jujur ​​berfungsi. Satu pasukan dipradaftarkan sebelum analisis: hipotesis utama tunggal, model utama tunggal, dua subkumpulan yang dipratentukan, pembetulan Bonferroni. Kesan utama tidak ketara, tetapi pasukan melaporkannya dengan jujur; Individu penerokaan menandakan satu penemuan sebagai "perlu diuji pada masa hadapan." Kajian itu boleh dibuat semula dan boleh dipercayai. Pengajaran: perancangan yang jujur ​​menjadikan hasil yang "gagal" berbaloi.

Kesilapan biasa

  • Memberitahu AI untuk "mencari hasil yang bermakna". Ini langsung p-penggodaman; Letakkan AI dalam bingkai yang jujur, minta ketepatan, bukan hasil.
  • Membentangkan penemuan sebagai pengesahan (HARKing). Adalah mengelirukan untuk menulis hipotesis yang ditubuhkan selepas data sebagai "Saya meramalkannya dari awal"; Labelkan dapatan penerokaan.
  • Hanya melaporkan keputusan yang baik. Tunjukkan semua spesifikasi yang diuji; Menyembunyikan analisis sentimen menjejaskan integriti.
  • Subkumpulan/penyaringan penukaran. Memilih yang paling penting daripada berdozen subkumpulan atau transformasi menghasilkan penemuan palsu; kenal pasti dan betulkan terlebih dahulu.
  • Lupa berapa banyak ujian yang telah anda lakukan. Jejaki jumlah percubaan; Tiada nilai-p boleh ditafsirkan secara jujur ​​tanpa mengetahui nombor ini.
Petua: Sebelum menulis penemuan, tanya diri anda: "Berapa banyak cara yang telah saya cuba secara senyap sehingga saya menemui hasil ini, dan adakah saya melaporkan semuanya?" Jika sesetengah esei kekal dalam laci, laporan anda kelihatan lebih kuat daripada yang sedia ada.

Secara ringkasnya

p-hacking, HARKing, pelaporan terpilih, dan taman laluan bercabang; Banyak adalah perangkap yang beroperasi secara tidak sengaja tetapi menghasilkan penemuan palsu dan tidak boleh dibuat semula. AI mempercepatkan perangkap ini kerana ia boleh mencuba berpuluh-puluh analisis serta-merta; Permintaan jenis "cari hasil yang bermakna" menjadikan AI sebagai enjin penggodam p. Pertahanan; memisahkan penemuan daripada pengesahan dengan pelan prapendaftaran dan analisis, melaporkan semua spesifikasi dan analisis sensitiviti, membetulkan berbilang perbandingan, dan meletakkan AI dalam rangka kerja jujur ​​yang menuntut "hasil yang betul". Tanggungjawab akhir sentiasa terletak pada penyelidik.

Tugasan permohonan

Pilih soalan kajian dan tulis pelan analisis ringkas sebelum melihat data: hipotesis utama, model utama, pembolehubah hasil utama, subkumpulan yang dipratentukan, strategi perbandingan berbilang. Kemudian anggaran model utama. Kemudian lakukan analisis sensitiviti (kawalan berbeza, outlier disertakan/dikecualikan, bentuk fungsi berbeza) dan tunjukkan semua keputusan dalam satu jadual. Dalam satu perenggan, nilaikan langkah mana yang menimbulkan risiko penggodaman p dan cara rangka kerja jujur ​​anda mengehadkannya.

senarai semak

  • [ ] Saya menulis pelan analisis/model induk sebelum menyelami data.
  • [ ] Saya melabelkan analisis penerokaan dan pengesahan secara berasingan; Saya tidak HARKing.
  • [ ] Saya telah melaporkan semua spesifikasi yang telah saya cuba; Saya bukan sahaja memilih yang cantik.
  • [ ] Saya mentakrifkan subkumpulan dan transformasi terlebih dahulu, saya tidak mengimbasnya selepas data.
  • [ ] Saya menjejaki berapa banyak ujian yang telah saya jalankan dan menggunakan pembetulan yang diperlukan.
  • [ ] Saya menggunakan AI dalam konteks "cari kebenaran" dan bukannya "cari ia bermakna"; Saya mengambil tanggungjawab.