Unit 3 / 11

Persampelan, Perwakilan dan Bias

Keuntungan:

  • Mampu mentakrifkan alam semesta dengan jelas dan menilai keterwakilan kaedah pensampelan dan siapa yang dikecualikan secara sistematik
  • Keupayaan untuk membezakan antara berat sebelah dalam data dan stereotaip yang dibawa oleh kecerdasan buatan dan mengawal kedua-duanya
  • Keupayaan untuk menyatakan penemuan terhad kepada sampel, tanpa keterlaluan, dan menulis bahagian had yang jujur.

Konsep penyelidikan sosial yang paling penting ialah sampel — iaitu subkumpulan yang anda pilih kerana anda tidak boleh meneliti keseluruhan kumpulan yang anda minati (alam semesta/populasi: semua orang atau unit yang ingin dibincangkan oleh penyelidikan) satu demi satu. Kepada siapa dapatan kajian boleh digeneralisasikan (iaitu, "sama ada keputusan ini sah hanya untuk orang ini atau untuk kumpulan yang lebih luas") bergantung sepenuhnya pada keterwakilan sampel. Keputusan sampel yang salah atau berat sebelah adalah salah, tidak kira seberapa baik ia dianalisis. Dalam unit ini, anda akan belajar cara menggunakan AI untuk memikirkan reka bentuk sampel, mengesan bias — hanyutan sistematik data atau tafsiran dalam satu arah dan secara jujur ​​menyatakan had generalisasi.

Adalah perlu untuk membezakan dua jenis prasangka di sini. Yang pertama ialah berat sebelah dalam data: sampel lebih mewakili satu kumpulan dan kurang mewakili kumpulan lain (mis. mereka yang hanya boleh mengambil bahagian dalam tinjauan dalam talian, iaitu mereka yang mempunyai akses internet). Yang kedua ialah kecenderungan AI sendiri: AI membawa corak teks yang telah dilatih dan boleh menghasilkan generalisasi stereotaip tentang kumpulan sosial. Seorang penyelidik sosial yang baik mesti berwaspada terhadap kedua-duanya; AI boleh membantu anda mengenali kedua-duanya, atau ia boleh membesarkan kedua-duanya.

Langkah demi langkah: memikirkan tentang perwakilan

1. Huraikan alam semesta. Siapa yang anda ingin beritahu tentang penemuan anda? "Semua pengundi di Türkiye" dan "pengundi muda di kawasan kejiranan di Istanbul" adalah alam semesta yang sangat berbeza. Sampel tidak boleh diwujudkan tanpa menulis ini dengan jelas.

2. Pilih kaedah persampelan. Kaedah seperti rawak (setiap orang mempunyai peluang yang sama untuk dipilih), berstrata (membahagikan alam semesta kepada kumpulan dan memilih daripada setiap kumpulan), bola salji (seorang peserta mengesyorkan yang lain) memberikan kuasa perwakilan yang berbeza. AI boleh menerangkan kebaikan dan keburukan setiap kaedah dalam bahasa biasa.

3. Tanya siapa yang tertinggal. Setiap persampelan merindui seseorang. Tinjauan dalam talian merindui mereka yang tiada internet, tinjauan telefon merindui mereka yang tiada talian tetap, temuduga siang hari merindui pekerja. AI menghasilkan senarai semak yang baik untuk "siapa yang kaedah ini dikecualikan secara sistematik?"

4. Petakan sumber bias. Senaraikan sumber seperti bias pemilihan (siapa yang dipilih), bias respons (siapa yang menjawab), bias mengingat kembali (salah ingat masa lalu).

5. Tulis had generalisasi. Ungkapkan penemuan sebagai "orang muda dalam sampel ini," bukan "semua remaja." AI boleh membenderakan generalisasi berlebihan dalam draf anda.

Petua: Laporan penyelidikan yang baik diperkukuh, bukan dilemahkan, oleh bahagian "had". Menulis secara jujur ​​tentang siapa sampel anda tidak mewakili menjadikan kajian anda lebih dipercayai. Minta AI draf bahagian ini, tetapi sahkan sendiri apa-apa batasan.

tiga kes mini

Kes 1 — Bias pemilihan tersembunyi. Untuk mengukur kepuasan terhadap perkhidmatan perbandaran, satu pasukan membuat tinjauan di laman web perbandaran dan mendapati 78% kepuasan. Apabila saya bertanya kepada AI "siapa sampel ini hilang?", ternyata segmen yang sudah menggunakan tapak (iaitu, mempunyai akses kepada perkhidmatan dan mungkin lebih berpuas hati) diwakili secara berlebihan. Penemuan itu telah diperbetulkan kepada "78% dalam kalangan pengguna tapak."

Kes 2 — Stereotaip AI. Apabila penyelidik mempunyai AI meringkaskan "pandangan orang tua luar bandar terhadap teknologi," AI menambah bingkai stereotaip yang tiada dalam data, seperti "orang tua takut teknologi." Apabila penyelidik menyedari perkara ini dan berkata "hanya bergantung pada kenyataan dalam transkrip", ia dilihat bahawa sebenarnya terdapat pelbagai jenis sikap dalam data.

Kes 3 — Pembetulan pensampelan berstrata. Dalam sampel 500 orang, wanita adalah 30%, berbanding 51% dalam populasi. AI menerangkan logik pemberat dalam bahasa biasa, dan pasukan itu menimbang keputusan mengikut perkadaran populasi, menghasilkan gambaran yang lebih representatif.

Empat templat yang boleh disalin

1) Kritikan terhadap sampel:

Alam semesta penyelidikan saya: [huraian]. Kaedah persampelan saya ialah: [kaedah]. Tugas anda: senaraikan siapa sampel ini mungkin kurang atau terlalu mewakili secara sistematik. Pertimbangkan kesilapan pilihan, respons dan ingat semula secara berasingan. Berikan cadangan mitigasi untuk setiap risiko. Jangan membesar-besarkan penemuan saya; Tunjukkan sempadan dengan jujur.

2) Kawalan generalisasi:

Periksa ayat penemuan ini: [teks]. Tandai setiap generalisasi yang berlebihan. Tulis semula pernyataan seperti "semua/semua orang/orang muda/wanita" dengan pernyataan yang lebih sempit yang sebenarnya disokong oleh data. Sebagai contoh, bukannya "orang muda melakukan X", "Y% remaja dalam sampel ini melaporkan X." Benderakan sebarang tuntutan yang tidak pasti asal usulnya.

3) Tangkapan bias AI:

Saya memberi anda ringkasan di bawah. Semak: adakah sebarang pertimbangan, kata sifat atau generalisasi yang anda tambahkan BENAR-BENAR terdapat dalam teks yang diberikan? Tandai dan alih keluar sebarang ungkapan yang tiada dalam teks tetapi datang daripada corak anda sendiri. Hanya berpegang kepada apa yang ada dalam teks.

4) Bahagian had draf:

Tulis draf bahagian "Had" berdasarkan maklumat kaedah berikut: saiz sampel [n], kaedah [x], konteks [y]. Terangkan bagaimana setiap had boleh menjejaskan penemuan. Tidak keterlaluan mahupun memandang rendah; Jadilah seimbang dan jujur. Saya akan mengesahkan setiap item.

Gesaan lemah / Gesaan kuat

Gesaan yang lemah:

Menurut hasil tinjauan saya, kebanyakan orang muda mempunyai pendapat ini. Tulis ini dalam ayat yang kuat.

Ini menghasilkan generalisasi yang berlebihan tanpa mempersoalkan sampel. AI mudah tergelincir ke dalam dakwaan bahawa data tidak menanggung, seperti "Orang muda di Türkiye..."

Gesaan kuat:

Sampel saya: 220 pelajar sarjana muda di universiti tunggal, tinjauan dalam talian, penyertaan sukarela. Saya ingin menyatakan dapatan: 61% daripada peserta menyatakan pendapat X. Tulis ini dalam ayat akademik tanpa tambahan yang menyatakan dengan jelas had sampel (perwakilan, kecenderungan sukarela). Hadkan generalisasi kepada sampel ini.

Perbezaannya: ayat kedua menghasilkan dakwaan yang boleh dipertahankan bahawa data sebenarnya menyokong.

Kaedah persampelan dan keterwakilan

Kaedah

Bagaimana ia berfungsi

kuasa perwakilan

Risiko biasa

rawak mudah

Peluang yang sama untuk semua orang

tinggi

kos pengangkutan

berstrata

Bahagikan dan pilih kepada kumpulan

tinggi

Ralat definisi kumpulan

kuota

Pengisian kadar kumpulan

sederhana

Kecondongan dalam kumpulan

mudah

Jangan tanya sesiapa yang boleh dihubungi

rendah

Bias pemilihan yang teruk

bola salji

Mengikut cadangan peserta

rendah

Persamaan dalam rangkaian

Kesilapan biasa

  • Mewujudkan sampel tanpa menentukan alam semesta. Perwakilan tidak boleh dinilai tanpa mengetahui kepada siapa anda akan umumkan.
  • Mengitlak persampelan mudah kepada seluruh populasi. Kesilapan yang paling biasa; "responden tinjauan" keliru dengan "semua orang".
  • Tidak pernah bertanya siapa yang ditinggalkan. Setiap kaedah menculik seseorang; Cari ini secara sedar.
  • Tidak perasan stereotaip yang ditambahkan oleh AI. Model mungkin menambah stereotaip yang tidak terdapat dalam data.
  • Menyembunyikan batasan. Menyembunyikan kelemahan sampel menjadikan kajian itu rapuh, tidak boleh dipercayai.

Secara ringkasnya

Nilai sesuatu dapatan adalah sama seperti keterwakilan sampel yang menjadi asasnya. AI; ialah bantuan yang berkuasa dalam menerangkan kaedah persampelan, memetakan siapa yang kurang diwakili, membenderakan generalisasi yang berlebihan, dan merangka bahagian had yang jujur. Tetapi berhati-hati terhadap dua bias: berat sebelah data itu sendiri dan stereotaip yang dibawa oleh AI. Tentukan alam semesta dengan jelas, tanya siapa yang tertinggal, hadkan generalisasi kepada sampel, dan tuliskan batasan dengan jujur.

Tugasan permohonan

Huraikan populasi dan kaedah persampelan untuk kajian sebenar atau hipotesis. Ekstrak siapa yang mungkin kurang/terlalu diwakili daripada AI dengan templat "kritikan pensampelan" dan kenal pasti sekurang-kurangnya tiga sumber bias. Kemudian terjemah pernyataan penemuan ke dalam pernyataan sempit yang sebenarnya disokong oleh data dengan corak "semakan generalisasi". Akhir sekali, tulis bahagian had separuh halaman yang jujur.

senarai semak

  • [ ] Saya telah mentakrifkan alam semesta dengan jelas (kepada siapa saya akan umumkan).
  • [ ] Saya menilai keterwakilan kaedah pensampelan.
  • [ ] Saya menyenaraikan siapa yang secara sistematik ditinggalkan.
  • [ ] Saya menyatakan penemuan terhad kepada sampel dan tanpa keterlaluan.
  • [ ] Saya mengalih keluar stereotaip/generalisasi yang ditambah AI.