Enota 3 / 11

Vzorčenje, zastopanost in pristranskost

Dobički:

  • Biti sposoben jasno opredeliti vesolje in ovrednotiti reprezentativnost metode vzorčenja in kdo je sistematično izključen
  • Sposobnost razlikovanja med pristranskostjo podatkov in stereotipi, ki jih nosi umetna inteligenca, ter nadzorovati oboje
  • Sposobnost izraziti ugotovitve, omejene na vzorec, brez pretiravanja, in napisati pošten razdelek o omejitvah.

Najpomembnejši koncept družbenih raziskav je vzorec — to je podskupina, ki jo izberete, ker ne morete pregledati celotne skupine, ki vas zanima (vesolje/populacija: vsi ljudje ali enote, o katerih želi raziskava govoriti) enega za drugim. Na koga lahko izsledke raziskave posplošimo (torej, »ali ta rezultat velja le za te ljudi ali za širšo skupino«), je povsem odvisno od reprezentativnosti vzorca. Rezultat napačnega ali pristranskega vzorca je napačen, ne glede na to, kako dobro je analiziran. V tej enoti se boste naučili uporabljati umetno inteligenco za razmišljanje o oblikovanju vzorca, zaznavanje pristranskosti – sistematičnega premikanja podatkov ali interpretacije v eno smer in pošteno izražanje meja posploševanja.

Pri tem je treba ločiti dve vrsti predsodkov. Prvi je pristranskost v podatkih: v vzorcu je ena skupina preveč zastopana, druga pa premalo (npr. tisti, ki lahko sodelujejo le v spletni anketi, tj. tisti z dostopom do interneta). Drugi je lastna pristranskost umetne inteligence: umetna inteligenca nosi vzorce besedil, na katerih je bila usposobljena, in lahko ustvari stereotipne posplošitve o družbeni skupini. Dober družbeni raziskovalec mora biti pozoren na oboje; AI vam lahko pomaga prepoznati oboje ali pa oboje poveča.

Korak za korakom: razmišljanje o reprezentanci

1. Opišite vesolje. Komu želiš povedati o svoji najdbi? "Vsi volivci v Turčiji" in "mladi volivci v soseski v Istanbulu" sta zelo različna vesolja. Vzorca ni mogoče vzpostaviti, ne da bi to jasno zapisali.

2. Izberite način vzorčenja. Metode, kot so naključna (vsi imajo enake možnosti, da so izbrani), stratificirana (razdelitev vesolja v skupine in izbiranje iz vsake skupine), snežna kepa (en udeleženec priporoča drugega), dajejo različne moči zastopanja. AI lahko razloži prednosti in slabosti vsake metode v preprostem jeziku.

3. Vprašajte, kdo je izpuščen. Vsako vzorčenje nekoga pogreša. Spletna anketa pogreša tiste brez interneta, telefonska anketa pogreša tiste brez stacionarnega telefona, dnevni intervju pogreša zaposlene. AI pripravi dober kontrolni seznam za "koga ta metoda sistematično izključuje?"

4. Zemljevid virov pristranskosti. Navedite vire, kot so pristranskost pri izbiri (kdo je izbran), pristranskost pri odzivu (kdo odgovarja), pristranskost pri priklicu (napačno spominjanje preteklosti).

5. Napiši generalizacijsko mejo. Ugotovitev izrazite kot »mladi v tem vzorcu«, ne »vsi najstniki«. AI lahko v vašem osnutku označi pretirano posploševanje.

Namig: Dobro raziskovalno poročilo je okrepljeno, ne oslabljeno z razdelkom »omejitve«. Če iskreno pišete o tem, koga vaš vzorec ne predstavlja, bo vaša študija bolj zanesljiva. Naj AI pripravi osnutek tega razdelka, vendar morebitne omejitve potrdite sami.

trije mini kovčki

1. primer – pristranskost skrite izbire. Za merjenje zadovoljstva s storitvami občine je ena ekipa objavila anketo na spletni strani občine in ugotovila 78-odstotno zadovoljstvo. Ko sem vprašal AI "kdo manjka v tem vzorcu?", se je izkazalo, da je segment, ki spletno stran že uporablja (torej ima dostop do storitve in je verjetno bolj zadovoljen), preveč zastopan. Ugotovitev je bila popravljena na "78% med uporabniki spletnega mesta."

Primer 2 – Stereotip AI. Ko je raziskovalec dal AI povzeti "pogled podeželskih starejših ljudi na tehnologijo," je AI dodal stereotipen okvir, ki ga ni bilo v podatkih, na primer "starejši ljudje se bojijo tehnologije." Ko je raziskovalec to spoznal in rekel, "samo zanašajte se na izjave v zapisu", je bilo razvidno, da je v podatkih dejansko veliko različnih stališč.

Primer 3 – Popravek stratificiranega vzorčenja. V vzorcu 500 ljudi je bilo žensk 30 %, v populaciji pa 51 %. Umetna inteligenca je razložila logiko tehtanja v preprostem jeziku, ekipa pa je rezultate tehtala glede na deleže prebivalstva, kar je povzročilo bolj reprezentativno sliko.

Štiri predloge za kopiranje

1) Kritika vzorca:

Vesolje mojega raziskovanja : [opis]. Moja metoda vzorčenja je: [metoda]. Vaša naloga: navedite, koga bi lahko ta vzorec sistematično premalo ali preveč zastopal. Ločeno razmislite o napakah pri izbiri, odzivu in priklicu. Podajte priporočilo za ublažitev vsakega tveganja. Ne pretiravajte z mojo ugotovitvijo; Iskreno pokažite meje.

2) Generalizacijski nadzor:

Preglejte te ugotovitvene stavke: [besedilo]. Označite vsako pretirano posploševanje. Prepišite izjave, kot je "vsi/vsi/mladi/ženske", z ožjo izjavo, ki jo podatki dejansko podpirajo. Na primer, namesto »mladi naredijo X« je »Y % najstnikov v tem vzorcu poročalo o X«. Označite vsak zahtevek negotovega izvora.

3) Zajem pristranskosti AI:

Spodaj sem vam dal povzetek. Preverite: ali so v danem besedilu RES prisotne morebitne sodbe, pridevniki ali posplošitve, ki ste jih dodali? Označite in odstranite vse izraze, ki jih ni v besedilu, ampak izhajajo iz vaših vzorcev. Samo držite se tega, kar je v besedilu.

4) Razdelek o omejitvah osnutka:

Napišite osnutek razdelka »Omejitve« na podlagi naslednjih informacij o metodi: velikost vzorca [n], metoda [x], kontekst [y]. Pojasnite, kako lahko posamezna omejitev vpliva na ugotovitve. Niti pretiravanja niti podcenjevanja; Bodite uravnoteženi in pošteni. Vsak artikel bom potrdil.

Šibek poziv/močan poziv

Šibek poziv:

Po rezultatih moje ankete je tega mnenja večina mladih. Napišite to v močnem stavku.

To povzroči pretirano posploševanje, ne da bi sploh podvomili o vzorcu. AI zlahka zdrsne v trditev, ki je podatki ne podpirajo, kot je "Mladi v Turčiji ..."

Močan poziv:

Moj vzorec: 220 dodiplomskih študentov na eni sami univerzi, spletna anketa, prostovoljno sodelovanje. Rad bi izrazil ugotovitev: 61 % sodelujočih je izrazilo mnenje X. Zapišite to v preprostem akademskem stavku, ki jasno navaja meje vzorca (zastopanost, pristranskost prostovoljstva). Omejite posploševanje na ta vzorec.

Razlika: drugi stavek daje zagovorljivo trditev, ki jo podatki dejansko podpirajo.

Metode vzorčenja in reprezentativnost

Metoda

Kako deluje

moč zastopanja

Tipično tveganje

preprosto naključno

Enake možnosti za vse

visoka

stroški prevoza

stratificiran

Razdelite in izberite v skupine

visoka

Napaka pri definiciji skupine

kvota

Polnjenje skupinskih tarif

srednje

Pristranskost v skupini

enostavno

Ne sprašujte nikogar, ki je dosegljiv

nizka

Huda izbirna pristranskost

snežna kepa

Po predlogu udeleženca

nizka

Intranetwork podobnost

Pogoste napake

  • Vzpostavitev vzorca brez opredelitve vesolja. Zastopanja ni mogoče oceniti, ne da bi vedeli, na koga boste posploševali.
  • Posploševanje priročnega vzorčenja na celotno populacijo. Najpogostejša napaka; "anketiranci" zamenjujejo z "vsi".
  • Nikoli ne sprašuj, kdo je izpuščen. Vsaka metoda nekoga ugrabi; Iščite to zavestno.
  • Ne opaziti stereotipa, ki ga je dodal AI. Model lahko doda stereotipe, ki niso prisotni v podatkih.
  • Skrivanje omejitev. Skrivanje krhkosti vzorca naredi študijo krhko, nezanesljivo.

Če povzamem

Vrednost ugotovitve je tolikšna, kot je reprezentativnost vzorca, na katerem temelji. AI; je močan pripomoček pri razlagi metod vzorčenja, določanju, kdo je premalo zastopan, označevanju pretiranega posploševanja in pripravi odkritega razdelka o omejitvah. Toda pazite se dveh pristranskosti: pristranskosti samih podatkov in stereotipov, ki jih nosi AI. Jasno definirajte vesolje, vprašajte, kdo je izpuščen, omejite posploševanje na vzorec in pošteno zapišite omejitve.

Aplikacijska naloga

Opišite populacijo in metodo vzorčenja za resnično ali hipotetično študijo. Izluščite, kdo bi lahko bil premalo/preveč zastopan iz umetne inteligence s predlogo »kritika vzorčenja« in identificirajte vsaj tri vire pristranskosti. Nato ugotovitveno izjavo prevedite v ozko izjavo, ki jo podatki dejansko podpirajo z vzorcem »generalizacijskega preverjanja«. Nazadnje napišite pošten razdelek o omejitvah na pol strani.

kontrolni seznam

  • [ ] Jasno sem definiral vesolje (na koga bom posploševal).
  • [ ] Ocenil sem reprezentativnost metode vzorčenja.
  • [ ] Navedel sem, kdo je bil sistematično izpuščen.
  • [ ] Ugotovitve sem izrazil omejeno na vzorec in brez pretiravanja.
  • [ ] Odstranil sem stereotipe/generalizacije, ki jih je dodal AI.