Jednotka 5 / 11

Podpora analýzy údajov: kód, štatistická interpretácia a kvalitatívne kódovanie

zisky:

  • Schopnosť použiť umelú inteligenciu na generovanie plánu analýzy, výber vhodného štatistického testu a návrh kódu R/Python/SPSS a manuálne overiť výstup
  • Schopnosť prevziať návrhy tém a kódov v kvalitatívnych údajoch, prepojiť a potvrdiť interpretáciu umelej inteligencie k nespracovaným údajom
  • Schopnosť porozumieť riziku ochrany súkromia pri zdieľaní nespracovaných údajov, nebezpečenstvu falošných štatistík a p-hackingu a určiť hranice zodpovednej analýzy

Keď sú údaje zhromaždené, je čas dať im zmysel. Analýza údajov je proces transformácie nespracovaných čísel alebo textu na zistenia, ktoré odpovedajú na výskumnú otázku. V tejto fáze AI urýchľuje tri konkrétne úlohy: vytváranie návrhu kódu (R, Python, syntax SPSS), pomoc pri interpretácii štatistických výstupov a poskytovanie návrhov tém/kódov v kvalitatívnych údajoch. Analýza je však najcitlivejšou oblasťou presnosti a dôvernosti na akademickej pôde. Základné pravidlo tejto jednotky je dvojaké: nespracované údaje zostávajú dôverné, každý číselný výsledok sa overuje manuálne. AI môže tiež vytvárať falošné štatistiky; Neoverená p-hodnota je rovnako nebezpečná ako neoverená atribúcia.

Vygenerujte návrh kódu

Umelá inteligencia je veľmi výkonná pri prekladaní plánu analýzy do pracovného kódu. Ak poviete „Vykonajte nezávislý vzorový t-test medzi týmito premennými a skontrolujte predpoklady“, získate čistý obrys R alebo Pythonu. Ide o veľkú vymoženosť najmä pre výskumníkov, ktorí nie sú odborníkmi na programovanie. Existujú však dve pravidlá. Po prvé: spustite kód vo svojom vlastnom prostredí s vlastnými údajmi; Do nástroja nenahrávajte nespracované údaje. Opíšete štruktúru svojich údajov AI (názvy premenných, typy, niekoľko vzorových riadkov – žiadne ID), napíše kód a spustíte ho na lokálnom počítači. Po druhé: prečítať a pochopiť kód; slepé kopírovanie presunie tichú chybu (nesprávna premenná, nesprávny test) do zostavy bez toho, aby si to všimol.

Výber štatistického testu je kritickým rozhodnutím: o teste rozhoduje typ údajov (spojité/kategorické), počet skupín, distribučné predpoklady. Podobne ako rozhodovací strom, AI hovorí „v tomto prípade môže byť vhodný nasledujúci test“ a vysvetľuje svoje zdôvodnenie; Toto je poučné. Výber však potvrdíte kontrolou predpokladov vlastných údajov. Nesprávny test vedie k výsledku, ktorý sa zdá byť platný, ale nemá zmysel.

Upozornenie: Keď sa opýtate na číslo („aký je priemer v tejto vzorke“), AI môže vytvoriť číslo, ktoré sa zdá byť rozumné, bez toho, aby vykonal nejaké skutočné výpočty. Nikdy nenechávajte AI „vypočítať“ súhrn údajov a nepoužiť výsledok; Štatistický softvér robí matematiku, AI len vytvára kód a interpretáciu.

Štatistická interpretácia a kvalitatívne kódovanie

Keď váš softvér vytvorí výstup (napr. t(48) = 2,31, p = 0,025), AI vám ho pomôže interpretovať v jednoduchom jazyku: čo to znamená, význam veľkosti účinku, ako sa to bude hlásiť (vo formáte APA). Túto interpretáciu si overíte pohľadom na svoj vlastný výstup; Dáte výstup AI, ona ho interpretuje, viete, že číslo skutočne pochádza z vašej analýzy.

V kvalitatívnej analýze dokáže AI extrahovať možné kódy (opakujúce sa jednotky významu) a témy z prepisov rozhovorov. Toto je cenné ako východiskový bod v indukčnom kódovaní; AI môže navrhnúť vzor, ​​ktorý ste vynechali. Ale jadrom kvalitatívnej analýzy je hlboké čítanie výskumníka; Každý kód, ktorý AI navrhne, prepojíte späť s nespracovanými údajmi (skutočná cenová ponuka), skontrolujete jeho kontext a prefiltrujete ho pomocou vlastného interpretačného rámca. AI „neinterpretuje“ kvalitatívne údaje, navrhuje vzory; Vy tvoríte zmysel.

p-hacking (manipulácia s údajmi rôznymi spôsobmi, kým sa nedosiahnu zmysluplné výsledky) je vážnym etickým porušením. Prinútiť AI hovoriť „skúste rôzne testy, kým nenájdete zmysluplný výsledok“ je presne to a je zakázané. Pred pohľadom na údaje si určite plán analýzy (ak je to možné s predregistráciou) a použite AI na vykonanie tohto plánu, nie na „honbu“ za výsledkom.

Reprodukovateľnosť a dokumentácia kódu

V modernej akademickej obci je reprodukovateľnosť čoraz dôležitejšia: schopnosť iného výskumníka dospieť k rovnakému záveru s vašimi údajmi a kódom. AI je tu obojstranným pomocníkom. Najprv ho môžete požiadať, aby zdokumentoval vytvorený kód pomocou riadkov s komentármi; Kód, ktorý vysvetľuje, čo každý krok robí, vám uľahčí porozumenie o šesť mesiacov neskôr a pre audítora, ktorý bude nasledovať. Po druhé, AI tlačí vašu analýzu k tomu, aby bola založená na skriptoch a nie na náhodnom ručnom klikaní (napr. v ponukách SPSS); Skript je úplný záznam vašej analýzy a možno ho zopakovať jediným kliknutím. To eliminuje neistotu "s akým nastavením som dosiahol tento výsledok?"

Súčasťou reprodukovateľnosti je oddelenie nespracovaných údajov a spracovaných údajov: nikdy sa nespracovaných údajov nedotýkate ručne, všetky transformácie (čistenie, kódovanie, vylúčenie) vykonávate v kóde. Týmto spôsobom, keď nájdete chybu, môžete sa vrátiť na začiatok a spustiť ju znova. AI môže navrhnúť rámec pracovného toku, ktorý zachováva tento rozdiel; Ale rozhodnutia, ako napríklad ktorý účastník bol vylúčený a prečo, sú vedecké úsudky, ktoré musíte urobiť a zaznamenať.

tri mini prípady

Prípad 1 – Zrýchlenie kódu, manuálne overenie. Jeden výskumník nevedel, ako urobiť opakované meranie ANOVA v R. Opísal dátovú štruktúru (anonymnú) AI, vzal návrh kódu a spustil ho na svojom vlastnom počítači. Výstup zopakoval aj v SPSS; Oba výsledky súhlasili. Kód bol správny, ale výskumník sa v ňom cítil istý až vtedy, keď ho overil pomocou druhého nástroja.

Prípad 2 – Vymyslené súhrnné štatistiky. Študent prilepil tabuľku s údajmi do AI a povedal „vypočítajte priemery a štandardné odchýlky“. AI vrátila čísla, ktoré sa zdali rozumné; Keď si to študent skontroloval v softvéri, videl, že viacero priemerov je chybných. AI v skutočnosti nevypočítala tabuľku, uhádla ju. Ponaučenie: softvér robí výpočet, výsledok nedostanete z AI.

Prípad 3 – Návrh kvalitatívneho kódu. Sociálny vedec sám zakódoval 30 rozhovorov, potom nakŕmil AI anonymizovanú podskupinu a spýtal sa, „aké ďalšie témy sa objavia“. AI navrhol tému „inštitucionálnej dôvery“, ktorú neuvažoval samostatne. Výskumníčka sa vrátila k surovým citátom, zistila, že téma bola skutočne podporovaná, a pridala ju do svojej analýzy. AI pridaná perspektíva; Výskumník urobil rozhodnutie a overenie.

Kopírovateľné šablóny

1) Konzultácia pri výbere testu:

Výnos: [typ závislej premennej], [počet skupín], [nezávislý/spárovaný],[čo viem o rozdelení]. Moja otázka: je medzi skupinami rozdiel? Uveďte štatistické testy, ktoré môžu byť vhodné, s ich odôvodnením a zapíšte si predpoklady každého z nich. Ja robím výber.

2) Návrh kódu (bez ID):

Používam R. Môj dátový rámec má nasledujúce stĺpce: [názvy a typy stĺpcov, príklad NEIDENTIFIKOVANÉ 2 riadky]. Napíšte kód s interpretáciou, ktorá vykoná nezávislý vzorový t-test a skontroluje predpoklady (normalita, homogenita rozptylu). Spustím kód na svojom vlastnom počítači.

3) Výstupná interpretácia (APA):

Môj štatistický softvér vytvoril nasledujúci výstup: [prilepiť výstup]. Ako to nahlásim vo formáte APA 7? Vysvetlite veľkosť účinku a jeho praktický význam jednoduchým jazykom. Vezmite čísla z môjho výstupu, nevytvárajte nové.

4) Kvalitatívny návrh témy (anonymný):

Nižšie sú uvedené anonymizované úryvky z rozhovorov. Induktívne navrhnite možný kód a tému KANDIDÁTI; Ukážte, z ktorej ponuky vychádza každý kandidát. Toto sú návrhy; Overím to z nespracovaných údajov. Citáty: [anonymný text]

Slabá výzva / Silná výzva

Slabá výzva:

Analyzujte tieto údaje a povedzte mi výsledok. [prilepiť tabuľku]

AI tvorí výpočet; Okrem toho sa nespracované údaje odosielajú do otvoreného nástroja. Dvojité riziko.

Výkonná výzva:

Používam Python (pandy + scipy). Môj dátový rámec: [definícia neidentifikovaného stĺpca]. Chcem porovnať dve skupiny. Napíšte INTERPRETOVANÝ kód, ktorý (1) skontroluje predpoklady, (2) použije vhodný test, (3) vypočíta veľkosť účinku. Spustím to s vlastnými údajmi a nahlásim výsledok. NEVYHOVUJETE číslo; stačí zadať kód a komentáre.

podnikania

AI áno

robíš

Výber testu

Možnosť + odôvodnenie

Kontrola predpokladov, rozhodnutie

Analytický kód

návrh kódexu

Beh a čítanie lokálne

numerický výpočet

nemal by

Výpočet so softvérom

Výstupný komentár

Prehľad jednoduchého jazyka

Potvrďte vlastným výtlačkom

Kvalitatívne kódovanie

Kandidát na tému

Validácia s nespracovanými dátami

Časté chyby

  • Nahrávanie nespracovaných/identifikovaných údajov do otvoreného nástroja. Dôvernosť účastníka je porušená; najvážnejšia chyba.
  • Umelá inteligencia počíta čísla. Vytvára vymyslené štatistiky; Softvér vykoná výpočet.
  • Spustenie kódu bez jeho prečítania. Tichá chyba prenikne do správy.
  • p-hacking. Pokúšať sa testami nájsť zmysluplné výsledky je etické porušenie.
  • Ponechanie kvalitatívnej interpretácie na AI. Výskumník konštruuje význam; AI iba navrhuje vzory.
Tip: Plán analýzy a odôvodnenie každého testu, ktorý použijete, si uchovajte v písomnej forme. To chráni pred p-hackingom a poskytuje pripravený záznam pri písaní časti metódy.

V súhrne

AI výrazne urýchľuje analýzu údajov pomocou návrhu kódu, poradenstva pri výbere testov, interpretácie výstupov a kvalitatívnych návrhov tém. Analýza je však najchúlostivejšou oblasťou presnosti akadémie: nespracované údaje sa uchovávajú v tajnosti, výpočty sa vykonávajú v softvéri, každý číselný výsledok sa overuje ručne, kvalitatívna interpretácia je viazaná na nespracované údaje a vyhýba sa p-hackingu. Najkratšie pravidlo: kód a interpretácia sú od AI, výpočet a rozhodnutie sú od vás.

Aplikačná úloha

Anonymne popíšte štruktúru svojich vlastných (alebo vzoriek) údajov a požiadajte AI o vhodné odporúčanie na test a komentovaný kód analýzy. Prečítajte si kód a jednou vetou napíšte, čo robí každý riadok. Spustite kód a získajte výstup a ak je to možné, overte aspoň jeden výsledok druhým spôsobom (ručne alebo iným nástrojom). Ak pracujete kvalitatívne, navrhnite tému anonymnej skupine citátov a porovnajte ich s nespracovanými údajmi.

kontrolný zoznam

  • [ ] Nenačítal som nespracované/identifikované údaje do žiadnych otvorených nástrojov?
  • [ ] Potvrdil som výber testu kontrolou predpokladov?
  • [ ] Prečítal som si kód, porozumel som mu a spustil som ho lokálne?
  • [ ] Overil som každý softvér/sekundárny číselný výsledok?
  • [ ] Zviazal som kvalitatívne témy späť so surovými úvodzovkami?