zisky:
- Schopnosť vytvárať popisné štatistiky a distribučné/relačné grafy s podporou umelej inteligencie a zvoliť správny typ grafu podľa údajov a otázky
- Schopnosť rozpoznať zavádzajúce voľby (prerušovaná os, nevhodná mierka, nadmerné vyhladzovanie) v obrázkoch vytvorených umelou inteligenciou a aplikovať poctivé princípy vizualizácie
- Schopnosť rozlíšiť túto prieskumnú analýzu slúži na generovanie hypotéz a pasce na objavovanie a potvrdenie s rovnakými údajmi (čo otvára dvere p-hackingu).
Po vyčistení dát je prvou úlohou empirického výskumníka ich spoznať. Táto fáza sa nazýva prieskumná analýza údajov (EDA - Exploratory Data Analysis): je to proces skúmania údajov pomocou grafov a súhrnných štatistík a pozorovania ich štruktúry, vzorov a prekvapení. Cieľom zatiaľ nie je testovať hypotézu, ale zoznámiť sa s dátami, vygenerovať otázky a položiť základy pre model, ktorý v budúcnosti postavíte. V tejto jednotke uvidíme, ako umelá inteligencia (AI) zrýchľuje EDA a vizualizáciu, ale prečo grafika, ktorú produkuje, musí byť dôkladne auditovaná.
Najprv urobme dva základné rozdiely. Po prvé, deskriptívna štatistika (čísla, ktoré sumarizujú údaje ako priemer, medián, štandardná odchýlka, kvartily) a vizualizácia (graficky zobrazujúce rovnaké informácie) sa navzájom dopĺňajú; Spoločne popisujú údaje. Po druhé, a to najdôležitejšie: treba rozlišovať medzi objavom a potvrdením. Prieskumná analýza slúži na generovanie hypotéz; Skúmanie hypotézy s rovnakými údajmi a vyslovenie „Testoval som to a zistil som, že je to významné“ otvára dvere p-hackingu, ktorý uvidíme v ďalšej časti. Je zadarmo pozrieť sa na údaje a vidieť vzor; Ale vyhlásiť tento vzor za „dokázaný nález“ v tých istých údajoch je zavádzajúce.
Prieskumná analýza krok za krokom
1. Univariačný pohľad. Preskúmajte každú premennú jednotlivo: je jej rozdelenie symetrické alebo šikmé; koľko je tam kopcov; Kde sú odľahlé hodnoty? Pre numerické premenné histogram (graf zobrazujúci frekvenciu delením hodnôt do rozsahov) a box graf (box graf – graf zobrazujúci medián, kvartil a extrémne hodnoty); Pre kategorické premenné použite frekvenčné tabuľky a stĺpcové grafy.
2. Dvojrozmerné zobrazenie. Pozrite si vzťah medzi dvoma premennými: bodový graf pre dve numerické premenné (zobrazuje každé pozorovanie ako bod v rovine x-y), skupinový rámček pre numericko-kategoriálne, krížová tabuľka pre dve kategorické. Predtým, než sa pozriete na korelačný koeficient, nezabudnite sa pozrieť na bodový graf: rovnaká korelácia môže vykazovať veľmi odlišné vzory (slávne Anscombeho kvarteto to demonštruje; štyri súbory údajov majú takmer identickú štatistiku, ale pri vykreslení sa ukáže, že sú úplne odlišné).
3. Vyberte správny typ grafu. Typ grafu závisí od vašej otázky a typu údajov. Histogram pre distribúciu; rozptyl pre vzťah; čiarový graf pre zmenu v čase; stĺpcový graf na porovnanie kategórií; (opatrne) naskladaný bar pre pomer častí k celku. AI rýchlo vygeneruje kód za vás, ale rozhodnutie „ktorý graf pre ktorú otázku“ je na vás.
4. Všimnite si vzor, nedeklarujte výsledky. Zaznamenajte si akýkoľvek zaujímavý vzor, ktorý vidíte, ako „objavnú poznámku“, ale nepovažujte to za potvrdené zistenie. Potvrdenie sa vykonáva v samostatnom kroku, najlepšie so samostatnými údajmi alebo vopred stanoveným harmonogramom.
Poctivé princípy vizualizácie
Grafika presvedčí; Preto je jeho klamlivá sila tiež vysoká. AI môže robiť estetické, ale niekedy zavádzajúce rozhodnutia. Skontrolujte tieto zásady:
- V stĺpcových grafoch musí os y začínať na nule. Prerušovaná os ukazuje malé rozdiely ako veľké.
- Mierka by mala byť konzistentná. Ak sa porovnávajú dva grafy, použite rovnaký rozsah osi.
- Prílišné vyhladzovanie môže skryť skutočný vzor. Trendová čiara vyzerá pekne, ale ak príliš „vyhladzuje“ údaje, môže byť zavádzajúca.
- Farba a 3D dekorácia skresľujú pozornosť, nie údaje. Vyberte si jednoduchosť.
- Chýbajúce údaje a veľkosť vzorky by mali byť viditeľné. "n=12" a "n=12 000" by nemali vyzerať rovnako.
Pozor: Len preto, že grafika vytvorená AI je krásna, nie je pravdivá. Najčastejšou chybou, ktorú robí, je, že nezačína os od nuly v stĺpcovom grafe a zveličuje rozdiel medzi týmito dvoma skupinami. Vždy skontrolujte os.
Porovnávacia tabuľka: otázka → tabuľka
Opýtajte sa
správny graf
Bežná chyba
Ako je táto premenná rozdelená?
Histogram/krabicový graf
použite koláčový graf
Súvisia dve číselné premenné?
Bodový pozemok
Stačí sa pozrieť na počet korelácií
Ako sa to časom zmenilo?
čiarový graf
Vyjadrenie trendu pomocou stĺpcového grafu
Aký je rozdiel medzi skupinami?
Zoskupený box/bar (od začiatku)
Zrezaná os tyč
Pomer časti k celku?
Skladaný pruh (s opatrnosťou)
Viacvýsekový koláčový graf
Štyri kopírovateľné výzvy
1. Kód automatického zisťovania:
Vaša úloha: asistent EDA. Údaje nezdieľam, chcem kód R (ggplot2). V dátovom rámci sú numerické (príjem, vek, výdavky) a kategorické (región, vzdelanie) premenné. Úloha: napíšte kód, ktorý vytvorí histogram pre každé číslo, stĺpcový graf pre každú kategóriu a bodový graf pre vek príjmu. V stĺpcových grafoch nech os y začína od NULY. Pridať riadok komentára.
2. Preskúmanie korelácie (korelácia + vizuál spolu):
Napíšte kód, ktorý vypočíta Pearsonovu koreláciu pre príjem a výdavky a vykreslí bodový graf + lineárny trend. Pridajte riadok s komentárom, ktorý mi pripomenie, aby som preskúmal graf predtým, ako DÔVERUJEM počtu korelácií (varovanie Anscombe). Neprehladzujte trendovú líniu.
3. Audit integrity:
Skontrolujte nasledujúci kód ggplot pre poctivú vizualizáciu:[kód]. Skontrolujte a opravte nasledovné: začína os y od nuly, je mierka konzistentná, je viditeľná veľkosť vzorky, dochádza k nadmernému vyhladzovaniu? Vysvetlite odôvodnenie každej opravy, ktorú ste vykonali.
4. Vytvorenie poznámky o objave (nie nálezu):
Na základe grafov, ktoré vytvorím, uveďte POZNÁMKY ako „objavnú poznámku“; napíšte každú položku v jazyku „hypotéza, ktorá sa má testovať“, nie „presvedčivé zistenie“. Príklad: „ZDÁ SA, že príjem vo vysokoškolskom vzdelávaní je viac rozptýlený; by sa mali testovať so samostatnými údajmi.“ Vyhnite sa kauzálnym a konečným vyhláseniam.
Slabá výzva / Silná výzva
Slabá výzva:
Urob pekné grafy z výnosu a povedz mi, čo znamenajú.
Táto výzva vyvoláva zavádzajúci výstup: „krásny“ sa zameriava na estetiku, zatiaľ čo „čo to znamená“ tlačí AI, aby skočila od objavu k definitívnemu záveru. Nasledujú kauzálne, prehnané komentáre.
Výkonná výzva:
Vaša úloha: čestný asistent EDA. Úloha: (1) vybrať typ grafu, ktorý vyhovuje mojej otázke a napísať zdôvodnenie, (2) začať os od nuly v stĺpcových grafoch, (3) interpretovať výstup v jazyku DISCOVERY NOTE: žiadne definitívne/kauzálne tvrdenie nenaznačuje hypotézu v jazyku „musí byť otestované“, (4) varovať ma, ak je vzorka malá (n<30 v mojom prostredí).
Rozdiel: silná vôľa ospravedlňuje typ grafu, ukladá pravidlá čestnosti a nezamieňa objavenie s potvrdením.
tri mini prípady
Prípad 1 – zveličenie diskrétnej osi. Analytik ukázal skóre spokojnosti dvoch odvetví (7,8 a 8,0; z 10) v stĺpcovom grafe. Pri spustení osi YZ od 7,5 sa druhá vetva javila takmer dvakrát vyššia ako prvá; pričom rozdiel bol len 2,5 %. Vedenie sa chystalo odmeniť pobočku pod nesprávnym dojmom. Keď som začal s osou od nuly, rozdiel bol takmer neviditeľný. Poučenie: samotný výber osi mení vnímanie.
Prípad 2 – Dôverovanie korelácii a preskočenie grafu. Výskumník videl r = 0,81 medzi dvoma premennými a napísal "silný lineárny vzťah". Keď jeho konzultant požiadal o rozptylový graf, bolo vidieť, že vzťah bol v skutočnosti spôsobený jediným extrémnym pozorovaním, a keď bol tento bod odstránený, korelácia klesla na 0,12. Poučenie: počet korelácií nenahrádza graf; vždy sa pozrite na rozptyl.
Prípad 3 – Mätúci objav s potvrdením. Jeden študent sa pozrel na všetky párové korelácie v súbore údajov so 40 premennými, vybral tú najvyššiu (r=0,52) a napísal: „Zistili sme významný vzťah medzi vzdelaním a úsporami (p=0,004).“ V 40 premenných však boli stovky párov; výber najvyššieho bol chybným zistením v dôsledku náhody. Ponaučenie: objavený vzor nemožno „otestovať a vyhlásiť za významný“ v rovnakých údajoch; Vyžaduje sa samostatné potvrdenie.
Časté chyby
- Nespustenie osi od nuly v stĺpcovom grafe. Preháňa to malý rozdiel; Najbežnejšia vizuálna lož. Vždy skontrolujte.
- Pohľad na koreláciu a preskočenie grafu. Rovnaká korelácia pochádza z veľmi odlišných vzorcov; môže pasovať do odľahlého vzťahu. Po prvé, rozptyl.
- Vzor nájdený v objave považujeme za „dôkaz“ v rovnakých údajoch. Toto je vstupná brána k p-hackingu; Potvrdenie sa vykonáva samostatne.
- Nesprávny typ grafu. Zhody ako stĺpec pre trend a koláč pre rozdelenie sú zavádzajúce. Vyberte si žáner na základe otázky.
- Skrytie veľkosti vzorky. n=8 a n=8 000 by nemalo vyzerať rovnako na rovnakom grafe; treba ukázať neistotu.
Tip: Pred zverejnením grafu si položte otázku: "Zmenil by sa príbeh, keby som zmenil os?" Ak je odpoveď áno, pravdepodobne ste začali pivot z nečestného miesta.
V súhrne
Prieskumná analýza údajov je fázou stretávania sa s údajmi, videnia vzorov a vytvárania hypotéz; Nie je to potvrdenie. AI rýchlo generuje popisnú štatistiku a kód grafu, ale typ grafu si vyberáte na základe svojej otázky a ovládate princípy spravodlivosti (nulová os, konzistentná mierka, zjavná neistota). Pred dôverou korelačnému číslu sa pozrite na rozptyl; Nedeklarujte vzor, ktorý ste našli pri objave, ako „dôkaz“ v tých istých údajoch. Krásny graf AI neznamená správny graf.
Aplikačná úloha
Vyberte aspoň tri premenné v množine údajov. Požiadajte AI a spustite kód, ktorý vytvorí prieskumné grafy (histogram, rozptyl, rámček) s výzvou, ktorá presadzuje pravidlá čestnosti. Pre každý graf: skontrolujte (1) vhodnosť typu grafu k otázke, (2) pravdivosť osi, (3) viditeľnosť veľkosti vzorky. Napíšte aspoň jednu „objavnú poznámku“ v jazyku hypotéz („...zdá sa, že sa testuje samostatne“). Preskúmajte koreláciu s počtom aj rozptylom a nahláste, či medzi nimi existuje nezrovnalosť.
kontrolný zoznam
- [ ] Typ grafu som zvolil na základe mojej otázky a typu údajov.
- [ ] V stĺpcových grafoch začínam na osi y od nuly; Skontroloval som poctivosť osi.
- [ ] Pozrel som sa na bodový graf predtým, ako som uveril korelácii.
- [ ] Veľkosť vzorky a neistotu som premietol do grafu.
- [ ] Vzorce, ktoré som našiel pri prieskume, som napísal skôr ako „hypotézu na testovanie“ než „dôkaz“.
- [ ] Poznamenal som, že na potvrdenie nepoužijem rovnaké údaje a že je potrebný samostatný krok.