Jednotka 3 / 11

Průzkumná analýza a vizualizace dat: Grafy a interpretace pomocí umělé inteligence

zisky:

  • Schopnost vytvářet popisné statistiky a distribuční/vztahové grafy s podporou umělé inteligence a zvolit správný typ grafu podle dat a otázky
  • Schopnost rozpoznat zavádějící volby (přerušovaná osa, nevhodné měřítko, nadměrné vyhlazování) v obrazech vytvořených umělou inteligencí a aplikovat poctivé principy vizualizace
  • Být schopen rozlišit, že průzkumná analýza je pro generování hypotéz a pasti objevování a potvrzení se stejnými daty (což otevírá dveře p-hackingu).

Po vyčištění dat je prvním úkolem empirického výzkumníka je poznat. Tato fáze se nazývá exploratory data analysis (EDA - Exploratory Data Analysis): je to proces zkoumání dat pomocí grafů a souhrnných statistik a sledování jejich struktury, vzorců a překvapení. Cílem zatím není testovat hypotézu, ale seznámit se s daty, vygenerovat otázky a položit základy pro model, který v budoucnu postavíte. V této jednotce uvidíme, jak umělá inteligence (AI) zrychluje EDA a vizualizaci, ale proč grafika, kterou produkuje, musí být pečlivě auditována.

Udělejme nejprve dva základní rozdíly. Za prvé, deskriptivní statistika (čísla, která shrnují data, jako je průměr, medián, směrodatná odchylka, kvartily) a vizualizace (zobrazující stejné informace graficky) se vzájemně doplňují; Společně popisují data. Za druhé, a to nejdůležitější: je třeba rozlišovat objev a potvrzení. Průzkumná analýza slouží ke generování hypotéz; Prozkoumání hypotézy se stejnými daty a vyslovení „Testoval jsem to a zjistil jsem, že je to významné“ otevírá dveře k p-hackování, které uvidíme v další jednotce. Je zdarma podívat se na data a vidět vzor; Ale prohlašovat tento vzor za „prokázaný nález“ ve stejných datech je zavádějící.

Průzkumná analýza krok za krokem

1. Jednorozměrné zobrazení. Prozkoumejte každou proměnnou jednotlivě: je její rozdělení symetrické nebo zkreslené; kolik je tam kopců; Kde jsou odlehlé hodnoty? U numerických proměnných histogram (graf zobrazující četnost rozdělením hodnot do rozsahů) a boxplot (box plot — graf zobrazující medián, kvartil a extrémní hodnoty); Pro kategorické proměnné použijte frekvenční tabulky a sloupcové grafy.

2. Dvourozměrný pohled. Podívejte se na vztah mezi dvěma proměnnými: bodový graf pro dvě číselné proměnné (ukazuje každé pozorování jako bod v rovině x-y), seskupený rámeček pro číselně-kategoriální, křížová tabulka pro dvě kategoriální. Než se podíváte na korelační koeficient, nezapomeňte se podívat na bodový graf: stejná korelace může vykazovat velmi odlišné vzory (slavná čtveřice Anscombe to demonstruje; čtyři datové sady mají téměř totožné statistiky, ale při vykreslení se ukáží jako zcela odlišné).

3. Vyberte správný typ grafu. Typ grafu závisí na vaší otázce a typu dat. Histogram pro distribuci; rozptyl pro vztah; spojnicový graf pro změnu v čase; sloupcový graf pro srovnání kategorií; (pečlivě) složená tyč pro poměr částí k celku. Umělá inteligence vám rychle vygeneruje kód, ale rozhodnutí „který graf pro kterou otázku“ je na vás.

4. Všimněte si vzoru, nedeklarujte výsledky. Zaznamenejte si jakýkoli zajímavý vzorec, který vidíte, jako „poznámku k objevu“, ale nepovažujte to za potvrzený nález. Potvrzení se provádí v samostatném kroku, nejlépe se samostatnými údaji nebo předem stanoveným harmonogramem.

Poctivé principy vizualizace

Grafika přesvědčí; Proto je jeho klamavá síla také vysoká. Umělá inteligence může dělat estetická, ale někdy zavádějící rozhodnutí. Zkontrolujte tyto zásady:

  • Ve sloupcových grafech musí osa y začínat nulou. Čárkovaná osa ukazuje malé rozdíly jako velké.
  • Měřítko by mělo být konzistentní. Pokud se porovnávají dva grafy, použijte stejný rozsah os.
  • Přílišné vyhlazení může skrýt skutečný vzor. Trendová linie vypadá hezky, ale pokud příliš „vyhlazuje“ data, může být zavádějící.
  • Barva a 3D dekorace zkreslují pozornost, nikoli data. Zvolte jednoduchost.
  • Chybějící data a velikost vzorku by měly být viditelné. "n=12" a "n=12 000" by neměly vypadat stejně.
Pozor: Jen proto, že grafika vytvořená umělou inteligencí je krásná, není pravdivá. Nejčastější chybou, kterou dělá, je, že nezačíná osu od nuly ve sloupcovém grafu a zveličuje rozdíl mezi oběma skupinami. Vždy zkontrolujte osu.

Srovnávací tabulka: otázka → tabulka

Zeptejte se

správný graf

Běžná chyba

Jak je tato proměnná distribuována?

Histogram/krabicový graf

použít koláčový graf

Souvisí spolu dvě číselné proměnné?

Bodový děj

Stačí se podívat na počet korelací

Jak se to v průběhu času změnilo?

spojnicový graf

Vyjádření trendu pomocí sloupcového grafu

Jaký je rozdíl mezi skupinami?

Seskupený box/bar (od začátku)

Tyč ve zkrácené ose

Poměr části k celku?

Skládaný pruh (s opatrností)

Vícedílný koláčový graf

Čtyři kopírovatelné výzvy

1. Kód automatického zjišťování:

Vaše role: asistent EDA. Data nesdílím, chci kód R (ggplot2). V datovém rámci jsou numerické (příjmy, věk, výdaje) a kategoriální (region, vzdělání) proměnné. Úkol: napište kód, který vytvoří histogram pro každé číslo, sloupcový graf pro každou kategorii a bodový graf pro příjmový věk. Ve sloupcových grafech nechejte osu y začínat od NULY. Přidat řádek komentáře.

2. Korelace (korelace + vizuální dohromady):

Napište kód, který vypočítá Pearsonovu korelaci pro příjmy a výdaje a vykreslí bodový graf + lineární trend. Přidejte řádek komentáře, který mi připomene, abych prozkoumal graf, než DŮVĚŘUJI počtu korelací (varování Anscombe). Nepřehladzujte trendovou linii.

3. Audit integrity:

Zkontrolujte následující kód ggplot pro poctivou vizualizaci:[kód]. Zkontrolujte a opravte následující: začíná osa y od nuly, je měřítko konzistentní, je vidět velikost vzorku, dochází k nadměrnému vyhlazení? Vysvětlete odůvodnění každé opravy, kterou jste provedli.

4. Vytvoření poznámky o nálezu (nikoli nálezu):

Na základě grafů, které vytvořím, uveďte POZOROVÁNÍ jako „objevnou poznámku“; pište každou položku v jazyce „hypotéza, která má být testována“, nikoli „průkazné zjištění“. Příklad: „Zdá se, že příjem ve vysokoškolském vzdělávání je více rozptýlený; by měly být testovány se samostatnými údaji.“ Vyvarujte se kauzálních a definitivních prohlášení.

Slabá výzva / Silná výzva

Slabá výzva:

Udělejte z výnosu pěkné grafy a řekněte mi, co znamenají.

Tato výzva vyvolává zavádějící výstup: „krásný“ se zaměřuje na estetiku, zatímco „co to znamená“ tlačí umělou inteligenci, aby skočila od objevu ke konečnému závěru. Následují kauzální, přehnané komentáře.

Výkonná výzva:

Vaše role: čestný asistent EDA. Úkol: (1) vybrat typ grafu, který odpovídá mé otázce a napsat zdůvodnění, (2) začít osu od nuly ve sloupcových grafech, (3) interpretovat výstup v jazyce DISCOVERY NOTE: žádné definitivní/kauzální tvrzení nenaznačuje hypotézu v jazyce „musí být otestováno“, (4) varovat mě, pokud je vzorek malý (n<30 v mém prostředí).

Rozdíl: silná vůle ospravedlňuje typ grafu, ukládá pravidla poctivosti a nezaměňuje objevování s potvrzením.

tři mini pouzdra

Případ 1 – Zvětšení diskrétní osy. Analytik ukázal skóre spokojenosti dvou poboček (7,8 a 8,0; z 10) ve sloupcovém grafu. Při spuštění osy YZ od 7,5 se druhá větev jevila téměř dvakrát tak vysoko než první; přičemž rozdíl byl pouze 2,5 %. Vedení se chystalo odměnit pobočku pod špatným dojmem. Když jsem začal s osou od nuly, rozdíl byl téměř neviditelný. Poučení: samotná volba osy mění vnímání.

Případ 2 — Důvěřování korelaci a přeskakování grafu. Výzkumník viděl r = 0,81 mezi dvěma proměnnými a napsal „silný lineární vztah“. Když jeho konzultant požádal o bodový graf, bylo vidět, že vztah byl ve skutečnosti způsoben jediným extrémním pozorováním, a když byl tento bod odstraněn, korelace klesla na 0,12. Poučení: počet korelací nenahrazuje graf; vždy se podívejte na rozptyl.

Případ 3 – Záměna zjištění s potvrzením. Jeden student se podíval na všechny párové korelace v souboru 40 proměnných dat, vybral tu nejvyšší (r=0,52) a napsal: „našli jsme významný vztah mezi vzděláním a úsporami (p=0,004). Ve 40 proměnných však byly stovky párů; volba nejvyšší bylo falešným zjištěním kvůli náhodě. Ponaučení: objevený vzor nelze „otestovat a prohlásit za významný“ ve stejných datech; Je vyžadováno samostatné potvrzení.

Časté chyby

  • Nespuštění osy od nuly ve sloupcovém grafu. Přehání ten malý rozdíl; Nejčastější vizuální lež. Vždy zkontrolujte.
  • Pohled na korelaci a přeskakování grafu. Stejná korelace pochází z velmi odlišných vzorců; může odpovídat odlehlému vztahu. Za prvé, rozptyl.
  • Vzor nalezený v objevu považujeme za „důkaz“ ve stejných datech. Toto je brána k p-hackingu; Potvrzení se provádí samostatně.
  • Špatný typ grafu. Shody jako sloupec pro trend a koláč pro distribuci jsou zavádějící. Vyberte žánr na základě otázky.
  • Skrytí velikosti vzorku. n=8 a n=8 000 by na stejném grafu nemělo vypadat stejně; nejistota se musí ukázat.
Tip: Před publikováním grafu si položte otázku: "Změnil by se příběh, kdybych změnil osu?" Pokud je odpověď ano, pravděpodobně jste zahájili pivot z nečestného místa.

V souhrnu

Průzkumná analýza dat je fáze setkání s daty, sledování vzorců a generování hypotéz; Není to potvrzení. Umělá inteligence rychle generuje popisné statistiky a kód grafu, ale vy si vyberete typ grafu na základě své otázky a řídíte principy spravedlnosti (nulová osa, konzistentní měřítko, zdánlivá nejistota). Než důvěřujete číslu korelace, podívejte se na rozptyl; Nedeklarujte vzor, ​​který jste našli při objevu, jako „důkaz“ ve stejných datech. Krásný graf AI neznamená správný graf.

Aplikační úkol

Vyberte alespoň tři proměnné v sadě dat. Požádejte AI ​​a spusťte kód, který vytváří průzkumné grafy (histogram, rozptyl, rámeček) s výzvou, která prosazuje pravidla poctivosti. Pro každý graf: zkontrolujte (1) vhodnost typu grafu k otázce, (2) poctivost osy, (3) viditelnost velikosti vzorku. Napište alespoň jednu „objevnou poznámku“ v jazyce hypotéz („...zdá se, že bude testován samostatně“). Prozkoumejte korelaci s počtem i rozptylem a nahlaste, zda mezi nimi existuje nesrovnalost.

kontrolní seznam

  • [ ] Typ grafu jsem zvolil na základě své otázky a typu dat.
  • [ ] Ve sloupcových grafech začínám na ose y od nuly; Zkontroloval jsem poctivost osy.
  • [ ] Díval jsem se na bodový graf, než jsem uvěřil korelaci.
  • [ ] Velikost vzorku a nejistotu jsem promítl do grafu.
  • [ ] Vzorce, které jsem našel při průzkumu, jsem napsal spíše jako „hypotézu k testování“ než „důkaz“.
  • [ ] Poznamenal jsem, že pro potvrzení nepoužiji stejná data a že je vyžadován samostatný krok.