Enota 3 / 11

Raziskovalna analiza in vizualizacija podatkov: Grafiranje in interpretacija z umetno inteligenco

Dobički:

  • Sposobnost izdelave deskriptivne statistike in distribucijskih/relacijskih grafikonov s podporo za umetno inteligenco ter izbira prave vrste grafikona glede na podatke in vprašanja
  • Sposobnost prepoznavanja zavajajočih izbir (črtkana os, neustrezno merilo, pretirano glajenje) na slikah, ki jih je ustvarila umetna inteligenca, in uporaba načel poštene vizualizacije
  • Biti sposoben razlikovati, da je raziskovalna analiza namenjena generiranju hipotez in pasti odkrivanja in potrditve z istimi podatki (kar odpira vrata p-hekanju).

Po čiščenju podatkov je prva naloga empiričnega raziskovalca, da jih spozna. Ta stopnja se imenuje raziskovalna analiza podatkov (EDA – Exploratory Data Analysis): gre za postopek preučevanja podatkov z grafi in povzetki statistike ter opazovanje njihove strukture, vzorcev in presenečenj. Cilj še ni preizkusiti hipotezo, ampak se seznaniti s podatki, ustvariti vprašanja in postaviti temelje za model, ki ga boste gradili v prihodnosti. V tej enoti bomo videli, kako umetna inteligenca (AI) pospešuje EDA in vizualizacijo, a zakaj je treba grafiko, ki jo proizvaja, skrbno pregledati.

Najprej naredimo dve osnovni ločljivosti. Prvič, deskriptivna statistika (števila, ki povzemajo podatke, kot so povprečje, mediana, standardni odklon, kvartili) in vizualizacija (grafično prikazuje iste informacije) se dopolnjujeta; Skupaj opisujejo podatke. Drugič in najbolj kritično: odkritje in potrditev je treba razlikovati. Raziskovalna analiza je namenjena ustvarjanju hipotez; Raziskovanje hipoteze z istimi podatki in beseda "preizkusil sem jo in se mi je zdelo pomembno" odpre vrata p-hekanju, ki ga bomo videli v naslednji enoti. Pogled na podatke in vzorec je brezplačen; Toda razglasitev tega vzorca za "dokazano ugotovitev" v istih podatkih je zavajajoča.

Raziskovalna analiza korak za korakom

1. Univariatni pogled. Preglejte vsako spremenljivko posebej: ali je njena porazdelitev simetrična ali poševna; koliko je hribov; Kje so odstopanja? Za numerične spremenljivke histogram (graf, ki prikazuje frekvenco z razdelitvijo vrednosti na razpone) in boxplot (boxplot — grafikon, ki prikazuje mediano, kvartil in ekstremne vrednosti); Za kategorične spremenljivke uporabite frekvenčne tabele in palične grafikone.

2. Bivariatni pogled. Oglejte si razmerje med dvema spremenljivkama: raztreseni diagram za dve numerični spremenljivki (vsako opazovanje prikazuje kot točko na ravnini x-y), združeni kvadratni diagram za numerično-kategorično, navzkrižna tabela za dve kategorični. Preden pogledate korelacijski koeficient, se prepričajte, da si ogledate raztreseni graf: ista korelacija lahko kaže zelo različne vzorce (slavni kvartet Anscombe to dokazuje; štirje nizi podatkov imajo skoraj enake statistike, vendar se pri narisu izkažejo za popolnoma drugačne).

3. Izberite pravilno vrsto grafikona. Vrsta grafikona je odvisna od vašega vprašanja in vrste podatkov. Histogram za porazdelitev; raztros za odnos; črtni grafikon za spremembe skozi čas; palični grafikon za primerjavo kategorij; (previdno) zložena palica za razmerje delov proti celoti. AI hitro ustvari kodo za vas, vendar je odločitev, "kateri graf za katero vprašanje", vaša.

4. Upoštevajte vzorec, ne objavljajte rezultatov. Vsak zanimiv vzorec, ki ga vidite, zapišite kot "opombo o odkritju", vendar ga ne imejte za potrjeno ugotovitev. Potrditev se opravi v ločenem koraku, po možnosti z ločenimi podatki ali vnaprej določenim urnikom.

Iskrena načela vizualizacije

Grafika prepriča; Zato je tudi njegova zavajajoča moč velika. AI lahko sprejema estetske, a včasih zavajajoče odločitve. Preverite te pravilnike:

  • V paličnih grafikonih se mora os y začeti pri nič. Črtkana os prikazuje majhne razlike kot velike.
  • Lestvica mora biti dosledna. Če primerjate dva grafikona, uporabite isti obseg osi.
  • Prekomerno glajenje lahko skrije pravi vzorec. Linija trenda izgleda lepo, a če preveč »zgladi« podatke, je lahko zavajajoča.
  • Barva in 3D dekoracija izkrivljata pozornost, ne podatkov. Izberite preprostost.
  • Manjkajoči podatki in velikost vzorca morajo biti vidni. »n=12« in »n=12.000« ne bi smela izgledati enako.
Pozor: samo zato, ker je grafika, ki jo ustvarja AI, lepa, ni resnična. Najpogostejša napaka, ki jo naredi, je, da ne začne osi od nič v paličnem grafikonu in pretirava z razliko med obema skupinama. Vedno preverite os.

Primerjalna tabela: vprašanje → tabela

Vprašajte

pravilen grafikon

Pogosta napaka

Kako je ta spremenljivka porazdeljena?

Histogram/škatlasti izris

uporabite tortni grafikon

Ali sta dve številski spremenljivki povezani?

Raztreseni prikaz

Če samo pogledam število korelacij

Kako se je spremenil skozi čas?

črtni grafikon

Predstavljanje trenda s paličnim grafikonom

Kakšna je razlika med skupinami?

Združena škatla/bar (od začetka)

Palica z okrnjeno osjo

Razmerje med delom in celoto?

Zložena palica (previdno)

Večrezinski tortni grafikon

Štirje pozivi za kopiranje

1. Koda za samodejno odkrivanje:

Vaša vloga: pomočnik EDA. Ne delim podatkov, želim kodo R (ggplot2). Obstajajo numerične (dohodek, starost, izdatki) in kategorične (regija, izobrazba) spremenljivke v 'data' data.frame. Naloga: napišite kodo, ki ustvari histogram za vsako številko, palični grafikon za vsako kategoriko in raztreseni diagram za dohodek~starost. V paličnih grafikonih naj se os y začne od NIČ. Dodajte vrstico za komentar.

2. Pregled korelacije (korelacija + vizualno skupaj):

Napišite kodo, ki izračuna Pearsonovo korelacijo za dohodek in porabo ter izriše raztreseni grafikon + linearni trend. Dodajte vrstico s komentarjem, ki me opomni, naj pregledam grafikon, preden ZAUPAM številu korelacije (opozorilo Anscombe). Ne pregladite linije trenda.

3. Revizija integritete:

Preverite naslednjo kodo ggplot za pošteno vizualizacijo: [code]. Preverite in popravite naslednje: ali se os y začne od nič, ali je merilo dosledno, ali je velikost vzorca vidna, ali je prišlo do prekomernega glajenja? Pojasnite utemeljitev za vsak popravek, ki ste ga naredili.

4. Izdelava opombe o odkritju (ne najdbe):

Na podlagi grafov, ki jih izdelam, navedite OPAZANJA kot 'opombo o odkritju'; vsako postavko napišite v jeziku 'hipoteze, ki jo je treba preizkusiti', ne 'dokončne ugotovitve'. Primer: „ZDI SE, da so prihodki v visokem šolstvu bolj razpršeni; je treba testirati z ločenimi podatki.' Izogibajte se vzročnim in dokončnim izjavam.

Šibek poziv/močan poziv

Šibek poziv:

Naredite lepe grafe iz donosa in mi povejte, kaj pomenijo.

Ta poziv vabi k zavajajočim rezultatom: »lepo« se osredotoča na estetiko, medtem ko »kaj to pomeni« prisili AI, da skoči od odkritja do dokončnega zaključka. Sledijo vzročni, pretirani komentarji.

Močan poziv:

Vaša vloga: pošten pomočnik EDA. Naloga: (1) izberite vrsto grafikona, ki ustreza mojemu vprašanju, in napišite utemeljitev, (2) začnite os od nič v paličnih grafikonih, (3) interpretirajte izhod v jeziku OPOMBE O ODKRITJU: ni dokončne/vzročne trditve predlagajte hipotezo v jeziku, ki ga je treba preizkusiti, (4) opozori me, če je vzorec majhen (n<30). Grafikon bom zagnal v svojem okolju in preveril to.

Razlika: močna volja upravičuje tip karte, vsiljuje pravila poštenosti in ne zamenjuje odkritja s potrditvijo.

trije mini kovčki

Primer 1 – Pretiravanje diskretne osi. Analitik je v paličnem grafikonu prikazal ocene zadovoljstva dveh vej (7,8 in 8,0; od 10). Na začetku osi YZ od 7,5 je bila druga veja skoraj dvakrat višja od prve; medtem ko je bila razlika le 2,5 %. Vodstvo je hotelo nagraditi podružnico pod napačnim vtisom. Ko sem zagnal os iz nič, je bila razlika skoraj nevidna. Lekcija: sama izbira osi spremeni dojemanje.

2. primer – zaupanje korelaciji in preskok grafikona. Raziskovalec je videl r = 0,81 med dvema spremenljivkama in zapisal "močno linearno razmerje". Ko je njegov svetovalec prosil za diagram razpršitve, je bilo razvidno, da je razmerje dejansko posledica enega samega ekstremnega opazovanja, in ko je bila ta točka odstranjena, je korelacija padla na 0,12. Lekcija: štetje korelacije ni nadomestilo za graf; vedno poglejte razpršenost.

3. primer – zamenjava odkritja s potrditvijo. En študent je pogledal vse korelacije po parih v naboru podatkov s 40 spremenljivkami, izbral najvišjo (r=0,52) in zapisal, "ugotovili smo pomembno povezavo med izobrazbo in prihranki (p=0,004)." Vendar pa je bilo na stotine parov v 40 spremenljivkah; izbira najvišjega je bila napačna ugotovitev zaradi naključja. Lekcija: odkritega vzorca ni mogoče »testirati in razglasiti za pomembnega« v istih podatkih; Potrebna je posebna potrditev.

Pogoste napake

  • Osi se v paličnem grafikonu ne začne z ničle. Pretirava majhno razliko; Najpogostejša vizualna laž. Vedno preverite.
  • Če pogledamo korelacijo in preskočimo grafikon. Ista korelacija izhaja iz zelo različnih vzorcev; lahko ustreza zunanjemu razmerju. Prvič, raztros.
  • Upoštevanje vzorca, najdenega v odkritju, kot "dokaza" v istih podatkih. To je prehod do p-hekanja; Potrditev poteka ločeno.
  • Napačna vrsta grafikona. Ujemanja, kot sta vrstica za trend in pita za distribucijo, so zavajajoča. Izberite žanr glede na vprašanje.
  • Skrivanje velikosti vzorca. n=8 in n=8.000 ne bi smeli izgledati enako na istem grafu; pokazati je treba negotovost.
Nasvet: Preden objavite grafikon, se vprašajte: "Ali bi se zgodba spremenila, če bi spremenil os?" Če je odgovor pritrdilen, ste pivot verjetno začeli z nepoštenega mesta.

Če povzamem

Raziskovalna analiza podatkov je faza srečanja s podatki, videnja vzorcev in generiranja hipotez; To ni potrditev. Umetna inteligenca hitro ustvari opisno statistiko in kodo grafa, vendar izberete vrsto grafa na podlagi vašega vprašanja in nadzirate načela pravičnosti (ničelna os, dosledna lestvica, navidezna negotovost). Poglejte razpršenost, preden zaupate korelacijskemu številu; Ne razglasite vzorca, ki ste ga našli pri odkrivanju, kot "dokaz" v istih podatkih. Lep graf AI ne pomeni pravilnega grafa.

Aplikacijska naloga

Izberite vsaj tri spremenljivke v nizu podatkov. Prosite AI za in zaženite kodo, ki ustvari raziskovalne grafe (histogram, razpršene, okvirjaste) s pozivom, ki uveljavlja pravila poštenosti. Za vsak grafikon: preverite (1) ustreznost vrste grafikona glede na vprašanje, (2) poštenost osi, (3) vidnost velikosti vzorca. Napišite vsaj eno »opombo o odkritju« v jeziku hipotez (»… zdi se, da bo testirano ločeno«). Preglejte korelacijo s štetjem in razpršenostjo ter poročajte, če med njima obstaja neskladje.

kontrolni seznam

  • [ ] Vrsto grafikona sem izbral glede na svoje vprašanje in vrsto podatkov.
  • [ ] V paličnih grafikonih začnem os y od nič; Preveril sem poštenost osi.
  • [ ] Preden sem zaupal korelaciji, sem pogledal diagram razpršitve.
  • [ ] Na grafu sem prikazal velikost vzorca in negotovost.
  • [ ] Vzorce, ki sem jih našel med raziskovanjem, sem zapisal kot "hipotezo, ki jo je treba preizkusiti" in ne kot "dokaz".
  • [ ] Opozoril sem, da ne bom uporabil istih podatkov za potrditev in da je potreben ločen korak.