Jedinica 3 / 11

Istraživačka analiza i vizualizacija podataka: grafički prikaz i interpretacija s umjetnom inteligencijom

Dobici:

  • Sposobnost izrade deskriptivne statistike i grafikona distribucije/odnosa s podrškom za umjetnu inteligenciju i odabir pravog tipa grafikona prema podacima i pitanju
  • Sposobnost prepoznavanja pogrešnih izbora (isprekidana osa, neprikladna skala, pretjerano izglađivanje) na slikama proizvedenim umjetnom inteligencijom i primjena principa poštene vizualizacije
  • Biti u stanju razlikovati da je istraživačka analiza za generiranje hipoteza i zamku otkrivanja i potvrde s istim podacima (što otvara vrata p-hakiranju).

Nakon čišćenja podataka, prvi posao empirijskog istraživača je da ih upozna. Ova faza se naziva istraživačka analiza podataka (EDA - Exploratory Data Analysis): to je proces ispitivanja podataka sa grafikonima i zbirnom statistikom i sagledavanje njihove strukture, obrazaca i iznenađenja. Cilj nije još testirati hipotezu, već se upoznati s podacima, generirati pitanja i postaviti temelje za model koji ćete graditi u budućnosti. U ovoj jedinici ćemo vidjeti kako umjetna inteligencija (AI) ubrzava EDA i vizualizaciju, ali zašto se grafika koju proizvodi mora pažljivo provjeriti.

Hajde da prvo napravimo dve osnovne razlike. Prvo, deskriptivna statistika (brojevi koji sumiraju podatke kao što su srednja vrijednost, medijan, standardna devijacija, kvartili) i vizualizacija (prikaz istih informacija grafički) se međusobno dopunjuju; Zajedno opisuju podatke. Drugo, i najkritičnije: otkriće i potvrda moraju se razlikovati. Eksplorativna analiza služi za generisanje hipoteza; Istraživanje hipoteze sa istim podacima i izgovaranje "testirao sam je i našao da je značajno" otvara vrata p-hakovanju, što ćemo vidjeti u sljedećoj jedinici. Slobodno je pogledati podatke i vidjeti obrazac; Ali proglašavanje tog uzorka "dokazanim nalazom" u istim podacima je pogrešno.

Korak po korak istraživačka analiza

1. Jednovarijantni pogled. Ispitajte svaku varijablu pojedinačno: da li je njena distribucija simetrična ili iskrivljena; koliko ima brda; Gdje su izvanredni? Za numeričke varijable, histogram (grafikon koji prikazuje frekvenciju dijeljenjem vrijednosti u raspone) i boxplot (boxplot — grafikon koji prikazuje medijanu, kvartil i ekstremne vrijednosti); Za kategoričke varijable koristite tabele učestalosti i trakaste grafikone.

2. Bivarijantni pogled. Pogledajte odnos između dvije varijable: dijagram raspršenosti za dvije numeričke varijable (prikazuje svako opažanje kao tačku na x-y ravni), grafikon grupisanog okvira za numeričko-kategoričke, unakrsni grafikon za dvije kategoričke. Prije nego što pogledate koeficijent korelacije, svakako pogledajte dijagram raspršenosti: ista korelacija može pokazati vrlo različite obrasce (čuveni Anscombe kvartet to demonstrira; četiri skupa podataka imaju gotovo identičnu statistiku, ali kada se nacrtaju ispostavi se da su potpuno različiti).

3. Odaberite ispravan tip grafikona. Tip grafikona zavisi od vašeg pitanja i tipa podataka. Histogram za distribuciju; raspršivanje za odnos; linijski grafikon za promjenu tokom vremena; trakasti grafikon za poređenje kategorija; (pažljivo) naslagana šipka za omjer dijelova prema cjelini. AI brzo generiše kod za vas, ali odluka o tome "koji grafikon za koje pitanje" je vaša.

4. Obratite pažnju na obrazac, nemojte deklarirati rezultate. Zabilježite bilo koji zanimljiv obrazac koji vidite kao "napomenu o otkriću", ali nemojte to smatrati potvrđenim nalazom. Potvrda se vrši u posebnom koraku, po mogućnosti sa zasebnim podacima ili unaprijed određenim rasporedom.

Principi poštene vizualizacije

Grafika uvjerava; Stoga je i njegova obmanjujuća moć velika. AI može donijeti estetske, ali ponekad pogrešne odluke. Provjerite ova pravila:

  • U trakastim grafikonima, y-osa mora početi od nule. Isprekidana os prikazuje male razlike kao i velike.
  • Skala bi trebala biti konzistentna. Ako se uspoređuju dva grafikona, koristite isti raspon osi.
  • Pretjerano zaglađivanje može sakriti pravi uzorak. Linija trenda izgleda lijepo, ali ako previše "izglađuje" podatke, može biti pogrešno.
  • Boja i 3D dekoracija iskrivljuju pažnju, a ne podatke. Odaberite jednostavnost.
  • Podaci koji nedostaju i veličina uzorka trebaju biti vidljivi. "n=12" i "n=12,000" ne bi trebalo da izgledaju isto.
Pažnja: Samo zato što je grafika koju proizvodi AI lijepa, ona nije istinita. Najčešća greška koju pravi je što ne započinje os od nule na trakastom grafikonu i preuveličava razliku između dvije grupe. Uvijek provjerite osovinu.

Uporedni grafikon: pitanje → grafikon

Pitaj

ispravan grafikon

Uobičajena greška

Kako je ova varijabla raspoređena?

Histogram/kutija dijagram

koristite tortni grafikon

Jesu li dvije numeričke varijable povezane?

Scatter plot

Samo gledam broj korelacija

Kako se mijenjao tokom vremena?

linijski grafikon

Označavanje trenda pomoću trakastog grafikona

Koja je razlika između grupa?

Grupirana kutija/bar (od nule)

Skraćena osovinska šipka

Odnos dijela prema cjelini?

Naslagana šipka (sa oprezom)

Višeslojni tortni grafikon

Četiri upita za kopiranje

1. Kod za automatsko otkrivanje:

Vaša uloga: EDA asistent. Ne dijelim podatke, želim R (ggplot2) kod. Postoje numeričke (prihodi, godine, rashodi) i kategorijalne (region, obrazovanje) varijable u okviru podataka. Zadatak: napišite kod koji proizvodi histogram za svaki broj, trakasti grafikon za svaku kategoriju i dijagram raspršenosti za prihod. U trakastim grafikonima, neka os y počinje od NULE. Dodajte red za komentare.

2. Pregled korelacije (korelacija + vizuelni zajedno):

Napišite kod koji izračunava Pearsonovu korelaciju za prihod i potrošnju i prikazuje dijagram raspršenja + linearni trend. Dodajte red za komentare koji me podsjeća da pregledam grafikon prije nego DA VERUJEM u broj korelacija (Anscombe upozorenje). Nemojte previše zaglađivati ​​liniju trenda.

3. Revizija integriteta:

Provjerite sljedeći ggplot kod za iskrenu vizualizaciju:[code]. Provjerite i ispravite sljedeće: da li y-osa počinje od nule, da li je skala konzistentna, da li je veličina uzorka vidljiva, da li postoji pretjerano izglađivanje? Objasnite opravdanje za svaku ispravku koju ste napravili.

4. Izrada bilješke o otkriću (ne nalaza):

Na osnovu grafikona koje napravim, navedite ZAPAŽANJA kao 'napomenu o otkriću'; svaku stavku napišite jezikom 'hipoteze koja se testira', a ne 'uvjerljivog nalaza'. Primjer: 'Čini se da su prihodi u visokom obrazovanju više rasprostranjeni; treba testirati sa posebnim podacima.' Izbjegavajte uzročne i konačne izjave.

Slaba prompt / Jaka prompt

Slab upit:

Napravite lepe grafikone od prinosa i recite mi šta oni znače.

Ova poruka poziva na pogrešan rezultat: "lijepo" se fokusira na estetiku, dok "šta to znači" tjera AI da skoči od otkrića do konačnog zaključka. Slijede uzročni, pretjerani komentari.

Snažan upit:

Vaša uloga: iskreni EDA asistent. Zadatak: (1) odaberite tip grafikona koji odgovara mom pitanju i napišite obrazloženje, (2) započnite os od nule na trakastim grafikonima, (3) protumačite izlaz u jeziku DISCOVERY NOTE: nema definitivne/uzročne tvrdnje ne sugeriše hipotezu na jeziku "mora se testirati", (4) upozorit će me ako je moj uzorak mali dijagram (vjeri30). to.

Razlika: jaka volja opravdava tip grafikona, nameće pravila poštenja i ne brka otkriće sa potvrdom.

tri mini kofera

Slučaj 1 — Preuveličavanje diskretne ose. Analitičar je pokazao rezultate zadovoljstva za dvije grane (7,8 i 8,0; od 10) na trakastom grafikonu. Prilikom pokretanja YZ ose od 7.5, druga grana se pojavila skoro dvostruko viša od prve; dok je razlika bila samo 2,5%. Uprava je trebala nagraditi podružnicu pod pogrešnim utiskom. Kada sam pokrenuo os od nule razlika je bila gotovo nevidljiva. Pouka: sam izbor ose mijenja percepciju.

Slučaj 2 — Vjerovanje u korelaciju i preskakanje grafikona. Istraživač je vidio r = 0,81 između dvije varijable i napisao "jaku linearnu vezu". Kada je njegov konsultant zatražio dijagram raspršenosti, vidjelo se da je odnos zapravo rezultat jednog ekstremnog zapažanja, a kada je ta tačka uklonjena, korelacija je pala na 0,12. Lekcija: broj korelacija nije zamjena za grafikon; uvijek gledajte raspršivanje.

Slučaj 3 — Konfuzno otkriće sa potvrdom. Jedan učenik je pogledao sve korelacije u paru u skupu podataka od 40 varijabli, odabrao najvišu (r=0,52) i napisao, "pronašli smo značajnu vezu između obrazovanja i štednje (p=0,004)." Međutim, postojale su stotine parova u 40 varijabli; odabir najviše je bio lažan nalaz zbog slučajnosti. Pouka: otkriveni obrazac se ne može “testirati i proglasiti značajnim” u istim podacima; Potrebna je posebna potvrda.

Uobičajene greške

  • Ne počinje os od nule na trakastom grafikonu. To preuveličava malu razliku; Najčešća vizuelna laž. Uvijek provjeri.
  • Gledajući korelaciju i preskačući grafikon. Ista korelacija dolazi iz veoma različitih obrazaca; može odgovarati izvanrednom odnosu. Prvo, raspršivanje.
  • Uzimajući u obzir obrazac pronađen u otkriću kao "dokaz" u istim podacima. Ovo je kapija za p-hakovanje; Potvrda se vrši posebno.
  • Pogrešan tip grafikona. Podudaranja kao što su traka za trend i pita za distribuciju su obmanjujuća. Odaberite žanr na osnovu pitanja.
  • Skrivanje veličine uzorka. n=8 i n=8.000 ne bi trebalo da izgledaju isto na istom grafikonu; neizvjesnost se mora pokazati.
Savjet: Prije objavljivanja grafikona, zapitajte se: "Da li bi se priča promijenila ako bih promijenio os?" Ako je odgovor da, vjerovatno ste započeli pivot s nepoštenog mjesta.

Ukratko

Eksploratorna analiza podataka je faza upoznavanja podataka, sagledavanja obrazaca i generisanja hipoteza; To nije potvrda. AI brzo generiše deskriptivnu statistiku i kod grafikona, ali vi birate tip grafikona na osnovu vašeg pitanja i kontrolišete principe pravičnosti (nulta osa, konzistentna skala, očigledna nesigurnost). Pogledajte raspršivanje prije nego što vjerujete korelacijskom broju; Ne deklarišite obrazac koji ste pronašli u otkriću kao "dokaz" u istim podacima. Prekrasan graf AI ne znači ispravan graf.

Zadatak aplikacije

Odaberite najmanje tri varijable u skupu podataka. Zatražite od AI i pokrenite kod koji proizvodi istraživačke grafikone (histogram, raspršivanje, okvir) s promptom koji primjenjuje pravila poštenja. Za svaki grafikon: provjerite (1) prikladnost tipa grafikona za pitanje, (2) iskrenost ose, (3) vidljivost veličine uzorka. Napišite barem jednu „napomenu o otkriću“ u jeziku hipoteze („...izgleda da se testira odvojeno“). Ispitajte korelaciju i sa brojanjem i sa raspršivanjem i prijavite ako postoji neslaganje između njih.

kontrolna lista

  • [ ] Odabrao sam tip grafikona na osnovu mog pitanja i tipa podataka.
  • [ ] U trakastim grafikonima, ja počinjem y-os od nule; Provjerio sam poštenje osovine.
  • [ ] Pogledao sam dijagram raspršenosti prije nego što sam vjerovao korelaciji.
  • [ ] Odrazio sam veličinu uzorka i nesigurnost na grafikonu.
  • [ ] Napisao sam obrasce koje sam pronašao u istraživanju kao "hipotezu koju treba testirati", a ne kao "dokaz".
  • [ ] Napomenuo sam da ne bih koristio iste podatke za potvrdu i da je potreban poseban korak.