Dobici:
- Sposobnost izrade deskriptivne statistike i dijagrama distribucije/odnosa uz podršku umjetne inteligencije i odabir odgovarajuće vrste grafikona prema podacima i pitanju
- Sposobnost prepoznavanja pogrešnih izbora (iscrtkana os, neodgovarajuće mjerilo, pretjerano izglađivanje) na slikama koje je proizvela umjetna inteligencija i primjena načela poštene vizualizacije
- Biti u stanju razlikovati da istraživačka analiza služi za generiranje hipoteza i zamku otkrivanja i potvrde s istim podacima (što otvara vrata p-hakiranju).
Nakon čišćenja podataka, prvi posao empirijskog istraživača je njihovo upoznavanje. Ova se faza naziva eksplorativna analiza podataka (EDA - Exploratory Data Analysis): to je proces ispitivanja podataka pomoću grafikona i sumarne statistike i uvida u njihovu strukturu, obrasce i iznenađenja. Cilj još nije testirati hipotezu, već se upoznati s podacima, generirati pitanja i postaviti temelje za model koji ćete graditi u budućnosti. U ovoj jedinici vidjet ćemo kako umjetna inteligencija (AI) ubrzava EDA i vizualizaciju, ali zašto se grafika koju proizvodi mora pažljivo revidirati.
Prvo napravimo dvije osnovne razlike. Prvo, deskriptivna statistika (brojevi koji sažimaju podatke kao što su srednja vrijednost, medijan, standardna devijacija, kvartili) i vizualizacija (prikazivanje istih informacija grafički) nadopunjuju jedna drugu; Zajedno opisuju podatke. Drugo, i najvažnije: potrebno je razlikovati otkriće i potvrdu. Istraživačka analiza služi za stvaranje hipoteza; Istraživanje hipoteze s istim podacima i izgovaranje "testirao sam je i smatram značajnom" otvara vrata p-hakiranju, što ćemo vidjeti u sljedećoj jedinici. Slobodno je pogledati podatke i vidjeti obrazac; Ali proglašavanje tog obrasca "dokazanim nalazom" u istim podacima je pogrešno.
Istraživačka analiza korak po korak
1. Univarijantni pogled. Ispitajte svaku varijablu pojedinačno: je li njezina distribucija simetrična ili iskrivljena; koliko ima brda; Gdje su ekstremi? Za numeričke varijable, histogram (grafikon koji prikazuje učestalost dijeljenjem vrijednosti u raspone) i boxplot (boxplot — dijagram koji prikazuje medijan, kvartil i ekstremne vrijednosti); Za kategoričke varijable koristite tablice učestalosti i stupčaste dijagrame.
2. Bivarijatni pogled. Pogledajte odnos između dviju varijabli: dijagram raspršenosti za dvije numeričke varijable (svako opažanje prikazuje kao točku na x-y ravnini), dijagram grupiranog okvira za numeričko-kategoričke, unakrsna tablica za dvije kategoričke. Prije nego što pogledate koeficijent korelacije, svakako pogledajte dijagram raspršenosti: ista korelacija može pokazati vrlo različite uzorke (slavni Anscombeov kvartet to pokazuje; četiri skupa podataka imaju gotovo identične statistike, ali kada se iscrtaju ispada da su potpuno različiti).
3. Odaberite ispravnu vrstu grafikona. Vrsta grafikona ovisi o vašem pitanju i vrsti podataka. Histogram za distribuciju; rasipanje za odnos; linijski grafikon za promjene tijekom vremena; stupčasti dijagram za usporedbu kategorija; (pažljivo) naslagana šipka za omjer dijelova prema cjelini. AI brzo generira kod za vas, ali odluka "koji grafikon za koje pitanje" je vaša.
4. Zabilježite uzorak, nemojte objavljivati rezultate. Zabilježite sve zanimljive uzorke koje vidite kao "bilješku o otkriću", ali nemojte to smatrati potvrđenim otkrićem. Potvrda se vrši u zasebnom koraku, po mogućnosti s odvojenim podacima ili unaprijed određenim rasporedom.
Iskreni principi vizualizacije
Grafika uvjerava; Stoga je i njegova moć zavaravanja velika. AI može donositi estetske, ali ponekad pogrešne odluke. Provjerite ova pravila:
- U stupčastim dijagramima y-os mora počinjati od nule. Crtkana os prikazuje male razlike kao velike.
- Ljestvica bi trebala biti dosljedna. Ako se uspoređuju dva grafikona, koristite isti raspon osi.
- Pretjerano zaglađivanje može sakriti pravi uzorak. Linija trenda izgleda lijepo, ali ako previše "izgladi" podatke, može dovesti u zabludu.
- Boja i 3D dekoracija iskrivljuju pozornost, a ne podatke. Odaberite jednostavnost.
- Podaci koji nedostaju i veličina uzorka trebaju biti vidljivi. "n=12" i "n=12 000" ne bi trebali izgledati isto.
Pažnja: samo zato što je grafika koju proizvodi AI lijepa, nije istinita. Najčešća pogreška koju čini je što ne započinje os od nule na stupčastom grafikonu i preuveličava razliku između dviju skupina. Uvijek provjerite osovinu.
Usporedna tablica: pitanje → tablica
Pitajte
ispravan grafikon
Uobičajena greška
Kako je ova varijabla raspoređena?
Histogram/kutijasti prikaz
koristiti tortni grafikon
Jesu li dvije numeričke varijable povezane?
Raspršeni dijagram
Samo gledajući broj korelacija
Kako se promijenio tijekom vremena?
linijski grafikon
Iskazivanje trenda pomoću stupčastog grafikona
Koja je razlika između grupa?
Grupirana kutija/traka (od nule)
Šipka krnje osi
Omjer dijela i cjeline?
Naslagana traka (uz oprez)
Višeslojni tortni grafikon
Četiri upita za kopiranje
1. Kod za automatsko otkrivanje:
Vaša uloga: EDA asistent. Ne dijelim podatke, želim R (ggplot2) kod. Postoje numeričke (prihodi, dob, rashodi) i kategoričke (regija, obrazovanje) varijable u podatkovnom okviru 'podataka'. Zadatak: napišite kod koji proizvodi histogram za svaki broj, stupčasti dijagram za svaku kategoriju i dijagram raspršenosti za dohodovnu dob. U stupčastim dijagramima neka y-os počinje od NULE. Dodajte redak komentara.
2. Pregled korelacije (korelacija + vizualno zajedno):
Napišite kod koji izračunava Pearsonovu korelaciju za prihod i potrošnju i iscrtava dijagram raspršenosti + linearni trend. Dodajte redak komentara koji me podsjeća da pregledam grafikon prije nego što POVJERUJEM broju korelacije (upozorenje Anscombe). Nemojte previše zagladiti liniju trenda.
3. Revizija integriteta:
Provjerite sljedeći ggplot kod za poštenu vizualizaciju:[code]. Provjerite i ispravite sljedeće: počinje li y-os od nule, je li mjerilo dosljedno, je li veličina uzorka vidljiva, postoji li pretjerano izglađivanje? Objasnite obrazloženje za svaki ispravak koji ste napravili.
4. Izrada bilješke o otkriću (ne nalaza):
Na temelju grafikona koje napravim, navedite ZAPAŽANJA kao 'bilješku o otkriću'; napišite svaku stavku jezikom 'hipoteze koju treba testirati', a ne 'konkluzivnog nalaza'. Primjer: 'ČINI SE da su prihodi u visokom obrazovanju više raspoređeni; treba testirati s odvojenim podacima.' Izbjegavajte uzročne i konačne izjave.
Slab upit / Jak upit
Slab upit:
Napravite lijepe grafikone od prinosa i recite mi što oni znače.
Ovaj upit poziva na pogrešan rezultat: "lijepo" se fokusira na estetiku, dok "što to znači" tjera AI da skoči od otkrića do konačnog zaključka. Slijede uzročni, pretjerani komentari.
Snažan upit:
Vaša uloga: pošten EDA pomoćnik. Zadatak: (1) odaberite vrstu grafikona koji odgovara mom pitanju i napišite obrazloženje, (2) pokrenite os od nule u trakastim dijagramima, (3) protumačite izlaz u jeziku NAPOMENE OTKRIĆA: nema konačne/uzročne tvrdnje predložite hipotezu u jeziku "mora se testirati", (4) upozorite me ako je uzorak mali (n<30). Pokrenut ću grafikon u vlastitom okruženju i potvrditi to.
Razlika: snažna volja opravdava tip karte, nameće pravila poštenja i ne brka otkriće s potvrdom.
tri mini kućišta
Slučaj 1 — Pretjerivanje diskretne osi. Analitičar je prikazao rezultate zadovoljstva dviju grana (7,8 i 8,0; od 10) u stupčastom grafikonu. Kad se polazi od osi YZ od 7,5, druga se grana čini gotovo dvostruko viša od prve; dok je razlika bila samo 2,5%. Uprava se spremala nagraditi podružnicu pod krivim dojmom. Kad sam pokrenuo os od nule, razlika je bila gotovo nevidljiva. Lekcija: sam izbor osi mijenja percepciju.
Slučaj 2 — Vjerovanje korelaciji i preskakanje grafikona. Istraživač je vidio r = 0,81 između dvije varijable i napisao "jaku linearnu vezu". Kad je njegov konzultant zatražio dijagram raspršenosti, vidjelo se da je odnos zapravo posljedica jednog ekstremnog opažanja, a kad je ta točka uklonjena, korelacija je pala na 0,12. Lekcija: brojanje korelacija nije zamjena za grafikon; uvijek gledajte raspršeno.
Slučaj 3 — Brkanje otkrića s potvrdom. Jedan je student pogledao sve korelacije u paru u skupu podataka od 40 varijabli, odabrao onu najvišu (r=0,52) i napisao: "Pronašli smo značajan odnos između obrazovanja i štednje (p=0,004)." Međutim, postojale su stotine parova u 40 varijabli; odabir najvišeg bio je pogrešan nalaz zbog slučajnosti. Lekcija: otkriveni obrazac ne može se "testirati i proglasiti značajnim" u istim podacima; Potrebna je posebna potvrda.
Uobičajene greške
- Ne počinje os od nule na trakastom grafikonu. Preuveličava malu razliku; Najobičnija vizualna laž. Uvijek provjerite.
- Gledajući korelaciju i preskačući grafikon. Ista korelacija dolazi iz vrlo različitih obrazaca; može odgovarati izvanrednom odnosu. Prvo, rasipanje.
- Uzimajući u obzir obrazac pronađen u otkriću kao "dokaz" u istim podacima. Ovo je ulaz u p-hakiranje; Potvrda se vrši zasebno.
- Pogrešna vrsta grafikona. Podudaranja poput trake za trend i kolača za distribuciju dovode u zabludu. Odaberite žanr na temelju pitanja.
- Skrivanje veličine uzorka. n=8 i n=8,000 ne bi trebali izgledati isto na istom grafikonu; mora se pokazati neizvjesnost.
Savjet: Prije nego što objavite grafikon, zapitajte se: "Bi li se priča promijenila ako promijenim os?" Ako je odgovor potvrdan, vjerojatno ste pokrenuli pivot s nepoštenog mjesta.
Ukratko
Istraživačka analiza podataka je faza upoznavanja podataka, uočavanja obrazaca i generiranja hipoteza; Nije potvrda. AI brzo generira deskriptivnu statistiku i kod grafikona, ali vi birate vrstu grafikona na temelju svog pitanja i kontrolirate načela pravednosti (nulta os, dosljedna skala, prividna nesigurnost). Pogledajte raspršenost prije nego što povjerujete korelacijskom broju; Ne proglašavajte obrazac koji ste pronašli u otkriću "dokazom" u istim podacima. Prekrasan grafikon AI ne znači i ispravan grafikon.
Zadatak aplikacije
Odaberite najmanje tri varijable u skupu podataka. Zatražite od umjetne inteligencije i pokrenite kod koji proizvodi istraživačke grafove (histogram, raspršene, uokvirene) s upitom koji provodi pravila poštenja. Za svaki grafikon: provjerite (1) prikladnost vrste grafikona pitanju, (2) iskrenost osi, (3) vidljivost veličine uzorka. Napišite barem jednu "bilješku o otkriću" jezikom hipoteze ("…čini se da se zasebno testira"). Ispitajte korelaciju s brojem i raspršenošću i prijavite ako postoji odstupanje između njih.
popis za provjeru
- [ ] Odabrao sam vrstu grafikona na temelju svog pitanja i vrste podataka.
- [ ] U stupčastim dijagramima, y-os počinjem od nule; Provjerio sam poštenje osi.
- [ ] Pogledao sam dijagram raspršenosti prije nego što sam povjerovao korelaciji.
- [ ] Odrazio sam veličinu uzorka i nesigurnost na grafikonu.
- [ ] Napisao sam uzorke koje sam pronašao u istraživanju kao "hipotezu koju treba testirati", a ne kao "dokaz".
- [ ] Napomenuo sam da neću koristiti iste podatke za potvrdu i da je potreban zaseban korak.