Dobici:
- Sposobnost istraživanja distribucije, središta, širenja i anomalija varijabli s odgovarajućim grafikonima (histogram, box plot, scatter plot).
- Sposobnost ispravnog tumačenja korelacije i njezinog čitanja zajedno s dijagramom raspršenosti, bez brkanja s uzročno-posljedičnom vezom
- Sposobnost razumijevanja da sumarne statistike mogu dovesti u zabludu (Anscombeova lekcija) i razvijanja hipoteza koje određuju smjer modeliranja.
Prije izgradnje modela potrebno je poznavati podatke. Baš kao što liječnik ne propisuje lijekove bez pregleda pacijenta, podatkovni znanstvenik ne gradi model bez "pregleda" podataka. Ovo se ispitivanje naziva eksplorativna analiza podataka (skraćeno EDA): to je faza otkrivanja distribucije, odnosa, iznenađenja i zamki podataka vizualno i grafički. Svrha EDA je generirati hipoteze, uhvatiti pogreške i odrediti smjer modeliranja. Umjetna inteligencija je vrlo moćan pomoćnik u ovoj fazi: ona predlaže koji je grafikon prikladan, piše svoj kod, tumači distribuciju. Ali osoba odlučuje, svojim znanjem o terenu, je li uzorak koji vidi stvaran ili slučajnost.
Što EDA traži?
EDA traži odgovore na četiri pitanja. Distribucija: Kako je svaka varijabla raspoređena - je li simetrična, iskrivljena ili s dva vrha? Središnja tendencija i širenje: Što su srednja vrijednost, medijan, standardna devijacija? Odnosi: Kako su varijable povezane jedna s drugom? Anomalije: Postoje li neočekivane vrijednosti, praznine, grupiranja? Ova četiri pitanja određuju koja će značajka funkcionirati i koji je model prikladan.
Definirajmo neke osnovne pojmove. Histogram je grafikon koji dijeli vrijednosti numeričke varijable u intervale i pokazuje koliko je opažanja u svakom intervalu; To je najbrži način da vidite distribuciju. Asimetrija je pomak distribucije u jednom smjeru; Varijable kao što je dohodak su nagnute udesno (većina je niska, nekoliko vrlo visoko). Kutijasti dijagram na prvi pogled prikazuje medijan, kvartile i izvanredne vrijednosti. Dijagram raspršenosti prikazuje odnos dviju numeričkih varijabli s oblakom točaka.
Korelacija: postoji veza, ali budite oprezni
Korelacija — mjera kako se dvije varijable pomiču zajedno; broj između -1 i +1 — je najčešće korišten i najviše pogrešno shvaćen alat EDA. +1 znači savršeno supovećanje, -1 znači savršen inverzni odnos, 0 znači da nema linearnog odnosa. Postoje dvije velike zamke. Prvo, poznato pravilo: korelacija nije uzročnost. Slučajevi gušenja rastu s prodajom sladoleda; ne zato što jedno vodi drugome, nego zato što ljeto (skrivena treća varijabla) pokreće oboje. Drugo, korelacija mjeri samo linearni odnos; Može ukazivati na jak, ali krivolinijski odnos blizak 0. Dakle, kada gledate korelaciju, svakako pogledajte i dijagram raspršenosti.
Oprez: kada AI daje korelacijski broj, može skliznuti u kauzalni jezik poput "A povećava B." Ovo je opasno. Korelacija samo ukazuje na zajedničko kretanje; Samo iskustvo, poznavanje domene i pažljivo zaključivanje utvrđuju razlog.
Kvartet Anscombe: zašto ne samo pogledati broj
Poznat je primjer u statistici: četvorka Anscombe. Četiri različita skupa podataka imaju gotovo istu srednju vrijednost, istu varijancu i istu korelaciju (0,82); Ali kada se iscrtaju na grafikonu, izgledaju potpuno drugačije - jedna ravna linija, jedna zakrivljena, jedna je oblak kojeg vuče jedan ekstremitet. Lekcija je jasna: zbirna statistika dovodi u zabludu, pogled na grafikon je obavezan. AI vam može dati prosjeke i korelacije, ali vjerovati tim brojevima bez uvida u grafikon znači upasti u Anscombeovu zamku.
Tablica u nastavku sažima koji grafikon odgovara kojem pitanju:
Pitanje
prikladna grafika
Što pokazuje
Distribucija jedne varijable
Histogram / KDE
Oblik, nagnutost, broj vrhova
Središte i izvanredni dijelovi
Box plot
Medijan, kvartili, ekstremi
Odnos dvaju brojeva
raspršeni grafikon
Smjer, snaga, zakrivljenost
Usporedba kategorija
stupčasti grafikon
Razlika između grupa
mijenjati tijekom vremena
linijski grafikon
Trend, sezonalnost
Multivarijantni odnos
Korelacijska toplinska karta
Opća matrica odnosa
Simpsonov paradoks: agregirani podaci mogu lagati
Podmukla zamka u EDA-i koje treba biti svjestan je Simpsonov paradoks: obrazac može pokazati jedan smjer kada se svi podaci ispituju zajedno, ali obrnuti kada su podaci podijeljeni u smislene podskupine. Klasičan primjer: čini se da je ukupna stopa prihvaćanja kandidatkinja na sveučilištu niža nego kod muškaraca; Ali kada se pogleda odjel po odjel, stopa prihvaćanja žena veća je od muškaraca u većini odjela. Odakle? Žene su se prijavljivale na konkurentnije (niže stope prihvaćanja) odjele; Kombinirani broj pohranjuje ovu skrivenu varijablu. Pouka je jasna: kada gledate ukupni ili prosjek, svakako provjerite govori li taj broj istu priču kada se razloži na značajne podskupine (segment, razdoblje, kanal). Kada vam umjetna inteligencija da kombiniranu stopu, pitanjem "je li još uvijek važeća kada je segmentirate" rano ćete uhvatiti većinu pogrešnih rezultata.
tri mini kućišta
Slučaj 1 — Dva skrivena brda. Jedan je analitičar otkrio da je prosječna dob kupaca 41 godinu i opisao ih kao "sredovječnu gomilu". Ali histogram je pokazao dva vrhunca: dobne skupine 22-28 i 55-62. Prosjek 41 zapravo nije predstavljao nikoga. Lekcija: nacrtajte distribuciju prije nego što vjerujete srednjoj vrijednosti.
Slučaj 2 — Lažna korelacija. Jedan tim pronašao je korelaciju od 0,78 između "potrošnje na oglase" i "prodaje" i udvostručio proračun. Međutim, ono što je pokrenulo oboje bile su sezonske kampanje; tijekom razdoblja izvan kampanje odnos je pao na 0,10. 340 tisuća TL dodatnog oglašavanja nije donijelo očekivani povrat. Lekcija: zamjena korelacije za uzročnost je skupa.
Slučaj 3 — Crta koju je povukao usamljeni protivnik. Analiza nekretnina pokazala je jaku vezu između kvadrature i cijene (r=0,80). Kad je nacrtana dijagram raspršenosti, gotovo cijeli odnos stvorila je jedna luksuzna vila od 12 milijuna TL; Kada je ta točka uklonjena, korelacija je pala na 0,31. Lekcija: uvijek čitajte korelaciju zajedno s dijagramom raspršenosti.
Četiri predloška za kopiranje
1) Automatski EDA sažetak:
Imam pande df. Napišite kod koji proizvodi: (1) df.info() i df.describe(), (2) histogram za svaki numerički stupac, (3) broj za svaki kategorički stupac. Nemojte komentirati, samo generirajte kod za otkrivanje; Tumačim uzorke.
2) Korelacija + vizualno (uz ogradu uzročnosti):
Napišite kod koji crta korelacijsku matricu i toplinsku kartu za numeričke stupce. Također nacrtajte dijagram raspršenosti 3 najviše korelirana para. Dodajte redak komentara u izlaz koji vas podsjeća da korelacija ne implicira uzročnost. Nemojte iznositi uzročne tvrdnje.
3) Dijagnoza distribucije:
Za stupac "income_tl": napišite kod koji proizvodi histogram, okvirni dijagram, vrijednost asimetrije i usporedbu medijana/srednje vrijednosti. Ja ću protumačiti je li distribucija iskrivljena ili ne; samo daj šifru.
4) Usporedba segmenata:
Usporedite kupce prema "kanalu" (web/mobilni): napišite kod koji daje dijagram prosječnog iznosa, srednjeg iznosa, broja narudžbi i distribucije iznosa za svaki kanal. Predložite koji je test prikladan za statističku značajnost razlike između dva kanala, ali odluka je na meni.
Slab upit / Jak upit
Slab upit:
Pronađite nešto zanimljivo u ovim podacima.
“Zanimljivo” je nedefinirano; AI ne vidi podatke, pa ih ili izmišlja ili daje općenite izjave. Nema smjera, nema varijabli, nema svrhe.
Snažan upit:
Vaša uloga: EDA asistent. df stupci: dob (int), prihod_tl (float), grad (kategorija), kanal (web/mobile), iznos (float). Svrha: otkriti čimbenike koji utječu na "količinu". Zadatak: (1) kodiranje iscrtavanja distribucije iznosa, (2) grafikoni distribucije između iznosa i starosti i prihoda_tl, (3) dijagram okvira iznosa u raščlambi kanala. Utvrđivanje uzročne tvrdnje; Samo generiraj kod za otkrivanje i ja ću protumačiti uzorak.
Ovdje su svrha, varijable i granica "tvrdnje o uzročnosti" jasni.
Uobičajene greške
- Oslanjajući se isključivo na sumarnu statistiku. Kao što pokazuje kvartet Anscombe, ista srednja vrijednost skriva vrlo različite distribucije; vidi grafikon.
- Zamjena korelacije za uzročnost. Sudjelovanje ne znači da jedno vodi drugome; Čuvajte se skrivenih varijabli.
- Gledajući korelaciju bez dijagrama raspršenja. Jedan izuzetak ili zakrivljenost dovodi u zabludu broj.
- Sažimanje distribucije s dva vrha/kose distribucije sa srednjom. Prosjek možda ne predstavlja nikoga.
- Preskačemo EDA i idemo ravno na model. Neprepoznati podaci znače slijepi model.
Savjet: sa svakim novim skupom podataka, prvih 30 minuta posvetite samo crtanju grafikona: histogram svakog broja, dijagram raspršenosti značajnih parova, trakasti dijagram kategorija. Ovih 30 minuta sprječava buduće pogreške modeliranja u danima koji dolaze.
Ukratko
EDA je faza upoznavanja podataka prije izgradnje modela i traži odgovore na četiri pitanja: distribucija, središnje širenje, odnosi i anomalije. Sažetak statistike može dovesti u zabludu; gledanje u grafikon je obavezno (predavanje na Anscombeu). Korelacija je moćan alat, ali uzročnost nije i svakako bi je trebalo čitati zajedno s dijagramom raspršenosti. AI je izvrstan akcelerator za predlaganje grafike i pisanje koda; Ali ljudi svojim terenskim znanjem tumače je li obrazac koji vide stvaran ili je slučajnost.
Zadatak aplikacije
Odaberite skup podataka i samo napravite EDA: izdvojite histogram od najmanje tri numeričke varijable, dijagram raspršenosti dva para varijabli i korelacijsku toplinsku kartu. Pronađite barem jedno "iznenađenje" (kao što je distribucija s dva vrha, kandidat za lažnu korelaciju, odnos privučen jednim izuzetkom) i objasnite to u jednoj rečenici. Pišite bez ikakvih uzročnih tvrdnji.
popis za provjeru
- [ ] Jesam li grafički prikazao distribuciju svake numeričke varijable?
- [ ] Jesam li pogledao korelacije s dijagramom raspršenosti?
- [ ] Jesam li odvojio uzročnost i korelaciju?
- [ ] Nisam li primijetio iskrivljenu distribuciju ili distribuciju s dva vrha i slijepo vjerovao srednjoj vrijednosti?
- [ ] Jesam li iz svojih EDA nalaza izveo barem jedan aspekt/hipotezu modeliranja?