Dobički:
- Sposobnost raziskovanja porazdelitve, središča, širjenja in anomalij spremenljivk z ustreznimi grafi (histogram, škatlasti diagram, raztreseni diagram).
- Sposobnost pravilne interpretacije korelacije in branja skupaj z raztresenim grafom, ne da bi jo zamenjali z vzročnostjo
- Sposobnost razumevanja, da je povzetek statistike lahko zavajajoč (lekcija Anscombe) in razvijanja hipotez, ki določajo smer modeliranja.
Pred izdelavo modela je potrebno poznati podatke. Tako kot zdravnik ne predpiše zdravil, ne da bi pregledal bolnika, tudi podatkovni znanstvenik ne zgradi modela, ne da bi "preučil" podatke. Ta pregled se imenuje raziskovalna analiza podatkov (na kratko EDA): je faza odkrivanja distribucije, odnosov, presenečenj in pasti podatkov vizualno in grafično. Namen EDA je ustvarjanje hipotez, lovljenje napak in določanje smeri modeliranja. Umetna inteligenca je v tej fazi zelo močan pomočnik: predlaga, kateri grafikon je primeren, napiše njegovo kodo, interpretira porazdelitev. Toda človek se s svojim terenskim znanjem odloči, ali je vzorec, ki ga vidi, resničen ali naključje.
Kaj išče EDA?
EDA išče odgovore na štiri vprašanja. Porazdelitev: Kako je vsaka spremenljivka porazdeljena – ali je simetrična, nagnjena ali ima dva vrha? Centralna tendenca in širjenje: kaj so povprečje, mediana, standardni odklon? Odnosi: Kako so spremenljivke med seboj povezane? Anomalije: Ali obstajajo nepričakovane vrednosti, vrzeli, skupine? Ta štiri vprašanja določajo, katera funkcija bo delovala in kateri model je primeren.
Opredelimo nekaj osnovnih pojmov. Histogram je graf, ki deli vrednosti numerične spremenljivke v intervale in prikazuje, koliko opazovanj je v vsakem intervalu; To je najhitrejši način za ogled porazdelitve. Asimetrija je premik porazdelitve v eno smer; Spremenljivke, kot je dohodek, so nagnjene v desno (večina nizkih, nekaj zelo visokih). Škatlasti prikaz na prvi pogled prikazuje mediano, kvartile in izstopajoče vrednosti. Raztreseni graf prikazuje razmerje dveh numeričnih spremenljivk z oblakom točk.
Korelacija: obstaja razmerje, vendar bodite previdni
Korelacija — merilo, kako se dve spremenljivki premikata skupaj; število med -1 in +1 — je najbolj uporabljeno in najbolj napačno razumljeno orodje EDA. +1 pomeni popolno sozvišanje, -1 pomeni popolno obratno razmerje, 0 pomeni brez linearnega razmerja. Obstajata dve veliki pasti. Prvič, znano pravilo: korelacija ni vzročna zveza. Primeri zadušitve se povečujejo s prodajo sladoleda; ne zato, ker eno vodi k drugemu, ampak ker poletje (skrita tretja spremenljivka) sproži oboje. Drugič, korelacija meri le linearno razmerje; Lahko kaže na močno, a krivočrtno razmerje, ki je blizu 0. Torej, ko gledate korelacijo, si oglejte tudi raztreseni graf.
Pozor: Ko AI poda korelacijsko število, lahko zdrsne v vzročni jezik, kot je "A poveča B." To je nevarno. Korelacija kaže le gibanje skupaj; Le izkušnje, poznavanje področja in skrbno sklepanje ugotavljajo razlog.
Kvartet Anscombe: zakaj ne bi samo pogledali številke
V statistiki je znan primer: četverica Anscombe. Štirje različni nizi podatkov imajo skoraj enako povprečje, enako varianco in enako korelacijo (0,82); Toda na grafu so videti popolnoma drugače - ena ravna črta, ena ukrivljena, ena oblak, ki ga vleče en sam izstopajoč. Nauk je jasen: sumarna statistika je zavajajoča, pogled v graf je obvezen. Umetna inteligenca vam lahko poda povprečja in korelacije, toda če zaupate tem številkam, ne da bi videli graf, se ujamete v past Anscombe.
Spodnja tabela povzema, kateri grafikon ustreza kateremu vprašanju:
vprašanje
primerna grafika
Kaj kaže
Porazdelitev posamezne spremenljivke
Histogram / KDE
Oblika, nagnjenost, število oglišč
Središče in obrobja
Škatla
Mediana, kvartili, odstopanja
Razmerje dveh števil
raztreseni grafikon
Smer, moč, ukrivljenost
Primerjava kategorij
palični grafikon
Razlika med skupinami
spremeniti skozi čas
črtni grafikon
Trend, sezonskost
Multivariatno razmerje
Korelacijski toplotni zemljevid
Splošna matrika odnosov
Simpsonov paradoks: združeni podatki lahko lažejo
Zahrbtna past v EDA, ki se je morate zavedati, je Simpsonov paradoks: vzorec lahko kaže eno smer, ko so vsi podatki pregledani skupaj, vendar obratno, ko so podatki razdeljeni na pomembne podskupine. Klasičen primer: zdi se, da je splošna stopnja sprejema kandidatk na univerzi nižja kot pri moških; Toda če pogledamo oddelek za oddelkom, je stopnja sprejemanja žensk višja kot moških v večini oddelkov. od kje? Ženske so se prijavljale na bolj konkurenčne (nižje stopnje sprejemljivosti) oddelke; Kombinirano število shrani to skrito spremenljivko. Nauk je jasen: ko gledate skupno ali povprečje, preverite, ali to število pove isto zgodbo, če je razdeljeno na pomembne podskupine (segment, obdobje, kanal). Ko vam umetna inteligenca poda kombinirano stopnjo, boste z vprašanjem »ali je še vedno veljavna, ko jo segmentirate« zgodaj ujeli večino zavajajočih rezultatov.
trije mini kovčki
Primer 1 — Dva skrita hriba. En analitik je ugotovil, da je povprečna starost strank 41 let, in jo označil za "množico srednjih let". Toda histogram je pokazal dva vrha: starostni skupini 22-28 in 55-62. Povprečje 41 pravzaprav ni predstavljalo nikogar. Lekcija: narišite porazdelitev, preden zaupate povprečju.
Primer 2 – Lažna korelacija. Ena ekipa je našla korelacijo 0,78 med »porabo oglasov« in »prodajo« ter podvojila proračun. Vendar pa so oboje sprožile sezonske kampanje; v obdobju izven kampanje je razmerje padlo na 0,10. 340 tisoč TL dodatnega oglaševanja ni prineslo pričakovanega donosa. Lekcija: zamenjava korelacije za vzročno zvezo je draga.
Primer 3 – črta, ki jo je narisal edini nasprotnik. Analiza nepremičnin je pokazala močno povezavo med kvadraturo in ceno (r=0,80). Ko je bila narisana razpršena ploskev, je skoraj celotno razmerje ustvarila ena sama luksuzna vila, vredna 12 milijonov TL; Ko je bila ta točka odstranjena, je korelacija padla na 0,31. Lekcija: vedno preberite korelacijo skupaj z raztresenim grafom.
Štiri predloge za kopiranje
1) Samodejni povzetek EDA:
Imam pande df. Napišite kodo, ki ustvari: (1) df.info() in df.describe(), (2) histogram za vsak številski stolpec, (3) štetje za vsak kategorični stolpec. Ne komentirajte, samo ustvarite kodo za odkrivanje; Razlagam vzorce.
2) Korelacija + vizualno (z opozorilom glede vzročnosti):
Napišite kodo, ki nariše korelacijsko matriko in toplotni zemljevid za številske stolpce. Narišite tudi raztreseni graf treh najvišje koreliranih parov. Izpisu dodajte vrstico s komentarjem, ki vas opomni, da korelacija ne implicira vzročne zveze. Ne postavljajte vzročnih trditev.
3) Diagnoza distribucije:
Za stolpec "income_tl": napišite kodo, ki ustvari histogram, škatlasto grafiko, vrednost asimetrije in primerjavo mediane/povprečja. Razlagal bom, ali je porazdelitev izkrivljena ali ne; samo daj kodo.
4) Primerjava segmentov:
Primerjajte stranke po "kanalu" (splet/mobilno): napišite kodo, ki ustvari okvirni prikaz povprečnega zneska, medianega zneska, števila naročil in porazdelitve zneska za vsak kanal. Predlagajte, kateri test je primeren za statistično pomembnost razlike med obema kanaloma, vendar je odločitev na meni.
Šibek poziv/močan poziv
Šibek poziv:
Poiščite nekaj zanimivega v teh podatkih.
»Zanimivo« je nedefinirano; AI ne vidi podatkov, zato si jih izmisli ali poda splošne izjave. Ni smeri, ni spremenljivk, ni namena.
Močan poziv:
Vaša vloga: pomočnik EDA. df stolpci: starost (int), dohodek_tl (float), mesto (kategorija), kanal (spletni/mobilni), znesek (float). Namen: odkriti dejavnike, ki vplivajo na "količino". Naloga: (1) koda za prikaz porazdelitve zneska, (2) porazdelitveni grafi med zneskom in starostjo ter dohodkom_tl, (3) okvirni prikaz zneska v razčlenitvi kanala. Ugotovitev vzročne terjatve; Samo ustvari kodo za odkrivanje in jaz bom interpretiral vzorec.
Tu so namen, spremenljivke in meja »zahtevanja vzročnosti« jasni.
Pogoste napake
- Zanašanje izključno na sumarno statistiko. Kot kaže kvartet Anscombe, isto povprečje skriva zelo različne porazdelitve; glej grafikon.
- Napačna korelacija za vzročno zvezo. Sodelovanje ne pomeni, da eno vodi k drugemu; Pazite se skritih spremenljivk.
- Pogled na korelacijo brez razpršenega grafa. En sam izstop ali krivulja zavaja število.
- Povzemanje dvovrhne/poševne porazdelitve s povprečjem. Povprečje morda ne predstavlja nikogar.
- Preskoči EDA in gre naravnost k modelu. Neprepoznani podatki pomenijo slep model.
Namig: z vsakim novim naborom podatkov prvih 30 minut porabite samo za risanje grafov: histogram vsake številke, razpršeni graf pomembnih parov, palični grafikon kategorij. Teh 30 minut prepreči prihodnje napake modeliranja v prihodnjih dneh.
Če povzamem
EDA je faza spoznavanja podatkov pred izgradnjo modela in išče odgovore na štiri vprašanja: porazdelitev, širjenje središča, razmerja in anomalije. Povzetek statistike je lahko zavajajoč; ogled grafa je obvezen (predavanje Anscombe). Korelacija je močno orodje, vzročna zveza pa ni in jo je vsekakor treba brati v povezavi z razpršenim grafom. AI je odličen pospeševalnik za predlaganje grafike in pisanje kode; Toda ljudje s svojim terenskim znanjem razlagajo, ali je vzorec, ki ga vidijo, resničen ali naključje.
Aplikacijska naloga
Izberite nabor podatkov in samo naredite EDA: izvlecite histogram vsaj treh numeričnih spremenljivk, razpršeni diagram dveh parov spremenljivk in korelacijski toplotni zemljevid. Poiščite vsaj eno »presenečenje« (kot je porazdelitev z dvema vrhovoma, kandidat za lažno korelacijo, razmerje, ki ga pritegne en sam izstop) in ga razložite v enem stavku. Pišite brez kakršnih koli vzročnih trditev.
kontrolni seznam
- [ ] Ali sem grafično prikazal porazdelitev vsake numerične spremenljivke?
- [ ] Ali sem pogledal korelacije z raztresenim grafikonom?
- [ ] Ali sem vzročnost in korelacijo ločil?
- [ ] Ali nisem opazil poševnih porazdelitev ali porazdelitev z dvema vrhoma in slepo zaupal srednji vrednosti?
- [ ] Ali sem iz svojih ugotovitev EDA izpeljal vsaj en vidik/hipotezo modeliranja?