Jednotka 4 / 11

Prieskumná analýza údajov (EDA): distribúcie, vzťahy a počiatočné pohľady

zisky:

  • Schopnosť preskúmať distribúciu, stred, šírenie a anomálie premenných pomocou vhodných grafov (histogram, krabicový graf, bodový graf).
  • Schopnosť správne interpretovať koreláciu a čítať ju spolu s bodovým grafom bez toho, aby si ju zamieňal s kauzalitou
  • Schopnosť pochopiť, že súhrnné štatistiky môžu byť zavádzajúce (lekcia Anscombe) a rozvíjať hypotézy, ktoré určujú smer modelovania.

Pred zostavením modelu je potrebné poznať údaje. Tak ako lekár nepredpíše lieky bez vyšetrenia pacienta, ani dátový vedec nezostaví model bez „preskúmania“ údajov. Toto skúmanie sa nazýva exploratory data analysis (skrátene EDA): je to fáza zisťovania rozloženia, vzťahov, prekvapení a pascí údajov vizuálne a graficky. Účelom EDA je generovať hypotézy, zachytávať chyby a určovať smer modelovania. Umelá inteligencia je v tejto fáze veľmi silným pomocníkom: navrhuje, ktorý graf je vhodný, píše jeho kód, interpretuje distribúciu. Ale o tom, či vzor, ​​ktorý vidí, je skutočný alebo náhodný, rozhoduje človek na základe svojich znalostí v teréne.

Čo hľadá EDA?

EDA hľadá odpovede na štyri otázky. Distribúcia: Ako je rozdelená každá premenná – je symetrická, šikmá alebo dvojvrcholová? Centrálna tendencia a šírenie: Aký je priemer, medián, štandardná odchýlka? Vzťahy: Ako spolu premenné súvisia? Anomálie: Existujú neočakávané hodnoty, medzery, zoskupenia? Tieto štyri otázky určujú, ktorá funkcia bude fungovať a ktorý model je vhodný.

Definujme niekoľko základných pojmov. Histogram je graf, ktorý rozdeľuje hodnoty číselnej premennej do intervalov a ukazuje, koľko pozorovaní je v každom intervale; Je to najrýchlejší spôsob zobrazenia distribúcie. Šikmosť je posun distribúcie v jednom smere; Premenné, ako je príjem, sú vychýlené doprava (väčšina nízka, niekoľko veľmi vysoká). Krabicový graf zobrazuje medián, kvartily a odľahlé hodnoty na prvý pohľad. Bodový graf ukazuje vzťah dvoch číselných premenných s mrakom bodov.

Korelácia: existuje vzťah, ale buďte opatrní

Korelácia — miera toho, ako sa dve premenné pohybujú spolu; číslo medzi -1 a +1 — je najpoužívanejším a najviac nepochopeným nástrojom EDA. +1 znamená dokonalé spoločné zvýšenie, -1 znamená dokonalý inverzný vzťah, 0 znamená žiadny lineárny vzťah. Sú tam dve veľké pasce. Po prvé, známe pravidlo: korelácia nie je príčinná súvislosť. S predajom zmrzliny pribúdajú prípady dusenia; nie preto, že jedno vedie k druhému, ale preto, že leto (skrytá tretia premenná) spúšťa oboje. Po druhé, korelácia meria iba lineárny vzťah; Môže to naznačovať silný, ale krivočiary vzťah blízky 0. Takže keď sa pozeráte na koreláciu, nezabudnite sa pozrieť aj na bodový graf.

Upozornenie: Keď AI ​​poskytne korelačné číslo, môže skĺznuť do kauzálneho jazyka ako „A zvyšuje B“. Toto je nebezpečné. Korelácia označuje iba spoločný pohyb; Dôvod stanovia iba skúsenosti, znalosti domény a starostlivé vyvodzovanie.

Anscombe quartet: prečo sa nepozrieť len na číslo

V štatistike je známy príklad: Anscombovo kvarteto. Štyri rôzne súbory údajov majú takmer rovnaký priemer, rovnaký rozptyl a rovnakú koreláciu (0,82); Ale keď sú zobrazené v grafe, vyzerajú úplne inak – jedna priamka, jedna zakrivená, jedna oblak ťahaný jedinou odľahlou hodnotou. Poučenie je jasné: súhrnná štatistika je zavádzajúca, pohľad do grafu je nutnosťou. Umelá inteligencia vám môže poskytnúť priemery a korelácie, ale dôverovať týmto číslam bez toho, aby ste videli graf, spadá do Anscombovej pasce.

Nasledujúca tabuľka sumarizuje, ktorý graf zodpovedá ktorej otázke:

Otázka

vhodná grafika

Čo ukazuje

Distribúcia jednej premennej

Histogram / KDE

Tvar, zošikmenie, počet vrcholov

Stred a odľahlé hodnoty

Krabicový pozemok

Medián, kvartily, odľahlé hodnoty

Vzťah dvoch čísel

bodový graf

Smer, sila, zakrivenie

Porovnanie kategórií

stĺpcový graf

Rozdiel medzi skupinami

meniť v priebehu času

čiarový graf

Trend, sezónnosť

Viacrozmerný vzťah

Korelačná tepelná mapa

Všeobecná matica vzťahov

Simpsonov paradox: agregované údaje môžu klamať

Záludnou pascou v EDA, ktorú si treba uvedomiť, je Simpsonov paradox: vzor môže ukazovať jeden smer, keď sa všetky údaje skúmajú spoločne, ale naopak, keď sú údaje rozdelené do zmysluplných podskupín. Klasický príklad: celková miera prijatia uchádzačiek na univerzitu sa zdá byť nižšia ako u mužov; Keď sa však pozrieme na oddelenie po oddelení, miera prijatia žien je vo väčšine oddelení vyššia ako u mužov. Odkiaľ? Ženy sa prihlásili do konkurencieschopnejších (nižšia miera prijatia) oddelení; Kombinované číslo ukladá túto skrytú premennú. Poučenie je jasné: keď sa pozriete na súčet alebo priemer, nezabudnite skontrolovať, či toto číslo rozpráva rovnaký príbeh, keď je rozdelené do zmysluplných podskupín (segment, obdobie, kanál). Keď vám AI ​​poskytne kombinovanú sadzbu, otázka „je stále platná, keď ju segmentujete“, čoskoro zachytí väčšinu zavádzajúcich výsledkov.

tri mini prípady

Prípad 1 – Dva skryté kopce. Jeden analytik zistil, že priemerný vek zákazníka je 41 rokov a uviedol, že ide o „dav stredného veku“. Histogram však ukázal dva vrcholy: vekové skupiny 22-28 a 55-62. Priemerných 41 v skutočnosti nikoho nepredstavovalo. Ponaučenie: nakreslite distribúciu predtým, ako budete dôverovať priemeru.

Prípad 2 – Falošná korelácia. Jeden tím našiel 0,78 koreláciu medzi „výdavkami na reklamu“ a „predajom“ a zdvojnásobil rozpočet. Čo však spustilo obe, boli sezónne kampane; počas obdobia mimo kampane klesol vzťah na 0,10. 340 tisíc TL dodatočná reklama nepriniesla očakávaný výnos. Poučenie: zamieňať koreláciu za príčinnú súvislosť je drahé.

Prípad 3 – Čiara nakreslená osamelým protichodníkom. Analýza nehnuteľností ukázala silný vzťah medzi rozlohou a cenou (r=0,80). Keď bol nakreslený bodový graf, takmer celý vzťah vytvorila jediná luxusná vila za 12 miliónov TL; Keď bol tento bod odstránený, korelácia klesla na 0,31. Ponaučenie: vždy si prečítajte koreláciu spolu s bodovým grafom.

Štyri kopírovateľné šablóny

1) Automatické zhrnutie EDA:

Mám pandy df. Napíšte kód, ktorý vytvorí: (1) df.info() a df.describe(), (2) histogram pre každý číselný stĺpec, (3) počet pre každý kategorický stĺpec. Nekomentujte, len vygenerujte vyhľadávací kód; Interpretujem vzory.

2) Korelácia + vizuálna (s výhradou kauzality):

Napíšte kód, ktorý nakreslí korelačnú maticu a tepelnú mapu pre číselné stĺpce. Nakreslite tiež bodový graf 3 najvyšších korelovaných párov. Pridajte k výstupu komentár, ktorý vám pripomenie, že korelácia neznamená príčinnú súvislosť. Nerobte si kauzálne tvrdenia.

3) Diagnostika distribúcie:

Pre stĺpec "income_tl": napíšte kód, ktorý vytvorí histogram, krabicový graf, hodnotu šikmosti a porovnanie mediánu a priemeru. Budem interpretovať, či je rozdelenie skreslené alebo nie; stačí zadať kód.

4) Porovnanie segmentov:

Porovnajte zákazníkov podľa „kanálu“ (web/mobil): napíšte kód, ktorý vytvorí krabicový graf priemernej sumy, mediánu sumy, počtu objednávok a distribúcie sumy pre každý kanál. Navrhnite, ktorý test je vhodný pre štatistickú významnosť rozdielu medzi týmito dvoma kanálmi, ale rozhodnutie je na mne.

Slabá výzva / Silná výzva

Slabá výzva:

Nájdite v týchto údajoch niečo zaujímavé.

„Zaujímavé“ nie je definované; AI nevidí údaje, takže si ich buď vymýšľa, alebo robí všeobecné vyhlásenia. Neexistuje žiadny smer, žiadne premenné, žiadny účel.

Výkonná výzva:

Vaša úloha: asistent EDA. df stĺpce: vek (int), income_tl (float), mesto (kategória), kanál (web/mobil), suma (float). Účel: objaviť faktory ovplyvňujúce „množstvo“. Úloha: (1) kód vykresľujúci rozdelenie sumy, (2) grafy rozdelenia medzi sumou a vekom a príjem_tl, (3) krabicový graf sumy v členení podľa kanálov. Založenie kauzálneho nároku; Stačí vygenerovať vyhľadávací kód a ja interpretujem vzor.

Tu je jasný účel, premenné a hranica „nárokovania si kauzality“.

Časté chyby

  • Spoliehať sa len na súhrnné štatistiky. Ako ukazuje kvarteto Anscombe, rovnaký priemer skrýva veľmi odlišné distribúcie; pozri graf.
  • Nesprávna korelácia s príčinnou súvislosťou. Spolupôsobenie nenaznačuje, že jedno vedie k druhému; Pozor na skryté premenné.
  • Pohľad na koreláciu bez bodového grafu. Jediná odľahlá hodnota alebo zakrivenie zavádza číslo.
  • Zhrnutie dvojvrcholovej/šikmej distribúcie s priemerom. Priemer nemusí predstavovať nikoho.
  • Preskočiť EDA a ísť priamo k modelu. Nerozpoznané údaje znamenajú slepý model.
Tip: Pri každom novom súbore údajov strávte prvých 30 minút kreslením grafov: histogram každého čísla, bodový graf významných párov, stĺpcový graf kategórií. Týchto 30 minút zabráni budúcim chybám pri modelovaní počas nasledujúcich dní.

V súhrne

EDA je fáza spoznávania údajov pred vytvorením modelu a hľadá odpovede na štyri otázky: distribúcia, rozmiestnenie v strede, vzťahy a anomálie. Súhrnné štatistiky môžu byť zavádzajúce; prezeranie grafu je nutnosťou (Anscombova prednáška). Korelácia je mocný nástroj, ale príčinná súvislosť nie je a určite by sa mala čítať v spojení s bodovým grafom. AI je skvelý akcelerátor na navrhovanie grafiky a písanie kódu; Ale ľudia interpretujú svojimi znalosťami v teréne, či vzor, ​​ktorý vidia, je skutočný alebo náhodný.

Aplikačná úloha

Vyberte si množinu údajov a urobte len EDA: extrahujte histogram aspoň troch numerických premenných, bodový graf dvoch párov premenných a teplotnú mapu korelácie. Nájdite aspoň jedno „prekvapenie“ (napríklad rozdelenie s dvoma vrcholmi, kandidát na falošnú koreláciu, vzťah priťahovaný jedinou odľahlou hodnotou) a vysvetlite ho jednou vetou. Píšte bez kauzálnych tvrdení.

kontrolný zoznam

  • [ ] Vytvoril som graf distribúcie každej číselnej premennej?
  • [ ] Pozrel som sa na korelácie s bodovým grafom?
  • [ ] Ponechal som kauzalitu a koreláciu oddelene?
  • [ ] Nevšimol som si skreslené alebo dvojvrcholové rozdelenia a slepo som neveril priemeru?
  • [ ] Odvodil som zo svojich zistení EDA aspoň jeden aspekt modelovania/hypotézu?