Njësia 4 / 11

Analiza e të dhënave eksploruese (EDA): Shpërndarjet, marrëdhëniet dhe njohuritë fillestare

Fitimet:

  • Aftësia për të eksploruar shpërndarjen, qendrën, përhapjen dhe anomalitë e variablave me grafikët e duhur (histogram, grafik kuti, grafik shpërndarje).
  • Aftësia për të interpretuar saktë korrelacionin dhe për ta lexuar atë së bashku me grafikun e shpërndarjes, pa e ngatërruar atë me kauzalitetin
  • Aftësia për të kuptuar se statistikat përmbledhëse mund të jenë mashtruese (mësimi i Anscombe) dhe për të zhvilluar hipoteza që përcaktojnë drejtimin e modelimit.

Para se të ndërtoni një model, është e nevojshme të njihen të dhënat. Ashtu si një mjek nuk përshkruan ilaçe pa ekzaminuar pacientin, një shkencëtar i të dhënave nuk ndërton një model pa "ekzaminuar" të dhënat. Ky ekzaminim quhet analiza e të dhënave eksplorative (shkurt EDA): është faza e zbulimit të shpërndarjes, marrëdhënieve, surprizave dhe kurtheve të të dhënave në mënyrë vizuale dhe grafike. Qëllimi i EDA është të gjenerojë hipoteza, të kapë gabimet dhe të përcaktojë drejtimin e modelimit. Inteligjenca artificiale është një asistent shumë i fuqishëm në këtë fazë: sugjeron se cili grafik është i përshtatshëm, shkruan kodin e tij, interpreton një shpërndarje. Por një person vendos, me njohuritë e tij/saj në terren, nëse modeli që sheh është i vërtetë apo rastësi.

Çfarë kërkon EDA?

EDA kërkon përgjigje për katër pyetje. Shpërndarja: Si shpërndahet secila variabël—a është simetrike, e anuar apo me dy maja? Tendenca dhe përhapja qendrore: Cilat janë devijimi mesatar, mesatar, standard? Marrëdhëniet: Si lidhen variablat me njëri-tjetrin? Anomalitë: A ka vlera, boshllëqe, grupime të papritura? Këto katër pyetje përcaktojnë se cila veçori do të funksionojë dhe cili model është i përshtatshëm.

Le të përcaktojmë disa koncepte bazë. Një histogram është një grafik që ndan vlerat e një ndryshoreje numerike në intervale dhe tregon se sa vëzhgime ka në çdo interval; Është mënyra më e shpejtë për të parë shpërndarjen. Skewness është zhvendosja e shpërndarjes në një drejtim; Variablat si të ardhurat janë anuar djathtas (shumica e ulët, pak shumë e lartë). Një grafik kuti tregon mesataren, kuartilët dhe anët e jashtme me një shikim. Një grafik shpërndarjeje tregon marrëdhënien e dy ndryshoreve numerike me një re pikash.

Korrelacioni: ka një marrëdhënie, por kujdes

Korrelacioni - një masë se si lëvizin dy variabla së bashku; një numër midis -1 dhe +1 - është mjeti më i përdorur dhe më i keqkuptuar i EDA. +1 do të thotë bashkë-rritje perfekte, -1 do të thotë marrëdhënie e kundërt e përsosur, 0 do të thotë asnjë lidhje lineare. Ka dy kurthe të mëdha. Së pari, rregulli i famshëm: korrelacioni nuk është shkakësi. Rastet e mbytjes rriten me shitjet e akulloreve; jo sepse njëra çon te tjetra, por sepse vera (ndryshorja e tretë e fshehur) i nxit të dyja. Së dyti, korrelacioni mat vetëm marrëdhënien lineare; Mund të tregojë një marrëdhënie të fortë, por të lakuar afër 0. Pra, kur shikoni korrelacionin, sigurohuni që të shikoni edhe grafikun e shpërndarjes.

Kujdes: Kur AI jep një numër korrelacioni, ai mund të rrëshqasë në gjuhën shkakësore si "A rrit B". Kjo është e rrezikshme. Korrelacioni tregon vetëm lëvizjen së bashku; Vetëm përvoja, njohuritë e fushës dhe konkluzionet e kujdesshme përcaktojnë arsyen.

Kuarteti Anscombe: pse të mos shikoni vetëm numrin

Ekziston një shembull i famshëm në statistikë: kuarteti Anscombe. Katër grupe të ndryshme të dhënash kanë pothuajse të njëjtën mesatare, të njëjtën variancë dhe të njëjtin korrelacion (0.82); Por kur grafikohen, ato duken krejtësisht të ndryshme - një vijë e drejtë, një e lakuar, një re e tërhequr nga një pjesë e vetme e jashtme. Mësimi është i qartë: statistikat përmbledhëse janë mashtruese, shikimi i grafikut është i domosdoshëm. Inteligjenca artificiale mund t'ju japë mesatare dhe korrelacione, por t'u besoni atyre numrave pa parë grafikun po bini në kurthin e Anscombe.

Tabela e mëposhtme përmbledh se cili tabelë i përshtatet cilës pyetje:

Pyetje

grafik i përshtatshëm

Çfarë tregon

Shpërndarja e një ndryshoreje të vetme

Histogrami / KDE

Forma, anshmëria, numri i kulmeve

Qendra dhe pikat e jashtme

Komplot kuti

Mesatarja, kuartilet, periferitë

Marrëdhënia e dy numrave

grafik shpërndarje

Drejtimi, forca, lakimi

Krahasimi i kategorive

grafik me shtylla

Dallimi midis grupeve

ndryshojnë me kalimin e kohës

grafiku i linjës

Trendi, sezonaliteti

Marrëdhënie me shumë variacione

Harta e korrelacionit të nxehtësisë

Matrica e marrëdhënieve të përgjithshme

Paradoksi i Simpson: të dhënat e grumbulluara mund të gënjejnë

Një kurth i poshtër në EDA për të cilin duhet të jeni të vetëdijshëm është paradoksi i Simpson: një model mund të tregojë një drejtim kur të gjitha të dhënat ekzaminohen së bashku, por të kundërt kur të dhënat ndahen në nëngrupe kuptimplote. Shembull klasik: shkalla e përgjithshme e pranimit për aplikantet femra në një universitet duket të jetë më e ulët se për meshkujt; Por kur shikohet departament pas departamenti, shkalla e pranimit të grave është më e lartë se e burrave në shumicën e departamenteve. Nga ku? Gratë aplikuan në departamente më konkurruese (shkalla më e ulët e pranimit); Numri i kombinuar ruan këtë variabël të fshehur. Mësimi është i qartë: kur shikoni një total ose mesatare, sigurohuni që të kontrolloni nëse ai numër tregon të njëjtën histori kur ndahet në nëngrupe kuptimplote (segment, pikë, kanal). Kur AI ju jep një normë të kombinuar, pyetja "a është ende e vlefshme kur e segmentoni atë" do të arrijë rezultatet më mashtruese herët.

tre mini kuti

Rasti 1 - Dy kodra të fshehura. Një analist zbuloi se mosha mesatare e klientit ishte 41 vjeç dhe e raportoi atë si një "turmë e moshës së mesme". Por histogrami tregoi dy kulme: grupmoshat 22-28 dhe 55-62 vjeç. Mesatarja 41 në fakt nuk përfaqësonte askënd. Mësimi: vizatoni shpërndarjen përpara se t'i besoni mesatares.

Rasti 2 - Korrelacion i rremë. Një ekip gjeti një korrelacion 0.78 midis "shpenzimeve për reklama" dhe "shitjeve" dhe dyfishoi buxhetin. Megjithatë, ajo që i nxiti të dyja ishin fushatat sezonale; gjatë periudhës jashtë fushatës, marrëdhënia ra në 0.10. 340 mijë TL reklama shtesë nuk dhanë kthimin e pritur. Mësimi: gabimi i korrelacionit për shkakun është i shtrenjtë.

Rasti 3 - Vija e tërhequr nga kundërshtari i vetëm. Një analizë e pasurive të paluajtshme tregoi një lidhje të fortë midis sipërfaqes katrore dhe çmimit (r=0.80). Kur u hartua komploti i shpërndarjes, pothuajse e gjithë marrëdhënia u krijua nga një vilë luksoze e vetme 12 milionë TL; Kur kjo pikë u hoq, korrelacioni ra në 0.31. Mësimi: lexoni gjithmonë korrelacionin së bashku me grafikun e shpërndarjes.

Katër shabllone të kopjueshëm

1) Përmbledhje automatike EDA:

Unë kam panda df. Shkruani kodin që prodhon: (1) df.info() dhe df.describe(), (2) histogram për secilën kolonë numerike, (3) numërim për secilën kolonë kategorike. Mos komentoni, thjesht gjeneroni kodin e zbulimit; Unë interpretoj modelet.

2) Korrelacioni + vizual (me paralajmërimin e shkakësisë):

Shkruani kodin që vizaton një matricë korrelacioni dhe një hartë të nxehtësisë për kolonat numerike. Vizatoni gjithashtu një grafik shpërndarje të 3 çifteve të korreluara më të larta. Shtoni një linjë komenti në dalje duke ju kujtuar se korrelacioni nuk nënkupton shkakësinë. Mos bëni pretendime shkakësore.

3) Diagnoza e shpërndarjes:

Për kolonën "të ardhura_tl": shkruani kodin që prodhon histogramin, grafikun e kutisë, vlerën e anshmërisë dhe krahasimin mesatar/mesatar. Unë do të interpretoj nëse shpërndarja është e anuar apo jo; thjesht jepni kodin.

4) Krahasimi i segmenteve:

Krahasoni klientët sipas "kanalit" (web/mobil): shkruani kodin që prodhon një kuti të shumës mesatare, shumës mesatare, numrit të porosive dhe shpërndarjes së shumës për secilin kanal. Sugjeroni se cili test është i përshtatshëm për rëndësinë statistikore të ndryshimit midis dy kanaleve, por vendimi varet nga unë.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Gjeni diçka interesante në këto të dhëna.

"Interesante" është e papërcaktuar; AI nuk i sheh të dhënat, kështu që ose i krijon ato ose bën deklarata të përgjithshme. Nuk ka drejtim, nuk ka variabla, nuk ka asnjë qëllim.

Njoftim i fuqishëm:

Roli juaj: asistent EDA. Kolonat df: mosha (int), të ardhurat_tl (float), qyteti (kategoria), kanali (web/mobil), shuma (float). Qëllimi: zbulimi i faktorëve që ndikojnë në "sasinë". Detyra: (1) kodi që paraqet shpërndarjen e shumës, (2) grafikët e shpërndarjes midis shumës dhe moshës dhe të ardhurave_tl, (3) grafikut të kutisë së shumës në ndarjen e kanalit. Krijimi i një pretendimi shkakor; Thjesht gjeneroni kodin e zbulimit dhe unë do ta interpretoj modelin.

Këtu, qëllimi, variablat dhe kufiri i "pretendimit të shkakësisë" janë të qarta.

Gabimet e zakonshme

  • Duke u mbështetur vetëm në statistika përmbledhëse. Siç tregon kuarteti Anscombe, e njëjta mesatare fsheh shpërndarje shumë të ndryshme; shih grafikun.
  • Gabimi i korrelacionit për shkakun. Bashkëveprimi nuk tregon se njëra çon te tjetra; Kujdes nga variablat e fshehur.
  • Duke parë korrelacionin pa një komplot shpërndarjeje. Një veçori e vetme ose kurvilinearitet mashtron numrin.
  • Përmbledhja e një shpërndarjeje me dy maja/të shtrembëruara me mesataren. Mesatarja mund të mos përfaqësojë askënd.
  • Duke anashkaluar EDA dhe duke shkuar direkt te modeli. Të dhëna të panjohura do të thotë model i verbër.
Këshillë: Me çdo grup të ri të dhënash, kaloni 30 minutat e para vetëm duke vizatuar grafikët: histogrami i secilës numerike, grafiku i shpërndarjes së çifteve të rëndësishme, grafiku me shtylla të kategorive. Këto 30 minuta parandalojnë gabimet e modelimit në të ardhmen për ditët në vijim.

Në përmbledhje

EDA është faza e njohjes së të dhënave përpara ndërtimit të një modeli dhe kërkon përgjigje për katër pyetje: shpërndarja, përhapja në qendër, marrëdhëniet dhe anomalitë. Statistikat përmbledhëse mund të jenë mashtruese; shikimi i grafikut është i domosdoshëm (leksioni i Anscombe). Korrelacioni është një mjet i fuqishëm, por shkaku nuk është dhe duhet patjetër të lexohet në lidhje me një komplot shpërndarjeje. AI është një përshpejtues i shkëlqyeshëm për sugjerimin e grafikave dhe shkrimin e kodit; Por njerëzit interpretojnë me njohuritë e tyre në terren nëse modeli që ata shohin është i vërtetë apo një rastësi.

Detyra e aplikimit

Zgjidhni një grup të dhënash dhe thjesht bëni EDA: nxirrni një histogram të të paktën tre variablave numerike, një grafik shpërndarjeje me dy palë variablash dhe një hartë të nxehtësisë së korrelacionit. Gjeni të paktën një "surprizë" (siç është një shpërndarje me dy maja, një kandidat për korrelacion të rremë, një marrëdhënie e tërhequr nga një e vetme e jashtme) dhe shpjegoni atë me një fjali. Shkruani pa bërë pretendime shkakësore.

listë kontrolli

  • [ ] A e kam grafikuar shpërndarjen e çdo ndryshoreje numerike?
  • [ ] A i shikova korrelacionet me grafikun e shpërndarjes?
  • [ ] A e kam mbajtur të ndara kauzalitetin dhe korrelacionin?
  • [ ] A nuk vura re shpërndarje të anuar ose me dy maja dhe i besova verbërisht mesatares?
  • [ ] A kam nxjerrë të paktën një aspekt/hipotezë modelimi nga gjetjet e mia të EDA?