Yunit 4 / 11

Exploratory Data Analysis (EDA): Mga Distribusyon, Relasyon, at Mga Paunang Insight

Mga nadagdag:

  • Kakayahang galugarin ang distribusyon, sentro, pagkalat at anomalya ng mga variable na may naaangkop na mga graph (histogram, box plot, scatter plot).
  • Kakayahang bigyang-kahulugan nang tama ang ugnayan at basahin ito kasama ng scatter plot, nang hindi nalilito ito sa sanhi
  • Kakayahang maunawaan na ang mga istatistika ng buod ay maaaring mapanlinlang (aralin sa Anscombe) at bumuo ng mga hypotheses na tumutukoy sa direksyon ng pagmomodelo.

Bago bumuo ng isang modelo, kinakailangang malaman ang data. Kung paanong ang isang doktor ay hindi nagrereseta ng gamot nang hindi sinusuri ang pasyente, ang isang data scientist ay hindi gumagawa ng isang modelo nang hindi "sinusuri" ang data. Ang pagsusuring ito ay tinatawag na exploratory data analysis (EDA para sa maikli): ito ang yugto ng pagtuklas ng pamamahagi, mga relasyon, mga sorpresa at mga bitag ng data sa visual at graphical na paraan. Ang layunin ng EDA ay bumuo ng mga hypotheses, mahuli ang mga error, at matukoy ang direksyon ng pagmomodelo. Ang artificial intelligence ay isang napakalakas na katulong sa yugtong ito: iminumungkahi nito kung aling tsart ang angkop, isinulat ang code nito, binibigyang-kahulugan ang isang pamamahagi. Ngunit ang isang tao ay nagpapasya, sa kanyang kaalaman sa larangan, kung ang pattern na nakikita niya ay totoo o isang pagkakataon.

Ano ang hinahanap ng EDA?

Ang EDA ay naghahanap ng mga sagot sa apat na tanong. Distribusyon: Paano ipinamamahagi ang bawat variable—simetrya ba, skewed, o two-peaked? Central tendency at spread: Ano ang mean, median, standard deviation? Mga Relasyon: Paano nauugnay ang mga variable sa isa't isa? Anomalya: Mayroon bang mga hindi inaasahang halaga, gaps, pagpapangkat? Tinutukoy ng apat na tanong na ito kung aling feature ang gagana at kung aling modelo ang naaangkop.

Tukuyin natin ang ilang mga pangunahing konsepto. Ang histogram ay isang graph na naghahati sa mga halaga ng isang numerical variable sa mga pagitan at nagpapakita kung gaano karaming mga obserbasyon ang nasa bawat pagitan; Ito ang pinakamabilis na paraan upang makita ang pamamahagi. Ang skewness ay ang paglipat ng pamamahagi sa isang direksyon; Ang mga variable tulad ng kita ay nakahilig sa kanan (majority low, few very high). Ang isang box plot ay nagpapakita ng median, quartile at outlier sa isang sulyap. Ipinapakita ng scatter plot ang relasyon ng dalawang numerical variable na may ulap ng mga puntos.

Kaugnayan: may relasyon pero mag-ingat

Correlation — isang sukatan kung paano gumagalaw ang dalawang variable; isang numero sa pagitan ng -1 at +1 — ay ang pinaka ginagamit at pinakahindi naiintindihan na tool ng EDA. Ang ibig sabihin ng +1 ay perpektong co-increase, -1 ay nangangahulugan ng perpektong kabaligtaran na relasyon, ang 0 ay nangangahulugang walang linear na relasyon. Mayroong dalawang malalaking bitag. Una, ang sikat na panuntunan: ang ugnayan ay hindi sanhi. Ang mga kaso ng nabulunan ay tumaas sa pagbebenta ng ice cream; hindi dahil ang isa ay humahantong sa isa, ngunit dahil ang tag-araw (ang nakatagong ikatlong variable) ay nag-trigger sa pareho. Pangalawa, ang ugnayan ay sumusukat lamang ng linear na relasyon; Maaari itong magpahiwatig ng isang malakas ngunit curvilinear na relasyon na malapit sa 0. Kaya kapag tumitingin sa ugnayan, siguraduhing tingnan din ang scatter plot.

Pag-iingat: Kapag nagbigay ang AI ng isang numero ng ugnayan, maaari itong madulas sa wikang sanhi tulad ng "A ay nagdaragdag ng B." Delikado ito. Ang ugnayan ay nagpapahiwatig lamang ng paggalaw nang magkasama; Ang karanasan, kaalaman sa domain, at maingat na hinuha lamang ang nagtatatag ng dahilan.

Anscombe quartet: bakit hindi na lang tingnan ang numero

Mayroong isang sikat na halimbawa sa mga istatistika: ang Anscombe quartet. Apat na magkakaibang set ng data ang may halos parehong mean, parehong pagkakaiba, at parehong ugnayan (0.82); Ngunit kapag na-graph, ganap na naiiba ang mga ito — isang tuwid na linya, isang hubog, ang isa ay ulap na hinihila ng isang solong outlier. Ang aralin ay malinaw: ang mga istatistika ng buod ay nakaliligaw, ang pagtingin sa graph ay kinakailangan. Maaaring magbigay sa iyo ang AI ng mga average at ugnayan, ngunit ang pagtitiwala sa mga numerong iyon nang hindi nakikita ang graph ay nahuhulog sa bitag ng Anscombe.

Ang talahanayan sa ibaba ay nagbubuod kung aling tsart ang akma sa aling tanong:

Tanong

angkop na graphic

Ano ang nagpapakita

Pamamahagi ng isang variable

Histogram / KDE

Hugis, skewness, bilang ng mga vertex

Center at outliers

Box plot

Median, quartile, outlier

Relasyon ng dalawang numero

scatter chart

Direksyon, lakas, kurbada

Paghahambing ng kategorya

bar chart

Pagkakaiba sa pagitan ng mga grupo

pagbabago sa paglipas ng panahon

tsart ng linya

Uso, seasonality

Multivariate na relasyon

Mapa ng init ng ugnayan

Pangkalahatang matrix ng relasyon

Ang kabalintunaan ni Simpson: ang pinagsama-samang data ay maaaring magsinungaling

Ang isang palihim na bitag sa EDA na dapat malaman ay ang kabalintunaan ni Simpson: ang isang pattern ay maaaring magpakita ng isang direksyon kapag ang lahat ng data ay sinusuri nang magkasama, ngunit baligtarin kapag ang data ay nahahati sa makabuluhang mga subgroup. Klasikong halimbawa: ang kabuuang rate ng pagtanggap para sa mga babaeng aplikante sa isang unibersidad ay mukhang mas mababa kaysa sa mga lalaki; Ngunit kung titingnan ang departamento ayon sa departamento, ang rate ng pagtanggap ng mga kababaihan ay mas mataas kaysa sa mga lalaki sa karamihan ng mga departamento. saan galing? Ang mga kababaihan ay nag-apply sa mas mapagkumpitensya (mas mababang mga rate ng pagtanggap) na mga departamento; Iniimbak ng pinagsamang numero ang nakatagong variable na ito. Malinaw ang aralin: kapag tumitingin sa kabuuan o average, tiyaking suriin kung ang numerong iyon ay nagsasabi ng parehong kuwento kapag hinati-hati sa mga makabuluhang subgroup (segment, tuldok, channel). Kapag binigyan ka ng AI ng isang pinagsamang rate, ang pagtatanong ng "wasto pa ba ito kapag na-segment mo ito" ay makakahanap ng karamihan sa mga mapanlinlang na resulta nang maaga.

tatlong mini case

Case 1 — Dalawang nakatagong burol. Nalaman ng isang analyst na ang average na edad ng customer ay 41 at iniulat ito bilang isang "mid-aged crowd." Ngunit ang histogram ay nagpakita ng dalawang peak: ang 22-28 at 55-62 na mga pangkat ng edad. Ang average na 41 ay hindi aktwal na kumakatawan sa sinuman. Aralin: balangkasin ang pamamahagi bago magtiwala sa mean.

Kaso 2 — Huwad na ugnayan. Nakakita ang isang team ng 0.78 na ugnayan sa pagitan ng "paggastos sa ad" at "mga benta" at nadoble ang badyet. Gayunpaman, ang nag-trigger sa pareho ay mga seasonal na kampanya; sa panahon ng off-campaign, bumaba ang relasyon sa 0.10. 340 thousand TL karagdagang advertising ay hindi nagbunga ng inaasahang pagbabalik. Aralin: ang mapagkakamalang ugnayan para sa sanhi ay mahal.

Case 3 — Ang linya na iginuhit ng nag-iisang kontrarian. Ang pagsusuri sa real estate ay nagpakita ng isang malakas na ugnayan sa pagitan ng square footage at presyo (r=0.80). Nang iguhit ang scatter plot, halos ang buong relasyon ay nilikha ng isang solong 12 milyong TL luxury villa; Kapag naalis ang puntong iyon, bumaba ang ugnayan sa 0.31. Aralin: laging basahin ang ugnayan kasama ang scatter plot.

Apat na maaaring kopyahin na mga template

1) Awtomatikong buod ng EDA:

Mayroon akong panda df. Sumulat ng code na gumagawa ng: (1) df.info() at df.describe(), (2) histogram para sa bawat numeric na column, (3) bilang para sa bawat kategoryang column. Huwag magkomento, bumuo lamang ng code ng pagtuklas; Binibigyang-kahulugan ko ang mga pattern.

2) Kaugnayan + visual (na may caveat of causality):

Sumulat ng code na kumukuha ng correlation matrix at isang heat map para sa mga numeric na column. Gumuhit din ng scatter plot ng 3 pinakamataas na magkaugnay na pares. Magdagdag ng linya ng komento sa output na nagpapaalala sa iyo na ang ugnayan ay hindi nagpapahiwatig ng sanhi. Huwag gumawa ng mga sanhi ng paghahabol.

3) Diagnosis ng pamamahagi:

Para sa column na "income_tl": sumulat ng code na gumagawa ng histogram, box plot, skewness value at median/mean na paghahambing. Ipapaliwanag ko kung ang pamamahagi ay baluktot o hindi; ibigay lang ang code.

4) Paghahambing ng segment:

Ikumpara ang mga customer ayon sa "channel" (web/mobile): sumulat ng code na gumagawa ng boxplot ng average na halaga, median na halaga, bilang ng mga order, at pamamahagi ng halaga para sa bawat channel. Magmungkahi kung aling pagsubok ang angkop para sa istatistikal na kahalagahan ng pagkakaiba sa pagitan ng dalawang channel, ngunit ang desisyon ay nasa akin.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Maghanap ng isang bagay na kawili-wili sa data na ito.

Ang "Kawili-wili" ay hindi natukoy; Hindi nakikita ng AI ang data, kaya ito ay bumubuo o gumagawa ng mga pangkalahatang pahayag. Walang direksyon, walang variable, walang layunin.

Napakahusay na prompt:

Ang iyong tungkulin: EDA assistant. df column: edad (int), income_tl (float), lungsod (category), channel (web/mobile), halaga (float). Layunin: upang matuklasan ang mga salik na nakakaapekto sa "halaga". Gawain: (1) code plotting ng distribusyon ng halaga, (2) distribution graphs sa pagitan ng halaga at edad at kita_tl, (3) box plot ng halaga sa channel breakdown. Pagtatatag ng sanhi ng paghahabol; Bumuo lamang ng code ng pagtuklas at bibigyang-kahulugan ko ang pattern.

Dito, ang layunin, mga variable at ang limitasyon ng "pag-aangkin ng sanhi" ay malinaw.

Mga karaniwang pagkakamali

  • Umaasa lamang sa mga istatistika ng buod. Tulad ng ipinapakita ng Anscombe quartet, ang parehong ibig sabihin ay nagtatago ng ibang mga distribusyon; tingnan ang tsart.
  • Napagkakamalang ugnayan para sa sanhi. Ang co-action ay hindi nagpapahiwatig na ang isa ay humahantong sa isa pa; Mag-ingat sa mga nakatagong variable.
  • Pagtingin sa ugnayan nang walang scatter plot. Nililinlang ng isang solong outlier o curvilinearity ang numero.
  • Pagbubuod ng two-peaked/skewed distribution na may mean. Ang average ay maaaring hindi kumakatawan sa sinuman.
  • Nilaktawan ang EDA at dumiretso sa modelo. Ang hindi nakikilalang data ay nangangahulugan ng bulag na modelo.
Tip: Sa bawat bagong set ng data, gumugol ng unang 30 minuto sa pagguhit lang ng mga graph: histogram ng bawat numeric, scatter plot ng makabuluhang pares, bar chart ng mga kategorya. Pinipigilan ng 30 minutong ito ang mga error sa pagmomodelo sa hinaharap para sa mga darating na araw.

Sa buod

Ang EDA ay ang yugto ng pagkilala sa data bago bumuo ng isang modelo at naghahanap ng mga sagot sa apat na tanong: pamamahagi, center-spread, mga relasyon at mga anomalya. Ang mga istatistika ng buod ay maaaring mapanlinlang; ang pagtingin sa graph ay dapat (Anscombe lecture). Ang ugnayan ay isang mahusay na tool, ngunit ang sanhi ay hindi at dapat talagang basahin kasabay ng isang scatter plot. Ang AI ay isang mahusay na accelerator para sa pagmumungkahi ng mga graphics at pagsulat ng code; Ngunit binibigyang-kahulugan ng mga tao ang kanilang kaalaman sa larangan kung ang pattern na nakikita nila ay totoo o isang pagkakataon.

Gawain ng aplikasyon

Pumili ng isang dataset at gawin lang ang EDA: kumuha ng histogram ng hindi bababa sa tatlong numerical variable, isang scatter plot ng dalawang pares ng mga variable, at isang correlation heat map. Maghanap ng hindi bababa sa isang "sorpresa" (tulad ng isang pamamahagi na may dalawang peak, isang kandidato para sa huwad na ugnayan, isang relasyon na naaakit ng isang outlier) at ipaliwanag ito sa isang pangungusap. Sumulat nang hindi gumagawa ng anumang dahilan ng paghahabol.

checklist

  • [ ] Nai-graph ko na ba ang distribusyon ng bawat numerical variable?
  • [ ] Tiningnan ko ba ang mga ugnayan sa scatterplot?
  • [ ] Napanatili ko bang hiwalay ang causality at correlation?
  • [ ] Hindi ko ba napansin ang mga skewed o two-peaked distribution at bulag na nagtitiwala sa ibig sabihin?
  • [ ] Nakakuha ba ako ng kahit isang aspeto/hypothesis ng pagmomodelo mula sa aking mga natuklasan sa EDA?