Yunit 3 / 11

Exploratory Data Analysis at Visualization: Graphing at Interpretation gamit ang Artificial Intelligence

Mga nadagdag:

  • Kakayahang gumawa ng mga deskriptibong istatistika at mga chart ng pamamahagi/relasyon na may suporta sa artificial intelligence at piliin ang tamang uri ng chart ayon sa data at tanong
  • Kakayahang kilalanin ang mga mapanlinlang na pagpipilian (dashed axis, hindi naaangkop na sukat, labis na pagpapakinis) sa mga larawang ginawa ng artificial intelligence at ilapat ang mga prinsipyo ng tapat na visualization
  • Ang pagiging matukoy na ang pagsusuri sa paggalugad ay para sa pagbuo ng mga hypotheses at ang bitag ng paggawa ng pagtuklas at pagkumpirma gamit ang parehong data (na nagbubukas ng pinto sa p-hacking).

Matapos linisin ang datos, ang unang trabaho ng empirical researcher ay kilalanin ito. Ang yugtong ito ay tinatawag na exploratory data analysis (EDA - Exploratory Data Analysis): ito ay ang proseso ng pagsusuri sa data gamit ang mga graph at buod na istatistika at makita ang istraktura, pattern at mga sorpresa nito. Ang layunin ay hindi upang subukan ang isang hypothesis pa, ngunit upang maging pamilyar sa data, bumuo ng mga tanong at maglatag ng batayan para sa modelong iyong itatayo sa hinaharap. Sa unit na ito, makikita natin kung paano pinabilis ng artificial intelligence (AI) ang EDA at visualization, ngunit kung bakit kailangang maingat na i-audit ang mga graphics na ginagawa nito.

Gumawa muna tayo ng dalawang pangunahing pagkakaiba. Una, ang mga deskriptibong istatistika (mga numero na nagbubuod ng data tulad ng mean, median, standard deviation, quartiles) at visualization (nagpapakita ng parehong impormasyon sa graphical na paraan) ay umaakma sa isa't isa; Magkasama nilang inilalarawan ang data. Pangalawa, at pinaka-kritikal: ang pagtuklas at kumpirmasyon ay dapat na makilala. Exploratory analysis ay para sa pagbuo ng mga hypotheses; Ang paggalugad sa hypothesis na may parehong data at pagsasabi na "Sinubukan ko ito at nakita kong makabuluhan" nagbubukas ng pinto sa p-hacking, na makikita natin sa susunod na yunit. Ito ay libre upang tingnan ang data at makita ang isang pattern; Ngunit ang pagdedeklara ng pattern na iyon bilang isang "napatunayang paghahanap" sa parehong data ay nakaliligaw.

Hakbang-hakbang na pagsusuri ng eksplorasyon

1. Univariate view. Suriin ang bawat variable nang paisa-isa: simetriko ba o skewed ang distribusyon nito; gaano karaming burol ang naroon; Nasaan ang mga outliers? Para sa mga numerical variable, histogram (plot na nagpapakita ng dalas sa pamamagitan ng paghahati ng mga value sa mga range) at boxplot (boxplot — chart na nagpapakita ng median, quartile at extreme values); Para sa mga kategoryang variable, gumamit ng mga talahanayan ng dalas at bar chart.

2. Bivariate view. Tingnan ang ugnayan sa pagitan ng dalawang variable: scatter plot para sa dalawang numerical variable (ipinapakita ang bawat obserbasyon bilang isang punto sa x-y plane), pinagsamang box plot para sa numeric-categorical, crosstab para sa dalawang kategorya. Bago tingnan ang koepisyent ng ugnayan, siguraduhing tingnan ang scatter plot: ang parehong ugnayan ay maaaring magpakita ng ibang mga pattern (ang sikat na Anscombe quartet ay nagpapakita nito; apat na data set ay may halos magkaparehong mga istatistika, ngunit kapag na-plot sila ay magiging ganap na naiiba).

3. Piliin ang tamang uri ng tsart. Ang uri ng chart ay depende sa iyong tanong at uri ng data. Histogram para sa pamamahagi; scattering para sa relasyon; line chart para sa pagbabago sa paglipas ng panahon; bar chart para sa paghahambing ng kategorya; (maingat) nakasalansan na bar para sa ratio ng mga bahagi sa kabuuan. Ang AI ay mabilis na bumubuo ng code para sa iyo, ngunit ang desisyon ng "aling graph para sa aling tanong" ay sa iyo.

4. Tandaan ang pattern, huwag magdeklara ng mga resulta. Itala ang anumang kawili-wiling pattern na nakikita mo bilang isang "tala ng pagtuklas," ngunit huwag itong ituring na isang kumpirmadong paghahanap. Ginagawa ang pagkumpirma sa isang hiwalay na hakbang, mas mabuti na may hiwalay na data o isang paunang natukoy na iskedyul.

Mga prinsipyo ng tapat na visualization

Ang graphic ay nakakumbinsi; Samakatuwid, mataas din ang mapanlinlang na kapangyarihan nito. Ang AI ay maaaring gumawa ng aesthetic ngunit minsan ay nakakapanlinlang na mga pagpipilian. Suriin ang mga patakarang ito:

  • Sa mga bar chart, ang y-axis ay dapat magsimula sa zero. Ang dashed axis ay nagpapakita ng maliliit na pagkakaiba na kasing laki.
  • Dapat pare-pareho ang sukat. Kung dalawang chart ang pinaghahambing, gamitin ang parehong hanay ng axis.
  • Maaaring itago ng labis na pagpapakinis ang totoong pattern. Ang isang trend line ay mukhang maganda, ngunit kung ito ay "smoothes" ng data nang labis, maaari itong maging mapanlinlang.
  • Ang kulay at 3D na dekorasyon ay nakakasira ng atensyon, hindi ng data. Piliin ang pagiging simple.
  • Ang nawawalang data at laki ng sample ay dapat makita. Ang "n=12" at "n=12,000" ay hindi dapat magkamukha.
Pansin: Dahil lang sa maganda ang mga graphics na ginawa ng AI, hindi totoo ang mga ito. Ang pinakakaraniwang pagkakamali na ginagawa niya ay ang hindi pagsisimula ng axis mula sa zero sa bar chart at pagpapalaki ng pagkakaiba sa pagitan ng dalawang grupo. Palaging suriin ang axis.

Tsart ng paghahambing: tanong → tsart

Magtanong

tamang tsart

Karaniwang pagkakamali

Paano ipinamamahagi ang variable na ito?

Histogram/box plot

gumamit ng pie chart

May kaugnayan ba ang dalawang numeric na variable?

Scatter plot

Tinitingnan lamang ang bilang ng mga ugnayan

Paano ito nagbago sa paglipas ng panahon?

tsart ng linya

Pagsasabi ng trend gamit ang bar chart

Ano ang pagkakaiba sa pagitan ng mga grupo?

Nakapangkat na kahon/bar (mula sa simula)

Pinutol na axis rod

Part-to-whole ratio?

Naka-stack na bar (nang may pag-iingat)

Multi-slice pie chart

Apat na makokopya na prompt

1. Auto discovery na code:

Ang iyong tungkulin: EDA assistant. Hindi ko ibinabahagi ang data, gusto ko ang R (ggplot2) code. May mga numerical (kita, edad, paggasta) at kategorya (rehiyon, edukasyon) na mga variable sa 'data' data.frame. Gawain: sumulat ng code na gumagawa ng histogram para sa bawat numeric, bar chart para sa bawat kategorya, at scatter plot para sa income~age. Sa mga bar chart, hayaang magsimula ang y-axis sa ZERO. Magdagdag ng linya ng komento.

2. Pagsusuri ng ugnayan (kaugnayan + visual na magkasama):

Sumulat ng code na parehong kinakalkula ang ugnayan ng Pearson para sa kita at paggasta at nag-plot ng scatter plot + linear trend. Magdagdag ng linya ng komento na nagpapaalala sa akin na suriin ang tsart bago MAGTIWALA sa bilang ng ugnayan (babala ng Anscombe). Huwag mag-over-smooth sa trend line.

3. Integridad na pag-audit:

Suriin ang sumusunod na ggplot code para sa tapat na visualization:[code]. Suriin at itama ang mga sumusunod: nagsisimula ba ang y-axis sa zero, pare-pareho ba ang sukat, nakikita ba ang laki ng sample, may labis bang pagpapakinis? Ipaliwanag ang katwiran para sa bawat pagwawasto na iyong ginawa.

4. Paggawa ng discovery note (hindi paghahanap):

Batay sa mga graph na ginawa ko, ilista ang OBSERVATIONS bilang isang 'discovery note'; isulat ang bawat aytem sa wika ng 'hypothesis to be test', hindi 'conclusive finding'. Halimbawa: 'Mukhang mas nakakalat ang kita sa mas mataas na edukasyon; dapat masuri gamit ang hiwalay na data.' Iwasan ang sanhi at tiyak na mga pahayag.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Gumawa ng magagandang graph mula sa yield at sabihin sa akin kung ano ang ibig sabihin ng mga ito.

Ang prompt na ito ay nag-iimbita ng mapanlinlang na output: ang "maganda" ay nakatuon sa aesthetics, habang ang "kung ano ang ibig sabihin nito" ay nagtutulak sa AI na tumalon mula sa pagtuklas patungo sa tiyak na konklusyon. Ang sanhi, labis na mga komento ay sumusunod.

Napakahusay na prompt:

Ang iyong tungkulin: matapat na EDA assistant.Gawain: (1) piliin ang uri ng tsart na nababagay sa aking tanong at isulat ang katwiran,(2) simulan ang axis mula sa zero sa mga bar chart,(3) bigyang-kahulugan ang output sa DISCOVERY NOTE language: walang definitive/causal claim na nagmumungkahi ng hypothesis sa "dapat masuri" na wika,(4) babalaan ako kung ang sample ay maliit.

Pagkakaiba: ang malakas na kalooban ay nagbibigay-katwiran sa uri ng tsart, nagpapataw ng mga patakaran ng katapatan at hindi nalilito ang pagtuklas sa kumpirmasyon.

tatlong mini case

Case 1 — Discrete axis exaggeration. Ipinakita ng isang analyst ang mga marka ng kasiyahan ng dalawang sangay (7.8 at 8.0; sa 10) sa isang bar chart. Kapag sinimulan ang YZ axis mula sa 7.5, ang pangalawang sangay ay lumitaw nang halos dalawang beses na mas mataas kaysa sa una; samantalang ang pagkakaiba ay 2.5% lamang. Gagantimpalaan sana ng management ang isang branch sa ilalim ng maling impression. Kapag sinimulan ko ang axis mula sa simula ang pagkakaiba ay halos hindi nakikita. Aralin: ang pagpili ng axis lamang ay nagbabago ng pananaw.

Kaso 2 — Pagtitiwala sa ugnayan at paglaktaw sa tsart. Nakita ng isang mananaliksik ang r = 0.81 sa pagitan ng dalawang variable at nagsulat ng "malakas na linear na relasyon". Nang hilingin ng kanyang consultant ang scatter plot, nakita na ang relasyon ay talagang dahil sa isang matinding obserbasyon, at nang alisin ang puntong iyon, bumaba ang ugnayan sa 0.12. Aralin: ang bilang ng ugnayan ay walang kapalit para sa isang graph; laging tumingin sa nakakalat.

Kaso 3 — Nakalilitong pagtuklas na may kumpirmasyon. Tiningnan ng isang mag-aaral ang lahat ng pairwise correlations sa isang 40-variable na set ng data, pinili ang pinakamataas (r=0.52) at isinulat, "nakakita kami ng makabuluhang kaugnayan sa pagitan ng edukasyon at pagtitipid (p=0.004)." Gayunpaman, mayroong daan-daang mga pares sa 40 mga variable; ang pagpili ng pinakamataas ay isang maling paghahanap dahil sa pagkakataon. Aralin: ang pattern na natuklasan ay hindi maaaring "masubok at ideklarang makabuluhan" sa parehong data; Kinakailangan ang hiwalay na kumpirmasyon.

Mga karaniwang pagkakamali

  • Hindi sinisimulan ang axis mula sa zero sa bar chart. Pinalalaki nito ang maliit na pagkakaiba; Ang pinakakaraniwang visual na kasinungalingan. Laging suriin.
  • Pagtingin sa ugnayan at paglaktaw sa tsart. Ang parehong ugnayan ay nagmumula sa magkaibang mga pattern; maaaring magkasya sa isang outlier na relasyon. Una, pakalat-kalat.
  • Isinasaalang-alang ang pattern na natagpuan sa pagtuklas bilang "ebidensya" sa parehong data. Ito ang gateway sa p-hacking; Ang pagkumpirma ay ginagawa nang hiwalay.
  • Maling uri ng tsart. Ang mga tugma tulad ng bar para sa trend at pie para sa pamamahagi ay nakaliligaw. Pumili ng isang genre batay sa tanong.
  • Itinatago ang sample size. hindi dapat magkapareho ang n=8 at n=8,000 sa parehong graph; dapat ipakita ang kawalan ng katiyakan.
Tip: Bago mag-publish ng chart, tanungin ang iyong sarili: "Magbabago ba ang kuwento kung binago ko ang axis?" Kung oo ang sagot, malamang na sinimulan mo ang pivot mula sa isang hindi tapat na lugar.

Sa buod

Ang Exploratory data analysis ay ang yugto ng pagtugon sa data, pagtingin sa mga pattern at pagbuo ng mga hypotheses; Hindi ito kumpirmasyon. Mabilis na bumubuo ang AI ng mga mapaglarawang istatistika at graph code, ngunit pipiliin mo ang uri ng graph batay sa iyong tanong at kontrolin ang mga prinsipyo ng pagiging patas (zero axis, pare-parehong sukat, maliwanag na kawalan ng katiyakan). Tingnan ang scatter bago magtiwala sa numero ng ugnayan; Huwag ideklara ang pattern na nakita mo sa pagtuklas bilang "ebidensya" sa parehong data. Ang magandang graph ng AI ay hindi nangangahulugan ng tamang graph.

Gawain ng aplikasyon

Pumili ng hindi bababa sa tatlong variable sa isang set ng data. Hilingin sa AI at patakbuhin ang code na gumagawa ng mga exploratory graph (histogram, scatter, boxed) na may prompt na nagpapatupad ng mga panuntunan sa katapatan. Para sa bawat tsart: lagyan ng tsek (1) ang pagiging angkop ng uri ng tsart sa tanong, (2) ang katapatan ng axis, (3) ang visibility ng sample size. Sumulat ng hindi bababa sa isang “discovery note” sa hypothesis language (“…ay mukhang hiwalay na susuriin”). Suriin ang isang ugnayan na may parehong bilang at scatter at iulat kung mayroong pagkakaiba sa pagitan ng mga ito.

checklist

  • [ ] Pinili ko ang uri ng tsart batay sa aking tanong at uri ng data.
  • [ ] Sa mga bar chart, sinisimulan ko ang y-axis mula sa zero; Sinuri ko ang katapatan ng axis.
  • [ ] Tiningnan ko ang scatterplot bago nagtiwala sa ugnayan.
  • [ ] Naipakita ko ang laki ng sample at kawalan ng katiyakan sa graph.
  • [ ] Isinulat ko ang mga pattern na nakita ko sa paggalugad bilang "hypothesis na susuriin" sa halip na "ebidensya".
  • [ ] Nabanggit ko na hindi ko gagamitin ang parehong data para sa kumpirmasyon at kailangan ng isang hiwalay na hakbang.