Fitimet:
- Aftësia për të prodhuar statistika përshkruese dhe grafikët e shpërndarjes/marrëdhënieve me mbështetjen e inteligjencës artificiale dhe për të zgjedhur llojin e duhur të grafikut sipas të dhënave dhe pyetjes
- Aftësia për të njohur zgjedhjet mashtruese (bosht i thyer, shkallë e papërshtatshme, zbutje e tepërt) në imazhet e prodhuara nga inteligjenca artificiale dhe për të aplikuar parime të sinqerta vizualizimi
- Të jesh në gjendje të dallosh se analiza eksploruese është për gjenerimin e hipotezave dhe kurthin për të bërë zbulim dhe konfirmim me të njëjtat të dhëna (që hap derën për p-hacking).
Pas pastrimit të të dhënave, puna e parë e studiuesit empirik është ta njohë atë. Kjo fazë quhet analiza e të dhënave eksplorative (EDA - Exploratory Data Analysis): është procesi i ekzaminimit të të dhënave me grafikët dhe statistikat përmbledhëse dhe shikimi i strukturës, modeleve dhe surprizave të tyre. Qëllimi nuk është të testoni ende një hipotezë, por të njiheni me të dhënat, të gjeneroni pyetje dhe të vendosni bazat për modelin që do të ndërtoni në të ardhmen. Në këtë njësi, ne do të shohim se si inteligjenca artificiale (AI) përshpejton EDA dhe vizualizimin, por pse grafika që prodhon duhet të auditohet me kujdes.
Së pari, le të bëjmë dy dallime themelore. Së pari, statistikat përshkruese (numrat që përmbledhin të dhëna si mesatarja, mediana, devijimi standard, kuartilet) dhe vizualizimi (duke treguar të njëjtin informacion grafikisht) plotësojnë njëri-tjetrin; Së bashku ata përshkruajnë të dhënat. E dyta dhe më kritike: zbulimi dhe konfirmimi duhet të dallohen. Analiza eksploruese është për gjenerimin e hipotezave; Eksplorimi i hipotezës me të njëjtat të dhëna dhe thënia "E testova dhe e gjeta të rëndësishme" hap derën për hakimin p, të cilin do ta shohim në njësinë e ardhshme. Është e lirë të shikosh të dhënat dhe të shohësh një model; Por deklarimi i këtij modeli një "gjetje të provuar" në të njëjtat të dhëna është mashtruese.
Analizë eksploruese hap pas hapi
1. Pamje e njëanshme. Shqyrtoni secilën variabël veç e veç: a është shpërndarja e saj simetrike apo e anuar; sa kodra ka; Ku janë pikat e jashtme? Për variablat numerike, histogrami (grafiku që tregon frekuencën duke i ndarë vlerat në diapazon) dhe boks (boksplot - grafik që tregon vlerat mesatare, kuartil dhe ekstrem); Për variablat kategorike, përdorni tabelat e frekuencës dhe grafikët me shtylla.
2. Pamje e dyfishtë. Shihni lidhjen midis dy variablave: grafiku i shpërndarjes për dy ndryshore numerike (tregon çdo vëzhgim si një pikë në planin x-y), grafik i grupuar kuti për numerik-kategorik, kryqëzim për dy kategorike. Përpara se të shikoni koeficientin e korrelacionit, sigurohuni që të shikoni grafikun e shpërndarjes: i njëjti korrelacion mund të tregojë modele shumë të ndryshme (katërta e famshme Anscombe e demonstron këtë; katër grupe të dhënash kanë statistika pothuajse identike, por kur vizatohen ato rezultojnë të jenë krejtësisht të ndryshme).
3. Zgjidhni llojin e saktë të grafikut. Lloji i grafikut varet nga pyetja juaj dhe lloji i të dhënave. Histogram për shpërndarje; shpërndarje për marrëdhënie; grafiku i linjës për ndryshimin me kalimin e kohës; grafik me shtylla për krahasimin e kategorive; shirit i stivosur (me kujdes) për raportin e pjesëve me të tërën. AI gjeneron shpejt kodin për ju, por vendimi se "cili grafik për cilën pyetje" është i juaji.
4. Vini re modelin, mos i deklaroni rezultatet. Regjistroni çdo model interesant që shihni si një "shënim zbulimi", por mos e konsideroni atë një gjetje të konfirmuar. Konfirmimi bëhet në një hap të veçantë, mundësisht me të dhëna të veçanta ose një orar të paracaktuar.
Parimet e sinqerta të vizualizimit
Grafika të bind; Prandaj, fuqia e tij mashtruese është gjithashtu e lartë. AI mund të bëjë zgjedhje estetike, por ndonjëherë mashtruese. Kontrolloni këto politika:
- Në grafikët me shtylla, boshti y duhet të fillojë me zero. Boshti i ndërprerë tregon dallime të vogla aq të mëdha.
- Shkalla duhet të jetë e qëndrueshme. Nëse krahasohen dy tabela, përdorni të njëjtin gamë boshti.
- Zbutja e tepërt mund të fshehë modelin e vërtetë. Një linjë trendi duket bukur, por nëse "zbut" shumë të dhënat, mund të jetë mashtruese.
- Ngjyra dhe dekorimi 3D shtrembërojnë vëmendjen, jo të dhënat. Zgjidhni thjeshtësinë.
- Të dhënat që mungojnë dhe madhësia e kampionit duhet të jenë të dukshme. "n=12" dhe "n=12,000" nuk duhet të duken njësoj.
Kujdes: Vetëm për shkak se grafika e prodhuar nga AI janë të bukura, ato nuk janë të vërteta. Gabimi më i zakonshëm që ai bën është mos fillimi i boshtit nga zero në grafikun me shtylla dhe ekzagjerimi i diferencës midis dy grupeve. Kontrolloni gjithmonë boshtin.
Grafik krahasues: pyetje → grafik
Pyetni
grafik i saktë
Gabim i zakonshëm
Si shpërndahet kjo variabël?
Histogrami/skica e kutisë
përdorni grafikun me byrek
A janë të lidhura dy ndryshore numerike?
Komplot shpërndaj
Vetëm duke parë numrin e korrelacioneve
Si ka ndryshuar me kalimin e kohës?
grafiku i linjës
Tregimi i një tendence me një grafik me shtylla
Cili është ndryshimi midis grupeve?
Kuti/shirit i grupuar (nga e para)
Shufra e boshtit të cunguar
Raporti pjesë-tërës?
Shirit i grumbulluar (me kujdes)
Grafik me byrek me shumë feta
Katër kërkesa të kopjueshme
1. Kodi i zbulimit automatik:
Roli juaj: asistent EDA. Unë nuk i ndaj të dhënat, dua kodin R (ggplot2). Ka variabla numerikë (të ardhura, mosha, shpenzime) dhe kategorike (rajoni, arsimi) në data.frame 'të dhënat'. Detyrë: shkruani kodin që prodhon një histogram për çdo numerik, një grafik me shtylla për çdo kategori dhe një grafik shpërndarjeje për moshën e të ardhurave. Në grafikët me shtylla, le të fillojë boshti y nga ZERO. Shto rreshtin e komenteve.
2. Rishikimi i korrelacionit (korrelacion + vizual së bashku):
Shkruani kodin që të dy llogarit korrelacionin Pearson për të ardhurat dhe shpenzimet dhe të vizatojë një grafik shpërndarje + prirje lineare. Shto një linjë komenti që më kujton të ekzaminoj grafikun përpara se të BESIM në numërimin e korrelacionit (paralajmërim Anscombe). Mos e zbutni shumë linjën e trendit.
3. Auditimi i integritetit:
Kontrolloni kodin e mëposhtëm ggplot për vizualizim të sinqertë:[code]. Kontrolloni dhe korrigjoni sa vijon: a fillon boshti y nga zero, a është shkalla e qëndrueshme, a është e dukshme madhësia e kampionit, a ka zbutje të tepërt? Shpjegoni arsyetimin për çdo korrigjim që keni bërë.
4. Prodhimi i një shënimi zbulimi (jo një gjetje):
Bazuar në grafikët që prodhoj, rendis VËZHGIMET si një 'shënim zbulimi'; shkruani çdo artikull në gjuhën e 'hipotezës për t'u testuar', jo 'gjetjes përfundimtare'. Shembull: 'Të ardhurat në arsimin e lartë DUKEN më të përhapura; duhet të testohet me të dhëna të veçanta.' Shmangni deklaratat shkakësore dhe përfundimtare.
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
Bëni grafikë të bukur nga rendimenti dhe më tregoni se çfarë kuptimi kanë.
Kjo kërkesë fton rezultate mashtruese: "e bukur" fokusohet në estetikë, ndërsa "çfarë do të thotë" e shtyn AI të kalojë nga zbulimi në përfundimin përfundimtar. Pasojnë komente kauzale, të ekzagjeruara.
Njoftim i fuqishëm:
Roli juaj: asistent i ndershëm EDA. Detyra: (1) zgjidhni llojin e grafikut që i përshtatet pyetjes sime dhe shkruani justifikimin, (2) filloni boshtin nga zero në grafikët me shtylla, (3) interpretoni rezultatin në gjuhën e SHËNIMIT ZBULOJE: asnjë pretendim përfundimtar/shkak që sugjeron hipotezë në gjuhën "duhet të testohet", (4) paralajmëroj se diagrami do të jetë i vogël (4) do të më paralajmëroj në skemën time të vogël (4) do të më paralajmëroj në mjedisin tim të vogël. atë.
Dallimi: vullneti i fortë justifikon llojin e grafikut, vendos rregullat e ndershmërisë dhe nuk ngatërron zbulimin me konfirmimin.
tre mini kuti
Rasti 1 - Ekzagjerim diskret i boshtit. Një analist tregoi rezultatet e kënaqësisë së dy degëve (7.8 dhe 8.0; nga 10) në një grafik me shtylla. Kur filloni boshtin YZ nga 7.5, dega e dytë u shfaq pothuajse dy herë më e lartë se e para; ndërsa diferenca ishte vetëm 2.5%. Menaxhmenti ishte gati të shpërblente një degë nën përshtypjen e gabuar. Kur e nisa boshtin nga e para, ndryshimi ishte pothuajse i padukshëm. Mësimi: vetëm zgjedhja e boshtit ndryshon perceptimin.
Rasti 2 - Besimi në korrelacion dhe anashkalimi i grafikut. Një studiues pa r = 0.81 midis dy variablave dhe shkroi "marrëdhënie të fortë lineare". Kur konsulenti i tij kërkoi grafikun e shpërndarjes, u pa se marrëdhënia ishte në të vërtetë për shkak të një vëzhgimi të vetëm ekstrem, dhe kur kjo pikë u hoq, korrelacioni ra në 0.12. Mësimi: numërimi i korrelacionit nuk zëvendëson një grafik; gjithmonë shiko shpërndarjen.
Rasti 3 - Ngatërrimi i zbulimit me konfirmimin. Një student shikoi të gjitha korrelacionet në çift në një grup të dhënash me 40 ndryshore, zgjodhi atë më të lartën (r=0.52) dhe shkroi, "ne gjetëm një lidhje të rëndësishme midis arsimit dhe kursimeve (p=0.004)." Megjithatë, kishte qindra çifte në 40 variabla; Zgjedhja më e lartë ishte një gjetje e rreme për shkak të rastësisë. Mësimi: modeli i zbuluar nuk mund të “testohet dhe deklarohet i rëndësishëm” në të njëjtat të dhëna; Kërkohet konfirmim i veçantë.
Gabimet e zakonshme
- Mos fillimi i boshtit nga zero në grafikun me shtylla. E ekzagjeron ndryshimin e vogël; Gënjeshtra vizuale më e zakonshme. Gjithmonë kontrolloni.
- Shikimi i korrelacionit dhe anashkalimi i grafikut. I njëjti korrelacion vjen nga modele shumë të ndryshme; mund të përshtatet me një marrëdhënie të jashtme. Së pari, shpërndarja.
- Duke e konsideruar modelin e gjetur në zbulim si "provë" në të njëjtat të dhëna. Kjo është porta për p-hacking; Konfirmimi bëhet veçmas.
- Lloji i gabuar i grafikut. Ndeshjet si shiriti për trend dhe byreku për shpërndarje janë mashtruese. Zgjidhni një zhanër bazuar në pyetjen.
- Fshehja e madhësisë së mostrës. n=8 dhe n=8,000 nuk duhet të duken njësoj në të njëjtin grafik; duhet treguar pasiguri.
Këshillë: Përpara se të publikoni një grafik, pyesni veten: "A do të ndryshonte historia nëse do të ndryshoja boshtin?" Nëse përgjigja është po, ndoshta e keni nisur strumbullarin nga një vend i pandershëm.
Në përmbledhje
Analiza hulumtuese e të dhënave është faza e takimit të të dhënave, shikimit të modeleve dhe gjenerimit të hipotezave; Nuk është një konfirmim. AI gjeneron shpejt statistika përshkruese dhe kodin e grafikut, por ju zgjidhni llojin e grafikut bazuar në pyetjen tuaj dhe kontrolloni parimet e drejtësisë (bosht zero, shkallë konsistente, pasiguri e dukshme). Shikoni shpërndarjen përpara se t'i besoni numrit të korrelacionit; Mos e deklaroni modelin që gjetët në zbulim si "provë" në të njëjtat të dhëna. Një grafik i bukur i AI nuk do të thotë një grafik i saktë.
Detyra e aplikimit
Zgjidhni të paktën tre variabla në një grup të dhënash. Kërkoni nga AI dhe ekzekutoni kodin që prodhon grafikë eksplorues (histogram, shpërndarje, kuti) me një kërkesë që zbaton rregullat e ndershmërisë. Për çdo grafik: kontrolloni (1) përshtatshmërinë e llojit të grafikut me pyetjen, (2) ndershmërinë e boshtit, (3) dukshmërinë e madhësisë së mostrës. Shkruani të paktën një "shënim zbulimi" në gjuhën e hipotezës ("...duket të testohet veçmas"). Shqyrtoni një korrelacion me numërimin dhe shpërndarjen dhe raportoni nëse ka mospërputhje mes tyre.
listë kontrolli
- [ ] Zgjodha llojin e grafikut bazuar në pyetjen time dhe llojin e të dhënave.
- [ ] Në grafikët me shtylla, e nis boshtin y nga zero; Kontrollova ndershmërinë e boshtit.
- [ ] E shikova grafikun e shpërndarjes përpara se t'i besoja korrelacionit.
- [ ] Unë pasqyrova madhësinë e kampionit dhe pasigurinë në grafik.
- [ ] Unë i shkrova modelet që gjeta në eksplorim si "hipotezë për t'u testuar" dhe jo si "provë".
- [ ] Vura re se nuk do të përdorja të njëjtat të dhëna për konfirmim dhe se kërkohej një hap i veçantë.