Vienība 3 / 11

Izpētes datu analīze un vizualizācija: grafiku veidošana un interpretācija ar mākslīgo intelektu

Ieguvumi:

  • Spēja izveidot aprakstošu statistiku un izplatības/attiecību diagrammas ar mākslīgā intelekta atbalstu un izvēlēties pareizo diagrammas veidu atbilstoši datiem un jautājumam
  • Spēja atpazīt maldinošas izvēles (pārtraukta ass, neatbilstošs mērogs, pārmērīga izlīdzināšana) mākslīgā intelekta radītajos attēlos un pielietot godīgus vizualizācijas principus
  • Spēja atšķirt, ka pētnieciskā analīze ir paredzēta hipotēžu ģenerēšanai un slazdam, lai ar tiem pašiem datiem izdarītu atklājumus un apstiprinājumus (kas paver durvis p-uzlaušanai).

Pēc datu tīrīšanas empīriskā pētnieka pirmais darbs ir tos iepazīt. Šo posmu sauc par izpētes datu analīzi (EDA — Exploratory Data Analysis): tas ir process, kurā dati tiek pārbaudīti ar grafikiem un kopsavilkuma statistiku un redzētu to struktūru, modeļus un pārsteigumus. Mērķis vēl nav pārbaudīt hipotēzi, bet gan iepazīties ar datiem, ģenerēt jautājumus un likt pamatus modelim, kuru veidosiet nākotnē. Šajā nodaļā mēs redzēsim, kā mākslīgais intelekts (AI) paātrina EDA un vizualizāciju, bet kāpēc tā radītā grafika ir rūpīgi jāpārbauda.

Vispirms izdarīsim divas galvenās atšķirības. Pirmkārt, aprakstošā statistika (skaitļi, kas apkopo tādus datus kā vidējā, mediāna, standarta novirze, kvartiles) un vizualizācija (parāda vienu un to pašu informāciju grafiski) papildina viens otru; Kopā tie apraksta datus. Otrkārt, vissvarīgākais: ir jānošķir atklājums un apstiprinājums. Izpētes analīze ir paredzēta hipotēžu ģenerēšanai; Izpētot hipotēzi ar tiem pašiem datiem un sakot: "Es to pārbaudīju un atklāju, ka tas ir nozīmīgs", tiek atvērtas p-hacking durvis, ko mēs redzēsim nākamajā vienībā. Var brīvi apskatīt datus un redzēt modeli; Taču pasludināt šo modeli par "pierādītu atradumu" tajos pašos datos ir maldinoši.

Soli pa solim izpētes analīze

1. Viendimensiju skats. Pārbaudiet katru mainīgo atsevišķi: vai tā sadalījums ir simetrisks vai šķībs; cik daudz kalnu tur ir; Kur ir novirzes? Skaitliskajiem mainīgajiem — histogramma (grafika, kas parāda frekvenci, sadalot vērtības diapazonos) un boxplot (boxplot — diagramma, kurā parādītas vidējās, kvartiles un galējās vērtības); Kategoriskiem mainīgajiem izmantojiet biežuma tabulas un joslu diagrammas.

2. Divfaktoru skats. Skatiet sakarību starp diviem mainīgajiem: izkliedes diagramma diviem skaitliskiem mainīgajiem (parāda katru novērojumu kā punktu x-y plaknē), grupētu lodziņu diagrammu skaitliski-kategoriskajam, krustveida diagrammu diviem kategoriskiem. Pirms skatāties uz korelācijas koeficientu, noteikti apskatiet izkliedes diagrammu: viena un tā pati korelācija var parādīt ļoti dažādus modeļus (to demonstrē slavenais Anscombe kvartets; četrām datu kopām ir gandrīz identiska statistika, taču, uzzīmējot diagrammu, tie izrādās pilnīgi atšķirīgi).

3. Izvēlieties pareizo diagrammas veidu. Diagrammas veids ir atkarīgs no jūsu jautājuma un datu veida. Histogramma izplatīšanai; izkliedēšana attiecībām; līniju diagramma izmaiņām laika gaitā; joslu diagramma kategoriju salīdzināšanai; (uzmanīgi) sakrauts stienis daļu attiecībai pret veselumu. AI ātri ģenerē kodu jums, bet lēmums par to, "kurš grafiks kuram jautājumam" ir jūsu.

4. Ņemiet vērā modeli, nedeklarējiet rezultātus. Ierakstiet jebkuru interesantu modeli, ko redzat kā "atklājuma piezīmi", taču neuzskatiet to par apstiprinātu atradumu. Apstiprināšana tiek veikta atsevišķā solī, vēlams ar atsevišķiem datiem vai iepriekš noteiktu grafiku.

Godīgi vizualizācijas principi

Grafika pārliecina; Tāpēc arī tā maldinošais spēks ir augsts. AI var izdarīt estētisku, bet dažreiz maldinošu izvēli. Pārbaudiet šīs politikas:

  • Joslu diagrammās y asij jāsākas ar nulli. Pārtrauktā ass parāda nelielas atšķirības kā lielas.
  • Mērogam jābūt konsekventam. Ja tiek salīdzinātas divas diagrammas, izmantojiet to pašu asu diapazonu.
  • Pārmērīga izlīdzināšana var paslēpt patieso rakstu. Tendenču līnija izskatās jauki, taču, ja tā pārāk daudz "izlīdzina" datus, tā var būt maldinoša.
  • Krāsa un 3D dekorēšana izkropļo uzmanību, nevis datus. Izvēlieties vienkāršību.
  • Trūkstošajiem datiem un izlases lielumam jābūt redzamam. “n=12” un “n=12 000” nedrīkst izskatīties vienādi.
Uzmanību: tikai tāpēc, ka AI radītā grafika ir skaista, tā nav patiesa. Visbiežāk sastopamā kļūda, ko viņš pieļauj, ir nesākt asi no nulles joslu diagrammā un pārspīlēt atšķirību starp abām grupām. Vienmēr pārbaudiet asi.

Salīdzinājuma diagramma: jautājums → diagramma

Jautājiet

pareiza diagramma

Bieža kļūda

Kā šis mainīgais tiek izplatīts?

Histogrammas/kastes grafiks

izmantojiet sektoru diagrammu

Vai divi skaitliskie mainīgie ir saistīti?

Izkliedes grafiks

Paskatoties tikai uz korelāciju skaitu

Kā tas laika gaitā ir mainījies?

līniju diagramma

Tendenču izstāstīšana ar joslu diagrammu

Kāda ir atšķirība starp grupām?

Grupēts lodziņš/josla (no nulles)

Saīsinātas ass stienis

Daļu pret veselu attiecība?

Sakrauts stienis (ar piesardzību)

Vairāku slāņu sektoru diagramma

Četras kopējamas uzvednes

1. Automātiskās atklāšanas kods:

Jūsu loma: EDA palīgs. Es nedalos ar datiem, es vēlos R (ggplot2) kodu. Datu karkasā ir skaitliski (ienākumi, vecums, izdevumi) un kategoriski (reģions, izglītība) mainīgie. Uzdevums: uzrakstiet kodu, kas izveido histogrammu katram skaitlim, joslu diagrammu katrai kategorijai un izkliedes diagrammu ienākumu ~ vecumam. Joslu diagrammās ļaujiet y ass sākt no NULLES. Pievienojiet komentāra rindiņu.

2. Korelācijas apskats (korelācija + vizuālais kopā):

Uzrakstiet kodu, kas gan aprēķina Pīrsona korelāciju ienākumiem un izdevumiem, gan uzzīmē izkliedes diagrammu + lineāro tendenci. Pievienojiet komentāra rindiņu, atgādinot, ka ir jāpārbauda diagramma, pirms UZTICĒos korelācijas skaitīšanai (Anscombe brīdinājums). Nepārmērīgi izlīdziniet tendenču līniju.

3. Integritātes audits:

Lai iegūtu godīgu vizualizāciju, pārbaudiet šo ggplot kodu: [kods]. Pārbaudiet un izlabojiet sekojošo: vai y ass sākas no nulles, vai skala ir konsekventa, vai ir redzams parauga lielums, vai ir pārmērīga izlīdzināšana? Izskaidrojiet katra veiktā labojuma pamatojumu.

4. Atklāšanas piezīmes (nevis atraduma) izveidošana.

Pamatojoties uz manis izveidotajiem grafikiem, norādiet NOVĒROJUMUS kā “atklājuma piezīmi”; katru vienumu rakstiet valodā "pārbaudāmā hipotēze", nevis "pārliecinošs secinājums". Piemērs: “Ieņēmumi augstākajā izglītībā ŠĶITĀS vairāk sadalīti; jātestē ar atsevišķiem datiem. Izvairieties no cēloņsakarības un galīgiem apgalvojumiem.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Izveidojiet skaistus grafikus no ražas un pastāstiet man, ko tie nozīmē.

Šī uzvedne aicina iegūt maldinošus rezultātus: “skaisti” koncentrējas uz estētiku, savukārt “ko tas nozīmē” mudina AI pāriet no atklājuma līdz galīgam secinājumam. Seko cēloņsakarīgi, pārspīlēti komentāri.

Spēcīga uzvedne:

Jūsu loma: godīgs EDA asistents.Uzdevums: (1) izvēlieties diagrammas veidu, kas atbilst manam jautājumam, un uzrakstiet pamatojumu, (2) joslu diagrammās sāciet asi no nulles, (3) interpretējiet rezultātu DISCOVERY NOTE valodā: nav galīgas/cēloņsakarības apgalvojuma, kas neliecina par hipotēzi valodā "jāpārbauda", (4) brīdinās mani, ja es izpildīšu <3 diagrammu, un manā paraugs ir mazs. to.

Atšķirība: spēcīga griba attaisno diagrammas veidu, uzliek godīguma noteikumus un nejauc atklāšanu ar apstiprinājumu.

trīs mini futrāļi

1. gadījums — diskrētas ass pārspīlējums. Analītiķis joslu diagrammā parādīja divu nozaru apmierinātības rādītājus (7,8 un 8,0; no 10). Sākot YZ asi no 7,5, otrais zars parādījās gandrīz divreiz augstāks par pirmo; savukārt atšķirība bija tikai 2,5 %. Vadība gatavojās apbalvot filiāli, radot nepareizu iespaidu. Kad es sāku asi no nulles, atšķirība bija gandrīz neredzama. Nodarbība: ass izvēle vien maina uztveri.

2. gadījums — uzticēšanās korelācijai un diagrammas izlaišana. Pētnieks redzēja r = 0,81 starp diviem mainīgajiem un uzrakstīja "spēcīgu lineāru saistību". Kad viņa konsultants jautāja par izkliedes diagrammu, bija redzams, ka attiecības patiesībā ir saistītas ar vienu ekstrēmu novērojumu, un, kad šis punkts tika noņemts, korelācija samazinājās līdz 0,12. Nodarbība: korelāciju skaits neaizstāj grafiku; vienmēr skaties uz izkliedi.

3. gadījums — mulsinošs atklājums ar apstiprinājumu. Viens students aplūkoja visas pāru korelācijas 40 mainīgo datu kopā, atlasīja augstāko (r=0,52) un rakstīja: "Mēs atklājām būtisku saistību starp izglītību un uzkrājumiem (p = 0,004)." Tomēr 40 mainīgajos lielumos bija simtiem pāru; Augstākā izvēle bija nepatiesa nejaušības dēļ. Nodarbība: atklāto modeli nevar “pārbaudīt un atzīt par nozīmīgu” tajos pašos datos; Nepieciešams atsevišķs apstiprinājums.

Biežas kļūdas

  • Joslu diagrammā ass nesākas no nulles. Tas pārspīlē mazo atšķirību; Visizplatītākie vizuālie meli. Vienmēr pārbaudiet.
  • Aplūkojot korelāciju un izlaižot diagrammu. Tāda pati korelācija izriet no ļoti dažādiem modeļiem; var atbilst ārējām attiecībām. Pirmkārt, izkliedēšana.
  • Uzskatot atklājumā atrasto modeli par "pierādījumu" tajos pašos datos. Šie ir vārti uz p-uzlaušanu; Apstiprinājums tiek veikts atsevišķi.
  • Nepareizs diagrammas veids. Atbilstības, piemēram, josla tendencei un pīrāgs izplatīšanai, ir maldinoši. Izvēlieties žanru, pamatojoties uz jautājumu.
  • Parauga lieluma slēpšana. n=8 un n=8000 vienā un tajā pašā grafikā nedrīkst izskatīties vienādi; ir jāparāda nenoteiktība.
Padoms. Pirms diagrammas publicēšanas pajautājiet sev: "Vai stāsts mainītos, ja es mainītu asi?" Ja atbilde ir apstiprinoša, jūs, iespējams, sākāt rakursu no negodīgas vietas.

Rezumējot

Izpētes datu analīze ir datu iegūšanas, modeļu saskatīšanas un hipotēžu ģenerēšanas fāze; Tas nav apstiprinājums. AI ātri ģenerē aprakstošu statistiku un grafika kodu, taču jūs izvēlaties diagrammas veidu, pamatojoties uz savu jautājumu, un kontrolējat godīguma principus (nulles ass, konsekventa skala, šķietama nenoteiktība). Apskatiet izkliedi, pirms uzticaties korelācijas skaitlim; Nenorādiet paraugu, ko atradāt atklājumā, kā "pierādījumu" tajos pašos datos. Skaists AI grafiks nenozīmē pareizu grafiku.

Lietojumprogrammas uzdevums

Datu kopā atlasiet vismaz trīs mainīgos. Pieprasiet AI un palaidiet kodu, kas veido pētnieciskus grafikus (histogrammu, izkliedētu, lodziņu) ar uzvedni, kas ievieš godīguma noteikumus. Katrai diagrammai: pārbaudiet (1) diagrammas veida atbilstību jautājumam, (2) ass godīgumu, (3) izlases lieluma redzamību. Uzrakstiet vismaz vienu “atklājuma piezīmi” hipotēzes valodā (“...šķiet, ka tiks pārbaudīta atsevišķi”). Pārbaudiet korelāciju gan ar skaitīšanu, gan izkliedi un ziņojiet, ja starp tām ir neatbilstība.

kontrolsaraksts

  • [ ] Es izvēlējos diagrammas veidu, pamatojoties uz manu jautājumu un datu veidu.
  • [ ] Joslu diagrammās es sāku y asi no nulles; Es pārbaudīju ass godīgumu.
  • [ ] Es paskatījos uz izkliedes diagrammu, pirms uzticējos korelācijai.
  • [ ] Es grafikā atspoguļoju izlases lielumu un nenoteiktību.
  • [ ] Izpētē atrastos modeļus es uzrakstīju kā "pārbaudāmo hipotēzi", nevis "pierādījumus".
  • [ ] Es atzīmēju, ka es neizmantošu tos pašus datus apstiprināšanai un ka ir nepieciešama atsevišķa darbība.