Üksus 3 / 11

Uurimuslik andmete analüüs ja visualiseerimine: graafiku tegemine ja tõlgendamine tehisintellektiga

Kasu:

  • Võimalus koostada tehisintellekti toega kirjeldavat statistikat ja jaotus-/seosdiagramme ning valida vastavalt andmetele ja küsimusele õige diagrammi tüüp
  • Oskus tehisintellekti poolt toodetud piltidel ära tunda eksitavaid valikuid (katkendtelg, sobimatu skaala, liigne silumine) ja rakendada ausaid visualiseerimispõhimõtteid
  • Võimalus eristada, et uurimuslik analüüs on hüpoteeside genereerimiseks ja samade andmetega avastamise ja kinnituse tegemise lõks (mis avab ukse p-häkkimisele).

Pärast andmete puhastamist on empiirilise uurija esimene töö neid tundma õppida. Seda etappi nimetatakse uurimuslikuks andmeanalüüsiks (EDA – Exploratory Data Analysis): see on protsess, mille käigus uuritakse andmeid graafikute ja kokkuvõtliku statistika abil ning nähakse nende struktuuri, mustreid ja üllatusi. Eesmärk ei ole veel hüpoteesi testida, vaid tutvuda andmetega, genereerida küsimusi ja panna alus tulevikus ehitatavale mudelile. Selles üksuses näeme, kuidas tehisintellekt (AI) kiirendab EDA-d ja visualiseerimist, kuid miks tuleb selle toodetud graafikat hoolikalt auditeerida.

Teeme esmalt kaks põhilist vahet. Esiteks täiendavad üksteist kirjeldav statistika (arvud, mis võtavad kokku sellised andmed nagu keskmine, mediaan, standardhälve, kvartiilid) ja visualiseerimine (sama informatsiooni graafiline näitamine); Koos kirjeldavad nad andmeid. Teiseks ja kõige kriitilisem: avastamist ja kinnitamist tuleb eristada. Uurimuslik analüüs on hüpoteeside genereerimiseks; Hüpoteesi uurimine samade andmetega ja ütlemine "Ma testisin seda ja leidsin selle oluliseks" avab ukse p-häkkimisele, mida näeme järgmises üksuses. Andmete vaatamine ja mustri vaatamine on tasuta; Kuid selle mustri kuulutamine samades andmetes "tõestatud leiuks" on eksitav.

Samm-sammult uurimuslik analüüs

1. Ühemõõtmeline vaade. Uurige iga muutujat eraldi: kas selle jaotus on sümmeetriline või viltu; kui palju mägesid seal on; Kus on kõrvalekalded? Arvmuutujate puhul histogramm (diagramm, mis näitab sagedust, jagades väärtused vahemikeks) ja boxplot (boxplot – diagramm, mis näitab mediaan-, kvartiili- ja äärmuslikke väärtusi); Kategooriliste muutujate jaoks kasutage sagedustabeleid ja tulpdiagramme.

2. Kahe muutujaga vaade. Vaadake kahe muutuja vahelist seost: hajuvusdiagramm kahe arvmuutuja jaoks (näitab iga vaatlust punktina x-y tasapinnal), rühmitatud kastdiagramm arv-kategooria jaoks, risttabel kahe kategoorilise jaoks. Enne korrelatsioonikordaja vaatamist vaadake kindlasti hajuvusgraafikut: sama korrelatsioon võib näidata väga erinevaid mustreid (seda demonstreerib kuulus Anscombe'i nelik; neljal andmekogumil on peaaegu identne statistika, kuid joonistamisel osutuvad need täiesti erinevaks).

3. Valige õige diagrammi tüüp. Diagrammi tüüp sõltub teie küsimusest ja andmetüübist. Histogramm levitamiseks; hajutamine suhte jaoks; joondiagramm aja jooksul muutumiseks; tulpdiagramm kategooriate võrdlemiseks; (ettevaatlikult) virnastatud latt osade ja terviku suhte jaoks. Tehisintellekt genereerib teie jaoks kiiresti koodi, kuid otsus, mis graafik millise küsimuse jaoks on, on teie.

4. Märkige muster, ärge deklareerige tulemusi. Salvestage mis tahes huvitav muster, mida näete "avastusmärkmena", kuid ärge pidage seda kinnitatud leiuks. Kinnitamine toimub eraldi etapina, eelistatavalt eraldi andmetega või etteantud ajakavaga.

Ausad visualiseerimispõhimõtted

Graafika veenab; Seetõttu on ka selle eksitav jõud suur. AI võib teha esteetilisi, kuid mõnikord eksitavaid valikuid. Kontrollige neid eeskirju.

  • Lintdiagrammides peab y-telg algama nullist. Katkendteljel on väikesed erinevused suured.
  • Skaala peaks olema ühtlane. Kui võrreldakse kahte diagrammi, kasutage sama teljevahemikku.
  • Liigne silumine võib varjata tegelikku mustrit. Trendijoon näeb kena välja, kuid kui see andmeid liiga palju "silub", võib see olla eksitav.
  • Värv ja 3D-kaunistus moonutavad tähelepanu, mitte andmeid. Valige lihtsus.
  • Puuduvad andmed ja valimi suurus peaksid olema nähtavad. "n=12" ja "n=12 000" ei tohiks välja näha ühesugused.
Tähelepanu: lihtsalt sellepärast, et AI toodetud graafika on ilus, ei vasta see tõele. Kõige tavalisem viga, mida ta teeb, on see, et ta ei alusta tulpdiagrammis telge nullist ja liialdab kahe rühma erinevust. Kontrollige alati telge.

Võrdlustabel: küsimus → diagramm

Küsi

õige diagramm

Levinud viga

Kuidas see muutuja jaotub?

Histogrammi/kasti graafik

kasutage sektordiagrammi

Kas kaks numbrilist muutujat on omavahel seotud?

Hajudiagramm

Lihtsalt vaadates korrelatsioonide arvu

Kuidas on see aja jooksul muutunud?

joondiagramm

Trendide jutustamine tulpdiagrammiga

Mis vahe on rühmade vahel?

Grupeeritud kast/riba (nullist)

Kärbitud teljega varras

Osade-tervikute suhe?

Virnastatud riba (ettevaatusega)

Mitmeosaline sektordiagramm

Neli kopeeritavat viipa

1. Automaatse avastamise kood:

Teie roll: EDA assistent. Ma ei jaga andmeid, tahan R (ggplot2) koodi. Data.frame'is on numbrilised (sissetulek, vanus, kulutused) ja kategoorilised (piirkond, haridus) muutujad. Ülesanne: kirjutage kood, mis loob iga numbri jaoks histogrammi, iga kategooria jaoks tulpdiagrammi ja sissetuleku-vanuse hajuvusdiagrammi. Lintdiagrammides alustage y-telge nullist. Lisa kommentaaririda.

2. Korrelatsiooni ülevaade (korrelatsioon + visuaalne koos):

Kirjutage kood, mis nii arvutab sissetulekute ja kulutuste Pearsoni korrelatsiooni kui ka joonistab hajuvusgraafiku + lineaarse trendi. Lisage kommentaaririda, mis tuletab mulle meelde, et ma peaksin diagrammi enne korrelatsiooniloenduse USKALDAmist uurima (Anscombe'i hoiatus). Ärge siluge trendijoont üle.

3. Terviklikkuse audit:

Ausa visualiseerimise jaoks kontrollige järgmist ggplot-koodi: [kood]. Kontrollige ja parandage järgmist: kas y-telg algab nullist, kas skaala on ühtlane, kas valimi suurus on nähtav, kas on ülemäärast silumist? Selgitage iga tehtud paranduse põhjendust.

4. Avastusmärkme koostamine (mitte leid):

Loetlege minu koostatud graafikute põhjal TÄHELEPANEKUD kui "avastusmärkus"; kirjutage iga üksus keeles "kontrollitav hüpotees", mitte "lõplik leid". Näide: „Sissetulek kõrghariduses TUNUB rohkem hajutatud; tuleks testida eraldi andmetega. Vältige põhjuslikke ja lõplikke väiteid.

Nõrk viip / Tugev viip

Nõrk viip:

Tehke saagist ilusad graafikud ja öelge, mida need tähendavad.

See viip kutsub esile eksitava väljundi: "ilus" keskendub esteetikale, samas kui "mida see tähendab" sunnib tehisintellekti hüppama avastamiselt lõpliku järelduseni. Järgnevad põhjuslikud, liialdatud kommentaarid.

Võimas viip:

Teie roll: aus EDA assistent.Ülesanne: (1) valige minu küsimusele sobiv diagrammi tüüp ja kirjutage põhjendus, (2) alustage tulpdiagrammides telge nullist, (3) tõlgendage väljundit keeles DISCOVERY NOTE: ükski lõplik/põhjuslik väide ei viita hüpoteesile keeles "tuleb testida",(4) hoiata mind, kui ma käivitan <3 proovi, kui minu keskkond on 0). seda.

Erinevus: tugev tahe õigustab diagrammi tüüpi, kehtestab aususe reeglid ega aja avastamist segi kinnitusega.

kolm minikarpi

Juhtum 1 – diskreetse telje liialdus. Analüütik näitas tulpdiagrammis kahe haru rahuloluskoore (7,8 ja 8,0; 10-st). Alustades YZ-telge 7,5-st, paistis teine ​​haru peaaegu kaks korda kõrgem kui esimene; kusjuures erinevus oli vaid 2,5%. Juhtkond kavatses vale mulje korral filiaali premeerida. Kui alustasin telge nullist, oli erinevus peaaegu nähtamatu. Õppetund: ainuüksi telje valik muudab taju.

2. juhtum – korrelatsiooni usaldamine ja diagrammi vahelejätmine. Teadlane nägi kahe muutuja vahel r = 0,81 ja kirjutas "tugev lineaarne seos". Kui tema konsultant küsis hajuvusgraafikut, oli näha, et seos oli tegelikult tingitud ühest äärmuslikust vaatlusest ja kui see punkt eemaldati, langes korrelatsioon 0,12-ni. Õppetund: korrelatsiooniloendus ei asenda graafikut; vaata alati hajumist.

Juhtum 3 – Segane avastus kinnitusega. Üks õpilane vaatas kõiki paaripõhiseid korrelatsioone 40 muutujaga andmekogumis, valis neist kõrgeima (r=0,52) ja kirjutas: "Leidsime olulise seose hariduse ja säästude vahel (p = 0,004)." 40 muutujas oli aga sadu paare; kõrgeima valimine oli juhuse tõttu vale leid. Õppetund: avastatud mustrit ei saa samades andmetes "testida ja oluliseks kuulutada"; Vaja on eraldi kinnitust.

Levinud vead

  • Telge ei alustata tulpdiagrammi nullist. See liialdab väikese erinevusega; Kõige tavalisem visuaalne vale. Kontrollige alati.
  • Korrelatsiooni vaatamine ja diagrammi vahelejätmine. Sama korrelatsioon tuleneb väga erinevatest mustritest; võib sobida kõrvalise suhtega. Esiteks hajutamine.
  • Pidades avastusest leitud mustrit "tõendiks" samades andmetes. See on p-häkkimise värav; Kinnitamine toimub eraldi.
  • Vale diagrammi tüüp. Sellised vasted nagu trendiriba ja levitamise pirukas on eksitavad. Valige küsimuse põhjal žanr.
  • Valimi suuruse peitmine. n=8 ja n=8000 ei tohiks samal graafikul ühesugused välja näha; tuleb näidata ebakindlust.
Näpunäide. Enne diagrammi avaldamist küsige endalt: "Kas lugu muutuks, kui muudaks telge?" Kui vastus on jaatav, alustasite pivoti tõenäoliselt ebaausast kohast.

Kokkuvõttes

Uurimuslik andmete analüüs on andmete täitmise, mustrite nägemise ja hüpoteeside genereerimise faas; See ei ole kinnitus. Tehisintellekt genereerib kiiresti kirjeldavat statistikat ja graafikukoodi, kuid graafiku tüübi valite oma küsimuse põhjal ja kontrollite õigluse põhimõtteid (nulltelg, ühtlane skaala, näiv määramatus). Enne korrelatsiooninumbri usaldamist vaadake hajumist; Ärge kuulutage avastuse käigus leitud mustrit samades andmetes "tõendiks". Ilus AI graafik ei tähenda õiget graafikut.

Rakenduse ülesanne

Valige andmekogumis vähemalt kolm muutujat. Küsige AI-lt ja käivitage kood, mis loob uurimuslikke graafikuid (histogramm, hajutatud, kastitud) koos viipaga, mis jõustab aususe reeglid. Iga diagrammi puhul: kontrollige (1) diagrammi tüübi sobivust küsimusele, (2) telje ausust, (3) valimi suuruse nähtavust. Kirjutage hüpoteesi keeles vähemalt üks "avastusmärkus" ("...näib, et seda testitakse eraldi"). Uurige korrelatsiooni nii loenduse kui ka hajumisega ja teatage, kui nende vahel esineb lahknevusi.

kontrollnimekiri

  • [ ] Valisin diagrammi tüübi oma küsimuse ja andmetüübi põhjal.
  • [ ] Lintdiagrammides alustan y-telge nullist; Kontrollisin telje ausust.
  • [ ] Vaatasin hajuvusdiagrammi, enne kui korrelatsiooni usaldasin.
  • [ ] Kajastasin graafikul valimi suurust ja määramatust.
  • [ ] Kirjutasin uurimise käigus leitud mustrid pigem "hüpoteesiks, mida tuleb kontrollida" kui "tõendusmaterjali".
  • [ ] Märkasin, et ma ei kasutaks samu andmeid kinnitamiseks ja vaja on eraldi sammu.