Pelnas:
- Gebėjimas tirti kintamųjų pasiskirstymą, centrą, sklaidą ir anomalijas su atitinkamais grafikais (histograma, langelio diagrama, sklaidos diagrama).
- Gebėjimas teisingai interpretuoti koreliaciją ir perskaityti ją kartu su sklaidos diagrama, nepainiojant jos su priežastingumu
- Gebėjimas suprasti, kad suvestinė statistika gali būti klaidinanti (Anscombe pamoka) ir kurti hipotezes, kurios nulemia modeliavimo kryptį.
Prieš kuriant modelį, būtina žinoti duomenis. Kaip gydytojas neišrašo vaistų neištyręs paciento, duomenų mokslininkas nesukuria modelio „neištyręs“ duomenų. Šis tyrimas vadinamas žvalgomąja duomenų analize (trumpiau EDA): tai vizualiai ir grafiškai duomenų pasiskirstymo, ryšių, netikėtumų ir spąstų atskleidimo fazė. EDA tikslas yra generuoti hipotezes, sugauti klaidas ir nustatyti modeliavimo kryptį. Dirbtinis intelektas šiame etape yra labai galingas asistentas: jis pasiūlo, kuri diagrama tinka, rašo jos kodą, interpretuoja paskirstymą. Tačiau žmogus, remdamasis savo srities žiniomis, nusprendžia, ar jo matomas modelis yra tikras, ar atsitiktinumas.
Ko ieško EDA?
EDA ieško atsakymų į keturis klausimus. Pasiskirstymas: kaip pasiskirsto kiekvienas kintamasis – ar jis simetriškas, iškreiptas ar dviejų smailių? Centrinė tendencija ir plitimas: koks yra vidurkis, mediana, standartinis nuokrypis? Santykiai: kaip kintamieji yra susiję vienas su kitu? Anomalijos: ar yra netikėtų vertybių, spragų, grupuočių? Šie keturi klausimai nustato, kuri funkcija veiks ir kuris modelis yra tinkamas.
Apibrėžkime keletą pagrindinių sąvokų. Histograma yra grafikas, padalijantis skaitinio kintamojo reikšmes į intervalus ir parodantis, kiek stebėjimų yra kiekviename intervale; Tai greičiausias būdas pamatyti paskirstymą. Iškrypimas – pasiskirstymo poslinkis viena kryptimi; Tokie kintamieji kaip pajamos yra iškreipti į dešinę (dauguma žema, nedaugelis labai didelių). Dėžutės diagrama iš pirmo žvilgsnio rodo medianą, kvartilius ir nuokrypius. Sklaidos diagrama rodo dviejų skaitinių kintamųjų ryšį su taškų debesimi.
Koreliacija: santykiai yra, bet būkite atsargūs
Koreliacija – matas, kaip du kintamieji juda kartu; skaičius tarp -1 ir +1 yra dažniausiai naudojamas ir labiausiai nesuprantamas EDA įrankis. +1 reiškia tobulą bendrą padidėjimą, -1 reiškia tobulą atvirkštinį ryšį, 0 reiškia, kad nėra tiesinio ryšio. Yra du dideli spąstai. Pirma, garsioji taisyklė: koreliacija nėra priežastinis ryšys. Užspringimo atvejų padaugėja parduodant ledus; ne todėl, kad vienas veda į kitą, o todėl, kad vasara (paslėptas trečiasis kintamasis) suaktyvina abu. Antra, koreliacija matuoja tik tiesinį ryšį; Tai gali reikšti stiprų, bet kreivinį ryšį, artimą 0. Taigi, žiūrėdami į koreliaciją, būtinai pažiūrėkite ir į sklaidos diagramą.
Atsargiai: kai AI pateikia koreliacijos skaičių, jis gali nuslysti į priežastinę kalbą, pavyzdžiui, „A padidina B“. Tai pavojinga. Koreliacija rodo tik judėjimą kartu; Tik patirtis, srities žinios ir kruopščios išvados nustato priežastį.
Anscombe kvartetas: kodėl gi nepažiūrėjus į skaičių
Yra žinomas statistikos pavyzdys: Anscombe kvartetas. Keturi skirtingi duomenų rinkiniai turi beveik tą patį vidurkį, tą pačią dispersiją ir tą pačią koreliaciją (0,82); Tačiau pavaizdavus diagramą, jie atrodo visiškai kitaip – viena tiesi linija, kita lenkta, kitas – debesis, kurį traukia vienas nuokrypis. Pamoka aiški: suvestinė statistika yra klaidinanti, žiūrėti į grafiką būtina. AI gali pateikti vidurkius ir koreliacijas, tačiau pasitikėjimas šiais skaičiais nematant grafiko patenka į Anscombe spąstus.
Žemiau esančioje lentelėje apibendrinama, kuri diagrama atitinka kurį klausimą:
Klausimas
tinkama grafika
Kas rodo
Vieno kintamojo pasiskirstymas
Histograma / KDE
Forma, kreivumas, viršūnių skaičius
Centras ir nuokrypiai
Dėžutės sklypas
Mediana, kvartiliai, išoriniai rodikliai
Dviejų skaičių ryšys
sklaidos diagrama
Kryptis, stiprumas, kreivumas
Kategorijų palyginimas
juostinė diagrama
Skirtumas tarp grupių
keisti laikui bėgant
linijinė diagrama
Tendencija, sezoniškumas
Daugiamatis ryšys
Koreliacijos šilumos žemėlapis
Bendroji santykių matrica
Simpsono paradoksas: apibendrinti duomenys gali meluoti
Slaptūs EDA spąstai, kuriuos reikia žinoti, yra Simpsono paradoksas: modelis gali rodyti vieną kryptį, kai visi duomenys nagrinėjami kartu, bet atvirkščiai, kai duomenys yra suskirstyti į reikšmingus pogrupius. Klasikinis pavyzdys: bendras moterų kandidatų į universitetą lygis yra mažesnis nei vyrų; Tačiau pažvelgus į skyrius pagal skyrių, moterų priėmimo lygis daugumoje skyrių yra didesnis nei vyrų. Iš kur? Moterys kreipėsi į konkurencingesnius (mažesni priėmimo rodikliai) skyrius; Kombinuotas skaičius saugo šį paslėptą kintamąjį. Pamoka aiški: žiūrėdami į bendrą ar vidurkį, būtinai patikrinkite, ar šis skaičius pasakoja tą pačią istoriją, suskirstytas į reikšmingus pogrupius (segmentas, laikotarpis, kanalas). Kai dirbtinis intelektas pateikia bendrą rodiklį, paklausus „ar jis vis dar galioja, kai jį segmentuojate“, anksti gausite klaidinančių rezultatų.
trys mini dėklai
1 atvejis – dvi paslėptos kalvos. Vienas analitikas nustatė, kad vidutinis klientų amžius yra 41 metai, ir nurodė, kad tai „vidutinio amžiaus minia“. Tačiau histograma rodė dvi smailes: 22-28 ir 55-62 amžiaus grupes. Vidutinis 41 iš tikrųjų niekam neatstovavo. Pamoka: nubrėžkite pasiskirstymą prieš pasitikėdami vidurkiu.
2 atvejis – klaidinga koreliacija. Viena komanda nustatė 0,78 koreliaciją tarp „išlaidų reklamai“ ir „pardavimo“ ir padvigubino biudžetą. Tačiau abu suaktyvino sezoninės kampanijos; per nekampanijos laikotarpį santykiai nukrito iki 0,10. 340 tūkst. Lt papildoma reklama nedavė lauktos grąžos. Pamoka: koreliaciją sumaišyti su priežastiniu ryšiu yra brangu.
3 atvejis – vienišo priešininko nubrėžta linija. Nekilnojamojo turto analizė parodė stiprų ryšį tarp kvadratinių metrų ir kainos (r=0,80). Kai buvo nubraižytas sklypas, beveik visus santykius sukūrė viena 12 milijonų litų vertės prabangi vila; Kai šis taškas buvo pašalintas, koreliacija sumažėjo iki 0,31. Pamoka: visada perskaitykite koreliaciją kartu su sklaidos diagrama.
Keturi kopijuojami šablonai
1) Automatinė EDA santrauka:
Turiu pandas df. Parašykite kodą, kuris sukuria: (1) df.info() ir df.describe(), (2) kiekvieno skaitmeninio stulpelio histogramą, (3) kiekvieno kategorinio stulpelio skaičių. Nekomentuokite, tiesiog generuokite atradimo kodą; Aš interpretuoju modelius.
2) Koreliacija + vizualinis (su priežastingumo įspėjimu):
Parašykite kodą, kuris nubrėžia koreliacijos matricą ir skaitinių stulpelių šilumos žemėlapį. Taip pat nubrėžkite 3 didžiausių koreliuojančių porų sklaidos diagramą. Prie išvesties pridėkite komentaro eilutę, primenančią, kad koreliacija nereiškia priežastinio ryšio. Nereikškite priežastinių teiginių.
3) Pasiskirstymo diagnozė:
Stulpelyje „income_tl“: parašykite kodą, kuris sukuria histogramą, langelio diagramą, iškrypimo reikšmę ir medianos / vidurkio palyginimą. Aš interpretuosiu, ar paskirstymas yra iškreiptas, ar ne; tiesiog duok kodą.
4) Segmentų palyginimas:
Palyginkite klientus pagal „kanalą“ (žiniatinklis / mobilusis): parašykite kodą, kuris sukuria vidutinės sumos, vidutinės sumos, užsakymų skaičiaus ir sumos paskirstymo kiekvienam kanalui langelį. Pasiūlykite, kuris testas yra tinkamas dviejų kanalų skirtumo statistiniam reikšmingumui, bet sprendimas priklauso nuo manęs.
Silpnas raginimas / Stiprus raginimas
Silpnas raginimas:
Raskite ką nors įdomaus šiuose duomenyse.
„Įdomu“ neapibrėžtas; Dirbtinis intelektas nemato duomenų, todėl juos sukuria arba pateikia bendrus teiginius. Nėra krypties, kintamųjų, tikslo.
Galingas raginimas:
Jūsų vaidmuo: EDA asistentas. df stulpeliai: amžius (int), pajamų_tl (float), miestas (kategorija), kanalas (žiniatinklis/mobilusis), suma (float). Tikslas: išsiaiškinti veiksnius, turinčius įtakos „suimui“. Užduotis: (1) sumos pasiskirstymo kodas, (2) pasiskirstymo grafikai tarp sumos ir amžiaus bei pajamų_tl, (3) sumos dėžutės diagrama kanalų suskirstyme. Priežastinio reikalavimo nustatymas; Tiesiog sugeneruokite atradimo kodą ir aš interpretuosiu modelį.
Čia aiškus tikslas, kintamieji ir „priežastingumo tvirtinimo“ riba.
Dažnos klaidos
- Remdamiesi tik suvestine statistika. Kaip rodo Anscombe kvartetas, tas pats vidurkis slepia labai skirtingus pasiskirstymus; žr. diagramą.
- Klaidinga koreliacija ir priežastinis ryšys. Bendradarbiavimas nerodo, kad vienas veda į kitą; Saugokitės paslėptų kintamųjų.
- Žvelgiant į koreliaciją be sklaidos diagramos. Vienintelis nuokrypis arba kreiviškumas klaidina skaičių.
- Dviejų smailių / iškreipto skirstinio apibendrinimas su vidurkiu. Vidurkis gali niekam neatstovauti.
- Praleidžiant EDA ir pereiname tiesiai prie modelio. Neatpažinti duomenys reiškia aklą modelį.
Patarimas: su kiekvienu nauju duomenų rinkiniu pirmąsias 30 minučių skirkite tik piešdami grafikus: kiekvieno skaičiaus histogramą, reikšmingų porų sklaidos diagramą, kategorijų juostinę diagramą. Šios 30 minučių užkerta kelią būsimoms modeliavimo klaidoms ateinančiomis dienomis.
Apibendrinant
EDA yra duomenų pažinimo fazė prieš kuriant modelį ir ieško atsakymų į keturis klausimus: paskirstymą, paskirstymą centre, ryšius ir anomalijas. Suvestinė statistika gali būti klaidinanti; žiūrėti į grafiką būtina (Anscombe paskaita). Koreliacija yra galingas įrankis, tačiau priežastinis ryšys nėra ir neabejotinai turėtų būti skaitomas kartu su sklaidos diagrama. AI yra puikus greitintuvas siūlant grafiką ir rašant kodą; Tačiau žmonės savo srities žiniomis aiškina, ar matomas modelis yra tikras, ar sutapimas.
Taikymo užduotis
Pasirinkite duomenų rinkinį ir tiesiog atlikite EDA: ištraukite bent trijų skaitinių kintamųjų histogramą, dviejų kintamųjų porų sklaidos diagramą ir koreliacijos šilumos žemėlapį. Raskite bent vieną „staigmeną“ (pvz., pasiskirstymą su dviem smailėmis, netikros koreliacijos kandidatą, ryšį, kurį traukia vienas išskirtinis skirtumas) ir paaiškinkite jį vienu sakiniu. Rašykite nereikšdami jokių priežastinių teiginių.
kontrolinis sąrašas
- [ ] Ar nubraižiau kiekvieno skaitmeninio kintamojo pasiskirstymą?
- [ ] Ar pažiūrėjau koreliacijas su sklaidos diagrama?
- [ ] Ar atskyriau priežastinį ryšį ir koreliaciją?
- [ ] Ar nepastebėjau iškreiptų ar dviejų smailių pasiskirstymo ir aklai nepasitikėjau vidurkiu?
- [ ] Ar iš savo EDA išvadų išvedžiau bent vieną modeliavimo aspektą / hipotezę?