Fitimet:
- Aftësia për të njohur llojet e të dhënave që mungojnë (MCAR/MAR/MNAR), të dhënat e jashtme dhe gabimet e kodimit dhe për të përdorur AI me të dhënat e sakta për të prodhuar kodin e pastrimit dhe diagnostikimin
- Aftësia për të parë se si çdo hap i pastrimit (fshirje, caktim, transformim) i sugjeruar nga inteligjenca artificiale do të ndikojë në rezultatin e analizës dhe do të krijojë një rrjedhë pune të kthyeshme dhe të dokumentuar
- Mbajtja që vendimet e pastrimit bazohen në njohuritë e procesit që gjeneron të dhëna dhe se inteligjenca artificiale është një asistent i mbikëqyrur, jo një automat i verbër
Çdo analist me përvojë e di një të vërtetë: shumicën e kohës së një projekti empirik nuk është modelimi, por pastrimi i të dhënave (puna e korrigjimit të gabimeve, lëshimeve dhe mospërputhjeve në të dhëna dhe përgatitja e tyre për analizë). Si rregull i përafërt, rreth 70-80% e kohës kalon në kuptimin, pastrimin dhe transformimin e të dhënave; vetëm 20-30% ka mbetur për analizën aktuale. Në këtë njësi, do të shohim hap pas hapi se si inteligjenca artificiale (AI) e lehtëson këtë barrë të rëndë, por cilat vendime duhet të mbeten ende me ju dhe pse.
Le të vendosim së pari dy fakte themelore. Së pari, vendimet e pastrimit bazohen në njohuritë tuaja për procesin që prodhon të dhënat: vetëm ju e dini pse mungon një vlerë, pse një numër është tepër i madh. AI nuk i sheh të dhënat, nuk e njeh kontekstin; Shkruan kode, nuk merr vendime. Së dyti, çdo hap pastrimi mund të ndryshojë rezultatin e analizës. Fshirja e një treguesi të jashtëm mund të përmbysë koeficientin; Plotësimi i mungesës me mesataren mund të zvogëlojë artificialisht variancën. Pra, pastrimi duhet të jetë i kthyeshëm dhe i dokumentuar: mos prekni kurrë të dhënat e papërpunuara, bëni çdo hap në kod, regjistroni ndikimin e secilit hap.
Rrjedha e punës e pastrimit hap pas hapi
1. Njihni të dhënat. Fillimisht shikoni strukturën: numrin e rreshtave (vëzhgimeve) dhe kolonave (variablave), llojin e secilës variabël (numerike, kategorike, datë), statistikat përmbledhëse, numrin e atyre që mungojnë. Ju mund të kërkoni nga AI për këtë kod "profili të të dhënave"; Por ju lexoni rezultatin dhe bëni pyetje si "pse kjo ndryshore erdhi si tekst?"
2. Kuptoni dhe klasifikoni të dhënat që mungojnë. Të dhënat që mungojnë ndahen në tre lloje. MCAR (Mungon plotësisht në rastësi): mungesa nuk është për shkak të asgjëje, për shembull një sensor dështoi rastësisht. MAR (Mungon në rastësi): mungesa varet nga variabla të tjerë të vëzhguar, për shembull, të moshuarit lënë një pyetje bosh më shpesh, por ju e dini moshën. MNAR (Mungon Jo Rastësisht): mungesa varet nga vetë vlera e pavëzhguar, për shembull personat me fitime të larta nuk i raportojnë të ardhurat e tyre. Ky dallim është kritik sepse përcakton metodën e zgjidhjes dhe AI nuk mund ta vendosë këtë për ju.
3. Merreni me mangësinë. Opsionet: fshirje në listë, imputim mesatar/median, imputim i shumëfishtë i bazuar në model. Fshirja në MCAR është relativisht e sigurt, por zvogëlon madhësinë e mostrës. Detyra e shumëfishtë është më e përshtatshme në MAR. Asnjë metodë e thjeshtë nuk garanton paanshmëri në MNAR; Duhet të modelohet mekanizmi i mungesës ose të paktën të kryhet një analizë e ndjeshmërisë. Mbushja e mesatares është e lehtë por e rrezikshme: zvogëlon variancën, dobëson marrëdhëniet dhe fsheh pasigurinë.
4. Ekzaminoni pikat e jashtme. Një vështrim i jashtëm është një vëzhgim që qëndron shumë larg nga të tjerët. Ndani dy pyetjet: A është ky një gabim (mosha 999 është shkruar në hyrjen e të dhënave) apo është një vlerë reale, por e jashtme (të ardhura të një miliarderi)? Rregullimi i gabimeve; Mos i fshini të dhënat e vërteta, sepse ato përfaqësojnë të dhëna. Fshirja e pjesës së jashtme "sepse shqetëson" po i anon të dhënat drejt rezultatit.
5. Kodimi dhe konsistenca. Standardizoni kategoritë ("Mashkull", "mashkull", "E" të gjitha në një kod), sillni datat në një format, njësitë në një shkallë, zbuloni rreshtat e dyfishta. Kjo është faza më pak e rrezikshme ku AI ndihmon më së miri.
6. Dokumentoni dhe ngrini. Regjistroni çdo hap me kod dhe një linjë komenti, duke i mbajtur të ndara të dhënat e papërpunuara dhe të pastruara. Pra, kur një arbitër pyet "pse u hodhën poshtë këto vëzhgime?" e keni gati pergjigjen.
Kujdes: Mos merrni vendime pastrimi bazuar në rezultatet. Fshirja e një rreshti që thotë "Kur fshini këtë rresht, koeficienti bëhet i rëndësishëm" është forma më tinëzare e hakimit të p, të cilën do ta shohim në njësinë tjetër.
Tabela e krahasimit: metodat e të dhënave që mungojnë
Metoda
Kur është e përshtatshme?
rreziku
Roli i AI
Fshi një rresht
MCAR, përqindje e ulët e mungesës
Mostra bëhet më e vogël, paragjykim në MAR/MNAR
Shkruan kodin; ju vendosni
Detyra mesatare/mediane
Analiza e shpejtë paraprake
Redukton variancën, fsheh marrëdhënien
Është e lehtë por nuk e rekomandon; duhet të paralajmërojë
Detyra e shumëfishtë (MI)
MAR, variabla të rëndësishëm
Nëse nuk instalohet siç duhet, do të jetë mashtruese
Rekomandon kodin dhe paketën (minj)
Modelimi i mekanizmit
MNAR
Kompleks, me supozime intensive
vetëm draft; kërkohet ekspert
Katër kërkesa të kopjueshme
1. Profilizimi i të dhënave:
Roli juaj: asistent për pastrimin e të dhënave. Unë nuk i ndaj të dhënat, dua kodin R. Unë kam një kornizë të dhënash të quajtur 'shifror'; variablat: id, mosha (numerike), të ardhurat (numerike), arsimi (kategorike), rajoni (kategorike), data (data). Detyrë: shkruani kodin që prodhon llojin, numrin që mungon dhe normën për secilën variabël, statistikat përmbledhëse për ato numerike dhe tabelën e frekuencës për ato kategorike. Shto rreshtin e komenteve.
2. Diagnoza e të dhënave që mungojnë:
Shkruani kodin që shqyrton modelin e munguar për të dhënat 'shifrore' më sipër: - normën e munguar të secilës variabël, - një tabelë/grafikë të thjeshtë që tregon lidhjen e mungesës me variablat e tjerë. Unë do të shikoj daljen e kodit dhe do të bëj dallimin MCAR/MAR/MNAR; Ju vetëm prodhoni mjetin diagnostikues, MOS vendosni për metodën e caktimit.
3. Inspektimi i jashtëm (jo fshirje):
Shkruani kodin për variablin 'të ardhura' që shqyrton vlerat e jashtme PA FSHIRI: kutitë, kufijtë e bazuar në IQR dhe tabelat që renditin vëzhgimet e jashtme + vlerat. Do të shoh nëse këto janë gabime apo të vërteta. Shto fshirje automatike.
4. Standardizimi i kodimit:
Në variablin 'arsim', vlerat shkruhen të përziera: "Shkollë fillore", "shkollë fillore", "FILLORE", "Shkollë e mesme", "shkollë e mesme", "Universitet", "univ". Shkruani kodin R që i rikodon këto në kategori të qëndrueshme; Trego qartë tabelën e hartës që të mund të konfirmoj çdo konvertim. Cakto vlerën që nuk e njeh në "PANJOHUR".
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
Pastroni të dhënat, plotësoni boshllëqet, hidhni të dhënat e jashtme.
Kjo kërkesë është e rrezikshme: i jep autoritet të verbër AI. Çfarë lloji i munguar, çfarë lloj mbushjeje, çfarë e vërtete kontradiktore - asgjë nuk është e qartë. Rezultati mund të jetë një grup i njëanshëm i fshehtë i të dhënave.
Njoftim i fuqishëm:
Roli juaj: asistent pastrimi, nuk jeni ju vendimmarrësi. Shkoni hap pas hapi dhe shkruani kodin që raporton ndikimin e çdo hapi: 1) tregoni modelin që mungon (MOS fshini/plotësoni), 2) listoni kandidatët e jashtëm (MOS fshini), 3) rregulloni mospërputhjet e kategorive me tabelën e hartës. Shtypni numrin e rreshtave dhe statistikat përmbledhëse pas çdo hapi në mënyrë që të shoh dhe konfirmoj ndryshimin. Futja automatike e caktimit/fshirjes.
Dallimi është i qartë: vullneti i fortë e pozicionon AI si një asistent të mbikëqyrur, duke prodhuar hapa të kthyeshëm dhe të dokumentuar.
tre mini kuti
Rasti 1 — Kurthi mesatar i caktimit. Të dhënat e të ardhurave të një analisti për 5000 persona mungonin 18%. Ai i tha AI të "plotësojë boshllëqet"; AI i mesatarizoi të gjitha. Rezultati: varianca e të ardhurave u ul me 22%, dhe koeficienti i marrëdhënies arsim-të ardhura doli të ishte më i dobët se sa ishte. Mënyra e saktë: mangësia ishte MAR (për shkak të edukimit), duhej plotësuar me disa detyra (minj). Mësimi: mënyra e mbushjes varet nga mekanizmi.
Rasti 2 - Pastrimi i jashtëm përmbys gjetjen. Në të dhënat e një firme kishte 3 firma shumë të mëdha (0.6% e totalit të vëzhgimit). Këto u fshinë nga sugjerimi i "pastrimit" të AI; Koeficienti i ekonomisë së shkallës u kthye nga pozitiv në negativ. Megjithatë, ato 3 kompani ishin reale dhe një pjesë e rëndësishme e industrisë. Mënyra e duhur ishte raportimi me një vlerësim të plotë dhe të fuqishëm në vend që të fshihej. Mësimi: të dhënat e vërteta janë të dhëna, jo zhurma.
Rasti 3 - Gabim kodimi i heshtur. Në një panel, ndryshorja e datës erdhi në dy formate të ndryshme ("2020-03-01" dhe "01/03/2020"). Kur kodi i kombinimit i prodhuar nga AI i ngatërroi ato për vlera të ndryshme, 1400 vëzhgime nuk përputheshin dhe ritmet e rritjes u bënë qesharake. Nuk do të kishte rëndësi nëse analisti nuk do të kontrollonte numërimin e rreshtave. Mësimi: numërimi i vëzhgimeve dhe kontrollet e shëndetit pas çdo hapi janë një domosdoshmëri.
Gabimet e zakonshme
- Duke mbushur verbërisht boshllëkun me mesataren. Redukton variancën, fsheh pasigurinë dhe krijon paragjykime në MAR/MNAR. Së pari klasifikoni mekanizmin.
- Fshirja e skajit "sepse shqetëson". Ekzaminimet e vërteta përfaqësojnë të dhënat; fshirja është përkulje e rezultatit. Korrigjo atë që është e gabuar, mbaj atë që është e vërtetë.
- Prekja e të dhënave të papërpunuara. Asnjëherë mos modifikoni të dhënat e papërpunuara; Kryeni të gjithë pastrimin me kodin në një kopje të veçantë në mënyrë që të mund të rikthehet.
- Mos matja e ndikimit të hapave. Nëse numri i rreshtave dhe statistikat përmbledhëse nuk kontrollohen pas çdo hapi, do të grumbullohen gabime të heshtura.
- Pastrimi si rezultat. Logjika e "Kur shtoni këtë rresht, rezultati bëhet më i mirë" është p-hacking; Pastrimi duhet të planifikohet përpara dhe në mënyrë të pavarur nga rezultati i analizës.
Këshillë: Mbani një tabelë "para/pas" që vendos të njëjtat statistika bazë (mesatarja, mesatare, numri i vëzhgimeve, disa korrelacione) krah për krah para dhe pas pastrimit. Një kërcim i papritur është paralajmëruesi më i mirë i një gabimi të fshehur.
Në përmbledhje
Pastrimi i të dhënave është faza më kohë dhe vendimmarrëse e punës empirike. Inteligjenca artificiale është një gjenerues i fuqishëm i kodit për këtë, por nuk mund t'i quajë shkrepjet: ju klasifikoni llojin e të dhënave që mungon (MCAR/MAR/MNAR), përcaktoni nëse pjesa e jashtme është një gabim apo real, mbani çdo hap të kthyeshëm dhe të dokumentuar. Në vend që t'i jepni autoritet "të qartë" të verbërit të AI, krijoni një rrjedhë pune hap pas hapi, ndikimi i të cilit matet dhe vërtetohet. Kontrollimi i numrit të vëzhgimeve dhe statistikave përmbledhëse pas çdo hapi është antidoti më i mirë për gabimet e heshtura.
Detyra e aplikimit
Zgjidhni të paktën dy variabla që përmbajnë mungesë dhe periferike në një grup të dhënash (të dhënat tuaja ose një grup mostër). Kërkoni një kod diagnostikues nga AI përmes kërkesës "hap pas hapi, mos e fshini/mbushni" më lart dhe ekzekutoni atë. Klasifikojeni mangësinë si MCAR/MAR/MNAR dhe shkruani arsyetimin tuaj me një fjali. Shqyrtoni kandidatët kontradiktore një nga një dhe vendosni se cili është një gabim dhe cili është i vërtetë. Së fundi, krijoni një tabelë "para-pas" para/pas pastrimit dhe raportoni nëse ka ndonjë ndryshim të papritur.
listë kontrolli
- [ ] I pastrova të dhënat e papërpunuara në një kopje të veçantë pa i ndryshuar ato.
- [ ] E klasifikova mangësinë si MCAR/MAR/MNAR dhe zgjodha metodën në përputhje me rrethanat.
- [ ] Kam ekzaminuar të jashtzakonshme një nga një nëse ishin gabime apo reale; Nuk e fshiva verbërisht.
- [ ] Kontrollova numrin e vëzhgimeve dhe statistikat përmbledhëse pas çdo hapi pastrimi.
- [ ] Kam dokumentuar të gjitha hapat me kod dhe një linjë komenti; e kthyeshme.
- [ ] Unë e bazova pastrimin në njohuritë e procesit që prodhon të dhënat, jo në rezultatin e analizës.