Njësia 3 / 11

Pastrimi dhe përpunimi i të dhënave: Mungon vlera, vlera e jashtme dhe konvertimi i tipit

Fitimet:

  • Aftësia për të dalluar shkakun e vlerave të munguara (të rastësishme, sistematike, domethënëse) dhe për të zgjedhur strategjinë e duhur dhe për të llogaritur vlerën e plotësimit vetëm nga trajnimi
  • Aftësia për të ekzaminuar të dhënat e jashtme përpara fshirjes së tyre dhe për të dalluar një gabim të dhënash dhe një ngjarje të vërtetë të rrallë
  • Aftësia për të parandaluar humbjen e heshtur duke monitoruar ndikimin e çdo hapi në numrin e rreshtave/boshllëqeve duke sjellë mospërputhje të tipit dhe formatit me standardin

Përafërsisht 60-80 për qind e kohës së një shkencëtari të të dhënave shkon për pastrim; Në industri, kjo quhet me gjysmë shaka "marrëveshja e të dhënave" (përplasja e të dhënave ose pastrimi i të dhënave). Sepse të dhënat e botës reale pothuajse nuk bëhen kurrë gati për analizë: datat janë në formate të përziera, numrat ruhen si tekst, disa qeliza janë bosh, një klient shfaqet tre herë në të njëjtën tabelë me dy drejtshkrime të ndryshme. Në këtë njësi do të mbulojmë tre aspekte themelore të pastrimit: vlerat që mungojnë, vlerat e jashtme dhe konvertimi i llojit/formatit. Inteligjenca artificiale është një asistent jashtëzakonisht i shpejtë në këtë punë; Por jeni ju që vendosni se çfarë të pastroni dhe si, sepse çdo zgjedhje pastrimi ndryshon analizën.

Rregulli i artë i pastrimit: çdo ndryshim është një vendim

Fshirja e një qelize, plotësimi i një vlere që mungon me mesataren, zvogëlimi i një pjese të jashtme - asnjë nga këto nuk janë operacione "neutrale". Secili ndryshon të dhënat dhe ndikon në rezultatin. Pra, rregulli i artë i pastrimit: shkruani çdo ndryshim në kod, vini re arsyetimin, kurrë mos i mbishkruani të dhënat origjinale. AI ju jep kodin e shpejtë të pastrimit, por është përgjegjësia juaj të kuptoni se çfarë bën ai kod; Mos e ekzekutoni pa parë se sa rreshta janë zhdukur kur thoni "fshini linjat boshe".

Kujdes: Asnjëherë mos i modifikoni të dhënat e papërpunuara origjinale. Shkruani versionin e pastruar në një skedar/tabela të veçantë. Në këtë mënyrë, nëse vëreni një gabim, mund të ktheheni në shesh dhe të ruani riprodhueshmërinë.

Vlerat që mungojnë: pse është bosh, çfarë të bëni

Një vlerë që mungon (zakonisht shfaqet si NaN - "Jo një numër" te pandat) është kur një qelizë është bosh. Por shkaku i hendekut përcakton zgjidhjen. Janë tre situata tipike. Mungon rastësisht: sensori nuk funksionoi për asnjë moment; Mund të jetë e arsyeshme ta plotësoni. Mungon sistematikisht: një fushë formulari kërkohet vetëm për klientë të caktuar; Hendeku këtu është në fakt informacioni. Mungon domethënës: nëse "data e kthimit" është bosh, klienti nuk është kthyer; Kjo hapësirë ​​do të thotë 0 ose "asnjë", nuk është e mbushur.

Strategjitë kryesore:

Strategjia

Kur është e përshtatshme?

rreziku

Fshi rreshtin

Shkalla e mungesës është shumë e ulët (<5%) dhe e rastësishme

Humbja e të dhënave dhe përfaqësimit

Fshi një kolonë

Shumica e kolonës është bosh (>60%)

humbja e informacionit

Mbushje mesatare/mesatare

Numerike, mungon rastësisht

Redukton variancën dhe shtrembëron shpërndarjen

Kategoria "e panjohur"

Mungon kategorik, sistematik

Gjeneron kategori shtesë

Parashikimi me model

Kolona komplekse, e çmuar

Rreziku i rrjedhjes, kompleksiteti

Pika kritike: vlera e imputimit duhet të llogaritet vetëm nga të dhënat e trajnimit dhe e njëjta vlerë duhet të zbatohet për të dhënat e testit. Nëse përfshini mesataren e të dhënave të testimit, krijoni rrjedhje (Njësia 10). Mesatarja (vlera e mesme e të dhënave rendore) shpesh preferohet ndaj mesatares, sepse është më e qëndrueshme ndaj vlerave të jashtme sesa mesatarja.

Dallimet: gabim apo real?

Një ndryshim mund të jetë një nga dy gjërat: një gabim i të dhënave (999 në kolonën e moshës) ose një ngjarje reale, por e rrallë (porosi prej 2 milion dollarësh i një klienti). Ngatërrimi i të dyjave është katastrofik: fshini një informacion të jashtëzakonshëm të vërtetë dhe hidhni informacione të rëndësishme; Nëse hiqni dorë nga një gabim, mesatarja juaj do të vuajë. Prandaj, është e nevojshme që së pari të ekzaminohet pjesa e jashtme, jo të fshihet automatikisht.

Metodat e zakonshme të zbulimit: Metoda IQR (vargu ndërkuartil; vlerat që janë më shumë se 1,5 herë diferenca midis kuintileve 25% dhe 75% të të dhënave konsiderohen si të jashtme) dhe z-rezultati (numri i devijimeve standarde larg nga mesatarja e një vlere; zakonisht një i jashtëm nëse është më i madh se 3). AI shkruan kodin për këto llogaritje në sekonda; Por përpara se të thoni "fshini", kontrolloni se cilat janë ato vlera.

Konvertimi i llojit dhe formatit: burim gabimi i heshtur

Një nga dhimbjet më të mëdha të kokës është konfuzioni i llojit të të dhënave. Nëse një kolonë "shuma" ruhet si tekst, nuk mund të shtoni; Programi lexon gabimisht një numër të formatuar turk si "1250.50" në vend të "një mijë e dyqind e pesëdhjetë". Datat ("01/03/2024" ditë-muaj apo muaj-ditë?), kategoritë ("Mashkull"/"mashkull"/"M" janë e njëjta gjë?) dhe njësitë (TL apo kuruş?) prodhojnë në heshtje rezultate të pasakta. Një pjesë e madhe e pastrimit është tërheqja e këtyre mospërputhjeve në standard: datat në një format, kategoritë në një drejtshkrim, numrat në një njësi.

tre mini kuti

Rasti 1 - Kurthi mesatar. Një ekip plotësoi 320 vlerat që mungojnë në kolonën e të ardhurave me mesataren (48,500 dollarë). Por mangësitë ishin sistematike: këta ishin segmenti me të ardhura të ulëta që nuk kishin deklaruar kurrë të ardhura. Mbushja mesatare e bëri këtë grup të pasur artificialisht dhe modeli i kredisë ishte i gabuar. Mësimi: pyesni "pse është bosh" përpara se ta plotësoni.

Rasti 2 - Pjesa e jashtme që nuk duhet të fshihet. Një analist me pakicë fshiu 4 porosi të mëdha (1.8 milionë TL secila) në të dhënat e shitjeve, duke menduar se ishin "gabime". Megjithatë, këto ishin porosi të vërteta korporative dhe përbënin 22% të xhiros totale. Modeli i parashikimit pas fshirjes e humbi plotësisht kërkesën institucionale. Mësimi: shqyrtoni pjesën e jashtme përpara se ta fshini atë.

Rasti 3 - Fatkeqësi e formatit të datës. Në një CSV, datat u përzien si në "2024-03-01" dhe "01.03.2024". Kur kodi i shkruar nga YZ u analizua sipas formatit të parë, 6,400 rreshta u bënë NaT si "datë e pavlefshme" dhe u përjashtuan në heshtje nga analiza. Analisti e vuri re këtë vetëm kur numri i linjave u ul. Mësimi: kontrolloni gjithmonë numrin e rreshtave dhe boshllëqeve pas konvertimit.

Katër shabllone të kopjueshëm

1) Harta e vlerës që mungon:

Unë kam panda df. Shkruani kodin që prodhon një tabelë që tregon numrin dhe përqindjen e mungesës (NaN) për secilën kolonë. Më pas, listoni veçmas kolonat me një përqindje të mungesës që tejkalon 40% dhe ato me një përqindje të mungesës nën 5%. Thjesht gjeneroni këtë kod diagnostikimi, jo atë strategji që sugjeroni; Unë do ta marr vendimin.

2) Inspektimi i jashtëm (jo fshirje):

Shkruani kodin që Zbulon (nuk fshin!) të dhënat e jashtme për kolonën time "shuma" duke përdorur metodën IQR. Vendosni rreshtat periferikë në një df të veçantë në mënyrë që t'i shqyrtoj ato manualisht. Shtypni gjithashtu numrin e pikave të jashtme dhe pjesën e tyre në total.

3) Standardizimi i llojit/formatit:

Shkruani kodin që standardizon kolonat e mëposhtme: - "data": mund të jenë formate të përziera ("2024-03-01" dhe "01.03.2024"); konvertojini të gjitha në orën e datës, numëroni ato të papërkthyeshmet dhe raportoni (hidhini në heshtje). - "gjinia": "Mashkull"/"mashkull"/"M" -> "M", "Femër"/"femër"/"F" -> "K". - "shuma": tekst i formatuar turk ("1.250,50") -> numër dhjetor. Printoni sa rreshta preken pas çdo konvertimi.

4) Kontrolloni para/pas pastrimit:

Shkruani kodin që krahason df.shape, numërimin e munguar dhe statistikat përmbledhëse (mesatarja, mesatare, min, maksimumi) të kolonave të zgjedhura përpara dhe pas një hapi pastrimi. Qëllimi: për të parë se çfarë ndryshon pastrimi.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Pastro këto të dhëna.

"E qartë" është e paqartë; AI nuk e di se cilat pjesë që mungojnë duhet të fshihen, çfarë të plotësojë, cilën kolonë të përpunojë dhe si. Rezultati: ndryshime të verbëra, të pakthyeshme.

Njoftim i fuqishëm:

Roli juaj: asistent për pastrimin e të dhënave. Kolonat df: id-i i klientit (int), data_regjistrimi (teksti i formatit të përzier), të ardhurat_tl (teksti, "1200,00"), qyteti (teksti, drejtshkrimi jo konsistent). Rregullat:- Ndryshimi origjinal df; Punoni në kopjen e quajtur df_clean.- Konvertoni të ardhurat_tl në numër, numëroni ato që nuk mund të përkthehen.- Ndryshoni datën e regjistrimit në datën e datës, raportoni gabimin.- Mos fshini asnjë rresht pa miratimin tim; Tregojini kandidatët veç e veç. Pas çdo hapi, printoni df_temiz.shape dhe numrin që mungon.

Këtu burimi mbrohet, çdo transformim numërohet, fshirja i lihet njeriut.

Gabimet e zakonshme

  • Plotësimi i boshllëqeve pa pyetur "pse është bosh?" Plotësimi i mungesës sistematike/të rëndësishme me mesataren shtrembëron të dhënat.
  • Fshirja e pjesës së jashtme pa e shqyrtuar atë. Hedhja e ngjarjeve reale por të rralla shkatërron informacione të rëndësishme.
  • Llogaritja e vlerës së mbushjes nga të gjitha të dhënat. Përfshirja e të dhënave të testit krijon rrjedhje; thjesht llogarisni nga trajnimi.
  • Mos kontrollimi i numrit të rreshtave/boshllëqeve pas konvertimit. Rreshtat që janë në heshtje NaT/NaN përjashtohen nga analiza.
  • Mbishkrimi i të dhënave origjinale. Kthimi dhe riprodhueshmëria humbasin.
Këshillë: Kryeni pastrimin me një krahasim "para-pas". Shtypni df.shape, numërimin e munguar dhe statistikat përmbledhëse të kolonave kritike pas çdo hapi. Kështu që ju menjëherë shihni se një hap shkatërron papritur 6000 rreshta.

Në përmbledhje

Pastrimi është faza më kohë dhe vendimmarrëse e shkencës së të dhënave. Çdo ndryshim ndryshon të dhënat, kështu që secili është një vendim i ndërgjegjshëm. Për vlerat që mungojnë, pyesni "pse është bosh?" Rishikoni të gjitha pikat e jashtme përpara se t'i fshini ato; Sillni tipin dhe formatin në standard. Llogaritni vlerën e mbushjes vetëm nga të dhënat e trajnimit, mbani origjinalin dhe gjurmoni ndikimin e secilit hap duke e numëruar atë. Inteligjenca artificiale është një përshpejtues i jashtëzakonshëm në këtë biznes, por njerëzit vendosin se çfarë pastroni dhe pse.

Detyra e aplikimit

Merrni (ose krijoni) një tabelë të vogël dhe futni qëllimisht tre probleme në të: një tufë vlere që mungon, një vlerë e jashtme, një format i përzier datash. Kërkoni kodin e diagnozës dhe standardizimit nga AI me shabllonet e mësipërme; krahasoni numrin e rreshtave dhe boshllëqeve para/pas çdo hapi. Mundohuni të kapni të paktën një "humbje të heshtur" dhe vini re se si e keni vënë re atë.

listë kontrolli

  • [ ] A i kam mbajtur të dhënat origjinale të papërpunuara dhe kam punuar në kopje?
  • [ ] A e kam bërë pyetjen "pse është bosh" për secilën kolonë që mungon?
  • [ ] A i kam shqyrtuar vlerat e jashtme përpara se t'i fshij?
  • [ ] A e kam llogaritur vlerën e mbushjes vetëm nga të dhënat e trajnimit?
  • [ ] A po kontrolloj numrin e rreshtave/boshllëqeve pas çdo hapi dhe po eleminoj humbjen e heshtur?