Qazanclar:
- Çatışmayan dəyərlərin səbəbini (təsadüfi, sistematik, mənalı) ayırd etmək və uyğun strategiya seçmək və tək təlimdən doldurma dəyərini hesablamaq bacarığı
- Silinməzdən əvvəl kənar göstəriciləri yoxlamaq və məlumat xətası ilə əsl nadir hadisəni ayırd etmək bacarığı
- Tip və format uyğunsuzluqlarını standarta çatdırarkən hər bir addımın sətirlərin/boşluqların sayına təsirini izləməklə səssiz itkilərin qarşısını almaq imkanı
Məlumat aliminin vaxtının təxminən 60-80 faizi təmizləməyə gedir; Sənayedə buna yarı zarafatla "məlumat mübahisəsi" (məlumat mübahisəsi və ya məlumatların təmizlənməsi) deyilir. Çünki real dünya məlumatları demək olar ki, heç vaxt təhlil üçün hazır olmur: tarixlər qarışıq formatlardadır, nömrələr mətn kimi saxlanılır, bəzi xanalar boşdur, müştəri eyni cədvəldə iki fərqli yazı ilə üç dəfə görünür. Bu bölmədə biz təmizləmənin üç əsas aspektini əhatə edəcəyik: çatışmayan dəyərlər, kənar göstəricilər və tip/format çevrilməsi. Süni intellekt bu işdə qeyri-adi sürətli köməkçidir; Ancaq nəyi və necə təmizləməyinizə qərar verən sizsiniz, çünki hər təmizləmə seçimi analizi dəyişir.
Təmizliyin qızıl qaydası: hər dəyişiklik bir qərardır
Hüceyrənin silinməsi, çatışmayan dəyərin orta ilə doldurulması, kənar göstəricinin kəsilməsi – bunların heç biri “neytral” əməliyyatlar deyil. Hər biri məlumatları dəyişir və nəticəyə təsir göstərir. Beləliklə, təmizləmənin qızıl qaydası: koda hər dəyişikliyi yazın, əsaslandırmanı qeyd edin, əsla məlumatın üzərinə heç vaxt yazmayın. AI sizə sürətli təmizləmə kodu verir, lakin bu kodun nə etdiyini anlamaq sizin məsuliyyətinizdir; "Boş sətirləri sil" deyəndə neçə sətir getdiyini görmədən onu işə salmayın.
Diqqət: Heç vaxt orijinal xam məlumatları dəyişdirməyin. Təmizlənmiş versiyanı ayrı bir fayla/cədvələ yazın. Bu yolla, bir səhv aşkar etsəniz, birinci kvadrata qayıda və təkrarlanma qabiliyyətini qoruya bilərsiniz.
Çatışmayan dəyərlər: niyə boşdur, nə etməli
Çatışmayan dəyər (adətən pandalarda NaN — “Nömrə deyil” kimi görünür) xana boş olduqdadır. Ancaq boşluğun səbəbi həllini müəyyən edir. Üç tipik vəziyyət var. Təsadüfi itkin: sensor bir an işləmədi; Onu doldurmaq məqsədəuyğun ola bilər. Sistematik çatışmazlıq: forma sahəsi yalnız müəyyən müştərilər üçün tələb olunur; Buradakı boşluq əslində məlumatdır. Əhəmiyyətli çatışmazlıq: "qaytarma tarixi" boşdursa, müştəri geri qayıtmadı; Bu boşluq 0 və ya "heç biri" deməkdir, doldurulmur.
Əsas strategiyalar:
Strategiya
Nə vaxt uyğundur?
risk
Sıranı silin
Çatışmayan nisbət çox aşağıdır (<5%) və təsadüfi
Məlumatların və təmsilçiliyin itirilməsi
Sütunu silin
Sütunun çox hissəsi boşdur (>60%)
məlumat itkisi
Orta/median doldurma
Rəqəm, təsadüfi itkin
Dəyişməni azaldır və paylanmanı təhrif edir
"Naməlum" kateqoriyası
Kateqorik, sistematik itkin
Əlavə kateqoriyalar yaradır
Model ilə proqnoz
Mürəkkəb, qiymətli sütun
Sızma riski, mürəkkəblik
Kritik nöqtə: hesablama dəyəri yalnız təlim məlumatlarından hesablanmalı və eyni dəyər test məlumatlarına tətbiq edilməlidir. Test məlumatlarının ortasını daxil etsəniz, sızma yaradırsınız (Vahid 10). Median (ordinal verilənlərin orta qiyməti) çox vaxt ortadan üstündür, çünki o, ortadan kənar göstəricilərə qarşı daha möhkəmdir.
Fərqlər: səhv və ya real?
Fərq iki şeydən biri ola bilər: məlumat xətası (yaş sütununda 999) və ya real, lakin nadir hadisə (müştərinin 2 milyon dollarlıq sifarişi). İkisini qarışdırmaq fəlakətlidir: əsl kənar göstəricini silin və vacib məlumatları atırsınız; Bir səhvi buraxsanız, orta göstəriciləriniz zərər görəcək. Ona görə də ilk növbədə kənarı yoxlamaq lazımdır, onu avtomatik silmək yox.
Ümumi aşkarlama üsulları: IQR metodu (kvartallararası diapazon; məlumatların 25% və 75% kvintilləri arasındakı fərqdən 1,5 dəfə çox olan qiymətlər kənar hesab olunur) və z-balı (dəyərin orta dəyərdən uzaqlaşan standart sapmaların sayı; adətən 3-dən çox olarsa, kənar göstərici). AI bu hesablamalar üçün kodu saniyələr ərzində yazır; Ancaq "sil" deməzdən əvvəl bu dəyərlərin nə olduğunu yoxlayın.
Növ və format çevrilməsi: səssiz səhv mənbəyi
Ən çox baş ağrılarından biri məlumat tipində qarışıqlıqdır. Əgər "məbləğ" sütunu mətn kimi saxlanılırsa, siz əlavə edə bilməzsiniz; Proqramda “min iki yüz əlli” əvəzinə “1250,50” kimi türkcə formatlı rəqəm səhv oxunur. Tarixlər ("01/03/2024" gün-ay və ya ay-gün?), kateqoriyalar ("Kişi"/"kişi"/"M" eyni şeydir?) və vahidlər (TL və ya kuruş?) səssizcə səhv nəticələr verir. Təmizləmənin böyük bir hissəsi bu uyğunsuzluqları standarta çəkməkdir: tarixləri bir formata, kateqoriyaları bir imlaya, nömrələri bir vahidə.
üç mini qutu
Məsələn 1 - Orta tələ. Komanda gəlir sütununda 320 çatışmayan dəyəri orta hesabla (48,500 dollar) doldurdu. Lakin çatışmazlıqlar sistematik idi: bunlar heç vaxt gəlirlərini bəyan etməyən aşağı gəlirli təbəqə idi. Orta doldurma bu qrupu süni zənginləşdirdi və kredit modeli yanlış idi. Dərs: doldurmazdan əvvəl “niyə boşdur” sualını verin.
2-ci hal - Silinməməli olan kənar göstərici. Pərakəndə analitik satış məlumatlarında 4 nəhəng sifarişi (hər biri 1,8 milyon TL) "səhv" olduğunu düşünərək silib. Halbuki bunlar real korporativ sifarişlər idi və ümumi dövriyyənin 22%-ni təşkil edirdi. Silindikdən sonra proqnoz modeli institusional tələbi tamamilə əldən verdi. Dərs: silməzdən əvvəl kənar göstəricini yoxlayın.
Case 3 - Tarix formatı fəlakəti. CSV-də tarixlər həm "2024-03-01", həm də "01.03.2024" olaraq qarışdırılıb. YZ tərəfindən yazılan kod birinci formata uyğun təhlil edildikdə, 6400 sətir "etibarsız tarix" kimi NaT oldu və səssizcə təhlildən çıxarıldı. Analitik bunu yalnız sətirlərin sayı azaldıqda fərq etdi. Dərs: konvertasiyadan sonra həmişə sətirlərin və boşluqların sayını yoxlayın.
Dörd kopyalana bilən şablon
1) Çatışmayan dəyər xəritəsi:
Məndə pandalar df var. Hər sütun üçün çatışmayanların sayını və faizini (NaN) göstərən cədvəl yaradan kodu yazın. Sonra, 40%-dən çox çatışmayan və 5%-dən az olan sütunları ayrıca sadalayın. Təklif etdiyiniz strategiya deyil, sadəcə bu diaqnoz kodunu yaradın; Mən qərar verəcəm.
2) Kənar yoxlama (silinməməsi):
IQR metodundan istifadə edərək, mənim "məbləğ" sütunum üçün xaric olanları DETECEK (silmək deyil!) kodunu yazın. Kənar cərgələri ayrı bir df-yə qoyun ki, onları əl ilə yoxlaya bilim. Həm də kənar göstəricilərin sayını və onların cəmində payını çap edin.
3) Tip/format standartlaşdırması:
Aşağıdakı sütunları standartlaşdıran kodu yazın:- "tarix": qarışıq formatlar ola bilər ("2024-03-01" və "01.03.2024"); hamısını tarixə çevirin, tərcümə olunmayanları sayın və hesabat verin (səssizcə atın). - "cins": "Kişi"/"kişi"/"M" -> "M", "Qadın"/"qadın"/"F" -> "K". - "miqdar": türk formatlı mətn ("1.250,50") -> onluq ədəd. Hər dönüşümdən sonra neçə sətirin təsirləndiyini çap edin.
4) Təmizləmədən əvvəl/sonra yoxlayın:
Təmizləmə addımından əvvəl və sonra seçilmiş sütunların df.shape, çatışmayan sayı və xülasə statistikasını (orta, median, min, maks) müqayisə edən kod yazın. Məqsəd: təmizləmənin nə dəyişdiyini görmək.
Zəif məlumat / Güclü göstəriş
Zəif çağırış:
Bu məlumatları təmizləyin.
"Aydın" birmənalı deyil; Süni intellekt hansı çatışmayan hissələrin silinməli olduğunu, nəyi dolduracağını, hansı sütunu və necə emal edəcəyini bilmir. Nəticə: kor, geri dönməz dəyişikliklər.
Güclü göstəriş:
Rolunuz: məlumatların təmizlənməsi üzrə köməkçi. df sütunları: customer_id (int), qeydiyyat_tarixi (qarışıq formatlı mətn), revenue_tl (mətn, "1,200.00"), şəhər (mətn, uyğun olmayan yazım). Qaydalar:- Orijinal df-nin dəyişdirilməsi; df_clean adlı nüsxə üzərində işləyin.- Gəlir_tl-i nömrəyə çevirin, tərcümə oluna bilməyənləri sayın.- Record_date-i datetime olaraq dəyişdirin, xətanı bildirin.- Mənim təsdiqim olmadan heç bir sətir silməyin; Namizədləri ayrıca göstərin. Hər addımdan sonra df_temiz.shape və çatışmayan nömrəni çap edin.
Burada mənbə qorunur, hər çevrilmə hesablanır, silinmə insana qalır.
Ümumi səhvlər
- “Niyə boşdur?” sualını vermədən boşluqları doldurmaq. Sistematik/əhəmiyyətli çatışmazlıqların orta ilə doldurulması məlumatları təhrif edir.
- Tədqiq etmədən kənar göstəricinin silinməsi. Həqiqi, lakin nadir hadisələrdən imtina etmək vacib məlumatları məhv edir.
- Bütün məlumatlardan doldurma dəyərinin hesablanması. Test məlumatlarının daxil edilməsi sızma yaradır; sadəcə məşqdən hesablayın.
- Dönüşümdən sonra sətirlərin/boşluqların sayı yoxlanılmır. Səssiz NaT/NaN olan sətirlər təhlildən çıxarılır.
- Orijinal məlumatların üzərinə yazmaq. Qayıdış və təkrar istehsal qabiliyyəti itir.
İpucu: Təmizləməni "əvvəl-sonra" müqayisəsi ilə aparın. Hər addımdan sonra kritik sütunların df.shape, əskik sayı və xülasə statistikasını çap edin. Beləliklə, bir addımın gözlənilmədən 6000 sıranı məhv etdiyini dərhal görürsən.
Xülasə
Təmizləmə məlumat elminin ən çox vaxt aparan və qərar tələb edən mərhələsidir. Hər dəyişiklik məlumatları dəyişir, buna görə də hər biri şüurlu bir qərardır. Çatışmayan dəyərlər üçün "niyə boşdur?" Hər hansı kənar göstəriciləri silməzdən əvvəl nəzərdən keçirin; Növ və formatı standarta gətirin. Doldurma dəyərini yalnız təlim məlumatlarından hesablayın, orijinalı saxlayın və hər bir addımın təsirini hesablamaqla izləyin. Süni intellekt bu işdə böyük sürətləndiricidir, lakin nəyi və niyə təmizlədiyinizə insanlar qərar verir.
Tətbiq tapşırığı
Kiçik bir cədvəl götürün (və ya yaradın) və ona qəsdən üç problem daxil edin: çatışmayan dəyər dəsti, kənar göstərici, qarışıq tarix formatı. Yuxarıdakı şablonlarla AI-dən diaqnostika və standartlaşdırma kodunu tələb edin; hər addımdan əvvəl/sonra sətirlərin və boşluqların sayını müqayisə edin. Ən azı bir "səssiz itki" tutmağa çalışın və bunu necə hiss etdiyinizi qeyd edin.
yoxlama siyahısı
- [ ] Mən orijinal xam məlumatı saxladım və surəti üzərində işlədim?
- [ ] Hər bir çatışmayan sütun üçün "niyə boşdur" sualını vermişəm?
- [ ] Mən kənar göstəriciləri silməzdən əvvəl nəzərdən keçirdimmi?
- [ ] Mən doldurma dəyərini yalnız təlim məlumatından hesabladımmı?
- [ ] Mən hər addımdan sonra sətirlərin/boşluqların sayını yoxlayıram və səssiz itkini aradan qaldırıram?