Vahid 2 / 11

Məlumatların Təmizlənməsi və Hazırlanması: Çatışmayan Məlumatlar, Kənar məlumatlar və Kodlaşdırma

Qazanclar:

  • Çatışmayan məlumat növlərini (MCAR/MAR/MNAR), kənar göstəriciləri və kodlaşdırma səhvlərini tanımaq və təmizləmə kodu və diaqnostika yaratmaq üçün düzgün məlumatlarla AI-dan istifadə etmək bacarığı
  • Süni intellekt tərəfindən təklif olunan hər bir təmizləmə addımının (silmə, təyinat, transformasiya) təhlilin nəticələrinə necə təsir edəcəyini və geri qaytarıla bilən və sənədləşdirilmiş iş axını quracağını görmək bacarığı
  • Təmizləmə qərarlarının məlumat yaradan proses haqqında biliyə əsaslandığını və süni intellektin kor avtomat deyil, nəzarət edilən köməkçi olduğunu saxlamaq

Hər bir təcrübəli analitik bir həqiqəti bilir: empirik layihənin vaxtının çox hissəsi modelləşdirmə deyil, məlumatların təmizlənməsidir (məlumatlardakı səhvlərin, çatışmazlıqların və uyğunsuzluqların düzəldilməsi və təhlilə hazır edilməsi işi). Təxmini bir qayda olaraq, vaxtın təxminən 70-80% -i məlumatların anlaşılması, təmizlənməsi və dəyişdirilməsinə keçir; faktiki analiz üçün yalnız 20-30% qalır. Bu bölmədə biz addım-addım görəcəyik ki, süni intellekt (AI) bu ağır yükü necə yüngülləşdirir, lakin hansı qərarlar hələ də sizinlə qalmalıdır və niyə.

Əvvəlcə iki əsas faktı qeyd edək. Birincisi, təmizləmə qərarları məlumatı yaradan proses haqqında biliklərinizə əsaslanır: yalnız siz bilirsiniz ki, nə üçün bir dəyərin əskik olduğunu, nə üçün rəqəmin həddindən artıq böyük olduğunu bilirsiniz. AI məlumatları görmür, konteksti bilmir; Kod yazır, qərarlar qəbul etmir. İkincisi, hər bir təmizləmə addımı analizin nəticəsini dəyişə bilər. Həddindən artıq göstəricinin silinməsi əmsalı tərsinə çevirə bilər; Çatışmayanların orta ilə doldurulması fərqi süni şəkildə azalda bilər. Beləliklə, təmizləmə geri qaytarıla bilən və sənədləşdirilməlidir: heç vaxt xam məlumatlara toxunmayın, hər addımı kodda edin, hər bir addımın təsirini qeyd edin.

Addım-addım təmizləmə iş prosesi

1. Məlumatları bilin. Əvvəlcə struktura baxın: sətirlərin (müşahidələrin) və sütunların (dəyişənlərin) sayı, hər bir dəyişənin növü (rəqəmli, kateqoriyalı, tarix), xülasə statistikası, çatışmayanların sayı. Bu "məlumat profili" kodunu AI-dən soruşa bilərsiniz; Amma siz çıxışı oxuyub “niyə bu dəyişən mətn kimi gəldi?” kimi suallar verirsiniz.

2. Çatışmayan məlumatları anlayın və təsnif edin. Çatışmayan məlumatlar üç növə bölünür. MCAR (Missing Completely At Random): itkin heç nəyə görə deyil, məsələn, sensor təsadüfi olaraq uğursuz oldu. MAR (Missing At Random): əskiklik müşahidə olunan digər dəyişənlərdən asılıdır, məsələn, yaşlı insanlar sualı daha tez-tez boş qoyurlar, lakin siz yaşı bilirsiniz. MNAR (Missing Not At Random): əskiklik müşahidə olunmayan dəyərin özündən asılıdır, məsələn, yüksək qazananlar öz gəlirlərini bildirmirlər. Bu fərq çox vacibdir, çünki həll üsulunu müəyyənləşdirir və AI sizin üçün buna qərar verə bilməz.

3. Çatışmazlığı aradan qaldırın. Seçimlər: siyahı üzrə silinmə, orta/median imputasiya, modelə əsaslanan çoxsaylı imputasiya. MCAR-da silinmə nisbətən təhlükəsizdir, lakin nümunənin ölçüsünü azaldır. Çoxlu tapşırıq MAR-da daha uyğundur. Heç bir sadə üsul MNAR-da qərəzsizliyə zəmanət vermir; Çatışmazlıq mexanizmi modelləşdirilməli və ya ən azı həssaslıq təhlili aparılmalıdır. Orta doldurma asan, lakin təhlükəlidir: fərqliliyi azaldır, münasibətləri zəiflədir və qeyri-müəyyənliyi gizlədir.

4. Həddindən artıq göstəriciləri yoxlayın. Kənar göstərici digərlərindən çox uzaqda dayanan müşahidədir. İki sualı ayırın: Bu səhvdir (məlumatların daxil edilməsində 999 yaş yazılıb) yoxsa real, lakin həddindən artıq dəyərdir (milyarderin gəliri)? Səhvləri düzəltmək; Həqiqi kənar göstəriciləri silməyin, çünki onlar məlumatları təmsil edirlər. "Narahat olduğu üçün" kənar göstəricini silməklə, məlumatları nəticəyə doğru əyirsiniz.

5. Kodlaşdırma və ardıcıllıq. Kateqoriyaları standartlaşdırın ("Kişi", "kişi", "E" hamısı bir kodda), tarixləri bir formata, vahidləri bir miqyasda gətirin, dublikat sıraları aşkar edin. Bu, AI-nin ən yaxşı kömək etdiyi ən az riskli mərhələdir.

6. Sənədləşdirin və dondurun. Xam və təmizlənmiş məlumatları ayrı saxlamaqla hər bir addımı kod və şərh xətti ilə qeyd edin. Beləliklə, bir hakim "niyə bu müşahidələr dayandırıldı?" cavabınız hazırdır.

Diqqət: Nəticələrə əsasən təmizlik qərarları verməyin. "Bu sətri sildiyiniz zaman əmsal əhəmiyyətli olur" deyən sətri silmək p-hackingin ən məkrli formasıdır ki, bunu növbəti bölmədə görəcəyik.

Müqayisə cədvəli: çatışmayan məlumat metodları

Metod

Nə vaxt uyğundur?

risk

AI-nin rolu

Bir sıra silin

MCAR, aşağı itkin nisbət

Nümunə kiçik olur, MAR/MNAR-da qərəzli olur

Kodu yazır; siz qərar verin

Orta/orta təyinat

Tez ilkin təhlil

Fərqliliyi azaldır, əlaqəni gizlədir

Bu asandır, lakin bunu tövsiyə etmir; xəbərdar etməlidir

Çoxlu tapşırıq (MI)

MAR, mühüm dəyişənlər

Düzgün quraşdırılmasa, bu, aldadıcı olacaq

Kod və paketi tövsiyə edir (siçanlar)

Mexanizmlərin modelləşdirilməsi

MNAR

Mürəkkəb, fərziyyə intensivliyi

Yalnız qaralama; mütəxəssis tələb olunur

Dörd kopyalana bilən sorğu

1. Məlumat profili:

Rolunuz: məlumatların təmizlənməsi üzrə köməkçi. Mən məlumatları paylaşmıram, R kodunu istəyirəm. Məndə 'digit' adlı data.frame var; dəyişənlər: id, yaş (rəqəm), gəlir (rəqəm), təhsil (kateqorik), region (kateqorik), tarix (tarix). Tapşırıq: hər bir dəyişən üçün növü, əskik sayı və dərəcəsini, rəqəmli olanlar üçün xülasə statistikasını və kateqoriyalı olanlar üçün tezlik cədvəlini yaradan kodu yazın. Şərh xətti əlavə edin.

2. Çatışmayan məlumat diaqnozu:

Yuxarıdakı "rəqəm" verilənləri üçün çatışmayan nümunəni araşdıran kodu yazın: - hər bir dəyişənin itkin dərəcəsi, - digər dəyişənlərlə əskikliyin əlaqəsini göstərən sadə cədvəl/qrafik. Mən kodun çıxışına baxacağam və MCAR/MAR/MNAR fərqini yaradacağam; Siz sadəcə diaqnostika alətini istehsal edirsiniz, təyinat metoduna qərar verməyin.

3. Kənar yoxlama (silmək deyil):

SİLİNMƏDƏN kənar göstəriciləri yoxlayan "gəlir" dəyişəni üçün kod yazın: qutu qrafası, IQR-əsaslı sərhədlər və kənar müşahidələr + dəyərlərin siyahısı cədvəli. Baxacağam ki, bunlar səhvdir, yoxsa realdır. Avtomatik silmə əlavə edin.

4. Kodlaşdırma standartlaşdırması:

"Təhsil" dəyişənində dəyərlər qarışıq yazılır: "İbtidai məktəb", "ibtidai məktəb", "İBTİBİT", "Lisey", "lisey", "Universitet", "universitet". Bunları ardıcıl kateqoriyalara yenidən kodlayan R kodunu yazın; Xəritəçəkmə cədvəlini aydın şəkildə göstərin ki, hər bir dönüşümü təsdiq edə bilim. Tanımadığınız dəyəri "BİLMƏMƏN" olaraq təyin edin.

Zəif məlumat / Güclü göstəriş

Zəif çağırış:

Məlumatları təmizləyin, boşluqları doldurun, kənar göstəriciləri atın.

Bu tələb təhlükəlidir: AI-yə kor səlahiyyət verir. Hansı növ çatışmazlıq, hansı doldurma, nə ziddiyyətli həqiqət - bunların heç biri aydın deyil. Nəticə gizli qərəzli məlumat dəsti ola bilər.

Güclü göstəriş:

Rolunuz: təmizlik köməkçisi, siz qərar verən deyilsiniz. Addım-addım gedin və HƏR bir addımın təsirini bildirən kodu yazın: 1) çatışmayan nümunəni göstərin (SİLMƏYİN/doldurmayın), 2) kənar namizədləri siyahıya salın (SİLMƏYİN), 3) Xəritəçəkmə cədvəli ilə kateqoriya uyğunsuzluqlarını düzəldin. Hər addımdan sonra sətir sayını və xülasə statistikasını çap edin ki, dəyişikliyi görə bilim və təsdiq edim. Avtomatik təyin/silmə daxil edilməsi.

Fərq aydındır: güclü iradə süni intellektni geri qaytarıla bilən və sənədləşdirilmiş addımlar yaradan nəzarət edilən köməkçi kimi yerləşdirir.

üç mini qutu

Case 1 - Orta tapşırıq tələsi. Bir analitikin 5000 nəfər üçün gəlir məlumatında 18% yox idi. O, AI-yə "boşluqları doldurmağı" söylədi; Süni intellekt onların hamısını orta hesabla qiymətləndirdi. Nəticə: gəlir fərqi 22% azalıb və təhsil-gəlir əlaqəsi əmsalı olduğundan daha zəif olub. Düzgün yol: çatışmazlıq MAR idi (təhsillə əlaqədar), çoxlu tapşırıq (siçanlar) ilə doldurulmalı idi. Dərs: doldurma üsulu mexanizmdən asılıdır.

2-ci hal - Kənar təmizlik tapıntını əks etdirir. Bir firma məlumatında 3 çox böyük firma (ümumi müşahidənin 0,6%-i) var idi. Bunlar AI-nin "təmizləmə" təklifi ilə silindi; Şkala iqtisadiyyatı əmsalı müsbətdən mənfiyə çevrildi. Halbuki həmin 3 şirkət real və sənayenin mühüm hissəsi idi. Düzgün yol, silmək əvəzinə həm tam, həm də etibarlı qiymətləndirmə ilə hesabat vermək idi. Dərs: real kənar göstəricilər səs-küy deyil, məlumatdır.

Hal 3 - Səssiz kodlaşdırma xətası. Bir paneldə tarix dəyişəni iki fərqli formatda ("2020-03-01" və "01/03/2020") gəldi. Süni intellekt tərəfindən istehsal edilən kombinasiya kodu onları fərqli dəyərlər üçün səhv saldıqda, 1400 müşahidə uyğun gəlmədi və artım templəri gülünc oldu. Analitik cərgələrin sayını yoxlamasa, fərq etməzdi. Dərs: hər addımdan sonra müşahidələrin sayılması və ağlı başında olmanın yoxlanılması mütləqdir.

Ümumi səhvlər

  • Orta ilə kor-koranə boşluğu doldurmaq. O, fərqi azaldır, qeyri-müəyyənliyi gizlədir və MAR/MNAR-da qərəz yaradır. Əvvəlcə mexanizmi təsnif edin.
  • "Narahat olduğu üçün" kənar göstəricinin silinməsi. Həqiqi kənar göstəricilər məlumatları təmsil edir; silmək nəticəni əyməkdir. Səhv olanı düzəldin, gerçək olanı saxlayın.
  • Xam məlumatlara toxunma. Heç vaxt xam məlumatları dəyişdirməyin; Kodla bütün təmizləməni ayrı bir nüsxədə aparın ki, onu geri qaytarsın.
  • Addımların təsirini ölçməmək. Hər addımdan sonra sətirlərin sayı və xülasə statistikası yoxlanılmazsa, səssiz xətalar yığılacaq.
  • Nəticədə təmizlənmə. “Bu sətri əlavə edəndə nəticə daha yaxşı olur” məntiqi p-hackingdir; Təmizləmə əvvəl və təhlil nəticəsindən asılı olmayaraq planlaşdırılmalıdır.
İpucu: Təmizləmədən əvvəl və sonra eyni əsas statistikanı (orta, median, müşahidələrin sayı, bir neçə korrelyasiya) yan-yana qoyan “əvvəl/sonra” cədvəlini saxlayın. Gözlənilməz bir sıçrayış gizli bir səhvin ən yaxşı xəbərçisidir.

Xülasə

Məlumatların təmizlənməsi empirik işin ən çox vaxt aparan və qərar tələb edən mərhələsidir. Süni intellekt bu sahədə güclü kod generatorudur, lakin o, çəkilişləri çağıra bilməz: siz çatışmayan məlumat növünü (MCAR/MAR/MNAR) təsnif edirsiniz, kənar göstəricinin səhv və ya real olduğunu müəyyənləşdirirsiniz, hər addımı geri qaytarıla bilən və sənədləşdirilmiş saxlayın. AI korlarına "aydın" səlahiyyət vermək əvəzinə, təsiri ölçülən və təsdiqlənən addım-addım iş axını qurun. Hər addımdan sonra müşahidələrin sayını və ümumi statistikanı yoxlamaq səssiz səhvlərə qarşı ən yaxşı antidotdur.

Tətbiq tapşırığı

Verilənlər dəstində çatışmayan və kənar göstəriciləri ehtiva edən ən azı iki dəyişəni seçin (öz məlumatlarınız və ya nümunə dəsti). Yuxarıdakı "addım-addım, silməyin/doldurmayın" sorğusu vasitəsilə AI-dən diaqnostik kod tələb edin və onu işə salın. Çatışmazlığı MCAR/MAR/MNAR kimi təsnif edin və əsaslandırmanızı bir cümlə ilə yazın. Ziddiyyətli namizədləri bir-bir araşdırın və hansının səhv, hansının real olduğuna qərar verin. Nəhayət, təmizləmədən əvvəl/sonra "əvvəl-sonra" cədvəlini hazırlayın və gözlənilməz dəyişikliklər olduqda hesabat verin.

yoxlama siyahısı

  • [ ] Xam məlumatları dəyişdirmədən ayrıca nüsxədə təmizlədim.
  • [ ] Mən çatışmazlığı MCAR/MAR/MNAR kimi təsnif etdim və ona uyğun olaraq metodu seçdim.
  • [ ] Mən kənar göstəriciləri bir-bir yoxladım, onların səhv və ya real olduğunu; Mən onu kor-koranə silməmişəm.
  • [ ] Mən hər təmizləmə addımından sonra müşahidələrin sayını və ümumi statistikanı yoxladım.
  • [ ] Mən bütün addımları kod və şərh xətti ilə sənədləşdirdim; geri çevrilə bilən.
  • [ ] Təmizləməni təhlilin nəticələrinə deyil, məlumatları yaradan proses haqqında biliyə əsaslandırdım.