Qazanclar:
- Məlumat boru kəmərini qurmaq (toplama, yoxlama, təmizləmə, transformasiya, bölmə, versiya) və sxemin təsdiqini boru kəmərinin əvvəlinə yerləşdirmək bacarığı
- Məlumat sızmasının (qrup və müvəqqəti) qarşısını almaq üçün sahənin mənası və bölgüsü əsasında çatışmayan dəyər və etiketləmə qərarları qəbul etmək bacarığı
- Məlumat versiyasını və təsadüfi toxumu düzəltmək yolu ilə təkrarlana bilən məlumat bazası yaratmaq imkanı
Hər bir maşın öyrənmə sisteminin əsl gücü modeldə deyil, məlumatlardadır. Təcrübəli mühəndislər bilirlər: “zibil girir, zibil çıxır” — hətta pis məlumatlarla qidalanan ən qabaqcıl model pis nəticələr verəcək. Bu bölmədə biz məlumat kəmərini (məlumat kəməri: xam məlumatları model təliminə hazır edən addımlar zənciri) başdan sona qururuq və bu xəttin hansı pilləsində süni intellektdən təhlükəsiz istifadə edə biləcəyimizi öyrənirik.
Məlumat xəttinin addımları
Məlumat xətti adətən bu dayanacaqlardan keçir:
- Kolleksiya (qəbul): Mənbələrdən məlumatların çıxarılması (verilənlər bazası, API, log faylları, hadisə axınları).
- Doğrulama: Verilənlərin gözlənilən sxemə, növlərə və diapazonlara uyğun olub olmadığını yoxlamaq.
- Təmizləmə: Çatışmayan dəyərlər, dublikat qeydlər, kənar göstəricilər və uyğunsuzluqların idarə edilməsi.
- Transformasiya: Xam məlumatı atributlara çevirmək – məsələn, kateqoriyalı dəyişəni nömrəyə çevirmək, tarixdən “həftənin günü” yaratmaq.
- Bölmə: Təlim, doğrulama və sınaq dəstlərinə ayrılma.
- Versiyalaşdırma: Hansı modelin hansı data ilə öyrədildiyini qeyd etmək.
Süni intellekt, xüsusilə 2, 3 və 4-cü addımlarda kod layihələri və ideyalar yaradaraq vaxta qənaət edir. Lakin hansı qeydin atılacağı, hansı çatışmayan dəyərin doldurulacağı və necə olacağı kimi qərarlar məlumatları bilən mühəndisə aiddir; çünki düzgün olmayan təmizlik modelə gizli qərəz yeridə bilər.
Məlumatların yoxlanılması: xəttin erkən müdafiəsi
Ən bahalı səhvlər istehsalda deyil, yoxlama mərhələsinin atlandığı yerdən başlayır. Sxemin yoxlanılması avtomatik olaraq hər bir daxil olan məlumat toplusunun gözlənilən struktura uyğun olub olmadığını yoxlayır. Məsələn, yaş sütunu 0-120 arasındadır, e-poçt sahəsi boşdur, sütunların sayı dəyişibmi?
İpucu: Doğrulamanı xəttin əvvəlinə qoyun. Korrupsiyaya uğramış məlumatlar nə qədər tez tutulsa, onu düzəltmək bir o qədər ucuz olar. İstehsalda tutulan sxem xətası təlim mərhələsində tutulandan dəfələrlə baha başa gəlir.
Aşağıdakı məlumat sxemi üçün pandera (və ya Böyük Gözləntilər) ilə təsdiqləmə sxemini yazın. Sütunlar və qaydalar:- user_id: tam, null ola bilməz, unikal- yaş: tam, 0-120-dən ola bilməz- qeydiyyat_tarixi: tarix, gələcəkdə ola bilməz- ölkə: kateqoriyalı, {TR, DE, ABŞ, Böyük Britaniya} dəstindən- balans: onluq, mənfi ola bilməz Hər bir qayda pozuntusu üçün mənalı xəta mesajı yaradın. Testi kodun sonunda qırıq sətir nümunəsi ilə göstərin.
Təmizlik: qərar verən insandır
Çatışmayan dəyərlər hər bir məlumat dəstinin reallığıdır. İdarəetmə yolları:
- Silinmə: Çox yüksək çatışmayan sətir/sütun silinir. Ancaq məlumat itkisi və qərəzlilik riski var.
- İmputasiya: Orta, median, ən tez-tez verilən dəyər və ya modelə əsaslanan proqnozlaşdırma ilə təyin.
- Bayraq: Ayrı bir bayraq sütununda "çatışıb" məlumatının saxlanması - bəzən itkin özü siqnaldır.
Hansının düzgün olması problemdən asılıdır. Tibbi məlumat toplusunda "qan dəyəri ölçülməmişdir" məlumatı silinmək əvəzinə qorunmalıdır; Çünki hətta həkimin ölçü götürməkdən imtina etməsi də siqnaldır. AI sizə seçimlər və kodlar verə bilər; Hansının sahənin reallığına uyğun olduğunu seçirsiniz.
Zəif məlumat / Güclü göstəriş
Zəif təklif: "Çatışmayan dəyərləri doldurun."
Güclü sorğu: "Aşağıdakı sütunlarda çatışmayan dəyərlər var: gəlir (12% əskik, sağa əyilmiş paylama), sonuncu_login (30% çatışmazlıq). Gəlirləri media ilə doldurmağı təklif edin, lakin niyə medianın mənasını vermədiyini izah edin. Last_login üçün çatışmayan dəyərin əhəmiyyətli ola biləcəyini fərz edin (istifadəçi heç vaxt daxil olmamış ola bilər); W_ hesaba girişi heç vaxt endirməyi nəzərə alın. qərəzli yanaşma modelə əlavə edəcək”.
Fərq: güclü əmr paylama məlumatı və sahə mənasını verir; süni intellekt mexaniki doldurma yerinə qərar dəstəyi istehsal edir.
Etiketləmə: keyfiyyət ölçülür
Nəzarət altında olan təlimdə (düzgün cavablarla nümunələrin verildiyi öyrənmə) modelin öyrəndiyi şey etiketlərdir (etiketlər: hər nümunə üçün düzgün cavab). Etiket keyfiyyəti bir tavan təyin edir - insanlar uyğunsuz şəkildə etiketləyirlərsə, model uyğunsuz öyrənir.
Annotatorlararası razılaşma müxtəlif insanların eyni nümunəyə eyni etiketi vermə dərəcəsini ölçür; Koen Kappa kimi bir əmsalla ifadə edilir. Aşağı uyğunluq ya tapşırığın aydın olmadığını, ya da təlimatın zəif olduğunu göstərir.
Süni intellekt etiketləşdirməyə iki yolla kömək edir: (1) annotasiya təlimatının hazırlanması, (2) əvvəlcədən etiketləmə və yalnız insan tərəfindən düzəliş edilməsi. Lakin LLM ilə əvvəlcədən etiketləmə bir tələ var: modelin sistematik səhvi bütün etiket dəstinə sıza bilər. Buna görə insanlar həmişə bəzi LLM etiketlərini yoxlayırlar.
Diqqət: LLM tərəfindən istehsal olunan etiketləri "əsas həqiqət" hesab etməyin. Nümunəni insanla yoxlayın və LLM-insan uyğunluğunu ölçün. Uyğunluq aşağı olarsa, əvvəlcədən etiketləmə yaxşıdan daha çox zərər verəcəkdir.
Məlumat bölməsi: sızmanın qarşısını alın
Məlumatı təlim/təsdiqləmə/testə bölərkən ən təhlükəli səhv məlumat sızmasıdır: test məlumatlarının təlimə qarışdırılması. Nümunələr:
- Eyni istifadəçinin qeydləri həm təlimə, həm də testə düşür (qrup sızması).
- Təlimdə gələcəyin və zaman seriyalarında sınaqda keçmişin istifadəsi (müvəqqəti sızma).
- Bütün verilənlərdən miqyaslama (normallaşdırma) parametrlərinin hesablanması və sonra bölünməsi.
Zamanla bağlı problemlər üçün müvəqqəti parçalanma vacibdir: keçmişlə məşq edin, gələcəkdə sınaqdan keçirin. Təsadüfi parçalanma istehsalda heç vaxt baş verməyəcək "gələcək" fayda verir və ölçüləri şişirdir.
Verilənlərin versiyalaşdırılması və təkrar istehsal olunma qabiliyyəti
"Bu modeli hansı məlumatlarla öyrətdik?" Aylar sonra suala cavab verə bilmək ciddi ML mühəndisliyinin əlamətidir. Verilənlərin versiyalaşdırılması hər bir məlumat şəklini ID (hash və ya versiya etiketi) ilə saxlayır. Kod kimi DVC (Data Version Control) versiya məlumatları kimi alətlər.
Modelin nəticəsini təkrar etmək üçün üç şey düzəldilməlidir: məlumat versiyası, kod versiyası və təsadüfi toxum. Bu üçlük olmadan “mən də eyni nəticəni aldım” demək mümkün deyil. Biz 11-ci bölmədə Təkrarlanma qabiliyyətini dərinləşdirəcəyik; lakin məlumat boru kəmərində toxumun fiksasiyası buradan başlayır.
üç mini qutu
Case 1 - Gün şemasının təsdiqi saxlanıldı. Bir komanda yuxarı sistem qiymət sahəsini qəpikdən lirəyə çevirəndə bütün qiymətlər 100 dəfə aşağı düşdü. Sxemanın doğrulanması partiyanı "qiymət aralığından kənar" kimi rədd etdi və model pozulmuş məlumatlarla öyrədilmədi. Doğrulama olmadan, səhv yalnız yanlış proqnozlarla istehsalda qeyd edilə bilər.
2-ci hal - Yanlış doldurulma meyli. Kredit modelində çatışmayan gəlir dəyərləri orta ilə dolduruldu. Lakin çatışmayan gəlirlər əsasən aşağı gəlirli qrupda idi; orta hesabla bu qrupu süni şəkildə "zənginləşdirdi" və model onlara ədalətsiz yüksək hədd təklif etdi. Median + çatışmazlıq bayrağı ilə bağlı problem həll edildi.
3-cü hal - müvəqqəti sızma. Tələb proqnozlaşdırma modeli sınaq dəstində əla göründü (95% dəqiqlik), lakin istehsal zamanı qəzaya uğradı. Niyə: təsadüfi parçalanma səbəbindən model gələcəyi görmüşdü. Müvəqqəti bağlamaya keçid test dəqiqliyini 78%-ə endirdi – lakin bu, real performans idi və onu istehsalda saxladı.
Kopyalana bilən şablonlar
Aşağıdakı verilənlər toplusunu üç dəstə bölün: təlim/təsdiqləmə/test. Məhdudiyyət: Bu zaman seriyasıdır; TEMPORAL parçalanmadan istifadə edin (keçmişdə məşq edin, gələcəkdə sınaqdan keçirin). Dəstə sızmasının qarşısını alın: eyni `müştəri_id`si yalnız bir klasterdə olsun. Ölçmə parametrlərini YALNIZ təlim dəstindən hesablayın, sonra hamıya tətbiq edin. Hər addımda kodda neçə sətir qaldığını çap edin və sızma olub olmadığını yoxlayan təsdiq əlavə edin.
Bu etiketləmə tapşırığı üçün qaralama annotasiya təlimatı yazın. Tapşırıq: [məs. Müştəri rəyini müsbət/mənfi/neytral etiketləyin]Sərhəd hallarına aydınlıq gətirin: sarkazm, qarışıq emosiya, məhsulla əlaqəsi olmayan rəyi necə etiketləmək olar? Taggerlər arasında ardıcıllığı artıracaq 5 misal və 3 çətin kənar vəziyyət verin.
Bu məlumat kəməri üçün təkrar istehsal qabiliyyətinə nəzarət siyahısı hazırlayın:- Məlumat versiyası necə düzəldilməlidir?- Hansı təsadüfi toxumlar harada təyin edilməlidir?- Hansı metadata (məlumat hash, sıra sayı, tarix) qeyd edilməlidir? Mənim kod bazam: [dil/kitabxana]
Məlumat sızması üçün bu təmizləmə kodunu yoxlayın. Xüsusilə buna baxın: miqyaslama/kodlaşdırma parametrləri bölünmədən ƏVVƏL hesablanırmı? Hər hansı bir statistika bütün məlumatlardan hesablanır, yoxsa sadəcə təlim? Kod: [kod]
Qərar cədvəli: itkin dəyər strategiyası
Vəziyyət
Tövsiyə olunan yanaşma
Niyə
Rəqəmsal, əyri paylama
median ilə doldurun
Orta qiymətə kənar göstəricilər təsir edir
Rəqəmsal, simmetrik
orta ilə doldurun
Məlumatı qoruyur
Çatışmazlıq əhəmiyyətli ola bilər
Bayraq sütunu + doldurun
Çatışmazlıq bir siqnaldır
Çatışmayan nisbət > 60%
Sütunu qiymətləndirin/çəkin
Səs-küy həddindən artıqdır
Kateqorik
"Naməlum" kateqoriyası
Süni çoxluq yaratmır
Ümumi səhvlər
- Doğrulama atlanır. Sxem nəzarəti olmadan, zədələnmiş məlumatlar səssizcə daxil olur.
- Bölmədən əvvəl miqyaslama. Test statistikasını təhsilə sızdırır.
- Zaman sıralarında təsadüfi bölgüdən istifadə. Saxta yüksək göstəricilər istehsal edir.
- LLM etiketlərinə kor-koranə etibar etmək. Sistematik xəta bütün məlumatlara yayılır.
- Data versiyası saxlanmır. Nəticəni təkrarlaya bilməzsiniz.
- Orta ilə mexaniki doldurma. Sahənin mənasını nəzərə almır, qərəz əlavə edir.
Xülasə
Məlumat kəməri ML sisteminin əsasını təşkil edir və modeldən daha çox səyə layiqdir. Doğrulamanı yuxarıya qoyun; domen bilikləri ilə təmizləmə və etiketləmə qərarları qəbul etmək; bölmədə sızmanın (qrup və müvəqqəti) qarşısını almaq; məlumat versiyasını və toxumu düzəldin. Süni intellekt bu xətt üzrə kod və ideyalar yaradır, lakin hansı məlumatların və necə emal ediləcəyinə qərar vermək sizin ixtiyarınızdadır – çünki burada hər bir yanlış qərar modelə gizli qüsur kimi keçir.
Tətbiq tapşırığı
Öz verilənlər bazanızda təsdiqləmə sxemi (pandera/Böyük gözləntilər) yazın və qəsdən pis sıra əlavə edin və onun tutulduğunu göstərin. Sonra məlumatları müvəqqəti və ya qrup şəklində bölün, yalnız təlimdən miqyaslama parametrlərini hesablayın və təsdiqlə heç bir sızma olmadığını yoxlayın. Data versiyasını və sıra sayını metadata faylına yazın.
yoxlama siyahısı
- [ ] Sxemanın yoxlanılması xəttin yuxarı hissəsində işləyir.
- [ ] Mən sahə mənasına əsaslanaraq çatışmayan dəyər strategiyasını seçdim, onu mexaniki şəkildə doldurmadım.
- [ ] Mən etiket keyfiyyətini ölçdüm (uyğunluq); Mən LLM etiketlərini insan tərəfindən yoxladım.
- [ ] Paneldə qrup və müvəqqəti sızmanın qarşısını aldım.
- [ ] Ölçmə/kodlaşdırma yalnız təlim dəstindən hesablanır.
- [ ] Məlumat versiyası, cərgələrin sayı və qeydə alınmış toxum.