Vahid 2 / 11

Məlumatların toplanması və mənbənin anlaşılması: sxem, nümunə götürmə, keyfiyyət və sızma məlumatlılığı

Qazanclar:

  • Müxtəlif məlumat mənbələrini (verilənlər bazası, API, fayl, veb kazıma) və hər birinin tələlərini tanımaq və sxemi düzgün başa düşmək bacarığı
  • Nümunənin populyasiyanı və seçim meylini təmsil edib-etmədiyini qiymətləndirməklə təkrarlanan seçməni yerinə yetirmək bacarığı
  • Toplama mərhələsində məlumat sızmasını aradan qaldırmaq və hər bir sütunda “Proqnoz zamanı məndə olacaqmı” sualını verməklə hüquqi/etik sərhədlərə riayət etmək bacarığı?

Hər bir analiz topladığınız məlumatların keyfiyyəti qədər yaxşıdır. Dünyanın ən qabaqcıl modeli belə, səhv toplanmış, qərəzli şəkildə seçilmiş və ya gələcəklə bağlı məlumatları ehtiva edən məlumatlarla işləsə, etibarsız nəticələr verəcəkdir. Kompüter elmində bu prinsip "qarbage in, garbage out" (qarbage in, garbage out) kimi ümumiləşdirilir. Bu bölmədə biz məlumatların toplanması mərhələsini əhatə edəcəyik: mənbəni anlamaq, nümunə götürmək, keyfiyyətli suallar vermək və ilk gündən məlumat sızması riskinə qarşı diqqətli olmaq. Süni intellekt bu mərhələdə güclü köməkçidir; SQL sorğusunu yazır, API sənədini ümumiləşdirir, məlumat müqaviləsini tərtib edir. Ancaq hansı məlumatları topladığınıza və bu məlumatların sizi təmsil edib-etməməsinə qərar verən insandır.

Məlumat mənbələri ilə tanış olmaq

Məlumatlar müxtəlif yerlərdən gəlir və hər bir mənbənin öz tələləri var. Verilənlər bazası (cədvəllərdə saxlanılan strukturlaşdırılmış verilənlər, adətən SQL ilə sorğulanır) ən çox yayılmış mənbədir; Etibarlıdır, lakin onun sxemini yaxşı başa düşmək lazımdır. API (Tətbiq Proqramlaşdırma İnterfeysi) canlı məlumat təqdim edir, lakin sürət məhdudiyyətləri və format dəyişiklikləri riskini daşıyır. Fayllar (CSV, Excel, JSON) çevikdir, lakin format uyğunsuzluğuna meyllidir. Veb kazıma güclüdür, lakin onun hüquqi və etik məhdudiyyətləri var; Hər sayt qırıla bilməz.

Diqqət: Veb qırıntıları və avtomatik məlumatların toplanması üçün saytın istifadə şərtlərinə, robots.txt faylına və KVKK/GDPR-ə əməl edin. İcazəsiz məlumatların toplanması hüquqi məsuliyyət yaradır. İnformasiya təhlükəsizliyi kontekstində məlumat toplama vasitələrindən yalnız sizin icazə verdiyiniz sistemlərdə və müdafiə/analiz məqsədləri üçün istifadə edin; İcazəsiz giriş və ya kazıma qadağandır.

Sxemi başa düşmək: verilənlərlə tanış olmaq

Məlumat toplusunu toplamazdan əvvəl onun sxemini (sütunların adları, onların məlumat növləri, mənaları və bir-biri ilə əlaqələri) başa düşməlisiniz. Süni intellekt burada "məlumat lüğəti" yaratmaqda çox faydalıdır - hər sütunun nə demək olduğunu izah edən cədvəl. Lakin AI-nin verdiyi izahatlar proqnozlardır; Məlumatları hazırlayan komanda ilə hər bir sütunun əsl mənasını təsdiqləyin. Məsələn, "status" adlı sütunda 0/1/2 ola bilər; Yalnız başlanğıc komanda bunların "gözlənilən/təsdiqlənmiş/ləğv edilmiş" və ya başqa bir şey olub olmadığını bilir.

Aşağıdakı cədvəl əsas resurs növlərini və xəbərdarlıqları ümumiləşdirir:

Mənbə

güclü nöqtə

tələ

AI necə kömək edir

SQL verilənlər bazası

Struktur, etibarlı

Kompleks JOIN-lar

Sorğu layihəsini yazır

API

canlı məlumatlar

Sürət həddi, forma dəyişikliyi

Sənəd xülasəsi, kodu çəkin

CSV/Excel

Çevik, sürətli

Format uyğunsuzluğu

Kodu oxuyun/parse edin

veb kazıma

Geniş əhatə

Hüquqi/etik limit

Qaralamanın təhlili (səlahiyyət daxilində)

Qeyd/hadisə datası

ətraflı

böyük həcm

Filtrləmə sorğusu

İllüstrasiya: hissə bütünü təmsil edirmi?

Çox vaxt siz bütün verilənlərlə deyil, nümunə ilə (əhalidən seçilmiş alt çoxluq) işləyirsiniz. Kritik sual budur: bu nümunə əhalini təmsil edirmi? Seçim qərəzi ən çox yayılmış tələdir. Məsələn, yalnız mobil proqramdan istifadəçiləri seçsəniz, veb istifadəçilərini görməyəcəksiniz və nəticələriniz yanıltıcı olacaq. Təsadüfi seçmə (hər bir qeydin seçilmək şansı bərabərdir) əksər hallarda ən təhlükəsizdir; lakin zaman seriyası məlumatlarında bölünmə təsadüfi deyil, xronoloji qaydada aparılır (bunu 7 və 10-cu bölmələrdə görəcəyik).

İlk gündən məlumat sızdırın

Məlumat sızması əksər fəlakətlərin mənbəyidir və adətən məlumatların toplanması mərhələsində baş verir. Nümunə: "ləğv edilibmi" proqnozunu verərkən, məlumatlara "ləğv tarixi" sütununu əlavə etsəniz, model gələcəyə baxır. Toplama mərhələsində hər sütun üçün bir sual verin: “Proqnoz verəndə həqiqətən bu məlumat məndə olacaqmı?” Cavab yoxsa, o sütun sızır. Bu mövzunu 10-cu bölmədə dərindən əhatə edəcəyik; Amma maarifləndirmə ilk gündən başlamalıdır.

üç mini qutu

1-ci hal – Nümayəndəlik problemi. Bir bank kredit riski modeli üçün yalnız təsdiq edilmiş kreditlər haqqında məlumat toplayıb (18 500 qeyd). Məlumatlarda imtinalar yox idi. Model real dünyada səhv etdi, çünki rədd edənlərin necə davranacağını heç görməmişdi. Dərs: Nümunə qərarınızı verdiyiniz bütün əhalini təmsil etməlidir.

Case 2 - Səssiz forma dəyişikliyi. Komanda hər gün API-dən qiymət məlumatlarını çıxarırdı. Bir gün API provayderi valyutanı USD-dən EUR-ya dəyişdi, lakin domen adı eyni qaldı. Məlumat 12 gün ərzində yanlış vahiddə toplanıb; 3200 xətt pozulub. Dərs: API məlumatlarının həcmini və format ardıcıllığını müntəzəm olaraq yoxlayın.

3-cü hal - Erkən sızma. Bir analitik "hesabın bağlanmasının səbəbi" sütununu "çarpışma" təxmini üçün məlumat toplayarkən daxil etdi. Bu sütun yalnız müştəri getdikdən sonra dolduruldu. Model test dəstində 97% dəqiqlik verdi; Proqnoz zamanı həmin sütun boş olduğu üçün istehsalda işləmədi. Dərs: hər sütuna "proqnoz zamanı məndə varmı?" sualını verin.

Dörd kopyalana bilən şablon

1) Məlumat lüğətinin çıxarılması:

Rolunuz: məlumat alimi köməkçisi. Aşağıda cədvəlin sütun adları və nümunə (anonim) dəyərləri verilmişdir. Hər bir sütun üçün onun təxmin edilən mənası, məlumat növü və potensial keyfiyyət risklərini cədvəldə sadalayın. Əmin olmadığınız sütunları "təsdiq tələb olunur" kimi qeyd edin; edilməsi mənası. Sütunlar: [buraya yapışdırın]

2) Seçmə kodu (təsadüfi, təkrarlanan):

Məndə pandalar df var. 200.000 cərgədən 5% təsadüfi nümunə çıxaran kodu yazın. random_state=42 istifadə edin (təkrar istehsal üçün). Nümunənin sinif paylanmasının populyasiyaya oxşar olduğunu yoxlamaq üçün kod əlavə edin.

3) Sızıntının skan edilməsi sualı:

Bu sütunların siyahısını sizə verəcəyəm. Məqsədim "ləğv edilibmi" (0/1) proqnozlaşdırmaqdır. Hər sütun üçün proqnoz zamanı məndə həqiqətən olub-olmayacağımı qiymətləndirin və onu "təhlükəsiz/şübhəli/sızma" kimi qeyd edin. Məntiqinizi bir cümlə ilə yazın. Sütunlar: [siyahı]

4) SQL çəkmə sorğu layihəsi:

PostgreSQL-də "sifarişlər" və "müştərilər" cədvəllərim var. Son 90 günün sifarişlərini müştəri şəhəri ilə birləşdirən və hər şəhər üzrə sifarişlərin ümumi məbləğini və sayını qaytaran JOIN sorğusu yazın. Tarix filtrini və NULL şəhərlərin necə idarə olunduğunu izah edin. Sorğunu icra edib yoxlayacağam.

Zəif məlumat / Güclü göstəriş

Zəif çağırış:

Mənə bu verilənlər bazasından yaxşı bir nümunə məlumatı çəkin.

"Yaxşı" birmənalı deyil; Hansı rəsm, hansı dövr, hansı ölçü, hansı məqsədlə çəkildiyi bəlli deyil. Süni intellekt yalnız ümumi, ehtimal ki, yanlış sorğu yaradacaq.

Güclü göstəriş:

Rolunuz: SQL köməkçisi. Mənim "əməliyyatlar" cədvəlim var: sütun id, müştəri_id, tarix (vaxt damğası), məbləğ (rəqəm), kanal (mətn: 'veb'/'mobil'). Tapşırıq: 2024-cü il üçün hər kanaldan 10.000 təmsilçi sətir qaytaran təkrarlana bilən (SİPARİŞ BY ilə deterministik) sorğu yazın. Məqsəd: kanalın müqayisəli təhlili. Sorğunuzun fərziyyələrini sadalayın.

Burada cədvəl, məqsəd, ölçü və təkrarlanma aydındır.

Ümumi səhvlər

  • Nümunənin təmsilçiliyinə şübhə etməmək. Asanlıqla əldə edilən məlumatlar dəqiq məlumat deyil; seçim qərəzi nəticəni təhrif edir.
  • Sütun mənalarının AI-yə uyğunlaşdırılması. Mənbə komandası mənasını bilir; Süni intellekt proqnozunu təsdiq etmədən istifadə etməyin.
  • API formatı/vahid dəyişikliyi izlənmir. Səssiz dəyişiklik günlərlə pozulmuş məlumatları toplayır.
  • Toplama mərhələsində sızıntıya məhəl qoymamaq. "Proqnoz zamanı məndə varmı" sualı erkən verilməsə, model yalançı uğur qazanacaq.
  • İcazəsiz və ya qeyri-qanuni məlumatların toplanması. robots.txt, istifadə şərtləri və KVKK-nın pozulması ciddi riskdir.
İpucu: Hər yeni məlumat mənbəyi üçün bir səhifəlik “məlumat kartı” saxlayın: mənbə, çəkilmə tarixi, sıraların sayı, məlum sərhədlər və sızma riski olan sütunlar. Bu kart "bu məlumat nə idi" sualını və aylar sonra təkrarlanma qabiliyyətini saxlayır.

Xülasə

Təhlilin keyfiyyəti toplanmış məlumatların keyfiyyəti ilə məhdudlaşır. Mənbəni (verilənlər bazası, API, fayl, kazıma) və sxemi yaxşı bilmək; nümunənin əhalini təmsil etdiyinə əmin olun; Hər sütundan “proqnozlaşdırma zamanı məndə varmı?” sualını verməklə ilk gündən sızıntıları aradan qaldırın. Süni intellekt sorğu və sənəd işi üçün əla sürətləndiricidir, lakin insanlar hansı məlumatların toplanacağına və onun təmsilçiliyinə qərar verirlər. Səlahiyyət məhdudiyyətləri, qanun və məxfilik həmişə birinci yerdədir.

Tətbiq tapşırığı

Məlumat mənbəyi seçin (öz biznesinizdən və ya hipotetikdən). Yuxarıdakı “məlumat lüğətinin çıxarılması” şablonu ilə süni intellektdən verilənlər lüğətinin qaralamasını əldə edin; Sonra sızma olub-olmadığını görmək üçün hər bir sütunu əl ilə qiymətləndirin. Ən azı bir şübhəli/sızma sütunu tapmağa çalışın və bunun niyə riskli olduğunu bir cümlə ilə yazın.

yoxlama siyahısı

  • [ ] Mən məlumat mənbəyini və sxemi mənbə komandası ilə təsdiqləmişəm?
  • [ ] Nümunənin əhalini təmsil etdiyini yoxladımmı?
  • [ ] Mən hər sütuna "hesablama zamanı məndə olacaqmı?"
  • [ ] Mən nümunə götürməni təkrarlana bilən (sabit toxum) etdimmi?
  • [ ] Mən qanuni/etik (səlahiyyət, robots.txt, KVKK) yığım limitlərini yoxlamışammı?