Vahid 1 / 11

Məlumat Elmləri və Analitikada Süni İntellektə Giriş: İş axını, Rollar, Sərhədlər, Qiymətləndirmə və Etika

Qazanclar:

  • Verilənlər elminin altı mərhələli iş axınını (problemin müəyyən edilməsi, toplanması, təmizlənməsi, kəşfi, modelləşdirilməsi, əlaqəsi) və tapşırıq risk səviyyəsinə uyğun olaraq hər mərhələdə süni intellektin işlədiyi səlahiyyəti ayırd etmək bacarığı
  • Hər bir süni intellektin çıxışını mənbəyə qoşmaqla, işlətməklə və müqayisə etməklə, ekspert filtrindən keçirərək yoxlayan bir intizam tətbiq etmək bacarığı.
  • Təkrarlanma və məxfilik prinsiplərini (koda yazma, anonimləşdirmə) ilk gündən analiz vərdişlərinə çevirmək bacarığı

Xam, qarışıq və tez-tez “yalan” məlumatlar hər gün bir məlumat aliminin masasına düşür. Satış cədvəlində tarix sütunu üç müxtəlif formatda yazılır; bəzi sətirlərdə müştəri nömrələri boşdur; Sütun adı "gəlir"dir, lakin o, həm TL, həm də ABŞ dolları dəyərlərini ehtiva edir. Məlumat elminin işi bu xaosdan etibarlı qərar qəbul etməkdir: məlumatları toplamaq, təmizləmək, araşdırmaq, model qurmaq, nəticəni təsdiqləmək və onu hekayəyə çevirmək. Süni intellekt (Mətn və kod yarada, nümunələri tanıya, ümumiləşdirə və proqnozlar verə bilən qısa kompüter sistemləri üçün AI) bu zəncirdəki hər bir keçidə toxuna bilər: bir neçə dəqiqə ərzində təmizləmə kodunu yazmaq, kəşfiyyat xarakterli analiz üçün qrafikləri tövsiyə etmək, modelin metrikasını şərh etmək, SQL sorğusunu korrektə etmək. Lakin eyni süni intellekt sizə heç vaxt görmədiyi məlumatlar üçün "korrelyasiya 0.72" kimi inamlı bir uydurma da verə bilər.

Bu birinci bölmə kitabxananın təqdimatı deyil. Onun məqsədi AI-nin məlumat elminin iş prosesində hara qoyulacağını və heç vaxt hara qoyulmayacağını aydınlaşdırmaqdır. Əvvəldən əsas prinsipi açıqlayaq: AI məlumat alimi deyil, köməkçidir. Hansı məlumatların toplanacağına, hansı ölçüyə qərar veriləcəyinə, modelin istehsala daxil edilib-edilməyəcəyinə və etik sərhədləri haradan çəkəcəyinə dair qərar səlahiyyətli ekspertdən asılıdır. Təsdiqlənməmiş AI çıxışı, imzasız təhlil hesabatı kimi risklidir.

Məlumat elmi iş axını: uçdan-uca xəritə

Məlumat layihəsini başa düşmək üçün onu altı mərhələyə bölmək faydalıdır. Bütün modul bu xəritəni izləyir.

1. Problemin tərifi: Hansı qərarı dəstəkləmək üçün nəyi, niyə, nəyi ölçürük? Bu mərhələ AI-yə həvalə edilmir; İşi təyin edən şəxsdir.

2. Məlumatların toplanması: Mənbələrin müəyyən edilməsi, məlumatların çıxarılması, nümunələrin götürülməsi. (Vahid 2)

3. Məlumatların təmizlənməsi və əvvəlcədən işlənməsi: Çatışmayan dəyər, kənar göstərici, tip çevrilməsi. (Vahid 3)

4. Kəşfiyyat məlumatlarının təhlili (EDA - Exploratory Data Analysis, "gözlə" məlumatların paylanması və əlaqələrinin tanınması mərhələsi): (Bölmə 4)

5. Xüsusiyyət mühəndisliyi və modelləşdirmə: Dəyişən generasiya, alqoritm seçimi, təlim, qiymətləndirmə. (Vahid 5, 6, 7)

6. Ünsiyyət və istehsal: Vizuallaşdırma, hekayə, MLOps (modeli canlı çəkmək və ona nəzarət etmək intizamı). (Vahid 8, 11)

Süni intellekt bu altı mərhələnin hər birində fərqli səlahiyyətlə fəaliyyət göstərir. Aşağıdakı cədvəl bu səlahiyyət bölgüsünü ümumiləşdirir; Bu modulun ən vacib cədvəlidir.

Mərhələ

AI-nin rolu

Risk səviyyəsi

Kim təsdiq edir

Problemin tərifi

beyin fırtınası tərəfdaşı

aşağı

Məlumat alimi + maraqlı tərəf

Təmizləmə kodunu yazın

Kod eskiz generatoru

orta

Məlumat alimi (kodu oxuyur)

EDA şərhi

nümunə təklifçisi

orta

məlumat alimi

Xüsusiyyət generasiyası

İdeya və kod generatoru

orta-yüksək

Sızıntıya nəzarət mütləqdir

Model seçimi/metrik

məsləhətçi

yüksək

məlumat alimi

İstehsalata başlamaq qərarı

köməkçi giriş

çox yüksək

Komanda + biznes sahibi

Etika/məxfilik təsdiqi

stimullaşdırıcı

çox yüksək

insan, həmişə

Bu cədvəldən bir cümləni yadda saxlayın: paylar artdıqca, AI-nin rolu azalır və insanların razılığı artır.

Doğrulama niyə bu biznesin ürəyidir?

AI dil modelləri əmin görünür, lakin əmin olmaya bilər. Texniki dildə buna hallüsinasiya deyilir: bu, modelin mövcud olmayan məlumatları səlis bir cümlə ilə gerçəkmiş kimi uydurmasıdır. Məlumat elmində bu üç formada olur. Birincisi saxta nömrədir: modeldən heç bir məlumat vermədən “orta sifariş məbləği nə qədərdir” sualını versəniz, məlumatlarınızı heç vaxt görməsə də, əminliklə sizə rəqəm söyləyəcək. İkincisi mövcud olmayan funksiyadır: model pandas.read_excel_fast() kimi ümumiyyətlə mövcud olmayan funksiyanı təklif edə bilər. Üçüncüsü, yanlış statistik şərh: model “p-dəyəri 0,04-dür, buna görə də fərziyyə 96% doğrudur” kimi klassik statistik səhvi rəvan şəkildə təkrarlaya bilər.

Doğrulama intizamı üç mərhələdən ibarətdir:

  1. Mənbəyə keçid: Hər bir rəqəm, dərəcə və tendensiya AI yaddaşından deyil, məlumatlarınızdan gəlməlidir. Məlumatları yadda saxlamaq üçün deyil, verilənlər üzərində işləyən kod üçün AI-dan istifadə edin.
  2. Çalışın və müqayisə edin: AI tərəfindən verilən hər bir kod parçasını özünüz işlədin; Onun yaratdığı hər bir metrikanı müstəqil baza ilə müqayisə edin.
  3. Ekspert filtri: Çıxışın statistikaya və domen biliklərinə zidd olub-olmadığını özünüz yoxlayın.
Diqqət: Süni intellekt tərəfindən yazılmış təhlili işə salmadan və oxumadan təqdimata yerləşdirmək imzasız hesabat təqdim etmək kimidir. Sadəcə kodun işləməsi onun düzgün olması demək deyil; Yanlış sütunu cəmləyən kod da səhvsiz işləyir.

Təkrarlanma qabiliyyəti: eyni nəticəni iki dəfə verə bilmək

Məlumat elminin səssiz, lakin kritik prinsipi təkrarlanabilirlikdir: altı ay sonra və ya başqa bir kompüterdə yenidən təhlil apardığınız zaman eyni nəticəni əldə edirsiniz. Süni intellektlə işləyərkən bu risk artır, çünki süni intellektə “bu qrafiki düzəldin” deyəndə və onu əl ilə oynadıqda addımlar yox olur. Qayda: hər addım kodda və versiya nəzarətində (Git kimi) qeydiyyatdan keçməlidir; Təsadüfiliyi əhatə edən addımlarda, təsadüfi toxum (təsadüfi ədədlər generatorunun ilkin dəyəri; müəyyən edilərsə, nəticə təkrarlana bilər) sabitlənməlidir. Bu mövzunu 10-cu bölmədə dərinləşdirəcəyik; Hələlik bu vərdişinizə keçin: “Əl ilə klikləməyin, kodla yazın”.

üç mini qutu

1-ci hal - Təhlükəsiz sürətlənmə. Bir e-ticarət analitiki normal olaraq 240 min sıra sifariş cədvəlini təmizləmək üçün yarım gün sərf edərdi. Sütun adlarını və ilk 5 sıranı (şəxsi məlumat olmadan) AI-ya verdi və pandaların təmizləyici kodunu istədi. Süni intellekt 8 saniyə ərzində qaralama hazırladı; Analitik kodu sətir-sətir oxudu, tarix təhlilində səhvi düzəltdi və onu işə saldı. Müddət: 4 saat əvəzinə 35 dəqiqə. AI kodu təqdim etdi, doğrulama insanda qaldı.

Case 2 - Uydurulmuş metrik tələ. Təcrübəçi AI-dən soruşdu: "Təsadüfi meşə bu məlumatda nə qədər dəqiqdir?" modeli ümumiyyətlə öyrətmədən. "Təxminən 89%" dedi AI. Təcrübəçi bunu təqdimata qoydu; Həqiqi model öyrədildikdə dəqiqlik 71% idi. Səhv: Süni intellektə məlumat və model vermədən ölçüləri gözləmək.

3-cü hal - Səssiz sızma. Bir komanda süni intellekt tərəfindən təklif olunan “hədəf dəyişənin ortasını xüsusiyyət kimi əlavə etmək” ideyasını sorğu-sual etmədən həyata keçirdi. Model sınaq dəstində 98% performans göstərdi, lakin funksiya gələcək məlumatı sızdırdığı üçün istehsal zamanı qəzaya uğradı (məlumat sızması, Vahid 10). Səhv: AI tövsiyəsini statistik olaraq filtrləmə.

Zəif məlumat / Güclü göstəriş

Zəif çağırış:

Bu satış məlumatlarını təhlil edin və mənə orta gəliri deyin.

Bu iddia qüsurludur: AI-yə məlumat verilməmişdir, buna görə də "orta gəlir" yalnız düzəldilə bilər. Nə sütunlar, nə dövr, nə də valyuta aydın deyil.

Güclü göstəriş:

Rolunuz: məlumat aliminə kömək edən köməkçi. Məndə panda DataFrame var: df. Sütunlar:- order_date (mətn, “2024-03-01” formatında)- summa_tl (ondalıq, bəzi sətirlərdə NaN)- customer_id (tam)Tapşırıq: (1) orta məbləği hesablayan pandas kodunu yazın,(2) NaN dəyərlərini necə idarə etdiyini izah edin,(3) kodun etdiyi fərziyyələri sadalayın. Məlumat məzmununu təşkil etməyin; sadəcə kod yaradın və mən işləyəcəm və nəticəni yoxlayacağam.

Bu tələbdə sxem, gözlənti və “uydurma qadağanı” aydındır. Siz hələ də qaçırsınız və çıxışı özünüz yoxlayırsınız.

Etika və məxfiliyin başlanğıcı

Məlumat elmi çox vaxt şəxsi məlumatlarla işləyir: müştəri, xəstə, işçi qeydləri. Türkiyədə KVKK (Şəxsi Məlumatların Qorunması Qanunu) və Avropada GDPR bu məlumatları qoruyur. Əsl adınızı, şəxsiyyət vəsiqənizi, e-poçt ünvanınızı və ya ünvanınızı ictimai AI alətinə yapışdırmaq pozuntudur. Qayda: paylaşmadan əvvəl məlumatları anonimləşdirin, lazım olduqda yalnız sxem (sütun adları, növləri) və saxta nümunə sətir təqdim edin. 11-ci bölmədə etika mövzusunu dərinləşdirəcəyik; Prinsipi əvvəldən qoyaq: Verilənləri başa düşmək üçün çox vaxt məzmununu deyil, strukturunu paylaşmaq kifayətdir.

Ümumi səhvlər

  • Süni intellektə məlumat vermədən rəqəmləri/ölçmələri gözləmək. Model məlumatlara daxil ola bilmir; Onun verdiyi nömrə saxtadır. Həmişə nəticəni hesablayın və işə salın.
  • İş kodunun düzgün olduğunu düşünərək. Yanlış sütunu manipulyasiya edən kod da səhvsiz işləyir; Məntiqi oxumadan etibar etməyin.
  • Həqiqi şəxsi məlumatların açıq alətə yapışdırılması. Ad, ID nömrəsi, e-mail heç vaxt paylaşılmır; Diaqram kifayətdir.
  • Addımları əl ilə yerinə yetirmək və onları koda yazmamaq. Təkrarlana bilməyən analiz etibarsızdır.
  • AI-nin statistikanın şərhini sualsız qəbul etmək. Süni intellekt p-dəyəri və korrelyasiya kimi anlayışlarda klassik səhvləri təkrarlaya bilər.
İpucu: Süni intellekt sessiyalarınızın hər birində qısa bir “qayda xətti” daxil edin: “Məlumat məzmununu tərtib etməyin; sadəcə kod/analiz yaradın, mən işə düşüb nəticəni yoxlayacağam; əmin olmadığınız yerdə “əmin deyiləm”i göstərin.” Bu tək cümlə halüsinasiyalar riskini əhəmiyyətli dərəcədə azaldır.

Xülasə

Süni intellekt məlumat elmində güclü köməkçidir: təmizləmə kodunu, EDA şərhini, model tövsiyəsini və vizuallaşdırmanı sürətləndirir. Ancaq problemin tərifi, metrik seçim, istehsal qərarı və etik sərhədlər insanlara aiddir. İş axını altı mərhələdən ibarətdir və risk artdıqca AI-nin rolu azalır. Üç vərdiş hər şeyin əsasını təşkil edir: mənbə əlaqəsi (təsdiqləmə), təkrar istehsal (kodlaşdırma) və anonimləşdirmə (məxfilik). Bu üçünü mənimsədikdən sonra modulun qalan hissəsindəki hər bir alət sizin üçün təhlükəsiz sürətləndiriciyə çevrilir.

Tətbiq tapşırığı

Sadəcə əlinizdə olan kiçik bir cədvəlin (və ya hipotetik) sxemini yaradın: sütun adları, növlər və 2-3 dummy misal sətirləri (real şəxsi məlumatlar olmadan). Yuxarıdakı "Güclü sorğu" şablonundan istifadə edərək, AI-dan xülasə statistika kodunu soruşun. Kodu işlədin, çıxışı əl ilə müqayisə edin, hər hansı saxta fərziyyələri yoxlayın və tapıntılarınızı 5 nöqtədə qeyd edin.

yoxlama siyahısı

  • [ ] Mən süni intellektə real şəxsi məlumat əvəzinə sxem və saxta nümunə verdim?
  • [ ] Mən onun istehsal etdiyi kodu sətir-sətir oxuyub işlətdimmi?
  • [ ] Mən çıxışdakı hər bir nömrəni müstəqil olaraq yoxladımmı?
  • [ ] Mən analizin hər addımını koda yazdım və onu təkrarlana bilən etdim?
  • [ ] Mən missiyanın risk səviyyəsini təyin etdim və son qərarı bir insana verdimmi?