Vahid 11 / 11

MLOps Fondu, Etika, Məxfilik və Məsuliyyətli Analitika

Qazanclar:

  • MLOps mərhələlərini (buraxılış, yerləşdirmə, monitorinq, yenidən təlim, geri qaytarma) və model sürüşməsini anlamaq və monitorinq edilən yerləşdirməni planlaşdırmaq bacarığı
  • Model ədalətlilik, şəffaflıq və hesabatlılıq prinsiplərini tətbiq etmək və statistik dəqiqliyi etik məqbuldan ayırmaq bacarığı
  • Şəxsi məlumatları KVKK/GDPR prinsipləri ilə qorumaq və yüksək təsirli qərarlarda insana son məsuliyyət təyin etmək bacarığı

Model yetişdirmək və yüksək bal toplamaq son deyil, ortadır. Əsl dəyər, model istehsala qoyulduqda və etibarlı işlədikdə, zamanla xarab olmadan izlənildikdə və bütün proses etik və hüquqi sərhədlər daxilində həyata keçirildikdə gəlir. Bu yekun bölmə üç mövzunu birləşdirir: MLOps (canlı yayım, modellərin monitorinqi və saxlanması intizamı), etika (ədalətlilik, şəffaflıq, zərərə yol verməmək) və məxfilik (şəxsi məlumatların qorunması). Süni intellekt bu sahələrdə kod, yoxlama siyahıları və planlar hazırlayır; Lakin insanlar modelin canlı olub-olmamasına, kimin təsirlənəcəyinə və hansı məlumatlardan istifadə olunacağına qərar verir. Bu qərarlar texniki deyil, məsuliyyət qərarlarıdır.

MLOps: model bir məhsul kimi yaşayır

MLOps (Maşın Öyrənmə Əməliyyatları - istehsalda maşın öyrənmə modellərinin işlədilməsi, monitorinqi və yenilənməsi təcrübəsi) proqram təminatının hazırlanmasında DevOps-un məlumat elminə uyğunlaşdırılmasıdır. Əsas ideya: model bir dəfə öyrədilən və unudulan fayl deyil, daimi baxım tələb edən canlı məhsuldur. Əsas mərhələlər:

1. Versiyalaşdırma: Kod (Git), verilənlər və model birlikdə versiyalaşdırılır; Hansı modelin hansı məlumat və kodla istehsal olunduğu qeydə alınır.

2. Yerləşdirmə: Model API və ya toplu iş kimi canlı olaraq qoyulur. Adətən əvvəlcə kiçik bir auditoriyaya verilir (kölgə/kanar paylanması).

3. Monitorinq: Modelin və daxil edilən məlumatların performansı daim nəzarətdə saxlanılır.

4. Yenidən hazırlıq: Performans aşağı düşdükdə model yenilənmiş məlumatlarla yenidən hazırlanır.

Nümunə dəyişikliyi: səssiz təhrif

İstehsalda ən böyük təhlükə model sürüşməsidir (model drift / data drift). Dünya dəyişir; Modelinizi öyrətdiyiniz şərtlər (müştəri davranışı, qiymətlər, mövsüm, qanunvericilik) zamanla dəyişir və model köhnəlməyə başlayır. Məsələn, pandemiyadan əvvəl hazırlanmış tələb modeli pandemiya zamanı tamamilə səhvdir. Drift iki formada baş verir: məlumatların sürüşməsi (giriş məlumatlarının dəyişməsinin paylanması) və konsepsiyanın drifti (giriş və hədəf dəyişiklikləri arasındakı əlaqə). Bunları tutmağın yolu monitorinqdir: giriş paylanmasını, proqnozun paylanmasını və (mümkünsə) faktiki nəticə ilə müqayisədə performansı daim izləyin.

Diqqət: İstehsalata qoyulan model öz-özünə xarab olacaq; Məsələ “əgər” deyil, “nə vaxt” məsələsidir. Monitorinq qurmadan modellərin yerləşdirilməsi avtomobili heç vaxt mühərrikinə nəzarət etmədən idarə etmək kimidir; Bir gün o, sakitcə orada oturur və sən hiss etmirsən.

MLOps elementi

Məqsəd

Baxımsız olarsa

Versiyalaşdırma

Nə istehsal olunduğunu bilmək

Yenidən istehsal olunmayan, izi olmayan

Monitorinq

Sürüşməni erkən görmək

Model səssizcə dağılır

yenidən hazırlıq

xəbərdar olun

Proqnozlar köhnəlir

Geriyə qayıt

pis modelə qayıt

Qüsurlu model canlı olaraq qalır

Sənədləşdirmə

şəffaflıq, dövriyyə

Məlumat bir adamda ilişib qalır

Etika: model qərarlar insanlara təsir edir

Məlumat modelləri insanların həyatına təsir edən qərarlarda daha çox istifadə olunur: kredit, işə götürmə, sığorta, ədalət. Bu güclə məsuliyyət də gəlir. Əsas etik risklər:

Qərəz və ayrı-seçkilik: Model tarixi məlumatlarda ədalətsizlikləri öyrənə və davam etdirə bilər. Əgər müəyyən qrupa keçmişdə daha az kredit verilmişdirsə, model bunun bir “qayda” olduğunu fərz edir və ayrı-seçkiliyi avtomatlaşdırır. Buna görə də ədalətlilik təhlili - modelin müxtəlif qruplar (cins, yaş, region) üçün eyni şəkildə çıxış edib-etmədiyini yoxlamaq vacibdir.

Şəffaflıq və izah edilə bilənlik: Modelin bir insanı niyə rədd etdiyini izah edə bilməlisiniz. “Qara qutu belə dedi” etik və çox vaxt hüquqi baxımdan qəbuledilməzdir. Buna görə də izah edilə bilən alətlər (xüsusiyyət əhəmiyyəti, SHAP dəyərləri) dəyərlidir.

Hesabatlılıq: Model səhv qərar verərsə, kim məsuliyyət daşıyır? Cavab həmişə bir şəxs/müəssisədir, model deyil. Yüksək təsirli qərarlarda insan nəzarəti (insan-in-the-loop — son qərarı təsdiqləyən insan) qorunmalıdır.

Diqqət: Model statistik olaraq "düzgün" ola bilər, lakin etik cəhətdən qəbuledilməzdir. Bir qrupa sistematik olaraq mənfi təsir göstərən yüksək dəqiqlikli model yaxşı model deyil. Dürüstlük ədaləti əvəz edə bilməz.

Məxfilik: şəxsi məlumatlar diqqətlə qorunur

Məlumat elminin xammalı çox vaxt şəxsi məlumatlardır və bu məlumatlar qanunla qorunur: Türkiyədə KVKK, Avropada GDPR. Əsas prinsiplər bunlardır: məqsədin məhdudlaşdırılması (məlumat toplandığı məqsəddən başqa məqsədlər üçün istifadə olunmur), məlumatların minimuma endirilməsi (zəruri olduğundan daha çox məlumat toplanmır/saxlanılmır), anonimləşdirmə (identifikasiyaedici məlumat silinir) və təhlükəsizlik (məlumat şifrələnmiş saxlanılır və giriş məhdudlaşdırılır). Süni intellekt alətləri ilə işləyərkən kritik qayda: əsl şəxsi məlumatları heç vaxt ictimai AI alətinə yapışdırmayın. Çox vaxt analiz üçün diaqram və anonim/sintetik nümunə kifayətdir.

İnformasiya təhlükəsizliyi kontekstində əlavə vurğu: müdafiə və qanuni təhlil məqsədləri üçün yalnız səlahiyyətiniz olan məlumat və sistemlərdə məlumat elmi alətləri və üsullarından istifadə edin. Başqasının məlumatlarına icazəsiz giriş, şəxslərin yenidən identifikasiyası (anonim məlumatlardan şəxsiyyətin çıxarılması) və ya icazəsiz profilin yaradılması həm qanunsuz, həm də qeyri-etikdir.

üç mini qutu

1-ci hal - İzlənilməmiş çökmə. Bir e-ticarət şirkəti tövsiyə modeli ilə canlı yayıma çıxdı və izləmə qurmadı. 4 aydan sonra məhsul kataloqu çox dəyişdi; model köhnəlmiş məhsulları tövsiyə etməyə davam etdi və dönüşüm nisbəti sakitcə 30% azaldı. Aylarla heç kim fərqinə varmadı. Dərs: monitorinq olmadan yerləşdirmə kor olur.

2-ci hal – Gizli ayrı-seçkilik. İşə götürmə seçim modeli tarixi məlumatlarda gender balanssızlığı və sistematik olaraq aşağı qiymətləndirilən qadın namizədlər haqqında öyrəndi. Ədalətlilik təhlili olmadığı üçün diqqət yetirilmədi; Audit zamanı üzə çıxıb və qurum ciddi reputasiya/hüquqi risklə üzləşib. Dərs: Qrup əsaslı ədalət nəzarəti yüksək təsirli modellərdə vacibdir.

3-cü hal – Məxfiliyin pozulması. Bir analitik ictimai AI alətinə real müştəri e-poçtları və alış tarixçəsi olan faylı yüklədi və “seqmentləri ümumiləşdirin” dedi. Şəxsi məlumatlar qurumu tərk etdi; KVKK prosesi başladı. Doğru yol şəxsiyyət sahələrini silmək və yalnız anonim xüsusiyyətləri paylaşmaq idi. Dərs: real şəxsi məlumatlar açıq alətə daxil deyil.

Dörd kopyalana bilən şablon

1) Yerləşdirmədən əvvəl yoxlama siyahısı:

Rolunuz: MLOps məsləhətçisi. Modeli istehsala qoymazdan əvvəl yoxlamalı olduğum şeyləri sadalayın: versiya, monitorinq ölçüləri, geriyə qayıtma planı, performans həddi, məlumat sürüşməsi xəbərdarlığı, məsul şəxs. Hər bir maddə üçün bir cümləlik "niyə vacibdir" izahını əlavə edin. mən qərar verəcəm.

2) Model növbəsini izləmə dizaynı:

İstehsalda təsnifat modeli üçün sürüşmə monitorinqi planını təklif edin: (1) hansı giriş paylamalarına nəzarət etməliyəm, (2) proqnozun paylanması üçün hansı həyəcan siqnalı, (3) real nəticə gəldikdə performansı necə müqayisə etməli, (4) hansı həddə yenidən hazırlıq işə salınmalıdır. Həmçinin kod skeleti təmin edin.

3) Ədalətliliyə nəzarət:

Modelimin müxtəlif qruplar (məsələn, yaş qrupu, bölgə) üçün performansını müqayisə edən kodu yazın: geri çağırma/dəqiqlik və hər qrup üçün müsbət qərar nisbəti. Qruplar arasında əhəmiyyətli fərq varsa xəbərdar edin. Səbəb/siyasi şərhlərin edilməsi; Sadəcə mənə fərqləri göstər və mən qərarı nəzərə alacağam.

4) Məxfiliyin ilkin yoxlanışı:

Süni intellekt alətinə məlumat verməzdən əvvəl yoxlayın: aşağıdakı sütun siyahısında şəxsi/şəxsiyyət məlumatları (ad, e-poçt, şəxsiyyət vəsiqəsi, telefon, ünvan, IP) varmı? Əgər belədirsə, hansıların silinməli və ya anonimləşdirilməli olduğunu sadalayın. Sütunlar: [siyahı]. Məqsəd: yalnız anonim sxemi paylaşmaq.

Zəif məlumat / Güclü göstəriş

Zəif çağırış:

Modelim hazırdır, canlı yayıma çıxın.

Yerləşdirmə tək bir addım deyil; Monitorinq, geri çəkilmə, ədalət və məxfiliyə nəzarət olmadan canlı yayıma çıxmaq fəlakət üçün səssiz bir dəvətdir.

Güclü göstəriş:

Sizin rolunuz: məsul MLOps məsləhətçisi. Modelim hazırlanıb, canlı yayımdan əvvəl tam hazırlaşmaq istəyirəm. Yaradın: (1) yerləşdirmədən əvvəl yoxlama siyahısı, (2) sürüşmə monitorinqi planı, (3) qrup əsaslı ədalət yoxlama kodu, (4) məxfilik yoxlanışı (fərdi məlumat varmı). Həmçinin yüksək təsirli qərarlarda insan razılığını necə qorumağı təklif edin. Son qərarlar mənimdir.

Burada paylama, monitorinq, ədalətlilik və məxfilik vahid məsuliyyətli proses kimi qəbul edilir.

Ümumi səhvlər

  • Monitorinq qurmadan modelin yerləşdirilməsi. Model səssizcə sürüşür və təhrif edir; Bunun fərqinə varmaq aylar çəkə bilər.
  • Ədalət yoxlamasından yan keçmək. Yüksək sədaqətli model sistematik olaraq bir qrupa mənfi təsir göstərə bilər.
  • Səbəbsiz qara qutu qərarı vermək. Yüksək təsirli qərarlar izah edilə bilən olmalıdır; “Model belə dedi” kifayət deyil.
  • AI alətini açmaq üçün real şəxsi məlumatların verilməsi. KVKK/GDPR pozuntusu; Diaqram və anonim nümunə kifayətdir.
  • Qərarın modelə verilməsi. Məsuliyyət həmişə insanın üzərinə düşür; Yüksək təsirli insan nəzarəti qorunur.
İpucu: Hər bir modellə canlı yayıma çıxmazdan əvvəl yüksək səslə bir sual verin: “Əgər bu model sabah səssizcə pozarsa və ya bir qrupu ədalətsiz şəkildə cəzalandırarsa, mən onu necə görüb geri qaytaracağam?” Bu suala dəqiq cavabınız yoxdursa, model hələ istehsala hazır deyil.

Xülasə

Modelin işi yüksək balla yox, istehsalatda etibarlı və məsuliyyətli işləməklə bitər. MLOps canlı yayıma keçmək, sürüşmənin monitorinqi, yenidən hazırlanması və modeli geri qaytarmaq intizamıdır; İzləmə olmadan yerləşdirmə səssiz çökmədir. Etika modelin ədalətliliyini, şəffaflığını və hesabatlılığını tələb edir; statistik dəqiqlik etik məqbulluğu əvəz edə bilməz. Məxfilik şəxsi məlumatların KVKK/GDPR prinsipləri ilə qorunması və real məlumatların açıq alətlərdən uzaq tutulması deməkdir. Bütün bu qərarlar texniki deyil, məsuliyyət qərarlarıdır və həmişə insana aiddir.

Tətbiq tapşırığı

Bunu elə düşünün ki, siz qurduğunuz (və ya fərziyyə etdiyiniz) modeli istehsalata yerləşdirəcəksiniz və dörd siyahı dolduracaqsınız: (1) yerləşdirmədən əvvəl yoxlama siyahısı, (2) izləyəcəyiniz sürüşmə ölçüləri, (3) qrup əsaslı ədalətə nəzarət planı, (4) məxfiliyə nəzarət. O zaman “Sabah səssizcə qırılsa, onu necə hiss edəcəm və onu geri alacam?” sualına konkret cavab yazın.

yoxlama siyahısı

  • [ ] Mən modeli monitorinq (sürüşmə xəbərdarlığı) və geri çəkilmə planı ilə yerləşdirirəmmi?
  • [ ] Mən müxtəlif qruplar üçün ədalətlilik/performans fərqini yoxlamışammı?
  • [ ] Mən yüksək təsirli qərarlar qəbul etməkdə insan rolunu qorumuşammı?
  • [ ] Mən şəxsi məlumatları KVKK/GDPR prinsipləri ilə qorumuşam və onları açıq alətlərdən uzaq saxlamışam?
  • [ ] Mən əsas məsuliyyəti modelə deyil, insanın üzərinə qoymuşammı?

Modul imtahanı

1. Məlumat alimi süni intellektə “Təsadüfi meşə bu məlumatda nə dərəcədə doğrudur?” deyə soruşur. modeli heç öyrətmədən və birbaşa “89%” cavabını təqdimata qoyur. Bu yanaşmada əsas səhv nədir?

  • A) Süni intellektə verilənlər və modellər vermədən metrikləri gözləmək; İstehsal etdiyi nömrənin saxta olduğunu və əsl metrikanın yalnız təlim və sınaqdan keçərək tapıla biləcəyinə məhəl qoymamaq ✔
  • B) Təsadüfi meşə əvəzinə logistik reqressiyadan istifadə etməlidir
  • C) Dəqiqlik dərəcəsi həmişə 90%-dən yuxarı olmalıdır.
  • D) Təqdimata metriklərin daxil edilməsi qəti qadağandır

İzahat: Süni intellekt model və məlumatlara daxil olmadan metrik istehsal edə bilməz; Verdiyi nömrə halüsinasiyadır (uydurma). Metrik məlumat aliminin öz hesablaması ilə yalnız model həqiqətən öyrədildikdən və sınaqdan keçirildikdən sonra əldə edilir. Təsdiqlənməmiş çıxış imzasız hesabata bənzəyir.

2. "Hesabın bağlanmasının səbəbi" sütunu, itkilərin proqnozu üçün məlumat toplanarkən daxil edilir; Bu sütun yalnız müştəri getdikdən sonra doldurulur. Model test dəstində 97% verir, lakin istehsalda işləmir. Bu vəziyyətin adı və səbəbi nədir?

  • A) Həddindən artıq öyrənmə; Model çox mürəkkəbdir
  • B) Məlumat sızması; ✔ Proqnoz zamanı mövcud olmayacaq, lakin hədəfin nəticəsi olan məlumatlardan bir xüsusiyyət kimi istifadə
  • C) Qeyri-kafi öyrənmə; Model çox sadədir
  • D) Seçmə meyli; kiçik nümunə ölçüsü

İzahat: Bu, klassik məlumat sızmasıdır: “bağlama səbəbi” hədəfin nəticəsidir və proqnozlaşdırma zamanı hələ də boşdur. Model bu gələcək biliyi ilə hiylə edir, test dəstində əla görünür, lakin o sütun boş olduğu üçün istehsalda qəzaya uğrayır. Hər sütuna "proqnozlaşdırma zamanı məndə varmı" sualı verilməlidir.

3. Analitik gəlir sütununda çatışmayan dəyərləri orta ilə doldurur; lakin itkin düşənlər əslində heç vaxt gəlirlərini bəyan etməyən (sistemli itkin düşmüş) aztəminatlı təbəqəyə aiddirlər. Bu doldurma niyə səhvdir?

  • A) Orta həmişə mediandan böyükdür, ona görə də düzgün deyil
  • B) Çatışmayan dəyərlər heç vaxt doldurulmamalı, həmişə silinməlidir
  • C) Sistematik boşluğun orta ilə doldurulması həmin qrupu süni şəkildə təmsil etməklə məlumatları təhrif edir; Doldurma “niyə boşdur?” sualı verilmədən həyata keçirilib. ✔
  • D) Ortanın hesablanması çox yavaş olduğu üçün performans problemi yaradır

İzahat: Çatışmazlığın səbəbi həll yolunu müəyyən edir. Sistematik çatışmayan (müəyyən qrupda cəmləşən boşluq) orta göstərici ilə doldurulduqda həmin qrup süni şəkildə “orta gəlir”ə çevrilir və məlumatlar təhrif olunur. Onu doldurmazdan əvvəl “niyə boşdur” sualı verilməlidir; sistematik/əhəmiyyətli çatışmayan orta doldurulmamalıdır.

4. Komanda “reklam xərcləri” və “satış” arasında 0,78 nisbət tapır və büdcəni ikiqat artırır; Ancaq əslində hər ikisini tetikleyen mövsümi kampaniyalardır. Bu səhvi statistikada hansı prinsip izah edir?

  • A) Korrelyasiya səbəb-nəticə deyil; Gizli üçüncü dəyişən hər iki dəyişənə təsir edə bilər ✔
  • B) 0,78 korrelyasiya çox aşağı olduğu üçün əlaqə nəzərə alınmamalıdır
  • C) Korrelyasiya həmişə səbəb-nəticəni sübut edir, komanda bunu düzgün başa düşür
  • D) Reklam və satış arasındakı əlaqəni riyazi olaraq hesablamaq mümkün deyil.

İzahat: Korrelyasiya səbəb-nəticə deyil. İki dəyişən birlikdə hərəkət edə bilər, çünki gizli üçüncü dəyişən (burada mövsümi kampaniyalar) onların hər ikisinə təsir edir. Birinin digərinə səbəb olduğu qənaəti ancaq təcrübə və sahə biliyi ilə müəyyən edilə bilər; Təkcə korrelyasiyaların sayı səbəbliliyin sübutu deyil.

5. Fırıldaqçılığın aşkarlanması modeli 99,2% dəqiqlik göstərir və komanda qeyd edir; Bununla belə, məlumatlarda saxta əməliyyat dərəcəsi cəmi 0,8%, modelin geri çağırılması isə 6% təşkil edir. Bu cədvəl nəyi göstərir?

  • A) Model mükəmməldir, çünki dəqiqlik 99%-dən yuxarıdır
  • B) Dəqiqlik balanssız məlumatlarla yanıltıcıdır; Model demək olar ki, bütün saxtakarlıqları əldən verir (aşağı geri çağırma), müvafiq metrikaya baxılmalıdır ✔
  • C) Modelin geri çağırılması yüksək olduğundan heç bir problem yoxdur
  • D) Saxta nisbət aşağı olduğu üçün model qurmağa ehtiyac yox idi

İzahat: 'Dəqiqlik' balanssız məlumatlarda yanıltıcıdır. Model, demək olar ki, hər bir əməliyyatı “təmiz” adlandırdıqda, saxtalar çox az olduğu üçün yüksək dəqiqlik əldə edir, lakin saxtaları tuta bilmir, bu da onun əsas məqsədidir (6%-i xatırlayın). Buna görə də, balanssız problemlərdə diqqət dəqiqliyə deyil, çaşqınlıq matrisinə və işin məqsədinə uyğun olan ölçülərə, məsələn, geri çağırma/dəqiqliyə yönəldilir.

6. Tələbin proqnozlaşdırılması layihəsində vaxtdan asılı məlumatlar təsadüfi olaraq təlimə/testə bölünür. Model 93% dəqiqlik verir, lakin istehsal zamanı çökür. Düzgün bölgü yanaşması necə olmalıdır?

  • A) Test toplusunun genişləndirilməsi, məs. bölünmə 50%/50%
  • B) Daha mürəkkəb modeldən istifadə etməklə
  • C) Bölməni tamamilə çıxarın və bütün məlumatlarla məşq edin
  • D) Xronoloji bölgü: köhnə dövrlə məşq və yeni dövrlə sınaqdan keçirmək, beləliklə, modelin gələcəyi görməsinə mane olur✔

İzahat: Zaman seriyası məlumatlarında təsadüfi bölgü aparılırsa, model təlimdə gələcəyi görür və keçmişi proqnozlaşdırır; bu, bir sızmadır və əslində mövcud olmayan bir uğur gətirir. Düzgün yanaşma xronoloji bölgüdür: köhnə dövrlə təlim və yeni dövrlə sınaqdan keçirmək, istehsaldakı real vəziyyəti imitasiya etmək (keçmişdən gələcəyə proqnoz vermək).

7. Xüsusiyyət mühəndisliyində miqyaslaşdırma (StandardScaler) parametrləri hansı məlumatlardan hesablanmalı və necə tətbiq edilməlidir?

  • A) Daha dəqiq olması üçün bütün məlumatlardan (təlim + testlərin birlikdə) hesablanması lazımdır
  • B) Hər sətir üçün ayrı-ayrılıqda, həmin cərgənin öz dəyərindən hesablanmalıdır
  • C) Yalnız test məlumatlarından hesablanmalıdır
  • D) Yalnız təlim məlumatlarından hesablanmalı, sonra eyni parametrlər sınaq məlumatlarına tətbiq edilməlidir; əks halda sızacaq ✔

İzahat: Ölçəkləmə, kodlaşdırma və doldurma kimi bütün transformasiyaların parametrləri (orta, standart kənarlaşma və s.) yalnız təlim məlumatlarından öyrənilməli, sonra eyni şey test məlumatlarına tətbiq edilməlidir. Test məlumatlarının nəzərə alınması da test məlumatlarının təlimə mane olmasına, yəni sızmasına səbəb olur və modelin olduğundan daha yaxşı görünməsinə səbəb olur. Boru kəmərindən istifadə bunu təmin edir.

8. Model məşq dəstində 98%, test dəstində isə 72% dəqiqlik verir. Bu simptom nəyi göstərir və nə etmək lazımdır?

  • A) Qeyri-kafi öyrənmə; modeli daha mürəkkəb etmək lazımdır
  • B) Məlumat sızması; test dəsti dəyişdirilməlidir
  • C) Həddindən artıq uyğunlaşma; model sadələşdirilməli, nizamlanma və çarpaz doğrulama tətbiq edilməlidir ✔
  • D) Normal vəziyyət; Onsuz da təhsil balı həmişə yüksəkdir, ehtiyat tədbirlərinə ehtiyac yoxdur

İzahat: Təlimdə çox yüksək xal və sınaqda əhəmiyyətli dərəcədə aşağı bal həddindən artıq uyğunlaşmanın klassik əlamətidir: model real nümunəni deyil, məşq məlumatlarının səs-küyünü yadda saxlamışdır. Həlllərə modelin sadələşdirilməsi, daha çox məlumat, nizamlanma və çarpaz doğrulama ilə vəziyyəti yoxlamaq daxildir. Yalnız təhsil balına güvənmək bu tələni gizlədir.

9. İdarəetmə təqdimatında satışların 1000-dən 1020-yə qədər artdığı bar diaqramının y oxu, artımın böyük görünməsi üçün 980-dən başlayır. Faktiki artım 2% təşkil edir. Niyə bu etik məsələdir?

  • A) Kəsilmiş y oxu vizual olaraq kiçik fərqi şişirdir və izləyicini çaşdırır; Ədalət naminə, müqayisə çubuqlarındakı ox 0 ✔-dən başlamalıdır
  • B) Ştrix diaqramları heç vaxt satış məlumatları üçün istifadə edilə bilməz
  • C) Heç bir problem yoxdur; Qrafikin təsirli görünməsi həmişə yaxşıdır
  • D) Y oxu həmişə verilənlərin ən böyük qiymətindən başlamalıdır

İzahat: Müqayisə məqsədləri üçün bar diaqramlarında y oxu ümumiyyətlə 0-dan başlamalıdır. Oxun kəsilməsi və 980-dən başlayaraq kiçik 2% fərq vizual olaraq böyük görünür və izləyicini çaşdırır. Məlumat mütəxəssisinin etik məsuliyyəti məlumatları çox göstərməyən və ya aşağı salmayan dürüst qrafiklər çəkməkdir.

10. Sifarişləri məhsul cədvəli ilə QOŞULDURduqdan sonra analitik 3 dəfə ümumi dövriyyəni tapır; Xətlərin sayı 240 mindən 690 minə yüksəldi. Bu səssiz səhvin qarşısını almaq üçün nə etməli idi?

  • A) Ümumi dövriyyəni 3-ə bölün
  • B) JOIN əvəzinə həmişə ayrı sorğulardan istifadə edin
  • C) Məhsul cədvəlinin tamamilə silinməsi
  • D) Birləşmədən/Qoşulduqdan sonra sətirlərin sayının yoxlanılması və düzgün düymə vasitəsilə birləşdirildiyinin yoxlanılması; Replikasiyanın erkən tutulması ✔

İzahat: Məhsul cədvəlində hər bir məhsul üçün bir neçə cərgə (məsələn, müxtəlif rəng) olduqda, yanlış düymə ilə QOŞULMA hər sifarişin dublikatını çıxaracaq və ümumi məbləği artıracaq. Kod səhvsiz işləyir, lakin nəticə səhvdir. Bunun qarşısını almağın yolu hər birləşmədən/QOŞULDAN sonra sətirlərin sayını yoxlamaq və düzgün düymə ilə birləşməkdir.

11. İşə götürmə skrininq modeli tarixi məlumatlarda və sistematik olaraq qadın namizədlərin balları altında gender balanssızlığını öyrənir, lakin onun ümumi dəqiqliyi yüksəkdir. Bu nə deməkdir?

  • A) Model yüksək dəqiqliyə malik olduğundan problem yoxdur
  • B) Statistik dəqiqlik etik məqbulluğu əvəz etmir; model keçmiş ayrı-seçkilik haqqında öyrəndi, qrup əsaslı ədalət yoxlaması tələb olunur ✔
  • C) Modelin dəqiqliyini daha da artırmaq məsələni həll edir
  • D) Ədalətlilik məlumat elminin əhatə dairəsindən kənardadır

İzahat: Model statistik cəhətdən düzgün olsa belə, etik cəhətdən qəbuledilməz ola bilər. Model keçmiş məlumatlarda ədalətsizliyi öyrənir və ayrı-seçkiliyi avtomatlaşdırır. Yüksək dürüstlük ədaləti əvəz edə bilməz; Yüksək təsirli modellərdə, müxtəlif qruplar üçün performans/qərar fərqini ölçən ədalətliliyə nəzarət vacibdir və son məsuliyyət insanın üzərinə düşür.

12. İşçi real müştəri e-poçtları və alış tarixçəsi olan faylı ictimai AI alətinə yükləyir və "seqmentləri ümumiləşdirin" deyir. Niyə bu ciddi səhvdir və düzgün yol nədir?

  • A) Heç bir problem yoxdur; AI alətləri heç vaxt məlumatları saxlamır
  • B) Səhv faylın çox böyük olmasıdır; azaldılmalı idi
  • C) Açıq alətə real şəxsi məlumatların verilməsi KVKK/GDPR-nin pozulmasıdır; şəxsiyyət sahələri silinməli və yalnız anonim sxem/mülk paylaşılmalı ✔
  • D) Yalnız Excel əvəzinə CSV istifadə edilməli idi

İzahat: Həqiqi şəxsi məlumatlar (məsələn, e-poçt, ad və s.) ictimaiyyətə açıq olan süni intellekt alətinə verildikdə, KVKK/GDPR çərçivəsində məxfilik pozuntusu olacaq; məlumatlar təşkilatı tərk edir. Çox vaxt analiz üçün diaqram və anonim/sintetik nümunə kifayətdir. Doğru yol şəxsiyyət sahələrini silmək və yalnız anonim xüsusiyyətləri paylaşmaqdır.

13. Tövsiyə modeli istehsala buraxılır, lakin izləmə qurulmur; Məhsul kataloqu 4 aydan sonra dəyişdikdə, model köhnə məhsulları tövsiyə etməyə davam edir və dönüşüm nisbəti səssizcə 30% azalır. Bu fenomenin adı nədir?

  • A) Həddindən artıq öyrənmə; Model məşq dəstini yadda saxlayır
  • B) Model drifti; Dünya dəyişdikcə monitorinq qurulmadığından model səssizcə, diqqətdən kənarda qalır ✔
  • C) Seçim qərəzi; nümunə qərəzi
  • D) Məlumatların minimuma endirilməsinin pozulması

İzahat: Bu, model sürüşməsidir (model/məlumat sürüşməsi): dünya dəyişdikdə (kataloq, davranış, mövsüm) modelin öyrədildiyi şərtlər dəyişir və model səssizcə dağılır. İstehsalata qoyulan model öz-özünə xarab olur; Bu, "nə vaxt" məsələsidir. Monitorinq olmadan yerləşdirmə (giriş və performansı izləmək) deqradasiyanı aşkar etməyi qeyri-mümkün edir.

14. Tək məşq/test bölgüsündə 88% dəqiqlik əldə edən model 88%, 71%, 83%, 64%, 79% olmaqla 5 dəfə çarpaz doğrulama ballarına malikdir. Bu nəyi göstərir və çarpaz doğrulama nə üçün vacibdir?

  • A) Model sabitdir; 88% real performansdır
  • B) Çarpaz doğrulamaya ehtiyac yoxdur; Bir bölmə kifayətdir
  • C) Balların böyük dəyişkənliyi modelin qeyri-sabit olduğunu göstərir; çarpaz doğrulama, bir şanslı zibil qutusu deyil, orta hesabla və çoxlu zibil qutularının paylanması üzrə performansı əsaslandırır ✔
  • D) Ən yüksək balı (88%) bildirmək yaxşıdır

İzahat: Tək kupe şanslı və ya uğursuz ola bilər; 88% bu asan bölgünün nəticəsi idi. Çarpaz doğrulama, performansı orta göstəriciyə əsaslanaraq (burada ~ 77%) və balların dəyişkənliyini göstərən məlumatları bir neçə dəfə bölür. Buradakı yüksək dəyişkənlik modelin qeyri-sabit olduğunu göstərir; Tək bir bölməyə güvənmək yanlışdır.