Daromadlar:
- MLOps bosqichlarini (chiqarish, joylashtirish, monitoring, qayta tayyorlash, orqaga qaytarish) tushunish va driftni modellashtirish va nazorat qilinadigan joylashtirishni rejalashtirish qobiliyati
- Adolatlilik, shaffoflik va javobgarlik tamoyillarini qo'llash va statistik aniqlikni axloqiy maqbullikdan ajrata olish qobiliyati
- Shaxsiy ma'lumotlarni KVKK/GDPR tamoyillari bilan himoya qilish va yuqori ta'sirli qarorlar qabul qilishda insonga yakuniy javobgarlikni yuklash qobiliyati
Modelni tayyorlash va yuqori ball olish - bu oxir emas, balki o'rtadir. Haqiqiy qiymat model ishlab chiqarishga kiritilganda va ishonchli ishlaganda, vaqt o'tishi bilan buzilmagan holda kuzatilganda va butun jarayon axloqiy va huquqiy chegaralar doirasida amalga oshirilganda keladi. Ushbu yakunlovchi bo'lim uchta mavzuni birlashtiradi: MLOps (jonli efirga chiqish, modellarni kuzatish va ularga xizmat ko'rsatish intizomi), axloq (adolat, shaffoflik, zarar keltirmaslik) va maxfiylik (shaxsiy ma'lumotlarni himoya qilish). AI ushbu sohalarda kod, nazorat ro'yxatlari va chizmalarni ishlab chiqaradi; Ammo odamlar modelning jonli efirga uzatilishi, kimga ta'sir qilishi va qanday ma'lumotlardan foydalanish mumkinligini hal qiladi. Bu qarorlar texnik emas, balki javobgarlik qarorlaridir.
MLOps: model mahsulot kabi yashaydi
MLOps (Machine Learning Operations - ishlab chiqarishda mashinani o'rganish modellarini ishga tushirish, kuzatish va yangilash amaliyoti) DevOps-ning dasturiy ta'minotni ishlab chiqishda ma'lumotlar faniga moslashuvidir. Asosiy g'oya: model bir marta o'qitilgan va unutilgan fayl emas, balki doimiy parvarish qilishni talab qiladigan tirik mahsulotdir. Asosiy bosqichlar:
1. Versiyalash: Kod (Git), ma'lumotlar va model birgalikda versiyalanadi; Qaysi model qaysi ma'lumotlar va kod bilan ishlab chiqarilganligi qayd etiladi.
2. Joylashtirish: Model API yoki ommaviy ish sifatida ishga tushiriladi. Odatda birinchi navbatda kichik auditoriyaga beriladi (soya / kanareyka taqsimoti).
3. Monitoring: Model va kirish ma'lumotlarining ishlashi doimiy ravishda nazorat qilinadi.
4. Qayta tayyorlash: unumdorlik pasayganda, model yangilangan ma'lumotlar bilan qayta o'qitiladi.
Naqsh o'zgarishi: jim buzilish
Ishlab chiqarishdagi eng katta xavf - bu modelning drifti (model drifti / ma'lumotlar drifti). Dunyo o'zgaradi; Modelingizni o'rgatgan sharoitlar (mijozlarning xatti-harakati, narxlar, mavsum, qonunchilik) vaqt o'tishi bilan o'zgaradi va model eskirib keta boshlaydi. Masalan, pandemiyadan oldin o'qitilgan talab modeli pandemiya davrida mutlaqo noto'g'ri. Drift ikki shaklda sodir bo'ladi: ma'lumotlar drifti (kirish ma'lumotlarini taqsimlash o'zgarishlari) va kontseptsiya drifti (kirish va maqsad o'zgarishlari o'rtasidagi munosabat). Bularni qo'lga kiritishning yo'li - bu monitoring: kirish taqsimotini, bashorat taqsimotini va (agar iloji bo'lsa) haqiqiy natija bilan solishtirganda ishlashni doimiy ravishda kuzatib boring.
E'tibor bering: ishlab chiqarishga kiritilgan model o'z-o'zidan yomonlashadi; Gap “agar”da emas, “qachon”da. Monitoringni o'rnatmasdan modellarni joylashtirish avtomobilni dvigatelini hech qachon boshqarmasdan haydashga o'xshaydi; Bir kuni u jimgina o'tiradi va siz buni sezmaysiz.
MLOps elementi
Maqsad
Agar e'tiborsiz bo'lsa
Versiyalash
Nima ishlab chiqarilganligini bilish
Qayta tiklanmaydigan, kuzatilmaydigan
Monitoring
Slipni erta ko'rish
Model jimgina buziladi
qayta tayyorlash
yangilanib turing
Bashoratlar eskiradi
Orqaga qaytarish
yomon modelga qaytish
Noto'g'ri model jonli bo'lib qoladi
Hujjatlar
oshkoralik, aylanma
Axborot bir odamga tiqilib qoladi
Etika: namunaviy qarorlar odamlarga ta'sir qiladi
Ma'lumotlar modellari odamlar hayotiga ta'sir qiluvchi qarorlar qabul qilishda tobora ko'proq foydalanilmoqda: kredit, ishga yollash, sug'urta, adolat. Bu kuch bilan mas'uliyat ham keladi. Asosiy axloqiy xavflar:
Tarafsizlik va kamsitish: Model tarixiy ma'lumotlardagi adolatsizliklarni o'rganishi va davom ettirishi mumkin. Agar ilgari ma'lum bir guruhga kamroq kredit berilgan bo'lsa, model buni "qoida" deb hisoblaydi va diskriminatsiyani avtomatlashtiradi. Shuning uchun adolat tahlili - modelning turli guruhlar (jins, yosh, mintaqa) uchun o'xshash ishlashini tekshirish - muhim ahamiyatga ega.
Shaffoflik va tushunarlilik: Siz nima uchun model odamni rad etganini tushuntira olishingiz kerak. "Qora quti shunday dedi" axloqiy va ko'pincha qonuniy ravishda qabul qilinishi mumkin emas. Shuning uchun tushuntirish vositalari (xususiyat ahamiyati, SHAP qiymatlari) qimmatlidir.
Javobgarlik: Agar model noto'g'ri qaror qabul qilsa, kim javobgar? Javob har doim model emas, balki shaxs/muassasadir. Yuqori ta'sirli qarorlarda inson nazorati (inson-in-the-loop - yakuniy qarorni ma'qullaydigan inson) saqlanishi kerak.
Diqqat: Model statistik jihatdan "to'g'ri" bo'lishi mumkin, ammo axloqiy jihatdan qabul qilinishi mumkin emas. Bir guruhni muntazam ravishda kamchiliklarga olib keladigan juda aniq model yaxshi model emas. Halollik adolat o'rnini bosa olmaydi.
Maxfiylik: shaxsiy ma'lumotlar ehtiyotkorlik bilan himoyalangan
Ma'lumotlar fanining xom ashyosi ko'pincha shaxsiy ma'lumotlardir va bu ma'lumotlar qonun bilan himoyalangan: Turkiyada KVKK, Evropada GDPR. Asosiy tamoyillar quyidagilardan iborat: maqsadni cheklash (ma'lumotlar to'plangan maqsaddan boshqa maqsadlarda foydalanilmaydi), ma'lumotlarni minimallashtirish (kerak bo'lganidan ko'proq ma'lumot yig'ilmaydi/saqlanmaydi), anonimlashtirish (identifikatsiya qiluvchi ma'lumotlar olib tashlanadi) va xavfsizlik (ma'lumotlar shifrlangan holda saqlanadi va kirish cheklangan). AI vositalari bilan ishlashda muhim qoida: hech qachon haqiqiy shaxsiy ma'lumotlarni ommaviy AI vositasiga joylashtirmang. Ko'pincha diagramma va anonim/sintetik namuna tahlil qilish uchun etarli.
Axborot xavfsizligi kontekstida qo'shimcha e'tibor: ma'lumotlar fanining vositalari va usullaridan faqat o'zingiz vakolatga ega bo'lgan ma'lumotlar va tizimlarda, mudofaa va qonuniy tahlil maqsadlarida foydalaning. Birovning maʼlumotlariga ruxsatsiz kirish, shaxslarni qayta identifikatsiya qilish (anonim maʼlumotlardan shaxsni olish) yoki ruxsatsiz profil yaratish ham noqonuniy, ham axloqiy emas.
uchta mini holat
1-holat - Kuzatilmagan qulash. Elektron tijorat kompaniyasi o'zining tavsiya modeli bilan jonli efirga chiqdi va kuzatuvni o'rnatmadi. 4 oydan keyin mahsulot katalogi sezilarli darajada o'zgardi; model eskirgan mahsulotlarni tavsiya qilishni davom ettirdi va konvertatsiya darajasi jimgina 30% ga kamaydi. Oylar davomida hech kim sezmadi. Dars: monitoringsiz joylashtirish ko'r bo'lib qoladi.
2-holat - Yashirin kamsitish. Ishga olish skrining modeli tarixiy ma'lumotlardagi gender nomutanosibligi va ayol nomzodlarni muntazam ravishda past baholaganligi haqida bilib oldi. Bu e'tiborga olinmadi, chunki adolat tahlili yo'q edi; Bu audit natijasida ma'lum bo'ldi va muassasa jiddiy reputatsiya/huquqiy xavfga duch keldi. Dars: Guruhga asoslangan adolatni nazorat qilish yuqori ta'sirli modellarda muhim ahamiyatga ega.
3-holat - Maxfiylikni buzish. Tahlilchilardan biri haqiqiy mijozlarning elektron pochta xabarlari va xaridlar tarixini o'z ichiga olgan faylni ommaviy AI vositasiga yukladi va "segmentlarni umumlashtiring" dedi. Shaxsiy ma'lumotlar muassasani tark etgan; KVKK jarayoni boshlandi. To'g'ri yo'l identifikatsiya maydonlarini olib tashlash va faqat anonim xususiyatlarni almashish edi. Dars: haqiqiy shaxsiy ma'lumotlar ochiq vositaga kirmaydi.
To'rt nusxa ko'chirish shablonlari
1) Joylashtirishdan oldingi nazorat ro'yxati:
Sizning rolingiz: MLOps maslahatchisi. Modelni ishlab chiqarishga qo'yishdan oldin tekshirishim kerak bo'lgan narsalarni sanab o'ting: versiya yaratish, monitoring ko'rsatkichlari, orqaga qaytarish rejasi, ishlash chegarasi, ma'lumotlarning siljishi haqida ogohlantirish, mas'ul shaxs. Har bir element uchun bir jumladan iborat "nima uchun bu muhim" tushuntirishini qo'shing. Men qaror qilaman.
2) Model siljishini kuzatish dizayni:
Ishlab chiqarishda tasniflash modeli uchun drift monitoringi rejasini taklif qiling: (1) qanday kirish taqsimotlarini kuzatishim kerak, (2) bashorat taqsimoti uchun qanday signal, (3) haqiqiy natija kelganda ishlashni qanday solishtirish kerak, (4) qaysi chegarada qayta tayyorlashni boshlash kerak. Shuningdek, kod skeletini taqdim eting.
3) adolat nazorati:
Modelimning turli guruhlar (masalan, yosh chegarasi, mintaqa) uchun ishlashini taqqoslaydigan kodni yozing: eslab qolish/aniqlik va har bir guruh uchun ijobiy qaror darajasi. Guruhlar o'rtasida sezilarli farq bo'lsa, ogohlantiring. Kauzal/siyosiy talqin qilish; Menga faqat farqlarni ko'rsating va men qarorni ko'rib chiqaman.
4) Maxfiylikni oldindan tekshirish:
AI vositasiga ma'lumot berishdan oldin, tekshiring: quyidagi ustunlar ro'yxatida shaxsiy/identifikatsiya ma'lumotlari (ism, elektron pochta, ID, telefon, manzil, IP) bormi? Agar shunday bo'lsa, qaysilarini olib tashlash yoki anonimlashtirish kerakligini ko'rsating. Ustunlar: [ro'yxat]. Maqsad: faqat anonim sxemani baham ko'rish.
Zaif taklif / Kuchli taklif
Zaif taklif:
Modelim tayyor, jonli efirga chiqing.
Joylashtirish bir qadam emas; Monitoring, orqaga qaytarish, adolat va maxfiylik nazoratisiz jonli efirga chiqish - bu falokat uchun jimgina taklif.
Kuchli so'rov:
Sizning rolingiz: mas'uliyatli MLOps maslahatchisi. Mening modelim o'qitilgan, men jonli efirga chiqishdan oldin to'liq tayyorgarlik ko'rmoqchiman. Yarating: (1) joylashtirishdan oldin nazorat ro'yxati, (2) drift monitoringi rejasi, (3) guruhga asoslangan adolatni tekshirish kodi, (4) maxfiylik tekshiruvi (shaxsiy ma'lumotlar mavjudmi). Shuningdek, yuqori ta'sirli qarorlarda inson roziligini qanday himoya qilishni taklif qiling. Yakuniy qarorlar meniki.
Bu erda tarqatish, monitoring, adolat va maxfiylik yagona mas'uliyatli jarayon sifatida ko'rib chiqiladi.
Umumiy xatolar
- Monitoringni o'rnatmasdan modelni joylashtirish. Model jimgina siljiydi va buzadi; Buni sezish uchun oylar ketishi mumkin.
- Adolat tekshiruvini chetlab o'tish. Yuqori aniqlikdagi model tizimli ravishda guruhga zarar etkazishi mumkin.
- Tushuntirilmagan qora quti qarorini qabul qilish. Yuqori ta'sirli qarorlar tushuntirilishi kerak; "Model shunday dedi" - etarli emas.
- AI vositasini ochish uchun haqiqiy shaxsiy ma'lumotlarni berish. KVKK/GDPR buzilishi; Diagramma va anonim misol etarli.
- Qarorni modelga topshirish. Mas'uliyat har doim odamda; Yuqori ta'sirli inson kuzatuvi saqlanadi.
Maslahat: Har bir model bilan jonli efirga chiqishdan oldin bitta savolni baland ovozda so'rang: "Agar bu model ertaga jimgina buzilib qolsa yoki guruhni nohaq jazolasa, men buni qanday sezaman va uni orqaga qaytaraman?" Agar bu savolga aniq javobingiz bo'lmasa, model hali ishlab chiqarishga tayyor emas.
qisqa bayoni; yakunida
Modelning ishi yuqori ball bilan tugamaydi, balki ishlab chiqarishda ishonchli va mas’uliyatli ishlash bilan tugaydi. MLOps - bu jonli efirga chiqish, driftni kuzatish, qayta tayyorlash va modelni orqaga qaytarish intizomi; Kuzatmasdan joylashtirish jimgina qulashdir. Etika modelning adolatliligi, shaffofligi va javobgarligini talab qiladi; statistik aniqlik axloqiy maqbullikni almashtira olmaydi. Maxfiylik shaxsiy ma'lumotlarni KVKK/GDPR tamoyillari bilan himoya qilishni va haqiqiy ma'lumotlarni ochiq vositalardan uzoqroq tutishni anglatadi. Bu qarorlarning barchasi texnik emas, balki mas'uliyatli qarorlardir va har doim insonga tegishli.
Ilova vazifasi
O'zingiz yaratgan (yoki taxminiy) modelni ishlab chiqarishga qo'ymoqchi bo'lganingizdek o'ylab ko'ring va to'rtta ro'yxatni to'ldiring: (1) joylashtirishdan oldingi nazorat ro'yxati, (2) siz kuzatib boradigan drift ko'rsatkichlari, (3) guruhga asoslangan adolatni nazorat qilish rejasi, (4) maxfiylik nazorati. Undan keyin “Ertaga jimgina buzilib qolsa, uni qanday sezaman va qaytarib olaman?” degan savolga aniq javob yozing.
nazorat ro'yxati
- [ ] Men modelni monitoring (slip alert) va orqaga qaytarish rejasi bilan ishlatyapmanmi?
- [ ] Turli guruhlar uchun adolat/samaradorlik farqini tekshirdimmi?
- [ ] Men yuqori ta'sirli qarorlar qabul qilishda odamlarning fikrini saqlab qoldimmi?
- [ ] Men shaxsiy maʼlumotlarni KVKK/GDPR tamoyillari bilan himoya qildimmi va ularni ochiq vositalardan uzoqroq tutdimmi?
- [ ] Men mas'uliyatni modelga emas, insonga yuklaganmanmi?
Modul imtihoni
1. Ma'lumot olimi sun'iy intellektdan "Bu ma'lumotlarda tasodifiy o'rmon qanchalik to'g'ri?" modelni umuman o'rgatmasdan va to'g'ridan-to'g'ri "89%" javobini taqdimotga qo'yadi. Ushbu yondashuvning asosiy xatosi nimada?
- A) Sun'iy intellektga ma'lumotlar va modellar bermasdan o'lchovlarni kutish; U ishlab chiqaradigan raqam soxta ekanligini va haqiqiy ko'rsatkichni faqat trening va test orqali topish mumkinligiga e'tibor bermaslik ✔
- B) Tasodifiy o'rmon o'rniga logistik regressiyadan foydalanish kerak
- C) Aniqlik darajasi har doim 90% dan yuqori bo'lishi kerak.
- D) Taqdimotga ko'rsatkichlarni kiritish qat'iyan man etiladi
Tushuntirish: Sun'iy intellekt model va ma'lumotlarga kirmasdan metrikani ishlab chiqa olmaydi; U bergan raqam gallyutsinatsiya (to'qima). Ko'rsatkich model haqiqatda o'qitilgan va sinovdan o'tkazilgandan keyingina ma'lumotlar olimining shaxsiy hisob-kitobi bilan olinadi. Tasdiqlanmagan chiqish imzosiz hisobotga o'xshaydi.
2. “Hisobni yopish sababi” ustuni uzilishlar prognozi uchun maʼlumotlarni yigʻishda kiritiladi; Ushbu ustun faqat mijoz ketganidan keyin to'ldiriladi. Model sinov to'plamida 97% beradi, lekin ishlab chiqarishda ishlamaydi. Bu holatning nomi va sababi nima?
- A) Qo‘shimcha o‘rganish; Model juda murakkab
- B) Ma'lumotlarning sizib chiqishi; ✔ Bashorat qilish vaqtida mavjud bo'lmaydigan, ammo maqsadning natijasi bo'lgan ma'lumotlardan xususiyat sifatida foydalanish
- C) O‘rganishning yetarli darajada emasligi; Model juda oddiy
- D) Tanlovning tarafkashligi; kichik namuna hajmi
Izoh: Bu klassik ma'lumotlar sizib chiqishi: "yopilish sababi" maqsad natijasidir va bashorat qilish vaqtida hali ham bo'sh. Model ushbu kelajakdagi bilim bilan hiyla-nayrang qiladi, u test to'plamida ajoyib ko'rinadi, lekin ishlab chiqarishda ishdan chiqadi, chunki bu ustun bo'sh. Har bir ustunga "bashorat paytida menda bormi" degan savol berilishi kerak.
3. Tahlilchi daromad ustunidagi etishmayotgan qiymatlarni o'rtacha qiymat bilan to'ldiradi; ammo bedarak yo'qolganlar aslida hech qachon daromadini e'lon qilmagan kam ta'minlangan segmentga tegishli (tizimli yo'qolgan). Nima uchun bu to'ldirish noto'g'ri?
- A) O‘rtacha har doim medianadan katta, shuning uchun u noto‘g‘ri
- B) etishmayotgan qiymatlar hech qachon to'ldirilmasligi kerak, ular doimo o'chirilishi kerak
- C) Tizimli bo'shliqni o'rtacha ko'rsatkich bilan to'ldirish ushbu guruhni sun'iy ravishda ifodalash orqali ma'lumotlarni buzadi; To‘ldirish “nega bo‘sh?” degan savolsiz amalga oshirildi. ✔
- D) O'rtachani hisoblash ishlash muammosini keltirib chiqaradi, chunki u juda sekin
Tushuntirish: Kamchilikning sababi yechimni belgilaydi. Tizimli etishmayotgan (ma'lum bir guruhda jamlangan bo'shliq) o'rtacha bilan to'ldirilganda, bu guruh sun'iy ravishda "o'rtacha daromad" ga aylanadi va ma'lumotlar buziladi. Uni to'ldirishdan oldin "nima uchun bo'sh" degan savolni berish kerak; tizimli/muhim etishmayotgan o'rtacha to'ldirilmasligi kerak.
4. Jamoa "reklama xarajatlari" va "sotish" o'rtasida 0,78 korrelyatsiyani topadi va byudjetni ikki baravar oshiradi; Biroq, aslida ikkalasini ham qo'zg'atadigan narsa mavsumiy kampaniyalardir. Statistikada qaysi tamoyil bu xatoni tushuntiradi?
- A) Korrelyatsiya sabab bog‘lanish emas; Yashirin uchinchi o'zgaruvchi ikkala o'zgaruvchiga ham ta'sir qilishi mumkin ✔
- B) 0,78 ning korrelyatsiyasi juda past bo'lganligi sababli, munosabatni e'tiborsiz qoldirish kerak
- C) Korrelyatsiya har doim sababiy bog'liqlikni isbotlaydi, jamoa buni to'g'ri tushundi
- D) Reklama va sotish o'rtasidagi bog'liqlikni matematik tarzda hisoblab bo'lmaydi.
Tushuntirish: korrelyatsiya sabab-oqibat emas. Ikki o'zgaruvchi birgalikda harakat qilishi mumkin, chunki yashirin uchinchi o'zgaruvchi (bu erda mavsumiy kampaniyalar) ikkalasiga ham ta'sir qiladi. Birining ikkinchisini keltirib chiqaradigan xulosasini faqat tajriba va dala bilimlari orqali aniqlash mumkin; Korrelyatsiyalar sonining o'zi sabab-oqibatning dalili emas.
5. Firibgarlikni aniqlash modeli 99,2% aniqlikni ko'rsatadi va jamoa bayram qiladi; Biroq, ma'lumotlardagi soxta tranzaksiya darajasi atigi 0,8% va modelni chaqirib olish 6% ni tashkil qiladi. Ushbu jadval nimani ko'rsatadi?
- A) Model mukammal, chunki aniqlik 99% dan yuqori
- B) Aniqlik muvozanatsiz ma'lumotlar bilan chalg'itadi; Model deyarli barcha soxta narsalarni o'tkazib yuboradi (past eslab qolish), tegishli ko'rsatkichni ko'rib chiqish kerak ✔
- C) Modelning eslab qolish darajasi yuqori bo'lgani uchun hech qanday muammo yo'q
- D) Soxta ko'rsatkich past bo'lgani uchun modelni qurishning hojati yo'q edi
Izoh: "Aniqlik" balanssiz ma'lumotlarda chalg'itadi. Model deyarli har bir tranzaksiyani "toza" deb atasa, u yuqori aniqlikka erishadi, chunki soxtalar juda kam, lekin u soxta narsalarni ushlay olmaydi, bu uning asosiy maqsadi (6% ni eslang). Shuning uchun, muvozanatsiz muammolarda asosiy e'tibor aniqlikka emas, balki chalkashlik matritsasiga va ishning maqsadiga mos keladigan ko'rsatkichlarga, masalan, eslab qolish/aniqlikga qaratiladi.
6. Talabni prognozlash loyihasida vaqtga bog'liq ma'lumotlar tasodifiy ravishda trening/testga bo'linadi. Model 93% aniqlikni beradi, lekin ishlab chiqarishda qulab tushadi. To'g'ri taqsimlash usuli qanday bo'lishi kerak?
- A) Test majmuasini kattalashtirish, masalan. bo'linish 50%/50%
- B) Murakkabroq modeldan foydalanish
- C) Bo'limni butunlay olib tashlang va barcha ma'lumotlar bilan mashq qiling
- D) Xronologik bo'linish: eski davr bilan mashq qilish va yangi davr bilan sinovdan o'tkazish, shu bilan modelning kelajakni ko'rishiga to'sqinlik qiladi ✔
Izoh: Vaqt seriyalari ma'lumotlarida tasodifiy bo'linish amalga oshirilsa, model kelajakni ko'radi va treningda o'tmishni bashorat qiladi; bu oqish va aslida mavjud bo'lmagan muvaffaqiyatni keltirib chiqaradi. To'g'ri yondashuv - xronologik bo'linish: eski davr bilan o'qitish va yangi davr bilan sinovdan o'tkazish, ishlab chiqarishdagi haqiqiy vaziyatga taqlid qilish (o'tmishdan kelajakka bashorat qilish).
7. Xususiyat muhandisligida masshtablash (StandardScaler) parametrlarini qanday ma'lumotlardan hisoblash kerak va ularni qanday qo'llash kerak?
- A) To'g'riroq bo'lishi uchun barcha ma'lumotlardan (o'qitish + testlarni birgalikda) hisoblash kerak
- B) Har bir satr uchun alohida, shu qatorning o'z qiymatidan hisoblanishi kerak
- C) Faqat test ma'lumotlaridan hisoblanishi kerak
- D) U faqat o'quv ma'lumotlaridan hisoblanishi kerak, keyin test ma'lumotlariga bir xil parametrlar qo'llanilishi kerak; aks holda u oqadi ✔
Tushuntirish: Masshtablash, kodlash va to'ldirish kabi barcha transformatsiyalarning parametrlari (o'rtacha, standart og'ish va boshqalar) faqat o'quv ma'lumotlaridan o'rganilishi kerak, keyin test ma'lumotlariga ham xuddi shunday qo'llanilishi kerak. Sinov ma'lumotlarini hisobga olish, shuningdek, test ma'lumotlarining mashg'ulotlarga xalaqit berishiga, ya'ni sizib chiqishiga olib keladi va modelni avvalgidan ko'ra yaxshiroq qiladi. Quvur liniyasidan foydalanish buni ta'minlaydi.
8. Model o'quv majmuasida 98% va test to'plamida 72% aniqlikni beradi. Bu alomat nimani ko'rsatadi va nima qilish kerak?
- A) yetarli darajada o‘rganmaslik; modelni murakkabroq qilish kerak
- B) Ma'lumotlarning sizib chiqishi; test majmuasini o'zgartirish kerak
- C) Ortiqcha moslashish; model soddalashtirilgan bo'lishi kerak, tartibga solish va o'zaro tasdiqlashni qo'llash kerak ✔
- D) Oddiy holat; Ta'lim balli har doim yuqori bo'ladi, ehtiyot choralari kerak emas
Izoh: Treningda juda yuqori ball va testda sezilarli darajada past ball haddan tashqari moslashishning klassik alomatidir: model haqiqiy naqsh emas, balki mashg'ulot ma'lumotlarining shovqinini yodlab oldi. Yechimlar modelni soddalashtirish, qo'shimcha ma'lumotlar, tartibga solish va o'zaro tekshirish bilan holatni tekshirishni o'z ichiga oladi. Faqat ta'lim balliga tayanish bu xatoni yashiradi.
9. Boshqaruv taqdimotida sotuvlar 1000 dan 1020 gacha ko'tarilgan shtrixli diagrammaning y o'qi o'sish katta ko'rinishi uchun 980 dan boshlanadi. Haqiqiy o'sish 2% ni tashkil qiladi. Nima uchun bu axloqiy masala?
- A) Kesilgan y o'qi kichik farqni vizual ravishda oshirib yuboradi va tomoshabinni chalg'itadi; Adolat uchun, taqqoslash panelidagi o'q 0 dan boshlanishi kerak ✔
- B) Shtrixli diagrammalardan hech qachon savdo ma’lumotlari uchun foydalanilmaydi
- C) Hech qanday muammo yo‘q; Grafikni ta'sirchan ko'rinishga keltirish har doim yaxshi
- D) Y o'qi har doim ma'lumotlarning eng katta qiymatidan boshlanishi kerak
Izoh: Qiyosiy maqsadlar uchun shtrixli diagrammalarda y o'qi odatda 0 dan boshlanishi kerak. O'qni kesish va 980 dan boshlash kichik 2% farq vizual jihatdan katta ko'rinadi va tomoshabinni chalg'itadi. Ma'lumotlar bo'yicha mutaxassisning axloqiy mas'uliyati ma'lumotlarni ortiqcha yoki kamaytirmaydigan halol grafiklarni chizishdir.
10. Tahlilchi buyurtmalarni mahsulot jadvali bilan QO'SHILGAN so'ng jami aylanmani 3 marta topadi; Chiziqlar soni 240 mingdan 690 mingga oshdi. Bu jim xatoni oldini olish uchun nima qilish kerak edi?
- A) Jami tovar aylanmasini 3 ga bo‘ling
- B) JOIN o'rniga har doim alohida so'rovlardan foydalaning
- C) Mahsulotlar jadvalini butunlay yo'q qilish
- D) Birlashtirish/JOIN dan keyin qatorlar sonini tekshirish va ularning to'g'ri tugma orqali birlashtirilganligini tekshirish; Replikatsiyani erta ushlash ✔
Izoh: Agar mahsulot jadvalida har bir mahsulot uchun bir nechta qatorlar mavjud bo'lsa (masalan, turli rangda), noto'g'ri tugma orqali JOIN har bir buyurtmani takrorlaydi va jami ko'paytiradi. Kod xatosiz ishlaydi, ammo natija noto'g'ri. Bunga yo'l qo'ymaslikning yo'li har bir birlashma/JOINdan keyin qatorlar sonini tekshirish va to'g'ri kalit bilan birlashtirishdir.
11. Ishga qabul qilish skrining modeli tarixiy ma'lumotlarda va tizimli ravishda ayol nomzodlar ballari ostida gender nomutanosibligi haqida bilib oladi, lekin uning umumiy aniqligi yuqori. Bu qanday ma'nono bildiradi?
- A) Hech qanday muammo yo'q, chunki model yuqori aniqlikka ega
- B) Statistik aniqlik axloqiy maqbullikni almashtirmaydi; model o'tmishdagi kamsitish haqida bilib oldi, guruhga asoslangan adolatni tekshirish talab qilinadi ✔
- C) Modelning aniqligini yanada oshirish muammoni hal qiladi
- D) Adolat ma'lumotlar fanining doirasidan tashqarida
Izoh: Model statistik jihatdan to'g'ri bo'lsa ham, axloqiy jihatdan qabul qilinishi mumkin emas. Model o'tgan ma'lumotlardagi adolatsizlikni o'rganadi va diskriminatsiyani avtomatlashtiradi. Yuqori halollik adolat o'rnini bosa olmaydi; Yuqori ta'sirli modellarda turli guruhlar uchun ishlash/qarorlar farqini o'lchaydigan adolat nazorati muhim ahamiyatga ega va yakuniy javobgarlik inson zimmasiga tushadi.
12. Xodim haqiqiy mijozlarning elektron pochta xabarlari va xaridlar tarixini o‘z ichiga olgan faylni umumiy sun’iy intellekt vositasiga yuklaydi va “segmentlarni umumlashtirish” deydi. Nima uchun bu jiddiy xato va to'g'ri yo'l nima?
- A) Hech qanday muammo yo‘q; AI vositalari hech qachon ma'lumotlarni saqlamaydi
- B) Xato fayl juda katta; qisqartirilishi kerak edi
- C) Ochiq vositaga haqiqiy shaxsiy ma'lumotlarni taqdim etish KVKK/GDPRni buzish hisoblanadi; identifikatsiya maydonlari olib tashlanishi va faqat anonim sxema/mulk baham ko'rilishi kerak ✔
- D) CSV faqat Excel o'rniga ishlatilishi kerak edi
Izoh: Haqiqiy shaxsiy ma'lumotlar (masalan, elektron pochta, ism va boshqalar) ommaviy foydalanish mumkin bo'lgan sun'iy intellekt vositasiga berilganda, KVKK / GDPR doirasida maxfiylik buzilishi sodir bo'ladi; ma'lumotlar tashkilotni tark etadi. Ko'pincha diagramma va anonim/sintetik namuna tahlil qilish uchun etarli. To'g'ri yo'l identifikatsiya maydonlarini olib tashlash va faqat anonim xususiyatlarni almashishdir.
13. Tavsiya modeli ishlab chiqarishga kiritildi, lekin kuzatuv o'rnatilmagan; Mahsulotlar katalogi 4 oydan keyin o'zgarganda, model eski mahsulotlarni tavsiya etishda davom etadi va konvertatsiya darajasi jimgina 30% ga tushadi. Bu hodisaning nomi nima?
- A) Qo‘shimcha o‘rganish; Model o'quv majmuasini yodlab oladi
- B) Model drifti; Dunyo o'zgargan sari, model jimgina, sezilmasdan eskiradi, chunki monitoring o'rnatilmagan ✔
- C) Tanlovning tarafkashligi; namuna tarafkashligi
- D) Ma'lumotlarni minimallashtirish buzilishi
Izoh: Bu modelning siljishi (model/ma'lumotlarning siljishi): dunyo o'zgarganda (katalog, xatti-harakatlar, mavsum) model o'qitilgan sharoitlar o'zgaradi va model jimgina buziladi. Ishlab chiqarishga qo'yilgan model o'z-o'zidan yomonlashadi; Bu “qachon” masalasi. Monitoringsiz joylashtirish (kirish va ishlashni kuzatish) degradatsiyani aniqlashni imkonsiz qiladi.
14. Bitta trening/test boʻlinishida 88% aniqlikka ega boʻlgan model 88%, 71%, 83%, 64%, 79% 5 marta oʻzaro tekshirish ballariga ega. Bu nimani ko'rsatadi va nima uchun o'zaro tekshirish muhim?
- A) Model barqaror; 88% haqiqiy ishlash
- B) O‘zaro tekshirish kerak emas; Bitta bo'lim etarli
- C) Ballarning katta o’zgaruvchanligi modelning beqaror ekanligini ko’rsatadi; o'zaro tekshirish o'rtacha ishlashga asoslanadi va bitta omadli quti emas, balki bir nechta qutilarning taqsimlanishi ✔
- D) Eng yuqori ball (88%) haqida xabar berish yaxshidir.
Tushuntirish: bitta bo'lim omadli yoki omadsiz bo'lishi mumkin; 88% shunchaki oson bo'linish natijasi edi. O'zaro tekshirish ma'lumotlarni bir necha marta bo'lib, o'rtacha (bu erda ~ 77%) ishlashga asoslanadi va ballarning o'zgaruvchanligini ko'rsatadi. Bu erda yuqori volatillik modelning beqaror ekanligini ko'rsatadi; Bitta bo'limga tayanish noto'g'ri.