Dobički:
- Sposobnost razumevanja faz MLOps (izdaja, uvajanje, spremljanje, ponovno usposabljanje, povrnitev nazaj) in premikanja modela ter načrtovanja nadzorovane uvedbe
- Sposobnost uporabe načel pravičnosti modela, preglednosti in odgovornosti ter razlikovanja med statistično natančnostjo in etično sprejemljivostjo
- Sposobnost varovanja osebnih podatkov z načeli KVKK/GDPR in dodelitve končne odgovornosti človeku pri odločitvah z velikim vplivom
Usposabljanje modela in doseganje visoke ocene ni konec, ampak sredina. Prava vrednost pride, ko je model dan v proizvodnjo in deluje zanesljivo, se spremlja skozi čas brez poslabšanja, celoten proces pa poteka znotraj etičnih in zakonskih meja. Ta zaključna enota združuje tri teme: MLOps (disciplina obveščanja, spremljanja in vzdrževanja modelov), etika (pravičnost, preglednost, neškodljivost) in zasebnost (varovanje osebnih podatkov). AI proizvaja kodo, kontrolne sezname in načrte na teh področjih; Toda ljudje se odločijo, ali bo model deloval, na koga bo vplival in katere podatke je mogoče uporabiti. Te odločitve niso tehnične, temveč odgovornosti.
MLOps: model živi kot izdelek
MLOps (Machine Learning Operations – praksa izvajanja, spremljanja in posodabljanja modelov strojnega učenja v proizvodnji) je prilagoditev DevOps pri razvoju programske opreme podatkovni znanosti. Osnovna ideja: model ni datoteka, ki se enkrat natrenira in pozabi, temveč živi izdelek, ki zahteva stalno vzdrževanje. Glavne stopnje:
1. Različice: koda (Git), podatki in model so različice skupaj; Zapisano je, kateri model je bil izdelan s katerimi podatki in kodo.
2. Razmestitev: Model se objavi kot API ali paketno opravilo. Običajno je najprej namenjena majhnemu občinstvu (distribucija v senci/kanarčku).
3. Spremljanje: Delovanje modela in vhodnih podatkov se nenehno spremlja.
4. Preusposabljanje: Ko se zmogljivost zmanjša, se model ponovno usposobi s posodobljenimi podatki.
Premik vzorca: tiho popačenje
Največja nevarnost v proizvodnji je model drift (model drift / data drift). Svet se spreminja; Pogoji, na katerih ste učili svoj model (vedenje strank, cene, sezona, zakonodaja), se sčasoma spreminjajo in model začne zastareti. Na primer, model povpraševanja, naučen pred pandemijo, je med pandemijo popolnoma napačen. Odmik se pojavlja v dveh oblikah: odmik podatkov (razporeditev sprememb vhodnih podatkov) in odmik koncepta (razmerje med vhodnimi in ciljnimi spremembami). Način za zajemanje teh je spremljanje: stalno spremljanje porazdelitve vnosa, porazdelitve napovedi in (če je mogoče) uspešnosti v primerjavi z dejanskim rezultatom.
Pozor: model, ki je dan v proizvodnjo, se bo sam pokvaril; Ne gre za vprašanje "če" ampak "kdaj". Uvajanje modelov brez nastavitve nadzora je kot vožnja avtomobila, ne da bi kdaj nadzorovali njegov motor; Nekega dne samo tiho sedi in ne opaziš.
element MLOps
Namen
Če se zanemari
Versioning
Vedeti, kaj se proizvaja
Ni ponovljivo, ni sledljivo
Spremljanje
Zgodaj opaziti spodrsljaj
Model se tiho pokvari
prekvalifikacija
ostanite na tekočem
Napovedi se starajo
Povratek nazaj
vrnitev k slabemu modelu
Napačen model ostane živ
Dokumentacija
preglednost, promet
Informacije se zataknejo v eni osebi
Etika: modelne odločitve vplivajo na ljudi
Podatkovni modeli se vse bolj uporabljajo pri odločitvah, ki vplivajo na življenja ljudi: krediti, najemanje, zavarovanje, pravosodje. S to močjo pride odgovornost. Glavna etična tveganja:
Pristranskost in diskriminacija: model se lahko nauči in ohranja krivice v zgodovinskih podatkih. Če je bila določena skupina v preteklosti deležna manj zaslug, model predvideva, da je to "pravilo" in avtomatizira diskriminacijo. Zato je analiza pravičnosti – preverjanje, ali model deluje podobno za različne skupine (spol, starost, regija) – bistvenega pomena.
Preglednost in razložljivost: Morali bi biti sposobni razložiti, zakaj je model zavrnil osebo. "Črna skrinjica je tako rekla" je etično in pogosto pravno nesprejemljivo. Zato so orodja za razložljivost (pomembnost značilnosti, vrednosti SHAP) dragocena.
Odgovornost: kdo je odgovoren, če se model napačno odloči? Odgovor je vedno oseba/institucija, ne model. Človeški nadzor (človek v zanki – človek, ki odobri končno odločitev) je treba ohraniti pri odločitvah z velikim vplivom.
Pozor: model je lahko statistično "pravilen", vendar etično nesprejemljiv. Zelo natančen model, ki sistematično postavlja eno skupino v slabši položaj, ni dober model. Poštenost ni nadomestilo za pravičnost.
Zasebnost: osebne podatke skrbno varujemo
Surovina podatkovne znanosti so pogosto osebni podatki in ti podatki so zaščiteni z zakonom: KVKK v Turčiji, GDPR v Evropi. Osnovna načela so: omejitev namena (podatki se ne uporabljajo za druge namene kot za namen, za katerega so bili zbrani), minimizacija podatkov (ne zbira/hrani se več podatkov, kot je potrebno), anonimizacija (identifikacijski podatki so odstranjeni) in varnost (podatki se hranijo šifrirani in dostop je omejen). Ključno pravilo pri delu z orodji AI: nikoli ne prilepite resničnih osebnih podatkov v javno orodje AI. Največkrat za analizo zadostujeta diagram in anonimni/sintetični vzorec.
Dodaten poudarek v kontekstu informacijske varnosti: uporabljajte orodja in tehnike podatkovne znanosti samo na podatkih in sistemih, za katere imate pooblastila, za namene obrambne in legitimne analize. Nepooblaščen dostop do podatkov nekoga drugega, ponovna identifikacija posameznikov (izvlekanje identitete iz anonimnih podatkov) ali nepooblaščeno profiliranje je nezakonito in neetično.
trije mini kovčki
1. primer – sesutje brez sledenja. Podjetje za e-trgovino je začelo delovati s svojim modelom priporočil in ni nastavilo sledenja. Po 4 mesecih se je katalog izdelkov močno spremenil; model je še naprej priporočal zastarele izdelke, stopnja konverzije pa je tiho padla za 30 %. Mesece ni nihče opazil. Lekcija: uvajanje brez spremljanja je slepo.
Primer 2 – Skrita diskriminacija. Model preverjanja zaposlovanja je izvedel za neravnovesje med spoloma v zgodovinskih podatkih in sistematično podcenjeval kandidatke. Ni bilo opaziti, ker ni bilo analize pravičnosti; To je bilo razkrito pri reviziji in institucija se je soočila z resnim tveganjem za ugled/pravnim tveganjem. Lekcija: skupinski nadzor poštenosti je bistvenega pomena pri modelih z velikim vplivom.
Primer 3 – Kršitev zaupnosti. En analitik je v javno orodje umetne inteligence naložil datoteko, ki je vsebovala resnična e-poštna sporočila strank in zgodovino nakupov, in rekel: »povzemite segmente«. Osebni podatki so zapustili institucijo; Postopek KVKK se je začel. Pravilen način je bil odstraniti polja identitete in deliti samo anonimne lastnosti. Nauk: pravi osebni podatki ne vstopijo v odprto orodje.
Štiri predloge za kopiranje
1) Kontrolni seznam pred uvedbo:
Vaša vloga: MLOps svetovalec. Naštejte stvari, ki jih moram preveriti, preden dam model v produkcijo: različice, meritve spremljanja, načrt za povrnitev, prag zmogljivosti, opozorilo o odmiku podatkov, odgovorna oseba. Za vsako postavko dodajte razlago v enem stavku »zakaj je pomembno«. se bom odločil.
2) Zasnova sledenja premikom modela:
Predlagajte načrt spremljanja premikanja za klasifikacijski model v proizvodnji: (1) katere porazdelitve vnosa naj spremljam, (2) kateri alarm za porazdelitev napovedi, (3) kako primerjati uspešnost, ko pride dejanski rezultat, (4) pri katerem pragu je treba sprožiti ponovno usposabljanje. Zagotovite tudi okostje kode.
3) Nadzor poštenosti:
Napišite kodo, ki primerja uspešnost mojega modela za različne skupine (npr. starostni razred, regijo): stopnja priklica/natančnosti in pozitivne odločitve za vsako skupino. Opozori, če obstaja velika razlika med skupinami. ustvarjanje vzročnih/političnih interpretacij; Samo pokažite mi razlike in razmislil bom o odločitvi.
4) Predhodno preverjanje zasebnosti:
Preden posredujete podatke orodju AI, preverite: ali so na spodnjem seznamu stolpcev osebni/identitetni podatki (ime, e-pošta, ID, telefon, naslov, IP)? Če je tako, navedite, katere bi bilo treba odstraniti ali anonimizirati. Stolpci: [seznam]. Namen: deliti samo anonimno shemo.
Šibek poziv/močan poziv
Šibek poziv:
Moj model je pripravljen, v živo.
Uvajanje ni en korak; Vklop v živo brez nadzora, povrnitve, pravičnosti in nadzora zasebnosti je tiho vabilo na katastrofo.
Močan poziv:
Vaša vloga: odgovorni MLOps svetovalec. Moj model je bil usposobljen, želim popolno pripravo, preden začnem delovati. Ustvarite: (1) kontrolni seznam pred uvedbo, (2) načrt za spremljanje premikanja, (3) skupinsko kodo za preverjanje poštenosti, (4) preverjanje zasebnosti (ali obstajajo osebni podatki). Predlagajte tudi, kako zaščititi človeško soglasje pri odločitvah z velikim vplivom. Končne odločitve so moje.
Tukaj se distribucija, spremljanje, pravičnost in zasebnost obravnavajo kot en odgovoren proces.
Pogoste napake
- Namestitev modela brez nastavitve spremljanja. Model tiho zdrsne in se izkrivlja; Lahko traja mesece, da opazite.
- Mimo pravosodnega pregleda. Visoko zvest model lahko sistematično prikrajša skupino.
- Sprejem nepojasnjene odločitve črne skrinjice. Odločitve z velikim učinkom morajo biti razložljive; "Manekenka je tako rekla" ni dovolj.
- Dajanje resničnih osebnih podatkov za odprto orodje AI. kršitev KVKK/GDPR; Zadostujeta diagram in anonimni primer.
- Prenos odločitve na model. Odgovornost je vedno na osebi; Ohranja se močan nadzor ljudi.
Namig: Preden začnete s posameznim modelom v živo, postavite eno vprašanje na glas: »Če se ta model jutri tiho pokvari ali nepravično kaznuje skupino, kako ga bom opazil in vrnil?« Če na to vprašanje nimate jasnega odgovora, model še ni pripravljen za proizvodnjo.
Če povzamem
Delo modela se ne konča z visoko oceno, temveč z zanesljivim in odgovornim delom v proizvodnji. MLOps je disciplina sproščanja, spremljanja zanašanja, ponovnega usposabljanja in vračanja modela; Uvajanje brez sledenja je tiho sesutje. Etika zahteva pravičnost, preglednost in odgovornost modela; statistična natančnost ni nadomestilo za etično sprejemljivost. Zasebnost pomeni varovanje osebnih podatkov z načeli KVKK/GDPR in ohranjanje resničnih podatkov stran od odprtih orodij. Vse te odločitve niso tehnične, temveč odgovorne in vedno pripadajo človeku.
Aplikacijska naloga
Pomislite na to, kot da bi model, ki ste ga zgradili (ali hipotetični), dali v proizvodnjo in izpolnite štiri sezname: (1) kontrolni seznam pred uvedbo, (2) meritve premikanja, ki jim boste sledili, (3) skupinski načrt nadzora pravičnosti, (4) nadzor zasebnosti. Nato napišite konkreten odgovor na vprašanje "Kako bom opazil, če se jutri tiho pokvari in ga dobil nazaj?"
kontrolni seznam
- [ ] Ali uvajam model z nadzorom (opozorilo o zdrsu) in načrtom za povrnitev?
- [ ] Ali sem preveril vrzel med pravičnostjo in uspešnostjo za različne skupine?
- [ ] Ali sem vzdrževal človeško vpetje pri odločitvah z velikim vplivom?
- [ ] Ali sem osebne podatke zaščitil z načeli KVKK/GDPR in jih hranil stran od odprtih orodij?
- [ ] Ali sem končno odgovornost preložil na človeka, ne na model?
Modulni izpit
1. Podatkovni znanstvenik vpraša umetno inteligenco: "Kako natančen je naključni gozd na teh podatkih?" ne da bi sploh usposobil modela, in neposredno postavi odgovor "89 %" v predstavitev. Kaj je temeljna napaka v tem pristopu?
- A) Čakanje na meritve brez dajanja podatkov in modelov umetni inteligenci; Ignoriranje dejstva, da je število, ki ga ustvari, lažno in da je pravo meritev mogoče najti le z usposabljanjem in testiranjem ✔
- B) Uporabiti mora logistično regresijo namesto naključnega gozda
- C) Stopnja natančnosti mora biti vedno nad 90 %.
- D) V predstavitev je strogo prepovedano vključevati metrike
Pojasnilo: Umetna inteligenca ne more izdelati metrike brez dostopa do modela in podatkov; Številka, ki jo navaja, je halucinacija (izmišljena). Metrika se pridobi z lastnim izračunom podatkovnega znanstvenika šele potem, ko je bil model dejansko usposobljen in preizkušen. Nepreverjen izpis je kot nepodpisano poročilo.
2. Stolpec 'razlog za zaprtje računa' je vključen pri zbiranju podatkov za napoved odliva; Ta stolpec se izpolni šele, ko stranka odide. Model daje 97% na testnem nizu, vendar ne deluje v proizvodnji. Kakšno je ime in vzrok tega stanja?
- A) Preučenje; Model je preveč zapleten
- B) Puščanje podatkov; ✔ Uporaba informacij, ki ne bodo na voljo v času napovedi, vendar so rezultat cilja, kot funkcija
- C) Nezadostno učenje; Model je preveč preprost
- D) Pristranskost izbire; majhna velikost vzorca
Pojasnilo: To je klasično uhajanje podatkov: 'razlog zapiranja' je posledica cilja in je v času predvidevanja še vedno prazen. Model se dobro znajde s tem prihodnjim znanjem, na testnem nizu je videti odlično, vendar se v proizvodnji zruši, ker je ta stolpec prazen. K vsakemu stolpcu je treba postaviti vprašanje "ali ga imam v času napovedi".
3. Analitik izpolni manjkajoče vrednosti v stolpcu prihodkov s srednjo vrednostjo; vendar pogrešani dejansko spadajo v segment z nizkimi dohodki, ki nikoli ni prijavil dohodkov (sistematski pogrešani). Zakaj je to polnjenje napačno?
- A) Povprečna vrednost je vedno večja od mediane, zato ni pravilna
- B) Manjkajočih vrednosti ne smete nikoli izpolniti, vedno jih je treba izbrisati
- C) Zapolnitev sistematične vrzeli s povprečjem popači podatke z umetnim predstavljanjem te skupine; Polnjenje je potekalo brez vprašanja 'zakaj je prazno?' ✔
- D) Izračun povprečja povzroča težave z zmogljivostjo, ker je prepočasen
Pojasnilo: Vzrok pomanjkanja določa rešitev. Ko se sistematično manjkajoče (vrzel, skoncentrirana v določeni skupini) zapolni s povprečjem, ta skupina postane umetno "povprečni dohodek" in podatki so popačeni. Preden ga napolnite, si je treba zastaviti vprašanje, zakaj je prazen; sistematična/značilna manjkajoča sredina se ne sme zapolniti.
4. Ekipa najde korelacijo 0,78 med 'porabo oglasov' in 'prodajo' ter podvoji proračun; Toda tisto, kar dejansko sproži oboje, so sezonske kampanje. Katero načelo v statistiki pojasnjuje to napako?
- A) Korelacija ni vzročna zveza; Skrita tretja spremenljivka morda vpliva na obe spremenljivki ✔
- B) Ker je korelacija 0,78 prenizka, je treba razmerje zanemariti
- C) Korelacija vedno dokaže vzročno zvezo, ekipa je imela prav
- D) Korelacije med oglaševanjem in prodajo ni mogoče izračunati matematično.
Pojasnilo: Korelacija ni vzročna zveza. Obe spremenljivki lahko delujeta skupaj, ker skrita tretja spremenljivka (tukaj sezonske akcije) vpliva na obe. Sklep, da eno povzroča drugo, je mogoče ugotoviti le z eksperimentom in terenskim znanjem; Samo število korelacij ni dokaz vzročnosti.
5. Model za odkrivanje goljufij pokaže 99,2-odstotno natančnost in ekipa slavi; Vendar je stopnja lažnih transakcij v podatkih le 0,8 %, odpoklic modela pa 6 %. Kaj prikazuje ta tabela?
- A) Model je popoln, ker je natančnost nad 99 %
- B) Natančnost je zavajajoča z neuravnoteženimi podatki; Model zgreši skoraj vse ponaredke (nizek priklic), treba je pogledati ustrezno metriko ✔
- C) Ni problema, saj je odpoklic modela velik
- D) Ni bilo potrebe po izdelavi modela, ker je bila stopnja ponaredkov nizka
Pojasnilo: 'Točnost' je zavajajoča pri neuravnoteženih podatkih. Ko model skoraj vsako transakcijo označi za "čisto", dobi visoko natančnost, ker je ponaredkov zelo malo, vendar ne uspe ujeti ponaredkov, kar je njegov glavni namen (spomnimo se 6 %). Zato pri neuravnoteženih težavah poudarek ni na natančnosti, ampak na matriki zmede in meritvah, primernih za namen opravila, kot je priklic/natančnost.
6. V projektu napovedovanja povpraševanja so časovno odvisni podatki naključno razdeljeni na usposabljanje/testiranje. Model daje 93-odstotno natančnost, vendar se v proizvodnji zruši. Kakšen naj bo pravilen pristop k delitvi?
- A) Povečanje testnega niza, npr. delitev 50%/50%
- B) Uporaba kompleksnejšega modela
- C) Popolnoma odstranite particijo in trenirajte z vsemi podatki
- D) Kronološka delitev: urjenje s starim obdobjem in testiranje z novim obdobjem, s čimer preprečimo, da bi model videl prihodnost ✔
Pojasnilo: Če se izvede naključna delitev v podatkih časovne serije, model vidi prihodnost in napove preteklost v usposabljanju; je uhajanje in ustvarja uspeh, ki dejansko ne obstaja. Pravilen pristop je kronološka delitev: urjenje s starim obdobjem in testiranje z novim obdobjem, posnemanje realnega stanja v proizvodnji (napovedovanje iz preteklosti v prihodnost).
7. Iz katerih podatkov je treba izračunati parametre skaliranja (StandardScaler) pri inženiringu funkcij in kako jih uporabiti?
- A) Izračunati ga je treba iz vseh podatkov (usposabljanje + testiranje skupaj), da bo bolj natančen
- B) Izračunati ga je treba posebej za vsako vrstico iz lastne vrednosti te vrstice
- C) Izračunati ga je treba samo iz podatkov o preskusu
- D) Izračunati ga je treba samo iz podatkov o usposabljanju, nato pa je treba iste parametre uporabiti za podatke o preskusu; drugače bo puščalo ✔
Pojasnilo: parametre vseh transformacij (povprečje, standardno odstopanje itd.), kot so skaliranje, kodiranje in polnjenje, je treba naučiti samo iz podatkov o usposabljanju, nato pa je treba isto uporabiti za testne podatke. Upoštevanje testnih podatkov tudi povzroči, da testne informacije motijo usposabljanje, to je uhajanje, zaradi česar je model videti boljši, kot je. Uporaba cevovoda to zagotavlja.
8. Model daje 98-odstotno natančnost na vadbenem nizu in 72-odstotno natančnost na testnem nizu. Kaj kaže ta simptom in kaj je treba storiti?
- A) Nezadostno učenje; model bi moral biti bolj zapleten
- B) Puščanje podatkov; testni niz je treba spremeniti
- C) Prekomerno opremljanje; model je treba poenostaviti, uporabiti je treba zakonodajo in navzkrižno validacijo ✔
- D) normalna situacija; Ocena izobrazbe je tako ali tako vedno višja, previdnost je odveč
Pojasnilo: Zelo visok rezultat pri usposabljanju in občutno nizek rezultat pri testiranju je klasičen simptom prekomernega opremljanja: model si je zapomnil šum podatkov o usposabljanju in ne dejanskega vzorca. Rešitve vključujejo poenostavitev modela, več podatkov, ureditev in preverjanje stanja z navzkrižno validacijo. Zanašanje zgolj na izobrazbeni rezultat skriva to past.
9. V vodstveni predstavitvi se os y paličnega grafikona, v katerem se prodaja poveča s 1.000 na 1.020, začne pri 980, da je povečanje videti ogromno. Dejansko povečanje je 2 %. Zakaj je to etično vprašanje?
- A) Prirezana os y vizualno poveča majhno razliko in zavede gledalca; Zaradi poštenosti se mora os v primerjalnih vrsticah začeti z 0 ✔
- B) Paličnih grafikonov nikoli ni mogoče uporabiti za podatke o prodaji
- C) Ni problema; Vedno je dobro narediti grafikon impresiven
- D) Os Y se mora vedno začeti z največjo vrednostjo podatkov
Pojasnilo: V paličnih grafikonih za primerjalne namene se mora os y na splošno začeti pri 0. Če prerežete os in začnete pri 980, se majhna 2-odstotna razlika zdi vizualno velika in zavaja gledalca. Etična odgovornost strokovnjaka za podatke je risanje poštenih grafov, ki ne precenjujejo ali podcenjujejo podatkov.
10. Analitik po združitvi naročil s tabelo izdelkov 3-krat ugotovi skupni promet; Število vrstic se je povečalo z 240 tisoč na 690 tisoč. Kaj bi bilo treba storiti, da bi preprečili to tiho napako?
- A) Skupni promet delite s 3
- B) Vedno uporabite ločene poizvedbe namesto JOIN
- C) Popoln izbris tabele izdelkov
- D) Preverjanje števila vrstic po spajanju/JOIN in preverjanje, ali so združene s pravilnim ključem; Zgodnje lovljenje replikacije ✔
Pojasnilo: Ko je v tabeli izdelkov več vrstic za vsak izdelek (na primer drugačne barve), bo JOIN prek napačnega ključa podvojil vsako naročilo in povečal skupne vrednosti. Koda deluje brez napak, vendar je rezultat napačen. Temu se lahko izognete tako, da preverite število vrstic po vsakem spajanju/JOIN in spajate s pravilnim ključem.
11. Model preverjanja zaposlovanja izve o neravnovesju med spoloma v preteklih podatkih in sistematično nižje ocenjuje kandidatke, vendar je njegova splošna natančnost visoka. Kaj to pomeni?
- A) Ni problema, ker ima model visoko natančnost
- B) Statistična natančnost ni nadomestilo za etično sprejemljivost; je model izvedel za preteklo diskriminacijo, je potrebno skupinsko preverjanje pravičnosti ✔
- C) Nadaljnje povečanje natančnosti modela reši problem
- D) Poštenost je zunaj obsega podatkovne znanosti
Pojasnilo: Tudi če je model statistično pravilen, je lahko etično nesprejemljiv. Model se nauči nepravičnosti v preteklih podatkih in avtomatizira diskriminacijo. Visoka integriteta ni nadomestilo za pravičnost; Pri modelih z velikim vplivom je nadzor poštenosti, ki meri razliko v uspešnosti/odločitvi za različne skupine, bistvenega pomena, končna odgovornost pa je na človeku.
12. Zaposleni naloži datoteko, ki vsebuje e-poštna sporočila resničnih strank in zgodovino nakupov, v javno orodje AI in reče "povzemi segmente". Zakaj je to resna napaka in kaj je prava pot?
- A) Ni problema; Orodja AI nikoli ne shranjujejo podatkov
- B) Napaka je, da je datoteka prevelika; bi bilo treba zmanjšati
- C) Posredovanje resničnih osebnih podatkov v odprto orodje je kršitev KVKK/GDPR; polja z identiteto bi morali odstraniti in deliti samo anonimno shemo/lastnost ✔
- D) Namesto Excela bi morali uporabiti CSV
Pojasnilo: Ko so resnični osebni podatki (kot so e-pošta, ime itd.) posredovani javno dostopnemu orodju umetne inteligence, bo prišlo do kršitve zasebnosti v okviru KVKK / GDPR; podatki zapustijo organizacijo. Največkrat za analizo zadostujeta diagram in anonimni/sintetični vzorec. Pravilen način je, da odstranite polja identitete in delite samo anonimne lastnosti.
13. Priporočeni model je dan v proizvodnjo, vendar sledenje ni vzpostavljeno; Ko se katalog izdelkov spremeni po 4 mesecih, model še naprej priporoča stare izdelke in stopnja konverzije tiho pade za 30 %. Kako se imenuje ta pojav?
- A) Preučenje; Model si zapomni vadbeni niz
- B) zanašanje modela; Ko se svet spreminja, model zastara tiho, neopazno, ker nadzor ni vzpostavljen ✔
- C) Pristranskost izbire; pristranskost vzorca
- D) Kršitev minimizacije podatkov
Pojasnilo: To je premik modela (odmik modela/podatkov): ko se svet spremeni (katalog, vedenje, sezona), se pogoji, v katerih je bil model učen, premaknejo in model se tiho pokvari. Model, dan v proizvodnjo, se pokvari sam od sebe; Vprašanje je 'kdaj'. Uvedba brez spremljanja (sledenje vnosom in zmogljivosti) onemogoča odkrivanje poslabšanja.
14. Model, ki dobi 88-odstotno natančnost v enem samem razdelku usposabljanje/test, ima 5-kratne rezultate navzkrižne validacije 88 %, 71 %, 83 %, 64 %, 79 %. Kaj to pomeni in zakaj je navzkrižna validacija pomembna?
- A) Model je stabilen; 88% je realna zmogljivost
- B) Navzkrižna validacija je nepotrebna; En prekat je dovolj
- C) Velika volatilnost rezultatov kaže, da je model nestabilen; navzkrižno preverjanje uspešnosti temelji na povprečju in porazdelitvi več košev, ne enega samega posrečenega koša ✔
- D) Najbolje je prijaviti najvišji rezultat (88 %)
Pojasnilo: En sam predelek je lahko srečen ali nesrečen; 88% je bil samo rezultat te enostavne delitve. Navzkrižna validacija večkrat razdeli podatke, pri čemer uspešnost temelji na povprečju (tu ~77 %) in prikaže nestanovitnost rezultatov. Visoka volatilnost tukaj nakazuje, da je model nestabilen; Zanašanje na en sam predelek je zavajajoče.