Vienetas 11 / 11

MLOps fondas, etika, privatumas ir atsakinga analizė

Pelnas:

  • Gebėjimas suprasti MLOps fazes (išleidimas, diegimas, stebėjimas, perkvalifikavimas, atšaukimas) ir modeliuoti dreifą bei planuoti stebimą diegimą
  • Gebėjimas taikyti modelio teisingumo, skaidrumo ir atskaitomybės principus ir atskirti statistinį tikslumą nuo etinio priimtinumo
  • Galimybė apsaugoti asmens duomenis pagal KVKK/GDPR principus ir priskirti galutinę atsakomybę žmogui priimant didelio poveikio sprendimus

Išmokyti modelį ir gauti aukštą balą – ne pabaiga, o vidurys. Tikroji vertė atsiranda tada, kai modelis pradedamas gaminti ir veikia patikimai, yra stebimas laikui bėgant, o visas procesas vyksta neperžengiant etinių ir teisinių ribų. Šiame baigiamajame skyriuje sujungiamos trys temos: MLOps (tiesioginio pristatymo, modelių stebėjimo ir priežiūros disciplina), etika (sąžiningumas, skaidrumas, nepiktybiškumas) ir privatumas (asmens duomenų apsauga). AI gamina kodą, kontrolinius sąrašus ir brėžinius šiose srityse; Tačiau žmonės nusprendžia, ar modelis pradės veikti, kas bus paveiktas ir kokius duomenis galima naudoti. Šie sprendimai yra ne techniniai, o atsakomybės sprendimai.

MLOps: modelis gyvena kaip produktas

MLOps (Machine Learning Operations – mašininio mokymosi modelių paleidimo, stebėjimo ir atnaujinimo praktika gamyboje) yra programinės įrangos kūrimo DevOps pritaikymas duomenų mokslui. Pagrindinė mintis: modelis – tai ne kartą apmokytas ir pamirštas failas, o gyvas produktas, reikalaujantis nuolatinės priežiūros. Pagrindiniai etapai:

1. Versijų kūrimas: kodas (Git), duomenys ir modelis versijos kartu; Užfiksuojama, koks modelis su kokiais duomenimis ir kodu buvo pagamintas.

2. Diegimas: modelis pristatomas kaip API arba paketinis darbas. Paprastai jis pirmiausia skiriamas nedidelei auditorijai (pavėsis / kanarėlių paskirstymas).

3. Stebėjimas: modelio veikimas ir įvesties duomenys yra nuolat stebimi.

4. Perkvalifikavimas: kai sumažėja našumas, modelis perkvalifikuojamas naudojant atnaujintus duomenis.

Rašto poslinkis: tylus iškraipymas

Didžiausias pavojus gamyboje yra modelio dreifas (model drift / data drift). Pasaulis keičiasi; Sąlygos, kuriomis mokėte savo modelį (klientų elgsena, kainos, sezonas, teisės aktai), laikui bėgant keičiasi ir modelis pradeda nebereikalauti. Pavyzdžiui, paklausos modelis, parengtas prieš pandemiją, pandemijos metu yra visiškai neteisingas. Dreifas pasireiškia dviem formomis: duomenų dreifu (įvesties duomenų pasiskirstymas) ir sąvokų dreifu (santykiu tarp įvesties ir tikslinių pokyčių). Būdas tai užfiksuoti yra stebėjimas: nuolat stebėkite įvesties pasiskirstymą, prognozavimo pasiskirstymą ir (jei įmanoma) našumą, palyginti su tikruoju rezultatu.

Atsargiai: pradėtas gaminti modelis pats suges; Svarbu ne „jei“, o „kada“. Modelių diegimas nenustačius stebėjimo prilygsta važiavimui automobiliu nevaldant jo variklio; Vieną dieną jis tiesiog sėdi tyliai ir nepastebi.

MLOps elementas

Tikslas

Jei nepaisoma

Versijų kūrimas

Žinant, kas gaminama

Neatkuriama, neatsekama

Stebėjimas

Anksti pamatęs paslydimą

Modelis tyliai sugenda

perkvalifikavimas

neatsilikti nuo naujienų

Prognozės sensta

Atšaukimas

grįžti prie blogo modelio

Sugedęs modelis lieka gyvas

Dokumentacija

skaidrumas, apyvarta

Informacija įstringa viename žmoguje

Etika: modelio sprendimai veikia žmones

Duomenų modeliai vis dažniau naudojami priimant sprendimus, turinčius įtakos žmonių gyvenimui: kreditas, samdymas, draudimas, teisingumas. Su šia galia ateina ir atsakomybė. Pagrindinės etinės rizikos:

Šališkumas ir diskriminacija: modelis gali išmokti ir išsaugoti istorinių duomenų neteisingumą. Jei tam tikrai grupei praeityje buvo suteikta mažiau kredito, modelis daro prielaidą, kad tai yra „taisyklė“ ir automatizuoja diskriminaciją. Todėl labai svarbu atlikti teisingumo analizę – patikrinti, ar modelis veikia panašiai skirtingose ​​grupėse (lytis, amžius, regionas).

Skaidrumas ir paaiškinamumas: turėtumėte sugebėti paaiškinti, kodėl modelis atstūmė asmenį. „Juodoji dėžė taip pasakė“ yra etiškai ir dažnai teisiškai nepriimtina. Štai kodėl paaiškinamumo įrankiai (funkcijų svarba, SHAP reikšmės) yra vertingi.

Atsakomybė: kas atsakingas, jei modelis priima neteisingą sprendimą? Atsakymas visada yra asmuo/institucija, o ne modelis. Žmogaus priežiūra (žmogus in-the-loop – žmogus, patvirtinantis galutinį sprendimą) turėtų būti išsaugotas priimant didelio poveikio sprendimus.

Atsargiai: modelis gali būti statistiškai „teisingas“, bet etiškai nepriimtinas. Labai tikslus modelis, kuris sistemingai kenkia vienai grupei, nėra geras modelis. Sąžiningumas nepakeičia teisingumo.

Privatumas: asmens duomenys yra kruopščiai saugomi

Duomenų mokslo žaliava dažnai yra asmens duomenys, o šie duomenys yra saugomi įstatymų: KVKK Turkijoje, GDPR Europoje. Pagrindiniai principai yra šie: tikslo ribojimas (duomenys nenaudojami kitiems tikslams, nei jie buvo surinkti), duomenų sumažinimas (nerenkama/saugoma ne daugiau duomenų, nei reikia), anonimiškumas (identifikavimo informacija pašalinama) ir saugumas (duomenys laikomi šifruojami ir prieiga ribojama). Kritinė taisyklė dirbant su AI įrankiais: niekada neįklijuokite tikrų asmeninių duomenų į viešą AI įrankį. Dažniausiai analizei pakanka diagramos ir anoniminio/sintetinio mėginio.

Papildomas akcentas informacijos saugumo kontekste: naudokite duomenų mokslo įrankius ir metodus tik tiems duomenims ir sistemoms, kuriems turite įgaliojimus, gynybos ir teisėtos analizės tikslais. Neteisėta prieiga prie kažkieno duomenų, pakartotinis asmenų identifikavimas (tapatybės išgavimas iš anoniminių duomenų) arba neteisėtas profiliavimas yra neteisėta ir neetiška.

trys mini dėklai

1 atvejis – neatsektas žlugimas. El. prekybos įmonė pradėjo taikyti savo rekomendacinį modelį ir nenustatė stebėjimo. Po 4 mėnesių prekių katalogas labai pasikeitė; modelis ir toliau rekomenduodavo pasenusius produktus, o konversijų rodiklis tyliai nukrito 30%. Mėnesius niekas nepastebėjo. Pamoka: diegimas be stebėjimo tampa aklas.

2 atvejis – paslėpta diskriminacija. Įdarbinimo patikros modelis sužinojo apie lyčių disbalansą istoriniuose duomenyse ir sistemingai neįvertino moterų kandidatų. Tai nebuvo pastebėta, nes nebuvo teisingumo analizės; Tai buvo atskleista per auditą ir įstaigai iškilo rimta reputacijos / teisinė rizika. Pamoka: grupėmis pagrįsta sąžiningumo kontrolė yra labai svarbi didelio poveikio modeliuose.

3 atvejis. Konfidencialumo pažeidimas. Vienas analitikas į viešą AI įrankį įkėlė failą, kuriame buvo tikri klientų el. laiškai ir pirkimo istorija, ir pasakė: „Apibendrinkite segmentus“. Asmens duomenys išėjo iš įstaigos; Pradėtas KVKK procesas. Teisingas būdas buvo pašalinti tapatybės laukus ir bendrinti tik anonimines ypatybes. Pamoka: tikri asmens duomenys nepatenka į atvirą įrankį.

Keturi kopijuojami šablonai

1) Kontrolinis sąrašas prieš įdiegimą:

Jūsų vaidmuo: MLOps konsultantas. Išvardykite dalykus, kuriuos turiu patikrinti prieš pradėdamas gaminti modelį: versijų kūrimas, stebėjimo metrika, atkūrimo planas, našumo slenkstis, įspėjimas apie duomenų nukrypimą, atsakingas asmuo. Prie kiekvieno elemento pridėkite vieno sakinio paaiškinimą „kodėl tai svarbu“. Aš nuspręsiu.

2) Modelio pamainos sekimo dizainas:

Pasiūlykite dreifo stebėjimo planą klasifikavimo modeliui gamyboje: (1) kokius įvesties paskirstymus turėčiau stebėti, (2) kokį įspėjimo pasiskirstymo signalą, (3) kaip palyginti našumą, kai gaunamas tikras rezultatas, (4) prie kokios slenksčio turėtų būti suaktyvintas perkvalifikavimas. Taip pat pateikite kodo skeletą.

3) Sąžiningumo kontrolė:

Parašykite kodą, kuris palygintų mano modelio našumą skirtingose ​​grupėse (pvz., amžiaus grupėje, regione): prisiminimas / tikslumas ir teigiamų sprendimų dažnis kiekvienai grupei. Įspėkite, jei tarp grupių yra didelis skirtumas. Priežastinių/politinių interpretacijų teikimas; Tiesiog parodykite man skirtumus ir aš apsvarstysiu sprendimą.

4) Išankstinė privatumo patikra:

Prieš pateikdami duomenis dirbtinio intelekto įrankiui, patikrinkite: ar žemiau esančiame stulpelių sąraše yra asmens / tapatybės duomenų (vardas, el. pašto adresas, ID, telefonas, adresas, IP)? Jei taip, nurodykite, kuriuos iš jų reikėtų pašalinti arba anonimizuoti. Stulpeliai: [sąrašas]. Tikslas: bendrinti tik anoniminę schemą.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Mano modelis paruoštas, transliuokite.

Diegimas nėra vienas žingsnis; Tiesioginė transliacija be stebėjimo, atšaukimo, sąžiningumo ir privatumo kontrolės yra tylus kvietimas į nelaimę.

Galingas raginimas:

Jūsų vaidmuo: atsakingas MLOps konsultantas. Mano modelis buvo apmokytas, noriu visapusiškai pasiruošti prieš pradedant transliuoti. Sugeneruokite: (1) kontrolinį sąrašą prieš diegimą, (2) dreifo stebėjimo planą, (3) grupinį sąžiningumo patikrinimo kodą, (4) privatumo patikrinimą (ar yra asmens duomenų). Taip pat pasiūlykite, kaip apsaugoti žmogaus sutikimą priimant didelio poveikio sprendimus. Galutiniai sprendimai yra mano.

Čia platinimas, stebėjimas, sąžiningumas ir privatumas traktuojami kaip vienas atsakingas procesas.

Dažnos klaidos

  • Modelio diegimas nenustačius stebėjimo. Modelis tyliai slysta ir išsikreipia; Gali praeiti mėnesiai, kol tai pastebėsite.
  • Apeinant teisingumo patikrinimą. Didelio tikslumo modelis gali sistemingai sudaryti nepalankią padėtį grupei.
  • Nepaaiškinamo juodosios dėžės sprendimo priėmimas. Didelio poveikio sprendimai turi būti paaiškinami; „Modelis taip pasakė“ – neužtenka.
  • Tikrų asmeninių duomenų suteikimas atidaryti AI įrankį. KVKK/BDAR pažeidimas; Pakanka diagramos ir anoniminio pavyzdžio.
  • Sprendimo delegavimas modeliui. Atsakomybė visada tenka žmogui; Išlaikomas didelio poveikio žmonių stebėjimas.
Patarimas: prieš pradėdami transliuoti su kiekvienu modeliu, garsiai užduokite vieną klausimą: „Jei šis modelis rytoj tyliai sugenda arba nesąžiningai nubaus grupę, kaip aš pastebėsiu ir grąžinsiu jį atgal? Jei neturite aiškaus atsakymo į šį klausimą, modelis dar nėra paruoštas gamybai.

Apibendrinant

Modelio darbas nesibaigia aukštu balu, o patikimu ir atsakingu darbu gamyboje. MLOps – tai modelio paleidimo, dreifo stebėjimo, perkvalifikavimo ir atšaukimo disciplina; Diegimas be stebėjimo yra tylus žlugimas. Etika reikalauja modelio sąžiningumo, skaidrumo ir atskaitomybės; statistinis tikslumas nepakeičia etinio priimtinumo. Privatumas reiškia asmens duomenų apsaugą pagal KVKK/GDPR principus ir realių duomenų saugojimą nuo atvirų įrankių. Visi šie sprendimai yra ne techniniai, o atsakomybės sprendimai ir visada priklauso žmogui.

Taikymo užduotis

Pagalvokite apie tai taip, lyg ketintumėte įdiegti savo sukurtą (arba hipotetinį) modelį į gamybą ir užpildyti keturis sąrašus: (1) kontrolinis sąrašas prieš diegimą, (2) slinkimo metrika, kurią stebėsite, (3) grupinis sąžiningumo kontrolės planas, (4) privatumo kontrolė. Tada parašykite konkretų atsakymą į klausimą "Kaip pastebėsiu, jei rytoj tyliai suges ir susigrąžinsiu?"

kontrolinis sąrašas

  • [ ] Ar aš įdiegiu modelį su stebėjimo (slydimo įspėjimu) ir atšaukimo planu?
  • [ ] Ar patikrinau skirtingų grupių teisingumo / veiklos atotrūkį?
  • [ ] Ar priimdamas didelio poveikio sprendimus išlaikiau žmogiškąjį ryšį?
  • [ ] Ar asmeninius duomenis saugojau KVKK/BDAR principais ir saugojau juos nuo atvirų įrankių?
  • [ ] Ar didžiausią atsakomybę užkėliau žmogui, o ne modeliui?

Modulio egzaminas

1. Duomenų mokslininkas klausia dirbtinio intelekto: „Kaip tikslus atsitiktinis miškas pagal šiuos duomenis? visai neapmokydamas modelio, o tiesiai į pristatymą įdeda atsakymą „89 %“. Kokia esminė šio požiūrio klaida?

  • A) Laukimas metrikų, neduodant duomenų ir modelių dirbtiniam intelektui; Nepaisydami to, kad jo pateikiamas skaičius yra netikras ir kad tikrąją metriką galima rasti tik mokantis ir išbandant ✔
  • B) Vietoj atsitiktinio miško turi naudoti logistinę regresiją
  • C) Tikslumo koeficientas visada turi būti didesnis nei 90%.
  • D) Griežtai draudžiama pateikti metriką

Paaiškinimas: dirbtinis intelektas negali sukurti metrikos nepasiekęs modelio ir duomenų; Skaičius, kurį jis pateikia, yra haliucinacija (išgalvota). Metrikas gaunamas paties duomenų mokslininko skaičiavimu tik po to, kai modelis iš tikrųjų buvo apmokytas ir išbandytas. Nepatvirtinta išvestis yra kaip nepasirašyta ataskaita.

2. Stulpelis „Paskyros uždarymo priežastis“ įtraukiamas renkant duomenis apie dingimo prognozę; Šis stulpelis užpildomas tik klientui išvykus. Modelis suteikia 97% bandymo rinkinio, bet neveikia gamyboje. Koks šios būklės pavadinimas ir priežastis?

  • A) Overleping; Modelis per sudėtingas
  • B) Duomenų nutekėjimas; ✔ Kaip funkciją naudoti informaciją, kuri nebus pasiekiama numatymo metu, bet yra tikslo rezultatas
  • C) Nepakankamas mokymasis; Modelis per paprastas
  • D) atrankos šališkumas; mažas imties dydis

Paaiškinimas: tai klasikinis duomenų nutekėjimas: „uždarymo priežastis“ yra tikslo rezultatas ir prognozės metu vis dar tuščia. Modelis apgauna šias ateities žinias, jis puikiai atrodo bandymo rinkinyje, tačiau gamyboje sugenda, nes tas stulpelis tuščias. Klausimas „ar turiu jį numatymo metu“ turėtų būti pateiktas kiekviename stulpelyje.

3. Analitikas užpildo trūkstamas reikšmes pajamų stulpelyje su vidurkiu; tačiau dingę žmonės iš tikrųjų priklauso mažas pajamas gaunančiam segmentui, kuris niekada nedeklaravo pajamų (sistemingai trūksta). Kodėl šis užpildas yra neteisingas?

  • A) Vidurkis visada didesnis už medianą, todėl jis neteisingas
  • B) Trūkstamų reikšmių niekada negalima pildyti, jas visada reikia ištrinti
  • C) Sisteminės spragos užpildymas vidurkiu iškraipo duomenis, dirbtinai reprezentuodamas tą grupę; Pildymas atliktas neuždavus klausimo 'kodėl jis tuščias?' ✔
  • D) Vidurkio apskaičiavimas sukuria našumo problemą, nes jis yra per lėtas

Paaiškinimas: trūkumo priežastis lemia sprendimą. Kai sisteminis trūkstamas (tarpas, sutelktas tam tikroje grupėje) užpildomas vidurkiu, ta grupė dirbtinai tampa „vidutinėmis pajamomis“ ir duomenys iškraipomi. Prieš pildant reikia užduoti klausimą „kodėl jis tuščias“; sisteminis / reikšmingas trūkstamas vidurkis neturėtų būti pildomas.

4. Komanda nustato 0,78 koreliaciją tarp „reklamos išlaidų“ ir „pardavimų“ ir padvigubina biudžetą; Tačiau iš tikrųjų abu suaktyvina sezoninės kampanijos. Koks statistikos principas paaiškina šią klaidą?

  • A) Koreliacija nėra priežastinis ryšys; Paslėptas trečiasis kintamasis gali turėti įtakos abiem kintamiesiems ✔
  • B) Kadangi koreliacija 0,78 yra per maža, ryšį reikia ignoruoti
  • C) Koreliacija visada įrodo priežastinį ryšį, komanda teisingai suprato
  • D) Koreliacija tarp reklamos ir pardavimų negali būti apskaičiuota matematiškai.

Paaiškinimas: Koreliacija nėra priežastinis ryšys. Abu kintamieji gali veikti kartu, nes paslėptas trečiasis kintamasis (čia sezoninės kampanijos) veikia juos abu. Išvada, kad viena sukelia kitą, gali būti padaryta tik eksperimentuojant ir žinant lauką; Vien tik koreliacijų skaičius nėra priežastingumo įrodymas.

5. Sukčiavimo aptikimo modelis rodo 99,2% tikslumą ir komanda švenčia; Tačiau netikrų operacijų rodiklis duomenyse siekia tik 0,8%, o modelio atšaukimas – 6%. Ką rodo ši lentelė?

  • A) Modelis yra tobulas, nes tikslumas yra didesnis nei 99%
  • B) tikslumas yra klaidinantis su nesubalansuotais duomenimis; Modelis pasigenda beveik visų padirbinių (mažas atšaukimas), reikia pasižiūrėti atitinkamą metriką ✔
  • C) Nėra jokių problemų, nes modelio atšaukimas yra didelis
  • D) Nereikėjo kurti modelio, nes padirbinėjimo procentas buvo mažas

Paaiškinimas: „Tikslumas“ yra klaidinantis nesubalansuotuose duomenyse. Kai modelis beveik kiekvieną operaciją vadina „švaria“, jis gauna didelį tikslumą, nes padirbinių yra labai mažai, tačiau nepavyksta sugauti padirbinių, o tai yra pagrindinė jo paskirtis (prisiminkime 6 proc.). Todėl, esant nesubalansuotoms problemoms, dėmesys sutelkiamas ne į tikslumą, o į painiavos matricą ir darbo tikslui tinkamus rodiklius, tokius kaip atšaukimas / tikslumas.

6. Paklausos prognozavimo projekte nuo laiko priklausomi duomenys atsitiktinai suskirstomi į mokymus/testavimą. Modelis užtikrina 93% tikslumą, tačiau gamyboje sugenda. Koks turėtų būti teisingas skirstymo metodas?

  • A) Bandymo rinkinio padidinimas, pvz. padalijimas 50 %/50 %
  • B) Sudėtingesnio modelio naudojimas
  • C) Visiškai pašalinkite skaidinį ir mokykitės su visais duomenimis
  • D) Chronologinis padalijimas: mokymas su senu laikotarpiu ir testavimas su nauju periodu, taip neleidžiant modeliui matyti ateities ✔

Paaiškinimas: Jei atsitiktinis padalijimas atliekamas laiko eilučių duomenyse, modelis mato ateitį ir numato praeitį treniruotėse; tai yra nutekėjimas ir sukuria sėkmę, kurios iš tikrųjų nėra. Teisingas požiūris yra chronologinis padalijimas: mokymas su senuoju laikotarpiu ir bandymas su nauju periodu, imituojant realią situaciją gamyboje (numatant iš praeities į ateitį).

7. Iš kokių duomenų reikėtų skaičiuoti mastelio (StandardScaler) parametrus funkcijų inžinerijoje ir kaip juos taikyti?

  • A) Jis turėtų būti skaičiuojamas iš visų duomenų (treniruotės + testavimas kartu), kad būtų tikslesnis
  • B) Jis turėtų būti apskaičiuojamas atskirai kiekvienai eilutei, atsižvelgiant į tos eilutės vertę
  • C) Turėtų būti skaičiuojamas tik pagal bandymo duomenis
  • D) Jis turėtų būti skaičiuojamas tik iš treniruočių duomenų, tada tie patys parametrai turėtų būti taikomi bandymo duomenims; kitaip jis nutekės ✔

Paaiškinimas: visų transformacijų (vidurkis, standartinis nuokrypis ir kt.), pvz., mastelio keitimas, kodavimas ir užpildymas, parametrai turėtų būti išmokti tik iš mokymo duomenų, tada tie patys turėtų būti taikomi ir bandymo duomenims. Atsižvelgus į bandymo duomenis, bandymo informacija taip pat trukdo mokymui, tai yra nuotėkis, todėl modelis atrodo geriau nei yra. „Pipeline“ naudojimas tai užtikrina.

8. Modelis suteikia 98% tikslumą treniruočių rinkinyje ir 72% tikslumą bandymo rinkinyje. Ką rodo šis simptomas ir ką daryti?

  • A) Nepakankamas mokymasis; modelis turėtų būti sudėtingesnis
  • B) Duomenų nutekėjimas; bandymo rinkinys turi būti pakeistas
  • C) Perdozavimas; modelis turėtų būti supaprastintas, taikomas reguliavimas ir kryžminis patvirtinimas ✔
  • D) Įprasta situacija; Išsilavinimo balas ir taip visada aukštesnis, atsargumo priemonės nereikalingos

Paaiškinimas: Labai aukštas balas treniruočių metu ir labai žemas testavimo rezultatas yra klasikinis per didelio pritaikymo simptomas: modelis įsiminė treniruočių duomenų triukšmą, o ne tikrąjį modelį. Sprendimai apima modelio supaprastinimą, daugiau duomenų, reguliavimą ir būsenos patikrinimą kryžminiu patvirtinimu. Pasikliaujant vien tik išsilavinimo balu, ši spąsta slepiasi.

9. Valdymo pristatyme stulpelinės diagramos, kurioje pardavimai padidėja nuo 1000 iki 1020, y ašis pradedama nuo 980, kad padidėjimas atrodytų didžiulis. Faktinis padidėjimas yra 2%. Kodėl tai etinė problema?

  • A) Sutrumpinta y ašis vizualiai padidina nedidelį skirtumą ir klaidina žiūrovą; Sąžiningumo dėlei ašis palyginimo juostose turėtų prasidėti nuo 0 ✔
  • B) Stulpelių diagramos niekada negali būti naudojamos pardavimo duomenims
  • C) nėra problemų; Visada gerai, kad diagrama atrodytų įspūdingai
  • D) Y ašis visada turi prasidėti nuo didžiausios duomenų reikšmės

Paaiškinimas: juostinėse diagramose palyginimo tikslais y ašis paprastai turėtų prasidėti nuo 0. Iškirpus ašį ir pradedant nuo 980, nedidelis 2 % skirtumas atrodo vizualiai didžiulis ir klaidina žiūrovą. Duomenų specialisto etinė atsakomybė yra sudaryti sąžiningus grafikus, kuriuose duomenys nebūtų pervertinami ar neįvertinami.

10. Sujungęs užsakymus su prekių lentele, analitikas suranda bendrą apyvartą 3 kartus; Eilučių skaičius išaugo nuo 240 tūkst. iki 690 tūkst. Ką reikėjo padaryti, kad būtų išvengta šios tylios klaidos?

  • A) Padalinkite visą apyvartą iš 3
  • B) Visada naudokite atskiras užklausas, o ne JOIN
  • C) Visiškai ištrinkite produktų lentelę
  • D) eilučių skaičiaus patikrinimas po sujungimo/JOIN ir patikrinimas, ar jos sujungtos tinkamu raktu; Anksti sugauti replikaciją ✔

Paaiškinimas: Kai produktų lentelėje yra kelios kiekvieno produkto eilutės (pavyzdžiui, skirtingos spalvos), PRISIJUNGTI naudojant netinkamą klavišą bus dubliuojamas kiekvienas užsakymas ir padidintos bendros sumos. Kodas veikia be klaidų, bet rezultatas neteisingas. Būdas to išvengti – patikrinti eilučių skaičių po kiekvieno sujungimo/JOIN ir sujungti su tinkamu raktu.

11. Įdarbinimo patikros modelis sužino apie lyčių disbalansą istoriniuose duomenyse ir sistemingai įvertina moteris kandidates, tačiau bendras jo tikslumas yra didelis. Ką tai reiškia?

  • A) Nėra problemų, nes modelis pasižymi dideliu tikslumu
  • B) Statistinis tikslumas nepakeičia etinio priimtinumo; modelis sužinojo apie buvusią diskriminaciją, reikalingas grupinis sąžiningumo patikrinimas ✔
  • C) Toliau didinant modelio tikslumą problema išsprendžiama
  • D) Sąžiningumas nepatenka į duomenų mokslo sritį

Paaiškinimas: Net jei modelis yra statistiškai teisingas, jis gali būti etiškai nepriimtinas. Modelis sužino apie praeities duomenų neteisingumą ir automatizuoja diskriminaciją. Aukštas sąžiningumas nepakeičia teisingumo; Didelio poveikio modeliuose sąžiningumo kontrolė, kuri matuoja skirtingų grupių veiklos / sprendimų skirtumus, yra labai svarbi, o galutinė atsakomybė tenka žmogui.

12. Darbuotojas į viešą AI įrankį įkelia failą su tikrais klientų el. laiškais ir pirkimo istorija ir sako „sutraukti segmentus“. Kodėl tai rimta klaida ir koks yra teisingas būdas?

  • A) nėra problemų; AI įrankiai niekada nesaugo duomenų
  • B) Klaida ta, kad failas per didelis; turėjo būti sumažintas
  • C) Tikrų asmens duomenų teikimas atviram įrankiui yra KVKK/BDAR pažeidimas; tapatybės laukai turėjo būti pašalinti ir bendrinama tik anoniminė schema / nuosavybė ✔
  • D) Vietoj „Excel“ turėjo būti naudojamas CSV

Paaiškinimas: kai tikri asmens duomenys (pvz., el. pašto adresas, vardas ir kt.) pateikiami viešai prieinamam dirbtinio intelekto įrankiui, bus privatumo pažeidimas, patenkantis į KVKK / GDPR taikymo sritį; duomenys palieka organizaciją. Dažniausiai analizei pakanka diagramos ir anoniminio/sintetinio mėginio. Teisingas būdas yra pašalinti tapatybės laukus ir bendrinti tik anonimines ypatybes.

13. Rekomendacinis modelis pradedamas gaminti, bet sekimas nenustatytas; Kai prekių katalogas pasikeičia po 4 mėnesių, modelis ir toliau rekomenduoja senus produktus, o konversijų rodiklis tyliai sumažėja 30%. Kaip vadinasi šis reiškinys?

  • A) Overleping; Modelis įsimena treniruočių rinkinį
  • B) modelio dreifas; Keičiantis pasauliui, modelis tyliai, nepastebimai pasensta, nes nenustatytas stebėjimas ✔
  • C) atrankos šališkumas; imties šališkumas
  • D) Duomenų mažinimo pažeidimas

Paaiškinimas: Tai modelio dreifas (modelio/duomenų poslinkis): pasikeitus pasauliui (katalogui, elgesiui, sezonui), pasikeičia sąlygos, kuriomis modelis buvo apmokytas, ir modelis tyliai sugenda. Pradėtas gaminti modelis pats sugenda; Tai „kada“ reikalas. Diegiant be stebėjimo (įvesties ir našumo stebėjimo) neįmanoma aptikti pablogėjimo.

14. Modelis, kurio tikslumas yra 88 % per vieną mokymo/testo padalijimą, turi 5 kartus kryžminio patvirtinimo balus – 88%, 71%, 83%, 64%, 79%. Ką tai rodo ir kodėl svarbus kryžminis patvirtinimas?

  • A) modelis yra stabilus; 88% yra tikras našumas
  • B) kryžminis patvirtinimas nereikalingas; Užtenka vieno skyriaus
  • C) Didelis balų nepastovumas rodo, kad modelis yra nestabilus; kryžminis patvirtinimas pagrįstas kelių šiukšliadėžių, o ne vienos laimingos šiukšliadėžės vidurkiu ir pasiskirstymu ✔
  • D) Geriausia nurodyti aukščiausią balą (88 %)

Paaiškinimas: vienas skyrius gali būti sėkmingas arba nepasisekęs; 88% buvo tik tokio lengvo padalijimo rezultatas. Kryžminis patvirtinimas padalija duomenis kelis kartus, našumas grindžiamas vidurkiu (čia ~ 77 %) ir parodo balų nepastovumą. Didelis nepastovumas rodo, kad modelis yra nestabilus; Pasikliauti vienu skyriumi yra klaidinga.