Njësia 11 / 11

Fondacioni MLOps, Etika, Privatësia dhe Analiza Përgjegjëse

Fitimet:

  • Aftësia për të kuptuar fazat e MLOps (lëshimi, vendosja, monitorimi, ritrajnimi, rikthimi) dhe zhvendosja e modelit dhe planifikimi i një vendosjeje të monitoruar
  • Aftësia për të zbatuar parimet e drejtësisë, transparencës dhe llogaridhënies së modelit dhe për të dalluar saktësinë statistikore nga pranueshmëria etike
  • Aftësia për të mbrojtur të dhënat personale me parimet KVKK/GDPR dhe për t'i caktuar përgjegjësinë përfundimtare një personi në vendimet me ndikim të lartë

Të trajnosh një modele dhe të marrësh një rezultat të lartë nuk është fundi, por mesi. Vlera reale vjen kur modeli vihet në prodhim dhe funksionon me besueshmëri, monitorohet me kalimin e kohës pa përkeqësim dhe i gjithë procesi kryhet brenda kufijve etikë dhe ligjorë. Kjo njësi përmbyllëse kombinon tre tema: MLOps (disiplina e transmetimit të drejtpërdrejtë, monitorimi dhe mirëmbajtja e modeleve), etika (drejtësia, transparenca, jo keqbërja) dhe privatësia (mbrojtja e të dhënave personale). AI prodhon kode, lista kontrolli dhe plane në këto fusha; Por njerëzit vendosin nëse një model do të hyjë në jetë, kush do të preket dhe cilat të dhëna mund të përdoren. Këto vendime nuk janë teknike, por vendime përgjegjësie.

MLOps: modelja jeton si një produkt

MLOps (Machine Learning Operations - praktika e ekzekutimit, monitorimit dhe përditësimit të modeleve të mësimit të makinerive në prodhim) është përshtatja e DevOps në zhvillimin e softuerit me shkencën e të dhënave. Ideja bazë: një model nuk është një skedar që trajnohet një herë dhe harrohet, por një produkt i gjallë që kërkon mirëmbajtje të vazhdueshme. Fazat kryesore:

1. Versionimi: Kodi (Git), të dhënat dhe modeli janë versionuar së bashku; Regjistrohet se cili model është prodhuar me cilat të dhëna dhe kod.

2. Zbatimi: Modeli vendoset drejtpërdrejt si një API ose punë grupore. Zakonisht së pari i jepet një audiencë të vogël (shpërndarja e hijeve/kanarinave).

3. Monitorimi: Performanca e modelit dhe të dhënat hyrëse monitorohen vazhdimisht.

4. Rikualifikimi: Kur performanca bie, modeli rikualifikohet me të dhëna të përditësuara.

Zhvendosja e modelit: shtrembërim i heshtur

Rreziku më i madh në prodhim është zhvendosja e modelit (model drift / lëvizja e të dhënave). Bota ndryshon; Kushtet në të cilat keni trajnuar modelin tuaj (sjellja e klientit, çmimet, sezoni, legjislacioni) ndryshojnë me kalimin e kohës dhe modeli fillon të vjetërohet. Për shembull, një model kërkese i trajnuar para pandemisë është krejtësisht i gabuar gjatë pandemisë. Zhvendosja ndodh në dy forma: zhvendosja e të dhënave (shpërndarja e ndryshimeve të të dhënave hyrëse) dhe zhvendosja e konceptit (lidhja midis ndryshimeve të hyrjes dhe objektivit). Mënyra për t'i kapur këto është monitorimi: gjurmoni vazhdimisht shpërndarjen e hyrjes, shpërndarjen e parashikimit dhe (nëse është e mundur) performancën në krahasim me rezultatin aktual.

Kujdes: Një model i vënë në prodhim do të përkeqësohet vetë; Nuk është çështje “nëse” por “kur”. Vendosja e modeleve pa vendosur monitorim është si të ngasësh një makinë pa e kontrolluar ndonjëherë motorin e saj; Një ditë ajo thjesht ulet aty në heshtje dhe ju nuk e vini re.

Elementi MLOps

Qëllimi

Nëse neglizhohet

Versionimi

Duke ditur se çfarë prodhohet

I pa riprodhueshëm, i pa gjurmueshëm

Monitorimi

Duke parë rrëshqitjen herët

Modelja prishet në heshtje

rikualifikim

qëndroni të përditësuar

Parashikimet plaken

Rikthim

kthehu në modelin e keq

Modeli me defekt mbetet live

Dokumentacioni

transparencë, qarkullim

Informacioni ngec në një person

Etika: vendimet model prekin njerëzit

Modelet e të dhënave përdoren gjithnjë e më shumë në vendimet që ndikojnë në jetën e njerëzve: kreditë, punësimet, sigurimet, drejtësia. Me këtë fuqi vjen përgjegjësia. Rreziqet kryesore etike:

Paragjykimi dhe diskriminimi: Modeli mund të mësojë dhe përjetësojë padrejtësitë në të dhënat historike. Nëse një grupi të caktuar i është dhënë më pak kredi në të kaluarën, modeli supozon se ky është një "rregull" dhe automatizon diskriminimin. Kjo është arsyeja pse analiza e drejtësisë - kontrollimi nëse modeli funksionon në mënyrë të ngjashme për grupe të ndryshme (gjinia, mosha, rajoni) - është thelbësore.

Transparenca dhe shpjegueshmëria: Ju duhet të jeni në gjendje të shpjegoni pse një model refuzoi një person. "Kutia e zezë tha kështu" është etike dhe shpesh ligjërisht e papranueshme. Kjo është arsyeja pse mjetet e shpjegueshmërisë (rëndësia e veçorive, vlerat SHAP) janë të vlefshme.

Përgjegjësia: Kush është përgjegjës nëse modeli merr vendimin e gabuar? Përgjigja është gjithmonë një person/institucion, jo një model. Mbikëqyrja njerëzore (human-in-the-loop - një njeri që miraton vendimin përfundimtar) duhet të ruhet në vendimet me ndikim të lartë.

Kujdes: Një model mund të jetë statistikisht "korrekt" por etikisht i papranueshëm. Një model shumë i saktë që sistematikisht e dëmton një grup nuk është një model i mirë. Ndershmëria nuk është zëvendësim për drejtësinë.

Privatësia: të dhënat personale mbrohen me kujdes

Lënda e parë e shkencës së të dhënave është shpesh të dhëna personale, dhe këto të dhëna mbrohen me ligj: KVKK në Turqi, GDPR në Evropë. Parimet bazë janë: kufizimi i qëllimit (të dhënat nuk përdoren për qëllime të tjera përveç qëllimit për të cilin janë mbledhur), minimizimi i të dhënave (nuk mblidhen/mbahen më shumë të dhëna sesa duhet), anonimizimi (informacioni identifikues hiqet) dhe siguria (të dhënat mbahen të koduara dhe aksesi i kufizuar). Rregulli kritik kur punoni me mjetet e AI: mos i ngjitni kurrë të dhënat reale personale në një mjet publik të AI. Në shumicën e rasteve, një diagram dhe një mostër anonime/sintetike janë të mjaftueshme për analizë.

Një theks shtesë në kontekstin e sigurisë së informacionit: përdorni mjetet dhe teknikat e shkencës së të dhënave vetëm për të dhënat dhe sistemet për të cilat keni autoritet, për qëllime të analizës mbrojtëse dhe legjitime. Qasja e paautorizuar në të dhënat e dikujt tjetër, riidentifikimi i individëve (nxjerrja e identitetit nga të dhënat anonime) ose profilizimi i paautorizuar është i paligjshëm dhe joetik.

tre mini kuti

Rasti 1 - Kolaps i pa gjurmuar. Një kompani e-commerce doli drejtpërdrejt me modelin e saj të rekomandimit dhe nuk vendosi gjurmimin. Pas 4 muajsh katalogu i produkteve ka ndryshuar shumë; modeli vazhdoi të rekomandonte produkte të vjetëruara dhe norma e konvertimit ra në heshtje me 30%. Askush nuk e vuri re për muaj të tërë. Mësimi: vendosja pa monitorim po shkon verbër.

Rasti 2 - Diskriminimi i fshehur. Një model shqyrtimi i punësimit mësoi për çekuilibrin gjinor në të dhënat historike dhe nënvlerësoi sistematikisht kandidatet femra. Nuk u vu re sepse nuk kishte analizë të drejtë; Ajo u zbulua në një auditim dhe institucioni u përball me rrezik serioz reputacioni/ligjor. Mësimi: kontrolli i drejtësisë i bazuar në grup është thelbësor në modelet me ndikim të lartë.

Rasti 3 - Shkelja e konfidencialitetit. Një analist ngarkoi një skedar që përmban emaile reale të klientëve dhe histori blerjeje në një mjet publik të AI dhe tha, "përmblidhni segmentet". Të dhënat personale janë larguar nga institucioni; Procesi i KVKK-së ka filluar. Mënyra e saktë ishte heqja e fushave të identitetit dhe shpërndarja e vetëm pronave anonime. Mësimi: të dhënat personale reale nuk hyjnë në mjetin e hapur.

Katër shabllone të kopjueshëm

1) Lista kontrolluese e para-vendosjes:

Roli juaj: konsulent MLOps. Rendis gjërat që duhet të kontrolloj përpara se të vë në prodhim një model: versionimi, matjet e monitorimit, plani i rikthimit, pragu i performancës, alarmi për zhvendosjen e të dhënave, personi përgjegjës. Shtoni një shpjegim me një fjali "pse ka rëndësi" për çdo artikull. Unë do të vendos.

2) Dizajni i përcjelljes së ndërrimit të modelit:

Sugjeroni një plan monitorimi drift për një model klasifikimi në prodhim: (1) cilat shpërndarje të dhënash duhet të monitoroj, (2) çfarë alarmi për shpërndarjen e parashikimit, (3) si të krahasohet performanca kur të arrijë rezultati real, (4) në cilin prag duhet të aktivizohet rikualifikimi. Jepni gjithashtu një skelet kodi.

3) Kontrolli i drejtësisë:

Shkruani kodin që krahason performancën e modelit tim për grupe të ndryshme (p.sh. brezi i moshës, rajoni): rikujtimi/saktësia dhe norma pozitive e vendimeve për secilin grup. Paralajmëroni nëse ka një ndryshim domethënës midis grupeve. Bërja e interpretimeve kauzale/politike; Thjesht më tregoni dallimet dhe unë do të marr parasysh vendimin.

4) Kontrolli paraprak i privatësisë:

Përpara se t'i jepni të dhëna një vegle AI, kontrolloni: a ka të dhëna personale/identiteti (emri, emaili, ID, telefoni, adresa, IP) në listën e kolonës më poshtë? Nëse po, rendisni cilat duhen hequr ose anonimizuar. Kolonat: [lista]. Qëllimi: të ndahet vetëm skema anonime.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Modeli im është gati, shkoni live.

Vendosja nuk është një hap i vetëm; Transmetimi i drejtpërdrejtë pa monitorim, rikthim, drejtësi dhe kontroll të privatësisë është një ftesë e heshtur për katastrofë.

Njoftim i fuqishëm:

Roli juaj: konsulent përgjegjës për MLOps. Modelja ime është trajnuar, dua përgatitje të plotë përpara se të dal live. Gjeneroni: (1) listë kontrolli para vendosjes, (2) plan monitorimi të lëvizjes, (3) kodin e kontrollit të drejtësisë të bazuar në grup, (4) kontrollin e privatësisë (a ka të dhëna personale). Gjithashtu sugjeroni se si të mbroni pëlqimin njerëzor në vendimet me ndikim të lartë. Vendimet përfundimtare janë të miat.

Këtu shpërndarja, monitorimi, drejtësia dhe privatësia trajtohen si një proces i vetëm përgjegjës.

Gabimet e zakonshme

  • Vendosja e një modeli pa vendosur monitorim. Modeli në heshtje rrëshqet dhe shtrembëron; Mund të duhen muaj për ta vërejtur.
  • Duke anashkaluar kontrollin e drejtësisë. Një model me besnikëri të lartë mund të dëmtojë sistematikisht një grup.
  • Marrja e një vendimi të pashpjeguar të kutisë së zezë. Vendimet me ndikim të lartë duhet të jenë të shpjegueshme; “Kështu tha modelja” nuk mjafton.
  • Dhënia e të dhënave reale personale për të hapur mjetin AI. Shkelje KVKK/GDPR; Diagrami dhe shembulli anonim janë të mjaftueshëm.
  • Delegimi i vendimit tek modelja. Përgjegjësia i takon gjithmonë një personi; Mbajtja e mbikëqyrjes njerëzore me ndikim të lartë.
Këshillë: Përpara se të dilni drejtpërdrejt me çdo model, bëni një pyetje me zë të lartë: "Nëse ky model prishet në heshtje nesër ose penalizon padrejtësisht një grup, si do ta vërej dhe do ta kthej përsëri?" Nëse nuk keni një përgjigje të qartë për këtë pyetje, modeli nuk është ende gati për prodhim.

Në përmbledhje

Puna e një modeleje nuk përfundon me një rezultat të lartë, por me punën e besueshme dhe të përgjegjshme në prodhim. MLOps është disiplina e transmetimit të drejtpërdrejtë, monitorimit për drift, ritrajnimit dhe rikthimit të modelit; Vendosja pa gjurmim është kolaps i heshtur. Etika kërkon drejtësi, transparencë dhe llogaridhënie të modelit; saktësia statistikore nuk është zëvendësim për pranueshmërinë etike. Privatësia nënkupton mbrojtjen e të dhënave personale me parimet KVKK/GDPR dhe mbajtjen e të dhënave reale larg mjeteve të hapura. Të gjitha këto vendime nuk janë vendime teknike, por përgjegjësie dhe i përkasin gjithmonë një njeriu.

Detyra e aplikimit

Mendojeni sikur do të vendosnit në prodhim një model që keni ndërtuar (ose hipotetik) dhe plotësoni katër lista: (1) listë kontrolli para vendosjes, (2) metrikat e zhvendosjes që do të gjurmoni, (3) planin e kontrollit të drejtësisë të bazuar në grup, (4) kontrollin e privatësisë. Më pas shkruani një përgjigje konkrete për pyetjen "Si do ta vërej nëse do të prishet në heshtje nesër dhe do ta marr përsëri?"

listë kontrolli

  • [ ] A po e vendos modelin me një plan monitorimi (paralajmërim për rrëshqitje) dhe rikthim?
  • [ ] A e kam kontrolluar hendekun e drejtësisë/performancës për grupe të ndryshme?
  • [ ] A kam mbajtur mendjen njerëzore në vendimet me ndikim të lartë?
  • [ ] A i kam mbrojtur të dhënat personale me parimet KVKK/GDPR dhe i kam mbajtur larg mjeteve të hapura?
  • [ ] A ia kam vënë përgjegjësinë përfundimtare njeriut, jo modelit?

Provimi i Modulit

1. Një shkencëtar i të dhënave pyet inteligjencën artificiale: "Sa i saktë është pylli i rastësishëm në këto të dhëna?" pa e trajnuar fare modelin, dhe e vendos drejtpërdrejt përgjigjen "89%" në prezantim. Cili është gabimi themelor në këtë qasje?

  • A) Pritja e metrikës pa i dhënë të dhëna dhe modele inteligjencës artificiale; Duke injoruar se numri që prodhon është i rremë dhe se metrika e vërtetë mund të gjendet vetëm përmes trajnimit dhe testimit ✔
  • B) Duhet të përdorë regresionin logjistik në vend të pyllit të rastësishëm
  • C) Shkalla e saktësisë duhet të jetë gjithmonë mbi 90%.
  • D) Është rreptësisht e ndaluar përfshirja e metrikës në prezantim

Shpjegim: Inteligjenca artificiale nuk mund të prodhojë një metrikë pa qasje në model dhe të dhëna; Numri që ai jep është një halucinacion (i sajuar). Metrika merret nga llogaritja e vetë shkencëtarit të të dhënave vetëm pasi modeli të jetë trajnuar dhe testuar. Prodhimi i paverifikuar është si një raport i panënshkruar.

2. Kolona 'arsyeja e mbylljes së llogarisë' përfshihet gjatë mbledhjes së të dhënave për një parashikim të përmbysjes; Kjo kolonë plotësohet vetëm pasi klienti të largohet. Modeli jep 97% në grupin e provës, por nuk funksionon në prodhim. Cili është emri dhe shkaku i kësaj gjendjeje?

  • A) Mësimi i tepërt; Modeli është shumë kompleks
  • B) Rrjedhja e të dhënave; ✔ Përdorimi i informacionit që nuk do të jetë i disponueshëm në momentin e parashikimit, por është rezultat i objektivit, si veçori
  • C) Mësimi i pamjaftueshëm; Modeli është shumë i thjeshtë
  • D) Paragjykimet e përzgjedhjes; madhësia e vogël e mostrës

Shpjegim: Kjo është një rrjedhje klasike e të dhënave: 'arsyeja e mbylljes' është rezultat i objektivit dhe është ende bosh në kohën e parashikimit. Modeli e bën mashtrimin me këtë njohuri në të ardhmen, duket i shkëlqyeshëm në grupin e provës, por rrëzohet në prodhim sepse ajo kolonë është bosh. Pyetja 'a e kam në momentin e parashikimit' duhet t'i bëhet çdo kolone.

3. Një analist plotëson vlerat që mungojnë në kolonën e të ardhurave me mesataren; por të zhdukurit në fakt i përkasin segmentit me të ardhura të ulëta që nuk ka deklaruar asnjëherë të ardhura (të munguara sistematike). Pse është e gabuar kjo mbushje?

  • A) Mesatarja është gjithmonë më e madhe se mesatarja, pra është e pasaktë
  • B) Vlerat që mungojnë nuk duhet të plotësohen kurrë, ato duhet të fshihen gjithmonë
  • C) Plotësimi i boshllëkut sistematik me mesataren shtrembëron të dhënat duke e përfaqësuar artificialisht atë grup; Mbushja u bë pa shtruar pyetjen 'pse është bosh?' ✔
  • D) Llogaritja e mesatares krijon një problem performancës sepse është shumë i ngadaltë

Shpjegimi: Shkaku i mungesës përcakton zgjidhjen. Kur mungesa sistematike (boshllëku i përqendruar në një grup të caktuar) plotësohet me mesataren, ai grup bëhet artificialisht 'të ardhura mesatare' dhe të dhënat shtrembërohen. Para se ta plotësoni, duhet bërë pyetja 'pse është bosh'; Mesatarja sistematike/e rëndësishme që mungon nuk duhet të plotësohet.

4. Një ekip gjen një korrelacion 0.78 midis 'shpenzimeve për reklama' dhe 'shitjeve' dhe dyfishon buxhetin; Megjithatë, ajo që në fakt i nxit të dyja janë fushatat sezonale. Cili parim në statistikë e shpjegon këtë gabim?

  • A) Korrelacioni nuk është shkakësi; Një ndryshore e tretë e fshehur mund të jetë duke prekur të dy variablat ✔
  • B) Meqenëse korrelacioni prej 0.78 është shumë i ulët, lidhja duhet të injorohet
  • C) Korrelacioni dëshmon gjithmonë kauzën, skuadra e kishte të drejtë
  • D) Korrelacioni ndërmjet reklamave dhe shitjeve nuk mund të llogaritet matematikisht.

Shpjegimi: Korrelacioni nuk është shkakësi. Të dy variablat mund të veprojnë së bashku sepse një variabël i tretë i fshehur (këtu fushatat sezonale) i prek të dyja. Përfundimi se njëri shkakton tjetrin mund të përcaktohet vetëm nëpërmjet eksperimentit dhe njohurive në terren; Vetëm numri i korrelacioneve nuk është dëshmi e shkakësisë.

5. Një model i zbulimit të mashtrimit tregon saktësi 99,2% dhe ekipi feston; Megjithatë, norma e transaksioneve të rreme në të dhëna është vetëm 0.8% dhe tërheqja e modelit është 6%. Çfarë tregon kjo tabelë?

  • A) Modeli është i përsosur sepse saktësia është mbi 99%
  • B) Saktësia është mashtruese me të dhëna të pabalancuara; Modelit i mungojnë pothuajse të gjitha falsifikimet (kujtesa e ulët), metrika e duhur duhet të shikohet ✔
  • C) Nuk ka asnjë problem pasi tërheqja e modelit është e lartë
  • D) Nuk kishte nevojë për të ndërtuar një model, sepse norma e rreme ishte e ulët

Shpjegim: 'Saktësia' është mashtruese në të dhënat e pabalancuara. Kur modeli e quan pothuajse çdo transaksion 'të pastër', ai merr saktësi të lartë sepse falsifikimet janë shumë të pakta, por nuk arrin të kapë falsifikimet, që është qëllimi i tij kryesor (kujtimi 6%). Prandaj, në problemet e pabalancuara, fokusi nuk është te saktësia, por te matrica e konfuzionit dhe metrikat e përshtatshme për qëllimin e punës, si për shembull rikujtimi/precizioni.

6. Në një projekt të parashikimit të kërkesës, të dhënat e varura nga koha ndahen rastësisht në trajnim/testim. Modeli jep 93% saktësi, por rrëzohet në prodhim. Cila duhet të jetë qasja e saktë e ndarjes?

  • A) Zgjerimi i grupit të testimit, p.sh. ndarja 50%/50%
  • B) Përdorimi i një modeli më kompleks
  • C) Hiqni plotësisht ndarjen dhe stërvituni me të gjitha të dhënat
  • D) Ndarja kronologjike: trajnimi me periudhën e vjetër dhe testimi me periudhën e re, duke penguar kështu modelin të shohë të ardhmen ✔

Shpjegim: Nëse ndarja e rastësishme bëhet në të dhënat e serive kohore, modeli sheh të ardhmen dhe parashikon të shkuarën në trajnim; është një rrjedhje dhe prodhon sukses që në fakt nuk ekziston. Qasja e saktë është ndarja kronologjike: trajnimi me periudhën e vjetër dhe testimi me periudhën e re, imitimi i situatës reale në prodhim (parashikimi nga e kaluara në të ardhmen).

7. Nga cilat të dhëna duhet të llogariten parametrat e shkallëzimit (StandardScaler) në inxhinierinë e veçorive dhe si duhet të aplikohen?

  • A) Duhet të llogaritet nga të gjitha të dhënat (trajnim + testim së bashku) në mënyrë që të jetë më i saktë
  • B) Duhet të llogaritet veçmas për çdo rresht, nga vlera e vetë atij rreshti
  • C) Duhet të llogaritet vetëm nga të dhënat e testit
  • D) Duhet të llogaritet vetëm nga të dhënat e trajnimit, pastaj të njëjtat parametra duhet të zbatohen për të dhënat e testit; përndryshe do të rrjedhë ✔

Shpjegim: Parametrat e të gjitha transformimeve (mesatarja, devijimi standard, etj.) si shkallëzimi, kodimi dhe mbushja duhet të mësohen vetëm nga të dhënat e trajnimit, pastaj e njëjta duhet të zbatohet për të dhënat e testit. Marrja në konsideratë e të dhënave të testit gjithashtu shkakton që informacioni i testit të ndërhyjë në trajnim, domethënë rrjedhje, dhe e bën modelin të duket më i mirë se sa është. Përdorimi i Pipeline e siguron këtë.

8. Një model jep 98% saktësi në grupin e trajnimit dhe 72% saktësi në grupin e testimit. Çfarë tregon kjo simptomë dhe çfarë duhet bërë?

  • A) Mësimi i pamjaftueshëm; modeli duhet bërë më kompleks
  • B) Rrjedhja e të dhënave; grupi i provës duhet të ndryshohet
  • C) Mbi përshtatje; modeli duhet të thjeshtohet, duhet të zbatohet rregullimi dhe vlefshmëria e kryqëzuar ✔
  • D) Një situatë normale; Gjithsesi, rezultati i arsimit është gjithmonë më i lartë, masat paraprake janë të panevojshme

Shpjegim: Një rezultat shumë i lartë në trajnim dhe një rezultat dukshëm i ulët në testim është një simptomë klasike e përshtatjes së tepërt: modeli ka memorizuar zhurmën e të dhënave të trajnimit dhe jo modelin real. Zgjidhjet përfshijnë thjeshtimin e modelit, më shumë të dhëna, rregullimin dhe verifikimin e gjendjes me verifikim të kryqëzuar. Mbështetja vetëm në rezultatin e arsimit e fsheh këtë grackë.

9. Në një prezantim menaxhimi, boshti y i një grafiku me shtylla në të cilin shitjet rriten nga 1000 në 1020 fillon në 980 për ta bërë rritjen të duket e madhe. Rritja aktuale është 2%. Pse është kjo një çështje etike?

  • A) Një bosht i cunguar y ekzagjeron vizualisht një ndryshim të vogël dhe mashtron shikuesin; Për drejtësi, boshti në shiritat e krahasimit duhet të fillojë nga 0 ✔
  • B) Grafikët me shirita nuk mund të përdoren kurrë për të dhënat e shitjeve
  • C) Nuk ka problem; Është gjithmonë mirë që grafiku të duket mbresëlënës
  • D) Boshti Y duhet të fillojë gjithmonë nga vlera më e madhe e të dhënave

Shpjegim: Në grafikët me shtylla për qëllime krahasuese, boshti y në përgjithësi duhet të fillojë me 0. Prerja e boshtit dhe fillimi në 980 bën që një ndryshim i vogël prej 2% të duket vizualisht i madh dhe të mashtron shikuesin. Përgjegjësia etike e profesionistit të të dhënave është të nxjerrë grafikë të sinqertë që nuk i mbivlerësojnë ose nënvlerësojnë të dhënat.

10. Një analist gjen xhiron totale 3 herë pas BASHKIMIT të porosive me tabelën e produkteve; Numri i linjave u rrit nga 240 mijë në 690 mijë. Çfarë duhet të ishte bërë për të parandaluar këtë gabim të heshtur?

  • A) Pjestoni xhiron totale me 3
  • B) Përdorni gjithmonë pyetje të veçanta në vend të JOIN
  • C) Fshirja e plotë e tabelës së produkteve
  • D) Kontrollimi i numrit të rreshtave pas bashkimit/JOIN dhe verifikimi që ato janë bashkuar nëpërmjet çelësit të saktë; Kapja e përsëritjes herët ✔

Shpjegim: Kur ka shumë rreshta për çdo produkt (ngjyra të ndryshme, për shembull) në tabelën e produktit, JOIN nëpërmjet çelësit të gabuar do të kopjojë çdo porosi dhe do të fryjë totalet. Kodi funksionon pa gabime, por rezultati është i gabuar. Mënyra për të shmangur këtë është të kontrolloni numrin e rreshtave pas çdo bashkimi/JOIN dhe të bashkoni me çelësin e duhur.

11. Një model i shqyrtimit të punësimit mëson për mosbalancimin gjinor në të dhënat historike dhe nënvlerëson sistematikisht kandidatet femra, por saktësia e tij e përgjithshme është e lartë. Çfarë do të thotë kjo?

  • A) Nuk ka asnjë problem sepse modeli ka saktësi të lartë
  • B) Saktësia statistikore nuk është zëvendësim për pranueshmërinë etike; modeli ka mësuar për diskriminimin e kaluar, kërkohet kontrolli i drejtësisë i bazuar në grup ✔
  • C) Rritja e mëtejshme e saktësisë së modelit zgjidh problemin
  • D) Drejtësia është jashtë fushës së shkencës së të dhënave

Shpjegim: Edhe nëse një model është statistikisht i saktë, ai mund të jetë etikisht i papranueshëm. Modeli mëson padrejtësinë në të dhënat e kaluara dhe automatizon diskriminimin. Integriteti i lartë nuk është zëvendësues për drejtësinë; Në modelet me ndikim të lartë, kontrolli i drejtësisë, i cili mat dallimin e performancës/vendimit për grupe të ndryshme, është thelbësor dhe përgjegjësia përfundimtare i takon njeriut.

12. Një punonjës ngarkon një skedar që përmban emaile reale të klientëve dhe histori blerjesh në një mjet publik të AI dhe thotë 'përmbledh segmentet'. Pse është ky një gabim serioz dhe cila është mënyra e duhur?

  • A) Nuk ka asnjë problem; Mjetet e AI nuk ruajnë kurrë të dhëna
  • B) Gabimi është se skedari është shumë i madh; duhej të reduktohej
  • C) Dhënia e të dhënave reale personale në një mjet të hapur është shkelje e KVKK/GDPR; Fushat e identitetit duhet të ishin hequr dhe të ndaheshin vetëm skema/prona anonime ✔
  • D) CSV duhet të ishte përdorur në vend të vetëm Excel

Shpjegim: Kur të dhënat reale personale (si e-mail, emri, etj.) i jepen një mjeti të inteligjencës artificiale të disponueshme publikisht, do të ketë shkelje të privatësisë brenda fushës së KVKK / GDPR; të dhënat largohen nga organizata. Në shumicën e rasteve, një diagram dhe një mostër anonime/sintetike janë të mjaftueshme për analizë. Mënyra e duhur është të hiqni fushat e identitetit dhe të ndani vetëm pronat anonime.

13. Një model rekomandimi është vënë në prodhim, por gjurmimi nuk është vendosur; Kur katalogu i produkteve ndryshon pas 4 muajsh, modeli vazhdon të rekomandojë produkte të vjetra dhe shkalla e konvertimit bie në heshtje me 30%. Cili është emri i këtij fenomeni?

  • A) Mësimi i tepërt; Modeli memorizon grupin e trajnimit
  • B) Zhvendosja e modelit; Ndërsa bota ndryshon, modeli bëhet i vjetëruar në heshtje, pa u vënë re sepse monitorimi nuk është vendosur ✔
  • C) Paragjykimet e përzgjedhjes; paragjykimi i mostrës
  • D) Shkelje e minimizimit të të dhënave

Shpjegim: Ky është zhvendosja e modelit (model/zhvendosje e të dhënave): kur bota ndryshon (katalogu, sjellja, sezoni) ndryshojnë kushtet në të cilat modeli është trajnuar dhe modeli prishet në heshtje. Një model i vënë në prodhim përkeqësohet vetvetiu; Është çështje “kur”. Vendosja pa monitorim (përcjellja e hyrjes dhe performancës) e bën të pamundur zbulimin e degradimit.

14. Një model që merr 88% saktësi në një ndarje të vetme trajnimi/testi ka 5-fish rezultate të verifikimit të kryqëzuar prej 88%, 71%, 83%, 64%, 79%. Çfarë tregon kjo dhe pse është i rëndësishëm verifikimi i kryqëzuar?

  • A) Modeli është i qëndrueshëm; 88% është performancë reale
  • B) Vlerësimi i kryqëzuar është i panevojshëm; Mjafton një ndarje
  • C) Paqëndrueshmëria e madhe e pikëve tregon se modeli është i paqëndrueshëm; Vërtetimi i kryqëzuar e bazon performancën në mesataren dhe shpërndarjen e koshave të shumtë, jo një kosh të vetëm me fat ✔
  • D) Është më mirë të raportoni rezultatin më të lartë (88%)

Shpjegim: Një ndarje e vetme mund të jetë me fat ose pa fat; 88% ishte vetëm rezultat i asaj ndarjeje të lehtë. Vërtetimi i kryqëzuar i ndan të dhënat disa herë, duke bazuar performancën në mesataren (këtu ~ 77%) dhe duke treguar paqëndrueshmërinë e rezultateve. Paqëndrueshmëria e lartë këtu sugjeron që modeli është i paqëndrueshëm; Të mbështetesh në një ndarje të vetme është mashtruese.