Eenheid 11 / 11

MLOps Foundation, Ethiek, Privacy en Verantwoorde Analytics

Winst:

  • Mogelijkheid om MLOps-fasen (release, implementatie, monitoring, hertraining, rollback) en modeldrift te begrijpen en een bewaakte implementatie te plannen
  • Vermogen om de principes van eerlijkheid, transparantie en verantwoording van modellen toe te passen en statistische nauwkeurigheid te onderscheiden van ethische aanvaardbaarheid
  • Mogelijkheid om persoonlijke gegevens te beschermen met de KVKK/GDPR-principes en de eindverantwoordelijkheid toe te wijzen aan een mens bij beslissingen met grote impact

Het trainen van een model en het behalen van een hoge score is niet het einde, maar het midden. De echte waarde ontstaat wanneer het model in productie wordt genomen en betrouwbaar werkt, in de loop van de tijd wordt gecontroleerd zonder verslechtering, en het hele proces wordt uitgevoerd binnen ethische en juridische grenzen. Deze afsluitende unit combineert drie onderwerpen: MLOps (de discipline van het live gaan, monitoren en onderhouden van modellen), ethiek (eerlijkheid, transparantie, non-maleficence) en privacy (bescherming van persoonsgegevens). AI produceert code, checklists en blauwdrukken op deze gebieden; Maar mensen beslissen of een model live gaat, wie erdoor wordt beïnvloed en welke gegevens kunnen worden gebruikt. Deze beslissingen zijn geen technische, maar verantwoordelijkheidsbeslissingen.

MLOps: het model leeft als een product

MLOps (Machine Learning Operations - de praktijk van het uitvoeren, monitoren en updaten van machine learning-modellen in productie) is de aanpassing van DevOps in softwareontwikkeling aan datawetenschap. Het basisidee: een model is geen bestand dat één keer wordt getraind en vergeten, maar een levend product dat voortdurend onderhoud vereist. Belangrijkste fasen:

1. Versiebeheer: Code (Git), data en model worden samen in versiebeheer gebracht; Er wordt vastgelegd welk model met welke data en code is geproduceerd.

2. Implementatie: Het model wordt live gezet als API of batchjob. Het wordt meestal eerst aan een klein publiek gegeven (schaduw-/kanarieverdeling).

3. Monitoring: De prestaties van het model en de invoergegevens worden voortdurend gemonitord.

4. Opnieuw trainen: wanneer de prestaties afnemen, wordt het model opnieuw getraind met bijgewerkte gegevens.

Patroonverschuiving: stille vervorming

Het grootste gevaar bij de productie is modeldrift (modeldrift / datadrift). De wereld verandert; De omstandigheden waarop u uw model heeft getraind (klantgedrag, prijzen, seizoen, wetgeving) veranderen in de loop van de tijd en het model begint verouderd te raken. Een vraagmodel dat vóór de pandemie is getraind, is bijvoorbeeld tijdens de pandemie volkomen verkeerd. Drift komt in twee vormen voor: datadrift (de verdeling van wijzigingen in invoergegevens) en conceptdrift (de relatie tussen invoer- en doelwijzigingen). De manier om deze vast te leggen is monitoring: volg voortdurend de invoerverdeling, de voorspellingsverdeling en (indien mogelijk) de prestaties in vergelijking met het daadwerkelijke resultaat.

Let op: een model dat in productie wordt genomen, zal vanzelf verslechteren; Het is geen kwestie van ‘of’, maar van ‘wanneer’. Het inzetten van modellen zonder monitoring in te stellen is als autorijden zonder ooit de motor onder controle te hebben; Op een dag zit het daar gewoon stil en merk je het niet.

MLOps-element

Doel

Indien verwaarloosd

Versiebeheer

Weten wat er geproduceerd wordt

Niet reproduceerbaar, niet traceerbaar

Toezicht

Vroeg de slip zien

Het model valt stilletjes uiteen

omscholing

blijf op de hoogte

Voorspellingen worden oud

Terugdraaien

terug naar een slecht model

Het defecte model blijft live

Documentatie

transparantie, omzet

Informatie blijft hangen in één persoon

Ethiek: modelbeslissingen beïnvloeden mensen

Datamodellen worden steeds vaker gebruikt bij beslissingen die van invloed zijn op het leven van mensen: krediet, aanwerving, verzekeringen, justitie. Met deze macht komt verantwoordelijkheid. Grote ethische risico’s:

Vooroordelen en discriminatie: het model kan onrechtvaardigheden in historische gegevens leren en bestendigen. Als een bepaalde groep in het verleden minder krediet heeft gekregen, gaat het model ervan uit dat dit een ‘regel’ is en wordt discriminatie geautomatiseerd. Daarom is een eerlijkheidsanalyse – waarbij wordt gecontroleerd of het model voor verschillende groepen (geslacht, leeftijd, regio) op vergelijkbare wijze presteert – essentieel.

Transparantie en uitlegbaarheid: Je moet kunnen uitleggen waarom een ​​model een persoon heeft afgewezen. ‘De zwarte doos zei het’ is ethisch en vaak juridisch onaanvaardbaar. Daarom zijn tools voor uitlegbaarheid (belangrijkheid van functies, SHAP-waarden) waardevol.

Verantwoording: wie is verantwoordelijk als het model de verkeerde beslissing neemt? Het antwoord is altijd een persoon/instelling, geen model. Menselijk toezicht (human-in-the-loop – een mens die de uiteindelijke beslissing goedkeurt) moet behouden blijven bij beslissingen met een grote impact.

Let op: een model kan statistisch 'correct' zijn, maar ethisch onaanvaardbaar. Een zeer accuraat model dat systematisch één groep benadeelt, is geen goed model. Eerlijkheid is geen vervanging voor gerechtigheid.

Privacy: persoonsgegevens worden zorgvuldig beschermd

De grondstof van data science zijn vaak persoonsgegevens, en deze gegevens zijn beschermd door de wet: KVKK in Türkiye, GDPR in Europa. De basisprincipes zijn: doelbinding (gegevens worden niet gebruikt voor andere doeleinden dan waarvoor ze zijn verzameld), dataminimalisatie (er worden niet meer gegevens verzameld/bewaard dan noodzakelijk), anonimisering (identificerende informatie wordt verwijderd) en beveiliging (gegevens worden gecodeerd bewaard en de toegang wordt beperkt). Cruciale regel bij het werken met AI-tools: plak nooit echte persoonlijke gegevens in een openbare AI-tool. Meestal zijn een diagram en een anoniem/synthetisch monster voldoende voor analyse.

Een extra nadruk in de context van informatiebeveiliging: gebruik data science-tools en -technieken alleen op gegevens en systemen waarvoor u autoriteit heeft, voor defensieve en legitieme analysedoeleinden. Ongeoorloofde toegang tot de gegevens van iemand anders, heridentificatie van individuen (identiteit uit anonieme gegevens halen) of ongeoorloofde profilering is zowel illegaal als onethisch.

drie minikoffers

Geval 1 – Ongespoorde ineenstorting. Een e-commercebedrijf is live gegaan met zijn aanbevelingsmodel en heeft geen tracking ingesteld. Na 4 maanden is de productcatalogus sterk veranderd; het model bleef verouderde producten aanbevelen en het conversiepercentage daalde stilletjes met 30%. Maandenlang heeft niemand het gemerkt. Les: inzet zonder monitoring is blind.

Geval 2 — Verborgen discriminatie. Een wervingsscreeningsmodel leerde over de ongelijkheid tussen mannen en vrouwen in historische gegevens en onderschatte vrouwelijke kandidaten systematisch. Het werd niet opgemerkt omdat er geen eerlijkheidsanalyse was; Dit kwam aan het licht tijdens een audit en de instelling liep ernstige reputatie- en juridische risico's. Les: op groepen gebaseerde eerlijkheidscontrole is essentieel in modellen met een hoge impact.

Geval 3 — Schending van de vertrouwelijkheid. Eén analist laadde een bestand met echte e-mails van klanten en de aankoopgeschiedenis in een openbare AI-tool en zei: ‘vat segmenten samen’. Persoonsgegevens hebben de instelling verlaten; KVKK-proces is gestart. De juiste manier was om identiteitsvelden te verwijderen en alleen anonieme eigenschappen te delen. Les: echte persoonlijke gegevens komen niet in de open tool terecht.

Vier kopieerbare sjablonen

1) Controlelijst voorafgaand aan de implementatie:

Jouw rol: MLOps-consultant. Noem de dingen die ik moet controleren voordat ik een model in productie breng: versiebeheer, monitoringstatistieken, rollbackplan, prestatiedrempel, waarschuwing voor gegevensafwijking, verantwoordelijke persoon. Voeg voor elk item een ​​uitleg van één zin toe: 'Waarom het ertoe doet'. Ik zal beslissen.

2) Ontwerp voor het volgen van modelverschuivingen:

Stel een driftmonitoringplan voor voor een classificatiemodel in productie: (1) welke invoerverdelingen moet ik monitoren, (2) welk alarm voor de voorspellingsverdeling, (3) hoe de prestaties te vergelijken wanneer het echte resultaat arriveert, (4) op welke drempel hertraining moet worden geactiveerd. Geef ook een codeskelet op.

3) Eerlijkheidscontrole:

Schrijf code die de prestaties van mijn model voor verschillende groepen vergelijkt (bijvoorbeeld leeftijdscategorie, regio): herinnering/precisie en positief beslissingspercentage voor elke groep. Waarschuw als er een significant verschil is tussen groepen. Het maken van causale/politieke interpretaties; Laat me gewoon de verschillen zien, dan zal ik de beslissing overwegen.

4) Privacycontrole vooraf:

Voordat u gegevens aan een AI-tool verstrekt, controleert u: staan er persoonlijke/identiteitsgegevens (naam, e-mailadres, ID, telefoon, adres, IP) in de onderstaande kolommenlijst? Zo ja, vermeld dan welke moeten worden verwijderd of geanonimiseerd. Kolommen: [lijst]. Doel: alleen anoniem schema delen.

Zwakke prompt/sterke prompt

Zwakke prompt:

Mijn model is klaar, ga live.

Implementatie is geen enkele stap; Live gaan zonder monitoring, terugdraaien, eerlijkheid en privacycontrole is een stille uitnodiging voor een ramp.

Krachtige prompt:

Jouw rol: verantwoordelijke MLOps consultant. Mijn model is getraind, ik wil een volledige voorbereiding voordat ik live ga. Genereer: (1) checklist vóór de inzet, (2) driftmonitoringplan, (3) op groepen gebaseerde eerlijkheidscontrolecode, (4) privacycontrole (zijn er persoonlijke gegevens). Stel ook voor hoe u de menselijke toestemming kunt beschermen bij beslissingen met een grote impact. De uiteindelijke beslissingen zijn van mij.

Hier worden distributie, monitoring, eerlijkheid en privacy behandeld als één enkel verantwoord proces.

Veel voorkomende fouten

  • Een model implementeren zonder monitoring in te stellen. Het model glijdt stilletjes weg en vervormt; Het kan maanden duren voordat je dit merkt.
  • Het omzeilen van de gerechtigheidscontrole. Een high-fidelity-model kan een groep systematisch benadelen.
  • Een onverklaarbare black box-beslissing nemen. Beslissingen met een grote impact moeten verklaarbaar zijn; ‘Het model zei het’ is niet genoeg.
  • Echte persoonlijke gegevens geven om de AI-tool te openen. KVKK/AVG-schending; Het diagram en het anonieme voorbeeld zijn voldoende.
  • Het delegeren van de beslissing aan het model. De verantwoordelijkheid ligt altijd bij een persoon; Menselijk toezicht met hoge impact wordt gehandhaafd.
Tip: Voordat je met elk model live gaat, stel je één vraag hardop: "Als dit model morgen stilletjes kapot gaat of een groep oneerlijk bestraft, hoe kan ik het dan opmerken en terugdraaien?" Als u geen duidelijk antwoord heeft op deze vraag, is het model nog niet klaar voor productie.

Samengevat

Het werk van een model eindigt niet bij een hoge score, maar bij betrouwbaar en verantwoord werken in de productie. MLOps is de discipline van live gaan, monitoren op drift, herscholing en het terugdraaien van het model; Implementatie zonder tracking is een stille ineenstorting. Ethiek vereist eerlijkheid, transparantie en verantwoording van het model; statistische nauwkeurigheid is geen vervanging voor ethische aanvaardbaarheid. Privacy betekent het beschermen van persoonlijke gegevens met de KVKK/GDPR-principes en het weghouden van echte gegevens uit open tools. Al deze beslissingen zijn geen technische, maar verantwoordelijkheidsbeslissingen en behoren altijd toe aan een mens.

Applicatie taak

Zie het alsof je een model dat je hebt gebouwd (of hypothetisch) in productie gaat nemen en vier lijsten invult: (1) checklist vóór de implementatie, (2) driftstatistieken die je gaat volgen, (3) op groepen gebaseerd eerlijkheidscontroleplan, (4) privacycontrole. Schrijf dan een concreet antwoord op de vraag "Hoe merk ik het morgen als het stilletjes kapot gaat en krijg ik het terug?"

controlelijst

  • [ ] Implementeer ik het model met een monitoring (slip alert) en rollback plan?
  • [ ] Heb ik de kloof tussen eerlijkheid en prestatie voor verschillende groepen gecontroleerd?
  • [ ] Heb ik de mens betrokken bij beslissingen met een grote impact?
  • [ ] Heb ik persoonlijke gegevens beschermd met de KVKK/GDPR-principes en weggehouden van open tools?
  • [ ] Heb ik de uiteindelijke verantwoordelijkheid bij een mens gelegd, en niet bij het model?

Module-examen

1. Een datawetenschapper vraagt aan de kunstmatige intelligentie: "Hoe nauwkeurig is willekeurig bos op basis van deze gegevens?" zonder het model helemaal te trainen, en plaatst het antwoord van "89%" direct in de presentatie. Wat is de fundamentele fout in deze aanpak?

  • A) Wachten op statistieken zonder gegevens en modellen aan kunstmatige intelligentie te geven; Negeren dat het getal dat het oplevert nep is en dat de echte maatstaf alleen kan worden gevonden door middel van training en testen ✔
  • B) Moet logistieke regressie gebruiken in plaats van willekeurig bos
  • C) Het nauwkeurigheidspercentage moet altijd boven de 90% liggen.
  • D) Het is ten strengste verboden om statistieken op te nemen in de presentatie

Uitleg: Kunstmatige intelligentie kan geen metriek produceren zonder toegang te krijgen tot het model en de gegevens; Het nummer dat hij geeft is een hallucinatie (verzonnen). De metriek wordt pas verkregen door de eigen berekening van de datawetenschapper nadat het model daadwerkelijk is getraind en getest. Niet-geverifieerde uitvoer is als een niet-ondertekend rapport.

2. De kolom 'Reden voor sluiting account' wordt opgenomen bij het verzamelen van gegevens voor een klantverloopprognose; Deze kolom wordt pas gevuld nadat de klant is vertrokken. Het model geeft 97% op de testset, maar werkt niet in productie. Wat is de naam en oorzaak van deze aandoening?

  • A) Overleren; Het model is te complex
  • B) Datalek; ✔ Het gebruik van informatie die niet beschikbaar zal zijn op het moment van de voorspelling, maar die het resultaat is van het doel, als een functie
  • C) Onvoldoende leren; Het model is te simpel
  • D) Selectiebias; kleine steekproefomvang

Uitleg: Dit is een klassiek datalek: de 'sluitingsreden' is een resultaat van het doel en is nog leeg op het moment van de voorspelling. Het model doet het met deze toekomstige kennis, het ziet er geweldig uit op de testset maar crasht in productie omdat die kolom leeg is. De vraag 'heb ik het op het moment van de voorspelling' moet aan elke kolom worden gesteld.

3. Een analist vult ontbrekende waarden in de omzetkolom in met het gemiddelde; maar de vermiste personen behoren feitelijk tot het lage-inkomenssegment dat nooit een inkomen heeft aangegeven (systematisch vermist). Waarom is deze vulling onjuist?

  • A) Het gemiddelde is altijd groter dan de mediaan, dus het is onjuist
  • B) Ontbrekende waarden mogen nooit worden ingevuld, ze moeten altijd worden verwijderd
  • C) Het opvullen van de systematische leemte met het gemiddelde vertekent de gegevens door die groep kunstmatig weer te geven; Het vullen gebeurde zonder de vraag te stellen 'waarom is het leeg?' ✔
  • D) Het berekenen van het gemiddelde creëert een prestatieprobleem omdat het te langzaam is

Toelichting: De oorzaak van het tekort bepaalt de oplossing. Wanneer het systematische ontbreken (het gat dat zich in een bepaalde groep concentreert) wordt opgevuld met het gemiddelde, wordt die groep kunstmatig een 'gemiddeld inkomen' en worden de gegevens vertekend. Voordat het wordt gevuld, moet de vraag worden gesteld 'waarom is het leeg'; systematisch/significant ontbrekend gemiddelde mag niet worden ingevuld.

4. Een team vindt een correlatie van 0,78 tussen 'advertentie-uitgaven' en 'verkoop' en verdubbelt het budget; Wat beide echter daadwerkelijk triggert, zijn seizoenscampagnes. Welk principe in de statistiek verklaart deze fout?

  • A) Correlatie is geen oorzakelijk verband; Een verborgen derde variabele kan beide variabelen beïnvloeden ✔
  • B) Omdat de correlatie van 0,78 te laag is, moet de relatie genegeerd worden
  • C) Correlatie bewijst altijd oorzakelijk verband, het team had gelijk
  • D) De correlatie tussen reclame en verkoop kan niet wiskundig worden berekend.

Uitleg: Correlatie is geen oorzakelijk verband. De twee variabelen kunnen samen optreden omdat een verborgen derde variabele (hier seizoenscampagnes) op beide van invloed is. De conclusie dat het een het ander veroorzaakt, kan alleen worden vastgesteld door middel van experimenten en veldkennis; Het aantal correlaties alleen is geen bewijs voor causaliteit.

5. Een fraudedetectiemodel toont een nauwkeurigheid van 99,2% en het team viert feest; Het percentage neptransacties in de gegevens bedraagt ​​echter slechts 0,8% en de herinnering van het model is 6%. Wat laat deze tabel zien?

  • A) Het model is perfect omdat de nauwkeurigheid meer dan 99% bedraagt
  • B) Nauwkeurigheid is misleidend bij onevenwichtige gegevens; Het model mist bijna alle vervalsingen (lage herinnering), er moet naar de juiste maatstaf worden gekeken ✔
  • C) Er is geen probleem, aangezien de terugroepactie van het model hoog is
  • D) Het was niet nodig om een model te bouwen omdat het percentage nepberichten laag was

Toelichting: 'Nauwkeurigheid' is misleidend bij onevenwichtige gegevens. Wanneer het model bijna elke transactie 'schoon' noemt, krijgt het een hoge nauwkeurigheid omdat er maar heel weinig namaaktransacties zijn, maar het slaagt er niet in om namaaktransacties te onderscheppen, wat het voornaamste doel is (denk aan 6%). Daarom ligt de nadruk bij onevenwichtige problemen niet op nauwkeurigheid, maar op de verwarringsmatrix en metrieken die geschikt zijn voor het doel van de taak, zoals herinnering/precisie.

6. In een vraagvoorspellingsproject worden tijdsafhankelijke gegevens willekeurig opgesplitst in training/testen. Het model geeft een nauwkeurigheid van 93%, maar crasht tijdens de productie. Wat zou de juiste verdelingsaanpak moeten zijn?

  • A) Het vergroten van de testset, b.v. splitsen 50%/50%
  • B) Gebruik van een complexer model
  • C) Verwijder de partitie volledig en train met alle gegevens
  • D) Chronologische opsplitsing: trainen met de oude periode en testen met de nieuwe periode, waardoor wordt voorkomen dat het model de toekomst ziet ✔

Uitleg: Als tijdreeksgegevens willekeurig worden verdeeld, ziet het model de toekomst en voorspelt het verleden tijdens de training; het is een lek en levert succes op dat eigenlijk niet bestaat. De juiste aanpak is chronologisch opsplitsen: trainen met de oude periode en testen met de nieuwe periode, waarbij de werkelijke situatie in de productie wordt nagebootst (voorspellen van het verleden naar de toekomst).

7. Uit welke gegevens moeten schaalparameters (StandardScaler) worden berekend in feature engineering en hoe moeten ze worden toegepast?

  • A) Het moet worden berekend op basis van alle gegevens (training + testen samen), zodat het nauwkeuriger is
  • B) Het moet voor elke rij afzonderlijk worden berekend, op basis van de eigen waarde van die rij
  • C) Moet uitsluitend op basis van testgegevens worden berekend
  • D) Het mag alleen worden berekend op basis van de trainingsgegevens, waarna dezelfde parameters moeten worden toegepast op de testgegevens; anders gaat het lekken ✔

Uitleg: De parameters van alle transformaties (gemiddelde, standaarddeviatie, enz.), zoals schaling, codering en opvulling, mogen alleen uit de trainingsgegevens worden geleerd, en vervolgens moet hetzelfde worden toegepast op de testgegevens. Het in aanmerking nemen van testgegevens zorgt er ook voor dat testinformatie de training verstoort (dat wil zeggen lekkage) en ervoor zorgt dat het model er beter uitziet dan het is. Het gebruik van Pipeline zorgt hiervoor.

8. Een model geeft 98% nauwkeurigheid op de trainingsset en 72% nauwkeurigheid op de testset. Wat duidt dit symptoom aan en wat moet er gedaan worden?

  • A) Onvoldoende leren; het model moet complexer worden gemaakt
  • B) Datalek; testset moet worden gewijzigd
  • C) Overfitting; het model moet worden vereenvoudigd, regularisatie en kruisvalidatie moeten worden toegepast ✔
  • D) Een normale situatie; De onderwijsscore is sowieso altijd hoger, voorzorgsmaatregelen zijn niet nodig

Uitleg: Een zeer hoge score bij training en een aanzienlijk lage score bij testen is een klassiek symptoom van overfitting: het model heeft de ruis van de trainingsgegevens onthouden in plaats van het werkelijke patroon. Oplossingen zijn onder meer het vereenvoudigen van het model, meer gegevens, regularisatie en het verifiëren van de staat met kruisvalidatie. Alleen vertrouwen op de onderwijsscore verbergt deze valkuil.

9. In een managementpresentatie begint de y-as van een staafdiagram waarin de omzetstijging van 1.000 naar 1.020 stijgt bij 980 om de stijging enorm te laten lijken. De werkelijke stijging bedraagt ​​2%. Waarom is dit een ethische kwestie?

  • A) Een afgeknotte y-as overdrijft visueel een klein verschil en misleidt de kijker; Om eerlijk te zijn moet de as in vergelijkingsbalken beginnen bij 0 ✔
  • B) Staafdiagrammen kunnen nooit worden gebruikt voor verkoopgegevens
  • C) Er is geen probleem; Het is altijd goed om de grafiek er indrukwekkend uit te laten zien
  • D) De Y-as moet altijd beginnen met de grootste waarde van de gegevens

Uitleg: In staafdiagrammen voor vergelijkingsdoeleinden zou de y-as over het algemeen moeten beginnen bij 0. Als u de as afsnijdt en begint bij 980, lijkt een klein verschil van 2% visueel enorm en misleidt de kijker. De ethische verantwoordelijkheid van de dataprofessional is om eerlijke grafieken te maken die de gegevens niet overdrijven of onderschatten.

10. Een analist vindt 3 keer de totale omzet na het samenvoegen van de bestellingen met de producttabel; Het aantal lijnen steeg van 240 duizend naar 690 duizend. Wat had er gedaan moeten worden om deze stille fout te voorkomen?

  • A) Deel de totale omzet door 3
  • B) Gebruik altijd afzonderlijke queries in plaats van JOIN
  • C) Het volledig verwijderen van de producttabel
  • D) Het controleren van het aantal rijen na het samenvoegen/JOIN en verifiëren dat ze zijn samengevoegd via de juiste sleutel; Replicatie vroeg opvangen ✔

Uitleg: Als er meerdere rijen voor elk product (bijvoorbeeld een andere kleur) in de producttabel staan, zal JOIN via de verkeerde sleutel elke bestelling dupliceren en de totalen verhogen. De code wordt zonder fouten uitgevoerd, maar het resultaat is verkeerd. De manier om dit te voorkomen is door het aantal rijen na elke samenvoeging/JOIN te controleren en samen te voegen met de juiste sleutel.

11. Een screeningsmodel voor aanwervingen leert over de onevenwichtigheid tussen mannen en vrouwen in historische gegevens en geeft systematisch onderscores aan vrouwelijke kandidaten, maar de algehele nauwkeurigheid is hoog. Wat betekent dit?

  • A) Er is geen probleem omdat het model een hoge nauwkeurigheid heeft
  • B) Statistische nauwkeurigheid is geen vervanging voor ethische aanvaardbaarheid; model heeft geleerd over discriminatie uit het verleden, is een op groepen gebaseerde eerlijkheidscontrole vereist ✔
  • C) Het verder vergroten van de nauwkeurigheid van het model lost het probleem op
  • D) Eerlijkheid valt buiten het bereik van datawetenschap

Uitleg: Zelfs als een model statistisch correct is, kan het ethisch onaanvaardbaar zijn. Het model leert het onrecht in gegevens uit het verleden en automatiseert discriminatie. Hoge integriteit is geen vervanging voor gerechtigheid; In modellen met een hoge impact is eerlijkheidscontrole, die het prestatie-/beslissingsverschil voor verschillende groepen meet, essentieel en ligt de uiteindelijke verantwoordelijkheid bij de mens.

12. Een medewerker uploadt een bestand met echte e-mails van klanten en de aankoopgeschiedenis naar een openbare AI-tool en zegt 'samenvatting van segmenten'. Waarom is dit een ernstige fout en wat is de juiste manier?

  • A) Er is geen probleem; AI-tools slaan nooit gegevens op
  • B) De fout is dat het bestand te groot is; had moeten worden verkleind
  • C) Het verstrekken van echte persoonlijke gegevens aan een open tool is een overtreding van KVKK/GDPR; identiteitsvelden hadden moeten worden verwijderd en alleen anoniem schema/eigenschap gedeeld ✔
  • D) CSV had moeten worden gebruikt in plaats van alleen Excel

Toelichting: Wanneer echte persoonsgegevens (zoals e-mail, naam, etc.) worden doorgegeven aan een publiekelijk beschikbaar hulpmiddel voor kunstmatige intelligentie, is er sprake van een privacyschending in de zin van KVKK/AVG; gegevens verlaten de organisatie. Meestal zijn een diagram en een anoniem/synthetisch monster voldoende voor analyse. De juiste manier is om identiteitsvelden te verwijderen en alleen anonieme eigenschappen te delen.

13. Er wordt een aanbevelingsmodel in productie genomen, maar er is geen tracking tot stand gebracht; Wanneer de productcatalogus na 4 maanden verandert, blijft het model oude producten aanbevelen en daalt het conversiepercentage stilletjes met 30%. Wat is de naam van dit fenomeen?

  • A) Overleren; Het model onthoudt de trainingsset
  • B) Modeldrift; Naarmate de wereld verandert, raakt het model stilletjes en onopgemerkt achterhaald omdat er geen toezicht is ✔
  • C) Selectiebias; steekproef bias
  • D) Schending van gegevensminimalisatie

Uitleg: Dit is modeldrift (model/datadrift): wanneer de wereld verandert (catalogus, gedrag, seizoen) veranderen de omstandigheden waaronder het model werd getraind en valt het model stilzwijgend uiteen. Een model dat in productie wordt genomen, gaat vanzelf achteruit; Het is een kwestie van ‘wanneer’. Implementatie zonder monitoring (het volgen van input en prestaties) maakt het onmogelijk om degradatie te detecteren.

14. Een model dat een nauwkeurigheid van 88% behaalt in een enkele training/test-splitsing heeft vijfvoudige kruisvalidatiescores van 88%, 71%, 83%, 64%, 79%. Wat betekent dit en waarom is kruisvalidatie belangrijk?

  • A) Het model is stabiel; 88% zijn echte prestaties
  • B) Kruisvalidatie is niet nodig; Eén compartiment is voldoende
  • C) Grote volatiliteit van scores geeft aan dat het model instabiel is; kruisvalidatie baseert de prestaties op het gemiddelde en de verdeling van meerdere bakken, niet op één enkele geluksbak ✔
  • D) Het beste is om de hoogste score (88%) te rapporteren

Uitleg: Een enkel compartiment kan geluk of pech hebben; 88% was slechts het resultaat van die gemakkelijke verdeling. Bij kruisvalidatie worden de gegevens meerdere keren gesplitst, waarbij de prestaties worden gebaseerd op het gemiddelde (hier ~77%) en de volatiliteit van de scores wordt weergegeven. De hoge volatiliteit duidt er op dat het model onstabiel is; Het is misleidend om op één compartiment te vertrouwen.