Gevinster:
- Evne til at forstå MLOps faser (frigivelse, implementering, overvågning, genoptræning, rollback) og modeldrift og planlægge en overvåget implementering
- Evne til at anvende principperne om modelretfærdighed, gennemsigtighed og ansvarlighed og skelne statistisk nøjagtighed fra etisk acceptabel
- Evne til at beskytte personlige data med KVKK/GDPR-principper og tildele det endelige ansvar til et menneske i beslutninger med stor indflydelse
At træne en model og få en høj score er ikke slutningen, men midten. Den reelle værdi kommer, når modellen sættes i produktion og fungerer pålideligt, overvåges over tid uden forringelse, og hele processen udføres inden for etiske og juridiske rammer. Denne afsluttende enhed kombinerer tre emner: MLOps (disciplinen at gå live, overvåge og vedligeholde modeller), etik (retfærdighed, gennemsigtighed, ikke-maleficence) og privatliv (beskyttelse af personlige data). AI producerer kode, tjeklister og tegninger på disse områder; Men mennesker bestemmer, om en model går live, hvem der vil blive påvirket, og hvilke data der kan bruges. Disse beslutninger er ikke tekniske, men ansvarsbeslutninger.
MLOps: modellen lever som et produkt
MLOps (Machine Learning Operations - praksis med at køre, overvåge og opdatere maskinlæringsmodeller i produktionen) er tilpasningen af DevOps i softwareudvikling til datavidenskab. Grundideen: en model er ikke en fil, der er trænet én gang og glemt, men et levende produkt, der kræver konstant vedligeholdelse. Vigtigste faser:
1. Versionering: Kode (Git), data og model er versioneret sammen; Det registreres, hvilken model der er produceret med hvilke data og kode.
2. Implementering: Modellen sættes live som et API eller batchjob. Det gives normalt til et lille publikum først (skygge/kanariefuglefordeling).
3. Overvågning: Modellens ydeevne og inputdata overvåges konstant.
4. Genoptræning: Når ydelsen falder, genoptrænes modellen med opdaterede data.
Mønsterskift: lydløs forvrængning
Den største fare i produktionen er modeldrift (modeldrift/datadrift). Verden forandrer sig; De forhold, som du trænede din model på (kundeadfærd, priser, sæson, lovgivning) skifter over tid, og modellen begynder at blive forældet. For eksempel er en efterspørgselsmodel trænet før pandemien helt forkert under pandemien. Drift forekommer i to former: datadrift (fordelingen af inputdataændringer) og konceptdrift (forholdet mellem input- og målændringer). Måden at fange disse er overvågning: Spor konstant inputfordelingen, forudsigelsesfordelingen og (hvis muligt) ydeevnen sammenlignet med det faktiske resultat.
Forsigtig: En model, der sættes i produktion, vil forringes af sig selv; Det er ikke et spørgsmål om "hvis", men "hvornår". At implementere modeller uden at opsætte overvågning er som at køre en bil uden nogensinde at kontrollere dens motor; En dag sidder den bare stille og roligt, og man lægger ikke mærke til det.
MLOps element
Formål
Hvis forsømt
Versionering
At vide, hvad der produceres
Ikke-reproducerbar, ikke-sporbar
Overvågning
At se lappen tidligt
Modellen bryder lydløst sammen
omskoling
holde sig opdateret
Forudsigelser bliver gamle
Rul tilbage
tilbage til dårlig model
Defekt model forbliver i live
Dokumentation
gennemsigtighed, omsætning
Information sætter sig fast i én person
Etik: modelbeslutninger påvirker mennesker
Datamodeller bruges i stigende grad i beslutninger, der påvirker folks liv: kredit, ansættelse, forsikring, retfærdighed. Med denne magt følger ansvar. Store etiske risici:
Bias og diskrimination: Modellen kan lære og fastholde uretfærdigheder i historiske data. Hvis en bestemt gruppe tidligere har fået mindre kredit, antager modellen, at dette er en "regel" og automatiserer diskrimination. Det er derfor, retfærdighedsanalyse - at kontrollere, om modellen fungerer ens for forskellige grupper (køn, alder, region) - er afgørende.
Gennemsigtighed og forklarlighed: Du skal kunne forklare, hvorfor en model afviste en person. "Den sorte boks sagde det" er etisk og ofte juridisk uacceptabelt. Det er derfor, forklaringsværktøjer (funktionsvigtighed, SHAP-værdier) er værdifulde.
Ansvarlighed: Hvem er ansvarlig, hvis modellen træffer den forkerte beslutning? Svaret er altid en person/institution, ikke en model. Menneskelig tilsyn (menneske-i-løkken - et menneske, der godkender den endelige beslutning) bør bevares i beslutninger med stor effekt.
Forsigtig: En model kan være statistisk "korrekt", men etisk uacceptabel. En meget præcis model, der systematisk forfordrer én gruppe, er ikke en god model. Ærlighed er ingen erstatning for retfærdighed.
Fortrolighed: personlige data er omhyggeligt beskyttet
Datavidenskabens råmateriale er ofte persondata, og disse data er beskyttet ved lov: KVKK i Türkiye, GDPR i Europa. De grundlæggende principper er: formålsbegrænsning (data bruges ikke til andre formål end det formål, hvortil de er indsamlet), dataminimering (der indsamles/bevares ikke flere data end nødvendigt), anonymisering (identificerende oplysninger fjernes) og sikkerhed (data holdes krypteret og adgangsbegrænset). Kritisk regel, når du arbejder med AI-værktøjer: Indsæt aldrig rigtige personlige data i et offentligt AI-værktøj. Det meste af tiden er et diagram og en anonym/syntetisk prøve tilstrækkelige til analyse.
En yderligere vægt i forbindelse med informationssikkerhed: Brug kun datavidenskabelige værktøjer og teknikker på data og systemer, som du har autoritet til, til forsvarlige og legitime analyseformål. Uautoriseret adgang til en andens data, genidentifikation af enkeltpersoner (udtræk af identitet fra anonyme data) eller uautoriseret profilering er både ulovligt og uetisk.
tre minisager
Tilfælde 1 — Usporet sammenbrud. En e-handelsvirksomhed gik live med sin anbefalingsmodel og satte ikke sporing op. Efter 4 måneder har produktkataloget ændret sig meget; modellen fortsatte med at anbefale forældede produkter, og konverteringsraten faldt stille og roligt med 30 %. Ingen har bemærket det i flere måneder. Lektion: implementering uden overvågning bliver blind.
Sag 2 — Skjult forskelsbehandling. En ansættelsesscreeningsmodel lærte om kønsubalance i historiske data og systematisk undervurderede kvindelige kandidater. Det blev ikke bemærket, fordi der ikke var nogen retfærdighedsanalyse; Det blev afsløret ved en revision, og institutionen stod over for en alvorlig omdømme-/juridisk risiko. Lektion: gruppebaseret retfærdighedskontrol er afgørende i modeller med stor effekt.
Sag 3 — Brud på tavshedspligt. En analytiker indlæste en fil med rigtige kunde-e-mails og købshistorik i et offentligt AI-værktøj og sagde, "opsummer segmenter." Personoplysninger har forladt institutionen; KVKK-processen er startet. Den korrekte måde var at fjerne identitetsfelter og kun dele anonyme egenskaber. Lektion: ægte personlige data kommer ikke ind i det åbne værktøj.
Fire kopierbare skabeloner
1) Tjekliste før implementering:
Din rolle: MLOps konsulent. Liste over de ting, jeg skal tjekke, før jeg sætter en model i produktion: versionering, overvågningsmålinger, tilbagerulningsplan, ydeevnetærskel, advarsel om datadrift, ansvarlig person. Tilføj en forklaring med én sætning "hvorfor det betyder noget" for hvert element. Jeg vil bestemme.
2) Modelskiftesporingsdesign:
Foreslå en driftovervågningsplan for en klassifikationsmodel i produktionen: (1) hvilke inputfordelinger skal jeg overvåge, (2) hvilken alarm for forudsigelsesfordelingen, (3) hvordan man sammenligner ydeevnen, når det reelle resultat ankommer, (4) ved hvilken tærskel omtræning skal udløses. Angiv også et kodeskelet.
3) Retfærdighedskontrol:
Skriv kode, der sammenligner min models ydeevne for forskellige grupper (f.eks. aldersgruppe, region): tilbagekaldelse/præcision og positiv beslutningsrate for hver gruppe. Advar, hvis der er en væsentlig forskel mellem grupperne. At lave kausale/politiske fortolkninger; Bare vis mig forskellene, og jeg vil overveje beslutningen.
4) Forhåndskontrol af privatlivets fred:
Før du giver data til et AI-værktøj, skal du kontrollere: er der personlige/identitetsdata (navn, e-mail, ID, telefon, adresse, IP) i kolonnelisten nedenfor? Hvis det er tilfældet, skal du angive, hvilke der skal fjernes eller anonymiseres. Kolonner: [liste]. Formål: kun at dele anonymt skema.
Svag prompt / Stærk prompt
Svag prompt:
Min model er klar, gå live.
Implementering er ikke et enkelt trin; At gå live uden overvågning, rollback, retfærdighed og privatlivskontrol er en tavs invitation til katastrofe.
Kraftig prompt:
Din rolle: ansvarlig MLOps konsulent. Min model er blevet uddannet, jeg vil have fuld forberedelse, inden jeg går live. Generer: (1) tjekliste før implementering, (2) afdriftsovervågningsplan, (3) gruppebaseret retfærdighedskontrolkode, (4) kontrol af privatlivets fred (er der personlige data). Foreslå også, hvordan man beskytter menneskeligt samtykke i beslutninger med stor indflydelse. De endelige beslutninger er mine.
Her behandles distribution, overvågning, retfærdighed og privatliv som en enkelt ansvarlig proces.
Almindelige fejl
- Implementering af en model uden opsætning af overvågning. Modellen glider lydløst og forvrænger; Det kan tage måneder at mærke det.
- Omgå retfærdighedskontrollen. En high-fidelity-model kan systematisk stille en gruppe dårligere.
- At tage en uforklarlig black box-beslutning. Beslutninger med stor effekt skal kunne forklares; "Det sagde modellen" er ikke nok.
- Giver ægte personlige data til at åbne AI-værktøj. KVKK/GDPR overtrædelse; Diagrammet og det anonyme eksempel er tilstrækkeligt.
- Delegering af beslutningen til modellen. Ansvaret ligger altid hos en person; Menneskelig overvågning med høj effekt opretholdes.
Tip: Før du går live med hver model, skal du stille ét spørgsmål højt: "Hvis denne model stille og roligt går i stykker i morgen eller uretfærdigt straffer en gruppe, hvordan vil jeg så bemærke det og rulle den tilbage?" Hvis du ikke har et klart svar på dette spørgsmål, er modellen ikke klar til produktion endnu.
Sammenfattende
En models job ender ikke med en høj score, men med at arbejde pålideligt og ansvarligt i produktionen. MLOps er disciplinen at gå live, overvåge for drift, genoptræning og rulle modellen tilbage; Implementering uden sporing er et stille sammenbrud. Etik kræver modellens retfærdighed, gennemsigtighed og ansvarlighed; statistisk nøjagtighed er ingen erstatning for etisk accept. Privatliv betyder at beskytte personlige data med KVKK/GDPR-principper og holde reelle data væk fra åbne værktøjer. Alle disse beslutninger er ikke tekniske, men ansvarsbeslutninger og tilhører altid et menneske.
Ansøgningsopgave
Tænk på det, som om du ville sætte en model, du har bygget (eller hypotetisk) i produktion, og udfylde fire lister: (1) tjekliste før implementering, (2) drift-metrics, du vil spore, (3) gruppebaseret plan for retfærdighedskontrol, (4) kontrol med privatlivets fred. Skriv derefter et konkret svar på spørgsmålet "Hvordan vil jeg mærke, hvis det lydløst går i stykker i morgen og få det tilbage?"
tjekliste
- [ ] Implementerer jeg modellen med en overvågning (slip-alarm) og rollback-plan?
- [ ] Har jeg tjekket rimeligheden/ydelsesgabet for forskellige grupper?
- [ ] Har jeg opretholdt mennesket-in-the-loop på beslutninger med stor indflydelse?
- [ ] Har jeg beskyttet persondata med KVKK/GDPR-principper og holdt dem væk fra åbne værktøjer?
- [ ] Har jeg lagt det ultimative ansvar på et menneske, ikke modellen?
Modul eksamen
1. En dataforsker spørger den kunstige intelligens: "Hvor nøjagtig er tilfældig skov på disse data?" uden overhovedet at træne modellen, og lægger direkte svaret på "89%" ind i præsentationen. Hvad er den grundlæggende fejl i denne tilgang?
- A) Venter på målinger uden at give data og modeller til kunstig intelligens; Ignorerer, at tallet, det producerer, er falsk, og at det rigtige mål kun kan findes gennem træning og test ✔
- B) Skal bruge logistisk regression i stedet for tilfældig skov
- C) Nøjagtighedsgraden skal altid være over 90%.
- D) Det er strengt forbudt at inkludere målinger i præsentationen
Forklaring: Kunstig intelligens kan ikke producere en metrik uden at få adgang til modellen og data; Tallet han giver er en hallucination (fabrikeret). Metrikken opnås først ved dataforskerens egen beregning, efter at modellen faktisk er blevet trænet og testet. Ubekræftet output er som en usigneret rapport.
2. Kolonnen 'årsag til kontolukning' er inkluderet ved indsamling af data til en churn-prognose; Denne kolonne udfyldes først, når kunden forlader. Modellen giver 97% på testsættet, men virker ikke i produktionen. Hvad er navnet og årsagen til denne tilstand?
- A) Overlæring; Modellen er for kompleks
- B) Datalæk; ✔ Brug af information, der ikke vil være tilgængelig på forudsigelsestidspunktet, men som er resultatet af målet, som en funktion
- C) Utilstrækkelig læring; Modellen er for enkel
- D) Udvælgelsesbias; lille prøvestørrelse
Forklaring: Dette er et klassisk datalæk: 'lukkeårsagen' er et resultat af målet og er stadig tom på forudsigelsestidspunktet. Modellen gør tricket med denne fremtidsviden, den ser godt ud på testsættet, men går ned i produktionen, fordi den kolonne er tom. Spørgsmålet 'har jeg det på forudsigelsestidspunktet' skal stilles til hver kolonne.
3. En analytiker udfylder manglende værdier i indtægtskolonnen med middelværdien; men de savnede tilhører faktisk lavindkomstsegmentet, der aldrig har opgivet indkomst (systematisk savnet). Hvorfor er denne udfyldning forkert?
- A) Middelværdien er altid større end medianen, så den er forkert
- B) Manglende værdier skal aldrig udfyldes, de skal altid slettes
- C) At udfylde det systematiske hul med middelværdien forvrænger dataene ved kunstigt at repræsentere denne gruppe; Påfyldningen blev udført uden at stille spørgsmålet "hvorfor er den tom?" ✔
- D) Beregning af gennemsnittet skaber et præstationsproblem, fordi det er for langsomt
Forklaring: Årsagen til manglen bestemmer løsningen. Når den systematiske manglende (gab koncentreret i en bestemt gruppe) udfyldes med gennemsnittet, bliver denne gruppe kunstigt 'gennemsnitsindkomst', og dataene forvrænges. Før du fylder det, bør spørgsmålet "hvorfor er det tomt" stilles; systematisk/signifikant manglende middelværdi skal ikke udfyldes.
4. Et team finder en 0,78 sammenhæng mellem 'annonceudgifter' og 'salg' og fordobler budgettet; Men hvad der faktisk udløser begge er sæsonbestemte kampagner. Hvilket princip i statistik forklarer denne fejl?
- A) Korrelation er ikke årsagssammenhæng; En skjult tredje variabel kan påvirke begge variable ✔
- B) Da korrelationen på 0,78 er for lav, bør sammenhængen ignoreres
- C) Korrelation beviser altid årsagssammenhæng, holdet fik ret
- D) Sammenhængen mellem reklame og salg kan ikke beregnes matematisk.
Forklaring: Korrelation er ikke årsagssammenhæng. De to variabler kan virke sammen, fordi en skjult tredje variabel (her sæsonbestemte kampagner) påvirker dem begge. Konklusionen om, at den ene forårsager den anden, kan kun fastslås gennem forsøg og feltviden; Antallet af korrelationer alene er ikke bevis for kausalitet.
5. En svigdetektionsmodel viser 99,2 % nøjagtighed, og holdet fejrer; Dog er den falske transaktionsrate i dataene kun 0,8 %, og modellens tilbagekaldelse er 6 %. Hvad viser denne tabel?
- A) Modellen er perfekt, fordi nøjagtigheden er over 99%
- B) Nøjagtighed er vildledende med ubalancerede data; Modellen savner næsten alle forfalskninger (lav tilbagekaldelse), den passende metriske bør ses på ✔
- C) Der er ikke noget problem, da tilbagekaldelsen af modellen er høj
- D) Der var ingen grund til at bygge en model, fordi den falske rate var lav
Forklaring: 'Nøjagtighed' er vildledende i ubalancerede data. Når modellen kalder næsten hver transaktion 'ren', får den høj nøjagtighed, fordi forfalskninger er meget få, men den formår ikke at fange forfalskninger, hvilket er dens hovedformål (tilbagekaldelse 6%). Derfor er fokus i ubalancerede problemer ikke på nøjagtighed, men på forvirringsmatricen og målinger, der passer til jobbets formål, såsom tilbagekaldelse/præcision.
6. I et efterspørgselsprognoseprojekt opdeles tidsafhængige data tilfældigt i træning/test. Modellen giver 93% nøjagtighed, men går ned i produktionen. Hvad skal være den korrekte opdelingstilgang?
- A) Forstørrelse af testsættet, f.eks. opdeling 50%/50%
- B) Brug af en mere kompleks model
- C) Fjern partitionen fuldstændigt og træn med alle data
- D) Kronologisk opdeling: Træning med den gamle periode og test med den nye periode, hvilket forhindrer modellen i at se fremtiden ✔
Forklaring: Hvis der foretages tilfældig division i tidsseriedata, ser modellen fremtiden og forudsiger fortiden under træning; det er en lækage og producerer succes, der faktisk ikke eksisterer. Den korrekte tilgang er kronologisk opdeling: træning med den gamle periode og test med den nye periode, efterligning af den virkelige situation i produktionen (forudsigelse fra fortiden til fremtiden).
7. Ud fra hvilke data skal skaleringsparametre (StandardScaler) beregnes i feature engineering, og hvordan skal de anvendes?
- A) Det bør beregnes ud fra alle data (træning + test sammen), så det er mere præcist
- B) Det skal beregnes separat for hver række ud fra den pågældende rækkes egen værdi
- C) Bør kun beregnes ud fra testdata
- D) Det bør kun beregnes ud fra træningsdataene, så skal de samme parametre anvendes på testdataene; ellers vil det lække ✔
Forklaring: Parametrene for alle transformationer (middelværdi, standardafvigelse osv.) såsom skalering, kodning og udfyldning bør kun læres fra træningsdataene, derefter bør det samme anvendes på testdataene. At tage testdata i betragtning får også testinformation til at forstyrre træningen, det vil sige lækage, og får modellen til at se bedre ud, end den er. Brug af Pipeline sikrer dette.
8. En model giver 98% nøjagtighed på træningssættet og 72% nøjagtighed på testsættet. Hvad indikerer dette symptom, og hvad skal der gøres?
- A) Utilstrækkelig læring; modellen bør gøres mere kompleks
- B) Datalæk; testsæt skal ændres
- C) Overmontering; modellen bør forenkles, regularisering og krydsvalidering bør anvendes ✔
- D) En normal situation; Uddannelsesscore er altid højere alligevel, forholdsregler er unødvendige
Forklaring: En meget høj score i træning og en signifikant lav score i test er et klassisk symptom på overfitting: Modellen har husket støjen fra træningsdataene frem for det reelle mønster. Løsninger omfatter forenkling af modellen, flere data, regularisering og verificering af tilstanden med krydsvalidering. At stole udelukkende på uddannelsesresultatet skjuler denne faldgrube.
9. I en ledelsespræsentation startes y-aksen i et søjlediagram, hvor salget stiger fra 1.000 til 1.020, ved 980 for at få stigningen til at fremstå enorm. Den faktiske stigning er 2%. Hvorfor er dette et etisk spørgsmål?
- A) En afkortet y-akse overdriver visuelt en lille forskel og vildleder seeren; For retfærdighedens skyld bør aksen i sammenligningsbjælker starte fra 0 ✔
- B) Søjlediagrammer kan aldrig bruges til salgsdata
- C) Der er ikke noget problem; Det er altid godt at få diagrammet til at se imponerende ud
- D) Y-aksen skal altid starte fra den største værdi af dataene
Forklaring: I søjlediagrammer til sammenligningsformål bør y-aksen generelt starte ved 0. At skære aksen over og starte ved 980 får en lille forskel på 2 % til at virke visuelt stor og vildleder seeren. Dataprofessionens etiske ansvar er at tegne ærlige grafer, der ikke overvurderer eller undervurderer dataene.
10. En analytiker finder den samlede omsætning 3 gange efter at have tilsluttet ordrerne med produkttabellen; Antallet af linjer steg fra 240 tusind til 690 tusind. Hvad skulle der have været gjort for at forhindre denne tavse fejl?
- A) Divider den samlede omsætning med 3
- B) Brug altid separate forespørgsler i stedet for JOIN
- C) Sletning af produkttabellen fuldstændigt
- D) Kontrol af antallet af rækker efter fletning/JOIN og verifikation af, at de er forbundet med den korrekte nøgle; Fange replikation tidligt ✔
Forklaring: Når der er flere rækker for hvert produkt (f.eks. forskellig farve) i produkttabellen, vil JOIN via den forkerte tast duplikere hver ordre og øge totalerne. Koden kører uden fejl, men resultatet er forkert. Måden at undgå dette på er at tjekke antallet af rækker efter hver fletning/JOIN og flette med den korrekte nøgle.
11. En ansættelsesscreeningsmodel lærer om kønsubalance i historiske data og systematisk underscore kvindelige kandidater, men dens samlede nøjagtighed er høj. Hvad betyder det?
- A) Der er ikke noget problem, fordi modellen har høj nøjagtighed
- B) Statistisk nøjagtighed er ikke en erstatning for etisk accept; modellen har lært om tidligere diskrimination, gruppebaseret retfærdighedskontrol er påkrævet ✔
- C) Yderligere forøgelse af modellens nøjagtighed løser problemet
- D) Retfærdighed ligger uden for datavidenskabens rammer
Forklaring: Selvom en model er statistisk korrekt, kan den være etisk uacceptabel. Modellen lærer uretfærdigheden i tidligere data og automatiserer diskrimination. Høj integritet er ingen erstatning for retfærdighed; I high-impact modeller er retfærdighedskontrol, som måler præstations-/beslutningsforskellen for forskellige grupper, essentiel, og det ultimative ansvar ligger hos mennesket.
12. En medarbejder uploader en fil, der indeholder rigtige kunde-e-mails og købshistorik, til et offentligt AI-værktøj og siger "opsummer segmenter". Hvorfor er dette en alvorlig fejl, og hvad er den rigtige måde?
- A) Der er intet problem; AI-værktøjer gemmer aldrig data
- B) Fejlen er, at filen er for stor; burde være reduceret
- C) At give ægte persondata til et åbent værktøj er en overtrædelse af KVKK/GDPR; identitetsfelter skulle have været fjernet og kun anonymt skema/egenskab delt ✔
- D) CSV skulle have været brugt i stedet for kun Excel
Forklaring: Når ægte persondata (såsom e-mail, navn osv.) gives til et offentligt tilgængeligt værktøj til kunstig intelligens, vil der være en krænkelse af privatlivets fred inden for rammerne af KVKK / GDPR; data forlader organisationen. Det meste af tiden er et diagram og en anonym/syntetisk prøve tilstrækkelige til analyse. Den korrekte måde er at fjerne identitetsfelter og kun dele anonyme egenskaber.
13. En anbefalingsmodel sættes i produktion, men sporing er ikke etableret; Når produktkataloget ændres efter 4 måneder, fortsætter modellen med at anbefale gamle produkter, og konverteringsraten falder lydløst med 30%. Hvad er navnet på dette fænomen?
- A) Overlæring; Modellen husker træningssættet
- B) Modeldrift; Efterhånden som verden ændrer sig, bliver modellen forældet lydløst, ubemærket, fordi overvågning ikke er etableret ✔
- C) Udvælgelsesbias; prøve bias
- D) Dataminimeringsovertrædelse
Forklaring: Dette er modeldrift (model/datadrift): Når verden ændrer sig (katalog, adfærd, årstid), skifter betingelserne, som modellen blev trænet under, og modellen bryder lydløst sammen. En model sat i produktion forringes af sig selv; Det er et spørgsmål om 'hvornår'. Implementering uden overvågning (sporing af input og ydeevne) gør det umuligt at opdage forringelse.
14. En model, der får 88 % nøjagtighed i en enkelt trænings-/testopdeling, har 5-fold krydsvalideringsscore på 88 %, 71 %, 83 %, 64 %, 79 %. Hvad indikerer dette, og hvorfor er krydsvalidering vigtig?
- A) Modellen er stabil; 88% er reel ydeevne
- B) Krydsvalidering er unødvendig; Et rum er nok
- C) Stor volatilitet af score indikerer, at modellen er ustabil; krydsvalidering baserer ydeevnen på gennemsnittet og fordelingen af flere beholdere, ikke en enkelt heldig beholder ✔
- D) Det er bedst at rapportere den højeste score (88 %)
Forklaring: Et enkelt rum kan være heldigt eller uheldigt; 88% var blot resultatet af den nemme division. Krydsvalidering opdeler dataene flere gange, baserer ydeevnen på middelværdien (her ~77%) og viser volatiliteten af scoringerne. Høj volatilitet tyder her på, at modellen er ustabil; At stole på et enkelt rum er vildledende.