Kasu:
- Võimalus mõista MLOps-i etappe (väljalaskmine, juurutamine, jälgimine, ümberõpe, tagasipööramine) ja modelleerida triivi ning planeerida jälgitavat kasutuselevõttu
- Võimalus rakendada mudeli õigluse, läbipaistvuse ja vastutuse põhimõtteid ning eristada statistilist täpsust eetilisest vastuvõetavusest
- Võimalus kaitsta isikuandmeid KVKK/GDPR põhimõtetega ja määrata inimesele lõplik vastutus suure mõjuga otsuste tegemisel
Modelli koolitamine ja kõrge hinde saamine pole lõpp, vaid keskpaik. Tõeline väärtus tekib siis, kui mudel pannakse tootmisse ja töötab usaldusväärselt, seda jälgitakse aja jooksul ilma riknemiseta ning kogu protsess viiakse läbi eetilistes ja seaduslikes piirides. See lõpetav üksus ühendab kolm teemat: MLOps (elavdamise distsipliin, mudelite jälgimine ja hooldamine), eetika (õiglus, läbipaistvus, pahatahtlikkus) ja privaatsus (isikuandmete kaitsmine). AI toodab nendes valdkondades koodi, kontrollnimekirju ja jooniseid; Kuid inimesed otsustavad, kas mudel läheb kasutusele, keda see mõjutab ja milliseid andmeid saab kasutada. Need otsused ei ole tehnilised, vaid vastutusotsused.
MLOps: mudel elab nagu toode
MLOps (Machine Learning Operations – masinõppemudelite käitamise, jälgimise ja värskendamise praktika tootmises) on tarkvaraarenduse DevOpsi kohandamine andmeteadusega. Põhiidee: mudel ei ole fail, mida üks kord koolitatakse ja unustatakse, vaid elav toode, mis vajab pidevat hooldust. Peamised etapid:
1. Versioonide koostamine: kood (Git), andmed ja mudel versioonitakse koos; Salvestatakse, milline mudel milliste andmete ja koodiga toodeti.
2. Kasutuselevõtt: mudel käivitatakse API või pakktööna. Tavaliselt antakse see kõigepealt väikesele publikule (varju/kanaari jaotus).
3. Järelevalve: mudeli ja sisendandmete toimivust jälgitakse pidevalt.
4. Ümberõpe: kui jõudlus langeb, õpetatakse mudelit uuendatud andmetega ümber.
Mustri nihe: vaikne moonutus
Suurim oht tootmises on mudelitriiv (model drift / data drift). Maailm muutub; Tingimused, mille alusel te oma mudelit koolitasite (kliendi käitumine, hinnad, hooaeg, seadusandlus), muutuvad aja jooksul ja mudel hakkab vananema. Näiteks enne pandeemiat koolitatud nõudlusmudel on pandeemia ajal täiesti vale. Triiv esineb kahel kujul: andmete triiv (sisendandmete jaotus muutub) ja kontseptsiooni triiv (sisendi ja sihtmärgi muutuste vaheline seos). Nende jäädvustamise viis on jälgimine: jälgige pidevalt sisendi jaotust, prognoosijaotust ja (võimaluse korral) jõudlust võrreldes tegeliku tulemusega.
Ettevaatust. Tootmisse pandud mudel halveneb iseenesest; Asi pole "kui" vaid "millal". Mudelite kasutuselevõtt ilma jälgimist seadistamata on nagu auto juhtimine ilma selle mootorit kunagi juhtimata; Ühel päeval see lihtsalt istub vaikselt ja sa ei pane tähele.
MLOps element
Eesmärk
Kui tähelepanuta jäetakse
Versioonide koostamine
Teades, mida toodetakse
Mittepaljutatav, mittejälgitav
Järelevalve
Nähes libisemist varakult
Mudel laguneb vaikselt
ümberõpe
kursis olla
Ennustused vananevad
Tagasipööramine
tagasi halva mudeli juurde
Vigane mudel jääb tööle
Dokumentatsioon
läbipaistvus, käive
Info takerdub ühte inimesesse
Eetika: mudelotsused mõjutavad inimesi
Andmemudeleid kasutatakse üha enam otsustes, mis mõjutavad inimeste elu: krediit, palkamine, kindlustus, õiglus. Selle jõuga kaasneb vastutus. Peamised eetilised riskid:
Eelarvamus ja diskrimineerimine: mudel võib õppida ja põlistada ebaõiglust ajaloolistes andmetes. Kui teatud rühmale on varem vähem krediiti antud, eeldab mudel, et see on "reegel" ja automatiseerib diskrimineerimise. Seetõttu on õigluse analüüs – kontrollimine, kas mudel toimib erinevate rühmade puhul (sugu, vanus, piirkond) sarnaselt – on oluline.
Läbipaistvus ja seletatavus: peaksite suutma selgitada, miks modell inimese tagasi lükkas. "Must kast ütles nii" on eetiliselt ja sageli ka juriidiliselt vastuvõetamatu. Seetõttu on selgitatavuse tööriistad (funktsiooni tähtsus, SHAP väärtused) väärtuslikud.
Vastutus: kes vastutab, kui modell teeb vale otsuse? Vastus on alati inimene/asutus, mitte mudel. Inimjärelevalve (in-the-loop – inimene, kes kiidab heaks lõpliku otsuse) peaks säilima suure mõjuga otsuste puhul.
Ettevaatust: mudel võib olla statistiliselt "õige", kuid eetiliselt vastuvõetamatu. Väga täpne mudel, mis seab süstemaatiliselt ühte rühma ebasoodsasse olukorda, ei ole hea mudel. Ausus ei asenda õiglust.
Privaatsus: isikuandmeid kaitstakse hoolikalt
Andmeteaduse tooraineks on sageli isikuandmed ja need andmed on seadusega kaitstud: Türkiye's KVKK, Euroopas GDPR. Põhiprintsiibid on järgmised: eesmärgi piiramine (andmeid ei kasutata muudel eesmärkidel kui sellel, milleks need koguti), andmete minimeerimine (andmeid ei koguta/säilitata rohkem kui vaja), anonüümseks muutmine (tuvastusandmed eemaldatakse) ja turvalisus (andmeid hoitakse krüpteerituna ja juurdepääs on piiratud). Kriitiline reegel tehisintellekti tööriistadega töötamisel: ärge kunagi kleepige tõelisi isikuandmeid avalikku tehisintellekti tööriista. Enamasti piisab analüüsiks diagrammist ja anonüümsest/sünteetilisest proovist.
Täiendav rõhk infoturbe kontekstis: kasutage andmeteaduse tööriistu ja tehnikaid ainult nende andmete ja süsteemide puhul, mille jaoks teil on volitusi, kaitsva ja legitiimse analüüsi eesmärgil. Volitamata juurdepääs kellegi teise andmetele, isikute uuesti tuvastamine (identiteedi väljavõtmine anonüümsetest andmetest) või volitamata profiilide koostamine on nii ebaseaduslik kui ka ebaeetiline.
kolm minikarpi
Juhtum 1 – jälgimata kokkuvarisemine. E-kaubandusega tegelev ettevõte võttis kasutusele oma soovitusmudeli ega seadistanud jälgimist. 4 kuu pärast on tootekataloog oluliselt muutunud; mudel jätkas vananenud toodete soovitamist ja konversioonimäär langes vaikselt 30%. Keegi ei märganud kuud. Õppetund: juurutamine ilma jälgimiseta läheb pimedaks.
2. juhtum – varjatud diskrimineerimine. Töötajate sõeluuringu mudel sai teada soolisest tasakaalustamatusest ajaloolistes andmetes ja süstemaatiliselt alahinnatud naiskandidaate. Seda ei märgatud, sest puudus õiglusanalüüs; See selgus auditis ja asutus seisis silmitsi tõsise maine-/õigusliku riskiga. Õppetund: rühmapõhine õigluse kontroll on suure mõjuga mudelite puhul hädavajalik.
Juhtum 3 – konfidentsiaalsuse rikkumine. Üks analüütik laadis avalikku AI-tööriista faili, mis sisaldas tõelisi klientide e-kirju ja ostude ajalugu, ning ütles: "võtke kokku segmendid." Isikuandmed on asutusest lahkunud; KVKK protsess on alanud. Õige viis oli eemaldada identiteediväljad ja jagada ainult anonüümseid omadusi. Õppetund: tegelikud isikuandmed ei sisene avatud tööriista.
Neli kopeeritavat malli
1) Juurutamiseelne kontroll-loend:
Teie roll: MLOps konsultant. Loetlege asjad, mida pean enne mudeli tootmisse panemist kontrollima: versioonide loomine, jälgimismõõdikud, tagasipööramise plaan, jõudluse lävi, andmete triivimise hoiatus, vastutav isik. Lisage iga üksuse juurde ühelauseline selgitus "miks see on oluline". Mina otsustan.
2) Mudeli nihke jälgimise disain:
Soovitage tootmises kasutatava klassifitseerimismudeli triivi jälgimise kava: (1) milliseid sisendjaotusi peaksin jälgima, (2) millist häiret prognoosijaotuse jaoks, (3) kuidas võrrelda jõudlust tegeliku tulemuse saabumisel, (4) millise läve juures tuleks käivitada ümberõpe. Esitage ka koodi skelett.
3) õigluse kontroll:
Kirjutage kood, mis võrdleb minu mudeli toimivust eri rühmades (nt vanusevahemik, piirkond): meeldetuletus/täpsus ja positiivsete otsuste määr iga rühma kohta. Hoiatage, kui rühmade vahel on oluline erinevus. Põhjuslike/poliitiliste tõlgenduste tegemine; Lihtsalt näidake mulle erinevusi ja ma kaalun otsust.
4) Privaatsuse eelkontroll:
Enne tehisintellekti tööriistale andmete andmist kontrollige: kas allolevas veergude loendis on isiku-/identiteediandmed (nimi, e-posti aadress, ID, telefon, aadress, IP)? Kui jah, siis loetlege, millised tuleks eemaldada või anonüümseks muuta. Veerud: [loend]. Eesmärk: ainult anonüümset skeemi jagada.
Nõrk viip / Tugev viip
Nõrk viip:
Minu mudel on valmis, minge otseülekandesse.
Kasutuselevõtt ei ole üks samm; Otseülekanne ilma jälgimise, tagasivõtmise, õigluse ja privaatsuskontrollita on vaikne kutse katastroofi jaoks.
Võimas viip:
Teie roll: vastutav MLOpsi konsultant. Minu modell on koolitatud, ma tahan enne otseülekandeks täielikku ettevalmistust. Looge: (1) kasutuselevõtueelne kontroll-loend, (2) triivi jälgimise plaan, (3) rühmapõhine õigluse kontrolli kood, (4) privaatsuskontroll (kas isikuandmed on olemas). Samuti soovitage, kuidas kaitsta inimeste nõusolekut suure mõjuga otsuste puhul. Lõplikud otsused on minu teha.
Siin käsitletakse levitamist, jälgimist, õiglust ja privaatsust ühtse vastutustundliku protsessina.
Levinud vead
- Mudeli juurutamine ilma jälgimist seadistamata. Mudel vaikselt libiseb ja moondub; Märkamiseks võib kuluda kuid.
- Mööda õigluskontrollist. Kõrge täpsusega mudel võib rühma süstemaatiliselt ebasoodsasse olukorda seada.
- Seletamatu musta kasti otsuse tegemine. Suure mõjuga otsused peavad olema seletatavad; "Modell ütles nii" ei piisa.
- Reaalsete isikuandmete andmine AI tööriista avamiseks. KVKK/GDPR rikkumine; Piisab diagrammist ja anonüümsest näitest.
- Otsuse delegeerimine mudelile. Vastutus lasub alati inimesel; Säilitatakse suure mõjuga inimeste järelevalve.
Näpunäide. Enne iga mudeliga otseülekannet esitage valjusti üks küsimus: "Kui see mudel homme vaikselt katki läheb või rühma ebaõiglaselt karistan, siis kuidas ma seda märkan ja tagasi kerin?" Kui teil pole sellele küsimusele selget vastust, pole mudel veel tootmiseks valmis.
Kokkuvõttes
Modelli töö ei lõpe kõrge hindega, vaid usaldusväärse ja vastutustundliku tööga tootmises. MLOps on reaalajas käivitamise, triivi jälgimise, ümberõppe ja mudeli tagasipööramise distsipliin; Juurutamine ilma jälgimiseta on vaikne kokkuvarisemine. Eetika nõuab mudeli õiglust, läbipaistvust ja vastutust; statistiline täpsus ei asenda eetilist vastuvõetavust. Privaatsus tähendab isikuandmete kaitsmist KVKK/GDPR põhimõtetega ja tegelike andmete hoidmist avatud tööriistadest eemal. Kõik need otsused ei ole tehnilised, vaid vastutusotsused ja kuuluvad alati inimesele.
Rakenduse ülesanne
Mõelge sellele nii, nagu paneksite enda loodud (või hüpoteetilise) mudeli tootmisse ja täitke neli loendit: (1) juurutamiseelne kontroll-loend, (2) jälgitavad triivimõõdikud, (3) rühmapõhine õigluse kontrolli plaan, (4) privaatsuse kontroll. Seejärel kirjuta konkreetne vastus küsimusele "Kuidas ma märkan, kui see homme vaikselt katki läheb ja saan selle tagasi?"
kontrollnimekiri
- [ ] Kas ma võtan mudeli kasutusele seire (libisemishoiatuse) ja tagasipööramisplaaniga?
- [ ] Kas ma olen kontrollinud erinevate rühmade õigluse/tulemuste erinevust?
- [ ] Kas ma olen säilitanud inimkonna in-the-loop suure mõjuga otsuste tegemisel?
- [ ] Kas olen kaitsnud isikuandmeid KVKK/GDPR põhimõtetega ja hoidnud neid eemal avatud tööriistadest?
- [ ] Kas olen pannud lõpliku vastutuse inimesele, mitte mudelile?
Mooduli eksam
1. Andmeteadlane küsib tehisintellektilt: "Kui täpne on juhuslik mets nendel andmetel?" mudelit üldse koolitamata ja paneb otse esitlusse vastuse "89%. Mis on selle lähenemisviisi põhiline viga?
- A) Mõõdikute ootamine tehisintellektile andmeid ja mudeleid andmata; Ignoreerides, et selle toodetav number on võlts ja et tegeliku mõõdiku saab leida ainult koolituse ja testimise teel ✔
- B) Juhusliku metsa asemel peab kasutama logistilist regressiooni
- C) Täpsusmäär peab alati olema üle 90%.
- D) Esitlusele on rangelt keelatud lisada mõõdikuid
Selgitus: tehisintellekt ei saa luua mõõdikut ilma mudelile ja andmetele juurdepääsuta; Tema antud number on hallutsinatsioon (fabritseeritud). Mõõdik saadakse andmeteadlase enda arvutustega alles pärast seda, kui mudelit on tegelikult koolitatud ja testitud. Kontrollimata väljund on nagu allkirjastamata aruanne.
2. Veerg „Konto sulgemise põhjus” on kaasatud andmete kogumisel maksehäirete prognoosi jaoks; See veerg täidetakse alles pärast kliendi lahkumist. Mudel annab testikomplektil 97%, kuid tootmises ei tööta. Mis on selle seisundi nimi ja põhjus?
- A) üleõppimine; Mudel on liiga keeruline
- B) Andmeleke; ✔ Funktsioonina teabe kasutamine, mis pole prognoosimise ajal saadaval, kuid on sihtmärgi tulemus
- C) ebapiisav õppimine; Mudel on liiga lihtne
- D) valiku kallutatus; väike valimi suurus
Selgitus: see on klassikaline andmelekke: sulgemispõhjus tuleneb eesmärgist ja on ennustamise ajal endiselt tühi. Mudel ajab asja ära nende tulevaste teadmistega, see näeb katsekomplektil hea välja, kuid jookseb tootmises kokku, kuna see veerg on tühi. Küsimus "kas mul on see ennustamise ajal" tuleks esitada igale veerule.
3. Analüütik täidab tulude veerus puuduvad väärtused keskmisega; kuid kadunud inimesed kuuluvad tegelikult madala sissetulekuga segmenti, kes pole kunagi sissetulekuid deklareerinud (süstemaatiline puudu). Miks see täidis on vale?
- A) Keskmine on alati suurem kui mediaan, seega on see vale
- B) Puuduvaid väärtusi ei tohi kunagi täita, need tuleks alati kustutada
- C) Süstemaatilise tühimiku täitmine keskmisega moonutab andmeid selle rühma kunstliku esituse kaudu; Täitmine toimus ilma küsimust "miks see tühi on?" ✔
- D) Keskmise arvutamine tekitab jõudlusprobleemi, kuna see on liiga aeglane
Selgitus: puuduse põhjus määrab lahenduse. Kui süstemaatiline puudujääk (teatud rühma koondunud tühimik) täidetakse keskmisega, muutub see rühm kunstlikult "keskmiseks sissetulekuks" ja andmed moonutatakse. Enne selle täitmist tuleks esitada küsimus "miks see tühi on"; süstemaatilist/olulist puuduvat keskmist ei tohiks täita.
4. Meeskond leiab 0,78 korrelatsiooni "reklaamikulude" ja "müügi" vahel ning kahekordistab eelarve; Kuid tegelikult käivitavad mõlemad hooajalised kampaaniad. Milline põhimõte statistikas seda viga seletab?
- A) Korrelatsioon ei ole põhjuslik seos; Varjatud kolmas muutuja võib mõjutada mõlemat muutujat ✔
- B) Kuna korrelatsioon 0,78 on liiga madal, tuleks seost ignoreerida
- C) Korrelatsioon tõestab alati põhjuslikku seost, meeskond sai õigesti aru
- D) Reklaami ja müügi vahelist seost ei saa matemaatiliselt arvutada.
Selgitus: korrelatsioon ei ole põhjuslik seos. Need kaks muutujat võivad koos toimida, kuna peidetud kolmas muutuja (siin hooajalised kampaaniad) mõjutab neid mõlemaid. Järeldus, et üks põhjustab teist, saab kindlaks teha ainult katse ja väliteadmiste kaudu; Ainuüksi korrelatsioonide arv ei tõenda põhjuslikku seost.
5. Pettuste tuvastamise mudel näitab 99,2% täpsust ja meeskond tähistab; Samas on andmetes võltsitud tehingute määr vaid 0,8% ja mudeli tagasikutsumine 6%. Mida see tabel näitab?
- A) Mudel on täiuslik, kuna täpsus on üle 99%
- B) Tasakaalustamata andmete korral on täpsus eksitav; Mudelil puuduvad peaaegu kõik võltsingud (madal tagasikutsumine), tuleks vaadata sobivat mõõdikut ✔
- C) Pole probleemi, kuna mudeli tagasikutsumine on kõrge
- D) Mudelit polnud vaja ehitada, sest võltsimise määr oli madal
Selgitus: "Täpsus" on tasakaalustamata andmete puhul eksitav. Kui mudel nimetab peaaegu iga tehingu "puhtaks", saavutab see suure täpsuse, kuna võltsinguid on väga vähe, kuid see ei suuda võltsinguid tabada, mis on selle peamine eesmärk (meenutagem 6%). Seetõttu ei keskenduta tasakaalustamata probleemide puhul mitte täpsusele, vaid segadusmaatriksile ja töö eesmärgile sobivatele mõõdikutele, nagu näiteks meeldetuletus/täpsus.
6. Nõudluse prognoosimise projektis jagatakse ajast sõltuvad andmed juhuslikult koolituseks/testimiseks. Mudel annab 93% täpsust, kuid jookseb tootmises kokku. Milline peaks olema õige jaotusviis?
- A) Testikomplekti suurendamine, nt. jagamine 50%/50%
- B) Keerulisema mudeli kasutamine
- C) Eemaldage partitsioon täielikult ja treenige koos kõigi andmetega
- D) Kronoloogiline poolitamine: treenimine vana perioodiga ja testimine uue perioodiga, takistades nii mudelil tulevikku nägemast ✔
Selgitus: Kui aegridade andmetes tehakse juhuslik jagamine, näeb mudel koolitusel tulevikku ja ennustab minevikku; see on leke ja toodab edu, mida tegelikult ei eksisteeri. Õige lähenemine on kronoloogiline poolitamine: vana perioodiga treenimine ja uue perioodiga katsetamine, tootmises tegeliku olukorra imiteerimine (minevikust tulevikku ennustamine).
7. Millistest andmetest tuleks funktsioonitehnikas arvutada skaleerimise (StandardScaler) parameetreid ja kuidas neid rakendada?
- A) See tuleks arvutada kõigi andmete põhjal (koolitus + testimine koos), et see oleks täpsem
- B) See tuleks arvutada iga rea jaoks eraldi selle rea väärtusest
- C) Tuleks arvutada ainult katseandmete põhjal
- D) Seda tuleks arvutada ainult treeninguandmete põhjal, seejärel tuleks katseandmetele rakendada samu parameetreid; muidu lekib ✔
Selgitus: Kõikide teisenduste (keskmine, standardhälve jne) parameetrid, nagu skaleerimine, kodeerimine ja polsterdus, tuleks õppida ainult koolitusandmetest, seejärel tuleks sama rakendada katseandmetele. Testiandmete arvesse võtmine põhjustab ka testiteabe segamist treeningutel, st lekkeid, ja muudab mudeli paremaks, kui see on. Pipeline'i kasutamine tagab selle.
8. Mudel annab 98% täpsuse treeningkomplektil ja 72% täpsust testikomplektil. Mida see sümptom näitab ja mida tuleks teha?
- A) ebapiisav õppimine; mudel tuleks muuta keerulisemaks
- B) Andmeleke; testikomplekti tuleb muuta
- C) liigne paigaldamine; mudelit tuleks lihtsustada, rakendada regulatsiooni ja ristvalideerimist ✔
- D) Tavaline olukord; Haridushinne on nagunii alati kõrgem, ettevaatusabinõud pole vajalikud
Selgitus: väga kõrge tulemus treeningul ja oluliselt madal tulemus testimisel on klassikaline ülepaigutamise sümptom: mudel on jätnud meelde treeningandmete müra, mitte tegelikku mustrit. Lahendused hõlmavad mudeli lihtsustamist, rohkem andmeid, reguleerimist ja oleku kontrollimist ristvalideerimisega. Ainuüksi haridusskoorile tuginemine peidab selle lõksu.
9. Juhtkonna esitluses alustatakse tulpdiagrammi y-telge, kus müük kasvab 1000-lt 1020-le, 980-st, et kasv näiks tohutu. Tegelik kasv on 2%. Miks on see eetiline probleem?
- A) kärbitud y-telg liialdab visuaalselt väikese erinevusega ja eksitab vaatajat; Õigluse huvides peaks võrdlusribade telg algama 0 ✔
- B) Tulpdiagramme ei saa kunagi müügiandmete jaoks kasutada
- C) Pole probleemi; Diagramm on alati hea muljetavaldav välja näha
- D) Y-telg peaks alati algama andmete suurimast väärtusest
Selgitus: Võrdlemise eesmärgil kasutatavates tulpdiagrammides peaks y-telg üldiselt algama 0-st. Telje lõikamine ja alustamine 980-st muudab väikese 2% erinevuse visuaalselt tohutuks ja eksitab vaatajat. Andmespetsialisti eetiline vastutus on koostada ausad graafikud, mis ei hinda andmeid üle ega alahinda.
10. Analüütik leiab kogukäibe 3 korda peale tellimuste LIITMIST tootetabeliga; Liinide arv kasvas 240 tuhandelt 690 tuhandele. Mida oleks pidanud selle vaikiva vea vältimiseks tegema?
- A) Jaga kogukäive 3-ga
- B) Kasutage JOIN asemel alati eraldi päringuid
- C) Tootetabeli täielik kustutamine
- D) ridade arvu kontrollimine pärast ühendamist/JOIN-i ja kontrolli, kas need on ühendatud õige võtmega; Replikatsiooni püüdmine varakult ✔
Selgitus: kui tootetabelis on iga toote kohta (näiteks erinevat värvi) mitu rida, siis vale võtmega JOIN dubleerib iga tellimuse ja suurendab kogusummat. Kood töötab ilma vigadeta, kuid tulemus on vale. Selle vältimiseks kontrollige pärast iga ühendamist/JOIN ridade arvu ja ühendage õige võtmega.
11. Töötajate sõeluuringu mudel õpib ajaloolistes andmetes tundma soolist tasakaalustamatust ja hindab süstemaatiliselt naiskandidaate alla, kuid selle üldine täpsus on kõrge. Mida see tähendab?
- A) Pole probleemi, kuna mudelil on suur täpsus
- B) Statistiline täpsus ei asenda eetilist vastuvõetavust; mudel on õppinud varasemast diskrimineerimisest, nõutav on rühmapõhine õigluse kontroll ✔
- C) Mudeli täpsuse edasine suurendamine lahendab probleemi
- D) Õiglus on väljaspool andmeteaduse ulatust
Selgitus: isegi kui mudel on statistiliselt õige, võib see olla eetiliselt vastuvõetamatu. Mudel õpib tundma minevikuandmete ebaõiglust ja automatiseerib diskrimineerimise. Kõrge ausus ei asenda õiglust; Suure mõjuga mudelite puhul on õigluse kontroll, mis mõõdab erinevate rühmade tulemuslikkuse/otsuste erinevust, oluline ja lõplik vastutus lasub inimesel.
12. Töötaja laadib avalikku tehisintellekti tööriista üles faili, mis sisaldab tegelikke klientide e-kirju ja ostude ajalugu, ning ütleb „summeeri segmendid”. Miks on see tõsine viga ja milline on õige tee?
- A) Pole probleemi; AI tööriistad ei salvesta kunagi andmeid
- B) Viga seisneb selles, et fail on liiga suur; oleks pidanud vähendama
- C) Reaalsete isikuandmete esitamine avatud tööriistale on KVKK/GDPR rikkumine; identiteediväljad tuleks eemaldada ja jagada ainult anonüümset skeemi/vara ✔
- D) Exceli asemel oleks pidanud kasutama CSV-d
Selgitus: kui avalikult kättesaadavale tehisintellekti tööriistale antakse tõelised isikuandmed (nagu e-post, nimi jne), on tegemist privaatsuse rikkumisega KVKK / GDPR raames; andmed lahkuvad organisatsioonist. Enamasti piisab analüüsiks diagrammist ja anonüümsest/sünteetilisest proovist. Õige viis on eemaldada identiteediväljad ja jagada ainult anonüümseid atribuute.
13. Soovitusmudel võetakse kasutusele, kuid jälgimist ei kehtestata; Kui tootekataloog 4 kuu pärast muutub, soovitab mudel jätkuvalt vanu tooteid ja konversioonimäär langeb vaikselt 30%. Mis on selle nähtuse nimi?
- A) üleõppimine; Modell jätab treeningkomplekti meelde
- B) Mudeli triiv; Maailma muutudes vananeb mudel vaikselt, märkamatult, sest seiret ei kehtestata ✔
- C) valiku kallutatus; näidise eelarvamus
- D) Andmete minimeerimise rikkumine
Selgitus: see on mudeli triiv (mudel/andmete triiv): kui maailm muutub (kataloog, käitumine, aastaaeg), muutuvad mudeli väljaõppe tingimused ja mudel läheb vaikselt katki. Tootmisse pandud mudel rikneb iseenesest; Iseasi on "millal". Ilma jälgimiseta juurutamine (sisendi ja jõudluse jälgimine) muudab halvenemise tuvastamise võimatuks.
14. Mudelil, mis saavutab ühe treeningu/testi jaotuse 88% täpsuse, on 5-kordne ristvalideerimise skoor: 88%, 71%, 83%, 64%, 79%. Mida see näitab ja miks on ristvalideerimine oluline?
- A) mudel on stabiilne; 88% on tegelik jõudlus
- B) ristvalideerimine pole vajalik; Piisab ühest sektsioonist
- C) Skooride suur volatiilsus näitab, et mudel on ebastabiilne; ristvalideerimine põhineb mitme prügikasti keskmisel ja jaotusel, mitte ühel õnnelikul prügikastil ✔
- D) Parim on esitada kõrgeim tulemus (88%)
Selgitus: Üks kamber võib olla õnnelik või õnnetu; 88% oli lihtsalt selle lihtsa jaotuse tulemus. Ristvalideerimine jagab andmed mitu korda, võttes aluseks toimivuse keskmisel (siin ~77%) ja näidates skooride volatiilsust. Kõrge volatiilsus viitab siinkohal sellele, et mudel on ebastabiilne; Ühele sektsioonile tuginemine on eksitav.