Yksikkö 11 / 11

MLOps Foundation, Ethics, Privacy ja Responsible Analytics

Voitot:

  • Kyky ymmärtää MLOps-vaiheita (julkaisu, käyttöönotto, seuranta, uudelleenkoulutus, palautus) ja mallin ajautuminen ja suunnitella valvottu käyttöönotto
  • Kyky soveltaa mallien oikeudenmukaisuuden, läpinäkyvyyden ja vastuullisuuden periaatteita ja erottaa tilastollinen tarkkuus eettisestä hyväksyttävyydestä
  • Kyky suojata henkilötietoja KVKK/GDPR-periaatteilla ja antaa lopullisen vastuun ihmiselle vaikuttavissa päätöksissä

Mallin kouluttaminen ja huippupisteiden saaminen ei ole loppu, vaan keskikohta. Todellinen arvo syntyy, kun malli otetaan tuotantoon ja toimii luotettavasti, sitä seurataan ajan mittaan ilman huononemista ja koko prosessi suoritetaan eettisten ja lakisääteisten rajojen sisällä. Tämä päättävä yksikkö yhdistää kolme aihetta: MLOps (julkilausunnon kurinalaisuus, mallien seuranta ja ylläpito), etiikka (reiluus, läpinäkyvyys, ei-vahingollisuus) ja yksityisyys (henkilötietojen suojaaminen). Tekoäly tuottaa näillä alueilla koodia, tarkistuslistoja ja piirustuksia; Mutta ihmiset päättävät, otetaanko malli käyttöön, ketä se koskee ja mitä tietoja voidaan käyttää. Nämä päätökset eivät ole teknisiä, vaan vastuullisia päätöksiä.

MLOps: malli elää kuin tuote

MLOps (Machine Learning Operations - koneoppimismallien ajamisen, seurannan ja päivittämisen käytäntö tuotannossa) on ohjelmistokehityksen DevOps-sovellusta datatieteeseen. Perusidea: malli ei ole kerran koulutettu ja unohdettu tiedosto, vaan elävä tuote, joka vaatii jatkuvaa ylläpitoa. Tärkeimmät vaiheet:

1. Versiointi: Koodi (Git), tiedot ja malli versioitetaan yhdessä; Tallennetaan, mikä malli on valmistettu millä tiedoilla ja koodilla.

2. Käyttöönotto: Malli otetaan käyttöön API- tai erätyönä. Se annetaan yleensä ensin pienelle yleisölle (varjo/kanaarin jakelu).

3. Valvonta: Mallin ja syöttötietojen suorituskykyä seurataan jatkuvasti.

4. Uudelleenkoulutus: Kun suorituskyky heikkenee, malli koulutetaan uudelleen päivitetyillä tiedoilla.

Kuvion muutos: hiljainen vääristymä

Tuotannon suurin vaara on mallin ajautuminen (model drift / data drift). Maailma muuttuu; Olosuhteet, joissa koulutit malliasi (asiakaskäyttäytyminen, hinnat, kausi, lainsäädäntö) muuttuvat ajan myötä ja malli alkaa vanhentua. Esimerkiksi ennen pandemiaa harjoitettu kysyntämalli on täysin väärä pandemian aikana. Drift esiintyy kahdessa muodossa: data drift (syötetietojen muutosten jakautuminen) ja käsitteiden ajautuminen (syötteen ja kohteen muutosten välinen suhde). Tapa saada nämä talteen on seuranta: seuraa jatkuvasti syötteiden jakautumista, ennustejakaumaa ja (jos mahdollista) suorituskykyä verrattuna todelliseen tulokseen.

Varoitus: Tuotantoon otettu malli heikkenee itsestään; Kyse ei ole "jos" vaan "milloin". Mallien käyttöönotto ilman valvontaa on kuin ajaa autoa ilman, että sen moottoria koskaan ohjattaisiin. Eräänä päivänä se vain istuu siellä hiljaa etkä huomaa.

MLOps-elementti

Tarkoitus

Jos laiminlyödään

Versiointi

Tietää mitä tuotetaan

Ei toistettavissa, ei jäljitettävissä

Valvonta

Nähdään lipsahdus aikaisin

Malli hajoaa hiljaa

uudelleenkoulutus

pysy ajan tasalla

Ennusteet vanhenevat

Palautus

palaa huonoon malliin

Viallinen malli pysyy voimassa

Dokumentaatio

läpinäkyvyys, liikevaihto

Tieto juuttuu yhteen ihmiseen

Etiikka: mallipäätökset vaikuttavat ihmisiin

Tietomalleja käytetään yhä enemmän ihmisten elämään vaikuttavissa päätöksissä: luotto, palkkaus, vakuutus, oikeus. Tämän voiman mukana tulee vastuu. Tärkeimmät eettiset riskit:

Harha ja syrjintä: Malli voi oppia ja säilyttää historiallisten tietojen epäoikeudenmukaisuudet. Jos tietylle ryhmälle on aiemmin myönnetty vähemmän tunnustusta, malli olettaa tämän olevan "sääntö" ja automatisoi syrjinnän. Siksi oikeudenmukaisuusanalyysi – sen tarkistaminen, toimiiko malli samalla tavalla eri ryhmissä (sukupuoli, ikä, alue) – on välttämätöntä.

Läpinäkyvyys ja selitettävyys: Sinun pitäisi pystyä selittämään, miksi malli hylkäsi henkilön. "Musta laatikko sanoi niin" on eettisesti ja usein oikeudellisesti mahdotonta hyväksyä. Siksi selitettävyystyökalut (ominaisuuksien tärkeys, SHAP-arvot) ovat arvokkaita.

Vastuullisuus: Kuka on vastuussa, jos malli tekee väärän päätöksen? Vastaus on aina henkilö/instituutio, ei malli. Inhimillinen valvonta (ihminen silmukassa – ihminen, joka hyväksyy lopullisen päätöksen) olisi säilytettävä vaikuttavissa päätöksissä.

Varoitus: Malli voi olla tilastollisesti "oikea", mutta eettisesti mahdoton hyväksyä. Erittäin tarkka malli, joka järjestelmällisesti heikentää yhtä ryhmää, ei ole hyvä malli. Rehellisyys ei korvaa oikeutta.

Yksityisyys: Henkilötiedot suojataan huolellisesti

Datatieteen raaka-aineena on usein henkilötietoja, ja nämä tiedot on suojattu lailla: KVKK Turkissa, GDPR Euroopassa. Perusperiaatteet ovat käyttötarkoituksen rajoittaminen (tietoja ei käytetä muihin tarkoituksiin kuin siihen tarkoitukseen, johon ne on kerätty), tietojen minimointi (tietoja ei kerätä/säilytetä enempää kuin on tarpeen), anonymisointi (tunnistetiedot poistetaan) ja turvallisuus (tiedot pidetään salattuna ja pääsyä rajoitetaan). Kriittinen sääntö, kun työskentelet tekoälytyökalujen kanssa: älä koskaan liitä oikeita henkilötietoja julkiseen tekoälytyökaluun. Useimmiten kaavio ja anonyymi/synteettinen näyte riittävät analysointiin.

Lisäpainotus tietoturvan yhteydessä: käytä tietotekniikan työkaluja ja tekniikoita vain sellaisissa tiedoissa ja järjestelmissä, joihin sinulla on valtuudet, puolustavaan ja oikeutettuun analyysitarkoituksiin. Luvaton pääsy jonkun toisen tietoihin, henkilöiden uudelleentunnistaminen (identiteetin poistaminen nimettömistä tiedoista) tai luvaton profilointi on sekä laitonta että epäeettistä.

kolme minilaukkua

Tapaus 1 – Seuraamaton romahdus. Verkkokauppayritys otti suositusmallinsa käyttöön eikä määrittänyt seurantaa. 4 kuukauden jälkeen tuoteluettelo on muuttunut suuresti; malli suositteli edelleen vanhentuneita tuotteita, ja konversioprosentti laski hiljaa 30 %. Kukaan ei huomannut sitä kuukausiin. Oppitunti: käyttöönotto ilman valvontaa sokeutuu.

Tapaus 2 – Piilotettu syrjintä. Palkkausseulontamalli oppi sukupuolten epätasapainosta historiallisissa tiedoissa ja aliarvioi naispuolisia ehdokkaita järjestelmällisesti. Sitä ei huomattu, koska oikeudenmukaisuusanalyysiä ei ollut; Se paljastui tarkastuksessa, ja laitoksella oli vakava maine/oikeudellinen riski. Oppitunti: ryhmäpohjainen oikeudenmukaisuuden valvonta on olennaista suurivaikutteisissa malleissa.

Tapaus 3 – Luottamuksellisuuden rikkominen. Eräs analyytikko latasi julkiseen tekoälytyökaluun tiedoston, joka sisälsi todelliset asiakassähköpostit ja ostohistorian, ja sanoi "yhteenveto segmenteistä". Henkilötiedot ovat poistuneet laitoksesta; KVKK-prosessi on alkanut. Oikea tapa oli poistaa identiteettikentät ja jakaa vain nimettömiä ominaisuuksia. Oppitunti: todelliset henkilötiedot eivät pääse avoimeen työkaluun.

Neljä kopioitavaa mallia

1) Käyttöönottoa edeltävä tarkistuslista:

Roolisi: MLOps-konsultti. Listaa asiat, jotka minun on tarkistettava ennen mallin käyttöönottoa: versiointi, seurantamittaukset, palautussuunnitelma, suorituskynnys, tiedon siirtymävaroitus, vastuuhenkilö. Lisää jokaiselle kohteelle yksilauseinen "miksi sillä on merkitystä" -selitys. Minä päätän.

2) Mallin vaihdon seurantasuunnittelu:

Ehdota ryömintäseurantasuunnitelmaa tuotannossa käytettävälle luokitusmallille: (1) mitä syöttöjakaumia minun pitäisi valvoa, (2) mikä hälytys ennustejakaumassa, (3) kuinka vertailla suorituskykyä, kun todellinen tulos saapuu, (4) millä kynnyksellä uudelleenkoulutus tulisi laukaista. Anna myös koodirunko.

3) oikeudenmukaisuuden valvonta:

Kirjoita koodi, joka vertaa mallini suorituskykyä eri ryhmissä (esim. ikäluokka, alue): muistaminen/tarkkuus ja positiivinen päätösprosentti kussakin ryhmässä. Varoita, jos ryhmien välillä on merkittäviä eroja. Kausaalisten/poliittisten tulkintojen tekeminen; Näytä vain erot, niin harkitsen päätöstä.

4) Yksityisyyden ennakkotarkastus:

Ennen kuin annat tietoja tekoälytyökalulle, tarkista: onko alla olevassa sarakeluettelossa henkilö-/identiteettitietoja (nimi, sähköpostiosoite, tunnus, puhelin, osoite, IP)? Jos näin on, luettele mitkä pitäisi poistaa tai anonymisoida. Sarakkeet: [luettelo]. Tarkoitus: vain anonyymin mallin jakamiseen.

Heikko kehote / Vahva kehote

Heikko kehote:

Mallini on valmis, aloita lähetys.

Käyttöönotto ei ole yksittäinen vaihe; Live-lähetyksen aloittaminen ilman valvontaa, palautusta, oikeudenmukaisuutta ja tietosuojan valvontaa on hiljainen kutsu katastrofiin.

Tehokas kehotus:

Tehtäväsi: vastuullinen MLOps-konsultti. Mallini on koulutettu, haluan täyden valmistautumisen ennen live-lähetystä. Luo: (1) käyttöönottoa edeltävä tarkistuslista, (2) poikkeaman seurantasuunnitelma, (3) ryhmäkohtainen oikeudenmukaisuuden tarkistuskoodi, (4) tietosuojatarkistus (onko henkilötietoja). Ehdota myös, kuinka suojella ihmisen suostumusta vaikuttavissa päätöksissä. Lopulliset päätökset ovat minun.

Tässä jakelua, valvontaa, oikeudenmukaisuutta ja yksityisyyttä käsitellään yhtenä vastuullisena prosessina.

Yleisiä virheitä

  • Mallin käyttöönotto ilman valvontaa. Malli liukuu hiljaa ja vääristyy; Sen huomaaminen voi kestää kuukausia.
  • Oikeustarkastuksen ohittaminen. High-fidelity-malli voi järjestelmällisesti haitata ryhmää.
  • Selittämättömän mustan laatikon päätöksen tekeminen. Vaikuttavien päätösten on oltava selitettävissä; "Malli sanoi niin" ei riitä.
  • Oikeiden henkilötietojen antaminen avoimeen tekoälytyökaluun. KVKK/GDPR-rikkomus; Kaavio ja anonyymi esimerkki riittää.
  • Päätöksen delegointi mallille. Vastuu on aina henkilöllä; Ihmisten tehokasta valvontaa ylläpidetään.
Vinkki: Ennen kuin aloitat jokaisen mallin, esitä yksi kysymys ääneen: "Jos tämä malli rikkoutuu hiljaa huomenna tai rankaisee ryhmää epäoikeudenmukaisesti, miten huomaan sen ja perään sen?" Jos sinulla ei ole selkeää vastausta tähän kysymykseen, malli ei ole vielä valmis tuotantoon.

Yhteenvetona

Mallin työ ei pääty huippupisteisiin, vaan luotettavaan ja vastuulliseen työskentelyyn tuotannossa. MLOps on kurinalaisuutta, joka koskee mallin käynnistämistä, driftin seurantaa, uudelleenkoulutusta ja mallin peruuttamista; Käyttöönotto ilman seurantaa on hiljaista romahtamista. Etiikka edellyttää mallin oikeudenmukaisuutta, läpinäkyvyyttä ja vastuullisuutta; tilastollinen tarkkuus ei korvaa eettistä hyväksyttävyyttä. Yksityisyys tarkoittaa henkilötietojen suojaamista KVKK/GDPR-periaatteilla ja todellisten tietojen pitämistä poissa avoimista työkaluista. Kaikki nämä päätökset eivät ole teknisiä vaan vastuullisia päätöksiä ja kuuluvat aina ihmiselle.

Sovellustehtävä

Ajattele sitä ikään kuin laittaisit rakentamasi (tai hypoteettisen) mallin tuotantoon ja täytät neljä listaa: (1) käyttöönottoa edeltävä tarkistuslista, (2) seurattavat poikkeamismittarit, (3) ryhmäpohjainen oikeudenmukaisuuden valvontasuunnitelma, (4) yksityisyyden valvonta. Kirjoita sitten konkreettinen vastaus kysymykseen "Kuinka huomaan, jos se katkeaa hiljaa huomenna ja saan sen takaisin?"

tarkistuslista

  • [ ] Otanko mallin käyttöön seuranta- ja palautussuunnitelmalla?
  • [ ] Olenko tarkistanut eri ryhmien oikeudenmukaisuuden/suorituskyvyn eron?
  • [ ] Olenko pysynyt in-the-loop-ihmisinä vaikuttavissa päätöksissä?
  • [ ] Olenko suojannut henkilötietoja KVKK/GDPR-periaatteilla ja pitänyt ne poissa avoimista työkaluista?
  • [ ] Olenko laittanut lopullisen vastuun ihmiselle, en mallille?

Moduulin tentti

1. Datatieteilijä kysyy tekoälyltä: "Kuinka tarkkaa satunnainen metsä on näissä tiedoissa?" kouluttamatta mallia ollenkaan ja laittaa vastauksen "89%" suoraan esitykseen. Mikä on perustavanlaatuinen virhe tässä lähestymistavassa?

  • A) Odottaa mittareita antamatta tietoja ja malleja tekoälylle; Huomioimatta, että sen tuottama numero on väärennös ja että todellinen mittari löytyy vain koulutuksen ja testauksen avulla ✔
  • B) On käytettävä logistista regressiota satunnaisen metsän sijaan
  • C) Tarkkuuden tulee aina olla yli 90 %.
  • D) Mittareiden sisällyttäminen esitykseen on ehdottomasti kielletty

Selitys: Tekoäly ei voi tuottaa metriikkaa ilman mallia ja tietoja. Hänen antamansa numero on hallusinaatio (kehitetty). Mittari saadaan datatieteilijän omalla laskelmalla vasta, kun malli on todella koulutettu ja testattu. Vahvistamaton tulos on kuin allekirjoittamaton raportti.

2. Tilin sulkemisen syy -sarake sisällytetään kerättäessä tietoja vaihtuvuusennustetta varten. Tämä sarake täytetään vasta asiakkaan poistuttua. Malli antaa 97% testisarjasta, mutta ei toimi tuotannossa. Mikä on tämän tilan nimi ja syy?

  • A) Ylioppiminen; Malli on liian monimutkainen
  • B) Tietovuoto; ✔ Käyttää ominaisuutena tietoja, jotka eivät ole saatavilla ennustehetkellä, mutta ovat kohteen tulosta
  • C) Riittämätön oppiminen; Malli on liian yksinkertainen
  • D) valintaharha; pieni näytekoko

Selitys: Tämä on klassinen tietovuoto: 'sulkemissyy' johtuu tavoitteesta ja on edelleen tyhjä ennustehetkellä. Malli tekee tempun tällä tulevaisuuden tiedolla, se näyttää hyvältä testisarjassa, mutta kaatuu tuotannossa, koska sarake on tyhjä. Kysymys "onko minulla se ennustushetkellä" tulee esittää jokaiselle sarakkeelle.

3. Analyytikko täyttää puuttuvat arvot tulosarakkeessa keskiarvolla; mutta kadonneet kuuluvat itse asiassa pienituloiseen segmenttiin, joka ei ole koskaan ilmoittanut tuloja (järjestelmällinen puuttuminen). Miksi tämä täyttö on väärä?

  • A) Keskiarvo on aina suurempi kuin mediaani, joten se on virheellinen
  • B) Puuttuvia arvoja ei saa koskaan täyttää, vaan ne tulee aina poistaa
  • C) Systemaattisen aukon täyttäminen keskiarvolla vääristää dataa esittämällä keinotekoisesti kyseistä ryhmää; Täyttö tehtiin kysymättä kysymystä "miksi se on tyhjä?" ✔
  • D) Keskiarvon laskeminen aiheuttaa suorituskykyongelman, koska se on liian hidas

Selitys: Puutteen syy ratkaisee ratkaisun. Kun systemaattinen puuttuva (tiettyyn ryhmään keskittynyt aukko) täytetään keskiarvolla, ryhmästä tulee keinotekoisesti "keskituloinen" ja tiedot vääristyvät. Ennen sen täyttämistä on kysyttävä "miksi se on tyhjä"; systemaattista/merkittävää puuttuvaa keskiarvoa ei tule täyttää.

4. Ryhmä löytää 0,78-korrelaation "mainoskulujen" ja "myynnin" välillä ja kaksinkertaistaa budjetin; Se, mikä itse asiassa käynnistää molemmat, ovat kuitenkin kausiluonteiset kampanjat. Mikä tilaston periaate selittää tämän virheen?

  • A) Korrelaatio ei ole syy-yhteyttä; Piilotettu kolmas muuttuja saattaa vaikuttaa molempiin muuttujiin ✔
  • B) Koska korrelaatio 0,78 on liian alhainen, suhde tulisi jättää huomiotta
  • C) Korrelaatio osoittaa aina syy-yhteyden, joukkue teki sen oikein
  • D) Mainonnan ja myynnin välistä korrelaatiota ei voida laskea matemaattisesti.

Selitys: Korrelaatio ei ole syy-yhteyttä. Nämä kaksi muuttujaa voivat toimia yhdessä, koska piilotettu kolmas muuttuja (tässä kausiluonteiset kampanjat) vaikuttaa niihin molempiin. Johtopäätös siitä, että toinen aiheuttaa toisen, voidaan tehdä vain kokeilun ja kenttätiedon avulla; Korrelaatioiden lukumäärä yksinään ei ole todiste syy-yhteydestä.

5. Petosten havaitsemismalli näyttää 99,2 %:n tarkkuudella ja tiimi juhlii; Väärennetyt tapahtumat tiedoissa on kuitenkin vain 0,8 % ja mallin palautusprosentti on 6 %. Mitä tämä taulukko näyttää?

  • A) Malli on täydellinen, koska tarkkuus on yli 99 %
  • B) Tarkkuus on harhaanjohtava epätasapainoisilla tiedoilla; Mallista puuttuu melkein kaikki väärennökset (alhainen muistaminen), sopivaa mittaria kannattaa katsoa ✔
  • C) Ei ole ongelmaa, koska mallin takaisinkutsuminen on korkea
  • D) Mallia ei tarvinnut rakentaa, koska väärennösten määrä oli alhainen

Selitys: 'Tarkkuus' on harhaanjohtava epätasapainoisissa tiedoissa. Kun malli kutsuu lähes jokaista tapahtumaa "puhtaiksi", se saa suuren tarkkuuden, koska väärennöksiä on hyvin vähän, mutta se ei pysty havaitsemaan väärennöksiä, mikä on sen päätarkoitus (muista 6 %). Siksi epätasapainoisissa ongelmissa ei keskitytä tarkkuuteen, vaan hämmennysmatriisiin ja työn tarkoitukseen sopiviin mittareihin, kuten muistamiseen/tarkkuuteen.

6. Kysynnän ennusteprojektissa ajasta riippuvainen data jaetaan satunnaisesti koulutukseen/testaukseen. Malli antaa 93 % tarkkuuden, mutta kaatuu tuotannossa. Minkä pitäisi olla oikea jakotapa?

  • A) Testisarjan laajentaminen, esim. jako 50 %/50 %
  • B) Käyttämällä monimutkaisempaa mallia
  • C) Poista osio kokonaan ja harjoittele kaikilla tiedoilla
  • D) Kronologinen jakaminen: Harjoittelu vanhan jakson kanssa ja testaus uuden jakson kanssa, mikä estää mallia näkemästä tulevaisuutta ✔

Selitys: Jos aikasarjadatassa tehdään satunnainen jako, malli näkee tulevaisuuden ja ennustaa menneisyyden harjoittelussa; se on vuoto ja tuottaa menestystä, jota ei todellisuudessa ole olemassa. Oikea lähestymistapa on kronologinen jakaminen: kouluttaminen vanhan jakson kanssa ja testaus uuden jakson kanssa, imitoimalla todellista tilannetta tuotannossa (ennakoimalla menneisyydestä tulevaisuuteen).

7. Mistä tiedoista skaalausparametrit (StandardScaler) ominaisuussuunnittelussa lasketaan ja miten niitä tulee soveltaa?

  • A) Se tulisi laskea kaikista tiedoista (harjoittelu + testaus yhdessä), jotta se on tarkempi
  • B) Se tulee laskea jokaiselle riville erikseen kyseisen rivin omasta arvosta
  • C) Lasketaan vain testitiedoista
  • D) Se tulisi laskea vain harjoitustiedoista, sitten samoja parametreja tulee soveltaa testitietoihin; muuten se vuotaa ✔

Selitys: Kaikkien muunnosten parametrit (keskiarvo, keskihajonta jne.), kuten skaalaus, koodaus ja täyttö, tulisi oppia vain harjoitustiedoista, sitten samaa tulee soveltaa testitietoihin. Testitietojen huomioon ottaminen aiheuttaa myös testitiedon häiriöitä harjoittelua, eli vuotoa, ja saa mallin näyttämään paremmalta kuin se on. Pipelinen käyttö varmistaa tämän.

8. Malli antaa 98 % tarkkuuden harjoitussarjassa ja 72 % tarkkuuden testisarjassa. Mitä tämä oire tarkoittaa ja mitä pitäisi tehdä?

  • A) Riittämätön oppiminen; mallista pitäisi tehdä monimutkaisempi
  • B) Tietovuoto; testisarja on vaihdettava
  • C) Yliasennus; mallia tulee yksinkertaistaa, regularisointia ja ristiinvalidointia tulisi soveltaa ✔
  • D) Normaali tilanne; Koulutuspisteet ovat joka tapauksessa aina korkeammat, varotoimet ovat tarpeettomia

Selitys: Erittäin korkeat pisteet harjoittelussa ja merkittävästi alhaiset testitulokset ovat klassinen oire yliasetuksesta: malli on muistanut harjoitustietojen kohinan todellisen kuvion sijaan. Ratkaisuja ovat mallin yksinkertaistaminen, lisää dataa, regularisointi ja tilan tarkistaminen ristiinvalidaatiolla. Pelkästään koulutuspisteisiin luottaminen piilottaa tämän sudenkuopan.

9. Johdon esityksessä pylväskaavion y-akseli, jossa myynti kasvaa 1 000:sta 1 020:een, aloitetaan 980:sta, jotta kasvu näyttäisi valtavalta. Todellinen lisäys on 2 prosenttia. Miksi tämä on eettinen kysymys?

  • A) Katkaistu y-akseli liioittelee visuaalisesti pientä eroa ja johtaa katsojaa harhaan; Oikeudenmukaisuuden vuoksi vertailupalkkien akselin tulee alkaa 0 ✔:stä
  • B) Pylväskaavioita ei voi koskaan käyttää myyntitiedoissa
  • C) Ei ole ongelmaa; On aina hyvä saada kaavio näyttämään vaikuttavalta
  • D) Y-akselin tulee aina alkaa datan suurimmasta arvosta

Selitys: Vertailevia pylväskaavioita varten y-akselin tulisi yleensä alkaa nollasta. Akselin leikkaaminen ja 980:sta alkava pieni 2 % ero näyttää visuaalisesti suurelta ja johtaa katsojaa harhaan. Tietojen ammattilaisen eettinen vastuu on piirtää rehellisiä kaavioita, jotka eivät yliarvioi tai aliarvioi tietoja.

10. Analyytikko löytää kokonaisliikevaihdon 3 kertaa tilausten liittämisen jälkeen tuotetaulukkoon; Linjojen määrä kasvoi 240 tuhannesta 690 tuhanteen. Mitä olisi pitänyt tehdä tämän hiljaisen virheen estämiseksi?

  • A) Jaa kokonaisliikevaihto kolmella
  • B) Käytä aina erillisiä kyselyitä JOIN-komenton sijaan
  • C) Tuotetaulukon poistaminen kokonaan
  • D) Tarkistaa rivien lukumäärä yhdistämisen/JOIN-toiminnon jälkeen ja varmistaa, että ne on yhdistetty oikealla avaimella; Replikoinnin saaminen aikaisin ✔

Selitys: Kun tuotetaulukossa on useita rivejä kullekin tuotteelle (esimerkiksi eri värillä), JOIN väärällä avaimella monistaa jokaisen tilauksen ja kasvattaa kokonaissummaa. Koodi toimii ilman virheitä, mutta tulos on väärä. Tapa välttää tämä on tarkistaa rivien määrä jokaisen yhdistämisen/JOIN:n jälkeen ja yhdistää oikealla avaimella.

11. Rekrytointiseulontamalli oppii sukupuolten välisen epätasapainon historiallisista tiedoista ja pisteyttää systemaattisesti naispuolisia ehdokkaita, mutta sen yleinen tarkkuus on korkea. Mitä tämä tarkoittaa?

  • A) Ei ole ongelmaa, koska mallilla on korkea tarkkuus
  • B) Tilastollinen tarkkuus ei korvaa eettistä hyväksyttävyyttä; malli on oppinut aiemmasta syrjinnästä, vaaditaan ryhmäkohtainen oikeudenmukaisuustarkastus ✔
  • C) Mallin tarkkuuden lisääminen edelleen ratkaisee ongelman
  • D) Oikeudenmukaisuus ei kuulu datatieteen piiriin

Selitys: Vaikka malli olisi tilastollisesti oikea, se voi olla eettisesti mahdotonta hyväksyä. Malli oppii aiempien tietojen epäoikeudenmukaisuuden ja automatisoi syrjinnän. Korkea rehellisyys ei korvaa oikeutta; Suurivaikutteisissa malleissa eri ryhmien suoritus-/päätöseroa mittaava oikeudenmukaisuuden hallinta on olennaista ja perimmäinen vastuu on ihmisellä.

12. Työntekijä lataa todelliset asiakassähköpostit ja ostohistorian sisältävän tiedoston julkiseen tekoälytyökaluun ja sanoo "yhteenveto segmenteistä". Miksi tämä on vakava virhe ja mikä on oikea tapa?

  • A) Ei ole ongelmaa; AI-työkalut eivät koskaan tallenna tietoja
  • B) Virhe on, että tiedosto on liian suuri; olisi pitänyt vähentää
  • C) Oikeiden henkilötietojen toimittaminen avoimeen työkaluun on KVKK/GDPR:n vastaista; identiteettikentät olisi pitänyt poistaa ja jakaa vain anonyymit skeemat/omaisuudet ✔
  • D) CSV:tä olisi pitänyt käyttää pelkän Excelin sijaan

Selitys: Kun todellisia henkilötietoja (kuten sähköpostiosoite, nimi jne.) annetaan julkisesti saatavilla olevalle tekoälytyökalulle, kyseessä on KVKK/GDPR:n piirissä oleva tietosuojaloukkaus; tiedot lähtevät organisaatiosta. Useimmiten kaavio ja anonyymi/synteettinen näyte riittävät analysointiin. Oikea tapa on poistaa identiteettikentät ja jakaa vain nimettömiä ominaisuuksia.

13. Suositusmalli otetaan tuotantoon, mutta seurantaa ei ole vahvistettu; Kun tuoteluettelo muuttuu 4 kuukauden jälkeen, malli jatkaa vanhojen tuotteiden suosittelemista ja konversioprosentti putoaa hiljaa 30%. Mikä on tämän ilmiön nimi?

  • A) Ylioppiminen; Malli muistaa harjoitussarjan
  • B) Mallin ajautuminen; Maailman muuttuessa malli vanhenee hiljaa, huomaamatta, koska seurantaa ei vakiinnu ✔
  • C) Valintaharha; näyteharha
  • D) Tietojen minimoinnin rikkomus

Selitys: Tämä on mallin ajautuminen (mallin/datan ajautuminen): kun maailma muuttuu (katalogi, käyttäytyminen, vuodenaika), mallin koulutuksen olosuhteet muuttuvat ja malli hajoaa hiljaa. Valmistukseen otettu malli huononee itsestään; Kyse on 'milloin'. Käyttöönotto ilman valvontaa (syötteen ja suorituskyvyn seuranta) tekee heikkenemisen havaitsemisen mahdottomaksi.

14. Mallilla, joka saa 88 % tarkkuuden yhdessä harjoitus-/testijaksossa, on 5-kertaiset ristiinvalidointipisteet 88 %, 71 %, 83 %, 64 %, 79 %. Mitä tämä tarkoittaa ja miksi ristiinvalidointi on tärkeää?

  • A) Malli on vakaa; 88 % on todellista suorituskykyä
  • B) Ristiinvalidointi on tarpeetonta; Yksi lokero riittää
  • C) Pisteiden suuri volatiliteetti osoittaa, että malli on epävakaa; ristiintarkistus perustuu useiden roskakorien keskiarvoon ja jakautumiseen, ei yhteen onnelliseen roskakoriin ✔
  • D) On parasta ilmoittaa korkein pistemäärä (88 %)

Selitys: Yksi osasto voi olla onnekas tai epäonninen; 88 % oli vain tulosta tästä helposta jaosta. Ristiinvalidointi jakaa tiedot useita kertoja, perustaen suorituskyvyn keskiarvoon (tässä ~77 %) ja näyttäen tulosten volatiliteetin. Suuri volatiliteetti tässä viittaa siihen, että malli on epävakaa; Yhteen osastoon luottaminen on harhaanjohtavaa.