Unitate 11 / 11

Fundația MLOps, Etică, confidențialitate și analiză responsabilă

Câștiguri:

  • Abilitatea de a înțelege fazele MLOps (lansare, implementare, monitorizare, reantrenare, rollback) și deriva modelului și planificarea unei implementări monitorizate
  • Abilitatea de a aplica principiile echității modelului, transparenței și răspunderii și de a distinge acuratețea statistică de acceptabilitatea etică
  • Capacitatea de a proteja datele personale cu principiile KVKK/GDPR și de a atribui responsabilitatea finală unui om în deciziile cu impact mare

Antrenarea unui model și obținerea unui scor mare nu este finalul, ci mijlocul. Valoarea reală vine atunci când modelul este pus în producție și funcționează fiabil, este monitorizat în timp fără deteriorare, iar întregul proces se desfășoară în limitele etice și legale. Această unitate de închidere combină trei subiecte: MLOps (disciplina lansării în direct, monitorizarea și menținerea modelelor), etica (echitate, transparență, non-malefință) și confidențialitate (protecția datelor cu caracter personal). AI produce coduri, liste de verificare și planuri în aceste domenii; Dar oamenii decid dacă un model este disponibil, cine va fi afectat și ce date pot fi utilizate. Aceste decizii nu sunt decizii tehnice, ci decizii de responsabilitate.

MLOps: modelul trăiește ca un produs

MLOps (Machine Learning Operations - practica de rulare, monitorizare și actualizare a modelelor de învățare automată în producție) este adaptarea DevOps în dezvoltarea de software la știința datelor. Ideea de bază: un model nu este un dosar antrenat o dată și uitat, ci un produs viu care necesită întreținere constantă. Etape majore:

1. Versiune: Codul (Git), datele și modelul sunt versiuni împreună; Se înregistrează ce model a fost produs cu ce date și cod.

2. Implementare: modelul este pus live ca API sau job batch. De obicei, este dat mai întâi unui public mic (distribuție de umbră/canar).

3. Monitorizare: Performanța modelului și a datelor de intrare sunt monitorizate în mod constant.

4. Reantrenare: Când performanța scade, modelul este reantrenat cu date actualizate.

Schimbarea modelului: distorsiune silențioasă

Cel mai mare pericol în producție este drift-ul modelului (model drift / data drift). Lumea se schimbă; Conditiile in care ti-ai antrenat modelul (comportamentul clientului, preturi, sezon, legislatie) se schimba in timp si modelul incepe sa devina invechit. De exemplu, un model de cerere antrenat înainte de pandemie este complet greșit în timpul pandemiei. Deriva apare sub două forme: deriva de date (distribuția modificărilor datelor de intrare) și deriva de concept (relația dintre modificările de intrare și țintă). Modul de captare a acestora este monitorizarea: urmăriți în mod constant distribuția de intrare, distribuția de predicție și (dacă este posibil) performanța în comparație cu rezultatul real.

Atenție: Un model pus în producție se va deteriora de la sine; Nu este o chestiune de „dacă” ci „când”. Implementarea modelelor fără a configura monitorizarea este ca și cum ai conduce o mașină fără să-i controlezi vreodată motorul; Într-o zi, stă acolo liniștit și nu observi.

element MLOps

Scop

Dacă este neglijat

Versiune

Știind ce se produce

Nereproductibil, netrasabil

Monitorizare

Văzând alunecarea devreme

Modelul se defectează în tăcere

recalificare

fii la curent

Predicțiile îmbătrânesc

Rollback

revenirea la modelul prost

Modelul defect rămâne activ

Documentare

transparență, cifra de afaceri

Informația se blochează într-o singură persoană

Etica: deciziile model afectează oamenii

Modelele de date sunt din ce în ce mai folosite în deciziile care afectează viața oamenilor: credit, angajare, asigurări, justiție. Cu această putere vine și responsabilitatea. Riscuri etice majore:

Prejudecăți și discriminare: modelul poate învăța și perpetua nedreptățile în datele istorice. Dacă un anumit grup a primit mai puțin credit în trecut, modelul presupune că aceasta este o „regulă” și automatizează discriminarea. De aceea, analiza echității – verificarea dacă modelul are performanțe similare pentru diferite grupuri (sex, vârstă, regiune) – este esențială.

Transparență și explicabilitate: ar trebui să puteți explica de ce un model a respins o persoană. „Cutia neagră a spus așa” este inacceptabil din punct de vedere etic și adesea din punct de vedere legal. De aceea instrumentele de explicabilitate (importanța caracteristicilor, valorile SHAP) sunt valoroase.

Responsabilitate: Cine este responsabil dacă modelul ia o decizie greșită? Răspunsul este întotdeauna o persoană/instituție, nu un model. Supravegherea umană (human-in-the-loop - un om care aprobă decizia finală) ar trebui păstrată în deciziile cu impact ridicat.

Atenție: Un model poate fi „corect” din punct de vedere statistic, dar inacceptabil din punct de vedere etic. Un model foarte precis care dezavantajează sistematic un grup nu este un model bun. Onestitatea nu înlocuiește justiția.

Confidențialitate: datele personale sunt protejate cu grijă

Materia primă a științei datelor sunt adesea datele personale, iar aceste date sunt protejate de lege: KVKK în Türkiye, GDPR în Europa. Principiile de bază sunt: ​​limitarea scopului (datele nu sunt utilizate în alte scopuri decât scopul pentru care au fost colectate), minimizarea datelor (nu sunt colectate/reținute mai multe date decât este necesar), anonimizarea (informațiile de identificare sunt eliminate) și securitate (datele sunt păstrate criptate și accesul restricționat). Regulă critică atunci când lucrați cu instrumente AI: nu lipiți niciodată date personale reale într-un instrument AI public. De cele mai multe ori, o diagramă și o probă anonimă/sintetică sunt suficiente pentru analiză.

Un accent suplimentar în contextul securității informațiilor: utilizați instrumente și tehnici de știință a datelor numai asupra datelor și sistemelor pentru care aveți autoritate, în scopuri de analiză defensive și legitime. Accesul neautorizat la datele altcuiva, reidentificarea persoanelor (extragerea identității din date anonime) sau crearea de profiluri neautorizate este atât ilegală, cât și lipsită de etică.

trei mini cutii

Cazul 1 — Colaps neurmărit. O companie de comerț electronic a intrat în funcțiune cu modelul său de recomandare și nu a configurat urmărirea. După 4 luni catalogul de produse s-a schimbat foarte mult; modelul a continuat să recomande produse învechite, iar rata de conversie a scăzut liniștit cu 30%. Nimeni nu a observat luni de zile. Lecție: implementarea fără monitorizare devine orb.

Cazul 2 – Discriminare ascunsă. Un model de screening de angajare a aflat despre dezechilibrul de gen în datele istorice și a subestimat sistematic candidații de sex feminin. Nu a fost observat deoarece nu a existat o analiză de corectitudine; A fost dezvăluit într-un audit, iar instituția s-a confruntat cu un risc reputațional/legal serios. Lecție: controlul echității pe bază de grup este esențial în modelele cu impact ridicat.

Cazul 3 – Încălcarea confidențialității. Un analist a încărcat un fișier care conține e-mailuri reale ale clienților și istoricul achizițiilor într-un instrument public de inteligență artificială și a spus „rezumați segmentele”. Datele personale au părăsit instituția; Procesul KVKK a început. Modul corect a fost să eliminați câmpurile de identitate și să partajați numai proprietăți anonime. Lecție: datele personale reale nu intră în instrumentul deschis.

Patru șabloane copiabile

1) Lista de verificare înainte de implementare:

Rolul dumneavoastră: consultant MLOps. Enumerați lucrurile pe care trebuie să le verific înainte de a pune un model în producție: versiunea, valorile de monitorizare, planul de rollback, pragul de performanță, alertă de deriva de date, persoană responsabilă. Adăugați o explicație cu o propoziție „de ce contează” pentru fiecare articol. voi decide.

2) Design de urmărire a schimbării modelului:

Sugerați un plan de monitorizare a deriva pentru un model de clasificare în producție: (1) ce distribuții de intrare ar trebui să monitorizez, (2) ce alarmă pentru distribuția de predicție, (3) cum să compar performanța când ajunge rezultatul real, (4) la ce prag ar trebui declanșată reinstruirea. De asemenea, furnizați un schelet de cod.

3) Controlul corectitudinii:

Scrieți un cod care compară performanța modelului meu pentru diferite grupuri (de exemplu, grupă de vârstă, regiune): reamintire/precizie și rata de decizie pozitivă pentru fiecare grup. Avertizați dacă există o diferență semnificativă între grupuri. Realizarea de interpretări cauzale/politice; Doar arată-mi diferențele și voi lua în considerare decizia.

4) Verificare prealabilă a confidențialității:

Înainte de a oferi date unui instrument AI, verificați: există date personale/de identitate (nume, e-mail, ID, telefon, adresă, IP) în lista de coloane de mai jos? Dacă da, enumerați care ar trebui eliminate sau anonimizate. Coloane: [listă]. Scop: pentru a partaja numai schema anonimă.

Prompt slab / Prompt puternic

Prompt slab:

Modelul meu este gata, intră în direct.

Implementarea nu este un singur pas; Lansarea live fără monitorizare, rollback, corectitudine și control al confidențialității este o invitație tăcută la dezastru.

Solicitare puternică:

Rolul dumneavoastră: consultant responsabil MLOps. Modelul meu a fost antrenat, vreau pregătire completă înainte de a intra în direct. Generați: (1) listă de verificare înainte de implementare, (2) plan de monitorizare a deriva, (3) cod de verificare a corectitudinii bazat pe grup, (4) verificare a confidențialității (există date personale). De asemenea, sugerați cum să protejați consimțământul uman în deciziile cu impact ridicat. Deciziile finale sunt ale mele.

Aici distribuția, monitorizarea, corectitudinea și confidențialitatea sunt tratate ca un singur proces responsabil.

Greșeli comune

  • Implementarea unui model fără a configura monitorizarea. Modelul alunecă și se distorsionează în tăcere; Poate dura luni până la observarea.
  • Ocolind verificarea justiției. Un model de înaltă fidelitate poate dezavantaja sistematic un grup.
  • Luarea unei decizii inexplicabile de cutie neagră. Deciziile cu impact ridicat trebuie să fie explicabile; „Modelul a spus așa” nu este suficient.
  • Oferirea de date personale reale pentru a deschide instrumentul AI. Încălcarea KVKK/GDPR; Diagrama și exemplul anonim sunt suficiente.
  • Delegarea deciziei modelului. Responsabilitatea revine întotdeauna unei persoane; Se menține supravegherea umană cu impact ridicat.
Sfat: înainte de a intra în direct cu fiecare model, puneți o întrebare cu voce tare: „Dacă acest model se rupe în liniște mâine sau penalizează în mod nedrept un grup, cum îl voi observa și îl voi face înapoi?” Dacă nu aveți un răspuns clar la această întrebare, modelul nu este încă pregătit pentru producție.

În concluzie

Munca unui model nu se termină cu un scor mare, ci cu lucrul fiabil și responsabil în producție. MLOps este disciplina de lansare live, monitorizare pentru derive, reantrenare și derulare înapoi a modelului; Implementarea fără urmărire este colaps silențios. Etica necesită corectitudine, transparență și responsabilitate a modelului; acuratețea statistică nu înlocuiește acceptabilitatea etică. Confidențialitatea înseamnă protejarea datelor cu caracter personal cu principiile KVKK/GDPR și păstrarea datelor reale departe de instrumentele deschise. Toate aceste decizii nu sunt decizii tehnice, ci de responsabilitate și aparțin întotdeauna unui om.

Sarcina de aplicare

Gândiți-vă la asta ca și cum ați pune în producție un model pe care l-ați construit (sau ipotetic) și completați patru liste: (1) listă de verificare înainte de implementare, (2) valori de derive pe care le veți urmări, (3) plan de control al corectitudinii bazat pe grup, (4) control al confidențialității. Apoi scrieți un răspuns concret la întrebarea „Cum voi observa dacă mâine se rupe în tăcere și îl voi primi înapoi?”

lista de verificare

  • [ ] Implementez modelul cu un plan de monitorizare (alerta de alunecare) și de retragere?
  • [ ] Am verificat diferența de corectitudine/performanță pentru diferite grupuri?
  • [ ] Am menținut o stare umană în curs de luare a deciziilor cu impact ridicat?
  • [ ] Am protejat datele personale cu principiile KVKK/GDPR și le-am ținut departe de instrumentele deschise?
  • [ ] Am pus responsabilitatea supremă asupra unui om, nu modelului?

Examenul modulului

1. Un cercetător de date întreabă inteligența artificială: „Cât de exactă este pădurea aleatoare pe aceste date?” fără a antrena deloc modelul și pune direct răspunsul „89%” în prezentare. Care este greșeala fundamentală în această abordare?

  • A) Așteptând metrici fără a oferi date și modele inteligenței artificiale; Ignorând faptul că numărul pe care îl produce este fals și că valoarea reală poate fi găsită doar prin antrenament și testare ✔
  • B) Trebuie să folosească regresia logistică în locul pădurii aleatorii
  • C) Rata de precizie trebuie să fie întotdeauna peste 90%.
  • D) Este strict interzisă includerea unor metrici în prezentare

Explicație: Inteligența artificială nu poate produce o metrică fără a accesa modelul și datele; Numărul pe care îl dă este o halucinație (fabricată). Metrica este obținută prin calculul propriu al cercetătorului de date numai după ce modelul a fost efectiv antrenat și testat. Ieșirea neverificată este ca un raport nesemnat.

2. Coloana „Motivul închiderii contului” este inclusă atunci când se colectează date pentru o prognoză de abandon; Această coloană este completată numai după ce clientul pleacă. Modelul oferă 97% pe setul de testare, dar nu funcționează în producție. Care este numele și cauza acestei afecțiuni?

  • A) supraînvățare; Modelul este prea complex
  • B) Scurgere de date; ✔ Utilizarea informațiilor care nu vor fi disponibile în momentul predicției, dar sunt rezultatul țintei, ca caracteristică
  • C) Învățare insuficientă; Modelul este prea simplu
  • D) Prejudecăți de selecție; dimensiune mică a eșantionului

Explicație: Aceasta este o scurgere de date clasică: „motivul de închidere” este un rezultat al țintei și este încă gol în momentul predicției. Modelul face șmecheria cu aceste cunoștințe viitoare, arată grozav pe setul de testare, dar se blochează în producție pentru că acea coloană este goală. Întrebarea „o am în momentul predicției” ar trebui adresată fiecărei coloane.

3. Un analist completează valorile lipsă în coloana veniturilor cu media; dar persoanele dispărute aparțin de fapt segmentului cu venituri mici care nu a declarat niciodată venituri (dispăruți sistematici). De ce este incorectă această umplere?

  • A) Media este întotdeauna mai mare decât mediana, deci este incorectă
  • B) Valorile lipsă nu trebuie completate niciodată, ele trebuie întotdeauna șterse
  • C) Completarea golului sistematic cu media denaturează datele prin reprezentarea artificială a grupului respectiv; Umplerea a fost făcută fără a pune întrebarea „de ce este gol?” ✔
  • D) Calcularea mediei creează o problemă de performanță deoarece este prea lentă

Explicație: Cauza deficienței determină soluția. Atunci când lipsa sistematică (decalajul concentrat într-un anumit grup) este completată cu media, acel grup devine artificial „venit mediu” și datele sunt distorsionate. Înainte de a-l completa, trebuie pusă întrebarea „de ce este gol”; media lipsă sistematică/semnificativă nu trebuie completată.

4. O echipă găsește o corelație de 0,78 între „cheltuieli publicitare” și „vânzări” și dublează bugetul; Cu toate acestea, ceea ce declanșează de fapt ambele sunt campaniile sezoniere. Ce principiu din statistică explică această eroare?

  • A) Corelația nu este cauzalitate; O a treia variabilă ascunsă poate afecta ambele variabile ✔
  • B) Deoarece corelația de 0,78 este prea mică, relația ar trebui ignorată
  • C) Corelația demonstrează întotdeauna cauzalitate, echipa a înțeles bine
  • D) Corelația dintre publicitate și vânzări nu poate fi calculată matematic.

Explicație: Corelația nu este cauzalitate. Cele două variabile pot acționa împreună, deoarece o a treia variabilă ascunsă (aici campanii sezoniere) le afectează pe amândouă. Concluzia că unul îl provoacă pe celălalt nu poate fi stabilită decât prin experiment și cunoștințe de teren; Numărul de corelații singur nu este o dovadă a cauzalității.

5. Un model de detectare a fraudei arată o acuratețe de 99,2% și echipa sărbătorește; Cu toate acestea, rata tranzacțiilor false în date este de doar 0,8%, iar rechemarea modelului este de 6%. Ce arată acest tabel?

  • A) Modelul este perfect deoarece precizia este de peste 99%
  • B) Precizia este înșelătoare în cazul datelor dezechilibrate; Modelul ratează aproape toate falsurile (reamintire scăzută), măsurarea adecvată ar trebui să fie analizată ✔
  • C) Nu există nicio problemă, deoarece rechemarea modelului este mare
  • D) Nu a fost nevoie să construim un model deoarece rata falsurilor era scăzută

Explicație: „Acuratețea” este înșelătoare în cazul datelor dezechilibrate. Când modelul numește aproape fiecare tranzacție „curată”, obține o precizie ridicată, deoarece falsurile sunt foarte puține, dar nu reușește să prindă falsurile, care este scopul său principal (reamintire 6%). Prin urmare, în problemele dezechilibrate, accentul nu se pune pe acuratețe, ci pe matricea de confuzie și metrica potrivită pentru scopul muncii, cum ar fi rechemarea/precizia.

6. Într-un proiect de prognoză a cererii, datele dependente de timp sunt împărțite aleatoriu în instruire/testare. Modelul oferă o precizie de 93%, dar se prăbușește în producție. Care ar trebui să fie abordarea corectă a diviziunii?

  • A) Mărirea setului de testare, de ex. împărțire 50%/50%
  • B) Folosind un model mai complex
  • C) Eliminați complet partiția și antrenați-vă cu toate datele
  • D) Împărțirea cronologică: antrenament cu perioada veche și testare cu perioada nouă, împiedicând astfel modelul să vadă viitorul ✔

Explicație: Dacă se face împărțirea aleatorie în datele seriei temporale, modelul vede viitorul și prezice trecutul în antrenament; este o scurgere și produce succes care de fapt nu există. Abordarea corectă este împărțirea cronologică: antrenament cu perioada veche și testarea cu perioada nouă, imitarea situației reale în producție (predicție de la trecut la viitor).

7. Din ce date ar trebui să se calculeze parametrii de scalare (StandardScaler) în ingineria caracteristicilor și cum ar trebui să fie aplicați?

  • A) Ar trebui calculat din toate datele (antrenament + testare împreună), astfel încât să fie mai precis
  • B) Ar trebui calculat separat pentru fiecare rând, din valoarea proprie a rândului respectiv
  • C) Ar trebui să fie calculat numai din datele de testare
  • D) Ar trebui calculat numai din datele de antrenament, apoi aceiași parametri trebuie aplicați și datelor de testare; altfel se va scurge ✔

Explicație: Parametrii tuturor transformărilor (media, abaterea standard etc.) cum ar fi scalarea, codificarea și umplutura ar trebui învățați numai din datele de antrenament, apoi același lucru ar trebui aplicat datelor de testare. Luarea în considerare a datelor de testare determină, de asemenea, ca informațiile de testare să interfereze cu antrenamentul, adică scurgeri, și face ca modelul să arate mai bine decât este. Utilizarea Pipeline asigură acest lucru.

8. Un model oferă o precizie de 98% la setul de antrenament și o precizie de 72% la setul de testare. Ce indică acest simptom și ce trebuie făcut?

  • A) Învățare insuficientă; modelul ar trebui să fie mai complex
  • B) Scurgere de date; setul de testare trebuie schimbat
  • C) Supramontare; modelul ar trebui simplificat, trebuie aplicate regularizarea și validarea încrucișată ✔
  • D) O situație normală; Scorul de educație este oricum mai mare, măsurile de precauție nu sunt necesare

Explicație: Un scor foarte mare la antrenament și un scor semnificativ scăzut la testare este un simptom clasic de supraadaptare: modelul a memorat mai degrabă zgomotul datelor de antrenament decât modelul real. Soluțiile includ simplificarea modelului, mai multe date, regularizarea și verificarea stării cu validare încrucișată. Bazându-ne exclusiv pe scorul de educație ascunde această capcană.

9. Într-o prezentare de management, axa y a unui diagramă cu bare în care vânzările cresc de la 1.000 la 1.020 este începută de la 980 pentru a face creșterea să pară uriașă. Creșterea efectivă este de 2%. De ce este aceasta o problemă etică?

  • A) O axa y trunchiată exagerează vizual o mică diferență și induce în eroare privitorul; Pentru corectitudine, axa din barele de comparație ar trebui să înceapă de la 0 ✔
  • B) Diagramele cu bare nu pot fi folosite niciodată pentru datele vânzărilor
  • C) Nu există nicio problemă; Este întotdeauna bine să faci graficul să arate impresionant
  • D) Axa Y ar trebui să înceapă întotdeauna de la cea mai mare valoare a datelor

Explicație: În diagramele cu bare, în scopuri comparative, axa y ar trebui să înceapă în general la 0. Tăierea axei și începerea de la 980 face ca o mică diferență de 2% să pară vizual uriașă și induce în eroare privitorul. Responsabilitatea etică a profesionistului în domeniul datelor este să creeze grafice oneste care să nu supraestimeze sau să nu subestimeze datele.

10. Un analist găsește cifra de afaceri totală de 3 ori după ALAREA comenzilor cu tabelul de produse; Numărul de linii a crescut de la 240 mii la 690 mii. Ce ar fi trebuit făcut pentru a preveni această eroare silențioasă?

  • A) Împărțiți cifra de afaceri totală la 3
  • B) Folosiți întotdeauna interogări separate în loc de JOIN
  • C) Ștergerea completă a tabelului de produse
  • D) Verificarea numărului de rânduri după merge/JOIN și verificarea că acestea sunt unite prin cheia corectă; Prinderea replicării devreme ✔

Explicație: Când există mai multe rânduri pentru fiecare produs (o culoare diferită, de exemplu) în tabelul de produse, JOIN prin cheia greșită va duplica fiecare comandă și va umfla totalurile. Codul rulează fără erori, dar rezultatul este greșit. Modul de a evita acest lucru este să verificați numărul de rânduri după fiecare îmbinare/JOIN și să îmbinați cu cheia corectă.

11. Un model de screening de angajare învață despre dezechilibrul de gen în datele istorice și subscrie sistematic candidații de sex feminin, dar acuratețea sa generală este mare. Ce înseamnă acest lucru?

  • A) Nu există nicio problemă deoarece modelul are o precizie ridicată
  • B) Acuratețea statistică nu înlocuiește acceptabilitatea etică; modelul a aflat despre discriminarea din trecut, este necesară verificarea corectitudinii pe bază de grup ✔
  • C) Creșterea în continuare a preciziei modelului rezolvă problema
  • D) Corectitudinea este în afara domeniului de aplicare al științei datelor

Explicație: Chiar dacă un model este corect din punct de vedere statistic, acesta poate fi inacceptabil din punct de vedere etic. Modelul învață nedreptatea din datele din trecut și automatizează discriminarea. Integritatea ridicată nu înlocuiește justiția; În modelele cu impact ridicat, controlul echității, care măsoară diferența de performanță/decizie pentru diferite grupuri, este esențial, iar responsabilitatea finală revine omului.

12. Un angajat încarcă un fișier care conține e-mailuri reale ale clienților și istoricul achizițiilor într-un instrument public AI și spune „rezuma segmente”. De ce este aceasta o greșeală gravă și care este calea corectă?

  • A) Nu există nicio problemă; Instrumentele AI nu stochează niciodată date
  • B) Eroarea este că fișierul este prea mare; ar fi trebuit redus
  • C) Furnizarea de date personale reale unui instrument deschis reprezintă o încălcare a KVKK/GDPR; câmpurile de identitate ar fi trebuit să fie eliminate și să fie partajată doar schema/proprietatea anonimă ✔
  • D) Ar fi trebuit folosit CSV în loc de doar Excel

Explicație: Când date cu caracter personal reale (cum ar fi e-mailul, numele etc.) sunt furnizate unui instrument de inteligență artificială disponibil public, va exista o încălcare a confidențialității în domeniul de aplicare a KVKK / GDPR; datele părăsesc organizația. De cele mai multe ori, o diagramă și o probă anonimă/sintetică sunt suficiente pentru analiză. Modul corect este să eliminați câmpurile de identitate și să partajați numai proprietăți anonime.

13. Se pune în producție un model de recomandare, dar urmărirea nu este stabilită; Când catalogul de produse se schimbă după 4 luni, modelul continuă să recomande produse vechi, iar rata de conversie scade în tăcere cu 30%. Care este numele acestui fenomen?

  • A) supraînvățare; Modelul memorează setul de antrenament
  • B) Deriva modelului; Pe măsură ce lumea se schimbă, modelul devine învechit în tăcere, neobservat deoarece monitorizarea nu este stabilită ✔
  • C) prejudecăți de selecție; prejudecățile eșantionului
  • D) Încălcarea minimizării datelor

Explicație: Aceasta este deriva modelului (deriva modelului/datelor): când lumea se schimbă (catalog, comportament, sezon) condițiile în care modelul a fost antrenat se schimbă și modelul se defectează în tăcere. Un model pus în producție se deteriorează de la sine; Este o chestiune de „când”. Implementarea fără monitorizare (urmărirea intrării și a performanței) face imposibilă detectarea degradării.

14. Un model care obține o precizie de 88% într-o singură împărțire de antrenament/test are scoruri de validare încrucișată de 5 ori de 88%, 71%, 83%, 64%, 79%. Ce indică acest lucru și de ce este importantă validarea încrucișată?

  • A) Modelul este stabil; 88% este performanță reală
  • B) Validarea încrucișată este inutilă; Un singur compartiment este suficient
  • C) Volatilitatea mare a scorurilor indică faptul că modelul este instabil; validarea încrucișată bazează performanța pe media și distribuția mai multor containere, nu pe un singur bin norocos ✔
  • D) Cel mai bine este să raportați cel mai mare scor (88%)

Explicație: Un singur compartiment poate fi norocos sau ghinionist; 88% a fost doar rezultatul acelei diviziuni ușoare. Validarea încrucișată împarte datele de mai multe ori, bazând performanța pe medie (aici ~77%) și arătând volatilitatea scorurilor. Volatilitatea ridicată sugerează că modelul este instabil; A te baza pe un singur compartiment este înșelător.