zisky:
- Schopnosť zabezpečiť reprodukovateľnosť so štyrmi piliermi (fixácia semien, vytváranie verzií údajov, zmrazenie médií, monitorovanie experimentu) a dosiahnuť rovnaký výsledok pri opakovaní rovnakého cyklu
- Schopnosť kombinovať všetky časti modulu (metriky, údaje, model, komponenty LLM, hodnotenie, spravodlivosť, bezpečnosť, distribúcia, monitorovanie) v reťazci typu end-to-end
- Schopnosť overiť, že kritické rozhodnutie zostáva na človeku pri každom zastavení a zdokumentovať projekt kontrolovateľným spôsobom
Najzákernejšie zlyhanie projektu ML nie je krach; "Znova nedosiahnem rovnaký výsledok." Ak dnes nedokážete reprodukovať skóre modelu, ktorý ste dali do výroby pred tromi mesiacmi, v skutočnosti tento model neovládate. V tejto záverečnej jednotke prehlbujeme reprodukovateľnosť: schopnosť spoľahlivo získať rovnaký výsledok s rovnakými vstupmi a spojiť celý modul v disciplíne end-to-end projektu.
Prečo je reprodukovateľnosť náročná
V bežnom softvéri dáva rovnaký kód rovnaký výstup. V ML existuje oveľa viac premenných, ktoré určujú výsledok:
- Náhodnosť: Miešanie údajov, inicializácia hmotnosti, rozdelenie údajov – to všetko závisí od náhodnosti.
- Údaje: Rovnaký kód vytvára iný model s odlišnou verziou údajov.
- Prostredie: Verzie knižnice, hardvér (CPU/GPU), dokonca aj operačný systém môžu zmeniť výsledok.
- Skrytý prípad: Neuložený hyperparameter, krok manuálneho predbežného spracovania, nepoznamenaný výber.
Reprodukovateľnosť nie je „príjemné mať“, ale vedecký a technický imperatív. Výsledok, ktorý nemožno reprodukovať, je tvrdenie, ktoré nemožno dokázať.
Štyri piliere reprodukovateľnosti
1. Opravte náhodnosť. Nastavte všetky náhodné semená na jednom mieste: rozdelenie údajov, inicializácia modelu, miešanie údajov. Pevné osivo je základom záruky „rovnaký výsledok, keď zopakujete rovnaký beh“.
2. Verzia údajov. Zaznamenajte, s ktorou verziou údajov sa každý experiment uskutočnil (verzia údajov v jednotke 2). „Najnovšie údaje“ sú vágne; "dátová verzia v3, hash abc123" je presná.
3. Zmrazte médium. Pripnite všetky závislosti na ich presné verzie (napr. presné verzie ako numpy==1.26.4 v súbore požiadaviek.txt alebo obrázok kontajnera). „Najnovšia verzia“ jedného dňa všetko rozbije.
4. Sledujte všetko (sledovanie experimentov). Automaticky uložiť pre každý experiment: verziu kódu (git commit), verziu údajov, všetky hyperparametre, metriky a výstupné štruktúry. Nástroje na sledovanie experimentov ako MLflow, Weights & Biases to robia systematicky. Bez registrácie ostáva nezodpovedaná otázka „ktoré nastavenie bolo najlepšie“.
Pozor: „Budem si pamätať neskôr“ je najdrahší omyl. O dva týždne neskôr si nebudete pamätať, ktoré semeno, ktoré údaje, ktorý hyperparameter ste použili. Automatické sledovanie eliminuje závislosť na pamäti.
Slabý prístup / Silný prístup
Slabý: "Našiel som najlepší model, je na notebooku, myslím, že jeho skóre bolo 89%."
Strong: "Spustiť číslo 147 v nástroji na sledovanie experimentu: git commit a3f9c, verzia údajov v3 (hash abc123), seed 42, všetky hyperparametre zaregistrované, test PR-AUC 0,887. Keď znova spustím rovnaký príkaz, dostanem rovnaký výsledok kúsok po kúsku. Model závisí od tohto spustenia v registri."
Rozdiel: v silnom prístupe nie je výsledok založený na pamäti, ale na pevnom a monitorovanom reťazci. Každý môže vždy dosiahnuť rovnaký výsledok.
End-to-end projekt: kombinácia modulu
Teraz spojme celý modul do jedného toku projektu. Skutočný systém ML prechádza týmito zastávkami a každá zastávka nadväzuje na predchádzajúcu:
- Definícia problému: Čo riešime, ako merať úspech (jednotka 3: správna metrika, obchodný kontext). Metrika a prah sú jasné od začiatku.
- Dátový kanál: Zhromažďovanie, overovanie, čistenie, rozdelenie bez úniku, vytváranie verzií (jednotka 2).
- Vývoj modelu: Školenie, porovnanie základnej línie, krížová validácia, tvrdá príprava (jednotka 3 + táto jednotka).
- Komponenty LLM (ak sú použiteľné): RAG (jednotka 4) a/alebo činidlá (jednotka 5); v prípade potreby jemné doladenie (jednotka 6).
- Hodnotenie: eval cluster s okrajovými a bezpečnostnými puzdrami, viacvrstvové eval v LLM systémoch (jednotka 8).
- Audit spravodlivosti a etiky: Analýza podskupiny, modelová karta, vysvetliteľnosť (jednotka 10).
- Bezpečnostný audit: Rýchla injekcia, súkromie, dodávateľský reťazec (jednotka 9).
- Distribúcia: Balenie, postupná distribúcia, rollback, register modelov (7. jednotka).
- Monitorovanie: Trojvrstvové monitorovanie, alarmy posunu (jednotka 8).
- Reprodukovateľnosť: Sledovanie zárodku, verzie údajov, médií a experimentov v rámci celého reťazca (táto jednotka).
V tomto toku je AI urýchľovačom a generátorom plánov na každej zastávke; ale výber metrík, rozhodnutia o údajoch, prioritizácia spravodlivosti, prah nasadenia a schválenie vydania – kritické rozhodnutia zostávajú na človeku. Toto je podstata modulu.
Dokumentácia: budúcnosť sa vám poďakuje
Dobrý ML projekt dokumentuje sám seba. Minimálne by mali byť napísané: problémové a úspešné kritériá, zdroj a verzia údajov, výber modelov a zdôvodnenia, výsledky hodnotenia (vrátane podskupín), známe limity a riziká, postup nasadenia a vyhľadávania, plán monitorovania. Tento dokument je najlepším priateľom osoby (možno ste to vy), ktorá sa po šiestich mesiacoch vráti do projektu.
tri mini prípady
Prípad 1 – Stratený výsledok. Inžinier vycvičil skvelý model, ale neopravil zárodok a neuložil dátovú verziu. Keď odišiel z práce, nikto nemohol reprodukovať tento výsledok; model sa stal „legendou čiernej skrinky“ a nakoniec bol postavený od nuly. Boli premárnené týždne. Ponaučenie: nereprodukovateľný výsledok je neexistujúci výsledok.
Prípad 2 – Zrútenie prostredia. Jeden tím neopravil závislosti. Keď bola knižnica automaticky aktualizovaná, výstupy modelu sa ticho zmenili a výroba bola prerušená. Nájdenie problému trvalo niekoľko dní. Keď boli závislosti zmrazené a kontajnerizované s definitívnymi verziami, problém sa už nevyskytol. Ponaučenie: zmrazte životné prostredie.
Prípad 3 – Sila monitorovania. Tím automaticky monitoroval každý experiment. O tri mesiace neskôr pri regulačnom audite odpovedali na otázku "s akými údajmi, s akými nastaveniami, aký výkon to v ktorých skupinách dosiahlo?" s úplným záznamom v priebehu niekoľkých minút. Kontrola prebehla bez problémov. Ponaučenie: Monitorovanie je nástroj na dodržiavanie predpisov, nie len inžiniersky.
Kopírovateľné šablóny
Vykonajte kontrolu reprodukovateľnosti pre tento projekt ML.- Sú všetky počiatočné hodnoty náhodnosti opravené (rozdelenie, inicializácia, premiešanie)?- Sú údaje verzií?- Sú závislosti zmrazené na presné verzie?- Je každý experiment (potvrdenie kódu, údaje, hyperparameter, metrika) sledovaný? Napíšte konkrétne kroky, ako to opraviť pre každý chýbajúci stĺpec. Štruktúra projektu: [popis]
Vytvorte kostru plánu pre tento komplexný projekt ML. Problém: [popis] Zakryte nasledujúce zastávky a označte, kde je na každej zastávke rozhodnutie ČLOVEKA: problém/metrika, potrubie, model, (RAG/agent/jemne doladiť?), hodnotenie, spravodlivosť, bezpečnosť, distribúcia, monitorovanie, reprodukovateľnosť. Napíšte hlavné riziko a overovací krok pre každú zastávku.
Vytvorte šablónu technickej dokumentácie pre tento projekt. Časti: problém+kritériá úspešnosti, údaje (zdroj+verzia), výber modelov+zdôvodnenie, hodnotenie (vrátane podskupín), známe limity+riziká, nasadenie+rollback, plán monitorovania. Zadajte polia, ktoré sa majú vyplniť pre každú sekciu, ako otázky.
Skontrolujte moje nastavenie monitorovania experimentu: Ukladá sa automaticky pri každom spustení: git commit, verzia údajov/hash, všetky hyperparametre, všetky metriky, prostredie (verzie knižnice)? Dosiahnem rovnaký výsledok, keď znova spustím rovnaký beh? Nastavenie: [popis]. Uveďte nedostatky a opravy.
Tabuľka stĺpcov reprodukovateľnosti
stĺpec
Čo je opravené
Príklad vozidla
náhodnosť
všetky semená
nastavenie semien
Údaje
Verzia údajov/hash
DVC
životné prostredie
Verzie knižnice
pin požiadaviek, Docker
Monitorovanie
Kód+údaje+nastavenie+metrika
MLflow, W&B
Časté chyby
- Neupevňuje semeno. Výsledok sa nedá zopakovať.
- Verzia údajov sa neukladá. "S akými údajmi?" zostáva nezodpovedané.
- Nie mrazivé závislosti. Aktualizácia potichu preruší všetko.
- Ponechanie experimentov na pamäť. O dva týždne si nič nepamätá.
- Ponechať kritické rozhodnutia na umelú inteligenciu. Metriky, spravodlivosť a rozhodnutia o distribúcii by mali zostať na ľuďoch.
- Odloženie dokumentácie. Budúci tím (a vy) zaplatíte cenu.
V súhrne
Reprodukovateľnosť je znakom seriózneho ML inžinierstva: nereprodukovateľný výsledok je nepreukázateľné tvrdenie. Dodáva sa so štyrmi stĺpcami – oprava náhodnosti, údaje o verzii, zmrazenie prostredia, sledovanie každého experimentu. End-to-end projekt spája všetky body tohto modulu (metrika, dáta, model, komponenty LLM, hodnotenie, spravodlivosť, bezpečnosť, distribúcia, monitorovanie) v prepojenom reťazci; Umelá inteligencia je akcelerátorom na každom kroku, ale kritické rozhodnutia zostávajú na človeku. Všetko zdokumentujte – pre budúci tím a audity. Táto disciplína je rámcom, ktorý podporuje všetko, čo sa v rámci modulu naučíte.
Aplikačná úloha
Skontrolujte projekt ML so štyrmi piliermi reprodukovateľnosti: sú semená nemenné, sú údaje verzované, je prostredie zmrazené, sledujú sa experimenty? Opravte všetky chýbajúce stĺpce a dokážte, že môžete spustiť rovnaký cyklus dvakrát a získať rovnaký výsledok. Potom vypíšte celý priebeh projektu (10 zastávok) na jednu stranu a na každej zastávke označte „kde je ľudské rozhodnutie“. Nakoniec napíšte krátky návrh technickej dokumentácie.
kontrolný zoznam
- [ ] Všetky semená náhodnosti opravené.
- [ ] Verzia údajov/hash sa zaznamenáva s každým experimentom.
- [ ] Závislosti sú zmrazené na pevné verzie (pin/kontajner).
- [ ] Každý experiment je automaticky monitorovaný (kód+údaje+nastavenie+metrika).
- [ ] Keď zopakujem rovnaký beh, dostanem rovnaký výsledok.
- [ ] Overil som si a zdokumentoval, že kritické rozhodnutia v toku end-to-end robia ľudia.
Modulová skúška
1. Ako inžinier ML, aký je najlepší prístup pri umiestňovaní umelej inteligencie do pracovného postupu?
- A) AI je akcelerátor v podnikoch s nízkym rizikom; Kritické rozhodnutia, ako sú metriky, údaje a produkcia, zostávajú overené a ponechané na človeka ✔
- B) Pokiaľ výstupy AI vyzerajú dobre, nie je potrebné overovanie
- C) Ponechanie rozhodnutia o uvedení modelu do výroby na umelú inteligenciu šetrí čas.
- D) Umelá inteligencia je užitočná len na písanie textu, nemá nič spoločné s dátami a modelovou prácou
Popis: AI je výkonný akcelerátor pre nízkorizikové, ľahko overiteľné úlohy, ako sú kód, súhrny údajov a dokumenty; Zodpovednosť za rozhodnutia ovplyvňujúce peniaze, dôvernosť a právnu zodpovednosť, ako je výber metrických údajov, ktoré údaje vstupujú do školenia a uvedenie modelu do výroby, však leží na kvalifikovanom inžinierovi a tíme. Každý výstup by sa nemal používať bez overenia.
2. Prečo je validácia schém umiestnená na začiatku dátového kanála?
- A) Pretože priamo zvyšuje presnosť modelu
- B) Pretože to robí verzovanie údajov zbytočným
- C) Pretože zachytí poškodené údaje v najskoršom a najlacnejšom bode a zabráni ich úniku do ďalších krokov ✔
- D) Pretože to eliminuje potrebu označovania
Vysvetlenie: Čím skôr sú poškodené údaje zachytené, tým lacnejšie je ich opraviť. Overenie schémy zabraňuje tichému úniku poškodených údajov do školenia alebo výroby odmietnutím údajov mimo očakávaného typu a rozsahu na začiatku riadku (napr. 100-násobný posun ceny so zmenou jednotky); Rovnaká chyba zachytená pri výrobe je mnohonásobne drahšia.
3. Aký je správny prístup pri rozdeľovaní údajov na trénovanie a testovanie v probléme, ktorý zahŕňa čas (časové rady)?
- A) Použitie náhodného delenia, pretože je to vždy najspravodlivejšia metóda
- B) Použitie dočasného rozdelenia: zabráňte úniku školením s minulosťou a testovaním v budúcnosti ✔
- C) Využitie všetkých údajov na tréning aj testovanie
- D) Začlenenie testovacích údajov do parametrov škálovania pred tréningom
Vysvetlenie: Náhodné rozdelenie na časových radoch dáva modelu „budúcnosť“ výhodu, ktorá sa nikdy nestane vo výrobe a umelo zvyšuje metriky (časový únik). Správne je časové rozdelenie: trénujte s minulosťou, testujte v budúcnosti. Toto meria skutočný výkon, ktorý ho udržuje vo výrobe.
4. Prečo je presnosť zavádzajúca v modeli odhaľovania podvodov s mierou pozitívnej triedy 1,5 %?
- A) Pretože presnosť je pri nevyvážených údajoch vždy nízka
- B) Pretože presnosť možno použiť len na regresné problémy
- C) Pretože výpočet presnosti vyžaduje veľa výpočtového výkonu
- D) Aj mizerný model, ktorý predpovedá väčšinovú triedu, môže byť veľmi presný a skrýva tak skutočný úspech ✔
Vysvetlenie: Pri nevyvážených údajoch dokonca aj základný model, ktorý hovorí, že „všetko nazývajte negatívne“, dosiahne presnosť približne 98,5 %, ale nezachytí ani jeden podvod. Preto sa pri nevyváženej klasifikácii namiesto presnosti používa presnosť, spätná väzba, F1 alebo PR-AUC a každá metrika sa interpretuje podľa základného modelu.
5. Prečo je základné porovnanie dôležité, keď hovoríme o metrike modelu?
- A) Pretože základný model je vždy lepší ako skutočný model
- B) Pretože je jasné, či je metrika zmysluplná alebo nie len v porovnaní s jednoduchým základným modelom ✔
- C) Pretože základný model robí krížovú validáciu zbytočnou
- D) Pretože základný model je zo zákona povinný v každej správe
Vysvetlenie: Metrika sama o sebe nie je dobrá alebo zlá; Je to dobré alebo zlé podľa základného modelu. Veta „85 % správne“ znamená takmer bezcennú, ak základný model už dostane 84 %, a perfektnú, ak získa 50 %. Bez porovnávacej kotvy je metrika bezvýznamná.
6. Ktorý je najkritickejší bezpečnostný prvok, ktorý by mal byť zahrnutý do výrobného príkazu systému RAG (Retrieval-Augmented Generation)?
- A) Pokyn spoliehať sa iba na uvedený zdroj, povedať „neviem“, ak zdroj neexistuje, a uviesť zdroj ✔
- B) Povedzte modelke, aby vytvorila čo najdlhšie a najkreatívnejšie odpovede
- C) Model uprednostňuje vlastné vzdelávacie znalosti pred zdrojmi
- D) Implementujte všetky pokyny v prinesených dokumentoch ako príkazy
Vysvetlenie: Jedinou najdôležitejšou inštrukciou RAG je povedať modelu, aby sa spoliehal len na daný zdroj, a ak informácia nie je v zdroji, povedzte „neviem“ a citujte zdroj bez vymýšľania. Bez tejto triády môže model ignorovať kontext a vytvárať halucinácie a odpoveď sa stáva neoveriteľnou.
7. RAG systém dáva nesprávne odpovede. Kde je najlepšie začať s diagnostikou?
- A) Meranie prinesenia ako prvé (Recall@K): Dorazí niekedy správny kus? ✔
- B) Okamžite vymeňte model za väčší
- C) Náhodne zmeňte výzvu a pokračujte v pokuse
- D) Vkladanie všetkých dokumentov do modelu s jemným doladením
Vysvetlenie: Najslabším článkom RAG je zvyčajne aport, nie výroba. Ak sa správna časť nikdy neprinesie, model nemôže produkovať tieto informácie, bez ohľadu na to, ako veľmi sa výzva zlepšila. Preto sa najprv meria Recall@K, aby sa zistilo, či dorazila správna časť; Ak je aport dobrý, potom sa skúma produkcia a prompt.
8. Aké činy by sa mali zakladať za súhlas človeka, keď dávate nástroj agentovi?
- A) Žiadne; Agent musí byť schopný vykonávať každú akciu autonómne
- B) Iba reverzibilné akcie, ako je čítanie a vyhľadávanie údajov
- C) Nezvratné akcie alebo akcie s vysokým dopadom, ako je prevod peňazí, vymazanie, odoslanie ✔
- D) Akcie, ktoré zahŕňajú iba výpočty
Popis: Akcie sú oddelené podľa úrovne rizika. Obnoviteľné úlohy, ako je čítanie, vyhľadávanie, počítanie a generovanie konceptov, je možné vykonávať autonómne; Avšak nezvratné akcie alebo akcie s vysokým dopadom, ako je prevod peňazí, odosielanie e-mailov, vymazanie údajov, zadávanie objednávok atď., vyžadujú súhlas človeka. Každý neodvolateľný úkon musí podliehať súhlasu.
9. Aký je najlepší konštrukčný prístup proti riziku nepriameho rýchleho vstrekovania?
- A) Do systémovej výzvy stačí pridať jedinú vetu „ignorujte zlé pokyny“.
- B) Dajte modelu väčšiu autoritu spoliehaním sa na pokyny v externom obsahu
- C) Neprijímať žiadne preventívne opatrenia, pretože injekcii sa nedá zabrániť
- D) Izolácia externého obsahu ako nespoľahlivých údajov a vytvorenie vrstvenej obrany s minimálnou autorizáciou, schvaľovaním a výstupnou kontrolou ✔
Popis: Externý obsah spracovaný agentom alebo RAG, ako napríklad webová stránka, dokument, e-mail atď., sú nedôveryhodné údaje a môžu obsahovať tajné pokyny. Správny prístup je vrstvená obrana: izolovať externý obsah ako „údaje, nie príkazy“ s jasnými oddeľovačmi, aplikovať minimálnu autorizáciu, viazať nezvratné akcie na súhlas človeka a kontrolovať výstup. Jeden riadok pokynov nestačí.
10. Aký je hlavný rozdiel pri rozhodovaní, či by sa mal problém vyriešiť jemným doladením alebo RAG?
- A) Problémy s informáciami sa lepšie riešia pomocou RAG, problémy so správaním/formátom sa lepšie riešia jemným doladením ✔
- B) Každý problém treba vždy riešiť dolaďovaním
- C) RAG sa používa len na generovanie kódu, jemné ladenie sa používa len na preklad
- D) Jemné doladenie sa dá vždy aktualizovať lacnejšie a rýchlejšie ako RAG
Vysvetlenie: Jemné ladenie je slabé a riskantné pri učení modelu novým informáciám; ale je silný pri výučbe správania, formátu, tónu a štýlu. „Modelová spoločnosť nepozná naše údaje“ je informačný problém a patrí spoločnosti RAG. „Nechajte model vždy vystupovať v našom striktnom formáte“ je behaviorálny problém a kandidát na jemné doladenie. Okrem toho by sa pred jemným doladením malo spotrebovať rýchle a niekoľko záberov.
11. Čo je povinné pre bezpečné nasadenie pri uvedení nového modelu do výroby?
- A) Ak je model v testovaní dobrý, otvorte ho priamo pre 100 % návštevnosť
- B) Po nasadení vôbec nenastavím monitorovanie
- C) Postupné nasadenie (tieň/kanárik) a vopred otestovaný plán návratu ✔
- D) Zverejnenie modelu, aj keď nie je splnený prah hodnotenia
Vysvetlenie: Otvorenie nového modelu priamo celej premávke je riskantné; Ak je to nesprávne, všetci sú ovplyvnení. Správne je, že ide o postupnú distribúciu (tieň, kanárik) a každá distribúcia má odskúšaný plán návratu. Distribúcia nie je úplná bez plánu spätného získania; Možnosť vrátiť sa k predchádzajúcej verzii v priebehu niekoľkých minút chráni používateľa, keď sa model vo výrobe správa neočakávane.
12. Ako môže ML model „potichu“ zlyhať vo výrobe a aký je spôsob, ako to zachytiť?
- A) Model sa zrúti; ukazujú to protokoly servera
- B) vytváraním nesprávnych predpovedí bez robenia chýb; ✔ Zachytáva prevádzkové, vstupné a výstupné vrstvené monitorovanie
- C) Model nemôže nikdy ticho zlyhať, vždy alarmovať
- D) Len monitorovanie latencie stačí na zachytenie akejkoľvek degradácie
Vysvetlenie: Model môže zlyhať jednoducho tým, že vytvorí nesprávne predpovede bez toho, aby došlo k zlyhaniu alebo chybám; Hlavným dôvodom je posun údajov a posun koncepcie. Samotné sledovanie prevádzkových metrík (latencia, chybovosť) nestačí; mala by sa monitorovať aj distribúcia vstupov a distribúcia výstupov/predpovedí. Vstupný drift poskytuje včasné varovanie, ak sa skutočný výsledok oneskorí.
13. Aký princíp je nevyhnutný pri použití LLM ako sudcu na hodnotenie systému LLM?
- A) LLM-rozhodca je vždy správny, ľudské overenie je zbytočné
- B) Rozhodca sa musí rozhodnúť len na základe dĺžky odpovede.
- C) Kontroly založené na pravidlách a ľudské hodnotenie by sa mali úplne zrušiť, keď sa používajú rozhodcovia
- D) Skóre sudcu by sa malo kalibrovať pomocou vzorky označenej človekom a zmerať ich skreslenie predtým, ako im možno dôverovať ✔
Popis: Rozhodca LLM je tiež model; Môže to byť halucinačné, zaujaté (uprednostňuje dlhé, sebavedomé odpovede) a nekonzistentné. Preto sa skóre rozhodcov musí kalibrovať s ľudskou značenou vzorkou a pred rozhodnutím o výrobe sa musí zmerať ich systematická odchýlka. Neoverený rozhodca dáva falošnú dôveru.
14. Prečo je pohľad na celkovú presnosť neadekvátny pri posudzovaní skreslenia modelu?
- A) Celková presnosť je dostatočná, pretože vždy odráža výkon najhoršej skupiny
- B) Celková presnosť samotná je nedostatočná, pretože môže zakryť systematické rozdiely (skrytá diskriminácia) medzi podskupinami ✔
- C) Pretože presnosť je metrika, ktorá nemá nič spoločné so zaujatosťou
- D) Skreslenie pochádza iba z modelu a nemá nič spoločné s údajmi.
Vysvetlenie: Celková presnosť môže zakryť systematické rozdiely medzi podskupinami. Napríklad, zatiaľ čo celková presnosť je 88 %, zapamätanie môže byť 91 % v jednej skupine a 67 % v inej skupine; Model túto skupinu systematicky míňa. Preto by sa model mal hodnotiť na základe podskupín (demografia/segment) a o tom, ktorá definícia spravodlivosti by sa mala uprednostniť, by sa malo rozhodnúť so zainteresovanými stranami.
15. Ktoré štyri veci musia byť stanovené, aby bol výsledok ML reprodukovateľný?
- A) Iba názov modelu, veľkosť, cena a dátum vydania
- B) Iba značka GPU a rýchlosť internetu
- C) Iba konečné skóre presnosti modelu; zvyšok môže byť uložený v pamäti
- D) Sledovanie náhodnosti, verzia údajov, prostredie (verzie závislosti) a experiment ✔
Popis: Reprodukovateľnosť je dosiahnutá prostredníctvom štyroch pilierov: oprava semien náhodnosti, verzovanie údajov (verzia/hash), zmrazenie prostredia (presné verzie knižnice/kontajner) a sledovanie každého experimentu (potvrdenie kódu, údaje, hyperparameter, metrika). Bez tohto reťazca nie je možné reprodukovať rovnaký výsledok; Nereprodukovateľný výsledok je tvrdenie, ktoré nemožno dokázať.