zisky:
- Schopnost porozumět fázím MLOps (vydání, nasazení, monitorování, přeškolení, vrácení zpět) a modelovat drift a plánovat monitorované nasazení
- Schopnost aplikovat principy modelové spravedlnosti, transparentnosti a odpovědnosti a odlišit statistickou přesnost od etické přijatelnosti
- Schopnost chránit osobní údaje podle zásad KVKK/GDPR a přidělit konečnou odpovědnost člověku v rozhodnutích s velkým dopadem
Výcvik modelky a získání vysokého skóre není konec, ale střed. Skutečná hodnota přichází, když je model uveden do výroby a funguje spolehlivě, je průběžně sledován bez poškození a celý proces probíhá v rámci etických a právních hranic. Tato závěrečná část kombinuje tři témata: MLOps (disciplína uvádění do provozu, monitorování a udržování modelů), etika (férovost, transparentnost, neškodlivost) a soukromí (ochrana osobních údajů). AI vytváří kód, kontrolní seznamy a plány v těchto oblastech; Ale lidé rozhodují, zda bude model spuštěn, kdo bude ovlivněn a jaká data lze použít. Tato rozhodnutí nejsou technická, ale rozhodnutí o odpovědnosti.
MLOps: model žije jako produkt
MLOps (Machine Learning Operations – praxe spouštění, monitorování a aktualizace modelů strojového učení ve výrobě) je adaptací DevOps ve vývoji softwaru na datovou vědu. Základní myšlenka: model není pilník, který se jednou vycvičí a zapomene, ale živý produkt, který vyžaduje neustálou údržbu. Hlavní fáze:
1. Verze: Kód (Git), data a model jsou verzovány společně; Zaznamenává se, který model byl vyroben s jakými daty a kódem.
2. Nasazení: Model je uveden do provozu jako API nebo dávková úloha. Obvykle se dává nejprve malému publiku (distribuce stín/kanár).
3. Monitorování: Výkon modelu a vstupní data jsou neustále monitorovány.
4. Přeškolení: Když výkon klesne, model se přeškolí s aktualizovanými daty.
Posun vzoru: tiché zkreslení
Největší nebezpečí ve výrobě představuje modelový drift (modelový drift / datový drift). Svět se mění; Podmínky, za kterých jste svůj model trénovali (chování zákazníků, ceny, sezóna, legislativa), se časem mění a model začíná zastarávat. Například model poptávky trénovaný před pandemií je během pandemie zcela nesprávný. Drift se vyskytuje ve dvou formách: datový drift (distribuce změn vstupních dat) a koncept drift (vztah mezi vstupními a cílovými změnami). Způsob, jak je zachytit, je monitorování: neustále sledujte rozložení vstupů, rozložení předpovědí a (pokud je to možné) výkon v porovnání se skutečným výsledkem.
Pozor: Model uvedený do výroby se sám o sobě znehodnotí; Není to otázka „jestli“, ale „kdy“. Nasazování modelů bez nastavení monitorování je jako řízení auta, aniž byste kdy ovládali jeho motor; Jednoho dne tam jen tiše sedí a vy si toho nevšimnete.
prvek MLOps
Účel
Pokud se zanedbá
Verzování
Vědět, co se vyrábí
Nereprodukovatelné, nesledovatelné
Sledování
Vidět skluz brzy
Model se tiše rozpadá
rekvalifikace
zůstat v obraze
Předpovědi stárnou
Vrátit zpět
vrátit se ke špatnému modelu
Vadný model zůstává aktivní
Dokumentace
transparentnost, obrat
Informace uvíznou v jedné osobě
Etika: modelová rozhodnutí ovlivňují lidi
Datové modely se stále častěji používají při rozhodováních, která ovlivňují životy lidí: úvěr, najímání, pojištění, spravedlnost. S touto mocí přichází zodpovědnost. Hlavní etická rizika:
Předpojatost a diskriminace: Model se může učit a udržovat nespravedlnosti v historických datech. Pokud byla určité skupině v minulosti připisována menší zásluha, model předpokládá, že jde o „pravidlo“ a automatizuje diskriminaci. Proto je nezbytná analýza spravedlnosti — kontrola, zda model funguje podobně pro různé skupiny (pohlaví, věk, region).
Transparentnost a vysvětlitelnost: Měli byste být schopni vysvětlit, proč model odmítl osobu. „Černá skříňka to řekla“ je eticky a často právně nepřijatelné. Proto jsou cenné nástroje vysvětlitelnosti (důležitost funkce, hodnoty SHAP).
Odpovědnost: Kdo je odpovědný za to, že se model rozhodne špatně? Odpovědí je vždy osoba/instituce, nikoli model. Lidský dohled (human-in-the-loop — člověk schvalující konečné rozhodnutí) by měl být zachován v rozhodnutích s velkým dopadem.
Pozor: Model může být statisticky „správný“, ale eticky nepřijatelný. Vysoce přesný model, který systematicky znevýhodňuje jednu skupinu, není dobrý model. Upřímnost nemůže nahradit spravedlnost.
Soukromí: osobní údaje jsou pečlivě chráněny
Surovinou datové vědy jsou často osobní údaje a tato data jsou chráněna zákonem: KVKK in Türkiye, GDPR v Evropě. Základními principy jsou: omezení účelu (údaje nejsou používány pro jiné účely, než pro jaký byly shromážděny), minimalizace údajů (nesbírá se/neuchovává se více údajů, než je nutné), anonymizace (identifikační informace jsou odstraněny) a bezpečnost (data jsou uchovávána zašifrována a přístup je omezen). Zásadní pravidlo při práci s nástroji AI: nikdy nevkládejte skutečné osobní údaje do veřejného nástroje AI. K analýze většinou stačí diagram a anonymní/syntetický vzorek.
Další důraz v souvislosti s bezpečností informací: používejte nástroje a techniky datové vědy pouze na data a systémy, pro které máte oprávnění, pro účely obranné a legitimní analýzy. Neoprávněný přístup k cizím údajům, zpětná identifikace osob (vytěžování identity z anonymních údajů) nebo neoprávněné profilování je nezákonné i neetické.
tři mini pouzdra
Případ 1 – Nesledovaný kolaps. Společnost zabývající se elektronickým obchodováním uvedla do provozu svůj model doporučení a nenastavila sledování. Po 4 měsících se produktový katalog výrazně změnil; model nadále doporučoval zastaralé produkty a konverzní poměr tiše klesl o 30 %. Celé měsíce si toho nikdo nevšiml. Ponaučení: nasazení bez monitorování se stává slepým.
Případ 2 – Skrytá diskriminace. Model náborového screeningu se dozvěděl o genderové nerovnováze v historických datech a systematicky podceňoval kandidátky. Nebylo to zaznamenáno, protože neexistovala žádná analýza spravedlnosti; Bylo to odhaleno při auditu a instituce čelila vážnému reputačnímu/právnímu riziku. Ponaučení: skupinová kontrola spravedlnosti je zásadní v modelech s vysokým dopadem.
Případ 3 – Porušení důvěrnosti. Jeden analytik nahrál soubor obsahující skutečné e-maily zákazníků a historii nákupů do veřejného nástroje AI a řekl: „Shrňte segmenty“. Osobní údaje opustily instituci; Proces KVKK byl zahájen. Správným způsobem bylo odstranit pole identity a sdílet pouze anonymní vlastnosti. Poučení: skutečná osobní data nevstupují do otevřeného nástroje.
Čtyři kopírovatelné šablony
1) Kontrolní seznam před nasazením:
Vaše role: konzultant MLOps. Vyjmenujte věci, které musím zkontrolovat před uvedením modelu do výroby: verzování, metriky monitorování, plán vrácení, prahová hodnota výkonu, upozornění na posun dat, odpovědná osoba. Ke každé položce přidejte vysvětlení „proč na tom záleží“ jednou větou. rozhodnu se.
2) Návrh sledování řazení modelu:
Navrhněte plán sledování posunu pro klasifikační model ve výrobě: (1) jaké rozdělení vstupů bych měl sledovat, (2) jaký alarm pro rozdělení předpovědí, (3) jak porovnávat výkon, když se dostaví skutečný výsledek, (4) při jaké prahové hodnotě by se mělo spustit přeškolení. Poskytněte také kostru kódu.
3) Kontrola spravedlnosti:
Napište kód, který porovná výkon mého modelu pro různé skupiny (např. věková skupina, region): zapamatování/přesnost a míra pozitivních rozhodnutí pro každou skupinu. Upozorněte, pokud je mezi skupinami významný rozdíl. Vytváření kauzálních/politických interpretací; Ukažte mi rozdíly a já zvážím rozhodnutí.
4) Předběžná kontrola soukromí:
Před poskytnutím údajů nástroji umělé inteligence zkontrolujte, zda jsou v seznamu sloupců níže uvedeny osobní/identitní údaje (jméno, e-mail, ID, telefon, adresa, IP)? Pokud ano, uveďte, které z nich by měly být odstraněny nebo anonymizovány. Sloupce: [seznam]. Účel: sdílet pouze anonymní schéma.
Slabá výzva / Silná výzva
Slabá výzva:
Můj model je připraven, pusťte se do vysílání.
Nasazení není jediným krokem; Živé vysílání bez monitorování, vrácení zpět, spravedlnosti a kontroly soukromí je tichou pozvánkou ke katastrofě.
Výkonná výzva:
Vaše role: zodpovědný konzultant MLOps. Můj model byl vycvičený, chci se před spuštěním plně připravit. Vygenerujte: (1) kontrolní seznam před nasazením, (2) plán monitorování posunu, (3) skupinový kontrolní kód spravedlivosti, (4) kontrolu soukromí (jsou tam osobní údaje). Navrhněte také, jak chránit lidský souhlas v rozhodnutích s velkým dopadem. Konečná rozhodnutí jsou na mně.
Distribuce, monitorování, spravedlnost a soukromí jsou zde považovány za jeden odpovědný proces.
Časté chyby
- Nasazení modelu bez nastavení monitorování. Model tiše klouže a deformuje se; Může trvat měsíce, než si to všimnete.
- Obcházení justiční kontroly. Vysoce věrný model může skupinu systematicky znevýhodňovat.
- Učinit nevysvětlitelné rozhodnutí černé skříňky. Rozhodnutí s velkým dopadem musí být vysvětlitelná; "Model to řekl" nestačí.
- Poskytování skutečných osobních údajů pro otevření nástroje AI. Porušení KVKK/GDPR; Schéma a anonymní příklad jsou dostačující.
- Delegování rozhodnutí na modelku. Odpovědnost je vždy na člověku; Je zachován vysoký dopad lidského dohledu.
Tip: Než začnete s každým modelem žít, položte nahlas jednu otázku: „Pokud se tento model zítra tiše rozbije nebo nespravedlivě penalizuje skupinu, jak si toho všimnu a vrátím zpět?“ Pokud na tuto otázku nemáte jasnou odpověď, model ještě není připraven k výrobě.
V souhrnu
Práce modelky nekončí vysokým skóre, ale spolehlivou a zodpovědnou prací ve výrobě. MLOps je disciplína živého vysílání, monitorování driftu, přeškolování a vracení modelu zpět; Nasazení bez sledování je tichý kolaps. Etika vyžaduje spravedlnost, transparentnost a odpovědnost modelu; statistická přesnost není náhradou za etickou přijatelnost. Soukromí znamená ochranu osobních údajů podle zásad KVKK/GDPR a uchovávání skutečných dat mimo otevřené nástroje. Všechna tato rozhodnutí nejsou technická, ale rozhodnutí o odpovědnosti a vždy patří člověku.
Aplikační úkol
Představte si to, jako byste se chystali uvést model, který jste vytvořili (nebo hypotetický) do výroby, a vyplnit čtyři seznamy: (1) kontrolní seznam před nasazením, (2) metriky posunu, které budete sledovat, (3) skupinový plán kontroly spravedlnosti, (4) kontrola soukromí. Pak napište konkrétní odpověď na otázku "Jak si všimnu, když se to zítra tiše rozbije a dostanu to zpět?"
kontrolní seznam
- [ ] Nasazuji model s plánem monitorování (upozornění na skluz) a vrácení?
- [ ] Zkontroloval jsem rozdíl mezi spravedlností a výkonem u různých skupin?
- [ ] Zachoval jsem člověka ve smyčce při rozhodování s velkým dopadem?
- [ ] Chránil jsem osobní údaje podle zásad KVKK/GDPR a držel jsem je mimo otevřené nástroje?
- [ ] Dal jsem konečnou odpovědnost na člověka, ne na model?
Modulová zkouška
1. Datový vědec se ptá umělé inteligence: "Jak přesný je náhodný les na těchto datech?" aniž by model vůbec trénoval, a přímo vloží do prezentace odpověď „89 %“. Jaká je zásadní chyba tohoto přístupu?
- A) Čekání na metriky bez poskytování dat a modelů umělé inteligenci; Ignorování toho, že číslo, které produkuje, je falešné a že skutečnou metriku lze zjistit pouze školením a testováním ✔
- B) Musí použít logistickou regresi místo náhodného lesa
- C) Míra přesnosti musí být vždy vyšší než 90 %.
- D) Je přísně zakázáno vkládat do prezentace metriky
Vysvětlení: Umělá inteligence nemůže vytvořit metriku bez přístupu k modelu a datům; Číslo, které uvádí, je halucinace (vymyšlená). Metrika je získána vlastním výpočtem datového vědce až poté, co byl model skutečně vyškolen a otestován. Neověřený výstup je jako nepodepsaný report.
2. Sloupec „důvod pro uzavření účtu“ je zahrnut při shromažďování údajů pro prognózu odchodu; Tento sloupec se vyplní až po odchodu zákazníka. Model dává 97% na testovací sadě, ale ve výrobě nefunguje. Jaký je název a příčina tohoto stavu?
- A) Overlearning; Model je příliš složitý
- B) Únik dat; ✔ Použití informací, které nebudou k dispozici v době predikce, ale jsou výsledkem cíle, jako funkce
- C) Nedostatečné učení; Model je příliš jednoduchý
- D) výběrové zkreslení; malá velikost vzorku
Vysvětlení: Toto je klasický únik dat: „důvod uzavření“ je výsledkem cíle a v době predikce je stále prázdný. Model dělá trik s těmito budoucími znalostmi, vypadá skvěle na testovací sadě, ale ve výrobě se zhroutí, protože sloupec je prázdný. U každého sloupce by měla být položena otázka „mám to v době predikce“.
3. Analytik doplní chybějící hodnoty ve sloupci příjmů průměrem; ale chybějící lidé ve skutečnosti patří do nízkopříjmového segmentu, který nikdy nepřiznal příjem (systematické chybějící). Proč je tato výplň nesprávná?
- A) Průměr je vždy větší než medián, takže je nesprávný
- B) Chybějící hodnoty nikdy nevyplňujte, vždy je smažte
- C) Vyplnění systematické mezery průměrem zkresluje data umělým zastoupením této skupiny; Plnění bylo provedeno bez položení otázky 'proč je prázdný?' ✔
- D) Výpočet průměru vytváří problém s výkonem, protože je příliš pomalý
Vysvětlení: Příčina nedostatku určuje řešení. Když se systematické chybějící (mezera soustředěná v určité skupině) zaplní průměrem, stane se tato skupina uměle „průměrným příjmem“ a data jsou zkreslena. Před vyplněním je třeba položit otázku „proč je prázdný“; systematický/významně chybějící průměr by neměl být vyplněn.
4. Tým najde 0,78 korelaci mezi „výdaji na reklamu“ a „prodejem“ a zdvojnásobí rozpočet; Co však ve skutečnosti spouští obojí, jsou sezónní kampaně. Jaký princip ve statistice vysvětluje tuto chybu?
- A) Korelace není kauzalita; Skrytá třetí proměnná může ovlivňovat obě proměnné ✔
- B) Protože korelace 0,78 je příliš nízká, vztah by měl být ignorován
- C) Korelace vždy dokazuje kauzalitu, tým to pochopil správně
- D) Souvislost mezi reklamou a prodejem nelze vypočítat matematicky.
Vysvětlení: Korelace není kauzalita. Tyto dvě proměnné mohou působit společně, protože je obě ovlivňuje skrytá třetí proměnná (zde sezónní kampaně). Závěr, že jedno způsobuje druhé, lze stanovit pouze experimentem a znalostmi v terénu; Samotný počet korelací není důkazem kauzality.
5. Model detekce podvodů vykazuje 99,2% přesnost a tým slaví; Míra falešných transakcí v datech je však pouze 0,8 % a odvolání modelu je 6 %. Co ukazuje tato tabulka?
- A) Model je dokonalý, protože přesnost je více než 99%
- B) Přesnost je zavádějící s nevyváženými údaji; Model postrádá téměř všechny padělky (nízká vyvolávatelnost), je třeba se podívat na vhodnou metriku ✔
- C) Není žádný problém, protože stažení modelu je vysoké
- D) Nebylo potřeba stavět model, protože míra falešných byla nízká
Vysvětlení: 'Přesnost' je v nevyvážených datech zavádějící. Když model nazývá téměř každou transakci „čistou“, získá vysokou přesnost, protože padělků je velmi málo, ale nepodaří se mu zachytit padělky, což je jeho hlavní účel (připomeňme 6 %). Proto u nevyvážených problémů není kladen důraz na přesnost, ale na matici zmatků a metriky vhodné pro účel dané úlohy, jako je vyvolání/přesnost.
6. V projektu prognózování poptávky jsou časově závislá data náhodně rozdělena do školení/testování. Model dává 93% přesnost, ale ve výrobě havaruje. Jaký by měl být správný přístup k rozdělení?
- A) Zvětšení testovací sady např. rozdělení 50%/50%
- B) Použití složitějšího modelu
- C) Úplně odstraňte oddíl a trénujte se všemi daty
- D) Chronologické rozdělení: trénování se starým obdobím a testování s novým obdobím, čímž se zabrání tomu, aby model viděl budoucnost ✔
Vysvětlení: Pokud se provádí náhodné dělení v datech časové řady, model vidí budoucnost a předpovídá minulost v tréninku; je to únik a produkuje úspěch, který ve skutečnosti neexistuje. Správným přístupem je chronologické dělení: trénování se starým obdobím a testování s novým obdobím, napodobování skutečné situace ve výrobě (předpovídání z minulosti do budoucnosti).
7. Z jakých dat by měly být parametry škálování (StandardScaler) počítány v inženýrství prvků a jak by měly být aplikovány?
- A) Mělo by se to vypočítat ze všech dat (trénink + testování dohromady), aby to bylo přesnější
- B) Mělo by se vypočítat samostatně pro každý řádek z vlastní hodnoty tohoto řádku
- C) Mělo by být vypočítáno pouze ze zkušebních dat
- D) Mělo by být vypočítáno pouze z tréninkových dat, poté by měly být stejné parametry aplikovány na testovací data; jinak vyteče ✔
Vysvětlení: Parametry všech transformací (průměr, směrodatná odchylka atd.), jako je škálování, kódování a výplň, by se měly naučit pouze z trénovacích dat, poté by se totéž mělo aplikovat na testovací data. Zohlednění testovacích dat také způsobuje, že testovací informace narušují trénink, to znamená úniky, a model vypadá lépe, než je. Použití Pipeline to zajišťuje.
8. Model poskytuje 98% přesnost na tréninkové sadě a 72% přesnost na testovací sadě. Co tento příznak naznačuje a co je třeba udělat?
- A) Nedostatečné učení; model by měl být složitější
- B) Únik dat; testovací sada musí být změněna
- C) Přemontování; model by měl být zjednodušen, měla by být použita regularizace a křížová validace ✔
- D) normální situace; Vzdělávací skóre je každopádně vždy vyšší, opatření jsou zbytečná
Vysvětlení: Velmi vysoké skóre v tréninku a výrazně nízké skóre v testování je klasickým příznakem nadměrného vybavení: model si zapamatoval spíše šum tréninkových dat než skutečný vzor. Řešení zahrnují zjednodušení modelu, více dat, regularizaci a ověřování stavu pomocí křížové validace. Spoléhat se pouze na skóre vzdělání toto úskalí skrývá.
9. V prezentaci managementu je osa y sloupcového grafu, ve kterém nárůst prodeje z 1 000 na 1 020 začíná na 980, aby se nárůst zdál obrovský. Skutečný nárůst je 2 %. Proč je to etický problém?
- A) Zkrácená osa y vizuálně zveličuje malý rozdíl a uvádí diváka v omyl; Pro spravedlnost by osa ve srovnávacích sloupcích měla začínat od 0 ✔
- B) Sloupcové grafy nelze nikdy použít pro údaje o prodeji
- C) Není problém; Vždy je dobré, aby graf vypadal působivě
- D) Osa Y by měla vždy začínat od největší hodnoty dat
Vysvětlení: Ve sloupcových grafech pro účely srovnání by osa y obecně měla začínat na 0. Oříznutí osy a začátek na 980 způsobí, že malý 2% rozdíl se zdá vizuálně obrovský a klame diváka. Etickou odpovědností datového profesionála je kreslit poctivé grafy, které nepřeceňují ani nepodceňují data.
10. Analytik zjistí celkový obrat 3x po PŘIPOJENÍ objednávek s tabulkou produktů; Počet linek se zvýšil z 240 tisíc na 690 tisíc. Co by se mělo udělat, aby se zabránilo této tiché chybě?
- A) Vydělte celkový obrat 3
- B) Vždy používejte samostatné dotazy místo JOIN
- C) Úplné smazání tabulky produktů
- D) Kontrola počtu řádků po sloučení/JOIN a ověření, že jsou spojeny pomocí správného klíče; Včasné zachycení replikace ✔
Vysvětlení: Pokud je v tabulce produktů více řádků pro každý produkt (například jiné barvy), JOIN pomocí špatného klíče zduplikuje každou objednávku a zvýší celkové součty. Kód běží bez chyb, ale výsledek je špatný. Způsob, jak se tomu vyhnout, je zkontrolovat počet řádků po každém sloučení/JOIN a sloučit se správným klíčem.
11. Model náborového screeningu se dozvídá o genderové nerovnováze v historických datech a systematicky podhodnocuje kandidátky, ale jeho celková přesnost je vysoká. Co to znamená?
- A) Není problém, protože model má vysokou přesnost
- B) Statistická přesnost nenahrazuje etickou přijatelnost; model se dozvěděl o diskriminaci v minulosti, je vyžadována skupinová kontrola spravedlivosti ✔
- C) Další zvyšování přesnosti modelu problém řeší
- D) Spravedlnost je mimo rozsah datové vědy
Vysvětlení: I když je model statisticky správný, může být eticky nepřijatelný. Model se učí nespravedlnosti v minulých datech a automatizuje diskriminaci. Vysoká integrita není náhradou za spravedlnost; V modelech s velkým dopadem je kontrola spravedlnosti, která měří rozdíl mezi výkonem/rozhodnutím pro různé skupiny, zásadní a konečná odpovědnost spočívá na člověku.
12. Zaměstnanec nahraje soubor obsahující skutečné e-maily zákazníků a historii nákupů do veřejného nástroje umělé inteligence a řekne „shrnout segmenty“. Proč je to vážná chyba a jaká je správná cesta?
- A) Není žádný problém; Nástroje AI nikdy neukládají data
- B) Chyba je, že soubor je příliš velký; měla být snížena
- C) Poskytování skutečných osobních údajů otevřenému nástroji je porušením KVKK/GDPR; pole identity by měla být odstraněna a sdíleno pouze anonymní schéma/vlastnost ✔
- D) Místo Excelu měl být použit CSV
Vysvětlení: Když jsou veřejně dostupnému nástroji umělé inteligence předány skutečné osobní údaje (jako je e-mail, jméno atd.), dojde k porušení soukromí v rámci KVKK / GDPR; data opustí organizaci. K analýze většinou stačí diagram a anonymní/syntetický vzorek. Správným způsobem je odebrat pole identity a sdílet pouze anonymní vlastnosti.
13. Do výroby je uveden model doporučení, ale není zavedeno sledování; Když se produktový katalog po 4 měsících změní, model nadále doporučuje staré produkty a míra konverze tiše klesne o 30 %. Jak se tento fenomén jmenuje?
- A) Overlearning; Model si zapamatuje tréninkovou sestavu
- B) drift modelu; Jak se svět mění, model zastarává tiše, bez povšimnutí, protože není zavedeno monitorování ✔
- C) zkreslení výběru; zkreslení vzorku
- D) Porušení minimalizace dat
Vysvětlení: Toto je drift modelu (posun modelu/dat): když se svět změní (katalog, chování, roční období), podmínky, za kterých byl model trénován, se posunou a model se tiše rozpadne. Model uvedený do výroby se sám o sobě kazí; Jde o to „kdy“. Nasazení bez monitorování (sledování vstupu a výkonu) znemožňuje detekci degradace.
14. Model, který získá 88% přesnost v jednom tréninku/testu, má 5násobné skóre křížové validace 88%, 71%, 83%, 64%, 79%. Co to znamená a proč je křížová validace důležitá?
- A) Model je stabilní; 88% je skutečný výkon
- B) Křížové ověření není nutné; Jedna přihrádka stačí
- C) Velká volatilita skóre naznačuje, že model je nestabilní; křížová validace zakládá výkon na průměru a rozložení více přihrádek, ani jedné šťastné přihrádky ✔
- D) Nejlepší je nahlásit nejvyšší skóre (88 %)
Vysvětlení: Jediný oddíl může být šťastný nebo nešťastný; 88 % bylo jen výsledkem toho snadného dělení. Křížová validace rozděluje data vícekrát, přičemž výkon je založen na průměru (zde ~77 %) a ukazuje volatilitu skóre. Vysoká volatilita zde naznačuje, že model je nestabilní; Spoléhat se na jeden oddíl je zavádějící.