Fitimet:
- Aftësia për të siguruar riprodhueshmëri me katër shtylla (fiksimi i farës, versioni i të dhënave, ngrirja e mediave, monitorimi i eksperimentit) dhe për të prodhuar të njëjtin rezultat kur përsëritet i njëjti ekzekutim
- Aftësia për të kombinuar të gjitha pikat e modulit (metrika, të dhënat, modeli, komponentët LLM, evali, drejtësia, siguria, shpërndarja, monitorimi) në një zinxhir nga fundi në fund
- Aftësia për të verifikuar që vendimi kritik mbetet me njeriun në çdo ndalesë dhe të dokumentojë projektin në një mënyrë të auditueshme
Dështimi më tinëzar i një projekti ML nuk është një përplasje; “Të mos marrim përsëri të njëjtin rezultat”. Nëse nuk mund të riprodhoni rezultatin sot të modelit që keni vënë në prodhim tre muaj më parë, ju nuk e kontrolloni vërtet atë model. Në këtë njësi mbyllëse, ne thellojmë riprodhueshmërinë: aftësinë për të marrë në mënyrë të besueshme të njëjtin rezultat me të njëjtat inpute dhe për të kombinuar të gjithë modulin në një disiplinë projekti nga fundi në fund.
Pse riprodhueshmëria është e vështirë
Në softuerin e zakonshëm, i njëjti kod jep të njëjtin rezultat. Në ML ka shumë më tepër variabla që përcaktojnë rezultatin:
- Rastësia: Përzierja e të dhënave, inicializimi i peshës, ndarja e të dhënave - të gjitha mbështeten në rastësi.
- Të dhënat: I njëjti kod prodhon modele të ndryshme me versione të ndryshme të të dhënave.
- Mjedisi: Versionet e bibliotekës, hardueri (CPU/GPU), madje edhe sistemi operativ mund të ndryshojnë rezultatin.
- Rasti i fshehur: Një hiperparametër i paruajtur, një hap parapërpunimi manual, një përzgjedhje e pashënuar.
Riprodhueshmëria nuk është një "mirë për të pasur", por një imperativ shkencor dhe inxhinierik. Një rezultat që nuk mund të riprodhohet është një pretendim që nuk mund të provohet.
Katër shtylla të riprodhueshmërisë
1. Rregulloni rastësinë. Vendosni të gjitha farat e rastësishme në një vend: ndarjen e të dhënave, inicializimin e modelit, përzierjen e të dhënave. Fara fikse është baza e garancisë "të njëjtin rezultat kur përsëritni të njëjtin drejtim".
2. Versioni i të dhënave. Regjistroni se me cilin version të të dhënave është kryer secili eksperiment (versionimi i të dhënave në njësinë 2). "Të dhënat e fundit" janë të paqarta; "Versioni i të dhënave v3, hash abc123" është i saktë.
3. Ngrijeni mediumin. Vendosni të gjitha varësitë në versionet e tyre të sakta (p.sh. versionet e sakta si numpy==1.26.4 në kërkesat.txt ose një imazh kontejneri). "Versioni më i fundit" do të thyejë gjithçka një ditë.
4. Gjurmo gjithçka (ndjekja e eksperimentit). Ruani automatikisht për çdo eksperiment: versionin e kodit (git commit), versionin e të dhënave, të gjithë hiperparametrat, metrikat dhe strukturat e daljes. Mjetet e gjurmimit të eksperimentit si MLflow, Weights & Biases e bëjnë këtë në mënyrë sistematike. Pa regjistrim, pyetja "cili cilësim ishte më i mirë" mbetet pa përgjigje.
Kujdes: "Do ta mbaj mend më vonë" është gabimi më i shtrenjtë. Dy javë më vonë nuk do të mbani mend se cilën farë, cilat të dhëna, cilin hiperparametër keni përdorur. Gjurmimi automatik eliminon mbështetjen në memorie.
Qasje e dobët / Qasje e fortë
I dobët: "Kam gjetur modelin më të mirë, është në fletore, mendoj se rezultati i tij ishte 89%.
Strong: "Ekzekutoni #147 në mjetin e gjurmimit të eksperimentit: git commit a3f9c, versioni i të dhënave v3 (hash abc123), seed 42, të gjithë hiperparametrat e regjistruar, testoni PR-AUC 0.887. Kur ekzekutoj përsëri të njëjtën komandë, marr të njëjtin rezultat pak nga pak. Modeli varet nga ky ekzekutim i modelit."
Dallimi: në qasjen e fortë rezultati nuk bazohet në një memorie, por në një zinxhir të fiksuar dhe të monitoruar. Të gjithë mund të japin të njëjtin rezultat çdo herë.
Projekti nga fundi në fund: kombinimi i modulit
Tani le të kombinojmë të gjithë modulin në një rrjedhë të vetme projekti. Një sistem i vërtetë ML kalon nëpër këto ndalesa dhe çdo ndalesë bazohet në atë të mëparshmen:
- Përkufizimi i problemit: Çfarë po zgjidhim, si të masim suksesin (njësia 3: metrika e duhur, konteksti i biznesit). Metrika dhe pragu janë të qarta që në fillim.
- Pika e të dhënave: Mbledhja, vlefshmëria, pastrimi, ndarja pa rrjedhje, versionimi (njësia 2).
- Zhvillimi i modelit: Trajnimi, krahasimi bazë, verifikimi i kryqëzuar, fara e fortë (njësia 3 + kjo njësi).
- Komponentët LLM (nëse aplikohet): RAG (njësia 4) dhe/ose agjentët (njësia 5); rregullimi i imët nëse është e nevojshme (njësia 6).
- Vlerësimi: grupi vlerësues me kuti të skajeve dhe sigurisë, eval me shumë shtresa në sistemet LLM (njësia 8).
- Auditimi i drejtësisë dhe etikës: Analiza e nëngrupit, modeli i kartës, shpjegueshmëria (njësia 10).
- Auditimi i sigurisë: Injeksion i menjëhershëm, privatësi, zinxhir furnizimi (njësia 9).
- Shpërndarja: Paketimi, shpërndarja graduale, rikthimi, regjistri i modelit (njësia 7).
- Monitorimi: Monitorimi me tre shtresa, alarmet e lëvizjes (njësia 8).
- Riprodhueshmëria: Seed, versioni i të dhënave, media dhe gjurmimi i eksperimentit në të gjithë zinxhirin (këtë njësi).
Në këtë rrjedhë, AI është një përshpejtues dhe gjenerues i planit në çdo ndalesë; por përzgjedhja metrike, vendimet e të dhënave, prioritizimi i drejtësisë, pragu i vendosjes dhe miratimi i lëshimit - vendimet kritike mbeten me njeriun. Ky është thelbi i modulit.
Dokumentacioni: e ardhmja do t'ju falënderojë
Një projekt i mirë ML dokumenton vetë. Së paku, duhet të shkruhen sa më poshtë: problemi dhe kriteret e suksesit, burimi dhe versioni i të dhënave, përzgjedhjet dhe arsyetimet e modeleve, rezultatet e vlerësimit (përfshirë nëngrupet), kufijtë dhe rreziqet e njohura, procedura e vendosjes dhe rikthimit, plani i monitorimit. Ky dokument është miku më i mirë i personit (ndoshta jeni ju) që kthehet në projekt pas gjashtë muajsh.
tre mini kuti
Rasti 1 - Rezultati i humbur. Një inxhinier trajnoi një model të shkëlqyer, por ai nuk e rregulloi farën dhe nuk e ruajti versionin e të dhënave. Kur ai u largua nga puna, askush nuk mund ta riprodhonte atë rezultat; modeli u bë një "legjendë e kutisë së zezë" dhe u ndërtua përfundimisht nga e para. Javët kaluan kot. Mësimi: një rezultat jo i riprodhueshëm është një rezultat joekzistent.
Rasti 2 - Kolapsi i mjedisit. Një ekip nuk i kishte rregulluar varësitë. Kur një bibliotekë përditësohej automatikisht, rezultatet e modelit ndryshuan në heshtje dhe prodhimi u ndërpre. U deshën ditë për të gjetur problemin. Kur varësitë u ngrinë dhe u kontejneruan me versionet përfundimtare, problemi nuk u shfaq më. Mësimi: ngrini mjedisin.
Rasti 3 - Fuqia e monitorimit. Një ekip monitoroi automatikisht çdo eksperiment. Tre muaj më vonë, gjatë një auditimi rregullator, ata iu përgjigjën pyetjes "me çfarë të dhënash, me çfarë cilësimesh, çfarë performance ka marrë në cilat grupe?" me një regjistrim të plotë brenda disa minutave. Inspektimi shkoi pa probleme. Mësimi: monitorimi është një mjet përputhshmërie, jo thjesht një mjet inxhinierik.
Modele të kopjueshme
Bëni një kontroll riprodhueshmërie për këtë projekt ML.- A janë të fiksuara të gjitha farat e rastësisë (ndarja, inicializimi, përzierja)?- A janë versionuar të dhënat?- A janë ngrirë varësitë në versione të sakta?- A gjurmohet çdo eksperiment (kommitimi i kodit, të dhënat, hiperparametrat, metrikë)? Shkruani hapa konkretë se si ta rregulloni atë për secilën kolonë që mungon. Struktura e projektit: [përshkrim]
Krijoni një skelet plani për këtë projekt ML nga fundi në fund. Problemi: [përshkrimi] Mbuloni ndalesat e mëposhtme dhe shënoni se ku është vendimi NJERËZOR në çdo ndalesë: problemi/metrika, tubacioni, modeli, (RAG/agjenti/rregullimi i imët?), vlerësimi, drejtësia, siguria, shpërndarja, monitorimi, riprodhueshmëria. Shkruani rrezikun kryesor dhe hapin e verifikimit për çdo ndalesë.
Përgatitni një model të dokumentacionit teknik për këtë projekt. Seksionet: problem+kriteret e suksesit, të dhënat (burimi+versioni), përzgjedhjet e modeleve+justifikimi, vlerësimi (përfshirë nëngrupet), kufijtë e njohur+risqet, vendosja+rikthehet, plani i monitorimit. Jepni fushat që duhet të plotësohen për çdo seksion si pyetje.
Kontrollo konfigurimin tim të monitorimit të eksperimentit: A ruhet automatikisht në çdo ekzekutim: git commit, versioni/hash i të dhënave, të gjithë hiperparametrat, të gjitha metrikat, mjedisi (versionet e bibliotekës)? A marr të njëjtin rezultat kur bëj përsëri të njëjtin vrap? Konfigurimi: [përshkrim]. Listoni të metat dhe korrigjimin.
Tabela e kolonave të riprodhueshmërisë
kolonë
Çfarë është fiksuar
Shembull i automjetit
rastësi
të gjitha farat
vendosja e farës
Të dhënat
Versioni/hash i të dhënave
DVC
mjedisi
Versionet e bibliotekës
pin kërkesat, Docker
Monitorimi
Kod+të dhëna+cilësim+metrik
MLflow, W&B
Gabimet e zakonshme
- Nuk e rregullon farën. Rezultati nuk mund të përsëritet.
- Versioni i të dhënave nuk ruhet. "Me çfarë të dhënash?" mbetet pa përgjigje.
- Nuk ngrijnë varësitë. Një përditësim do të prishë në heshtje gjithçka.
- Duke i lënë në kujtesë eksperimentet. Dy javë më vonë asgjë nuk mbahet mend.
- Duke i lënë vendimet kritike inteligjencës artificiale. Metrikat, drejtësia dhe vendimet e shpërndarjes duhet të mbeten me njerëzit.
- Shtyrja e dokumentacionit. Ekipi i ardhshëm (dhe ju) paguani çmimin.
Në përmbledhje
Riprodhueshmëria është nënshkrimi i inxhinierisë serioze të ML: rezultati jo i riprodhueshëm është pretendimi i paprovueshëm. Vjen me katër kolona - rregulloni rastësinë, të dhënat e versionit, mjedisin e ngrirjes, gjurmoni çdo eksperiment. Një projekt nga fundi në fund kombinon të gjitha pikat e këtij moduli (metrika, të dhënat, modeli, komponentët LLM, vlerësimi, drejtësia, siguria, shpërndarja, monitorimi) në një zinxhir të ndërlidhur; Inteligjenca artificiale është një përshpejtues në çdo ndalesë, por vendimet kritike mbeten me njeriun. Dokumentoni gjithçka - për ekipin dhe auditimet e ardhshme. Kjo disiplinë është korniza që mbështet gjithçka që mësoni gjatë gjithë modulit.
Detyra e aplikimit
Kontrolloni një projekt ML kundrejt katër shtyllave të riprodhueshmërisë: a janë farat e pandryshueshme, a janë versionet e të dhënave, a është mjedisi i ngrirë, a gjurmohen eksperimentet? Rregulloni çdo kolonë që mungon dhe provoni se mund të ekzekutoni të njëjtin ekzekutim dy herë dhe të merrni të njëjtin rezultat. Më pas nxirrni rrjedhën nga fundi në fund të projektit (10 ndalesa) në një faqe dhe shënoni "ku është vendimi njerëzor" në çdo ndalesë. Së fundi, shkruani një draft të shkurtër të dokumentacionit teknik.
listë kontrolli
- [ ] Të gjitha farat e rastësisë janë fiksuar.
- [ ] Versioni/hashi i të dhënave regjistrohet me çdo eksperiment.
- [ ] Varësitë janë ngrirë në versione të qëndrueshme (pin/kontejner).
- [ ] Çdo eksperiment monitorohet automatikisht (kodi+të dhëna+cilësimi+metrika).
- [ ] Kur përsëris të njëjtin vrapim, marr të njëjtin rezultat.
- [ ] Kam verifikuar dhe dokumentuar se vendimet kritike në rrjedhën nga fundi në fund merren nga njerëzit.
Provimi i Modulit
1. Si inxhinier ML, cila është qasja më e mirë kur poziciononi inteligjencën artificiale në rrjedhën e punës?
- A) AI është një përshpejtues në bizneset me rrezik të ulët; Vendimet kritike si metrikat, të dhënat dhe prodhimi mbeten të vërtetuara dhe i lihen njeriut ✔
- B) Për sa kohë që rezultatet e AI duken të mira, nuk ka nevojë për verifikim
- C) Lënia e vendimit për të nxjerrë modelin në prodhim tek inteligjenca artificiale kursen kohë.
- D) Inteligjenca artificiale është e dobishme vetëm për të shkruar tekst, nuk ka të bëjë me të dhënat dhe punën e modeleve
Përshkrimi: AI është një përshpejtues i fuqishëm për detyra me rrezik të ulët dhe lehtësisht të verifikueshme si kodi, përmbledhja e të dhënave dhe dokumentet; Megjithatë, përgjegjësia për vendimet që prekin paratë, konfidencialitetin dhe përgjegjësinë ligjore, siç është përzgjedhja metrike, e cila të dhënat kalojnë në trajnim dhe vënia e modelit në prodhim, i takon inxhinierit dhe ekipit të kualifikuar. Çdo dalje nuk duhet të përdoret pa verifikim.
2. Pse vërtetimi i skemës vendoset në fillim të një tubacioni të dhënash?
- A) Sepse rrit drejtpërdrejt saktësinë e modelit
- B) Sepse e bën të panevojshëm versionimin e të dhënave
- C) Sepse kap të dhënat e korruptuara në momentin më të hershëm dhe më të lirë dhe i parandalon ato të rrjedhin në hapat e ardhshëm ✔
- D) Sepse eliminon nevojën për etiketim
Shpjegim: Sa më herët të kapen të dhënat e korruptuara, aq më lirë është t'i rregulloni ato. Vlefshmëria e skemës parandalon të dhënat e korruptuara të rrjedhin në heshtje në trajnim ose prodhim duke refuzuar të dhënat jashtë llojit dhe gamës së pritshme në fillim të linjës (p.sh. ndryshimi i çmimit 100x me ndryshimin e njësisë); I njëjti gabim i kapur në prodhim është shumë herë më i shtrenjtë.
3. Cila është qasja e saktë kur ndahen të dhënat në trajnim dhe testim në një problem që përfshin kohë (seritë kohore)?
- A) Përdorimi i ndarjes së rastësishme sepse është gjithmonë metoda më e drejtë
- B) Përdorimi i ndarjes së përkohshme: parandaloni rrjedhjet duke u trajnuar me të kaluarën dhe duke testuar në të ardhmen ✔
- C) Përdorimi i të gjitha të dhënave si trajnim dhe testim
- D) Përfshirja e të dhënave të testit në parametrat e shkallëzimit përpara stërvitjes
Shpjegim: Ndarja e rastësishme në seritë kohore i jep modelit një avantazh 'duke parë të ardhmen' që nuk do të ndodhë kurrë në prodhim dhe fryn artificialisht metrikat (rrjedhje të përkohshme). E sakta është ndarja kohore: stërvituni me të kaluarën, testoni në të ardhmen. Kjo mat performancën aktuale që e mban atë në prodhim.
4. Pse saktësia është mashtruese në një model të zbulimit të mashtrimit me një normë pozitive të klasës prej 1.5%?
- A) Sepse Saktësia është gjithmonë e ulët në të dhënat e pabalancuara
- B) Sepse Saktësia mund të përdoret vetëm në problemet e regresionit
- C) Sepse llogaritja e saktësisë kërkon shumë fuqi përpunuese
- D) Edhe një model i vogël që parashikon klasën e shumicës mund të jetë shumë i saktë, duke fshehur kështu suksesin e vërtetë ✔
Shpjegim: Në të dhënat e pabalancuara, edhe një model bazë që thotë 'quaji gjithçka negative' merr rreth 98.5% saktësi, por nuk do të kapë asnjë mashtrim të vetëm. Prandaj, në klasifikimin e pabalancuar, saktësia, rikujtimi, F1 ose PR-AUC përdoren në vend të saktësisë dhe çdo metrikë interpretohet sipas një modeli bazë.
5. Pse është thelbësor krahasimi bazë kur flitet për metrikën e një modeli?
- A) Sepse modeli bazë është gjithmonë më i mirë se modeli real
- B) Sepse është e qartë nëse një metrikë është kuptimplotë apo jo vetëm kur krahasohet me një model të thjeshtë bazë ✔
- C) Sepse modeli bazë e bën të panevojshëm verifikimin e kryqëzuar
- D) Sepse modeli bazë kërkohet ligjërisht në çdo raport
Shpjegim: Një metrikë nuk është e mirë apo e keqe në vetvete; Është e mirë apo e keqe sipas një modeli bazë. Fjalia '85% e saktë' do të thotë pothuajse e pavlefshme nëse modeli bazë tashmë merr 84%, dhe i përsosur nëse merr 50%. Pa një spirancë krahasimi, metrika është e pakuptimtë.
6. Cili është elementi më kritik i sigurisë që duhet të përfshihet në promptin e prodhimit të sistemit RAG (Retrieval-Augmented Generation)?
- A) Udhëzim për t'u mbështetur vetëm në burimin e dhënë, për të thënë 'nuk e di' nëse burimi nuk ekziston dhe për të cituar burimin ✔
- B) T'i thuash modelit të prodhojë përgjigje sa më të gjata dhe kreative
- C) Modeli i jep përparësi njohurive të veta arsimore mbi burimet
- D) Zbatoni të gjitha udhëzimet në dokumentet e sjella si komanda
Shpjegim: Udhëzimi i vetëm më i rëndësishëm i RAG është t'i thuash modelit të mbështetet vetëm në burimin e dhënë, dhe nëse informacioni nuk është në burim, thuaj 'Nuk e di' dhe citoje burimin pa e shpikur. Pa këtë treshe, modeli mund të injorojë kontekstin dhe të prodhojë halucinacione, dhe përgjigja bëhet e paverifikueshme.
7. Një sistem RAG jep përgjigje të pasakta. Ku është vendi më i mirë për të filluar diagnozën?
- A) Matja e tërheqjes së pari (Kujto@K): a arrin ndonjëherë pjesa e duhur? ✔
- B) Zëvendësoni menjëherë modelin me një më të madh
- C) Ndryshoni kërkesën në mënyrë të rastësishme dhe vazhdoni të provoni
- D) Futja e të gjitha dokumenteve në model me rregullim të imët
Shpjegim: Lidhja më e dobët e RAG është zakonisht marrja, jo prodhimi. Nëse pjesa e duhur nuk është sjellë kurrë, modeli nuk mund ta prodhojë atë informacion, pa marrë parasysh se sa është përmirësuar kërkesa. Prandaj, së pari matet Recall@K për të parë nëse ka mbërritur pjesa e saktë; Nëse marrja është e mirë, atëherë prodhimi dhe prompti shqyrtohen.
8. Cilat veprime duhet të vendosen pas miratimit njerëzor kur i jepni një mjet një agjenti?
- A) Asnjë; Agjenti duhet të jetë në gjendje të kryejë çdo veprim në mënyrë autonome
- B) Vetëm veprime të kthyeshme si leximi dhe kërkimi i të dhënave
- C) Veprime të pakthyeshme ose me ndikim të lartë si transferimi i parave, fshirja, dërgimi ✔
- D) Veprimet që përfshijnë vetëm llogaritje
Përshkrimi: Veprimet janë të ndara sipas nivelit të rrezikut. Detyrat e rikuperueshme si leximi, kërkimi, llogaritja dhe gjenerimi i drafteve mund të kryhen në mënyrë autonome; Megjithatë, veprimet e pakthyeshme ose me ndikim të lartë si transferimi i parave, dërgimi i emaileve, fshirja e të dhënave, vendosja e porosive etj. kërkojnë miratim njerëzor. Çdo veprim i parevokueshëm duhet t'i nënshtrohet pëlqimit.
9. Cila është qasja më e mirë e projektimit kundër rrezikut të injektimit të menjëhershëm të tërthortë?
- A) Mjafton të shtoni një fjali të vetme 'injoroni udhëzimet e këqija' në kërkesën e sistemit
- B) Jepini më shumë autoritet modelit duke u mbështetur në udhëzimet në përmbajtje të jashtme
- C) Mos marrja e masave paraprake sepse injektimi është i paparandalueshëm
- D) Izolimi i përmbajtjes së jashtme si të dhëna jo të besueshme dhe vendosja e mbrojtjeve të shtresuara me autorizim, miratim dhe kontroll minimal ✔
Përshkrimi: Përmbajtja e jashtme e përpunuar nga agjenti ose RAG, të tilla si një faqe interneti, dokument, email, etj., janë të dhëna të pabesueshme dhe mund të përmbajnë udhëzime sekrete. Qasja e saktë është mbrojtja me shtresa: izolimi i përmbajtjes së jashtme si 'të dhëna, jo komanda' me kufij të qartë, aplikimi i autorizimit minimal, detyrimi i veprimeve të pakthyeshme për miratimin njerëzor dhe auditimi i rezultatit. Një rresht i vetëm udhëzimesh nuk mjafton.
10. Cili është dallimi kryesor kur vendoset nëse një problem duhet të zgjidhet me rregullim të imët apo RAG?
- A) Problemet e informacionit zgjidhen më mirë me RAG, problemet e sjelljes/formatit zgjidhen më mirë me rregullim të imët ✔
- B) Çdo problem duhet të zgjidhet gjithmonë me rregullim të imët
- C) RAG përdoret vetëm për gjenerimin e kodit, rregullimi i imët përdoret vetëm për përkthim
- D) Rregullimi i imët mund të përditësohet gjithmonë më lirë dhe më shpejt se RAG
Shpjegim: Rregullimi i imët është i dobët dhe i rrezikshëm në mësimin e modelit të informacionit të ri; por është i fuqishëm në mësimdhënien e sjelljes, formatit, tonit dhe stilit. 'Kompania model nuk i njeh të dhënat tona' është një problem informacioni dhe i përket RAG. 'Modeli le të dalë gjithmonë në formatin tonë të rreptë' është një problem sjelljeje dhe një kandidat për rregullim të imët. Për më tepër, duhet të konsumohen shkrepje të shpejta dhe të pakta përpara akordimit.
11. Cila është e detyrueshme për vendosje të sigurt kur vihet në prodhim një model i ri?
- A) Nëse modeli është i mirë në testim, hapeni drejtpërdrejt në trafik 100%.
- B) Mos vendosja fare e monitorimit pas vendosjes
- C) Vendosja me faza (hije/kanarie) dhe një plan rikthimi i para-testuar ✔
- D) Publikimi i modelit edhe nëse nuk plotësohet pragu i vlerësimit
Shpjegim: Hapja e modelit të ri drejtpërdrejt për të gjithë trafikun është e rrezikshme; Nëse është e gabuar, të gjithë janë të prekur. E drejta është se është një shpërndarje graduale (hije, kanarina) dhe çdo shpërndarje ka një plan rikthimi të testuar. Një shpërndarje nuk është e plotë pa një plan kthimi; Mundësia për t'u rikthyer në versionin e mëparshëm brenda disa minutave mbron përdoruesin kur modeli sillet papritur në prodhim.
12. Si mund të dështojë një model ML 'në heshtje' në prodhim dhe cila është mënyra për ta kapur këtë?
- A) Modeli shembet; regjistrat e serverit e tregojnë këtë
- B) Duke prodhuar parashikime të gabuara pa bërë gabime; ✔ Kap monitorimin me shtresa operacionale, hyrëse dhe dalëse
- C) Modeli nuk mund të dështojë kurrë në heshtje, gjithmonë alarm
- D) Mjafton vetëm monitorimi i vonesës për të kapur ndonjë degradim
Shpjegim: Modeli mund të dështojë thjesht duke prodhuar parashikime të pasakta pa përplasje ose duke dhënë gabime; Arsyeja kryesore për këtë është zhvendosja e të dhënave dhe zhvendosja e konceptit. Vetëm monitorimi i matjeve operacionale (latenca, shkalla e gabimit) nuk mjafton; Duhet të monitorohet edhe shpërndarja e inputeve dhe shpërndarja e prodhimit/parashikimit. Zhvendosja e hyrjes jep paralajmërim të hershëm nëse rezultati aktual vonohet.
13. Cili parim është thelbësor kur përdoret LLM-si gjyqtar për të vlerësuar një sistem LLM?
- A) LLM-arbitri është gjithmonë i saktë, verifikimi njerëzor është i panevojshëm
- B) Arbitri duhet të marrë një vendim bazuar vetëm në gjatësinë e përgjigjes.
- C) Kontrollet e bazuara në rregulla dhe vlerësimi njerëzor duhet të hiqen plotësisht kur përdoren gjyqtarë
- D) Rezultatet e gjyqtarëve duhet të kalibrohen me një kampion të etiketuar nga njeriu dhe paragjykimi i tyre të matet përpara se t'u besohet ✔
Përshkrimi: LLM-arbitër është gjithashtu një model; Ajo mund të jetë halucinative, e njëanshme (duke favorizuar përgjigje të gjata dhe të sigurta) dhe jokonsistente. Prandaj, rezultatet e gjyqtarëve duhet të kalibrohen me një mostër të etiketuar njerëzore dhe paragjykimi i tyre sistematik duhet të matet përpara se të merret vendimi i prodhimit. Një gjyqtar i paverifikuar jep besim të rremë.
14. Pse është e pamjaftueshme shikimi i saktësisë së përgjithshme kur vlerësohet paragjykimi i modelit?
- A) Saktësia e përgjithshme është e mjaftueshme sepse gjithmonë pasqyron performancën e grupit më të keq
- B) Vetëm saktësia e përgjithshme është e pamjaftueshme pasi mund të errësojë dallimin sistematik (diskriminimin e fshehur) midis nëngrupeve ✔
- C) Sepse saktësia është një metrikë që nuk ka të bëjë me paragjykimet
- D) Paragjykimi vjen vetëm nga modeli dhe nuk ka lidhje me të dhënat.
Shpjegim: Saktësia e përgjithshme mund të errësojë dallimet sistematike midis nëngrupeve. Për shembull, ndërsa saktësia e përgjithshme është 88%, rikujtimi mund të jetë 91% në një grup dhe 67% në një grup tjetër; Modelit i mungon sistematikisht ai grup. Prandaj, modeli duhet të vlerësohet në bazë të nëngrupeve (demografike/segmenti) dhe se cili përkufizim i drejtësisë duhet të ketë prioritet duhet të vendoset me palët e interesuara.
15. Cilat katër gjëra duhet të fiksohen së bashku që një rezultat ML të jetë i riprodhueshëm?
- A) Vetëm emri i modelit, madhësia, çmimi dhe data e lëshimit
- B) Vetëm marka GPU dhe shpejtësia e internetit
- C) Vetëm rezultati përfundimtar i saktësisë së modelit; pjesa tjetër mund të mbahet në kujtesë
- D) Fara e rastësisë, versioni i të dhënave, mjedisi (versionet e varësisë) dhe gjurmimi i eksperimentit ✔
Përshkrimi: Riprodhueshmëria arrihet përmes katër shtyllave: fiksimi i farave të rastësisë, versionimi i të dhënave (versioni/hash), ngrirja e mjedisit (versionet e sakta të bibliotekës/kontejneri) dhe gjurmimi i çdo eksperimenti (kommitimi i kodit, të dhënat, hiperparametri, metrika). Pa këtë zinxhir nuk është e mundur të riprodhohet i njëjti rezultat; Një rezultat jo i riprodhueshëm është një pretendim që nuk mund të provohet.