Vienība 11 / 11

Reproducējamība un pilnīgais projekts: visa apvienošana

Ieguvumi:

  • Spēja nodrošināt reproducējamību ar četriem pīlāriem (sēklu fiksācija, datu versiju veidošana, datu nesēja iesaldēšana, eksperimenta uzraudzība) un iegūt tādu pašu rezultātu, atkārtojot to pašu darbību
  • Iespēja apvienot visas moduļa pieturas (metriku, datus, modeli, LLM komponentus, eval, godīgumu, drošību, izplatīšanu, uzraudzību) ķēdē no gala līdz galam
  • Spēja pārbaudīt, vai kritiskais lēmums paliek cilvēka ziņā katrā pieturā, un dokumentēt projektu auditējamā veidā

Vismānīgākā ML projekta neveiksme nav avārija; "Nevar iegūt tādu pašu rezultātu vēlreiz." Ja šodien nevarat reproducēt tā modeļa rezultātu, kuru laidāt ražošanā pirms trim mēnešiem, jūs īsti nekontrolējat šo modeli. Šajā noslēguma vienībā mēs padziļinām reproducējamību: spēju droši iegūt vienu un to pašu rezultātu ar vienādām ievadēm un apvienot visu moduli visaptverošā projekta disciplīnā.

Kāpēc reproducējamība ir sarežģīta

Parastajā programmatūrā viens un tas pats kods dod tādu pašu izvadi. ML ir daudz vairāk mainīgo, kas nosaka rezultātu:

  • Nejaušība: datu sajaukšana, svara inicializācija, datu sadalīšana — tas viss ir atkarīgs no nejaušības.
  • Dati: viens un tas pats kods rada atšķirīgu modeli ar atšķirīgu datu versiju.
  • Vide: Bibliotēkas versijas, aparatūra (CPU/GPU), pat operētājsistēma var mainīt rezultātu.
  • Slēptais gadījums: nesaglabāts hiperparametrs, manuāla pirmapstrādes darbība, neatzīmēta atlase.

Reproducējamība nav "patīkami iegūt", bet gan zinātniska un inženiertehniska nepieciešamība. Rezultāts, ko nevar reproducēt, ir apgalvojums, ko nevar pierādīt.

Četri reproducējamības pīlāri

1. Labojiet nejaušību. Iestatiet vienuviet visas izlases sēklas: datu sadalīšana, modeļa inicializācija, datu sajaukšana. Fiksētā sēkla ir garantijas "tāds pats rezultāts, atkārtojot to pašu skrējienu" pamatā.

2. Versējiet datus. Pierakstiet, ar kuru datu versiju tika veikts katrs eksperiments (datu versiju noteikšana 2. vienībā). “Jaunākie dati” ir neskaidri; "Datu versija v3, hash abc123" ir precīza.

3. Sasaldē barotni. Piespraust visas atkarības to precīzajām versijām (piem., precīzām versijām, piemēram, numpy==1.26.4 failā prasības.txt vai konteinera attēlā). "Jaunākā versija" reiz visu salauzīs.

4. Izsekojiet visam (eksperimenta izsekošana). Automātiski saglabājiet katram eksperimentam: koda versija (git commit), datu versija, visi hiperparametri, metrika un izvades struktūras. Eksperimentu izsekošanas rīki, piemēram, MLflow, Weights & Biases, to dara sistemātiski. Bez reģistrācijas jautājums "kurš uzstādījums bija vislabākais" paliek neatbildēts.

Uzmanību: "Es atcerēšos vēlāk" ir visdārgākā kļūda. Pēc divām nedēļām jūs neatcerēsities, kuras sēklas, kādus datus, kādu hiperparametru izmantojāt. Automātiskā izsekošana novērš paļaušanos uz atmiņu.

Vāja pieeja / spēcīga pieeja

Vājš: "Es atradu labāko modeli, tas ir piezīmjdatorā, man šķiet, ka tā rezultāts bija 89%.

Strong: "Palaidiet #147 eksperimenta izsekošanas rīkā: git commit a3f9c, datu versija v3 (hash abc123), seed 42, visi hiperparametri reģistrēti, pārbaudiet PR-AUC 0.887. Kad es vēlreiz izpildu to pašu komandu, es saņemu to pašu rezultātu pa bitam. Modelis ir atkarīgs no šīs palaišanas reģistrā."

Atšķirība: spēcīgajā pieejā rezultāts nav balstīts uz atmiņu, bet gan uz fiksētu un uzraudzītu ķēdi. Ikviens var iegūt vienu un to pašu rezultātu katru reizi.

Pilnīgs projekts: moduļa kombinācija

Tagad apvienosim visu moduli vienā projekta plūsmā. Īsta ML sistēma iet caur šīm pieturām, un katra pietura balstās uz iepriekšējo:

  1. Problēmas definīcija: ko mēs risinām, kā izmērīt panākumus (3. vienība: pareiza metrika, biznesa konteksts). Metrika un slieksnis ir skaidri no paša sākuma.
  2. Datu konveijers: vākšana, validācija, tīrīšana, sadalīšana bez noplūdēm, versiju veidošana (2. vienība).
  3. Modeļa izstrāde: apmācība, bāzes līnijas salīdzinājums, savstarpēja validācija, cietā sēkla (3. vienība + šī vienība).
  4. LLM komponenti (ja piemērojams): RAG (4. nodaļa) un/vai aģenti (5. vienība); precizēšana, ja nepieciešams (6. bloks).
  5. Novērtējums: eval klasteris ar malām un drošības gadījumiem, daudzslāņu eval LLM sistēmās (8. bloks).
  6. Tiesiskuma un ētikas audits: Apakšgrupu analīze, paraugkarte, izskaidrojamība (10. nodaļa).
  7. Drošības audits: tūlītēja injekcija, privātums, piegādes ķēde (9. vienība).
  8. Izplatīšana: Iepakojums, pakāpeniska izplatīšana, atcelšana, modeļu reģistrs (7. vienība).
  9. Uzraudzība: Trīs slāņu uzraudzība, dreifēšanas trauksmes (8. bloks).
  10. Reproducējamība: sēklu, datu versijas, multivides un eksperimentu izsekošana visā ķēdē (šī vienība).

Šajā plūsmā AI ir paātrinātājs un projektu ģenerators katrā pieturā; bet metrikas atlase, datu lēmumi, taisnīguma prioritāšu noteikšana, izvietošanas slieksnis un atbrīvošanas apstiprinājums — kritiskie lēmumi paliek cilvēka ziņā. Tāda ir moduļa būtība.

Dokumentācija: nākotne jums pateiks paldies

Labs ML projekts pats sevi dokumentē. Jāuzraksta vismaz: problēmas un panākumu kritēriji, datu avots un versija, modeļu izvēle un pamatojums, novērtēšanas rezultāti (ieskaitot apakšgrupas), zināmie ierobežojumi un riski, izvietošanas un izguves procedūra, monitoringa plāns. Šis dokuments ir tās personas (varbūt tas esi tu) labākais draugs, kurš atgriežas projektā pēc sešiem mēnešiem.

trīs mini futrāļi

1. gadījums — zaudēts rezultāts. Inženieris apmācīja lielisku modeli, taču viņš nelaboja sēklu un nesaglabāja datu versiju. Kad viņš atstāja darbu, neviens nevarēja atveidot šo rezultātu; modelis kļuva par "melnās kastes leģendu" un galu galā tika uzbūvēts no nulles. Nedēļas bija izniekotas. Nodarbība: nereproducējams rezultāts ir neesošs rezultāts.

2. gadījums — vides sabrukums. Viena komanda nebija novērsusi atkarības. Kad bibliotēka tika automātiski atjaunināta, modeļa izvadi klusi mainījās un ražošana tika pārtraukta. Pagāja dienas, lai atrastu problēmu. Kad atkarības tika iesaldētas un ievietotas konteineros ar galīgajām versijām, problēma vairs neatkārtojās. Nodarbība: iesaldē vidi.

3. gadījums — uzraudzības spēja. Komanda automātiski uzraudzīja katru eksperimentu. Trīs mēnešus vēlāk, veicot normatīvo auditu, viņi atbildēja uz jautājumu "ar kādiem datiem, ar kādiem iestatījumiem, kādu sniegumu tas ieguva kādās grupās?" ar pilnu ierakstu dažu minūšu laikā. Pārbaude noritēja raiti. Nodarbība: uzraudzība ir atbilstības rīks, nevis tikai inženiertehnisks.

Kopējamas veidnes

Veiciet šī ML projekta reproducējamības pārbaudi.- Vai visas nejaušības sākuma vērtības ir fiksētas (sadalīšana, inicializācija, jaukšana)?- Vai datu versijas ir iestatītas?- Vai atkarības ir iesaldētas līdz precīzām versijām?- Vai tiek izsekoti katrs eksperiments (koda slēgšana, dati, hiperparametrs, metrika)? Uzrakstiet konkrētas darbības, kā to labot katrai trūkstošajai kolonnai.Projekta struktūra: [apraksts]

Izveidojiet šī visaptverošā ML projekta plāna skeletu. Problēma: [apraksts] Nosedziet šādas pieturas un atzīmējiet, kur katrā pieturā ir CILVĒKA lēmums: problēma/metrika, konveijera, modelis, (RAG/agent/fine-tune?), eval, godīgums, drošība, izplatīšana, uzraudzība, reproducējamība. Uzrakstiet katras pieturas galveno risku un pārbaudes soli.

Izveidojiet šī projekta tehniskās dokumentācijas veidni. Sadaļas: problēma+veiksmes kritēriji, dati (avots+versija), modeļu izvēle+pamatojums, novērtējums (ieskaitot apakšgrupas), zināmās robežas+riski, izvietošana+atcelšana, monitoringa plāns. Katrai sadaļai aizpildāmos laukus norādiet kā jautājumus.

Pārbaudiet manu eksperimenta uzraudzības iestatījumu: vai tas tiek automātiski saglabāts katrā izpildē: git commit, datu versija/jaukšana, visi hiperparametri, visa metrika, vide (bibliotēkas versijas)? Vai es iegūstu tādu pašu rezultātu, atkal skrienot to pašu? Iestatīšana: [apraksts]. Uzskaitiet trūkumus un labojumus.

Reproducējamības kolonnu tabula

kolonnu

Kas ir fiksēts

Transportlīdzekļa piemērs

nejaušība

visas sēklas

sēklu iestatījums

Dati

Datu versija/jaukšana

DVC

vidi

Bibliotēkas versijas

prasību tapa, Docker

Uzraudzība

Kods+dati+iestatījums+metrika

MLflow, W&B

Biežas kļūdas

  • Nefiksē sēklu. Rezultātu nevar atkārtot.
  • Datu versija netiek saglabāta. "Ar kādiem datiem?" paliek neatbildēts.
  • Nesasaldējot atkarības. Atjauninājums klusi izjauks visu.
  • Eksperimentus atstājot atmiņā. Pēc divām nedēļām nekas vairs neatceras.
  • Svarīgu lēmumu pieņemšana mākslīgā intelekta ziņā. Metrikas, taisnīguma un sadales lēmumiem vajadzētu palikt cilvēkiem.
  • Dokumentācijas atlikšana. Topošā komanda (un jūs) maksājat cenu.

Rezumējot

Reproducējamība ir nopietnas ML inženierijas paraksts: nereproducējams rezultāts ir nepierādāms apgalvojums. Tam ir četras kolonnas — labojiet nejaušību, versiju datus, iesaldējiet vidi, izsekojiet katram eksperimentam. Pilnīgs projekts apvieno visas šī moduļa pieturas (metrika, dati, modelis, LLM komponenti, eval, godīgums, drošība, izplatīšana, uzraudzība) savstarpēji saistītā ķēdē; Mākslīgais intelekts ir paātrinātājs katrā pieturā, bet kritiskie lēmumi paliek cilvēka ziņā. Dokumentējiet visu — turpmākajai komandai un auditiem. Šī disciplīna ir ietvars, kas atbalsta visu, ko jūs apgūstat moduļa laikā.

Lietojumprogrammas uzdevums

Pārbaudiet ML projektu pret četriem reproducējamības pīlāriem: vai sēklas ir nemainīgas, vai dati ir versijā, vai vide ir iesaldēta, vai eksperimenti tiek izsekoti? Labojiet visas trūkstošās kolonnas un pierādiet, ka varat veikt vienu un to pašu darbību divas reizes un iegūt tādu pašu rezultātu. Pēc tam vienā lapā izvadiet projekta plūsmu no gala līdz galam (10 pieturas) un katrā pieturā atzīmējiet "kur ir cilvēka lēmums". Visbeidzot uzrakstiet īsu tehniskās dokumentācijas projektu.

kontrolsaraksts

  • [ ] Visas nejaušības sēklas ir fiksētas.
  • [ ] Datu versija/jaukšana tiek reģistrēta katrā eksperimentā.
  • [ ] Atkarības tiek iesaldētas līdz stingrām versijām (piespraude/konteiners).
  • [ ] Katrs eksperiments tiek automātiski pārraudzīts (kods+dati+iestatījums+metrika).
  • [ ] Atkārtojot to pašu skrējienu, man ir tāds pats rezultāts.
  • [ ] Es pārbaudīju un dokumentēju, ka kritiskus lēmumus plūsmā no gala līdz galam pieņem cilvēki.

Moduļa eksāmens

1. Kāda ir labākā pieeja mākslīgā intelekta pozicionēšanai darbplūsmā kā ML inženierim?

  • A) AI ir paātrinātājs zema riska uzņēmumos; Būtiski lēmumi, piemēram, metrika, dati un ražošana, paliek apstiprināti un atstāti cilvēka ziņā ✔
  • B) Kamēr AI izvadi izskatās labi, pārbaude nav nepieciešama
  • C) Atstājot lēmumu par modeļa laišanu ražošanā mākslīgā intelekta ziņā, tiek ietaupīts laiks.
  • D) Mākslīgais intelekts noder tikai teksta rakstīšanai, tam nav nekāda sakara ar datu un modeļu darbu

Apraksts: AI ir spēcīgs paātrinātājs zema riska, viegli pārbaudāmiem uzdevumiem, piemēram, kodam, datu apkopojumiem un dokumentiem; Tomēr atbildība par lēmumiem, kas ietekmē naudu, konfidencialitāti un juridisko atbildību, piemēram, metrikas atlasi, kuru dati tiek izmantoti apmācībā un modeļa nodošanā ražošanā, ir kvalificētam inženierim un komandai. Katru izvadi nedrīkst izmantot bez pārbaudes.

2. Kāpēc shēmas validācija tiek ievietota datu konveijera sākumā?

  • A) Jo tas tieši palielina modeļa precizitāti
  • B) Tāpēc, ka tas padara datu versijas nevajadzīgu
  • C) Tā kā tas uztver bojātos datus agrākajā un lētākajā vietā un novērš to noplūdi nākamajās darbībās ✔
  • D) Jo tas novērš nepieciešamību pēc marķēšanas

Paskaidrojums: jo agrāk tiek noķerti bojāti dati, jo lētāk tos salabot. Shēmas validācija novērš bojātu datu klusu noplūdi apmācībā vai ražošanā, noraidot datus ārpus paredzētā veida un diapazona rindas sākumā (piemēram, cenas maiņa 100 reizes ar vienības maiņu); Tā pati kļūda, kas pieķerta ražošanā, ir daudzkārt dārgāka.

3. Kāda ir pareizā pieeja, sadalot datus apmācībā un testēšanā problēmā, kas saistīta ar laiku (laikrindas)?

  • A) Izmantojot nejaušu sadalīšanu, jo tā vienmēr ir godīgākā metode
  • B) Laika sadalīšanas izmantošana: novērsiet noplūdi, apmācot pagātni un pārbaudot nākotnē ✔
  • C) Visu datu izmantošana gan apmācībai, gan testēšanai
  • D) Testa datu iekļaušana mērogošanas parametros pirms apmācības

Paskaidrojums. Laika rindu nejauša sadalīšana dod modelim "nākotnes redzes" priekšrocības, kas nekad nenotiks ražošanā, un mākslīgi palielina rādītājus (laika noplūde). Pareizais ir laika dalījums: trenēties ar pagātni, pārbaudīt nākotni. Tas mēra faktisko veiktspēju, kas nodrošina to ražošanā.

4. Kāpēc precizitāte ir maldinoša krāpšanas atklāšanas modelī ar pozitīvo klases līmeni 1,5%?

  • A) Tā kā nelīdzsvarotu datu precizitāte vienmēr ir zema
  • B) Tā kā precizitāti var izmantot tikai regresijas problēmām
  • C) Tā kā precizitātes aprēķināšanai ir nepieciešama liela apstrādes jauda
  • D) Pat niecīgs modelis, kas paredz vairākuma klasi, var būt ļoti precīzs, tādējādi slēpjot patiesus panākumus ✔

Paskaidrojums: nelīdzsvarotu datu gadījumā pat pamata modelim, kas saka “izsaukt visu, kas ir negatīvs”, ir aptuveni 98,5% precizitāte, taču tas neuztvers nevienu krāpšanu. Tāpēc nelīdzsvarotā klasifikācijā precizitātes vietā tiek izmantota precizitāte, atsaukšana, F1 vai PR-AUC, un katra metrika tiek interpretēta saskaņā ar bāzes modeli.

5. Kāpēc, runājot par modeļa metriku, ir svarīgi veikt bāzes salīdzināšanu?

  • A) Jo bāzes modelis vienmēr ir labāks par reālo modeli
  • B) Jo ir skaidrs, vai metrika ir jēgpilna vai ne, tikai salīdzinot ar vienkāršu bāzes modeli ✔
  • C) Tā kā bāzes modelis padara savstarpēju validāciju nevajadzīgu
  • D) Jo pamata modelis ir juridiski pieprasīts katrā ziņojumā

Paskaidrojums: metrika pati par sevi nav laba vai slikta; Tas ir labs vai slikts saskaņā ar pamata modeli. Teikums "85% pareizi" nozīmē gandrīz nevērtīgu, ja bāzes modelis jau iegūst 84%, un ideāls, ja tas saņem 50%. Bez salīdzināšanas enkura metrika ir bezjēdzīga.

6. Kurš ir vissvarīgākais drošības elements, kas jāiekļauj RAG (Retrieval-Augmented Generation) sistēmas ražošanas uzvednē?

  • A) Norādījums paļauties tikai uz norādīto avotu, pateikt “es nezinu”, ja avots neeksistē, un citēt avotu ✔
  • B) Liekot modelim sniegt pēc iespējas garākas un radošākas atbildes
  • C) Modelis piešķir prioritāti savām izglītības zināšanām, nevis resursiem
  • D) Ieviesiet visus norādījumus dokumentos, kas atnesti kā komandas

Paskaidrojums: Vienīgais vissvarīgākais RAG norādījums ir likt modelim paļauties tikai uz norādīto avotu, un, ja informācija nav avotā, sakiet "Es nezinu" un nosauciet avotu, to neizdomājot. Bez šīs triādes modelis var ignorēt kontekstu un izraisīt halucinācijas, un atbilde kļūst nepārbaudāma.

7. RAG sistēma sniedz nepareizas atbildes. Kur vislabāk sākt diagnostiku?

  • A) Mērīšana, atnest vispirms (Recall@K): vai kādreiz tiek piegādāts pareizais gabals? ✔
  • B) Nekavējoties nomainiet modeli ar lielāku
  • C) Nejauši mainiet uzvedni un turpiniet mēģināt
  • D) Visu dokumentu iegulšana modelī ar precizēšanu

Paskaidrojums: RAG vājākais posms parasti ir ielāde, nevis ražošana. Ja pareizā daļa nekad netiek piegādāta, modelis nevar sniegt šo informāciju neatkarīgi no tā, cik uzvedne tiek uzlabota. Tāpēc vispirms tiek mērīts Recall@K, lai redzētu, vai ir ieradusies pareizā daļa; Ja atnese ir laba, tiek pārbaudīta produkcija un uzvedne.

8. Kādas darbības būtu jāatbalsta, dodot rīku aģentam?

  • A) nav; Aģentam jāspēj veikt visas darbības autonomi
  • B) Tikai atgriezeniskas darbības, piemēram, datu lasīšana un meklēšana
  • C) Neatgriezeniskas vai spēcīgas ietekmes darbības, piemēram, naudas pārskaitīšana, dzēšana, nosūtīšana ✔
  • D) Darbības, kas ietver tikai aprēķinus

Apraksts: Darbības ir atdalītas pēc riska līmeņa. Atgūstamus uzdevumus, piemēram, lasīšanu, meklēšanu, aprēķināšanu un melnrakstu ģenerēšanu var veikt autonomi; Tomēr neatgriezeniskām vai ļoti iedarbīgām darbībām, piemēram, naudas pārskaitīšanai, e-pasta sūtīšanai, datu dzēšanai, pasūtījumu veikšanai utt., ir nepieciešams cilvēka apstiprinājums. Katrai neatsaucamai darbībai ir jāsaņem piekrišana.

9. Kāda ir labākā dizaina pieeja, lai novērstu netiešas tūlītējas injekcijas risku?

  • A) Pietiek sistēmas uzvednei pievienot vienu teikumu “ignorēt sliktas instrukcijas”.
  • B) Piešķiriet modelim lielāku autoritāti, paļaujoties uz norādījumiem ārējā saturā
  • C) Neveiciet nekādus piesardzības pasākumus, jo injekcija nav novēršama
  • D) Ārēja satura kā neuzticamu datu izolēšana un slāņveida aizsardzības izveide ar minimālu autorizāciju, apstiprinājumu un izvades kontroli ✔

Apraksts: ārējais saturs, ko apstrādā aģents vai RAG, piemēram, tīmekļa lapa, dokuments, e-pasts utt., ir neuzticami dati un var saturēt slepenus norādījumus. Pareizā pieeja ir daudzslāņu aizsardzība: ārējā satura izolēšana kā “dati, nevis komandas” ar skaidriem norobežotājiem, minimālas atļaujas piemērošana, neatgriezenisku darbību piesaistīšana cilvēka apstiprinājumam un izvades auditēšana. Ar vienu instrukciju rindiņu nepietiek.

10. Kāda ir galvenā atšķirība, lemjot, vai problēma ir jāatrisina ar precizēšanu vai RAG?

  • A) Informācijas problēmas labāk risina ar RAG, uzvedības/formāta problēmas labāk risina ar precizēšanu ✔
  • B) Katra problēma vienmēr ir jāatrisina, precīzi pielāgojot
  • C) RAG tiek izmantots tikai koda ģenerēšanai, precizēšana tiek izmantota tikai tulkošanai
  • D) Precizitāti vienmēr var atjaunināt lētāk un ātrāk nekā RAG

Paskaidrojums: Precizēšana ir vāja un riskanta, mācot modelim jaunu informāciju; bet ir spēcīgs mācīšanas uzvedībā, formātā, tonī un stilā. “Modeļu uzņēmums nezina mūsu datus” ir informācijas problēma un pieder RAG. “Ļaujiet modelim vienmēr izvadīt mūsu stingrā formātā” ir uzvedības problēma un precīzas pielāgošanas kandidāts. Turklāt pirms precīzas noregulēšanas ir jāizlieto ātri un daži kadri.

11. Kas ir obligāts drošai izvietošanai, nododot jaunu modeli ražošanā?

  • A) Ja modelis ir labs testēšanas laikā, atveriet to tieši 100% datplūsmai
  • B) Pēc izvietošanas vispār netiek iestatīta uzraudzība
  • C) Pakāpeniska izvietošana (ēna/kanārijputniņš) un iepriekš pārbaudīts atcelšanas plāns ✔
  • D) Modeļa publicēšana pat tad, ja nav sasniegts novērtējuma slieksnis

Paskaidrojums. Jaunā modeļa atvēršana tieši visai satiksmei ir riskanti; Ja tas ir nepareizi, tas ietekmē visus. Pareizi ir tas, ka tā ir pakāpeniska izplatīšana (ēna, kanārijputniņš), un katram izplatīšanai ir pārbaudīts atcelšanas plāns. Izplatīšana nav pilnīga bez atgūšanas plāna; Iespēja atgriezties pie iepriekšējās versijas dažu minūšu laikā pasargā lietotāju, ja modelis neparedzēti uzvedas ražošanā.

12. Kā ML modelis var “klusi” neizdoties ražošanā un kā to panākt?

  • A) Modelis sabrūk; servera žurnāli to parāda
  • B) radot nepareizas prognozes, nepieļaujot kļūdas; ✔ Tas uztver darbības, ievades un izvades slāņu uzraudzību
  • C) Modelis nekad nevar neizdoties klusi, vienmēr trauksme
  • D) Pietiek tikai ar latentuma uzraudzību, lai uztvertu jebkādu degradāciju

Paskaidrojums. Modelis var neizdoties, vienkārši radot nepareizas prognozes bez avārijas vai kļūdu parādīšanas; Galvenais iemesls tam ir datu novirze un koncepciju novirze. Nepietiek tikai ar darbības rādītāju (latences, kļūdu īpatsvara) uzraudzību; Jāuzrauga arī ievades sadalījums un izvades/prognozes sadalījums. Ievades novirze sniedz agrīnu brīdinājumu, ja faktiskais rezultāts tiek aizkavēts.

13. Kāds princips ir būtisks, izmantojot LLM kā tiesnesi, lai novērtētu LLM sistēmu?

  • A) LLM tiesnesim vienmēr ir taisnība, cilvēka pārbaude nav nepieciešama
  • B) Tiesnesim jāpieņem lēmums, pamatojoties tikai uz atbildes garumu.
  • C) Ja tiek izmantoti tiesneši, uz noteikumiem balstītas kontroles un cilvēku novērtējums ir pilnībā jāatmet
  • D) Tiesnešu rezultāti ir jākalibrē, izmantojot cilvēku marķētu paraugu, un jāizmēra to novirze, pirms tiem var uzticēties ✔

Apraksts: LLM tiesnesis ir arī modelis; Tas var būt halucinācijas, neobjektīvs (labvēlīgi sniedzot garas, pārliecinošas atbildes) un nekonsekventi. Tāpēc tiesnešu rezultāti ir jākalibrē, izmantojot cilvēku marķētu paraugu, un pirms ražošanas lēmuma pieņemšanas ir jāizmēra to sistemātiskā novirze. Nepārbaudīts tiesnesis sniedz nepatiesu pārliecību.

14. Kāpēc, novērtējot modeļa novirzi, vispārējā precizitāte ir nepietiekama?

  • A) Kopējā precizitāte ir pietiekama, jo tā vienmēr atspoguļo sliktākās grupas sniegumu
  • B) Ar kopējo precizitāti vien nepietiek, jo tā var aizēnot sistemātisku atšķirību (slēptu diskrimināciju) starp apakšgrupām ✔
  • C) Tā kā precizitāte ir metrika, kurai nav nekā kopīga ar neobjektivitāti
  • D) Novirze nāk tikai no modeļa, un tai nav nekāda sakara ar datiem.

Paskaidrojums: kopējā precizitāte var aizēnot sistemātiskas atšķirības starp apakšgrupām. Piemēram, lai gan kopējā precizitāte ir 88%, atmiņā var būt 91% vienā grupā un 67% citā grupā; Modelis sistemātiski izlaiž šo grupu. Tāpēc modelis būtu jāizvērtē, pamatojoties uz apakšgrupām (demogrāfiskie dati/segments), un par to, kura taisnīguma definīcija būtu jāpiešķir prioritātei, būtu jāizlemj kopā ar ieinteresētajām personām.

15. Kādas četras lietas ir jālabo kopā, lai ML rezultāts būtu reproducējams?

  • A) Tikai modeļa nosaukums, izmērs, cena un izlaišanas datums
  • B) Tikai GPU zīmols un interneta ātrums
  • C) tikai modeļa galīgais precizitātes rādītājs; pārējo var paturēt atmiņā
  • D) nejaušības sākums, datu versija, vide (atkarības versijas) un eksperimenta izsekošana ✔

Apraksts: reproducējamība tiek panākta, izmantojot četrus pīlārus: nejaušības sēklu labošana, datu versiju noteikšana (versija/jaukšana), vides iesaldēšana (precīzas bibliotēkas versijas/konteiners) un katra eksperimenta izsekošana (koda izpilde, dati, hiperparametrs, metrika). Bez šīs ķēdes nav iespējams reproducēt to pašu rezultātu; Nereproducējams rezultāts ir apgalvojums, ko nevar pierādīt.