Vienetas 11 / 11

Atkuriamumas ir projektas nuo galo iki galo: visko derinimas

Pelnas:

  • Galimybė užtikrinti atkuriamumą naudojant keturis ramsčius (sėklų fiksavimas, duomenų versijų kūrimas, laikmenos užšaldymas, eksperimento stebėjimas) ir gauti tą patį rezultatą kartojant tą patį paleidimą.
  • Galimybė sujungti visas modulio stoteles (metriką, duomenis, modelį, LLM komponentus, įvertinimą, sąžiningumą, saugumą, paskirstymą, stebėjimą) grandinėje nuo galo iki galo
  • Galimybė patikrinti, ar kritinis sprendimas lieka žmogui kiekvienoje stotelėje, ir dokumentuoti projektą audituojamu būdu

Klastingiausia ML projekto nesėkmė nėra avarija; „Daugiau to paties rezultato nepasiekti“. Jei šiandien negalite atkurti modelio, kurį pradėjote gaminti prieš tris mėnesius, balų, to modelio tikrai nevaldote. Šiame baigiamajame skyriuje mes giliname atkuriamumą: galimybę patikimai gauti tą patį rezultatą su tais pačiais įvestimis ir sujungti visą modulį iki galo projekto disciplinoje.

Kodėl sunku atkurti

Įprastoje programinėje įrangoje tas pats kodas suteikia tą pačią išvestį. ML yra daug daugiau kintamųjų, kurie lemia rezultatą:

  • Atsitiktingumas: duomenų maišymas, svorio inicijavimas, duomenų padalijimas – viskas priklauso nuo atsitiktinumo.
  • Duomenys: tas pats kodas sukuria skirtingą modelį su skirtinga duomenų versija.
  • Aplinka: bibliotekos versijos, aparatinė įranga (CPU / GPU), net operacinė sistema gali pakeisti rezultatą.
  • Paslėptas atvejis: neišsaugotas hiperparametras, rankinis išankstinio apdorojimo veiksmas, nepažymėtas pasirinkimas.

Atkuriamumas yra ne „malonu turėti“, o mokslinis ir inžinerinis reikalavimas. Rezultatas, kurio negalima atkurti, yra teiginys, kurio negalima įrodyti.

Keturi atkuriamumo ramsčiai

1. Pataisykite atsitiktinumą. Nustatykite visas atsitiktines sėklas vienoje vietoje: duomenų padalijimą, modelio inicijavimą, duomenų maišymą. Fiksuota sėkla yra „to paties rezultato, kai kartosite tą patį paleidimą“ garantijos pagrindas.

2. Versijuokite duomenis. Įrašykite, su kuria duomenų versija buvo atliktas kiekvienas eksperimentas (duomenų versijų nustatymas 2 skyriuje). „Naujausi duomenys“ yra neaiškūs; „Data version v3, hash abc123“ yra tikslus.

3. Užšaldykite terpę. Prisegkite visas priklausomybes prie tikslių jų versijų (pvz., tikslios versijos, pvz., numpy==1.26.4 faile requirements.txt arba sudėtinio rodinio vaizdas). „Naujausia versija“ vieną dieną viską sulaužys.

4. Stebėkite viską (eksperimento sekimas). Automatiškai išsaugokite kiekvienam eksperimentui: kodo versiją (git commit), duomenų versiją, visus hiperparametrus, metriką ir išvesties struktūras. Eksperimentų stebėjimo įrankiai, tokie kaip MLflow, Weights & Biases, tai daro sistemingai. Neužsiregistravus, klausimas „kuris nustatymas buvo geriausias“ lieka neatsakytas.

Atsargiai: „Prisiminsiu vėliau“ yra pati brangiausia klaida. Po dviejų savaičių jūs neprisiminsite, kurią sėklą, kokius duomenis, kurį hiperparametrą naudojote. Automatinis sekimas pašalina priklausomybę nuo atminties.

Silpnas požiūris / Stiprus požiūris

Silpnas: „Radau geriausią modelį, jis yra užrašų knygelėje, manau, kad jo balas buvo 89 proc.“.

Stiprus: "Eksperimento stebėjimo įrankyje vykdykite #147: git commit a3f9c, duomenų versija v3 (hash abc123), seed 42, visi hiperparametrai užregistruoti, testuokite PR-AUC 0.887. Kai vėl paleidžiu tą pačią komandą, po truputį gaunu tą patį rezultatą. Modelis priklauso nuo šio paleidimo registre."

Skirtumas: naudojant stiprų požiūrį, rezultatas grindžiamas ne atmintimi, o fiksuota ir stebima grandine. Kiekvienas gali pasiekti tą patį rezultatą kiekvieną kartą.

Projektas iki galo: modulio derinys

Dabar sujungkime visą modulį į vieną projekto srautą. Tikra ML sistema praeina per šiuos sustojimus, o kiekviena stotelė remiasi ankstesne:

  1. Problemos apibrėžimas: ką mes sprendžiame, kaip išmatuoti sėkmę (3 skyrius: teisinga metrika, verslo kontekstas). Metrika ir slenkstis yra aiškūs nuo pat pradžių.
  2. Duomenų srautas: rinkimas, patvirtinimas, valymas, skaidymas be nuotėkio, versijų kūrimas (2 skyrius).
  3. Modelio kūrimas: mokymas, pradinio lygio palyginimas, kryžminis patvirtinimas, kietoji sėkla (3 vienetas + šis vienetas).
  4. LLM komponentai (jei taikoma): RAG (4 skyrius) ir (arba) agentai (5 skyrius); jei reikia, patikslinkite (6 blokas).
  5. Vertinimas: eval klasteris su briaunomis ir saugumo atvejais, daugiasluoksnis įvertinimas LLM sistemose (8 skyrius).
  6. Teisingumo ir etikos auditas: Pogrupių analizė, modelio kortelė, paaiškinamumas (10 skyrius).
  7. Saugumo auditas: greitas įpurškimas, privatumas, tiekimo grandinė (9 skyrius).
  8. Platinimas: pakavimas, laipsniškas paskirstymas, atšaukimas, modelių registras (7 vienetas).
  9. Stebėjimas: Trijų sluoksnių stebėjimas, dreifo signalizacija (8 blokas).
  10. Atkuriamumas: sėklos, duomenų versijos, laikmenos ir eksperimento sekimas visoje grandinėje (šis įrenginys).

Šiame sraute AI yra greitintuvas ir planų generatorius kiekvienoje stotelėje; bet metrikos pasirinkimas, duomenų sprendimai, sąžiningumo prioritetų nustatymas, diegimo slenkstis ir išleidimo patvirtinimas – svarbiausi sprendimai lieka žmogui. Tai yra modulio esmė.

Dokumentacija: ateitis jums padėkos

Geras ML projektas dokumentuoja save. Turėtų būti parašyta bent ši informacija: problemos ir sėkmės kriterijai, duomenų šaltinis ir versija, modelių pasirinkimas ir pagrindimas, vertinimo rezultatai (įskaitant pogrupius), žinomos ribos ir rizika, diegimo ir paieškos procedūra, stebėjimo planas. Šis dokumentas yra geriausias draugas žmogaus (galbūt tai jūs), kuris grįžta į projektą po šešių mėnesių.

trys mini dėklai

1 atvejis – prarastas rezultatas. Inžinierius parengė puikų modelį, bet jis nepataisė sėklos ir neišsaugojo duomenų versijos. Kai jis paliko darbą, niekas negalėjo atkurti to rezultato; modelis tapo „juodosios dėžės legenda“ ir galiausiai buvo sukurtas nuo nulio. Savaitės buvo sugaištos. Pamoka: neatkuriamas rezultatas yra neegzistuojantis rezultatas.

2 atvejis – aplinkos žlugimas. Viena komanda neištaisė priklausomybių. Kai biblioteka buvo automatiškai atnaujinta, modelio išėjimai tyliai pasikeitė ir gamyba buvo sutrikdyta. Problemai rasti prireikė dienų. Kai priklausomybės buvo įšaldytos ir sudėtos į galutines versijas, problema nepasikartojo. Pamoka: užšaldykite aplinką.

3 atvejis – stebėjimo galia. Komanda automatiškai stebėjo kiekvieną eksperimentą. Po trijų mėnesių, per reguliavimo auditą, jie atsakė į klausimą "su kokiais duomenimis, su kokiais nustatymais, kokius rezultatus jis gavo kokiose grupėse?" su visu įrašu per kelias minutes. Apžiūra praėjo sklandžiai. Pamoka: stebėjimas yra atitikties įrankis, o ne tik inžinerinis.

Kopijuojami šablonai

Atlikite šio ML projekto atkuriamumo patikrą.- Ar visos atsitiktinumo pradinės dalys yra nustatytos (padalytos, inicijuojamos, sumaišomos)?- Ar duomenų versijos?- Ar priklausomybės užšaldytos iki tikslių versijų?- Ar stebimas kiekvienas eksperimentas (kodo įvedimas, duomenys, hiperparametras, metrika)? Parašykite konkrečius veiksmus, kaip taisyti kiekvienam trūkstamam stulpeliui.Projekto struktūra: [aprašas]

Sukurkite šio visapusiško ML projekto plano skeletą. Problema: [aprašymas] Uždenkite šias stoteles ir pažymėkite, kur yra ŽMOGAUS sprendimas: problema / metrika, konvejeris, modelis, (RAG / agentas / tiksli derinimas?), eval, sąžiningumas, saugumas, paskirstymas, stebėjimas, atkuriamumas. Parašykite kiekvieno sustojimo pagrindinę riziką ir patikrinimo veiksmą.

Sukurkite šio projekto techninės dokumentacijos šabloną. Skyriai: problema+sėkmės kriterijai, duomenys (šaltinis+versija), modelių parinktys+pagrindinimas, įvertinimas (įskaitant pogrupius), žinomos ribos+rizika, diegimas+atšaukimas, stebėjimo planas. Laukus, kuriuos reikia užpildyti kiekvienam skyriui, nurodykite kaip klausimus.

Patikrinkite mano eksperimento stebėjimo sąranką: ar ji automatiškai išsaugoma kiekvieną kartą vykdant: git commit, duomenų versija / maiša, visi hiperparametrai, visa metrika, aplinka (bibliotekos versijos)? Ar gaunu tą patį rezultatą, kai vėl bėgu tą patį? Sąranka: [aprašymas]. Išvardykite trūkumus ir pataisykite.

Atkuriamumo stulpelių lentelė

stulpelyje

Kas pataisyta

Transporto priemonės pavyzdys

atsitiktinumas

visos sėklos

sėklų nustatymas

Duomenys

Duomenų versija / maiša

DVC

aplinką

Bibliotekos versijos

reikalavimų kaištis, Docker

Stebėjimas

Kodas+duomenys+nustatymas+metrika

MLflow, W&B

Dažnos klaidos

  • Netaiso sėklos. Rezultatas negali būti kartojamas.
  • Neišsaugoma duomenų versija. "Su kokiais duomenimis?" lieka neatsakyta.
  • Neužšaldančios priklausomybės. Atnaujinimas tyliai viską sulaužys.
  • Palikti eksperimentus atminčiai. Po dviejų savaičių nieko neprisimena.
  • Palikti svarbius sprendimus dirbtiniam intelektui. Metrika, teisingumas ir paskirstymo sprendimai turėtų likti žmonėms.
  • Dokumentacijos atidėjimas. Būsimoji komanda (ir jūs) sumokėsite kainą.

Apibendrinant

Atkuriamumas yra rimtos ML inžinerijos požymis: neatkuriamas rezultatas yra neįrodomas teiginys. Jame yra keturi stulpeliai – pataisykite atsitiktinumą, versijos duomenis, užfiksuokite aplinką, stebėkite kiekvieną eksperimentą. Projektas nuo galo iki galo sujungia visas šio modulio stoteles (metriką, duomenis, modelį, LLM komponentus, eval, sąžiningumą, saugumą, paskirstymą, stebėjimą) į tarpusavyje susijusią grandinę; Dirbtinis intelektas yra greitintuvas kiekvienoje stotelėje, tačiau svarbiausi sprendimai lieka žmogui. Viską dokumentuokite – būsimai komandai ir auditams. Ši disciplina yra sistema, kuri palaiko viską, ko išmokstate per modulį.

Taikymo užduotis

Patikrinkite ML projektą pagal keturis atkuriamumo ramsčius: ar sėklos yra nekintamos, ar duomenų versijos, ar aplinka užšaldyta, ar eksperimentai stebimi? Pataisykite trūkstamus stulpelius ir įrodykite, kad galite paleisti tą patį paleidimą du kartus ir gauti tą patį rezultatą. Tada viename puslapyje išveskite visą projekto eigą (10 sustojimų) ir kiekvienoje stotelėje pažymėkite „kur yra žmogaus sprendimas“. Galiausiai parašykite trumpą techninės dokumentacijos projektą.

kontrolinis sąrašas

  • [ ] Ištaisytos visos atsitiktinumo sėklos.
  • [ ] Duomenų versija / maiša įrašoma su kiekvienu eksperimentu.
  • [ ] Priklausomybės užšaldytos iki tvirtų versijų (smeigtukas / konteineris).
  • [ ] Kiekvienas eksperimentas stebimas automatiškai (kodas+duomenys+nustatymas+metrika).
  • [ ] Kai kartoju tą patį bėgimą, gaunu tą patį rezultatą.
  • [ ] Patikrinau ir patvirtinau dokumentais, kad svarbiausius sprendimus sraute nuo galo iki galo priima žmonės.

Modulio egzaminas

1. Koks yra geriausias ML inžinierius dirbtinio intelekto pozicionavimo darbo eigoje būdas?

  • A) AI yra mažos rizikos verslo akceleratorius; Svarbūs sprendimai, tokie kaip metrika, duomenys ir gamyba, lieka patvirtinti ir paliekami žmogui ✔
  • B) Kol AI išėjimai atrodo gerai, tikrinti nereikia
  • C) Palikdami sprendimą pradėti modelį gaminti dirbtiniam intelektui, sutaupysite laiko.
  • D) Dirbtinis intelektas naudingas tik teksto rašymui, jis neturi nieko bendra su duomenų ir modelių darbu

Aprašymas: AI yra galingas greitintuvas, skirtas mažos rizikos, lengvai patikrinamoms užduotims, tokioms kaip kodas, duomenų santraukos ir dokumentai; Tačiau atsakomybė už sprendimus, turinčius įtakos pinigams, konfidencialumui ir teisinei atsakomybei, pavyzdžiui, metrikos atranka, kurios duomenys naudojami mokymui ir modelio paleidimui į gamybą, tenka kvalifikuotam inžinieriui ir komandai. Kiekviena išvestis neturėtų būti naudojama be patikrinimo.

2. Kodėl schemos patvirtinimas yra duomenų konvejerio pradžioje?

  • A) Nes tai tiesiogiai padidina modelio tikslumą
  • B) Nes dėl to duomenų versijų kūrimas nereikalingas
  • C) Nes sugadintus duomenis sugauna anksčiausiai ir pigiausiai ir neleidžia jiems nutekėti atliekant kitus veiksmus ✔
  • D) Kadangi tai pašalina poreikį ženklinti

Paaiškinimas: kuo anksčiau sugadinti duomenys sugaunami, tuo pigiau juos ištaisyti. Schemos patvirtinimas apsaugo nuo sugadintų duomenų tyliai nutekėjimo į mokymą ar gamybą, nes eilutės pradžioje atmetami duomenys, kurie nepatenka į numatytą tipą ir diapazoną (pvz., kaina pasislenka 100 kartų keičiant vienetą); Ta pati klaida, pagauta gamyboje, yra daug kartų brangesnė.

3. Koks yra teisingas metodas skirstant duomenis į mokymą ir testavimą, kai problema susijusi su laiku (laiko eilutė)?

  • A) Atsitiktinis padalijimas, nes tai visada yra teisingiausias metodas
  • B) Laikinojo padalijimo naudojimas: užkirskite kelią nuotėkiui mokydamiesi praeities ir išbandydami ateityje ✔
  • C) Visų duomenų naudojimas ir mokymui, ir testavimui
  • D) Bandymo duomenų įtraukimas į mastelio parametrus prieš treniruotę

Paaiškinimas: Atsitiktinis padalijimas pagal laiko eilutes suteikia modeliui pranašumą, kuris niekada nebus gamyboje, ir dirbtinai padidina metriką (laikinis nutekėjimas). Teisingas yra laiko padalijimas: treniruokitės su praeitimi, išbandykite ateitį. Tai matuoja tikrąjį našumą, dėl kurio jis išlieka gamyboje.

4. Kodėl sukčiavimo aptikimo modelio, kurio teigiama klasė yra 1,5 %, tikslumas yra klaidinantis?

  • A) Nes nesubalansuotų duomenų tikslumas visada yra mažas
  • B) Kadangi tikslumas gali būti naudojamas tik regresijos problemoms spręsti
  • C) Kadangi tikslumo skaičiavimas reikalauja daug apdorojimo galios
  • D) Net menkas modelis, numatantis daugumos klasę, gali būti labai tikslus, taip slepiantis tikrą sėkmę ✔

Paaiškinimas: esant nesubalansuotiems duomenims, net pagrindinis modelis, kuriame sakoma „vadinti viską, kas neigiama“, yra maždaug 98,5 % tikslumas, bet neužfiksuos nė vieno sukčiavimo. Todėl nesubalansuotoje klasifikacijoje vietoj tikslumo naudojamas tikslumas, atšaukimas, F1 arba PR-AUC, o kiekviena metrika interpretuojama pagal bazinį modelį.

5. Kodėl, kalbant apie modelio metriką, būtinas palyginimas?

  • A) Kadangi pagrindinis modelis visada yra geresnis už tikrąjį modelį
  • B) Nes aišku, ar metrika yra reikšminga, ar ne, tik palyginus su paprastu baziniu modeliu ✔
  • C) Kadangi dėl bazinio modelio kryžminis patvirtinimas nereikalingas
  • D) Kadangi pagrindinis modelis yra teisiškai reikalaujamas kiekvienoje ataskaitoje

Paaiškinimas: metrika pati savaime nėra gera ar bloga; Pagal pagrindinį modelį jis yra geras ar blogas. Sakinys „85% teisingas“ reiškia beveik bevertį, jei bazinis modelis jau gauna 84%, ir tobulas, jei jis gauna 50%. Be palyginimo inkaro metrika yra beprasmė.

6. Kuris yra svarbiausias saugos elementas, kuris turėtų būti įtrauktas į RAG (Retrieval-Augmented Generation) sistemos gamybos užklausą?

  • A) Nurodymas pasikliauti tik pateiktu šaltiniu, pasakyti „nežinau“, jei šaltinio nėra, ir nurodyti šaltinį ✔
  • B) Nurodykite modeliui pateikti kuo ilgesnius ir kūrybiškesnius atsakymus
  • C) Modelis teikia pirmenybę savo švietimo žinioms, o ne ištekliams
  • D) Įgyvendinkite visus nurodymus dokumentuose, pateiktuose kaip komandas

Paaiškinimas: Vienintelis svarbiausias RAG nurodymas yra nurodyti modeliui pasikliauti tik pateiktu šaltiniu, o jei informacijos šaltinyje nėra, pasakykite „nežinau“ ir nurodykite šaltinį jo nesugalvodami. Be šios triados modelis gali nepaisyti konteksto ir sukelti haliucinacijas, o atsakymas tampa nepatvirtintas.

7. RAG sistema pateikia neteisingus atsakymus. Kur geriausia pradėti diagnozę?

  • A) Išmatuoti paimti pirmiausia (Recall@K): ar kada nors atkeliauja tinkama dalis? ✔
  • B) Nedelsdami pakeiskite modelį didesniu
  • C) Atsitiktinai pakeiskite raginimą ir bandykite toliau
  • D) Visų dokumentų įterpimas į modelį su tiksliu derinimu

Paaiškinimas: silpniausia RAG grandis dažniausiai yra gavimas, o ne gamyba. Jei teisinga dalis niekada nepateikiama, modelis negali pateikti tos informacijos, nesvarbu, kiek raginimas būtų patobulintas. Todėl pirmiausia išmatuojamas Recall@K, kad būtų galima pamatyti, ar atkeliavo tinkama dalis; Jei atnešimas geras, tada tikrinama gamyba ir raginimas.

8. Kokie veiksmai turėtų būti atliekami už žmogaus pritarimą duodant įrankį agentui?

  • A) Nėra; Agentas turi sugebėti kiekvieną veiksmą atlikti savarankiškai
  • B) Tik grįžtami veiksmai, tokie kaip duomenų skaitymas ir paieška
  • C) Negrįžtami arba didelio poveikio veiksmai, tokie kaip pinigų pervedimas, trynimas, siuntimas ✔
  • D) Veiksmai, kurie apima tik skaičiavimus

Aprašymas: Veiksmai yra atskirti pagal rizikos lygį. Atkuriamos užduotys, tokios kaip skaitymas, paieška, skaičiavimas ir juodraščių generavimas, gali būti atliekamos savarankiškai; Tačiau negrįžtamiems ar didelio poveikio veiksmams, tokiems kaip pinigų pervedimas, el. laiškų siuntimas, duomenų trynimas, užsakymų pateikimas ir pan., reikalingas žmogaus pritarimas. Kiekvienas neatšaukiamas veiksmas turi būti sutiktas.

9. Koks yra geriausias projektavimo metodas, apsaugantis nuo netiesioginio greito įpurškimo rizikos?

  • A) Pakanka į sistemos raginimą įtraukti vieną sakinį „nepaisyti blogų nurodymų“.
  • B) Suteikite modeliui daugiau autoritetų, remdamiesi išorinio turinio instrukcijomis
  • C) Nesiima jokių atsargumo priemonių, nes injekcijos išvengti nepavyks
  • D) Išorinio turinio kaip nepatikimų duomenų išskyrimas ir daugiasluoksnės apsaugos nustatymas su minimaliu įgaliojimu, patvirtinimu ir išvesties kontrole ✔

Aprašymas: agento arba RAG apdorojamas išorinis turinys, pvz., tinklalapis, dokumentas, el. laiškas ir kt., yra nepatikimi duomenys ir jame gali būti slaptų nurodymų. Teisingas požiūris yra daugiasluoksnė gynyba: išorinio turinio išskyrimas kaip „duomenys, o ne komandos“ su aiškiais skyrikliais, minimalių įgaliojimų taikymas, negrįžtamų veiksmų susiejimas su žmogaus patvirtinimu ir išvesties auditas. Vienos instrukcijų eilutės neužtenka.

10. Koks yra pagrindinis skirtumas sprendžiant, ar problema turi būti sprendžiama koregavimu, ar RAG?

  • A) Informacinės problemos geriau išsprendžiamos naudojant RAG, elgsenos / formato problemos geriau išsprendžiamos koreguojant ✔
  • B) Kiekviena problema visada turi būti išspręsta tikslinant
  • C) RAG naudojamas tik kodo generavimui, koregavimas naudojamas tik vertimui
  • D) Tikslų derinimą visada galima atnaujinti pigiau ir greičiau nei RAG

Paaiškinimas: Tikslus derinimas yra silpnas ir rizikingas mokant modelį naujos informacijos; bet yra galingas mokantis elgesio, formato, tono ir stiliaus. „Modelinė įmonė nežino mūsų duomenų“ yra informacinė problema ir priklauso RAG. „Tegul modelis visada rodomas mūsų griežtu formatu“ yra elgesio problema ir tikslinga. Be to, prieš koreguojant reikia atlikti greitus ir kelis kadrus.

11. Kuris yra privalomas saugiam diegimui pradedant gaminti naują modelį?

  • A) Jei modelis yra geras bandymo metu, atidarykite jį tiesiogiai 100 % srautui
  • B) Po įdiegimo visiškai nenustatoma stebėjimo
  • C) Laipsniškas diegimas (šešėlis / kanarėlė) ir iš anksto patikrintas atšaukimo planas ✔
  • D) Modelio paskelbimas, net jei vertinimo riba nesiekiama

Paaiškinimas: Naujojo modelio atidarymas tiesiogiai visam srautui yra rizikingas; Jei negerai, nukenčia visi. Teisingas dalykas yra tai, kad tai yra laipsniškas platinimas (šešėlis, kanarėlė) ir kiekvienas platinimas turi patikrintą atšaukimo planą. Paskirstymas nėra baigtas be susigrąžinimo plano; Galimybė per kelias minutes grįžti prie ankstesnės versijos apsaugo vartotoją, kai modelis gamyboje elgiasi netikėtai.

12. Kaip ML modelis gali „tyliai“ sugesti gamyboje ir kaip tai padaryti?

  • A) Modelis žlunga; serverio žurnalai tai rodo
  • B) rengiant klaidingas prognozes, nedarant klaidų; ✔ Užfiksuoja operatyvinį, įvesties ir išvesties daugiasluoksnį stebėjimą
  • C) Modelis niekada negali tyliai žlugti, visada žadina
  • D) Pakanka stebėti delsą, kad būtų galima pastebėti bet kokį pablogėjimą

Paaiškinimas: modelis gali sugesti paprasčiausiai pateikiant neteisingas prognozes, nesuduždamas ir nepateikdamas klaidų; Pagrindinė to priežastis yra duomenų ir koncepcijų dreifas. Neužtenka vien stebėti veiklos rodiklius (delsą, klaidų dažnį); Taip pat turėtų būti stebimas įvesties paskirstymas ir išvesties / numatymo paskirstymas. Įvesties poslinkis iš anksto įspėja, jei tikrasis rezultatas vėluoja.

13. Koks principas yra esminis naudojant LLM kaip teisėją vertinant LLM sistemą?

  • A) LLM teisėjas visada teisus, žmogaus tikrinimas nereikalingas
  • B) Teisėjas turi priimti sprendimą remdamasis tik atsakymo trukme.
  • C) Taisyklėmis pagrįstos kontrolės priemonės ir žmogaus vertinimas turėtų būti visiškai atmesti, kai naudojami teisėjai
  • D) Teisėjų balai turi būti sukalibruoti naudojant žmogaus paženklintą mėginį ir išmatuotas jų šališkumas, kad jais būtų galima pasitikėti ✔

Aprašymas: LLM teisėjas taip pat yra modelis; Jis gali būti haliucinacinis, neobjektyvus (linkęs atsakyti į ilgus, patikimus atsakymus) ir nenuoseklus. Todėl teisėjų balai turi būti sukalibruoti naudojant žmogaus paženklintą mėginį, o prieš priimant sprendimą dėl gamybos turi būti išmatuotas sistemingas jų šališkumas. Nepatvirtintas teisėjas suteikia klaidingą pasitikėjimą.

14. Kodėl vertinant modelio paklaidą nepakanka žiūrėti į bendrą tikslumą?

  • A) Bendras tikslumas yra pakankamas, nes jis visada atspindi prasčiausios grupės rezultatus
  • B) Vien bendro tikslumo nepakanka, nes jis gali užgožti sisteminį skirtumą (paslėptą diskriminaciją) tarp pogrupių ✔
  • C) Kadangi tikslumas yra metrika, neturinti nieko bendra su šališkumu
  • D) Šališkumas kyla tik iš modelio ir neturi nieko bendra su duomenimis.

Paaiškinimas: bendras tikslumas gali užgožti sisteminius skirtumus tarp pogrupių. Pavyzdžiui, nors bendras tikslumas yra 88%, prisiminimas gali būti 91% vienoje grupėje ir 67% kitoje grupėje; Modelis sistemingai praleidžia tą grupę. Todėl modelis turėtų būti vertinamas remiantis pogrupiais (demografija/segmentas), o kuriam teisingumo apibrėžimui teikti pirmenybę, reikėtų nuspręsti kartu su suinteresuotosiomis šalimis.

15. Kokie keturi dalykai turi būti ištaisyti kartu, kad ML rezultatas būtų atkuriamas?

  • A) Tik modelio pavadinimas, dydis, kaina ir išleidimo data
  • B) Tik GPU prekės ženklas ir interneto greitis
  • C) Tik galutinis modelio tikslumo balas; likusieji gali būti išsaugoti atmintyje
  • D) Atsitiktinumo pradžia, duomenų versija, aplinka (priklausomybės versijos) ir eksperimento sekimas ✔

Aprašymas: atkuriamumas pasiekiamas keturiais ramsčiais: atsitiktinumo pradmenų taisymas, duomenų versijų nustatymas (versija / maiša), aplinkos užšaldymas (tikslios bibliotekos versijos / sudėtinis rodinys) ir kiekvieno eksperimento stebėjimas (kodo įvedimas, duomenys, hiperparametras, metrika). Be šios grandinės neįmanoma atkurti to paties rezultato; Neatkuriamas rezultatas yra teiginys, kurio negalima įrodyti.