Jedinica 8 / 11

Ocjenjivanje i praćenje: znati šta model zaista radi u proizvodnji

Dobici:

  • Sposobnost prepoznavanja tihih uzroka degradacije modela (pomicanje podataka, pomicanje koncepta, uzvodna greška) i uspostavljanje troslojnog (operativnog, ulaznog, izlaznog) praćenja
  • Sposobnost evaluacije LLM sistema u više slojeva s provjerama pravila, LLM-refere i ljudske evaluacije, i kalibracije s LLM-refere ljudskim sidrom
  • Sposobnost dizajniranja eval skupa koji sadrži rubne i sigurnosne slučajeve i pretvaranje svake uhvaćene greške u trajni test slučaj

Jednom kada model krene u proizvodnju, vaš posao nije završen; Prava odgovornost tek počinje. Zato što se model može nečujno pokvariti kada niko ne gleda. U ovoj cjelini pokrivamo dvije komplementarne discipline: evaluaciju (sistematsko mjerenje kvaliteta modela) i monitoring (stalno praćenje modela u proizvodnji). Posebno u LLM sistemima, eval je teži i zahtijeva više pažnje od klasičnog ML-a.

Zašto se proizvodni model tiho kvari

Greška se ruši, zapisnik se štampa, alarm se uključuje. ML model, s druge strane, može biti pogrešan, a da ne uzrokuje greške. Tri glavna uzroka degradacije:

  • Drift podataka: Distribucija ulaznih podataka se mijenja tokom vremena (novi proizvodi, mijenjanje ponašanja korisnika, sezonalnost). Model ostaje isti, ali svijet se mijenja.
  • Pomicanje koncepta: mijenja se odnos ulaz-izlaz. Taktike prevare i obrasci neželjene pošte se razvijaju; Ono što je juče bilo ispravno, danas će biti pogrešno.
  • Upstream korupcija: izvor podataka mijenja format, područje postaje slobodno; Model tiho slini od pokvarenog unosa.

Praćenje čini ove tihe distorzije čujnim.

Šta gledati: tri sloja

Dobro praćenje pokriva tri sloja:

  1. Operativna metrika: Latencija, stopa grešaka, obim zahtjeva, korištenje resursa. "Da li sistem stoji?"
  2. Podaci/ulazni pokazatelji: Da li je distribucija ulaza slična onoj u obuci? Da li se stopa vrijednosti koja nedostaje povećala? Jesu li stigle nove kategorije? "Da li model vidi poznate podatke?"
  3. metrika modela/izlaza: Dnevnik distribucije predviđanja? Da li su rezultati samopouzdanja pali? I ako je moguće, koja je točnost u poređenju sa osnovnom istinom? “Je li model još uvijek tačan?”

Treći sloj je najvredniji, ali najteži; jer pravi rezultat obično dolazi sa zakašnjenjem (postaje jasno nakon mjeseci da li će kredit biti otplaćen ili ne).

Savjet: Ako stvarni rezultat kasni, prvo pratite distribuciju ulaza i predviđanja. Pomak distribucije ulaza je rani znak degradacije tačnosti i može izazvati alarm bez čekanja na stvarni rezultat.

Evaluacija LLM sistema: poseban izazov

U klasičnom ML-u, "tačan odgovor" je jasan (klasa 0 ili 1). S druge strane, ishod LLM-a je otvoren: može biti mnogo tačnih odgovora na isto pitanje, "ispravnost" se ne uklapa u jedan broj. Pristupi LLM evaluacije:

  • Referentne metrike: Poređenje rezultata sa idealnim odgovorom. Limited; jer može smatrati tačan odgovor drugačije izražen kao "pogrešan".
  • Provjere zasnovane na pravilima: Da li je izlaz važeći JSON? Ima li zabranjenih riječi? Da li sadrži željena polja? Jeftino, pouzdano, čvrsto.
  • LLM-sudija (LLM-kao-sudija): Nemojte tjerati model da pita "da li je ovaj odgovor dobar prema ovom kriteriju?" Skala je, ali sam sudija mora biti verifikovan.
  • Ljudski pregled: Zlatni standard, ali skup i spor. Koristi se na uzorku.

U praksi se koriste zajedno: jeftine provjere pravila za svaki izlaz, LLM-procjena na velikom uzorku, ljudska evaluacija na malom, ali rigoroznom uzorku.

Slab pristup / Snažan pristup

Slabo: "LLM-pitao sam sudiju, 92% naših odgovora je bilo dobro. Sistem je odličan."

Güçlü: "Prvo smo označili 100 ispisa ljudi. Proveli smo LLM-sudiju na istih 100 ispisa i izmjerili slaganje ljudi i sudije — 85% slaganja, prihvatljivo. Dokumentirali smo gdje je sudija sistematski pogriješio (sklonost da dugi odgovori budu nepravedno dobri) i popravili njegov rezultat povjerili smo sudiji. Tek tada smo povjerili sudiji."

Razlika: jak pristup verifikuje sudiju ljudskim sidrom, a ne slepo. Neprovjereni LLM sudija daje lijep izgled, ali lažno samopouzdanje.

Pažnja: LLM-refere je takođe model; halucinogena, pristrasna (pogoduje dugim/sigurnim odgovorima), može biti nedosljedna. Kalibrirajte sudijske rezultate pomoću ljudskih oznaka prije donošenja odluka o produkciji.

Set za evaluaciju: pažljivo dizajniran

Dobar set za evaluaciju predstavlja raznovrsnost stvarne upotrebe i teških slučajeva. Eval ispunjen samo lakim primjerima ostavit će vas u lažnom povjerenju. Obavezno ga stavite u eval klaster:

  • Rubni slučajevi: prazan unos, veoma dug unos, neobičan format.
  • Poznati teški slučajevi: Primjeri u kojima je model napravio greške u prošlosti (kao regresijski test).
  • Sigurnosni incidenti: brzi pokušaji ubrizgavanja, zlonamjerni zahtjevi, zamke kršenja privatnosti.

Eval klaster vremenom raste: svaka nova greška koju uhvatite u proizvodnji postaje testni slučaj za sljedeću evaluaciju.

Alarm i intervencija

Monitoring ostaje nepotpun bez alarma. Trebao bi postojati prag i plan odgovora za svaku važnu metriku: "Obavijesti inženjera ako odstupanje unosa premaši X", "Automatsko vraćanje unatrag ako stopa greške premaši Y". Neka alarmi budu smisleni – previše lažnih alarma desenzibilizira tim i čini ih da propuste pravi alarm.

tri mini kofera

Slučaj 1 - Rano upozorenje. Prava tačnost modela predviđanja potražnje postala je očigledna tek krajem sedmice. Tim je pratio distribuciju inputa i uočio je nagli porast nove kategorije proizvoda u utorak - nešto što model nikada nije vidio. Ažurirali su model ne čekajući pad preciznosti. Nadgledanje unosa ušteđenih dana.

Slučaj 2 - Neprovjereni sudija. Jedan tim je rekao da je "naš kvalitet odličan" na osnovu LLM-recenzenta. Kada su se pritužbe kupaca povećale, uveden je ljudski nadzor: sudija je samouvjerene, ali netačne odgovore računao kao "dobre". Nakon što je sudija kalibriran ljudskim oznakama, otkriven je pravi kvalitet koji je bio mnogo niži. Pouka: ne vjerujte sudiji a da to ne potvrdite.

Slučaj 3 - Regresijsko testiranje. Brza promjena riješila je jedan problem dok je tiho prekinula drugi. Ali tim je zadržao prošle greške u kanti za procjenu; Kada je nova promjena testirana na ovom klasteru, pokvareni slučaj je odmah uhvaćen i promjena je popravljena. Lekcija: svaka ispravljena greška treba da postane trajni test slučaj.

Predlošci koji se mogu kopirati

Napravite plan praćenja za ovaj proizvodni model. Pokrijte tri sloja: 1) Operativni (latencija, stopa grešaka, volumen)2) Ulaz/podaci (pomak distribucije, nedostajuća vrijednost, nova kategorija)3) Model/izlaz (distribucija predviđanja, pouzdanost, tačnost ako je moguće) Model: [opis]. Koliko vremena je potrebno da stigne stvarni rezultat: [trajanje]Dodajte prag i preporuku za intervenciju za svaku metriku.

Predložite strategiju evaluacije (evaluacije) za ovaj LLM sistem. Zadatak: [opis] Odredite slojeve:- Koje provjere zasnovane na pravilima treba da se pokreću na svakom izlazu?- Koje kriterijume LLM-arbitar treba da procijeni i kako ih treba validirati (ljudsko sidro)?- U kojem uzorku treba izvršiti ljudsku evaluaciju? Navesti rubove i sigurnosne slučajeve koje bih trebao postaviti u val.

Provjerite ovaj upit LLM-refere:- Jesu li kriteriji evaluacije jasni ili subjektivni?- Je li sklon pristranosti dužine/pouzdanja?- Kako da kalibriram sudiju s ljudskim oznakama? Sudijski upit: [uvjet]

Napišite runbook odgovora za ovaj nadzorni alarm. Alarm: [npr. prag pomaka ulaza prekoračen]Mora sadržavati: početne kontrolne korake, moguće uzroke, kriterije vraćanja, koga obavijestiti.

Tabela uzroka pogoršanja

izobličenje

simptom

Put do ranog otkrivanja

drift podataka

Promjene u distribuciji ulaza

Nadzor distribucije ulaza

promena koncepta

Pravednost tiho pada

Predviđanje + stvarno poređenje

upstream error

Polja postaju prazna/format se mijenja

Validacija šeme + stopa nedostajućih

Nedosljednost modela

Pomaci distribucije izlaza

Nadzor distribucije izlaza

Uobičajene greške

  • Neuspostavljanje monitoringa. Model se tiho kvari, niko ga ne vidi.
  • Pratite samo operativne metrike. Sistem je pokrenut, ali predviđanja mogu biti pogrešna.
  • Korištenje LLM bez verifikacije sudije. To daje lažno samopouzdanje.
  • Procijenite jednostavnim primjerima. To ne ukazuje na stvarnu poteškoću.
  • Ne uključujući prethodne greške u evaluaciji. Ponovo se vraća ista greška.
  • Glasni alarmi. Tim postaje desenzibiliziran, nedostaje pravi alarm.

Ukratko

Model može biti netačan, a da ne uzrokuje greške u proizvodnji; tako da su evaluacija i praćenje jednako važni kao i razvoj. Uspostaviti praćenje na tri nivoa (operativni, ulazni, izlazni); Koristite input drift kao rano upozorenje ako stvarni rezultat kasni. U LLM sistemima, eval je otvorenog tipa; Koristite provjere pravila, LLM-refere i ljudsku evaluaciju zajedno - ali budite sigurni da ste potvrdili LLM-refere s ljudskim sidrom. Obogatite svoj Eval klaster rubnim i sigurnosnim slučajevima i pretvorite svaku uhvaćenu grešku u trajni test slučaj.

Zadatak aplikacije

Napišite troslojni plan praćenja za proizvodni (ili skoro proizvodni) model i definirajte prag + alarm za najmanje jednu metriku distribucije ulaza. Ako imate LLM sistem: označite 30 izlaza sa ljudima, pokrenite LLM-refere na istim izlazima i izmerite sporazum između ljudi i sudije; Obratite pažnju na sistematsku pristrasnost sudije. Dodajte najmanje 3 ivice i 2 sigurnosna kućišta u svoj eval klaster.

kontrolna lista

  • [ ] Monitoring pokriva sva tri sloja (operativni, ulazni, izlazni).
  • [ ] Koristim input drift kao rano upozorenje ako stvarni rezultat kasni.
  • [ ] Kalibrirao sam LLM-arbitra s ljudskim oznakama.
  • [ ] Eval klaster sadrži rubne i sigurnosne slučajeve.
  • [ ] Svaku grešku koju sam uhvatio pretvorio sam u trajni test slučaj.
  • [ ] Svaka važna metrika ima prag i plan odgovora.