Enota 8 / 11

Ocenjevanje in spremljanje: Vedeti, kaj model v resnici počne v proizvodnji

Dobički:

  • Sposobnost prepoznavanja tihih vzrokov degradacije modela (odmik podatkov, odmik koncepta, napaka navzgor) in vzpostavitev troslojnega (operativno, vhodno, izhodno) spremljanje
  • Sposobnost ocenjevanja sistemov LLM v več plasteh s preverjanji pravil, LLM-sodnikom in človeškim ocenjevanjem ter umerjanje s človeškim sidrom LLM-sodnika
  • Sposobnost oblikovanja nabora eval, ki vsebuje robne in varnostne primere, ter spremeni vsako ugotovljeno napako v trajni testni primer

Ko gre model v proizvodnjo, vaše delo ni končano; Prava odgovornost se šele začne. Ker se lahko model tiho pokvari, ko nihče ne gleda. V tej enoti pokrivamo dve komplementarni disciplini: evalvacijo (sistematično merjenje kakovosti modela) in monitoring (konstantno spremljanje modela v proizvodnji). Zlasti v sistemih LLM je vrednotenje težje in zahteva več pozornosti kot klasično ML.

Zakaj se proizvodni model tiho razpada

Hrošč se zruši, dnevnik se natisne, alarm se sproži. Po drugi strani pa je model ML lahko napačen, ne da bi povzročil napake. Trije glavni vzroki za degradacijo:

  • Odmik podatkov: Porazdelitev vhodnih podatkov se skozi čas spreminja (novi izdelki, spreminjanje vedenja uporabnikov, sezonskost). Model ostaja isti, a svet se spreminja.
  • Premik koncepta: spremeni se razmerje input-output. Razvijajo se taktike goljufij in vzorci neželene pošte; Kar je bilo včeraj prav, bo danes narobe.
  • Poškodba navzgor: vir podatkov spremeni obliko, območje postane prosto; Model se tiho slini s pokvarjenim vnosom.

Sledenje naredi ta tiha popačenja slišna.

Kaj paziti: tri plasti

Dobro spremljanje zajema tri plasti:

  1. Operativne metrike: zakasnitev, stopnja napak, obseg zahtev, uporaba virov. "Ali sistem stoji?"
  2. Meritve podatkov/vnosa: Ali je porazdelitev vnosa podobna tisti pri usposabljanju? Ali se je stopnja manjkajoče vrednosti povečala? Ali so prispele nove kategorije? »Ali model vidi znane podatke?«
  3. Meritve modela/izhoda: dnevnik distribucije napovedi? So se ocene zaupanja znižale? In če je mogoče, kakšna je točnost v primerjavi z osnovno resnico? "Ali je model še vedno točen?"

Tretja plast je najdragocenejša, a najtežja; ker pravi rezultat običajno pride z zamudo (čez mesece postane jasno, ali bo posojilo vrnjeno ali ne).

Namig: če je dejanski rezultat zakasnjen, najprej spremljajte porazdelitev vnosa in napovedi. Premik vhodne porazdelitve je zgodnji znak poslabšanja natančnosti in lahko sproži alarm, ne da bi čakal na dejanski rezultat.

Ocenjevanje sistemov LLM: poseben izziv

V klasičnem ML je "pravilni odgovor" jasen (razred 0 ali 1). Po drugi strani pa je izid LLM odprt: na isto vprašanje je lahko veliko pravilnih odgovorov, "pravilnost" se ne prilega eni sami številki. LLM ocenjevalni pristopi:

  • Referenčne metrike: primerjava izhoda z idealnim odgovorom. omejeno; ker lahko pravilen odgovor, izražen drugače, šteje za "napačen".
  • Preverjanja na podlagi pravil: ali je izhod veljaven JSON? Ali obstajajo prepovedane besede? Ali vsebuje želena polja? Poceni, zanesljivo, tesno.
  • LLM-sodnik (LLM-as-judge): Ne sili modela k vprašanju "ali je ta odgovor dober glede na to merilo?" Tehta, vendar mora biti sam sodnik preverjen.
  • Človeški pregled: Zlati standard, vendar drag in počasen. Uporablja se na vzorcu.

V praksi se to uporablja skupaj: poceni preverjanje pravil za vsak rezultat, LLM-ocenjevanje na velikem vzorcu, človeško ocenjevanje na majhnem, a strogem vzorcu.

Šibek pristop / Močan pristop

Slab: "LLM-sem vprašal sodnika, 92 % naših odgovorov je bilo dobrih. Sistem je odličen."

Güçlü: »Najprej smo 100 izpisov označili s človekom. Sodnika LLM smo preizkusili na istih 100 izpisih in izmerili soglasje med človekom in sodnikom – 85-odstotno strinjanje, sprejemljivo. Dokumentirali smo, kje je sodnik sistematično delal napake (nagnjenost k temu, da se dolgi odgovori zdijo nepravično dobri) in popravili njegov poziv. Šele takrat smo zaupali sodnikovim ocenam.«

Razlika: močan pristop preveri sodnika s človeškim sidrom, ne na slepo. Nepreverjen LLM-sodnik daje lepega videza, a lažno zaupanje.

Pozor: LLM-sodnik je tudi model; halucinogen, pristranski (naklonjen je dolgim/samozavestnim odgovorom), lahko je nedosleden. Pred odločitvijo o proizvodnji umerite rezultate sodnikov s človeškimi oznakami.

Komplet za ocenjevanje: skrbno oblikovan

Dober eval set predstavlja raznolikost resnične uporabe in težkih primerov. Ocena, polna preprostih primerov, vas bo pustila v lažnem zaupanju. Ne pozabite ga postaviti v gručo eval:

  • Robni primeri: prazen vnos, zelo dolg vnos, nenavaden format.
  • Znani težki primeri: primeri, ko je model v preteklosti delal napake (kot regresijski test).
  • Varnostni incidenti: poskusi hitrega vbrizgavanja, zlonamerne zahteve, pasti kršitev zasebnosti.

Grozd eval sčasoma raste: vsaka nova napaka, ki jo ujamete v proizvodnji, postane testni primer za naslednjo oceno.

Alarm in intervencija

Nadzor ostane nepopoln brez alarma. Obstajati mora prag in odzivni načrt za vsako pomembno metriko: "Obvesti inženirja, če vhodni zamik preseže X", "Samodejno povrnitev nazaj, če stopnja napake preseže Y". Naj bodo alarmi smiselni – preveč lažnih alarmov desenzibilizira ekipo in spregleda pravi alarm.

trije mini kovčki

Primer 1 – Zgodnje opozorilo. Prava točnost modela napovedi povpraševanja se je pokazala šele konec tedna. Ekipa je spremljala distribucijo vložkov in v torek opazila nenaden porast nove kategorije izdelkov – nekaj, česar model še ni videl. Model so posodobili, ne da bi čakali na padec natančnosti. Spremljanje vnosa shranjenih dni.

Primer 2 - Nepreverjeni sodnik. Ena ekipa je na podlagi LLM-recenzenta poročala, da je "naša kakovost odlična". Ko so se pritožbe strank povečale, je bil uveden človeški nadzor: sodnik je samozavestne, a nepravilne odgovore štel za "dobre". Ko je bil sodnik umerjen s človeškimi oznakami, se je pokazala prava kakovost, ki je bila veliko nižja. Nauk: ne zaupajte sodniku, ne da bi ga preverili.

Primer 3 - Regresijsko testiranje. Hitra sprememba je rešila eno težavo, drugo pa tiho zlomila. Toda ekipa je hranila pretekle napake v vedru eval; Ko je bila nova sprememba preizkušena na tej gruči, je bil pokvarjen primer takoj ujet in sprememba je bila popravljena. Lekcija: vsaka popravljena napaka bi morala postati stalen testni primer.

Kopirane predloge

Izdelajte načrt sledenja za ta proizvodni model. Pokrijte tri plasti: 1) Operativni (zakasnitev, stopnja napak, obseg) 2) Vhodni/podatki (premik porazdelitve, manjkajoča vrednost, nova kategorija) 3) Model/izhod (razporeditev napovedi, zaupanje, natančnost, če je mogoče) Model: [opis]. Koliko časa traja, da pride dejanski rezultat: [trajanje]Dodajte prag in priporočilo za poseg za vsako metriko.

Predlagajte strategijo ocenjevanja (vrednotenja) za ta sistem LLM. Naloga: [opis] Določite plasti: - Katera preverjanja na podlagi pravil naj se izvajajo za vsak izhod? - Katera merila naj ovrednoti LLM-arbiter in kako jih je treba potrditi (človeško sidro)? - V katerem vzorcu naj se izvede človeško vrednotenje? Seznam robnih in varnostnih primerov, ki naj jih dam v nabor za vrednotenje.

Preverite ta poziv sodnika LLM: - Ali so kriteriji ocenjevanja jasni ali subjektivni? - Ali je nagnjen k pristranskosti glede dolžine/zaupanja? - Kako umerim sodnika s človeškimi oznakami? Poziv sodnika: [poziv]

Napišite zbirko odzivov za ta nadzorni alarm. Alarm: [npr. vhodni prag zamika presežen] Vsebovati mora: začetne korake nadzora, možne vzroke, merila za povrnitev, koga obvestiti.

Tabela vzrokov poslabšanja

popačenje

simptom

Pot do zgodnjega odkrivanja

odmik podatkov

Spremembe porazdelitve vnosa

Spremljanje distribucije vnosa

premik koncepta

Pravičnost tiho pade

Napoved + dejanska primerjava

napaka navzgor

Polja postanejo prazna/format se spremeni

Preverjanje sheme + manjkajoča stopnja

Nedoslednost modela

Premiki distribucije proizvodnje

Spremljanje distribucije izhoda

Pogoste napake

  • Brez vzpostavitve nadzora. Model se tiho pokvari, nihče ga ne vidi.
  • Sledite samo operativnim meritvam. Sistem deluje, vendar so lahko napovedi napačne.
  • Uporaba LLM brez preverjanja sodnika. Daje lažno zaupanje.
  • Ocenite z enostavnimi primeri. Ne kaže na resnične težave.
  • Ne vključuje preteklih napak v eval. Ponovno se vrne ista napaka.
  • Glasni alarmi. Ekipa postane desenzibilizirana in pogreša pravi alarm.

Če povzamem

Model je lahko netočen, ne da bi povzročil napake v proizvodnji; zato sta vrednotenje in spremljanje prav tako pomembna kot razvoj. Vzpostaviti nadzor na treh ravneh (operativni, vhodni, izhodni); Uporabite zamik vnosa kot zgodnje opozorilo, če dejanski rezultat zamuja. V sistemih LLM je eval odprt; Uporabite preverjanje pravil, LLM-referee in človeško ocenjevanje skupaj – vendar ne pozabite potrditi LLM-referee s človeškim sidrom. Obogatite svojo gručo Eval z robnimi in varnostnimi primeri ter vsako ugotovljeno napako spremenite v trajen testni primer.

Aplikacijska naloga

Napišite trislojni načrt spremljanja za proizvodni (ali skoraj proizvodni) model in definirajte prag + alarm za vsaj eno metriko distribucije vnosa. Če imate sistem LLM: označite 30 izhodov z ljudmi, zaženite LLM-referee na istih izhodih in izmerite soglasje med človekom in sodnikom; Upoštevajte sodnikovo sistematično pristranskost. V svoj grozd eval dodajte vsaj 3 robove in 2 varnostna ohišja.

kontrolni seznam

  • [ ] Nadzor zajema vse tri plasti (operativno, vhodno, izhodno).
  • [ ] Zamik vnosa uporabljam kot zgodnje opozorilo, če dejanski rezultat zamuja.
  • [ ] LLM-arbitra sem umeril s človeškimi oznakami.
  • [ ] Grozd Eval vsebuje robne in varnostne primere.
  • [ ] Vsako napako, ki sem jo ujel, sem spremenil v stalni testni primer.
  • [ ] Vsaka pomembna metrika ima prag in odzivni načrt.