Yksikkö 8 / 11

Eval ja seuranta: Tietäen, mitä malli todella tekee tuotannossa

Voitot:

  • Kyky tunnistaa hiljaiset syyt mallin huonontumiseen (datan ajautuminen, käsitteen ajautuminen, alkuvirran virhe) ja luoda kolmikerroksinen (toiminta, tulo, lähtö) valvonta
  • Kyky arvioida LLM-järjestelmiä useissa kerroksissa sääntötarkistuksilla, LLM-tuomari- ja ihmisarvioinnilla ja kalibroida LLM-tuomarin ihmisankkurin avulla
  • Kyky suunnitella eval-sarja, joka sisältää reuna- ja turvatapauksia ja muuttaa jokaisesta havaitusta virheestä pysyvä testitapaus

Kun malli tulee tuotantoon, työsi ei ole valmis. Todellinen vastuu alkaa vasta. Koska malli voi hajota hiljaa, kun kukaan ei katso. Tässä yksikössä käsittelemme kahta toisiaan täydentävää tieteenalaa: arviointia (mallin laadun systemaattinen mittaaminen) ja seurantaa (mallin jatkuva seuranta tuotannossa). Erityisesti LLM-järjestelmissä eval on vaikeampaa ja vaatii enemmän hoitoa kuin klassinen ML.

Miksi tuotantomalli on hiljaa hajoamassa

Virhe kaatuu, loki tulostuu, hälytys soi. Toisaalta ML-malli voi olla väärä aiheuttamatta virheitä. Kolme pääasiallista hajoamisen syytä:

  • Tietojen ajautuminen: Syötetietojen jakautuminen muuttuu ajan myötä (uudet tuotteet, muuttuva käyttäjien käyttäytyminen, kausiluonteisuus). Malli pysyy samana, mutta maailma muuttuu.
  • Käsitteen ajautuminen: Panos-lähtösuhde muuttuu. Petostaktiikat ja roskapostimallit kehittyvät; Se mikä oli oikein eilen, on tänään väärin.
  • Ylävirran korruptio: Tietolähde muuttaa muotoa, alue vapautuu; Malli kuolaa hiljaa korruptoituneella syötteellä.

Jäljitys tekee näistä hiljaisista vääristymistä kuuluvia.

Mitä katsoa: kolme kerrosta

Hyvä seuranta kattaa kolme kerrosta:

  1. Toimintamittarit: Latenssi, virheprosentti, pyyntöjen määrä, resurssien käyttö. "Onko järjestelmä pystyssä?"
  2. Data/syöttömetriikka: Onko syötteiden jakautuminen samanlainen kuin koulutuksessa? Onko puuttuva arvo noussut? Onko uusia luokkia saapunut? "Näkeekö malli tuttua dataa?"
  3. Malli/tulostusmittarit: Ennustejakeluloki? Ovatko luottamuspisteet laskeneet? Ja jos mahdollista, mikä on tarkkuus verrattuna perustotuuteen? "Onko malli edelleen tarkka?"

Kolmas kerros on arvokkain, mutta vaikein; koska todellinen tulos tulee yleensä viiveellä (kuukausien kuluttua selviää, maksetaanko laina takaisin vai ei).

Vihje: Jos todellinen tulos viivästyy, tarkkaile ensin syötteen ja ennusteen jakautumista. Syöttöjakauman muutos on varhainen merkki tarkkuuden heikkenemisestä ja voi herättää hälytyksen odottamatta todellista tulosta.

LLM-järjestelmien arviointi: erityinen haaste

Klassisessa ML:ssä "oikea vastaus" on selvä (luokka 0 tai 1). LLM-tulos sen sijaan on avoin: samaan kysymykseen voi olla monia oikeita vastauksia, "oikeus" ei mahdu yhteen numeroon. LLM eval lähestyy:

  • Viittausmittarit: Tulosten vertaaminen ihanteelliseen vastaukseen. Rajoitettu; koska se voi pitää oikean vastauksen eri tavalla ilmaistuna "vääränä".
  • Sääntöihin perustuvat tarkistukset: Onko tulos kelvollinen JSON? Onko kiellettyjä sanoja? Sisältääkö se halutut kentät? Halpa, luotettava, tiukka.
  • LLM-tuomari (LLM-as-judge): Älä pakota mallia kysymään "onko tämä vastaus hyvä tämän kriteerin mukaan?" Se skaalautuu, mutta itse erotuomari on tarkistettava.
  • Ihmisten arvostelu: Kultataso, mutta kallis ja hidas. Sitä käytetään näytteessä.

Käytännössä näitä käytetään yhdessä: halvat sääntötarkistukset jokaiselle ulostulolle, LLM-tuomari suuressa otoksessa, ihmisen arviointi pienessä mutta tiukassa otoksessa.

Heikko lähestymistapa / Vahva lähestymistapa

Heikko: "LLM-Kysyin erotuomarilta, 92% vastauksistamme oli hyviä. Järjestelmä on loistava."

Güçlü: "Aluksi merkitsimme ihmisen 100 tulostetta. Ajoimme LLM-tuomarin samoilla 100 tulosteella ja mittasimme ihmisen ja tuomarin yhteisymmärryksen - 85 %:n yksimielisyys, hyväksyttävä. Dokumentoimme, missä tuomari meni systemaattisesti pieleen (taipumus pitää pitkiä vastauksia kohtuuttoman hyviksi) ja korjasimme kehotuksensa. Vasta sitten luotimme tuomarin pisteisiin."

Ero: vahva lähestymistapa vahvistaa erotuomarin ihmisankkurilla, ei sokeasti. Vahvistamaton LLM-tuomari antaa hyvännäköistä mutta väärää luottamusta.

Huomio: LLM-tuomari on myös malli; hallusinogeeninen, puolueellinen (kannattaa pitkiä / varmoja vastauksia), voi olla epäjohdonmukaista. Kalibroi erotuomarin pisteet ihmistunnisteilla ennen tuotantopäätösten tekemistä.

Arviointisarja: huolellisesti suunniteltu

Hyvä eval-sarja edustaa todellisen käytön monipuolisuutta ja vaikeita tapauksia. Eval, joka on täynnä vain helppoja esimerkkejä, jättää sinut väärään luottamukseen. Muista laittaa se eval-klusteriin:

  • Reunakotelot: Tyhjä syöttö, erittäin pitkä syöttö, epätavallinen muoto.
  • Tunnetut vaikeat tapaukset: Esimerkkejä, joissa malli on tehnyt virheitä aiemmin (regressiotestinä).
  • Tietoturvahäiriöt: nopeat injektioyritykset, haitalliset pyynnöt, yksityisyyden loukkausloukut.

Eval-klusteri kasvaa ajan myötä: jokaisesta tuotannossa havaitusta uudesta bugista tulee testitapaus seuraavaa arviointia varten.

Hälytys ja väliintulo

Valvonta jää kesken ilman hälytystä. Jokaiselle tärkeälle mittarille tulee olla kynnys ja vastaussuunnitelma: "Ilmoita insinöörille, jos syötteen poikkeama ylittää X", "Automaattinen palautus, jos virheprosentti ylittää Y". Pidä hälytykset merkityksellisinä – liian monet väärät hälytykset tekevät tiimin tunteettomaksi ja saavat heidät huomaamaan oikean hälytyksen.

kolme minilaukkua

Tapaus 1 - Varhainen varoitus. Kysynnän ennustemallin todellinen tarkkuus paljastui vasta viikon lopulla. Tiimi seurasi syötteiden jakautumista ja näki uuden tuoteluokan äkillisen nousun tiistaina – mitä malli ei ollut koskaan nähnyt. He päivittivät mallin odottamatta tarkkuuden laskua. Tallennettujen päivien syötteen seuranta.

Tapaus 2 - Vahvistamaton erotuomari. Yksi tiimi ilmoitti "laatumme on erinomainen" LLM-arvioijan perusteella. Kun asiakkaiden valitukset lisääntyivät, otettiin käyttöön inhimillinen seuranta: erotuomari piti itsevarmat mutta väärät vastaukset "hyvinä". Kun erotuomari oli kalibroitu ihmislappujen avulla, todellinen laatu paljastui ja oli paljon huonompi. Oppitunti: älä luota erotuomariin tarkistamatta sitä.

Tapaus 3 - Regressiotestaus. Nopea muutos ratkaisi yhden ongelman ja mursi hiljaa toisen. Mutta tiimi piti ohi bugeja eval-ämpärissä; Kun uutta muutosta testattiin tässä klusterissa, katkennut kotelo saatiin heti kiinni ja muutos korjattiin. Oppitunti: Jokaisesta korjatusta virheestä tulisi tulla pysyvä testitapaus.

Kopioitavat mallit

Luo seurantasuunnitelma tälle tuotantomallille. Peitä kolme kerrosta:1) Toiminnallinen (latenssi, virhesuhde, tilavuus)2) Syöte/tiedot (jakauman muutos, puuttuva arvo, uusi luokka)3) Malli/tulostus (ennustejakauma, luottamus, tarkkuus, jos mahdollista) Malli: [kuvaus]. Kuinka kauan todellisen tuloksen saapuminen kestää: [duration]Lisää kynnys ja toimenpidesuositus kullekin mittarille.

Ehdota arviointi- (eval) -strategiaa tälle LLM-järjestelmälle. Tehtävä: [kuvaus]Määritä tasot:- Mitä sääntöihin perustuvia tarkistuksia tulee suorittaa jokaiselle tulosteelle?- Mitä kriteerejä LLM-välimiehen tulee arvioida ja miten ne tulisi validoida (ihminen ankkuri)?- Missä otoksessa ihmisen arviointi tulisi suorittaa? Listaa reuna- ja turvallisuustapaukset, jotka minun tulee asettaa arviointiin.

Tarkista tämä LLM-tuomarin kehote:- Ovatko arviointikriteerit selkeitä vai subjektiivisia?- Onko se altis pituus/luottamusharhalle?- Kuinka kalibroin erotuomarin ihmistunnisteilla?Tuomarin kehote: [kehote]

Kirjoita tämän valvontahälytyksen vastauskirja. Hälytys: [esim. syötteen poikkeaman kynnys ylitetty]Pitäisi sisältää: alkuohjausvaiheet, mahdolliset syyt, palautuskriteerit, kenelle ilmoitetaan.

Heikkenemissyytaulukko

vääristymistä

oire

Tie varhaiseen havaitsemiseen

tiedon ajautuminen

Tulojen jakautuminen muuttuu

Tulojen jakelun valvonta

käsitteen muutos

Vanhurskaus kaatuu hiljaa

Ennuste + todellinen vertailu

ylävirran virhe

Kentät vapautuvat / muoto muuttuu

Kaavion vahvistus + puuttuva hinta

Mallin epäjohdonmukaisuus

Tuotoksen jakautuminen muuttuu

Tuotoksen jakelun seuranta

Yleisiä virheitä

  • Valvontaa ei perusteta. Malli hajoaa hiljaa, kukaan ei näe sitä.
  • Seuraa vain toiminnallisia mittareita. Järjestelmä on toiminnassa, mutta ennusteet voivat olla vääriä.
  • LLM:n käyttö ilman erotuomarin vahvistamista. Se antaa väärää luottamusta.
  • Eval helpoilla esimerkeillä. Se ei tarkoita todellista vaikeutta.
  • Ei sisällä aiempia virheitä arvioinnissa. Sama virhe toistuu.
  • Kovat hälytykset. Ryhmästä tulee tunteeton, ja se kaipaa oikeaa hälytystä.

Yhteenvetona

Malli voi olla epätarkka aiheuttamatta virheitä tuotannossa; joten eval ja seuranta ovat yhtä tärkeitä kuin kehitys. Perustetaan valvonta kolmella tasolla (toiminnallinen, tulo, lähtö); Käytä syötteen poikkeamaa varhaisvaroituksena, jos todellinen tulos viivästyy. LLM-järjestelmissä eval on avoin; Käytä sääntötarkistuksia, LLM-tuomaria ja ihmisen arviointia yhdessä – mutta muista vahvistaa LLM-tuomari ihmisankkurin avulla. Rikastuta Eval-klusteriasi reuna- ja suojakoteloilla ja muuta jokainen havaittu virhe pysyväksi testitapaukseksi.

Sovellustehtävä

Kirjoita kolmikerroksinen valvontasuunnitelma tuotanto- (tai lähes tuotanto-) mallille ja määritä kynnys + hälytys vähintään yhdelle syöttö-jakometriikalle. Jos sinulla on LLM-järjestelmä: merkitse 30 tulostetta ihmisillä, suorita LLM-tuomari samoilla lähdöillä ja mittaa ihmisen ja erotuomarin välinen sopimus; Huomaa erotuomarin systemaattinen ennakkoluulo. Lisää vähintään 3 reunaa ja 2 suojakoteloa eval-klusteriisi.

tarkistuslista

  • [ ] Valvonta kattaa kaikki kolme kerrosta (toiminnallinen, syöttö, lähtö).
  • [ ] Käytän input driftiä varhaisvaroituksena, jos todellinen tulos viivästyy.
  • [ ] Kalibroin LLM-välimiehen ihmismerkinnöillä.
  • [ ] Eval-klusteri sisältää reuna- ja suojakotelot.
  • [ ] Muutin jokaisen havaitsemani vian pysyväksi testitapaukseksi.
  • [ ] Jokaisella tärkeällä mittarilla on kynnys ja vastaussuunnitelma.