Jednotka 8 / 11

Hodnotenie a monitorovanie: Vedieť, čo model skutočne robí vo výrobe

zisky:

  • Schopnosť rozpoznať tiché príčiny degradácie modelu (drift údajov, posun konceptu, chyba upstream) a zaviesť trojvrstvové (prevádzkové, vstupné, výstupné) monitorovanie
  • Schopnosť vyhodnocovať systémy LLM vo viacerých vrstvách pomocou kontroly pravidiel, hodnotenia rozhodcov LLM a ľudí a kalibrovať pomocou ľudskej kotvy rozhodcu LLM
  • Schopnosť navrhnúť eval sadu obsahujúcu okrajové a bezpečnostné puzdrá a premeniť každú zachytenú chybu na trvalý testovací prípad

Keď sa model dostane do výroby, vaša práca nie je hotová; Skutočná zodpovednosť len začína. Pretože model sa môže ticho zrútiť, keď sa nikto nepozerá. V tomto celku pokrývame dve doplnkové disciplíny: hodnotenie (systematické meranie kvality modelu) a monitorovanie (neustále sledovanie modelu vo výrobe). Najmä v LLM systémoch je eval náročnejší a vyžaduje viac starostlivosti ako klasický ML.

Prečo sa produkčný model potichu kazí

Chyba sa zrúti, protokol sa vytlačí, alarm sa spustí. Na druhej strane model ML môže byť chybný bez toho, aby spôsobil chyby. Tri hlavné príčiny degradácie:

  • Dátový drift: Distribúcia vstupných údajov sa mení v čase (nové produkty, meniace sa správanie používateľov, sezónnosť). Model zostáva rovnaký, ale svet sa mení.
  • Posun konceptu: Zmení sa vzťah vstup-výstup. Taktiky podvodov a vzory spamu sa vyvíjajú; Čo bolo správne včera, bude zlé aj dnes.
  • Poškodenie proti prúdu: Zdroj údajov zmení formát, oblasť sa uvoľní; Model ticho slintá s poškodeným vstupom.

Vďaka trasovaniu sú tieto tiché skreslenia počuteľné.

Čo sledovať: tri vrstvy

Dobrý monitoring pokrýva tri vrstvy:

  1. Operačné metriky: latencia, chybovosť, objem požiadaviek, využitie zdrojov. "Stojí systém?"
  2. Údaje/vstupné metriky: Je distribúcia vstupov podobná ako pri tréningu? Zvýšila sa miera chýbajúcej hodnoty? Prišli nové kategórie? "Vidí model známe údaje?"
  3. Metriky modelu/výstupu: Log distribúcie predpovedí? Poklesli skóre dôvery? A ak je to možné, aká je presnosť v porovnaní so základnou pravdou? "Je model stále presný?"

Tretia vrstva je najcennejšia, ale najťažšia; pretože skutočný výsledok zvyčajne prichádza s oneskorením (po mesiacoch sa ukáže, či bude úver splatený alebo nie).

Tip: Ak sa skutočný výsledok oneskorí, najskôr sledujte rozloženie vstupu a predpovede. Posun distribúcie vstupu je skorým znakom zníženia presnosti a môže vyvolať poplach bez čakania na skutočný výsledok.

Hodnotenie systémov LLM: špeciálna výzva

V klasickom ML je „správna odpoveď“ jasná (trieda 0 alebo 1). Výsledok LLM je na druhej strane otvorený: na tú istú otázku môže byť veľa správnych odpovedí, „správnosť“ sa nezmestí do jedného čísla. LLM hodnotiace prístupy:

  • Referenčné metriky: Porovnanie výstupu s ideálnou odpoveďou. Obmedzené; pretože správnu odpoveď vyjadrenú inak môže považovať za „nesprávnu“.
  • Kontroly založené na pravidlách: Je výstup platný JSON? Existujú nejaké zakázané slová? Obsahuje požadované polia? Lacné, spoľahlivé, tesné.
  • LLM-sudca (LLM-ako-sudca): Nenechajte modelku, aby sa pýtala „je táto odpoveď dobrá podľa tohto kritéria?“ Váha, ale musí sa overiť samotný rozhodca.
  • Ľudská recenzia: Zlatý štandard, ale drahý a pomalý. Používa sa na vzorke.

V praxi sa používajú spoločne: lacné kontroly pravidiel na každom výstupe, LLM-posúdenie na veľkej vzorke, ľudské hodnotenie na malej, ale dôslednej vzorke.

Slabý prístup / Silný prístup

Slabý: "LLM-pýtal som sa rozhodcu, 92 % našich odpovedí bolo dobrých. Systém je skvelý."

Güçlü: "Najprv sme označili 100 výtlačkov ľudskou nálepkou. Spustili sme sudcu LLM na tých istých 100 výtlačkoch a zmerali sme zhodu medzi človekom a sudcom — 85% zhoda, prijateľná. Zdokumentovali sme, kde sa sudca systematicky mýlil (s tendenciou nájsť dlhé odpovede nespravodlivo dobré) a opravili sme jeho výzvu. Až potom sme verili skóre sudcu."

Rozdiel: silný prístup preveruje rozhodcu ľudskou kotvou, nie slepo. Neoverený rozhodca LLM dáva pekne vyzerajúcu, ale falošnú dôveru.

Pozor: Rozhodca LLM je tiež model; halucinogénne, zaujaté (uprednostňuje dlhé/dôveryhodné odpovede), môže byť nekonzistentné. Pred rozhodnutím o výrobe kalibrujte skóre rozhodcu pomocou ľudských značiek.

Hodnotiaca sada: starostlivo navrhnutá

Dobrá hodnotná súprava predstavuje rozmanitosť skutočného použitia a zložitých prípadov. Hodnotenie plné jednoduchých príkladov vás zanechá v falošnej dôvere. Nezabudnite ho vložiť do hodnotiaceho klastra:

  • Okrajové prípady: Prázdny vstup, veľmi dlhý vstup, neobvyklý formát.
  • Známe ťažké prípady: Príklady, keď model v minulosti urobil chyby (ako regresný test).
  • Bezpečnostné incidenty: Rýchle pokusy o vloženie injekcie, škodlivé žiadosti, pasce na porušenie súkromia.

Eval cluster sa časom rozrastá: každá nová chyba, ktorú zachytíte vo výrobe, sa stane testovacím prípadom pre ďalšie hodnotenie.

Alarm a zásah

Bez alarmu zostáva monitorovanie neúplné. Pre každú dôležitú metriku by mala existovať prahová hodnota a plán odozvy: „Upozorniť inžiniera, ak posun vstupu prekročí X“, „Automaticky vrátiť späť, ak chybovosť prekročí Y“. Udržujte alarmy zmysluplné – príliš veľa falošných poplachov znižuje citlivosť tímu a spôsobuje, že zmeškajú skutočný alarm.

tri mini prípady

Prípad 1 – Včasné varovanie. Skutočná presnosť modelu prognózy dopytu sa ukázala až na konci týždňa. Tím monitoroval distribúciu vstupov a v utorok videl náhly vzostup novej kategórie produktov – niečo, čo tento model nikdy nevidel. Aktualizovali model bez čakania na pokles presnosti. Uložené dni sledovania vstupu.

Prípad 2 – Neoverený rozhodca. Jeden tím uviedol, že „naša kvalita je vynikajúca“ na základe recenzenta LLM. Keď sa zvýšil počet sťažností zákazníkov, zaviedol sa ľudský monitoring: rozhodca považoval sebavedomé, ale nesprávne odpovede za „dobré“. Keď bol rozhodca kalibrovaný ľudskými značkami, odhalila sa skutočná kvalita a bola oveľa nižšia. Ponaučenie: neverte rozhodcovi bez toho, aby ste si to overili.

Prípad 3 – Regresné testovanie. Rýchla zmena vyriešila jeden problém a potichu prelomila ďalší. Ale tím sa vyhýbal chybám v eval vedre; Keď bola nová zmena testovaná na tomto klastri, rozbité puzdro bolo okamžite zachytené a zmena bola opravená. Ponaučenie: každá opravená chyba by sa mala stať trvalým testovacím prípadom.

Kopírovateľné šablóny

Vytvorte plán sledovania pre tento výrobný model. Pokrytie troch vrstiev: 1) Prevádzkové (latencia, chybovosť, objem)2) Vstup/údaje (distribučný posun, chýbajúca hodnota, nová kategória)3) Model/výstup (distribúcia predpovedí, spoľahlivosť, presnosť, ak je to možné) Model: [popis]. Ako dlho trvá, kým sa dostaví skutočný výsledok: [trvanie]Pridajte prahovú hodnotu a odporúčanie zásahu pre každú metriku.

Navrhnite stratégiu hodnotenia (hodnotenia) pre tento systém LLM. Úloha: [popis]Určite vrstvy:- Ktoré kontroly založené na pravidlách by mali prebiehať na každom výstupe?- Aké kritériá by mal rozhodca LLM vyhodnotiť a ako by sa mali validovať (ľudská kotva)?- V akej vzorke by sa malo vykonať ľudské hodnotenie?Vymenujte okrajové a bezpečnostné prípady, ktoré by som mal vložiť do hodnotiacej sady.

Skontrolujte túto výzvu pre rozhodcu LLM:- Sú hodnotiace kritériá jasné alebo subjektívne?- Je náchylná na skreslenie dĺžky/dôvery?- Ako kalibrujem rozhodcu s ľudskými štítkami?Výzva rozhodcu: [výzva]

Napíšte runbook odozvy pre tento monitorovací alarm. Alarm: [napr. prekročený prah posunu vstupu]Musí obsahovať: počiatočné kontrolné kroky, možné príčiny, kritériá vrátenia, koho informovať.

Tabuľka príčin zhoršenia

skreslenie

symptóm

Cesta k skorému odhaleniu

dátový drift

Zmeny distribúcie vstupov

Monitorovanie distribúcie vstupov

posun koncepcie

Spravodlivosť ticho padá

Predpoveď + skutočné porovnanie

chyba proti prúdu

Polia sa uvoľnia/zmení sa formát

Overenie schémy + chybná miera

Nekonzistentnosť modelu

Posuny distribúcie výstupu

Monitorovanie distribúcie výstupov

Časté chyby

  • Nezavádza sa monitorovanie. Model sa potichu pokazí, nikto to nevidí.
  • Sledujte iba prevádzkové metriky. Systém funguje, ale predpovede môžu byť nesprávne.
  • Používanie LLM bez overenia rozhodcu. Dodáva falošnú dôveru.
  • Eval s jednoduchými príkladmi. Neznamená to skutočnú náročnosť.
  • Nezahŕňa minulé chyby do eval. Znova sa vráti rovnaká chyba.
  • Hlasné alarmy. Tím sa znecitliví, chýba mu skutočný alarm.

V súhrne

Model môže byť nepresný bez toho, aby spôsobil chyby vo výrobe; takže hodnotenie a monitorovanie sú rovnako dôležité ako rozvoj. Zaviesť monitorovanie na troch úrovniach (prevádzková, vstupná, výstupná); Ak sa skutočný výsledok oneskorí, použite posun vstupu ako včasné varovanie. V systémoch LLM je eval neobmedzený; Spoločne používajte kontroly pravidiel, rozhodcu LLM a ľudské hodnotenie – nezabudnite však overiť rozhodcu LLM s ľudskou kotvou. Obohaťte svoj klaster Eval o hraničné a bezpečnostné prípady a premeňte každú zachytenú chybu na trvalý testovací prípad.

Aplikačná úloha

Napíšte trojvrstvový plán monitorovania pre produkčný (alebo takmer produkčný) model a definujte prah + alarm pre aspoň jednu metriku distribúcie vstupu. Ak máte systém LLM: označte 30 výstupov ľuďmi, spustite rozhodcu LLM na rovnakých výstupoch a zmerajte dohodu medzi človekom a rozhodcom; Všimnite si systematickú zaujatosť rozhodcu. Pridajte do svojho eval klastra aspoň 3 hrany a 2 bezpečnostné puzdrá.

kontrolný zoznam

  • [ ] Monitorovanie pokrýva všetky tri vrstvy (prevádzková, vstupná, výstupná).
  • [ ] Posun vstupu používam ako včasné varovanie, ak sa skutočný výsledok oneskorí.
  • [ ] Kalibroval som LLM-arbittor s ľudskými štítkami.
  • [ ] Klaster Eval obsahuje okrajové a bezpečnostné puzdrá.
  • [ ] Každú zachytenú chybu som premenil na trvalý testovací prípad.
  • [ ] Každá dôležitá metrika má prah a plán odozvy.