Jednostka 8 / 11

Ocena i monitorowanie: wiedza o tym, co model naprawdę robi w produkcji

Zyski:

  • Umiejętność rozpoznawania cichych przyczyn degradacji modelu (dryf danych, dryf koncepcji, błąd upstream) i ustanowienia trójwarstwowego monitorowania (operacyjnego, wejściowego, wyjściowego)
  • Możliwość oceny systemów LLM na wielu warstwach ze sprawdzaniem zasad, oceną sędziego LLM i oceną człowieka oraz kalibracji za pomocą ludzkiej kotwicy sędziego LLM
  • Możliwość zaprojektowania zestawu ewaluacyjnego zawierającego przypadki brzegowe i bezpieczeństwa oraz przekształcenia każdego wykrytego błędu w stały przypadek testowy

Kiedy model trafia do produkcji, Twoja praca się nie kończy; Prawdziwa odpowiedzialność dopiero się zaczyna. Ponieważ model może po cichu się zepsuć, gdy nikt nie patrzy. W tej jednostce zajmujemy się dwiema uzupełniającymi się dyscyplinami: ewaluacją (systematyczne mierzenie jakości modelu) i monitoringiem (stałe monitorowanie modelu w produkcji). Szczególnie w systemach LLM ewaluacja jest trudniejsza i wymaga więcej uwagi niż klasyczne ML.

Dlaczego model produkcyjny po cichu się psuje

Występuje błąd, drukowany jest dziennik, włącza się alarm. Z drugiej strony model ML może się mylić, nie powodując błędów. Trzy główne przyczyny degradacji:

  • Dryf danych: Rozkład danych wejściowych zmienia się w czasie (nowe produkty, zmieniające się zachowania użytkowników, sezonowość). Model pozostaje ten sam, ale świat się zmienia.
  • Dryf koncepcji: zmienia się relacja wejście-wyjście. Taktyki oszustw i wzorce spamu ewoluują; To, co było dobre wczoraj, dzisiaj będzie złe.
  • Uszkodzenie wyższego szczebla: źródło danych zmienia format, obszar staje się wolny; Model cicho ślini się z uszkodzonymi danymi wejściowymi.

Tracing sprawia, że ​​te ciche zniekształcenia stają się słyszalne.

Co oglądać: trzy warstwy

Dobry monitoring obejmuje trzy warstwy:

  1. Metryki operacyjne: opóźnienie, stopa błędów, liczba żądań, wykorzystanie zasobów. „Czy system stoi?”
  2. Metryki danych/wejściowe: Czy dystrybucja danych wejściowych jest podobna do tej stosowanej w szkoleniu? Czy wzrósł wskaźnik brakujących wartości? Czy pojawiły się nowe kategorie? „Czy model widzi znajome dane?”
  3. Metryki modelu/wyjścia: dziennik rozkładu prognoz? Czy wskaźniki pewności siebie spadły? A jeśli to możliwe, jaka jest dokładność w porównaniu z podstawową prawdą? „Czy model jest nadal dokładny?”

Trzecia warstwa jest najcenniejsza, ale i najtrudniejsza; bo prawdziwy efekt zwykle przychodzi z opóźnieniem (po miesiącach okazuje się, czy pożyczka zostanie spłacona, czy nie).

Wskazówka: jeśli rzeczywisty wynik jest opóźniony, najpierw monitoruj rozkład danych wejściowych i przewidywań. Przesunięcie rozkładu sygnału wejściowego jest wczesnym sygnałem pogorszenia dokładności i może wywołać alarm bez czekania na rzeczywisty wynik.

Ocena systemów LLM: szczególne wyzwanie

W klasycznym ML „poprawna odpowiedź” jest jasna (klasa 0 lub 1). Wynik LLM natomiast jest otwarty: poprawnych odpowiedzi na to samo pytanie może być wiele, a „poprawność” nie mieści się w jednej liczbie. Podejścia do oceny LLM:

  • Metryki odniesienia: porównanie wyników z idealną odpowiedzią. Ograniczony; ponieważ może uznać poprawną odpowiedź wyrażoną inaczej za „złą”.
  • Kontrole oparte na regułach: czy dane wyjściowe są prawidłowymi kodami JSON? Czy są jakieś zakazane słowa? Czy zawiera żądane pola? Tani, niezawodny, szczelny.
  • Sędzia LLM (LLM-as-sędzia): Nie każ modelowi pytać „czy ta odpowiedź jest dobra według tego kryterium?” To się skaluje, ale samego sędziego trzeba zweryfikować.
  • Recenzja ludzka: Złoty standard, ale drogi i powolny. Jest używany na próbce.

W praktyce stosuje się je łącznie: tanie kontrole reguł dla każdego wyniku, ocena LLM na dużej próbie, ocena przez człowieka na małej, ale rygorystycznej próbie.

Słabe podejście / Silne podejście

Słabe: „LLM – zapytałem sędziego, 92% naszych odpowiedzi było dobrych. System jest świetny”.

Güçlü: „Najpierw oznaczyliśmy 100 wydruków etykietami człowieka. Przeprowadziliśmy analizę sędziego LLM na tych samych 100 wydrukach i zmierzyliśmy zgodność między człowiekiem a sędzią – 85% zgodności, akceptowalne. Udokumentowaliśmy, gdzie sędzia systematycznie popełniał błędy (tendencja do uznawania długich odpowiedzi za niesprawiedliwie dobre) i korygowaliśmy jego podpowiedzi. Dopiero wtedy zaufaliśmy wynikom sędziego”.

Różnica: mocne podejście weryfikuje sędziego za pomocą ludzkiej kotwicy, a nie na ślepo. Niezweryfikowany sędzia LLM daje ładnie wyglądającą, ale fałszywą pewność siebie.

Uwaga: sędzia LLM jest także wzorem; halucynogenne, stronnicze (preferuje długie/pewne odpowiedzi), mogą być niespójne. Przed podjęciem decyzji produkcyjnych kalibruj wyniki sędziów za pomocą ludzkich znaczników.

Zestaw ewaluacyjny: starannie zaprojektowany

Dobry zestaw ewaluacyjny reprezentuje różnorodność rzeczywistych zastosowań i trudnych przypadków. Ewaluacja wypełniona prostymi przykładami pozostawi cię w fałszywej pewności. Pamiętaj, aby umieścić go w klastrze eval:

  • Przypadki Edge: puste dane wejściowe, bardzo długie dane wejściowe, nietypowy format.
  • Znane trudne przypadki: Przykłady, w których model popełnił błędy w przeszłości (jako test regresji).
  • Incydenty związane z bezpieczeństwem: natychmiastowe próby wstrzyknięcia, złośliwe żądania, pułapki naruszające prywatność.

Klaster eval rozrasta się z czasem: każdy nowy błąd wyłapany w środowisku produkcyjnym staje się przypadkiem testowym do następnej oceny.

Alarm i interwencja

Bez alarmu monitorowanie nie jest kompletne. Dla każdej ważnej metryki powinien istnieć próg i plan reakcji: „Powiadom inżyniera, jeśli dryft wejściowy przekracza X”, „Automatyczne wycofywanie, jeśli poziom błędów przekracza Y”. Dbaj o to, aby alarmy miały znaczenie — zbyt wiele fałszywych alarmów znieczula zespół i sprawia, że ​​nie dostrzega on prawdziwego alarmu.

trzy mini etui

Przypadek 1 – Wczesne ostrzeganie. Prawdziwa dokładność modelu prognozy popytu ujawniła się dopiero pod koniec tygodnia. Zespół monitorował dystrybucję danych wejściowych i we wtorek zaobserwował nagły wzrost liczby nowych kategorii produktów — coś, czego modelka nigdy nie widziała. Zaktualizowali model, nie czekając na spadek dokładności. Monitorowanie wejścia zaoszczędziło dni.

Przypadek 2 – Sędzia niezweryfikowany. Jeden zespół stwierdził, że „nasza jakość jest doskonała” – na podstawie recenzenta LLM. Kiedy wzrosła liczba skarg klientów, wprowadzono monitorowanie przez człowieka: sędzia uznał pewne, ale nieprawidłowe odpowiedzi za „dobre”. Kiedy sędzia został skalibrowany za pomocą ludzkich znaczników, prawdziwa jakość została ujawniona i była znacznie niższa. Lekcja: nie ufaj sędziemu bez sprawdzenia go.

Przypadek 3 – Testowanie regresyjne. Szybka zmiana rozwiązała jeden problem, jednocześnie cicho psując inny. Jednak zespół trzymał w wiadrze ewaluacyjnym błędy; Kiedy nowa zmiana została przetestowana w tym klastrze, uszkodzony przypadek został natychmiast wykryty i zmiana została naprawiona. Lekcja: każdy naprawiony błąd powinien stać się trwałym przypadkiem testowym.

Szablony do kopiowania

Przygotuj plan śledzenia dla tego modelu produkcyjnego. Obejmuje trzy warstwy: 1) Operacyjne (opóźnienie, poziom błędów, wolumen) 2) Dane wejściowe/dane (przesunięcie dystrybucji, brakująca wartość, nowa kategoria) 3) Model/wyjście (rozkład predykcji, pewność, dokładność, jeśli to możliwe) Model: [opis]. Ile czasu zajmuje uzyskanie rzeczywistego wyniku: [czas trwania]Dodaj próg i zalecenie dotyczące interwencji dla każdego wskaźnika.

Zaproponuj strategię oceny (ewaluacji) dla tego systemu LLM. Zadanie: [opis] Określ warstwy: – Które kontrole oparte na regułach powinny być przeprowadzane na każdym wyjściu? – Jakie kryteria powinien ocenić arbiter LLM i w jaki sposób powinny one zostać zweryfikowane (kotwica ludzka)? – W jakiej próbce należy przeprowadzić ocenę przez człowieka? Wymień przypadki brzegowe i przypadki bezpieczeństwa, które powinienem umieścić w zestawie ewaluacyjnym.

Sprawdź monit sędziego LLM: – Czy kryteria oceny są jasne lub subiektywne? – Czy jest podatny na błąd związany z długością/ufnością? – Jak skalibrować sędziego za pomocą ludzkich znaczników? Podpowiedź sędziego: [podpowiedź]

Napisz element runbook odpowiedzi dla tego alarmu monitorowania.Alarm: [np. przekroczono próg dryftu wejściowego] Musi zawierać: wstępne kroki kontrolne, możliwe przyczyny, kryteria wycofywania, kogo należy poinformować.

Tabela przyczyn pogorszenia

zniekształcenie

objaw

Sposób na wczesne wykrycie

dryf danych

Zmiany w dystrybucji wejściowej

Monitorowanie dystrybucji wejścia

zmiana koncepcji

Sprawiedliwość upada cicho

Prognoza + rzeczywiste porównanie

błąd w górę

Pola stają się puste/zmiany formatu

Walidacja schematu + wskaźnik braków

Niespójność modelu

Zmiany w dystrybucji produkcji

Monitorowanie dystrybucji wyjściowej

Typowe błędy

  • Nie ustanowienie monitoringu. Model rozkłada się po cichu, nikt tego nie widzi.
  • Śledź tylko wskaźniki operacyjne. System już działa, ale przewidywania mogą się mylić.
  • Korzystanie z LLM bez weryfikacji sędziego. Daje fałszywą pewność.
  • Ewaluacja z łatwymi przykładami. Nie oznacza to rzeczywistych trudności.
  • Nie obejmuje błędów z przeszłości w eval. Ten sam błąd powraca ponownie.
  • Głośne alarmy. Zespół staje się znieczulony i nie dostrzega prawdziwego alarmu.

Podsumowując

Model może być niedokładny, nie powodując błędów w produkcji; dlatego ewaluacja i monitorowanie są tak samo ważne jak rozwój. Ustanowienie monitorowania na trzech poziomach (operacyjnym, wejściowym, wyjściowym); Użyj dryftu wejściowego jako wczesnego ostrzeżenia, jeśli rzeczywisty wynik jest opóźniony. W systemach LLM eval ma charakter otwarty; Używaj jednocześnie kontroli zasad, sędziego LLM i oceny przez człowieka, ale pamiętaj, aby zweryfikować sędziego LLM za pomocą ludzkiej kotwicy. Wzbogać swój klaster Eval o przypadki brzegowe i zabezpieczające i zamień każdy wykryty błąd w stały przypadek testowy.

Zadanie aplikacji

Napisz trójwarstwowy plan monitorowania dla modelu produkcyjnego (lub prawie produkcyjnego) i zdefiniuj próg + alarm dla co najmniej jednego miernika wejścia-dystrybucji. Jeśli masz system LLM: oznacz 30 wyników ludźmi, uruchom funkcję sędziowania LLM na tych samych wynikach i zmierz zgodność człowiek-sędzia; Zwróć uwagę na systematyczne stronniczość sędziego. Dodaj co najmniej 3 krawędzie i 2 przypadki bezpieczeństwa do klastra eval.

lista kontrolna

  • [ ] Monitoring obejmuje wszystkie trzy warstwy (operacyjną, wejściową, wyjściową).
  • [ ] Używam dryftu wejściowego jako wczesnego ostrzeżenia, jeśli rzeczywisty wynik jest opóźniony.
  • [ ] Kalibrowałem arbitra LLM za pomocą ludzkich etykiet.
  • [ ] Klaster Eval zawiera przypadki brzegowe i bezpieczeństwa.
  • [ ] Każdy złapany przeze mnie błąd zamieniłem w stały przypadek testowy.
  • [ ] Każda ważna metryka ma próg i plan reakcji.