Jednostka 8 / 11

Ocena i monitorowanie RAG

Zyski:

  • Definiowanie metryk, które oddzielnie mierzą jakość utrzymania i wytwarzania
  • Skonfiguruj złoty zestaw pytań i przeprowadź automatyczną ocenę z LLM-as-sędzią
  • Utrzymanie jakości poprzez informację zwrotną, monitorowanie i testy regresyjne na produkcji

Zdanie „Zainstalowałem asystenta, wydaje się, że działa dobrze” nie jest stwierdzeniem inżynierskim. Systemy RAG psują się po cichu: nowy typ dokumentu oszukuje przy pobieraniu, szybka zmiana zmniejsza dokładność, indeks staje się nieaktualny. Jedynym sposobem, aby to sobie uświadomić, jest pomiar. W tej części omawiamy sposób pomiaru jakości RAG (oddzielnie pobieranie i generowanie), automatyczną ocenę (LLM-as-sędzia) i utrzymywanie jakości w produkcji (monitorowanie, regresja). „Nie możesz ulepszyć tego, czego nie mierzysz” – to motto tej jednostki.

Zmierz dwie oddzielne rzeczy

RAG ma dwie nogi i należy go mierzyć osobno, ponieważ problem może dotyczyć jednej z nich:

  1. Jakość odbioru: czy dotarła właściwa część?
  2. Jakość generowania: czy na podstawie otrzymanej części otrzymano poprawną odpowiedź?

Jeśli odpowiedź jest zła, musisz najpierw dowiedzieć się, która noga jest uszkodzona. Jeśli właściwa część nigdy nie dotrze, nawet najlepszy monit nie będzie mógł zostać zapisany (problem z pobieraniem). Jeśli dotarła właściwa część, ale model błędnie ją odczytał, poprawianie odzyskiwania jest daremne (problem z generacją).

Metryki pobierania

Wyszukiwanie jest problemem sortowania/dostępu; mierzone klasycznymi metrykami wyszukiwania informacji. Do tego trzeba mieć złotą gromadę: wiedzę, który fragment jest „poprawny” w każdym pytaniu.

metryczny

Jakie środki

Prosta definicja

Przypomnij @k

Czy właściwy element znajduje się na górze k?

Prawidłowa szybkość wychwytywania części

precyzja@k

Ile z k zwróconych elementów jest istotnych?

Sprzątanie tego, co przyniesione

MRR (średnia ranga wzajemna)

W jakiej kolejności jest właściwy element?

Nagrody za bycie na czołowych miejscach

Współczynnik trafień

Czy dotarł chociaż jeden prawidłowy egzemplarz?

Najbardziej podstawowa miara sukcesu

Praktyczny komentarz: Jeśli Recall@k jest niski, należy przerobić strategię fragmentowania lub wyszukiwania (hybrydowa, k, zmiana rankingu). Jeśli precyzja jest niska, ale zapamiętywanie jest wysokie, dobrym posunięciem jest dodanie ponownego rankingu.

Metryki generacji

Kiedy nadejdzie właściwa część, mierzymy jakość reakcji generowanej przez model. Trzy podstawowe wymiary:

  • Wierność: czy każde twierdzenie w odpowiedzi jest poparte kontekstem? Czy jest jakieś dopasowanie? Jest to bezpośrednia miara halucynacji.
  • Znaczenie odpowiedzi: czy odpowiedź faktycznie odpowiada na pytanie, czy też jest nie na temat?
  • Kompletność: czy wykorzystano wszystkie istotne informacje w kontekście, czy też ich brakuje?

Często są one oceniane na podstawie stopni (np. 1-5), a nie binarnie, jak „prawda/fałsz”.

Wskazówka: Śledź wierność jako oddzielny wskaźnik. Jeśli wierność maleje wraz ze spadkiem dokładności, problemem jest wytwarzanie; Jeśli wierność jest wysoka, ale odpowiedź jest błędna, problemem jest niewłaściwy element (odzyskanie). Razem te dwa wskaźniki tworzą kompas pokazujący lokalizację usterki.

Utworzenie złotego zestawu pytań

Każdy pomiar wymaga złotego zestawu/zbioru danych ewaluacyjnych: realistyczne pytania + oczekiwane prawidłowe odpowiedzi + prawidłowe elementy źródłowe. Lepsze jest rozpoczęcie od 30–50 dobrze wybranych pytań niż 500 losowych pytań. W zestawie uwzględnij: często zadawane pytania rzeczywiste, znane trudne pytania, pytania-pułapki bez odpowiedzi (należy powiedzieć „nie wiem”), pytania ze sprzecznymi źródłami.

# Przykład złotego klastra (koncepcyjny)[ {"question": "Ile dni urlopu rocznego?", "expected_answer": "14 dni za 1-5 lat stażu pracy", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Gdzie jest biuro firmy na Marsie?", "expected_answer": "NO_INFORMATION", # trap: nie wiem „correct_part_id”: null, „category”: „pułapka”}]

LLM-as-Judge: automatyczna ocena

Ręczne zdobywanie setek odpowiedzi jest męczące. Model LLM jako sędziego ma miejsce, gdy jeden model ocenia i uzasadnia odpowiedź innego modelu na podstawie określonych kryteriów. Dobry sędzia podpowiada jasno określa kryteria, podaje przykłady i prosi o uzasadnienie.

# Podpowiedź LLM-jako-sędziego (koncepcyjna)Jesteś bezstronnym oceniającym. Oceń poniższą ODPOWIEDŹ zgodnie z podanym KONTEKSTEM i OCZEKIWANĄ ODPOWIEDZI. Oceń (1-5) i uzasadnij: - wierność: czy każde twierdzenie w odpowiedzi jest poparte kontekstem? - trafność: czy odpowiedź odpowiada oczekiwanej odpowiedzi? - kompletność: czy odpowiednie informacje są kompletne? W szczególności: jeśli odpowiedź zawiera informacje niezwiązane z kontekstem, okaż wierność1 i wskaż, które twierdzenie jest sfabrykowane.CONTEXT: {context}OCZEKIWANE: {oczekiwane}ODPOWIEDŹ: {answer}Wynik: {wierność, dokładność, kompletność, uzasadnienie}

Uwaga: LLM-jako-sędzia nie jest doskonały; Mogą mieć własne uprzedzenia (długa odpowiedź, preferowanie własnego stylu). Zweryfikuj także Sędziego: uzyskaj kilka odpowiedzi punktowanych zarówno przez sędziego, jak i człowieka i zmierz zgodność między nimi. Jeśli Sędzia jest zgodny z wynikami ludzkimi, można mu zaufać.

Słaba/silna ocena

Słabe („to było dla mnie dobre”):

Zadałem kilka pytań i odpowiedzi wydawały się dobre. Mam to na żywo. # Problem: brak pomiarów, regresja niezauważalna, poprawa ślepa.

Potężny (złoty klaster + dyskretne metryki + automatyczna ocena + regresja):

Złoty klaster 40 pytań. Przy każdej zmianie, przypomnienie@5, wierność i dokładność są mierzone automatycznie. Jeśli wynik spadnie, zmiana zostanie cofnięta. Na etapie produkcji zbierane są opinie użytkowników i dodawane do zestawu.

Monitorowanie i regresja w produkcji

Ocena nie jest dokonywana raz i na koniec. Trzy stałe praktyki:

  • Testowanie regresyjne: automatyczne uruchamianie złotego klastra przy każdym monitie/pobraniu/zmianie modelu. Jeśli wynik zostanie obniżony, zmiana zostanie odwrócona. Zapobiega to „zepsuciu tego podczas próby ulepszenia”.
  • Monitorowanie produkcji: monitorowany jest wskaźnik „Nie mogłem znaleźć informacji” w prawdziwych pytaniach, średnie opóźnienie, koszt, opinie użytkowników (👍/👎). Nagły wzrost odpowiedzi „Nie wiem” jest często pierwszą oznaką nieprawidłowego działania indeksu lub wyszukiwania.
  • Pętla informacji zwrotnej: Prawdziwe pytania zadane przez użytkownika 👎 są sprawdzane i dodawane do złotego stosu; Dzięki temu zestaw z czasem staje się bogatszy, a martwe punkty systemu zamykają się.

Trzy mini etui

Przypadek 1 – Cicha regresja. Zespół zmodyfikował monit, aby go „ulepszyć”; Ogólna dokładność wzrosła, ale wierność spadła o 30% w przypadku pytań-pułapek (model zaczął bardziej pasować). Nie zostałoby to zauważone, gdyby nie pytania-pułapki w złotej gromadzie; Testy regresyjne cofnęły zmianę.

Przypadek 2 — Prostowanie niewłaściwej nogi. W przypadku jednego asystenta odpowiedzi były złe; Zespół pracował nad podpowiedzią przez tygodnie. Kiedy mierzyliśmy wskaźniki wyszukiwania, wskaźnik przypomnienia@5 wyniósł tylko 48% — problem dotyczył wyszukiwania, a nie generowania. Po dodaniu hybrydy + ponownego rankingu, przypomnienie wzrosło do 89%, a także wzrosła celność.

Przypadek 3 — Alarm produkcyjny. Któregoś dnia wskaźnik „Nie mogłem znaleźć informacji” w przypadku asystenta wsparcia wzrósł z 6% do 34%. Gładzik ostrzegł; Powodem było to, że zadanie indeksowania, które działa w nocy, po cichu zakończyło się niepowodzeniem i nowe artykuły nie zostały przesłane. Bez monitorowania błędne stwierdzenia „nie wiem” powtarzałyby się przez wiele dni.

Typowe błędy

  • Satysfakcja z „udało mi się”: bez pomiaru regresja pozostaje niezauważona.
  • Nie oddzielanie pobierania i generowania: poprawisz złą nogę i zmarnujesz czas.
  • Nie zadawanie pytań-pułapek: W złotej gromadzie nie pojawia się tendencja do zmyślania.
  • Sędzia nieweryfikujący: stronnicza ława przysięgłych daje fałszywą pewność.
  • Brak monitorowania produkcji: awaria indeksu, eksplozja kosztów trwa cicho.

Podsumowując

  • W RAG jakość wyszukiwania i wytwarzania mierzy się oddzielnie; Najpierw należy ustalić, która noga jest uszkodzona.
  • wycofanie@k, precyzja@k, MRR dla odzyskania; Wierność, przydatność, kompletność są wykorzystywane do generowania.
  • Każdy pomiar wymaga złotego klastra; Umieść w nim prawdziwe, trudne, pułapkowe i sprzeczne pytania.
  • LLM-as-sędzia duże zestawy automatycznie zdobywa punkty; lecz sam sędzia musi być usprawiedliwiony wobec człowieka.
  • Testy regresyjne, monitorowanie produkcji i pętla informacji zwrotnej utrzymują jakość w czasie.

Zadanie aplikacji

(1) Stwórz złoty zestaw co najmniej 15 pytań dla swojego asystenta: uwzględnij co najmniej 3 pułapki (brak odpowiedzi), 3 trudne, 2 sprzeczne pytania źródłowe. Do każdego pytania wpisz oczekiwaną odpowiedź i właściwą część. (2) Ręcznie porównaj dwie różne wersje podpowiedzi z tym zestawem; Każdej odpowiedzi przyznaj 1–5 punktów za wierność i dokładność. (3) Dostosuj powyższy monit dotyczący LLM jako sędziego do własnych kryteriów. (4) Określ 3 wskaźniki, które będziesz śledzić w produkcji i dla każdego z nich zadaj pytanie „Przy jakim progu mam alarmować?” napisz wartość.

lista kontrolna

  • [ ] Potrafię mierzyć jakość utrzymania i generowania za pomocą oddzielnych wskaźników.
  • [ ] Wiem, co oznaczają wskaźniki takie jak przypominanie@k, wierność.
  • [ ] Potrafię zbudować złotą klaster zawierającą pytania rzeczywiste, trudne, pułapki i sprzeczne.
  • [ ] Mogę ustawić automatyczną ocenę i zweryfikować sędziego za pomocą LLM-as-sędziego.
  • [ ] Potrafię obsługiwać testy regresyjne, monitorowanie produkcji i pętlę sprzężenia zwrotnego.