Egység 8 / 11

RAG értékelése és nyomon követése

Nyereség:

  • Olyan mérőszámok meghatározása, amelyek külön mérik a megőrzést és a generálás minőségét
  • Hozzon létre egy arany kérdéskészletet, és futtassa az automatikus értékelést az LLM-as-judge segítségével
  • A minőség fenntartása visszacsatolás, monitorozás és regressziós tesztelés révén a termelésben

A "telepítettem az asszisztenst, úgy tűnik, hogy jól működik" mondat nem mérnöki kijelentés. A RAG rendszerek csendben tönkremennek: egy új dokumentumtípus megbolondítja a visszakeresést, az azonnali változtatás csökkenti a pontosságot, az index elavulttá válik. Ennek felismerésének egyetlen módja a mérés. Ebben az egységben foglalkozunk a RAG minőségének mérésével (külön-visszakeresés és generálás), az automatikus értékeléssel (LLM-as-judge) és a termelés minőségének fenntartásával (monitoring, regresszió). „Amit nem mérsz, azt nem tudod javítani” – ez a mottója ennek az egységnek.

Mérj két külön dolgot

A RAG-nak két lába van, és külön kell mérni, mert a probléma bármelyikben lehet:

  1. Letöltés minősége: A megfelelő alkatrész érkezett?
  2. Generáció minősége: A bejövő darabból származott a helyes válasz?

Ha rossz a válasz, először meg kell tudni, melyik láb a rossz. Ha a megfelelő alkatrész soha nem érkezik meg, még a legjobb prompt sem tud menteni (visszakeresési probléma). Ha a megfelelő alkatrész megérkezett, de a modell rosszul olvasta, akkor hiábavaló a visszakeresés javítása (generációs probléma).

Visszakeresési metrikák

A visszakeresés rendezési/elérési probléma; klasszikus információ-visszakeresési mérőszámokkal mérve. Ehhez rendelkezned kell az aranyfürttel: az a tudás, amelyik minden kérdésnél "helyes".

metrikus

Milyen intézkedéseket

Egyszerű meghatározás

Recall@k

A megfelelő darab a felső k-ben van?

Helyes alkatrészrögzítési sebesség

precizitás@k

A visszaküldött k darab közül hány releváns?

A hozott takarítás

MRR (átlagos kölcsönös rangsor)

Milyen sorrendben van a megfelelő darab?

Jutalmak, hogy a legfelsőbb rangokban

Találatszám

Megérkezett legalább egy megfelelő darab?

A siker legalapvetőbb mércéje

Gyakorlati megjegyzés: Ha a Recall@k alacsony, a darabolási vagy keresési stratégiát (hibrid, k, újrarangsorolás) át kell dolgozni. Ha a pontosság alacsony, de a visszahívás magas, jó lépés az átsorolás hozzáadása.

Generációs mérőszámok

A megfelelő rész megérkezésekor mérjük a modell által generált válasz minőségét. Három alapvető dimenzió:

  • Hűség: A válasz minden állítása alátámasztja-e a kontextus? Van valami szerelvény? Ez a hallucináció közvetlen mértéke.
  • A válasz relevanciája: A válasz valóban választ ad a kérdésre, vagy nem témánk?
  • Teljesség: Felhasználták-e az összes releváns információt a kontextusban, vagy hiányzik?

Ezeket gyakran osztályozási alapon (pl. 1-5) pontozzák, nem pedig binárisan, például „igaz/hamis”.

Tipp: Kövesse nyomon a hűséget külön mérőszámként. Ha a hűség a pontosság csökkenésével csökken, a probléma a generációs; Ha a hűség magas, de a válasz rossz, akkor a probléma a rossz darab (visszakeresés). Ez a két mérőszám együtt egy iránytű, amely megmutatja a hiba helyét.

Aranykérdés-készlet létrehozása

Minden méréshez szükség van egy aranyhalmazra / értékelési adatkészletre: reális kérdések + várható helyes válaszok + helyes forrásdarabok. 30-50 jól megválasztott kérdéssel kezdeni jobb, mint 500 véletlenszerű kérdéssel. Tartalmazza a következőket a készletben: gyakran ismételt valódi kérdések, ismert nehéz kérdések, válasz nélküli csapdakérdések (azt kell mondani, hogy „nem tudom”), ellentmondásos forrású kérdések.

# Aranyfürt-példa (koncepcionális)[ {"question": "Hány nap éves szabadság?", "várható_válasz": "14 nap 1-5 év szolgálati idő esetén", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Hol van a cég iroda?", "segvárt_válasz?" "NO_INFORMATION", # trap: nem tudom "correct_part_id": null, "category": "trap"}]

LLM-as-Judge: Automatikus értékelés

Több száz válasz kézzel pontozása fárasztó. Az LLM-as-judge modell az, amikor az egyik modell bizonyos kritériumok alapján pontozza és igazolja egy másik modell válaszát. A jó bíró egyértelműen meghatározza a kritériumokat, példákat ad és indoklást kér.

# LLM-as-judge prompt (koncepcionális) Ön pártatlan értékelő. Értékelje az alábbi VÁLASZT a megadott KÖRNYEZET és VÁRT VÁLASZ szerint! Pontozzon (1-5) és indokolja:- hűség: a válaszban szereplő egyes állításokat kontextusban támasztják alá?- pontosság: megfelel-e a válasz a várt válasznak?- teljesség: teljes-e a releváns információ? Különösen: ha a válasz nem a szövegkörnyezetben tartalmaz információt, adja meg a hűséget1, és jelezze, hogy melyik állítást találták ki. CONTEXT: {context}VÁRT: {expected}VÁLASZ: {válasz}Kimenet: {hűség, pontosság, teljesség, indoklás}

Vigyázat: Az LLM-as-judge nem tökéletes; Lehetnek saját elfogultságaik (hosszú válasz, saját stílusuk előnyben részesítése). Ellenőrizze a bírót is: kérjen néhány választ mind a bíró, mind az ember által pontozva, és mérje meg a köztük lévő egyetértést. Ha Judge összhangban van az emberi pontszámokkal, akkor megbízhat benne.

Gyenge/erős minősítés

Gyenge ("jó volt nekem"):

Feltettem néhány kérdést, és a válaszok jónak tűntek. Élőben megvan.# Probléma: nincs mérés, a regresszió észrevehetetlen, a javulás vak.

Erőteljes (arany klaszter + diszkrét mutatók + automatikus ítélet + regresszió):

40 kérdésből álló arany klaszter. Minden egyes változtatásnál, visszahívásnál, automatikusan mérjük a hűséget és a pontosságot. Ha a pontszám csökken, a változás visszakerül. A gyártás során a felhasználói visszajelzéseket összegyűjtik és hozzáadják a készlethez.

Monitoring és regresszió a termelésben

Az értékelés nem egyszer történik meg és nem fejeződik be. Három állandó gyakorlat:

  • Regressziós tesztelés: Az aranyfürt automatikus futtatása minden prompt/lekérdezés/modellváltáskor. Ha a pontszám csökken, a változás megfordul. Ez megakadályozza, hogy „eltörjük, miközben megpróbáljuk jobbá tenni”.
  • Gyártásfigyelés: "Nem találtam információt" valós kérdésekben, figyelik az átlagos késést, költséget, felhasználói visszajelzéseket (👍/👎). A "nem tudom" hirtelen növekedése gyakran az index vagy a visszakeresés meghibásodásának első jele.
  • Visszajelzési hurok: A felhasználó által feltett valódi kérdéseket 👎 áttekintjük, és hozzáadjuk az aranyhalomhoz; Így a halmaz idővel gazdagodik és a rendszer vakfoltjai bezáródnak.

Három mini tok

1. eset – Csendes regresszió. Egy csapat módosította a promptot, hogy „javítsa” azt; Az általános pontosság nőtt, de a hűség 30%-kal csökkent a csapdakérdésekben (a modell kezdett jobban illeszkedni). Észre sem vették volna, ha nincsenek az aranyfürt csapdakérdései; A regressziós tesztelés visszaállította a változást.

2. eset – A rossz láb kiegyenesítése. Az egyik asszisztensnél a válaszok rosszak voltak; A csapat hetekig dolgozott a felszólításon. Amikor mértük a visszakeresési mutatókat, a visszahívási@5 csak 48% volt – a probléma a visszakeresésben volt, nem a generálásban. A hibrid + átsorolás hozzáadásával a visszahívás 89%-ra nőtt, és a pontosság is nőtt.

3. eset – Gyártási riasztás. Egy napon a „Nem találtam információt” aránya egy támogató asszisztensnél 6%-ról 34%-ra ugrott. A görgetőpad figyelmeztetett; Ennek oka az volt, hogy az éjszakai indexelési feladat csendben meghiúsult, és nem kerültek fel új cikkek. Monitorozás nélkül napokig folytatódtak volna a helytelen "nem tudom" kijelentések.

Gyakori hibák

  • Megelégedve azzal, hogy „nekem jól működött”: Mérés nélkül a regresszió észrevétlen marad.
  • Nem választja el egymástól a visszakeresést és a generálást: A rossz lábat javítja, és időt veszít.
  • Nem tesz fel csapda kérdéseket: A dolgok kitalálására való hajlam nem jelenik meg az aranyhalmazban.
  • Nem ellenőrzi a bírót: Az elfogult esküdtszék hamis bizalmat ad.
  • Nem figyeli a termelést: Indexhiba, költségrobbanás csendben folytatódik.

Összefoglalva

  • A RAG-ban a visszakeresés és a generálás minőségét külön mérik; Először meg kell határozni, hogy melyik láb sérült.
  • visszahívás@k, precizitás@k, MRR visszakereséshez; A hűség, az alkalmasság, a teljesség a generációhoz használatos.
  • Minden méréshez arany klaszter szükséges; Tegyél fel benne valós, nehéz, csapda és ellentmondó kérdéseket.
  • LLM-as-Judge nagy sorozatok automatikus pontszámok; de magát a bírót kell megigazítani az emberrel szemben.
  • A regressziós tesztelés, a gyártásfigyelés és a visszacsatolási hurok idővel megőrzik a minőséget.

Pályázati feladat

(1) Készítsen legalább 15 kérdésből álló aranyhalmazt saját asszisztensének: tartalmazzon legalább 3 csapdát (nincs válasz), 3 nehéz, 2 egymásnak ellentmondó forráskérdést. Minden kérdéshez írja le a várt választ és a megfelelő részt! (2) Hasonlítson össze kézzel két különböző prompt verziót ezzel a készlettel; Minden válasznak adjon 1-5 pontot a hűségért és a pontosságért. (3) Igazítsa a fenti LLM-as-judge promptot saját kritériumaihoz. (4) Határozzon meg 3 mérőszámot, amelyeket nyomon fog követni a termelés során, és mindegyiknél kérdezze meg, hogy „milyen küszöbértéknél riasztást tegyek?” írja be az értéket.

ellenőrző lista

  • [ ] Külön mérőszámmal tudom mérni a megtartást és a generálás minőségét.
  • [ ] Tudom, mit jelentenek az olyan mérőszámok, mint a visszahívás@k, a hűség.
  • [ ] Fel tudok építeni egy arany klasztert, amely valós, nehéz, csapda és ellentmondásos kérdéseket tartalmaz.
  • [ ] Beállíthatom az automatikus értékelést és igazolhatom a bírót az LLM-as-judge segítségével.
  • [ ] Tudok regressziós tesztelést, termelésfigyelést és visszacsatoló hurkot működtetni.