Jednotka 8 / 11

Hodnocení a monitorování RAG

zisky:

  • Definování metrik, které samostatně měří retenci a kvalitu generování
  • Nastavte sadu zlatých otázek a spusťte automatické vyhodnocování pomocí LLM jako soudce
  • Udržování kvality prostřednictvím zpětné vazby, monitorování a regresního testování ve výrobě

Věta „Nainstaloval jsem asistenta, zdá se, že funguje dobře“ není technické prohlášení. Systémy RAG se tiše rozpadnou: nový typ dokumentu oklame vyhledávání, rychlá změna snižuje přesnost, index zastarává. Jediný způsob, jak si to uvědomit, je měřit. V této jednotce se zabýváme tím, jak měřit kvalitu RAG (oddělené získávání a generování), automatické vyhodnocování (LLM-as-judge) a udržování kvality ve výrobě (monitorování, regrese). „Co neměříš, nemůžeš zlepšit“ je motto této jednotky.

Změřte dvě samostatné věci

RAG má dvě nohy a musí se měřit samostatně, protože problém může být v jedné z nich:

  1. Kvalita vyzvednutí: Přišel správný díl?
  2. Generační kvalita: Byla správná odpověď vytvořena z příchozího kusu?

Pokud je odpověď špatná, musíte nejprve vědět, která noha je špatná. Pokud správná část nikdy nedorazí, ani ta nejlepší výzva se nemůže uložit (problém s načítáním). Pokud dorazil správný díl, ale model jej špatně přečetl, je zlepšování vyhledávání marné (problém s generováním).

Metriky vyhledávání

Vyhledávání je problém s tříděním/přístupem; měřeno klasickými metrikami vyhledávání informací. K tomu musíte mít zlatý shluk: znalost toho, který díl je „správný“ pro každou otázku.

metrický

Jaká opatření

Jednoduchá definice

Recall@k

Je správný kus v horní k?

Správná rychlost zachycení části

přesnost@k

Kolik z vrácených k kusů je relevantních?

Úklid přineseného

MRR (průměrná reciproční hodnost)

V jakém pořadí je správný kus?

Odměny za umístění na nejvyšších příčkách

Úspěšnost

Přišel alespoň jeden správný kus?

Nejzákladnější měřítko úspěchu

Praktická poznámka: Pokud je Recall@k nízká, měla by být přepracována strategie chunkingu nebo vyhledávání (hybrid, k, re-ranking). Pokud je přesnost nízká, ale vyvolání je vysoké, je přidání nového pořadí dobrým krokem.

Generační metriky

Když dorazí správný díl, měříme kvalitu odezvy vytvářené modelem. Tři základní rozměry:

  • Věrnost: Je každé tvrzení v odpovědi podpořeno kontextem? Existuje nějaká armatura? Je to přímá míra halucinace.
  • Relevance odpovědi: Odpovídá odpověď skutečně na otázku, nebo je mimo téma?
  • Úplnost: Byly použity všechny relevantní informace v kontextu nebo chybí?

Ty jsou často hodnoceny na základě hodnocení (např. 1–5), spíše než binárně jako „pravda/nepravda“.

Tip: Věrnost sledujte jako samostatnou metriku. Pokud věrnost klesá se snižující se přesností, problémem je generování; Pokud je věrnost vysoká, ale odpověď je špatná, problém je ve špatném kousku (vyhledání). Společně jsou tyto dvě metriky kompasem, který ukazuje místo poruchy.

Vytvoření sady zlatých otázek

Každé měření vyžaduje zlatý soubor / vyhodnocovací datový soubor: realistické otázky + očekávané správné odpovědi + správné zdrojové části. Začít s 30-50 dobře vybranými otázkami je lepší než 500 náhodných otázek. Do sady zahrňte následující: často kladené skutečné otázky, známé obtížné otázky, pastové otázky bez odpovědí (mělo by se říci „nevím“), otázky s protichůdnými zdroji.

# Příklad zlatého shluku (koncepční)[ {"question": "Kolik dní roční dovolené?", "expected_answer": "14 dní na 1-5 let odpracovaných let", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Kde je očekávaná kancelář Marsu, #_INTERNATION I don't', "" znát "correct_part_id": null, "category": "trap"}]

LLM jako soudce: Automatické hodnocení

Vyhodnocování stovek odpovědí ručně je únavné. Model LLM jako soudce je, když jeden model skóruje a odůvodňuje odpověď jiného modelu na základě určitých kritérií. Dobrý soudce pohotově jasně definuje kritéria, uvádí příklady a žádá zdůvodnění.

# LLM-as-judge prompt (koncepční)Jste nestranný hodnotitel. Níže uvedenou ODPOVĚĎ vyhodnoťte podle daného SOUVISLOSTI a OČEKÁVANÉ ODPOVĚDI. Bodujte (1-5) a zdůvodněte:- věrnost: je každé tvrzení v odpovědi podpořeno v kontextu?- přesnost: odpovídá odpověď očekávané odpovědi?- úplnost: jsou příslušné informace úplné? Zejména: pokud odpověď obsahuje informace, které nejsou v kontextu, uveďte věrnost1 a uveďte, které tvrzení je vymyšlené. KONTEXT: {context}OČEKÁVANÉ: {očekávané}ODPOVĚĎ: {answer}Výstup: {věrnost, přesnost, úplnost, zdůvodnění}

Pozor: LLM jako soudce není dokonalý; Mohou mít své vlastní předsudky (dlouhá odpověď, preferující svůj vlastní styl). Ověřte také soudce: nechte některé odpovědi obodovat soudcem i člověkem a změřte shodu mezi nimi. Pokud je soudce v souladu s lidskými skóre, můžete mu věřit.

Slabé/silné hodnocení

Slabé ("pro mě to bylo dobré"):

Položil jsem pár otázek a odpovědi se mi zdály dobré. Mám to naživo.# Problém: žádná měření, regrese nepostřehnutelná, zlepšení slepé.

Výkonné (zlatý shluk + diskrétní metriky + automatický úsudek + regrese):

Zlatý shluk 40 otázek. S každou změnou se automaticky měří věrnost a přesnost. Pokud skóre klesne, změna se vrátí zpět. Při výrobě se zpětná vazba od uživatelů shromažďuje a přidává do sady.

Monitoring a regrese ve výrobě

Hodnocení se neprovádí jednou a je ukončeno. Tři stálé praktiky:

  • Regresní testování: Automatické spouštění zlatého clusteru při každé výzvě/načítání/změně modelu. Pokud je skóre sníženo, změna je obrácena. Tím se zabrání „rozbití při pokusu o zlepšení“.
  • Sledování výroby: Sleduje se sazba „Nemohl jsem najít informace“ ve skutečných otázkách, průměrné zpoždění, náklady, zpětná vazba od uživatelů (👍/👎). Náhlé zvýšení "nevím" je často prvním příznakem selhání indexu nebo vyhledávání.
  • Smyčka zpětné vazby: Skutečné otázky poskytnuté uživatelem 👎 jsou zkontrolovány a přidány do zlaté hromady; Soubor se tak postupem času stává bohatším a slepá místa systému se uzavírají.

Tři mini pouzdra

Případ 1 – Tichá regrese. Tým upravil výzvu, aby ji „vylepšil“; Obecná přesnost se zvýšila, ale věrnost klesla o 30 % u trapových otázek (model začal více vyhovovat). Nebylo by si toho všimlo, nebýt pastí ve zlatém shluku; Regresní testování vrátilo změnu.

Případ 2 — Narovnání špatné nohy. U jednoho asistenta byly odpovědi špatné; Tým pracoval na výzvě celé týdny. Když jsme měřili metriky vyhledávání, reminiscence@5 byla pouze 48 % – problém byl ve vyhledávání, nikoli v generování. Když byl přidán hybrid + re-ranking, paměť se zvýšila na 89 % a zvýšila se také přesnost.

Případ 3 – Výrobní upozornění. Jednoho dne vyskočila sazba „Nemohl jsem najít informace“ pro asistenta podpory z 6 % na 34 %. Trackpad varoval; Důvodem bylo, že úloha indexování, která běží v noci, tiše selhala a nové články nebyly nahrány. Bez monitorování by nesprávná prohlášení „nevím“ pokračovala několik dní.

Časté chyby

  • Být spokojený s „mně to fungovalo dobře“: Bez měření zůstane regrese bez povšimnutí.
  • Neoddělovat získávání a generování: Opravíte špatnou nohu a ztratíte čas.
  • Nepokládání pastových otázek: Tendence vymýšlet si věci se ve zlatém shluku neobjevuje.
  • Neověření Soudce: Zaujatá porota dává falešnou důvěru.
  • Nemonitorování výroby: Selhání indexu, exploze nákladů tiše pokračuje.

V souhrnu

  • V RAG se kvalita vyhledávání a generování měří odděleně; Nejprve se musí určit, která noha je poškozená.
  • vyvolat@k, přesnost@k, MRR pro vyhledávání; Pro generaci se používá věrnost, vhodnost, úplnost.
  • Každé měření vyžaduje zlatý shluk; Položte do něj skutečné, obtížné, pasti a protichůdné otázky.
  • LLM jako soudce velké sady automatických skóre; ale sám soudce musí být ospravedlněn proti člověku.
  • Regresní testování, monitorování výroby a zpětná vazba udržují kvalitu v průběhu času.

Aplikační úkol

(1) Vytvořte zlatou sadu alespoň 15 otázek pro svého vlastního asistenta: zahrňte alespoň 3 pasti (žádné odpovědi), 3 obtížné, 2 protichůdné zdrojové otázky. Ke každé otázce napište očekávanou odpověď a správnou část. (2) Ručně porovnejte dvě různé verze promptu s touto sadou; Za věrnost a přesnost dejte každé odpovědi 1–5 bodů. (3) Přizpůsobte výzvu LLM jako soudce výše svým vlastním kritériím. (4) Určete 3 metriky, které budete sledovat ve výrobě, a pro každou se zeptejte „při jakém prahu mám alarm?“ napište hodnotu.

kontrolní seznam

  • [ ] Mohu měřit kvalitu udržení a generování pomocí samostatných metrik.
  • [ ] Vím, co znamenají metriky jako reminiscen@k, věrnost.
  • [ ] Dokážu vytvořit zlatý shluk, který zahrnuje skutečné, obtížné, pasti a protichůdné otázky.
  • [ ] Mohu nastavit automatické hodnocení a ověřit rozhodčího pomocí LLM-as-judge.
  • [ ] Mohu provozovat regresní testování, monitorování výroby a zpětnovazební smyčku.