zisky:
- Definovanie metrík, ktoré merajú kvalitu uchovávania a generovania oddelene
- Nastavte zlatý súbor otázok a spustite automatické vyhodnotenie s LLM ako sudca
- Udržiavanie kvality prostredníctvom spätnej väzby, monitorovania a regresného testovania vo výrobe
Veta „Nainštaloval som asistenta, zdá sa, že funguje dobre“ nie je technickým vyhlásením. Systémy RAG sa potichu pokazia: nový typ dokumentu oklame vyhľadávanie, rýchla zmena znižuje presnosť, index zastaráva. Jediný spôsob, ako si to uvedomiť, je merať. V tejto jednotke sa zaoberáme tým, ako merať kvalitu RAG (oddelené získavanie a generovanie), automatické vyhodnotenie (LLM-as-judge) a udržiavanie kvality vo výrobe (monitorovanie, regresia). „To, čo nemeriaš, nezlepšíš“ je motto tejto jednotky.
Zmerajte dve samostatné veci
RAG má dve nohy a musí sa merať oddelene, pretože problém môže byť v ktorejkoľvek z nich:
- Kvalita odberu: Prišiel správny diel?
- Generačná kvalita: Bola správna odpoveď vytvorená z prichádzajúceho kusu?
Ak je odpoveď zlá, musíte najskôr vedieť, ktorá noha je zlá. Ak správna časť nikdy nepríde, ani tá najlepšia výzva sa nedá uložiť (problém s načítaním). Ak prišla správna súčiastka, ale model ju nesprávne prečítal, zlepšenie vyhľadávania je zbytočné (generačný problém).
Metriky vyhľadávania
Získavanie je problém triedenia/prístupu; merané klasickými metrikami vyhľadávania informácií. Na to musíte mať zlatý zhluk: znalosť toho, ktorá časť je „správna“ pre každú otázku.
metrický
Aké opatrenia
Jednoduchá definícia
Odvolanie@k
Je správny kus v hornej časti k?
Správna miera zachytávania dielov
presnosť@k
Koľko z vrátených k kusov je relevantných?
Upratovanie prineseného
MRR (priemerná recipročná hodnosť)
V akom poradí je správny kus?
Odmenou za umiestnenie na popredných priečkach
Miera návštevnosti
Prišiel aspoň jeden správny kus?
Najzákladnejšia miera úspechu
Praktická poznámka: Ak je Recall@k nízka, mala by sa prepracovať stratégia chunkingu alebo vyhľadávania (hybrid, k, re-ranking). Ak je presnosť nízka, ale zapamätanie je vysoké, pridanie nového poradia je dobrý krok.
Generačné metriky
Keď príde správny diel, zmeriame kvalitu odozvy produkovanej modelom. Tri základné rozmery:
- Vernosť: Je každé tvrdenie v odpovedi podporené kontextom? Existuje nejaká armatúra? Je to priama miera halucinácií.
- Relevantnosť odpovede: Odpovedá odpoveď skutočne na otázku alebo je mimo témy?
- Úplnosť: Boli použité všetky relevantné informácie v kontexte alebo chýbajú?
Tieto sú často hodnotené na základe hodnotenia (napr. 1 – 5), a nie binárne ako „pravda/nepravda“.
Tip: Vernosť sledujte ako samostatnú metriku. Ak vernosť klesá so znižujúcou sa presnosťou, problémom je generovanie; Ak je vernosť vysoká, ale odpoveď je nesprávna, problém je v nesprávnom kúsku (vyhľadávanie). Tieto dve metriky sú spolu kompasom, ktorý ukazuje miesto poruchy.
Vytvorenie zlatého súboru otázok
Každé meranie vyžaduje zlatý súbor / hodnotiaci súbor údajov: realistické otázky + očakávané správne odpovede + správne zdrojové časti. Začať s 30-50 dobre zvolenými otázkami je lepšie ako 500 náhodných otázok. Zahrňte do súboru nasledovné: často kladené skutočné otázky, známe zložité otázky, pasce bez odpovedí (treba povedať „neviem“), otázky s protichodnými zdrojmi.
# Príklad zlatého zhluku (koncepčný)[ {"question": "Koľko dní ročnej dovolenky?", "expected_answer": "14 dní na 1-5 rokov odpracovaných rokov", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Kde je očakávaná kancelária spoločnosti Mars, #_NOT_INTERNATION": "" poznať "correct_part_id": null, "category": "pasca"}]
LLM ako sudca: Automatické hodnotenie
Bodovať stovky odpovedí ručne je únavné. Model LLM ako sudcu je, keď jeden model skóruje a odôvodňuje odpoveď iného modelu na základe určitých kritérií. Dobrý sudca jasne definuje kritériá, uvádza príklady a žiada zdôvodnenie.
# LLM ako sudca prompt (koncepčný)Ste nestranný hodnotiteľ. ODPOVEĎ nižšie vyhodnoťte podľa daného KONTEXTU a OČAKÁVANEJ ODPOVEDE. Ohodnoťte (1-5) a zdôvodnite:- vernosť: je každé tvrdenie v odpovedi podporené v kontexte?- presnosť: zodpovedá odpoveď očakávanej odpovedi?- úplnosť: sú relevantné informácie úplné? Najmä: ak odpoveď obsahuje informácie, ktoré nie sú v kontexte, uveďte vernosť1 a uveďte, ktoré tvrdenie je vymyslené. KONTEXT: {context}OČAKÁVANÉ: {očakávané}ODPOVEĎ: {answer}Výstup: {vernosť, presnosť, úplnosť, odôvodnenie}
Pozor: LLM ako sudca nie je dokonalý; Môžu mať svoje vlastné predsudky (dlhá odpoveď, uprednostňovanie vlastného štýlu). Overte si aj sudcu: nechajte niektoré odpovede obodovať sudcom aj človekom a zmerajte zhodu medzi nimi. Ak je sudca v súlade s ľudskými skóre, môžete mu dôverovať.
Slabé/silné hodnotenie
Slabé ("bolo to pre mňa dobré"):
Položil som pár otázok a odpovede sa mi zdali dobré. Mám to naživo.# Problém: žiadne merania, regresia nepostrehnuteľná, zlepšenie slepé.
Výkonný (zlatý klaster + diskrétne metriky + automatický úsudok + regresia):
Zlatý zhluk 40 otázok. Pri každej zmene sa automaticky meria vernosť a presnosť. Ak skóre klesne, zmena sa vráti späť. Pri výrobe sa spätná väzba od používateľov zhromažďuje a pridáva do súpravy.
Monitorovanie a regresia vo výrobe
Hodnotenie sa nerobí raz a je ukončené. Tri neustále praktiky:
- Regresné testovanie: Automatické spustenie zlatého klastra pri každej výzve/načítaní/zmene modelu. Ak sa skóre zníži, zmena sa zruší. Tým sa zabráni tomu, aby sa to „rozbilo pri pokuse o zlepšenie“.
- Monitorovanie výroby: Monitoruje sa miera „Nemohol som nájsť informácie“ v skutočných otázkach, priemerné oneskorenie, náklady, spätná väzba od používateľov (👍/👎). Náhle zvýšenie „neviem“ je často prvým príznakom poruchy indexu alebo aportu.
- Slučka spätnej väzby: Skutočné otázky poskytnuté používateľom 👎 sú skontrolované a pridané do zlatej kôpky; Zostava sa tak časom stáva bohatšou a mŕtve miesta systému sa uzatvárajú.
Tri mini puzdrá
Prípad 1 – Tichá regresia. Tím upravil výzvu, aby ju „vylepšil“; Všeobecná presnosť sa zvýšila, ale vernosť sa znížila o 30 % v trapových otázkach (model začal viac pasovať). Nebolo by si to všimlo, keby to nebolo pre otázky pasce v zlatom zhluku; Regresné testovanie vrátilo zmenu.
Prípad 2 – Narovnanie nesprávnej nohy. U jedného asistenta boli odpovede zlé; Tím pracoval na výzve celé týždne. Keď sme merali metriky vyhľadávania, spomínaná hodnota@5 bola iba 48 % – problém bol vo vyhľadávaní, nie v generovaní. Keď sa pridal hybrid + re-ranking, pripomenutie sa zvýšilo na 89 % a zvýšila sa aj presnosť.
Prípad 3 – Výrobné upozornenie. Jedného dňa miera „Nemohol som nájsť informácie“ pre asistenta podpory vyskočila zo 6 % na 34 %. Trackpad varoval; Dôvodom bolo, že úloha indexovania, ktorá beží v noci, potichu zlyhala a nové články sa nenahrali. Bez monitorovania by nesprávne vyhlásenia typu „neviem“ pokračovali niekoľko dní.
Časté chyby
- Byť spokojný s „mne to fungovalo dobre“: Bez merania zostane regresia nepovšimnutá.
- Neoddeľovať získavanie a generovanie: Opravíte nesprávnu nohu a stratíte čas.
- Neklásť pascové otázky: Tendencia vymýšľať si veci sa v zlatom zhluku neobjavuje.
- Neoverovanie Sudca: Zaujatá porota dáva falošnú dôveru.
- Nemonitorovanie výroby: Zlyhanie indexu, explózia nákladov ticho pokračuje.
V súhrne
- V RAG sa kvalita získavania a generovania meria oddelene; Najprv sa musí určiť, ktorá noha je poškodená.
- odvolanie@k, presnosť@k, MRR pre vyhľadávanie; Vernosť, vhodnosť, úplnosť sa používa na pokolenie.
- Každé meranie vyžaduje zlatý klaster; Dajte do nej skutočné, ťažké, pasce a protichodné otázky.
- LLM-ako sudca veľké súbory auto-skóre; ale sám sudca musí byť ospravedlnený proti človeku.
- Regresné testovanie, monitorovanie výroby a spätná väzba udržujú kvalitu v priebehu času.
Aplikačná úloha
(1) Vytvorte zlatý súbor aspoň 15 otázok pre svojho vlastného asistenta: zahrňte aspoň 3 pasce (žiadne odpovede), 3 zložité, 2 protichodné zdrojové otázky. Ku každej otázke napíšte očakávanú odpoveď a správnu časť. (2) Manuálne porovnajte dve rôzne rýchle verzie s touto sadou; Za vernosť a presnosť dajte každej odpovedi 1-5 bodov. (3) Prispôsobte výzvu LLM ako sudcu vyššie svojim vlastným kritériám. (4) Identifikujte 3 metriky, ktoré budete sledovať vo výrobe, a pre každú sa opýtajte „pri akej hranici mám alarmovať?“ napíš hodnotu.
kontrolný zoznam
- [ ] Môžem merať kvalitu udržania a generovania pomocou samostatných metrík.
- [ ] Viem, čo znamenajú metriky ako pripomenúť@k, vernosť.
- [ ] Dokážem vybudovať zlatý zhluk, ktorý obsahuje skutočné, zložité, pasce a protichodné otázky.
- [ ] Môžem nastaviť automatické hodnotenie a overiť sudcu pomocou LLM-ako-sudca.
- [ ] Dokážem prevádzkovať regresné testovanie, monitorovanie výroby a spätnú väzbu.