Vienetas 8 / 11

RAG vertinimas ir stebėsena

Pelnas:

  • Apibrėžkite metriką, kuri atskirai matuoja išlaikymą ir generavimo kokybę
  • Sukurkite auksinių klausimų rinkinį ir paleiskite automatinį vertinimą naudodami LLM kaip teisėją
  • Kokybės palaikymas naudojant grįžtamąjį ryšį, stebėjimą ir regresijos testavimą gamyboje

Sakinys „Įdiegiau asistentą, atrodo, kad jis veikia gerai“ nėra inžinerinis teiginys. RAG sistemos genda tyliai: naujas dokumento tipas apgauna gavimą, greitas pakeitimas sumažina tikslumą, indeksas pasensta. Vienintelis būdas tai suprasti – išmatuoti. Šiame skyriuje aptariame, kaip išmatuoti RAG kokybę (atskirai gavimas ir generavimas), automatinis vertinimas (LLM-as-judge) ir gamybos kokybės palaikymas (stebėjimas, regresija). „To, ko nematuosi, nepatobulinsi“ – toks šio padalinio šūkis.

Išmatuokite du atskirus dalykus

RAG turi dvi kojeles ir turi būti matuojama atskirai, nes problema gali būti vienoje iš jų:

  1. Gavimo kokybė: ar buvo gauta tinkama dalis?
  2. Kartos kokybė: ar teisingas atsakymas buvo gautas iš gaunamo kūrinio?

Jei atsakymas blogas, pirmiausia reikia žinoti, kuri koja bloga. Jei tinkama dalis niekada nepasiekiama, net geriausio raginimo nepavyks išsaugoti (gavimo problema). Jei gauta tinkama dalis, bet modelis ją neteisingai perskaitė, patobulinti gavimą yra beprasmiška (kartos problema).

Paieškos metrika

Gavimas yra rūšiavimo / prieigos problema; matuojamas klasikiniais informacijos paieškos metrikais. Tam jūs turite turėti auksinį klasterį: žinoti, kuris gabalas yra „tinkamas“ kiekvienam klausimui.

metrinė

Kokias priemones

Paprastas apibrėžimas

Prisiminkite@k

Ar teisinga dalis yra viršuje k?

Teisingas dalių fiksavimo greitis

preciziškumas@k

Kiek iš k grąžintų vienetų yra aktualūs?

Išvalymas to, kas atsinešta

MRR (vidutinis abipusis reitingas)

Kokia tvarka yra teisinga dalis?

Apdovanojimai yra aukščiausiose gretose

Pataikymo rodiklis

Ar atkeliavo bent vienas teisingas gabalas?

Pats pagrindinis sėkmės matas

Praktinis komentaras: Jei Recall@k yra žemas, gabalų skirstymo arba paieškos strategiją (hibridą, k, pakartotinį reitingavimą) reikia pakeisti. Jei tikslumas mažas, o atšaukimas didelis, galima būtų pakeisti reitingą.

Kartos metrika

Kai gaunama tinkama dalis, mes išmatuojame modelio atsakymo kokybę. Trys pagrindiniai matmenys:

  • Ištikimybė: ar kiekvienas atsakymo teiginys yra pagrįstas kontekstu? Ar yra koks nors tvirtinimas? Tai tiesioginis haliucinacijų matas.
  • Atsakymo tinkamumas: ar atsakymas iš tikrųjų atsako į klausimą, ar jis ne į temą?
  • Išsamumas: ar buvo panaudota visa atitinkama informacija, ar jos trūksta?

Jie dažnai vertinami balais (pvz., 1–5), o ne dvejetainiais, pavyzdžiui, „teisinga / klaidinga“.

Patarimas: stebėkite ištikimybę kaip atskirą metriką. Jei ištikimybė mažėja mažėjant tikslumui, problema yra generavimas; Jei ištikimybė yra aukšta, bet atsakymas neteisingas, problema yra netinkamas gabalas (atsiekimas). Kartu šie du rodikliai yra kompasas, rodantis gedimo vietą.

Auksinių klausimų rinkinio sudarymas

Kiekvienam matavimui reikalingas auksinis rinkinys / vertinimo duomenų rinkinys: realistiški klausimai + laukiami teisingi atsakymai + teisingi šaltinio elementai. Geriau pradėti nuo 30–50 gerai atrinktų klausimų nei 500 atsitiktinių klausimų. Į rinkinį įtraukite: dažnai užduodamus tikrus klausimus, žinomus sudėtingus klausimus, spąstus klausimus be atsakymų (reikia sakyti „nežinau“), klausimus su prieštaringais šaltiniais.

# Auksinio klasterio pavyzdys (konceptualus)[ {"question": "Kiek dienų kasmetinių atostogų?", "expected_answer": "14 dienų už 1-5 metų darbo stažą", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Kur yra įmonė, "s "NO_INFORMATION", # trap: Nežinau "correct_part_id": null, "category": "trap"}]

LLM kaip teisėjas: automatinis vertinimas

Ranka vertinti šimtus atsakymų vargina. LLM kaip teisėjas modelis yra tada, kai vienas modelis įvertina balus ir pagrindžia kito modelio atsakymą pagal tam tikrus kriterijus. Geras teisėjas aiškiai apibrėžia kriterijus, pateikia pavyzdžių ir prašo pagrįsti.

# LLM kaip teisėjas raginimas (konceptualus) Jūs esate nešališkas vertintojas. Įvertinkite žemiau esantį ATSAKYMĄ pagal pateiktą KONTEKSTĄ ir LAUKIAMĄ ATSAKYMĄ. Įvertinkite (1–5) ir pagrįskite:- ištikimybė: ar kiekvienas atsakymo teiginys yra pagrįstas kontekste?- tikslumas: ar atsakymas atitinka laukiamą atsakymą?- išsamumas: ar atitinkama informacija yra išsami? Ypač: jei atsakyme yra informacijos, kuri nėra kontekste, pateikite ištikimybę1 ir nurodykite, kuris teiginys yra išgalvotas.KONTEKSTAS: {kontekstas}TIEKAMA: {tikėtina}ATSAKYMAS: {atsakymas}Išvestis: {ištikimumas, tikslumas, išsamumas, pagrindimas}

Atsargiai: LLM kaip teisėjas nėra tobulas; Jie gali turėti savo šališkumo (ilgas atsakymas, teikia pirmenybę savo stiliui). Taip pat patikrinkite teisėją: paprašykite, kad teisėjas ir žmogus įvertintų kai kuriuos atsakymus ir įvertintų jų tarpusavio susitarimą. Jei teisėjas atitinka žmonių balus, galite juo pasitikėti.

Silpnas/stiprus įvertinimas

Silpnas („man buvo geras“):

Uždaviau keletą klausimų ir atsakymai atrodė geri. Turiu tai gyvai.# Problema: nėra matavimų, regresija nepastebima, tobulėjimas aklas.

Galingas (auksinis klasteris + diskreti metrika + automatinis sprendimas + regresija):

Auksinė 40 klausimų grupė. Su kiekvienu pakeitimu, atšaukimu@5, ištikimybė ir tikslumas matuojamas automatiškai. Jei rezultatas sumažėja, pakeitimas atšaukiamas. Gamyboje renkami vartotojų atsiliepimai ir pridedami prie rinkinio.

Stebėjimas ir regresija gamyboje

Vertinimas neatliekamas vieną kartą ir nebaigtas. Trys nuolatinės praktikos:

  • Regresijos testavimas: automatiškai paleiskite auksinį klasterį kiekvieną kartą ragindami / gavus / pakeitus modelį. Jei balas sumažinamas, pokytis atšaukiamas. Tai neleidžia „sulaužyti bandant jį pagerinti“.
  • Gamybos stebėjimas: „Neradau informacijos“ rodiklis realiuose klausimuose, stebimas vidutinis vėlavimas, kaina, vartotojų atsiliepimai (👍/👎). Staigus „nežinau“ padidėjimas dažnai yra pirmasis indekso ar paieškos gedimo požymis.
  • Atsiliepimų ciklas: Tikrieji vartotojo pateikti klausimai 👎 yra peržiūrimi ir pridedami prie aukso krūvos; Taigi rinkinys laikui bėgant tampa turtingesnis ir sistemos aklosios dėmės užsidaro.

Trys mini dėklai

1 atvejis – tyli regresija. Komanda pakeitė raginimą, kad jį „patobulintų“; Bendras tikslumas padidėjo, tačiau spąstų klausimų ištikimybė sumažėjo 30% (modelis pradėjo labiau tikti). Jis nebūtų buvęs pastebėtas, jei ne spąstų klausimai auksiniame klasteryje; Regresinis testas atšaukė pokyčius.

2 atvejis – neteisingos kojos ištiesinimas. Vieno asistento atsakymai buvo blogi; Komanda pagal raginimą dirbo kelias savaites. Kai išmatavome paieškos metriką, recenzija@5 buvo tik 48 % – problema buvo nuskaitant, o ne generuojant. Pridėjus hibridinį + pakartotinį reitingą, atšaukimas padidėjo iki 89%, o tikslumas taip pat padidėjo.

3 atvejis. Gamybos įspėjimas. Vieną dieną palaikymo asistento „neradau informacijos“ rodiklis šoktelėjo nuo 6% iki 34%. Valdymo skydelis perspėjo; Priežastis buvo ta, kad indeksavimo darbas, kuris vyksta naktį, tyliai žlugo ir nebuvo įkelti nauji straipsniai. Be stebėjimo neteisingi „nežinau“ teiginiai būtų tęsiami kelias dienas.

Dažnos klaidos

  • Būdamas patenkintas tuo, kad „man gerai pasiteisino“: be matavimo regresija nepastebima.
  • Neatskirkite gavimo ir generavimo: ištaisysite neteisingą koją ir sugaišite laiką.
  • Neuždavinėti spąstų klausimų: polinkis išsigalvoti neatsiranda auksiniame klasteryje.
  • Netvirtina teisėjo: šališka žiuri suteikia klaidingą pasitikėjimą.
  • Gamybos nestebėjimas: indekso gedimas, išlaidų sprogimas tęsiasi tyliai.

Apibendrinant

  • RAG duomenų gavimo ir generavimo kokybė vertinama atskirai; Pirmiausia reikia nustatyti, kuri koja pažeista.
  • prisiminimas@k, preciziškumas@k, MRR paieškai; Ištikimybė, tinkamumas, užbaigtumas naudojamas kartai.
  • Kiekvienam matavimui reikia aukso klasterio; Įdėkite tikrus, sunkius, spąstus ir prieštaringus klausimus.
  • LLM kaip teisėjas nustato didelius automatinius balus; bet pats teisėjas turi būti išteisintas prieš žmogų.
  • Regresijos testavimas, gamybos stebėjimas ir grįžtamasis ryšys laikui bėgant išlaiko kokybę.

Taikymo užduotis

(1) Sukurkite auksinį bent 15 klausimų rinkinį savo asistentui: įtraukite bent 3 spąstus (atsakymų nėra), 3 sudėtingus, 2 prieštaringus šaltinio klausimus. Užrašykite laukiamą atsakymą ir teisingą kiekvieno klausimo dalį. (2) Rankiniu būdu palyginkite dvi skirtingas raginimo versijas su šiuo rinkiniu; Už ištikimybę ir tikslumą kiekvienam atsakymui skirkite 1–5 balus. (3) Pritaikykite aukščiau pateiktą LLM kaip teisėjo raginimą pagal savo kriterijus. (4) Nurodykite 3 metrikas, kurias stebėsite gamyboje, ir už kiekvieną paklauskite „pasiekus kokio slenksčio galiu perspėti? parašyti vertę.

kontrolinis sąrašas

  • [ ] Galiu išmatuoti išlaikymo ir generavimo kokybę naudodamas atskirus rodiklius.
  • [ ] Žinau, ką reiškia tokie rodikliai kaip prisiminimas@k, ištikimybė.
  • [ ] Galiu sukurti auksinį klasterį, kuriame yra tikrų, sunkių, spąstų ir prieštaringų klausimų.
  • [ ] Galiu nustatyti automatinį vertinimą ir patikrinti teisėją naudodamas LLM kaip teisėją.
  • [ ] Galiu atlikti regresijos testavimą, gamybos stebėjimą ir grįžtamąjį ryšį.