Üksus 8 / 11

RAG hindamine ja seire

Kasu:

  • Mõõdikute määratlemine, mis mõõdavad eraldi säilitamise ja genereerimise kvaliteeti
  • Seadistage kuldküsimuste komplekt ja käivitage automaatne hindamine LLM-as-judge abil
  • Kvaliteedi säilitamine tagasiside, seire ja regressioonitestide abil tootmises

Lause "Ma installisin assistendi, tundub, et see töötab hästi" ei ole inseneri väide. RAG-süsteemid lagunevad vaikselt: uus dokumenditüüp petab otsimise, kiire muudatus vähendab täpsust, indeks muutub vanaks. Ainus viis seda mõista on mõõta. Selles üksuses käsitleme RAG-i kvaliteedi mõõtmist (eraldi otsimine ja genereerimine), automaatset hindamist (LLM-as-judge) ja tootmise kvaliteedi säilitamist (seire, regressioon). "Sa ei saa parandada seda, mida te ei mõõda" on selle üksuse moto.

Mõõtke kahte eraldiseisvat asja

RAG-l on kaks jalga ja seda tuleb mõõta eraldi, kuna probleem võib olla ühes neist:

  1. Allalaadimise kvaliteet: kas õige osa saabus?
  2. Generatsiooni kvaliteet: kas õige vastus saadi sissetulevast kirjatükist?

Kui vastus on halb, peate kõigepealt teadma, milline jalg on halb. Kui õiget osa ei jõua kunagi kohale, ei saa isegi parimat viipa salvestada (otsimisprobleem). Kui õige osa saabus, kuid mudel luges seda valesti, on otsingu parandamine mõttetu (põlvkonnaprobleem).

Otsimise mõõdikud

Otsimine on sortimise/juurdepääsu probleem; mõõdetuna klassikaliste teabeotsingu mõõdikutega. Selleks peab teil olema kuldne klaster: teadmine, milline tükk on iga küsimuse jaoks "õige".

meetriline

Milliseid meetmeid

Lihtne määratlus

Meenuta @ k

Kas õige tükk on ülemises k?

Õige osa hõivamise kiirus

täpsus@k

Kui paljud tagastatud k tükist on asjakohased?

Toodu koristamine

MRR (keskmine vastastikune aste)

Millises järjekorras on õige tükk?

Preemiad kõrgeimates ridades

Tabamusmäär

Kas vähemalt üks õige tükk saabus?

Edukuse kõige elementaarsem mõõt

Praktiline kommentaar: Kui Recall@k on madal, tuleks tükeldamise või otsingustrateegia (hübriid, k, ümberpaigutamine) ümber töötada. Kui täpsus on madal, kuid meeldetuletus kõrge, on paremusjärjestuse lisamine hea samm.

Põlvkonna mõõdikud

Õige osa saabumisel mõõdame mudeli poolt tekitatud vastuse kvaliteeti. Kolm põhimõõdet:

  • Truudus: kas iga vastuse väidet toetab kontekst? Kas kinnitust on olemas? See on hallutsinatsioonide otsene mõõt.
  • Vastuse asjakohasus: kas vastus vastab tegelikult küsimusele või on see teemaväline?
  • Täielikkus: kas kogu asjakohast teavet kontekstis on kasutatud või see puudub?

Neid hinnatakse sageli hindepõhiselt (nt 1–5), mitte binaarselt nagu "tõene/väär".

Nõuanne. Jälgige ustavust eraldi mõõdikuna. Kui ustavus täpsuse vähenedes väheneb, on probleem genereerimises; Kui truudus on kõrge, kuid vastus on vale, on probleemiks vale tükk (tagasiotsimine). Need kaks mõõdikut koos on kompass, mis näitab tõrke asukohta.

Kuldsete küsimuste komplekti loomine

Iga mõõtmine nõuab kuldset komplekti / hindamisandmestikku: realistlikud küsimused + eeldatavad õiged vastused + õiged lähtetekstid. 30–50 hästi valitud küsimusega alustamine on parem kui 500 juhuslikku küsimust. Kaasake komplekti: korduma kippuvad tõelised küsimused, teadaolevalt keerulised küsimused, vastuseta lõksküsimused (peab ütlema "ma ei tea"), vastuoluliste allikatega küsimused.

# Kuldse klastri näide (kontseptuaalne)[ {"question": "Mitu päeva põhipuhkust?", "oodatav_vastus": "14 päeva 1-5-aastase staaži eest", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Kus on ettevõtte asukoht?", ""s:" "NO_INFORMATION", # trap: ma ei tea "correct_part_id": null, "category": "trap"}]

LLM-as-Judge: automaatne hindamine

Sadade vastuste käsitsi hindamine on väsitav. LLM-as-Judge mudel on see, kui üks mudel hindab ja põhjendab teise mudeli vastust teatud kriteeriumide alusel. Hea kohtuniku küsib selgelt kriteeriumid, toob näiteid ja küsib põhjendust.

# LLM-as-Judge prompt (kontseptuaalne) Olete erapooletu hindaja. Hinnake allolevat VASTUST vastavalt etteantud KONTEKSTILE ja OODATUD VASTUSELE. Hinda (1-5) ja põhjenda:- tõepärasus: kas vastuse iga väide on kontekstis toetatud?- täpsus: kas vastus vastab oodatud vastusele?- täielikkus: kas vastav teave on täielik? Eelkõige: kui vastus sisaldab konteksti mittekuuluvat teavet, märkige ustavus1 ja märkige, milline väide on väljamõeldud. KONTEKST: {kontekst}OODATUD: {oodata}VASTUS: {vastus}Väljund: {truudus, täpsus, täielikkus, õigustus}

Ettevaatust: LLM-kohtunik ei ole täiuslik; Neil võib olla oma eelarvamus (pikk vastus, oma stiili eelistamine). Kontrollige ka kohtunikku: laske mõned vastused hinnata nii kohtunikul kui ka inimesel ja mõõtke nende vahelist kokkulepet. Kui Judge on inimeste tulemustega kooskõlas, võite teda usaldada.

Nõrk/tugev hinnang

Nõrk ("see oli minu jaoks hea"):

Küsisin paar küsimust ja vastused tundusid head. Mul on see reaalajas.# Probleem: mõõtmised puuduvad, regressioon on märkamatu, paranemine pime.

Võimas (kullaklaster + diskreetsed mõõdikud + automaatne otsustus + regressioon):

40 küsimusest koosnev kuldne klaster. Iga muudatusega, tagasikutsumisega @5, mõõdetakse ustavust ja täpsust automaatselt. Kui skoor langeb, tühistatakse muudatus. Tootmises kogutakse kasutajate tagasisidet ja lisatakse see komplekti.

Seire ja regressioon tootmises

Hindamist ei tehta üks kord ja see lõpetatakse. Kolm pidevat praktikat:

  • Regressioonitest: käivitage kuldklaster automaatselt iga viipa/otsingu/mudeli muutmise korral. Kui skoori vähendatakse, pööratakse muudatus tagasi. See hoiab ära selle "murdmise, püüdes seda paremaks muuta".
  • Tootmise jälgimine: jälgitakse reaalsetes küsimustes "infot ei leidnud", keskmist viivitust, maksumust, kasutajate tagasisidet (👍/👎). "Ma ei tea" järsk tõus on sageli esimene märk indeksi või otsingu rikke kohta.
  • Tagasiside tsükkel: kasutaja esitatud tõelised küsimused 👎 vaadatakse üle ja lisatakse kuldsesse hunnikusse; Seega muutub komplekt aja jooksul rikkalikumaks ja süsteemi pimealad suletakse.

Kolm miniümbrist

Juhtum 1 – vaikne regressioon. Meeskond muutis viipa selle "parandamiseks"; Üldine täpsus tõusis, kuid truudus langes lõksküsimustes 30% (mudel hakkas rohkem sobima). Seda poleks märganud, kui poleks olnud lõksuküsimusi kuldses kobaras; Regressioonitestimine tühistas muudatuse.

Juhtum 2 – vale jala sirgendamine. Ühel assistendil olid vastused halvad; Meeskond töötas nädalaid selle viipa kallal. Kui mõõtsime otsingumõõdikuid, oli tagasikutsumine@5 vaid 48% – probleem oli otsimises, mitte genereerimises. Kui lisati hübriid + ümberpaigutamine, suurenes tagasikutsumine 89% -ni ja samuti suurenes täpsus.

Juhtum 3 – tootmishoiatus. Ühel päeval hüppas tugiassistendi "Ma ei leidnud teavet" määr 6 protsendilt 34 protsendile. Puuteplaat hoiatas; Põhjus oli selles, et öösel jooksev indekseerimistöö nurjus vaikselt ja uusi artikleid ei laetud üles. Ilma jälgimiseta oleks valesid "ma ei tea" väiteid jätkunud päevadeks.

Levinud vead

  • Olles rahul sellega, et "see töötas minu jaoks hästi": ilma mõõtmiseta jääb regressioon märkamatuks.
  • Otsimist ja genereerimist ei eraldata: parandate vale jala ja raiskate aega.
  • Lõksuküsimuste esitamata jätmine: kalduvus asju välja mõelda ei paista kuldses kobaras.
  • Kohtunikut ei kontrolli: erapoolik žürii annab vale enesekindluse.
  • Tootmist ei jälgita: indeksi rike, kuluplahvatus jätkub vaikselt.

Kokkuvõttes

  • RAG-is mõõdetakse otsimise ja genereerimise kvaliteeti eraldi; Kõigepealt tuleb kindlaks teha, milline jalg on kahjustatud.
  • meeldetuletus@k, täpsus@k, MRR otsimiseks; Põlvkonna jaoks kasutatakse truudust, sobivust, täielikkust.
  • Iga mõõtmise jaoks on vaja kullaklastrit; Pange sellesse tõelised, rasked, lõksu ja vastuolulised küsimused.
  • LLM-as-Judge suured komplektid auto-skoorid; aga kohtunik ise peab olema õigustatud inimese vastu.
  • Regressioonitestimine, tootmise jälgimine ja tagasiside ahel säilitavad kvaliteedi aja jooksul.

Rakenduse ülesanne

(1) Koostage oma abilise jaoks vähemalt 15 küsimusest koosnev kuldne komplekt: lisage vähemalt 3 lõksu (vastuseid pole), 3 rasket, 2 vastuolulist allikaküsimust. Kirjuta iga küsimuse juurde oodatud vastus ja õige osa. (2) Võrrelge selle komplektiga käsitsi kahte erinevat viipa versiooni; Andke igale vastusele truuduse ja täpsuse eest 1-5 punkti. (3) Kohandage ülaltoodud viip LLM-as-Judge vastavalt oma kriteeriumidele. (4) Määrake 3 mõõdikut, mida tootmises jälgite, ja küsige iga kohta: „millise läve korral ma hoiatan?” kirjuta väärtus.

kontrollnimekiri

  • [ ] Saan mõõta säilitamise ja genereerimise kvaliteeti eraldi mõõdikutega.
  • [ ] Ma tean, mida tähendavad sellised mõõdikud nagu meeldetuletus@k, truudus.
  • [ ] Oskan ehitada kuldse klastri, mis sisaldab tõelisi, keerulisi, lõksu ja vastuolulisi küsimusi.
  • [ ] Saan seadistada automaatse hindamise ja kontrollida kohtunikku LLM-as-Judge abil.
  • [ ] Oskan kasutada regressioonitesti, tootmise jälgimist ja tagasisideahelat.