Fitimet:
- Përcaktimi i metrikave që matin veçmas mbajtjen dhe cilësinë e gjenerimit
- Krijoni një grup pyetjesh të arta dhe ekzekutoni vlerësimin automatik me LLM-as-judge
- Ruajtja e cilësisë përmes reagimeve, monitorimit dhe testimit të regresionit në prodhim
Fjalia "Instalova asistentin, duket se funksionon mirë" nuk është një deklaratë inxhinierike. Sistemet RAG prishen në heshtje: një lloj i ri dokumenti mashtron rikthimin, një ndryshim i menjëhershëm zvogëlon saktësinë, indeksi bëhet bajat. Mënyra e vetme për ta realizuar këtë është të matet. Në këtë njësi, ne mbulojmë mënyrën e matjes së cilësisë së RAG-së (rikthimi dhe gjenerimi veçmas), vlerësimi automatik (LLM-as-judge) dhe ruajtja e cilësisë në prodhim (monitorimi, regresioni). “Nuk mund të përmirësosh atë që nuk mat” është motoja e kësaj njësie.
Matni dy gjëra të veçanta
RAG ka dy këmbë dhe duhet të matet veçmas sepse problemi mund të jetë në secilën prej tyre:
- Cilësia e marrjes: A mbërriti pjesa e duhur?
- Cilësia e gjeneratës: A u krijua përgjigjja e saktë nga pjesa hyrëse?
Nëse përgjigja është e keqe, së pari duhet të dini se cila këmbë është e keqe. Nëse pjesa e duhur nuk arrin kurrë, edhe kërkesa më e mirë nuk mund të shpëtojë (problemi i rikthimit). Nëse pjesa e saktë mbërriti, por modeli e lexoi gabimisht, përmirësimi i rikthimit është i kotë (problemi i gjeneratës).
Metrika e rikthimit
Rikthimi është një problem renditje/qasjeje; matet nga metrikat klasike të marrjes së informacionit. Për këtë duhet të keni grupin e artë: njohuria se cila pjesë është "e saktë" për secilën pyetje.
metrikë
Çfarë masash
Përkufizim i thjeshtë
Kujtoj@k
A është pjesa e saktë në k lart?
Shkalla e saktë e kapjes së pjesëve
precision@k
Sa nga k pjesët e kthyera janë relevante?
Pastrimi i asaj që është sjellë
MRR (Ranku mesatar reciprok)
Në cilën renditje është pjesa e duhur?
Shpërblimet janë në rangjet më të larta
Shkalla e goditjes
A mbërriti të paktën një pjesë e saktë?
Masa më themelore e suksesit
Koment praktik: Nëse Recall@k është i ulët, strategjia e ndarjes ose e kërkimit (hibrid, k, rirenditje) duhet të ripunohet. Nëse saktësia është e ulët, por rikujtimi është i lartë, shtimi i rirenditjes është një veprim i mirë.
Metrika e gjenerimit
Kur arrin pjesa e duhur, ne matim cilësinë e përgjigjes së prodhuar nga modeli. Tre dimensione themelore:
- Besnikëria: A mbështetet çdo pretendim në përgjigje nga konteksti? A ka ndonjë përshtatje? Është një masë e drejtpërdrejtë e halucinacioneve.
- Rëndësia e përgjigjes: A i përgjigjet në të vërtetë përgjigja pyetjes apo është jashtë temës?
- Plotësia: A është përdorur i gjithë informacioni përkatës në kontekst apo mungon?
Këto shpesh vlerësohen në bazë të notave (p.sh. 1-5), në vend të binare si "e vërtetë/e gabuar".
Këshillë: Ndiqni besnikërinë si një metrikë më vete. Nëse besnikëria zvogëlohet ndërsa saktësia zvogëlohet, problemi është gjenerimi; Nëse besnikëria është e lartë, por përgjigja është e gabuar, problemi është pjesa e gabuar (rikthimi). Së bashku, këto dy metrika janë një busull që tregon vendndodhjen e defektit.
Krijimi i një grupi të artë pyetjesh
Çdo matje kërkon një grup të artë / grup të dhënash vlerësimi: pyetje realiste + përgjigje të sakta të pritura + pjesë të sakta burimore. Fillimi me 30-50 pyetje të zgjedhura mirë është më mirë se 500 pyetje të rastësishme. Përfshini sa vijon në grup: pyetje reale të bëra shpesh, pyetje të vështira të njohura, pyetje në kurth pa përgjigje (duhet thënë "nuk e di"), pyetje me burime kontradiktore.
# Shembull i grupit të artë (konceptual)[ {"pyetje": "Sa ditë pushim vjetor?", "përgjigje_e pritur": "14 ditë për 1-5 vjet vjetërsi pune", "correct_part_id": "two-pjes-3", "kategori": "largim"}, {"pyetje": "Ku është përgjigjur kompania?" "NO_INFORMATION", # kurth: nuk e di "correct_part_id": null, "category": "trap"}]
LLM-as-Judge: Vlerësimi Automatik
Të shënosh qindra përgjigje me dorë është e lodhshme. Modeli LLM-as-judge është kur një model shënon dhe justifikon përgjigjen e një modeli tjetër bazuar në kritere të caktuara. Një gjyqtar i mirë i shpejtë përcakton qartë kriteret, jep shembuj dhe kërkon arsyetim.
# Prompt LLM-as-judge (konceptual) Ju jeni një vlerësues i paanshëm. Vlerësoni PËRGJIGJEN e mëposhtme sipas KONTEKSTIT të dhënë dhe PËRGJIGJES së PRITUR. Vlerësoni (1-5) dhe justifikoni:- besnikërinë: a mbështetet çdo pretendim në përgjigje në kontekst?- saktësia: a përputhet përgjigjja me përgjigjen e pritur?- plotësia: a është i plotë informacioni përkatës? Veçanërisht: nëse përgjigja përmban informacione që nuk janë në kontekst, jepni besnikërinë1 dhe tregoni se cili pretendim është i sajuar. KONTEKSTI: {context}E PRITUR: {E pritshme} PËRGJIGJE: {përgjigje} Rezultati: {besnikëria, saktësia, plotësia, justifikimi}
Kujdes: LLM-si-gjyqtar nuk është i përsosur; Ata mund të kenë paragjykimet e tyre (përgjigje e gjatë, duke preferuar stilin e tyre). Verifikoni gjithashtu gjyqtarin: jepni disa përgjigje të shënuara nga gjyqtari dhe njeriu dhe matni marrëveshjen midis tyre. Nëse gjyqtari është në përputhje me rezultatet njerëzore, ju mund t'i besoni atij.
Vlerësim i dobët/i fortë
I dobët ("ishte mirë për mua"):
Bëra disa pyetje dhe përgjigjet më dukeshin të mira. E kam marrë drejtpërdrejt.# Problem: pa matje, regresion i padukshëm, përmirësim i verbër.
I fuqishëm (grup ari + metrikë diskrete + gjykim automatik + regresion):
Grup i artë prej 40 pyetjesh. Me çdo ndryshim, rikujtimi@5, besnikëria dhe saktësia maten automatikisht. Nëse rezultati bie, ndryshimi kthehet prapa. Në prodhim, reagimet e përdoruesve mblidhen dhe shtohen në grup.
Monitorimi dhe regresioni në prodhim
Vlerësimi nuk bëhet një herë dhe përfundon. Tre praktika të vazhdueshme:
- Testimi i regresionit: Grup i artë ekzekutohet automatikisht në çdo ndryshim të kërkesës/rimarrjes/modelit. Nëse rezultati zvogëlohet, ndryshimi kthehet. Kjo parandalon "thyerjen e tij duke u përpjekur ta përmirësoni".
- Monitorimi i prodhimit: Norma "Nuk mund të gjeja informacion" në pyetjet reale, vonesa mesatare, kostoja, komentet e përdoruesve (👍/👎) monitorohen. Një rritje e papritur e "Nuk e di" është shpesh shenja e parë e një mosfunksionimi të indeksit ose rikthimit.
- Cikli i reagimit: Pyetjet reale të ofruara nga përdoruesi 👎 rishikohen dhe shtohen në grumbullin e artë; Kështu, kompleti bëhet më i pasur me kalimin e kohës dhe pikat e verbëra të sistemit mbyllen.
Tre Mini Rastet
Rasti 1 - Regresioni i heshtur. Një ekip modifikoi kërkesën për ta "përmirësuar" atë; Saktësia e përgjithshme u rrit, por besnikëria u ul me 30% në pyetjet e kurthit (modeli filloi të përshtatej më shumë). Nuk do të vihej re nëse nuk do të ishin pyetjet e kurthit në grupin e artë; Testimi i regresionit e ktheu ndryshimin.
Rasti 2 - Drejtimi i këmbës së gabuar. Në një asistent përgjigjet ishin të këqija; Ekipi punoi sipas kërkesës për javë të tëra. Kur matëm metrikën e rikthimit, kujtimi@5 ishte vetëm 48% — problemi ishte në rikthim, jo në gjenerim. Kur u shtua rirenditja hibrid +, kujtesa u rrit në 89% dhe saktësia u rrit gjithashtu.
Rasti 3 — Alarmi i prodhimit. Një ditë, shkalla "Nuk mund të gjeja informacion" për një asistent mbështetës u hodh nga 6% në 34%. Trackpad paralajmëroi; Arsyeja ishte se puna e indeksimit, e cila funksionon gjatë natës, dështoi në heshtje dhe nuk u ngarkuan artikuj të rinj. Pa monitorim, deklaratat e pasakta “nuk e di” do të kishin vazhduar për ditë të tëra.
Gabimet e zakonshme
- Të jesh i kënaqur me "më funksionoi mirë": Pa matje, regresioni kalon pa u vënë re.
- Mos ndarja e rikthimit dhe gjenerimit: Do të korrigjoni këmbën e gabuar dhe do të humbni kohë.
- Mos bërja e pyetjeve kurth: Tendenca për t'i krijuar gjërat nuk shfaqet në grupin e artë.
- Gjyqtari që nuk verifikon: Një juri e njëanshme jep besim të rremë.
- Mos monitorimi i prodhimit: Dështimi i indeksit, shpërthimi i kostos vazhdon në heshtje.
Në përmbledhje
- Në RAG, cilësia e marrjes dhe e gjenerimit maten veçmas; Së pari duhet të përcaktohet se cila këmbë është e dëmtuar.
- kujtoj@k, precision@k, MRR për rikthim; Besnikëria, përshtatshmëria, plotësia përdoren për gjenerim.
- Çdo matje kërkon një grup ari; Vendosni në të pyetje reale, të vështira, kurth dhe kontradiktore.
- LLM-as-judge grupe të mëdha automatike; por vetë gjyqtari duhet të justifikohet kundër njeriut.
- Testimi i regresionit, monitorimi i prodhimit dhe një qark reagimi ruajnë cilësinë me kalimin e kohës.
Detyra e aplikimit
(1) Krijoni një grup të artë prej të paktën 15 pyetjesh për asistentin tuaj: përfshini të paktën 3 kurthe (pa përgjigje), 3 të vështira, 2 pyetje burimore kontradiktore. Shkruani përgjigjen e pritur dhe pjesën e saktë për secilën pyetje. (2) Krahasoni manualisht dy versione të ndryshme prompt me këtë grup; Jepini secilës përgjigje 1-5 pikë për besnikërinë dhe saktësinë. (3) Përshtatni kërkesën LLM-as-gjyqtar më sipër me kriteret tuaja. (4) Identifikoni 3 metrikë që do të gjurmoni në prodhim dhe për secilën pyesni "në çfarë pragu alarmoj?" shkruani vlerën.
listë kontrolli
- [ ] Mund të mat cilësinë e mbajtjes dhe gjenerimit me metrika të veçanta.
- [ ] Unë e di se çfarë do të thotë metrikë si kujtimi@k, besnikëria.
- [ ] Mund të ndërtoj një grup të artë që përfshin pyetje reale, të vështira, kurth dhe kontradiktore.
- [ ] Mund të vendos vlerësimin automatik dhe të verifikoj gjyqtarin me LLM-si gjyqtar.
- [ ] Unë mund të operoj testimin e regresionit, monitorimin e prodhimit dhe ciklin e reagimit.