Dobici:
- Definiranje metrika koje mjere zadržavanje i kvalitet proizvodnje odvojeno
- Postavite zlatni skup pitanja i pokrenite automatsku evaluaciju sa LLM-kao-sucem
- Održavanje kvaliteta putem povratnih informacija, praćenja i regresijskog testiranja u proizvodnji
Rečenica "Instalirao sam pomoćnika, izgleda da radi dobro" nije inženjerska izjava. RAG sistemi se nečujno kvare: novi tip dokumenta zavarava pronalaženje, brza promjena smanjuje tačnost, indeks postaje zastarjeli. Jedini način da se to shvati je mjerenje. U ovoj jedinici pokrivamo kako mjeriti kvalitet RAG-a (preuzimanje i generiranje odvojeno), automatsku evaluaciju (LLM-kao sudija) i održavati kvalitetu u proizvodnji (praćenje, regresija). "Ne možete poboljšati ono što ne izmjerite" moto je ove jedinice.
Izmjerite dvije odvojene stvari
RAG ima dvije noge i mora se mjeriti odvojeno jer problem može biti u bilo kojoj od njih:
- Kvalitet preuzimanja: Je li stigao ispravan dio?
- Kvalitet generiranja: Da li je tačan odgovor proizveo iz dolaznog komada?
Ako je odgovor loš, prvo morate znati koja je noga loša. Ako pravi dio nikada ne stigne, čak ni najbolji prompt ne može sačuvati (problem pri preuzimanju). Ako je stigao ispravan dio, ali ga je model pogrešno pročitao, poboljšanje preuzimanja je uzaludno (problem generiranja).
Retrieval Metrics
Dohvaćanje je problem sortiranja/pristupa; mjereno klasičnim metrikama pronalaženja informacija. Za ovo morate imati zlatni grozd: znanje o tome koji komad je "tačan" za svako pitanje.
metrički
Koje mere
Jednostavna definicija
Recall@k
Da li je ispravan komad u gornjem k?
Ispravna stopa hvatanja dijela
preciznost@k
Koliko je od vraćenih k komada relevantno?
Čišćenje onog što se donese
MRR (srednji recipročni rang)
Kojim redoslijedom je ispravan komad?
Nagrade su u najvišim rangovima
Stopa pogodaka
Je li stigao barem jedan ispravan komad?
Najosnovnije merilo uspeha
Praktični komentar: Ako je Recall@k nizak, treba preraditi strategiju razdvajanja ili pretraživanja (hibrid, k, ponovno rangiranje). Ako je preciznost niska, ali je pamćenje visoko, dodavanje ponovnog rangiranja je dobar potez.
Generation Metrics
Kada stigne ispravan dio, mjerimo kvalitetu odgovora modela. Tri osnovne dimenzije:
- Vjernost: Da li je svaka tvrdnja u odgovoru potkrijepljena kontekstom? Da li postoji neka oprema? To je direktna mjera halucinacije.
- Relevantnost odgovora: Da li odgovor zapravo odgovara na pitanje ili je van teme?
- Potpunost: Da li su sve relevantne informacije u kontekstu korištene ili nedostaju?
Oni se često boduju na osnovu stepena (npr. 1-5), a ne binarno poput „tačno/netačno“.
Savjet: Pratite vjernost kao zasebnu metriku. Ako vjernost opada kako se smanjuje tačnost, problem je generacija; Ako je vjernost visoka, ali je odgovor pogrešan, problem je pogrešan komad (preuzimanje). Zajedno, ove dvije metrike su kompas koji pokazuje lokaciju kvara.
Uspostavljanje skupa zlatnih pitanja
Svako mjerenje zahtijeva zlatni skup / skup podataka evaluacije: realna pitanja + očekivani tačni odgovori + tačni izvorni dijelovi. Bolje je započeti sa 30-50 dobro odabranih pitanja od 500 nasumičnih pitanja. U set uključite sljedeće: često postavljana prava pitanja, poznata teška pitanja, pitanja zamke bez odgovora (treba reći "ne znam"), pitanja sa kontradiktornim izvorima.
# Primjer zlatnog klastera (konceptualni)[ {"question": "Koliko dana godišnjeg odmora?", "expected_answer": "14 dana za 1-5 godina staža", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Gdje je ured kompanije?", "M. # trap: ne znam "correct_part_id": null, "category": "trap"}]
LLM-kao sudija: Automatska procjena
Ocjenjivanje stotina odgovora rukom je zamorno. LLM-kao sudijski model je kada jedan model daje bodove i opravdava odgovor drugog modela na osnovu određenih kriterija. Dobar sudija jasno definiše kriterijume, daje primere i traži opravdanje.
# LLM-as-udge prompt (konceptualno)Vi ste nepristrasni evaluator. Procijenite ODGOVOR u nastavku prema datom KONTEKSTU i OČEKIVANOM ODGOVORU. Ocijenite (1-5) i opravdajte:- vjernost: da li je svaka tvrdnja u odgovoru potkrijepljena u kontekstu?- tačnost: odgovara li odgovor očekivanom odgovoru?- potpunost: da li je relevantna informacija potpuna? Konkretno: ako odgovor sadrži informacije koje nisu u kontekstu, navedite vjernost1 i navedite koja je tvrdnja izmišljena. KONTEKST: {kontekst}OČEKIVANO: {očekivano}ODGOVOR: {answer}Izlaz: {vjernost, tačnost, potpunost, opravdanost}
Oprez: LLM-kao sudija nije savršen; Oni mogu imati svoje predrasude (dugi odgovor, preferiraju svoj stil). Također provjerite sudiju: neka odgovore ocijene i sudija i čovjek i izmjerite slaganje između njih. Ako je sudija dosljedan ljudskim rezultatima, možete mu vjerovati.
Slaba/Jaka ocjena
Slabo ("bilo je dobro za mene"):
Postavio sam nekoliko pitanja i odgovori su bili dobri. Imam ga uživo.# Problem: nema mjerenja, regresija neprimjetna, poboljšanje slijepo.
Moćan (zlatni klaster + diskretna metrika + automatsko prosuđivanje + regresija):
Zlatni skup od 40 pitanja. Sa svakom promjenom, opoziv@5, vjernost i tačnost se mjere automatski. Ako rezultat padne, promjena se poništava. U proizvodnji se prikupljaju povratne informacije korisnika i dodaju u set.
Monitoring i regresija u proizvodnji
Evaluacija se ne radi jednom i završava. Tri stalne prakse:
- Regresijsko testiranje: Automatski pokreni zlatni klaster pri svakoj prompt/preuzimanju/promjeni modela. Ako se rezultat smanji, promjena se poništava. Time se sprečava „razbijanje dok pokušavate da ga poboljšate“.
- Praćenje proizvodnje: prati se stopa "Nisam mogao pronaći informacije" u stvarnim pitanjima, prosječno kašnjenje, cijena, povratne informacije korisnika (👍/👎). Iznenadno povećanje "ne znam" često je prvi znak neispravnosti indeksa ili preuzimanja.
- Petlja povratnih informacija: Prava pitanja koja postavlja korisnik 👎 se pregledavaju i dodaju na zlatnu gomilu; Tako skup postaje bogatiji tokom vremena i mrtve tačke sistema se zatvaraju.
Tri mini futrole
Slučaj 1 — Tiha regresija. Tim je modificirao prompt kako bi ga "poboljšao"; Opća preciznost se povećala, ali je vjernost smanjena za 30% u pitanjima zamke (model je počeo više odgovarati). To se ne bi primijetilo da nije bilo pitanja o zamkama u zlatnom grozdu; Regresijsko testiranje je poništilo promjenu.
Slučaj 2 — Ispravljanje pogrešne noge. Kod jednog asistenta odgovori su bili loši; Tim je sedmicama radio na brzini. Kada smo mjerili metriku preuzimanja, opoziv@5 je bio samo 48% — problem je bio u pronalaženju, a ne u generiranju. Kada je dodat hibrid + ponovno rangiranje, opoziv se povećao na 89%, a preciznost se također povećala.
Slučaj 3 — Upozorenje o proizvodnji. Jednog dana, stopa "nisam mogao pronaći informacije" za pomoćnika za podršku skočila je sa 6% na 34%. Trakpad je upozorio; Razlog je taj što je posao indeksiranja, koji radi noću, tiho propao i novi članci nisu učitani. Bez praćenja, netačne izjave "ne znam" bi se nastavile danima.
Uobičajene greške
- Biti zadovoljan sa „meni je dobro funkcionisalo“: Bez merenja, regresija ostaje neprimećena.
- Ne razdvajajući pronalaženje i generisanje: ispravit ćete pogrešnu nogu i izgubiti vrijeme.
- Ne postavljati pitanja o zamkama: Sklonost izmišljanju ne pojavljuje se u zlatnom grozdu.
- Neprovjeravajući sudija: Pristrasna porota daje lažno povjerenje.
- Ne prati proizvodnju: neuspjeh indeksa, eksplozija troškova se nastavlja tiho.
Ukratko
- U RAG-u, kvalitet preuzimanja i proizvodnje se mjere odvojeno; Prvo se mora utvrditi koja je noga oštećena.
- opoziv@k, preciznost@k, MRR za pronalaženje; Vjernost, podobnost, potpunost se koriste za generiranje.
- Za svako mjerenje je potreban zlatni klaster; Stavite prava, teška, zamka i kontradiktorna pitanja.
- LLM-kao sudija veliki setovi automatski bodovi; ali sam sudija mora biti opravdan protiv čoveka.
- Regresijsko testiranje, praćenje proizvodnje i povratna sprega održavaju kvalitet tokom vremena.
Zadatak aplikacije
(1) Napravite zlatni set od najmanje 15 pitanja za svog asistenta: uključite najmanje 3 zamke (bez odgovora), 3 teška, 2 kontradiktorna izvorna pitanja. Za svako pitanje napišite očekivani odgovor i tačan dio. (2) Ručno uporedite dvije različite verzije prompta sa ovim skupom; Svakom odgovoru dajte 1-5 bodova za vjernost i tačnost. (3) Prilagodite upit LLM-kao sudija iznad vašim kriterijima. (4) Identifikujte 3 metrike koje ćete pratiti u proizvodnji i za svaku pitajte „na kom pragu da alarmiram?“ napišite vrijednost.
kontrolna lista
- [ ] Mogu mjeriti kvalitet zadržavanja i generiranja s odvojenim metrikama.
- [ ] Znam šta znače metrika poput recall@k, vjernost.
- [ ] Mogu da napravim zlatnu grupu koja uključuje stvarna, teška, zamka i kontradiktorna pitanja.
- [ ] Mogu podesiti automatsku evaluaciju i verifikovati sudiju sa LLM-kao sudija.
- [ ] Mogu upravljati regresijskim testiranjem, praćenjem proizvodnje i povratnom spregom.