Voitot:
- Säilytystä ja sukupolven laatua mittaavien mittareiden määrittäminen erikseen
- Määritä kultainen kysymyssarja ja suorita automaattinen arviointi LLM-tuomarina
- Laadun ylläpitäminen palautteen, seurannan ja regressiotestauksen avulla tuotannossa
Lause "Asensin avustajan, se näyttää toimivan hyvin" ei ole tekninen lausunto. RAG-järjestelmät hajoavat äänettömästi: uusi asiakirjatyyppi huijaa hakua, nopea muutos heikentää tarkkuutta, hakemisto vanhenee. Ainoa tapa ymmärtää tämä on mitata. Tässä osiossa käsittelemme RAG-laadun mittaamista (haku ja generointi erikseen), automaattista arviointia (LLM-as-judge) ja tuotannon laadun ylläpitämistä (seuranta, regressio). "Et voi parantaa sitä, mitä et mittaa" on tämän yksikön motto.
Mittaa kaksi erillistä asiaa
RAG:ssa on kaksi jalkaa ja ne on mitattava erikseen, koska ongelma voi olla jommassakummassa niistä:
- Hakulaatu: Tuliko oikea osa perille?
- Sukupolven laatu: Tuotettiinko oikea vastaus saapuvasta kappaleesta?
Jos vastaus on huono, sinun on ensin tiedettävä, mikä jalka on huono. Jos oikea osa ei koskaan tule perille, edes paras kehote ei voi tallentaa (hakuongelma). Jos oikea osa saapui, mutta malli on lukenut sen väärin, haun parantaminen on turhaa (sukupolviongelma).
Hakumittarit
Haku on lajittelu-/käyttöongelma; mitataan klassisilla tiedonhakumittareilla. Tätä varten sinulla on oltava kultainen klusteri: tieto siitä, mikä pala on "oikea" jokaisessa kysymyksessä.
metristä
Mitä toimenpiteitä
Yksinkertainen määritelmä
Muista @k
Onko oikea pala ylemmässä k?
Oikea osan sieppausnopeus
tarkkuus@k
Kuinka moni palautetusta k kappaleesta on relevanttia?
Tuotujen siivous
MRR (keskimääräinen vastavuoroinen sijoitus)
Missä järjestyksessä on oikea pala?
Palkinnot kärkisijoilla olemisesta
Osumaprosentti
Tuliko ainakin yksi oikea kappale?
Menestyksen perusmittari
Käytännön kommentti: Jos Recall@k on alhainen, paloittelu- tai hakustrategia (hybridi, k, uudelleensijoitus) on muokattava. Jos tarkkuus on alhainen, mutta muistaminen korkea, uudelleensijoittamisen lisääminen on hyvä toimenpide.
Sukupolvimittarit
Kun oikea osa saapuu, mittaamme mallin tuottaman vastauksen laatua. Kolme perusmittaa:
- Uskollisuus: Tukeeko asiayhteys jokaista vastauksen väitettä? Onko mitään sovitusta? Se on suora mittari hallusinaatioista.
- Vastauksen relevanssi: Vastaako vastaus todella kysymykseen vai onko se aiheen ulkopuolella?
- Täydellisyys: Onko kaikkia asiaankuuluvia tietoja käytetty vai puuttuvatko ne?
Ne pisteytetään usein arvosanan perusteella (esim. 1-5) binääriarvon, kuten "tosi/epätosi", sijaan.
Vinkki: Seuraa uskollisuutta erillisenä mittarina. Jos uskollisuus heikkenee tarkkuuden heikkeneessä, ongelma on sukupolvi; Jos uskollisuus on korkea, mutta vastaus on väärä, ongelma on väärä pala (haku). Yhdessä nämä kaksi mittaria ovat kompassi, joka näyttää vian sijainnin.
Kultaisen kysymyssarjan perustaminen
Jokainen mittaus vaatii kultaisen sarjan/arviointiaineiston: realistiset kysymykset + odotetut oikeat vastaukset + oikeat lähdekappaleet. Aloittaminen 30-50 hyvin valitusta kysymyksestä on parempi kuin 500 satunnaista kysymystä. Sisällytä joukkoon seuraavat asiat: usein kysytyt oikeat kysymykset, tunnetut vaikeat kysymykset, ansakysymykset, joihin ei ole vastauksia (pitäisi sanoa "en tiedä"), kysymykset, joiden lähteet ovat ristiriitaisia.
# Kultainen klusteriesimerkki (käsitteellinen)[ {"question": "Kuinka monta päivää vuosilomaa?", "odotettu_vastaus": "14 päivää 1-5 vuoden työsuhteesta", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Missä on yrityksen toimisto?", ""s_expected office?" "NO_INFORMATION", # trap: En tiedä "correct_part_id": null, "category": "trap"}]
LLM-as-Judge: Automaattinen arviointi
Satojen vastausten pisteytäminen käsin on väsyttävää. LLM-as-judge -malli on, kun yksi malli pisteyttää ja perustelee toisen mallin vastauksen tiettyjen kriteerien perusteella. Hyvä tuomarikehottaa selkeästi kriteerit, antaa esimerkkejä ja pyytää perusteluja.
# LLM-as-judge kehote (käsitteellinen) Olet puolueeton arvioija. Arvioi alla oleva VASTAUS annetun KONTEKSTIN ja ODOTETUN VASTAUKSEN mukaan. Piste (1-5) ja perustele:- uskollisuus: onko vastauksen kutakin väitettä tuettu kontekstissa?- tarkkuus: vastaako vastaus odotettua vastausta?- täydellisyys: ovatko asiaankuuluvat tiedot täydellisiä? Erityisesti: jos vastaus sisältää tietoja, jotka eivät liity asiayhteyteen, anna uskollisuus1 ja ilmoita, mikä väite on keksitty.KONTEKSTI: {konteksti}ODOTETTU: {odotettu}VASTAUS: {answer}Tulos: {uskollisuus, tarkkuus, täydellisyys, perustelu}
Varoitus: LLM-tuomarina ei ole täydellinen; Heillä voi olla omia ennakkoluuloja (pitkä vastaus, mieluummin oma tyyli). Tarkista myös tuomari: anna sekä tuomarin että ihmisen pisteytyksen jotkin vastaukset ja mittaa heidän välinen yksimielisyys. Jos Judge on yhdenmukainen ihmisten pisteiden kanssa, voit luottaa häneen.
Heikko/vahva luokitus
Heikko ("se oli hyvä minulle"):
Esitin muutaman kysymyksen ja vastaukset vaikuttivat hyviltä. Minulla on se livenä.# Ongelma: ei mittauksia, regressio huomaamaton, parannus sokea.
Tehokas (kultaklusteri + erilliset mittarit + automaattinen arviointi + regressio):
40 kysymyksen kultainen ryhmä. Jokaisella muutoksella, reverse@5, uskollisuus ja tarkkuus mitataan automaattisesti. Jos tulos laskee, muutos peruutetaan. Tuotannossa käyttäjien palautetta kerätään ja lisätään sarjaan.
Seuranta ja regressio tuotannossa
Arviointia ei tehdä kerran ja se on valmis. Kolme jatkuvaa käytäntöä:
- Regressiotestaus: Suorita kultainen klusteri automaattisesti jokaisen kehotteen/haun/mallin muutoksen yhteydessä. Jos pisteitä pienennetään, muutos peruuntuu. Tämä estää "rikkomasta sitä yrittäessään parantaa sitä".
- Tuotannon seuranta: "En löytänyt tietoa" -prosentia tosikysymyksissä, keskimääräistä viivettä, kustannuksia, käyttäjäpalautetta (👍/👎) seurataan. "En tiedä" -arvon äkillinen lisääntyminen on usein ensimmäinen merkki indeksin tai noudon toimintahäiriöstä.
- Palautesilmukka: Käyttäjän esittämät todelliset kysymykset 👎 tarkistetaan ja lisätään kultaiseen pinoon; Siten sarja rikastuu ajan myötä ja järjestelmän kuolleet kulmat sulkeutuvat.
Kolme minikoteloa
Tapaus 1 – Hiljainen regressio. Ryhmä muokkasi kehotetta "parantaakseen" sitä; Yleinen tarkkuus parani, mutta uskollisuus laski 30 % ansakysymyksissä (malli alkoi sopia enemmän). Sitä ei olisi huomattu, ellei kultaisen klusterin ansakysymyksiä olisi ollut; Regressiotestaus kumosi muutoksen.
Tapaus 2 – Väärän jalan suoristaminen. Yhdellä avustajalla vastaukset olivat huonoja; Ryhmä työskenteli kehotteen mukaan viikkoja. Kun mittasimme hakumittareita, recell@5 oli vain 48 % – ongelma oli noutossa, ei luomisessa. Kun hybridi + uudelleensijoitus lisättiin, palautus nousi 89 prosenttiin ja tarkkuus parani myös.
Tapaus 3 – Tuotantohälytys. Eräänä päivänä tukiassistentin "en löytänyt tietoa" -prosentti hyppäsi 6 prosentista 34 prosenttiin. Ohjauslevy varoitti; Syynä oli se, että yöllä käynnissä oleva indeksointityö epäonnistui äänettömästi ja uusia artikkeleita ei ladattu. Ilman seurantaa virheelliset "en tiedä"-lauseet olisivat jatkuneet päiviä.
Yleisiä virheitä
- Tyytyväinen "se toimi minulle hyvin": Ilman mittausta regressio jää huomaamatta.
- Hakua ja luomista ei eroteta: Korjaat väärän jalan ja tuhlaat aikaa.
- Ei esitä ansakysymyksiä: taipumus keksiä asioita ei näy kultaisessa klusterissa.
- Ei vahvista tuomaria: Puolueellinen tuomaristo antaa väärää luottamusta.
- Ei valvo tuotantoa: Indeksihäiriö, kustannusräjähdys jatkuu hiljaa.
Yhteenvetona
- RAG:ssa haun ja sukupolven laatu mitataan erikseen; Ensin on määritettävä, mikä jalka on vaurioitunut.
- Recovery@k, precision@k, MRR hakua varten; Sukupolvessa käytetään uskollisuutta, soveltuvuutta, täydellisyyttä.
- Jokainen mittaus vaatii kultaklusterin; Laita siihen todellisia, vaikeita, ansoja ja ristiriitaisia kysymyksiä.
- LLM-as-tuomari suuret automaattiset pisteet; mutta tuomarin itsensä täytyy olla vanhurskas ihmistä vastaan.
- Regressiotestaus, tuotannon seuranta ja palautesilmukka ylläpitävät laatua ajan myötä.
Sovellustehtävä
(1) Luo vähintään 15 kysymyksen kultainen sarja omalle avustajallesi: sisällytä vähintään 3 ansoja (ei vastauksia), 3 vaikeaa, 2 ristiriitaista lähdekysymystä. Kirjoita jokaiseen kysymykseen odotettu vastaus ja oikea osa. (2) Vertaa kahta eri kehoteversiota manuaalisesti tähän sarjaan; Anna jokaiselle vastaukselle 1-5 pistettä uskollisuudesta ja tarkkuudesta. (3) Mukauta yllä oleva LLM-tuomarina -kehote omien kriteeriesi mukaan. (4) Tunnista kolme mittaria, joita seuraat tuotannossa, ja kysy jokaisen kohdalla "millä kynnysarvolla hälytän?" kirjoita arvo.
tarkistuslista
- [ ] Pystyn mittaamaan säilyttämistä ja sukupolven laatua erillisillä mittareilla.
- [ ] Tiedän mitä mittarit, kuten muistaminen@k, uskollisuus, tarkoittavat.
- [ ] Pystyn rakentamaan kultaisen klusterin, joka sisältää todellisia, vaikeita, ansoja ja ristiriitaisia kysymyksiä.
- [ ] Voin määrittää automaattisen arvioinnin ja tarkistaa tuomarin LLM-as-judge -sovelluksella.
- [ ] Osaan käyttää regressiotestausta, tuotannon seurantaa ja palautesilmukkaa.