Yunit 8 / 11

Pagsusuri at Pagsubaybay ng RAG

Mga nadagdag:

  • Pagtukoy sa mga sukatan na sumusukat sa pagpapanatili at kalidad ng henerasyon nang hiwalay
  • Mag-set up ng gintong set ng tanong at magpatakbo ng awtomatikong pagsusuri sa LLM-bilang-hukom
  • Pagpapanatili ng kalidad sa pamamagitan ng feedback, monitoring at regression testing sa produksyon

Ang pangungusap na "Nag-install ako ng assistant, mukhang gumagana nang maayos" ay hindi isang engineering statement. Tahimik na nasira ang mga sistema ng RAG: niloloko ng bagong uri ng dokumento ang pagkuha, binabawasan ng mabilisang pagbabago ang katumpakan, nagiging lipas ang index. Ang tanging paraan upang mapagtanto ito ay ang pagsukat. Sa yunit na ito, sinasaklaw namin kung paano sukatin ang kalidad ng RAG (pagbawi at pagbuo nang hiwalay), awtomatikong pagsusuri (LLM-bilang-hukom) at pagpapanatili ng kalidad sa produksyon (pagsubaybay, regression). "Hindi mo mapapabuti ang hindi mo nasusukat" ang motto ng unit na ito.

Sukatin ang Dalawang Magkahiwalay na Bagay

Ang RAG ay may dalawang paa at dapat sukatin nang hiwalay dahil ang problema ay maaaring nasa alinman sa mga ito:

  1. Kalidad ng pagkuha: Dumating ba ang tamang bahagi?
  2. Kalidad ng henerasyon: Ang tamang sagot ba ay ginawa mula sa papasok na piraso?

Kung ang sagot ay masama, kailangan mong malaman kung aling binti ang masama. Kung ang tamang bahagi ay hindi kailanman dumating, kahit na ang pinakamahusay na prompt ay hindi makakapag-save (problema sa pagkuha). Kung dumating ang tamang bahagi ngunit mali ang nabasa ng modelo, ang pagpapabuti ng pagkuha ay walang saysay (problema sa henerasyon).

Mga Sukatan sa Pagbawi

Ang pagkuha ay isang problema sa pag-uuri/pag-access; sinusukat ng mga klasikal na sukatan sa pagkuha ng impormasyon. Para dito kailangan mong magkaroon ng golden cluster: ang kaalaman kung aling piraso ang "tama" para sa bawat tanong.

panukat

Anong mga sukat

Simpleng kahulugan

Recall@k

Ang tamang piraso ba ay nasa itaas k?

Tamang rate ng pagkuha ng bahagi

katumpakan@k

Ilan sa mga k piraso na ibinalik ang may kaugnayan?

Paglilinis ng dinadala

MRR (Mean Reciprocal Rank)

Sa anong pagkakasunud-sunod ang tamang piraso?

Ang mga gantimpala ay nasa nangungunang mga ranggo

Rate ng hit

May dumating ba kahit isang tamang piraso?

Ang pinakapangunahing sukatan ng tagumpay

Praktikal na komento: Kung mababa ang Recall@k, ang chunking o diskarte sa paghahanap (hybrid, k, re-ranking) ay dapat na muling gawin. Kung mababa ang katumpakan ngunit mataas ang recall, ang pagdaragdag ng muling pagraranggo ay isang magandang hakbang.

Mga Sukatan ng Pagbuo

Kapag dumating ang tamang bahagi, sinusukat namin ang kalidad ng tugon na ginawa ng modelo. Tatlong pangunahing sukat:

  • Katapatan: Ang bawat pahayag ba sa sagot ay sinusuportahan ng konteksto? Mayroon bang angkop? Ito ay isang direktang sukatan ng hallucination.
  • Kaugnayan ng sagot: Sinasagot ba ng sagot ang tanong o wala ito sa paksa?
  • Pagkakumpleto: Nagamit na ba ang lahat ng nauugnay na impormasyon sa konteksto o nawawala ba ito?

Ang mga ito ay madalas na namarkahan sa isang graded na batayan (hal. 1-5), sa halip na binary tulad ng "true/false."

Tip: Subaybayan ang Katapatan bilang isang hiwalay na sukatan. Kung bumababa ang katapatan habang bumababa ang katumpakan, ang problema ay henerasyon; Kung mataas ang katapatan ngunit mali ang sagot, ang problema ay ang maling piraso (retrieval). Magkasama, ang dalawang sukatan na ito ay isang compass na nagpapakita ng lokasyon ng fault.

Pagtatatag ng Golden Question Set

Ang bawat pagsukat ay nangangailangan ng golden set / evaluation dataset: makatotohanang mga tanong + inaasahang tamang sagot + tamang source na piraso. Ang simula sa 30-50 na napiling mabuti na mga tanong ay mas mahusay kaysa sa 500 na random na mga tanong. Isama ang mga sumusunod sa set: madalas itanong ang mga totoong tanong, alam na mahihirap na tanong, bitag na mga tanong na walang sagot (dapat sabihin ng isa na "Hindi ko alam"), mga tanong na may magkasalungat na mapagkukunan.

# Halimbawa ng golden cluster (conceptual)[ {"question": "Ilang araw ng annual leave?", "expected_answer": "14 days for 1-5 years of seniority", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Where is the company's #expected_NOFORM", "expected_answer?" hindi alam ang "correct_part_id": null, "category": "trap"}]

LLM-bilang-Hukom: Awtomatikong Pagsusuri

Nakakapagod ang pag-iskor ng daan-daang sagot gamit ang kamay. Ang LLM-as-judge model ay kapag ang isang modelo ay nag-iskor at nagbibigay-katwiran sa sagot ng isa pang modelo batay sa ilang pamantayan. Malinaw na tinutukoy ng isang mabuting prompt ng hukom ang pamantayan, nagbibigay ng mga halimbawa at humihingi ng katwiran.

# LLM-as-judge prompt (conceptual)Ikaw ay isang walang kinikilingan na evaluator. Suriin ang SAGOT sa ibaba ayon sa ibinigay na KONTEKSTO at INAASAHANG SAGOT. Puntos (1-5) at bigyang-katwiran:- katapatan: sinusuportahan ba ang bawat pahayag sa sagot sa konteksto?- katumpakan: tumutugma ba ang sagot sa inaasahang sagot?- pagkakumpleto: kumpleto ba ang nauugnay na impormasyon? Lalo na: kung ang sagot ay naglalaman ng impormasyon na wala sa konteksto, magbigay ng katapatan1 at isaad kung aling claim ang gawa-gawa. KONTEKSTO: {context}INAASAHAN: {inaasahang}SAGOT: {answer}Output: {faithfulness, accuracy, completeness, justification}

Babala: Ang LLM-bilang-hukom ay hindi perpekto; Maaaring mayroon silang sariling mga bias (mahabang sagot, mas pinipili ang kanilang sariling istilo). I-verify din ang Judge: magkaroon ng ilang mga sagot na nai-score ng hukom at ng tao at sukatin ang kasunduan sa pagitan nila. Kung ang Judge ay pare-pareho sa mga marka ng tao, maaari kang magtiwala sa kanya.

Mahina/Malakas na Rating

Mahina ("ito ay mabuti para sa akin"):

Nagtanong ako ng ilang tanong at mukhang maganda ang mga sagot. Nakuha ko ito nang live.# Problema: walang mga sukat, hindi mahahalata ang pagbabalik, bulag sa pagpapabuti.

Napakahusay (gold cluster + discrete metrics + awtomatikong paghatol + regression):

Golden cluster ng 40 katanungan. Sa bawat pagbabago, recall@5, ang katapatan at katumpakan ay awtomatikong nasusukat. Kung bumaba ang marka, ibabalik ang pagbabago. Sa produksyon, ang feedback ng user ay kinokolekta at idinaragdag sa set.

Pagsubaybay at Pagbabalik sa Produksyon

Ang pagsusuri ay hindi ginagawa nang isang beses at natapos. Tatlong palagiang kasanayan:

  • Pagsusuri ng regression: Auto-run golden cluster sa bawat prompt/pagbawi/pagbabago ng modelo. Kung ang marka ay nabawasan, ang pagbabago ay mababaligtad. Pinipigilan nito ang "pagsira nito habang sinusubukang pagandahin ito".
  • Pagsubaybay sa produksyon: "Hindi ako makahanap ng impormasyon" na rate sa mga totoong tanong, ang average na pagkaantala, gastos, feedback ng user (👍/👎) ay sinusubaybayan. Ang biglaang pagtaas sa "Hindi ko alam" ay kadalasang unang senyales ng index o retrieval malfunction.
  • Feedback loop: Ang mga totoong tanong na ibinigay ng user 👎 ay sinusuri at idinaragdag sa golden pile; Kaya, ang set ay nagiging mas mayaman sa paglipas ng panahon at ang mga blind spot ng system ay sarado.

Tatlong Mini Case

Kaso 1 — Tahimik na pagbabalik. Binago ng isang koponan ang prompt upang "pahusayin" ito; Ang pangkalahatang katumpakan ay tumaas, ngunit ang katapatan ay bumaba ng 30% sa mga tanong sa bitag (ang modelo ay nagsimulang magkasya nang higit pa). Hindi ito mapapansin kung hindi dahil sa mga tanong sa bitag sa golden cluster; Ibinalik sa pagsubok ng regression ang pagbabago.

Kaso 2 — Pagtuwid sa maling binti. Sa isang katulong ang mga sagot ay masama; Ang koponan ay nagtrabaho sa prompt para sa mga linggo. Noong sinukat namin ang retrieval metrics, ang recall@5 ay 48% lang — ang problema ay sa retrieval, hindi generation. Nang idinagdag ang hybrid + re-ranking, tumaas ang recall sa 89% at tumaas din ang katumpakan.

Kaso 3 — Alerto sa produksyon. Isang araw, ang rate na "Hindi ako makahanap ng impormasyon" para sa isang support assistant ay tumaas mula 6% hanggang 34%. Nagbabala ang trackpad; Ang dahilan ay ang trabaho sa pag-index, na tumatakbo sa gabi, ay tahimik na nabigo at ang mga bagong artikulo ay hindi na-upload. Kung walang pagsubaybay, ang mga maling pahayag na "Hindi ko alam" ay magpapatuloy nang ilang araw.

Mga karaniwang pagkakamali

  • Ang pagiging nasiyahan sa "nagtrabaho ito nang maayos para sa akin": Kung walang pagsukat, hindi napapansin ang pagbabalik.
  • Hindi pinaghihiwalay ang retrieval at generation: Itatama mo ang maling paa at mag-aaksaya ng oras.
  • Hindi nagtatanong ng mga tanong sa bitag: Ang tendensyang gumawa ng mga bagay ay hindi lilitaw sa golden cluster.
  • Hindi nagpapatunay sa Hukom: Ang isang may kinikilingan na hurado ay nagbibigay ng maling kumpiyansa.
  • Hindi sinusubaybayan ang produksyon: Ang pagkabigo ng index, ang pagsabog ng gastos ay nagpapatuloy nang tahimik.

Sa buod

  • Sa RAG, hiwalay na sinusukat ang retrieval at generation quality; Dapat matukoy muna kung aling binti ang nasira.
  • recall@k, precision@k, MRR para sa Pagbawi; Ang katapatan, kaangkupan, pagkakumpleto ay ginagamit para sa henerasyon.
  • Ang bawat pagsukat ay nangangailangan ng isang kumpol ng ginto; Maglagay ng totoo, mahirap, bitag at magkasalungat na mga tanong dito.
  • LLM-as-judge malalaking set ng auto-scores; ngunit ang hukom mismo ay dapat na maging makatarungan laban sa tao.
  • Ang pagsubok ng regression, pagsubaybay sa produksyon, at isang feedback loop ay nagpapanatili ng kalidad sa paglipas ng panahon.

Gawain ng aplikasyon

(1) Gumawa ng ginintuang hanay ng hindi bababa sa 15 tanong para sa sarili mong katulong: isama ang hindi bababa sa 3 traps (walang sagot), 3 mahirap, 2 magkasalungat na tanong sa pinagmulan. Isulat ang inaasahang sagot at ang tamang bahagi para sa bawat tanong. (2) Manu-manong ihambing ang dalawang magkaibang prompt na bersyon sa set na ito; Bigyan ng 1-5 puntos ang bawat sagot para sa katapatan at katumpakan. (3) Iangkop ang prompt ng LLM-bilang-hukom sa itaas sa sarili mong pamantayan. (4) Tukuyin ang 3 sukatan na iyong susubaybayan sa produksyon at para sa bawat tanong na "sa anong threshold ako mag-aalarma?" isulat ang halaga.

checklist

  • [ ] Masusukat ko ang kalidad ng pagpapanatili at henerasyon gamit ang magkahiwalay na sukatan.
  • [ ] Alam ko kung ano ang ibig sabihin ng mga sukatan tulad ng recall@k, katapatan.
  • [ ] Maaari akong bumuo ng isang gintong kumpol na may kasamang totoo, mahirap, bitag at magkasalungat na mga tanong.
  • [ ] Maaari akong mag-set up ng awtomatikong pagsusuri at i-verify ang hukom sa LLM-bilang-hukom.
  • [ ] Maaari akong magpatakbo ng pagsubok ng regression, pagsubaybay sa produksyon at feedback loop.