యూనిట్ 8 / 11

RAG మూల్యాంకనం మరియు పర్యవేక్షణ

లాభాలు:

  • నిలుపుదల మరియు ఉత్పత్తి నాణ్యతను విడిగా కొలిచే కొలమానాలను నిర్వచించడం
  • గోల్డ్ క్వశ్చన్ సెట్‌ను సెటప్ చేయండి మరియు LLM-గా-న్యాయమూర్తితో ఆటోమేటిక్ మూల్యాంకనాన్ని అమలు చేయండి
  • ఉత్పత్తిలో అభిప్రాయం, పర్యవేక్షణ మరియు తిరోగమన పరీక్ష ద్వారా నాణ్యతను నిర్వహించడం

"నేను అసిస్టెంట్‌ని ఇన్‌స్టాల్ చేసాను, అది బాగా పని చేస్తున్నట్లు కనిపిస్తోంది" అనే వాక్యం ఇంజనీరింగ్ స్టేట్‌మెంట్ కాదు. RAG వ్యవస్థలు నిశ్శబ్దంగా విచ్ఛిన్నమవుతాయి: కొత్త డాక్యుమెంట్ రకం తిరిగి పొందడాన్ని మోసం చేస్తుంది, తక్షణ మార్పు ఖచ్చితత్వాన్ని తగ్గిస్తుంది, సూచిక పాతదిగా మారుతుంది. దీన్ని గుర్తించడానికి ఏకైక మార్గం కొలత. ఈ యూనిట్‌లో, మేము RAG నాణ్యతను (రిట్రీవల్ మరియు జనరేషన్ విడిగా), ఆటోమేటిక్ మూల్యాంకనం (LLM-గా న్యాయమూర్తి) మరియు ఉత్పత్తిలో నాణ్యతను ఎలా నిర్వహించాలో (పర్యవేక్షించడం, తిరోగమనం) ఎలా కొలవాలో కవర్ చేస్తాము. "మీరు కొలవని దానిని మీరు మెరుగుపరచలేరు" అనేది ఈ యూనిట్ యొక్క నినాదం.

రెండు వేర్వేరు విషయాలను కొలవండి

RAGకి రెండు కాళ్లు ఉన్నాయి మరియు సమస్య వాటిలో దేనిలోనైనా ఉండవచ్చు కాబట్టి విడిగా కొలవాలి:

  1. తిరిగి పొందే నాణ్యత: సరైన భాగం వచ్చిందా?
  2. జనరేషన్ నాణ్యత: ఇన్‌కమింగ్ ముక్క నుండి సరైన సమాధానం ఉత్పత్తి చేయబడిందా?

సమాధానం చెడ్డదైతే, ముందుగా ఏ కాలు చెడ్డదో తెలుసుకోవాలి. సరైన భాగం ఎప్పటికీ రాకపోతే, ఉత్తమమైన ప్రాంప్ట్ కూడా సేవ్ చేయదు (రిట్రీవల్ సమస్య). సరైన భాగం వచ్చినప్పటికీ, మోడల్ దానిని తప్పుగా చదివితే, తిరిగి పొందడాన్ని మెరుగుపరచడం వ్యర్థం (తరం సమస్య).

రిట్రీవల్ మెట్రిక్స్

తిరిగి పొందడం అనేది సార్టింగ్/యాక్సెస్ సమస్య; క్లాసికల్ ఇన్ఫర్మేషన్ రిట్రీవల్ మెట్రిక్స్ ద్వారా కొలుస్తారు. దీని కోసం మీరు తప్పనిసరిగా గోల్డెన్ క్లస్టర్‌ను కలిగి ఉండాలి: ప్రతి ప్రశ్నకు ఏ ముక్క "సరైనది" అనే జ్ఞానం.

మెట్రిక్

ఏమి చర్యలు

సాధారణ నిర్వచనం

రీకాల్@k

ఎగువ kలో సరైన భాగం ఉందా?

సరైన పార్ట్ క్యాప్చర్ రేట్

ఖచ్చితత్వం@k

ఎన్ని k ముక్కలు తిరిగి వచ్చాయి?

తెచ్చినదానిని శుభ్రపరచడం

MRR (సగటు పరస్పర ర్యాంక్)

సరైన ముక్క ఏ క్రమంలో ఉంది?

టాప్ ర్యాంక్‌లో ఉన్నందుకు రివార్డులు

హిట్ రేటు

కనీసం ఒక్క ముక్క అయినా వచ్చిందా?

విజయం యొక్క అత్యంత ప్రాథమిక కొలత

ప్రాక్టికల్ వ్యాఖ్య: Recall@k తక్కువగా ఉంటే, చంకింగ్ లేదా శోధన వ్యూహం (హైబ్రిడ్, k, రీ-ర్యాంకింగ్) మళ్లీ పని చేయాలి. ఖచ్చితత్వం తక్కువగా ఉన్నప్పటికీ రీకాల్ ఎక్కువగా ఉంటే, రీ-ర్యాంకింగ్‌ను జోడించడం మంచి చర్య.

జనరేషన్ మెట్రిక్స్

సరైన భాగం వచ్చినప్పుడు, మేము మోడల్ ఉత్పత్తి చేసిన ప్రతిస్పందన నాణ్యతను కొలుస్తాము. మూడు ప్రాథమిక కొలతలు:

  • విశ్వసనీయత: సమాధానంలోని ప్రతి దావా సందర్భం ద్వారా మద్దతునిస్తుందా? ఏదైనా ఫిట్టింగ్ ఉందా? ఇది భ్రాంతి యొక్క ప్రత్యక్ష కొలత.
  • జవాబు ఔచిత్యం: సమాధానం వాస్తవానికి ప్రశ్నకు సమాధానం ఇస్తుందా లేదా అది టాపిక్‌కు దూరంగా ఉందా?
  • సంపూర్ణత: సందర్భానుసారంగా సంబంధిత సమాచారం అంతా ఉపయోగించబడిందా లేదా తప్పిపోయిందా?

ఇవి తరచుగా "నిజం/తప్పు" వంటి బైనరీ కాకుండా గ్రేడెడ్ ప్రాతిపదికన (ఉదా. 1-5) స్కోర్ చేయబడతాయి.

చిట్కా: విశ్వాసాన్ని ప్రత్యేక మెట్రిక్‌గా ట్రాక్ చేయండి. ఖచ్చితత్వం తగ్గినప్పుడు విశ్వాసం తగ్గితే, సమస్య తరం అవుతుంది; విశ్వాసం ఎక్కువగా ఉన్నప్పటికీ సమాధానం తప్పు అయితే, సమస్య తప్పు ముక్క (తిరిగి పొందడం). ఈ రెండు కొలమానాలు కలిపి, లోపం యొక్క స్థానాన్ని చూపే దిక్సూచి.

గోల్డెన్ క్వశ్చన్ సెట్‌ను ఏర్పాటు చేయడం

ప్రతి కొలతకు గోల్డెన్ సెట్ / మూల్యాంకన డేటాసెట్ అవసరం: వాస్తవిక ప్రశ్నలు + ఆశించిన సరైన సమాధానాలు + సరైన మూలం ముక్కలు. 500 యాదృచ్ఛిక ప్రశ్నల కంటే 30-50 బాగా ఎంచుకున్న ప్రశ్నలతో ప్రారంభించడం మంచిది. సెట్‌లో కింది వాటిని చేర్చండి: తరచుగా అడిగే నిజమైన ప్రశ్నలు, తెలిసిన కష్టమైన ప్రశ్నలు, సమాధానాలు లేని ట్రాప్ ప్రశ్నలు ("నాకు తెలియదు" అని చెప్పాలి), విరుద్ధమైన మూలాలతో ప్రశ్నలు.

# గోల్డెన్ క్లస్టర్ ఉదాహరణ (సంభావితం)[ {"ప్రశ్న": "ఎన్ని రోజులు వార్షిక సెలవులు?", "అంచనా_సమాధానం": "1-5 సంవత్సరాల సీనియారిటీకి 14 రోజులు", "సరైన_పార్ట్_ఐడి": "రెండు-భాగాలు-3", "కేటగిరీ": "వెళ్లిపోవు"}, {"సంస్థ: ఆఫీస్‌ను ఎక్కడిది?" "NO_INFORMATION", # ట్రాప్: నాకు "సరైన_భాగం_id" తెలియదు: శూన్యం, "వర్గం": "ట్రాప్"}]

న్యాయమూర్తిగా LLM: ఆటోమేటిక్ అసెస్‌మెంట్

చేతితో వందలాది సమాధానాలు స్కోర్ చేయడం అలసిపోతుంది. ఒక మోడల్ నిర్దిష్ట ప్రమాణాల ఆధారంగా మరొక మోడల్ సమాధానాన్ని స్కోర్ చేసి, సమర్థించడాన్ని LLM-యాజ్-జడ్జ్ మోడల్ అంటారు. మంచి న్యాయమూర్తి ప్రాంప్ట్ ప్రమాణాలను స్పష్టంగా నిర్వచిస్తుంది, ఉదాహరణలను ఇస్తుంది మరియు సమర్థన కోసం అడుగుతుంది.

# LLM-గా-న్యాయమూర్తి ప్రాంప్ట్ (సంభావితం)మీరు నిష్పాక్షిక మూల్యాంకనం చేసేవారు. అందించిన సందర్భం మరియు ఆశించిన సమాధానం ప్రకారం దిగువ సమాధానాన్ని మూల్యాంకనం చేయండి. స్కోర్ (1-5) మరియు సమర్థించండి:- విశ్వసనీయత: సమాధానంలోని ప్రతి దావా సందర్భానుసారంగా మద్దతు ఇస్తుందా?- ఖచ్చితత్వం: సమాధానం ఆశించిన సమాధానానికి సరిపోతుందా?- సంపూర్ణత: సంబంధిత సమాచారం పూర్తయిందా? ప్రత్యేకించి: సమాధానం సందర్భంలో లేని సమాచారాన్ని కలిగి ఉంటే, విశ్వసనీయత1 ఇవ్వండి మరియు ఏ దావా కల్పితమో సూచించండి. CONTEXT: {context}EXPECTED: {expected}సమాధానం: {answer}అవుట్‌పుట్: {విశ్వాసం, ఖచ్చితత్వం, సంపూర్ణత, సమర్థన}

హెచ్చరిక: LLM-గా-న్యాయమూర్తి పరిపూర్ణుడు కాదు; వారు వారి స్వంత పక్షపాతాలను కలిగి ఉండవచ్చు (దీర్ఘ సమాధానం, వారి స్వంత శైలిని ఇష్టపడతారు). న్యాయమూర్తిని కూడా ధృవీకరించండి: న్యాయమూర్తి మరియు మానవుడు ఇద్దరూ స్కోర్ చేసిన కొన్ని సమాధానాలను కలిగి ఉండండి మరియు వారి మధ్య ఒప్పందాన్ని కొలవండి. న్యాయమూర్తి మానవ స్కోర్‌లకు అనుగుణంగా ఉంటే, మీరు అతనిని విశ్వసించవచ్చు.

బలహీనమైన/బలమైన రేటింగ్

బలహీనమైన ("ఇది నాకు మంచిది"):

నేను కొన్ని ప్రశ్నలు అడిగాను మరియు సమాధానాలు బాగున్నాయనిపించింది. నేను దీన్ని ప్రత్యక్షంగా పొందాను.# సమస్య: కొలతలు లేవు, రిగ్రెషన్ కనిపించదు, మెరుగుదల బ్లైండ్.

శక్తివంతమైన (గోల్డ్ క్లస్టర్ + వివిక్త కొలమానాలు + ఆటోమేటిక్ జడ్జిమెంట్ + రిగ్రెషన్):

40 ప్రశ్నల గోల్డెన్ క్లస్టర్. ప్రతి మార్పుతో, రీకాల్@5, విశ్వసనీయత మరియు ఖచ్చితత్వం స్వయంచాలకంగా కొలవబడతాయి. స్కోర్ పడిపోతే, మార్పు వెనక్కి తీసుకోబడుతుంది. ఉత్పత్తిలో, వినియోగదారు అభిప్రాయం సేకరించబడుతుంది మరియు సెట్‌కు జోడించబడుతుంది.

ఉత్పత్తిలో పర్యవేక్షణ మరియు తిరోగమనం

మూల్యాంకనం ఒకసారి మరియు పూర్తి కాదు. మూడు స్థిరమైన అభ్యాసాలు:

  • రిగ్రెషన్ టెస్టింగ్: ప్రతి ప్రాంప్ట్/రిట్రీవల్/మోడల్ మార్పుపై స్వయంచాలకంగా నడిచే గోల్డెన్ క్లస్టర్. స్కోర్ తగ్గితే, మార్పు రివర్స్ అవుతుంది. ఇది "మంచి చేయడానికి ప్రయత్నిస్తున్నప్పుడు దానిని విచ్ఛిన్నం చేయడాన్ని" నిరోధిస్తుంది.
  • ఉత్పత్తి పర్యవేక్షణ: నిజమైన ప్రశ్నలలో "నేను సమాచారం కనుగొనలేకపోయాను" రేటు, సగటు ఆలస్యం, ధర, వినియోగదారు అభిప్రాయం (👍/👎) పర్యవేక్షించబడతాయి. "నాకు తెలియదు"లో ఆకస్మిక పెరుగుదల తరచుగా సూచిక లేదా పునరుద్ధరణ లోపం యొక్క మొదటి సంకేతం.
  • ఫీడ్‌బ్యాక్ లూప్: వినియోగదారు అందించిన నిజమైన ప్రశ్నలు 👎 సమీక్షించబడతాయి మరియు గోల్డెన్ పైల్‌కు జోడించబడతాయి; అందువలన, సెట్ కాలక్రమేణా ధనిక అవుతుంది మరియు సిస్టమ్ యొక్క బ్లైండ్ స్పాట్‌లు మూసివేయబడతాయి.

మూడు మినీ కేసులు

కేస్ 1 - సైలెంట్ రిగ్రెషన్. ఒక బృందం దానిని "మెరుగుపరచడానికి" ప్రాంప్ట్‌ను సవరించింది; సాధారణ ఖచ్చితత్వం పెరిగింది, కానీ ట్రాప్ ప్రశ్నలలో విశ్వసనీయత 30% తగ్గింది (మోడల్ మరింత సరిపోవడం ప్రారంభించింది). గోల్డెన్ క్లస్టర్‌లో ట్రాప్ ప్రశ్నలు లేకుంటే ఇది గమనించబడదు; రిగ్రెషన్ పరీక్ష మార్పును తిరిగి మార్చింది.

కేసు 2 - తప్పు కాలు నిఠారుగా చేయడం. ఒక అసిస్టెంట్‌లో సమాధానాలు చెడ్డవి; టీమ్ వారాల పాటు ప్రాంప్ట్‌లో పని చేసింది. మేము తిరిగి పొందే కొలమానాలను కొలిచినప్పుడు, రీకాల్@5 కేవలం 48% మాత్రమే - సమస్య తిరిగి పొందడంలో ఉంది, ఉత్పత్తి కాదు. హైబ్రిడ్ + రీ-ర్యాంకింగ్ జోడించబడినప్పుడు, రీకాల్ 89%కి పెరిగింది మరియు ఖచ్చితత్వం కూడా పెరిగింది.

కేస్ 3 - ఉత్పత్తి హెచ్చరిక. ఒక రోజు, సపోర్ట్ అసిస్టెంట్ కోసం "నేను సమాచారం కనుగొనలేకపోయాను" రేటు 6% నుండి 34%కి పెరిగింది. ట్రాక్‌ప్యాడ్ హెచ్చరించింది; రాత్రిపూట జరిగే ఇండెక్సింగ్ జాబ్ సైలెంట్‌గా విఫలమై కొత్త కథనాలు అప్‌లోడ్ చేయకపోవడమే కారణం. పర్యవేక్షణ లేకుండా, తప్పు "నాకు తెలియదు" ప్రకటనలు రోజుల తరబడి కొనసాగుతాయి.

సాధారణ తప్పులు

  • "ఇది నాకు బాగా పనిచేసింది"తో సంతృప్తి చెందడం: కొలత లేకుండా, తిరోగమనం గుర్తించబడదు.
  • తిరిగి పొందడం మరియు తరాన్ని వేరు చేయడం లేదు: మీరు తప్పు కాలును సరిదిద్దుతారు మరియు సమయాన్ని వృథా చేస్తారు.
  • ట్రాప్ ప్రశ్నలు అడగడం లేదు: స్వర్ణ సమూహాన్ని తయారు చేసే ధోరణి కనిపించదు.
  • న్యాయమూర్తిని ధృవీకరించడం లేదు: పక్షపాత జ్యూరీ తప్పుడు విశ్వాసాన్ని ఇస్తుంది.
  • ఉత్పత్తిని పర్యవేక్షించడం లేదు: ఇండెక్స్ వైఫల్యం, ధర పేలుడు నిశ్శబ్దంగా కొనసాగుతోంది.

సారాంశంలో

  • RAGలో, తిరిగి పొందడం మరియు ఉత్పత్తి నాణ్యత విడిగా కొలుస్తారు; ఏ కాలు దెబ్బతిన్నదో ముందుగా గుర్తించాలి.
  • recall@k, precision@k, రిట్రీవల్ కోసం MRR; విశ్వాసం, అనుకూలత, సంపూర్ణత తరానికి ఉపయోగపడతాయి.
  • ప్రతి కొలతకు బంగారు క్లస్టర్ అవసరం; అందులో నిజమైన, కష్టమైన, ఉచ్చు మరియు పరస్పర విరుద్ధమైన ప్రశ్నలను ఉంచండి.
  • LLM-నిర్ణేతగా పెద్ద సెట్‌లు ఆటో-స్కోర్‌లు; కానీ న్యాయాధిపతి స్వయంగా మనిషికి వ్యతిరేకంగా సమర్థించబడాలి.
  • రిగ్రెషన్ టెస్టింగ్, ప్రొడక్షన్ మానిటరింగ్ మరియు ఫీడ్‌బ్యాక్ లూప్ కాలక్రమేణా నాణ్యతను నిర్వహిస్తాయి.

అప్లికేషన్ టాస్క్

(1) మీ స్వంత అసిస్టెంట్ కోసం కనీసం 15 ప్రశ్నల గోల్డెన్ సెట్‌ను సృష్టించండి: కనీసం 3 ట్రాప్‌లు (సమాధానాలు లేవు), 3 కష్టమైన, 2 విరుద్ధమైన మూల ప్రశ్నలను చేర్చండి. ప్రతి ప్రశ్నకు ఆశించిన సమాధానం మరియు సరైన భాగాన్ని వ్రాయండి. (2) ఈ సెట్‌తో రెండు వేర్వేరు ప్రాంప్ట్ వెర్షన్‌లను మాన్యువల్‌గా సరిపోల్చండి; విశ్వసనీయత మరియు ఖచ్చితత్వం కోసం ప్రతి సమాధానానికి 1-5 పాయింట్లు ఇవ్వండి. (3) పైన ఉన్న LLM-ని జడ్జి ప్రాంప్ట్‌ని మీ స్వంత ప్రమాణాలకు అనుగుణంగా మార్చుకోండి. (4) మీరు ఉత్పత్తిలో ట్రాక్ చేసే 3 కొలమానాలను గుర్తించండి మరియు ప్రతి దాని కోసం "నేను ఏ థ్రెషోల్డ్‌లో అలారం చేయాలి?" విలువ వ్రాయండి.

చెక్లిస్ట్

  • [ ] నేను ప్రత్యేక కొలమానాలతో నిలుపుదల మరియు ఉత్పత్తి నాణ్యతను కొలవగలను.
  • [ ] recall@k, విధేయత వంటి కొలమానాలు అంటే ఏమిటో నాకు తెలుసు.
  • [ ] నేను నిజమైన, కష్టమైన, ట్రాప్ మరియు విరుద్ధమైన ప్రశ్నలను కలిగి ఉన్న గోల్డెన్ క్లస్టర్‌ని నిర్మించగలను.
  • [ ] నేను ఆటోమేటిక్ మూల్యాంకనాన్ని సెటప్ చేయగలను మరియు న్యాయమూర్తిని LLM-గా-న్యాయమూర్తితో ధృవీకరించగలను.
  • [ ] నేను రిగ్రెషన్ టెస్టింగ్, ప్రొడక్షన్ మానిటరింగ్ మరియు ఫీడ్‌బ్యాక్ లూప్‌ని ఆపరేట్ చేయగలను.