లాభాలు:
- నిలుపుదల మరియు ఉత్పత్తి నాణ్యతను విడిగా కొలిచే కొలమానాలను నిర్వచించడం
- గోల్డ్ క్వశ్చన్ సెట్ను సెటప్ చేయండి మరియు LLM-గా-న్యాయమూర్తితో ఆటోమేటిక్ మూల్యాంకనాన్ని అమలు చేయండి
- ఉత్పత్తిలో అభిప్రాయం, పర్యవేక్షణ మరియు తిరోగమన పరీక్ష ద్వారా నాణ్యతను నిర్వహించడం
"నేను అసిస్టెంట్ని ఇన్స్టాల్ చేసాను, అది బాగా పని చేస్తున్నట్లు కనిపిస్తోంది" అనే వాక్యం ఇంజనీరింగ్ స్టేట్మెంట్ కాదు. RAG వ్యవస్థలు నిశ్శబ్దంగా విచ్ఛిన్నమవుతాయి: కొత్త డాక్యుమెంట్ రకం తిరిగి పొందడాన్ని మోసం చేస్తుంది, తక్షణ మార్పు ఖచ్చితత్వాన్ని తగ్గిస్తుంది, సూచిక పాతదిగా మారుతుంది. దీన్ని గుర్తించడానికి ఏకైక మార్గం కొలత. ఈ యూనిట్లో, మేము RAG నాణ్యతను (రిట్రీవల్ మరియు జనరేషన్ విడిగా), ఆటోమేటిక్ మూల్యాంకనం (LLM-గా న్యాయమూర్తి) మరియు ఉత్పత్తిలో నాణ్యతను ఎలా నిర్వహించాలో (పర్యవేక్షించడం, తిరోగమనం) ఎలా కొలవాలో కవర్ చేస్తాము. "మీరు కొలవని దానిని మీరు మెరుగుపరచలేరు" అనేది ఈ యూనిట్ యొక్క నినాదం.
రెండు వేర్వేరు విషయాలను కొలవండి
RAGకి రెండు కాళ్లు ఉన్నాయి మరియు సమస్య వాటిలో దేనిలోనైనా ఉండవచ్చు కాబట్టి విడిగా కొలవాలి:
- తిరిగి పొందే నాణ్యత: సరైన భాగం వచ్చిందా?
- జనరేషన్ నాణ్యత: ఇన్కమింగ్ ముక్క నుండి సరైన సమాధానం ఉత్పత్తి చేయబడిందా?
సమాధానం చెడ్డదైతే, ముందుగా ఏ కాలు చెడ్డదో తెలుసుకోవాలి. సరైన భాగం ఎప్పటికీ రాకపోతే, ఉత్తమమైన ప్రాంప్ట్ కూడా సేవ్ చేయదు (రిట్రీవల్ సమస్య). సరైన భాగం వచ్చినప్పటికీ, మోడల్ దానిని తప్పుగా చదివితే, తిరిగి పొందడాన్ని మెరుగుపరచడం వ్యర్థం (తరం సమస్య).
రిట్రీవల్ మెట్రిక్స్
తిరిగి పొందడం అనేది సార్టింగ్/యాక్సెస్ సమస్య; క్లాసికల్ ఇన్ఫర్మేషన్ రిట్రీవల్ మెట్రిక్స్ ద్వారా కొలుస్తారు. దీని కోసం మీరు తప్పనిసరిగా గోల్డెన్ క్లస్టర్ను కలిగి ఉండాలి: ప్రతి ప్రశ్నకు ఏ ముక్క "సరైనది" అనే జ్ఞానం.
మెట్రిక్
ఏమి చర్యలు
సాధారణ నిర్వచనం
రీకాల్@k
ఎగువ kలో సరైన భాగం ఉందా?
సరైన పార్ట్ క్యాప్చర్ రేట్
ఖచ్చితత్వం@k
ఎన్ని k ముక్కలు తిరిగి వచ్చాయి?
తెచ్చినదానిని శుభ్రపరచడం
MRR (సగటు పరస్పర ర్యాంక్)
సరైన ముక్క ఏ క్రమంలో ఉంది?
టాప్ ర్యాంక్లో ఉన్నందుకు రివార్డులు
హిట్ రేటు
కనీసం ఒక్క ముక్క అయినా వచ్చిందా?
విజయం యొక్క అత్యంత ప్రాథమిక కొలత
ప్రాక్టికల్ వ్యాఖ్య: Recall@k తక్కువగా ఉంటే, చంకింగ్ లేదా శోధన వ్యూహం (హైబ్రిడ్, k, రీ-ర్యాంకింగ్) మళ్లీ పని చేయాలి. ఖచ్చితత్వం తక్కువగా ఉన్నప్పటికీ రీకాల్ ఎక్కువగా ఉంటే, రీ-ర్యాంకింగ్ను జోడించడం మంచి చర్య.
జనరేషన్ మెట్రిక్స్
సరైన భాగం వచ్చినప్పుడు, మేము మోడల్ ఉత్పత్తి చేసిన ప్రతిస్పందన నాణ్యతను కొలుస్తాము. మూడు ప్రాథమిక కొలతలు:
- విశ్వసనీయత: సమాధానంలోని ప్రతి దావా సందర్భం ద్వారా మద్దతునిస్తుందా? ఏదైనా ఫిట్టింగ్ ఉందా? ఇది భ్రాంతి యొక్క ప్రత్యక్ష కొలత.
- జవాబు ఔచిత్యం: సమాధానం వాస్తవానికి ప్రశ్నకు సమాధానం ఇస్తుందా లేదా అది టాపిక్కు దూరంగా ఉందా?
- సంపూర్ణత: సందర్భానుసారంగా సంబంధిత సమాచారం అంతా ఉపయోగించబడిందా లేదా తప్పిపోయిందా?
ఇవి తరచుగా "నిజం/తప్పు" వంటి బైనరీ కాకుండా గ్రేడెడ్ ప్రాతిపదికన (ఉదా. 1-5) స్కోర్ చేయబడతాయి.
చిట్కా: విశ్వాసాన్ని ప్రత్యేక మెట్రిక్గా ట్రాక్ చేయండి. ఖచ్చితత్వం తగ్గినప్పుడు విశ్వాసం తగ్గితే, సమస్య తరం అవుతుంది; విశ్వాసం ఎక్కువగా ఉన్నప్పటికీ సమాధానం తప్పు అయితే, సమస్య తప్పు ముక్క (తిరిగి పొందడం). ఈ రెండు కొలమానాలు కలిపి, లోపం యొక్క స్థానాన్ని చూపే దిక్సూచి.
గోల్డెన్ క్వశ్చన్ సెట్ను ఏర్పాటు చేయడం
ప్రతి కొలతకు గోల్డెన్ సెట్ / మూల్యాంకన డేటాసెట్ అవసరం: వాస్తవిక ప్రశ్నలు + ఆశించిన సరైన సమాధానాలు + సరైన మూలం ముక్కలు. 500 యాదృచ్ఛిక ప్రశ్నల కంటే 30-50 బాగా ఎంచుకున్న ప్రశ్నలతో ప్రారంభించడం మంచిది. సెట్లో కింది వాటిని చేర్చండి: తరచుగా అడిగే నిజమైన ప్రశ్నలు, తెలిసిన కష్టమైన ప్రశ్నలు, సమాధానాలు లేని ట్రాప్ ప్రశ్నలు ("నాకు తెలియదు" అని చెప్పాలి), విరుద్ధమైన మూలాలతో ప్రశ్నలు.
# గోల్డెన్ క్లస్టర్ ఉదాహరణ (సంభావితం)[ {"ప్రశ్న": "ఎన్ని రోజులు వార్షిక సెలవులు?", "అంచనా_సమాధానం": "1-5 సంవత్సరాల సీనియారిటీకి 14 రోజులు", "సరైన_పార్ట్_ఐడి": "రెండు-భాగాలు-3", "కేటగిరీ": "వెళ్లిపోవు"}, {"సంస్థ: ఆఫీస్ను ఎక్కడిది?" "NO_INFORMATION", # ట్రాప్: నాకు "సరైన_భాగం_id" తెలియదు: శూన్యం, "వర్గం": "ట్రాప్"}]
న్యాయమూర్తిగా LLM: ఆటోమేటిక్ అసెస్మెంట్
చేతితో వందలాది సమాధానాలు స్కోర్ చేయడం అలసిపోతుంది. ఒక మోడల్ నిర్దిష్ట ప్రమాణాల ఆధారంగా మరొక మోడల్ సమాధానాన్ని స్కోర్ చేసి, సమర్థించడాన్ని LLM-యాజ్-జడ్జ్ మోడల్ అంటారు. మంచి న్యాయమూర్తి ప్రాంప్ట్ ప్రమాణాలను స్పష్టంగా నిర్వచిస్తుంది, ఉదాహరణలను ఇస్తుంది మరియు సమర్థన కోసం అడుగుతుంది.
# LLM-గా-న్యాయమూర్తి ప్రాంప్ట్ (సంభావితం)మీరు నిష్పాక్షిక మూల్యాంకనం చేసేవారు. అందించిన సందర్భం మరియు ఆశించిన సమాధానం ప్రకారం దిగువ సమాధానాన్ని మూల్యాంకనం చేయండి. స్కోర్ (1-5) మరియు సమర్థించండి:- విశ్వసనీయత: సమాధానంలోని ప్రతి దావా సందర్భానుసారంగా మద్దతు ఇస్తుందా?- ఖచ్చితత్వం: సమాధానం ఆశించిన సమాధానానికి సరిపోతుందా?- సంపూర్ణత: సంబంధిత సమాచారం పూర్తయిందా? ప్రత్యేకించి: సమాధానం సందర్భంలో లేని సమాచారాన్ని కలిగి ఉంటే, విశ్వసనీయత1 ఇవ్వండి మరియు ఏ దావా కల్పితమో సూచించండి. CONTEXT: {context}EXPECTED: {expected}సమాధానం: {answer}అవుట్పుట్: {విశ్వాసం, ఖచ్చితత్వం, సంపూర్ణత, సమర్థన}
హెచ్చరిక: LLM-గా-న్యాయమూర్తి పరిపూర్ణుడు కాదు; వారు వారి స్వంత పక్షపాతాలను కలిగి ఉండవచ్చు (దీర్ఘ సమాధానం, వారి స్వంత శైలిని ఇష్టపడతారు). న్యాయమూర్తిని కూడా ధృవీకరించండి: న్యాయమూర్తి మరియు మానవుడు ఇద్దరూ స్కోర్ చేసిన కొన్ని సమాధానాలను కలిగి ఉండండి మరియు వారి మధ్య ఒప్పందాన్ని కొలవండి. న్యాయమూర్తి మానవ స్కోర్లకు అనుగుణంగా ఉంటే, మీరు అతనిని విశ్వసించవచ్చు.
బలహీనమైన/బలమైన రేటింగ్
బలహీనమైన ("ఇది నాకు మంచిది"):
నేను కొన్ని ప్రశ్నలు అడిగాను మరియు సమాధానాలు బాగున్నాయనిపించింది. నేను దీన్ని ప్రత్యక్షంగా పొందాను.# సమస్య: కొలతలు లేవు, రిగ్రెషన్ కనిపించదు, మెరుగుదల బ్లైండ్.
శక్తివంతమైన (గోల్డ్ క్లస్టర్ + వివిక్త కొలమానాలు + ఆటోమేటిక్ జడ్జిమెంట్ + రిగ్రెషన్):
40 ప్రశ్నల గోల్డెన్ క్లస్టర్. ప్రతి మార్పుతో, రీకాల్@5, విశ్వసనీయత మరియు ఖచ్చితత్వం స్వయంచాలకంగా కొలవబడతాయి. స్కోర్ పడిపోతే, మార్పు వెనక్కి తీసుకోబడుతుంది. ఉత్పత్తిలో, వినియోగదారు అభిప్రాయం సేకరించబడుతుంది మరియు సెట్కు జోడించబడుతుంది.
ఉత్పత్తిలో పర్యవేక్షణ మరియు తిరోగమనం
మూల్యాంకనం ఒకసారి మరియు పూర్తి కాదు. మూడు స్థిరమైన అభ్యాసాలు:
- రిగ్రెషన్ టెస్టింగ్: ప్రతి ప్రాంప్ట్/రిట్రీవల్/మోడల్ మార్పుపై స్వయంచాలకంగా నడిచే గోల్డెన్ క్లస్టర్. స్కోర్ తగ్గితే, మార్పు రివర్స్ అవుతుంది. ఇది "మంచి చేయడానికి ప్రయత్నిస్తున్నప్పుడు దానిని విచ్ఛిన్నం చేయడాన్ని" నిరోధిస్తుంది.
- ఉత్పత్తి పర్యవేక్షణ: నిజమైన ప్రశ్నలలో "నేను సమాచారం కనుగొనలేకపోయాను" రేటు, సగటు ఆలస్యం, ధర, వినియోగదారు అభిప్రాయం (👍/👎) పర్యవేక్షించబడతాయి. "నాకు తెలియదు"లో ఆకస్మిక పెరుగుదల తరచుగా సూచిక లేదా పునరుద్ధరణ లోపం యొక్క మొదటి సంకేతం.
- ఫీడ్బ్యాక్ లూప్: వినియోగదారు అందించిన నిజమైన ప్రశ్నలు 👎 సమీక్షించబడతాయి మరియు గోల్డెన్ పైల్కు జోడించబడతాయి; అందువలన, సెట్ కాలక్రమేణా ధనిక అవుతుంది మరియు సిస్టమ్ యొక్క బ్లైండ్ స్పాట్లు మూసివేయబడతాయి.
మూడు మినీ కేసులు
కేస్ 1 - సైలెంట్ రిగ్రెషన్. ఒక బృందం దానిని "మెరుగుపరచడానికి" ప్రాంప్ట్ను సవరించింది; సాధారణ ఖచ్చితత్వం పెరిగింది, కానీ ట్రాప్ ప్రశ్నలలో విశ్వసనీయత 30% తగ్గింది (మోడల్ మరింత సరిపోవడం ప్రారంభించింది). గోల్డెన్ క్లస్టర్లో ట్రాప్ ప్రశ్నలు లేకుంటే ఇది గమనించబడదు; రిగ్రెషన్ పరీక్ష మార్పును తిరిగి మార్చింది.
కేసు 2 - తప్పు కాలు నిఠారుగా చేయడం. ఒక అసిస్టెంట్లో సమాధానాలు చెడ్డవి; టీమ్ వారాల పాటు ప్రాంప్ట్లో పని చేసింది. మేము తిరిగి పొందే కొలమానాలను కొలిచినప్పుడు, రీకాల్@5 కేవలం 48% మాత్రమే - సమస్య తిరిగి పొందడంలో ఉంది, ఉత్పత్తి కాదు. హైబ్రిడ్ + రీ-ర్యాంకింగ్ జోడించబడినప్పుడు, రీకాల్ 89%కి పెరిగింది మరియు ఖచ్చితత్వం కూడా పెరిగింది.
కేస్ 3 - ఉత్పత్తి హెచ్చరిక. ఒక రోజు, సపోర్ట్ అసిస్టెంట్ కోసం "నేను సమాచారం కనుగొనలేకపోయాను" రేటు 6% నుండి 34%కి పెరిగింది. ట్రాక్ప్యాడ్ హెచ్చరించింది; రాత్రిపూట జరిగే ఇండెక్సింగ్ జాబ్ సైలెంట్గా విఫలమై కొత్త కథనాలు అప్లోడ్ చేయకపోవడమే కారణం. పర్యవేక్షణ లేకుండా, తప్పు "నాకు తెలియదు" ప్రకటనలు రోజుల తరబడి కొనసాగుతాయి.
సాధారణ తప్పులు
- "ఇది నాకు బాగా పనిచేసింది"తో సంతృప్తి చెందడం: కొలత లేకుండా, తిరోగమనం గుర్తించబడదు.
- తిరిగి పొందడం మరియు తరాన్ని వేరు చేయడం లేదు: మీరు తప్పు కాలును సరిదిద్దుతారు మరియు సమయాన్ని వృథా చేస్తారు.
- ట్రాప్ ప్రశ్నలు అడగడం లేదు: స్వర్ణ సమూహాన్ని తయారు చేసే ధోరణి కనిపించదు.
- న్యాయమూర్తిని ధృవీకరించడం లేదు: పక్షపాత జ్యూరీ తప్పుడు విశ్వాసాన్ని ఇస్తుంది.
- ఉత్పత్తిని పర్యవేక్షించడం లేదు: ఇండెక్స్ వైఫల్యం, ధర పేలుడు నిశ్శబ్దంగా కొనసాగుతోంది.
సారాంశంలో
- RAGలో, తిరిగి పొందడం మరియు ఉత్పత్తి నాణ్యత విడిగా కొలుస్తారు; ఏ కాలు దెబ్బతిన్నదో ముందుగా గుర్తించాలి.
- recall@k, precision@k, రిట్రీవల్ కోసం MRR; విశ్వాసం, అనుకూలత, సంపూర్ణత తరానికి ఉపయోగపడతాయి.
- ప్రతి కొలతకు బంగారు క్లస్టర్ అవసరం; అందులో నిజమైన, కష్టమైన, ఉచ్చు మరియు పరస్పర విరుద్ధమైన ప్రశ్నలను ఉంచండి.
- LLM-నిర్ణేతగా పెద్ద సెట్లు ఆటో-స్కోర్లు; కానీ న్యాయాధిపతి స్వయంగా మనిషికి వ్యతిరేకంగా సమర్థించబడాలి.
- రిగ్రెషన్ టెస్టింగ్, ప్రొడక్షన్ మానిటరింగ్ మరియు ఫీడ్బ్యాక్ లూప్ కాలక్రమేణా నాణ్యతను నిర్వహిస్తాయి.
అప్లికేషన్ టాస్క్
(1) మీ స్వంత అసిస్టెంట్ కోసం కనీసం 15 ప్రశ్నల గోల్డెన్ సెట్ను సృష్టించండి: కనీసం 3 ట్రాప్లు (సమాధానాలు లేవు), 3 కష్టమైన, 2 విరుద్ధమైన మూల ప్రశ్నలను చేర్చండి. ప్రతి ప్రశ్నకు ఆశించిన సమాధానం మరియు సరైన భాగాన్ని వ్రాయండి. (2) ఈ సెట్తో రెండు వేర్వేరు ప్రాంప్ట్ వెర్షన్లను మాన్యువల్గా సరిపోల్చండి; విశ్వసనీయత మరియు ఖచ్చితత్వం కోసం ప్రతి సమాధానానికి 1-5 పాయింట్లు ఇవ్వండి. (3) పైన ఉన్న LLM-ని జడ్జి ప్రాంప్ట్ని మీ స్వంత ప్రమాణాలకు అనుగుణంగా మార్చుకోండి. (4) మీరు ఉత్పత్తిలో ట్రాక్ చేసే 3 కొలమానాలను గుర్తించండి మరియు ప్రతి దాని కోసం "నేను ఏ థ్రెషోల్డ్లో అలారం చేయాలి?" విలువ వ్రాయండి.
చెక్లిస్ట్
- [ ] నేను ప్రత్యేక కొలమానాలతో నిలుపుదల మరియు ఉత్పత్తి నాణ్యతను కొలవగలను.
- [ ] recall@k, విధేయత వంటి కొలమానాలు అంటే ఏమిటో నాకు తెలుసు.
- [ ] నేను నిజమైన, కష్టమైన, ట్రాప్ మరియు విరుద్ధమైన ప్రశ్నలను కలిగి ఉన్న గోల్డెన్ క్లస్టర్ని నిర్మించగలను.
- [ ] నేను ఆటోమేటిక్ మూల్యాంకనాన్ని సెటప్ చేయగలను మరియు న్యాయమూర్తిని LLM-గా-న్యాయమూర్తితో ధృవీకరించగలను.
- [ ] నేను రిగ్రెషన్ టెస్టింగ్, ప్రొడక్షన్ మానిటరింగ్ మరియు ఫీడ్బ్యాక్ లూప్ని ఆపరేట్ చేయగలను.