एकाइ 8 / 11

RAG मूल्याङ्कन र अनुगमन

लाभ:

  • परिधारण र उत्पादन गुणस्तर अलग मापन गर्ने मेट्रिक्स परिभाषित
  • सुन प्रश्न सेट अप गर्नुहोस् र LLM-जज-जजको साथ स्वचालित मूल्याङ्कन चलाउनुहोस्
  • उत्पादनमा प्रतिक्रिया, अनुगमन र प्रतिगमन परीक्षण मार्फत गुणस्तर कायम गर्दै

वाक्य "मैले सहायक स्थापना गरें, यो राम्रोसँग काम गरिरहेको जस्तो देखिन्छ" इन्जिनियरिङ कथन होइन। RAG प्रणालीहरू चुपचाप टुट्छन्: नयाँ कागजात प्रकारले पुन: प्राप्तिलाई मूर्ख बनाउँछ, द्रुत परिवर्तनले शुद्धता घटाउँछ, सूचकांक बासी हुन्छ। यो महसुस गर्ने एक मात्र तरिका मापन हो। यस एकाईमा, हामी कसरी RAG गुणस्तर (पुनः प्राप्ति र उत्पादन छुट्टै), स्वचालित मूल्याङ्कन (LLM-जज-जज) र उत्पादनमा गुणस्तर कायम राख्ने (अनुगमन, प्रतिगमन) लाई समेट्छौं। "तपाईंले मापन नगर्ने कुरालाई सुधार गर्न सक्नुहुन्न" यो एकाइको आदर्श वाक्य हो।

दुई अलग चीजहरू मापन गर्नुहोस्

RAG का दुई खुट्टाहरू छन् र अलग मापन गर्नुपर्छ किनभने समस्या तिनीहरूमध्ये कुनै एकमा हुन सक्छ:

  1. पुनःप्राप्ति गुणस्तर: सही भाग आइपुग्यो?
  2. जेनेरेसन क्वालिटी: सही उत्तर आउने टुक्राबाट उत्पादन गरिएको थियो?

यदि जवाफ खराब छ भने, तपाईंले पहिले कुन खुट्टा खराब छ भनेर जान्न आवश्यक छ। यदि सही भाग कहिल्यै आउँदैन भने, उत्तम प्रम्प्टले पनि बचत गर्न सक्दैन (पुनप्राप्ति समस्या)। यदि सही भाग आइपुग्यो तर मोडेलले यसलाई गलत पढ्यो भने, पुन: प्राप्तिमा सुधार गर्नु व्यर्थ छ (पुस्ता समस्या)।

पुन: प्राप्ति मेट्रिक्स

पुन: प्राप्ति एक क्रमबद्ध/पहुँच समस्या हो; शास्त्रीय जानकारी पुन: प्राप्ति मेट्रिक्स द्वारा मापन। यसको लागि तपाईसँग सुनौलो क्लस्टर हुनुपर्छ: प्रत्येक प्रश्नको लागि कुन टुक्रा "सही" छ भन्ने ज्ञान।

मेट्रिक

के उपाय

सरल परिभाषा

सम्झनुहोस्@k

शीर्ष k मा सही टुक्रा छ?

सही भाग कब्जा दर

precision@k

फिर्ता गरिएका k टुक्राहरू कति सान्दर्भिक छन्?

ल्याएको सरसफाई

MRR (मीन पारस्परिक श्रेणी)

कुन क्रममा सही टुक्रा हो?

शीर्ष श्रेणीमा रहेको पुरस्कार

हिट दर

कम्तिमा एउटा सही टुक्रा आइपुग्यो?

सफलताको सबैभन्दा आधारभूत उपाय

व्यावहारिक टिप्पणी: यदि Recall@k कम छ भने, chunking वा खोज रणनीति (हाइब्रिड, k, पुन: श्रेणीकरण) पुन: काम गर्नुपर्छ। यदि परिशुद्धता कम छ तर सम्झना उच्च छ भने, पुन: वर्गीकरण थप्नु राम्रो कदम हो।

जेनेरेसन मेट्रिक्स

जब सही भाग आउँछ, हामी मोडेल द्वारा उत्पादित प्रतिक्रियाको गुणस्तर मापन गर्छौं। तीन आधारभूत आयामहरू:

  • विश्वासयोग्यता: के जवाफमा प्रत्येक दाबी सन्दर्भद्वारा समर्थित छ? त्यहाँ कुनै उपयुक्त छ? यो भ्रम को प्रत्यक्ष मापन हो।
  • उत्तर सान्दर्भिकता: के उत्तरले वास्तवमा प्रश्नको जवाफ दिन्छ वा यो विषय बाहिर छ?
  • पूर्णता: के सन्दर्भमा सबै सान्दर्भिक जानकारी प्रयोग गरिएको छ वा यो हराइरहेको छ?

यी प्रायः "साँचो/झूटो" जस्तै बाइनरी भन्दा ग्रेड गरिएको आधारमा (जस्तै 1-5) स्कोर गरिन्छ।

सुझाव: विश्वासयोग्यतालाई छुट्टै मेट्रिकको रूपमा ट्र्याक गर्नुहोस्। यदि सत्यता घट्दै जाँदा वफादारी घट्छ भने, समस्या पुस्ता हो। यदि वफादारी उच्च छ तर जवाफ गलत छ भने, समस्या गलत टुक्रा (पुनप्राप्ति) हो। सँगै, यी दुई मेट्रिक्स एक कम्पास हो जसले गल्तीको स्थान देखाउँछ।

गोल्डेन प्रश्न सेट स्थापना गर्दै

प्रत्येक मापनलाई सुनौलो सेट / मूल्याङ्कन डेटासेट चाहिन्छ: यथार्थपरक प्रश्नहरू + अपेक्षित सही उत्तरहरू + सही स्रोत टुक्राहरू। 30-50 राम्ररी छानिएका प्रश्नहरूबाट सुरु गर्नु 500 अनियमित प्रश्नहरू भन्दा राम्रो हो। सेटमा निम्न समावेश गर्नुहोस्: बारम्बार सोधिने वास्तविक प्रश्नहरू, ज्ञात कठिन प्रश्नहरू, कुनै जवाफ बिना जाल प्रश्नहरू (कसैले "मलाई थाहा छैन" भन्नु पर्छ), विरोधाभासी स्रोतहरू भएका प्रश्नहरू।

# गोल्डेन क्लस्टर उदाहरण (वैचारिक) [ {"प्रश्न": "वार्षिक बिदा कति दिन?", "expected_answer": "१-५ वर्षको ज्येष्ठताको लागि १४ दिन", "सही_पार्ट_आईडी": "दुई भाग-३", "श्रेणी": "बिदा"}, {"प्रश्न": "कम्पनीको कार्यालय कहाँ छ?", "मार्क_उत्तर", "कम्पनीको कार्यालय कहाँ छ?" # ट्र्याप: मलाई थाहा छैन "सही_पार्ट_आईडी": शून्य, "श्रेणी": "जाल"}]

LLM-जज-जज: स्वचालित मूल्याङ्कन

हातले सयौं जवाफहरू स्कोर गर्दा थकाइ लाग्छ। LLM-जज-जज मोडेल भनेको जब एउटा मोडेलले स्कोर गर्छ र अर्को मोडेलको जवाफलाई निश्चित मापदण्डको आधारमा औचित्य दिन्छ। राम्रो न्यायाधीश प्रम्प्टले स्पष्ट रूपमा मापदण्ड परिभाषित गर्दछ, उदाहरणहरू दिन्छ र औचित्यको लागि सोध्छ।

# LLM-जज-जज प्रम्प्ट (वैचारिक) तपाईं एक निष्पक्ष मूल्याङ्कनकर्ता हुनुहुन्छ। दिइएको CONTEXT र अपेक्षित उत्तर अनुसार तलको उत्तरको मूल्याङ्कन गर्नुहोस्। स्कोर (1-5) र औचित्य: - विश्वासयोग्यता: के जवाफमा प्रत्येक दाबी सन्दर्भमा समर्थित छ? - शुद्धता: के जवाफ अपेक्षित जवाफसँग मेल खान्छ? - पूर्णता: प्रासंगिक जानकारी पूर्ण छ? विशेष गरी: यदि जवाफमा सन्दर्भमा नभएको जानकारी समावेश छ भने, विश्वासयोग्यता1 दिनुहोस् र कुन दाबी बनावटी छ भनेर संकेत गर्नुहोस्। CONTEXT: {context} अपेक्षित: {expected} उत्तर: {answer}आउटपुट: {faithfulness, accuracy, completeness, justification}

सावधानी: LLM-जज-जज सिद्ध छैन; तिनीहरूको आफ्नै पूर्वाग्रहहरू हुन सक्छन् (लामो जवाफ, आफ्नै शैलीलाई प्राथमिकता दिँदै)। न्यायाधीशलाई पनि प्रमाणित गर्नुहोस्: न्यायाधीश र मानव दुवैद्वारा स्कोर गरिएका केही जवाफहरू छन् र तिनीहरू बीचको सम्झौता मापन गर्नुहोस्। यदि न्यायाधीश मानव स्कोर संग संगत छ भने, तपाइँ उसलाई विश्वास गर्न सक्नुहुन्छ।

कमजोर / बलियो रेटिंग

कमजोर ("यो मेरो लागि राम्रो थियो"):

मैले केहि प्रश्न सोधे र जवाफहरू राम्रो लागे। मैले यो लाइभ पाएको छु। # समस्या: कुनै मापन छैन, प्रतिगमन अगोचर, सुधार अन्धा।

शक्तिशाली (सुन क्लस्टर + अलग मेट्रिक्स + स्वचालित निर्णय + प्रतिगमन):

40 प्रश्नहरूको गोल्डेन क्लस्टर। प्रत्येक परिवर्तन संग, recall@5, वफादारी र शुद्धता स्वतः मापन गरिन्छ। यदि स्कोर घट्यो भने, परिवर्तन फिर्ता हुन्छ। उत्पादनमा, प्रयोगकर्ता प्रतिक्रिया सङ्कलन र सेटमा थपिएको छ।

उत्पादन मा निगरानी र प्रतिगमन

मूल्याङ्कन एकपटक गरि सकिएन। तीन निरन्तर अभ्यासहरू:

  • प्रतिगमन परीक्षण: प्रत्येक प्रम्प्ट/पुन:प्राप्ति/मोडेल परिवर्तनमा स्वत: रन गोल्डेन क्लस्टर। यदि स्कोर घट्यो भने, परिवर्तन उल्टाइन्छ। यसले "यसलाई राम्रो बनाउन प्रयास गर्दा यसलाई तोड्न" रोक्छ।
  • उत्पादन अनुगमन: वास्तविक प्रश्नहरूमा "मैले जानकारी फेला पार्न सकेन" दर, औसत ढिलाइ, लागत, प्रयोगकर्ता प्रतिक्रिया (👍/👎) अनुगमन गरिन्छ। "मलाई थाहा छैन" मा अचानक वृद्धि प्रायः अनुक्रमणिका वा पुन: प्राप्ति खराबीको पहिलो संकेत हो।
  • प्रतिक्रिया लुप: प्रयोगकर्ता द्वारा प्रदान गरिएका वास्तविक प्रश्नहरू 👎 समीक्षा गरी सुनौलो ढेरमा थपिन्छन्; यसरी, सेट समय संग धनी हुन्छ र प्रणाली को अन्धा स्पट बन्द छन्।

तीन मिनी केसहरू

केस 1 - मौन प्रतिगमन। एउटा टोलीले यसलाई "सुधार" गर्न प्रम्प्टलाई परिमार्जन गर्यो; सामान्य शुद्धता बढ्यो, तर ट्र्याप प्रश्नहरूमा विश्वासयोग्यता 30% ले घट्यो (मोडेल थप फिट हुन थाल्यो)। सुनौलो क्लस्टरमा जाल प्रश्नहरू नभएको भए यो ध्यान दिइने थिएन; रिग्रेसन परीक्षणले परिवर्तनलाई उल्टाइयो।

केस 2 - गलत खुट्टा सीधा गर्दै। एक सहायकमा जवाफहरू खराब थिए; टोलीले हप्तासम्म प्रम्प्टमा काम गर्यो। जब हामीले पुन: प्राप्ति मेट्रिक्स नाप्यौं, recall@5 मात्र 48% थियो — समस्या पुन: प्राप्तिमा थियो, पुस्तामा होइन। जब हाइब्रिड + पुन: श्रेणी थपियो, रिकॉल 89% मा बढ्यो र सटीकता पनि बढ्यो।

केस 3 - उत्पादन चेतावनी। एक दिन, समर्थन सहायकको लागि "मैले जानकारी फेला पार्न सकेन" दर 6% बाट 34% मा उफ्रियो। ट्र्याकप्याडले चेतावनी दियो; कारण यो थियो कि अनुक्रमणिका कार्य, जुन राती चल्छ, चुपचाप असफल भयो र नयाँ लेखहरू अपलोड भएनन्। अनुगमन नगरी, गलत "मलाई थाहा छैन" कथनहरू दिनसम्म जारी रहने थियो।

सामान्य गल्तीहरू

  • "यसले मेरो लागि राम्रो काम गर्यो" मा सन्तुष्ट हुनु: मापन बिना, प्रतिगमन अनावस्यक हुन्छ।
  • पुन: प्राप्ति र पुस्तालाई अलग गर्दैन: तपाईंले गलत खुट्टा सच्याउनुहुनेछ र समय बर्बाद गर्नुहुनेछ।
  • जाल प्रश्नहरू सोध्नु हुँदैन: चीजहरू बनाउने प्रवृत्ति सुनौलो क्लस्टरमा देखा पर्दैन।
  • न्यायाधीश प्रमाणित गर्दैन: एक पक्षपाती जूरीले गलत विश्वास दिन्छ।
  • उत्पादनको अनुगमन छैनः सूचकांक असफल, लागत विस्फोट चुपचाप जारी छ।

संक्षेपमा

  • RAG मा, पुन: प्राप्ति र उत्पादन गुणस्तर अलग मापन गरिन्छ; कुन खुट्टामा क्षति पुगेको छ भनेर पहिले निर्धारण गर्नुपर्छ।
  • recall@k, precision@k, MRR पुनःप्राप्तिको लागि; विश्वासयोग्यता, उपयुक्तता, पूर्णता पुस्ताको लागि प्रयोग गरिन्छ।
  • प्रत्येक मापनलाई सुनको क्लस्टर चाहिन्छ; यसमा वास्तविक, कठिन, जाल र विरोधाभासी प्रश्नहरू राख्नुहोस्।
  • LLM-जज-जज ठूलो सेट स्वत: स्कोर; तर न्यायकर्ता आफै मानिसको विरुद्धमा न्यायी हुनुपर्छ।
  • प्रतिगमन परीक्षण, उत्पादन निगरानी, ​​र प्रतिक्रिया पाश समय संग गुणस्तर कायम राख्छ।

आवेदन कार्य

(१) आफ्नो सहायकका लागि कम्तीमा १५ प्रश्नहरूको सुनौलो सेट बनाउनुहोस्: कम्तीमा ३ वटा पासो (उत्तर छैन), ३ कठिन, २ विरोधाभासी स्रोत प्रश्नहरू समावेश गर्नुहोस्। अपेक्षित उत्तर र प्रत्येक प्रश्नको सही भाग लेख्नुहोस्। (२) म्यानुअल रूपमा यस सेटसँग दुई फरक प्रम्प्ट संस्करणहरू तुलना गर्नुहोस्; वफादारी र शुद्धताको लागि प्रत्येक जवाफलाई 1-5 अंक दिनुहोस्। (३) तपाईंको आफ्नै मापदण्डमा माथिको LLM-जज-जज प्रम्प्टलाई अनुकूलन गर्नुहोस्। (4) तपाईंले उत्पादनमा ट्र्याक गर्नुहुने ३ मेट्रिकहरू पहिचान गर्नुहोस् र प्रत्येकको लागि सोध्नुहोस् "म कुन थ्रेसहोल्डमा अलार्म गर्छु?" मूल्य लेख्नुहोस्।

चेकलिस्ट

  • [] म छुट्टै मेट्रिक्सको साथ अवधारण र उत्पादन गुणस्तर मापन गर्न सक्छु।
  • [ ] मलाई थाहा छ recall@k, वफादारताको अर्थ के हो।
  • [ ] म एउटा सुनौलो क्लस्टर बनाउन सक्छु जसमा वास्तविक, कठिन, जाल र विरोधाभासी प्रश्नहरू समावेश छन्।
  • [ ] म स्वचालित मूल्याङ्कन सेट अप गर्न सक्छु र न्यायाधीशलाई LLM-जज-जजसँग प्रमाणित गर्न सक्छु।
  • [] म रिग्रेसन परीक्षण, उत्पादन निगरानी र प्रतिक्रिया लुप सञ्चालन गर्न सक्छु।