लाभ:
- ऐसे मेट्रिक्स को परिभाषित करना जो अवधारण और पीढ़ी की गुणवत्ता को अलग-अलग मापते हैं
- एक स्वर्ण प्रश्न सेट सेट करें और एलएलएम-ए-जज के साथ स्वचालित मूल्यांकन चलाएं
- उत्पादन में फीडबैक, निगरानी और प्रतिगमन परीक्षण के माध्यम से गुणवत्ता बनाए रखना
वाक्य "मैंने सहायक स्थापित किया, यह ठीक काम कर रहा है" एक इंजीनियरिंग कथन नहीं है। आरएजी सिस्टम चुपचाप टूट जाते हैं: एक नया दस्तावेज़ प्रकार पुनर्प्राप्ति को मूर्ख बनाता है, एक त्वरित परिवर्तन सटीकता को कम कर देता है, सूचकांक पुराना हो जाता है। इसे महसूस करने का एकमात्र तरीका मापना है। इस इकाई में, हम आरएजी गुणवत्ता (पुनर्प्राप्ति और उत्पादन अलग-अलग), स्वचालित मूल्यांकन (एलएलएम-ए-जज) और उत्पादन में गुणवत्ता बनाए रखने (निगरानी, प्रतिगमन) को मापने के तरीके को कवर करते हैं। "आप जिसे मापते नहीं उसे सुधार नहीं सकते" इस इकाई का आदर्श वाक्य है।
दो अलग-अलग चीज़ों को मापें
RAG के दो पैर होते हैं और उन्हें अलग-अलग मापा जाना चाहिए क्योंकि समस्या उनमें से किसी एक में हो सकती है:
- पुनर्प्राप्ति गुणवत्ता: क्या सही भाग आया?
- पीढ़ी की गुणवत्ता: क्या आने वाले टुकड़े से सही उत्तर उत्पन्न हुआ था?
यदि उत्तर खराब है, तो आपको पहले यह जानना होगा कि कौन सा पैर खराब है। यदि सही भाग कभी नहीं आता है, तो सबसे अच्छा संकेत भी सहेजा नहीं जा सकता (पुनर्प्राप्ति समस्या)। यदि सही भाग आ गया है लेकिन मॉडल ने इसे गलत पढ़ा है, तो पुनर्प्राप्ति में सुधार करना व्यर्थ है (पीढ़ी की समस्या)।
पुनर्प्राप्ति मेट्रिक्स
पुनर्प्राप्ति एक छँटाई/पहुंच समस्या है; शास्त्रीय सूचना पुनर्प्राप्ति मेट्रिक्स द्वारा मापा गया। इसके लिए आपके पास सुनहरा क्लस्टर होना चाहिए: प्रत्येक प्रश्न के लिए कौन सा भाग "सही" है इसका ज्ञान।
मीट्रिक
क्या उपाय
सरल परिभाषा
रिकॉल@के
क्या शीर्ष k में सही टुकड़ा है?
सही पार्ट कैप्चर दर
परिशुद्धता@k
लौटाए गए k टुकड़ों में से कितने प्रासंगिक हैं?
जो लाया जाता है उसकी सफ़ाई करना
एमआरआर (मीन रेसिप्रोकल रैंक)
सही टुकड़ा किस क्रम में है?
शीर्ष रैंक में होने का पुरस्कार
हिट दर
क्या कम से कम एक सही टुकड़ा आया?
सफलता का सबसे बुनियादी पैमाना
व्यावहारिक टिप्पणी: यदि रिकॉल@के कम है, तो चंकिंग या खोज रणनीति (हाइब्रिड, के, री-रैंकिंग) पर फिर से काम किया जाना चाहिए। यदि परिशुद्धता कम है लेकिन रिकॉल अधिक है, तो पुनः रैंकिंग जोड़ना एक अच्छा कदम है।
जनरेशन मेट्रिक्स
जब सही भाग आता है, तो हम मॉडल द्वारा उत्पादित प्रतिक्रिया की गुणवत्ता को मापते हैं। तीन बुनियादी आयाम:
- वफ़ादारी: क्या उत्तर में प्रत्येक दावा संदर्भ द्वारा समर्थित है? क्या कोई फिटिंग है? यह मतिभ्रम का प्रत्यक्ष माप है।
- उत्तर प्रासंगिकता: क्या उत्तर वास्तव में प्रश्न का उत्तर देता है या यह विषय से बाहर है?
- संपूर्णता: क्या संदर्भ में सभी प्रासंगिक जानकारी का उपयोग किया गया है या वह गायब है?
इन्हें अक्सर "सही/गलत" जैसे द्विआधारी के बजाय श्रेणीबद्ध आधार पर (उदाहरण के लिए 1-5) स्कोर किया जाता है।
युक्ति: वफ़ादारी को एक अलग मीट्रिक के रूप में ट्रैक करें। यदि सटीकता कम होने के साथ-साथ विश्वसनीयता कम हो जाती है, तो समस्या पीढ़ी है; यदि निष्ठा अधिक है लेकिन उत्तर गलत है, तो समस्या गलत अंश (पुनर्प्राप्ति) है। साथ में, ये दोनों मेट्रिक्स एक कंपास हैं जो गलती का स्थान दिखाते हैं।
एक स्वर्णिम प्रश्न सेट की स्थापना
प्रत्येक माप के लिए एक सुनहरे सेट/मूल्यांकन डेटासेट की आवश्यकता होती है: यथार्थवादी प्रश्न + अपेक्षित सही उत्तर + सही स्रोत टुकड़े। 30-50 अच्छी तरह से चुने गए प्रश्नों से शुरुआत करना 500 यादृच्छिक प्रश्नों से बेहतर है। सेट में निम्नलिखित को शामिल करें: अक्सर पूछे जाने वाले वास्तविक प्रश्न, ज्ञात कठिन प्रश्न, बिना उत्तर वाले ट्रैप प्रश्न (किसी को "मुझे नहीं पता" कहना चाहिए), विरोधाभासी स्रोतों वाले प्रश्न।
# गोल्डन क्लस्टर उदाहरण (वैचारिक)[ {"प्रश्न": "कितने दिनों की वार्षिक छुट्टी?", "अपेक्षित_उत्तर": "1-5 वर्ष की वरिष्ठता के लिए 14 दिन", "सही_भाग_आईडी": "दो-भाग-3", "श्रेणी": "छुट्टी"}, {"प्रश्न": "कंपनी का मंगल कार्यालय कहां है?", "अपेक्षित_उत्तर": "कोई जानकारी नहीं", # जाल: मुझे नहीं पता "सही_पार्ट_आईडी": शून्य, "श्रेणी": "जाल"}]
एलएलएम-ए-जज: स्वचालित मूल्यांकन
सैकड़ों उत्तरों को हाथ से स्कोर करना थका देने वाला होता है। एलएलएम-ए-जज मॉडल तब होता है जब एक मॉडल स्कोर करता है और कुछ मानदंडों के आधार पर दूसरे मॉडल के उत्तर को सही ठहराता है। एक अच्छा न्यायाधीश संकेत स्पष्ट रूप से मानदंडों को परिभाषित करता है, उदाहरण देता है और औचित्य पूछता है।
# एलएलएम-एज़-जज प्रॉम्प्ट (वैचारिक) आप एक निष्पक्ष मूल्यांकनकर्ता हैं। दिए गए संदर्भ और अपेक्षित उत्तर के अनुसार नीचे दिए गए उत्तर का मूल्यांकन करें। स्कोर (1-5) और पुष्टि करें: - विश्वसनीयता: क्या उत्तर में प्रत्येक दावा संदर्भ में समर्थित है? - सटीकता: क्या उत्तर अपेक्षित उत्तर से मेल खाता है? - पूर्णता: क्या प्रासंगिक जानकारी पूर्ण है? विशेष रूप से: यदि उत्तर में ऐसी जानकारी है जो संदर्भ में नहीं है, तो विश्वसनीयता 1 दें और इंगित करें कि कौन सा दावा मनगढ़ंत है। संदर्भ: {संदर्भ}अपेक्षित: {अपेक्षित}उत्तर: {उत्तर}आउटपुट: {वफादारी, सटीकता, पूर्णता, औचित्य}
सावधानी: एलएलएम-ए-जज सही नहीं है; उनके अपने पूर्वाग्रह हो सकते हैं (लंबे उत्तर, अपनी शैली को प्राथमिकता देना)। जज को भी सत्यापित करें: जज और मानव दोनों द्वारा कुछ उत्तर दिए जाएं और उनके बीच सहमति को मापें। यदि न्यायाधीश मानव स्कोर के अनुरूप है, तो आप उस पर भरोसा कर सकते हैं।
कमजोर/मजबूत रेटिंग
कमज़ोर ("यह मेरे लिए अच्छा था"):
मैंने कुछ प्रश्न पूछे और उत्तर अच्छे लगे। मैंने इसे लाइव कर लिया है। # समस्या: कोई माप नहीं, प्रतिगमन अगोचर, सुधार अंधा।
शक्तिशाली (स्वर्ण क्लस्टर + असतत मेट्रिक्स + स्वचालित निर्णय + प्रतिगमन):
40 प्रश्नों का स्वर्णिम समूह। प्रत्येक परिवर्तन के साथ, रिकॉल@5, विश्वसनीयता और सटीकता स्वचालित रूप से मापी जाती है। यदि स्कोर गिरता है, तो परिवर्तन वापस ले लिया जाता है। उत्पादन में, उपयोगकर्ता का फीडबैक एकत्र किया जाता है और सेट में जोड़ा जाता है।
उत्पादन में निगरानी और प्रतिगमन
एक बार मूल्यांकन कर ख़त्म नहीं किया जाता. तीन निरंतर अभ्यास:
- प्रतिगमन परीक्षण: प्रत्येक संकेत/पुनर्प्राप्ति/मॉडल परिवर्तन पर स्वचालित रूप से गोल्डन क्लस्टर चलाएं। यदि स्कोर कम हो जाता है, तो परिवर्तन उलट जाता है। यह "इसे बेहतर बनाने की कोशिश करते समय इसे तोड़ने" से रोकता है।
- उत्पादन निगरानी: वास्तविक प्रश्नों में "मुझे जानकारी नहीं मिल सकी" दर, औसत विलंब, लागत, उपयोगकर्ता प्रतिक्रिया (👍/👎) की निगरानी की जाती है। "मुझे नहीं पता" में अचानक वृद्धि अक्सर सूचकांक या पुनर्प्राप्ति खराबी का पहला संकेत है।
- फीडबैक लूप: उपयोगकर्ता 👎 द्वारा प्रदान किए गए वास्तविक प्रश्नों की समीक्षा की जाती है और सुनहरे ढेर में जोड़ा जाता है; इस प्रकार, सेट समय के साथ समृद्ध होता जाता है और सिस्टम के अंधे धब्बे बंद हो जाते हैं।
तीन मिनी मामले
केस 1 - मौन प्रतिगमन। एक टीम ने प्रॉम्प्ट को "सुधारने" के लिए संशोधित किया; सामान्य सटीकता में वृद्धि हुई, लेकिन ट्रैप प्रश्नों में विश्वसनीयता 30% कम हो गई (मॉडल अधिक फिट होने लगा)। यदि गोल्डन क्लस्टर में उलझे हुए प्रश्न न होते तो इस पर ध्यान नहीं दिया जाता; प्रतिगमन परीक्षण ने परिवर्तन को पूर्ववत कर दिया।
केस 2 - गलत पैर को सीधा करना। एक सहायक के उत्तर ख़राब थे; टीम ने हफ्तों तक प्रॉम्प्ट पर काम किया। जब हमने पुनर्प्राप्ति मेट्रिक्स को मापा, तो रिकॉल@5 केवल 48% था - समस्या पुनर्प्राप्ति में थी, पीढ़ी में नहीं। जब हाइब्रिड + री-रैंकिंग जोड़ी गई, तो रिकॉल बढ़कर 89% हो गया और सटीकता भी बढ़ गई।
केस 3 - उत्पादन चेतावनी। एक दिन, एक सहायता सहायक के लिए "मुझे जानकारी नहीं मिल सकी" दर 6% से बढ़कर 34% हो गई। ट्रैकपैड ने चेतावनी दी; कारण यह था कि अनुक्रमणिका कार्य, जो रात में चलता था, चुपचाप विफल हो गया और नये लेख अपलोड नहीं किये गये। निगरानी के बिना, गलत "मुझे नहीं पता" बयान कई दिनों तक जारी रहेंगे।
सामान्य गलतियाँ
- "इसने मेरे लिए अच्छा काम किया" से संतुष्ट होना: माप के बिना, प्रतिगमन पर ध्यान नहीं दिया जाता है।
- पुनर्प्राप्ति और पीढ़ी को अलग न करना: आप गलत पैर को सही करेंगे और समय बर्बाद करेंगे।
- उलझे हुए प्रश्न न पूछना: बातें बनाने की प्रवृत्ति सुनहरे समूह में प्रकट नहीं होती है।
- न्यायाधीश का सत्यापन न करना: पक्षपाती जूरी झूठा विश्वास दिलाती है।
- उत्पादन की निगरानी नहीं करना: सूचकांक विफलता, लागत विस्फोट चुपचाप जारी है।
संक्षेप में
- आरएजी में, पुनर्प्राप्ति और उत्पादन गुणवत्ता को अलग-अलग मापा जाता है; सबसे पहले यह निर्धारित करना होगा कि कौन सा पैर क्षतिग्रस्त है।
- रिकॉल@के, प्रिसिजन@के, पुनर्प्राप्ति के लिए एमआरआर; पीढ़ी के लिए विश्वसनीयता, उपयुक्तता, पूर्णता का उपयोग किया जाता है।
- प्रत्येक माप के लिए एक सोने के क्लस्टर की आवश्यकता होती है; इसमें वास्तविक, कठिन, उलझाने वाले और विरोधाभासी प्रश्न रखें।
- एलएलएम-जज के रूप में बड़े सेट ऑटो-स्कोर; परन्तु न्यायी को आप ही मनुष्य के विरूद्ध धर्मी ठहरना चाहिए।
- प्रतिगमन परीक्षण, उत्पादन निगरानी और फीडबैक लूप समय के साथ गुणवत्ता बनाए रखते हैं।
आवेदन कार्य
(1) अपने स्वयं के सहायक के लिए कम से कम 15 प्रश्नों का एक सुनहरा सेट बनाएं: कम से कम 3 ट्रैप (कोई उत्तर नहीं), 3 कठिन, 2 विरोधाभासी स्रोत प्रश्न शामिल करें। प्रत्येक प्रश्न के लिए अपेक्षित उत्तर और सही भाग लिखें। (2) इस सेट के साथ दो अलग-अलग प्रॉम्प्ट संस्करणों की मैन्युअल रूप से तुलना करें; प्रत्येक उत्तर को विश्वसनीयता और सटीकता के लिए 1-5 अंक दें। (3) उपरोक्त एलएलएम-ए-जज प्रॉम्प्ट को अपने मानदंडों के अनुसार अपनाएं। (4) 3 मेट्रिक्स की पहचान करें जिन्हें आप उत्पादन में ट्रैक करेंगे और प्रत्येक के लिए पूछें "मुझे किस सीमा पर अलार्म लगाना चाहिए?" मूल्य लिखें.
चेकलिस्ट
- [ ] मैं अलग-अलग मेट्रिक्स के साथ प्रतिधारण और पीढ़ी की गुणवत्ता को माप सकता हूं।
- [ ] मैं जानता हूं कि रिकॉल@के, वफ़ादारी जैसे मेट्रिक्स का क्या मतलब है।
- [ ] मैं एक सुनहरा समूह बना सकता हूं जिसमें वास्तविक, कठिन, उलझाने वाले और विरोधाभासी प्रश्न शामिल हों।
- [ ] मैं स्वचालित मूल्यांकन स्थापित कर सकता हूं और न्यायाधीश के रूप में एलएलएम के साथ न्यायाधीश का सत्यापन कर सकता हूं।
- [ ] मैं प्रतिगमन परीक्षण, उत्पादन निगरानी और फीडबैक लूप संचालित कर सकता हूं।