नफा:
- मेट्रिक्स परिभाषित करणे जे धारणा आणि जनरेशन गुणवत्ता स्वतंत्रपणे मोजतात
- एक सुवर्ण प्रश्न संच सेट करा आणि LLM-जज-जजसह स्वयंचलित मूल्यमापन चालवा
- उत्पादनातील अभिप्राय, देखरेख आणि प्रतिगमन चाचणीद्वारे गुणवत्ता राखणे
"मी सहाय्यक स्थापित केला आहे, असे दिसते की ते चांगले काम करत आहे" हे वाक्य अभियांत्रिकी विधान नाही. RAG सिस्टीम शांतपणे मोडतात: नवीन दस्तऐवज प्रकार पुनर्प्राप्तीमध्ये मूर्ख बनतो, त्वरित बदल अचूकता कमी करतो, निर्देशांक शिळा होतो. हे लक्षात येण्याचा एकमेव मार्ग म्हणजे मोजमाप. या युनिटमध्ये, आम्ही आरएजी गुणवत्ता (पुनर्प्राप्ती आणि निर्मिती स्वतंत्रपणे), स्वयंचलित मूल्यांकन (एलएलएम-जज-जज) आणि उत्पादनातील गुणवत्ता (निरीक्षण, प्रतिगमन) कशी मोजावी हे समाविष्ट करतो. "तुम्ही जे मोजत नाही ते तुम्ही सुधारू शकत नाही" हे या युनिटचे ब्रीदवाक्य आहे.
दोन वेगळ्या गोष्टी मोजा
RAG ला दोन पाय आहेत आणि ते वेगळे मोजले जाणे आवश्यक आहे कारण समस्या त्यांच्यापैकी एकामध्ये असू शकते:
- पुनर्प्राप्ती गुणवत्ता: योग्य भाग आला का?
- जनरेशन गुणवत्ता: येणाऱ्या भागातून योग्य उत्तर तयार केले गेले?
जर उत्तर खराब असेल तर तुम्हाला प्रथम कोणता पाय खराब आहे हे जाणून घेणे आवश्यक आहे. योग्य भाग कधीही न आल्यास, सर्वोत्तम प्रॉम्प्ट देखील जतन करू शकत नाही (पुनर्प्राप्ती समस्या). जर योग्य भाग आला असेल परंतु मॉडेलने ते चुकीचे वाचले असेल तर, पुनर्प्राप्ती सुधारणे व्यर्थ आहे (जनरेशन समस्या).
पुनर्प्राप्ती मेट्रिक्स
पुनर्प्राप्ती ही क्रमवारी/प्रवेश समस्या आहे; शास्त्रीय माहिती पुनर्प्राप्ती मेट्रिक्सद्वारे मोजले जाते. यासाठी तुमच्याकडे गोल्डन क्लस्टर असणे आवश्यक आहे: प्रत्येक प्रश्नासाठी कोणता तुकडा "बरोबर" आहे याचे ज्ञान.
मेट्रिक
काय उपाय
साधी व्याख्या
Recall@k
वरच्या k मध्ये योग्य तुकडा आहे का?
योग्य भाग कॅप्चर दर
precision@k
परत केलेल्या k तुकड्यांपैकी किती संबंधित आहेत?
जे आणले आहे त्याची साफसफाई
एमआरआर (मीन रेसिप्रोकल रँक)
योग्य तुकडा कोणत्या क्रमाने आहे?
बक्षिसे वरच्या क्रमांकावर आहेत
हिट दर
किमान एक योग्य तुकडा आला का?
यशाचे सर्वात मूलभूत माप
व्यावहारिक टिप्पणी: Recall@k कमी असल्यास, चंकिंग किंवा शोध धोरण (हायब्रिड, के, री-रँकिंग) पुन्हा तयार केले पाहिजे. जर अचूकता कमी असेल परंतु रिकॉल जास्त असेल, तर री-रँकिंग जोडणे ही चांगली चाल आहे.
जनरेशन मेट्रिक्स
जेव्हा योग्य भाग येतो, तेव्हा आम्ही मॉडेलद्वारे तयार केलेल्या प्रतिसादाची गुणवत्ता मोजतो. तीन मूलभूत परिमाणे:
- विश्वासूता: उत्तरातील प्रत्येक दाव्याला संदर्भाने समर्थन आहे का? काही समर्पक आहे का? हे भ्रमाचे थेट माप आहे.
- उत्तराची प्रासंगिकता: उत्तर प्रत्यक्षात प्रश्नाचे उत्तर देते की ते विषयाबाहेरचे आहे?
- पूर्णता: संदर्भातील सर्व संबंधित माहिती वापरली गेली आहे किंवा ती गहाळ आहे?
हे बऱ्याचदा “सत्य/असत्य” सारख्या बायनरी ऐवजी श्रेणीबद्ध आधारावर (उदा. 1-5) स्कोअर केले जातात.
टीप: विश्वासूपणाचा एक वेगळा मेट्रिक म्हणून मागोवा घ्या. अचूकता कमी झाल्यामुळे विश्वासूपणा कमी झाला तर समस्या निर्माण होते; जर विश्वासूपणा जास्त असेल परंतु उत्तर चुकीचे असेल, तर समस्या चुकीची आहे (पुनर्प्राप्ती). एकत्रितपणे, हे दोन मेट्रिक्स एक कंपास आहेत जे फॉल्टचे स्थान दर्शविते.
गोल्डन प्रश्न संच स्थापित करणे
प्रत्येक मोजमापासाठी सोनेरी संच / मूल्यमापन डेटासेट आवश्यक आहे: वास्तववादी प्रश्न + अपेक्षित योग्य उत्तरे + योग्य स्त्रोत तुकडे. 500 यादृच्छिक प्रश्नांपेक्षा चांगले निवडलेल्या 30-50 प्रश्नांसह प्रारंभ करणे चांगले आहे. संचामध्ये खालील समाविष्ट करा: वारंवार विचारले जाणारे वास्तविक प्रश्न, ज्ञात कठीण प्रश्न, उत्तर नसलेले ट्रॅप प्रश्न (एखाद्याने "मला माहित नाही" असे म्हटले पाहिजे), विरोधाभासी स्त्रोतांसह प्रश्न.
# गोल्डन क्लस्टर उदाहरण (वैचारिक)[ {"प्रश्न": "वार्षिक रजा किती दिवस?", "अपेक्षित_उत्तर": "1-5 वर्षांच्या ज्येष्ठतेसाठी 14 दिवस", "बरोबर_भाग_आयडी": "दोन-भाग-3", "श्रेणी": "रजा"}, {"प्रश्न": "कोठे आहे?" # सापळा: मला "योग्य_भाग_आयडी" माहित नाही: शून्य, "श्रेणी": "सापळा"}]
एलएलएम-जज: स्वयंचलित मूल्यांकन
हाताने शेकडो उत्तरे स्कोअर करणे थकवणारे आहे. LLM-जज-जज मॉडेल म्हणजे जेव्हा एक मॉडेल विशिष्ट निकषांवर आधारित दुसऱ्या मॉडेलच्या उत्तराला स्कोअर करते आणि त्याचे समर्थन करते. एक चांगला न्यायाधीश प्रॉम्प्ट स्पष्टपणे निकष परिभाषित करतो, उदाहरणे देतो आणि औचित्य विचारतो.
# LLM-जज-जज प्रॉम्प्ट (वैचारिक) तुम्ही निष्पक्ष मूल्यांकनकर्ता आहात. दिलेल्या CONTEXT आणि अपेक्षित उत्तरानुसार खालील उत्तराचे मूल्यमापन करा. स्कोअर (१-५) आणि औचित्य सिद्ध करा:- विश्वासूता: उत्तरातील प्रत्येक दाव्याला संदर्भात समर्थन आहे का?- अचूकता: उत्तर अपेक्षित उत्तराशी जुळते का?- पूर्णता: संबंधित माहिती पूर्ण आहे का? विशेषत:: उत्तरामध्ये संदर्भात नसलेली माहिती असल्यास, विश्वासूता1 द्या आणि कोणता दावा बनावट आहे ते सूचित करा. CONTEXT: {context} अपेक्षित: {अपेक्षित}उत्तर: {उत्तर}आउटपुट: {विश्वासूपणा, अचूकता, पूर्णता, औचित्य}
खबरदारी: एलएलएम-जज-जज परिपूर्ण नाही; त्यांचे स्वतःचे पूर्वाग्रह असू शकतात (दीर्घ उत्तर, त्यांच्या स्वतःच्या शैलीला प्राधान्य देणे). न्यायाधीश देखील सत्यापित करा: न्यायाधीश आणि मानव दोघांनी दिलेली काही उत्तरे घ्या आणि त्यांच्यामधील कराराचे मोजमाप करा. न्यायाधीश मानवी गुणांशी सुसंगत असल्यास, तुम्ही त्याच्यावर विश्वास ठेवू शकता.
कमकुवत/सशक्त रेटिंग
कमकुवत ("ते माझ्यासाठी चांगले होते"):
मी काही प्रश्न विचारले आणि उत्तरे छान वाटली. मला ते थेट मिळाले आहे. # समस्या: कोणतेही मोजमाप नाही, प्रतिगमन अदृश्य, सुधारणा अंध.
शक्तिशाली (गोल्ड क्लस्टर + डिस्क्रिट मेट्रिक्स + ऑटोमॅटिक जजमेंट + रिग्रेशन):
40 प्रश्नांचा गोल्डन क्लस्टर. प्रत्येक बदलासह, recall@5, विश्वासूता आणि अचूकता आपोआप मोजली जाते. स्कोअर कमी झाल्यास, बदल परत आणला जातो. उत्पादनामध्ये, वापरकर्त्याचा अभिप्राय गोळा केला जातो आणि सेटमध्ये जोडला जातो.
उत्पादनातील देखरेख आणि प्रतिगमन
मूल्यमापन एकदा करून पूर्ण होत नाही. तीन सतत सराव:
- प्रतिगमन चाचणी: प्रत्येक प्रॉम्प्ट/पुनर्प्राप्ती/मॉडेल बदलावर ऑटो-रन गोल्डन क्लस्टर. स्कोअर कमी केल्यास, बदल उलट केला जातो. हे "ते चांगले बनवण्याचा प्रयत्न करताना ते तोडणे" प्रतिबंधित करते.
- उत्पादन निरीक्षण: वास्तविक प्रश्नांमध्ये "मला माहिती सापडली नाही" दर, सरासरी विलंब, खर्च, वापरकर्ता अभिप्राय (👍/👎) यांचे परीक्षण केले जाते. "मला माहित नाही" मध्ये अचानक वाढ होणे हे सहसा अनुक्रमणिका किंवा पुनर्प्राप्ती खराबीचे पहिले लक्षण असते.
- फीडबॅक लूप: वापरकर्त्याने दिलेले खरे प्रश्न 👎 पुनरावलोकन केले जातात आणि सोनेरी ढिगाऱ्यात जोडले जातात; अशाप्रकारे, संच कालांतराने अधिक समृद्ध होतो आणि प्रणालीचे आंधळे स्पॉट्स बंद होतात.
तीन मिनी केसेस
केस 1 - मूक प्रतिगमन. एका संघाने ते "सुधारणा" करण्यासाठी प्रॉम्प्ट सुधारित केले; सामान्य अचूकता वाढली, परंतु ट्रॅप प्रश्नांमध्ये विश्वासूपणा 30% कमी झाला (मॉडेल अधिक फिट होऊ लागले). सोनेरी गुच्छातील सापळा प्रश्न नसता तर ते लक्षात आले नसते; प्रतिगमन चाचणीने बदल परत केला.
केस 2 - चुकीचा पाय सरळ करणे. एका असिस्टंटमध्ये उत्तरे खराब होती; टीमने आठवडे प्रॉम्प्टवर काम केले. जेव्हा आम्ही पुनर्प्राप्ती मेट्रिक्स मोजले, तेव्हा रिकॉल@5 फक्त 48% होते — समस्या पुनर्प्राप्तीमध्ये होती, पिढी नाही. जेव्हा हायब्रिड + री-रँकिंग जोडले गेले, तेव्हा रिकॉल 89% पर्यंत वाढले आणि अचूकता देखील वाढली.
केस 3 - उत्पादन सूचना. एके दिवशी, सपोर्ट असिस्टंटसाठी "मला माहिती सापडली नाही" दर 6% वरून 34% वर गेला. ट्रॅकपॅडने इशारा दिला; रात्री चालणारे अनुक्रमणिका कार्य शांतपणे अयशस्वी झाले आणि नवीन लेख अपलोड केले गेले नाहीत हे कारण होते. निरीक्षण न करता, चुकीची "मला माहित नाही" विधाने दिवसभर चालू राहिली असती.
सामान्य चुका
- "त्याने माझ्यासाठी चांगले काम केले" यावर समाधानी असणे: मोजमाप न करता, प्रतिगमनाकडे लक्ष दिले जात नाही.
- पुनर्प्राप्ती आणि पिढी वेगळे न करणे: आपण चुकीचा पाय दुरुस्त कराल आणि वेळ वाया घालवाल.
- ट्रॅप प्रश्न न विचारणे: गोष्टी बनवण्याची प्रवृत्ती गोल्डन क्लस्टरमध्ये दिसून येत नाही.
- न्यायाधीश पडताळत नाही: पक्षपाती ज्युरी खोटा आत्मविश्वास देते.
- उत्पादनाचे निरीक्षण करत नाही: निर्देशांक अपयश, खर्चाचा स्फोट शांतपणे सुरू आहे.
सारांशात
- RAG मध्ये, पुनर्प्राप्ती आणि पिढी गुणवत्ता स्वतंत्रपणे मोजली जाते; कोणता पाय खराब झाला आहे हे प्रथम निर्धारित करणे आवश्यक आहे.
- पुनर्प्राप्तीसाठी recall@k, precision@k, MRR; विश्वासूता, योग्यता, पूर्णता या पिढीसाठी वापरली जाते.
- प्रत्येक मोजमापासाठी सोन्याचे क्लस्टर आवश्यक आहे; त्यात वास्तविक, अवघड, सापळे आणि परस्परविरोधी प्रश्न टाका.
- एलएलएम-जज-जज मोठे सेट ऑटो-स्कोअर; परंतु न्यायाधीश स्वतः मनुष्याविरुद्ध न्यायी ठरला पाहिजे.
- प्रतिगमन चाचणी, उत्पादन निरीक्षण आणि फीडबॅक लूप कालांतराने गुणवत्ता राखतात.
अर्ज कार्य
(1) तुमच्या स्वतःच्या सहाय्यकासाठी किमान 15 प्रश्नांचा सुवर्ण संच तयार करा: किमान 3 सापळे (उत्तरे नाहीत), 3 कठीण, 2 विरोधाभासी स्रोत प्रश्न समाविष्ट करा. प्रत्येक प्रश्नासाठी अपेक्षित उत्तर आणि योग्य भाग लिहा. (2) या संचासह दोन भिन्न प्रॉम्प्ट आवृत्त्यांची व्यक्तिचलितपणे तुलना करा; विश्वासूपणा आणि अचूकतेसाठी प्रत्येक उत्तराला 1-5 गुण द्या. (३) वरील LLM-जज-जज प्रॉम्प्ट तुमच्या स्वतःच्या निकषांनुसार स्वीकारा. (4) तुम्ही उत्पादनात ट्रॅक कराल असे 3 मेट्रिक्स ओळखा आणि प्रत्येकासाठी "मी कोणत्या उंबरठ्यावर अलार्म करू?" मूल्य लिहा.
चेकलिस्ट
- मी स्वतंत्र मेट्रिक्ससह धारणा आणि जनरेशन गुणवत्ता मोजू शकतो.
- [ ] recall@k, निष्ठा म्हणजे काय हे मला माहीत आहे.
- [ ] मी एक सोनेरी क्लस्टर तयार करू शकतो ज्यामध्ये वास्तविक, कठीण, सापळा आणि विरोधाभासी प्रश्नांचा समावेश आहे.
- [ ] मी स्वयंचलित मूल्यमापन सेट करू शकतो आणि LLM-जज-जजसह न्यायाधीश सत्यापित करू शकतो.
- [] मी रीग्रेशन चाचणी, उत्पादन निरीक्षण आणि फीडबॅक लूप ऑपरेट करू शकतो.