इकाइयाँ
1. कॉल सेंटर और ग्राहक अनुभव में आर्टिफिशियल इंटेलिजेंस का परिचय: भूमिकाएँ, सीमाएँ, प्रमाणीकरण और गोपनीयता 2. वॉयस और टेक्स्ट बॉट: आईवीआर, चैटबॉट और वॉयसबॉट डिजाइन 3. वार्तालाप डिज़ाइन और आभासी सहायक: आशय, संवाद और प्राकृतिक अनुभव 4. कॉल सारांश और ऑटो-टैगिंग: रैप-अप को सेकंडों तक कम करना 5. नॉलेज बेस और आरएजी: बॉट और एजेंट कैसे सही उत्तर ढूंढते हैं 6. एजेंट सहायता: वास्तविक समय सहायता 7. भावना विश्लेषण और गुणवत्ता प्रबंधन: भाषण विश्लेषण के साथ क्यूए 8. स्व-सेवा और स्वचालन: ग्राहक स्व-समाधान 9. डेटा गोपनीयता, सुरक्षा और अनुपालन: केवीकेके, पीसीआई-डीएसएस और मास्किंग 10. वृद्धि और मानव-कृत्रिम बुद्धिमत्ता सहयोग 11. मापन, केपीआई और निरंतर सुधार: क्या निगरानी करें और कैसे? 12. एंड-टू-एंड सीएक्स-एआई कार्यक्रम का निर्माण: एकीकरण और शासन
इकाई 5 / 12

नॉलेज बेस और आरएजी: बॉट और एजेंट कैसे सही उत्तर ढूंढते हैं

लाभ:

  • समझें कि आरएजी (विखंडन, पहुंच, संसाधन-निर्भर पीढ़ी) कैसे काम करता है और यह मतिभ्रम को कैसे कम करता है
  • एक ऐसा ज्ञान आधार स्थापित करके उत्तरों की गुणवत्ता बढ़ाने की क्षमता जो वर्तमान, स्पष्ट, संघर्ष-मुक्त हो और जिसका एक ही सही स्रोत हो।
  • मॉडल को निर्देश देने की क्षमता 'यदि यह स्रोत में नहीं है, तो मुझे बताएं कि आप नहीं जानते' और जिन प्रश्नों का उत्तर यह नहीं दे सकता उन्हें ज्ञान के आधार में सुधार में बदलने की क्षमता

एक बॉट या एजेंट सहायक जो उत्तर देता है वह उतना ही अच्छा होता है जितनी जानकारी जिस पर वह आधारित होता है। जब ग्राहक पूछता है "क्या अभियान जारी है?", तो सही उत्तर मॉडल की स्मृति में नहीं, बल्कि संस्थान के वर्तमान ज्ञान आधार में होता है। यही कारण है कि कॉल सेंटर आर्टिफिशियल इंटेलिजेंस का दिल ज्ञान आधार (केबी) है: एक अद्यतन संसाधन जहां उत्पादों, नीतियों, एफएक्यू, प्रक्रियाओं और नियमों को लिखित रूप में रखा जाता है। और वह विधि जो इस ज्ञान आधार को कृत्रिम बुद्धिमत्ता से सुरक्षित रूप से जोड़ती है, उसे RAG: रिट्रीवल-ऑगमेंटेड जेनरेशन कहा जाता है - अपनी स्वयं की मेमोरी से उत्तर बनाने के बजाय, मॉडल पहले स्रोत (पुनर्प्राप्ति) से जानकारी के प्रासंगिक टुकड़े पुनर्प्राप्त करता है और फिर केवल उन टुकड़ों (पीढ़ी) के आधार पर उत्तर उत्पन्न करता है।

आरएजी मतिभ्रम को रोकने का सबसे शक्तिशाली तरीका है। मॉडल "ऋण ब्याज दर क्या है?" प्रश्न के लिए अपने दिमाग में कोई संख्या उत्पन्न नहीं करता है। यह ज्ञान के आधार से वर्तमान रुचि वाले पाठ को पुनः प्राप्त करता है और उसके आधार पर उत्तर देता है। इस इकाई में हम देखेंगे कि ज्ञान आधार कैसे स्थापित किया जाए, आरएजी कैसे काम करता है और एक अच्छा ज्ञान आधार उत्तरों की गुणवत्ता कैसे निर्धारित करता है।

आरएजी कैसे काम करता है: चार चरण

RAG को एक लाइब्रेरियन की तरह सोचें। ग्राहक प्रश्न पूछता है; सिस्टम पहले लाइब्रेरी की दाहिनी शेल्फ से संबंधित पेज ढूंढता है, फिर उन पेजों को पढ़ता है और उत्तर लिखता है। तकनीकी चरण इस प्रकार हैं:

  1. खंडन: ज्ञानकोष में लंबे दस्तावेज़ों को छोटे, सार्थक टुकड़ों में तोड़ दिया जाता है (उदाहरण के लिए, प्रत्येक FAQ एक खंड होता है)। क्योंकि मॉडल संबंधित छोटे भागों के साथ किसी प्रश्न का अधिक सटीक उत्तर देता है।
  2. एंबेडिंग और इंडेक्सिंग: प्रत्येक टुकड़े को उसके अर्थ का प्रतिनिधित्व करने वाले संख्यात्मक रूप में अनुवादित किया जाता है (एम्बेडिंग-पाठ के अर्थ का प्रतिनिधित्व करने वाली संख्याओं का एक क्रम) और एक खोजने योग्य डेटाबेस में रखा जाता है। इस प्रकार, यह "शब्द मिलान" नहीं बल्कि "अर्थ मिलान" है; यहां तक ​​कि अगर ग्राहक पूछता है कि "मेरा पैसा कब जमा किया जाएगा?", तो "रिफंड अवधि" भाग मिल सकता है।
  3. पुनर्प्राप्ति: ग्राहक के प्रश्न के अर्थ में निकटतम भाग पुनर्प्राप्त किए जाते हैं (उदाहरण के लिए निकटतम 3-5 भाग)।
  4. पीढ़ी: मॉडल केवल खींचे गए हिस्सों के आधार पर उत्तर लिखता है और यदि संभव हो तो स्रोत को इंगित करता है।

महत्वपूर्ण बिंदु चरण 4 में है: मॉडल को निर्देश दिया गया है कि "केवल दिए गए टुकड़ों पर भरोसा करें, या कहें कि आप नहीं जानते।" इस निर्देश के बिना, RAG मॉडल को फिट होने से नहीं रोकता है।

संकेत: RAG का सुनहरा नियम: "यदि यह स्रोत में नहीं है, तो कोई उत्तर नहीं है।" एक अच्छा आरएजी सिस्टम उस प्रश्न के लिए कहेगा "मैं इसके बारे में निश्चित रूप से नहीं जानता" जो ज्ञान के आधार पर नहीं है; अनुमान से कभी भी अंतर नहीं भरता। एक बॉट की "मुझे नहीं पता" कहने की क्षमता एक सुरक्षा सुविधा है, कमजोरी नहीं।

एक अच्छा ज्ञान आधार: उत्तर गुणवत्ता का वास्तविक स्रोत

RAG कितना भी अच्छा क्यों न हो, यदि ज्ञान का आधार ख़राब है, तो उत्तर ख़राब है। ज्ञान आधार गुणवत्ता को इसके द्वारा मापा जाता है:

सुविधा

ख़राब ज्ञान का आधार

अच्छा ज्ञान का आधार

वर्तमानता

महीनों तक अपडेट नहीं किया गया

बदलने पर तुरंत अपडेट किया गया

स्पष्टता

लंबा, जटिल पाठ

लघु, एकल-विषय लेख

संरचना

गन्दा पीडीएफ ढेर

नष्ट होने योग्य पदार्थों को लेबल किया गया

संगति

दो परस्पर विरोधी उत्तर

सत्य का एकल स्रोत

दायरा

बहुत सारी कमियाँ हैं

अक्सर पूछे जाने वाले प्रश्न शामिल हैं

स्वामित्व

कोई भी जिम्मेदार नहीं है

प्रत्येक विषय का एक स्वामी होता है

कॉल सेंटर के संदर्भ में सबसे खतरनाक समस्या विरोधाभास है: यदि ज्ञान आधार में दो अलग-अलग रिटर्न अवधि लिखी गई हैं, तो आरएजी कहेगा कि वह जो भी लेगा और ग्राहक को एक असंगत उत्तर भेजा जाएगा। इसीलिए "सत्य का एकल स्रोत" सिद्धांत महत्वपूर्ण है: जानकारी को एक ही स्थान पर अद्यतन रखा जाता है; उस स्रोत के सन्दर्भों का उपयोग किया जाता है, प्रतियों का नहीं।

चरण दर चरण: RAG-समर्थित प्रतिक्रिया प्रणाली का निर्माण

  1. ज्ञानकोष को साफ़ करें: पुराने, परस्पर विरोधी, डुप्लिकेट लेख हटाएँ। प्रत्येक लेख को संक्षिप्त और एकल-विषय बनाएं।
  2. इसे तोड़ें और टैग करें: प्रत्येक लेख में एक विषय टैग और अंतिम अद्यतन तिथि जोड़ें।
  3. पहुंच स्थापित करें: एक तंत्र कनेक्ट करें जो पूछे जाने पर प्रासंगिक भागों को खींचता है (एंटरप्राइज़ आरएजी उपकरण इसे प्रदान करते हैं)।
  4. एक सख्त संकेत लिखें: मॉडल को बताएं "केवल प्रदान किए गए हिस्सों पर भरोसा करें, स्रोत का हवाला दें, या कहें कि आप नहीं जानते।"
  5. स्रोत उद्धृत करें: वह आलेख दिखाएँ जिस पर उत्तर आधारित है; यह आत्मविश्वास भी देता है और सत्यापन की सुविधा भी देता है।
  6. अंतराल पर नजर रखें: उन प्रश्नों को एकत्र करें जहां बॉट कहता है "मुझे नहीं पता"; ये ज्ञान के आधार में कमियों को दर्शाते हैं, वहीं से फ़ीड करते हैं।

चार प्रतिलिपि योग्य टेम्पलेट

1) सख्त आरएजी उत्तर संकेत:

निम्नलिखित [स्रोत] भागों के आधार पर उत्तर दें। नियम: (1) केवल स्रोत में दी गई जानकारी का उपयोग करें, (2) यदि यह स्रोत में नहीं है, तो कहें "मुझे इसके बारे में कोई निश्चित जानकारी नहीं है, मैं आपको प्रतिनिधि से जोड़ता हूं", (3) बताएं कि यह किस लेख पर आधारित है [स्रोत: आइटम-नंबर], (4) स्रोत से सटीक मात्रा/अवधि/शर्त उद्धृत करें, गोल/बनाना न करें। [स्रोत]: <<खींचे गए हिस्से>>प्रश्न: "<<ग्राहक प्रश्न>>"

2) ज्ञान आधारित लेख लेखन:

निम्नलिखित बिखरे हुए नीति पाठ को RAG के लिए उपयुक्त FAQ आलेख में परिवर्तित करें। प्रारूप: प्रश्न (ग्राहक की भाषा में) / संक्षिप्त उत्तर (2-3 वाक्य) / शर्तें (खंड) / अंतिम अद्यतन की तिथि / विषय टैग। किसी भी अस्पष्ट बिंदु को "स्पष्ट किया जाना है" के रूप में चिह्नित करें, दिखावा करें। कच्चा पाठ: <<पाठ>>

3) विरोधाभासों और अंतरालों की स्कैनिंग:

निम्नलिखित ज्ञान आधारित आलेखों का परीक्षण करें। (1) लेखों के उन युग्मों को चिह्नित करें जो एक-दूसरे से टकराते हैं (उदाहरण के लिए अलग-अलग वापसी अवधि)। (2) उन विषयों का अनुमान लगाएं जिनसे अक्सर पूछा जाएगा लेकिन कोई उत्तर नहीं है। केवल दिए गए लेखों को देखें; नई नीति का निर्माण। लेख: <<सूची>>

4) "मुझे नहीं पता" लॉग से सुधार:

नीचे ऐसे प्रश्न हैं जिनका उत्तर बॉट नहीं दे सका (स्रोत नहीं ढूंढ सका)। उन्हें विषयों में समूहित करें और लेख का शीर्षक सुझाएं जिसे प्रत्येक समूह के लिए ज्ञान आधार में जोड़ा जाना चाहिए। उत्तर सामग्री न बनाएं, बस मुझे बताएं कि कौन सा आइटम गायब है। प्रश्न: <<सूची>>

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

ग्राहक के वापसी प्रश्न का उत्तर दें.

कोई स्रोत नहीं; मॉडल मेमोरी से फिट हो सकता है, मात्रा/अवधि गलत हो सकती है, इसे सत्यापित नहीं किया जा सकता है।

शक्तिशाली संकेत:

केवल नीचे दिए गए रिटर्न पॉलिसी खंड के आधार पर उत्तर दें। यदि यह स्रोत में उपलब्ध नहीं है, तो कहें "मुझे निश्चित रूप से नहीं पता"। अवधि और शर्त को शब्दश: उद्धृत करें, [स्रोत: रिटर्न-03] के रूप में संदर्भ दें। [स्रोत: रिटर्न-03]: "अप्रयुक्त उत्पाद 14 दिनों के भीतर वापस किया जा सकता है। वैयक्तिकृत उत्पाद वापसी के दायरे में नहीं हैं।" प्रश्न: "क्या मैं 20 दिन पहले खरीदा गया वैयक्तिकृत उत्पाद वापस कर सकता हूँ?"

अंतर: स्रोत पर निर्भर, संदर्भ अनिवार्य, निर्माण प्रतिबंध स्पष्ट; मॉडल स्रोत से सही उत्तर ("14 दिन पहले और वैयक्तिकृत, गैर-वापसी योग्य") उत्पन्न करता है।

तीन मिनी मामले

केस 1 - मतिभ्रम को समाप्त करना। बिना-आरएजी सेटअप में एक टेलीकॉम बॉट की अभियान के सवालों के जवाब की सटीकता 71% थी; मॉडल ने कभी-कभी पुराने अभियान बनाए। जब वर्तमान अभियान पृष्ठ आरएजी से जुड़े थे और "यदि यह स्रोत में नहीं है तो इसे न कहें" नियम जोड़ा गया था, सटीकता 96% तक बढ़ गई और "गलत अभियान शब्दों" के बारे में शिकायतें लगभग समाप्त हो गईं।

केस 2 - विरोधाभास की कीमत। एक ई-कॉमर्स कंपनी के ज्ञानकोष में, दो पृष्ठों पर दो अलग-अलग शिपिंग लागतें लिखी गईं (एक वर्तमान, एक पुराना भूला हुआ पृष्ठ)। बॉट बेतरतीब ढंग से किसी को खींच रहा था और कुछ ग्राहकों को गलत कीमत बता रहा था। जब पुराने पृष्ठ को एकल सही स्रोत के सिद्धांत के साथ संग्रहीत किया गया, तो असंगतता गायब हो गई। पाठ: RAG विरोधाभास का समाधान नहीं करता, वह विरोधाभास को वैसे ही प्रचारित करता है जैसे वह है।

केस 3 - "मुझे नहीं पता" लॉग का मान। एक बैंक में, बॉट प्रति माह ~4,000 प्रश्नों पर "मुझे निश्चित रूप से नहीं पता" कह रहा था। जब इन प्रश्नों को समूहीकृत किया गया, तो देखा गया कि 40% "अंतर्राष्ट्रीय कार्ड उपयोग" के बारे में थे; इसके बारे में कोई लेख नहीं था. जब प्रासंगिक आइटम जोड़े गए, तो ये प्रश्न हल हो गए और उस विषय पर लोगों का टर्नओवर 55% कम हो गया। यह तथ्य कि बॉट ने कहा कि उसे नहीं पता, सुधार का रोडमैप बन गया।

सामान्य गलतियाँ

  • स्रोत से लिंक किए बिना उत्तर देना। आरएजी के बिना, मॉडल ठोस जानकारी में फिट बैठता है; कोई भी ठोस उत्तर स्रोत पर निर्भर होना चाहिए।
  • "मुझे नहीं पता" विकल्प को बंद करना। मॉडल को हर प्रश्न का उत्तर देने के लिए बाध्य करना फिटिंग सुनिश्चित करता है।
  • परस्पर विरोधी/पुरानी जानकारी साफ़ नहीं करना. RAG विरोधाभास फैलाता है; एक भी सही स्रोत आवश्यक है.
  • टुकड़े-टुकड़े करने की उपेक्षा करना। बड़ी पीडीएफ़ को वैसे ही निर्यात करने से सटीक पहुंच बाधित होती है; लघु, एकल-विषय लेखों का उपयोग करें।
  • स्रोत छुपाया जा रहा है. यह न बताने पर कि उत्तर किस आधार पर है, सत्यापन और विश्वास को कमजोर करता है।
सावधानी: RAG सटीकता में सुधार करता है लेकिन 100% गारंटी प्रदान नहीं करता है। मॉडल कभी-कभी कैप्चर किए गए हिस्से की गलत व्याख्या कर सकता है। इसलिए, वित्तीय, कानूनी और सुरक्षा मुद्दों के लिए मानवीय अनुमोदन की आवश्यकता होती है, भले ही स्रोत का हवाला दिया गया हो; आरएजी मतिभ्रम को कम करता है लेकिन जिम्मेदारी को दूर नहीं करता है।

सारांश

ज्ञान का आधार और आरएजी कॉल सेंटर एआई की सटीकता की नींव हैं। आरएजी मॉडल को मेमोरी से उत्तर फिट करने और केवल वर्तमान स्रोत पर निर्भर रहने से रोककर मतिभ्रम को काफी हद तक रोकता है। लेकिन आरएजी उतना ही अच्छा है जितना उसका ज्ञान आधार: एक ज्ञान आधार जो अद्यतन, स्पष्ट, संरचित, संघर्ष-मुक्त हो और जिसमें सत्य का एक ही स्रोत हो, आवश्यक है। मॉडल को बताएं "यदि यह स्रोत में नहीं है, तो मुझे बताएं कि आप नहीं जानते", स्रोत को इंगित करें, और अपने ज्ञान के आधार को बेहतर बनाने के लिए उन प्रश्नों का उपयोग करें जिनका उत्तर बॉट नहीं दे सकता है। उच्च जोखिम वाले मामलों पर स्रोत के बावजूद मानवीय सहमति बनाए रखें।

आवेदन कार्य

अपने उद्योग से 8 वास्तविक/यथार्थवादी ग्राहक प्रश्न और 8 संबंधित लघु ज्ञान आधारित लेख लिखें (प्रत्येक लेख: प्रश्न, संक्षिप्त उत्तर, शर्तें, तिथि, टैग)। फिर परीक्षण करें कि क्या मॉडल "1) टाइट आरएजी उत्तर संकेत" पैटर्न का उपयोग करके और एक प्रश्न पूछकर "मुझे नहीं पता" कह सकता है, जिनमें से एक ज्ञान आधार में नहीं है। अंत में, "3) विरोधाभास और गैप स्कैनिंग" के साथ अपने लेखों की जाँच करें।

चेकलिस्ट

  • [ ] बॉट/सहायक द्वारा दिया गया प्रत्येक ठोस उत्तर वर्तमान ज्ञान आधार (आरएजी के माध्यम से) पर निर्भर करता है।
  • [ ] मैंने मॉडल को निर्देश दिया "यदि यह स्रोत में नहीं है, तो मुझे बताएं कि आप नहीं जानते" और इसका परीक्षण किया।
  • [ ] मेरे ज्ञानकोष में अद्यतन, स्पष्ट, एकल-विषय लेख शामिल हैं।
  • [ ] मैंने परस्पर विरोधी और पुराने लेखों को हटा दिया; सभी जानकारी के लिए केवल एक ही सही स्रोत है।
  • [ ] उत्तर दिखाते हैं कि यह किस लेख (स्रोत) पर आधारित है।
  • [ ] मैं "मुझे नहीं पता" प्रश्न एकत्र करता हूं और ज्ञान का आधार प्रदान करता हूं।