लाभ:
- स्कीमा और नियम-आधारित आउटपुट सत्यापन परतें स्थापित करने की क्षमता
- उच्च प्रभाव वाले निर्णयों में सार्थक रूप से मानव-इन-द-लूप की आवश्यकता की क्षमता
- दूसरे मॉडल के साथ सत्यापन और ट्रस्ट थ्रेशोल्ड आधारित रूटिंग डिजाइन करने की क्षमता
एक भाषा मॉडल तरल, प्रेरक और अक्सर सटीक उत्पन्न करता है - लेकिन "प्रेरक" "सही" के समान नहीं है। मॉडल किसी राशि, दिनांक या JSON फ़ील्ड को चुपचाप फिट कर सकता है; इसे मतिभ्रम कहा जाता है (मॉडल आत्मविश्वास से ऐसी जानकारी उत्पन्न करता है जो वास्तविकता में मौजूद नहीं है)। एक एंटरप्राइज़ सिस्टम में, यदि वह आउटपुट अगले चरण में प्रवाहित होता है - एक भुगतान, एक ईमेल, एक डेटाबेस लिखना - तो त्रुटि वास्तविक दुनिया में फैल जाती है। इस इकाई में, हम सिस्टम में प्रवेश करने से पहले सत्यापन परतों के साथ आउटपुट को फ़िल्टर करना सीखेंगे और उच्च प्रभाव वाले निर्णयों में मानव-इन-लूप की आवश्यकता होगी।
आउटपुट सत्यापन की आवश्यकता क्यों है?
मॉडल आउटपुट को दो प्राथमिक तरीकों से दूषित किया जा सकता है: प्रारूप (अपेक्षित JSON स्कीमा के अनुरूप नहीं है, फ़ील्ड गुम/अतिरिक्त है) और सामग्री (प्रारूप सही है लेकिन मान गलत है - एक गैर-मौजूद उत्पाद कोड, एक अतार्किक तारीख)। सुरक्षा की दृष्टि से एक तीसरा आयाम है: दुर्भावनापूर्ण आउटपुट (इंजेक्शन या रिसाव के परिणामस्वरूप उत्पन्न एक दुर्भावनापूर्ण कमांड)। एक ठोस व्यवस्था तीनों को दरवाजे पर रोक देती है।
सावधानी: "मॉडल आम तौर पर सटीक" कोई उत्पादन मानदंड नहीं है। सत्यापन के बिना एक प्रणाली में, एक हजार में से एक त्रुटि का मतलब प्रति दिन 100,000 अनुरोधों में प्रति दिन 100 गलत लेनदेन है।
प्रमाणीकरण की परतें: चरण दर चरण
- स्कीमा सत्यापन. मशीन से जाँच करें कि आउटपुट अपेक्षित संरचना के अनुरूप है: क्या फ़ील्ड मौजूद हैं, क्या उनके प्रकार सही हैं, क्या आवश्यक फ़ील्ड भरे हुए हैं?
- नियम/व्यावसायिक तर्क सत्यापन। क्या मूल्य व्यावसायिक नियमों से मेल खाते हैं? (राशि > 0, तारीख भविष्य में नहीं है, उत्पाद कोड कैटलॉग से संबंधित है।)
- संदर्भ/स्रोत नियंत्रण. यदि मॉडल कोई दावा प्रस्तुत करता है, तो क्या इसे स्रोत से जोड़ा जा सकता है? (क्या RAG उद्धरण वास्तव में दस्तावेज़ में है?)
- दूसरे मॉडल (एलएलएम-ए-जज) के साथ सत्यापन। एक स्वतंत्र मॉडल आउटपुट का मूल्यांकन "सही/अपूर्ण/जोखिम भरा" के रूप में करता है।
- विश्वास सीमा और अभिविन्यास. यदि मॉडल या सत्यापनकर्ता कम आत्मविश्वास की रिपोर्ट करता है, तो आउटपुट स्वचालित रूप से पास नहीं होता है; मनुष्यों के लिए निर्देशित है।
- मानव नियंत्रण. उच्च-क्षमता या कम-सुरक्षित परिणाम किसी विशेषज्ञ की मंजूरी पर निर्भर करता है।
चार प्रतिलिपि योग्य टेम्पलेट
योजना + "यदि आप नहीं जानते तो इसे बनाएं" एक साथ:
केवल निम्नलिखित JSON स्कीमा में प्रतिक्रिया लौटाएँ: "कम" लिखें। कभी भी कोई अनुमान ऐसे न लिखें जैसे कि वह सटीक हो।
दूसरे मॉडल के साथ सत्यापन (जज प्रॉम्प्ट):
आप एक स्वतंत्र सत्यापनकर्ता हैं. नीचे एक <स्रोत> पाठ और एक <दावा> है। यह देखने के लिए जांचें कि क्या दावे में प्रत्येक संख्या और तारीख स्रोत में शब्दशः मौजूद है। प्रत्येक के लिए, कहें: "सत्यापित | स्रोत में नहीं | स्रोत का खंडन करता है।" यदि उनमें से एक भी 'अनुपस्थित/विरोधाभासी' है, तो परिणाम को "मानव समीक्षा आवश्यक" के रूप में चिह्नित करें।
ट्रस्ट थ्रेशोल्ड रूटिंग नियम:
रूटिंग नियम:- एमिन_मिसिन = "उच्च" और राशि <10,000 टीएल -> स्वचालित प्रसंस्करण- एमिन_मिसिन = "मध्यम" या राशि 10,000-100,000 टीएल -> दूसरा मॉडल सत्यापन- एमिन_मिसिन = "कम" या राशि > 100,000 टीएल -> मानव अनुमोदन आवश्यक है
मानव ऑडिट सारांश कार्ड (समीक्षा को गति देता है):
किसी व्यक्ति के समक्ष निर्णय प्रस्तुत करते समय यह कार्ड प्रस्तुत करें:- क्या प्रस्तावित किया जा रहा है? (एक वाक्य)- यह किस स्रोत पर आधारित है? (लेख/दस्तावेज़ संदर्भ) - दो सबसे कमज़ोर धारणाएँ क्या हैं? - यदि अनुमोदित हो, तो क्या उन्हें उलटा किया जा सकता है? (हाँ/नहीं)
कमजोर संकेत/मजबूत संकेत
ख़राब दृष्टिकोण
मजबूत दृष्टिकोण
"चालान से राशि घटाएं" (मुक्त पाठ)
सख्त JSON स्कीमा + शून्य + ट्रस्ट फ़ील्ड
आउटपुट को सीधे भुगतान प्रणाली पर लिखना
स्कीमा → नियम → मानव अनुमोदन (यदि आवश्यक हो)
बस मॉडल को बता रहा हूं "सुनिश्चित करें"
दूसरे मॉडल के साथ संख्या/तिथि सत्यापन
प्रत्येक आउटपुट को समान आत्मविश्वास के साथ संसाधित करना
प्रभाव और विश्वास पर आधारित रूटिंग
मजबूत दृष्टिकोण यह आशा नहीं करता कि मॉडल सही है; यह एक ऐसा दरवाजा बनाता है जो गलत होने पर आपको पकड़ लेगा।
तीन मिनी मामले
केस 1 - अकेले योजना पर्याप्त नहीं थी। एक लेखांकन स्वचालन चालान से JSON के रूप में राशि निकाल रहा था। योजना सही थी, लेकिन मॉडल ने इनवॉइस (दशमलव बदलाव) पर "1,250.00" के बजाय "125,000" का उत्पादन किया। योजना इसे पकड़ने में विफल रही; नियम सत्यापन ("राशि ±1% तक चालान आइटम की कुल राशि के अनुरूप होनी चाहिए") पकड़ा गया और 112,500 टीएल की गलत रिकॉर्डिंग को रोका गया।
केस 2 - दूसरे मॉडल ने मतिभ्रम को पकड़ लिया। एक कानूनी सहायता सहायक ने अनुबंध सारांश में कहा, "समाप्ति का 30 दिन का नोटिस"; हालाँकि, अनुबंध में यह 90 दिन का था। जब स्वतंत्र न्यायाधीश ने मॉडल को "स्रोत के साथ विरोधाभासी" के रूप में चिह्नित किया, तो आउटपुट को मानव के पास भेज दिया गया और सही किया गया। यदि यह स्वचालित होता, तो ग्राहक गलत तारीख के आधार पर रद्दीकरण की सूचना देता।
केस 3 - रूटिंग से लोड 70% कम हो गया। एक बीमा दावा प्रणाली स्वचालित रूप से कम-राशि और उच्च-सुरक्षा दावों को मंजूरी देती है और केवल उपरोक्त सीमा/कम-सुरक्षित दावों को विशेषज्ञ के पास भेजती है। 3,200 दैनिक माँगों में से केवल 950 ही मनुष्यों की माँगें पूरी हुईं; विशेषज्ञों ने अपना समय वास्तव में जोखिम भरे 30% के लिए समर्पित किया, औसत लेनदेन का समय 4 घंटे से घटकर 40 मिनट हो गया।
युक्ति: मानव नियंत्रण स्थापित न करें ताकि "लोग सब कुछ देख सकें" - इससे लोग थक जाएंगे और अनुमोदन रबर स्टांप बन जाएगा। इसके बजाय, केवल उच्च-प्रभाव और कम-आत्मविश्वास वाले आउटपुट को ही मानव तक पहुँचाएँ; यह उस पर ध्यान केंद्रित करता है जो वास्तव में मायने रखता है।
मानव नियंत्रण को सार्थक बनाना
ह्यूमन-इन-द-लूप कागज पर चेकबॉक्स लगाने के बारे में नहीं है। समीक्षक के पास (1) निर्णय को समझने के लिए संदर्भ, (2) स्रोत तक पहुंच, और (3) "नहीं" कहने का अधिकार होना चाहिए। अन्यथा, नियंत्रण दिखावटी बना रहता है। समीक्षा कार्ड (उपरोक्त चौथा टेम्प्लेट) केवल वह संदर्भ प्रदान करने के लिए है।
सामान्य गलतियाँ
- बस स्कीमा सत्यापन कर रहा हूं और सामग्री/मूल्य त्रुटियों को छोड़ रहा हूं।
- यह सोचकर कि मॉडल को "सुनिश्चित करें" बताकर आप वास्तविक सत्यापन कर रहे हैं।
- उच्च प्रभाव वाले, अपरिवर्तनीय निर्णयों को स्वचालित रूप से लागू करें।
- प्रत्येक आउटपुट पर मानवीय नियंत्रण रखना और अनुमोदन को अर्थहीन रबर स्टांप में बदलना।
- स्रोत और संदर्भ बताए बिना समीक्षक को "अनुमोदन" कहना।
- ट्रस्ट थ्रेशोल्ड और रूटिंग स्थापित किए बिना सभी आउटपुट को समान जोखिम के साथ संसाधित करना।
संक्षेप में
- आउटपुट तीन तरह से दूषित होता है: रूप, सामग्री और दुर्भावनापूर्ण इरादा; एक ठोस व्यवस्था तीनों को दरवाजे पर रोक देती है।
- परतें: स्कीमा सत्यापन, नियम/व्यावसायिक तर्क, स्रोत नियंत्रण, दूसरा मॉडल (एलएलएम-ए-जज), और ट्रस्ट थ्रेशोल्ड रूटिंग।
- उच्च-प्रभाव और कम-सुरक्षा आउटपुट के लिए ह्यूमन-इन-द-लूप अनिवार्य होना चाहिए।
- मानव समीक्षा सार्थक होनी चाहिए: समीक्षक के पास संदर्भ, संसाधन पहुंच और "नहीं" कहने का अधिकार होना चाहिए।
- सुरक्षा और दक्षता दोनों केवल जोखिम भरे लोगों को मनुष्यों तक निर्देशित करने से प्राप्त होती हैं, प्रत्येक आउटपुट पर नहीं।
आवेदन कार्य
अपने स्वयं के AI आउटपुट से एक उदाहरण लें। सबसे पहले एक JSON स्कीमा को परिभाषित करें और आउटपुट को उस पर बाध्य करें। फिर कम से कम दो व्यावसायिक नियम लिखें (उदाहरण के लिए, "राशि वस्तुओं के कुल से मेल खाती है")। अंत में, एक रूटिंग टेबल सेट करें: कौन सा विश्वास/प्रभाव संयोजन स्वचालित रूप से चला जाता है, जो दूसरे मॉडल पर जाता है, जो मानव के पास जाता है? एक दोषपूर्ण नमूना तैयार करें और देखें कि प्रत्येक परत इसे कहाँ पकड़ती है।
चेकलिस्ट
- [ ] मैं आउटपुट के लिए एक सख्त स्कीमा परिभाषित करता हूं और इसे मशीन से सत्यापित करता हूं।
- [ ] मैंने कम से कम एक व्यवसाय/नियम सत्यापन (मूल्य तर्क) जोड़ा है।
- [ ] मैं दावों को स्रोत से जोड़ सकता हूं और उनकी जांच कर सकता हूं।
- [ ] उच्च प्रभाव/कम सुरक्षा परिणामों के लिए दूसरा मॉडल या मानव सत्यापन उपलब्ध है।
- [ ] रूटिंग नियम विश्वास और प्रभाव के आधार पर परिभाषित किया गया है।
- [ ] समीक्षक को संदर्भ, स्रोत और अस्वीकार करने का अधिकार प्रदान किया जाता है।