इकाई 3 / 11

आउटपुट सत्यापन और मानव निरीक्षण

लाभ:

  • स्कीमा और नियम-आधारित आउटपुट सत्यापन परतें स्थापित करने की क्षमता
  • उच्च प्रभाव वाले निर्णयों में सार्थक रूप से मानव-इन-द-लूप की आवश्यकता की क्षमता
  • दूसरे मॉडल के साथ सत्यापन और ट्रस्ट थ्रेशोल्ड आधारित रूटिंग डिजाइन करने की क्षमता

एक भाषा मॉडल तरल, प्रेरक और अक्सर सटीक उत्पन्न करता है - लेकिन "प्रेरक" "सही" के समान नहीं है। मॉडल किसी राशि, दिनांक या JSON फ़ील्ड को चुपचाप फिट कर सकता है; इसे मतिभ्रम कहा जाता है (मॉडल आत्मविश्वास से ऐसी जानकारी उत्पन्न करता है जो वास्तविकता में मौजूद नहीं है)। एक एंटरप्राइज़ सिस्टम में, यदि वह आउटपुट अगले चरण में प्रवाहित होता है - एक भुगतान, एक ईमेल, एक डेटाबेस लिखना - तो त्रुटि वास्तविक दुनिया में फैल जाती है। इस इकाई में, हम सिस्टम में प्रवेश करने से पहले सत्यापन परतों के साथ आउटपुट को फ़िल्टर करना सीखेंगे और उच्च प्रभाव वाले निर्णयों में मानव-इन-लूप की आवश्यकता होगी।

आउटपुट सत्यापन की आवश्यकता क्यों है?

मॉडल आउटपुट को दो प्राथमिक तरीकों से दूषित किया जा सकता है: प्रारूप (अपेक्षित JSON स्कीमा के अनुरूप नहीं है, फ़ील्ड गुम/अतिरिक्त है) और सामग्री (प्रारूप सही है लेकिन मान गलत है - एक गैर-मौजूद उत्पाद कोड, एक अतार्किक तारीख)। सुरक्षा की दृष्टि से एक तीसरा आयाम है: दुर्भावनापूर्ण आउटपुट (इंजेक्शन या रिसाव के परिणामस्वरूप उत्पन्न एक दुर्भावनापूर्ण कमांड)। एक ठोस व्यवस्था तीनों को दरवाजे पर रोक देती है।

सावधानी: "मॉडल आम तौर पर सटीक" कोई उत्पादन मानदंड नहीं है। सत्यापन के बिना एक प्रणाली में, एक हजार में से एक त्रुटि का मतलब प्रति दिन 100,000 अनुरोधों में प्रति दिन 100 गलत लेनदेन है।

प्रमाणीकरण की परतें: चरण दर चरण

  1. स्कीमा सत्यापन. मशीन से जाँच करें कि आउटपुट अपेक्षित संरचना के अनुरूप है: क्या फ़ील्ड मौजूद हैं, क्या उनके प्रकार सही हैं, क्या आवश्यक फ़ील्ड भरे हुए हैं?
  2. नियम/व्यावसायिक तर्क सत्यापन। क्या मूल्य व्यावसायिक नियमों से मेल खाते हैं? (राशि > 0, तारीख भविष्य में नहीं है, उत्पाद कोड कैटलॉग से संबंधित है।)
  3. संदर्भ/स्रोत नियंत्रण. यदि मॉडल कोई दावा प्रस्तुत करता है, तो क्या इसे स्रोत से जोड़ा जा सकता है? (क्या RAG उद्धरण वास्तव में दस्तावेज़ में है?)
  4. दूसरे मॉडल (एलएलएम-ए-जज) के साथ सत्यापन। एक स्वतंत्र मॉडल आउटपुट का मूल्यांकन "सही/अपूर्ण/जोखिम भरा" के रूप में करता है।
  5. विश्वास सीमा और अभिविन्यास. यदि मॉडल या सत्यापनकर्ता कम आत्मविश्वास की रिपोर्ट करता है, तो आउटपुट स्वचालित रूप से पास नहीं होता है; मनुष्यों के लिए निर्देशित है।
  6. मानव नियंत्रण. उच्च-क्षमता या कम-सुरक्षित परिणाम किसी विशेषज्ञ की मंजूरी पर निर्भर करता है।

चार प्रतिलिपि योग्य टेम्पलेट

योजना + "यदि आप नहीं जानते तो इसे बनाएं" एक साथ:

केवल निम्नलिखित JSON स्कीमा में प्रतिक्रिया लौटाएँ: "कम" लिखें। कभी भी कोई अनुमान ऐसे न लिखें जैसे कि वह सटीक हो।

दूसरे मॉडल के साथ सत्यापन (जज प्रॉम्प्ट):

आप एक स्वतंत्र सत्यापनकर्ता हैं. नीचे एक <स्रोत> पाठ और एक <दावा> है। यह देखने के लिए जांचें कि क्या दावे में प्रत्येक संख्या और तारीख स्रोत में शब्दशः मौजूद है। प्रत्येक के लिए, कहें: "सत्यापित | स्रोत में नहीं | स्रोत का खंडन करता है।" यदि उनमें से एक भी 'अनुपस्थित/विरोधाभासी' है, तो परिणाम को "मानव समीक्षा आवश्यक" के रूप में चिह्नित करें।

ट्रस्ट थ्रेशोल्ड रूटिंग नियम:

रूटिंग नियम:- एमिन_मिसिन = "उच्च" और राशि <10,000 टीएल -> स्वचालित प्रसंस्करण- एमिन_मिसिन = "मध्यम" या राशि 10,000-100,000 टीएल -> दूसरा मॉडल सत्यापन- एमिन_मिसिन = "कम" या राशि > 100,000 टीएल -> मानव अनुमोदन आवश्यक है

मानव ऑडिट सारांश कार्ड (समीक्षा को गति देता है):

किसी व्यक्ति के समक्ष निर्णय प्रस्तुत करते समय यह कार्ड प्रस्तुत करें:- क्या प्रस्तावित किया जा रहा है? (एक वाक्य)- यह किस स्रोत पर आधारित है? (लेख/दस्तावेज़ संदर्भ) - दो सबसे कमज़ोर धारणाएँ क्या हैं? - यदि अनुमोदित हो, तो क्या उन्हें उलटा किया जा सकता है? (हाँ/नहीं)

कमजोर संकेत/मजबूत संकेत

ख़राब दृष्टिकोण

मजबूत दृष्टिकोण

"चालान से राशि घटाएं" (मुक्त पाठ)

सख्त JSON स्कीमा + शून्य + ट्रस्ट फ़ील्ड

आउटपुट को सीधे भुगतान प्रणाली पर लिखना

स्कीमा → नियम → मानव अनुमोदन (यदि आवश्यक हो)

बस मॉडल को बता रहा हूं "सुनिश्चित करें"

दूसरे मॉडल के साथ संख्या/तिथि सत्यापन

प्रत्येक आउटपुट को समान आत्मविश्वास के साथ संसाधित करना

प्रभाव और विश्वास पर आधारित रूटिंग

मजबूत दृष्टिकोण यह आशा नहीं करता कि मॉडल सही है; यह एक ऐसा दरवाजा बनाता है जो गलत होने पर आपको पकड़ लेगा।

तीन मिनी मामले

केस 1 - अकेले योजना पर्याप्त नहीं थी। एक लेखांकन स्वचालन चालान से JSON के रूप में राशि निकाल रहा था। योजना सही थी, लेकिन मॉडल ने इनवॉइस (दशमलव बदलाव) पर "1,250.00" के बजाय "125,000" का उत्पादन किया। योजना इसे पकड़ने में विफल रही; नियम सत्यापन ("राशि ±1% तक चालान आइटम की कुल राशि के अनुरूप होनी चाहिए") पकड़ा गया और 112,500 टीएल की गलत रिकॉर्डिंग को रोका गया।

केस 2 - दूसरे मॉडल ने मतिभ्रम को पकड़ लिया। एक कानूनी सहायता सहायक ने अनुबंध सारांश में कहा, "समाप्ति का 30 दिन का नोटिस"; हालाँकि, अनुबंध में यह 90 दिन का था। जब स्वतंत्र न्यायाधीश ने मॉडल को "स्रोत के साथ विरोधाभासी" के रूप में चिह्नित किया, तो आउटपुट को मानव के पास भेज दिया गया और सही किया गया। यदि यह स्वचालित होता, तो ग्राहक गलत तारीख के आधार पर रद्दीकरण की सूचना देता।

केस 3 - रूटिंग से लोड 70% कम हो गया। एक बीमा दावा प्रणाली स्वचालित रूप से कम-राशि और उच्च-सुरक्षा दावों को मंजूरी देती है और केवल उपरोक्त सीमा/कम-सुरक्षित दावों को विशेषज्ञ के पास भेजती है। 3,200 दैनिक माँगों में से केवल 950 ही मनुष्यों की माँगें पूरी हुईं; विशेषज्ञों ने अपना समय वास्तव में जोखिम भरे 30% के लिए समर्पित किया, औसत लेनदेन का समय 4 घंटे से घटकर 40 मिनट हो गया।

युक्ति: मानव नियंत्रण स्थापित न करें ताकि "लोग सब कुछ देख सकें" - इससे लोग थक जाएंगे और अनुमोदन रबर स्टांप बन जाएगा। इसके बजाय, केवल उच्च-प्रभाव और कम-आत्मविश्वास वाले आउटपुट को ही मानव तक पहुँचाएँ; यह उस पर ध्यान केंद्रित करता है जो वास्तव में मायने रखता है।

मानव नियंत्रण को सार्थक बनाना

ह्यूमन-इन-द-लूप कागज पर चेकबॉक्स लगाने के बारे में नहीं है। समीक्षक के पास (1) निर्णय को समझने के लिए संदर्भ, (2) स्रोत तक पहुंच, और (3) "नहीं" कहने का अधिकार होना चाहिए। अन्यथा, नियंत्रण दिखावटी बना रहता है। समीक्षा कार्ड (उपरोक्त चौथा टेम्प्लेट) केवल वह संदर्भ प्रदान करने के लिए है।

सामान्य गलतियाँ

  • बस स्कीमा सत्यापन कर रहा हूं और सामग्री/मूल्य त्रुटियों को छोड़ रहा हूं।
  • यह सोचकर कि मॉडल को "सुनिश्चित करें" बताकर आप वास्तविक सत्यापन कर रहे हैं।
  • उच्च प्रभाव वाले, अपरिवर्तनीय निर्णयों को स्वचालित रूप से लागू करें।
  • प्रत्येक आउटपुट पर मानवीय नियंत्रण रखना और अनुमोदन को अर्थहीन रबर स्टांप में बदलना।
  • स्रोत और संदर्भ बताए बिना समीक्षक को "अनुमोदन" कहना।
  • ट्रस्ट थ्रेशोल्ड और रूटिंग स्थापित किए बिना सभी आउटपुट को समान जोखिम के साथ संसाधित करना।

संक्षेप में

  • आउटपुट तीन तरह से दूषित होता है: रूप, सामग्री और दुर्भावनापूर्ण इरादा; एक ठोस व्यवस्था तीनों को दरवाजे पर रोक देती है।
  • परतें: स्कीमा सत्यापन, नियम/व्यावसायिक तर्क, स्रोत नियंत्रण, दूसरा मॉडल (एलएलएम-ए-जज), और ट्रस्ट थ्रेशोल्ड रूटिंग।
  • उच्च-प्रभाव और कम-सुरक्षा आउटपुट के लिए ह्यूमन-इन-द-लूप अनिवार्य होना चाहिए।
  • मानव समीक्षा सार्थक होनी चाहिए: समीक्षक के पास संदर्भ, संसाधन पहुंच और "नहीं" कहने का अधिकार होना चाहिए।
  • सुरक्षा और दक्षता दोनों केवल जोखिम भरे लोगों को मनुष्यों तक निर्देशित करने से प्राप्त होती हैं, प्रत्येक आउटपुट पर नहीं।

आवेदन कार्य

अपने स्वयं के AI आउटपुट से एक उदाहरण लें। सबसे पहले एक JSON स्कीमा को परिभाषित करें और आउटपुट को उस पर बाध्य करें। फिर कम से कम दो व्यावसायिक नियम लिखें (उदाहरण के लिए, "राशि वस्तुओं के कुल से मेल खाती है")। अंत में, एक रूटिंग टेबल सेट करें: कौन सा विश्वास/प्रभाव संयोजन स्वचालित रूप से चला जाता है, जो दूसरे मॉडल पर जाता है, जो मानव के पास जाता है? एक दोषपूर्ण नमूना तैयार करें और देखें कि प्रत्येक परत इसे कहाँ पकड़ती है।

चेकलिस्ट

  • [ ] मैं आउटपुट के लिए एक सख्त स्कीमा परिभाषित करता हूं और इसे मशीन से सत्यापित करता हूं।
  • [ ] मैंने कम से कम एक व्यवसाय/नियम सत्यापन (मूल्य तर्क) जोड़ा है।
  • [ ] मैं दावों को स्रोत से जोड़ सकता हूं और उनकी जांच कर सकता हूं।
  • [ ] उच्च प्रभाव/कम सुरक्षा परिणामों के लिए दूसरा मॉडल या मानव सत्यापन उपलब्ध है।
  • [ ] रूटिंग नियम विश्वास और प्रभाव के आधार पर परिभाषित किया गया है।
  • [ ] समीक्षक को संदर्भ, स्रोत और अस्वीकार करने का अधिकार प्रदान किया जाता है।