युनिट 3 / 11

आउटपुट सत्यापन आणि मानवी तपासणी

नफा:

  • स्कीमा आणि नियम-आधारित आउटपुट प्रमाणीकरण स्तर स्थापित करण्याची क्षमता
  • उच्च-प्रभावपूर्ण निर्णयांमध्ये अर्थपूर्णपणे मानवी-इन-द-लूप आवश्यक असण्याची क्षमता
  • दुसऱ्या मॉडेलसह पडताळणी आणि ट्रस्ट थ्रेशोल्ड आधारित रूटिंग डिझाइन करण्याची क्षमता

भाषा मॉडेल द्रव, मन वळवणारे आणि बऱ्याचदा अचूक बनवते—परंतु "मन वळवणारे" हे "योग्य" सारखे नसते. मॉडेल शांतपणे रक्कम, तारीख किंवा JSON फील्डमध्ये बसू शकते; याला मतिभ्रम म्हणतात (मॉडेल आत्मविश्वासाने माहिती तयार करते जी प्रत्यक्षात अस्तित्वात नाही). एंटरप्राइझ सिस्टीममध्ये, जर ते आउटपुट पुढील पायरीवर वाहते - पेमेंट, ईमेल, डेटाबेस लेखन - त्रुटी वास्तविक जगात पसरते. या युनिटमध्ये, आम्ही सिस्टममध्ये प्रवेश करण्यापूर्वी आउटपुटला पडताळणी लेयर्ससह फिल्टर करण्यास शिकू आणि उच्च-परिणाम घेण्याच्या निर्णयांमध्ये मानवी-इन-द-लूप आवश्यक आहे.

आउटपुट प्रमाणीकरण आवश्यक का आहे?

मॉडेल आउटपुट दोन प्राथमिक मार्गांनी खराब केले जाऊ शकते: स्वरूप (अपेक्षित JSON स्कीमाशी सुसंगत नाही, फील्ड गहाळ/जास्त आहे) आणि सामग्री (स्वरूप योग्य आहे परंतु मूल्य चुकीचे आहे — अस्तित्वात नसलेला उत्पादन कोड, एक अतार्किक तारीख). सुरक्षिततेच्या दृष्टीने तिसरे परिमाण आहे: दुर्भावनायुक्त आउटपुट (इंजेक्शन किंवा गळतीमुळे निर्माण झालेली दुर्भावनायुक्त आज्ञा). एक ठोस यंत्रणा तिन्ही दारात थांबते.

खबरदारी: "मॉडेल साधारणपणे अचूक" हा उत्पादन निकष नाही. सत्यापनाशिवाय प्रणालीमध्ये, एक हजारात एक त्रुटी म्हणजे दररोज 100,000 विनंत्यांमध्ये दररोज 100 चुकीचे व्यवहार.

प्रमाणीकरणाचे स्तर: स्टेप बाय स्टेप

  1. स्कीमा प्रमाणीकरण. आउटपुट अपेक्षित संरचनेशी सुसंगत आहे की नाही हे मशीनद्वारे तपासा: फील्ड उपस्थित आहेत, त्यांचे प्रकार योग्य आहेत का, आवश्यक फील्ड भरली आहेत का?
  2. नियम/व्यवसाय तर्क प्रमाणीकरण. मूल्ये व्यवसायाच्या नियमांशी जुळतात का? (रक्कम > 0, तारीख भविष्यातील नाही, उत्पादन कोड कॅटलॉगशी संबंधित आहे.)
  3. संदर्भ/स्रोत नियंत्रण. मॉडेलने प्रतिपादन केले तर ते स्त्रोताशी जोडले जाऊ शकते का? (आरएजी कोट प्रत्यक्षात दस्तऐवजात आहे का?)
  4. दुसऱ्या मॉडेलसह प्रमाणीकरण (LLM-जज-जज). एक स्वतंत्र मॉडेल आउटपुटचे "योग्य/अपूर्ण/जोखमीचे" म्हणून मूल्यांकन करते.
  5. ट्रस्ट थ्रेशोल्ड आणि अभिमुखता. जर मॉडेल किंवा व्हॅलिडेटरने कमी आत्मविश्वासाचा अहवाल दिला, तर आउटपुट आपोआप पास होत नाही; मानवांना निर्देशित केले आहे.
  6. मानवी नियंत्रण. उच्च-शक्ती किंवा कमी-सुरक्षित परिणाम तज्ञांच्या मान्यतेवर अवलंबून असतात.

चार कॉपी करण्यायोग्य टेम्पलेट्स

योजना + "तुम्हाला माहित नसल्यास ते तयार करा" एकत्र:

फक्त खालील JSON स्कीमामध्ये प्रतिसाद परत करा: "लो" लिहा. अंदाज अचूक असल्यासारखे कधीही लिहू नका.

दुसऱ्या मॉडेलसह पडताळणी (न्यायाधीश प्रॉम्प्ट):

तुम्ही स्वतंत्र प्रमाणिकर आहात. खाली <स्रोत> मजकूर आणि <दावा> आहे. दाव्यातील प्रत्येक क्रमांक आणि तारीख स्त्रोतामध्ये शब्दशः येते का ते तपासा. प्रत्येकासाठी, म्हणा: "सत्यापित | स्त्रोतामध्ये नाही | स्रोताचा विरोधाभास." त्यापैकी एकही 'अनुपस्थित/विरोधात्मक' असल्यास, परिणाम "मानवी पुनरावलोकन आवश्यक" म्हणून चिन्हांकित करा.<source>{{ मजकूर }}</source><claim>{{ model_output }}</claim>

ट्रस्ट थ्रेशोल्ड राउटिंग नियम:

राउटिंग नियम:- emin_misin = "उच्च" आणि रक्कम < 10,000 TL -> स्वयंचलित प्रक्रिया- emin_misin = "मध्यम" किंवा रक्कम 10,000-100,000 TL -> द्वितीय मॉडेल पडताळणी- emin_misin = "कमी" किंवा रक्कम > 100,000 TL आवश्यक - मानवी अनुप्रयोग

मानवी ऑडिट सारांश कार्ड (पुनरावलोकनाला गती देते):

एखाद्या व्यक्तीला निर्णय सादर करताना, हे कार्ड तयार करा:- काय प्रस्तावित आहे? (एक वाक्य)- ते कोणत्या स्रोतावर आधारित आहे? (लेख/दस्तऐवज संदर्भ)- 2 सर्वात कमकुवत गृहीतके कोणती आहेत?- मंजूर केल्यास, ते उलट करता येतील का? (होय/नाही)

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

गरीब दृष्टीकोन

मजबूत दृष्टीकोन

"इनव्हॉइसमधून रक्कम वजा करा" (मोफत मजकूर)

कठोर JSON स्कीमा + शून्य + विश्वास फील्ड

आउटपुट थेट पेमेंट सिस्टमवर लिहित आहे

स्कीमा → नियम → मानवी मान्यता (आवश्यक असल्यास)

फक्त मॉडेलला सांगणे "खात्री करा"

दुसऱ्या मॉडेलसह क्रमांक/तारीख प्रमाणीकरण

प्रत्येक आउटपुटवर समान आत्मविश्वासाने प्रक्रिया करणे

प्रभाव आणि विश्वास यावर आधारित राउटिंग

मजबूत दृष्टिकोन मॉडेल योग्य आहे की आशा नाही; तो एक दरवाजा तयार करतो जो तुमची चूक असताना तुम्हाला पकडेल.

तीन मिनी केसेस

केस 1 - एकट्या योजना पुरेशी नव्हती. अकाउंटिंग ऑटोमेशन JSON म्हणून इनव्हॉइसमधून रक्कम काढत होते. योजना योग्य होती, परंतु मॉडेलने बीजक (दशांश शिफ्ट) वर "1,250.00" ऐवजी "125,000" तयार केले. हे पकडण्यात योजना अपयशी ठरली; नियम पडताळणी ("रक्कम इनव्हॉइस आयटमच्या एकूण ±1% च्या अनुरूप असणे आवश्यक आहे") पकडले गेले आणि 112,500 TL चे चुकीचे रेकॉर्डिंग रोखले गेले.

केस 2 - दुसऱ्या मॉडेलने भ्रम कॅप्चर केला. "समाप्तीची ३० दिवसांची नोटीस," कायदेशीर समर्थन सहाय्यकाने कराराच्या सारांशात सांगितले; मात्र, करारात तो ९० दिवसांचा होता. जेव्हा स्वतंत्र न्यायाधीशाने मॉडेलला "स्रोताशी विरोधाभास" म्हणून ध्वजांकित केले, तेव्हा आउटपुट मानवाकडे पाठवले गेले आणि दुरुस्त केले गेले. जर ते स्वयंचलित असेल तर, ग्राहक चुकीच्या तारखेवर आधारित रद्दीकरण सूचित करेल.

केस 3 - राउटिंगने लोड 70% कमी केले. इन्शुरन्स क्लेम सिस्टीमने कमी-रक्कम आणि उच्च-सुरक्षा दावे आपोआप मंजूर केले आणि तज्ञांना फक्त वरील-थ्रेशोल्ड/कमी-सुरक्षित दावे पाठवले. दैनंदिन 3,200 मागण्यांपैकी केवळ 950 मागण्या मानवाच्या हाती पडल्या; तज्ञांनी आपला वेळ खरोखरच धोकादायक 30% साठी दिला, सरासरी व्यवहार वेळ 4 तासांवरून 40 मिनिटांवर घसरला.

टीप: मानवी नियंत्रण सेट करू नका जेणेकरून "लोक सर्व काही पाहू शकतील" — यामुळे लोक थकतील आणि मान्यता रबर स्टॅम्प बनेल. त्याऐवजी, केवळ उच्च-परिणाम आणि कमी-आत्मविश्वासाचे आउटपुट मानवापर्यंत पोहोचवा; हे खरोखर महत्त्वाच्या गोष्टींवर लक्ष केंद्रित करते.

मानवी नियंत्रणास अर्थपूर्ण बनवणे

ह्युमन-इन-द-लूप म्हणजे कागदावर चेकबॉक्स टाकणे नाही. समीक्षकाकडे (1) निर्णय समजून घेण्यासाठी संदर्भ, (2) स्त्रोताचा प्रवेश आणि (3) "नाही" म्हणण्याचा अधिकार असणे आवश्यक आहे. अन्यथा, नियंत्रण कॉस्मेटिक राहते. पुनरावलोकन कार्ड (वरील चौथा टेम्पलेट) फक्त तोच संदर्भ देण्यासाठी आहे.

सामान्य चुका

  • फक्त स्कीमा प्रमाणीकरण करणे आणि सामग्री/मूल्य त्रुटी वगळणे.
  • असा विचार करून मॉडेलला "खात्री करा" सांगून तुम्ही खरे पडताळणी करत आहात.
  • उच्च-प्रभाव, अपरिवर्तनीय निर्णय आपोआप लागू करा.
  • प्रत्येक आउटपुटवर मानवी नियंत्रण ठेवणे आणि मंजुरीला निरर्थक रबर स्टॅम्पमध्ये बदलणे.
  • स्त्रोत आणि संदर्भ न देता समीक्षकाला "मंजूर करा" असे म्हणणे.
  • ट्रस्ट थ्रेशोल्ड आणि रूटिंग स्थापित न करता समान जोखमीसह सर्व आउटपुटवर प्रक्रिया करणे.

सारांशात

  • आउटपुट तीन प्रकारे दूषित आहे: फॉर्म, सामग्री आणि दुर्भावनापूर्ण हेतू; एक ठोस यंत्रणा तीनही दारात थांबते.
  • स्तर: स्कीमा प्रमाणीकरण, नियम/व्यवसाय तर्कशास्त्र, स्त्रोत नियंत्रण, द्वितीय मॉडेल (एलएलएम-जज-जज), आणि ट्रस्ट थ्रेशोल्ड राउटिंग.
  • उच्च-प्रभाव आणि कमी-सुरक्षित आउटपुटसाठी मानवी-इन-द-लूप अनिवार्य असावे.
  • मानवी पुनरावलोकन अर्थपूर्ण असणे आवश्यक आहे: पुनरावलोकनकर्त्याकडे संदर्भ, संसाधन प्रवेश आणि "नाही" म्हणण्याचा अधिकार असणे आवश्यक आहे.
  • सुरक्षितता आणि कार्यक्षमता या दोन्ही गोष्टी केवळ जोखमीच्या लोकांना निर्देशित केल्याने प्राप्त होतात, प्रत्येक आउटपुटला नाही.

अर्ज कार्य

तुमच्या स्वतःच्या AI आउटपुटचे उदाहरण घ्या. प्रथम JSON स्कीमा परिभाषित करा आणि त्यावर आउटपुट सक्ती करा. नंतर किमान दोन व्यवसाय नियम लिहा (उदाहरणार्थ, “रक्कम एकूण आयटमशी जुळते”). शेवटी, एक राउटिंग टेबल सेट करा: कोणता विश्वास/प्रभाव संयोजन आपोआप जाते, कोणते दुसऱ्या मॉडेलवर जाते, जे मानवाकडे जाते? सदोष नमुना व्युत्पन्न करा आणि प्रत्येक स्तर तो कोठे पकडतो ते पहा.

चेकलिस्ट

  • [ ] मी आउटपुटसाठी कठोर स्कीमा परिभाषित करतो आणि मशीनसह सत्यापित करतो.
  • मी किमान एक व्यवसाय/नियम प्रमाणीकरण (मूल्य तर्क) जोडले आहे.
  • [ ] मी विधाने स्त्रोताशी जोडू शकतो आणि ते तपासू शकतो.
  • उच्च प्रभाव/कमी सुरक्षा परिणामांसाठी दुसरे मॉडेल किंवा मानवी प्रमाणीकरण उपलब्ध आहे.
  • [ ] विश्वास आणि प्रभावावर आधारित राउटिंग नियम परिभाषित केला आहे.
  • [ ] पुनरावलोकनकर्त्याला संदर्भ, स्त्रोत आणि नाकारण्याचे अधिकार प्रदान केले जातात.