નફો:
- સ્કીમા અને નિયમ-આધારિત આઉટપુટ માન્યતા સ્તરો સ્થાપિત કરવાની ક્ષમતા
- ઉચ્ચ અસરવાળા નિર્ણયોમાં અર્થપૂર્ણ રીતે માનવ-ઇન-ધ-લૂપની આવશ્યકતાની ક્ષમતા
- બીજા મોડેલ સાથે ચકાસણી અને ટ્રસ્ટ થ્રેશોલ્ડ આધારિત રૂટીંગ ડિઝાઇન કરવાની ક્ષમતા
ભાષાનું મોડેલ પ્રવાહી, સમજાવવા જેવું અને ઘણી વખત સચોટ ઉત્પાદન કરે છે-પરંતુ "પ્રેરણાદાયક" "સાચા" જેવું નથી. મોડલ ચુપચાપ રકમ, તારીખ અથવા JSON ફીલ્ડમાં ફિટ થઈ શકે છે; આને આભાસ કહેવામાં આવે છે (મોડેલ આત્મવિશ્વાસપૂર્વક માહિતી ઉત્પન્ન કરે છે જે વાસ્તવિકતામાં અસ્તિત્વમાં નથી). એન્ટરપ્રાઇઝ સિસ્ટમમાં, જો તે આઉટપુટ આગલા પગલા પર વહે છે - ચુકવણી, ઇમેઇલ, ડેટાબેઝ લખો - ભૂલ વાસ્તવિક દુનિયામાં ફેલાય છે. આ એકમમાં, અમે સિસ્ટમમાં પ્રવેશતા પહેલા આઉટપુટને વેરિફિકેશન લેયર સાથે ફિલ્ટર કરવાનું શીખીશું અને ઉચ્ચ અસરવાળા નિર્ણયોમાં માનવ-ઇન-ધ-લૂપની જરૂર પડશે.
આઉટપુટ માન્યતા શા માટે જરૂરી છે?
મોડલ આઉટપુટ બે પ્રાથમિક રીતે બગડી શકે છે: ફોર્મેટ (અપેક્ષિત JSON સ્કીમાને અનુરૂપ નથી, ફીલ્ડ ખૂટે છે/વધારે છે) અને સામગ્રી (ફોર્મેટ સાચું છે પરંતુ મૂલ્ય ખોટું છે — એક અવિદ્યમાન ઉત્પાદન કોડ, એક અતાર્કિક તારીખ). સુરક્ષાના સંદર્ભમાં ત્રીજું પરિમાણ છે: દૂષિત આઉટપુટ (ઇન્જેક્શન અથવા લીકના પરિણામે ઉત્પન્ન થયેલ દૂષિત આદેશ). નક્કર સિસ્ટમ ત્રણેયને દરવાજા પર રોકે છે.
સાવધાન: "મોડલ સામાન્ય રીતે સચોટ" ઉત્પાદન માપદંડ નથી. ચકાસણી વિનાની સિસ્ટમમાં, એક હજારમાં એક ભૂલનો અર્થ પ્રતિદિન 100,000 વિનંતીઓમાં દરરોજ 100 ભૂલભરેલા વ્યવહારો થાય છે.
પ્રમાણીકરણના સ્તરો: સ્ટેપ બાય સ્ટેપ
- સ્કીમા માન્યતા. મશીન વડે તપાસો કે આઉટપુટ અપેક્ષિત માળખાને અનુરૂપ છે: શું ફીલ્ડ્સ હાજર છે, શું તેમના પ્રકારો સાચા છે, શું જરૂરી ફીલ્ડ્સ ભરેલા છે?
- નિયમ/વ્યાપાર તર્ક માન્યતા. શું મૂલ્યો વ્યવસાયના નિયમો સાથે મેળ ખાય છે? (રકમ > 0, તારીખ ભવિષ્યની નથી, ઉત્પાદન કોડ કેટલોગનો છે.)
- સંદર્ભ/સ્રોત નિયંત્રણ. જો મોડેલ કોઈ નિવેદન ઉત્પન્ન કરે છે, તો શું તે સ્ત્રોત સાથે લિંક કરી શકાય છે? (શું RAG ક્વોટ ખરેખર દસ્તાવેજમાં છે?)
- બીજા મોડેલ (એલએલએમ-જજ-જજ) સાથે માન્યતા. સ્વતંત્ર મોડેલ આઉટપુટનું મૂલ્યાંકન "સાચા/અપૂર્ણ/જોખમી" તરીકે કરે છે.
- ટ્રસ્ટ થ્રેશોલ્ડ અને ઓરિએન્ટેશન. જો મોડેલ અથવા વેલિડેટર ઓછા આત્મવિશ્વાસની જાણ કરે છે, તો આઉટપુટ આપમેળે પસાર થતું નથી; મનુષ્યોને નિર્દેશિત કરવામાં આવે છે.
- માનવ નિયંત્રણ. ઉચ્ચ-શક્તિ અથવા ઓછી-સલામત પરિણામ નિષ્ણાતની મંજૂરી પર આધારિત છે.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
સ્કીમ + "જો તમને ખબર ન હોય તો તેને બનાવો" એકસાથે:
ફક્ત નીચેની JSON સ્કીમામાં જ પ્રતિભાવ પરત કરો: "લો" લખો. ક્યારેય અંદાજ લખશો નહીં જાણે તે ચોક્કસ હોય.
બીજા મોડેલ સાથે ચકાસણી (જજ પ્રોમ્પ્ટ):
તમે સ્વતંત્ર માન્યકર્તા છો. નીચે એક <સ્રોત> ટેક્સ્ટ અને <દાવો> છે. દાવાની દરેક સંખ્યા અને તારીખ સ્ત્રોતમાં શબ્દશઃ થાય છે કે કેમ તે જોવા માટે તપાસો. દરેક માટે, કહો: "ચકાસાયેલ | સ્ત્રોતમાં નથી | સ્ત્રોતનો વિરોધાભાસ કરે છે." જો તેમાંથી એક પણ 'ગેરહાજર/વિરોધાભાસી' હોય, તો પરિણામને "માનવ સમીક્ષા જરૂરી" તરીકે ચિહ્નિત કરો.<source>{{ text }}</source><claim>{{ model_output }}</claim>
ટ્રસ્ટ થ્રેશોલ્ડ રૂટીંગ નિયમ:
રૂટીંગ નિયમ:- emin_misin = "ઉચ્ચ" અને રકમ < 10,000 TL -> સ્વચાલિત પ્રક્રિયા- emin_misin = "મધ્યમ" અથવા રકમ 10,000-100,000 TL -> બીજા મોડલની ચકાસણી- emin_misin = "નીચી" અથવા રકમ > 100,000 TL જરૂરી - માનવ એપ્લિકેશન
માનવ ઓડિટ સારાંશ કાર્ડ (સમીક્ષાને વેગ આપે છે):
કોઈ વ્યક્તિ સમક્ષ નિર્ણય રજૂ કરતી વખતે, આ કાર્ડ બનાવો:- શું પ્રસ્તાવિત કરવામાં આવી રહ્યું છે? (એક વાક્ય)- તે કયા સ્ત્રોત પર આધારિત છે? (લેખ/દસ્તાવેજ સંદર્ભ)- 2 સૌથી નબળી ધારણાઓ શું છે?- જો મંજૂર કરવામાં આવે, તો શું તે ઉલટાવી શકાય? (હા/ના)
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળી અભિગમ
મજબૂત અભિગમ
"ઇનવોઇસમાંથી રકમ બાદ કરો" (મફત ટેક્સ્ટ)
સખત JSON સ્કીમા + નલ + ટ્રસ્ટ ફીલ્ડ
પેમેન્ટ સિસ્ટમ પર સીધું આઉટપુટ લખવું
સ્કીમા → નિયમ → માનવ મંજૂરી (જો જરૂરી હોય તો)
ફક્ત મોડેલને કહેવું "ખાતરી કરો"
બીજા મોડેલ સાથે નંબર/તારીખની માન્યતા
સમાન આત્મવિશ્વાસ સાથે દરેક આઉટપુટ પર પ્રક્રિયા કરવી
પ્રભાવ અને વિશ્વાસ પર આધારિત રૂટીંગ
મજબૂત અભિગમ આશા રાખતો નથી કે મોડેલ સાચું છે; તે એક દરવાજો બનાવે છે જે જ્યારે તમે ખોટા હોવ ત્યારે તમને પકડી લેશે.
ત્રણ મિની કેસ
કેસ 1 - એકલી યોજના પૂરતી ન હતી. એકાઉન્ટિંગ ઓટોમેશન JSON તરીકે ઇન્વૉઇસમાંથી રકમ કાઢી રહ્યું હતું. સ્કીમ સાચી હતી, પરંતુ મોડેલે ઇન્વોઇસ (દશાંશ શિફ્ટ) પર "1,250.00" ને બદલે "125,000" બનાવ્યું. યોજના આને પકડવામાં નિષ્ફળ ગઈ; નિયમની ચકાસણી ("રકમ ±1% દ્વારા કુલ ઇન્વૉઇસ આઇટમ્સ સાથે સુસંગત હોવી જોઈએ") પકડવામાં આવી હતી અને 112,500 TL નું ખોટું રેકોર્ડિંગ અટકાવવામાં આવ્યું હતું.
કેસ 2 - બીજા મોડેલે આભાસને પકડ્યો. "સમાપ્તિની 30 દિવસની સૂચના," કાનૂની સહાયક સહાયકે કરારના સારાંશમાં જણાવ્યું હતું; જોકે, કોન્ટ્રાક્ટમાં તે 90 દિવસનો હતો. જ્યારે સ્વતંત્ર ન્યાયાધીશે મોડેલને "સ્રોત સાથે વિરોધાભાસી" તરીકે ધ્વજાંકિત કર્યું, ત્યારે આઉટપુટ માનવને ફોરવર્ડ કરવામાં આવ્યું અને તેને સુધારવામાં આવ્યું. જો તે સ્વચાલિત હોત, તો ગ્રાહક ખોટી તારીખના આધારે રદ કરવાની સૂચના આપશે.
કેસ 3 - રૂટીંગથી લોડ 70% ઘટ્યો. વીમા દાવા પ્રણાલીએ ઓછી રકમ અને ઉચ્ચ સુરક્ષાના દાવાઓને આપમેળે મંજૂર કર્યા છે અને નિષ્ણાતને માત્ર ઉપરના થ્રેશોલ્ડ/ઓછી-સુરક્ષિત દાવાઓ મોકલ્યા છે. 3,200 દૈનિક માંગમાંથી, માત્ર 950 માણસોને પડી; નિષ્ણાતોએ તેમનો સમય ખરેખર જોખમી 30% માટે સમર્પિત કર્યો, જેમાં વ્યવહારનો સરેરાશ સમય 4 કલાકથી ઘટીને 40 મિનિટ થઈ ગયો.
ટિપ: માનવ નિયંત્રણ ગોઠવશો નહીં જેથી "લોકો બધું જોઈ શકે" — આનાથી લોકો થાકી જશે અને મંજૂરી રબર સ્ટેમ્પ બની જશે. તેના બદલે, માત્ર ઉચ્ચ-અસરકારક અને ઓછા-આત્મવિશ્વાસના આઉટપુટને માનવી સુધી પહોંચાડો; આ ખરેખર મહત્વની બાબતો પર ધ્યાન કેન્દ્રિત કરે છે.
માનવ નિયંત્રણને અર્થપૂર્ણ બનાવવું
હ્યુમન-ઇન-ધ-લૂપ કાગળ પર ચેકબોક્સ મૂકવા વિશે નથી. સમીક્ષક પાસે (1) નિર્ણયને સમજવા માટેનો સંદર્ભ, (2) સ્ત્રોતની ઍક્સેસ અને (3) "ના" કહેવાની સત્તા હોવી આવશ્યક છે. નહિંતર, નિયંત્રણ કોસ્મેટિક રહે છે. સમીક્ષા કાર્ડ (ઉપરનો ચોથો નમૂનો) માત્ર તે સંદર્ભ આપવા માટે છે.
સામાન્ય ભૂલો
- ફક્ત સ્કીમા માન્યતા કરી રહ્યા છીએ અને સામગ્રી/મૂલ્ય ભૂલોને અવગણી રહ્યા છીએ.
- એવું વિચારીને કે મોડેલને "ખાતરી કરો" કહીને તમે વાસ્તવિક ચકાસણી કરી રહ્યા છો.
- ઉચ્ચ-અસરકારક, ઉલટાવી શકાય તેવા નિર્ણયોને આપમેળે લાગુ કરો.
- દરેક આઉટપુટ પર માનવ નિયંત્રણ મૂકવું અને મંજૂરીને અર્થહીન રબર સ્ટેમ્પમાં ફેરવવું.
- સ્રોત અને સંદર્ભ આપ્યા વિના સમીક્ષકને "મંજૂર કરો" કહેવું.
- ટ્રસ્ટ થ્રેશોલ્ડ અને રૂટીંગ સ્થાપિત કર્યા વિના સમાન જોખમ સાથે તમામ આઉટપુટ પર પ્રક્રિયા કરવી.
સારાંશમાં
- આઉટપુટ ત્રણ રીતે બગડે છે: ફોર્મ, સામગ્રી અને દૂષિત ઉદ્દેશ્ય; નક્કર સિસ્ટમ ત્રણેયને દરવાજા પર રોકે છે.
- સ્તરો: સ્કીમા માન્યતા, નિયમ/વ્યાપાર તર્ક, સ્ત્રોત નિયંત્રણ, બીજું મોડેલ (એલએલએમ-જજ) અને ટ્રસ્ટ થ્રેશોલ્ડ રૂટીંગ.
- હ્યુમન-ઇન-ધ-લૂપ ઉચ્ચ-અસર અને ઓછી-સુરક્ષા આઉટપુટ માટે ફરજિયાત હોવું જોઈએ.
- માનવ સમીક્ષા અર્થપૂર્ણ હોવી જોઈએ: સમીક્ષક પાસે સંદર્ભ, સંસાધન ઍક્સેસ અને "ના" કહેવાની સત્તા હોવી જોઈએ.
- સલામતી અને કાર્યક્ષમતા બંને માત્ર જોખમી લોકોને જ મનુષ્યોને નિર્દેશિત કરીને પ્રાપ્ત થાય છે, દરેક આઉટપુટને નહીં.
એપ્લિકેશન કાર્ય
તમારા પોતાના AI આઉટપુટમાંથી એક ઉદાહરણ લો. પ્રથમ JSON સ્કીમા વ્યાખ્યાયિત કરો અને તેના પર આઉટપુટ દબાણ કરો. પછી ઓછામાં ઓછા બે વ્યવસાય નિયમો લખો (ઉદાહરણ તરીકે, "રકમ વસ્તુઓની કુલ મેળ ખાય છે"). છેલ્લે, એક રૂટીંગ ટેબલ સેટ કરો: કયો વિશ્વાસ/પ્રભાવ સંયોજન આપમેળે જાય છે, જે બીજા મોડેલ પર જાય છે, જે માનવને જાય છે? ખામીયુક્ત નમૂના જનરેટ કરો અને દરેક સ્તર તેને ક્યાં કેપ્ચર કરે છે તેનું અવલોકન કરો.
ચેકલિસ્ટ
- [ ] હું આઉટપુટ માટે કડક સ્કીમા વ્યાખ્યાયિત કરું છું અને તેને મશીન વડે ચકાસું છું.
- [ ] મેં ઓછામાં ઓછું એક વ્યવસાય/નિયમોની માન્યતા (મૂલ્ય તર્ક) ઉમેર્યું છે.
- [ ] હું નિવેદનોને સ્ત્રોત સાથે લિંક કરી શકું છું અને તેમને તપાસી શકું છું.
- [] ઉચ્ચ અસર/ઓછી સલામતી પરિણામો માટે બીજું મોડેલ અથવા માનવ માન્યતા ઉપલબ્ધ છે.
- [ ] વિશ્વાસ અને પ્રભાવના આધારે નિર્ધારિત રૂટીંગ નિયમ.
- [ ] સમીક્ષકને સંદર્ભ, સ્ત્રોત અને અસ્વીકાર કરવાનો અધિકાર આપવામાં આવે છે.