ඒකකය 3 / 11

ප්රතිදාන සත්යාපනය සහ මානව පරීක්ෂාව

ලාභ:

  • යෝජනා ක්‍රමය සහ රීති මත පදනම් වූ ප්‍රතිදාන වලංගුකරණ ස්ථර පිහිටුවීමේ හැකියාව
  • අධි-බලපෑම් තීරණ වලදී අර්ථවත් ලෙස මනුෂ්‍ය-පුඩුව අවශ්‍ය කිරීමේ හැකියාව
  • දෙවන මාදිලිය සමඟින් සත්‍යාපනය සහ විශ්වාස සීමාව පදනම් කරගත් මාර්ගගත කිරීම් සැලසුම් කිරීමේ හැකියාව

භාෂා ආකෘතියක් තරල, ඒත්තු ගැන්වීම සහ බොහෝ විට නිවැරදි නිෂ්පාදනය කරයි - නමුත් "ඒත්තු ගැන්වීම" යනු "නිවැරදි" ට සමාන නොවේ. ආකෘතියට නිශ්ශබ්දව මුදලක්, දිනයක් හෝ JSON ක්ෂේත්‍රයකට ගැලපේ; මෙය මායාව ලෙස හැඳින්වේ (ආකෘතිය යථාර්ථයේ නොපවතින තොරතුරු විශ්වාසයෙන් නිපදවයි). ව්‍යවසාය පද්ධතියක, එම ප්‍රතිදානය ඊළඟ පියවරට ගලා ගියහොත් - ගෙවීමක්, විද්‍යුත් තැපෑලක්, දත්ත සමුදායක් ලිවීම - දෝෂය සැබෑ ලෝකයට විහිදේ. මෙම ඒකකය තුළ, අපි පද්ධතියට ඇතුළු වීමට පෙර ප්‍රතිදානය සත්‍යාපන ස්ථර සමඟ පෙරීමට ඉගෙන ගනිමු සහ ඉහළ බලපෑමක් ඇති තීරණ වලදී මනුෂ්‍ය-පුඩුව අවශ්‍ය වේ.

ප්‍රතිදාන වලංගුකරණය අවශ්‍ය වන්නේ ඇයි?

ආදර්ශ ප්‍රතිදානය ප්‍රාථමික ආකාර දෙකකින් දූෂිත විය හැක: ආකෘතිය (අපේක්‍ෂිත JSON ක්‍රමයට අනුකූල නොවේ, ක්ෂේත්‍රය අස්ථානගත වී ඇත/අතිරික්තය) සහ අන්තර්ගතය (ආකෘතිය නිවැරදි නමුත් අගය වැරදියි - නොපවතින නිෂ්පාදන කේතයක්, තාර්කික නොවන දිනයක්). ආරක්ෂාව සම්බන්ධයෙන් තුන්වන මානයක් ඇත: අනිෂ්ට ප්රතිදානය (එන්නත් කිරීම හෝ කාන්දු වීම හේතුවෙන් ඇතිවන අනිෂ්ට විධානය). ඝන පද්ධතියක් දොරකඩ තුනම නතර කරයි.

අවවාදයයි: "ආදර්ශය සාමාන්‍යයෙන් නිවැරදි" නිෂ්පාදන නිර්ණායකයක් නොවේ. සත්‍යාපනයක් නොමැති පද්ධතියක, දහසකින් එක් දෝෂයක් වුවද දිනකට ඉල්ලීම් 100,000 කින් දිනකට වැරදි ගනුදෙනු 100 ක් සිදු වේ.

සහතික කිරීමේ ස්ථර: පියවරෙන් පියවර

  1. යෝජනා ක්රමය වලංගු කිරීම. ප්‍රතිදානය අපේක්ෂිත ව්‍යුහයට අනුරූප වන යන්ත්‍රය සමඟ පරීක්ෂා කරන්න: ක්ෂේත්‍ර තිබේද, ඒවායේ වර්ග නිවැරදිද, අවශ්‍ය ක්ෂේත්‍ර පුරවා තිබේද?
  2. රීතිය/ව්‍යාපාර තර්කනය වලංගු කිරීම. අගයන් ව්‍යාපාරික නීති වලට ගැලපෙනවාද? (මුදල් > 0, දිනය අනාගතයේ නොවේ, නිෂ්පාදන කේතය නාමාවලියට අයත් වේ.)
  3. යොමු/මූලාශ්‍ර පාලනය. ආකෘතිය ප්‍රකාශයක් ඉදිරිපත් කරන්නේ නම්, එය මූලාශ්‍රයට සම්බන්ධ කළ හැකිද? (ඇත්ත වශයෙන්ම RAG උපුටා දැක්වීම ලේඛනයේ තිබේද?)
  4. දෙවන ආකෘතිය සමග වලංගු කිරීම (LLM-as-judge). ස්වාධීන ආකෘතියක් මඟින් ප්‍රතිදානය "නිවැරදි / අසම්පූර්ණ / අවදානම්" ලෙස ඇගයීමට ලක් කරයි.
  5. විශ්වාස සීමාව සහ දිශානතිය. ආකෘතිය හෝ වලංගුකාරකය අඩු විශ්වාසයක් වාර්තා කරයි නම්, ප්රතිදානය ස්වයංක්රීයව සමත් නොවේ; මිනිසුන් වෙත යොමු කෙරේ.
  6. මානව පාලනය. ඉහළ විභවයක් හෝ අඩු ආරක්ෂිත ප්‍රතිඵලයක් විශේෂඥයෙකුගේ අනුමැතිය මත රඳා පවතී.

පිටපත් කළ හැකි සැකිලි හතරක්

යෝජනා ක්‍රමය + "ඔබ නොදන්නේ නම් එය සාදන්න" එකට:

පහත JSON යෝජනා ක්‍රමය තුළ පමණක් ප්‍රතිචාරය ආපසු දෙන්න: "අඩු" ලියන්න. ඇස්තමේන්තුවක් හරියට ලියන්න එපා.

දෙවන ආකෘතිය සමඟ සත්‍යාපනය (විනිසුරු විමසුම):

ඔබ ස්වාධීන වලංගුකරුවෙකි. පහත දැක්වෙන්නේ <source> පෙළ සහ < හිමිකම් පෑමකි. හිමිකම් පෑමේ සෑම අංකයක්ම සහ දිනයක්ම මූලාශ්‍රයේ වාචිකව සිදුවේද යන්න පරීක්ෂා කරන්න. එක් එක් සඳහා, කියන්න: "තහවුරු කළ | මූලාශ්‍රයේ නැත | මූලාශ්‍රයට පටහැනියි." ඒවායින් එකක් හෝ 'නොපැමිණීම/ගැටුම්කාරී' නම්, ප්‍රතිඵලය "මානව සමාලෝචනය අවශ්‍ය" ලෙස සලකුණු කරන්න.<source>{{ text }}</source><claim>{{ model_output }}</claim>

විශ්වාස එළිපත්ත මාර්ගගත කිරීමේ රීතිය:

මාර්ගගත කිරීමේ රීතිය:- emin_misin = "ඉහළ" සහ ප්‍රමාණය < 10,000 TL -> ස්වයංක්‍රීය සැකසුම්- emin_misin = "මධ්‍යම" හෝ ප්‍රමාණය 10,000-100,000 TL -> දෙවන මාදිලිය සත්‍යාපනය- emin_misin = "අඩු" හෝ ප්‍රමාණය > 100,0 මානව අනුමැතිය අවශ්‍යයි

මානව විගණන සාරාංශ කාඩ්පත (සමාලෝචනය වේගවත් කරයි):

තීරණය පුද්ගලයෙකුට ඉදිරිපත් කරන විට, මෙම කාඩ්පත ඉදිරිපත් කරන්න:- යෝජනා කරන්නේ කුමක්ද? (එක් වාක්‍යයක්)- එය පදනම් වන්නේ කුමන මූලාශ්‍රයද? (ලිපිය/ලේඛන යොමුව)- දුර්වලම උපකල්පන 2 මොනවාද?- අනුමත කළහොත් ඒවා ආපසු හැරවිය හැකිද? (ඔව්/නැත)

දුර්වල ක්ෂණික / ශක්තිමත් ක්ෂණික

දුර්වල ප්රවේශය

ශක්තිමත් ප්රවේශය

"ඉන්වොයිසියෙන් මුදල අඩු කරන්න" (නොමිලේ පෙළ)

දැඩි JSON schema + null + විශ්වාස ක්ෂේත්‍රය

ප්රතිදානය සෘජුවම ගෙවීම් පද්ධතියට ලිවීම

යෝජනා ක්‍රමය → රීතිය → මානව අනුමැතිය (අවශ්‍ය නම්)

නිරූපිකාවට "අනිවාර්‍ය වන්න" යැයි පවසමින්

දෙවන ආකෘතිය සමඟ අංකය/දිනය වලංගු කිරීම

සෑම නිමැවුමක්ම සමාන විශ්වාසයකින් සැකසීම

බලපෑම සහ විශ්වාසය මත පදනම්ව මාර්ගගත කිරීම

ශක්තිමත් ප්රවේශය ආකෘතිය නිවැරදි බව බලාපොරොත්තු නොවේ; එය ඔබ වැරදි වූ විට ඔබව අල්ලා ගන්නා දොරක් නිර්මාණය කරයි.

කුඩා නඩු තුනක්

නඩුව 1 - යෝජනා ක්රමය පමණක් ප්රමාණවත් නොවීය. ගිණුම්කරණ ස්වයංක්‍රීයකරණයක් JSON ලෙස ඉන්වොයිසිවලින් මුදල ලබා ගනිමින් සිටියේය. යෝජනා ක්රමය නිවැරදියි, නමුත් ඉන්වොයිසියක (දශම මාරුව) "1,250.00" වෙනුවට "125,000" ආකෘතිය නිෂ්පාදනය කළේය. යෝජනා ක්රමය මෙය අල්ලා ගැනීමට අසමත් විය; රීති සත්‍යාපනය ("මුළු ඉන්වොයිස් අයිතම සමඟ ±1% කින් ප්‍රමාණය අනුකූල විය යුතුය") අල්ලා ගන්නා ලද අතර TL 112,500 ක වැරදි පටිගත කිරීම වැළකුණි.

නඩුව 2 - දෙවන ආකෘතිය මායාව අල්ලා ගත්තේය. කොන්ත්රාත්තුවේ සාරාංශයේ නීති ආධාරක සහායකයකු පැවසුවේ "දින 30 ක් අවසන් කිරීමේ දැන්වීම"; කෙසේ වෙතත්, කොන්ත්රාත්තුවේ එය දින 90 කි. ස්වාධීන විනිසුරුවරයා ආකෘතිය "මූලාශ්‍රය සමග ගැටෙන" ලෙස සලකුණු කළ විට, ප්‍රතිදානය මිනිසා වෙත යොමු කර නිවැරදි කරන ලදී. එය ස්වයංක්‍රීය නම්, වැරදි දිනය මත පදනම්ව පාරිභෝගිකයා අවලංගු කිරීම දැනුම් දෙනු ඇත.

නඩුව 3 - මාර්ගගත කිරීම බර 70% කින් අඩු කළේය. රක්ෂණ හිමිකම් පද්ධතියක් ස්වයංක්‍රීයව අඩු ප්‍රමාණයේ සහ ඉහළ-ආරක්ෂිත හිමිකම් අනුමත කර ඇති අතර ඉහත-ඉන්පස/අඩු-ආරක්ෂිත ඒවා පමණක් විශේෂඥයා වෙත යවන ලදී. දෛනික ඉල්ලීම් 3,200 න් මිනිසුන්ට වැටුණේ 950 ක් පමණි; සාමාන්‍ය ගනුදෙනු කාලය පැය 4 සිට විනාඩි 40 දක්වා පහත වැටීමත් සමඟ ප්‍රවීණයන් සැබවින්ම අවදානම් සහිත 30% සඳහා ඔවුන්ගේ කාලය කැප කළහ.

ඉඟිය: "මිනිසුන්ට සියල්ල දැකිය හැකි" ලෙස මිනිස් පාලනයක් පිහිටුවන්න එපා - මෙය මිනිසුන් වෙහෙසට පත් කරන අතර අනුමැතිය රබර් මුද්‍රාවක් බවට පත්වේ. ඒ වෙනුවට, මිනිසාට ඉහළ බලපෑමක් සහ අඩු විශ්වාසයක් ඇති ප්‍රතිදානයන් පමණක් යොමු කරන්න; මෙය සැබවින්ම වැදගත් දේ කෙරෙහි අවධානය යොමු කරයි.

මානව පාලනය අර්ථවත් කිරීම

Human-in-the-loop යනු චෙක් පෙට්ටියක් කඩදාසි මත තැබීම නොවේ. සමාලෝචකයාට (1) තීරණය තේරුම් ගැනීමට සන්දර්භය තිබිය යුතුය, (2) මූලාශ්‍රයට ප්‍රවේශය සහ (3) “නැහැ” කීමට බලය තිබිය යුතුය. එසේ නොමැති නම්, පාලනය අලංකාර ලෙස පවතී. සමාලෝචන කාඩ්පත (ඉහත සිව්වන අච්චුව) එම සන්දර්භය පමණක් සැපයීමට අදහස් කෙරේ.

පොදු වැරදි

  • ක්‍රමලේඛන වලංගුකරණය කිරීම සහ අන්තර්ගතය/අගය දෝෂ මඟ හැරීම පමණි.
  • නිරූපිකාවට "අනිවාර්‍ය කර ගන්න" පැවසීමෙන් ඔබ කරන්නේ සැබෑ සත්‍යාපනය බව සිතීම.
  • ඉහළ බලපෑමක් ඇති, ආපසු හැරවිය නොහැකි තීරණ ස්වයංක්‍රීයව ක්‍රියාත්මක කරන්න.
  • සෑම නිමැවුමකම මිනිස් පාලනයක් තබා අනුමැතිය අර්ථ විරහිත රබර් මුද්දරයක් බවට පත් කිරීම.
  • මූලාශ්‍රය සහ සන්දර්භය ලබා නොදී සමාලෝචකයාට "අනුමත කරන්න" යැයි පැවසීම.
  • විශ්වාසනීය සීමාවක් සහ මාර්ගගත කිරීමකින් තොරව එකම අවදානමක් සහිතව සියලුම නිමැවුම් සැකසීම.

සාරාංශයක් ලෙස

  • ප්‍රතිදානය ආකාර තුනකින් දූෂිත වේ: ආකෘතිය, අන්තර්ගතය සහ ද්වේෂ සහගත චේතනාව; ඝන පද්ධතියක් දොරකඩ තුනම නතර කරයි.
  • ස්ථර: ක්‍රමානුකූල වලංගුකරණය, රීති/ව්‍යාපාර තර්කනය, මූලාශ්‍ර පාලනය, දෙවන ආකෘතිය (LLM-විනිසුරු ලෙස) සහ විශ්වාස එළිපත්ත මාර්ගගත කිරීම.
  • ඉහළ-බලපෑම් සහ අඩු-ආරක්ෂිත නිමැවුම් සඳහා Human-in-the-loop අනිවාර්ය විය යුතුය.
  • මානව සමාලෝචනය අර්ථවත් විය යුතුය: සමාලෝචකයාට සන්දර්භය, සම්පත් ප්‍රවේශය සහ “නැහැ” කීමට බලය තිබිය යුතුය.
  • සෑම නිමැවුමක්ම නොව අවදානම් ඒවා පමණක් මිනිසුන් වෙත යොමු කිරීමෙන් ආරක්ෂාව සහ කාර්යක්ෂමතාව යන දෙකම ලබා ගනී.

යෙදුම් කාර්යය

ඔබේම AI ප්‍රතිදානයෙන් උදාහරණයක් ගන්න. මුලින්ම JSON schema එකක් නිර්වචනය කර එයට ප්‍රතිදානය බල කරන්න. ඉන්පසු අවම වශයෙන් ව්‍යාපාරික නීති දෙකක් ලියන්න (උදාහරණයක් ලෙස, "භාණ්ඩවල මුළු මුදලට ගැලපේ"). අවසාන වශයෙන්, මාර්ගගත කිරීමේ වගුවක් සකසන්න: කුමන විශ්වාසය/බලපෑම් සංයෝජනය ස්වයංක්‍රීයව යන්නේද, දෙවන මාදිලියට යන්නේ, මිනිසා වෙත යන්නේද? දෝෂ සහිත සාම්පලයක් උත්පාදනය කර එක් එක් ස්ථරයක් එය අල්ලා ගන්නා ස්ථානය නිරීක්ෂණය කරන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම ප්‍රතිදානය සඳහා දැඩි යෝජනා ක්‍රමයක් නිර්වචනය කර එය යන්ත්‍රය සමඟ සත්‍යාපනය කරමි.
  • [ ] මම අවම වශයෙන් එක් ව්‍යාපාරයක්/රීති වලංගු කිරීමක් (අගය තර්කනය) එක් කළෙමි.
  • [ ] මට ප්‍රකාශයන් මූලාශ්‍රයට සම්බන්ධ කර ඒවා පරීක්ෂා කළ හැක.
  • [ ] ඉහළ බලපෑමක්/අඩු ආරක්ෂිත ප්‍රතිඵල සඳහා දෙවන ආකෘතිය හෝ මානව වලංගුකරණය ලබා ගත හැකිය.
  • [ ] විශ්වාසය සහ බලපෑම මත පදනම්ව මාර්ගගත කිරීමේ රීතිය අර්ථ දක්වා ඇත.
  • [ ] සමාලෝචකයාට සන්දර්භය, මූලාශ්‍රය සහ ප්‍රතික්ෂේප කිරීමට බලය ලබා දී ඇත.