ඒකකය 8 / 11

RAG ඇගයීම සහ අධීක්ෂණය

ලාභ:

  • රඳවා තබා ගැනීම සහ උත්පාදන ගුණත්වය වෙන වෙනම මනින මිතික නිර්වචනය කිරීම
  • රන් ප්‍රශ්න කට්ටලයක් සකසා LLM-as-judge සමඟ ස්වයංක්‍රීය ඇගයීම ක්‍රියාත්මක කරන්න
  • නිෂ්පාදනයේදී ප්‍රතිපෝෂණ, අධීක්ෂණය සහ ප්‍රතිගාමී පරීක්ෂණ තුළින් ගුණාත්මකභාවය පවත්වා ගැනීම

"මම සහායකයා ස්ථාපනය කළෙමි, එය හොඳින් ක්‍රියාත්මක වන බව පෙනේ" යන වාක්‍යය ඉංජිනේරු ප්‍රකාශයක් නොවේ. RAG පද්ධති නිශ්ශබ්දව බිඳ වැටේ: නව ලේඛන වර්ගයක් ලබා ගැනීම රවටා ගනී, කඩිනම් වෙනස් කිරීමක් නිරවද්‍යතාවය අඩු කරයි, දර්ශකය පරණ වේ. මෙය අවබෝධ කර ගැනීමට ඇති එකම මාර්ගය මැනීමයි. මෙම ඒකකය තුළ, අපි RAG ගුණාත්මකභාවය මැනීම (නැවත ලබා ගැනීම සහ උත්පාදනය වෙන වෙනම), ස්වයංක්‍රීය ඇගයීම (LLM-විනිසුරු ලෙස) සහ නිෂ්පාදනයේ ගුණාත්මකභාවය (නිරීක්ෂණය, ප්‍රතිගාමීත්වය) පවත්වා ගන්නේ කෙසේද යන්න ආවරණය කරයි. "ඔබ මනින නැති දේ වැඩිදියුණු කළ නොහැක" යන්න මෙම ඒකකයේ ආදර්ශ පාඨයයි.

වෙනම කරුණු දෙකක් මැන බලන්න

RAG හට කකුල් දෙකක් ඇති අතර ගැටලුව ඒවා දෙකෙන් එකක් විය හැකි බැවින් වෙන වෙනම මැනිය යුතුය:

  1. ලබා ගැනීමේ ගුණාත්මකභාවය: නිවැරදි කොටස පැමිණියේද?
  2. පරම්පරාවේ ගුණාත්මකභාවය: නිවැරදි පිළිතුර ලැබෙන කෑල්ලෙන් නිපදවා තිබේද?

පිළිතුර නරක නම්, කුමන කකුල නරකදැයි ඔබ මුලින්ම දැනගත යුතුය. නිවැරදි කොටස කිසි විටෙක නොපැමිණෙන්නේ නම්, හොඳම විමසුමට පවා සුරැකිය නොහැක (නැවත ලබා ගැනීමේ ගැටලුව). නිවැරදි කොටස පැමිණ ඇති නමුත් ආකෘතිය එය වැරදි ලෙස කියවා ඇත්නම්, ලබා ගැනීම වැඩිදියුණු කිරීම නිෂ්ඵල වේ (පරම්පරා ගැටළුව).

ප්‍රතිසාධන මෙට්‍රික්ස්

නැවත ලබා ගැනීම වර්ග කිරීමේ/ප්‍රවේශ වීමේ ගැටලුවකි; සම්භාව්‍ය තොරතුරු ලබාගැනීමේ ප්‍රමිතික මගින් මනිනු ලැබේ. මේ සඳහා ඔබට රන් පොකුරක් තිබිය යුතුය: එක් එක් ප්‍රශ්නය සඳහා "නිවැරදි" කුමන කැබැල්ලද යන්න පිළිබඳ දැනුම.

මෙට්රික්

මොන මිනුම් දන්ඩ

සරල අර්ථ දැක්වීම

Recall@k

නිවැරදි කෑල්ල උඩ k එකේද?

නිවැරදි කොටස් අල්ලා ගැනීමේ අනුපාතය

නිරවද්යතාව@k

ආපසු ලබා දුන් k කෑලි කීයක් අදාළද?

ගෙනෙන දේ පිරිසිදු කිරීම

MRR (මධ්‍යන්‍ය අන්‍යෝන්‍ය ශ්‍රේණිය)

නිවැරදි කෑල්ල තිබෙන්නේ කුමන අනුපිළිවෙලටද?

ඉහළ ශ්‍රේණිවල සිටීමේ විපාක

පහර අනුපාතය

අඩුම තරමේ එක හරි කෑල්ලක්වත් ආවාද?

සාර්ථකත්වයේ මූලික මිනුම

ප්‍රායෝගික විවරණ: Recall@k අඩු නම්, chunking හෝ search strategy (hybrid, k, re-ranking) නැවත සකස් කළ යුතුය. නිරවද්‍යතාවය අඩු නමුත් නැවත කැඳවීම ඉහළ නම්, නැවත ශ්‍රේණිගත කිරීම එකතු කිරීම හොඳ පියවරකි.

පරම්පරාවේ මිනුම්

නිවැරදි කොටස පැමිණි විට, අපි ආකෘතියෙන් නිපදවන ප්රතිචාරයේ ගුණාත්මකභාවය මනිමු. මූලික මානයන් තුනක්:

  • විශ්වාසවන්තභාවය: පිළිතුරේ ඇති සෑම හිමිකම් පෑමක්ම සන්දර්භය මගින් සහාය දක්වයිද? සවි කිරීමක් තිබේද? එය මායාවේ සෘජු මිනුමක් වේ.
  • පිළිතුර අදාළත්වය: පිළිතුර ඇත්ත වශයෙන්ම ප්‍රශ්නයට පිළිතුරු සපයන්නේද නැතහොත් එය මාතෘකාවෙන් බැහැරද?
  • සම්පූර්ණත්වය: සන්දර්භය තුළ අදාළ සියලු තොරතුරු භාවිතා කර තිබේද නැතහොත් එය අතුරුදහන් වී තිබේද?

මේවා බොහෝ විට "සත්‍ය/අසත්‍ය" වැනි ද්විමය වෙනුවට ශ්‍රේණිගත පදනමක් මත ලකුණු කර ඇත (උදා. 1-5).

ඉඟිය: විශ්වාසවන්තකම වෙනම මෙට්‍රික් එකක් ලෙස හඹා යන්න. නිරවද්‍යතාවය අඩු වන විට විශ්වාසවන්තකම අඩු වුවහොත් ගැටළුව වන්නේ පරම්පරාවයි; විශ්වාසවන්තකම ඉහළ නමුත් පිළිතුර වැරදි නම්, ගැටලුව වැරදි කෑල්ලයි (නැවත ලබා ගැනීම). මෙම ප්‍රමිතික දෙක එක්ව, දෝෂය ඇති ස්ථානය පෙන්වන මාලිමා යන්ත්‍රයකි.

ස්වර්ණමය ප්‍රශ්න මාලාවක් ස්ථාපිත කිරීම

සෑම මිනුමකටම රන් කට්ටලයක් / ඇගයීම් දත්ත කට්ටලයක් අවශ්‍ය වේ: යථාර්ථවාදී ප්‍රශ්න + අපේක්ෂිත නිවැරදි පිළිතුරු + නිවැරදි මූලාශ්‍ර කොටස්. අහඹු ප්‍රශ්න 500කට වඩා හොඳින් තෝරාගත් ප්‍රශ්න 30-50 කින් ආරම්භ කිරීම හොඳය. කට්ටලයට පහත සඳහන් දෑ ඇතුළත් කරන්න: නිතර අසනු ලබන සැබෑ ප්‍රශ්න, දන්නා දුෂ්කර ප්‍රශ්න, පිළිතුරු නොමැති ප්‍රශ්න උගුලට හසු කරන්න (යමෙකු "මම දන්නේ නැහැ" යැයි පැවසිය යුතුය), පරස්පර මූලාශ්‍ර සහිත ප්‍රශ්න.

# ගෝල්ඩන් පොකුරු උදාහරණය (සංකල්පීය)[ {"ප්‍රශ්නය": "වාර්ෂික නිවාඩු දින කීයක්?", "අපේක්‍ෂිත_පිළිතුර": "වසර 1-5 ජ්‍යෙෂ්ඨත්වය සඳහා දින 14", "නිවැරදි_කොටස_id": "කොටස් දෙක-3", "ප්‍රවර්ගය": "පිටවීම"}, {"ප්‍රශ්නය "NO_INFORMATION", # උගුල: මම "නිවැරදි_කොටස_id" නොදනිමි: null, "category": "trap"}]

LLM-විනිසුරු ලෙස: ස්වයංක්‍රීය තක්සේරුව

අතින් පිළිතුරු සිය ගණනක් ලකුණු කිරීම වෙහෙසකරයි. LLM-as-judge ආකෘතිය යනු එක් ආකෘතියක් යම් නිර්ණායක මත පදනම්ව තවත් ආකෘතියක පිළිතුරක් ලකුණු කර සාධාරණීකරණය කිරීමයි. හොඳ විනිශ්චයකරුවෙකු නිර්ණායක පැහැදිලිව නිර්වචනය කරයි, උදාහරණ ලබා දෙයි සහ සාධාරණීකරණය ඉල්ලා සිටී.

# LLM-as-judge prompt (සංකල්පීය)ඔබ අපක්ෂපාතී ඇගයුම්කරුවෙකි. ලබා දී ඇති CONTEXT සහ අපේක්ෂිත පිළිතුර අනුව පහත පිළිතුර ඇගයීමට ලක් කරන්න. ලකුණු (1-5) සහ සාධාරණීකරණය කරන්න:- විශ්වාසවන්තභාවය: පිළිතුරේ එක් එක් හිමිකම් සන්දර්භය තුළ සහය දක්වයිද?- නිරවද්‍යතාවය: පිළිතුර අපේක්ෂිත පිළිතුරට ගැළපේද?- සම්පූර්ණත්වය: අදාළ තොරතුරු සම්පූර්ණද? විශේෂයෙන්: පිළිතුරේ සන්දර්භය තුළ නොමැති තොරතුරු තිබේ නම්, විශ්වාසවන්තභාවය1 ලබා දී කුමන හිමිකම් පෑමක්ද යන්න සඳහන් කරන්න.CONTEXT: {context}අපේක්ෂිත: {expected}පිළිතුර: {පිළිතුර: ප්‍රතිදානය: {විශ්වාසවන්තකම, නිරවද්‍යතාවය, සම්පූර්ණත්වය, සාධාරණීකරණය}

අවවාදයයි: LLM-as-judge පරිපූර්ණ නොවේ; ඔවුන්ට ඔවුන්ගේම නැඹුරුතාවයක් තිබිය හැකිය (දිගු පිළිතුර, ඔවුන්ගේම ශෛලියට වැඩි කැමැත්තක් දක්වයි). විනිසුරුවරයා ද සත්‍යාපනය කරන්න: විනිසුරුවරයා සහ මිනිසා යන දෙඅංශයෙන්ම පිළිතුරු ලබාගෙන ඔවුන් අතර එකඟතාව මැන බලන්න. විනිසුරු මානව ලකුණු සමඟ අනුකූල නම්, ඔබට ඔහුව විශ්වාස කළ හැකිය.

දුර්වල / ශක්තිමත් ශ්රේණිගත කිරීම

දුර්වල ("එය මට හොඳ විය"):

මම ප්‍රශ්න කිහිපයක් ඇසූ අතර පිළිතුරු හොඳ බව පෙනේ. මට එය සජීවීව ලැබී ඇත.# ගැටලුව: මිනුම් නැත, ප්‍රතිගාමීත්වය නොපෙනේ, වැඩිදියුණු කිරීම අන්ධයි.

බලවත් (රන් පොකුර + විවික්ත මිනුම් + ස්වයංක්‍රීය විනිශ්චය + ප්‍රතිගාමී):

ප්‍රශ්න 40 කින් යුත් රන් පොකුර. සෑම වෙනසක් සමඟම, recall@5, විශ්වාසවන්තභාවය සහ නිරවද්‍යතාවය ස්වයංක්‍රීයව මනිනු ලැබේ. ලකුණු අඩු වුවහොත්, වෙනස් කිරීම ආපසු හරවනු ලැබේ. නිෂ්පාදනයේදී, පරිශීලක ප්‍රතිපෝෂණ එකතු කර කට්ටලයට එකතු කරනු ලැබේ.

නිෂ්පාදනයේ අධීක්ෂණය සහ පසුබෑම

ඇගයීම එක් වරක් සිදු කර අවසන් නොවේ. නිරන්තර පුරුදු තුනක්:

  • ප්‍රතිගාමී පරීක්ෂාව: සෑම විමසුමකදීම/ප්‍රතිසාධනය/ආදර්ශ වෙනස් කිරීමේදී ස්වයංක්‍රීයව ධාවනය වන රන් පොකුර. ලකුණු අඩු වුවහොත්, වෙනස ආපසු හැරේ. මෙය "එය වඩා හොඳ කිරීමට උත්සාහ කරන අතරතුර එය බිඳ දැමීම" වළක්වයි.
  • නිෂ්පාදන අධීක්ෂණය: සැබෑ ප්‍රශ්නවල "මට තොරතුරු සොයාගත නොහැකි විය" අනුපාතය, සාමාන්‍ය ප්‍රමාදය, පිරිවැය, පරිශීලක ප්‍රතිපෝෂණ (👍/👎) නිරීක්ෂණය කෙරේ. "මම දන්නේ නැහැ" හි හදිසි වැඩිවීමක් බොහෝ විට දර්ශකයේ හෝ නැවත ලබා ගැනීමේ අක්රමිකතාවක පළමු සංඥාවයි.
  • ප්‍රතිපෝෂණ පුඩුව: පරිශීලකයා විසින් සපයනු ලබන සැබෑ ප්‍රශ්න සමාලෝචනය කර රන් ගොඩට එකතු කරනු ලැබේ; මේ අනුව, කට්ටලය කාලයත් සමඟ පොහොසත් වන අතර පද්ධතියේ අන්ධ ස්ථාන වසා ඇත.

කුඩා නඩු තුනක්

නඩුව 1 - නිශ්ශබ්ද පසුබෑම. කණ්ඩායමක් එය "වැඩිදියුණු කිරීම" සඳහා විමසුම වෙනස් කරන ලදී; සාමාන්‍ය නිරවද්‍යතාවය වැඩි විය, නමුත් උගුල් ප්‍රශ්නවලදී විශ්වාසවන්තභාවය 30% කින් අඩු විය (ආකෘතිය වඩාත් ගැලපෙන පරිදි ආරම්භ විය). රන් පොකුරේ උගුල් ප්‍රශ්න නොවන්නට එය අවධානයට ලක් නොවනු ඇත; ප්‍රතිගාමී පරීක්ෂණය වෙනස් කිරීම ප්‍රතිවර්තනය කරන ලදී.

නඩුව 2 - වැරදි කකුල කෙළින් කිරීම. එක් සහායකයක පිළිතුරු නරක විය; කණ්ඩායම සති ගණනාවක් පුරාවටම වැඩ කළා. අප ලබා ගැනීමේ මිනුම් දණ්ඩ මනින විට, recall@5 වූයේ 48%ක් පමණි - ප්‍රශ්නය තිබුනේ නැවත ලබා ගැනීමේදී මිස උත්පාදනය කිරීමේදී නොවේ. දෙමුහුන් + නැවත ශ්‍රේණිගත කිරීම එකතු කළ විට, නැවත කැඳවීම 89% දක්වා වැඩි වූ අතර නිරවද්‍යතාවයද වැඩි විය.

නඩුව 3 - නිෂ්පාදන අනතුරු ඇඟවීම. එක් දිනක්, සහායක සහයකයෙකු සඳහා "මට තොරතුරු සොයාගත නොහැකි විය" අනුපාතය 6% සිට 34% දක්වා ඉහළ ගියේය. ට්‍රැක්පැඩ් අනතුරු ඇඟවීය; එයට හේතුව වූයේ රාත්‍රියේ ක්‍රියාත්මක වන සුචිගත කිරීමේ කාර්යය නිශ්ශබ්දව අසාර්ථක වීම සහ නව ලිපි උඩුගත නොකිරීමයි. නිරීක්ෂණයකින් තොරව, වැරදි "මම දන්නේ නැහැ" ප්‍රකාශ දින ගණනාවක් දිගටම පවතිනු ඇත.

පොදු වැරදි

  • "එය මට හොඳින් වැඩ කළා" ගැන සෑහීමකට පත්වීම: මිනුම් නොමැතිව, පසුබෑම නොපෙනී යයි.
  • නැවත ලබා ගැනීම සහ පරම්පරාව වෙන් නොකිරීම: ඔබ වැරදි කකුල නිවැරදි කර කාලය නාස්ති කරනු ඇත.
  • උගුල් ප්‍රශ්න ඇසීම නොවේ: දේවල් සෑදීමේ ප්‍රවණතාව රන් පොකුරේ නොපෙනේ.
  • විනිසුරුවරයා සත්‍යාපනය නොකරයි: පක්ෂග්‍රාහී ජූරි සභාවක් ව්‍යාජ විශ්වාසයක් ලබා දෙයි.
  • නිෂ්පාදනය අධීක්‍ෂණය නොකිරීම: දර්ශක අසාර්ථකත්වය, පිරිවැය පිපිරීම නිහඬව දිගටම පවතී.

සාරාංශයක් ලෙස

  • RAG හි, ලබා ගැනීම සහ උත්පාදන ගුණාත්මකභාවය වෙන වෙනම මනිනු ලැබේ; කුමන කකුලට හානි වී ඇත්ද යන්න මුලින්ම තීරණය කළ යුතුය.
  • recall@k, precision@k, ලබා ගැනීම සඳහා MRR; විශ්වාසවන්තකම, සුදුසුකම, සම්පූර්ණත්වය පරම්පරාව සඳහා භාවිතා වේ.
  • එක් එක් මිනුම් සඳහා රන් පොකුරක් අවශ්ය වේ; එහි සැබෑ, දුෂ්කර, උගුල් සහ පරස්පර ප්‍රශ්න දමන්න.
  • LLM-as-judge විශාල කට්ටල ස්වයංක්‍රීය ලකුණු; නමුත් විනිශ්චයකාරයා මනුෂ්‍යයාට විරුද්ධව සාධාරණීකරණය කළ යුතුය.
  • ප්‍රතිගාමී පරීක්ෂණ, නිෂ්පාදන අධීක්ෂණය සහ ප්‍රතිපෝෂණ පුඩුවක් කාලයත් සමඟ ගුණාත්මක භාවය පවත්වා ගනී.

යෙදුම් කාර්යය

(1) ඔබේම සහායකයා සඳහා අවම වශයෙන් ප්‍රශ්න 15කින් යුත් රන් කට්ටලයක් සාදන්න: අවම වශයෙන් උගුල් 3ක් (පිළිතුරු නැත), දුෂ්කර 3ක්, පරස්පර විරෝධී මූලාශ්‍ර ප්‍රශ්න 2ක් ඇතුළත් කරන්න. එක් එක් ප්‍රශ්නය සඳහා අපේක්ෂිත පිළිතුර සහ නිවැරදි කොටස ලියන්න. (2) මෙම කට්ටලය සමඟ විවිධ කඩිනම් අනුවාද දෙකක් අතින් සංසන්දනය කරන්න; සෑම පිළිතුරකටම විශ්වාසවන්තකම සහ නිරවද්‍යතාවය සඳහා ලකුණු 1-5ක් දෙන්න. (3) ඉහත LLM-as-judge prompt ඔබේම නිර්ණායකයට අනුගත කරන්න. (4) නිෂ්පාදනයේදී ඔබ නිරීක්ෂණය කරන ප්‍රමිතික 3ක් හඳුනාගෙන ඒ සෑම එකක් සඳහාම "මම අනතුරු අඟවන්නේ කුමන සීමාවේදීද?" අගය ලියන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මට වෙනම ප්‍රමිතික සමඟ රඳවා තබා ගැනීම සහ උත්පාදන ගුණාත්මකභාවය මැනිය හැකිය.
  • [ ] recall@k, විශ්වාසවන්තකම වැනි ප්‍රමිතික අදහස් කරන්නේ කුමක්දැයි මම දනිමි.
  • [ ] මට සැබෑ, දුෂ්කර, උගුල් සහ පරස්පර ප්‍රශ්න ඇතුළත් රන් පොකුරක් ගොඩනගා ගත හැකිය.
  • [ ] මට ස්වයංක්‍රීය ඇගයීමක් සකසා LLM-as-judge සමඟ විනිශ්චයකරු සත්‍යාපනය කළ හැක.
  • [ ] මට ප්‍රතිගාමී පරීක්ෂණ, නිෂ්පාදන අධීක්ෂණය සහ ප්‍රතිපෝෂණ පුඩුව ක්‍රියාත්මක කළ හැක.