ඒකක
1. ML ඉංජිනේරු විද්‍යාවේ කෘතිම බුද්ධිය: භූමිකාව, සීමා මායිම්, වලංගුකරණය සහ වගකීම 2. දත්ත නල මාර්ගය: එකතු කිරීම, පිරිසිදු කිරීම, ටැග් කිරීම සහ අනුවාද කිරීම 3. ආදර්ශ පුහුණුව සහ ඇගයීම: නිරවද්‍ය ප්‍රමිතික, අවංක මිණුම් සලකුණු 4. LLM යෙදුම: RAG සමඟ ඔබේම දත්ත මත පදනම්ව පිළිතුරු 5. LLM යෙදුම: නියෝජිතයන්, මෙවලම් සහ ආරක්ෂිත ස්වයංක්‍රීයකරණය 6. සියුම්-සුසර කිරීමේ පදනම: කවදාද, කෙසේද සහ කුමන අවදානමක් සහිතව 7. MLOps සහ යෙදවීම: රසායනාගාරයේ සිට නිෂ්පාදනය දක්වා ආකෘතිය ගෙන යාම 8. Eval සහ අධීක්‍ෂණය: නිෂ්පාදනයේදී මොඩලය ඇත්ත වශයෙන්ම කරන්නේ කුමක්ද යන්න දැන ගැනීම 9. ආරක්ෂාව සහ පෞද්ගලිකත්වය: AI පද්ධති ආරක්ෂා කිරීම 10. පක්ෂග්‍රාහී, ආචාර ධර්ම සහ පිරිවැය: වගකීම් සහගත සහ තිරසාර AI ඉංජිනේරු විද්‍යාව 11. ප්රතිනිෂ්පාදනය සහ අවසානය දක්වා ව්යාපෘතිය: සියල්ල ඒකාබද්ධ කිරීම
ඒකකය 8 / 11

Eval සහ අධීක්‍ෂණය: නිෂ්පාදනයේදී මොඩලය ඇත්ත වශයෙන්ම කරන්නේ කුමක්ද යන්න දැන ගැනීම

ලාභ:

  • ආකෘතිය පිරිහීමට නිහඬ හේතු හඳුනාගැනීමේ හැකියාව (දත්ත ප්ලාවිතය, සංකල්ප ප්ලාවිතය, උඩුගත දෝෂය) සහ තුන්-ස්ථර (මෙහෙයුම්, ආදාන, ප්‍රතිදානය) අධීක්ෂණය ස්ථාපිත කිරීම
  • රීති පිරික්සුම්, LLM-තීරක සහ මානව ඇගයීම සමඟ බහු ස්ථර වල LLM පද්ධති ඇගයීමට සහ LLM-තීරක මානව නැංගුරම සමඟ ක්‍රමාංකනය කිරීමේ හැකියාව
  • දාර සහ ආරක්ෂක කේස් අඩංගු eval කට්ටලයක් සැලසුම් කිරීමට සහ හසු වූ සෑම දෝෂයක්ම ස්ථිර පරීක්ෂණ නඩුවක් බවට පත් කිරීමේ හැකියාව

ආකෘතියක් නිෂ්පාදනයට ගිය පසු, ඔබේ කාර්යය සිදු නොවේ; සැබෑ වගකීම ආරම්භ වන්නේ ය. මොඩලය කිසිවෙක් නොබලන විට නිශ්ශබ්දව බිඳ වැටිය හැකි බැවිනි. මෙම ඒකකය තුළ, අපි අනුපූරක විෂයයන් දෙකක් ආවරණය කරමු: ඇගයීම (ක්‍රමානුකූලව ආකෘතියේ ගුණාත්මකභාවය මැනීම) සහ අධීක්ෂණය (නිෂ්පාදනයේ ආකෘතිය නිරන්තරව අධීක්ෂණය කිරීම). විශේෂයෙන්ම LLM පද්ධතිවල, eval වඩාත් අපහසු වන අතර සම්භාව්‍ය ML වලට වඩා වැඩි සැලකිල්ලක් අවශ්‍ය වේ.

නිෂ්පාදන ආකෘතිය නිශ්ශබ්දව බිඳ වැටෙන්නේ ඇයි?

දෝෂයක් කඩා වැටේ, ලොගය මුද්‍රණය වේ, අනතුරු ඇඟවීම ක්‍රියා විරහිත වේ. අනෙක් අතට ML ආකෘතියක් දෝෂ ඇති නොකර වැරදි විය හැක. පිරිහීමට ප්‍රධාන හේතු තුනක්:

  • දත්ත ප්ලාවිතය: ආදාන දත්ත බෙදා හැරීම කාලයත් සමඟ වෙනස් වේ (නව නිෂ්පාදන, පරිශීලක හැසිරීම වෙනස් කිරීම, සෘතුමය බව). ආකෘතිය එලෙසම පවතින නමුත් ලෝකය වෙනස් වේ.
  • සංකල්ප ප්ලාවිතය: ආදාන-ප්‍රතිදාන සම්බන්ධතාවය වෙනස් වේ. වංචා උපක්‍රම සහ අයාචිත තැපැල් රටා පරිණාමය වේ; ඊයේ හරි දේ අද වැරදියි.
  • Upstream දූෂණය: දත්ත මූලාශ්රයක් ආකෘතිය වෙනස් කරයි, ප්රදේශයක් නිදහස් වේ; දූෂිත ආදානය සමඟ ආකෘතිය නිශ්ශබ්දව ගිලිහී යයි.

ලුහුබැඳීම මෙම නිහඬ විකෘති කිරීම් ශ්‍රවණය කරයි.

නැරඹිය යුතු දේ: ස්ථර තුනක්

හොඳ නිරීක්ෂණ ස්ථර තුනක් ආවරණය කරයි:

  1. මෙහෙයුම් ප්‍රමිතික: ප්‍රමාදය, දෝෂ අනුපාතය, ඉල්ලීම් පරිමාව, සම්පත් භාවිතය. "පද්ධතිය ස්ථාවරද?"
  2. දත්ත/ආදාන ප්‍රමිතික: ආදාන ව්‍යාප්තිය පුහුණුවේදී සමානද? නැතිවූ අගය අනුපාතය වැඩි වී තිබේද? නව කාණ්ඩ පැමිණ තිබේද? "ආකෘතිය හුරුපුරුදු දත්ත දකිනවාද?"
  3. ආදර්ශ/ප්‍රතිදාන ප්‍රමිතික: පුරෝකථන බෙදා හැරීමේ ලොගය? විශ්වාස ලකුණු පහත වැටී තිබේද? සහ හැකි නම්, බිම් සත්‍යයට සාපේක්ෂව නිරවද්‍යතාවය කුමක්ද? "ආකෘතිය තවමත් නිවැරදිද?"

තෙවන ස්ථරය වඩාත්ම වටිනා නමුත් වඩාත්ම දුෂ්කර ය; මක්නිසාද යත් සැබෑ ප්‍රති result ලය සාමාන්‍යයෙන් ප්‍රමාදයකින් පැමිණේ (ණය ආපසු ගෙවන්නේද නැද්ද යන්න මාස ගණනකට පසුව පැහැදිලි වේ).

ඉඟිය: සත්‍ය ප්‍රතිඵලය ප්‍රමාද වන්නේ නම්, ප්‍රථමයෙන් ආදානය සහ අනාවැකි බෙදා හැරීම නිරීක්ෂණය කරන්න. ආදාන ව්‍යාප්තිය මාරු කිරීම නිරවද්‍යතා පිරිහීමේ මුල් ලකුණක් වන අතර සත්‍ය ප්‍රතිඵලය බලා නොසිට අනතුරු ඇඟවීමක් කළ හැකිය.

LLM පද්ධති ඇගයීම: විශේෂ අභියෝගය

සම්භාව්‍ය ML හි, "නිවැරදි පිළිතුර" පැහැදිලිය (පංතිය 0 හෝ 1). අනෙක් අතට, LLM ප්‍රතිඵලය විවෘතව පවතී: එකම ප්‍රශ්නයට බොහෝ නිවැරදි පිළිතුරු තිබිය හැක, "නිවැරදි බව" තනි අංකයකට නොගැලපේ. LLM eval ප්රවේශයන්:

  • යොමු ප්‍රමිතික: ප්‍රතිදානය පරිපූර්ණ පිළිතුරට සංසන්දනය කිරීම. සීමා සහිත; මන්ද එය වෙනස් ලෙස ප්‍රකාශිත නිවැරදි පිළිතුර "වැරදි" ලෙස සැලකිය හැකි බැවිනි.
  • රීති මත පදනම් වූ චෙක්පත්: ප්‍රතිදානය වලංගු JSON ද? තහනම් වචන තිබේද? එහි අපේක්ෂිත ක්ෂේත්‍ර අඩංගුද? ලාභ, විශ්වසනීය, තද.
  • LLM-විනිසුරුවරයා (LLM-as-judge): "මෙම පිළිතුර මෙම නිර්ණායකයට අනුව හොඳද?" කියා නිරූපිකාවක් අසන්න එපා. එය පරිමාණය කරයි, නමුත් විනිසුරුවරයාම සත්‍යාපනය කළ යුතුය.
  • මානව සමාලෝචනය: රන් සම්මත නමුත් මිල අධික සහ මන්දගාමී. එය සාම්පලයේ භාවිතා වේ.

ප්‍රායෝගිකව මේවා එකට භාවිතා වේ: එක් එක් ප්‍රතිදානය මත ලාභ රීති පිරික්සුම්, විශාල සාම්පලයක් මත LLM-විනිසුරු, කුඩා නමුත් දැඩි නියැදියක මානව ඇගයීම.

දුර්වල ප්රවේශය / ශක්තිමත් ප්රවේශය

දුර්වල: "LLM-මම විනිසුරුගෙන් ඇහුවා, අපේ පිළිතුරුවලින් 92% ක් හොඳයි. පද්ධතිය විශිෂ්ටයි."

Güçlü: "අපි මුලින්ම මුද්‍රණ පිටපත් 100ක් ලේබල් කළා. අපි LLM-විනිසුරුවරයා එම මුද්‍රණපිටපත් 100 මතම ධාවනය කර මානව-විනිසුරු ගිවිසුම මනින ලදී - 85% එකඟතාව, පිළිගත හැකිය. විනිසුරුවරයාට ක්‍රමානුකූලව වැරදුණු තැන අපි ලේඛනගත කළෙමු (දිගු පිළිතුරු අසාධාරණ ලෙස සොයා ගැනීමේ ප්‍රවණතාවක් අපි හොඳ) සහ ඔහුගේ ලකුණු තීරණය කළේ එවිට පමණි."

වෙනස: ශක්තිමත් ප්‍රවේශය විනිසුරුවරයා අන්ධ ලෙස නොව මානව නැංගුරමකින් සත්‍යාපනය කරයි. සත්‍යාපනය නොකළ LLM-විනිසුරුවරයෙක් ලස්සන පෙනුමක් ඇති නමුත් ව්‍යාජ විශ්වාසයක් ලබා දෙයි.

අවධානය: LLM-තීරකවරයා ද ආකෘතියකි; හලූසිනොජනික්, පක්ෂග්‍රාහී (දිගු/විශ්වාසදායක පිළිතුරු වලට අනුග්‍රහය දක්වයි), අනනුකූල විය හැක. නිෂ්පාදන තීරණ ගැනීමට පෙර මානව ටැග් සමඟ විනිසුරු ලකුණු ක්‍රමාංකනය කරන්න.

ඇගයීම් කට්ටලය: ප්රවේශමෙන් නිර්මාණය කර ඇත

හොඳ eval කට්ටලයක් සැබෑ භාවිතයේ විවිධත්වය සහ දුෂ්කර අවස්ථා නියෝජනය කරයි. සරල උදාහරණ වලින් පිරුණු eval ඔබව ව්‍යාජ විශ්වාසයකින් තබයි. එය eval පොකුරේ තැබීමට වග බලා ගන්න:

  • Edge අවස්ථා: හිස් ආදානය, ඉතා දිගු ආදානය, අසාමාන්ය ආකෘතිය.
  • දන්නා දුෂ්කර අවස්ථා: ආකෘතිය අතීතයේ වැරදි සිදු කර ඇති උදාහරණ (ප්‍රතිගාමී පරීක්ෂණයක් ලෙස).
  • ආරක්ෂක සිදුවීම්: ඉක්මන් එන්නත් කිරීමේ උත්සාහයන්, ද්වේෂසහගත ඉල්ලීම්, පෞද්ගලිකත්වය උල්ලංඝනය කිරීමේ උගුල්.

eval පොකුර කාලයත් සමඟ වර්ධනය වේ: නිෂ්පාදනයේදී ඔබ අල්ලා ගන්නා සෑම නව දෝෂයක්ම ඊළඟ ඇගයීම සඳහා පරීක්ෂණ අවස්ථාවක් බවට පත්වේ.

අනතුරු ඇඟවීම සහ මැදිහත්වීම

අනතුරු ඇඟවීමකින් තොරව අධීක්ෂණය අසම්පූර්ණව පවතී. එක් එක් වැදගත් මෙට්‍රික් සඳහා එළිපත්තක් සහ ප්‍රතිචාර සැලැස්මක් තිබිය යුතුය: "ආදාන ප්ලාවිතය X ඉක්මවන්නේ නම් ඉංජිනේරුවරයාට දන්වන්න", "දෝෂ අනුපාතය Y ඉක්මවන්නේ නම් ස්වයංක්‍රීයව ආපසු හැරවීම". අනතුරු ඇඟවීම් අර්ථවත්ව තබා ගන්න - බොහෝ ව්‍යාජ එලාම් කණ්ඩායම අවශෝෂණ කරන අතර ඔවුන්ට සැබෑ අනතුරු ඇඟවීම මග හැරේ.

කුඩා නඩු තුනක්

නඩුව 1 - පූර්ව අනතුරු ඇඟවීම. ඉල්ලුමේ පුරෝකථන ආකෘතියක සැබෑ නිරවද්‍යතාවය පැහැදිලි වූයේ සතිය අවසානයේ පමණි. කණ්ඩායම ආදාන බෙදාහැරීම අධීක්‍ෂණය කරමින් සිටි අතර අඟහරුවාදා දිනක නව නිෂ්පාදන කාණ්ඩයක හදිසි නැගීම දුටුවේය - ආකෘතිය කිසි දිනක දැක නොතිබූ දෙයකි. ඔවුන් නිරවද්‍යතාවය පහත වැටෙන තෙක් බලා නොසිට ආකෘතිය යාවත්කාලීන කළහ. ආදාන අධීක්ෂණ දින ඉතිරි කර ඇත.

නඩුව 2 - තහවුරු නොකළ විනිසුරු. එක් කණ්ඩායමක් LLM-සමාලෝචනය මත පදනම්ව "අපගේ ගුණාත්මකභාවය විශිෂ්ටයි" යනුවෙන් වාර්තා කරන ලදී. පාරිභෝගික පැමිණිලි වැඩි වූ විට, මානව නිරීක්ෂණ හඳුන්වා දෙන ලදී: විනිසුරු විශ්වාස කළ නමුත් වැරදි පිළිතුරු "හොඳ" ලෙස ගණන් කළේය. විනිසුරුව මානව ටැග් සමඟ ක්‍රමාංකනය කළ පසු, සත්‍ය ගුණාත්මක බව හෙළි වූ අතර එය බෙහෙවින් අඩු විය. පාඩම: එය සත්‍යාපනය නොකර විනිසුරුව විශ්වාස නොකරන්න.

3 වන අවස්ථාව - ප්‍රතිගාමී පරීක්ෂාව. කඩිනම් වෙනසකින් එක ප්‍රශ්නයක් නිශ්ශබ්දව තවත් ප්‍රශ්නයක් නිරාකරණය විය. එහෙත් කණ්ඩායම eval බාල්දිය තුළ පසුගිය දෝෂ තබා; මෙම පොකුරේ නව වෙනස් කිරීම පරීක්ෂා කරන විට, කැඩුණු නඩුව වහාම අල්ලාගෙන වෙනස් කිරීම සවි කර ඇත. පාඩම: සෑම ස්ථාවර දෝෂයක්ම ස්ථිර පරීක්ෂණ අවස්ථාවක් බවට පත් විය යුතුය.

පිටපත් කළ හැකි සැකිලි

මෙම නිෂ්පාදන ආකෘතිය සඳහා ලුහුබැඳීමේ සැලැස්මක් නිෂ්පාදනය කරන්න. ස්ථර තුනක් ආවරණය කරන්න:1) මෙහෙයුම් (ප්‍රමාදය, දෝෂ අනුපාතය, පරිමාව)2) ආදානය/දත්ත (බෙදාහැරීමේ මාරුව, නැතිවූ අගය, නව කාණ්ඩය)3) මාදිලිය/ප්‍රතිදානය (පුරෝකථනය බෙදාහැරීම, විශ්වාසය, හැකිනම් නිරවද්‍යතාව)ආකෘතිය: [විස්තරය]. සත්‍ය ප්‍රතිඵලය පැමිණීමට කොපමණ කාලයක් ගතවේද: [duration]එක් එක් මෙට්‍රික් සඳහා එළිපත්ත සහ මැදිහත්වීම් නිර්දේශ එක් කරන්න.

මෙම LLM පද්ධතිය සඳහා ඇගයීම් (eval) උපාය මාර්ගයක් යෝජනා කරන්න. කාර්යය: [විස්තරය]ස්ථර නිර්ණය කරන්න:- එක් එක් ප්‍රතිදානය මත ධාවනය කළ යුත්තේ කුමන රීති මත පදනම් වූ චෙක්පත්ද?- LLM-බේරුම්කරු ඇගයීමට ලක් කළ යුතු නිර්ණායක මොනවාද සහ ඒවා වලංගු කළ යුත්තේ කෙසේද (මානව නැංගුරම)

මෙම LLM-විනිසුරු විමසුම පරීක්ෂා කරන්න:- ඇගයීමේ නිර්ණායක පැහැදිලි හෝ ආත්මීයද?- එය දිග/විශ්වාසනීය නැඹුරුවකට නැඹුරුද?- මානව ටැග් සමඟ විනිසුරුව ක්‍රමාංකනය කරන්නේ කෙසේද? විනිසුරු විමසුම: [prompt]

මෙම අධීක්ෂණ එලාමය සඳහා ප්‍රතිචාර ධාවන පොතක් ලියන්න.Alarm: [උදා. ආදාන ප්ලාවිත සීමාව ඉක්මවා ඇත] අඩංගු විය යුතුය: මූලික පාලන පියවර, විය හැකි හේතු, ආපසු හැරවීමේ නිර්ණායක, දැනුම් දිය යුත්තේ කාටද යන්න.

පිරිහීමට හේතු වගුව

විකෘති කිරීම

රෝග ලක්ෂණය

කලින් හඳුනාගැනීමේ මාර්ගය

දත්ත ප්ලාවිතය

ආදාන බෙදාහැරීමේ වෙනස්කම්

ආදාන බෙදා හැරීම අධීක්ෂණය

සංකල්ප මාරුව

ධර්මිෂ්ඨකම නිශ්ශබ්දව වැටේ

පුරෝකථනය + සැබෑ සංසන්දනය

upstream දෝෂය

ක්ෂේත්‍ර හිස්/ආකෘති වෙනස් වේ

යෝජනා ක්‍රම වලංගුකරණය + නැතිවූ අනුපාතය

මාදිලියේ නොගැලපීම

නිමැවුම් බෙදා හැරීමේ මාරුවීම්

නිමැවුම් බෙදා හැරීම අධීක්ෂණය

පොදු වැරදි

  • නිරීක්ෂණ ස්ථාපිත නොකිරීම. ආකෘතිය නිශ්ශබ්දව බිඳ වැටේ, කිසිවෙකු එය නොපෙනේ.
  • මෙහෙයුම් ප්‍රමිතික පමණක් හඹා යන්න. පද්ධතිය ක්‍රියාත්මකයි, නමුත් අනාවැකි වැරදි විය හැක.
  • විනිසුරුවරයා සත්‍යාපනය නොකර LLM භාවිතා කිරීම. එය ව්යාජ විශ්වාසයක් ලබා දෙයි.
  • පහසු උදාහරණ සහිත Eval. එය සැබෑ දුෂ්කරතාවයක් පෙන්නුම් නොකරයි.
  • eval හි අතීත දෝෂ ඇතුළත් නොවේ. එම දෝෂය නැවත පැමිණේ.
  • ඝෝෂාකාරී අනතුරු ඇඟවීම්. කණ්ඩායම අවනීත බවට පත් වේ, සැබෑ අනතුරු ඇඟවීම මග හැරේ.

සාරාංශයක් ලෙස

නිෂ්පාදනයේ දෝෂ ඇති නොකර ආකෘතිය වැරදි විය හැක; එබැවින් eval සහ අධීක්ෂණය සංවර්ධනය මෙන්ම වැදගත් වේ. ස්ථර තුනකින් (මෙහෙයුම්, ආදාන, ප්රතිදානය) අධීක්ෂණය ස්ථාපිත කරන්න; සැබෑ ප්‍රතිඵලය ප්‍රමාද වුවහොත් පූර්ව අනතුරු ඇඟවීමක් ලෙස ආදාන ප්ලාවිතය භාවිතා කරන්න. LLM පද්ධතිවල, eval විවෘතව පවතී; රීති චෙක්පත්, LLM-විනිසුරුවරයා සහ මානව ඇගයීම එකට භාවිතා කරන්න - නමුත් මානව නැංගුරමක් සමඟ LLM-විනිසුරුවරයා වලංගු කිරීමට වග බලා ගන්න. ඔබේ Eval පොකුර දාර සහ ආරක්ෂක කේස් වලින් පොහොසත් කර අහුවෙන සෑම දෝෂයක්ම ස්ථිර පරීක්ෂණ නඩුවක් බවට පත් කරන්න.

යෙදුම් කාර්යය

නිෂ්පාදන (හෝ නිෂ්පාදනයට ආසන්න) ආකෘතියක් සඳහා තට්ටු තුනක අධීක්ෂණ සැලැස්මක් ලියන්න සහ අවම වශයෙන් එක් ආදාන-බෙදාහැරීමේ මෙට්‍රික් සඳහා එළිපත්ත + අනතුරු ඇඟවීම් නිර්වචනය කරන්න. ඔබට LLM පද්ධතියක් තිබේ නම්: මිනිසුන් සමඟ ප්‍රතිදානයන් 30ක් ටැග් කරන්න, එම ප්‍රතිදානයන් මතම LLM-තීරකයක් ධාවනය කරන්න, සහ මානව-තීරක ගිවිසුම මැන බලන්න; විනිසුරුවරයාගේ ක්‍රමානුකූල නැඹුරුව සටහන් කරන්න. ඔබේ eval පොකුරට අවම වශයෙන් දාර 3ක් සහ ආරක්ෂක අවස්ථා 2ක් එක් කරන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] අධීක්‍ෂණය ස්ථර තුනම (මෙහෙයුම්, ආදාන, ප්‍රතිදානය) ආවරණය කරයි.
  • [ ] සැබෑ ප්‍රතිඵලය ප්‍රමාද වුවහොත් පූර්ව අනතුරු ඇඟවීමක් ලෙස මම ආදාන ප්ලාවිතය භාවිතා කරමි.
  • [ ] මම LLM- බේරුම්කරු මානව ලේබල් සමඟ ක්‍රමාංකනය කළෙමි.
  • [ ] Eval පොකුරේ දාර සහ ආරක්ෂක අවස්ථා අඩංගු වේ.
  • [ ] මම අල්ලා ගත් සෑම දෝෂයක්ම ස්ථිර පරීක්ෂණ නඩුවක් බවට පත් කළෙමි.
  • [ ] සෑම වැදගත් මිතිකයකටම එළිපත්ත සහ ප්‍රතිචාර සැලැස්මක් ඇත.