નફો:
- મેટ્રિક્સને વ્યાખ્યાયિત કરવું જે રીટેન્શન અને જનરેશન ગુણવત્તાને અલગથી માપે છે
- સુવર્ણ પ્રશ્નનો સમૂહ સેટ કરો અને LLM- તરીકે-જજ સાથે સ્વચાલિત મૂલ્યાંકન ચલાવો
- ઉત્પાદનમાં પ્રતિસાદ, દેખરેખ અને રીગ્રેશન પરીક્ષણ દ્વારા ગુણવત્તા જાળવવી
વાક્ય "મેં સહાયકને ઇન્સ્ટોલ કર્યું છે, તે સારું કામ કરી રહ્યું છે" એ એન્જિનિયરિંગ નિવેદન નથી. આરએજી સિસ્ટમ્સ ચુપચાપ તૂટી જાય છે: નવો દસ્તાવેજ પ્રકાર પુનઃપ્રાપ્તિને મૂર્ખ બનાવે છે, તાત્કાલિક ફેરફાર ચોકસાઈ ઘટાડે છે, ઇન્ડેક્સ વાસી બની જાય છે. આને સમજવાનો એકમાત્ર રસ્તો માપવાનો છે. આ એકમમાં, અમે આરએજી ગુણવત્તા (પુનઃપ્રાપ્તિ અને જનરેશન અલગથી), સ્વચાલિત મૂલ્યાંકન (એલએલએમ-જજ) અને ઉત્પાદનમાં ગુણવત્તા (મોનિટરિંગ, રીગ્રેશન) કેવી રીતે જાળવવી તે આવરી લઈએ છીએ. "તમે જે માપતા નથી તેને તમે સુધારી શકતા નથી" એ આ એકમનું સૂત્ર છે.
બે અલગ વસ્તુઓ માપો
આરએજીના બે પગ છે અને તેને અલગથી માપવા જોઈએ કારણ કે સમસ્યા તેમાંથી કોઈ એકમાં હોઈ શકે છે:
- પુનઃપ્રાપ્તિ ગુણવત્તા: શું સાચો ભાગ આવ્યો?
- જનરેશન ક્વોલિટી: શું આવનારા ભાગમાંથી સાચો જવાબ બનાવવામાં આવ્યો હતો?
જો જવાબ ખરાબ છે, તો તમારે પહેલા કયો પગ ખરાબ છે તે જાણવાની જરૂર છે. જો યોગ્ય ભાગ ક્યારેય ન આવે, તો શ્રેષ્ઠ પ્રોમ્પ્ટ પણ સાચવી શકતો નથી (પુનઃપ્રાપ્તિ સમસ્યા). જો સાચો ભાગ આવ્યો હોય પરંતુ મોડેલ તેને ખોટી રીતે વાંચે છે, તો પુનઃપ્રાપ્તિમાં સુધારો કરવો નિરર્થક છે (પેઢીની સમસ્યા).
પુનઃપ્રાપ્તિ મેટ્રિક્સ
પુનઃપ્રાપ્તિ એ સૉર્ટિંગ/ઍક્સેસ સમસ્યા છે; શાસ્ત્રીય માહિતી પુનઃપ્રાપ્તિ મેટ્રિક્સ દ્વારા માપવામાં આવે છે. આ માટે તમારી પાસે ગોલ્ડન ક્લસ્ટર હોવું આવશ્યક છે: દરેક પ્રશ્ન માટે કયો ભાગ "સાચો" છે તેનું જ્ઞાન.
મેટ્રિક
શું પગલાં
સરળ વ્યાખ્યા
Recall@k
શું ટોચના k માં સાચો ભાગ છે?
સાચો ભાગ કેપ્ચર દર
precision@k
પરત કરવામાં આવેલ k ટુકડાઓમાંથી કેટલા સંબંધિત છે?
જે લાવવામાં આવે છે તેની સફાઈ
MRR (મીન પારસ્પરિક ક્રમ)
કયા ક્રમમાં સાચો ભાગ છે?
પુરસ્કારો ટોચના રેન્કમાં છે
હિટ દર
શું ઓછામાં ઓછો એક સાચો ભાગ આવ્યો?
સફળતાનું સૌથી મૂળભૂત માપદંડ
વ્યવહારુ ટિપ્પણી: જો Recall@k ઓછી હોય, તો ચંકીંગ અથવા શોધ વ્યૂહરચના (હાઇબ્રિડ, k, પુનઃ રેન્કિંગ) પર ફરીથી કામ કરવું જોઈએ. જો ચોકસાઇ ઓછી હોય પરંતુ રિકોલ વધારે હોય, તો ફરીથી રેન્કિંગ ઉમેરવું એ એક સારી ચાલ છે.
જનરેશન મેટ્રિક્સ
જ્યારે સાચો ભાગ આવે છે, ત્યારે અમે મોડેલ દ્વારા ઉત્પાદિત પ્રતિસાદની ગુણવત્તાને માપીએ છીએ. ત્રણ મૂળભૂત પરિમાણો:
- વફાદારી: શું જવાબમાં દરેક દાવા સંદર્ભ દ્વારા સમર્થિત છે? ત્યાં કોઈ ફિટિંગ છે? તે આભાસનું સીધું માપ છે.
- જવાબની સુસંગતતા: શું જવાબ ખરેખર પ્રશ્નનો જવાબ આપે છે અથવા તે વિષયની બહાર છે?
- સંપૂર્ણતા: શું સંદર્ભમાં તમામ સંબંધિત માહિતીનો ઉપયોગ કરવામાં આવ્યો છે અથવા તે ખૂટે છે?
આ ઘણીવાર “સાચું/ખોટું” જેવા દ્વિસંગીને બદલે ગ્રેડના આધારે (દા.ત. 1-5) સ્કોર કરવામાં આવે છે.
ટીપ: એક અલગ મેટ્રિક તરીકે વિશ્વાસુતાને ટ્રૅક કરો. જો ચોકસાઈ ઘટતી જાય તેમ વફાદારી ઘટે, તો સમસ્યા પેઢીની છે; જો વફાદારી વધારે છે પરંતુ જવાબ ખોટો છે, તો સમસ્યા એ ખોટો ભાગ (પુનઃપ્રાપ્તિ) છે. એકસાથે, આ બે મેટ્રિક્સ એક હોકાયંત્ર છે જે ખામીનું સ્થાન દર્શાવે છે.
સુવર્ણ પ્રશ્ન સમૂહની સ્થાપના
દરેક માપન માટે સુવર્ણ સમૂહ / મૂલ્યાંકન ડેટાસેટની જરૂર છે: વાસ્તવિક પ્રશ્નો + અપેક્ષિત સાચા જવાબો + સાચા સ્ત્રોત ટુકડાઓ. 500 રેન્ડમ પ્રશ્નો કરતાં 30-50 સારી રીતે પસંદ કરેલા પ્રશ્નોથી શરૂ કરવું વધુ સારું છે. સેટમાં નીચેનાનો સમાવેશ કરો: વારંવાર પૂછાતા વાસ્તવિક પ્રશ્નો, જાણીતા અઘરા પ્રશ્નો, જવાબો વિનાના પ્રશ્નો (કોઈએ "મને ખબર નથી" એમ કહેવું જોઈએ), વિરોધાભાસી સ્ત્રોતવાળા પ્રશ્નો.
# ગોલ્ડન ક્લસ્ટર ઉદાહરણ (વૈકલ્પિક)[ {"પ્રશ્ન": "વાર્ષિક રજા કેટલા દિવસની?", "અપેક્ષિત_જવાબ": "1-5 વર્ષની વરિષ્ઠતા માટે 14 દિવસ", "સાચો_ભાગ_id": "બે-ભાગ-3", "કેટેગરી": "લીવ"}, {"પ્રશ્ન": "કંપનીની ઑફિસ ક્યાં છે?", "માર્ચ_જવાબ" , "માર્ગ_માર્ગ"ની ઓફિસ ક્યાં છે? # ટ્રેપ: મને "સાચો_ભાગ_આઈડી" ખબર નથી: નલ, "કેટેગરી": "ટ્રેપ"}]
જજ તરીકે એલએલએમ: ઓટોમેટિક એસેસમેન્ટ
હાથ વડે સેંકડો જવાબો સ્કોર કરવાથી થકવી નાખે છે. LLM-જજ તરીકેનું મોડલ એ છે જ્યારે એક મોડેલ ચોક્કસ માપદંડોના આધારે બીજા મોડેલના જવાબને સ્કોર કરે છે અને તેને ન્યાયી ઠેરવે છે. સારા ન્યાયાધીશ પ્રોમ્પ્ટ સ્પષ્ટપણે માપદંડોને વ્યાખ્યાયિત કરે છે, ઉદાહરણો આપે છે અને વાજબીતા માટે પૂછે છે.
# LLM-જજ-જજ પ્રોમ્પ્ટ (વૈકલ્પિક)તમે નિષ્પક્ષ મૂલ્યાંકનકર્તા છો. આપેલ સંદર્ભ અને અપેક્ષિત જવાબ અનુસાર નીચે આપેલા જવાબનું મૂલ્યાંકન કરો. સ્કોર (1-5) અને સર્મથન:- વફાદારી: શું જવાબમાં દરેક દાવા સંદર્ભમાં આધારભૂત છે?- ચોકસાઈ: શું જવાબ અપેક્ષિત જવાબ સાથે મેળ ખાય છે?- સંપૂર્ણતા: શું સંબંધિત માહિતી પૂર્ણ છે? ખાસ કરીને: જો જવાબમાં સંદર્ભમાં ન હોય તેવી માહિતી હોય, તો વફાદારી1 આપો અને કયો દાવો બનાવટી છે તે દર્શાવો. સંદર્ભ: {સંદર્ભ}અપેક્ષિત: {અપેક્ષિત}જવાબ: {જવાબ}આઉટપુટ: {વફાદારી, સચોટતા, સંપૂર્ણતા, વાજબીતા}
સાવધાન: જજ તરીકે એલએલએમ સંપૂર્ણ નથી; તેઓના પોતાના પૂર્વગ્રહો હોઈ શકે છે (લાંબા જવાબો, તેમની પોતાની શૈલીને પસંદ કરતા). ન્યાયાધીશને પણ ચકાસો: ન્યાયાધીશ અને માનવ બંને દ્વારા કેટલાક જવાબો મેળવો અને તેમની વચ્ચેના કરારને માપો. જો ન્યાયાધીશ માનવ સ્કોર્સ સાથે સુસંગત હોય, તો તમે તેના પર વિશ્વાસ કરી શકો છો.
નબળું/મજબૂત રેટિંગ
નબળા ("તે મારા માટે સારું હતું"):
મેં થોડા પ્રશ્નો પૂછ્યા અને જવાબો સારા લાગ્યા. મને તે જીવંત મળી ગયું છે. # સમસ્યા: કોઈ માપન નથી, રીગ્રેસન અગોચર, સુધારણા અંધ.
શક્તિશાળી (ગોલ્ડ ક્લસ્ટર + ડિસ્ક્રીટ મેટ્રિક્સ + ઓટોમેટિક જજમેન્ટ + રીગ્રેશન):
40 પ્રશ્નોનું ગોલ્ડન ક્લસ્ટર. દરેક ફેરફાર સાથે, recall@5, વફાદારી અને ચોકસાઈ આપોઆપ માપવામાં આવે છે. જો સ્કોર ઘટે છે, તો ફેરફાર પાછો ખેંચવામાં આવશે. ઉત્પાદનમાં, વપરાશકર્તા પ્રતિસાદ એકત્રિત કરવામાં આવે છે અને સેટમાં ઉમેરવામાં આવે છે.
ઉત્પાદનમાં દેખરેખ અને રીગ્રેસન
મૂલ્યાંકન એકવાર અને સમાપ્ત થતું નથી. ત્રણ સતત પ્રેક્ટિસ:
- રીગ્રેશન ટેસ્ટિંગ: દરેક પ્રોમ્પ્ટ/પુનઃપ્રાપ્તિ/મોડેલ ફેરફાર પર સ્વતઃ-રન ગોલ્ડન ક્લસ્ટર. જો સ્કોર ઘટાડવામાં આવે છે, તો ફેરફાર ઉલટાવી દેવામાં આવે છે. આ "તેને વધુ સારું બનાવવાનો પ્રયાસ કરતી વખતે તેને તોડતા" અટકાવે છે.
- ઉત્પાદન મોનિટરિંગ: વાસ્તવિક પ્રશ્નોમાં "મને માહિતી મળી નથી" દર, સરેરાશ વિલંબ, ખર્ચ, વપરાશકર્તા પ્રતિસાદ (👍/👎) મોનિટર કરવામાં આવે છે. "મને ખબર નથી" માં અચાનક વધારો એ ઘણીવાર ઇન્ડેક્સ અથવા પુનઃપ્રાપ્તિની ખામીનું પ્રથમ સંકેત છે.
- પ્રતિસાદ લૂપ: વપરાશકર્તા દ્વારા પૂરા પાડવામાં આવેલ વાસ્તવિક પ્રશ્નોની સમીક્ષા કરવામાં આવે છે અને ગોલ્ડન પાઇલમાં ઉમેરવામાં આવે છે; આમ, સમય જતાં સમૂહ વધુ સમૃદ્ધ બને છે અને સિસ્ટમના બ્લાઇન્ડ સ્પોટ્સ બંધ થાય છે.
ત્રણ મિની કેસ
કેસ 1 - સાયલન્ટ રીગ્રેશન. એક ટીમે તેને "સુધારવા" માટે પ્રોમ્પ્ટમાં ફેરફાર કર્યો; સામાન્ય ચોકસાઈમાં વધારો થયો, પરંતુ ટ્રેપ પ્રશ્નોમાં વફાદારીમાં 30% ઘટાડો થયો (મોડેલ વધુ ફિટ થવા લાગ્યું). સુવર્ણ ઝુમખામાં છટકું પ્રશ્નો ન હોત તો તે ધ્યાને ન આવ્યું હોત; રીગ્રેસન પરીક્ષણે ફેરફાર પાછો ખેંચ્યો.
કેસ 2 - ખોટા પગને સીધો કરવો. એક સહાયકમાં જવાબો ખરાબ હતા; ટીમે અઠવાડિયા સુધી પ્રોમ્પ્ટ પર કામ કર્યું. જ્યારે અમે પુનઃપ્રાપ્તિ મેટ્રિક્સનું માપન કર્યું, ત્યારે recall@5 માત્ર 48% હતી — સમસ્યા પુનઃપ્રાપ્તિમાં હતી, પેઢીમાં નહીં. જ્યારે હાઇબ્રિડ + રી-રેન્કિંગ ઉમેરવામાં આવ્યું, ત્યારે રિકોલ વધીને 89% થયું અને ચોકસાઈ પણ વધી.
કેસ 3 - ઉત્પાદન ચેતવણી. એક દિવસ, સહાયક સહાયક માટે "હું માહિતી શોધી શક્યો નથી" દર 6% થી વધીને 34% થયો. ટ્રેકપેડ ચેતવણી આપી; કારણ એ હતું કે ઇન્ડેક્સીંગ જોબ, જે રાત્રે ચાલે છે, ચૂપચાપ નિષ્ફળ ગયું અને નવા લેખો અપલોડ થયા ન હતા. દેખરેખ વિના, ખોટા "મને ખબર નથી" નિવેદનો દિવસો સુધી ચાલુ રહેત.
સામાન્ય ભૂલો
- "તે મારા માટે સારું કામ કર્યું" થી સંતુષ્ટ થવું: માપન વિના, રીગ્રેશન કોઈનું ધ્યાન જતું નથી.
- પુનઃપ્રાપ્તિ અને પેઢીને અલગ ન કરવી: તમે ખોટા પગને સુધારશો અને સમય બગાડશો.
- છટકું પ્રશ્નો પૂછતા નથી: વસ્તુઓ બનાવવાની વૃત્તિ ગોલ્ડન ક્લસ્ટરમાં દેખાતી નથી.
- ન્યાયાધીશની ચકાસણી કરતા નથી: પક્ષપાતી જ્યુરી ખોટો વિશ્વાસ આપે છે.
- ઉત્પાદન પર દેખરેખ રાખતા નથી: ઇન્ડેક્સ નિષ્ફળતા, ખર્ચ વિસ્ફોટ શાંતિપૂર્વક ચાલુ રહે છે.
સારાંશમાં
- RAG માં, પુનઃપ્રાપ્તિ અને જનરેશન ગુણવત્તા અલગથી માપવામાં આવે છે; કયા પગને નુકસાન થયું છે તે પહેલાં તે નક્કી કરવું આવશ્યક છે.
- recall@k, precision@k, MRR પુનઃપ્રાપ્તિ માટે; વફાદારી, યોગ્યતા, સંપૂર્ણતાનો ઉપયોગ પેઢી માટે થાય છે.
- દરેક માપ માટે ગોલ્ડ ક્લસ્ટર જરૂરી છે; તેમાં વાસ્તવિક, મુશ્કેલ, છટકું અને વિરોધાભાસી પ્રશ્નો મૂકો.
- LLM-જજ તરીકે મોટા સેટ ઓટો-સ્કોર્સ; પરંતુ ન્યાયાધીશ પોતે માણસ સામે ન્યાયી ઠરાવવો જોઈએ.
- રીગ્રેસન પરીક્ષણ, ઉત્પાદન મોનિટરિંગ અને પ્રતિસાદ લૂપ સમય જતાં ગુણવત્તા જાળવી રાખે છે.
એપ્લિકેશન કાર્ય
(1) તમારા પોતાના સહાયક માટે ઓછામાં ઓછા 15 પ્રશ્નોનો સુવર્ણ સમૂહ બનાવો: ઓછામાં ઓછા 3 ટ્રેપ્સ (કોઈ જવાબો નહીં), 3 મુશ્કેલ, 2 વિરોધાભાસી સ્ત્રોત પ્રશ્નોનો સમાવેશ કરો. દરેક પ્રશ્ન માટે અપેક્ષિત જવાબ અને સાચો ભાગ લખો. (2) આ સમૂહ સાથે મેન્યુઅલી બે અલગ-અલગ પ્રોમ્પ્ટ વર્ઝનની સરખામણી કરો; વફાદારી અને ચોકસાઈ માટે દરેક જવાબને 1-5 પોઈન્ટ આપો. (3) તમારા પોતાના માપદંડો માટે ઉપરોક્ત એલએલએમ-જજ-પ્રોમ્પ્ટને અનુકૂલિત કરો. (4) 3 મેટ્રિક્સને ઓળખો જે તમે ઉત્પાદનમાં ટ્રૅક કરશો અને દરેક માટે પૂછો કે "હું કયા થ્રેશોલ્ડ પર એલાર્મ કરું?" કિંમત લખો.
ચેકલિસ્ટ
- [ ] હું અલગ મેટ્રિક્સ વડે રીટેન્શન અને જનરેશન ગુણવત્તાને માપી શકું છું.
- [ ] મને ખબર છે કે recall@k, વફાદારીનો અર્થ શું છે.
- [ ] હું એક સુવર્ણ ક્લસ્ટર બનાવી શકું છું જેમાં વાસ્તવિક, મુશ્કેલ, છટકું અને વિરોધાભાસી પ્રશ્નોનો સમાવેશ થાય છે.
- [ ] હું સ્વચાલિત મૂલ્યાંકન સેટ કરી શકું છું અને ન્યાયાધીશને LLM-જજ તરીકે ચકાસી શકું છું.
- [ ] હું રીગ્રેશન ટેસ્ટિંગ, પ્રોડક્શન મોનિટરિંગ અને ફીડબેક લૂપ ઓપરેટ કરી શકું છું.