നേട്ടങ്ങൾ:
- നിലനിർത്തലും ജനറേഷൻ നിലവാരവും വെവ്വേറെ അളക്കുന്ന അളവുകൾ നിർവചിക്കുന്നു
- ഒരു സ്വർണ്ണ ചോദ്യ സെറ്റ് സജ്ജീകരിച്ച് LLM-ആസ്-ജഡ്ജ് ഉപയോഗിച്ച് യാന്ത്രിക മൂല്യനിർണ്ണയം നടത്തുക
- ഉൽപ്പാദനത്തിൽ ഫീഡ്ബാക്ക്, നിരീക്ഷണം, റിഗ്രഷൻ ടെസ്റ്റിംഗ് എന്നിവയിലൂടെ ഗുണനിലവാരം നിലനിർത്തുന്നു
"ഞാൻ അസിസ്റ്റൻ്റ് ഇൻസ്റ്റാൾ ചെയ്തു, അത് നന്നായി പ്രവർത്തിക്കുന്നതായി തോന്നുന്നു" എന്ന വാചകം ഒരു എഞ്ചിനീയറിംഗ് പ്രസ്താവനയല്ല. RAG സിസ്റ്റങ്ങൾ നിശബ്ദമായി തകരുന്നു: ഒരു പുതിയ ഡോക്യുമെൻ്റ് തരം വീണ്ടെടുക്കലിനെ കബളിപ്പിക്കുന്നു, പെട്ടെന്നുള്ള മാറ്റം കൃത്യത കുറയ്ക്കുന്നു, സൂചിക പഴയതാകുന്നു. ഇത് തിരിച്ചറിയാനുള്ള ഏക മാർഗം അളക്കുക എന്നതാണ്. ഈ യൂണിറ്റിൽ, RAG ഗുണനിലവാരം (വീണ്ടെടുക്കലും ജനറേഷനും വെവ്വേറെ), ഓട്ടോമാറ്റിക് മൂല്യനിർണ്ണയം (LLM-ആസ്-ജഡ്ജ്), ഉൽപ്പാദനത്തിൽ ഗുണനിലവാരം നിലനിർത്തൽ (നിരീക്ഷണം, റിഗ്രഷൻ) എന്നിവ എങ്ങനെ അളക്കാമെന്നും ഞങ്ങൾ കവർ ചെയ്യുന്നു. "നിങ്ങൾ അളക്കാത്തത് മെച്ചപ്പെടുത്താൻ നിങ്ങൾക്ക് കഴിയില്ല" എന്നതാണ് ഈ യൂണിറ്റിൻ്റെ മുദ്രാവാക്യം.
രണ്ട് പ്രത്യേക കാര്യങ്ങൾ അളക്കുക
RAG-ന് രണ്ട് കാലുകളുണ്ട്, അവയിൽ രണ്ടിലെങ്കിലും പ്രശ്നം ഉണ്ടാകാം എന്നതിനാൽ വെവ്വേറെ അളക്കണം:
- വീണ്ടെടുക്കൽ നിലവാരം: ശരിയായ ഭാഗം എത്തിയോ?
- ജനറേഷൻ നിലവാരം: ശരിയായ ഉത്തരം ഇൻകമിംഗ് പീസ് ഉപയോഗിച്ചോ?
ഉത്തരം മോശമാണെങ്കിൽ ഏത് കാലാണ് മോശമെന്ന് ആദ്യം അറിയണം. ശരിയായ ഭാഗം ഒരിക്കലും വരുന്നില്ലെങ്കിൽ, മികച്ച പ്രോംപ്റ്റിന് പോലും സംരക്ഷിക്കാൻ കഴിയില്ല (വീണ്ടെടുക്കൽ പ്രശ്നം). ശരിയായ ഭാഗം വന്നെങ്കിലും മോഡൽ അത് തെറ്റായി വായിച്ചാൽ, വീണ്ടെടുക്കൽ മെച്ചപ്പെടുത്തുന്നത് വ്യർത്ഥമാണ് (തലമുറയുടെ പ്രശ്നം).
വീണ്ടെടുക്കൽ മെട്രിക്സ്
വീണ്ടെടുക്കൽ ഒരു സോർട്ടിംഗ്/ആക്സസ് പ്രശ്നമാണ്; ക്ലാസിക്കൽ വിവരങ്ങൾ വീണ്ടെടുക്കൽ മെട്രിക്സ് ഉപയോഗിച്ച് അളക്കുന്നു. ഇതിനായി നിങ്ങൾക്ക് ഗോൾഡൻ ക്ലസ്റ്റർ ഉണ്ടായിരിക്കണം: ഓരോ ചോദ്യത്തിനും ഏത് കഷണം "ശരിയാണ്" എന്ന അറിവ്.
മെട്രിക്
എന്ത് അളവുകൾ
ലളിതമായ നിർവചനം
Recall@k
ശരിയായ ഭാഗം മുകളിലുള്ള k യിലാണോ?
ശരിയായ ഭാഗം പിടിച്ചെടുക്കൽ നിരക്ക്
പ്രിസിഷൻ@കെ
തിരികെ നൽകിയ കെ കഷണങ്ങളിൽ എത്രയെണ്ണം പ്രസക്തമാണ്?
കൊണ്ടുവന്നത് വൃത്തിയാക്കൽ
MRR (അർഥം പരസ്പര റാങ്ക്)
ഏത് ക്രമത്തിലാണ് ശരിയായ കഷണം?
റിവാർഡുകൾ ഉയർന്ന റാങ്കുകളിൽ ഉള്ളതാണ്
ഹിറ്റ് നിരക്ക്
ഒരു ശരിയായ കഷണമെങ്കിലും എത്തിയോ?
വിജയത്തിൻ്റെ ഏറ്റവും അടിസ്ഥാന അളവ്
പ്രായോഗിക അഭിപ്രായം: Recall@k കുറവാണെങ്കിൽ, ചങ്കിംഗ് അല്ലെങ്കിൽ തിരയൽ തന്ത്രം (ഹൈബ്രിഡ്, കെ, റീ-റാങ്കിംഗ്) പുനർനിർമ്മിക്കണം. കൃത്യത കുറവാണെങ്കിലും തിരിച്ചുവിളിക്കുന്നത് ഉയർന്നതാണെങ്കിൽ, റീ-റാങ്കിംഗ് ചേർക്കുന്നത് നല്ല നീക്കമാണ്.
ജനറേഷൻ മെട്രിക്സ്
ശരിയായ ഭാഗം വരുമ്പോൾ, മോഡൽ നിർമ്മിക്കുന്ന പ്രതികരണത്തിൻ്റെ ഗുണനിലവാരം ഞങ്ങൾ അളക്കുന്നു. മൂന്ന് അടിസ്ഥാന അളവുകൾ:
- വിശ്വസ്തത: ഉത്തരത്തിലെ ഓരോ അവകാശവാദവും സന്ദർഭം പിന്തുണയ്ക്കുന്നുണ്ടോ? എന്തെങ്കിലും ഫിറ്റിംഗ് ഉണ്ടോ? ഇത് ഹാലുസിനേഷൻ്റെ നേരിട്ടുള്ള അളവുകോലാണ്.
- ഉത്തരത്തിൻ്റെ പ്രസക്തി: ഉത്തരം യഥാർത്ഥത്തിൽ ചോദ്യത്തിന് ഉത്തരം നൽകുന്നതാണോ അതോ വിഷയത്തിന് പുറത്താണോ?
- പൂർണ്ണത: സന്ദർഭത്തിലെ പ്രസക്തമായ എല്ലാ വിവരങ്ങളും ഉപയോഗിച്ചിട്ടുണ്ടോ അതോ നഷ്ടമായോ?
"ശരി/തെറ്റ്" പോലെയുള്ള ബൈനറിക്ക് പകരം ഗ്രേഡഡ് അടിസ്ഥാനത്തിലാണ് (ഉദാ. 1-5) ഇവ പലപ്പോഴും സ്കോർ ചെയ്യുന്നത്.
നുറുങ്ങ്: വിശ്വസ്തതയെ ഒരു പ്രത്യേക മെട്രിക് ആയി ട്രാക്ക് ചെയ്യുക. കൃത്യത കുറയുന്നതിനനുസരിച്ച് വിശ്വസ്തത കുറയുകയാണെങ്കിൽ, പ്രശ്നം തലമുറയാണ്; വിശ്വസ്തത ഉയർന്നതാണെങ്കിലും ഉത്തരം തെറ്റാണെങ്കിൽ, പ്രശ്നം തെറ്റായ ഭാഗമാണ് (വീണ്ടെടുക്കൽ). ഈ രണ്ട് അളവുകളും ഒരുമിച്ച്, തകരാർ ഉള്ള സ്ഥലം കാണിക്കുന്ന ഒരു കോമ്പസാണ്.
ഒരു സുവർണ്ണ ചോദ്യ സെറ്റ് സ്ഥാപിക്കുന്നു
ഓരോ അളവെടുപ്പിനും ഒരു ഗോൾഡൻ സെറ്റ് / മൂല്യനിർണ്ണയ ഡാറ്റാസെറ്റ് ആവശ്യമാണ്: റിയലിസ്റ്റിക് ചോദ്യങ്ങൾ + പ്രതീക്ഷിക്കുന്ന ശരിയായ ഉത്തരങ്ങൾ + ശരിയായ ഉറവിട ഭാഗങ്ങൾ. നന്നായി തിരഞ്ഞെടുത്ത 30-50 ചോദ്യങ്ങളിൽ നിന്ന് ആരംഭിക്കുന്നത് ക്രമരഹിതമായ 500 ചോദ്യങ്ങളേക്കാൾ മികച്ചതാണ്. സെറ്റിൽ ഇനിപ്പറയുന്നവ ഉൾപ്പെടുത്തുക: പതിവായി ചോദിക്കുന്ന യഥാർത്ഥ ചോദ്യങ്ങൾ, അറിയപ്പെടുന്ന ബുദ്ധിമുട്ടുള്ള ചോദ്യങ്ങൾ, ഉത്തരങ്ങളില്ലാത്ത ചോദ്യങ്ങൾ ("എനിക്കറിയില്ല" എന്ന് ഒരാൾ പറയണം), പരസ്പര വിരുദ്ധമായ ഉറവിടങ്ങളുള്ള ചോദ്യങ്ങൾ.
# ഗോൾഡൻ ക്ലസ്റ്റർ ഉദാഹരണം (സങ്കല്പപരം)[ {"ചോദ്യം": "വാർഷിക അവധി എത്ര ദിവസം?", "പ്രതീക്ഷിച്ച_ഉത്തരം": "1-5 വർഷത്തെ സീനിയോറിറ്റിക്ക് 14 ദിവസം", "ശരിയായ_പാർട്ട്_ഐഡി": "രണ്ട്-ഭാഗം-3", "വിഭാഗം": "ലീവ്"}, {"ചോദ്യം": കമ്പനി: "എവിടെയാണ്_" "NO_INFORMATION", # ട്രാപ്പ്: "ശരിയായ_പാർട്ട്_ഐഡി" എനിക്കറിയില്ല: null, "category": "trap"}]
LLM-ആസ്-ജഡ്ജ്: സ്വയമേവയുള്ള വിലയിരുത്തൽ
നൂറുകണക്കിന് ഉത്തരങ്ങൾ കൈകൊണ്ട് സ്കോർ ചെയ്യുന്നത് മടുപ്പിക്കുന്നതാണ്. LLM-as-judge മോഡൽ എന്നത് ഒരു മോഡൽ സ്കോർ ചെയ്യുകയും മറ്റൊരു മോഡലിൻ്റെ ഉത്തരത്തെ ചില മാനദണ്ഡങ്ങളെ അടിസ്ഥാനമാക്കി ന്യായീകരിക്കുകയും ചെയ്യുന്നു. ഒരു നല്ല ജഡ്ജി പ്രോംപ്റ്റ് മാനദണ്ഡങ്ങൾ വ്യക്തമായി നിർവചിക്കുകയും ഉദാഹരണങ്ങൾ നൽകുകയും ന്യായീകരണം ആവശ്യപ്പെടുകയും ചെയ്യുന്നു.
# LLM-ആസ്-ജഡ്ജ് പ്രോംപ്റ്റ് (സങ്കൽപ്പം)നിങ്ങൾ ഒരു നിഷ്പക്ഷ മൂല്യനിർണ്ണയക്കാരനാണ്. നൽകിയിരിക്കുന്ന സാഹചര്യത്തിനും പ്രതീക്ഷിക്കുന്ന ഉത്തരത്തിനും അനുസരിച്ച് ചുവടെയുള്ള ഉത്തരം വിലയിരുത്തുക. സ്കോർ (1-5) കൂടാതെ ന്യായീകരിക്കുക:- വിശ്വസ്തത: ഉത്തരത്തിലെ ഓരോ അവകാശവാദവും സന്ദർഭത്തിൽ പിന്തുണയ്ക്കുന്നുണ്ടോ?- കൃത്യത: ഉത്തരം പ്രതീക്ഷിച്ച ഉത്തരവുമായി പൊരുത്തപ്പെടുന്നുണ്ടോ?- പൂർണ്ണത: പ്രസക്തമായ വിവരങ്ങൾ പൂർണ്ണമാണോ? പ്രത്യേകിച്ചും: ഉത്തരത്തിൽ സന്ദർഭത്തിലല്ലാത്ത വിവരമുണ്ടെങ്കിൽ, വിശ്വസ്തത1 നൽകുകയും ഏത് ക്ലെയിം കെട്ടിച്ചമച്ചതാണെന്ന് സൂചിപ്പിക്കുകയും ചെയ്യുക.CONTEXT: {context}expected: {expected}ANSWER: {answer}ഔട്ട്പുട്ട്: {വിശ്വാസം, കൃത്യത, പൂർണ്ണത, ന്യായീകരണം}
മുന്നറിയിപ്പ്: LLM-ആയി-ജഡ്ജ് തികഞ്ഞതല്ല; അവർക്ക് അവരുടേതായ പക്ഷപാതങ്ങൾ ഉണ്ടായിരിക്കാം (ദീർഘമായ ഉത്തരം, അവരുടേതായ ശൈലി തിരഞ്ഞെടുക്കുന്നു). ജഡ്ജിയും പരിശോധിച്ചുറപ്പിക്കുക: ജഡ്ജിയും മനുഷ്യനും ചില ഉത്തരങ്ങൾ സ്കോർ ചെയ്യുകയും അവർ തമ്മിലുള്ള കരാർ അളക്കുകയും ചെയ്യുക. ജഡ്ജി മാനുഷിക സ്കോറുകളുമായി പൊരുത്തപ്പെടുന്നെങ്കിൽ, നിങ്ങൾക്ക് അദ്ദേഹത്തെ വിശ്വസിക്കാം.
ദുർബലമായ/ശക്തമായ റേറ്റിംഗ്
ദുർബലമായ ("ഇത് എനിക്ക് നല്ലതായിരുന്നു"):
ഞാൻ കുറച്ച് ചോദ്യങ്ങൾ ചോദിച്ചു, ഉത്തരങ്ങൾ മികച്ചതായി തോന്നി. എനിക്ക് അത് തത്സമയം ലഭിച്ചു.# പ്രശ്നം: അളവുകളില്ല, റിഗ്രഷൻ അദൃശ്യമാണ്, മെച്ചപ്പെടുത്തൽ അന്ധത.
ശക്തമായ (സ്വർണ്ണ ക്ലസ്റ്റർ + വ്യതിരിക്തമായ മെട്രിക്സ് + യാന്ത്രിക വിധി + റിഗ്രഷൻ):
40 ചോദ്യങ്ങളുടെ ഗോൾഡൻ ക്ലസ്റ്റർ. ഓരോ മാറ്റത്തിലും, recall@5, വിശ്വസ്തതയും കൃത്യതയും യാന്ത്രികമായി അളക്കുന്നു. സ്കോർ കുറയുകയാണെങ്കിൽ, മാറ്റം പിൻവലിക്കും. നിർമ്മാണത്തിൽ, ഉപയോക്തൃ ഫീഡ്ബാക്ക് ശേഖരിക്കുകയും സെറ്റിലേക്ക് ചേർക്കുകയും ചെയ്യുന്നു.
ഉൽപ്പാദനത്തിലെ നിരീക്ഷണവും പിന്നോക്കാവസ്ഥയും
മൂല്യനിർണ്ണയം ഒരു പ്രാവശ്യം പൂർത്തിയാക്കിയിട്ടില്ല. മൂന്ന് സ്ഥിരമായ പരിശീലനങ്ങൾ:
- റിഗ്രഷൻ ടെസ്റ്റിംഗ്: ഓരോ പ്രോംപ്റ്റിലും/വീണ്ടെടുക്കലും/മോഡൽ മാറ്റത്തിലും സ്വയമേവ പ്രവർത്തിപ്പിക്കുന്ന ഗോൾഡൻ ക്ലസ്റ്റർ. സ്കോർ കുറയുകയാണെങ്കിൽ, മാറ്റം വിപരീതമാണ്. ഇത് "മികച്ചതാക്കാൻ ശ്രമിക്കുമ്പോൾ അത് തകർക്കുന്നത്" തടയുന്നു.
- പ്രൊഡക്ഷൻ മോണിറ്ററിംഗ്: യഥാർത്ഥ ചോദ്യങ്ങളിലെ "എനിക്ക് വിവരങ്ങൾ കണ്ടെത്താനായില്ല" നിരക്ക്, ശരാശരി കാലതാമസം, ചെലവ്, ഉപയോക്തൃ ഫീഡ്ബാക്ക് (👍/👎) എന്നിവ നിരീക്ഷിക്കപ്പെടുന്നു. "എനിക്കറിയില്ല" എന്നതിൻ്റെ പെട്ടെന്നുള്ള വർദ്ധനവ് പലപ്പോഴും ഒരു സൂചിക അല്ലെങ്കിൽ വീണ്ടെടുക്കൽ തകരാറിൻ്റെ ആദ്യ സൂചനയാണ്.
- ഫീഡ്ബാക്ക് ലൂപ്പ്: ഉപയോക്താവ് 👎 നൽകിയ യഥാർത്ഥ ചോദ്യങ്ങൾ അവലോകനം ചെയ്യുകയും ഗോൾഡൻ ചിതയിലേക്ക് ചേർക്കുകയും ചെയ്യുന്നു; അങ്ങനെ, സെറ്റ് കാലക്രമേണ സമ്പന്നമാവുകയും സിസ്റ്റത്തിൻ്റെ അന്ധമായ പാടുകൾ അടയുകയും ചെയ്യുന്നു.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - സൈലൻ്റ് റിഗ്രഷൻ. ഒരു ടീം അത് "മെച്ചപ്പെടുത്താൻ" നിർദ്ദേശം പരിഷ്കരിച്ചു; പൊതുവായ കൃത്യത വർദ്ധിച്ചു, പക്ഷേ ട്രാപ്പ് ചോദ്യങ്ങളിൽ വിശ്വസ്തത 30% കുറഞ്ഞു (മോഡൽ കൂടുതൽ അനുയോജ്യമാകാൻ തുടങ്ങി). പൊൻകൂട്ടത്തിലെ കെണി ചോദ്യങ്ങൾ ഇല്ലായിരുന്നെങ്കിൽ ഇത് ശ്രദ്ധിക്കപ്പെടുമായിരുന്നില്ല; റിഗ്രഷൻ ടെസ്റ്റിംഗ് മാറ്റം പഴയപടിയാക്കി.
കേസ് 2 - തെറ്റായ കാൽ നേരെയാക്കുക. ഒരു സഹായിയുടെ ഉത്തരങ്ങൾ മോശമായിരുന്നു; ടീം ആഴ്ചകളോളം പ്രോംപ്റ്റിൽ പ്രവർത്തിച്ചു. ഞങ്ങൾ വീണ്ടെടുക്കൽ മെട്രിക്സ് അളന്നപ്പോൾ, recall@5 48% മാത്രമായിരുന്നു - പ്രശ്നം വീണ്ടെടുക്കലിലാണ്, ജനറേഷനല്ല. ഹൈബ്രിഡ് + റീ-റാങ്കിംഗ് ചേർത്തപ്പോൾ, തിരിച്ചുവിളിക്കൽ 89% ആയി വർദ്ധിച്ചു, ഒപ്പം കൃത്യതയും വർദ്ധിച്ചു.
കേസ് 3 - പ്രൊഡക്ഷൻ അലേർട്ട്. ഒരു ദിവസം, ഒരു സപ്പോർട്ട് അസിസ്റ്റൻ്റിനുള്ള "എനിക്ക് വിവരങ്ങൾ കണ്ടെത്താൻ കഴിഞ്ഞില്ല" നിരക്ക് 6% ൽ നിന്ന് 34% ആയി ഉയർന്നു. ട്രാക്ക്പാഡ് മുന്നറിയിപ്പ് നൽകി; കാരണം, രാത്രിയിൽ പ്രവർത്തിക്കുന്ന ഇൻഡെക്സിംഗ് ജോലി നിശബ്ദമായി പരാജയപ്പെടുകയും പുതിയ ലേഖനങ്ങൾ അപ്ലോഡ് ചെയ്യപ്പെടാതിരിക്കുകയും ചെയ്തു. നിരീക്ഷണം ഇല്ലായിരുന്നെങ്കിൽ, "എനിക്കറിയില്ല" എന്ന തെറ്റായ പ്രസ്താവനകൾ ദിവസങ്ങളോളം തുടരുമായിരുന്നു.
സാധാരണ തെറ്റുകൾ
- "ഇത് എനിക്ക് നന്നായി പ്രവർത്തിച്ചു" എന്നതിൽ സംതൃപ്തനായിരിക്കുക: അളവെടുക്കാതെ, റിഗ്രഷൻ ശ്രദ്ധിക്കപ്പെടാതെ പോകുന്നു.
- വീണ്ടെടുക്കലും തലമുറയും വേർതിരിക്കുന്നില്ല: നിങ്ങൾ തെറ്റായ കാൽ തിരുത്തി സമയം പാഴാക്കും.
- ട്രാപ്പ് ചോദ്യങ്ങൾ ചോദിക്കുന്നില്ല: കാര്യങ്ങൾ ഉണ്ടാക്കാനുള്ള പ്രവണത സുവർണ്ണ ക്ലസ്റ്ററിൽ ദൃശ്യമാകില്ല.
- ജഡ്ജിയെ പരിശോധിക്കുന്നില്ല: പക്ഷപാതപരമായ ജൂറി തെറ്റായ ആത്മവിശ്വാസം നൽകുന്നു.
- ഉൽപ്പാദനം നിരീക്ഷിക്കുന്നില്ല: സൂചിക പരാജയം, ചെലവ് പൊട്ടിത്തെറി നിശബ്ദമായി തുടരുന്നു.
ചുരുക്കത്തിൽ
- RAG-ൽ, വീണ്ടെടുക്കലും ജനറേഷൻ ഗുണനിലവാരവും വെവ്വേറെ അളക്കുന്നു; ഏത് കാലിനാണ് കേടുപാടുകൾ സംഭവിച്ചതെന്ന് ആദ്യം കണ്ടെത്തണം.
- വീണ്ടെടുക്കലിനായി recall@k, precision@k, MRR; വിശ്വസ്തത, അനുയോജ്യത, സമ്പൂർണ്ണത എന്നിവ തലമുറയ്ക്കായി ഉപയോഗിക്കുന്നു.
- ഓരോ അളവെടുപ്പിനും ഒരു സ്വർണ്ണ ക്ലസ്റ്റർ ആവശ്യമാണ്; അതിൽ യഥാർത്ഥവും ബുദ്ധിമുട്ടുള്ളതും കെണിയും പരസ്പരവിരുദ്ധവുമായ ചോദ്യങ്ങൾ ഇടുക.
- LLM-ആസ്-ജഡ്ജ് വലിയ സെറ്റുകൾ സ്വയമേവ സ്കോറുകൾ; ന്യായാധിപൻ തന്നെ മനുഷ്യനെതിരെ നീതീകരിക്കപ്പെടണം.
- റിഗ്രഷൻ ടെസ്റ്റിംഗ്, പ്രൊഡക്ഷൻ മോണിറ്ററിംഗ്, ഒരു ഫീഡ്ബാക്ക് ലൂപ്പ് എന്നിവ കാലക്രമേണ ഗുണനിലവാരം നിലനിർത്തുന്നു.
ആപ്ലിക്കേഷൻ ടാസ്ക്
(1) നിങ്ങളുടെ സ്വന്തം അസിസ്റ്റൻ്റിന് കുറഞ്ഞത് 15 ചോദ്യങ്ങളുടെ ഒരു സുവർണ്ണ സെറ്റ് സൃഷ്ടിക്കുക: കുറഞ്ഞത് 3 ട്രാപ്പുകളെങ്കിലും (ഉത്തരങ്ങളൊന്നുമില്ല), 3 ബുദ്ധിമുട്ടുള്ളതും 2 വൈരുദ്ധ്യാത്മകവുമായ ഉറവിട ചോദ്യങ്ങൾ ഉൾപ്പെടുത്തുക. ഓരോ ചോദ്യത്തിനും പ്രതീക്ഷിക്കുന്ന ഉത്തരവും ശരിയായ ഭാഗവും എഴുതുക. (2) ഈ സെറ്റുമായി രണ്ട് വ്യത്യസ്ത പ്രോംപ്റ്റ് പതിപ്പുകൾ സ്വമേധയാ താരതമ്യം ചെയ്യുക; വിശ്വസ്തതയ്ക്കും കൃത്യതയ്ക്കും ഓരോ ഉത്തരത്തിനും 1-5 പോയിൻ്റുകൾ നൽകുക. (3) മുകളിലുള്ള LLM-as-judge പ്രോംപ്റ്റ് നിങ്ങളുടെ സ്വന്തം മാനദണ്ഡത്തിന് അനുയോജ്യമാക്കുക. (4) ഉൽപ്പാദനത്തിൽ നിങ്ങൾ ട്രാക്ക് ചെയ്യുന്ന 3 മെട്രിക്കുകൾ തിരിച്ചറിയുക, ഓരോന്നിനും "ഏത് പരിധിയിലാണ് ഞാൻ അലാറം ചെയ്യുന്നത്?" മൂല്യം എഴുതുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] എനിക്ക് പ്രത്യേക അളവുകൾ ഉപയോഗിച്ച് നിലനിർത്തലും ജനറേഷൻ നിലവാരവും അളക്കാൻ കഴിയും.
- [ ] recall@k, വിശ്വസ്തത പോലുള്ള മെട്രിക്സിൻ്റെ അർത്ഥമെന്താണെന്ന് എനിക്കറിയാം.
- [ ] എനിക്ക് യഥാർത്ഥവും ബുദ്ധിമുട്ടുള്ളതും കെണിയും പരസ്പരവിരുദ്ധവുമായ ചോദ്യങ്ങൾ ഉൾപ്പെടുന്ന ഒരു സുവർണ്ണ ക്ലസ്റ്റർ നിർമ്മിക്കാൻ കഴിയും.
- [ ] എനിക്ക് യാന്ത്രിക മൂല്യനിർണ്ണയം സജ്ജീകരിക്കാനും LLM-ആസ്-ജഡ്ജ് ഉപയോഗിച്ച് ജഡ്ജിയെ പരിശോധിക്കാനും കഴിയും.
- [ ] എനിക്ക് റിഗ്രഷൻ ടെസ്റ്റിംഗ്, പ്രൊഡക്ഷൻ മോണിറ്ററിംഗ്, ഫീഡ്ബാക്ക് ലൂപ്പ് എന്നിവ പ്രവർത്തിപ്പിക്കാൻ കഴിയും.