നേട്ടങ്ങൾ:
- മോഡലിൻ്റെ അപചയത്തിൻ്റെ നിശ്ശബ്ദമായ കാരണങ്ങൾ (ഡാറ്റ ഡ്രിഫ്റ്റ്, കൺസെപ്റ്റ് ഡ്രിഫ്റ്റ്, അപ്സ്ട്രീം പിശക്) തിരിച്ചറിയാനും ത്രീ-ലെയർ (ഓപ്പറേഷണൽ, ഇൻപുട്ട്, ഔട്ട്പുട്ട്) മോണിറ്ററിംഗ് സ്ഥാപിക്കാനുമുള്ള കഴിവ്
- റൂൾ ചെക്കുകൾ, LLM-റഫറി, ഹ്യൂമൻ മൂല്യനിർണ്ണയം എന്നിവ ഉപയോഗിച്ച് ഒന്നിലധികം ലെയറുകളിൽ LLM സിസ്റ്റങ്ങളെ വിലയിരുത്താനും LLM-റഫറി ഹ്യൂമൻ ആങ്കർ ഉപയോഗിച്ച് കാലിബ്രേറ്റ് ചെയ്യാനും ഉള്ള കഴിവ്
- എഡ്ജ്, സെക്യൂരിറ്റി കേസുകൾ എന്നിവ ഉൾക്കൊള്ളുന്ന ഒരു എവൽ സെറ്റ് രൂപകൽപ്പന ചെയ്യാനും പിടിക്കപ്പെട്ട ഓരോ പിശകും സ്ഥിരമായ ടെസ്റ്റ് കേസാക്കി മാറ്റാനുമുള്ള കഴിവ്
ഒരു മോഡൽ നിർമ്മാണത്തിലേക്ക് പോയിക്കഴിഞ്ഞാൽ, നിങ്ങളുടെ ജോലി പൂർത്തിയായില്ല; യഥാർത്ഥ ഉത്തരവാദിത്തം ആരംഭിക്കുന്നു. കാരണം, ആരും നോക്കാത്തപ്പോൾ മോഡൽ നിശബ്ദമായി തകർക്കാൻ കഴിയും. ഈ യൂണിറ്റിൽ, ഞങ്ങൾ രണ്ട് അനുബന്ധ വിഷയങ്ങൾ ഉൾക്കൊള്ളുന്നു: മൂല്യനിർണ്ണയം (മോഡലിൻ്റെ ഗുണനിലവാരം വ്യവസ്ഥാപിതമായി അളക്കൽ), നിരീക്ഷണം (ഉത്പാദനത്തിൽ മോഡലിൻ്റെ നിരന്തരമായ നിരീക്ഷണം). പ്രത്യേകിച്ചും LLM സിസ്റ്റങ്ങളിൽ, ഇവവൽ കൂടുതൽ ബുദ്ധിമുട്ടുള്ളതും ക്ലാസിക്കൽ ML-നേക്കാൾ കൂടുതൽ പരിചരണം ആവശ്യമുള്ളതുമാണ്.
എന്തുകൊണ്ടാണ് പ്രൊഡക്ഷൻ മോഡൽ നിശബ്ദമായി തകരുന്നത്
ഒരു ബഗ് തകരാറിലാകുന്നു, ലോഗ് പ്രിൻ്റ് ചെയ്യുന്നു, അലാറം ഓഫാകുന്നു. മറുവശത്ത്, ഒരു ML മോഡൽ, പിശകുകൾ വരുത്താതെ തെറ്റായിരിക്കാം. തകർച്ചയുടെ മൂന്ന് പ്രധാന കാരണങ്ങൾ:
- ഡാറ്റ ഡ്രിഫ്റ്റ്: ഇൻപുട്ട് ഡാറ്റയുടെ വിതരണം കാലക്രമേണ മാറുന്നു (പുതിയ ഉൽപ്പന്നങ്ങൾ, മാറുന്ന ഉപയോക്തൃ സ്വഭാവം, കാലാനുസൃതത). മോഡൽ അതേപടി നിലനിൽക്കുന്നു, പക്ഷേ ലോകം മാറുന്നു.
- കൺസെപ്റ്റ് ഡ്രിഫ്റ്റ്: ഇൻപുട്ട്-ഔട്ട്പുട്ട് ബന്ധം മാറുന്നു. വഞ്ചന തന്ത്രങ്ങളും സ്പാം പാറ്റേണുകളും വികസിക്കുന്നു; ഇന്നലെ ശരിയായത് ഇന്ന് തെറ്റാകും.
- അപ്സ്ട്രീം അഴിമതി: ഒരു ഡാറ്റ ഉറവിടം ഫോർമാറ്റ് മാറ്റുന്നു, ഒരു പ്രദേശം സ്വതന്ത്രമാകുന്നു; കേടായ ഇൻപുട്ടിൽ മോഡൽ നിശബ്ദമായി തുള്ളിക്കളിക്കുന്നു.
ട്രെയ്സിംഗ് ഈ നിശബ്ദ വക്രീകരണങ്ങളെ കേൾക്കാവുന്നതാക്കുന്നു.
എന്താണ് കാണേണ്ടത്: മൂന്ന് പാളികൾ
നല്ല നിരീക്ഷണം മൂന്ന് ലെയറുകളെ ഉൾക്കൊള്ളുന്നു:
- പ്രവർത്തന അളവുകൾ: ലേറ്റൻസി, പിശക് നിരക്ക്, അഭ്യർത്ഥന അളവ്, ഉറവിട ഉപയോഗം. "സിസ്റ്റം നിലവിലുണ്ടോ?"
- ഡാറ്റ/ഇൻപുട്ട് മെട്രിക്സ്: പരിശീലനത്തിലെ ഇൻപുട്ട് വിതരണം സമാനമാണോ? നഷ്ടപ്പെട്ട മൂല്യത്തിൻ്റെ നിരക്ക് വർദ്ധിച്ചിട്ടുണ്ടോ? പുതിയ വിഭാഗങ്ങൾ വന്നിട്ടുണ്ടോ? "മോഡലിന് പരിചിതമായ ഡാറ്റ കാണുന്നുണ്ടോ?"
- മോഡൽ/ഔട്ട്പുട്ട് മെട്രിക്സ്: പ്രവചന വിതരണ ലോഗ്? ആത്മവിശ്വാസ സ്കോറുകൾ കുറഞ്ഞോ? സാധ്യമെങ്കിൽ, അടിസ്ഥാന സത്യവുമായി താരതമ്യപ്പെടുത്തുമ്പോൾ എന്താണ് കൃത്യത? "മോഡൽ ഇപ്പോഴും കൃത്യമാണോ?"
മൂന്നാമത്തെ പാളി ഏറ്റവും മൂല്യവത്തായതും എന്നാൽ ഏറ്റവും ബുദ്ധിമുട്ടുള്ളതുമാണ്; കാരണം യഥാർത്ഥ ഫലം സാധാരണയായി കാലതാമസത്തോടെയാണ് വരുന്നത് (ഒരു വായ്പ തിരിച്ചടയ്ക്കുമോ ഇല്ലയോ എന്ന് മാസങ്ങൾക്ക് ശേഷം വ്യക്തമാകും).
നുറുങ്ങ്: യഥാർത്ഥ ഫലം വൈകുകയാണെങ്കിൽ, ആദ്യം ഇൻപുട്ടും പ്രവചന വിതരണവും നിരീക്ഷിക്കുക. ഇൻപുട്ട് വിതരണത്തിൻ്റെ ഷിഫ്റ്റ് കൃത്യത ശോഷണത്തിൻ്റെ ആദ്യകാല സൂചനയാണ്, യഥാർത്ഥ ഫലത്തിനായി കാത്തുനിൽക്കാതെ ഒരു അലാറം ഉയർത്താം.
LLM സിസ്റ്റങ്ങൾ വിലയിരുത്തുന്നു: പ്രത്യേക വെല്ലുവിളി
ക്ലാസിക്കൽ ML-ൽ, "ശരിയായ ഉത്തരം" വ്യക്തമാണ് (ക്ലാസ് 0 അല്ലെങ്കിൽ 1). നേരെമറിച്ച്, LLM ഫലം തുറന്നതാണ്: ഒരേ ചോദ്യത്തിന് നിരവധി ശരിയായ ഉത്തരങ്ങൾ ഉണ്ടാകാം, "കൃത്യത" ഒരു സംഖ്യയിൽ യോജിക്കുന്നില്ല. LLM eval സമീപനങ്ങൾ:
- പരാമർശിച്ച മെട്രിക്സ്: ഔട്ട്പുട്ടിനെ അനുയോജ്യമായ ഉത്തരവുമായി താരതമ്യം ചെയ്യുന്നു. ലിമിറ്റഡ്; കാരണം വ്യത്യസ്തമായി പ്രകടിപ്പിക്കുന്ന ശരിയായ ഉത്തരം "തെറ്റായി" അത് കണക്കാക്കിയേക്കാം.
- നിയമങ്ങളെ അടിസ്ഥാനമാക്കിയുള്ള പരിശോധനകൾ: ഔട്ട്പുട്ട് സാധുവായ JSON ആണോ? നിരോധിത വാക്കുകൾ ഉണ്ടോ? അതിൽ ആവശ്യമുള്ള ഫീൽഡുകൾ അടങ്ങിയിട്ടുണ്ടോ? വിലകുറഞ്ഞ, വിശ്വസനീയമായ, ഇറുകിയ.
- LLM-ജഡ്ജ് (LLM-ജഡ്ജ്): "ഈ മാനദണ്ഡം അനുസരിച്ച് ഈ ഉത്തരം നല്ലതാണോ?" എന്ന് ഒരു മോഡൽ ചോദിക്കരുത്. ഇത് സ്കെയിൽ ചെയ്യുന്നു, പക്ഷേ റഫറി തന്നെ പരിശോധിച്ചിരിക്കണം.
- മാനുഷിക അവലോകനം: ഗോൾഡ് സ്റ്റാൻഡേർഡ് എന്നാൽ ചെലവേറിയതും മന്ദഗതിയിലുള്ളതുമാണ്. ഇത് സാമ്പിളിൽ ഉപയോഗിക്കുന്നു.
പ്രായോഗികമായി ഇവ ഒരുമിച്ച് ഉപയോഗിക്കുന്നു: ഓരോ ഔട്ട്പുട്ടിലും വിലകുറഞ്ഞ റൂൾ ചെക്കുകൾ, ഒരു വലിയ സാമ്പിളിൽ LLM-ജഡ്ജ്, ചെറുതും എന്നാൽ കർശനവുമായ സാമ്പിളിൽ മാനുഷിക വിലയിരുത്തൽ.
ദുർബലമായ സമീപനം / ശക്തമായ സമീപനം
ദുർബലം: "LLM-ഞാൻ റഫറിയോട് ചോദിച്ചു, ഞങ്ങളുടെ 92% ഉത്തരങ്ങളും മികച്ചതായിരുന്നു. സിസ്റ്റം മികച്ചതാണ്."
ഗൂക്ലൂ: "ഞങ്ങൾ ആദ്യം 100 പ്രിൻ്റൗട്ടുകൾ ലേബൽ ചെയ്തു. 100 പ്രിൻ്റൗട്ടുകളിൽ ഞങ്ങൾ LLM-ജഡ്ജിയെ ഓടിക്കുകയും മനുഷ്യ-ജഡ്ജി ഉടമ്പടി അളക്കുകയും ചെയ്തു - 85% ഉടമ്പടി, സ്വീകാര്യമാണ്. ജഡ്ജിക്ക് വ്യവസ്ഥാപിതമായി എവിടെയാണ് പിഴവ് സംഭവിച്ചതെന്ന് ഞങ്ങൾ രേഖപ്പെടുത്തി (നീണ്ട ഉത്തരങ്ങൾ അന്യായമായി കണ്ടെത്താനുള്ള പ്രവണത) ഞങ്ങൾ അദ്ദേഹത്തിൻ്റെ സ്കോർ ഉറപ്പിച്ചു."
വ്യത്യാസം: ശക്തമായ സമീപനം അന്ധമായിട്ടല്ല, ഒരു ഹ്യൂമൻ ആങ്കർ ഉപയോഗിച്ച് റഫറിയെ പരിശോധിക്കുന്നു. പരിശോധിച്ചുറപ്പിക്കാത്ത ഒരു LLM-റഫറി ഭംഗിയുള്ളതും എന്നാൽ തെറ്റായ ആത്മവിശ്വാസവും നൽകുന്നു.
ശ്രദ്ധിക്കുക: LLM- റഫറിയും ഒരു മാതൃകയാണ്; ഹാലുസിനോജെനിക്, പക്ഷപാതം (ദീർഘമായ/ആത്മവിശ്വാസമുള്ള ഉത്തരങ്ങളെ അനുകൂലിക്കുന്നു), പൊരുത്തമില്ലാത്തതായിരിക്കാം. പ്രൊഡക്ഷൻ തീരുമാനങ്ങൾ എടുക്കുന്നതിന് മുമ്പ് ഹ്യൂമൻ ടാഗുകൾ ഉപയോഗിച്ച് റഫറി സ്കോറുകൾ കാലിബ്രേറ്റ് ചെയ്യുക.
മൂല്യനിർണ്ണയ സെറ്റ്: ശ്രദ്ധാപൂർവ്വം രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്
ഒരു നല്ല എവൽ സെറ്റ് യഥാർത്ഥ ഉപയോഗത്തിൻ്റെ വൈവിധ്യത്തെയും ബുദ്ധിമുട്ടുള്ള കേസുകളെയും പ്രതിനിധീകരിക്കുന്നു. ലളിതമായ ഉദാഹരണങ്ങൾ കൊണ്ട് നിറഞ്ഞ ഒരു എവൽ നിങ്ങളെ തെറ്റായ ആത്മവിശ്വാസത്തിൽ ആക്കും. ഇത് എവൽ ക്ലസ്റ്ററിൽ ഇടുന്നത് ഉറപ്പാക്കുക:
- എഡ്ജ് കേസുകൾ: ശൂന്യമായ ഇൻപുട്ട്, വളരെ നീണ്ട ഇൻപുട്ട്, അസാധാരണ ഫോർമാറ്റ്.
- അറിയപ്പെടുന്ന ഹാർഡ് കേസുകൾ: മോഡൽ മുമ്പ് തെറ്റുകൾ വരുത്തിയ ഉദാഹരണങ്ങൾ (ഒരു റിഗ്രഷൻ ടെസ്റ്റ് ആയി).
- സുരക്ഷാ സംഭവങ്ങൾ: പെട്ടെന്നുള്ള കുത്തിവയ്പ്പ് ശ്രമങ്ങൾ, ക്ഷുദ്രകരമായ അഭ്യർത്ഥനകൾ, സ്വകാര്യത ലംഘിക്കുന്ന കെണികൾ.
കാലക്രമേണ ഈവൽ ക്ലസ്റ്റർ വളരുന്നു: ഉൽപ്പാദനത്തിൽ നിങ്ങൾ പിടിക്കുന്ന ഓരോ പുതിയ ബഗും അടുത്ത മൂല്യനിർണ്ണയത്തിനുള്ള ഒരു പരീക്ഷണ കേസായി മാറുന്നു.
അലാറവും ഇടപെടലും
ഒരു അലാറം കൂടാതെ നിരീക്ഷണം അപൂർണ്ണമായി തുടരുന്നു. ഓരോ പ്രധാന മെട്രിക്കിനും ഒരു പരിധിയും പ്രതികരണ പ്ലാനും ഉണ്ടായിരിക്കണം: "ഇൻപുട്ട് ഡ്രിഫ്റ്റ് X കവിയുന്നുവെങ്കിൽ എഞ്ചിനീയറെ അറിയിക്കുക", "പിശക് നിരക്ക് Y കവിയുന്നുവെങ്കിൽ യാന്ത്രിക റോൾ ബാക്ക്". അലാറങ്ങൾ അർത്ഥവത്തായി സൂക്ഷിക്കുക - വളരെയധികം തെറ്റായ അലാറങ്ങൾ ടീമിനെ നിർജ്ജീവമാക്കുകയും യഥാർത്ഥ അലാറം നഷ്ടപ്പെടുത്തുകയും ചെയ്യുന്നു.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - നേരത്തെയുള്ള മുന്നറിയിപ്പ്. ഡിമാൻഡ് പ്രവചന മോഡലിൻ്റെ യഥാർത്ഥ കൃത്യത ആഴ്ചയുടെ അവസാനത്തിൽ മാത്രമേ വ്യക്തമാകൂ. ഇൻപുട്ട് വിതരണം നിരീക്ഷിച്ച സംഘം ചൊവ്വാഴ്ച ഒരു പുതിയ ഉൽപ്പന്ന വിഭാഗത്തിൻ്റെ പെട്ടെന്നുള്ള ഉയർച്ച കണ്ടു - മോഡൽ ഇതുവരെ കണ്ടിട്ടില്ലാത്ത ഒന്ന്. കൃത്യത കുറയുന്നതിന് കാത്തുനിൽക്കാതെ അവർ മോഡൽ അപ്ഡേറ്റ് ചെയ്തു. ഇൻപുട്ട് മോണിറ്ററിംഗ് ദിവസങ്ങൾ സംരക്ഷിച്ചു.
കേസ് 2 - സ്ഥിരീകരിക്കാത്ത റഫറി. LLM-അവലോകനത്തെ അടിസ്ഥാനമാക്കി "ഞങ്ങളുടെ ഗുണനിലവാരം മികച്ചതാണ്" എന്ന് ഒരു ടീം റിപ്പോർട്ട് ചെയ്തു. ഉപഭോക്തൃ പരാതികൾ വർദ്ധിച്ചപ്പോൾ, മാനുഷിക നിരീക്ഷണം ഏർപ്പെടുത്തി: റഫറി ആത്മവിശ്വാസത്തോടെയും എന്നാൽ തെറ്റായ ഉത്തരങ്ങൾ "നല്ലത്" ആയി കണക്കാക്കി. ഹ്യൂമൻ ടാഗുകൾ ഉപയോഗിച്ച് റഫറി കാലിബ്രേറ്റ് ചെയ്തുകഴിഞ്ഞാൽ, യഥാർത്ഥ ഗുണനിലവാരം വെളിപ്പെട്ടു, അത് വളരെ കുറവായിരുന്നു. പാഠം: പരിശോധിച്ചുറപ്പിക്കാതെ റഫറിയെ വിശ്വസിക്കരുത്.
കേസ് 3 - റിഗ്രഷൻ ടെസ്റ്റിംഗ്. പെട്ടെന്നുള്ള മാറ്റം ഒരു പ്രശ്നം പരിഹരിച്ചു, അതേസമയം മറ്റൊന്നിനെ നിശബ്ദമായി തകർക്കുന്നു. എന്നാൽ ടീം കഴിഞ്ഞ ബഗുകൾ ഇവാൽ ബക്കറ്റിൽ സൂക്ഷിച്ചു; ഈ ക്ലസ്റ്ററിൽ പുതിയ മാറ്റം പരീക്ഷിച്ചപ്പോൾ, തകർന്ന കേസ് ഉടൻ പിടിക്കുകയും മാറ്റം ശരിയാക്കുകയും ചെയ്തു. പാഠം: സ്ഥിരമായ എല്ലാ ബഗുകളും സ്ഥിരമായ ഒരു പരീക്ഷണ കേസായി മാറണം.
പകർത്താവുന്ന ടെംപ്ലേറ്റുകൾ
ഈ പ്രൊഡക്ഷൻ മോഡലിനായി ഒരു ട്രാക്കിംഗ് പ്ലാൻ നിർമ്മിക്കുക. മൂന്ന് ലെയറുകൾ കവർ ചെയ്യുക:1) പ്രവർത്തനപരം (ലേറ്റൻസി, പിശക് നിരക്ക്, വോളിയം)2) ഇൻപുട്ട്/ഡാറ്റ (വിതരണ ഷിഫ്റ്റ്, നഷ്ടപ്പെട്ട മൂല്യം, പുതിയ വിഭാഗം)3) മോഡൽ/ഔട്ട്പുട്ട് (പ്രവചന വിതരണം, ആത്മവിശ്വാസം, സാധ്യമെങ്കിൽ കൃത്യത) മോഡൽ: [വിവരണം]. യഥാർത്ഥ ഫലം വരാൻ എത്ര സമയമെടുക്കും: [ദൈർഘ്യം]ഓരോ മെട്രിക്കിനും ത്രെഷോൾഡും ഇടപെടൽ ശുപാർശയും ചേർക്കുക.
ഈ LLM സിസ്റ്റത്തിനായി ഒരു മൂല്യനിർണ്ണയ (eval) തന്ത്രം നിർദ്ദേശിക്കുക. ടാസ്ക്: [വിവരണം] ലെയറുകൾ നിർണ്ണയിക്കുക:- ഓരോ ഔട്ട്പുട്ടിലും ഏത് റൂൾ അടിസ്ഥാനമാക്കിയുള്ള ചെക്കുകളാണ് പ്രവർത്തിക്കേണ്ടത്?- LLM-ആർബിട്രേറ്റർ എന്ത് മാനദണ്ഡം വിലയിരുത്തണം, അവ എങ്ങനെ സാധൂകരിക്കണം (മനുഷ്യ ആങ്കർ)?- ഏത് സാമ്പിളിലാണ് മനുഷ്യ മൂല്യനിർണ്ണയം നടത്തേണ്ടത്.
ഈ LLM-റഫറി പ്രോംപ്റ്റ് പരിശോധിക്കുക:- മൂല്യനിർണ്ണയ മാനദണ്ഡം വ്യക്തമാണോ അതോ ആത്മനിഷ്ഠമാണോ?- ഇത് ദൈർഘ്യം/ആത്മവിശ്വാസ പക്ഷപാതത്തിന് സാധ്യതയുണ്ടോ?- ഹ്യൂമൻ ടാഗുകൾ ഉപയോഗിച്ച് റഫറിയെ എങ്ങനെ കാലിബ്രേറ്റ് ചെയ്യാം? റഫറി പ്രോംപ്റ്റ്: [prompt]
ഈ നിരീക്ഷണ അലാറത്തിനായി ഒരു പ്രതികരണ റൺബുക്ക് എഴുതുക. അലാറം: [ഉദാ. ഇൻപുട്ട് ഡ്രിഫ്റ്റ് ത്രെഷോൾഡ് കവിഞ്ഞു] അടങ്ങിയിരിക്കണം: പ്രാരംഭ നിയന്ത്രണ ഘട്ടങ്ങൾ, സാധ്യമായ കാരണങ്ങൾ, റോൾബാക്ക് മാനദണ്ഡം, ആരെ അറിയിക്കണം.
അപചയത്തിന് കാരണമാകുന്ന പട്ടിക
വക്രീകരണം
ലക്ഷണം
നേരത്തേ കണ്ടുപിടിക്കാനുള്ള വഴി
ഡാറ്റ ഡ്രിഫ്റ്റ്
ഇൻപുട്ട് വിതരണ മാറ്റങ്ങൾ
ഇൻപുട്ട് വിതരണ നിരീക്ഷണം
ആശയ മാറ്റം
നീതി നിശ്ശബ്ദമായി വീഴുന്നു
പ്രവചനം + യഥാർത്ഥ താരതമ്യം
അപ്സ്ട്രീം പിശക്
ഫീൽഡുകൾ ഒഴിഞ്ഞുകിടക്കുന്ന/ഫോർമാറ്റ് മാറ്റങ്ങളായി മാറുന്നു
സ്കീമ മൂല്യനിർണ്ണയം + നഷ്ടമായ നിരക്ക്
മോഡൽ പൊരുത്തക്കേട്
ഔട്ട്പുട്ട് വിതരണ ഷിഫ്റ്റുകൾ
ഔട്ട്പുട്ട് വിതരണ നിരീക്ഷണം
സാധാരണ തെറ്റുകൾ
- നിരീക്ഷണം സ്ഥാപിക്കുന്നില്ല. മോഡൽ നിശബ്ദമായി തകരുന്നു, ആരും അത് കാണുന്നില്ല.
- പ്രവർത്തന അളവുകൾ മാത്രം ട്രാക്ക് ചെയ്യുക. സിസ്റ്റം പ്രവർത്തനക്ഷമമാണ്, പക്ഷേ പ്രവചനങ്ങൾ തെറ്റാം.
- റഫറിയെ പരിശോധിക്കാതെ LLM ഉപയോഗിക്കുന്നു. അത് തെറ്റായ ആത്മവിശ്വാസം നൽകുന്നു.
- എളുപ്പമുള്ള ഉദാഹരണങ്ങളോടെ Eval. ഇത് യഥാർത്ഥ ബുദ്ധിമുട്ട് സൂചിപ്പിക്കുന്നില്ല.
- ഈവലിൽ മുൻകാല തെറ്റുകൾ ഉൾപ്പെടുത്തിയിട്ടില്ല. അതേ പിശക് വീണ്ടും വരുന്നു.
- ഉച്ചത്തിലുള്ള അലാറങ്ങൾ. യഥാർത്ഥ അലാറം നഷ്ടമായതിനാൽ ടീം സംവേദനക്ഷമമല്ല.
ചുരുക്കത്തിൽ
ഉൽപ്പാദനത്തിൽ പിശകുകൾ വരുത്താതെ മോഡൽ കൃത്യമല്ല; അതിനാൽ വികസനം പോലെ തന്നെ പ്രധാനമാണ് ഇവലും നിരീക്ഷണവും. മൂന്ന് ലെയറുകളിൽ നിരീക്ഷണം സ്ഥാപിക്കുക (ഓപ്പറേഷണൽ, ഇൻപുട്ട്, ഔട്ട്പുട്ട്); യഥാർത്ഥ ഫലം വൈകുകയാണെങ്കിൽ മുൻകൂർ മുന്നറിയിപ്പായി ഇൻപുട്ട് ഡ്രിഫ്റ്റ് ഉപയോഗിക്കുക. LLM സിസ്റ്റങ്ങളിൽ, eval ഓപ്പൺ-എൻഡ് ആണ്; റൂൾ ചെക്കുകൾ, LLM-റഫറി, ഹ്യൂമൻ മൂല്യനിർണ്ണയം എന്നിവ ഒരുമിച്ച് ഉപയോഗിക്കുക - എന്നാൽ ഒരു ഹ്യൂമൻ ആങ്കർ ഉപയോഗിച്ച് LLM-റഫറി സാധൂകരിക്കുന്നത് ഉറപ്പാക്കുക. എഡ്ജ്, സെക്യൂരിറ്റി കേസുകൾ ഉപയോഗിച്ച് നിങ്ങളുടെ Eval ക്ലസ്റ്ററിനെ സമ്പന്നമാക്കുക, ഒപ്പം പിടിക്കപ്പെടുന്ന എല്ലാ പിശകുകളും സ്ഥിരമായ ഒരു ടെസ്റ്റ് കേസാക്കി മാറ്റുക.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു പ്രൊഡക്ഷൻ (അല്ലെങ്കിൽ ഉൽപ്പാദനത്തിനു സമീപമുള്ള) മോഡലിനായി ഒരു ത്രീ-ലെയർ മോണിറ്ററിംഗ് പ്ലാൻ എഴുതുകയും കുറഞ്ഞത് ഒരു ഇൻപുട്ട്-ഡിസ്ട്രിബ്യൂഷൻ മെട്രിക്കിന് ത്രെഷോൾഡ് + അലാറം നിർവ്വചിക്കുകയും ചെയ്യുക. നിങ്ങൾക്ക് ഒരു LLM സിസ്റ്റം ഉണ്ടെങ്കിൽ: മനുഷ്യരുമായി 30 ഔട്ട്പുട്ടുകൾ ടാഗ് ചെയ്യുക, അതേ ഔട്ട്പുട്ടുകളിൽ ഒരു LLM-റഫറി പ്രവർത്തിപ്പിക്കുക, കൂടാതെ ഹ്യൂമൻ-റഫറി കരാർ അളക്കുക; റഫറിയുടെ വ്യവസ്ഥാപിത പക്ഷപാതം ശ്രദ്ധിക്കുക. നിങ്ങളുടെ എവൽ ക്ലസ്റ്ററിലേക്ക് കുറഞ്ഞത് 3 അരികുകളും 2 സുരക്ഷാ കേസുകളും ചേർക്കുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] മോണിറ്ററിംഗ് മൂന്ന് ലെയറുകളേയും (ഓപ്പറേഷണൽ, ഇൻപുട്ട്, ഔട്ട്പുട്ട്) ഉൾക്കൊള്ളുന്നു.
- [ ] യഥാർത്ഥ ഫലം വൈകുകയാണെങ്കിൽ മുൻകൂർ മുന്നറിയിപ്പായി ഞാൻ ഇൻപുട്ട് ഡ്രിഫ്റ്റ് ഉപയോഗിക്കുന്നു.
- [ ] മനുഷ്യ ലേബലുകൾ ഉപയോഗിച്ച് ഞാൻ LLM-മധ്യസ്ഥനെ കാലിബ്രേറ്റ് ചെയ്തു.
- Eval ക്ലസ്റ്ററിൽ എഡ്ജ്, സെക്യൂരിറ്റി കേസുകൾ അടങ്ങിയിരിക്കുന്നു.
- [ ] ഞാൻ പിടികൂടിയ എല്ലാ ബഗുകളും ഒരു സ്ഥിരമായ ടെസ്റ്റ് കേസാക്കി മാറ്റി.
- [ ] ഓരോ പ്രധാന മെട്രിക്കിനും ഒരു പരിധിയും പ്രതികരണ പദ്ധതിയും ഉണ്ട്.