നേട്ടങ്ങൾ:
- നിരീക്ഷണത്തിൻ്റെ മൂന്ന് സ്തംഭങ്ങളും (മെട്രിക്, ലോഗ്, ട്രേസ്) നാല് സുവർണ്ണ സിഗ്നലുകളും മനസിലാക്കാനും കൃത്രിമ ബുദ്ധി പ്രോംക്യുഎൽ അന്വേഷണങ്ങളും അലാറം നിയമങ്ങളും ഡാഷ്ബോർഡുകളും സൃഷ്ടിക്കുന്നതിനുള്ള കഴിവും
- അലാറങ്ങൾ പ്രവർത്തന-അധിഷ്ഠിതവും ശരിയായ അടിയന്തിരവും നിങ്ങളുടെ സ്വന്തം സിസ്റ്റത്തിൻ്റെ ചരിത്രപരമായ ഡാറ്റയ്ക്കെതിരായ ടെസ്റ്റിംഗ് പരിധിയിൽ സൂക്ഷിച്ചുകൊണ്ട് അലാറം ക്ഷീണം തടയാനുള്ള കഴിവ്
- ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിന് ലോഗുകൾ നൽകുന്നതിന് മുമ്പ് സെൻസിറ്റീവ് ഏരിയകൾ മറയ്ക്കുന്നതിലൂടെ സ്വകാര്യതയും രഹസ്യ ചോർച്ചയും തടയാനുള്ള കഴിവ്
ഒരു സിസ്റ്റം പ്രവർത്തിക്കുന്നുണ്ടെന്ന് തോന്നുമെങ്കിലും, അത് ഉള്ളിൽ മരിക്കുന്നുണ്ടാകാം: മെമ്മറി പതുക്കെ നിറയുന്നു, പ്രതികരണ സമയം വർദ്ധിക്കുന്നു, പിശക് നിരക്ക് വർദ്ധിക്കുന്നു. ഇത് ശ്രദ്ധിക്കാനുള്ള ഏക മാർഗം സിസ്റ്റത്തെ നിരന്തരം നിരീക്ഷിക്കുക എന്നതാണ്. കൂടുതൽ വിപുലമായ ഒരു ആശയം നിരീക്ഷണക്ഷമതയാണ്: സിസ്റ്റത്തിനുള്ളിൽ എന്താണ് സംഭവിക്കുന്നതെന്ന് അതിൻ്റെ ബാഹ്യ അടയാളങ്ങൾ നോക്കി മനസ്സിലാക്കാനുള്ള കഴിവ്. നിരീക്ഷണത്തിൻ്റെ മൂന്ന് തൂണുകളുണ്ട്, കൂടാതെ DevOps പ്രൊഫഷണലുകൾ ഇവ മൂന്നും ഉപയോഗിക്കുന്നു:
- മെട്രിക്: കാലക്രമേണ അളക്കുന്ന സംഖ്യാ മൂല്യങ്ങൾ - സിപിയു ഉപയോഗം, അഭ്യർത്ഥനകളുടെ എണ്ണം, പ്രതികരണ സമയം, പിശക് നിരക്ക്. "എത്രമാത്രം?" എന്ന ചോദ്യത്തിന് ഉത്തരം നൽകുന്നു.
- ലോഗ്: സിസ്റ്റം നിർമ്മിച്ച ടെക്സ്റ്റ് ഇവൻ്റ് റെക്കോർഡുകൾ - "ഉപയോക്താവ് ലോഗിൻ ചെയ്തു", "ഡാറ്റാബേസ് കണക്ഷൻ നഷ്ടപ്പെട്ടു". "കൃത്യമായി എന്താണ് സംഭവിച്ചത്?" എന്ന ചോദ്യത്തിന് ഉത്തരം നൽകുന്നു.
- ട്രെയ്സ്: സിസ്റ്റത്തിനുള്ളിൽ സേവനത്തിൽ നിന്ന് സേവനത്തിലേക്ക് കടന്നുപോകുമ്പോൾ ഒരു അഭ്യർത്ഥന പിന്തുടരുന്ന പാതയും ഓരോ ഘട്ടത്തിൻ്റെയും ദൈർഘ്യവും. "എവിടെയാണ് മന്ദത?" എന്ന ചോദ്യത്തിന് ഉത്തരം നൽകുന്നു.
ഏറ്റവും സാധാരണമായ ടൂളുകൾ: മെട്രിക്സിനുള്ള പ്രോമിത്യൂസ്, വിഷ്വലൈസേഷനായി ഗ്രാഫാന, ലോജിനായി ലോകി/ELK, ട്രേസിനായി ജെയ്ഗർ/ഓപ്പൺ ടെലിമെട്രി. ഈ ടൂളുകൾക്കായി അന്വേഷണ ഭാഷകൾ (പ്രത്യേകിച്ച് പ്രോമിത്യൂസിൻ്റെ പ്രോംക്യുഎൽ), അലാറം നിയമങ്ങൾ, ഡാഷ്ബോർഡ് കോൺഫിഗറേഷനുകൾ എന്നിവ എഴുതുന്നതിൽ AI വളരെ വൈദഗ്ദ്ധ്യം നേടിയിട്ടുണ്ട്. AI ഏറ്റവും ശക്തമായിരിക്കുന്നതും ഇവിടെയാണ്: ലോഗുകളുടെയും മെട്രിക്കുകളുടെയും വലിയ ഭാഗങ്ങൾ സംഗ്രഹിക്കുകയും അപാകതകൾ ഫ്ലാഗുചെയ്യുകയും ചെയ്യുന്നു.
നിരീക്ഷണവും നിരീക്ഷണക്ഷമതയും തമ്മിലുള്ള വ്യത്യാസം ഒരു വാക്യത്തിൽ വ്യക്തമാക്കാം: നിരീക്ഷണം നിങ്ങൾക്ക് ഇതിനകം അറിയാവുന്ന ചോദ്യങ്ങൾ ചോദിക്കുന്നു (“സിപിയു 90% കഴിഞ്ഞോ?”); നിങ്ങൾക്ക് ഇതിനകം അറിയാത്ത ചോദ്യങ്ങൾ ചോദിക്കാൻ കഴിയുന്നതാണ് നിരീക്ഷണക്ഷമത ("എന്തുകൊണ്ടാണ് ഈ വിചിത്രമായ മന്ദത ഒരു നിശ്ചിത സമയത്ത് ഒരു നിശ്ചിത ഉപഭോക്താവിന് മാത്രം സംഭവിക്കുന്നത്?"). ആധുനിക സംവിധാനങ്ങൾ വളരെ സങ്കീർണ്ണമാണ്, പരാജയത്തിൻ്റെ എല്ലാ രീതികളും നിങ്ങൾക്ക് പ്രവചിക്കാൻ കഴിയില്ല; അതിനാൽ, സമ്പന്നമായ അളവുകൾ, രേഖകൾ, അടയാളങ്ങൾ എന്നിവ ശേഖരിക്കാനും അവയെ ആഴത്തിൽ അന്വേഷിക്കാനുമുള്ള കഴിവ് - അതായത്, നിരീക്ഷണക്ഷമത - നിർണായകമായിത്തീരുന്നു. "മുമ്പ് അജ്ഞാതമായ ചോദ്യത്തിന്" ഉത്തരം നൽകുമ്പോൾ AI പ്രവർത്തിക്കുന്നത് ഇവിടെയാണ്: ഇത് നിങ്ങളുടെ പക്കലുള്ള അസംസ്കൃത ഡാറ്റ വേഗത്തിൽ സ്കാൻ ചെയ്യുന്നു, പാറ്റേണുകളും അപാകതകളും നിർദ്ദേശിക്കുന്നു, ഈ സൂചനകൾ പരിശോധിച്ചുകൊണ്ട് നിങ്ങൾ മൂലകാരണത്തിലെത്തുന്നു.
ഘട്ടം ഘട്ടമായി: എന്ത്, എങ്ങനെ നിരീക്ഷിക്കണം?
- ശരിയായ മെട്രിക്സ് തിരഞ്ഞെടുക്കുക. വ്യവസായത്തിൽ, "നാല് സുവർണ്ണ സിഗ്നലുകൾ" അടിസ്ഥാനമായി എടുക്കുന്നു: ലേറ്റൻസി, ട്രാഫിക്, പിശകുകൾ, സാച്ചുറേഷൻ - ഉറവിടം എത്രമാത്രം നിറഞ്ഞിരിക്കുന്നു. ഇവ മിക്ക സേവനങ്ങളുടെയും ആരോഗ്യത്തെ സംഗ്രഹിക്കുന്നു.
- അളവുകൾ ശേഖരിക്കുക. പ്രോമിത്യൂസിന് വായിക്കാൻ കഴിയുന്ന ഒരു എൻഡ്പോയിൻ്റ് അവതരിപ്പിക്കാൻ ആപ്ലിക്കേഷൻ അനുവദിക്കുക.
- ഡാഷ്ബോർഡുകൾ സജ്ജീകരിക്കുക. ഗ്രാഫാനയിൽ ഈ മെട്രിക്കുകൾ ദൃശ്യവൽക്കരിക്കുക.
- അലാറം നിയമങ്ങൾ എഴുതുക. ഒരു പരിധി കവിഞ്ഞാൽ ആർക്ക് മുന്നറിയിപ്പ് നൽകും, എങ്ങനെ?
- ലോഗുകൾ കേന്ദ്രീകരിക്കുക. എല്ലാ സേവന ലോഗുകളും ഒരിടത്ത് തിരയാൻ കഴിയുന്ന തരത്തിലാക്കുക.
- ശബ്ദം കുറയ്ക്കുക. വളരെയധികം അലാറം "അലേർട്ട് ക്ഷീണം" സൃഷ്ടിക്കുന്നു; പ്രധാനപ്പെട്ട അലാറം അപ്രത്യക്ഷമാകുന്നു.
നുറുങ്ങ്: ഒരു നല്ല അലാറം രണ്ട് കാര്യങ്ങൾ നിറവേറ്റുന്നു: അത് പ്രവർത്തനക്ഷമവും ശരിയായ അടിയന്തിരതയുമാണ്. പുലർച്ചെ 3 മണിക്ക് ഒരാളെ ഉണർത്തുന്ന ഒരു അലാറം യഥാർത്ഥത്തിൽ രാത്രികാല ഇടപെടൽ ആവശ്യമായ ഒന്നായിരിക്കണം. "സിപിയു 70%" പോലെ സ്വന്തമായി നടപടി ആവശ്യമില്ലാത്ത കാര്യത്തിന് ആരെയും ഉണർത്തരുത്; അത് ബോർഡിൽ പ്രദർശിപ്പിക്കുക.
ഒരു അലാറം നിയമം എങ്ങനെ എഴുതാം?
ഒരു അലേർട്ടിൽ മൂന്ന് ഘടകങ്ങൾ അടങ്ങിയിരിക്കുന്നു: അവസ്ഥ (ഏത് പരിധി കവിയുന്നു, എത്ര സമയത്തേക്കാണ് മെട്രിക്), ദൈർഘ്യം (ക്ഷണികമായ ഏറ്റക്കുറച്ചിലുകൾ ഉണ്ടാകാതിരിക്കാൻ "5 മിനിറ്റ്"), പ്രാധാന്യം/പ്രവർത്തനം (ആർക്ക്, ഏത് ചാനലിലൂടെ). ശരിയായ സന്ദർഭത്തിൽ ഇവ മൂന്നും AI സമർത്ഥമായി സ്ഥാപിക്കുന്നു. ഉദാഹരണത്തിന്, "പിഴവ് നിരക്ക് 5% കവിയുന്നുവെങ്കിൽ ക്രിട്ടിക്കൽ അലാറം" പോലുള്ള ഒരു റൂൾ PromQL-ലേക്ക് വിവർത്തനം ചെയ്യുന്നത് AI-യുടെ ഒരു സ്പ്ലിറ്റ്-സെക്കൻഡ് ടാസ്ക് ആണ് - എന്നാൽ നിങ്ങളുടെ സിസ്റ്റത്തിന് ത്രെഷോൾഡ് അനുയോജ്യമാണോ എന്ന് നിങ്ങൾ തീരുമാനിക്കുക.
മുന്നറിയിപ്പ്: AI നിർദ്ദേശിച്ച അലാറം പരിധികൾ പൊതുവായ അനുമാനങ്ങളാണ്. നിങ്ങളുടെ സിസ്റ്റത്തിൻ്റെ സാധാരണ ലോഡ്, സഹിഷ്ണുത, ജോലിയുടെ സ്വാധീനം എന്നിവ വ്യത്യസ്തമാണ്. നിങ്ങൾ ഉൽപ്പന്നത്തിലേക്ക് നേരിട്ട് ഒരു പരിധി ഇടുന്നതിനുമുമ്പ്, നിങ്ങളുടെ ചരിത്രപരമായ ഡാറ്റ നോക്കുകയും "ഈ പരിധി മുമ്പ് എത്ര തവണ പ്രവർത്തനക്ഷമമാക്കിയിട്ടുണ്ട്, അവയിൽ എത്രയെണ്ണം യഥാർത്ഥ പ്രശ്നങ്ങളായിരുന്നു?" ചോദ്യത്തിന് ഉത്തരം നൽകുക.
ലോഗ് സ്വകാര്യത: നിർണായക മുന്നറിയിപ്പ്
ചോർച്ചയുടെ ഏറ്റവും കൂടുതൽ ശ്രദ്ധിക്കപ്പെടുന്ന ഉറവിടമാണ് ലോഗുകൾ. ഒരു ലോഗ് ലൈനിൽ ആകസ്മികമായി ഒരു പാസ്വേഡ്, ഒരു ക്രെഡിറ്റ് കാർഡ് നമ്പർ അല്ലെങ്കിൽ വ്യക്തിഗത ഡാറ്റ (KVKK/GDPR പ്രകാരം) അടങ്ങിയിരിക്കാം. വിശകലനത്തിനായി ഒരു AI-യിലേക്ക് ലോഗുകൾ ഒട്ടിക്കുമ്പോൾ:
- സെൻസിറ്റീവ് ഏരിയകൾ മാസ്ക് ചെയ്യുക. ടോക്കൺ, പാസ്വേഡ്, ഇമെയിൽ, ഐഡി നമ്പർ തുടങ്ങിയ മൂല്യങ്ങൾ <REDACTED> ഉപയോഗിച്ച് മാറ്റിസ്ഥാപിക്കുക.
- ഉദാഹരണങ്ങൾ നൽകുക, എല്ലാം അല്ല. ഒരു ദശലക്ഷം വരികൾക്ക് പകരം, നൂറുകണക്കിന് പ്രതിനിധി ലൈനുകൾ മതിയാകും.
- സ്ഥാപനം അംഗീകരിച്ച വാഹനം തിരഞ്ഞെടുക്കുക. പ്രത്യേകിച്ച് പ്രൊഡക്ഷൻ ലോഗുകൾക്കായി, പരിശീലനത്തിലേക്ക് പോകാത്ത ഒരു ഉപകരണം ഉപയോഗിക്കുക.
നാല് ഗോൾഡൻ സിഗ്നലുകളും അലാറം ടേബിളുകളും
സിഗ്നൽ
അളന്നു
ഉദാഹരണ അലാറം പരിധി
അടിയന്തിരം
കാലതാമസം
പ്രതികരണ സമയം
p95 > 800 ms, 5 മിനിറ്റ്
ഉയർന്നത്
ഗതാഗതം
അഭ്യർത്ഥന/സെക്കൻഡ്
പെട്ടെന്നുള്ള 300% വർദ്ധനവ്/കുറവ്
ഇടത്തരം
പിശക്
അഭ്യർത്ഥന നിരക്ക് പരാജയപ്പെട്ടു
> 5%, 5 മിനിറ്റ്
വിമർശനാത്മകം
സാച്ചുറേഷൻ
റിസോഴ്സ് ഒക്യുപൻസി
ഡിസ്ക് > 85%
ഉയർന്നത്
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - 400 ലൈനുകൾ 30 സെക്കൻഡിൽ സംഗ്രഹിച്ചു. ഒരു സർവീസ് മന്ദഗതിയിലായി. എഞ്ചിനീയർ മാസ്ക് ചെയ്ത 400 വരി ലോഗ് AI-ക്ക് നൽകി, "ആവർത്തിച്ചുള്ള പിശക് പാറ്റേണുകളും സമയ തീവ്രതയും സംഗ്രഹിക്കുക" എന്ന് പറഞ്ഞു. ഓരോ 30 സെക്കൻഡിലും ഒരു പ്രത്യേക ബാഹ്യ API കോൾ സമയമുണ്ടെന്ന് AI കാണിച്ചു. 30 സെക്കൻഡിനുള്ളിൽ മൂലകാരണം കണ്ടെത്തി; ലോഗുകൾ സ്വമേധയാ സ്കാൻ ചെയ്യാൻ അര മണിക്കൂർ എടുക്കും.
കേസ് 2 - അലാറം ക്ഷീണം പരിഹരിച്ചു. ഒരു ടീമിന് ഒരു ദിവസം 200 അലാറങ്ങൾ ലഭിക്കുകയും അവയെല്ലാം അവഗണിക്കുകയും ചെയ്തു - ഒരു യഥാർത്ഥ അലാറം പോലും അവഗണിക്കപ്പെടുന്നതുവരെ. AI-ക്ക് എല്ലാ അലേർട്ട് നിയമങ്ങളും നൽകുകയും "ഏതാണ് പ്രവർത്തനക്ഷമമല്ലാത്തവ ഏതെല്ലാം സംയോജിപ്പിക്കാൻ കഴിയുക?" അവർ ചോദിച്ചു. അലാറങ്ങളുടെ എണ്ണം പ്രതിദിനം 12 ആയി കുറഞ്ഞു; ഓരോ അലാറവും ഇപ്പോൾ ഗൗരവമായി എടുത്തിട്ടുണ്ട്.
കേസ് 3 - തെറ്റായ പരിധി നേരത്തെ പിടികൂടി. YZ ഡിസ്കിനായി "95% നിറയുമ്പോൾ മുന്നറിയിപ്പ് നൽകുക" നിർദ്ദേശിച്ചു. എഞ്ചിനീയർ ചരിത്രപരമായ ഡാറ്റ നോക്കി: ഡിസ്ക് 95% എത്തിയപ്പോൾ ഇടപെടലിന് കുറച്ച് സമയമേ ഉണ്ടായിരുന്നുള്ളൂ. ഇത് പരിധി 80% ആയി താഴ്ത്തി, "വളർച്ചാ നിരക്ക്" അടിസ്ഥാനമാക്കി രണ്ടാമത്തെ അലാറം ചേർത്തു. പരിശോധിച്ചുറപ്പിക്കൽ യഥാർത്ഥ അർദ്ധരാത്രി തടസ്സം തടഞ്ഞു.
പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ
1) ലോഗ് സംഗ്രഹം (മുഖമൂടി):
ചുവടെയുള്ള ലോഗ് ഉദാഹരണം വിശകലനം ചെയ്യുക (ഞാൻ സെൻസിറ്റീവ് മൂല്യങ്ങൾ <REDACTED> ഉപയോഗിച്ച് മറച്ചു). എനിക്ക് തരൂ: (1) ആവർത്തിച്ചുള്ള പിശക് പാറ്റേണുകൾ, (2) കാലക്രമേണ ഏകാഗ്രത, (3) ഏറ്റവും സാധ്യതയുള്ള മൂലകാരണം, (4) സ്ഥിരീകരിക്കാൻ ഞാൻ നോക്കുന്ന 3 മെട്രിക്കുകൾ. ലോഗ്: [LINES]
2) അലാറം റൂൾ ജനറേഷൻ:
Prometheus/Alertmanager-നായി ഒരു അലാറം റൂൾ എഴുതുക: [THRESHOLD] [METRIC][DURATION] കവിഞ്ഞാൽ [SVERITY] അലാറം സൃഷ്ടിക്കുക. നിയമം പ്രവർത്തന-അധിഷ്ഠിതവും ഒരു വ്യാഖ്യാനവും റൺബുക്ക് ലിങ്ക് ഫീൽഡും ഉൾപ്പെടുത്തിയിരിക്കണം. PromQL വിശദീകരിച്ച് എന്തുകൊണ്ട് ഈ പരിധി ന്യായമാണെന്ന് എഴുതുക.
3) PromQL അന്വേഷണം എഴുതുന്നു/പ്രഖ്യാപിക്കുന്നു:
അളക്കുന്ന ഒരു PromQL അന്വേഷണം എഴുതുക: [EX. അവസാന 5 മിനിറ്റിലെ 5xxerror നിരക്ക് ശതമാനം]. ചോദ്യം ഘട്ടം ഘട്ടമായി വിശദീകരിക്കുക. അപ്പോൾ ഈ മൂല്യത്തിൻ്റെ ആരോഗ്യകരമായ ശ്രേണി എന്തായിരിക്കണമെന്ന് എന്നോട് പറയുക.
4) ഡാഷ്ബോർഡ് ഡിസൈൻ:
[സേവനം] എന്നതിനായി ഒരു ഗ്രാഫാന ഡാഷ്ബോർഡ് രൂപകൽപ്പന ചെയ്യുക: ഏത് പാനലുകൾ ഉപയോഗിച്ചാണ് ഞാൻ നാല് ഗോൾഡൻ സിഗ്നലുകൾ (ലേറ്റൻസി, ട്രാഫിക്, പിശക്, സാച്ചുറേഷൻ) പ്രദർശിപ്പിക്കേണ്ടത്? ഓരോ പാനലിനും മെട്രിക്, വിഷ്വലൈസേഷൻ തരം, ന്യായമായ പരിധി എന്നിവ നിർദ്ദേശിക്കുക. ഉദ്ദേശ്യം: ഒരു കാവൽക്കാരൻ്റെ ആരോഗ്യനില 10 സെക്കൻഡിനുള്ളിൽ കാണാൻ.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലൻ: "ആ രേഖയിൽ എന്താണുള്ളത്?" (അതിനു പിന്നാലെ 5000 വരികൾ റോ ലോഗ്, ടോക്കണുകൾ)
ഫലം: നിങ്ങൾ രഹസ്യങ്ങൾ ചോർത്തുന്നു, AI ലക്ഷ്യമില്ലാത്തതും ഉപരിപ്ലവവുമായ ഒരു സംഗ്രഹം നൽകുന്നു.
ശക്തമായത്: "ചുവടെയുള്ള 300-വരി മാസ്ക് ചെയ്ത ലോഗ് ഉദാഹരണത്തിൽ ആവർത്തിച്ചുള്ള പിശക് പാറ്റേണുകളും സമയ തീവ്രതയും കണ്ടെത്തുക; ഏറ്റവും സാധ്യതയുള്ള മൂലകാരണവും ഞാൻ സ്ഥിരീകരിക്കാൻ നോക്കുന്ന അളവുകളും എന്നോട് പറയൂ. ഞാൻ ടോക്കണുകൾ <REDACTED> ഉണ്ടാക്കി."
വ്യത്യാസം: രണ്ടാമത്തെ പ്രോംപ്റ്റ് മുഖംമൂടിയും കേന്ദ്രീകൃതവുമായ ഒരു ഉദാഹരണം നൽകുന്നു, വ്യക്തമായ വിശകലന ഔട്ട്പുട്ട് ആവശ്യപ്പെടുന്നു; ഇത് സുരക്ഷിതവും ഉപയോഗപ്രദവുമാണ്.
സാധാരണ തെറ്റുകൾ
- മാസ്ക് ചെയ്യാതെ AI-യിലേക്ക് ലോഗ് ഒട്ടിക്കുന്നു. ഏറ്റവും സാധാരണമായ രഹസ്യ/വ്യക്തിഗത ഡാറ്റ ചോർച്ച.
- എല്ലാത്തിനും അലാറങ്ങൾ സജ്ജീകരിക്കുന്നു. അലാറം ക്ഷീണം യഥാർത്ഥ അലാറത്തെ കുഴിച്ചിടുന്നു.
- പ്രവർത്തനക്ഷമമല്ലാത്ത അലാറം. ആർക്കും ഒന്നും ചെയ്യാൻ പറ്റാത്ത മുന്നറിയിപ്പ് ശബ്ദമാണ്.
- ചോദ്യം ചെയ്യാതെ തന്നെ AI യുടെ പരിധി സ്വീകരിക്കുന്നു. നിങ്ങളുടെ സിസ്റ്റത്തിൻ്റെ ചരിത്രം അനുസരിച്ച് ത്രെഷോൾഡ് സജ്ജീകരിക്കണം.
- മെട്രിക് നോക്കിയാൽ മതി. രേഖയും കണ്ടെത്തലും കൂടാതെ, മൂലകാരണം മിക്കപ്പോഴും കണ്ടെത്താനാവില്ല.
- ഒരു അലാറം സമയം സജ്ജീകരിക്കുന്നില്ല (ഇതിനായി). ക്ഷണികമായ ഏറ്റക്കുറച്ചിലുകൾ തെറ്റായ അലാറങ്ങൾ ഉണ്ടാക്കുന്നു.
ചുരുക്കത്തിൽ
നിരീക്ഷണക്ഷമത; മെട്രിക്സ്, ലോഗുകൾ, ട്രെയ്സുകൾ എന്നിവ ഉപയോഗിച്ച് സിസ്റ്റത്തിൻ്റെ ഉള്ളിൽ നിന്ന് പുറത്തു നിന്ന് മനസ്സിലാക്കാനുള്ള കഴിവാണിത്. നാല് സുവർണ്ണ സിഗ്നലുകൾ (ലേറ്റൻസി, ട്രാഫിക്, പിശക്, സാച്ചുറേഷൻ) മിക്ക സേവനങ്ങളുടെയും ആരോഗ്യത്തെ സംഗ്രഹിക്കുന്നു. PromQL അന്വേഷണങ്ങൾ, അലാറം നിയമങ്ങൾ, ഡാഷ്ബോർഡുകൾ എന്നിവ എഴുതുന്നതിലും ലോഗുകളുടെ വലിയ ഭാഗങ്ങൾ സംഗ്രഹിക്കുന്നതിലും അപാകതകൾ കണ്ടെത്തുന്നതിലും AI വളരെ ശക്തമാണ്. എന്നാൽ നിങ്ങളുടെ സ്വന്തം സിസ്റ്റത്തിൻ്റെ ചരിത്രത്തിനെതിരായ അലാറം പരിധികൾ പരിശോധിച്ചുറപ്പിക്കുക, അലാറങ്ങൾ പ്രവർത്തന-ഓറിയൻ്റഡ് ആയി സൂക്ഷിക്കുക, ലോഗുകൾ മറയ്ക്കാതെ ഒരിക്കലും പങ്കിടരുത്.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു സേവനത്തിന് (അല്ലെങ്കിൽ ഒരു സാമ്പിൾ സേവനം): (1) "അലാറം റൂൾ ജനറേഷൻ" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് പിശക് റേറ്റിനായി ഒരു അലാറം റൂൾ സൃഷ്ടിച്ച് നിർദ്ദേശിച്ച പരിധി "ഇത് മുമ്പ് എത്ര തവണ ട്രിഗർ ചെയ്തിട്ടുണ്ട്?" ചോദ്യം ഉപയോഗിച്ച് ഇത് പരിശോധിക്കുക; (2) നിങ്ങളുടെ കൈവശമുള്ള ഒരു ലോഗ് സാമ്പിൾ മറയ്ക്കുകയും "ലോഗ് സംഗ്രഹം" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് വിശകലനം ചെയ്യുകയും ചെയ്യുക; (3) ഏറ്റവും സാധ്യതയുള്ള മൂലകാരണം സ്ഥിരീകരിക്കാൻ നിങ്ങൾ ഏത് മെട്രിക്കാണ് നോക്കേണ്ടതെന്ന് ശ്രദ്ധിക്കുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] നാല് ഗോൾഡൻ സിഗ്നലുകളെ അടിസ്ഥാനമാക്കി ട്രാക്ക് ചെയ്യാൻ ഞാൻ മെട്രിക്സ് തിരഞ്ഞെടുത്തു.
- സെൻസിറ്റീവ് ഏരിയകളുടെ അടിസ്ഥാനത്തിൽ AI-ന് നൽകിയ എല്ലാ ലോഗുകളും ഞാൻ മറച്ചുവച്ചു.
- [ ] ഓരോ അലാറവും പ്രവർത്തന-അധിഷ്ഠിതവും ശരിയായ അടിയന്തിരവും ആണെന്ന് ഞാൻ പരിശോധിച്ചു.
- [ ] എൻ്റെ സിസ്റ്റത്തിൻ്റെ ചരിത്രപരമായ ഡാറ്റയ്ക്കെതിരായ അലാറം പരിധികൾ ഞാൻ പരീക്ഷിച്ചു.
- [ ] അലാറങ്ങളിൽ (ദൈർഘ്യം) ചേർത്ത് ഞാൻ തൽക്ഷണ ഏറ്റക്കുറച്ചിലുകൾ ഫിൽട്ടർ ചെയ്തു.
- [ ] മൂലകാരണത്തിനായി ഞാൻ മെട്രിക് + ലോഗ് + ട്രെയ്സ് ഒരുമിച്ച് ഉപയോഗിച്ചു.