യൂണിറ്റുകൾ
1. DevOps, Cloud AI എന്നിവയിലേക്കുള്ള ആമുഖം: റോളുകൾ, അതിരുകൾ, ആധികാരികത, സുരക്ഷ, രഹസ്യങ്ങൾ 2. ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിച്ച് സിഐ/സിഡി പൈപ്പ്ലൈനുകൾ രൂപകൽപ്പന ചെയ്യുന്നു: GitHub ആക്ഷൻസ്, GitLab CI 3. അടിസ്ഥാന സൗകര്യങ്ങൾ കോഡായി കൈകാര്യം ചെയ്യുക: ടെറാഫോമും ഐഎസിയും ഉള്ള ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് 4. കണ്ടെയ്‌നറൈസേഷൻ: ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിച്ചുള്ള ഡോക്കർഫയലും ഇമേജ് ഒപ്റ്റിമൈസേഷനും 5. കുബർനെറ്റസ്: മാനിഫെസ്റ്റ്, ഹെൽം, AI- പവർഡ് ഓർക്കസ്ട്രേഷൻ 6. നിരീക്ഷണവും നിരീക്ഷണവും: മെട്രിക്, ലോഗ്, ട്രേസ്, അലാറം നിയമങ്ങൾ 7. സംഭവ മാനേജ്മെൻ്റ് ആൻഡ് പോസ്റ്റ്മോർട്ടം: കൃത്രിമ ബുദ്ധി ഉപയോഗിച്ച് മൂലകാരണ വിശകലനം 8. ക്ലൗഡ് കോസ്റ്റ് ഒപ്റ്റിമൈസേഷൻ (ഫിൻഓപ്‌സ്): കൃത്രിമ ബുദ്ധി ഉപയോഗിച്ച് മാലിന്യങ്ങൾക്കായി വേട്ടയാടൽ 9. സ്ക്രിപ്റ്റും ഓട്ടോമേഷൻ ജനറേഷനും: ബാഷ്, പൈത്തൺ, പവർഷെൽ 10. സെക്യൂരിറ്റി ആൻഡ് സീക്രട്ട്സ് മാനേജ്മെൻ്റ്: DevSecOps ആൻഡ് ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് 11. ഉൽപ്പന്ന പരിശോധന, റിലീസ് സ്ട്രാറ്റജികൾ, എൻഡ്-ടു-എൻഡ് AI വർക്ക്ഫ്ലോ
യൂണിറ്റ് 7 / 11

സംഭവ മാനേജ്മെൻ്റ് ആൻഡ് പോസ്റ്റ്മോർട്ടം: കൃത്രിമ ബുദ്ധി ഉപയോഗിച്ച് മൂലകാരണ വിശകലനം

നേട്ടങ്ങൾ:

  • ഒരു സംഭവത്തിൻ്റെ ജീവിത ചക്രം (കണ്ടെത്തൽ, വിചാരണ, ലഘൂകരണം, റെസലൂഷൻ, പോസ്റ്റ്‌മോർട്ടം), MTTD/MTTR അളവുകോലുകളും 'ആദ്യം ലഘൂകരിക്കുക, പിന്നീട് അന്വേഷിക്കുക' എന്ന തത്വവും മനസ്സിലാക്കാനുള്ള കഴിവ്.
  • സംഭവസമയത്ത് അനുമാനങ്ങൾ ചുരുക്കാനും കുറ്റമറ്റ പോസ്റ്റ്‌മോർട്ടം സ്കെച്ച് നിർമ്മിക്കാനും AI ഉപയോഗിക്കാനുള്ള കഴിവ്, ഡാറ്റ ഉപയോഗിച്ച് ഓരോ മൂലകാരണവും സാധൂകരിക്കുന്നു
  • പോസ്റ്റ്‌മോർട്ടത്തെ കുറ്റപ്പെടുത്താത്ത ഭാഷയിൽ എഴുതാനുള്ള അച്ചടക്കം പ്രയോഗിക്കാനുള്ള കഴിവ്, അത് മറച്ചുവെച്ച് ഇവൻ്റ് ഡാറ്റ പങ്കിടുക.

എല്ലാ സിസ്റ്റവും ഒടുവിൽ തകരുന്നു. ഈ അനിവാര്യമായ ഇവൻ്റിനായി നല്ല ടീമുകൾ എങ്ങനെ തയ്യാറെടുക്കുന്നു, അവർ എങ്ങനെ പഠിക്കുന്നു എന്നതാണ് വ്യത്യാസം. സേവനം തടസ്സപ്പെടുത്തുകയോ തടസ്സപ്പെടുത്തുമെന്ന് ഭീഷണിപ്പെടുത്തുകയോ ചെയ്യുന്ന ഒരു അപ്രതീക്ഷിത സംഭവമാണ് സംഭവം: ഒരു സർവീസ് ക്രാഷ്, പ്രതികരണ സമയം കുതിച്ചുയരുന്നു, ഡാറ്റ നഷ്ടം. സംഭവ മാനേജ്മെൻ്റ് എന്നാൽ സംഭവത്തെ എത്രയും വേഗം കണ്ടെത്തുക, ലഘൂകരിക്കുക, പരിഹരിക്കുക, തുടർന്ന് അതിൽ നിന്ന് പഠിക്കുക. DevOps, SRE (സൈറ്റ് വിശ്വാസ്യത എഞ്ചിനീയറിംഗ്) പ്രൊഫഷണലുകളെ രാവും പകലും നയിക്കുന്ന അച്ചടക്കമാണിത്.

രണ്ട് നിർണായക അളവുകൾ ഇവൻ്റിൻ്റെ ഗുണനിലവാരം അളക്കുന്നു: MTTD (കണ്ടെത്താനുള്ള ശരാശരി സമയം), MTTR (വീണ്ടെടുക്കാനുള്ള ശരാശരി സമയം). രണ്ടും ചുരുക്കുകയാണ് ലക്ഷ്യം. AI ഇവിടെ രണ്ട് വലിയ മൂല്യങ്ങൾ ചേർക്കുന്നു: സാധ്യമായ മൂലകാരണം കുറയ്ക്കുന്നതിന് ഇവൻ്റ് സമയത്ത് ലോഗുകളും മെട്രിക്കുകളും വേഗത്തിൽ സംഗ്രഹിക്കുക, കൂടാതെ ഇവൻ്റിന് ശേഷം ഒരു പോസ്റ്റ്‌മോർട്ടം (പോസ്റ്റ്-ഇവൻ്റ് അന്വേഷണ റിപ്പോർട്ട്) വേഗത്തിൽ തയ്യാറാക്കുക. എന്നാൽ ഇവൻ്റുകളുടെ ഗതിയെക്കുറിച്ചുള്ള തീരുമാനങ്ങൾ - ഏത് സേവനം ഓഫ് ചെയ്യണം, റോൾബാക്ക് ചെയ്യണം, ഉപഭോക്താവിനോട് എന്താണ് പറയേണ്ടത് - നിങ്ങളുടേതാണ്.

ഒരു സംഭവത്തിൻ്റെ ജീവിത ചക്രം

  1. കണ്ടെത്തൽ: ഒരു അലാറം മുഴങ്ങുന്നു അല്ലെങ്കിൽ ഒരു ഉപഭോക്തൃ പരാതി വരുന്നു. എത്രയും വേഗം അത്രയും നല്ലത്.
  2. ട്രയേജ്: ഇത് എത്രത്തോളം ഗുരുതരമാണ്? എന്താണ് ഡൊമെയ്ൻ? തീവ്രത ലെവലുകൾ നിയുക്തമാക്കിയിരിക്കുന്നു-സാധാരണയായി SEV1 (ഏറ്റവും നിർണായകമായ, മുഴുവൻ സിസ്റ്റം) SEV4 (മൈനർ) ലേക്ക്.
  3. നിങ്ങളുടെ പ്രതികരണ ടീമിനെ കൂട്ടിച്ചേർക്കുക. ഗുരുതരമായ സംഭവങ്ങളിൽ, ഒരു സംഭവ കമാൻഡർ ഏകോപനം ഏറ്റെടുക്കുന്നു.
  4. ലഘൂകരിക്കുക: ആദ്യം രക്തസ്രാവം നിർത്തുക - പലപ്പോഴും ഒരു റോൾബാക്ക് അല്ലെങ്കിൽ ഒരു പതാക മൂടുക. മൂലകാരണം പിന്നീട് കണ്ടെത്തും.
  5. പരിഹരിക്കുക: ശാശ്വത പരിഹാരം പ്രയോഗിക്കുക.
  6. പഠിക്കുക (പോസ്റ്റ്‌മോർട്ടം): എന്താണ് സംഭവിച്ചത്, എന്തുകൊണ്ടാണ് ഇത് സംഭവിച്ചത്, അത് വീണ്ടും സംഭവിക്കുന്നത് എങ്ങനെ തടയാം?
നുറുങ്ങ്: സംഭവസമയത്തെ ഏറ്റവും വിലപിടിപ്പുള്ള തെറ്റുകളിലൊന്ന് രക്തസ്രാവം നിർത്തുന്നത് വൈകുകയാണ്, കാരണം "ആദ്യം കൃത്യമായ മൂലകാരണത്തിലേക്ക് പോകാം." നിയമം: ആദ്യം കുറയ്ക്കുക (സേവനം പുനഃസ്ഥാപിക്കുക/പുനഃസ്ഥാപിക്കുക), തുടർന്ന് അന്വേഷിക്കുക. അറിയപ്പെടുന്ന-നല്ല പതിപ്പിലേക്ക് മടങ്ങുന്നത് പലപ്പോഴും വേഗത്തിലുള്ള ലഘൂകരണമാണ്.

കുറ്റബോധമില്ലാത്ത പോസ്റ്റ്മോർട്ടം സംസ്കാരം

ആരോഗ്യമുള്ള ടീമുകളുടെ നട്ടെല്ല് കുറ്റമറ്റ പോസ്റ്റ്‌മോർട്ടത്തിൻ്റെ ഒരു സംസ്കാരമാണ്: ലക്ഷ്യം "ആരാണ് ഇത് ചെയ്തത്" എന്നല്ല, "ഏത് സംവിധാനവും പ്രക്രിയയും ഈ തെറ്റ് അനുവദിച്ചു?" എന്നതാണ് ചോദ്യം. ശിക്ഷിക്കപ്പെടുമെന്ന് അറിഞ്ഞാൽ തെറ്റ് മറച്ചുവെക്കുന്നവർ; മറഞ്ഞിരിക്കുന്ന പിശക് ആവർത്തിക്കുന്നു. പോസ്റ്റ്‌മോർട്ടം ഒരു ആരോപണ റിപ്പോർട്ടല്ല, മറിച്ച് ഒരു പഠന രേഖയാണ്.

ഒരു നല്ല പോസ്റ്റ്‌മോർട്ടത്തിൽ ഉൾപ്പെടുന്നു: സംഗ്രഹം, ആഘാതം (എത്ര ഉപയോക്താക്കൾ, എത്ര കാലം, എത്ര പണം), ടൈംലൈൻ, മൂലകാരണം(കൾ), എന്താണ് നന്നായി/മോശമായി പോയി, കൂടാതെ പ്രവർത്തന ഇനങ്ങൾ-കോൺക്രീറ്റ് അളവുകൾ, ഓരോന്നിനും ഉടമയും തീയതിയും ഉണ്ട്.

മുന്നറിയിപ്പ്: AI ഉപയോഗിച്ച് പോസ്റ്റ്‌മോർട്ടം എഴുതുമ്പോൾ, കുറ്റപ്പെടുത്തുന്ന ഭാഷ ഒഴിവാക്കുന്നത് ഉറപ്പാക്കുക (അതായത് "X വ്യക്തിക്ക് ഒരു തെറ്റ് സംഭവിച്ചു"). AI-യിലേക്ക് ഇവൻ്റ് ഡാറ്റ നൽകുമ്പോൾ ക്ലയൻ്റ് ഐഡികൾ, ആന്തരിക ഐപികൾ, രഹസ്യങ്ങൾ എന്നിവ മറയ്ക്കുക - പോസ്റ്റ്‌മോർട്ടം പലപ്പോഴും വ്യാപകമായി പങ്കിടപ്പെടുന്നു.

മൂലകാരണ വിശകലനം: 5 എന്തുകൊണ്ട്, AI

ഒരു ക്ലാസിക് ടെക്നിക് "5 എന്തുകൊണ്ട്" ആണ്: ചോദിക്കുക "എന്തുകൊണ്ട്?" ഒരു പ്രശ്നത്തിലേക്ക്. വീണ്ടും വീണ്ടും ചോദിക്കുന്നതിലൂടെ, നിങ്ങൾ ഉപരിപ്ലവമായ ലക്ഷണത്തിൽ നിന്ന് യഥാർത്ഥ റൂട്ടിലേക്ക് എത്തുന്നു. "സേവനം തകരാറിലായി. എന്തുകൊണ്ട്? മെമ്മറി ഇല്ലാതായി. എന്തുകൊണ്ട്? ഒരു ചോർച്ചയുണ്ടായി. എന്തുകൊണ്ട്? ഒരു ലൈബ്രറി അപ്ഡേറ്റ്..." ഈ ശൃംഖല നിർമ്മിക്കാനും സാധ്യമായ ശാഖകൾ നിർദ്ദേശിക്കാനും AI വേഗത്തിലാണ് - എന്നാൽ നിങ്ങളുടെ ഡാറ്റ ഉപയോഗിച്ച് ഓരോ "എന്തുകൊണ്ട്" നിങ്ങൾ പരിശോധിക്കണം; AI-ക്ക് ന്യായമായതും എന്നാൽ തെറ്റായതുമായ ഒരു ശൃംഖല നിർമ്മിക്കാനും കഴിയും.

തീവ്രത പട്ടിക

ലെവൽ

ആഘാതം

ഉദാഹരണം

ഇടപെടൽ

SEV1

മുഴുവൻ സിസ്റ്റം/നിർണ്ണായക ബിസിനസ്സ് നഷ്ടം

പേയ്‌മെൻ്റ് പൂർണ്ണമായും കുറഞ്ഞു

തൽക്ഷണം, മുഴുവൻ ടീമും, കമാൻഡർ

SEV2

പ്രധാന തകരാറ്

ലോഗിനുകൾ പരാജയപ്പെട്ടു

വേഗത്തിലുള്ള, ഓൺ-കോൾ + പിന്തുണ

SEV3

ഭാഗിക/പരിമിതമായ പ്രഭാവം

റിപ്പോർട്ട് വൈകുന്നു

ജോലി സമയങ്ങളിൽ

SEV4

ചെറിയ/സൗന്ദര്യവർദ്ധകവസ്തു

അക്ഷരത്തെറ്റ്

സാധാരണ ജോലി ക്യൂ

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - MTTR 45 മിനിറ്റ് മുതൽ 8 മിനിറ്റ് വരെ. പേയ്‌മെൻ്റ് സേവനം തകരാറിലായി. ഡ്യൂട്ടിയിലുള്ള എഞ്ചിനീയർ മാസ്ക് ധരിച്ച ലോഗുകളും അവസാനത്തെ വിന്യാസ വിവരങ്ങളും AI-ക്ക് നൽകി, "അവസാന 20 മിനിറ്റിനുള്ളിൽ ഏറ്റവും സാധ്യതയുള്ള ട്രിഗർ ഏതാണ്?" അവൻ ചോദിച്ചു. അവസാന വിന്യാസത്തിൻ്റെ അതേ മിനിറ്റിൽ തകർച്ച ആരംഭിച്ചതായി AI കാണിച്ചു. എഞ്ചിനീയർ ഉടൻ തന്നെ ആ പതിപ്പ് പിൻവലിച്ചു; 8 മിനിറ്റിനുള്ളിൽ സർവീസ് മടങ്ങി. മൂലകാരണം (പുതിയ പതിപ്പിലെ ഒരു കണക്ഷൻ പൂൾ ബഗ്) പിന്നീട് സൗകര്യപ്രദമായി അന്വേഷിച്ചു.

കേസ് 2-20 മിനിറ്റിനുള്ളിൽ പോസ്റ്റ്‌മോർട്ടം സ്കെച്ച്. ഒരു SEV2 ന് ശേഷം, ടീം തളർന്നു, ഒരു റിപ്പോർട്ട് എഴുതാനുള്ള ശക്തി ഇല്ലായിരുന്നു; പലപ്പോഴും റിപ്പോർട്ട് ആഴ്ചകളോളം വൈകി. ഇത്തവണ, അവർ ടൈംലൈനും സംഭവ കുറിപ്പുകളും AI-ക്ക് നൽകുകയും കുറ്റകൃത്യങ്ങളില്ലാത്ത പോസ്റ്റ്‌മോർട്ടം സ്കെച്ച് തയ്യാറാക്കുകയും ചെയ്തു. ഇംപാക്ട്, ടൈംലൈൻ, ആക്ഷൻ ഇനങ്ങൾ എന്നിവയ്ക്കായി AI ഒരു വൃത്തിയുള്ള ചട്ടക്കൂട് സൃഷ്ടിച്ചു; സംഘം അതിൽ വസ്തുതകൾ പൂരിപ്പിച്ച് 20 മിനിറ്റിനുള്ളിൽ പ്രസിദ്ധീകരിച്ചു. പാഠം നഷ്ടപ്പെട്ടില്ല.

കേസ് 3 - തെറ്റായ മൂലകാരണം പിടിക്കപ്പെട്ടു. ഒരു സാഹചര്യത്തിൽ, "റൂട്ട് കോസ് ഡാറ്റാബേസ് ഓവർലോഡ്" എന്ന് AI പറഞ്ഞു, അത് ന്യായമാണെന്ന് തോന്നുന്നു. എന്നാൽ എഞ്ചിനീയർ അളവുകൾ സ്ഥിരീകരിച്ചു: സംഭവ സമയത്ത് ഡാറ്റാബേസ് ലോഡ് സാധാരണമായിരുന്നു. യഥാർത്ഥ കാരണം ഒരു ബാഹ്യ DNS പ്രശ്നമായിരുന്നു. AI യുടെ പ്രാരംഭ സിദ്ധാന്തം ദ്രാവകമായിരുന്നു, പക്ഷേ തെറ്റായിരുന്നു; ഡാറ്റ ഉപയോഗിച്ചുള്ള മൂല്യനിർണ്ണയം തെറ്റായ നിഗമനത്തോടെ റിപ്പോർട്ട് പ്രസിദ്ധീകരിക്കുന്നതിൽ നിന്ന് തടഞ്ഞു.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) സംഭവ സമയത്ത് ദ്രുതപരിശോധന:

ഞങ്ങൾ ഒരു പ്രൊഡക്ഷൻ ഇവൻ്റ് അനുഭവിക്കുകയാണ്. മറഞ്ഞിരിക്കുന്ന ലക്ഷണങ്ങൾ: [SYMPTOM]. അവസാന മാറ്റങ്ങൾ: [അവസാനം വിന്യസിക്കുക/മാറ്റം]. എനിക്ക് തരൂ:(1) പ്രോബബിലിറ്റിയുടെ ക്രമത്തിൽ ഏറ്റവും സാധ്യതയുള്ള 3 മൂലകാരണ സിദ്ധാന്തങ്ങൾ,(2) ഓരോന്നും 1 മിനിറ്റിനുള്ളിൽ പരിശോധിക്കുന്ന കമാൻഡ്/മെട്രിക്, (3) ഏറ്റവും വേഗതയേറിയ സുരക്ഷിതമായ ലഘൂകരണ ഘട്ടം (ഉദാ. റോൾബാക്ക്).കണിശമായി പറഞ്ഞാൽ; ഓരോ സിദ്ധാന്തവും ഞാൻ പരിശോധിക്കേണ്ടതുണ്ടെന്ന് പ്രസ്താവിക്കുക.

2) നിരപരാധിയായ പോസ്റ്റ്‌മോർട്ടം സ്കെച്ച്:

സംഭവ കുറിപ്പുകളിൽ നിന്ന് കുറ്റമറ്റ പോസ്റ്റ്‌മോർട്ടം സ്കെച്ച് ചുവടെ എഴുതുക. വിഭാഗങ്ങൾ: സംഗ്രഹം, ആഘാതം (ഉപയോക്താവ്/ദൈർഘ്യം/ചെലവ്), ടൈംലൈൻ, മൂലകാരണം(കൾ), നന്നായി പോയത്, മോശമായത്, പ്രവർത്തന ഇനങ്ങൾ (ഓരോന്നിനും ഉടമ + തീയതി ഫീൽഡ്). പേരിടൽ, പ്രക്രിയ, സിസ്റ്റം എന്നിവയിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുക. കുറിപ്പുകൾ: [മാസ്ക്]

3) 5 എന്തുകൊണ്ട് വിശകലനം:

ഇനിപ്പറയുന്ന ലക്ഷണത്തോടെ ആരംഭിക്കുന്ന ഒരു "5 എന്തുകൊണ്ട്" ശൃംഖല നിർമ്മിക്കുക: [Symptom]. ഓരോ ഘട്ടത്തിലും സാധ്യമായ ഒന്നിൽ കൂടുതൽ ശാഖകൾ ഉണ്ടെങ്കിൽ കാണിക്കുക. ഓരോ "എന്തുകൊണ്ട്" എന്നതിന് അടുത്തായി ഞാൻ പരിശോധിക്കുന്ന തെളിവുകൾ (ലോഗ്/മെട്രിക്) എഴുതുക. അവസാനം, ഇതുവരെ പരിശോധിച്ചിട്ടില്ലാത്ത ഘട്ടങ്ങൾ അടയാളപ്പെടുത്തുക.

4) പ്രവർത്തനക്ഷമമായ ഇനങ്ങൾ സൃഷ്ടിക്കുന്നു:

ഈ മൂലകാരണം അനുസരിച്ച്, അതേ ഇവൻ്റ് ആവർത്തിക്കുന്നത് തടയുന്ന പ്രവർത്തനക്ഷമമായ ഇനങ്ങൾ നിർദ്ദേശിക്കുക. ഓരോ ഇനത്തെയും ഇപ്രകാരം തരംതിരിക്കുക: (എ) പ്രതിരോധം, കണ്ടെത്തൽ അല്ലെങ്കിൽ കുറയ്ക്കൽ, (ബി) കണക്കാക്കിയ പ്രയത്നം, (സി) ആഘാതം. ഉയർന്ന ആഘാതം/പ്രയത്ന അനുപാതം അനുസരിച്ച് അടുക്കുക. മൂലകാരണം: [X]

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായത്: "സേവനം തകർന്നു, ഞാൻ എന്തുചെയ്യണം?"

ഫലം: സന്ദർഭമില്ല; നിങ്ങളുടെ കേസിന് അനുയോജ്യമല്ലാത്ത പൊതുവായ ശുപാർശകൾ നൽകാൻ AI-ക്ക് കഴിയും, കൂടാതെ ഒരു നിർണായക മൂലകാരണം കണ്ടെത്താനും കഴിയും.

ശക്തമായത്: "പ്രൊഡക്ഷൻ പേയ്‌മെൻ്റ് സേവനം 5 മിനിറ്റായി 5xx നൽകുന്നു. അവസാനത്തെ വിന്യാസം 6 മിനിറ്റ് മുമ്പായിരുന്നു. സാധ്യതയുള്ള 3 മൂലകാരണ സിദ്ധാന്തങ്ങൾ പ്രോബബിലിറ്റിയുടെ ക്രമത്തിൽ നൽകുക, അവ ഓരോന്നും പരിശോധിച്ചുറപ്പിക്കുന്ന കമാൻഡിനോട് പറയുക, ഏറ്റവും വേഗതയേറിയ സുരക്ഷിതമായ ലഘൂകരണം നിർദ്ദേശിക്കുക. വ്യക്തമാക്കരുത്, ഞാൻ പരിശോധിക്കേണ്ടതുണ്ടെന്ന് പ്രസ്താവിക്കുക."

വ്യത്യാസം: രണ്ടാമത്തെ പ്രോംപ്റ്റ് ലക്ഷണം, സമയം, അവസാന മാറ്റം എന്നിവ നൽകുന്നു; ഇത് അനുമാനം + സ്ഥിരീകരണം + കുറയ്ക്കൽ ആവശ്യപ്പെടുന്നു, കൂടാതെ AI കൃത്യതയില്ലാത്തതാക്കുകയും ചെയ്യുന്നു.

സാധാരണ തെറ്റുകൾ

  • ലഘൂകരിക്കുന്നതിന് മുമ്പ് കൃത്യമായ മൂലകാരണം അന്വേഷിക്കുക. ഇത് രക്തസ്രാവം നിർത്തുന്നത് വൈകിപ്പിക്കുകയും എംടിടിആർ വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു.
  • AI-യുടെ ആദ്യ സിദ്ധാന്തം സ്ഥിരീകരിക്കാതെ പ്രസിദ്ധീകരിക്കുന്നു. ദ്രാവകവും എന്നാൽ തെറ്റായ മൂലവും റിപ്പോർട്ടിലേക്ക് ചോർച്ചയുണ്ടാക്കുന്നു.
  • കുറ്റപ്പെടുത്തുന്ന ഭാഷ. അജ്ഞാതമായി എഴുതിയ പോസ്റ്റ്‌മോർട്ടം മറച്ചുവെക്കലും ആവർത്തിച്ചുള്ള പിശകും വളർത്തുന്നു.
  • ബുള്ളറ്റ് പോയിൻ്റുകളില്ലാത്ത പ്രവർത്തന-അധിഷ്‌ഠിത റിപ്പോർട്ട്. ഉടമയും തീയതിയും ഇല്ലാത്ത ഒരു നിർദ്ദേശം ഒരിക്കലും നടപ്പിലാക്കില്ല.
  • ഇവൻ്റ് ഡാറ്റ മറയ്ക്കാതെ പങ്കിടുന്നു. പോസ്റ്റ്‌മോർട്ടം വിശാലമായ പ്രേക്ഷകരിലേക്ക് പോകുന്നു; രഹസ്യ/വ്യക്തിഗത വിവരങ്ങൾ ചോർന്നു.
  • റോൾബാക്ക് പാത മുൻകൂട്ടി തയ്യാറാക്കുന്നില്ല. വിപരീതമാക്കൽ പ്രായോഗികമല്ലെങ്കിൽ, കുറയ്ക്കൽ മന്ദഗതിയിലാകും.

ചുരുക്കത്തിൽ

അനിവാര്യമായ ഇവൻ്റുകൾ വേഗത്തിൽ കണ്ടെത്തുന്നതിനും ലഘൂകരിക്കുന്നതിനും പരിഹരിക്കുന്നതിനും പഠിക്കുന്നതിനുമാണ് സംഭവ മാനേജ്മെൻ്റ്; MTTD, MTTR എന്നിവ പ്രധാന അളവുകോലുകളാണ്. "ആദ്യം ലഘൂകരിക്കുക, പിന്നീട് അന്വേഷിക്കുക" എന്നതാണ് സുവർണ്ണ നിയമം, അറിയപ്പെടുന്ന-നല്ല പതിപ്പിലേക്ക് മടങ്ങുന്നത് പലപ്പോഴും വേഗത്തിലുള്ള ലഘൂകരണമാണ്. ഇവൻ്റ് സമയത്ത് ലോഗുകൾ സംഗ്രഹിക്കുന്നതിലും അനുമാനങ്ങൾ ചുരുക്കുന്നതിലും ഇവൻ്റിന് ശേഷം കുറ്റമറ്റ പോസ്റ്റ്‌മോർട്ടം സ്കെച്ചുകൾ നിർമ്മിക്കുന്നതിലും AI വിലമതിക്കാനാവാത്തതാണ് - എന്നാൽ ഓരോ മൂലകാരണ സിദ്ധാന്തത്തെയും ഡാറ്റ ഉപയോഗിച്ച് സാധൂകരിക്കുക, കുറ്റപ്പെടുത്തുന്ന ഭാഷ, ഇവൻ്റ് ഡാറ്റ മറയ്ക്കുക എന്നിവ നിങ്ങളുടെ ഉത്തരവാദിത്തമാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു മുൻകാല (അല്ലെങ്കിൽ സാങ്കൽപ്പിക) ഇവൻ്റ് പരിഗണിക്കുക. (1) "ഓൺ-ദി-സീൻ റാപ്പിഡ് ട്രയേജ്" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് AI അനുമാനങ്ങളും സ്ഥിരീകരണ ഘട്ടങ്ങളും സൃഷ്ടിക്കാൻ ആവശ്യപ്പെടുക; ഡാറ്റ ഉപയോഗിച്ച് ഏത് അനുമാനം സ്ഥിരീകരിക്കാനാകുമെന്ന് ശ്രദ്ധിക്കുക. (2) "കുറ്റമില്ലാത്ത പോസ്റ്റ്‌മോർട്ടം ഔട്ട്‌ലൈൻ" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് ഒരു റിപ്പോർട്ട് തയ്യാറാക്കി അതിൽ വസ്തുതകൾ പൂരിപ്പിക്കുക. (3) പ്രവർത്തനക്ഷമമായ രണ്ട് ഇനങ്ങളെങ്കിലും തിരിച്ചറിയുകയും ഓരോന്നിനും ഒരു ഉടമയും തീയതിയും നൽകുകയും ചെയ്യുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] സംഭവസമയത്ത്, ലഘൂകരിക്കാൻ (റോൾബാക്ക്/ഷട്ട്ഡൗൺ) ഞാൻ ആദ്യം ചിന്തിച്ചു, പിന്നീട് മൂലകാരണം ഉപേക്ഷിച്ചു.
  • AI-യുടെ എല്ലാ മൂലകാരണ സിദ്ധാന്തങ്ങളും ലോഗ്/മെട്രിക് ഉപയോഗിച്ച് ഞാൻ പരിശോധിച്ചു.
  • [ ] പോസ്റ്റ്‌മോർട്ടത്തെ കുറ്റപ്പെടുത്താത്ത ഒരു ഭാഷയിലാണ് ഞാൻ അത് എഴുതിയത്, പ്രക്രിയയിലും സിസ്റ്റത്തിലും ശ്രദ്ധ കേന്ദ്രീകരിച്ചു.
  • [ ] ഞാൻ പ്രവർത്തനക്ഷമമായ ഓരോ ഇനത്തിനും ഒരു ഉടമയും തീയതിയും നൽകി.
  • [ ] ഞാൻ AI-ക്ക് നൽകിയ ഇവൻ്റ് ഡാറ്റയിൽ നിന്നുള്ള രഹസ്യവും വ്യക്തിപരവുമായ വിവരങ്ങൾ മറച്ചുവച്ചു.
  • [ ] ആഘാതത്തിനനുസരിച്ച് ഞാൻ തീവ്രത ലെവൽ ശരിയായി നിശ്ചയിച്ചു.