ඒකක
1. DevOps සහ Cloud AI සඳහා හැඳින්වීම: භූමිකාවන්, සීමා මායිම්, සත්‍යාපනය, ආරක්ෂාව සහ රහස් 2. කෘතිම බුද්ධිය සහිත CI/CD නල මාර්ග සැලසුම් කිරීම: GitHub ක්‍රියා සහ GitLab CI 3. කේතය ලෙස යටිතල පහසුකම් කළමනාකරණය: Terraform සහ IaC සමඟ කෘතිම බුද්ධිය 4. බහාලුම්කරණය: කෘතිම බුද්ධිය සමඟින් ඩොකර්ෆයිල් සහ රූප ප්‍රශස්තකරණය 5. කුබර්නෙටස්: මැනිෆෙස්ට්, හෙල්ම් සහ AI-බලවත් වාද්‍ය වෘන්දය 6. අධීක්‍ෂණය සහ නිරීක්ෂණ හැකියාව: මෙට්‍රික්, ලොග්, ට්‍රේස් සහ එලාම් රීති 7. සිදුවීම් කළමනාකරණය සහ පශ්චාත් මරණ පරීක්ෂණය: කෘතිම බුද්ධිය සමඟ මූල හේතුව විශ්ලේෂණය 8. Cloud Cost Optimization (FinOps): කෘතිම බුද්ධිය සමඟ අපද්‍රව්‍ය සඳහා දඩයම් කිරීම 9. ස්ක්‍රිප්ට් සහ ස්වයංක්‍රීය ජනනය: Bash, Python සහ PowerShell 10. ආරක්ෂාව සහ රහස් කළමනාකරණය: DevSecOps සහ කෘතිම බුද්ධිය 11. නිෂ්පාදන සත්‍යාපනය, මුදා හැරීමේ උපාය මාර්ග සහ අවසානය සිට අවසානය දක්වා AI කාර්ය ප්‍රවාහය
ඒකකය 7 / 11

සිදුවීම් කළමනාකරණය සහ පශ්චාත් මරණ පරීක්ෂණය: කෘතිම බුද්ධිය සමඟ මූල හේතුව විශ්ලේෂණය

ලාභ:

  • සිදුවීමක ජීවන චක්‍රය (හඳුනා ගැනීම, ට්‍රයිජ්, අවම කිරීම, විභේදනය, පශ්චාත් මරණ පරීක්ෂණය), MTTD/MTTR ප්‍රමිතික සහ 'පළමුව අවම කරන්න, පසුව විමර්ශනය කරන්න' යන මූලධර්මය අවබෝධ කර ගැනීමේ හැකියාව.
  • සිද්ධිය වූ අවස්ථාවේ උපකල්පන පටු කිරීමට සහ නිර්දෝෂී පශ්චාත් මරණ සටහනක් නිෂ්පාදනය කිරීමට AI භාවිතා කිරීමේ හැකියාව, දත්ත සමඟ එක් එක් මූල හේතුව තහවුරු කිරීම
  • පශ්චාත් මරණ පරීක්ෂණයට දොස් නොකියන භාෂාවකින් ලිවීමේ විනය යෙදීමේ හැකියාව සහ එය වසං කිරීමෙන් සිදුවීම් දත්ත බෙදාගැනීම.

සෑම පද්ධතියක්ම අවසානයේ බිඳ වැටේ. වෙනස වන්නේ මෙම නොවැළැක්විය හැකි සිදුවීම සඳහා හොඳ කණ්ඩායම් සූදානම් වන ආකාරය සහ ඔවුන් ඉගෙන ගන්නා ආකාරයයි. සිදුවීම යනු සේවාව කඩාකප්පල් කරන හෝ කඩාකප්පල් කිරීමට තර්ජනය කරන අනපේක්ෂිත සිදුවීමකි: සේවා බිඳවැටීමක්, ප්‍රතිචාර දැක්වීමේ වේලාවන් අහස උසට නැගීම, දත්ත නැතිවීමක්. සිද්ධි කළමනාකරණය යනු හැකි ඉක්මනින් සිද්ධිය හඳුනා ගැනීම, අවම කිරීම, විසඳීම සහ ඉන් පසුව ඉගෙන ගැනීමයි. DevOps සහ SRE (Site Reliability Engineering) වෘත්තිකයන් දිවා රෑ මෙහෙයවන විනය මෙයයි.

තීරනාත්මක ප්‍රමිතික දෙකක් සිදුවීමේ ගුණාත්මක භාවය මනිනු ලබයි: MTTD (හඳුනා ගැනීමට මධ්‍යන්‍ය වේලාව) සහ MTTR (ප්‍රතිසාධනය සඳහා මධ්‍යන්‍ය වේලාව). ඉලක්කය දෙකම හැකිලීමයි. AI මෙහි විශාල අගයන් දෙකක් එකතු කරයි: සිදුවිය හැකි මූල හේතුව අඩු කිරීම සඳහා සිදුවීම සිදුවන අවස්ථාවේ ලඝු-සටහන් සහ ප්‍රමිතික ඉක්මනින් සාරාංශ කිරීම සහ සිදුවීමෙන් පසු පශ්චාත් මරණ පරීක්ෂණයක් (පශ්චාත් සිදුවීම් විමර්ශන වාර්තාව) ඉක්මනින් කෙටුම්පත් කිරීම. නමුත් සිදුවීම් ක්‍රියාවලිය පිළිබඳ තීරණ - කුමන සේවාව අක්‍රිය කළ යුතුද, ආපසු හැරවිය යුතුද, පාරිභෝගිකයාට කිව යුතු දේ - ඔබ සතුය.

සිදුවීමක ජීවන චක්‍රය

  1. හඳුනාගැනීම: අනතුරු ඇඟවීමක් හෝ පාරිභෝගික පැමිණිල්ලක් පැමිණේ. ඉක්මනින්ම හොඳයි.
  2. Triage: එය කොතරම් බරපතලද? වසම යනු කුමක්ද? බරපතල මට්ටම් පවරනු ලැබේ - සාමාන්‍යයෙන් SEV1 (වඩාත්ම තීරණාත්මක, සම්පූර්ණ පද්ධතිය) SEV4 (සුළු) වෙත.
  3. ඔබේ ප්‍රතිචාර කණ්ඩායම එක්රැස් කරන්න. තීරණාත්මක සිදුවීම් වලදී, සිද්ධි අණ දෙන නිලධාරියා සම්බන්ධීකරණය භාර ගනී.
  4. අවම කිරීම: පළමුව ලේ ගැලීම නවත්වන්න - බොහෝ විට ආපසු හැරීමක් හෝ ධජයක් ආවරණය කිරීම. මූල හේතුව ඔබට පසුව සොයාගත හැකිය.
  5. විසඳන්න: ස්ථිර විසඳුමක් යොදන්න.
  6. ඉගෙන ගන්න (පශ්චාත් මරණ පරීක්ෂණය): සිදුවූයේ කුමක්ද, එය සිදු වූයේ ඇයි, එය නැවත සිදුවීම වළක්වා ගන්නේ කෙසේද?
ඉඟිය: සිද්ධිය වූ අවස්ථාවේ වඩාත්ම මිල අධික අත්වැරැද්දක් වන්නේ ලේ ගැලීම නැවැත්වීම ප්රමාද කිරීමයි, මන්ද "අපි මුලින්ම නිවැරදි මූල හේතුව වෙත යමු." රීතිය: පළමු අඩු කිරීම (ප්‍රතිසාධනය/ප්‍රතිසාධනය සේවාව), පසුව විමසන්න. දන්නා-හොඳ අනුවාදයක් වෙත ආපසු යාම බොහෝ විට ඉක්මන්ම අවම කිරීම වේ.

වරදින් තොර පශ්චාත් මරණ සංස්කෘතිය

සෞඛ්‍ය සම්පන්න කණ්ඩායම්වල කොඳු නාරටිය නිර්දෝෂී පශ්චාත් මරණ පරීක්ෂණ සංස්කෘතියකි: ඉලක්කය "කවුද එය කළේ" නොව "මෙම වැරැද්දට ඉඩ දුන්නේ කුමන පද්ධතිය සහ ක්‍රියාවලියද?" යනු ප්‍රශ්නයයි. දඬුවම් දෙන බව දන්නවා නම් මිනිස්සු වරද සඟවනවා; සැඟවුණු දෝෂය නැවත නැවතත් සිදු වේ. පශ්චාත් මරණ පරීක්ෂණය චෝදනා වාර්තාවක් නොව ඉගෙනුම් ලියවිල්ලකි.

හොඳ පශ්චාත් මරණ පරීක්ෂණයකට ඇතුළත් වන්නේ: සාරාංශය, බලපෑම (පරිශීලකයින් කී දෙනෙක්, කොපමණ කාලයක්, කොපමණ මුදලක්), කාල නියමය, මූල හේතුව(ය), හොඳින්/නරක සිදු වූ දේ, සහ ක්‍රියා අයිතම-කොන්ක්‍රීට් මිනුම්, එක් එක් හිමිකරු සහ දිනය සමඟ.

අවවාදයයි: AI සමඟ පශ්චාත් මරණ පරීක්ෂණ ලියන විට, චෝදනා කරන භාෂාව ඉවත් කිරීමට වග බලා ගන්න (එනම් "X පුද්ගලයා වැරැද්දක් කර ඇත"). AI වෙත සිදුවීම් දත්ත පෝෂණය කිරීමේදී සේවාදායක හැඳුනුම්පත්, අභ්‍යන්තර IPs සහ රහස් ආවරණය කරන්න - පශ්චාත් මරණ පරීක්ෂණ බොහෝ විට පුළුල් ලෙස බෙදා ගනී.

මූල හේතු විශ්ලේෂණය: 5 ඇයි සහ AI

සම්භාව්‍ය තාක්‍ෂණයක් වන්නේ "5 ඇයි": අසන්න "ඇයි?" ගැටලුවකට. නැවත නැවතත් ඇසීමෙන්, ඔබ මතුපිට රෝග ලක්ෂණයෙන් සැබෑ මූලයට පැමිණේ. "සේවාව බිඳ වැටුණි. ඇයි? මතකය නැති වී ඇත. ඇයි? කාන්දුවක් ඇති විය. ඇයි? පුස්තකාල යාවත්කාලීන කිරීමක්..." AI මෙම දාමය ගොඩනඟා හැකි ශාඛා යෝජනා කිරීමට ඉක්මන් වේ - නමුත් ඔබ ඔබේ දත්ත සමඟ එක් එක් "ඇයි" සත්‍යාපනය කළ යුතුය; AI හට සාධාරණ නමුත් වැරදි දාමයක් ගොඩනගා ගත හැකිය.

බරපතලකම වගුව

මට්ටම

බලපෑම

උදාහරණයක්

මැදිහත් වීම

SEV1

සම්පූර්ණ පද්ධතිය/විවේචනාත්මක ව්‍යාපාර පාඩුව

ගෙවීම සම්පූර්ණයෙන්ම පහත වැටී ඇත

ක්ෂණිකව, මුළු කණ්ඩායමම, අණ දෙන නිලධාරියා

SEV2

ප්රධාන අක්රිය වීම

ඇතුල්වීම් අසාර්ථක විය

වේගවත්, ඇමතුම් + සහාය

SEV3

අර්ධ/සීමිත බලපෑම

වාර්තාවක් ප්‍රමාදයි

වැඩ කරන වේලාවන් තුළ

SEV4

කුඩා / රූපලාවන්ය

මුද්‍රණ දෝෂයක්

සාමාන්ය වැඩ පෝලිම

කුඩා නඩු තුනක්

නඩුව 1 - MTTR විනාඩි 45 සිට විනාඩි 8 දක්වා. ගෙවීම් සේවාව බිඳ වැටුණි. රාජකාරියේ යෙදී සිටි ඉංජිනේරුවරයා වෙස්මුහුණු ලොග සහ අවසාන යෙදවීමේ තොරතුරු AI වෙත ලබා දී "පසුගිය මිනිත්තු 20 තුළ බොහෝ දුරට ප්‍රේරකය කුමක්ද?" ඔහු ඇසුවේය. AI විසින් පෙන්නුම් කළේ බිඳවැටීම අවසන් වරට යෙදවීම සිදු වූ මොහොතේම ආරම්භ වූ බවයි. ඉංජිනේරුවරයා වහාම එම අනුවාදය ආපසු හැරවීය; සේවාව විනාඩි 8 කින් ආපසු පැමිණියේය. මූල හේතුව (නව අනුවාදයේ සම්බන්ධතා සංචිත දෝෂයක්) පසුව පහසුවෙන් විමර්ශනය කරන ලදී.

නඩුව 2-පශ්චාත් මරණ පරීක්ෂණය විනාඩි 20 කින්. SEV2 එකකින් පසුව, කණ්ඩායම වෙහෙසට පත්ව සිටි අතර වාර්තාවක් ලිවීමට ශක්තියක් නොතිබුණි; බොහෝ විට වාර්තාව සති ගණන් ප්‍රමාද විය. මෙම අවස්ථාවේදී, ඔවුන් AI වෙත කාල නියමය සහ සිදුවීම් සටහන් ලබා දී අපරාධවලින් තොර පශ්චාත් මරණ සටහනක් ඉදිරිපත් කළහ. AI බලපෑම, කාල නියමය සහ ක්‍රියා අයිතම සඳහා මනා රාමුවක් නිර්මාණය කළේය; කණ්ඩායම එය කරුණු වලින් පුරවා විනාඩි 20 කින් එය ප්‍රකාශයට පත් කළේය. පාඩම නැති වුණේ නැහැ.

නඩුව 3 - වැරදි මූල හේතුව අල්ලා. එක් අවස්ථාවක, AI පැවසුවේ "root cause database overload" සහ එය සාධාරණ බව පෙනේ. නමුත් ඉංජිනේරුවරයා ප්‍රමිතික තහවුරු කළේය: සිද්ධිය වූ අවස්ථාවේ දත්ත සමුදාය භාරය සාමාන්‍ය විය. සැබෑ හේතුව බාහිර DNS ගැටලුවකි. AI හි ආරම්භක කල්පිතය තරල නමුත් වැරදි ය; දත්ත සමඟ වලංගු කිරීම වැරදි නිගමනයක් සමඟ වාර්තාව ප්‍රකාශයට පත් කිරීම වළක්වා ඇත.

පිටපත් කළ හැකි සැකිලි හතරක්

1) සිද්ධිය වූ අවස්ථාවේ දී වේගවත් පරීක්ෂාව:

අපි නිෂ්පාදන සිදුවීමක් අත්විඳිමින් සිටිමු. ආවරණ රෝග ලක්ෂණ: [SYMPTOM]. අවසාන වෙනස්කම්: [අවසාන යෙදවීම/වෙනස් කිරීම]. මට දෙන්න:(1) සම්භාවිතාව අනුපිළිවෙලට බොහෝ දුරට ඉඩ ඇති මූල හේතු උපකල්පන 3, (2) විනාඩි 1 කින් එක් එක් සත්‍යාපනය කරන විධානය/මෙට්‍රික්, (3) වේගවත්ම ආරක්ෂිත අවම කිරීමේ පියවර (උදා. ආපසු හැරවීම). හරියටම කිවහොත්; මම එක් එක් උපකල්පනය සත්‍යාපනය කළ යුතු බව ප්‍රකාශ කරන්න.

2) අහිංසක පශ්චාත් මරණ සටහන:

පහත සිදුවීම් සටහන් වලින් නිර්දෝෂී පශ්චාත් මරණ සටහනක් ලියන්න. කොටස්: සාරාංශය, බලපෑම (පරිශීලක/කාලසීමාව/පිරිවැය), කාලරේඛාව, මූල හේතුව(ය), හොඳින් ගිය දේ, නරකට ගිය දේ, ක්‍රියා අයිතම (එක් එක් හිමිකරු + දිනය ක්ෂේත්‍රය සමඟ). නම් කිරීම, ක්රියාවලිය සහ පද්ධතිය කෙරෙහි අවධානය යොමු කරන්න. සටහන්: [වෙස්මුහුණු]

3) 5 ඇයි විශ්ලේෂණය:

පහත රෝග ලක්ෂණයෙන් ආරම්භ වන "5 ඇයි" දාමයක් සාදන්න: [SYMPTOM]. සෑම පියවරකදීම හැකි ශාඛා එකකට වඩා තිබේදැයි පෙන්වන්න. එක් එක් "ඇයි" අසලින් මම එය සත්‍යාපනය කිරීමට බලන සාක්ෂි (ලඝු-සටහන/මෙට්‍රික්) ලියන්න. අවසානයේ, තවමත් සත්‍යාපනය කර නොමැති පියවර සලකුණු කරන්න.

4) ක්‍රියා කළ හැකි අයිතම නිර්මාණය කිරීම:

මෙම මූල හේතුව අනුව, එකම සිදුවීම නැවත නැවත සිදුවීම වලක්වන ක්‍රියා කළ හැකි අයිතම යෝජනා කරන්න. සෑම අයිතමයක්ම වර්ග කරන්න: (අ) වැළැක්වීම, හඳුනා ගැනීම හෝ අඩු කිරීම, (ආ) ඇස්තමේන්තුගත උත්සාහය, (ඇ) බලපෑම. ඉහළම බලපෑම/උත්සාහ අනුපාතය අනුව වර්ග කරන්න. මූල හේතුව: [X]

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල: "සේවාව බිඳ වැටී ඇත, මා කුමක් කළ යුතුද?"

ප්රතිඵලය: සන්දර්භය නැත; AI හට ඔබේ නඩුවට නොගැලපෙන සාමාන්‍ය නිර්දේශ ඉදිරිපත් කළ හැකි අතර, නිශ්චිත මූල හේතුව පවා ඉදිරිපත් කළ හැක.

ප්‍රබල: "නිෂ්පාදන ගෙවීම් සේවාව මිනිත්තු 5ක් සඳහා 5xx ලබා දී ඇත. අවසන් යෙදවීම මිනිත්තු 6කට පෙරය. සම්භාවිතාව අනුව බොහෝ දුරට ඉඩ ඇති මූල හේතු උපකල්පන 3 ලබා දෙන්න, ඒ සෑම එකක්ම සත්‍යාපනය කරන විධානයට කියන්න, සහ වේගවත්ම ආරක්ෂිත අවම කිරීම යෝජනා කරන්න. නිශ්චිත නොවන්න, මට සත්‍යාපනය කිරීමට අවශ්‍ය බව ප්‍රකාශ කරන්න."

වෙනස: දෙවන විමසුම රෝග ලක්ෂණය, වේලාව සහ අවසාන වෙනස ලබා දෙයි; එය කල්පිතය + සත්‍යාපනය + අඩු කිරීම ඉල්ලා සිටින අතර AI නිරවද්‍යව තබා ගනී.

පොදු වැරදි

  • අවම කිරීමට පෙර නිශ්චිත මූල හේතුව සොයමින්. එය ලේ ගැලීම නැවැත්වීම ප්‍රමාද කරන අතර MTTR වැඩි කරයි.
  • AI හි පළමු කල්පිතය සත්‍යාපනය නොකර ප්‍රකාශයට පත් කිරීම. තරල නමුත් ව්‍යාජ මූල හේතු වාර්තාවට කාන්දු වේ.
  • චෝදනා කරන භාෂාව. නිර්නාමිකව ලියා ඇති පශ්චාත් මරණ පරීක්ෂණය සැඟවීම සහ නැවත නැවත දෝෂය ඇති කරයි.
  • බුලට් පොයින්ට් නොමැතිව ක්‍රියාවට නැඹුරු වාර්තාව. හිමිකරුවෙකු සහ දිනයක් නොමැති යෝජනාවක් කිසි විටෙකත් ක්‍රියාත්මක නොවේ.
  • සිදුවීම් දත්ත වසන් නොකර බෙදා ගැනීම. පශ්චාත් මරණ පරීක්ෂණය පුළුල් ප්‍රේක්ෂක පිරිසක් වෙත යයි; රහස්/පුද්ගලික දත්ත කාන්දු වේ.
  • ආපසු හැරවීමේ මාර්ගය කල්තියා සූදානම් නොකිරීම. ආපසු හැරවීම ප්රායෝගික නොවේ නම්, අඩු කිරීම මන්දගාමී වේ.

සාරාංශයකින්

සිදුවීම් කළමනාකරණය යනු නොවැළැක්විය හැකි සිදුවීම් ඉක්මනින් හඳුනා ගැනීම, අවම කිරීම, විසඳීම සහ ඉගෙනීමයි; MTTD සහ MTTR ප්‍රධාන මිතික වේ. ස්වර්ණමය රීතිය "පළමුව අවම කරන්න, පසුව විමර්ශනය කරන්න" සහ දන්නා-හොඳ අනුවාදය වෙත ආපසු යාම බොහෝ විට වේගවත්ම අවම කිරීම වේ. සිදුවීම සිදුවන අවස්ථාවේ ලඝු-සටහන් සාරාංශ කිරීම, උපකල්පන පටු කිරීම සහ සිද්ධියෙන් පසු නිර්දෝෂී පශ්චාත් මරණ කටු සටහන් නිෂ්පාදනය කිරීම සඳහා AI ඉතා අගනේය - නමුත් දත්ත සමඟ එක් එක් මූල හේතු උපකල්පනය වලංගු කිරීම, දොස් පැවරීමේ භාෂාව ඉවත් කිරීම සහ සිදුවීම් දත්ත වසං කිරීම ඔබේ වගකීමකි.

යෙදුම් කාර්යය

අතීත (හෝ ප්‍රබන්ධ) සිදුවීමක් සලකා බලන්න. (1) "දර්ශන තලයේ වේගවත් ට්‍රයිජ්" අච්චුව සමඟ AI උපකල්පන සහ සත්‍යාපන පියවර ජනනය කිරීමට සලස්වන්න; දත්ත මගින් තහවුරු කළ හැකි උපකල්පනය සටහන් කරන්න. (2) “වැරදිකරු නොවන පශ්චාත් මරණ පරීක්ෂණ දළ සටහන” අච්චුව භාවිතයෙන් වාර්තාවක් සකස් කර එය කරුණු වලින් පුරවන්න. (3) අවම වශයෙන් ක්‍රියා කළ හැකි අයිතම දෙකක්වත් හඳුනාගෙන ඒ එකකට හිමිකරුවෙකු සහ දිනයක් පවරන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] සිද්ධිය වූ අවස්ථාවේදී, මම මුලින්ම සිතුවේ අවම කිරීම (ආපසු හැරීම / වසා දැමීම) සහ පසුව වන තෙක් මූලික හේතුව අත්හැරීමයි.
  • [ ] මම AI හි සෑම මූල හේතු උපකල්පනයක්ම ලොග්/මෙට්‍රික් සමඟින් සත්‍යාපනය කළෙමි.
  • [ ] මම එය ලිව්වේ පශ්චාත් මරණ පරීක්ෂණයට දොස් නොකියන භාෂාවකින්, ක්‍රියාවලිය සහ පද්ධතිය කෙරෙහි අවධානය යොමු කරමිනි.
  • [ ] මම ක්‍රියා කළ හැකි සෑම අයිතමයකටම හිමිකරුවෙකු සහ දිනයක් පවරමි.
  • [ ] මම AI වෙත ලබා දුන් සිදුවීම් දත්ත වලින් රහස් සහ පුද්ගලික තොරතුරු වසන් කළෙමි.
  • [ ] මම බලපෑමට අනුව බරපතල මට්ටම නිවැරදිව නියම කළෙමි.