युनिट्स
1. DevOps आणि Cloud AI चा परिचय: भूमिका, सीमा, प्रमाणीकरण, सुरक्षा आणि रहस्ये 2. कृत्रिम बुद्धिमत्तेसह CI/CD पाइपलाइन डिझाइन करणे: GitHub क्रिया आणि GitLab CI 3. कोड म्हणून पायाभूत सुविधा व्यवस्थापित करणे: टेराफॉर्म आणि IaC सह कृत्रिम बुद्धिमत्ता 4. कंटेनरायझेशन: डॉकरफाइल आणि आर्टिफिशियल इंटेलिजन्ससह इमेज ऑप्टिमायझेशन 5. कुबर्नेट्स: मॅनिफेस्ट, हेल्म आणि एआय-पॉवर्ड ऑर्केस्ट्रेशन 6. देखरेख आणि निरीक्षणक्षमता: मेट्रिक, लॉग, ट्रेस आणि अलार्म नियम 7. घटना व्यवस्थापन आणि पोस्टमॉर्टम: आर्टिफिशियल इंटेलिजन्ससह मूळ कारण विश्लेषण 8. क्लाउड कॉस्ट ऑप्टिमायझेशन (फिनऑप्स): कृत्रिम बुद्धिमत्तेसह कचरा शोधणे 9. स्क्रिप्ट आणि ऑटोमेशन जनरेशन: बॅश, पायथन आणि पॉवरशेल 10. सुरक्षा आणि रहस्ये व्यवस्थापन: DevSecOps आणि कृत्रिम बुद्धिमत्ता 11. उत्पादन पडताळणी, रिलीझ स्ट्रॅटेजीज आणि एंड-टू-एंड AI वर्कफ्लो
युनिट 7 / 11

घटना व्यवस्थापन आणि पोस्टमॉर्टम: आर्टिफिशियल इंटेलिजन्ससह मूळ कारण विश्लेषण

नफा:

  • एखाद्या घटनेचे जीवनचक्र समजून घेण्याची क्षमता (डिटेक्शन, ट्रायज, मिटिगेशन, रिझोल्यूशन, पोस्टमॉर्टम), MTTD/MTTR मेट्रिक्स आणि 'आधी कमी करा, नंतर तपास करा' हे तत्त्व.
  • घटनेच्या वेळी गृहीतके कमी करण्यासाठी AI वापरण्याची क्षमता आणि डेटासह प्रत्येक मूळ कारण प्रमाणित करून निर्दोष पोस्टमॉर्टम स्केच तयार करणे
  • पोस्टमॉर्टमला दोष न देणाऱ्या भाषेत लिहिण्याची शिस्त लागू करण्याची आणि इव्हेंट डेटा मास्क करून शेअर करण्याची क्षमता.

प्रत्येक यंत्रणा शेवटी बिघडते. या अपरिहार्य कार्यक्रमासाठी चांगले संघ कसे तयार होतात आणि ते कसे शिकतात हा फरक आहे. घटना ही एक अनपेक्षित घटना आहे जी सेवेमध्ये व्यत्यय आणते किंवा व्यत्यय आणण्याची धमकी देते: सेवा क्रॅश, प्रतिसाद वेळा गगनाला भिडणे, डेटा गमावणे. घटना व्यवस्थापन म्हणजे शोधणे, कमी करणे, शक्य तितक्या लवकर घटनेचे निराकरण करणे आणि नंतर त्यातून शिकणे. हीच शिस्त आहे जी DevOps आणि SRE (साइट विश्वसनीयता अभियांत्रिकी) व्यावसायिकांना रात्रंदिवस चालवते.

दोन गंभीर मेट्रिक्स इव्हेंटची गुणवत्ता मोजतात: MTTD (मीन टाइम टू डिटेक्ट) आणि MTTR (मीन टाइम टू रिकव्हर). दोन्ही संकुचित करण्याचे ध्येय आहे. AI येथे दोन मोठी मूल्ये जोडते: संभाव्य मूळ कारण कमी करण्यासाठी इव्हेंटच्या वेळी लॉग आणि मेट्रिक्सचा त्वरीत सारांश करणे आणि इव्हेंटनंतर पोस्टमॉर्टम (पोस्ट-इव्हेंट तपास अहवाल) त्वरीत तयार करणे. परंतु इव्हेंटच्या कोर्सबद्दल निर्णय - कोणती सेवा बंद करायची, रोलबॅक, ग्राहकाला काय सांगायचे - हे तुमचे आहेत.

एखाद्या घटनेचे जीवन चक्र

  1. डिटेक्शन: अलार्म वाजतो किंवा ग्राहकाची तक्रार येते. जितक्या लवकर तितके चांगले.
  2. Triage: किती गंभीर आहे? डोमेन म्हणजे काय? तीव्रता पातळी नियुक्त केल्या जातात-सामान्यतः SEV1 (सर्वात गंभीर, संपूर्ण सिस्टम) SEV4 (किरकोळ) ला.
  3. तुमचा प्रतिसाद संघ एकत्र करा. गंभीर घटनांमध्ये, घटना कमांडर समन्वय गृहीत धरतो.
  4. कमी करा: प्रथम रक्तस्त्राव थांबवा — अनेकदा रोलबॅक किंवा ध्वज झाकणे. तुम्हाला नंतर मूळ कारण सापडेल.
  5. निराकरण: कायमस्वरूपी निराकरण लागू करा.
  6. शिका (पोस्टमॉर्टम): काय झाले, ते का झाले, ते पुन्हा होण्यापासून कसे रोखायचे?
टीप: घटनेच्या वेळी सर्वात महागड्या चुकांपैकी एक म्हणजे रक्तस्त्राव थांबवण्यास उशीर होणे कारण "आधी नेमके कारण शोधूया." नियम: प्रथम घट (सेवा पुनर्संचयित / पुनर्संचयित करा), नंतर चौकशी करा. एखाद्या ज्ञात-चांगल्या आवृत्तीकडे परत जाणे हे बऱ्याचदा जलद शमन असते.

दोषमुक्त पोस्टमॉर्टम संस्कृती

निरोगी संघांचा कणा निर्दोष शवविच्छेदनाची संस्कृती आहे: ध्येय "हे कोणी केले" नाही तर "कोणत्या प्रणाली आणि प्रक्रियेने या चुकीला परवानगी दिली?" प्रश्न आहे. लोक चूक लपवतात जर त्यांना माहित असेल की त्यांना शिक्षा होईल; लपविलेल्या त्रुटीची पुनरावृत्ती होते. पोस्टमॉर्टम हा आरोपाचा अहवाल नसून एक शिकण्याचा दस्तऐवज आहे.

चांगल्या पोस्टमॉर्टममध्ये हे समाविष्ट आहे: सारांश, प्रभाव (किती वापरकर्ते, किती काळ, किती पैसे), टाइमलाइन, मूळ कारण(ती), काय चांगले/वाईट झाले आणि कृती आयटम- ठोस उपाय, प्रत्येक मालक आणि तारीख.

खबरदारी: AI सह पोस्टमॉर्टेम लिहिताना, आरोप करणारी भाषा काढून टाकण्याची खात्री करा (म्हणजे "व्यक्ती X ने चूक केली"). एआयला इव्हेंट डेटा फीड करताना क्लायंट आयडी, अंतर्गत आयपी आणि रहस्ये देखील मास्क करा — पोस्टमॉर्टेम बऱ्याचदा मोठ्या प्रमाणात सामायिक केले जातात.

मूळ कारण विश्लेषण: 5 Whys आणि AI

एक क्लासिक तंत्र आहे "5 Whys": विचारा "का?" एका समस्येसाठी. पुन:पुन्हा विचारून वरवरच्या लक्षणापासून खऱ्या मुळापर्यंत पोहोचतो. "सेवा क्रॅश झाली. का? मेमरी संपली. का? गळती झाली. का? लायब्ररी अपडेट..." AI ही साखळी तयार करण्यास तत्पर आहे आणि संभाव्य शाखा सुचवते — परंतु तुम्ही प्रत्येक "का" तुमच्या डेटासह सत्यापित करणे आवश्यक आहे; AI वाजवी पण चुकीची साखळी देखील तयार करू शकते.

तीव्रता सारणी

पातळी

प्रभाव

उदाहरण

हस्तक्षेप

SEV1

संपूर्ण प्रणाली/गंभीर व्यवसाय तोटा

पेमेंट पूर्णपणे कमी झाले

त्वरित, संपूर्ण संघ, कमांडर

SEV2

मुख्य बिघडलेले कार्य

लॉगिन अयशस्वी

जलद, ऑन-कॉल + सपोर्ट

SEV3

आंशिक/मर्यादित प्रभाव

अहवाल येण्यास विलंब होत आहे

कामाच्या वेळेत

SEV4

लहान/कॉस्मेटिक

टायपो

सामान्य कामाची रांग

तीन लहान प्रकरणे

केस 1 — MTTR 45 मिनिटांपासून 8 मिनिटांपर्यंत. पेमेंट सेवा क्रॅश झाली. कर्तव्यावर असलेल्या अभियंत्याने मुखवटा घातलेले लॉग आणि शेवटच्या तैनातीची माहिती AI ला दिली आणि विचारले "गेल्या 20 मिनिटांमध्ये सर्वात जास्त ट्रिगर कोणता आहे?" त्याने विचारले. AI ने दर्शविले की शेवटच्या तैनातीप्रमाणेच पतन सुरू झाले. अभियंत्यांनी लगेच ती आवृत्ती परत आणली; सेवा 8 मिनिटांत परत आली. मूळ कारण (नवीन आवृत्तीमधील कनेक्शन पूल बग) नंतर सोयीस्करपणे तपासले गेले.

केस 2 - 20 मिनिटांत पोस्टमॉर्टम स्केच. SEV2 नंतर, संघ थकला होता आणि अहवाल लिहिण्याची ताकद नव्हती; अनेकदा अहवाल आठवडे उशीर झाला. यावेळी, त्यांनी एआयला टाइमलाइन आणि घटनेच्या नोट्स दिल्या आणि गुन्हामुक्त पोस्टमॉर्टम स्केच तयार केले. AI ने प्रभाव, टाइमलाइन आणि कृती आयटमसाठी एक व्यवस्थित फ्रेमवर्क तयार केले; टीमने त्यात तथ्ये भरली आणि 20 मिनिटांत प्रकाशित केली. धडा हरवला नाही.

प्रकरण 3 - चुकीचे मूळ कारण पकडले गेले. एका प्रकरणात, एआयने "मूळ कारण डेटाबेस ओव्हरलोड" म्हटले आणि ते वाजवी वाटले. परंतु अभियंत्याने मेट्रिक्सची पुष्टी केली: घटनेच्या वेळी डेटाबेस लोड सामान्य होता. वास्तविक कारण बाह्य DNS समस्या होती. AI ची सुरुवातीची गृहीतक तरल होती पण चुकीची होती; डेटाचे प्रमाणीकरण चुकीच्या निष्कर्षासह अहवाल प्रकाशित होण्यापासून प्रतिबंधित करते.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) घटनेच्या वेळी वेगवान ट्रायज:

आम्ही एक उत्पादन कार्यक्रम अनुभवत आहोत. मुखवटा घातलेली लक्षणे: [SYMPTOM].शेवटचे बदल: [LAST DEPLOY/CHANGE]. मला द्या:(1) संभाव्यतेच्या क्रमाने 3 बहुधा मूळ कारणे, (2) कमांड/मेट्रिक जी प्रत्येक 1 मिनिटात सत्यापित करेल, (3) सर्वात वेगवान सुरक्षित शमन पायरी (उदा. रोलबॅक). काटेकोरपणे बोलणे; मला प्रत्येक गृहीतक सत्यापित करणे आवश्यक आहे असे सांगा.

२) निर्दोष पोस्टमॉर्टम स्केच:

खाली दिलेल्या घटनेच्या टिपांमधून निर्दोष पोस्टमॉर्टम स्केच लिहा. विभाग: सारांश, प्रभाव (वापरकर्ता/कालावधी/किंमत), टाइमलाइन, मूळ कारण(ते), काय चांगले झाले, काय वाईट झाले, कृती आयटम (प्रत्येक मालक + तारीख फील्डसह). नामकरण, प्रक्रिया आणि प्रणालीवर लक्ष केंद्रित करा. टिपा: [मुखवटा घातलेला]

3) 5 का विश्लेषण:

खालील लक्षणाने सुरू होणारी "5 Whys" चेन तयार करा: [SYMPTOM].प्रत्येक पायरीवर एकापेक्षा जास्त संभाव्य शाखा आहेत का ते दाखवा. प्रत्येक "का" च्या पुढे पुरावा (लॉग/मेट्रिक) लिहा जो मी पडताळण्यासाठी पाहीन. शेवटी, कोणते चरण अद्याप सत्यापित केले गेले नाहीत ते चिन्हांकित करा.

4) कृती करण्यायोग्य वस्तू तयार करणे:

या मूळ कारणानुसार, कृती करण्यायोग्य आयटम सुचवा जे समान घटना पुनरावृत्ती होण्यापासून प्रतिबंधित करतील. प्रत्येक वस्तूचे यानुसार वर्गीकरण करा: (a) प्रतिबंध, शोध किंवा घट, (b) अंदाजे प्रयत्न, (c) प्रभाव. सर्वोच्च प्रभाव/प्रयत्न गुणोत्तरानुसार क्रमवारी लावा. मूळ कारण: [X]

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत: "सेवा क्रॅश झाली आहे, मी काय करावे?"

परिणाम: संदर्भ नाही; AI सामान्य शिफारसी करू शकते ज्या तुमच्या केसमध्ये बसत नाहीत आणि ते निश्चित मूळ कारण देखील शोधू शकतात.

सशक्त: "उत्पादन पेमेंट सेवा 5 मिनिटांसाठी 5xx देत आहे. शेवटची तैनाती 6 मिनिटांपूर्वी होती. संभाव्यतेच्या क्रमाने 3 बहुधा मूळ कारणे द्या, त्या प्रत्येकाची पडताळणी करणारी कमांड सांगा आणि सर्वात जलद सुरक्षित शमन सुचवा. विशिष्ट असू नका, मला सत्यापित करणे आवश्यक आहे असे सांगा."

फरक: दुसरा प्रॉम्प्ट लक्षण, वेळ आणि शेवटचा बदल देतो; हे गृहीतक + पडताळणी + कपात करण्याची मागणी करते आणि AI अशुद्ध ठेवते.

सामान्य चुका

  • कमी करण्यापूर्वी नेमके मूळ कारण शोधत आहे. हे रक्तस्त्राव थांबवण्यास विलंब करते आणि MTTR वाढवते.
  • AI ची पहिली गृहीते सत्यापित न करता प्रकाशित करणे. द्रव परंतु खोट्या मूळमुळे अहवालात गळती होते.
  • आरोप करणारी भाषा. अनामिकपणे लिहिलेले पोस्टमॉर्टम लपविणे आणि त्रुटीची पुनरावृत्ती करते.
  • बुलेट पॉइंटशिवाय कृती-देणारं अहवाल. मालक आणि तारीख नसलेला प्रस्ताव कधीही लागू केला जाणार नाही.
  • इव्हेंट डेटा मास्क न करता शेअर करणे. शवविच्छेदन व्यापक प्रेक्षकांपर्यंत जाते; गुप्त/वैयक्तिक डेटा लीक झाला आहे.
  • रोलबॅक मार्ग आगाऊ तयार करत नाही. उलट करणे व्यावहारिक नसल्यास, कपात कमी होते.

सारांशात

घटना व्यवस्थापन त्वरीत शोधणे, कमी करणे, निराकरण करणे आणि अपरिहार्य घटनांपासून शिकणे आहे; MTTD आणि MTTR हे प्रमुख मेट्रिक्स आहेत. "आधी कमी करा, नंतर तपास करा" हा सुवर्ण नियम आहे आणि ज्ञात-चांगल्या आवृत्तीकडे परत जाणे हे बऱ्याचदा जलद शमन असते. इव्हेंटच्या वेळी लॉग सारांशित करणे, गृहितके कमी करणे आणि घटनेनंतर निर्दोष पोस्टमॉर्टम स्केचेस तयार करणे यासाठी AI अमूल्य आहे — परंतु प्रत्येक मूळ कारण गृहीतके डेटासह सत्यापित करणे, दोषाची भाषा शुद्ध करणे आणि घटना डेटा मास्क करणे ही तुमची जबाबदारी आहे.

अर्ज कार्य

भूतकाळातील (किंवा काल्पनिक) घटनेचा विचार करा. (1) AI कडे “ऑन-द-सिन रॅपिड ट्रायज” टेम्प्लेटसह गृहीतके आणि पडताळणीचे चरण तयार करा; डेटाद्वारे कोणत्या गृहीतकाची पुष्टी केली जाऊ शकते ते लक्षात घ्या. (2) “नॉट गिल्टी पोस्टमॉर्टम आउटलाइन” टेम्प्लेट वापरून अहवालाचे रेखाटन करा आणि त्यात तथ्ये भरा. (3) किमान दोन कारवाई करण्यायोग्य आयटम ओळखा आणि प्रत्येकाला मालक आणि तारीख नियुक्त करा.

चेकलिस्ट

  • [] घटनेच्या वेळी, मी प्रथम कमी करण्याचा विचार केला (रोलबॅक/शटडाउन) आणि नंतरपर्यंत मूळ कारण सोडले.
  • [] मी लॉग/मेट्रिकसह AI च्या प्रत्येक मूळ कारणाची गृहीते सत्यापित केली.
  • [ ] मी ते अशा भाषेत लिहिले आहे ज्यामध्ये पोस्टमॉर्टमला दोष नाही, प्रक्रिया आणि प्रणालीवर लक्ष केंद्रित केले आहे.
  • [ ] मी प्रत्येक कारवाई करण्यायोग्य आयटमला मालक आणि तारीख नियुक्त केली आहे.
  • [ ] मी AI ला दिलेल्या इव्हेंट डेटामधून गुप्त आणि वैयक्तिक माहिती मास्क केली आहे.
  • मी प्रभावानुसार तीव्रता पातळी योग्यरित्या नियुक्त केली आहे.