युनिट्स
1. सिस्टीम आणि नेटवर्क व्यवस्थापनातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण आणि प्राधिकरण 2. ऑटोमेशन स्क्रिप्ट्स: बॅश, पॉवरशेल आणि पायथन सुरक्षितपणे निर्माण करणे 3. लॉग विश्लेषण आणि मूळ कारण विश्लेषण: आवाजात सिग्नल शोधणे 4. क्षमता आणि कार्यप्रदर्शन निरीक्षण: मेट्रिक्स वाचणे आणि भविष्यासाठी नियोजन 5. कॉन्फिगरेशन व्यवस्थापन: कॉन्फिगरेशन निर्माण करणे, प्रमाणीकरण करणे आणि ड्रिफ्ट कॅप्चर करणे 6. कोड (IaC) म्हणून पायाभूत सुविधांचे व्यवस्थापन: टेराफॉर्म, उत्तरदायी आणि योजना नियंत्रण 7. दस्तऐवजीकरण आणि माहिती व्यवस्थापन: रनबुक, पोस्ट-मॉर्टम आणि कॉर्पोरेट मेमरी 8. भविष्यसूचक देखभाल: ते होण्यापूर्वी अपयश पाहणे 9. व्यवस्थापन बदला: जोखीम मूल्यांकन, रोलबॅक आणि देखभाल विंडो 10. सुरक्षा आणि संरक्षण: संरक्षण उद्देशांसाठी आणि प्राधिकरणाच्या मर्यादेत कृत्रिम बुद्धिमत्ता वापरणे 11. एंड-टू-एंड इंटिग्रेशन: सुरुवातीपासून शेवटपर्यंत घटना व्यवस्थापित करणे
युनिट 3 / 11

लॉग विश्लेषण आणि मूळ कारण विश्लेषण: आवाजात सिग्नल शोधणे

नफा:

  • सारांश, गट आणि टाइमलाइन लॉगसाठी एआय वापरून आवाजात सिग्नल द्रुतपणे शोधा
  • सहसंबंध आणि कार्यकारणभाव वेगळे करण्याची क्षमता आणि कृत्रिम बुद्धिमत्तेच्या मूळ कारणांच्या सूचनांना गृहीतके म्हणून हाताळण्याची क्षमता ज्याची पडताळणी करणे आवश्यक आहे
  • कृत्रिम बुद्धिमत्तेसह '5 का' पद्धत चालवून आणि वास्तविक पुराव्यासह प्रत्येक चरणास समर्थन देऊन वास्तविक मूळ कारणापर्यंत पोहोचण्याची क्षमता

लॉग विश्लेषण आणि मूळ कारण विश्लेषण: एआय सह आवाजात सिग्नल शोधणे

जेव्हा एखादी सिस्टीम क्रॅश होते, तेव्हा तुम्ही पहिले स्थान पहाल ते लॉग असते. लॉग हा एक मजकूर प्रवाह आहे जो सिस्टम किंवा ऍप्लिकेशनच्या "मी काय केले, काय झाले, काय तोडले" याची टाइम-स्टॅम्प केलेली नोंद ठेवते. परंतु आधुनिक पायाभूत सुविधा प्रति तास लाखो लॉग तयार करते; हा माहितीचा समुद्र नसून अनेकदा आवाजाचा महासागर असतो. लॉग विश्लेषण ही या आवाजातील महत्त्वाचे सिग्नल (त्रुटी, असामान्यता, नमुना) शोधण्याची कला आहे. एखाद्या घटनेनंतर "खरे कारण काय होते" या प्रश्नाचे उत्तर देण्याच्या प्रक्रियेला मूळ कारण विश्लेषण (RCA - रूट कारण विश्लेषण) म्हणतात. येथे, प्रति सेकंद हजारो ओळींचा सारांश, नमुने काढणे, टाइमलाइन स्थापित करणे आणि संभाव्य कारणे सूचीबद्ध करण्यात AI खूप शक्तिशाली आहे. परंतु सावधगिरीचा एक शब्द: एआय संभाव्य कारणे निर्माण करते; तुम्हीच आहात जे सिस्टीममध्ये कोणते खरे आहे याची पडताळणी करतात आणि निर्णय घेतात.

या युनिटमध्ये तुम्ही AI सह लॉगचा आत्मविश्वासाने सारांश कसा बनवायचा, इव्हेंटची टाइमलाइन कशी प्रस्थापित करायची, सहसंबंध (एकत्र बदलणे) आणि कार्यकारणभाव (एक कारण दुसरे कारणीभूत) यांच्यात फरक कसा करायचा आणि AI सह "5 Whys" सारखी RCA पद्धत कशी चालवायची ते शिकाल.

सहसंबंध हे कार्यकारणभाव का नाही?

ही या युनिटची सर्वात गंभीर संकल्पना आहे. एकाच वेळी दोन घटना घडत असल्याने एक घडत नाही. सर्व्हरचे CPU आणि नेटवर्क रहदारी एकाच वेळी वाढू शकते; परंतु एक दुसऱ्याचा परिणाम नाही, दोन्ही तिसऱ्या घटनेचा परिणाम असू शकतात (उदाहरणार्थ, बॅच जॉबची सुरुवात). जेव्हा AI मेट्रिक्स एकत्र बदलत असल्याचे पाहते, तेव्हा ते "कदाचित X मुळे Y" असे गृहित धरते. हा एक प्रारंभिक बिंदू आहे, निष्कर्ष नाही. कार्यकारणभाव पडताळण्यासाठी, तुम्हाला एकतर व्हेरिएबल वेगळे करणे आवश्यक आहे (चाचणी वातावरणात X ट्रिगर करा आणि Y घडते की नाही ते पहा) किंवा यंत्रणा सिद्ध करा (X ने Y तयार केले ते तांत्रिक माध्यम दाखवा).

खबरदारी: AI चे वाक्य "यामुळे कदाचित हे झाले" हे गृहितक म्हणून घ्या, शोध नाही. RCA मध्ये, चुकीचे मूळ कारण चुकीचे दुरुस्त करते आणि घटनेची पुनरावृत्ती होते. तुम्हाला पहिला संशयित सापडला आहे, कारण नाही; तिथे काम सुरू होते.

स्टेप बाय स्टेप: AI सह लॉग विश्लेषण

  1. व्याप्ती कमी करा. इव्हेंट विंडो द्या, संपूर्ण लॉग नाही: "इव्हेंट 14:05 वाजता सुरू झाला, 14:00–14:20 पासून गंभीर". AI ला संबंधित वेळ स्लॉट आणि सेवा सांगा.
  2. मुखवटा. लॉगमध्ये अंतर्गत IP, होस्ट नाव, वापरकर्ता आणि टोकन असतात. त्यांना मुखवटा लावा (10.x.x.x, host-A, user1, REDACTED) नंतर निर्यात करा.
  3. विनंती सारांश आणि गट. "या लॉगचे तीव्रतेनुसार गट करा, आवर्ती चुका मोजा, ​​पहिल्या त्रुटीचा टाइमस्टॅम्प शोधा." रचना विचारा, कच्चा लॉग नाही.
  4. एक टाइमलाइन सेट करा. "या इव्हेंट्सची वेळेच्या क्रमाने व्यवस्था करा आणि पुढे काय आहे ते दर्शवा." पहिला डोमिनो शोधणे हा मूळ कारणाचा मार्ग आहे.
  5. गृहीतकांसाठी विचारा, पुरावे नाही. "संभाव्यतेच्या क्रमाने संभाव्य मूळ कारणे सूचीबद्ध करा आणि प्रत्येकासाठी सिस्टमवर चालण्यासाठी मला एक सत्यापन आदेश द्या." निदानासाठी विचारा, परिणाम नाही.
  6. सिस्टममध्ये सत्यापित करा. केवळ-वाचनीय निदान आदेशांसह प्रत्येक गृहितकाची चाचणी घ्या (लॉग ग्रेप, स्थिती क्वेरी, मेट्रिक). एकच पुष्टी मूळ कारण होईपर्यंत काढून टाका.

5 पद्धत का

RCA चे उत्कृष्ट आणि शक्तिशाली साधन आहे "5 Whys": एका लक्षणापासून सुरुवात करून "का?" पाच वेळा विचारून, तुम्ही पृष्ठभागाच्या लक्षणाच्या खाली असलेल्या मूळ कारणापर्यंत पोहोचता. उदाहरण: "साइट क्रॅश झाली. का? मेमरी संपल्यामुळे अनुप्रयोगाचा मृत्यू झाला. का? एका क्वेरीने सर्व मेमरी वापरली. का? क्वेरीने अनुक्रमणिका वापरली नाही. का? अनुक्रमणिका शेवटच्या प्रकाशनात हटवली गेली. का? बदलाच्या पुनरावलोकनात हे लक्षात आले नाही." मूळ कारण पृष्ठभाग "साइट क्रॅश" नसून "कमकुवत बदल पुनरावलोकन प्रक्रिया" आहे. ही साखळी तयार करण्यासाठी AI एक चांगला भागीदार असेल — परंतु तुम्ही प्रत्येक “का” पायरीचा खऱ्या पुराव्यासह बॅकअप घेतला पाहिजे किंवा AI कदाचित प्रशंसनीय पण खोटी साखळी घेऊन येऊ शकेल.

तीन लहान प्रकरणे

केस 1 — 40,000 ओळी, 3 मिनिटे. एका प्रशासकाने रात्रभर आउटेज दरम्यान 40,000 ओळी अनुप्रयोग लॉग मॅन्युअली स्कॅन करणे सुरू केले होते. त्याने मुखवटा घातलेल्या लॉगचा संबंधित 20-मिनिटांचा भाग AI ला दिला आणि सारांश आणि गटबद्धता विचारली. AI ने 02:14 वाजता पहिला OutOfMemory बग फ्लॅग केला, टाइमआउट बग्स वाढल्यानंतर लगेच. अभियंत्यांना 3 मिनिटांत टाईमशीट मिळाले; स्वतःच्या मेट्रिक पॅनेलवर मूळ निदानाची पुष्टी केली.

केस 2 - चुकीच्या मूळ कारणावरून परत येणे. एका टीमने विचार केला की AI चे पहिले गृहीतक ("लॉग भरलेले डिस्क") बरोबर आहे आणि लॉग साफ केले. मात्र दुसऱ्या दिवशी या घटनेची पुनरावृत्ती झाली. दुसऱ्या फेरीत, त्यांनी शिस्तीने "5 व्हाय्स" लागू केले: खरे कारण म्हणजे ऍप्लिकेशन त्रुटी प्रति सेकंद शेकडो कोर डंप लिहित होती. प्रथम गृहीतक सहसंबंध होते; खरे कारण वेगळे होते. सत्यापनाशिवाय स्वीकृती केवळ एक दिवसाची सुटका प्रदान करते.

केस 3 — टाइमलाइनला गुन्हेगार सापडला. मधूनमधून नेटवर्क आउटेज दरम्यान डझनभर उपकरणांचे लॉग होते. अभियंत्याने AI ला मुखवटा घातलेले लॉग दिले आणि एक एकीकृत टाइमलाइन तयार केली. चार्टमध्ये असे दिसून आले आहे की रिडंडंसी स्विच हेल्थ चेक मेसेजनंतर प्रत्येक आउटेज अगदी 30 सेकंदांनी सुरू झाला. हा परस्परसंबंध एक मजबूत सुगावा होता; टीमने डिव्हाइसवरील कीच्या फर्मवेअर त्रुटीची पडताळणी केली आणि ती बदलली.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) लॉग सारांश आणि गटबद्धता:

खाली 14:00-14:20 पासून [सेवेसाठी] मुखवटा घातलेला लॉग आहे. मला सांगा: (1) गटबद्ध करा आणि तीव्रतेनुसार ओळी मोजा (ERROR/WARN/INFO), (2) शीर्ष 5 आवर्ती त्रुटी नमुन्यांची यादी करा, (3) पहिल्या ERROR चा टाइमस्टॅम्प शोधा. कच्चा लॉग पुन्हा लिहू नका, फक्त एक संरचित सारांश द्या. मेड-अप लाइन जोडत आहे. लॉग: [मुखवटा घातलेला लॉग]

२) टाइमलाइन सेट करणे:

आम्ही खालील मुखवटा घातलेले इव्हेंट रेकॉर्ड एकाच टाइमलाइनमध्ये (टाइमस्टॅम्प + स्त्रोत + इव्हेंट) व्यवस्थापित केले. काय आहे ते दाखवा आणि प्रथम ट्रिगर वाटणारी घटना चिन्हांकित करा. लक्षात घ्या की हे एक हायपोथेसिस आहे आणि कार्यकारणभाव पडताळणे आवश्यक आहे. रेकॉर्डिंग: [मुखवटा घातलेले रेकॉर्डिंग]

3) 5 कारणे RCA भागीदार:

तुमची भूमिका: RCA फॅसिलिटेटर. लक्षण: [लक्षण]. माझ्यासोबत “5 का” करा: “का?” प्रत्येक पायरीवर. विचारा, माझ्याकडे असलेल्या पुराव्यानिशी मी उत्तर देईन, तुम्ही पुढचा प्रश्न विचारा. माझा पुरावा कमकुवत असल्यास, मला चेतावणी द्या आणि मला कोणता डेटा गोळा करायचा आहे ते सांगा. पुराव्याशिवाय मूळ कारण घोषित करू नका.

4) गृहीतक + सत्यापन आदेश:

संभाव्यतेच्या क्रमाने या लक्षणाची [लक्षण] संभाव्य मूळ कारणे सूचीबद्ध करा. प्रत्येक कारणासाठी: (अ) तुम्हाला काय संशय आहे, (ब) माझ्या सिस्टमवर चालण्यासाठी मला फक्त-वाचनीय सत्यापन आदेश द्या (हटवा/बदल नाही). कोणता परिणाम गृहीतकाला पुष्टी देतो किंवा नाकारतो ते स्पष्ट करा.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

या लॉगमध्ये काय चूक आहे? [कच्च्या लॉगच्या 10,000 ओळी]

हे प्रॉम्प्ट दोन्ही लीक संवेदनशील डेटा अनमास्क करते आणि AI ला संदर्भाशिवाय सोडते. AI यादृच्छिक रेषेवर अडखळू शकते आणि वरवरचे किंवा अगदी तयार केलेले कारण देऊ शकते.

शक्तिशाली सूचना:

तुमची भूमिका: वरिष्ठ SRE. इव्हेंट: पेमेंट सेवेने 02:10-02:25 दरम्यान 50% त्रुटी दिली. खाली त्या विंडोचा मुखवटा केलेला लॉग आहे. मला (1) तीव्रतेनुसार गटबद्ध केलेला सारांश, (2) पहिल्या त्रुटीचा टाइमस्टॅम्प, (3) संभाव्यतेच्या क्रमाने संभाव्य मूळ कारणे आणि प्रत्येकासाठी केवळ-वाचनीय सत्यापन आदेश द्या. कार्यकारणभावाचे दावे गृहितके म्हणून चिन्हांकित करा. लॉग: [मुखवटा घातलेला लॉग]

पाऊल

उद्देश

AI ची भूमिका

माणसाची भूमिका

सारांश/ग्रुपिंग

आवाज कमी करा

हजारो पंक्ती कॉन्फिगर करत आहे

व्याप्ती आणि मुखवटा निश्चित करा

टाइमलाइन

पहिला डोमिनो शोधत आहे

घटना क्रमवारी लावणे

स्टॅम्प प्रमाणित करा

गृहीतक निर्मिती

संशयितांची वर्गवारी करणे

शक्यतांची यादी करा

संदर्भानुसार फिल्टर करा

पडताळणी

खरे कारण शोधा

निदान आदेश सुचवा

कमांड चालवा आणि त्यावर टिप्पणी द्या

निर्णय

निराकरण करणे निवडत आहे

ऑफर पर्याय

निर्णय घ्या आणि पुष्टी करा

सामान्य चुका

  • कारणासाठी चुकीचा सहसंबंध. दोन मेट्रिक्स जे एकत्र बदलतात ते "एकामुळे दुसरे" म्हणून स्वीकारल्याने चुकीची सुधारणा होते.
  • मास्कशिवाय कच्चा लॉग पेस्ट करणे. आयपी, टोकन आणि वापरकर्ता असलेले लॉग ओपन टूलला देणे हे सुरक्षेचे उल्लंघन आहे.
  • पहिल्या गृहीतकाला मूळ कारण म्हणून घोषित करणे. AI ची पहिली सूचना सत्यापित न करता ती स्वीकारणे हे कार्यक्रमाच्या पुनरावृत्तीसाठी आमंत्रण आहे.
  • संपूर्ण लॉग एक्सपोर्ट करत आहे. संदर्भाशिवाय मोठा लॉग एआयला यादृच्छिक रेषेत प्लग करतो; इव्हेंट विंडोवर संकुचित करा.
  • 5 पुराव्याशिवाय कारणे. तुम्ही प्रत्येक "का" स्टेपचा रिअल डेटासह बॅकअप न घेतल्यास, तुम्हाला एक प्रशंसनीय पण तयार केलेली साखळी मिळेल.
टीप: RCA समाप्त करण्यापूर्वी, "हे मूळ कारण निश्चित झाले असल्यास, ते पुन्हा होणार नाही का?" विचारा. प्रश्न विचारा. जर उत्तर "कदाचित" असेल तर तुम्ही अद्याप मूळ कारणापर्यंत पोहोचलेले नाही; दुसऱ्याला "का" विचारा.

सारांशात

लॉग विश्लेषण हे आवाजाच्या महासागरात सिग्नल शोधण्याबद्दल आहे; AI काही सेकंदात या महासागराचा सारांश आणि रचना करते, एक टाइमलाइन स्थापित करते आणि गृहीतके निर्माण करते. परंतु सहसंबंध हे कार्यकारणभाव नाही: एआयने सुचवलेले कारण ही प्रारंभिक शंका आहे, पुष्टी होईपर्यंत शोध नाही. इव्हेंट विंडोमध्ये लॉग संकुचित करा, मुखवटा लावा, संरचनेसाठी विचारा, “5 Whys” सह खोल खोदून घ्या आणि सिस्टमवरील प्रत्येक गृहितकाची फक्त-वाचनीय कमांडसह चाचणी करा. मूळ कारण शोधणारे आणि निराकरणाची पुष्टी करणारे तुम्हीच आहात; AI तुमचा साथीदार आहे.

अर्ज कार्य

भूतकाळातील इव्हेंट (किंवा चाचणी इव्हेंट) च्या नोंदी घ्या, त्यास इव्हेंट विंडोमध्ये संकुचित करा आणि कोणतीही संवेदनशील क्षेत्रे मास्क करा. वरील “लॉग सारांश” आणि “टाइमलाइन” टेम्पलेट्ससह AI कडून सारांश आणि शेड्यूलची विनंती करा. नंतर “5 कारणे RCA भागीदार” टेम्पलेटसह लक्षणापासून मूळ कारणाकडे जा; प्रत्येक पायरीसाठी तुमचे स्वतःचे पुरावे लिहा. शेवटी, AI च्या प्रारंभिक गृहीतकाची पडताळणी आदेशासह चाचणी करा आणि ते पुष्टी किंवा नाकारले गेले आहे की नाही ते रेकॉर्ड करा. 6 आयटममध्ये प्रक्रियेचा सारांश द्या.

चेकलिस्ट

  • [ ] मी इव्हेंट विंडोमध्ये लॉग कोलॅप्स केला आहे आणि संवेदनशील भागांना मास्क केले आहे?
  • [ ] मी AI ला संरचित सारांश आणि टाइमलाइन विचारली होती, रॉ लॉग नाही?
  • [ ] मी AI चे कार्यकारणभाव दावे गृहितके म्हणून चिन्हांकित केले आहेत का?
  • [ ] मी सिस्टमवरील प्रत्येक गृहितकाची चाचणी केवळ-वाचनीय सत्यापन आदेशाद्वारे केली आहे का?
  • [ ] मी “5 का” च्या प्रत्येक पायरीचा खरा पुरावा घेतला आहे का?
  • [ ] मी प्रश्न केला आणि निर्णय घेतला की मूळ कारण खरोखरच घटना रोखेल का?