युनिट्स
1. DevOps आणि Cloud AI चा परिचय: भूमिका, सीमा, प्रमाणीकरण, सुरक्षा आणि रहस्ये 2. कृत्रिम बुद्धिमत्तेसह CI/CD पाइपलाइन डिझाइन करणे: GitHub क्रिया आणि GitLab CI 3. कोड म्हणून पायाभूत सुविधा व्यवस्थापित करणे: टेराफॉर्म आणि IaC सह कृत्रिम बुद्धिमत्ता 4. कंटेनरायझेशन: डॉकरफाइल आणि आर्टिफिशियल इंटेलिजन्ससह इमेज ऑप्टिमायझेशन 5. कुबर्नेट्स: मॅनिफेस्ट, हेल्म आणि एआय-पॉवर्ड ऑर्केस्ट्रेशन 6. देखरेख आणि निरीक्षणक्षमता: मेट्रिक, लॉग, ट्रेस आणि अलार्म नियम 7. घटना व्यवस्थापन आणि पोस्टमॉर्टम: आर्टिफिशियल इंटेलिजन्ससह मूळ कारण विश्लेषण 8. क्लाउड कॉस्ट ऑप्टिमायझेशन (फिनऑप्स): कृत्रिम बुद्धिमत्तेसह कचरा शोधणे 9. स्क्रिप्ट आणि ऑटोमेशन जनरेशन: बॅश, पायथन आणि पॉवरशेल 10. सुरक्षा आणि रहस्ये व्यवस्थापन: DevSecOps आणि कृत्रिम बुद्धिमत्ता 11. उत्पादन पडताळणी, रिलीझ स्ट्रॅटेजीज आणि एंड-टू-एंड AI वर्कफ्लो
युनिट 6 / 11

देखरेख आणि निरीक्षणक्षमता: मेट्रिक, लॉग, ट्रेस आणि अलार्म नियम

नफा:

  • निरीक्षणक्षमतेचे तीन स्तंभ (मेट्रिक, लॉग, ट्रेस) आणि चार सोनेरी सिग्नल समजून घेण्याची क्षमता आणि कृत्रिम बुद्धिमत्ता प्रोमक्यूएल क्वेरी, अलार्म नियम आणि डॅशबोर्ड तयार करते.
  • अलार्म क्रिया-केंद्रित ठेवून आणि योग्य तातडीने आणि आपल्या स्वतःच्या सिस्टमच्या ऐतिहासिक डेटाच्या विरूद्ध चाचणी थ्रेशोल्ड ठेवून अलार्म थकवा टाळण्याची क्षमता
  • कृत्रिम बुद्धिमत्तेला लॉग देण्यापूर्वी संवेदनशील भागांना मास्क करून गोपनीयता आणि गुप्त गळती रोखण्याची क्षमता

एखादी प्रणाली कार्य करत असल्याचे दिसून येत असले तरी, ती आतून मरत आहे: स्मृती हळूहळू भरत आहे, प्रतिसादाची वेळ वाढत आहे, त्रुटी दर वाढत आहे. हे लक्षात घेण्याचा एकमेव मार्ग म्हणजे सिस्टमचे सतत निरीक्षण करणे. अधिक प्रगत संकल्पना म्हणजे निरीक्षणक्षमता: प्रणालीच्या बाह्य चिन्हे पाहून आत काय चालले आहे हे समजून घेण्याची क्षमता. निरीक्षणक्षमतेचे तीन स्तंभ आहेत आणि DevOps व्यावसायिक तिन्ही वापरतात:

  • मेट्रिक: कालांतराने मोजलेली संख्यात्मक मूल्ये — CPU वापर, विनंतीची संख्या, प्रतिसाद वेळ, त्रुटी दर. "किती?" प्रश्नाचे उत्तर देते.
  • लॉग: सिस्टमद्वारे निर्मित मजकूर इव्हेंट रेकॉर्ड—"वापरकर्ता लॉग इन केले", "डेटाबेस कनेक्शन गमावले". "नक्की काय झालं?" प्रश्नाचे उत्तर देते.
  • ट्रेस: ​​सिस्टममधील सेवेतून सेवेकडे जाताना विनंतीचा मार्ग आणि प्रत्येक पायरीचा कालावधी. "मंदी कुठे आहे?" प्रश्नाचे उत्तर देते.

सर्वात सामान्य साधने: मेट्रिक्ससाठी प्रोमिथियस, व्हिज्युअलायझेशनसाठी ग्राफाना, लॉगसाठी लोकी/ईएलके, ट्रेससाठी जेगर/ओपनटेलीमेट्री. या साधनांसाठी AI क्वेरी भाषा (विशेषत: Prometheus' PromQL), अलार्म नियम आणि डॅशबोर्ड कॉन्फिगरेशन लिहिण्यात खूप कुशल आहे. हे देखील आहे जेथे AI सर्वात मजबूत आहे: लॉग आणि मेट्रिक्सच्या मोठ्या भागांचा सारांश आणि विसंगती फ्लॅग करणे.

निरीक्षण आणि निरीक्षणक्षमता यातील फरक एका वाक्यात स्पष्ट करूया: निरीक्षण म्हणजे तुम्हाला आधीच माहित असलेले प्रश्न विचारणे (“CPU 90% पेक्षा जास्त आहे का?”); निरीक्षणक्षमता म्हणजे तुम्हाला आधीपासून माहित नसलेले प्रश्न विचारण्यात सक्षम असणे ("हे विचित्र मंदपणा ठराविक वेळी ठराविक ग्राहकासाठीच का होत आहे?"). आधुनिक प्रणाली इतक्या गुंतागुंतीच्या आहेत की तुम्ही अपयशाच्या सर्व पद्धतींचा अंदाज लावू शकत नाही; म्हणून, समृद्ध मेट्रिक्स, लॉग आणि ट्रेस गोळा करण्याची आणि नंतर त्यांची सखोल चौकशी करण्याची क्षमता - म्हणजेच निरीक्षणक्षमता - गंभीर बनते. "पूर्वीच्या अज्ञात प्रश्नाचे" उत्तर देताना AI इथेच कामात येते: ते तुमच्याकडे असलेला कच्चा डेटा पटकन स्कॅन करते, नमुने आणि विसंगती सुचवते आणि या संकेतांची पडताळणी करून तुम्ही मूळ कारणापर्यंत पोहोचता.

चरण-दर-चरण: काय आणि कसे निरीक्षण करावे?

  1. योग्य मेट्रिक्स निवडा. उद्योगात, "चार सोनेरी सिग्नल" आधार म्हणून घेतले जातात: विलंब, रहदारी, त्रुटी, संपृक्तता — संसाधन किती भरले आहे. हे बहुतेक सेवांच्या आरोग्याचा सारांश देतात.
  2. मेट्रिक्स गोळा करा. प्रोमिथियस वाचू शकेल असा शेवटचा बिंदू अनुप्रयोगास सादर करू द्या.
  3. डॅशबोर्ड सेट करा. Grafana मध्ये या मेट्रिक्सची कल्पना करा.
  4. अलार्म नियम लिहा. थ्रेशोल्ड ओलांडल्यावर कोणाला चेतावणी दिली जाईल आणि कसे?
  5. नोंदी केंद्रीकृत करा. सर्व सेवा नोंदी एकाच ठिकाणी शोधण्यायोग्य बनवा.
  6. आवाज कमी करा. खूप जास्त अलार्म "अलर्ट थकवा" निर्माण करतो; महत्त्वाचा अलार्म गायब होतो.
टीप: एक चांगला अलार्म दोन गोष्टी पूर्ण करतो: तो कृती करण्यायोग्य आहे आणि योग्य निकड आहे. एखाद्याला पहाटे 3 वाजता उठवणारा अलार्म खरोखर रात्रीच्या हस्तक्षेपाची आवश्यकता असलेला काहीतरी असावा. "CPU 70%" सारख्या स्वतःहून कृती आवश्यक नसलेल्या गोष्टीसाठी कोणालाही जागे करू नका; ते बोर्डवर प्रदर्शित करा.

अलार्म नियम कसा लिहायचा?

अलर्टमध्ये तीन घटक असतात: स्थिती (कोणता मेट्रिक कोणत्या थ्रेशोल्डपेक्षा जास्त आणि किती काळासाठी), कालावधी ("5 मिनिटांसाठी" क्षणिक चढउतार टाळण्यासाठी), आणि महत्त्व/कृती (कोणासाठी, कोणत्या चॅनेलद्वारे). AI कुशलतेने या तिघांना योग्य संदर्भासह स्थापित करते. उदाहरणार्थ, PromQL मध्ये “एरर रेट 5% पेक्षा जास्त असल्यास गंभीर अलार्म” सारख्या नियमाचे PromQL मध्ये भाषांतर करणे हे AI साठी स्प्लिट-सेकंड कार्य आहे — परंतु थ्रेशोल्ड तुमच्या सिस्टमसाठी योग्य आहे की नाही हे तुम्ही ठरवा.

खबरदारी: AI ने सुचवलेले अलार्म थ्रेशोल्ड सामान्य गृहीतके आहेत. तुमच्या सिस्टमचा सामान्य भार, सहनशीलता आणि कामाचा प्रभाव वेगळा आहे. तुम्ही थेट उत्पादनामध्ये थ्रेशोल्ड टाकण्यापूर्वी, तुम्ही तुमचा ऐतिहासिक डेटा पाहता आणि "हा थ्रेशोल्ड भूतकाळात किती वेळा ट्रिगर झाला होता, त्यापैकी किती वास्तविक समस्या होत्या?" प्रश्नाचे उत्तर द्या.

लॉग गोपनीयता: गंभीर चेतावणी

लॉग हे गळतीचे सर्वात वारंवार दुर्लक्षित स्त्रोत आहेत. लॉग लाइनमध्ये चुकून पासवर्ड, क्रेडिट कार्ड नंबर किंवा वैयक्तिक डेटा (KVKK/GDPR अंतर्गत) असू शकतो. विश्लेषणासाठी AI मध्ये लॉग पेस्ट करताना:

  1. संवेदनशील क्षेत्रे मास्क करा. टोकन, पासवर्ड, ईमेल, आयडी क्रमांक यासारखी मूल्ये <REDACTED> ने बदला.
  2. उदाहरणे द्या, सर्व नाही. दशलक्ष ओळींऐवजी, काही शंभर प्रातिनिधिक ओळी अनेकदा पुरेशा असतात.
  3. संस्था-मान्यता असलेले वाहन निवडा. विशेषत: उत्पादन लॉगसाठी, एक साधन वापरा ज्याचा डेटा प्रशिक्षणाकडे जात नाही.

चार सोनेरी सिग्नल आणि अलार्म टेबल

सिग्नल

द्वारे मोजले जाते

अलार्म थ्रेशोल्डचे उदाहरण

निकड

विलंब

प्रतिसाद वेळ

p95 > 800 ms, 5 मि

उच्च

रहदारी

विनंती/से

अचानक 300% वाढ/कमी

मध्यम

त्रुटी

अयशस्वी विनंती दर

> 5%, 5 मि

गंभीर

संपृक्तता

संसाधनाचा व्याप

डिस्क > ८५%

उच्च

तीन लहान प्रकरणे

केस 1 — लॉगच्या 400 ओळी 30 सेकंदात सारांशित केल्या आहेत. एक सेवा मंदावली होती. अभियंत्याने AI ला मुखवटा घातलेल्या 400 ओळी लॉग दिल्या आणि म्हणाले, "आवर्ती त्रुटीचे नमुने आणि वेळेची तीव्रता सारांशित करा." AI ने दाखवले की प्रत्येक 30 सेकंदात विशिष्ट बाह्य API कॉलचा वेळ संपतो. 30 सेकंदात मूळ कारण सापडले; लॉग मॅन्युअली स्कॅन करण्यासाठी अर्धा तास लागेल.

केस 2 - अलार्म थकवा सोडवला. एका संघाला दिवसाला 200 अलार्म मिळत होते आणि ते त्या सर्वांकडे दुर्लक्ष करत होते — जोपर्यंत वास्तविक आउटेज अलार्मकडेही दुर्लक्ष केले जात नाही. AI ला सर्व अलर्ट नियम द्या आणि विचारा "कोणते कारवाई करण्यायोग्य नाहीत आणि कोणते एकत्र केले जाऊ शकतात?" त्यांनी विचारले. अलार्मची संख्या दररोज 12 पर्यंत कमी झाली; प्रत्येक अलार्म आता गांभीर्याने घेतला होता.

केस 3 - चुकीचा थ्रेशोल्ड लवकर पकडला गेला. YZ ने डिस्कसाठी "95% भरल्यावर चेतावणी द्या" असे सुचवले. अभियंत्याने ऐतिहासिक डेटा पाहिला: एकदा डिस्क 95% पर्यंत पोहोचली की हस्तक्षेपासाठी थोडा वेळ होता. त्याने थ्रेशोल्ड 80% पर्यंत कमी केला आणि "वाढीचा दर" वर आधारित दुसरा अलार्म जोडला. पडताळणीने प्रत्यक्ष मध्यरात्री आउटेज रोखले.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) लॉग सारांश (मुखवटा घातलेला):

खालील लॉग उदाहरणाचे विश्लेषण करा (मी <REDACTED> सह संवेदनशील मूल्ये मास्क केली आहेत). मला द्या: (1) आवर्ती त्रुटी नमुने, (2) कालांतराने एकाग्रता, (3) बहुधा मूळ कारण आणि (4) 3 मेट्रिक्स मी सत्यापित करण्यासाठी पाहीन. लॉग: [लाइन्स]

2) अलार्म नियम निर्मिती:

Prometheus/Alertmanager साठी अलार्म नियम लिहा: [THRESHOLD] [METRIC][DURATION] पेक्षा जास्त असल्यास [SEVERITY] अलार्म व्युत्पन्न करा. नियम कृती-केंद्रित असावा आणि त्यात भाष्य आणि रनबुक लिंक फील्डचा समावेश असावा. PromQL समजावून सांगा आणि हा थ्रेशोल्ड वाजवी का आहे ते लिहा.

3) PromQL क्वेरी लिहिणे/घोषित करणे:

मोजमाप करणारी PromQL क्वेरी लिहा: [उदा. शेवटच्या 5 मिनिटांमध्ये 5xx त्रुटी दर टक्केवारी]. प्रश्न चरण-दर-चरण स्पष्ट करा. मग मला सांगा की या मूल्यासाठी आरोग्यदायी श्रेणी काय असावी.

4) डॅशबोर्ड डिझाइन:

[सेवा] साठी ग्राफाना डॅशबोर्ड डिझाइन करा: मी कोणत्या पॅनेलसह चार सोनेरी सिग्नल (लेटन्सी, रहदारी, त्रुटी, संपृक्तता) प्रदर्शित करू? प्रत्येक पॅनेलसाठी मेट्रिक, व्हिज्युअलायझेशन प्रकार आणि वाजवी थ्रेशोल्ड सुचवा. उद्देशः 10 सेकंदात गार्डची आरोग्य स्थिती पाहणे.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत: "त्या लॉगमध्ये काय आहे?" (त्यानंतर रॉ लॉगच्या 5000 ओळी, त्यात टोकन)

परिणाम: तुम्ही रहस्ये लीक करता आणि AI एक लक्ष्यरहित, वरवरचा सारांश देते.

सशक्त: "खालील 300-लाइन मास्क केलेल्या लॉग उदाहरणामध्ये आवर्ती त्रुटीचे नमुने आणि वेळेची तीव्रता शोधा; मला बहुधा मूळ कारण आणि मी पडताळणी करण्यासाठी पाहीन ते मेट्रिक्स सांगा. मी टोकन <REDACTED> बनवले आहेत."

फरक: दुसरा प्रॉम्प्ट मुखवटा घातलेला आणि केंद्रित उदाहरण देतो, स्पष्ट विश्लेषण आउटपुटसाठी विचारतो; हे सुरक्षित आणि उपयुक्त दोन्ही आहे.

सामान्य चुका

  • मास्क न लावता AI मध्ये लॉग पेस्ट करत आहे. सर्वात सामान्य गुप्त/वैयक्तिक डेटा लीक.
  • प्रत्येक गोष्टीसाठी अलार्म सेट करत आहे. अलार्म थकवा खरा गजर पुरतो.
  • गैर-कार्यक्षम अलार्म. कोणीही काहीही करू शकत नाही असा हा इशारा आहे.
  • AI चा उंबरठा कोणत्याही प्रश्नाशिवाय स्वीकारत आहे. थ्रेशोल्ड तुमच्या सिस्टमच्या इतिहासानुसार सेट केला पाहिजे.
  • फक्त मेट्रिक बघत आहे. लॉग आणि ट्रेसशिवाय, बहुतेक वेळा मूळ कारण शोधले जाऊ शकत नाही.
  • अलार्मची वेळ सेट करत नाही (साठी). क्षणिक चढउतार खोटे अलार्म तयार करतात.

सारांशात

निरीक्षणक्षमता; मेट्रिक्स, लॉग आणि ट्रेससह बाहेरून सिस्टमची आतील बाजू समजून घेण्याची क्षमता आहे. चार सुवर्ण सिग्नल (लेटन्सी, ट्रॅफिक, एरर, सॅचुरेशन) बहुतेक सेवांच्या आरोग्याचा सारांश देतात. AI PromQL क्वेरी, अलार्म नियम आणि डॅशबोर्ड लिहिण्यासाठी आणि लॉगच्या मोठ्या भागांचा सारांश देण्यासाठी आणि विसंगती शोधण्यात खूप शक्तिशाली आहे. परंतु तुमच्या स्वतःच्या सिस्टमच्या इतिहासाविरुद्ध अलार्म थ्रेशोल्ड सत्यापित करणे, अलार्म क्रिया-केंद्रित ठेवणे आणि लॉग मास्क न करता कधीही सामायिक करणे ही तुमची जबाबदारी आहे.

अर्ज कार्य

सेवेसाठी (किंवा नमुना सेवेसाठी): (१) "अलार्म नियम निर्मिती" टेम्प्लेटसह त्रुटी दरासाठी अलार्म नियम व्युत्पन्न करा आणि सुचविलेला थ्रेशोल्ड "पूर्वी किती वेळा ट्रिगर झाला?" वर सेट करा. प्रश्नासह त्याची चाचणी घ्या; (२) तुमच्याकडे असलेला लॉग नमुना मुखवटा लावा आणि "लॉग सारांशीकरण" टेम्पलेटसह त्याचे विश्लेषण करा; (३) संभाव्य मूळ कारणाची पुष्टी करण्यासाठी तुम्ही कोणते मेट्रिक पहाल ते लक्षात घ्या.

चेकलिस्ट

  • [ ] मी चार गोल्डन सिग्नलवर आधारित ट्रॅक करण्यासाठी मेट्रिक्स निवडले.
  • संवेदनशील भागांच्या दृष्टीने मी AI ला दिलेले सर्व लॉग मी मास्क केले आहेत.
  • [ ] मी सत्यापित केले की प्रत्येक अलार्म क्रिया-केंद्रित आणि योग्य निकडीचा होता.
  • मी माझ्या सिस्टमच्या ऐतिहासिक डेटावर अलार्म थ्रेशोल्डची चाचणी केली.
  • मी अलार्ममध्ये (कालावधी) जोडून तात्काळ चढ-उतार फिल्टर केले.
  • मी मूळ कारणासाठी मेट्रिक + लॉग + ट्रेस एकत्र वापरले.