इकाइयाँ
1. सिस्टम और नेटवर्क प्रबंधन में आर्टिफिशियल इंटेलिजेंस का परिचय: भूमिकाएँ, सीमाएँ, प्रमाणीकरण और प्राधिकरण 2. स्वचालन स्क्रिप्ट: बैश, पावरशेल और पायथन को सुरक्षित रूप से उत्पन्न करना 3. लॉग विश्लेषण और मूल कारण विश्लेषण: शोर में सिग्नल ढूँढना 4. क्षमता और प्रदर्शन की निगरानी: मेट्रिक्स पढ़ना और भविष्य के लिए योजना बनाना 5. कॉन्फ़िगरेशन प्रबंधन: कॉन्फ़िगरेशन उत्पन्न करना, सत्यापन करना और बहाव को कैप्चर करना 6. कोड (IaC) के रूप में बुनियादी ढांचे का प्रबंधन: टेराफॉर्म, एन्सिबल और प्लान कंट्रोल 7. दस्तावेज़ीकरण और सूचना प्रबंधन: रनबुक, पोस्टमार्टम और कॉर्पोरेट मेमोरी 8. पूर्वानुमानित रखरखाव: विफलताओं को घटित होने से पहले ही देखना 9. परिवर्तन प्रबंधन: जोखिम मूल्यांकन, रोलबैक और रखरखाव विंडो 10. सुरक्षा और रक्षा: रक्षा उद्देश्यों के लिए और अधिकार की सीमा के भीतर कृत्रिम बुद्धिमत्ता का उपयोग करना 11. शुरू से अंत तक एकीकरण: किसी घटना को शुरू से अंत तक प्रबंधित करना
इकाई 8 / 11

पूर्वानुमानित रखरखाव: विफलताओं को घटित होने से पहले ही देखना

लाभ:

  • स्मार्ट कृत्रिम बुद्धिमत्ता के साथ एक प्रवृत्ति के रूप में प्रमाणपत्र/लाइसेंस जीवन और त्रुटि दर जैसे शुरुआती संकेतों को पढ़ सकता है और विफलता का पूर्वानुमान लगा सकता है।
  • एकल रीडिंग के बजाय समय श्रृंखला की प्रवृत्ति को देखकर झूठे अलार्म को वास्तविक जोखिम से अलग करने की क्षमता
  • यह समझना कि कृत्रिम बुद्धिमत्ता संभावनाएं पैदा करती है और भागों को अतिरेक, लागत और आपूर्ति समय के साथ बदलने का निर्णय लेना

पूर्वानुमानित रखरखाव: एआई के साथ होने से पहले खराबी को देखना

सिस्टम प्रबंधन में तीन प्रकार के रखरखाव होते हैं। किसी चीज़ के टूटने के बाद उसे ठीक करना प्रतिक्रियाशील रखरखाव है - सबसे महंगा और तनावपूर्ण; डिस्क भर जाती है, सर्वर क्रैश हो जाता है, फिर आप चलते हैं। निवारक रखरखाव वह रखरखाव है जो एक शेड्यूल पर नियमित अंतराल पर होता है - जैसे "हर 6 महीने में डिस्क बदलें"; यह काम करता है, लेकिन यह या तो बहुत जल्दी (अनावश्यक लागत) या बहुत देर से हो सकता है (विफलता पहले आती है)। पूर्वानुमानित रखरखाव सबसे स्मार्ट चीज़ है: शुरुआती संकेतों को पढ़ना जो इंगित करता है कि एक घटक विफलता के करीब पहुंच रहा है और समय पर हस्तक्षेप करता है। यह बिल्कुल शुरुआती संकेत हैं कि एआई पहचानने में शक्तिशाली है - एक डिस्क का स्मार्ट डेटा भ्रष्टाचार, एक प्रमाणपत्र की आसन्न समाप्ति, एक मेमोरी की बढ़ती त्रुटि दर, एक प्रवृत्ति की मौन चढ़ाई। लेकिन चेतावनी स्पष्ट है: एआई एक संभाव्यता और प्रारंभिक चेतावनी उत्पन्न करता है; आप ही वह व्यक्ति हैं जो जोखिम और लागत को तौलकर पुर्जों के प्रतिस्थापन, आउटेज योजना और बजट संबंधी निर्णय लेते हैं।

इस इकाई में, पूर्वानुमानित रखरखाव के बुनियादी संकेत (स्मार्ट, प्रमाणपत्र/लाइसेंस जीवन, त्रुटि दर प्रवृत्ति, संसाधन टूट-फूट); एआई के साथ प्रारंभिक चेतावनी पढ़ना; और आप झूठे अलार्म को वास्तविक जोखिम से अलग करना सीखेंगे।

शुरुआती संकेत कहां छिपे हैं?

हार्डवेयर और सॉफ्टवेयर शायद ही कभी अचानक मर जाते हैं; अधिकांश समय वह पहले फुसफुसाता है। डिस्क स्मार्ट (स्व-निगरानी, ​​​​विश्लेषण और रिपोर्टिंग प्रौद्योगिकी) डेटा उत्पन्न करती है: पुनः आवंटित क्षेत्रों की संख्या, त्रुटि दर पढ़ें, लंबित क्षेत्र। इन संख्याओं का धीरे-धीरे बढ़ना यह दर्शाता है कि डिस्क समाप्ति के करीब पहुंच रही है। इसी तरह, टीएलएस प्रमाणपत्र और सॉफ्टवेयर लाइसेंस की समाप्ति तिथि होती है; इसे मिस करने का मतलब होगा कि पूरी सेवा "सुरक्षित नहीं" चेतावनी के साथ रातों-रात क्रैश हो जाएगी। मेमोरी मॉड्यूल सुधार योग्य त्रुटियों की संख्या बढ़ाकर आसन्न विफलता की चेतावनी देते हैं। एआई संख्याओं के इन ढेरों में धीमी प्रवृत्ति को चिह्नित करने में अच्छा है - वह गुप्त चढ़ाई जिसे मानव आंख शोर में नहीं देख पाती है।

युक्ति: पूर्वानुमानित रखरखाव के लिए सबसे आसान और सबसे लाभदायक शुरुआत प्रमाणन और लाइसेंसिंग कैलेंडर है। समय सीमा समाप्त हो चुका प्रमाणपत्र आउटेज का सबसे अनुमानित कारण है जिसे पहले से ही जाना जा सकता है। एआई को आपके सभी प्रमाणपत्रों की समाप्ति तिथियां देने और यह कहने पर कि "उन्हें प्राथमिकता के क्रम में सूचीबद्ध करें क्योंकि वे अगले 60 दिनों में समाप्त हो जाएंगे" इसे कई रातों तक जागने से रोका जाएगा।

सिग्नल के साथ शोर: एकल रीडिंग कुछ नहीं कहती

पूर्वानुमानित रख-रखाव का सबसे बड़ा ख़तरा एक भी ख़राब रीडिंग पर ज़रूरत से ज़्यादा प्रतिक्रिया देना है। डिस्क के स्मार्ट मान में एक भी त्रुटि घबराने का कारण नहीं है; डिस्क में कभी-कभार त्रुटियों का सुधार होना सामान्य बात है। वास्तविक संकेत प्रवृत्ति है: समय के साथ मूल्य में लगातार और तेजी से गिरावट। इसीलिए आप एआई को एक तात्कालिक मूल्य नहीं, बल्कि एक समय श्रृंखला देते हैं और पूछते हैं "क्या यह मूल्य बढ़ रहा है, और यदि हां, तो क्या इसमें तेजी आ रही है?" वही अंतर आपको विफलता की संभावना को विफलता की वास्तविक निश्चितता से अलग करने में मदद करता है: एआई कहता है "इस ड्राइव में विफलता का जोखिम बढ़ गया है"; आप अपनी अतिरेक स्थिति, हिस्से की गंभीरता और अतिरिक्त हिस्से की आपूर्ति अवधि के साथ इसका मूल्यांकन करते हैं और तय करते हैं कि इसे बदलना है या नहीं।

चरण दर चरण: एआई के साथ पूर्वानुमानित रखरखाव

  1. सही संकेत लीजिए. स्मार्ट आउटपुट, प्रमाणन सूची, मेमोरी त्रुटि काउंटर, संसाधन प्रवृत्ति डेटा - किसी भी घटक के लिए जो भी प्रारंभिक संकेत उपलब्ध हैं, उन्हें एकत्र करें।
  2. समय शृंखला बतायें. केवल एक रीडिंग नहीं, बल्कि अतीत का डेटा दें, ताकि एआई रुझान देख सके।
  3. प्रवृत्ति और त्वरण के बारे में पूछें. "क्या यह मूल्य बढ़ रहा है, तेज हो रहा है, यह महत्वपूर्ण सीमा तक कब पहुंचेगा?" - अंतराल पर प्रक्षेपण के लिए पूछें।
  4. प्राथमिकता दें. दर्जनों चेतावनियों में से कौन सी सबसे गंभीर और तात्कालिक है? एआई को जोखिम और तात्कालिकता के आधार पर ऑर्डर रैंक करने के लिए कहें।
  5. संदर्भ के साथ निर्णय लें. क्या आपके पास अतिरेक है, पार्ट्स का लीड टाइम क्या है, आउटेज विंडो कब है? यह संदर्भ आप में है, एआई में नहीं; आप परिवर्तन का निर्णय लें.
  6. योजना बनाएं और सत्यापित करें. रखरखाव विंडो के भीतर प्रतिस्थापन को शेड्यूल करें; प्रतिस्थापन के बाद, सत्यापित करें कि नया घटक स्वस्थ है।

तीन मिनी मामले

केस 1 - कपटपूर्ण डिस्क प्रवृत्ति। एक स्टोरेज मैनेजर ने 200 डिस्क का साप्ताहिक स्मार्ट डेटा एआई को फीड किया। YZ ने नोट किया कि पिछले 6 हफ्तों में तीन डिस्क पर "पुन: असाइन किए गए सेक्टर" की संख्या क्रमशः 0 से बढ़कर 4, 11 और 27 हो गई, और 27 डिस्क का त्वरण उच्चतम था। ये डिस्क अभी तक विफल नहीं हुई थीं, लेकिन प्रवृत्ति स्पष्ट थी। व्यवस्थापक ने किसी भी डेटा को खोए बिना एक निर्धारित विंडो में सबसे जोखिम भरी डिस्क को बदल दिया - रात भर की प्रतिक्रियाशील पुनर्प्राप्ति से बचा।

केस 2 - प्रमाणपत्र संकट टल गया। एक टीम दर्जनों सेवाओं के प्रमाणपत्रों को मैन्युअल रूप से ट्रैक करने का प्रयास कर रही थी। उन्होंने एआई को मुखौटा प्रमाणपत्र समाप्ति सूची दी और उन लोगों को प्राथमिकता दी जो 60 दिनों के भीतर समाप्त हो जाएंगे। एआई ने शीर्ष पर एक महत्वपूर्ण एपीआई प्रमाणपत्र डाल दिया जिसके बारे में किसी को भी पता नहीं था, जो 9 दिनों में समाप्त हो जाएगा। नवीकरण समय पर किया गया था; एक ऐसा व्यवधान जो रातों-रात सभी एकीकरणों को बाधित कर देता, उसे रोक दिया गया।

केस 3 - झूठे अलार्म से वापसी। एक इंजीनियर ने सर्वर के मेमोरी त्रुटि काउंटर में एक सुधार योग्य त्रुटि देखी और डिस्क को तुरंत बदलना चाहा। सबसे पहले उन्होंने एआई को 3 महीने का काउंटर ट्रेंड दिया। एआई ने कहा कि यह एक पृथक, गैर-आवर्ती, गैर-बढ़ती एकल घटना थी और इसमें कोई प्रवृत्ति नहीं दिखी। अनावश्यक हार्डवेयर प्रतिस्थापन और रखरखाव विंडो लागत से बचा गया; इंजीनियर देखता ही रह गया.

चार प्रतिलिपि योग्य टेम्पलेट

1) स्मार्ट/हार्डवेयर प्रवृत्ति विश्लेषण:

नीचे [एन] डिस्क का पिछले [एक्स] सप्ताह का छिपा हुआ स्मार्ट डेटा है (विशेष रूप से पुनः आवंटित/लंबित सेक्टर और रीड त्रुटि दर)। मुझे बताएं: (1) किन डिस्क पर प्रासंगिक मान बढ़ रहे हैं, (2) वृद्धि तेज हो रही है, (3) तात्कालिकता के क्रम में 3 सबसे जोखिम भरी डिस्क को चिह्नित करें। सिर्फ पढ़ने से नहीं, बल्कि रुझान पर भी गौर करें। ध्यान दें कि यह एक संभावित चेतावनी है और निर्णय मेरा है। डेटा: [...]

2) प्रमाणपत्र/लाइसेंस समाप्ति प्राथमिकता:

नीचे प्रमाणपत्रों/लाइसेंसों और उनकी समाप्ति तिथियों की एक गुप्त सूची दी गई है। आज [तारीख] है. मुझे उन चीजों की सूची बनाएं जो अगले 60 दिनों में, तात्कालिकता (शेष दिन) के क्रम में पूरी हो जाएंगी; प्रत्येक के लिए अनुमानित ताज़ा प्राथमिकता स्तर लिखें। यदि कोई ऐसी चीज़ है जो आज से पहले समाप्त हो गई है, तो उसे सबसे ऊपर रखें। सूची: [...]

3) त्रुटि दर प्रवृत्ति मूल्यांकन:

नीचे एक घटक का विवरण दिया गया है [उदा. मेमोरी/नेटवर्क] में पिछले 3 महीनों से एक त्रुटि काउंटर है। क्या यह वास्तविक गिरावट की प्रवृत्ति है या पृथक शोर है? (1) क्या मूल्य बढ़ रहा है, (2) क्या यह लगातार/त्वरित या बिखरा हुआ है, (3) क्या आपकी सिफारिश "देखो" या "योजनाबद्ध परिवर्तन" है? मैं निर्णय लूंगा; आप एक तर्कसंगत मूल्यांकन प्रदान करते हैं. डेटा: [...]

4) वेल्ड घिसाव प्रक्षेपण:

नीचे [स्रोत, उदा. एसएसडी राइट लाइफ/डिस्क ऑक्यूपेंसी] ट्रेंड डेटा उपलब्ध है। वर्तमान दर पर, महत्वपूर्ण सीमा (%[X]%) कब तक पहुँचेगी? आशावादी और निराशावादी सीमा की भविष्यवाणी करें, अपनी धारणा लिखें। यदि पुर्जों की आपूर्ति का समय [Y] दिन है, तो मुझे कब कार्रवाई करनी चाहिए? डेटा: [समय श्रृंखला]

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

क्या यह डिस्क विफल हो जाएगी? [एकल स्मार्ट आउटपुट]

एक भी स्नैपशॉट पढ़ने से कोई रुझान नहीं दिखता। एआई या तो एक खाली "शायद" कहता है या एक एकल मूल्य को देखता है और अनुमान लगाता है जो ओवररिएक्ट करेगा।

शक्तिशाली संकेत:

आपकी भूमिका: भंडारण विश्वसनीयता विशेषज्ञ। डिस्क के पिछले 8 सप्ताह के साप्ताहिक स्मार्ट स्नैपशॉट (छिपे हुए) नीचे दिए गए हैं: पुनः आबंटित सेक्टर गणना और वर्तमान लंबित सेक्टर। मुझे (1) इन दो मूल्यों का साप्ताहिक रुझान दें, (2) यदि कोई वृद्धि है, तो क्या इसमें तेजी आ रही है, (3) यदि मेरी वर्तमान अतिरेक RAID के साथ 1 डिस्क सहनशीलता है, तो मुझे एक तर्कसंगत मूल्यांकन दें कि क्या मुझे इस डिस्क को योजनाबद्ध आधार पर या तत्काल बदलना चाहिए। यह मेरे ऊपर निर्भर है। डेटा: [8-सप्ताह की श्रृंखला]

रखरखाव का प्रकार

कब हस्तक्षेप करना है

लागत

एआई का योगदान

प्रतिक्रियाशील

जब कोई खराबी हो

उच्चतम (कटौती)

सीमित, घटना के बाद

निवारक

निश्चित कैलेंडर के साथ

मध्यम (जल्दी/देर से)

कैलेंडर अनुकूलन

पूर्वानुमानित

प्रारंभिक संकेत पर

न्यूनतम (योजनाबद्ध)

रुझान और प्रारंभिक चेतावनी

सामान्य गलतियाँ

  • एकल पढ़ने पर प्रतिक्रिया. खराब स्मार्ट वैल्यू घबराहट का कारण नहीं है; संकेत एक प्रवृत्ति है, एक बिंदु नहीं।
  • प्रमाणन कैलेंडर की उपेक्षा. सबसे पूर्वानुमानित व्यवधान एक समाप्त प्रमाणपत्र है; इसे चूकना अक्षम्य है।
  • संभाव्यता को निश्चितता समझना। "विफलता का जोखिम बढ़ रहा है" "विफल होगा" से भिन्न है; अतिरेक और लागत के साथ निर्णय लें.
  • पार्ट्स सप्लाई का समय भूल जाना। प्रारंभिक चेतावनी को देखने और स्पेयर पार्ट्स की आपूर्ति अवधि को ध्यान में नहीं रखने से फिर से रुकावट आएगी।
  • शोर पर बजट खर्च कर रहे हैं. हार्डवेयर प्रतिस्थापन के साथ एक अलग, गैर-बढ़ने वाली गलती पर प्रतिक्रिया करना अनावश्यक लागत है।
सावधानी: एआई की विफलता की भविष्यवाणी पिछले पैटर्न पर आधारित है; अचानक विनिर्माण त्रुटि, बिजली वृद्धि, या सॉफ्टवेयर से संबंधित मौत को इन पैटर्न से बाहर रखा गया है। पूर्वानुमानित रखरखाव जोखिम को कम करता है, न कि उसे रीसेट करता है; बैकअप और अतिरेक हमेशा रक्षा की पहली पंक्ति होते हैं।

सारांश

पूर्वानुमानित रखरखाव विफलता के घटित होने से पहले उसके शुरुआती लक्षण देखना और समय पर हस्तक्षेप करना है - जो आपको प्रतिक्रियाशील रखरखाव के तनाव और निवारक रखरखाव की बर्बादी से बचाता है। एआई स्मार्ट डेटा में घातक रुझानों को चिह्नित करने, प्रमाणन समाप्ति के करीब पहुंचने और त्रुटि दर बढ़ाने में शक्तिशाली है। लेकिन केवल पढ़ने पर ही नहीं, प्रवृत्ति पर भी गौर करें; संभाव्यता को निश्चितता के रूप में न लें; कुछ हिस्सों के लीड समय और अपनी अतिरेक को ध्यान में रखें। एआई पूर्व चेतावनी उत्पन्न करता है; जोखिम और लागत का आकलन करने के लिए पार्ट रिप्लेसमेंट, डाउनटाइम योजना और बजट निर्णय आपका है। और याद रखें: पूर्वानुमानित रखरखाव बैकअप का पूरक है, न कि उसे प्रतिस्थापित करता है।

आवेदन कार्य

पूर्वानुमानित रखरखाव से सबसे आसान उपाय के साथ शुरुआत करें: अपने सिस्टम में सभी प्रमाणपत्रों (या लाइसेंस) की समाप्ति तिथियों को सूचीबद्ध करें, उन्हें छुपाएं, और ऊपर दिए गए "प्रमाणपत्र/लाइसेंस समाप्ति प्राथमिकता" टेम्पलेट के साथ 60 दिनों के भीतर समाप्त होने वाली तिथियों को प्राथमिकता दें। फिर, यदि आपके पास पहुंच है, तो कुछ डिस्क का स्मार्ट ट्रेंड डेटा एकत्र करें और देखें कि "स्मार्ट/हार्डवेयर ट्रेंड विश्लेषण" टेम्पलेट के साथ कोई वृद्धि हुई है या नहीं। अपने निष्कर्षों और आपके द्वारा की जाने वाली योजनाबद्ध कार्रवाइयों (नवीकरण, निगरानी, ​​परिवर्तन) को 6 वस्तुओं में लिखें; प्रत्येक के लिए, अपने निर्णय का तर्क बताएं।

चेकलिस्ट

  • [ ] क्या मैंने प्रमाणपत्रों और लाइसेंसों की समाप्ति तिथियां हटा दी हैं और आगामी तिथियों को प्राथमिकता दी है?
  • [ ] क्या मैं हार्डवेयर सिग्नलों में समय श्रृंखला की प्रवृत्ति को देख रहा हूं और एक भी रीडिंग नहीं?
  • [ ] क्या मैंने एआई के "विफलता के जोखिम" आउटपुट को एक संभाव्यता के रूप में नहीं लिया और इसे निश्चितता समझने की भूल नहीं की?
  • [ ] क्या मैंने प्रतिस्थापन निर्णय में अपनी अतिरेक और पुर्जों की आपूर्ति में लगने वाले समय को ध्यान में रखा है?
  • [ ] क्या मैंने अनावश्यक हार्डवेयर प्रतिस्थापन के साथ पृथक शोर पर प्रतिक्रिया करने से परहेज किया है?
  • [ ] क्या मैंने भविष्य कहनेवाला रखरखाव को बैकअप और अतिरेक के प्रतिस्थापन के बजाय पूरक के रूप में रखा है?