единици
1. Въведение в изкуствения интелект в управлението на системи и мрежи: Роли, граници, удостоверяване и пълномощия 2. Скриптове за автоматизация: Безопасно генериране на Bash, PowerShell и Python 3. Анализ на регистрационния файл и анализ на първопричината: Намиране на сигнала в шума 4. Мониторинг на капацитета и производителността: Разчитане на показатели и планиране за бъдещето 5. Управление на конфигурацията: Генериране на конфигурация, валидиране и улавяне на отклонение 6. Управление на инфраструктурата като код (IaC): Terraform, Ansible и Plan Control 7. Управление на документация и информация: Runbook, Post mortem и корпоративна памет 8. Прогнозна поддръжка: Виждане на повреди, преди да се случат 9. Управление на промените: Оценка на риска, връщане назад и прозорец за поддръжка 10. Сигурност и отбрана: Използване на изкуствен интелект за отбранителни цели и в рамките на правомощията 11. Интеграция от край до край: Управление на инцидент от началото до края
единица 8 / 11

Прогнозна поддръжка: Виждане на повреди, преди да се случат

Печалби:

  • SMART може да разчита ранни сигнали като живот на сертификат/лиценз и процент грешки като тенденция с изкуствения интелект и да предвиди повредата.
  • Възможност за отделяне на фалшивите аларми от реалния риск чрез разглеждане на тенденцията на времевия ред, а не на едно отчитане
  • Разбиране, че изкуственият интелект създава възможности и вземане на решение за подмяна на части с излишък, цена и време за доставка на части

Прогнозна поддръжка: Виждане на неизправности, преди да се случат с AI

В управлението на системата има три вида поддръжка. Реактивната поддръжка е поправка на нещо след повреда – най-скъпото и стресиращо; Дискът се запълва, сървърът се срива и тогава стартирате. Превантивната поддръжка е поддръжка, която се извършва на редовни интервали по график — като например „смяна на диска на всеки 6 месеца“; Работи, но може да е твърде рано (ненужни разходи) или твърде късно (провалът е на първо място). Прогнозната поддръжка е най-умното нещо: разчитане на ранните сигнали, които показват, че даден компонент наближава повреда и намеса точно навреме. Точно тези ранни сигнали са мощни в забелязването на AI – повреда на SMART данни на диска, предстоящо изтичане на сертификата, нарастващ процент грешки на паметта, тихо изкачване на тенденция. Но предупреждението е ясно: AI създава вероятност и ранно предупреждение; Вие сте този, който взема решения за подмяна на части, планиране на прекъсвания и бюджетиране чрез претегляне на риска и разходите.

В това устройство, основни сигнали за предсказуема поддръжка (SMART, живот на сертификат/лиценз, тенденция в процента на грешки, износване на ресурса); Четене за ранно предупреждение с AI; и ще се научите да различавате фалшивата тревога от реалния риск.

Къде са скрити ранните сигнали?

Хардуерът и софтуерът рядко умират внезапно; през повечето време той шепне пръв. Дисковете произвеждат SMART (технология за самонаблюдение, анализ и отчитане) данни: брой преразпределени сектори, процент грешки при четене, чакащи сектори. Бавното увеличаване на тези числа показва, че дискът се приближава към смъртта. По същия начин TLS сертификатите и софтуерните лицензи носят дата на изтичане; Липсата на това би означавало, че цяла услуга се срива за една нощ с предупреждение „не е защитено“. Модулите с памет предупреждават за предстояща повреда, като увеличават броя на поправимите грешки. AI е добър в отбелязването на бавната тенденция в тези купчини числа – скритото изкачване, което човешкото око пропуска в шума.

Съвет: Най-лесният и най-изгоден старт за предсказуема поддръжка е календарът за сертифициране и лицензиране. Изтеклият сертификат е най-предвидимата причина за прекъсване, която може да бъде известна предварително. Даването на AI на датите на изтичане на всичките ви сертификати и казването им „избройте ги по приоритет, тъй като изтичат през следващите 60 дни“, ще му попречи да се събужда много нощи.

Шум със сигнал: едно четене не казва нищо

Най-големият капан на предсказуемата поддръжка е прекомерната реакция на едно лошо отчитане. Единична грешка в SMART стойността на диска не е причина за паника; Нормално е дисковете да имат коригирани случайни грешки. Истинският сигнал е тенденцията: последователно и ускоряващо се влошаване на стойността с течение на времето. Ето защо давате на AI не една моментна стойност, а времева серия и питате "увеличава ли се тази стойност и ако да, ускорява ли се?" Същото разграничение ви помага да отделите възможността за повреда от действителната сигурност за повреда: AI казва, че „това устройство има повишен риск от повреда“; Вие оценявате това заедно с вашата ситуация на излишък, критичността на частта и периода на доставка на резервна част и решавате дали да я замените.

Стъпка по стъпка: Прогнозна поддръжка с AI

  1. Съберете правилния сигнал. SMART изход, списък със сертификати, броячи на грешки в паметта, данни за тенденциите на ресурсите—съберете всякакви ранни сигнали, налични за всеки компонент.
  2. Дайте времеви редове. Дайте данни, обхващащи миналото, а не само едно четене, така че AI да може да види тенденцията.
  3. Попитайте за тренда и ускорението. „Увеличава ли се, ускорява ли се тази стойност, кога ще достигне критичния праг?“ — питайте за проекцията на интервали.
  4. Приоритизирайте. Сред десетките предупреждения кое е най-критичното и незабавно? Помолете AI да класира поръчката по риск и спешност.
  5. Вземете решението с контекст. Имате ли съкращения, какво е времето за изпълнение на частите, кога е прозорецът за прекъсване? Този контекст е във вас, а не в AI; Вие вземате решението да се промените.
  6. Планирайте и проверете. Планирайте подмяната в рамките на прозорец за поддръжка; След смяната проверете дали новият компонент е здрав.

три мини калъфа

Случай 1 — Коварна дискова тенденция. Мениджърът на хранилището подаваше седмичните SMART данни на 200 диска към AI. YZ отбеляза, че броят на „преназначените сектори“ на трите диска се е увеличил съответно от 0 до 4, 11 и 27 през последните 6 седмици и че ускорението на 27 диска е най-високо. Тези дискове все още не се бяха провалили, но тенденцията беше ясна. Администраторът замени най-рисковия диск в планиран прозорец, без да загуби никакви данни — избягвайки реактивно възстановяване за една нощ.

Случай 2 — Предотвратено бедствие със сертификата. Екип се опитваше ръчно да проследи сертификатите на десетки услуги. Те дадоха маскирания списък с изтичащи сертификати на AI и приоритизираха тези, които ще изтекат в рамките на 60 дни. AI постави критичен API сертификат отгоре, за който никой не знаеше, който щеше да изтече след 9 дни. Ремонтът е извършен в срок; Беше предотвратено прекъсване, което би прекъснало всички интеграции за една нощ.

Случай 3 — Връщане от фалшива тревога. Инженер видя една единствена поправима грешка в брояча на грешки в паметта на сървъра и поиска незабавно да замени диска. Първо, той даде 3-месечната противоположна тенденция на AI. AI заяви, че това е изолирано, неповтарящо се единично събитие, което не се увеличава и не показва тенденция. Бяха избегнати ненужни разходи за подмяна на хардуер и поддръжка; Инженерът просто продължи да гледа.

Четири копируеми шаблона

1) SMART/хардуерен анализ на тенденциите:

По-долу са маскирани SMART данни от последната [X] седмица на [N] дискове (особено преразпределени/чакащи сектори и процент грешки при четене). Кажете ми: (1) на кои дискове се УВЕЛИЧАВАТ съответните стойности, (2) ускорява ли се увеличението, (3) маркирайте 3-те най-рискови диска по реда на спешност. Гледайте тенденцията, не само четете. Имайте предвид, че това е предупреждение за възможност и решението е мое. Данни: [...]

2) Приоритет за изтичане на сертификата/лиценза:

По-долу има маскиран списък със сертификати/лицензи и датите им на изтичане. Днес е [дата]. Избройте ми нещата, които ще бъдат изпълнени през следващите 60 дни, по ред на спешност (оставащи дни); Напишете очакваното ниво на приоритет на опресняване за всяко. Ако има нещо, което е изтекло преди днес, поставете го най-отгоре. Списък: [...]

3) Оценка на тенденцията за процент грешки:

По-долу е дадено описание на компонент [напр. памет/мрежа] има брояч на грешки за последните 3 месеца. Това истинска тенденция на влошаване ли е или изолиран шум? (1) увеличава ли се стойността, (2) последователна/ускорява ли се или разпръсната, (3) вашата препоръка „наблюдавайте“ или „планирана промяна“ ли е? Аз ще реша; Предоставяте обоснована оценка. Данни: [...]

4) Проекция на износване на заваръчния шев:

По-долу [източник, напр. SSD живот на запис / заетост на диска] са налични данни за тенденцията. При сегашния темп, кога ще бъде достигнат критичният праг (%[X]%)? Прогнозирайте оптимистичния и песимистичния диапазон, запишете предположението си. Ако времето за доставка на части е [Y] дни, кога трябва да предприема действия? Данни: [времеви редове]

Слаба подкана / Силна подкана

Слаба подкана:

Ще се повреди ли този диск? [единичен SMART изход]

Едно отчитане на моментна снимка не показва тенденция. AI или казва празно „може би“, или разглежда една единствена стойност и прави предположение, което ще реагира прекалено силно.

Мощна подкана:

Вашата роля: експерт по надеждност на съхранението. По-долу са последните 8 седмици седмични SMART моментни снимки на диск (маскиран): преразпределен брой сектори и текущи чакащи сектори. Дайте ми (1) седмичната тенденция на тези две стойности, (2) ако има увеличение, ускорява ли се, (3) ако текущото ми резервиране е толеранс на 1 диск с RAID, дайте ми обоснована оценка дали трябва да сменя този диск планирано или спешно. Зависи от мен. Данни: [серия от 8 седмици]

Тип поддръжка

Кога да се намеси

цена

Принос на AI

реактивен

Когато има неизправност

Най-висок (приспадане)

Ограничен, след събитието

превантивна

С фиксиран календар

Среден (ранен/късен)

Оптимизация на календара

предсказващ

При ранен сигнал

Минимум (планиран)

Тенденция и ранно предупреждение

Често срещани грешки

  • Реагиране на едно четене. Лоша SMART стойност не е повод за паника; Сигналът е тенденция, а не единична точка.
  • Пренебрегване на календара за сертифициране. Най-предсказуемото прекъсване е изтекъл сертификат; Липсата му е непростима.
  • Грешна вероятност за сигурност. „Рискът от провал нараства“ е различен от „ще се провали“; вземете решението с излишък и разходи.
  • Забравяйки времето за доставка на части. Виждането на ранното предупреждение и неотчитането на периода на доставка на резервни части отново ще доведе до прекъсвания.
  • Разходване на бюджет за шум. Реагирането на изолирана, неескалираща грешка с подмяна на хардуер е ненужен разход.
Внимание: Прогнозата за повреда на AI се основава на минали модели; Внезапна производствена грешка, пренапрежение на захранването или смърт, свързана със софтуера, са изключени от тези модели. Прогнозната поддръжка намалява риска, а не го нулира; архивирането и резервирането винаги са първата линия на защита.

В обобщение

Прогнозната поддръжка е да виждате ранни признаци на повреда, преди да се случи, и да се намесвате точно навреме – спестявайки ви от стреса на реактивната поддръжка и загубата на превантивна поддръжка. AI е мощен при маркиране на коварни тенденции в SMART данни, наближаващо изтичане на сертификата, увеличаване на процента на грешки. Но погледнете тенденцията, не само четенето; Не приемайте вероятността като сигурност; Вземете под внимание времето за изпълнение на частите и вашето излишък. AI произвежда ранно предупреждение; Подмяната на части, планът за престой и решението за бюджета са ваши, за да претеглите риска и разходите. И помнете: предсказуемата поддръжка допълва архивирането, а не го замества.

Задача за приложение

Започнете с най-лесния изход от предсказуемата поддръжка: избройте датите на изтичане на всички сертификати (или лицензи) във вашите системи, маскирайте ги и дайте приоритет на тези, които изтичат в рамките на 60 дни с шаблона „Приоритетизиране на изтичане на сертификат/лиценз“ по-горе. След това, ако имате достъп, съберете данните за тенденцията SMART на няколко диска и вижте дали има увеличение с шаблона „Анализ на тенденцията SMART/хардуер“. Запишете констатациите си и планираните действия, които ще предприемете (обновяване, мониторинг, промяна) в 6 точки; За всеки посочете обосновката за вашето решение.

контролен списък

  • [ ] Премахнал ли съм датите на изтичане на сертификатите и лицензите и съм ли приоритизирал предстоящите?
  • [ ] Гледам ли тенденция във времевата серия в хардуерните сигнали, а нито едно отчитане?
  • [ ] Не приех ли изхода на AI за „риск от повреда“ като вероятност и не го ли обърках със сигурност?
  • [ ] Взех ли предвид моето съкращаване и времето за доставка на части при решението за смяна?
  • [ ] Избягвал ли съм да реагирам на изолиран шум с ненужна подмяна на хардуер?
  • [ ] Позиционирал ли съм предсказуемата поддръжка като допълнение, а не като заместител на архивиране и резервиране?