Единици
1. Вовед во вештачката интелигенција во управувањето со системот и мрежата: улоги, граници, автентикација и авторитет 2. Скрипти за автоматизација: Безбедно генерирање на Bash, PowerShell и Python 3. Анализа на дневници и анализа на основната причина: Пронаоѓање на сигналот во бучавата 4. Мониторинг на капацитети и перформанси: Читање на метрика и планирање за иднината 5. Управување со конфигурација: генерирање конфигурација, валидација и снимање на Drift 6. Управување со инфраструктурата како код (IaC): Terraform, Ansible и Plan Control 7. Управување со документација и информации: Runbook, Post-mortem и Corporate Memory 8. Предвидливо одржување: Гледање на неуспеси пред да се случат 9. Управување со промени: Проценка на ризик, враќање и прозорец за одржување 10. Безбедност и одбрана: Користење на вештачка интелигенција за одбранбени цели и во рамките на границите на овластувањата 11. Интеграција од крај до крај: Управување со инцидент од почеток до крај
Единица 8 / 11

Предвидливо одржување: Гледање на неуспеси пред да се случат

Добивки:

  • SMART може да ги чита раните сигнали како што се векот на траење на сертификатот/лиценцата и стапката на грешки како тренд со вештачката интелигенција и да го предвиди неуспехот.
  • Способност да се одделат лажните аларми од реалниот ризик со гледање на трендот на временските серии наместо едно читање
  • Разбирање дека вештачката интелигенција создава можности и донесување одлука за замена на делови со вишок, цена и време на снабдување со делови

Предвидливо одржување: Гледање на дефекти пред да се случат со вештачката интелигенција

Постојат три типа на одржување во управувањето со системот. Реактивното одржување е поправање на нешто откако ќе се скрши - најскапото и најстресното; Дискот се полни, серверот паѓа, а потоа работиш. Превентивното одржување е одржување што се случува во редовни интервали на распоред - како што е „промена на диск на секои 6 месеци“; Работи, но може да биде или прерано (непотребна цена) или предоцна (неуспехот е на прво место). Предвидливото одржување е најпаметната работа: читањето на раните сигнали кои укажуваат дека компонентата се приближува до дефект и интервенира точно на време. Токму овие рани сигнали се дека вештачката интелигенција е моќна во забележувањето - оштетување на SMART податоците на дискот, претстојното истекување на сертификатот, зголемената стапка на грешка на меморијата, тивкото искачување на трендот. Но, предупредувањето е јасно: вештачката интелигенција произведува веројатност и рано предупредување; Вие сте тој што донесува одлуки за замена на делови, планирање прекини и буџетирање со мерење на ризикот и трошоците.

Во оваа единица, основни сигнали за предвидливо одржување (SMART, век на сертификат/лиценца, тренд на стапка на грешка, абење на ресурсите); Читање на рано предупредување со вештачка интелигенција; и ќе научите да разликувате лажна тревога од реален ризик.

Каде се скриени раните сигнали?

Хардверот и софтверот ретко умираат ненадејно; најчесто прв шепоти. Дисковите произведуваат податоци SMART (Технологија за само-следење, анализа и известување): број на прераспределени сектори, стапка на грешки во читањето, сектори во фаза на чекање. Полека зголемување на овие бројки покажува дека дискот се приближува кон смртта. Слично на тоа, TLS сертификатите и софтверските лиценци имаат датум на истекување; Пропуштањето на ова би значело дека цела услуга паѓа преку ноќ со предупредување „небезбедно“. Модулите за меморија предупредуваат за претстојниот неуспех со зголемување на бројот на грешки што може да се поправат. Вештачката интелигенција е добра во означување на бавниот тренд во овие купишта бројки - подмолното искачување што човечкото око го пропушта во бучавата.

Совет: Најлесен и најпрофитабилен почеток на предвидливо одржување е календарот за сертификација и лиценцирање. Истечен сертификат е најпредвидливата причина за прекин што може однапред да се знае. Ако на вештачката интелигенција ѝ ги дадете датумите на истекување на сите ваши сертификати и ќе кажете „наведете ги по редослед на приоритет бидејќи истекуваат во следните 60 дена“, ќе го спречи да се разбуди многу ноќи.

Шум со сигнал: едно читање не кажува ништо

Најголемата замка на предвидливото одржување е претерано реагирање на едно лошо читање. Една грешка во SMART вредноста на дискот не е причина за паника; Нормално е дисковите да имаат повремени поправени грешки. Вистинскиот сигнал е трендот: постојано и забрзано влошување на вредноста со текот на времето. Затоа на вештачката интелигенција не и давате ниту една моментална вредност, туку временска серија и прашувате „дали оваа вредност се зголемува, и ако е така, дали се забрзува? Истата разлика ви помага да ја одделите можноста за неуспех од вистинската сигурност на неуспех: вештачката интелигенција вели „овој диск има зголемен ризик од дефект“; Вие го оценувате ова заедно со вашата ситуација со вишок, критичноста на делот и периодот на снабдување со резервни делови и одлучувате дали да го замените.

Чекор по чекор: Предвидливо одржување со вештачка интелигенција

  1. Соберете го вистинскиот сигнал. SMART излез, список со сертификација, бројачи на грешки во меморијата, податоци за трендовите на ресурсите - собирајте какви било рани сигнали што се достапни за која било компонента.
  2. Дајте временски серии. Дајте податоци кои опфаќаат минатото, а не само едно читање, за да може вештачката интелигенција да го види трендот.
  3. Прашајте за трендот и забрзувањето. „Дали оваа вредност се зголемува, забрзува, кога ќе го достигне критичниот праг? — побарајте ја проекцијата во интервали.
  4. Дајте приоритет. Помеѓу десетици предупредувања, кое е најкритично и најнепосредно? Побарајте од вештачката интелигенција да го рангира редоследот по ризик и итност.
  5. Донесете ја одлуката со контекст. Дали имате технолошки вишок, колку е времето на испорака на делови, кога е испадниот прозорец? Овој контекст е во вас, а не во вештачката интелигенција; Вие донесувате одлука за промена.
  6. Планирајте и потврдете. Закажете замена во прозорец за одржување; По замената, проверете дали новата компонента е здрава.

три мини футроли

Случај 1 - Подмолен тренд на дискови. Менаџер за складирање ги напојуваше неделните SMART податоци од 200 дискови на вештачката интелигенција. YZ забележа дека бројот на „преназначени сектори“ на трите дискови се зголемил од 0 на 4, 11 и 27, соодветно, во последните 6 недели и дека забрзувањето на 27-те дискови било најголемо. Овие дискови сè уште не пропаднаа, но трендот беше јасен. Администраторот го замени најризичниот диск во закажаниот прозорец без губење податоци - избегнувајќи реактивно обновување преку ноќ.

Случај 2 - Избегната катастрофа на сертификатот. Тим се обидуваше рачно да ги следи сертификатите на десетици услуги. Тие го дадоа маскираниот список со истекување на сертификатот на вештачката интелигенција и им дадоа приоритет на оние што ќе истечат во рок од 60 дена. Вештачката интелигенција стави критичен API сертификат на врвот за кој никој не знаеше, кој ќе истече за 9 дена. Реновирањето е направено навреме; Спречен е прекин кој преку ноќ би ги прекинал сите интеграции.

Случај 3 - Враќање од лажна тревога. Еден инженер видел една единствена исправна грешка во бројачот на грешки во меморијата на серверот и сакал веднаш да го замени дискот. Прво, тој го даде 3-месечниот контра тренд на ВИ. АИ изјави дека ова е изолиран, неповторлив, единечен настан што не се зголемува и не покажува тренд. Беа избегнати непотребните трошоци за замена и одржување на хардверот; Инженерот само продолжи да гледа.

Четири шаблони за копирање

1) ПАМЕТНА/Анализа на трендови на хардвер:

Подолу се прикажани маскирани SMART податоци од [N] дискови од минатата [X] недела (особено прераспределени/во тек сектори и стапка на грешки при читање). Кажи ми: (1) на кои дискови релевантните вредности СЕ ЗГОЛЕМУВААТ, (2) дали зголемувањето се забрзува, (3) означете ги 3-те најризични дискови по редослед на итност. Погледнете го трендот, не само читањето. Имајте предвид дека ова е предупредување за можност и одлуката е моја. Податоци: [...]

2) Приоритизација на истекување на сертификат/лиценца:

Подолу е маскиран список на сертификати/лиценци и нивните датуми на истекување. Денес е [датум]. Наведете ми ги работите што ќе бидат завршени во следните 60 дена, по редослед на итност (преостанати денови); Напишете го проценетото ниво на приоритет на освежување за секое. Ако има нешто што е истечено пред денес, ставете го на врвот. Список: [...]

3) Проценка на трендот на стапката на грешка:

Подолу е опис на компонента [на пр. меморија/мрежа] има бројач на грешки во последните 3 месеци. Дали е ова вистински тренд на влошување или изолирана бучава? (1) дали вредноста се зголемува, (2) дали е конзистентна/забрзана или расфрлана, (3) дали вашата препорака е „внимавајте“ или „планирана промена“? јас ќе одлучам; Вие давате аргументирана оценка. Податоци: [...]

4) Проекција на абење на завар:

Подолу [извор, на пр. Достапни се податоци за трендот на запишување на SSD / зафатеност на дискот. Со сегашната стапка, кога ќе се достигне критичниот праг (%[X]%)? Предвидете го оптимистичкиот и песимистичкиот опсег, запишете ја вашата претпоставка. Ако времето за снабдување со делови е [Y] дена, кога треба да преземам акција? Податоци: [временска серија]

Слаб промпт / Силен промпт

Слаба навестување:

Дали овој диск ќе пропадне? [единечен SMART излез]

Читањето на една слика не покажува тренд. Вештачката интелигенција или вели празно „можеби“ или гледа на една вредност и прави претпоставка што ќе претерано реагира.

Моќен потсетник:

Вашата улога: експерт за доверливост на складирање. Подолу се последните 8 недели од неделните SMART снимки од диск (маскирани): прераспределен број на сектори и тековен сектор во фаза на чекање. Дајте ми (1) неделниот тренд на овие две вредности, (2) ако има зголемување, дали се забрзува, (3) ако мојот моментален вишок е 1 толеранција на диск со RAID, дајте ми образложена проценка дали треба да го заменам овој диск на планирана основа или итно. Од мене зависи.Податоци: [8-неделна серија]

Тип на одржување

Кога да се интервенира

Цена

Придонес на ВИ

реактивни

Кога има дефект

Највисоко (одбиток)

Ограничено, по настанот

превентивни

Со фиксен календар

Средно (рано/доцна)

Оптимизација на календарот

предвидливо

На раниот сигнал

Минимум (планирано)

Тренд и рано предупредување

Вообичаени грешки

  • Реакција на едно читање. Лошата SMART вредност не е причина за паника; Сигналот е тренд, а не една точка.
  • Занемарување на календарот за сертификација. Најпредвидливото нарушување е истечен сертификат; Пропуштањето е непростливо.
  • Грешка веројатноста за сигурност. „Ризикот од неуспех се зголемува“ е различен од „ќе пропадне“; донесете ја одлуката со вишок и трошоци.
  • Заборавајќи го времето за снабдување со делови. Ако го видите раното предупредување и не го земате предвид периодот на снабдување со резервни делови, повторно ќе доведете до прекини.
  • Трошење буџет на бучава. Реагирањето на изолирана грешка што не ескалира со замена на хардвер е непотребна цена.
Внимание: предвидувањето на неуспехот на вештачката интелигенција се заснова на минатите модели; Ненадејна грешка при производството, наплив на струја или смрт поврзана со софтвер се исклучени од овие модели. Предвидливото одржување го намалува ризикот, а не го ресетира; резервната копија и вишокот се секогаш првата линија на одбрана.

Сумирано

Предвидливото одржување е согледување на рани знаци на неуспех пред да се случи и интервенирање точно на време - ве спасува од стресот на реактивното одржување и губењето на превентивното одржување. Вештачката интелигенција е моќна да ги означува подмолните трендови во податоците на SMART, да се приближи до истекот на сертификатот, да ја зголеми стапката на грешки. Но, погледнете го трендот, не само читањето; Не земајте ја веројатноста како сигурност; Земете го предвид времето на носење на делови и вашиот вишок. ВИ произведува рано предупредување; Замената на делови, планот за застој и буџетската одлука се ваши за да ги измерите ризикот и трошоците. И запомнете: предвидливото одржување ја надополнува резервната копија, а не ја заменува.

Задача за апликација

Започнете со најлесното преземање од предвидливото одржување: наведете ги датумите на истекување на сите сертификати (или лиценци) во вашите системи, маскирајте ги и дадете приоритет на оние што истекуваат во рок од 60 дена со шаблонот „Приоритетизација на истекување на сертификатот/лиценцата“ погоре. Потоа, ако имате пристап, соберете ги податоците за трендовите SMART на неколку дискови и видете дали има зголемување со шаблонот „SMART/hardware trend analysis“. Запишете ги вашите наоди и планираните активности што ќе ги преземете (обновување, следење, промена) во 6 ставки; За секој, наведете го образложението за вашата одлука.

листа за проверка

  • [ ] Дали ги отстранив датумите на истекување на сертификатите и лиценците и им дадов приоритет на претстојните?
  • [ ] Дали гледам тренд на временски серии во хардверските сигнали и ниту едно читање?
  • [ ] Зарем не го зедов излезот „ризик од неуспех“ на вештачката интелигенција како веројатност и погрешно го земав со сигурност?
  • [ ] Дали го земав предвид мојот вишок и времето за снабдување со делови при одлуката за замена?
  • [ ] Дали избегнав да реагирам на изолиран шум со непотребна замена на хардверот?
  • [ ] Дали го позиционирав предвидливото одржување како дополнување, наместо како замена за, резервната копија и вишокот?