Јединице
1. Увод у вештачку интелигенцију у управљању системом и мрежом: улоге, границе, аутентификација и овлашћења 2. Скрипте за аутоматизацију: безбедно генерисање Басх-а, ПоверСхелл-а и Питхон-а 3. Анализа дневника и анализа основног узрока: Проналажење сигнала у шуму 4. Праћење капацитета и учинка: читање метрика и планирање за будућност 5. Управљање конфигурацијом: генерисање конфигурације, провера ваљаности и снимање одступања 6. Управљање инфраструктуром као код (ИаЦ): Терраформ, Ансибле и План Цонтрол 7. Управљање документацијом и информацијама: Рунбоок, пост мортем и корпоративно памћење 8. Предвиђено одржавање: уочавање кварова пре него што се догоде 9. Управљање променама: процена ризика, враћање уназад и прозор за одржавање 10. Безбедност и одбрана: коришћење вештачке интелигенције у одбрамбене сврхе иу границама овлашћења 11. Интеграција од краја до краја: Управљање инцидентом од почетка до краја
Јединица 8 / 11

Предвиђено одржавање: уочавање кварова пре него што се догоде

Добици:

  • СМАРТ може да чита ране сигнале као што су животни век сертификата/лиценце и стопа грешака као тренд са вештачком интелигенцијом и предвиди неуспех.
  • Способност одвајања лажних аларма од стварног ризика гледањем на тренд временске серије, а не на једно очитавање
  • Разумевање да вештачка интелигенција ствара могућности и доношење одлуке да се делови замене редундантношћу, трошковима и временом испоруке делова

Предиктивно одржавање: уочавање кварова пре него што се догоде са АИ

Постоје три врсте одржавања у управљању системом. Реактивно одржавање је поправљање нечега након што се поквари — најскупље и најстресније; Диск се пуни, сервер се руши, а онда трчите. Превентивно одржавање је одржавање које се одвија у редовним интервалима по распореду — као што је „промена диска сваких 6 месеци“; Ради, али може бити прерано (непотребан трошак) или прекасно (неуспех је први). Предвиђено одржавање је најпаметнија ствар: читање раних сигнала који указују да се компонента приближава квару и интервенише на време. Управо су ови рани сигнали да је АИ моћна у уочавању — оштећење СМАРТ података на диску, предстојећи истек сертификата, све већа стопа грешака у меморији, тихи успон тренда. Али упозорење је јасно: АИ производи вероватноћу и рано упозорење; Ви сте тај који доноси замену делова, планирање испада и одлуке о буџетирању тако што одмерава ризик и трошкове.

У овој јединици, основни сигнали предиктивног одржавања (СМАРТ, век трајања сертификата/лиценце, тренд стопе грешке, трошење ресурса); Читање раног упозорења са АИ; и научићете да разликујете лажну узбуну од стварног ризика.

Где се крију први сигнали?

Хардвер и софтвер ретко умиру изненада; најчешће прво шапуће. Дискови производе СМАРТ (технологија само-надгледања, анализе и извештавања) податке: број прераспоређених сектора, стопа грешке при читању, сектори на чекању. Полако повећање ових бројева указује да се диск приближава смрти. Слично, ТЛС сертификати и софтверске лиценце имају датум истека; Ако ово пропустите, то би значило да се цела услуга руши преко ноћи са упозорењем „није безбедно“. Меморијски модули упозоравају на предстојећи квар повећањем броја грешака које се могу исправити. АИ је добар у означавању спорог тренда у овим гомилама бројева — прикривеном успону који људском оку недостаје у буци.

Савет: Најлакши и најисплативији почетак предиктивног одржавања је календар сертификације и лиценцирања. Сертификат који је истекао је најпредвидљивији узрок нестанка који се може знати унапред. Ако АИ дате датуме истека свих ваших сертификата и кажете „наведите их по приоритету пошто истичу у наредних 60 дана“, спречићете је да се пробуди много ноћи.

Шум са сигналом: једно очитавање не говори ништа

Највећа замка предиктивног одржавања је претерано реаговање на једно лоше очитавање. Једна грешка у СМАРТ вредности диска није разлог за панику; Нормално је да се на дисковима повремено исправљају грешке. Прави сигнал је тренд: доследно и убрзано погоршање вредности током времена. Зато АИ не дајете једну тренутну вредност, већ временску серију и питате „да ли се ова вредност повећава, и ако јесте, да ли се убрзава?“ Иста разлика вам помаже да одвојите могућност квара од стварне извесности неуспеха: АИ каже да „овај диск има повећан ризик од квара“; Ово процењујете заједно са ситуацијом вашег вишка, критичношћу дела и периодом испоруке резервних делова и одлучујете да ли да га замените.

Корак по корак: Предиктивно одржавање са АИ

  1. Прикупите прави сигнал. СМАРТ излаз, листа сертификата, бројачи грешака у меморији, подаци о тренду ресурса—сакупите све ране сигнале који су доступни за било коју компоненту.
  2. Дајте временске серије. Дајте податке који обухватају прошлост, а не само једно очитавање, тако да АИ може да види тренд.
  3. Питајте о тренду и убрзању. „Да ли се ова вредност повећава, убрзава, када ће достићи критични праг? — тражити пројекцију у интервалима.
  4. Одредите приоритете. Међу десетинама упозорења, које је најкритичније и најнепосредније? Замолите АИ да рангира ред према ризику и хитности.
  5. Донесите одлуку са контекстом. Да ли имате вишак, које је време испоруке делова, када је период застоја? Овај контекст је у вама, а не у АИ; Ви доносите одлуку да се промените.
  6. Планирајте и проверите. Закажите замену унутар периода одржавања; Након замене, проверите да ли је нова компонента здрава.

три мини кофера

Случај 1 — Подмукли тренд дискова. Менаџер складиштења је хранио недељне СМАРТ податке од 200 дискова АИ. ИЗ је приметио да се број „предодељених сектора“ на три диска повећао са 0 на 4, 11 и 27, респективно, у последњих 6 недеља и да је убрзање 27 диска било највеће. Ови дискови још нису отказали, али тренд је био јасан. Администратор је заменио најризичнији диск у заказаном периоду без губитка података — избегавајући реактивни опоравак преко ноћи.

Случај 2 — Катастрофа сертификата је спречена. Тим је покушавао ручно да прати сертификате десетина услуга. Дали су маскирану листу истека сертификата АИ и дали приоритет онима који ће истећи у року од 60 дана. АИ је на врх ставио критични АПИ сертификат за који нико није знао, а који ће истећи за 9 дана. Реновирање је обављено на време; Спречен је прекид који би преко ноћи прекинуо све интеграције.

Случај 3 — Повратак из лажне узбуне. Инжењер је видео једну грешку која се може исправити у бројачу грешака у меморији сервера и желео је да одмах замени диск. Прво, дао је тромесечни контра тренд АИ. АИ је навео да је ово био изолован, непоновљив, без пораста појединачни догађај и да није показао никакав тренд. Избегнути су непотребни трошкови замене хардвера и одржавања прозора; Инжењер је само посматрао.

Четири шаблона за копирање

1) СМАРТ/хардверска анализа тренда:

Испод су маскирани СМАРТ подаци од [Н] дискова последње [Кс] недеље (посебно прераспоређени/на чекању сектори и стопа грешке при читању). Реците ми: (1) на којим дисковима су релевантне вредности У ПОВЕЋАЊУ, (2) да ли се повећање убрзава, (3) означите 3 најризичнија диска по хитности. Погледајте тренд, а не само читање. Имајте на уму да је ово упозорење о могућности и одлука је моја. Подаци: [...]

2) Одређивање приоритета истека сертификата/лиценце:

Испод је маскирана листа сертификата/лиценци и датума њиховог истека. Данас је [датум]. Наведите ми ствари које ће бити завршене у наредних 60 дана, по хитности (преостали дани); Напишите процењени ниво приоритета освежавања за сваки. Ако постоји нешто што је истекло пре данас, ставите то на врх. Листа: [...]

3) Процена тренда стопе грешака:

Испод је опис компоненте [нпр. меморија/мрежа] има бројач грешака за последња 3 месеца. Да ли је ово прави тренд погоршања или изолована бука? (1) да ли се вредност повећава, (2) да ли је доследна/убрзава или раштркана, (3) да ли је ваша препорука „гледајте” или „планирана промена”? ја ћу одлучити; Дајете образложену процену. Подаци: [...]

4) Пројекција хабања завара:

Испод [извор, нпр. Доступни су подаци о тренду трајања писања на ССД / заузетости диска. При тренутној стопи, када ће бити достигнут критични праг (%[Кс]%)? Предвидите оптимистични и песимистички распон, запишите своју претпоставку. Ако је време испоруке делова [И] дана, када треба да предузмем мере? Подаци: [временска серија]

Слаби промпт / Јаки промпт

Слабо обавештење:

Хоће ли овај диск отказати? [један СМАРТ излаз]

Једно очитавање снимка не показује тренд. АИ или каже празно „можда“ или гледа једну вредност и претпоставља да ће претерано реаговати.

Снажан упит:

Ваша улога: стручњак за поузданост складиштења. Испод су последњих 8 недеља седмичних СМАРТ снимака диска (маскираног): број прераспоређених сектора и тренутни сектор на чекању. Дајте ми (1) недељни тренд ове две вредности, (2) ако постоји повећање, да ли се убрзава, (3) ако је моја тренутна редундантност 1 толеранција диска са РАИД-ом, дајте ми образложену процену да ли треба да заменим овај диск планирано или хитно. На мени је. Подаци: [8-недељна серија]

Врста одржавања

Када треба интервенисати

Цост

Допринос АИ

реактиван

Када дође до квара

Највећи (одбитак)

Ограничено, после догађаја

превентивно

Са фиксним календаром

Средње (рано/касно)

Оптимизација календара

предиктивни

На рани сигнал

Минимум (планиран)

Тренд и рано упозорење

Уобичајене грешке

  • Реаговање на појединачно читање. Лоша СМАРТ вредност није разлог за панику; Сигнал је тренд, а не једна тачка.
  • Занемаривање календара сертификације. Најпредвидљивији поремећај је сертификат који је истекао; Пропуштање је неопростиво.
  • Погрешка вероватноћа за извесност. „Ризик од неуспеха расте“ се разликује од „неће успети“; донети одлуку уз вишак и трошак.
  • Заборављам време испоруке делова. Видети рано упозорење и не узети у обзир период испоруке резервних делова поново ће довести до прекида.
  • Трошење буџета на буку. Реаговање на изоловану грешку без ескалације заменом хардвера је непотребан трошак.
Опрез: предвиђање неуспеха АИ засновано је на прошлим обрасцима; Изненадна грешка у производњи, напон струје или смрт у вези са софтвером искључени су из ових образаца. Предиктивно одржавање смањује ризик, а не ресетује га; резервна копија и редундантност су увек прва линија одбране.

Укратко

Предиктивно одржавање је уочавање раних знакова квара пре него што се то деси и интервенција на време – спасавајући вас од стреса реактивног одржавања и губитка превентивног одржавања. АИ је моћна у означавању подмуклих трендова у СМАРТ подацима, приближавајући се истеку сертификата, повећавајући стопу грешака. Али погледајте тренд, а не само читање; Не узимајте вероватноћу као извесност; Узмите у обзир време испоруке делова и ваш вишак. АИ производи рано упозорење; Замена делова, план застоја и одлука о буџету су на вама да одмерите ризик и трошкове. И запамтите: предиктивно одржавање допуњује резервну копију, а не замењује је.

Задатак апликације

Започните са најједноставнијим потезом предиктивног одржавања: наведите датуме истека свих сертификата (или лиценци) у вашим системима, маскирајте их и дајте приоритет онима који истичу у року од 60 дана помоћу шаблона „Приоритет истицања сертификата/лиценце“ изнад. Затим, ако имате приступ, прикупите податке СМАРТ тренда за неколико дискова и погледајте да ли постоји повећање помоћу шаблона „СМАРТ/хардверска анализа тренда“. Запишите своје налазе и планиране радње које ћете предузети (обнављање, праћење, промена) у 6 ставки; За сваки наведите образложење своје одлуке.

контролна листа

  • [ ] Да ли сам уклонио датуме истека сертификата и лиценци и дао приоритет онима који долазе?
  • [ ] Да ли гледам тренд временске серије у хардверским сигналима, а не једно очитавање?
  • [ ] Зар нисам узео „ризик од неуспеха“ излаз вештачке интелигенције као вероватноћу и погрешно га сматрао извесношћу?
  • [ ] Да ли сам узео у обзир мој вишак и време испоруке делова у одлуци о замени?
  • [ ] Да ли сам избегао реакцију на изоловану буку непотребном заменом хардвера?
  • [ ] Да ли сам позиционирао предиктивно одржавање као допуну, а не замену за резервну копију и редундантност?