Јединице
1. Увод у вештачку интелигенцију у управљању системом и мрежом: улоге, границе, аутентификација и овлашћења 2. Скрипте за аутоматизацију: безбедно генерисање Басх-а, ПоверСхелл-а и Питхон-а 3. Анализа дневника и анализа основног узрока: Проналажење сигнала у шуму 4. Праћење капацитета и учинка: читање метрика и планирање за будућност 5. Управљање конфигурацијом: генерисање конфигурације, провера ваљаности и снимање одступања 6. Управљање инфраструктуром као код (ИаЦ): Терраформ, Ансибле и План Цонтрол 7. Управљање документацијом и информацијама: Рунбоок, пост мортем и корпоративно памћење 8. Предвиђено одржавање: уочавање кварова пре него што се догоде 9. Управљање променама: процена ризика, враћање уназад и прозор за одржавање 10. Безбедност и одбрана: коришћење вештачке интелигенције у одбрамбене сврхе иу границама овлашћења 11. Интеграција од краја до краја: Управљање инцидентом од почетка до краја
Јединица 11 / 11

Интеграција од краја до краја: Управљање инцидентом од почетка до краја

Добици:

  • Управљање инцидентом од краја до краја уз подршку вештачке интелигенције у фазама откривања, дијагностике, ублажавања, трајног решења и учења
  • Способност одржавања дисциплине верификације чак и у временима панике одвајањем корака који се могу пренети на вештачку интелигенцију и оних који захтевају људску одлуку у свакој фази.
  • Способност да се златно правило да вештачка интелигенција има предност над питањима „шта се дешава, како писати“ и да људи имају приоритет над питањима „да ли то треба да радим, ко је гарант“ претвори у пословни рефлекс

Интеграција од краја до краја: Управљање инцидентом од краја до краја помоћу вештачке интелигенције

Научили сте делове у претходних десет јединица: скриптовање, анализа дневника, надгледање, конфигурација, ИаЦ, документација, предиктивно одржавање, управљање променама и безбедност. Али у стварном свету, ови делови не долазе један по један, већ се преплићу унутар догађаја. У овој последњој јединици спајамо делове: видећете у целини како да управљате инцидентом који је почео усред ноћи, од краја до краја, од откривања до основног узрока, од санације до документације, и користећи праву дозу вештачке интелигенције у свакој фази. Циљ није да се научи нова техника; повезујући оно што сте научили као рефлекс инжењера, појачавајући једну истину која се понавља кроз модул: АИ убрзава, осветљава и црта у свакој фази; али увек је човек тај који потврђује дијагнозу, руководи командом, потврђује промену и сноси одговорност за исход.

У овој јединици ћете кроз пример интегрисати животни циклус инцидента – откривање, дијагноза, интервенција, решавање, учење – и улогу и ограничења АИ у свакој фази.

Животни циклус догађаја

Сваки озбиљан инцидент пролази кроз сличне фазе, а АИ има различиту улогу у свакој фази. Детекција: огласи се аларм, корисник се жали, метрика одступа од основне линије (Јединица 4). Валидација и обим: да ли је то заиста проблем, колико је широк? Дијагноза: доћи до основног узрока из евиденције и метрике (Јединица 3). Одговор и ублажавање: заустављање штете, заобилазно решење. Трајно решење: поправка са управљањем променама (Целина 9), скриптом (Целина 2) или конфигурацијом ако је потребно (Целина 5). Учење: пост мортем и ажурирање рунбоок-а (Наставна јединица 7). АИ обележава аномалију у откривању, производи хипотезе у дијагнози, нуди опције за интервенцију, пише нацрте решења, производи документе у учењу - али у свакој фази, људи стоје на месту одлучивања.

Савет: Најопаснији тренутак инцидента је тренутак дијагнозе и реаговања када је стрес највећи — управо када је порив да се слепо верује АИ најјача. Што више журите, чвршће се држите рефлекса „прочитајте, проверите, припремите се за повратак“. Једна верификација прескочена у тренутку панике удвостручује догађај.

Пример од почетка до краја

Хајде да га конкретизујемо. Аларм у 02:10: време одговора услуге плаћања п99 је 6 секунди, знатно изнад основне линије (250–400 мс). Тачна детекција: праћење је успело. Потврда: потврда са више локација, стварни догађај. Дијагностика: инжењер даје маскирани дневник и метрику последњих 20 минута АИ; АИ успоставља временску линију и означава успоравање као почетак одмах након постављања у 02:08 — јака корелација, али и даље хипотеза. Инжењер то потврђује са евиденцијом примене: да, издање је објављено у 02:08. Одговор: најбрже смањење је враћање дистрибуције; Корак враћања назад у захтеву за промену је спреман (Јединица 9). Инжењер прво имплементира враћање на сервер са канаринском логиком, време одзива се побољшава, а затим га пропагира. Трајно решење: прави основни узрок (неиндексирани упит у новој верзији) биће мирно отклоњен следећег дана. Учење: Направљен је пост мортем без вештачке интелигенције и корак „надгледање п99 после имплементације“ је додат у приручник. У свакој фази, АИ се убрзавао; људски потврђен у свакој тачки одлучивања.

Златно правило људске и АИ поделе рада

Разлика коју видите у целом модулу овде постаје правило: АИ је испред у питањима „шта се дешава, шта може да се деси, како писати“; Људи предњаче када су у питању питања као што су "да ли треба да урадим ово сада, ко може да гарантује за ово?" АИ је неуморан, брз, скенира огромне информације и генерише нацрте – али не познаје пун контекст, може да произведе халуцинације, не може да се носи са одговорношћу и не види скривене зависности ваше организације. Човек је спор, али носи контекст, одговорност и расуђивање. Најбољи исход је у правилној подели рада између то двоје: делегирати репетитивни, текстуални, продуктивни рад АИ; Задржите верификацију, одлуку и извршење људским.

три мини кофера

Случај 1 — 40 минута од краја до краја. У случају пуног диска, СРЕ је убрзао цео ланац помоћу АИ: потврдио је аларм са основном линијом (5 мин), дао је маскирани дневник сумиран на ИЗ и пронашао прву грешку (5 мин), потврдио хипотезу АИ о „заустављеној ротацији дневника“ на стварном систему (5 мин), покренуо и имплементирао готову скрипту за чишћење са мин-м. чињенице (15 мин). Укупно 40 минута; Отприлике дупло више без АИ. Али постојао је корак верификације у свакој фази.

Случај 2 — Прескочена верификација у тренутку панике. Други тим је пожурио са резом. Прихватио је прву хипотезу основног узрока АИ (услуга зависности) без верификације и поново покренуо ту услугу. Проблем није решен јер је прави узрок био нешто друго; Штавише, непотребно поновно покретање је довело до другог прекида рада. Поука: журба није оправдање за прескакање верификације; Пре него што се АИ хипотеза потврди, акција ескалира догађај.

Случај 3 — Бити свестан ограничења. Инжењер се спремао да примени промену конфигурације коју је АИ захтевао у вези са сложеним мрежним проблемом. Али промена је изгледала неповратна, а вештачка интелигенција није познавала специфична правила рутирања агенције. Инжењер је стао, консултовао се са вишим стручњаком за мрежу и сазнао да ће предлог вештачке интелигенције створити петљу за рутирање у овој конкретној топологији. Познавање ограничења АИ спречило је поремећај.

Четири шаблона за копирање

1) Резиме покретача догађаја (тријажа):

Ваша улога: виши СРЕ, помоћник команданта инцидента. Постоји активан догађај. Маскирана упозорење/метрика/лог који вам дајем даје ми брзу тријажу: (1) који је симптом, (2) који је обим утицаја, (3) 3 области које треба прво погледати, (4) контролну команду само за читање за сваку. Одлука и извршење су моји; Пошаљи пут. Подаци: [маскиран]

2) Водич за управљање инцидентима по фазама:

Водите ме корак по корак кроз животни циклус инцидента за симптом [симптом]: потврда детекције, дијагноза, ублажавање, трајно решавање, учење. У СВАКОЈ фази, реците ми (а) шта треба да урадим, (б) када то могу безбедно да пренесем на АИ, (ц) коју одлуку МОРАМ да донесем сам. Означите кораке верификације које не би требало да прескочим чак и ако журим.

3) Контрола тачке одлучивања:

Усред сам догађаја и спремам се да предузмем следећу радњу: [акција]. Пре имплементације, питајте ме: (1) да ли је ово реверзибилно, (2) коју верификацију сам урадио/нисам урадио, (3) да ли имам план враћања, (4) да ли имам доказ да је ова радња заиста решила основни узрок? Ако видите да нешто недостаје, зауставите ме.

4) Интегрисано учење након догађаја:

За инцидент који је управо решен, [сажетак] ми даје: (1) нацрт обдукције без кривице, (2) 3 трајна побољшања (надгледање/аутоматизација/конфигурација) која ће спречити овај инцидент, (3) кораке приручника који треба да се ажурирају, (4) предлог за рано упозорење за сличан инцидент. Писање основног узрока без доказа; на основу чињеница.

Слаби промпт / Јаки промпт

Слабо обавештење:

Систем се срушио, шта да радим?

Успаничено, без контекста и без провере, овај упит добија генеричке и можда опасне савете од вештачке интелигенције. Журба у овом тренутку највише доводи до грешака.

Снажан упит:

Ваша улога: помоћник команданта инцидента. Активан догађај: паи сервицеип99 време одговора 15 пута основно (250-400 мс) од 02:10. Знам да је била дистрибуција у 02:08. Дајте ми: (1) највероватнију хипотезу и како да је проверим САМО ЗА ЧИТАЊЕ, (2) најбржу и РЕВЕРЗИБИЛНУ опцију ублажавања, (3) ризике које морам да контролишем пре него што применим ово ублажавање. Имам извршење и одобрење. Додатни подаци: [маскирани показатељ/дневник]

фаза догађаја

Улога АИ

Критична људска одлука

детекција

Означите аномалију

Да ли је то стварни догађај, који је обим?

Дијагноза

генерисање хипотеза

Која хипотеза је потврђена?

смањење

Не нудите опције

Које смањење је реверзибилно?

трајно решење

Нацрт/скрипта

Одобрите и извршите промену

Учење

Обдукцијска скица

Потврђивање чињеница и поука

Уобичајене грешке

  • Прескакање верификације у паници. Журба није оправдање за напуштање рефлекса „читај-вери-припреми повратак“; Како се стрес повећава, дисциплина се мора повећати.
  • Погрешка хипотеза за доказ. Предузимање акције без потврђивања прве сугестије основног узрока АИ ће ескалирати инцидент.
  • Заборављајући границе контекста АИ. АИ не познаје скривене зависности организације; У критичним променама, људски суд преовладава.
  • Прескакање фазе учења. Догађај, без обдукције и ажурирања рунбоока, почиње поново исте ноћи.
  • Стављање одговорности на АИ. „АИ је тако рекао“ није одбрана; Одговорност за извршење увек лежи на људском бићу.
Опрез: Коришћење вештачке интелигенције у управљању инцидентима не замењује учење управљања инцидентима. Возило се може срушити, срушити или бити неприступачно. Инжењер који зна основе је бржи са АИ; Инжењер који не зна основе брже ће правити грешке са АИ. Прво успоставите дисциплину, а затим остварите брзину од АИ.

Укратко

У стварном свету, делови не долазе један по један, већ се преплићу унутар догађаја. Када управља догађајем од откривања до учења, АИ убрзава у свакој фази: означава аномалију, генерише хипотезе, нуди опције, нацрта, припрема пост мортем. Али у свакој тачки одлуке човек се зауставља — потврђује дијагнозу, бира смањење, одобрава промену, поседује исход. Златно правило је јасно: АИ је испред у питањима „шта се дешава, како писати“, а људи испред у питањима „да ли то треба да урадим, ко је гарант?“ У временима панике, повећајте дисциплину, одвојите хипотезу од доказа, запамтите ограничење контекста вештачке интелигенције и извуците лекцију из сваког догађаја. Суштина овог модула је једна реченица: АИ је моћан асистент; Инжењерска одговорност се не може делегирати.

Задатак апликације

Размислите о догађају који сте доживели (или замишљали) у својој прошлости, од почетка до краја. Уз горњи шаблон „Водич за управљање инцидентима у фазама“, замолите АИ да води инцидент кроз фазе откривања-дијагнозе-ублажавања-решавања-учења; У свакој фази посебно напишите корак који можете делегирати АИ-у и корак који морате сами да одлучите. Потврдите најмање једну хипотезу АИ командом за верификацију током фазе дијагнозе. На крају, направите нацрт ажурирања обдукције и рунбоок-а са шаблоном „Интегрисано учење после догађаја“. Сумирајте поделу рада човек-АИ у целом процесу у 7 ставки.

контролна листа

  • [ ] Да ли сам поделио инцидент на фазе откривања, дијагнозе, ублажавања, решавања и учења?
  • [ ] Да ли сам направио разлику између корака који се могу пренети на АИ и оних који захтевају људско доношење одлука у свакој фази?
  • [ ] Да ли сам у дијагнози одвојио АИ хипотезу од доказа и потврдио је командом за верификацију?
  • [ ] Да ли сам проценио ублажавање у смислу реверзибилности и плана повлачења?
  • [ ] Да ли сам задржао рефлекс „читај-верификуј-припреми повратак“ чак и у временима панике?
  • [ ] Да ли сам из овог инцидента научио лекцију о обдукцији и обради података?

Модул Екам

1. Шта је од следећег најтачније позиционирање вештачке интелигенције у управљању системом и мрежом?

  • А) Вештачка интелигенција је помоћник и алат за подршку одлучивању; Одговорност и коначно одобравање критичних одлука извршне власти лежи на људима ✔
  • Б) Вештачка интелигенција може да покреће команде и спроводи промене у производњи без људског одобрења
  • В) Вештачка интелигенција функционише само у писању текста, нема везе са радом система и мреже
  • Д) Вештачка интелигенција увек доноси тачније одлуке од људи, тако да провера није потребна

Опис: Вештачка интелигенција је помоћник и алат за подршку одлучивању који производи нацрте и анализе као што су скрипте, анализе дневника и документи. Одговорност и коначно одобрење извршних одлука које утичу на застоје, губитак података и безбедност, као што је извршење команде или одобравање промене, припада надлежном инжењеру.

2. Која су четири корака рефлекса верификације који се морају имплементирати пре покретања команде коју генерише вештачка интелигенција у производњи?

  • А) Копирајте, налепите, покрените, надајте се
  • Б) Прочитајте и разумејте, документујте, покушајте у изолованом окружењу, припремите се за повратне информације ✔
  • В) Лајкујте, поделите, сачувајте, архивирајте
  • Д) Избришите, препишите, компримујте, пошаљите

Опис: Четири корака за примену на критични излаз: (1) прочитајте и разумејте командну линију по ред, (2) повежите заставице и синтаксу са званичном документацијом, (3) покушајте у изолованом/тестном окружењу, покрените на суво ако је могуће, (4) припремите резервни план (резервна копија, снимак) ако пође по злу.

3. Шта значи да скрипта за аутоматизацију буде 'идемпотентна' и зашто је то важно?

  • А) Скрипта даје различите резултате у сваком покретању
  • Б) Скрипта се може покренути само једном, а затим бити избрисана
  • Ц) Скрипта не узрокује никакву штету када се покрене други пут; ✔ Сигурно чак и ако се поново активира
  • Д) Скрипта не садржи управљање грешкама

Објашњење: Идемпотенција значи да када се иста скрипта покрене два или више пута, она не узрокује штету нити производи грешке при другом покретању. Успостављена је логика као што је 'прескочи ако корисник већ постоји', 'креирај директоријум ако не постоји, не дирај ако постоји'. Ово осигурава да аутоматизација ради безбедно чак и ако се случајно поново активира.

4. Који је најосновнији начин да се обезбеди скрипта која садржи деструктивне операције (брисање, поновно покретање)?

  • А) Покрените скрипту што је брже могуће
  • Б) Сакривање порука о грешци
  • Ц) Тестирање скрипте директно у продукцији
  • Д) Стављање деструктивних операција иза подразумеваног рада на суво и везивање стварне имплементације за експлицитну ознаку за означавање ✔

Објашњење: Одржавање деструктивних процеса у режиму рада на суво по подразумеваној вредности и само покретање стварне апликације са експлицитном заставицом одобрења (нпр. --аппли) омогућава вам да прво видите шта ће се догодити када се скрипта покрене. Такође провера нулте променљиве (ВАР:?) спречава грешке путање.

5. Шта у анализи дневника значи принцип 'корелација није узрочна веза'?

  • А) Два догађаја која се мењају заједно нису нужно у узрочно-последичној вези; Узрочност се такође мора потврдити ✔
  • Б) Тражење корелације у евиденцији је губљење времена
  • Ц) Од два догађаја који се мењају заједно, један је дефинитивно узрок другог.
  • Д) Узрочност се може утврдити само помоћу вештачке интелигенције

Објашњење: Само зато што се два догађаја дешавају у исто време (корелација) не значи да један изазива други (узрочност); Оба могу бити резултат трећег догађаја. Сугестија вештачке интелигенције да је „Кс вероватно изазвао И“ је хипотеза и не сматра се налазом док се не потврди у систему.

6. Зашто је перцентил (п95/п99) пожељнији у односу на просек када се мери време одговора у праћењу перформанси?

  • А) Перцентил је лакше израчунати него просек
  • Б) Просек крије лоше искуство мањине; перцентил открива ове скривене проблеме ✔
  • Ц) Просек је увек погрешан и не треба га користити
  • Д) Перцентил се односи само на ЦПУ метрике

Објашњење: Просек скрива веома лоше искуство које има мали део корисника. Иако се чини да је просек 200 мс, п99 може бити 6 секунди; То значи да је један од сваких сто захтева ужасно спор. Перцентил чини видљивим бол ове мањине коју крије просек.

7. Шта је 'дрифт' у управљању конфигурацијом и зашто је опасно?

  • А) Мрежни саобраћај опада ноћу
  • Б) Физичко измештање сервера
  • Ц) Сервери одступају један од другог и стандарда током времена; ✔ Невидљив док се не појави проблем
  • Д) Аутоматска резервна копија конфигурационих датотека

Опис: Дрифт је одступање сервера један од другог и од стандарда кроз недокументоване ручне промене током времена. Његова опасност је тишина: није видљив док се проблем не појави, тада се један сервер понаша другачије од других и дијагноза траје сатима. АИ чини дрифт видљивим у поређењу; Принцип заваривања злата спречава.

8. Зашто је корак „план“ најважнија безбедносна ограда у ИаЦ алатима (као што је Терраформ)?

  • А) План покреће код брже
  • Б) Брише датотеку стања плана
  • Ц) План само поправља форматирање кода
  • Д) План показује шта ће се додати, променити и БРИСАТИ пре имплементације; Спречава губитак података ✔

Опис: План (терраформ план / ансибле --цхецк) даје преглед 'шта ће се променити' пре извршавања кода: колико ресурса ће бити додато, промењено, избрисано. Конкретно, линије 'уништити' и 'присилити замену' указују на ризик од губитка података пре имплементације. Пријављивање без читања плана једна је од најскупљих грешака.

9. Зашто би Терраформ државну датотеку требало пажљиво заштитити и не лепити у АИ или отворена спремишта?

  • А) Тајне обичних текстова могу бити укључене у државни фајл; Ако процуре, подаци о идентитету ће бити откривени ✔
  • Б) Зато што је датотека стања превелика
  • Ц) Датотека стања је већ нечитљиво шифрована.
  • Д) Код ради брже када се дели датотека стања

Опис: Датотека стања чува тренутно стање управљане инфраструктуре и може укључивати тајне у облику обичног текста (лозинке базе података, кључеве). Због тога га треба чувати у шифрованом, закључаном удаљеном позадину са ограниченим приступом; Никада га не треба стављати у јавно возило или спремиште, иначе ће тајна процурити.

10. Шта у документацији наглашава изјава „погрешан рунбоок је опаснији од непостојања рунбоока“?

  • А) Писање приручника је губљење времена
  • Б) Нетестирани рунбоок се слепо примењује у кризи; Један погрешан корак може довести до катастрофе ✔
  • Ц) Рунбоокс су написани само за администраторе
  • Д) Документацију никада не треба ажурирати

Објашњење: Тим без рунбоока је опрезан и сумњичав током кризе; али особа са 'званичним' рунбоок-ом га примењује под стресом без питања. Ако рунбоок није тестиран и има један корак погрешно, слепа примена ће довести до катастрофе. Зато сваки рунбоок мора бити темељно тестиран и печатиран у стварном окружењу.

11. У предиктивном одржавању, који је исправан приступ да се разуме када се диск приближава отказу?

  • А) Одмах замените један лош СМАРТ диск
  • Б) Потпуно игнорисање СМАРТ података
  • Ц) Гледање тренда вредности током времена; ✔ Конзистентно и убрзано повећавање броја сигнала
  • Д) Предузимање радњи тек након што се диск потпуно сруши

Објашњење: Једно лоше СМАРТ очитавање није разлог за панику; Нормално је да се на дисковима повремено исправљају грешке. Прави сигнал је тренд: доследно и убрзано повећање вредности као што је прерасподели сектор током времена. Зато АИ добија временску серију, а не једно очитавање.

12. Која су два најчешће занемарена, али критична дела промене производње?

  • А) Боја и назив промене
  • Б) Звање и одељење особе која врши промену
  • Ц) Најава промене на друштвеним мрежама
  • Д) План враћања и критеријуми верификације успеха ✔

Објашњење: Ако нема писменог одговора на питања 'како тачно да вратим ако се поквари' (план враћања) и 'како да докажем да је успешан' (критеријуми за верификацију успеха) пре него што се промена примени, та промена још није спремна. Без ова два, покварена промена се може сматрати „потпуном“.

13. Зашто је пожељнији приступ „канаринцу“ него увођење безбедносне имплементације (нова верзија/закрпа) на све сервере у исто време?

  • А) Промена се прво примењује на мали део; Грешка погађа мали део, а не целу флоту, и рано је ухваћена ✔
  • Б) Канарска дистрибуција троши мање електричне енергије
  • Ц) Цанари чини верификацију примене потпуно непотребном
  • Д) Цанари имплементација се примењује само на базе података

Опис: Цанари имплементација прво примењује промену на мали део (један сервер, 5% корисника) и надгледа. На овај начин, буба утиче на мали део, а не на целу флоту, и рано је ухваћена. Грешка која се шири одједном погађа све кориснике у исто време.

14. Које је непроменљиво етичко и правно правило при употреби вештачке интелигенције у пословима обезбеђења?

  • А) Вештачка интелигенција се може слободно користити за скенирање рањивости у било ком систему
  • Б) Етички кодекс се односи само на велике институције
  • Ц) Користи се само у овлашћеним системима иу сврхе одбране; Коришћење за неовлашћени приступ или напад је кривично дело ✔
  • Д) Слободно је инфилтрирати се у туђи систем да би учио.

Опис: Системске и мрежне информације су двоструке употребе. Вештачка интелигенција се може користити само у системима за које имате писмено овлашћење иу одбрамбене сврхе (откривање претњи у евиденцији, учвршћивање, реаговање на инциденте). Коришћење за скенирање или инфилтрирање у систем који вам не припада је неовлашћени приступ и злочин; За учење се мора користити изолована лабораторија.