одиниці
1. Вступ до штучного інтелекту в управлінні системою та мережею: ролі, межі, автентифікація та повноваження 2. Скрипти автоматизації: безпечне створення Bash, PowerShell і Python 3. Аналіз журналу та аналіз першопричини: пошук сигналу в шумі 4. Моніторинг потужності та продуктивності: читання показників і планування на майбутнє 5. Керування конфігурацією: генерація конфігурації, перевірка та фіксація дрейфу 6. Управління інфраструктурою як код (IaC): Terraform, Ansible і Plan Control 7. Управління документацією та інформацією: Runbook, Post-mortem і корпоративна пам’ять 8. Прогнозне технічне обслуговування: бачення несправностей до того, як вони виникнуть 9. Управління змінами: оцінка ризиків, відкат і вікно обслуговування 10. Безпека та оборона: використання штучного інтелекту в цілях оборони та в межах повноважень 11. Наскрізна інтеграція: керування інцидентом від початку до кінця
одиниця 3 / 11

Аналіз журналу та аналіз першопричини: пошук сигналу в шумі

Прибуток:

  • Швидко знаходите сигнал серед шуму за допомогою штучного інтелекту для узагальнення, групування та журналів часової шкали
  • Здатність відокремлювати кореляцію та причинно-наслідковий зв’язок і розглядати пропозиції штучного інтелекту про першопричину як гіпотези, які потрібно перевірити
  • Можливість дістатися до справжньої першопричини, застосовуючи метод «5 чому» за допомогою штучного інтелекту та підкріплюючи кожен крок реальними доказами

Аналіз журналу та аналіз першопричини: пошук сигналу в шумі за допомогою ШІ

Коли система виходить з ладу, перше місце, куди ви дивитеся, це журнали. Журнал — це текстовий потік, у якому зберігається запис із позначкою часу «що я зробив, що сталося, що зламалося» системи чи програми. Але сучасна інфраструктура виробляє мільйони рядків журналів на годину; це не море інформації, а часто океан шуму. Аналіз журналу — це мистецтво пошуку важливого сигналу (помилка, відхилення від норми, шаблон) у цьому шумі. Процес відповіді на запитання «що було справжньою причиною» після події називається аналізом першопричини (RCA — Root Cause Analysis). Тут штучний інтелект є дуже потужним у підсумовуванні тисяч рядків на секунду, вилученні шаблонів, встановленні часових шкал і переліку можливих причин. Але слово застереження: ШІ створює можливі причини; Ви той, хто перевіряє в системі, який з них справжній, і приймає рішення.

У цьому розділі ви дізнаєтесь, як впевнено підсумовувати журнали за допомогою штучного інтелекту, як встановити часову шкалу події, як відрізнити кореляцію (змінюється разом) і причинно-наслідковий зв’язок (одне викликає інше), а також як запустити метод RCA, наприклад «5 чому» за допомогою штучного інтелекту.

Чому кореляція не є причинно-наслідковим зв’язком?

Це найбільш критична концепція цього блоку. Просто тому, що дві події відбуваються одночасно, одна не викликає іншу. ЦП сервера та мережевий трафік можуть збільшуватися одночасно; але один не є результатом іншого, обидва можуть бути результатом третьої події (наприклад, початок пакетного завдання). Коли штучний інтелект бачить, що показники змінюються разом, він висуває гіпотезу, «ймовірно, X спричинив Y». Це відправна точка, а не висновок. Щоб перевірити причинність, вам потрібно або виділити змінну (запустити X у тестовому середовищі та перевірити, чи відбудеться Y), або підтвердити механізм (показати технічні засоби, за допомогою яких X створює Y).

Застереження: сприймайте речення штучного інтелекту «це, ймовірно, спричинило це» як гіпотезу, а не як висновок. У RCA неправильна першопричина призводить до неправильної корекції та повторення події. Ви знайшли першого підозрюваного, а не причину; Робота починається там.

Крок за кроком: аналіз журналів за допомогою ШІ

  1. Звужуйте рамки. Надайте вікно події, а не весь журнал: «подія почалася о 14:05, критична з 14:00–14:20». Повідомте AI відповідний часовий проміжок і послугу.
  2. Маска. Журнали містять внутрішню IP-адресу, ім’я хоста, користувача та маркер. Замаскуйте їх (10.x.x.x, host-A, user1, ВИДАЛЕНО), а потім експортуйте.
  3. Зведення та групування запитів. «Згрупуйте цей журнал за серйозністю, підрахуйте повторювані помилки, знайдіть мітку часу першої помилки». Запитуйте структуру, а не необроблену колоду.
  4. Налаштуйте часову шкалу. «Розташуйте ці події за часом і покажіть, що слідує за чим». Знайти першу доміно - це шлях до першопричини.
  5. Запитуйте гіпотези, а не докази. «Перелічіть можливі першопричини в порядку ймовірності та дайте мені команду перевірки для запуску в системі для кожної». Питайте діагноз, а не результат.
  6. Перевірити в системі. Перевірте кожну гіпотезу за допомогою діагностичних команд лише для читання (log grep, запит статусу, метрика). Усувайте, поки не буде лише одна підтверджена основна причина.

5 Чому метод

Класичним і потужним інструментом RCA є «5 чому»: починаючи з одного симптому та запитуючи «чому?» п'ять разів. Запитавши, ви дістанетеся до першопричини під поверхневим симптомом. Приклад: "Сайт дав збій. Чому? Програма припинила роботу, тому що їй не вистачило пам’яті. Чому? Запит поглинув всю пам’ять. Чому? Запит не використовував індекс. Чому? Індекс було видалено в останньому випуску. Чому? Це не було помічено під час перегляду змін." Основною причиною є не поверхневий «збій сайту», а «слабкий процес перегляду змін». Штучний інтелект був би хорошим партнером у побудові цього ланцюжка, але ви повинні підтверджувати кожен крок «чому» реальними доказами, інакше ШІ може створити правдоподібний, але хибний ланцюжок.

три міні-чохла

Кейс 1 — 40 000 рядків, 3 хвилини. Адміністратор почав вручну сканувати 40 000 рядків журналів програми під час нічного збою. Він передав ШІ відповідну 20-хвилинну частину замаскованого журналу та попросив підсумок і групування. AI позначив першу помилку OutOfMemory о 02:14, одразу після помилок збільшення часу очікування. Інженер отримав табель за 3 хвилини; підтвердив початковий діагноз на власній метричній панелі.

Випадок 2 — повернення з неправильної першопричини. Команда вважала, що перша гіпотеза штучного інтелекту («журнали заповнили диск») була правильною, і видалила журнали. Але наступного дня інцидент повторився. У другому раунді вони реалізували «5 чому» з дисципліною: справжня причина полягала в тому, що помилка програми створювала сотні дампів ядра за секунду. Першою гіпотезою була кореляція; Справжня причина була в іншому. Прийняття без перевірки забезпечувало лише одноденну відстрочку.

Випадок 3 — Хронологія знайшла винуватця. Були журнали десятків пристроїв під час періодичного збою мережі. Інженер передав замасковані журнали штучному інтелекту та змусив його створити єдину часову шкалу. Діаграма показала, що кожен збій починався рівно через 30 секунд після повідомлення перевірки працездатності резервного перемикача. Ця кореляція була сильною підказкою; Команда перевірила помилку прошивки ключа на пристрої та замінила його.

Чотири шаблони, які можна копіювати

1) Зведення та групування журналу:

Нижче наведено замаскований журнал для [послуги] з 14:00 до 14:20. Скажіть мені: (1) згрупуйте та підрахуйте рядки за ступенем серйозності (ПОМИЛКА/ПОПЕРЕДЖЕННЯ/ІНФО), (2) перелічіть 5 найпоширеніших шаблонів помилок, (3) знайдіть мітку часу першої ПОМИЛКИ. Не переписуйте необроблений журнал, просто надайте структуроване резюме. Додавання створеного рядка. Журнал: [замаскований журнал]

2) Налаштування шкали часу:

Ми впорядкували наступні замасковані записи подій на одній часовій шкалі (мітка часу + джерело + подія). Покажіть, що слідує за чим, і позначте подію, яка, здається, є першим тригером. Зауважте, що це ГІПОТЕЗА, і причинно-наслідковий зв’язок потрібно перевірити. Записи: [замасковані записи]

3) 5 причин, партнер RCA:

Ваша роль: фасилітатор RCA. Симптом: [симптом]. Виконайте зі мною «5 чому»: «чому?» на кожному кроці. Запитайте, я відповім тими доказами, які у мене є, ви задайте наступне запитання. Якщо мої докази слабкі, попередьте мене та скажіть, які дані мені потрібно зібрати. Не оголошуйте першопричину без доказів.

4) Гіпотеза + команда перевірки:

Перелічіть можливі основні причини цього симптому [симптому] в порядку ймовірності. Для кожної причини: (а) що ви підозрюєте, (б) дайте мені команду перевірки ЛИШЕ ЧИТАННЯ для виконання в моїй системі (без видалення/зміни). Поясніть, який результат підтверджує або спростовує гіпотезу.

Слабка підказка / Сильна підказка

Слабка підказка:

Що не так з цим журналом? [10 000 рядків необробленого журналу]

Ця підказка розкриває витік конфіденційних даних і залишає штучний інтелект без контексту. ШІ може натрапити на випадковий рядок і надати поверхневу або навіть вигадану причину.

Потужна підказка:

Ваша роль: старший SRE. Подія: платіжний сервіс дав помилку 50% між 02:10-02:25. Нижче наведено замаскований журнал цього вікна. Дайте мені (1) зведення, згруповане за серйозністю, (2) мітку часу першої помилки, (3) можливі першопричини в порядку ймовірності та команду перевірки лише для читання для кожної. Позначте твердження про причинність як гіпотези. Журнал: [замаскований журнал]

крок

призначення

Роль ШІ

чоловіча роль

Підсумок/групування

зменшити шум

Налаштування тисяч рядків

Визначте область і маску

шкала часу

Знайти перше доміно

сортування подій

Перевірка штампів

генерація гіпотез

сортування підозрюваних

перерахувати можливості

фільтрувати за контекстом

перевірка

знайти справжню причину

Запропонувати діагностичну команду

Виконайте команду та прокоментуйте її

рішення

Вибір виправити

пропонувати варіанти

Прийміть рішення та підтвердьте

Поширені помилки

  • Помилково приймаючи кореляцію за причинно-наслідковий зв’язок. Прийняття двох показників, які змінюються разом як «один викликав інший», призводить до хибного виправлення.
  • Вклеювання необробленого журналу без маски. Передача журналу, що містить IP, маркер і користувача, відкритому інструменту є порушенням безпеки.
  • Оголошення першої гіпотези першопричиною. Прийняття першої пропозиції штучного інтелекту без її перевірки є запрошенням для повторення події.
  • Експортування всього журналу. Величезний журнал без контексту підключає ШІ до випадкової лінії; Згорнути до вікна події.
  • 5 причин без доказів. Якщо ви не підтвердите кожен крок «чому» реальними даними, ви отримаєте правдоподібний, але вигаданий ланцюжок.
Порада: перш ніж завершити RCA, запитайте: "Якщо цю першопричину справді виправлено, чи це не повториться?" Задайте питання. Якщо відповідь «можливо», ви ще не дійшли до першопричини; Запитайте інше «чому».

Підсумовуючи

Аналіз журналу — це пошук сигналу в океані шуму; ШІ узагальнює та структурує цей океан за секунди, встановлює часову шкалу та генерує гіпотези. Але кореляція не є причинно-наслідковим зв’язком: причина, запропонована штучним інтелектом, є початковою підозрою, а не знахідкою, доки не буде підтверджено. Згорніть журнал у вікно подій, замаскуйте його, запитайте структуру, копніть глибоко за допомогою «5 чому» та перевірте кожну гіпотезу в системі за допомогою команд лише для читання. Ви знаходите першопричину та підтверджуєте її усунення; ШІ — ваш супутник.

Аплікаційне завдання

Візьміть журнали минулої події (або тестової події), згорніть його у вікно події та замаскуйте будь-які чутливі області. Запитуйте підсумок і розклад від AI за допомогою шаблонів «Резюме журналу» та «Часова шкала» вище. Потім перейдіть від симптому до першопричини за допомогою шаблону «5 причин партнера RCA»; Напишіть власні докази для кожного кроку. Нарешті, перевірте початкову гіпотезу штучного інтелекту за допомогою команди перевірки та зафіксуйте її підтвердження чи спростування. Узагальніть процес у 6 пунктах.

контрольний список

  • [ ] Я згорнув журнал у вікно подій і замаскував чутливі області?
  • [ ] Чи просив я штучний інтелект надати структуроване резюме та часову шкалу, а не необроблений журнал?
  • [ ] Чи позначив я твердження штучного інтелекту щодо причинності як гіпотези?
  • [ ] Чи перевірив я кожну гіпотезу в системі за допомогою команди перевірки лише для читання?
  • [ ] Чи підтвердив я кожен крок із «5 чому» реальними доказами?
  • [ ] Чи я сумнівався та чи приймав я рішення про те, чи справді основна причина завадить події?