одиниці
1. Вступ до штучного інтелекту в управлінні системою та мережею: ролі, межі, автентифікація та повноваження 2. Скрипти автоматизації: безпечне створення Bash, PowerShell і Python 3. Аналіз журналу та аналіз першопричини: пошук сигналу в шумі 4. Моніторинг потужності та продуктивності: читання показників і планування на майбутнє 5. Керування конфігурацією: генерація конфігурації, перевірка та фіксація дрейфу 6. Управління інфраструктурою як код (IaC): Terraform, Ansible і Plan Control 7. Управління документацією та інформацією: Runbook, Post-mortem і корпоративна пам’ять 8. Прогнозне технічне обслуговування: бачення несправностей до того, як вони виникнуть 9. Управління змінами: оцінка ризиків, відкат і вікно обслуговування 10. Безпека та оборона: використання штучного інтелекту в цілях оборони та в межах повноважень 11. Наскрізна інтеграція: керування інцидентом від початку до кінця
одиниця 4 / 11

Моніторинг потужності та продуктивності: читання показників і планування на майбутнє

Прибуток:

  • Можливість правильно інтерпретувати показники за допомогою штучного інтелекту за допомогою процентиля (p95/p99) і базового рівня замість середнього
  • Можливість відокремити сезонність від тенденції та створити прогноз потужності як оптимістично-песимістичний діапазон, а не одне число
  • Розуміння того, що рішення про інвестування ресурсів і порогові значення тривоги приймаються людиною разом із часом виконання ресурсів і бізнес-контекстом.

Моніторинг потужності та продуктивності: читання показників за допомогою ШІ та планування майбутнього

Ви не можете побачити працездатність системи своїми очима; Ви розумієте це через метрику. Метрика — це залежне від часу числове значення вимірюваної характеристики системи: використання процесора, зайнятість пам’яті, вільний простір на диску, затримка мережі, запити в секунду. Моніторинг продуктивності постійно збирає ці показники та дає відповідь на запитання "чи зараз система в порядку?" Планування ємності йде ще далі: воно відповідає на питання "за такої швидкості, коли мені стане недостатньо, коли мені слід придбати нові ресурси?" Тут штучний інтелект є висококваліфікованим помічником у інтерпретації купи показників, позначенні аномалій, читанні тенденції та створенні майбутніх прогнозів. Але одне застереження переважає над усім: ШІ витягує шаблони з історичних даних; Ви приймаєте рішення про інвестиції ресурсів, масштабування та порогові значення оповіщення з контекстом.

У цьому блоці моніторингу такі поняття, як базова лінія (лінія нормальної поведінки), аномалія (відхилення від норми), процентиль (процентиль); Метрична інтерпретація за допомогою ШІ; тренд і прогноз зростання; і ви навчитеся встановлювати правильний поріг тривоги.

Середня брехня: чому процентиль?

Найпоширеніша помилка під час відстеження — вимірювати все середнім. Скажімо, середній час відповіді становить 200 мс. Звучить добре. Але 5% користувачів можуть чекати 8 секунд; Середній це приховує. Ось чому професіонали використовують процентиль: p95 = «95% запитів менше цього періоду часу». Якщо час відповіді p95 становить 8 секунд, кожен двадцятий користувач має жахливий досвід — середнє значення цього ніколи не показує. Надаючи показники штучному інтелекту, чітко вкажіть, яку статистику ви хочете отримати: «інтерпретуйте для мене p50, p95 і p99, а не середнє». Ця звичка розкриває приховані проблеми.

Порада: подивіться на процентиль для кожного показника, який стосується взаємодії з користувачем (час відповіді, затримка); p95/p99 замість середнього передає вас до справжньої страждаючої меншості. У показниках ресурсів (ЦП, пам’ять) дивіться як на пікові, так і на стійкі значення.

Немає аномалії без базової лінії

Перш ніж ви зможете визначити, чи є показник «ненормальним», вам потрібно знати «нормальний». Базовий рівень — це типовий діапазон поведінки системи в здорові дні: «ця послуга ЦП буднього дня зазвичай становить 40–60%». Без базового рівня ви не можете знати, чи є значення 70% страшним чи нормальним. Ви можете встановити базову лінію, надавши ШІ історичні здорові дані та сказавши «витягнути нормальний діапазон і щоденний/тижневий шаблон цього показника». Потім ви інтерпретуєте нові дані відповідно до базової лінії: «де це значення в нормі?» Аномалія — це значне та стійке відхилення від базової лінії — одиничний раптовий стрибок часто є шумом.

Крок за кроком: прогноз потужності

  1. Зберіть чистий і адекватний анамнез. Тренд потребує принаймні кількох тижнів даних, бажано щомісяця. Прогноз, зроблений з невеликою кількістю даних, є припущенням, а не прогнозом.
  2. Окрема сезонність. Traffic drops on the weekend, increases at the end of the month, and explodes during the campaign. Повідомте штучному інтелекту ці цикли, щоб він не плутав зростання з сезонними коливаннями.
  3. Зніміть тренд. «На скільки ГБ у середньому збільшувався цей диск на тиждень за останні 8 тижнів?» ШІ розраховує швидкість зростання.
  4. Попросіть проекцію, розмістіть її. "За такої швидкості, коли диск буде заповнений на 90%?" — але просіть оптимістичний/песимістичний діапазон, а не одну дату. Майбутнє невизначене; непарне число є помилковою точністю.
  5. Визначте поріг прийняття рішення з людьми. Якщо в прогнозі зазначено: «Це буде завершено через 6 тижнів», ви враховуєте час пошуку (купівля, затвердження) і вирішуєте, чи вживати заходів сьогодні.
  6. Встановіть будильник правильно. Дуже чутлива сигналізація створює шум і втому сигналізації; занадто слабий сигнал тривоги пропустить подію. Отримайте рекомендацію порогового значення від ШІ, але визначте остаточне порогове значення з вашою власною толерантністю до ризику.

три міні-чохла

Випадок 1 — Середнє приховане, p99 показано. Одна команда вважала, що їхній API становить «у середньому 180 мс, цілком нормально». Коли я передав показники ШІ та попросив інтерпретувати процентиль, виявилося, що p99 становив 6400 мс — один із кожні сотні запитів був повільнішим за 6 секунд. Основною причиною був повільний запит до бази даних. У той час як середній здавався здоровим, меншість мала жахливий досвід.

Випадок 2 — проекцію попереджено за 3 тижні. Адміністратор передав ШІ дані про зайнятість диска журналу. Штучний інтелект зробив висновок про щотижневу тенденцію зростання приблизно на 7 ГБ і прогнозував, що за поточних темпів 90% буде досягнуто протягом 19 днів, з оптимістично-песимістичним діапазоном 16–23 днів. Оскільки на поставку нових дисків знадобилося 10 днів, команда негайно замовила та запобігла збою до того, як він стався.

Випадок 3 — Повернення після помилкової аномалії. Сигнал моніторингу спрацьовував щонеділі ввечері, повідомляючи, що ЦП піднімається до 95%. Перш ніж запанікувати, інженер змусив штучний інтелект підвищити базову лінію: цей стрибок був запланованим резервним завданням, яке відбувалося щотижня в один і той же час, тому це було частиною норми. Це не була аномалія; базова лінія була відсутня. Поріг будильника виправлено для цього періоду часу, і непотрібні нічні пробудження зникли.

Чотири шаблони, які можна копіювати

1) Інтерпретація показників (процентиль):

Нижче наведено показники часу відповіді [послуги] (замасковані). Прокоментуйте мені p50, p95 і p99, а не середній показник. Що означає різниця між p99 і p50, на яку проблему взаємодії з користувачем вона свідчить? Не додавайте вигадані значення, просто інтерпретуйте дані, які я вам надаю. Дані: [метрики]

2) Віднімання базової лінії:

Нижче наведено здорові [метричні] дані за останні 4 тижні. Витягніть (1) нормальний діапазон (2) денний і тижневий шаблон (наприклад, нічний мінімум, полуденний максимум) цього показника. Тоді я дам одне нове значення; класифікувати його як "нормальний/обережний/ненормальний" на основі цієї базової лінії. Дані: [історичні показники]

3) Проекція ємності (з діапазоном):

Нижче наведено дані про зайнятість [ресурсу] за останні 8 тижнів. (1) Розрахувати середній тижневий темп зростання, (2) вказати сезонні ефекти, (3) оцінити час досягнення порогового значення в 90% за поточного темпу з ОПТИМІСТИЧНИМ і ПЕСИМІСТИЧНИМ діапазонами. Вкажіть одну дату, діапазон і запишіть свої припущення. Дані: [часовий ряд]

4) Рекомендація щодо порогового значення тривоги:

Моя базова лінія для [метрики] — [діапазон]. Моя мета — звести до мінімуму помилкові тривоги, не пропускаючи реальних проблем. Дайте мені рекомендацію щодо (1) попередження та (2) критичного порогу, обґрунтувавши кожне та оцінивши ризик втоми тривоги. Я визначу кінцевий поріг.

Слабка підказка / Сильна підказка

Слабка підказка:

Мій сервер повільний?

Немає контексту, показників і базової лінії. ШІ не знає визначення «повільного» і не має нормального значення для його порівняння. Відповідь - пусте припущення.

Потужна підказка:

Ваша роль: спеціаліст з планування потужностей. Нижче наведено час відповіді p95 за останні 14 днів і запити/другі дані API (замасковані). Мій базовий рівень становить 250-400 мс для p95. Скажіть мені (1) позначте дні, які вийшли за межі базового рівня за останні 14 днів, (2) скажіть мені, чи існує видимий зв’язок між часом відповіді та навантаженням на запит (як гіпотеза), (3) передбачте, куди піде p95 через 30 днів, якщо ця тенденція збережеться. Дані: [часовий ряд]

Метричний тип

неправильне вимірювання

точне вимірювання

час відповіді

Просто середній

стор.50, стор.95, стор.99

ЦП/пам'ять

миттєве значення

Пік + стійка + базова лінія

зростання диска

Сьогоднішня заповненість

Тижневий тренд + прогноз

аномалія

одиночний відскок

Постійне відхилення від базової лінії

тривога

Довільний єдиний поріг

Обґрунтоване попередження + критичний поріг

Поширені помилки

  • Вимірюючи все середнім. Середнє приховує поганий досвід небагатьох; Дивіться процентиль.
  • Пошук аномалій без базової лінії. Ви не можете сказати, що значення є ненормальним, не знаючи, що є нормальним; Ви створюєте помилкову тривогу.
  • Приймаючи сезонність за тренд. Розглядання піку кампанії як постійного зростання та використання непотрібних ресурсів коштує грошей.
  • Покладаючись на проекцію непарних чисел. «Рівно 19 днів» — помилкова точність; Використовуйте оптимістично-песимістичний діапазон.
  • Забувши про час пошуку. Команда, яка не враховує поріг проекції та купівлю часу разом, буде перервана.
Застереження: прогноз тренду AI припускає, що минуле триватиме в майбутньому. Випуск нового продукту, перехід клієнта або зміна архітектури порушують це припущення. Ваше завдання — виправити проекцію відповідно до контексту.

Підсумовуючи

Моніторинг продуктивності відповідає на питання "чи добре зараз?" а планування потужностей відповідає на питання "коли цього недостатньо?" ШІ є потужним партнером у інтерпретації показників, встановленні базових показників, позначенні аномалій і прогнозуванні тенденцій. Але середнє бреше — використовуйте процентиль; Без базової лінії немає аномалії — спочатку встановіть норму; відокремити сезонність від тренду; і візьміть проекцію як діапазон, а не одне число. Рішення про інвестування ресурсів і порогові значення сповіщень приймаються людиною, а також час виконання ресурсів і бізнес-контекст.

Аплікаційне завдання

Візьміть дані за останні кілька тижнів для ресурсу (диск, пам’ять, час відгуку) з ваших власних систем і замаскуйте чутливі області. Відніміть нормальний діапазон і шаблон за допомогою шаблону «Віднімання базової лінії» вище. Потім попросіть шаблон «Прогноз потужності» передбачити, коли ви досягнете порогового значення, з оптимістично-песимістичним діапазоном. Крім того, інтерпретуйте показник часу відповіді за допомогою шаблону «процентиль» і подивіться, чи приховує середнє значення. Запишіть свої висновки та дії, які ви зробите, у 5 пунктах.

контрольний список

  • [] Чи дивився я на p95/p99 замість середнього показника часу відповіді?
  • [ ] Чи встановив я базову лінію на основі здорових даних перед пошуком аномалій?
  • [ ] Чи відрізнив я сезонні коливання від постійної тенденції?
  • [ ] Чи сприйняв я прогноз як оптимістично-песимістичний діапазон, а не одну дату?
  • [ ] Чи оцінив я час пошуку разом із порогом проекції?
  • [ ] Чи встановив я порогове значення тривоги на основі моєї власної терпимості до ризику, а не на основі рекомендацій ШІ?