Jednostka 4 / 11

Monitorowanie wydajności i wydajności: odczytywanie wskaźników i planowanie na przyszłość

Zyski:

  • Umiejętność prawidłowej interpretacji metryk przy wsparciu sztucznej inteligencji przy użyciu percentyla (p95/p99) i wartości bazowej zamiast średniej
  • Możliwość oddzielenia sezonowości od trendu i przedstawienia prognozy zdolności produkcyjnych w formie optymistycznego i pesymistycznego przedziału, a nie pojedynczej liczby
  • Zrozumienie, że decyzje dotyczące inwestycji w zasoby i progów alarmowych są podejmowane przez człowieka, podobnie jak czas realizacji zasobów i kontekst biznesowy.

Monitorowanie wydajności i wydajności: odczytywanie wskaźników za pomocą sztucznej inteligencji i planowanie przyszłości

Nie możesz zobaczyć stanu systemu na własne oczy; Rozumiesz to poprzez metryki. Metryka to zależna od czasu wartość liczbowa mierzalnej charakterystyki systemu: użycie procesora, zajętość pamięci, wolne miejsce na dysku, opóźnienie sieci, żądania na sekundę. Monitorowanie wydajności w sposób ciągły zbiera te wskaźniki i odpowiada na pytanie „czy system jest teraz w porządku?” Planowanie wydajności idzie o krok dalej: odpowiada na pytanie „kiedy przy tym tempie stanę się niewystarczający i kiedy powinienem zakupić nowe zasoby?” W tym przypadku sztuczna inteligencja jest wysoce wykwalifikowanym asystentem w interpretacji stosów wskaźników, zaznaczaniu anomalii, odczytywaniu trendu i tworzeniu prognoz na przyszłość. Przede wszystkim jednak przeważa jedno zastrzeżenie: sztuczna inteligencja wydobywa wzorce z danych historycznych; To Ty podejmujesz decyzje dotyczące inwestycji w zasoby, skalowania i progów alertów w oparciu o kontekst.

W tej jednostce monitorowane są takie pojęcia, jak linia bazowa (linia normalnego zachowania), anomalia (odchylenie od normy), percentyl (percentyl); Interpretacja metryczna za pomocą AI; prognoza trendu i wzrostu; i nauczysz się ustawiać prawidłowy próg alarmowy.

Średnia kłamie: dlaczego percentyl?

Najczęstszym błędem w śledzeniu jest mierzenie wszystkiego średnią. Załóżmy, że Twój czas odpowiedzi wynosi średnio 200 ms. Brzmi dobrze. Ale 5% użytkowników może czekać 8 sekund; Średnia to ukrywa. Dlatego profesjonaliści używają percentyla: p95 = „95% żądań przypada poniżej tego okresu”. Jeśli czas reakcji p95 wynosi 8 sekund, jeden na dwudziestu użytkowników ma okropne doświadczenia — średnia nigdy tego nie pokazuje. Podając wskaźniki AI, jasno określ, jakiej statystyki chcesz: „interpretuj dla mnie p50, p95 i p99, a nie średnią”. Ten jeden nawyk ujawnia ukryte problemy.

Wskazówka: spójrz na percentyl dla każdego wskaźnika dotyczącego doświadczenia użytkownika (czas odpowiedzi, opóźnienie); p95/p99 zamiast średniej prowadzi do naprawdę cierpiącej mniejszości. W metrykach zasobów (procesor, pamięć) należy zwrócić uwagę zarówno na wartości szczytowe, jak i trwałe.

Nie ma anomalii bez linii bazowej

Zanim będziesz mógł stwierdzić, czy dana metryka jest „nienormalna”, musisz wiedzieć, że jest „normalna”. Wartość bazowa to typowy zakres zachowań systemu w zdrowe dni: „w przypadku tej usługi w południe procesor wynosi zazwyczaj 40–60%”. Bez wartości bazowej nie można wiedzieć, czy wartość 70% jest przerażająca, czy normalna. Możesz ustawić linię bazową, przekazując AI historyczne zdrowe dane i mówiąc „wyodrębnij normalny zakres i dzienny/tygodniowy wzór tej metryki”. Następnie interpretujesz nowe dane zgodnie z tą wartością bazową: „gdzie jest ta wartość w normie?” Anomalia to znaczące i trwałe odchylenie od wartości wyjściowej — pojedynczy nagły skok często powoduje hałas.

Krok po kroku: prognoza wydajności

  1. Zbierz czystą i odpowiednią historię. Trend wymaga danych z co najmniej kilku tygodni, najlepiej co miesiąc. Prognoza sporządzona na podstawie niewielkiej ilości danych jest przypuszczeniem, a nie przewidywaniem.
  2. Odrębna sezonowość. Ruch spada w weekendy, wzrasta pod koniec miesiąca i eksploduje w trakcie kampanii. Poinformuj sztuczną inteligencję o tych cyklach, aby nie pomyliła wzrostu z wahaniami sezonowymi.
  3. Wyeliminuj trend. „Ile GB średnio rósł ten dysk tygodniowo w ciągu ostatnich 8 tygodni?” AI oblicza tempo wzrostu.
  4. Poproś o projekcję, rozplanuj ją. „Kiedy przy tym tempie dysk będzie zapełniony w 90%?” — ale zapytaj o optymistyczny/pesymistyczny zakres, a nie o pojedynczą datę. Przyszłość jest niepewna; liczba nieparzysta to fałszywa precyzja.
  5. Ustal z ludźmi próg decyzyjny. Jeśli prognoza mówi „Zostanie ukończona za 6 tygodni”, bierzesz pod uwagę czas pozyskiwania (zakup, zatwierdzenie) i decydujesz, czy podjąć działania już dziś.
  6. Ustaw alarm poprawnie. Bardzo czuły alarm powoduje hałas i zmęczenie alarmu; zbyt luźne, alarm pominie wydarzenie. Uzyskaj rekomendację progową od sztucznej inteligencji, ale ostateczny próg określ na podstawie własnej tolerancji ryzyka.

trzy mini etui

Przypadek 1 — Średnio ukryte, p99 pokazane. Jeden zespół uznał, że ich interfejs API wynosi „średnio 180 ms, w porządku”. Kiedy podałem metryki AI i poprosiłem o interpretację percentylową, okazało się, że p99 wynosiło 6400 ms — jedno na sto żądań było wolniejsze niż 6 sekund. Główną przyczyną było powolne zapytanie do bazy danych. Podczas gdy przeciętna osoba wydawała się zdrowa, mniejszość przeżyła straszne doświadczenia.

Przypadek 2 — Projekcja ostrzegana z 3-tygodniowym wyprzedzeniem. Administrator przekazał AI dane o zajętości dysku dziennika. Sztuczna inteligencja wywnioskowała tygodniowy trend wzrostu na poziomie ~7 GB i przewidziała, że ​​przy obecnym tempie 90% zostanie osiągnięte w ciągu 19 dni, przy optymistycznym i pesymistycznym przedziale 16–23 dni. Ponieważ dostawa nowych dysków trwała 10 dni, zespół natychmiast złożył zamówienie i zapobiegł przestojowi, zanim do niego doszło.

Przypadek 3 — Powrót z fałszywej anomalii. W każdą niedzielę wieczorem włączał się alarm monitorujący, informujący, że procesor wzrósł do 95%. Zanim wpadł w panikę, inżynier kazał sztucznej inteligencji podnieść poziom bazowy: ten skok był zaplanowanym zadaniem tworzenia kopii zapasowych, które odbywało się co tydzień o tej samej porze, więc było to częścią normy. To nie była anomalia; brakowało linii bazowej. Próg alarmowy został skorygowany o ten okres czasu i zniknęły niepotrzebne nocne pobudki.

Cztery szablony do kopiowania

1) Interpretacja metryczna (percentyl):

Poniżej znajdują się wskaźniki czasu odpowiedzi [usługi] (zamaskowane). Komentujcie mi p50, p95 i p99, a nie średnią. Jaka jest różnica między p99 a p50 i na jaki problem użytkownika wskazuje? Nie dodawaj wymyślonych wartości, po prostu zinterpretuj dane, które ci podałem. Dane: [metryki]

2) Odejmowanie linii bazowej:

Poniżej znajdują się zdrowe dane [metryczne] z ostatnich 4 tygodni. Wyodrębnij (1) normalny zakres (2) dzienny i tygodniowy wzór (np. minimum w nocy, maksimum w południe) tego wskaźnika. Następnie podam jedną nową wartość; sklasyfikować go jako „normalny/ostrożny/nienormalny” w oparciu o tę linię bazową. Dane: [dane historyczne]

3) Projekcja wydajności (z zasięgiem):

Poniżej znajdują się dane dotyczące obłożenia [zasobu] z ostatnich 8 tygodni. (1) Oblicz średnie tygodniowe tempo wzrostu, (2) wskaż efekty sezonowe, (3) oszacuj czas do osiągnięcia progu 90% przy obecnym tempie, z zakresami OPTYMISTYCZNYM i PESYMISTYCZNYM. Podaj jedną datę, podaj zakres i zapisz swoje założenia. Dane: [szereg czasowy]

4) Zalecenia dotyczące progu alarmowego:

Moja wartość bazowa dla [metryka] to [zakres]. Moim celem jest minimalizacja fałszywych alarmów bez pomijania realnych problemów. Podaj mi zalecenia dotyczące (1) ostrzeżenia i (2) progu krytycznego, uzasadniając każde z nich i oceniając ryzyko zmęczenia alarmami. Ustalę ostateczny próg.

Słaba zachęta/silna zachęta

Słaba zachęta:

Czy mój serwer jest powolny?

Nie ma kontekstu, wskaźników ani punktu odniesienia. Sztuczna inteligencja nie zna definicji „powolności” ani nie ma normalnej wartości, z którą można ją porównać. Odpowiedź jest pustym domysłem.

Potężny monit:

Twoja rola: specjalista ds. planowania wydajności. Poniżej znajduje się czas odpowiedzi p95 z ostatnich 14 dni i dane dotyczące żądań/sekundę interfejsu API (zamaskowane). Moja wartość bazowa wynosi 250–400 ms dla p95. Powiedz mi (1) zaznacz dni, które w ciągu ostatnich 14 dni wykraczały poza wartość bazową, (2) powiedz mi, czy istnieje widoczny związek między czasem odpowiedzi a obciążeniem żądaniami (jako hipoteza), (3) przewidź, gdzie p95 pójdzie w ciągu 30 dni, jeśli ten trend się utrzyma. Dane: [szereg czasowy]

Typ metryczny

błędny pomiar

dokładny pomiar

czas reakcji

Po prostu przeciętny

s. 50, s. 95, s. 99

Procesor/pamięć

wartość chwilowa

Szczyt + utrzymujący się + poziom bazowy

wzrost dysku

Dzisiejsze obłożenie

Trend tygodniowy + projekcja

Anomalia

pojedyncze odbicie

Ciągłe odchylenie od wartości bazowej

alarm

Arbitralny pojedynczy próg

Uzasadnione ostrzeżenie + próg krytyczny

Typowe błędy

  • Mierząc wszystko średnią. Przeciętność ukrywa złe doświadczenia nielicznych; Zobacz percentyl.
  • Wyszukiwanie anomalii bez linii bazowej. Nie można powiedzieć, że wartość jest nienormalna, nie wiedząc, co jest normalne; Tworzysz fałszywy alarm.
  • Mylenie sezonowości z trendem. Traktowanie szczytu kampanii jako trwałego wzrostu i zajmowanie niepotrzebnych zasobów kosztuje.
  • Opierając się na projekcji liczb nieparzystych. „Dokładnie 19 dni” to fałszywa precyzja; Użyj zakresu optymistyczno-pesymistycznego.
  • Zapominanie o czasie pozyskiwania. Zespół, który nie weźmie pod uwagę progu projekcji i wspólnego zakupu czasu, zostanie złapany w przerwie.
Uwaga: prognoza trendu AI zakłada, że ​​przeszłość będzie kontynuowana w przyszłości. Wprowadzenie na rynek nowego produktu, migracja klientów lub zmiana architektury podważają to założenie. Twoim zadaniem jest skorygowanie projekcji w zależności od kontekstu.

Podsumowując

Monitoring wydajności odpowiada na pytanie „czy teraz jest dobrze?” a planowanie wydajności odpowiada na pytanie „kiedy to nie wystarczy?” Sztuczna inteligencja to potężny partner w interpretacji wskaźników, ustalaniu wartości bazowych, sygnalizowaniu anomalii i prognozowaniu trendów. Ale średnia kłamie — użyj percentyla; Bez linii bazowej nie ma anomalii — najpierw ustal normę; oddziel sezonowość od trendu; i przyjmij projekcję jako zakres, a nie pojedynczą liczbę. Decyzje dotyczące inwestycji w zasoby i progów alarmowych są podejmowane przez człowieka, podobnie jak czas realizacji zasobów i kontekst biznesowy.

Zadanie aplikacji

Wykorzystaj dane z ostatnich kilku tygodni dla zasobu (dysk, pamięć, czas odpowiedzi) z własnych systemów i zamaskuj wrażliwe obszary. Odejmij normalny zakres i wzór, korzystając z powyższego szablonu „Odejmowanie linii bazowej”. Następnie użyj szablonu „Projekcja wydajności”, aby przewidzieć, kiedy osiągniesz próg, z zakresem optymistyczno-pesymistycznym. Zinterpretuj także swój czas reakcji za pomocą szablonu „percentyla” i sprawdź, czy jest coś, co ukrywa średnia. Zapisz swoje ustalenia i działania, które podejmiesz, w 5 punktach.

lista kontrolna

  • [ ] Czy w metrykach czasu reakcji uwzględniłem p95/p99 zamiast średniej?
  • [ ] Czy przed szukaniem anomalii ustaliłem punkt odniesienia na podstawie prawidłowych danych?
  • [ ] Czy rozróżniłem wahania sezonowe od trendu stałego?
  • [ ] Czy przyjąłem prognozę jako przedział optymistyczno-pesymistyczny, a nie jako pojedynczą datę?
  • [ ] Czy oszacowałem czas pozyskiwania wraz z progiem projekcji?
  • [ ] Czy ustawiłem próg alarmowy w oparciu o własną tolerancję ryzyka, a nie zalecenie sztucznej inteligencji?