Zyski:
- Szybko znajduj sygnał w szumie, korzystając ze sztucznej inteligencji do podsumowywania, grupowania i osi czasu dzienników
- Umiejętność oddzielenia korelacji i przyczynowości oraz traktowania sugestii sztucznej inteligencji dotyczących pierwotnych przyczyn jako hipotez wymagających weryfikacji
- Możliwość dotarcia do prawdziwej przyczyny poprzez zastosowanie metody „5 powodów” ze sztuczną inteligencją i wspieranie każdego kroku prawdziwymi dowodami
Analiza logów i analiza przyczyn źródłowych: znajdowanie sygnału w szumie za pomocą sztucznej inteligencji
Kiedy system ulegnie awarii, w pierwszej kolejności sprawdzane są dzienniki. Dziennik to strumień tekstowy przechowujący oznaczony czasowo zapis „co zrobiłem, co się stało, co się zepsuło” w systemie lub aplikacji. Jednak nowoczesna infrastruktura produkuje miliony linii kłód na godzinę; to nie morze informacji, ale często ocean hałasu. Analiza logów to sztuka znalezienia ważnego sygnału (błądu, nieprawidłowości, wzorca) w tym szumie. Proces uzyskiwania odpowiedzi na pytanie „co było prawdziwą przyczyną” po zdarzeniu nazywany jest analizą przyczyn źródłowych (RCA – Root Cause Analysis). W tym przypadku sztuczna inteligencja ma ogromną moc, podsumowując tysiące linii na sekundę, wydobywając wzorce, ustalając ramy czasowe i wymieniając możliwe przyczyny. Ale jedna uwaga: sztuczna inteligencja generuje możliwe przyczyny; To Ty weryfikujesz w systemie, który z nich jest prawdziwy i podejmujesz decyzję.
W tej części dowiesz się, jak pewnie podsumowywać logi za pomocą sztucznej inteligencji, jak ustalić oś czasu zdarzenia, jak odróżnić korelację (wspólną zmianę) od związku przyczynowego (jedna powoduje drugą) oraz jak zastosować metodę RCA, taką jak „5 powodów” z wykorzystaniem sztucznej inteligencji.
Dlaczego korelacja nie jest przyczyną?
Jest to najbardziej krytyczna koncepcja tej jednostki. Tylko dlatego, że dwa zdarzenia zachodzą w tym samym czasie, jedno nie powoduje drugiego. Jednocześnie może wzrosnąć obciążenie procesora i ruch sieciowy serwera; ale jedno nie jest wynikiem drugiego, oba mogą być wynikiem trzeciego zdarzenia (na przykład rozpoczęcia zadania wsadowego). Kiedy sztuczna inteligencja widzi, że wskaźniki zmieniają się razem, stawia hipotezę, że „prawdopodobnie X spowodowało Y”. To jest punkt wyjścia, a nie konkluzja. Aby zweryfikować związek przyczynowy, należy albo wyizolować zmienną (wyzwolić X w środowisku testowym i sprawdzić, czy zachodzi Y), albo udowodnić mechanizm (pokazać środki techniczne, za pomocą których X wytwarza Y).
Uwaga: zdanie sztucznej inteligencji „to prawdopodobnie spowodowało to” potraktuj jako hipotezę, a nie stwierdzenie. W przypadku RCA nieprawidłowa przyczyna prowadzi do nieprawidłowej korekty i ponownego wystąpienia zdarzenia. Znalazłeś pierwszego podejrzanego, a nie przyczynę; Praca zaczyna się tam.
Krok po kroku: analiza logów za pomocą AI
- Zawęź zakres. Podaj okno zdarzenia, a nie cały dziennik: „zdarzenie rozpoczęło się o 14:05, krytyczne od 14:00 do 14:20”. Poinformuj sztuczną inteligencję o odpowiednim przedziale czasowym i usłudze.
- Maska. Dzienniki zawierają wewnętrzny adres IP, nazwę hosta, użytkownika i token. Zamaskuj je (10.x.x.x, host-A, użytkownik1, ZMIENIONO), a następnie wyeksportuj.
- Poproś o podsumowanie i grupowanie. „Pogrupuj ten dziennik według ważności, zlicz powtarzające się błędy, znajdź sygnaturę czasową pierwszego błędu”. Zapytaj o konstrukcję, a nie surową kłodę.
- Ustaw oś czasu. „Ułóż te wydarzenia w kolejności czasowej i pokaż, co następuje po czym”. Znalezienie pierwszego domina jest drogą do pierwotnej przyczyny.
- Proś o hipotezę, a nie o dowód. „Wymień możliwe przyczyny pierwotne w kolejności prawdopodobieństwa i podaj polecenie weryfikacyjne, które mam uruchomić w systemie dla każdej z nich”. Zapytaj o diagnozę, a nie o wynik.
- Sprawdź w systemie. Przetestuj każdą hipotezę za pomocą poleceń diagnostycznych tylko do odczytu (log grep, zapytanie o status, metryka). Eliminuj, aż będzie tylko jedna potwierdzona przyczyna źródłowa.
5 Dlaczego metoda
Klasycznym i potężnym narzędziem RCA jest „5 powodów”: rozpoczynanie od jednego objawu i pytanie „dlaczego?” pięć razy. Zadając pytanie, docierasz do pierwotnej przyczyny ukrytej pod objawami powierzchniowymi. Przykład: „Witryna uległa awarii. Dlaczego? Aplikacja przestała działać, ponieważ zabrakło jej pamięci. Dlaczego? Zapytanie zużyło całą pamięć. Dlaczego? Zapytanie nie użyło indeksu. Dlaczego? Indeks został usunięty w ostatniej wersji. Dlaczego? Nie zostało to zauważone podczas przeglądu zmian. Główną przyczyną nie jest powierzchowna „awaria witryny”, ale „niedostateczny proces przeglądu zmian”. Sztuczna inteligencja byłaby dobrym partnerem w budowaniu tego łańcucha, ale każdy krok „dlaczego” należy poprzeć prawdziwymi dowodami, w przeciwnym razie sztuczna inteligencja może wymyślić wiarygodny, ale fałszywy łańcuch.
trzy mini etui
Przypadek 1 — 40 000 linii, 3 minuty. Administrator rozpoczął ręczne skanowanie 40 000 wierszy dzienników aplikacji podczas nocnej awarii. Przekazał AI odpowiednią 20-minutową część zamaskowanego dziennika i poprosił o podsumowanie i pogrupowanie. Sztuczna inteligencja zgłosiła pierwszy błąd OutOfMemory o 02:14, zaraz po błędach związanych ze zwiększonym przekroczeniem limitu czasu. Inżynier otrzymał kartę czasu pracy w ciągu 3 minut; potwierdził pierwotną diagnozę na swoim własnym panelu metrycznym.
Przypadek 2 — Powrót z niewłaściwej przyczyny. Zespół uznał, że pierwsza hipoteza sztucznej inteligencji („dzienniki wypełniły dysk”) była prawidłowa i wyczyścił dzienniki. Ale sytuacja powtórzyła się następnego dnia. W drugiej rundzie zdyscyplinowani wdrożyli zasadę „5 powodów”: prawdziwym powodem był błąd aplikacji polegający na zapisywaniu setek zrzutów pamięci na sekundę. Pierwszą hipotezą była korelacja; Prawdziwy powód był inny. Przyjęcie bez weryfikacji dało jedynie jednodniowe wytchnienie.
Przypadek 3 — Oś czasu znalazła winowajcę. Podczas sporadycznej awarii sieci istniały dzienniki kilkudziesięciu urządzeń. Inżynier przekazał zamaskowane logi sztucznej inteligencji i zlecił jej utworzenie jednolitej osi czasu. Wykres pokazał, że każda awaria rozpoczynała się dokładnie 30 sekund po komunikacie sprawdzającym stan przełącznika nadmiarowości. Ta korelacja była mocną wskazówką; Zespół zweryfikował błąd oprogramowania sprzętowego klucza na urządzeniu i wymienił go.
Cztery szablony do kopiowania
1) Podsumowanie i grupowanie logów:
Poniżej log zamaskowany dla [serwisu] w godzinach 14:00-14:20. Powiedz mi: (1) pogrupuj i policz wiersze według wagi (BŁĄD/OSTRZEŻENIE/INFO), (2) wypisz 5 najczęściej powtarzających się wzorców błędów, (3) znajdź sygnaturę czasową pierwszego BŁĘDU. Nie przepisuj surowego dziennika, po prostu podaj uporządkowane podsumowanie. Dodanie wymyślonej linii. Log: [zamaskowany log]
2) Konfigurowanie osi czasu:
Uporządkowaliśmy następujące zamaskowane rekordy zdarzeń na jednej osi czasu (znacznik czasu + źródło + zdarzenie). Pokaż, co następuje po czym i zaznacz zdarzenie, które wydaje się być pierwszym wyzwalaczem. Należy pamiętać, że jest to HIPOTEZA i należy zweryfikować związek przyczynowy. Nagrania: [zamaskowane nagrania]
3) 5 powodów, dla których partner RCA:
Twoja rola: koordynator RCA. Objaw: [objaw]. Wykonaj ze mną „5 pytań”: „dlaczego?” na każdym kroku. Zapytaj, odpowiem na podstawie dowodów, które posiadam, Ty zadajesz następne pytanie. Jeśli moje dowody są słabe, ostrzeż mnie i powiedz, jakie dane muszę zebrać. Nie deklaruj pierwotnej przyczyny bez dowodów.
4) Hipoteza + polecenie weryfikacji:
Wymień możliwe przyczyny źródłowe tego objawu [objawu] w kolejności prawdopodobieństwa. Z każdego powodu: (a) co podejrzewasz, (b) daj mi polecenie weryfikacyjne TYLKO DO ODCZYTU, aby uruchomić je w moim systemie (bez usuwania/zmiany). Wyjaśnij, który wynik potwierdza lub obala hipotezę.
Słaba zachęta/silna zachęta
Słaba zachęta:
Co jest nie tak z tym logiem? [10 000 linii surowego dziennika]
Ten monit powoduje zarówno ujawnienie ujawnienia poufnych danych, jak i pozostawienie sztucznej inteligencji bez kontekstu. Sztuczna inteligencja może natknąć się na przypadkową linię i podać powierzchowny lub nawet wymyślony powód.
Potężny monit:
Twoja rola: starszy SRE. Zdarzenie: usługa płatnicza wykazała błąd 50% między 02:10 a 02:25. Poniżej znajduje się zamaskowany dziennik tego okna. Podaj mi (1) podsumowanie pogrupowane według ważności, (2) sygnaturę czasową pierwszego błędu, (3) możliwe przyczyny pierwotne w kolejności prawdopodobieństwa oraz polecenie weryfikacji tylko do odczytu dla każdej z nich. Oznacz twierdzenia o przyczynowości jako hipotezy. Dziennik: [zamaskowany dziennik]
krok
Cel
Rola sztucznej inteligencji
rola mężczyzny
Podsumowanie/grupowanie
zmniejszyć hałas
Konfigurowanie tysięcy wierszy
Określ zakres i maskę
oś czasu
Znalezienie pierwszego domina
sortowanie zdarzeń
Zweryfikuj pieczątki
generowanie hipotez
sortowanie podejrzanych
wypisz możliwości
filtruj według kontekstu
weryfikacja
znaleźć prawdziwy powód
Zaproponuj polecenie diagnostyczne
Uruchom polecenie i skomentuj je
decyzja
Wybór naprawy
oferować opcje
Podejmij decyzję i potwierdź
Typowe błędy
- Mylenie korelacji z przyczynowością. Zaakceptowanie dwóch wskaźników, które zmieniają się razem, ponieważ „jeden spowodował drugi”, powoduje fałszywą korektę.
- Wklejanie surowego dziennika bez maski. Przekazanie logu zawierającego adres IP, token i użytkownika otwartemu narzędziu stanowi naruszenie bezpieczeństwa.
- Deklarowanie pierwszej hipotezy jako przyczyny źródłowej. Przyjęcie pierwszej sugestii AI bez jej sprawdzenia jest zaproszeniem do powtórki wydarzenia.
- Eksportowanie całego dziennika. Ogromny dziennik bez kontekstu podłącza sztuczną inteligencję do losowej linii; Zwiń do okna wydarzenia.
- 5 powodów bez dowodów. Jeśli nie poprzesz każdego kroku „dlaczego” prawdziwymi danymi, otrzymasz wiarygodny, ale wymyślony łańcuch.
Wskazówka: przed zakończeniem RCA zadaj sobie pytanie: „jeśli ta pierwotna przyczyna została rzeczywiście naprawiona, czy nie powtórzy się?” Zadaj pytanie. Jeśli odpowiedź brzmi „być może”, nie dotarłeś jeszcze do pierwotnej przyczyny; Zapytaj innego „dlaczego”.
Podsumowując
Analiza logów polega na znalezieniu sygnału w oceanie szumu; Sztuczna inteligencja podsumowuje i porządkuje ten ocean w ciągu kilku sekund, ustala oś czasu i generuje hipotezy. Ale korelacja nie jest związkiem przyczynowym: przyczyną sugerowaną przez sztuczną inteligencję jest początkowe podejrzenie, a nie ustalenie do czasu potwierdzenia. Zwiń dziennik w oknie zdarzeń, zamaskuj go, zapytaj o strukturę, przeszukaj głęboko za pomocą „5 powodów” i przetestuj każdą hipotezę w systemie za pomocą poleceń tylko do odczytu. Jesteś tym, który znajduje pierwotną przyczynę i potwierdza rozwiązanie; AI jest Twoim towarzyszem.
Zadanie aplikacji
Weź dzienniki przeszłego zdarzenia (lub zdarzenia testowego), zwiń je w oknie zdarzeń i zamaskuj wszystkie wrażliwe obszary. Poproś AI o podsumowanie i harmonogram, korzystając z powyższych szablonów „Podsumowanie dziennika” i „Oś czasu”. Następnie przejdź od objawu do przyczyny źródłowej, korzystając z szablonu „Partner 5 powodów RCA”; Napisz własne dowody dla każdego kroku. Na koniec przetestuj początkową hipotezę sztucznej inteligencji za pomocą polecenia weryfikacji i zanotuj, czy została ona potwierdzona, czy obalona. Podsumuj proces w 6 punktach.
lista kontrolna
- [ ] Czy zwinąłem dziennik do okna zdarzeń i zamaskowałem wrażliwe obszary?
- [ ] Czy poprosiłem sztuczną inteligencję o ustrukturyzowane podsumowanie i harmonogram, a nie o surowy dziennik?
- [ ] Czy oznaczyłem twierdzenia AI o przyczynowości jako hipotezy?
- [ ] Czy przetestowałem każdą hipotezę w systemie za pomocą polecenia weryfikacji tylko do odczytu?
- [ ] Czy poparłem każdy krok „5 pytań dlaczego” prawdziwymi dowodami?
- [ ] Czy kwestionowałem i podjąłem decyzję, czy pierwotna przyczyna faktycznie zapobiegnie zdarzeniu?