Jedinica 7 / 12

Analiza dnevnika i uočljivost

Dobici:

  • Sposobnost sumiranja velikih deponija dnevnika maskiranjem i filtriranjem u AI i kreiranjem vremenske linije
  • Biti u stanju procijeniti vremenske odnose koje je uspostavila AI kao hipoteze, a ne uzročne veze
  • Sposobnost validacije hipoteze o osnovnom uzroku pomoću metrike i koda i priprema postmortem skice

Kada je softver pokrenut u produkciji (živo okruženje), samo tragovi, metrika i evidencija (vremenski žigosani redovi dnevnika koje proizvodi aplikacija dok radi) vam govore šta radi. Povlačenje značajnog signala iz hiljada, ponekad i miliona linija dnevnika tokom prekida je najstresniji i vremenski najkritičniji trenutak reakcije na incident. Ovdje AI može biti pomoćnik, sažimajući masivni tekst, izdvajajući obrasce i generirajući hipoteze – sve dok poštujete ograničenja privatnosti i verifikacije.

U ovoj jedinici učimo da koristimo AI u kontekstu opservabilnosti — sposobnosti razumijevanja unutrašnjeg stanja sistema gledajući njegove vanjske izlaze: izdvajanje značenja iz buke dnevnika, uspostavljanje vremenske linije greške, pronalaženje obrazaca koji se ponavljaju i pravljenje obdukcije. Unaprijed kritično upozorenje: neobrađeni dnevniki proizvodnje često sadrže lične podatke i tajne; nasumično ubacivanje u AI alat je ozbiljan prekršaj.

Zašto su dnevnici teški, zašto je AI korisna?

Dnevnici su teški iz tri razloga: jačine (previše ih je), buke (mnogi redovi su nebitni) i nereda (događaj je razbacan po zapisnicima različitih usluga). Ljudsko oko se umori u ovoj gomili i promaši važnu liniju.

AI je dobar u sažimanju velikih blokova teksta, brojanju obrazaca koji se ponavljaju i postavljanju pitanja "šta se promijenilo neposredno prije tog naleta grešaka?" Snažan je u uspostavljanju vremenskih odnosa kao što su Međutim, postoje dvije granice. Prvi je kontekstni prozor: količina dnevnika koje možete uklopiti u model je ograničena, tako da prvo morate filtrirati i uzorkovati. Drugo, validacija: AI koja kaže „ovo je osnovni uzrok“ je hipoteza; Nemojte donositi odluku a da je ne potvrdite metrikom i kodom.

Oprez: neobrađeni zapisnici proizvodnje mogu sadržavati IP adresu, e-poštu, token, ID sesije i ponekad otvorenu tajnu. Zamaskirajte ih prije nego što ih unesete u AI ili koristite samo alate koje je odobrila tvrtka i zaštićene podatke. Ovu temu produbljujemo u jedinici 10.

Korak po korak: od dnevnika do korijenskog uzroka

  1. Suzite vremenski prozor. Odredite minute kada je događaj počeo; Pregledajte taj prozor, ne cijeli dan.
  2. Filtrirajte buku. Uklonite poznate ponavljajuće, bezopasne linije; Fokusirajte se na grešku (ERROR), upozorenje (WARN) i prvi trenutak odstupanja.
  3. Maskirajte osjetljive podatke. Očistite lične podatke i tajne prije nego ih date AI.
  4. Napravite sažetak i vremensku liniju. Zamolite AI da sumira događaj u hronologiji („prvo ovo, pa ono“).
  5. Potvrdite hipotezu pomoću metrike i koda. Razlog na koji je ukazao AI; Potvrdite kontrolnom pločom, relevantnim kodom i vremenskom linijom implementacije, ako je primjenjivo.
  6. Zapišite ono što ste naučili. Napravite postmortalnu skicu i navedite preventivne radnje.

Tri mini futrole

Slučaj 1 — 40.000 redova sažeto u 5 minuta. Usluga plaćanja prijavila je isprekidanu grešku u trajanju od 12 minuta. Tim je AI unio relevantan 20-minutni prozor maskiranih dnevnika (otprilike 40.000 redova, uzorkovanih) i generirao vremensku liniju. Model je pokazao da se rafal greške poklopio s trenutkom kada se vrijeme odziva usluge ovisnosti povećalo sa 200 ms na 8 sekundi. Tim je to potvrdio na kontrolnoj tabli i suzio uzrok u roku od 10 minuta.

Slučaj 2 — Obmanjujuća korelacija. U drugom incidentu, AI je za to okrivio rekavši da se greške dešavaju "istovremeno" kada se izvodi cron (planirani zadatak). Kada je tim provjerio metriku, vidio je da je cron zapravo završio prije događaja; Korelacija je bila slučajnost. Pravi uzrok je bilo curenje memorije. Pouka: Vremenska korelacija koju je uspostavila AI je trag, a ne dokaz.

Slučaj 3 — Obdukcija ubrzana. Nakon nestanka, tim je dostavio (maskirani) transkript poruke i vremensku liniju iz kanala događaja u AI i dao mu da napravi postmortem skicu: sažetak, utjecaj, vremensku liniju, osnovni uzrok, akcije. Ljudski urednik je ispravio činjenice i odredio vlasnike akcija. Dokument, koji obično traje 2 sata, završen je za otprilike 40 minuta sa konzistentnijom strukturom.

Četiri predloška koji se mogu kopirati

Sažetak dnevnika i vremenska linija (sa maskiranim dnevnikom):

Ispod je prozor događaja maskiranog dnevnika proizvodnje.1) Prelijte događaj u hronološki vremenski okvir (označite trenutak prvog odstupanja).2) Izbrojite i grupišete najčešće ponavljajuće vrste grešaka/upozorenja.3) "Šta se promijenilo neposredno prije?" Navedite događaje kandidata za pitanje. Ovo su hipoteze; Označite ga kao "mora biti potvrđeno". {{logovi}}

Ekstrakcija uzorka greške:

Pronađite obrasce grešaka koje se ponavljaju u ovim redovima dnevnika. Za svaki uzorak: linija uzorka (maskirana), procijenjeni izvor i moguće značenje. Sakupite rijetke, ali kritične pojedinačne greške na zasebnoj listi "pažnja".{{logs}}

Strukturirani upit/generacija filtera:

Za {{log alat: grep/jq/Kibana KQL/CloudWatch Insights}}, napišite upit koji ispunjava sljedeći uslov: {{npr. 5xx grešaka u posljednjih 15 min, isključujući korisnika X}}. Objasnite upit; Uvjerite se da ne izmišljate imena domena, pitajte ako niste sigurni.

Postmortem skica:

Napišite postmortem skicu sa sljedeće (maskiranog) vremenskog okvira događaja: Sažetak / Utjecaj (trajanje, korisnik pogođen) / Vremenska linija / Osnovni uzrok / Šta je prošlo dobro / Radnje (ostavite polje vlasnika prazno za svaki). NEMOJTE koristiti optužujući jezik; Budite činjenični i proaktivni.{{timeline}}

Slaba prompt / Jaka prompt

Slab: "Pogledajte ove dnevnike, šta nije u redu?" (Neobrađeni dnevnik cijelog dana, s ličnim podacima, neciljano.)
Snažno: "Ispod je maskirani dnevnik proizvodnje od 14:02–14:20 (filtriran na 5xxs). U ovom prozoru pronađite trenutak kada je pucanje greške počelo, prebrojite najčešći tip greške i navedite odstupanja koja su se pojavila u 60 sekundi neposredno prije eksplozije; označite ih sve kao 'hipotezu za provjeru'."

Moćna verzija; Sužava vremenski prozor, filtrira i maskira dnevnik, postavlja jasno pitanje i od samog početka utvrđuje da je rezultat hipoteza.

Quest

AI je jak

Ograničenje / verifikacija

Veliki sažetak dnevnika

Da, brzo

Može doći do gubitka uzorkovanja

Uspostavljanje vremenskog odnosa

generiše nagoveštaje

Korelacija ≠ uzročnost

Generisanje upita/filtra

dobar nacrt

Da li su imena domena stvarna?

Postmortem skica

Struktura i jezik

Slučajevi su potvrđeni kod ljudi

Korelacija nije uzročna veza

Najčešća zamka u analizi dnevnika je zabluda "dogodilo se u isto vrijeme, pa zato". AI upada u ovu zamku jednako lako, ako ne i lakše nego ljudi; jer misli da je istovremenost u tekstu jak signal. Da se može reći da jedan događaj zapravo vodi drugom; potrebno je vrijeme, mehanizam i, ako je moguće, ponovljivost. Za svaku tvrdnju o uzročnosti koju AI utvrdi, pitamo "koji drugi dokazi to potvrđuju?" Testirajte to pitanjem.

Savjet: Kada se prijavljujete na AI, umjesto dampa teksta, ako je moguće, prvo odštampajte upit/filter i pokrenite ga u svom vozilu; Na ovaj način i smanjujete osjetljive podatke i odvajate kontekstni prozor modela u zaista važne redove.

Uobičajene greške

  • Lijepljenje neobrađenog, nemaskiranog dnevnika. Otkrivanje ličnih podataka i tajni; teška povreda privatnosti.
  • Davanje ceo dan odjednom. Prekoračuje okvir konteksta, signal je utopljen u buku.
  • Pogrešna korelacija za uzročnost. Vremenski odnos koji je uspostavila AI je trag, a ne dokaz.
  • Oslanjajući se na upit sa izmišljenim imenom domene. Model može predložiti ime polja dnevnika koje ne postoji; provjerite sa šemom.
  • Objavljivanje obdukcije bez verifikacije. Činjenice i brojke o uticaju moraju biti potvrđene od strane ljudi.

Ukratko

AI je moćan alat za prevazilaženje volumena i šuma u analizi dnevnika: sumiranje velikih transkripata, uspostavljanje vremenskih linija, izdvajanje obrazaca i priprema postmortem skica. Ali zapamtite tri ograničenja: nemojte izvoziti osjetljive podatke bez maskiranja, filtrirajte ih i uzorkovajte kako bi odgovarali prozoru konteksta i provjerite svaku tvrdnju o uzročnosti pomoću metrike i koda. Korelacija nije uzročna veza; AI daje tragove, vi donosite odluku sa dokazima.

Zadatak aplikacije

Odaberite prozor od 15-20 minuta iz dnevnika događaja ili testnog okruženja koji imate. Prvo maskirajte lične podatke i tajne (ili napravite sintetički dnevnik). Zatim izdvojite hronologiju i najčešće vrste grešaka iz AI pomoću predloška „sažetak dnevnika i vremenska linija“. Pokušajte provjeriti hipotezu o osnovnom uzroku koju je AI iznio pomoću metrike ili dijela koda koji imate: da li se hipoteza držala ili je to bila pogrešna korelacija? Zapišite svoje otkriće u jednoj rečenici.

kontrolna lista

  • [ ] Maskiram lične podatke i tajne prije nego što dam dnevnik AI.
  • [ ] Svodim analizu na uski vremenski okvir i filtriram.
  • [ ] Vremenske odnose koje je uspostavila AI vidim kao hipoteze, a ne uzročnost.
  • [ ] Provjeravam tvrdnju o osnovnom uzroku pomoću metrike i koda.
  • [ ] Potvrđujem da su imena domena upita/filtera koje generišem stvarna.
  • [ ] Ljudski potvrđujem činjenice i brojke u obdukcijskoj skici.