Dobici:
- Sposobnost sažimanja velikih ispisa dnevnika maskiranjem i filtriranjem u AI i stvaranje vremenske trake
- Biti u stanju procijeniti vremenske odnose koje je uspostavila umjetna inteligencija kao hipoteze, a ne kao uzročnost
- Sposobnost potvrđivanja hipoteze temeljnog uzroka s metrikom i kodom te priprema postmortem skice
Kada softver radi u produkciji (živo okruženje), samo tragovi, metrika i zapisnici (redovi dnevnika s vremenskim žigom koje proizvodi aplikacija dok radi) govore vam što radi. Izvlačenje smislenog signala iz tisuća, ponekad i milijuna redaka dnevnika tijekom prekida je najstresniji i vremenski najkritičniji trenutak reakcije na incident. Ovdje AI može biti pomoćnik, sažimajući ogroman tekst, izdvajajući uzorke i generirajući hipoteze — sve dok poštujete privatnost i ograničenja provjere.
U ovoj jedinici učimo koristiti umjetnu inteligenciju u kontekstu promatranja — sposobnost razumijevanja unutarnjeg stanja sustava gledanjem njegovih vanjskih izlaza: izdvajanje značenja iz šuma u zapisniku, utvrđivanje vremenske trake greške, pronalaženje ponavljajućih obrazaca i izrada obdukcije. Kritično upozorenje unaprijed: neobrađeni proizvodni dnevnici često sadrže osobne podatke i tajne; njihovo nasumično ubacivanje u AI alat je ozbiljan prekršaj.
Zašto su zapisi teški, zašto je umjetna inteligencija korisna?
Zapisi su teški iz tri razloga: glasnoće (previše ih je), buke (mnogi redovi su nevažni) i nereda (događaj je razbacan po zapisima različitih usluga). Ljudsko oko se umori u ovoj hrpi i promaši važnu crtu.
AI je dobra u sažimanju velikih blokova teksta, brojanju ponavljajućih uzoraka i postavljanju pitanja "što se promijenilo neposredno prije tog niza pogrešaka?" Moćan je u uspostavljanju vremenskih odnosa kao što su Međutim, postoje dva ograničenja. Prvi je kontekstni prozor: količina zapisa koje možete smjestiti u model je ograničena, pa prvo morate filtrirati i uzorkovati. Drugo, potvrda: umjetna inteligencija kaže "ovdje je glavni uzrok" hipoteza; Nemojte donositi odluku bez da je potvrdite metrikom i kodom.
Oprez: neobrađeni proizvodni zapisnici mogu sadržavati IP adresu, e-poštu, token, ID sesije i ponekad otvorenu tajnu. Zamaskirajte ih prije nego što ih unesete u AI ili koristite samo alate zaštićene podacima koje je odobrila tvrtka. Ovu temu produbljujemo u jedinici 10.
Korak po korak: od dnevnika do temeljnog uzroka
- Suzite vremenski prozor. Odredite minute kada je događaj započeo; Pregledajte taj prozor, ne cijeli dan.
- Filtrirajte buku. Uklonite poznate repetitivne, bezopasne retke; Fokusirajte se na grešku (ERROR), upozorenje (WARN) i prvi trenutak odstupanja.
- Maskirajte osjetljive podatke. Očistite osobne podatke i tajne prije nego što ih date umjetnoj inteligenciji.
- Napravite sažetak i vremensku traku. Zamolite AI da sažeti događaj u kronologiji ("prvo ovo, zatim ono").
- Potvrdite hipotezu metrikom i kodom. Razlog koji ističe AI; Potvrdite s nadzornom pločom, relevantnim kodom i vremenskom crtom implementacije, ako je primjenjivo.
- Zapiši naučeno. Napraviti postmortem skicu i navesti preventivne radnje.
Tri mini kućišta
Slučaj 1 — 40 000 redaka sažeto u 5 minuta. Usluga plaćanja prijavila je povremenu pogrešku 12 minuta. Tim je ubacio relevantan 20-minutni prozor maskiranih zapisa (otprilike 40.000 redaka, uzorkovanih) AI-u i generirao vremensku liniju. Model je pokazao da se eksplozija pogreške poklopila s trenutkom kada se vrijeme odgovora usluge ovisnosti povećalo s 200 ms na 8 sekundi. Tim je to potvrdio na nadzornoj ploči i suzio uzrok u roku od 10 minuta.
Slučaj 2 — Pogrešna korelacija. U drugom incidentu, AI je to okrivio rekavši da su se pogreške događale "u isto vrijeme" kada se pokreće cron (planirani zadatak). Kad je tim provjerio metriku, vidjeli su da je cron zapravo završio prije događaja; Korelacija je bila slučajnost. Pravi uzrok bilo je curenje memorije. Lekcija: Vremenska korelacija koju je uspostavila AI je trag, a ne dokaz.
Slučaj 3 — Postmortem ubrzano. Nakon prekida, tim je AI-u poslao (maskirani) transkript poruke i vremensku crtu s kanala događaja i dao mu napraviti postmortalnu skicu: sažetak, utjecaj, vremensku crtu, glavni uzrok, akcije. Ljudski urednik ispravio je činjenice i imenovao vlasnike akcije. Dokument, koji obično traje 2 sata, dovršen je za otprilike 40 minuta s dosljednijom strukturom.
Četiri predloška za kopiranje
Sažetak dnevnika i vremenska traka (s maskiranim dnevnikom):
Ispod je prozor događaja maskiranog proizvodnog dnevnika.1) Prelijte događaj na kronološku vremensku traku (označite trenutak prvog odstupanja).2) Prebrojite i grupirajte najčešće ponavljajuće vrste grešaka/upozorenja.3) "Što se promijenilo neposredno prije?" Navedite događaje kandidate za pitanje. Ovo su hipoteze; Označite kao "mora se provjeriti". {{zapisi}}
Ekstrakcija uzorka pogreške:
Pronađite uzorke ponavljajućih pogrešaka u ovim redovima dnevnika. Za svaki uzorak: linija uzorka (maskirana), procijenjeni izvor i moguće značenje. Sakupite rijetke, ali kritične pojedinačne pogreške na posebnom popisu "pozornosti".{{logs}}
Generiranje strukturiranih upita/filtara:
Za {{log tool: grep/jq/Kibana KQL/CloudWatch Insights}} napišite upit koji ispunjava sljedeći uvjet: {{npr. 5xx pogrešaka u zadnjih 15 minuta, isključujući korisnika X}}. Objasnite upit; Pazite da ne izmišljate imena domena, pitajte ako niste sigurni.
Posmrtna skica:
Napišite posmrtnu skicu sa sljedeće (maskirane) vremenske trake događaja: Sažetak / Utjecaj (trajanje, pogođeni korisnik) / Vremenska linija / Glavni uzrok / Što je prošlo dobro / Radnje (ostavite polje vlasnika prazno za svaku). NEMOJTE koristiti optužujući jezik; Budite činjenični i proaktivni.{{timeline}}
Slab upit / Jak upit
Slab: "Pogledajte ove zapise, što nije u redu?" (Neobrađeni dnevnik cijelog dana, s osobnim podacima, neciljan.)
Strong: "Ispod je maskirani proizvodni dnevnik od 14:02–14:20 (filtriran na 5xxs). U ovom prozoru pronađite trenutak kada je došlo do eksplozije pogreške, izbrojite najčešće vrste pogreške i navedite odstupanja koja su se pojavila u 60 sekundi neposredno prije eksplozije; sve ih označite kao 'hipotezu koju treba provjeriti'."
Snažna verzija; Sužava vremenski prozor, filtrira i maskira zapisnik, postavlja jasno pitanje i od samog početka utvrđuje da je rezultat hipoteza.
Potraga
AI je jaka
Ograničenje / provjera
Veliki sažetak dnevnika
Da, brzo
Može doći do gubitka uzorkovanja
Uspostavljanje vremenskog odnosa
generira savjete
Korelacija ≠ uzročnost
Generiranje upita/filtara
dobar nacrt
Jesu li imena domena stvarna?
Posmrtna skica
Struktura i jezik
Slučajevi su potvrđeni kod ljudi
Korelacija nije uzročnost
Najčešća zamka u analizi dnevnika je pogreška "dogodilo se u isto vrijeme, pa zato". AI upada u ovu zamku jednako lako, ako ne i lakše, nego ljudi; jer misli da je simultanost u tekstu jak signal. Moći reći da jedan događaj zapravo vodi drugom; potrebno je vrijeme, mehanizam i, ako je moguće, ponovljivost. Za svaku tvrdnju o uzročnosti koju AI utvrdi, pitamo se "koji drugi dokaz to potvrđuje?" Testirajte to pitanjem.
Savjet: kada se prijavljujete na AI, umjesto ispisa teksta, ako je moguće, prvo ispišite upit/filtar i pokrenite ga u svom vozilu; Na ovaj način smanjujete osjetljive podatke i odvajate kontekstni prozor modela u stvarno važne retke.
Uobičajene greške
- Lijepljenje neobrađenog, nemaskiranog dnevnika. Odavanje osobnih podataka i tajni; ozbiljna povreda privatnosti.
- Davanje cijelog dana odjednom. Nadilazi kontekstni prozor, signal je utopljen u šumu.
- Zamjena korelacije za uzročnost. Vremenski odnos koji je uspostavila AI je trag, a ne dokaz.
- Oslanjanje na upit s izmišljenim nazivom domene. Model može predložiti naziv polja dnevnika koji ne postoji; provjerite pomoću sheme.
- Objavljivanje obdukcije bez provjere. Činjenice i podaci o utjecaju moraju biti potvrđeni od strane ljudi.
Ukratko
AI je moćan alat za pobjeđivanje glasnoće i buke u analizi dnevnika: sažimanje velikih transkripata, utvrđivanje vremenskih okvira, izdvajanje uzoraka i priprema postmortem skica. Ali zapamtite tri ograničenja: nemojte izvoziti osjetljive podatke bez maskiranja, filtrirajte ih i uzorkujte ih kako bi odgovarali kontekstualnom prozoru i provjerite svaku tvrdnju o uzročnosti pomoću metrike i koda. Korelacija nije uzročnost; AI daje tragove, vi donosite odluku s dokazima.
Zadatak aplikacije
Odaberite prozor od 15 do 20 minuta iz dnevnika događaja ili testnog okruženja koji imate. Najprije maskirajte osobne podatke i tajne (ili izradite sintetički dnevnik). Zatim izdvojite kronologiju i najčešće vrste pogrešaka iz AI-a s predloškom "sažetak dnevnika i vremenska traka". Pokušajte provjeriti hipotezu o temeljnom uzroku koju je umjetna inteligencija iznijela pomoću metrike ili dijela koda koji imate: je li hipoteza održala ili je to bila pogrešna korelacija? Zapiši svoje otkriće u jednoj rečenici.
popis za provjeru
- [ ] Maskiram osobne podatke i tajne prije davanja dnevnika AI-ju.
- [ ] Svodim analizu na uski vremenski prozor i filtriram.
- [ ] Vremenske odnose koje je uspostavila umjetna inteligencija vidim kao hipoteze, a ne uzročnost.
- [ ] Provjeravam temeljni uzrok tvrdnje metrikom i kodom.
- [ ] Potvrđujem da su imena domena upita/filtara koje generiram stvarna.
- [ ] Ljudski potvrđujem činjenice i brojke u posmrtnoj skici.