Jednotka 7 / 12

Log analýza a pozorovatelnost

zisky:

  • Schopnost shrnout velké výpisy protokolů jejich maskováním a filtrováním podle AI a vytvořit časovou osu
  • Schopnost hodnotit časové vztahy stanovené AI jako hypotézy, nikoli kauzalitu
  • Schopnost ověřit hypotézu hlavní příčiny pomocí metrik a kódu a připravit posmrtný náčrt

Když software běží v produkčním prostředí (živé prostředí), pouze trasování, metriky a protokoly (řádky protokolu s časovým razítkem vytvořené aplikací za běhu) vám řeknou, co dělá. Vytažení smysluplného signálu z tisíců, někdy i milionů řádků protokolu během výpadku je nejstresovější a časově nejkritičtější okamžik reakce na incident. Zde může být umělá inteligence pomocníkem, který shrnuje masivní text, extrahuje vzory a generuje hypotézy – pokud budete respektovat limity soukromí a ověřování.

V této jednotce se učíme používat umělou inteligenci v kontextu pozorovatelnosti – schopnosti porozumět vnitřnímu stavu systému pohledem na jeho externí výstupy: extrahovat význam z log šumu, stanovit časovou osu chyby, najít opakující se vzorce a navrhnout posmrtnou zprávu. Kritické varování předem: surové výrobní protokoly často obsahují osobní údaje a tajemství; jejich nahodilé zastrčení do nástroje AI je vážným porušením.

Proč jsou protokoly těžké, proč je AI užitečná?

Protokoly jsou obtížné ze tří důvodů: objem (je jich příliš mnoho), šum (mnoho řádků je irelevantních) a nepořádek (událost je rozptýlena v protokolech různých služeb). Lidské oko se v této hromadě unaví a mine důležitou linii.

Umělá inteligence je dobrá při sumarizaci velkých bloků textu, počítání opakujících se vzorů a ptát se „co se změnilo těsně před tím výbuchem chyb?“ Je mocný při navazování časových vztahů, jako jsou Nicméně, existují dvě omezení. Prvním je kontextové okno: množství protokolů, které se vejde do modelu, je omezené, takže nejprve musíte filtrovat a vzorkovat. Za druhé, validace: AI říká „zde je hlavní příčina“ je hypotéza; Nedělejte rozhodnutí, aniž byste to potvrdili pomocí metrik a kódu.

Upozornění: Nezpracované produkční protokoly mohou obsahovat IP adresu, e-mail, token, ID relace a někdy i otevřené tajemství. Než je předáte umělé inteligenci, zamaskujte je nebo používejte pouze podnikově schválené nástroje se zabezpečenými daty. Toto téma prohloubíme v bloku 10.

Krok za krokem: Od protokolu ke kořenové příčině

  1. Zúžit časové okno. Určete minuty, kdy událost začala; Prozkoumejte to okno, ne celý den.
  2. Odfiltrujte hluk. Odstraňte známé opakující se neškodné linie; Zaměřte se na chybu (ERROR), varování (WARN) a okamžik první odchylky.
  3. Maskovat citlivá data. Vyčistěte osobní data a tajemství, než je předáte AI.
  4. Vytvořte souhrn a časovou osu. Požádejte AI, aby událost shrnula v chronologii („nejdříve tohle, pak tamto“).
  5. Ověřte hypotézu pomocí metrik a kódu. Důvod, na který upozornila AI; Potvrďte pomocí řídicího panelu, příslušného kódu a časové osy nasazení, pokud je to možné.
  6. Dejte to, co se naučili, písemně. Udělejte si posmrtný náčrt a sepište preventivní opatření.

Tři mini pouzdra

Případ 1 — 40 000 řádků shrnutých do 5 minut. Platební služba hlásila občasnou chybu po dobu 12 minut. Tým poskytl příslušné 20minutové okno maskovaných protokolů (přibližně 40 000 vzorkovaných řádků) do AI a vygeneroval časovou osu. Model ukázal, že shluk chyb se shodoval s okamžikem, kdy se doba odezvy závislé služby zvýšila z 200 ms na 8 sekund. Tým to potvrdil na palubní desce a během 10 minut zúžil příčinu.

Případ 2 – Zavádějící korelace. V jiném incidentu to AI ​​obviňovala tím, že k chybám došlo „současně“ při spuštění cronu (plánované úlohy). Když tým zkontroloval metriky, viděli, že cron skutečně skončil před událostí; Korelace byla náhoda. Skutečnou příčinou byl únik paměti. Ponaučení: Časová korelace stanovená AI je vodítko, nikoli důkaz.

Případ 3 — Postmortem zrychlená. Po výpadku tým předal (maskovaný) přepis zprávy a časovou osu z kanálu události do AI a nechal ji vytvořit posmrtný náčrt: shrnutí, dopad, časová osa, hlavní příčina, akce. Lidský redaktor opravil fakta a jmenoval vlastníky akce. Dokument, který obvykle trvá 2 hodiny, byl dokončen přibližně za 40 minut s konzistentnější strukturou.

Čtyři kopírovatelné šablony

Shrnutí protokolu a časová osa (s maskovaným protokolem):

Níže je okno událostí maskovaného produkčního protokolu.1) Nalijte událost do chronologické časové osy (označte okamžik první odchylky).2) Spočítejte a seskupte nejčastěji se opakující typy chyb/varování.3) "Co se změnilo těsně předtím?" Seznam kandidátských událostí pro otázku. Toto jsou hypotézy; Označte jej jako „musí být ověřeno“. {{logy}}

Extrakce chybového vzoru:

Najděte vzory opakujících se chyb v těchto řádcích protokolu. Pro každý vzor: vzorový řádek (maskovaný), odhadovaný zdroj a možný význam. Shromažďujte vzácné, ale kritické jednotlivé chyby v samostatném seznamu „pozornosti“.{{logs}}

Generování strukturovaného dotazu/filtru:

Pro {{log tool: grep/jq/Kibana KQL/CloudWatch Insights}} napište dotaz, který splňuje následující podmínku: {{např. 5xx chyb za posledních 15 minut, s výjimkou uživatele X}}. Vysvětlete dotaz; Ujistěte se, že si názvy domén nevymýšlíte, pokud si nejste jisti, zeptejte se.

Posmrtná skica:

Napište posmrtný náčrt z následující (maskované) časové osy události: Shrnutí / Dopad (trvání, ovlivnění uživatelem) / Časová osa / Hlavní příčina / Co se povedlo / Akce (u každé ponechte pole vlastníka prázdné). NEPOUŽÍVEJTE obviňující jazyk; Buďte věcní a proaktivní.{{timeline}}

Slabá výzva / Silná výzva

Slabý: "Podívejte se na tyto protokoly, co se děje?" (Nezpracovaný záznam z celého dne, s osobními údaji, necílený.)
Strong: "Níže je maskovaný protokol výroby od 14:02 do 14:20 (filtrováno na 5xxs). V tomto okně najděte okamžik, kdy došlo k výbuchu chyby, spočítejte nejčastější typ chyby a vypište odchylky, které se objevily během 60 sekund bezprostředně před výbuchem; označte je všechny jako 'hypotéza k ověření'."

Výkonná verze; Zužuje časové okno, filtruje a maskuje protokol, klade jasnou otázku a od začátku stanoví, že výstupem je hypotéza.

Quest

AI je silná

Limit / ověření

Velké shrnutí protokolu

Ano, rychle

Může dojít ke ztrátě vzorku

Navázání časového vztahu

generuje rady

Korelace ≠ příčinná souvislost

Generování dotazu/filtru

dobrý návrh

Jsou doménová jména skutečná?

Posmrtná skica

Struktura a jazyk

Případy jsou potvrzeny lidmi

Korelace není kauzalita

Nejčastějším úskalím při analýze protokolů je omyl „stalo se to ve stejnou dobu, tak proto“. AI padne do této pasti stejně snadno, ne-li snadněji, než lidé; protože si myslí, že simultánnost v textu je silným signálem. Umět říci, že jedna událost vlastně vede k další; je vyžadováno načasování, mechanismus a pokud možno opakovatelnost. U každého tvrzení o kauzalitě, které AI prokáže, se ptáme „jaké další důkazy to potvrzují? Otestujte to otázkou.

Tip: Když se přihlašujete do AI, místo výpisu textu, pokud je to možné, nejprve vytiskněte dotaz/filtr a spusťte jej ve svém vozidle; Tímto způsobem snížíte citlivá data a rozdělíte kontextové okno modelu do skutečně důležitých řádků.

Časté chyby

  • Vkládání surového, nemaskovaného logu. Zveřejňování osobních údajů a tajemství; vážné porušení soukromí.
  • Dát celý den najednou. Přesahuje kontextové okno, signál se utápí v šumu.
  • Záměna korelace za příčinnou souvislost. Časový vztah vytvořený AI je vodítko, ne důkaz.
  • Spoléhání se na dotaz s vytvořeným názvem domény. Model může navrhnout název pole protokolu, který neexistuje; ověřit pomocí schématu.
  • Zveřejnění pitvy bez jejího ověření. Fakta a údaje o dopadu musí být potvrzeny lidmi.

V souhrnu

Umělá inteligence je mocný nástroj pro překonání objemu a šumu v analýze protokolů: shrnutí velkých přepisů, stanovení časových os, extrahování vzorů a příprava posmrtných náčrtů. Pamatujte však na tři limity: neexportujte citlivá data, aniž byste je zamaskovali, filtrujte je a vzorkujte je, aby se vešly do kontextového okna, a ověřujte každé tvrzení o kauzalitě pomocí metrik a kódu. Korelace není kauzalita; Umělá inteligence dává vodítka, vy rozhodujete na základě důkazů.

Aplikační úkol

Vyberte 15–20minutové okno z protokolu události nebo testovacího prostředí, který máte. Nejprve zamaskujte osobní údaje a tajemství (nebo vytvořte syntetický protokol). Poté extrahujte chronologii a nejčastější typy chyb z AI pomocí šablony „shrnutí protokolu a časová osa“. Pokuste se ověřit hypotézu hlavní příčiny, kterou AI předložila, pomocí metriky nebo kódu, který máte: platila hypotéza, nebo to byla zavádějící korelace? Své zjištění zapište jednou větou.

kontrolní seznam

  • [ ] Před předáním protokolu AI maskuji osobní údaje a tajemství.
  • [ ] Redukuji analýzu na úzké časové okno a filtruji.
  • [ ] Časové vztahy stanovené AI vnímám jako hypotézy, nikoli kauzalitu.
  • [ ] Ověřuji nárok na hlavní příčinu pomocí metrik a kódu.
  • [ ] Potvrzuji, že názvy domén dotazů/filtrů, které generuji, jsou skutečné.
  • [ ] Lidsky potvrzuji fakta a čísla v posmrtném náčrtu.