Dobički:
- Sposobnost razumevanja življenjskega cikla incidenta (odkrivanje, triaža, ublažitev, reševanje, postmortem), metrike MTTD/MTTR in načelo "najprej ublaži, razišči pozneje"
- Sposobnost uporabe umetne inteligence za zožitev hipotez v času incidenta in izdelavo brezhibne postmortem skice, s katero potrdi vsak glavni vzrok s podatki
- Sposobnost uporabe discipline pisanja v jeziku, ki ne obtožuje posmrtnih in deljenja podatkov o dogodkih z maskiranjem.
Vsak sistem se sčasoma pokvari. Razlika je v tem, kako se dobre ekipe pripravijo na ta neizogiben dogodek in kako se učijo. Incident je nepričakovan dogodek, ki moti ali grozi, da bo motil storitev: zrušitev storitve, skokoviti odzivni časi, izguba podatkov. Upravljanje incidentov pomeni odkrivanje, ublažitev, čim hitrejše reševanje incidenta in nato učenje iz njega. To je disciplina, ki dan in noč poganja strokovnjake za DevOps in SRE (Site Reliability Engineering).
Dve kritični metriki merita kakovost dogodka: MTTD (povprečni čas za odkrivanje) in MTTR (povprečni čas do okrevanja). Cilj je skrčiti oboje. Umetna inteligenca tu doda dve veliki vrednosti: hitro povzemanje dnevnikov in meritev v času dogodka, da se zoži možni glavni vzrok, in hitro pripravo obdukcije (poročila o preiskavi po dogodku) po dogodku. Toda odločitve o poteku dogodkov - katero storitev izključiti, vrniti, kaj povedati stranki - so vaše.
Življenjski cikel dogodka
- Zaznavanje: oglasi se alarm ali pride pritožba stranke. Čim prej tem bolje.
- Triaža: Kako resno je? Kaj je domena? Dodeljene so stopnje resnosti—običajno SEV1 (najbolj kritičen, celoten sistem) do SEV4 (manjša).
- Sestavite svojo odzivno ekipo. V kritičnih dogodkih koordinacijo prevzame poveljnik incidenta.
- Ublažitev: najprej ustavite krvavitev - pogosto vrnitev nazaj ali prekrivanje zastavice. Glavni vzrok boste našli kasneje.
- Rešitev: Uporabi trajno rešitev.
- Naučite se (posmrtno): Kaj se je zgodilo, zakaj se je zgodilo, kako preprečimo, da bi se ponovilo?
Namig: Ena najdražjih napak v času incidenta je odlašanje z ustavitvijo krvavitve, ker "pojdimo najprej do natančnega vzroka." Pravilo: najprej zmanjšaj (obnovi/obnovi storitev), nato poizvedi. Vrnitev nazaj na znano dobro različico je pogosto najhitrejša rešitev.
Posmrtna kultura brez krivde
Hrbtenica zdravih timov je kultura neoporečne posmrtne oskrbe: cilj ni "kdo je to storil", ampak "kateri sistem in postopek sta dovolila to napako?" je vprašanje. Ljudje prikrivajo napako, če vedo, da bodo kaznovani; Skrita napaka se ponavlja. Postmortem ni poročilo o obtožbi, ampak učni dokument.
Dober postmortem vključuje: povzetek, vpliv (koliko uporabnikov, kako dolgo, koliko denarja), časovnico, temeljni vzrok(-e), kaj je šlo dobro/slabo in elemente ukrepanja – konkretne ukrepe, vsak z lastnikom in datumom.
Pozor: pri pisanju posmrtnih ocen z AI se prepričajte, da odstranite obtožujoč jezik (in sicer "oseba X je naredila napako"). Zakrijte tudi ID-je odjemalcev, interne IP-je in skrivnosti, ko podatke o dogodkih posredujete umetni inteligenci - posmrtni podatki se pogosto delijo z vsemi ljudmi.
Analiza temeljnega vzroka: 5 zakaj in umetna inteligenca
Klasična tehnika je "5 zakaj": vprašajte "zakaj?" do težave. Če znova in znova sprašujete, pridete od površinskega simptoma do pravega korena. "Storitev se je zrušila. Zakaj? Zmanjkalo je pomnilnika. Zakaj? Prišlo je do uhajanja. Zakaj? Posodobitev knjižnice ..." AI hitro zgradi to verigo in predlaga možne veje - vendar morate vsak "zakaj" preveriti s svojimi podatki; AI lahko zgradi tudi razumno, a napačno verigo.
Tabela resnosti
Raven
Vpliv
primer
intervencija
SEV1
Celoten sistem/kritična poslovna izguba
Plačilo je popolnoma padlo
Takoj celotna ekipa, poveljnik
SEV2
Večja disfunkcija
Prijave niso uspele
Hitro, na klic + podpora
SEV3
Delni/omejen učinek
Poročilo zamuja
med delovnim časom
SEV4
majhna/kozmetična
tipkarska napaka
navadna delovna vrsta
trije mini kovčki
Primer 1 – MTTR s 45 minut na 8 minut. Plačilna storitev se je zrušila. Dežurni inženir je umetni inteligenci dal zamaskirane dnevnike in zadnje informacije o uvajanju ter vprašal: "Kateri je najverjetnejši sprožilec v zadnjih 20 minutah?" je vprašal. Umetna inteligenca je pokazala, da se je kolaps začel v isti minuti kot zadnja uvedba. Inženir je takoj zavrnil to različico; Storitev se je vrnila v 8 minutah. Temeljni vzrok (napaka v bazenu povezav v novi različici) je bil nato priročno raziskan.
Primer 2—posmrtna skica v 20 minutah. Po SEV2 je bila ekipa utrujena in ni imela moči za pisanje poročila; pogosto je bilo poročilo odloženo več tednov. Tokrat so AI dali časovnico in opombe o dogodkih ter izdelali posmrtno skico brez kaznivih dejanj. Umetna inteligenca je ustvarila čeden okvir za učinke, časovnico in ukrepe; Ekipa ga je napolnila z dejstvi in objavila v 20 minutah. Lekcija ni bila izgubljena.
Primer 3 – ujet napačen temeljni vzrok. V enem primeru je umetna inteligenca rekla "glavni vzrok preobremenjenosti baze podatkov" in zdelo se je razumno. Toda inženir je potrdil meritve: obremenitev baze podatkov je bila v času incidenta normalna. Pravi vzrok je bila zunanja težava DNS. Začetna hipoteza o AI je bila tekoča, a napačna; Validacija s podatki je preprečila objavo poročila z napačnim zaključkom.
Štiri predloge za kopiranje
1) Hitra triaža v času dogodka:
Doživljamo produkcijski dogodek. Prikriti simptomi: [SIMPTOM]. Zadnje spremembe: [ZADNJA UMEVITEV/SPREMEMBA]. Povejte mi: (1) 3 najverjetnejše hipoteze o glavnem vzroku po vrstnem redu verjetnosti, (2) ukaz/metriko, ki bo vsako preveril v 1 minuti, (3) najhitrejši VAREN korak ublažitve (npr. povrnitev nazaj). Strogo gledano; Navedite, da moram preveriti vsako hipotezo.
2) Nedolžna posmrtna skica:
Napišite brezhibno posmrtno skico iz spodnjih zapiskov incidenta. Razdelki: Povzetek, Vpliv (uporabnik/trajanje/cena), Časovnica, Glavni vzrok(i), Kaj je šlo dobro, Kaj je šlo slabo, Dejavni elementi (vsak z lastnikom + poljem datuma). Osredotočite se na poimenovanje, proces in sistem. Opombe: [MASKED]
3) Analiza 5 zakaj:
Zgradite verigo "5 zakaj", začenši z naslednjim simptomom: [SYMPTOM]. Pokaži, ali je na vsakem koraku več kot ena možna veja. Poleg vsakega "zakaj" napišite dokaz (dnevnik/metrika), ki ga bom pogledal, da ga preverim. Na koncu označite, kateri koraki še niso bili preverjeni.
4) Ustvarjanje uporabnih predmetov:
Glede na ta glavni vzrok predlagajte elemente, ki jih je mogoče ukrepati in preprečili, da bi se isti dogodek ponovil. Vsak element razvrstite po: (a) preprečevanju, odkrivanju ali zmanjševanju, (b) ocenjenem naporu, (c) vplivu. Razvrsti po največjem razmerju učinek/napor. Glavni vzrok: [X]
Šibek poziv/močan poziv
Slabo: "Storitev se je zrušila, kaj naj storim?"
Rezultat: brez konteksta; AI lahko poda splošna priporočila, ki ne ustrezajo vašemu primeru, in lahko celo odkrije dokončen glavni vzrok.
Strong: "Produkcijska plačilna storitev daje 5xx 5 minut. Zadnja uvedba je bila pred 6 minutami. Navedite 3 najverjetnejše hipoteze o vzroku po vrstnem redu verjetnosti, povejte ukazu, ki bo preveril vsako od njih, in predlagajte najhitrejšo varno ublažitev. Ne bodite natančni, navedite, da moram preveriti."
Razlika: drugi poziv podaja simptom, čas in zadnjo spremembo; zahteva hipotezo + preverjanje + zmanjšanje in ohranja AI nenatančno.
Pogoste napake
- Iskanje natančnega vzroka pred ublažitvijo. Zakasni ustavitev krvavitve in poveča MTTR.
- Objava prve hipoteze o AI brez njenega preverjanja. Tekoči, vendar lažni temeljni vzroki uhajajo v poročilo.
- Obtožujoči jezik. Posmrtno napisano anonimno spodbuja prikrivanje in ponavljajoče se napake.
- Akcijsko usmerjeno poročilo brez točk. Predlog brez lastnika in datuma ne bo nikoli uresničen.
- Skupna raba podatkov o dogodkih brez maskiranja. Postmortem je namenjen širokemu občinstvu; tajni/osebni podatki uhajajo.
- Nepriprava poti za vrnitev vnaprej. Če preobrat ni praktičen, se zmanjšanje upočasni.
Če povzamem
Obvladovanje incidentov je hitro odkrivanje, ublažitev, reševanje in učenje iz neizogibnih dogodkov; MTTD in MTTR sta ključni meritvi. Zlato pravilo je "najprej ublaži, nato razišči" in vrnitev na znano dobro različico je pogosto najhitrejša ublažitev. Umetna inteligenca je neprecenljiva pri povzemanju dnevnikov v času dogodka, zoževanju hipotez in izdelavi neoporečnih posmrtnih skic po dogodku – vendar je vaša odgovornost, da potrdite vsako hipotezo o vzroku s podatki, očistite jezik krivde in prikrijete podatke o dogodkih.
Aplikacijska naloga
Razmislite o preteklem (ali izmišljenem) dogodku. (1) Naj AI ustvari hipoteze in korake preverjanja s predlogo »hitre triaže na kraju samem«; Upoštevajte, katero hipotezo lahko potrdijo podatki. (2) Narišite poročilo z uporabo predloge »oris nedolžnega posmrtno« in ga napolnite z dejstvi. (3) Identificirajte vsaj dve predmeti, ki jih je mogoče ukrepati, in vsakemu določite lastnika in datum.
kontrolni seznam
- [ ] V času dogodka sem najprej pomislil na ublažitev (povrnitev nazaj/zaustavitev) in glavni vzrok pustil za pozneje.
- [ ] Vsako hipotezo o vzroku AI sem preveril z dnevnikom/metriko.
- [ ] Napisal sem ga v jeziku, ki ne obtožuje postmortema, s poudarkom na procesu in sistemu.
- [] Vsakemu elementu, ki ga je mogoče ukrepati, sem dodelil lastnika in datum.
- [] Zakril sem tajne in osebne podatke iz podatkov o dogodkih, ki sem jih dal AI.
- [ ] Glede na udarec sem pravilno določil stopnjo resnosti.