Unitate 7 / 11

Managementul incidentelor și postmortem: Analiza cauzei fundamentale cu inteligență artificială

Câștiguri:

  • Abilitatea de a înțelege ciclul de viață al unui incident (detecție, triaj, atenuare, rezoluție, post-mortem), valorile MTTD/MTTR și principiul „atenuare mai întâi, investigare mai târziu”
  • Abilitatea de a utiliza AI pentru a restrânge ipotezele la momentul incidentului și pentru a produce o schiță post-mortem fără vină, validând fiecare cauză principală cu date
  • Capacitatea de a aplica disciplina scrisului într-o limbă care nu dă vina pe autopsie și de a partaja datele despre evenimente prin mascarea acestora.

Fiecare sistem se defectează în cele din urmă. Diferența este modul în care echipele bune se pregătesc pentru acest eveniment inevitabil și cum învață. Incidentul este un eveniment neașteptat care întrerupe sau amenință să întrerupă serviciul: o prăbușire a serviciului, timpii de răspuns crescând vertiginos, o pierdere de date. Managementul incidentelor înseamnă detectarea, atenuarea, rezolvarea incidentului cât mai repede posibil și apoi învățarea din el. Aceasta este disciplina care conduce profesioniștii DevOps și SRE (Site Reliability Engineering), zi și noapte.

Două metrici critice măsoară calitatea evenimentului: MTTD (Timpul mediu de detectare) și MTTR (Timpul mediu de recuperare). Scopul este să le micșorăm pe ambele. AI adaugă două mari valori aici: rezumarea rapidă a jurnalelor și a valorilor la momentul evenimentului pentru a restrânge posibila cauză principală și elaborarea rapidă a unui post-mortem (raport de investigație post-eveniment) după eveniment. Dar deciziile cu privire la cursul evenimentelor - ce serviciu să dezactivați, rollback, ce să spuneți clientului - sunt ale dvs.

Ciclul de viață al unui eveniment

  1. Detectare: sună o alarmă sau vine o plângere a clientului. Cu cât mai devreme, cu atât mai bine.
  2. Triage: Cât de grav este? Care este domeniul? Sunt atribuite niveluri de severitate – de obicei SEV1 (cel mai critic, întregul sistem) la SEV4 (minor).
  3. Adunați-vă echipa de răspuns. În incidentele critice, un comandant de incident își asumă coordonarea.
  4. Atenuare: mai întâi opriți sângerarea - adesea o deplasare sau acoperirea unui steag. Veți găsi cauza principală mai târziu.
  5. Rezolvare: Aplicați remedierea permanentă.
  6. Învățați (postmortem): Ce s-a întâmplat, de ce s-a întâmplat, cum prevenim să se repete?
Sfat: Una dintre cele mai costisitoare greșeli la momentul incidentului este amânarea opririi sângerării, deoarece „să ajungem mai întâi la cauza exactă la rădăcină”. Regula: mai întâi reduceți (serviciu de restaurare/restaurare), apoi întrebați. Revenirea la o versiune cunoscută bună este adesea cea mai rapidă atenuare.

Cultura post-mortem fără vinovăție

Coloana vertebrală a echipelor sănătoase este o cultură post-mortem fără vină: scopul nu este „cine a făcut-o”, ci „ce sistem și proces a permis această greșeală?” este întrebarea. Oamenii ascund greșeala dacă știu că vor fi pedepsiți; Eroarea ascunsă se repetă. Postmortem nu este un raport de acuzație, ci un document de învățare.

Un post-mortem bun include: rezumatul, impactul (câți utilizatori, cât timp, câți bani), cronologia, cauzele principale, ce a mers bine/prost și măsurile concrete, fiecare cu un proprietar și o dată.

Atenție: atunci când scrieți autopsie cu IA, asigurați-vă că eliminați limbajul acuzator (și anume „persoana X a făcut o greșeală”). De asemenea, mascați ID-urile clientului, IP-urile interne și secretele atunci când furnizează date despre evenimente către AI – autopsia este adesea partajată pe scară largă.

Analiza cauzei principale: 5 de ce și AI

O tehnică clasică este „5 de ce”: întreabă „de ce?” la o problemă. Întrebând din nou și din nou, treci de la simptomul superficial la rădăcina reală. "Serviciul s-a prăbușit. De ce? Memorie lipsită. De ce? A existat o scurgere. De ce? O actualizare a bibliotecii..." AI ​​se grăbește să construiască acest lanț și să sugereze posibile ramuri - dar trebuie să verificați fiecare "de ce" cu datele dvs.; AI poate construi, de asemenea, un lanț rezonabil, dar greșit.

Tabel de severitate

Nivel

Impact

exemplu

interventie

SEV1

Întregul sistem/pierdere critică de afaceri

Plata a scăzut complet

Instantaneu, întreaga echipă, comandantul

SEV2

Disfuncție majoră

Conectarea nu a reușit

Rapid, on-call + asistență

SEV3

Efect parțial/limitat

Un raport este întârziat

în timpul orelor de lucru

SEV4

mic/cosmetic

greșeală de tipar

coadă de lucru obișnuită

trei mini cutii

Cazul 1 — MTTR de la 45 de minute la 8 minute. Serviciul de plată s-a prăbușit. Inginerul de serviciu a dat jurnalele mascate și ultimele informații despre desfășurare AI și a întrebat „Care este cel mai probabil declanșator în ultimele 20 de minute?” întrebă el. AI a arătat că prăbușirea a început în același minut cu ultima desfășurare. Inginerul a anulat imediat acea versiune; Serviciul a revenit în 8 minute. Cauza principală (o eroare a grupului de conexiuni în noua versiune) a fost apoi investigată convenabil.

Cazul 2 — schiță postmortem în 20 de minute. După un SEV2, echipa era obosită și nu avea puterea să scrie un raport; de multe ori raportul a fost amânat cu câteva săptămâni. De data aceasta, au dat cronologia și notele incidentului AI și au produs o schiță post-mortem fără crimă. AI a creat un cadru ordonat pentru impact, cronologie și elemente de acțiune; Echipa l-a umplut cu fapte și l-a publicat în 20 de minute. Lecția nu s-a pierdut.

Cazul 3 – cauza principală greșită prinsă. Într-un caz, AI a spus „supraîncărcarea bazei de date cu cauze rădăcină” și părea rezonabil. Dar inginerul a confirmat valorile: încărcarea bazei de date era normală la momentul incidentului. Cauza reală a fost o problemă DNS externă. Ipoteza inițială a IA a fost fluidă, dar greșită; Validarea cu date a împiedicat publicarea raportului cu o concluzie incorectă.

Patru șabloane copiabile

1) Triaj rapid la momentul incidentului:

Ne confruntăm cu un eveniment de producție. Simptome mascate: [SIMPTOM]. Ultimele modificări: [LAST DEPLOY/CHANGE]. Dați-mi:(1) cele mai probabile 3 ipoteze ale cauzei principale în ordinea probabilității,(2) comanda/metrica care va verifica fiecare în 1 minut,(3) cel mai rapid pas de atenuare SAFE (de exemplu, rollback). Strict vorbind; Precizați că trebuie să verific fiecare ipoteză.

2) Schiță post-mortem nevinovată:

Scrieți o schiță post-mortem fără vină din notele incidentului de mai jos. Secțiuni: Rezumat, Impact (utilizator/durată/cost), Cronologie, Cauze principale, Ce a mers bine, Ce a mers prost, Acțiuni (fiecare cu proprietar + câmp pentru dată). Concentrați-vă pe denumire, proces și sistem. Note: [MASCAT]

3) Analiza 5 de ce:

Construiți un lanț „5 de ce”, începând cu următorul simptom: [SIMPTOM]. Arată dacă există mai mult de o ramură posibilă la fiecare pas. Lângă fiecare „de ce” scrieți dovezile (log/metric) pe care mă voi uita pentru a le verifica. La sfârșit, marcați care pași nu au fost încă verificați.

4) Crearea de elemente acționabile:

În funcție de această cauză principală, sugerați elemente care pot fi acționate care vor împiedica repetarea aceluiași eveniment. Clasificați fiecare element după: (a) prevenire, detectare sau reducere, (b) efort estimat, (c) impact. Sortați după cel mai mare raport impact/efort. Cauza principală: [X]

Prompt slab / Prompt puternic

Slab: „Serviciul s-a prăbușit, ce ar trebui să fac?”

Rezultat: fără context; AI poate face recomandări generale care nu se potrivesc cu cazul dvs. și poate chiar să vină cu o cauză fundamentală definitivă.

Puternic: „Serviciul de plată de producție a dat 5xx de 5 minute. Ultima implementare a fost acum 6 minute. Dați cele mai probabile 3 ipoteze de cauza principală în ordinea probabilității, spuneți comanda care va verifica fiecare dintre ele și sugerați cea mai rapidă atenuare sigură. Nu fiți specific, spuneți că trebuie să verific."

Diferență: al doilea prompt oferă simptomul, momentul și ultima modificare; cere ipoteză + verificare + reducere și menține AI imprecisă.

Greșeli comune

  • Căutați cauza exactă înainte de a atenua. Întârzie oprirea sângerării și crește MTTR.
  • Publicarea primei ipoteze a AI fără a o verifica. Cauze rădăcină fluide, dar false se scurg în raport.
  • Limbajul acuzator. Postmortem scris anonim favorizează ascunderea și repetarea erorilor.
  • Raport orientat spre acțiune fără puncte marcante. O propunere fără proprietar și dată nu va fi niciodată implementată.
  • Partajarea datelor despre evenimente fără a le masca. Postmortem se adresează unui public larg; date secrete/personale sunt scurse.
  • Nu se pregătește calea de returnare în avans. Dacă inversarea nu este practică, reducerea este încetinită.

În concluzie

Managementul incidentelor se referă la detectarea rapidă, atenuarea, rezolvarea și învățarea din evenimente inevitabile; MTTD și MTTR sunt valori cheie. Regula de aur este „atenuarea întâi, investigarea mai târziu”, iar revenirea la versiunea cunoscută este adesea cea mai rapidă atenuare. AI este de neprețuit în rezumarea jurnalelor în momentul evenimentului, în restrângerea ipotezelor și în producerea de schițe post-mortem fără vină după eveniment - dar este responsabilitatea dvs. să validați fiecare ipoteză a cauzei principale cu date, să eliminați limbajul de vină și să mascați datele despre eveniment.

Sarcina de aplicare

Luați în considerare un eveniment trecut (sau fictiv). (1) Puneți AI să genereze ipoteze și pași de verificare cu șablonul „triaj rapid la scenă”; Observați ce ipoteză poate fi confirmată de date. (2) Schițați un raport folosind șablonul „schiță postmortem nevinovat” și completați-l cu fapte. (3) Identificați cel puțin două elemente acționabile și atribuiți fiecăruia un proprietar și o dată.

lista de verificare

  • [ ] La momentul incidentului, m-am gândit mai întâi să atenuez (retroducere/închidere) și am lăsat cauza principală pentru mai târziu.
  • [ ] Am verificat fiecare ipoteză a cauzei principale a IA cu log/metric.
  • [ ] Am scris-o într-o limbă care nu dă vina post-mortem, concentrându-mă pe proces și sistem.
  • [ ] Am atribuit fiecărui element acționabil un proprietar și o dată.
  • [ ] Am mascat informațiile secrete și personale din datele despre eveniment pe care le-am dat AI.
  • [ ] Am atribuit corect nivelul de severitate în funcție de impact.