Kasu:
- Võime mõista intsidendi elutsüklit (avastamine, triaaž, leevendamine, lahendamine, surmajärgne), MTTD/MTTR mõõdikuid ja põhimõtet „kõigepealt leevenda, uuri hiljem”
- Võimalus kasutada tehisintellekti hüpoteeside kitsendamiseks juhtumi ajal ja luua laitmatu surmajärgne sketš, kinnitades iga algpõhjuse andmetega
- Oskus rakendada kirjutamise distsipliini keeles, mis ei süüdista surmajärgset ja jagada sündmuste andmeid neid maskeerides.
Iga süsteem laguneb lõpuks. Erinevus seisneb selles, kuidas head meeskonnad selleks vältimatuks sündmuseks valmistuvad ja kuidas nad õpivad. Juhtum on ootamatu sündmus, mis häirib või ähvardab häirida teenust: teenuse krahh, reageerimisajad hüppeliselt tõusvad, andmete kadu. Juhtumi juhtimine tähendab juhtumi võimalikult kiiret avastamist, leevendamist, lahendamist ja seejärel sellest õppimist. See on distsipliin, mis juhib DevOpsi ja SRE (Site Reliability Engineering) professionaale päeval ja öösel.
Sündmuse kvaliteeti mõõdavad kaks kriitilist mõõdikut: MTTD (keskmine tuvastamise aeg) ja MTTR (keskmine taastumise aeg). Eesmärk on kahandada mõlemat. Tehisintellekt lisab siia kaks suurt väärtust: logide ja mõõdikute kiire kokkuvõtte sündmuse ajal, et kitsendada võimalikku algpõhjust, ning pärast sündmust kiiresti surmajärgse (sündmusejärgse uurimise aruande) koostamine. Kuid otsused sündmuste käigu kohta – milline teenus välja lülitada, tagasi võtta, mida kliendile öelda – on teie teha.
Sündmuse elutsükkel
- Tuvastamine: kõlab häire või tuleb kliendi kaebus. Mida varem, seda parem.
- Triaaž: kui tõsine see on? Mis on domeen? Määratakse raskusastmed – tavaliselt SEV1 (kõige kriitilisem, kogu süsteem) kuni SEV4 (väike).
- Pange oma reageerimismeeskond kokku. Kriitiliste vahejuhtumite korral võtab intsidendi ülem koordineerimise enda kanda.
- Leevendage: peatage esmalt verejooks – sageli tagasipööramine või lipu katmine. Algpõhjuse leiate hiljem.
- Lahendus: rakendage püsiparandus.
- Õppige (postmortem): mis juhtus, miks see juhtus, kuidas vältida selle kordumist?
Näpunäide. Üks kõige kulukamaid vigu juhtunu ajal on verejooksu peatamise viivitamine, sest "kõigepealt uurime täpset algpõhjust." Reegel: kõigepealt vähendage (taastamise/taastamise teenus), seejärel küsige. Tuntud hea versiooni juurde tagasipöördumine on sageli kiireim leevendus.
Süüvaba surmajärgne kultuur
Tervete meeskondade selgrooks on laitmatu surmajärgse surma kultuur: eesmärk ei ole "kes seda tegi", vaid "milline süsteem ja protsess seda viga lubas?" on küsimus. Inimesed varjavad viga, kui nad teavad, et neid karistatakse; Varjatud viga kordub. Postmortem ei ole süüdistusaruanne, vaid õppedokument.
Hea postmortem sisaldab järgmist: kokkuvõte, mõju (mitu kasutajat, kui kaua, kui palju raha), ajaskaala, algpõhjus(ed), mis läks hästi/halvasti ja tegevusüksusi – konkreetsed meetmed, millest igaühel on omanik ja kuupäev.
Ettevaatust: tehisintellektiga surmajärgseid dokumente kirjutades välistage kindlasti süüdistav keel (nimelt "isik X tegi vea"). Sündmuste andmete edastamisel tehisintellektile maskeeritakse ka kliendi ID-d, sisemised IP-d ja saladused – surmajärgseid andmeid jagatakse sageli laialdaselt.
Algpõhjuste analüüs: 5 põhjust ja tehisintellekt
Klassikaline tehnika on "5 Miks": küsige "miks?" probleemile. Ikka ja jälle küsides jõuad pindmisest sümptomist pärisjuureni. "Teenus jooksis kokku. Miks? Mälu otsas. Miks? Tekkis leke. Miks? Teegi värskendus..." Tehisintellekt ehitab kiiresti selle ahela ja soovitab võimalikke harusid, kuid iga "miks" peate oma andmetega kontrollima; AI võib ehitada ka mõistliku, kuid vale ahela.
Raskusastme tabel
Tase
Mõju
näide
sekkumine
SEV1
Kogu süsteem/kriitiline ärikahju
Makse langes täielikult
Koheselt kogu meeskond, komandör
SEV2
Suur düsfunktsioon
Sisselogimine ebaõnnestus
Kiire, valve + tugi
SEV3
Osaline/piiratud mõju
Aruanne viibib
tööajal
SEV4
väike/kosmeetiline
kirjaviga
tavaline tööjärjekord
kolm minikarpi
Juhtum 1 – MTTR 45 minutist 8 minutini. Makseteenus jooksis kokku. Valveinsener andis AI-le maskeeritud logid ja viimase kasutuselevõtu teabe ning küsis: "Mis on viimase 20 minuti kõige tõenäolisem päästik?" küsis ta. Tehisintellekt näitas, et kokkuvarisemine algas viimase kasutuselevõtuga samal minutil. Insener keeras selle versiooni kohe tagasi; Teenus naasis 8 minuti pärast. Seejärel uuriti mugavalt algpõhjust (ühendusbasseini viga uues versioonis).
Juhtum 2 – surmajärgne sketš 20 minutiga. Pärast SEV2 oli meeskond väsinud ja tal polnud jõudu raportit kirjutada; sageli hilines aruanne nädalaid. Seekord andsid nad tehisintellektile ajaskaala ja vahejuhtumite märkmed ning koostasid kuritegevusevaba surmajärgse visandi. AI lõi mõjude, ajaskaala ja tegevusüksuste jaoks korraliku raamistiku; Meeskond täitis selle faktidega ja avaldas selle 20 minutiga. Õppetund ei läinud kaotsi.
Juhtum 3 – tabati vale algpõhjus. Ühel juhul ütles AI "juurte põhjus andmebaasi ülekoormus" ja see tundus mõistlik. Kuid insener kinnitas mõõdikuid: andmebaasi koormus oli intsidendi ajal normaalne. Tegelik põhjus oli väline DNS-i probleem. AI esialgne hüpotees oli muutuv, kuid vale; Andmetega kinnitamine takistas aruande avaldamist vale järeldusega.
Neli kopeeritavat malli
1) Kiire triaaž intsidendi ajal:
Käimas on tootmissündmus. Maskeeritud sümptomid: [SÜMPTOM]. Viimased muudatused: [LAST DEPLOY/CHANGE]. Andke mulle:(1) 3 kõige tõenäolisemat algpõhjuse hüpoteesi tõenäosuse järjekorras,(2) käsk/mõõdik, mis kinnitab iga 1 minuti jooksul,(3) kiireim OHUTU leevendusetapp (nt tagasivõtmine). Rangelt võttes; Öelge, et pean iga hüpoteesi kontrollima.
2) Süütu surmajärgne sketš:
Kirjutage allpool olevate juhtumite märkmete põhjal laitmatu surmajärgne visand. Jaotised: Kokkuvõte, Mõju (kasutaja/kestus/kulu), Ajaskaala, Algpõhjus(ed), Mis läks hästi, Mis läks halvasti, Tegevusüksused (igaüks omaniku + kuupäevaväljaga). Keskenduge nimetamisele, protsessile ja süsteemile. Märkused: [MASKED]
3) 5 põhjuse analüüs:
Koostage ahel "5 miks", alustades järgmisest sümptomist: [SÜMPTOM]. Näidake, kas igal etapil on rohkem kui üks võimalik haru. Kirjutage iga "miks" juurde tõendid (log/meeter), mida ma selle kontrollimiseks vaatan. Lõpus märkige, millised sammud pole veel kinnitatud.
4) Toimivate üksuste loomine:
Vastavalt sellele algpõhjusele soovitage toiminguid, mis takistavad sama sündmuse kordumist. Klassifitseerige iga üksus: (a) ennetamise, avastamise või vähendamise, (b) hinnangulise jõupingutuse, (c) mõju järgi. Sorteeri suurima mõju/koormuse suhte järgi. Algpõhjus: [X]
Nõrk viip / Tugev viip
Nõrk: "Teenus on jooksnud, mida ma peaksin tegema?"
Tulemus: kontekst puudub; AI võib anda üldisi soovitusi, mis ei sobi teie juhtumiga, ja võib isegi välja tuua lõpliku algpõhjuse.
Tugev: "Tootmismakseteenus on andnud 5xx 5 minutit. Viimane kasutuselevõtt oli 6 minutit tagasi. Esitage 3 kõige tõenäolisemat algpõhjuse hüpoteesi tõenäosuse järjekorras, öelge käsk, mis neid kõiki kontrollib, ja soovitage kiireimat ohutut leevendusmeetodit. Ärge olge konkreetne, öelge, et ma pean kontrollima."
Erinevus: teine viip annab sümptomi, ajastuse ja viimase muudatuse; see nõuab hüpoteesi + kontrollimist + vähendamist ja hoiab AI ebatäpsena.
Levinud vead
- Enne leevendamist otsige täpne algpõhjus. See aeglustab verejooksu peatamist ja suurendab MTTR-i.
- Tehisintellekti esimese hüpoteesi avaldamine ilma seda kontrollimata. Vedelad, kuid valed algpõhjused lekivad aruandesse.
- Süüdistav keel. Anonüümselt kirjutatud postmortem soodustab varjamist ja vea kordumist.
- Tegevusele orienteeritud aruanne ilma täppideta. Ilma omaniku ja kuupäevata ettepanekut ei rakendata kunagi.
- Sündmuse andmete jagamine neid maskeerimata. Postmortem läheb laiale publikule; salajased/isikuandmed on lekkinud.
- Tagasipööramisteed ette ei valmistata. Kui ümberpööramine ei ole otstarbekas, aeglustub vähendamine.
Kokkuvõttes
Juhtumihaldus seisneb vältimatute sündmuste kiires tuvastamises, leevendamises, lahendamises ja nendest õppimises; MTTD ja MTTR on peamised mõõdikud. Kuldne reegel on "leevenda enne, uuri hiljem" ja teadaolevalt hea versiooni juurde naasmine on sageli kõige kiirem leevendus. Tehisintellekt on hindamatu tähtsusega sündmuse ajal logide kokkuvõtte tegemisel, hüpoteeside kitsendamisel ja pärast sündmust laitmatute surmajärgsete visandite loomisel – kuid teie kohustus on kinnitada iga algpõhjuse hüpotees andmetega, süüteo keel ja sündmuste andmete varjamine.
Rakenduse ülesanne
Mõelge mineviku (või väljamõeldud) sündmusele. (1) Laske tehisintellektil genereerida hüpoteese ja kontrollietappe, kasutades malli „kohapealne kiirtriaaž”; Pange tähele, millist hüpoteesi saab andmetega kinnitada. (2) Visandage aruanne, kasutades malli „süüdi ei ole surmajärgne ülevaade” ja täitke see faktidega. (3) Tehke kindlaks vähemalt kaks hagitavat üksust ning määrake igaühele omanik ja kuupäev.
kontrollnimekiri
- [ ] Vahejuhtumi ajal mõtlesin esmalt leevendamisele (tagasitõmbamine/väljalülitamine) ja jätsin algpõhjuse hilisemaks.
- [ ] Kontrollisin kõiki tehisintellekti algpõhjuste hüpoteese logi/meetrikaga.
- [ ] Kirjutasin selle keeles, mis ei süüdista surmajärgset, keskendudes protsessile ja süsteemile.
- [ ] Määrasin igale vaidlusalusele üksusele omaniku ja kuupäeva.
- [ ] Maskeerisin tehisintellektile edastatud sündmuste andmetest salajase ja isikliku teabe.
- [ ] Määrasin raskusastme õigesti vastavalt mõjule.