Kasu:
- Oskus mõista vaadeldavuse kolme sammast (meetria, logi, jälg) ja nelja kuldset signaali ning lasta tehisintellektil genereerida PromQL päringuid, häirereegleid ja armatuurlaudu
- Võimalus vältida häire väsimust, hoides häireid tegevusele orienteeritud ja õige kiireloomulisusega ning testides lävesid teie enda süsteemi ajalooliste andmete alusel
- Võimalus vältida privaatsust ja salajast leket, maskeerides tundlikud alad enne palkide tehisintellektile andmist
Ehkki süsteem võib tunduda töötavat, võib see sees olla suremas: mälu täitub aeglaselt, reageerimisajad pikenevad, veamäär tõuseb. Ainus viis seda märgata on süsteemi pidev jälgimine. Täiustatud kontseptsioon on jälgitavus: võime mõista süsteemi sees toimuvat, vaadates selle väliseid märke. Vaadeldavusel on kolm sammast ja DevOpsi professionaal kasutab kõiki kolme:
- Mõõdik: aja jooksul mõõdetud arvväärtused — protsessori kasutus, päringute arv, reaktsiooniaeg, veamäär. "Kui palju?" vastab küsimusele.
- Logi: süsteemi toodetud tekstisündmuste kirjed — "kasutaja logis sisse", "andmebaasiühendus katkes". "Mis täpselt juhtus?" vastab küsimusele.
- Jälgimine: tee, mida taotlus järgib süsteemis teenuselt teenusele üleminekul, ja iga sammu kestus. "Kus on aeglus?" vastab küsimusele.
Levinumad tööriistad: Prometheus mõõdikute jaoks, Grafana visualiseerimiseks, Loki/ELK logi jaoks, Jaeger/OpenTelemetry jälgimiseks. AI on väga osav nende tööriistade päringukeelte (eriti Prometheuse PromQL), häirereeglite ja armatuurlaua konfiguratsioonide kirjutamisel. See on ka koht, kus tehisintellekt on oma tugevaim: teeb kokkuvõtteid suurtest logide ja mõõdikute tükkidest ning märgib kõrvalekaldeid.
Teeme ühe lausega selgeks, mis vahe on jälgimisel ja vaadeldavusel: monitooring on sulle juba tuttavate küsimuste esitamine (“Kas protsessor on üle 90%?”); jälgitavus on võimalus esitada küsimusi, mida te veel ei teadnud ("miks see imelik aeglus juhtub ainult teatud kliendi jaoks teatud kellaajal?"). Kaasaegsed süsteemid on nii keerulised, et te ei suuda ette näha kõiki rikkeviise; Seetõttu muutub kriitiliseks võimalus koguda rikkalikke mõõdikuid, logisid ja jälgi ning seejärel neid põhjalikke päringuid teha – see tähendab vaadeldavust. Siin tuleb AI mängu "varem tundmatule küsimusele" vastamisel: see skannib kiiresti teie käsutuses olevad algandmed, soovitab mustreid ja kõrvalekaldeid ning te jõuate nende vihjete kontrollimisega algpõhjuseni.
Samm-sammult: mida ja kuidas jälgida?
- Valige õiged mõõdikud. Tööstuses võetakse aluseks "neli kuldset signaali": latentsusaeg, liiklus, vead, küllastus - kui täis ressurss on. Need võtavad kokku enamiku teenuste tervise.
- Koguge mõõdikuid. Laske rakendusel esitada lõpp-punkt, mida Prometheus saab lugeda.
- Seadistage armatuurlauad. Visualiseerige need mõõdikud Grafanas.
- Kirjutage häirereeglid. Keda hoiatatakse künnise ületamise korral ja kuidas?
- Tsentraliseerige logid. Muutke kõik teenuselogid ühes kohas otsitavaks.
- Vähendage müra. Liiga palju häiret tekitab "erksuse väsimuse"; Tähtis alarm kaob.
Näpunäide: hea äratus vastab kahele asjale: see on kasutatav ja selle kiireloomulisus on õige. Äratus, mis äratab kellegi kell 3 öösel, peab olema midagi, mis tegelikult nõuab öist sekkumist. Ärge äratage kedagi millegi pärast, mis ei nõua omaette tegutsemist, näiteks "CPU 70%"; kuvage see tahvlil.
Kuidas kirjutada häirereeglit?
Hoiatus koosneb kolmest komponendist: tingimus (milline mõõdik ületab mis läve ja kui kaua), kestus (5 minutit, et vältida hetkeliste kõikumiste esilekutsumist) ja tähtsus/tegevus (kellele, millise kanali kaudu). AI loob need kolm meisterlikult õiges kontekstis. Näiteks reegli "kriitiline häire, kui veamäär ületab 5% 5 minuti jooksul" tõlkimine PromQL-i on tehisintellekti jaoks sekundi murdosa ülesanne, kuid te otsustate, kas lävi on teie süsteemi jaoks õige.
Ettevaatust: AI soovitatud häireläved on üldised oletused. Teie süsteemi tavaline koormus, tolerants ja mõju tööle on erinevad. Enne kui määrate künnise otse tootesse, vaatate oma ajaloolisi andmeid ja küsite: "Mitu korda on see lävi varem käivitatud, kui paljud neist olid tõelised probleemid?" Vastake küsimusele.
Logi privaatsus: kriitiline hoiatus
Palgid on kõige sagedamini tähelepanuta jäetud lekete allikas. Logirida võib kogemata sisaldada parooli, krediitkaardi numbrit või isikuandmeid (HIKK/GDPR all). Logide kleepimisel AI-sse analüüsimiseks tehke järgmist.
- Maskeerige tundlikud alad. Asendage väärtused, nagu luba, parool, e-post, ID-number, väärtusega <REDACTED>.
- Tooge näiteid, mitte kõiki. Miljoni rea asemel piisab sageli mõnesajast esindusreast.
- Valige asutuse heakskiidetud sõiduk. Eriti tootmislogide jaoks kasuta tööriista, mille andmed ei lähe koolitusele.
Neli kuldset signaali ja häirelauda
signaali
mõõdetuna
Häirelävi näide
kiireloomulisus
latentsusaeg
reageerimisaeg
p95 > 800 ms, 5 min
kõrge
liiklust
Taotlus/sek
Järsk 300% tõus/langus
keskmine
Viga
Ebaõnnestunud päringu määr
> 5%, 5 min
kriitiline
Küllastus
ressursside hõivatus
ketas > 85%
kõrge
kolm minikarpi
Juhtum 1 – 30 sekundi jooksul kokku võetud 400 logirida. Teenus oli aeglustunud. Insener andis maskeeritud 400 logirida AI-le ja ütles: "võtke kokku korduvad veamustrid ja aja intensiivsus." AI näitas, et konkreetne väline API-kõne aegub iga 30 sekundi järel. Algpõhjus leiti 30 sekundiga; Logide käsitsi skannimine võtaks pool tundi.
Juhtum 2 – alarmi väsimus lahendatud. Üks meeskond sai 200 häiret päevas ja ignoreeris neid kõiki – kuni tähelepanuta jäi ka tõeline katkestushäire. Esitage tehisintellektile kõik hoiatusreeglid ja küsige, "millised neist ei ole rakendatavad ja milliseid saab kombineerida?" küsisid nad. Häirete arv vähenes 12-ni päevas; Iga häiret võeti nüüd tõsiselt.
Juhtum 3 – varakult tabati vale lävi. YZ soovitas ketta jaoks "Hoiata, kui 95% täis". Insener vaatas ajaloolisi andmeid: kui ketas saavutas 95%, oli sekkumiseks vähe aega. See alandas künnist 80% -ni ja lisas teise häire, mis põhineb "kasvumääral". Kinnitamine hoidis ära tegeliku kesköö katkestuse.
Neli kopeeritavat malli
1) Logi kokkuvõte (maskeeritud):
Analüüsige allolevat loginäidet (maskasin tundlikud väärtused funktsiooniga <REDACTED>). Andke mulle: (1) korduvad veamustrid, (2) kontsentratsioon aja jooksul, (3) kõige tõenäolisem algpõhjus ja (4) 3 mõõdikut, mida ma kontrollimiseks vaatan. Logi: [LINES]
2) Häirereegli genereerimine:
Kirjutage Prometheuse/Alertmanageri jaoks häirereegel: genereerige [SEVERITY] alarm, kui [THRESHOLD] ületab [METRIC][DURATION]. Reegel peaks olema tegevusele orienteeritud ning sisaldama annotatsiooni ja käsiraamatu lingivälja. Selgitage PromQL-i ja kirjutage, miks see lävi on mõistlik.
3) PromQL-i päringu kirjutamine/deklareerimine:
Kirjutage PromQL-i päring, mis mõõdab: [EX. 5xxtõrkemäära protsent viimase 5 minuti jooksul]. Selgitage päringut samm-sammult. Seejärel öelge mulle, milline peaks olema selle väärtuse tervislik vahemik.
4) Armatuurlaua kujundus:
Kujundage [SERVICE] jaoks Grafana armatuurlaud: milliste paneelidega peaksin kuvama neli kuldset signaali (latentsus, liiklus, viga, küllastus)? Soovitage iga paneeli jaoks mõõdikut, visualiseerimise tüüpi ja mõistlikku läve. Eesmärk: näha valvuri tervislikku seisundit 10 sekundiga.
Nõrk viip / Tugev viip
Nõrk: "Mis selles logis on?" (järgneb 5000 rida toorpalki, märgid selles)
Tulemus: lekite saladusi ja tehisintellekt annab sihipärase, pealiskaudse kokkuvõtte.
Tugev: "Leidke korduvad veamustrid ja aja intensiivsus allolevast 300-realisest maskeeritud logi näitest; öelge mulle kõige tõenäolisem algpõhjus ja mõõdikud, mida ma kontrollimiseks vaatan. Tegin märgid <REDACTED>."
Erinevus: teine viip annab maskeeritud ja keskendunud näite, paludes selget analüüsiväljundit; See on nii ohutu kui ka kasulik.
Levinud vead
- Logi kleepimine AI-sse ilma seda maskeerimata. Levinuim salajaste/isikuandmete leke.
- Alarmide seadistamine kõige jaoks. Häireväsimus matab tõelise häire.
- Mittetoimiv alarm. See on hoiatav müra, mille vastu ei saa keegi midagi ette võtta.
- AI lävega nõustumine ilma kahtluseta. Lävi tuleks määrata vastavalt teie süsteemi ajaloole.
- Vaadates lihtsalt mõõdikut. Ilma logi ja jäljeta ei leia enamasti algpõhjust.
- Äratuse aega ei määra (ehk). Hetkelised kõikumised tekitavad valehäireid.
Kokkuvõttes
Vaadeldavus; See on võime mõista süsteemi sisemust väljastpoolt mõõdikute, logide ja jälgede abil. Neli kuldset signaali (latentsus, liiklus, viga, küllastus) võtavad kokku enamiku teenuste seisundi. AI on väga võimas PromQL-i päringute, häirereeglite ja armatuurlaudade kirjutamisel ning suurte logitükkide kokkuvõtte tegemisel ja kõrvalekallete leidmisel. Kuid teie kohustus on kontrollida häireläve oma süsteemi ajaloo põhjal, hoida häireid tegevusele orienteeritud ja mitte kunagi jagada logisid neid varjamata.
Rakenduse ülesanne
Teenuse (või näidisteenuse) jaoks: (1) Laske malliga "Alarmi reegli genereerimine" luua häirereegel veamäära jaoks ja määrake soovitatud lävi väärtuseks "Mitu korda see on minevikus käivitunud?" Testige seda küsimusega; (2) maskeerige teil olev logiproov ja laske seda malliga "Logi kokkuvõte" analüüsida; (3) märkige üles, millist mõõdikut kõige tõenäolisema algpõhjuse kinnitamiseks vaatate.
kontrollnimekiri
- [ ] Valisin jälgitavad mõõdikud nelja kuldse signaali põhjal.
- [ ] Maskeerisin kõik AI-le antud palgid tundlike piirkondade osas.
- [ ] Kontrollisin, et iga häire oli tegevusele suunatud ja õige kiireloomulisusega.
- [ ] Testisin häireläve oma süsteemi ajalooliste andmetega.
- [ ] Filtreerisin hetkelised kõikumised, lisades häiretele (kestuse).
- [ ] Kasutasin algpõhjuseks koos mõõdikut + logi + jälge.