Ieguvumi:
- Spēja apkopot lielas baļķu izgāztuves, maskējot un filtrējot tās AI, un izveidot laika skalu
- Spēja novērtēt AI noteiktās laika attiecības kā hipotēzes, nevis cēloņsakarību
- Spēja apstiprināt pamatcēloņa hipotēzi ar metriku un kodu un sagatavot pēcnāves skici
Kad programmatūra darbojas ražošanas režīmā (tiešraides vidē), tikai trases, metrika un žurnāli (ar laika zīmogu apzīmētas žurnāla līnijas, ko lietojumprogramma izveido tās darbības laikā) norāda, ko tā dara. Nozīmīga signāla izvilkšana no tūkstošiem, dažreiz miljoniem žurnālu līniju pārtraukuma laikā ir saspringtākais un laikkritiskākais brīdis, reaģējot uz incidentu. Šeit AI var būt palīgs, apkopojot apjomīgu tekstu, izvelkot modeļus un ģenerējot hipotēzes, ja vien ievērojat privātuma un verifikācijas ierobežojumus.
Šajā nodaļā mēs mācāmies izmantot AI novērojamības kontekstā — spēju izprast sistēmas iekšējo stāvokli, aplūkojot tās ārējos izvadus: jēgas izgūšanu no log trokšņa, kļūdas laika skalas noteikšanu, atkārtojošos modeļu atrašanu un pēcnāves uzmetumu. Kritisks brīdinājums jau iepriekš: neapstrādāti ražošanas žurnāli bieži satur personas datus un noslēpumus; nejauša to ievietošana AI rīkā ir nopietns pārkāpums.
Kāpēc žurnāli ir grūti, kāpēc AI ir noderīgs?
Žurnāli ir sarežģīti trīs iemeslu dēļ: skaļums (to ir pārāk daudz), troksnis (daudzas līnijas nav svarīgas) un juceklis (notikums ir izkaisīts pa dažādu pakalpojumu žurnāliem). Cilvēka acs šajā kaudzē nogurst un palaiž garām svarīgo līniju.
AI labi spēj apkopot lielus teksta blokus, skaitīt atkārtojošos modeļus un jautāt: "Kas mainījās tieši pirms šī kļūdu uzliesmojuma?" Tas ir spēcīgs, lai izveidotu laika attiecības, piemēram, Tomēr ir divi ierobežojumi. Pirmais ir konteksta logs: žurnālu skaits, ko varat ievietot modelī, ir ierobežots, tāpēc vispirms ir jāfiltrē un jāizlasa. Otrkārt, validācija: AI sakot “šeit ir galvenais cēlonis” ir hipotēze; Nepieņemiet lēmumu, neapstiprinot to ar metriku un kodu.
Uzmanību! Neapstrādātos ražošanas žurnālos var būt ietverta IP adrese, e-pasts, marķieris, sesijas ID un dažreiz atklāts noslēpums. Maskējiet tos pirms ievadīšanas AI vai izmantojiet tikai uzņēmuma apstiprinātus, ar datiem aizsargātus rīkus. Mēs padziļinām šo tēmu 10. nodaļā.
Soli pa solim: no žurnāla līdz pamatcēlonim
- Sašauriniet laika logu. Nosakiet minūtes, kad notikums sākās; Pārbaudiet šo logu, nevis visu dienu.
- Filtrējiet troksni. Iznīciniet zināmās atkārtotās, nekaitīgās līnijas; Koncentrējieties uz kļūdu (ERROR), brīdinājumu (WARN) un pirmo novirzes momentu.
- Maskējiet sensitīvus datus. Pirms nodot tos AI, notīriet personas datus un noslēpumus.
- Izveidojiet kopsavilkumu un laika skalu. Lūdziet AI apkopot notikumu hronoloģijā (“vispirms tas, tad tas”).
- Apstipriniet hipotēzi ar metriku un kodu. AI norādītais iemesls; Apstipriniet ar informācijas paneli, attiecīgo kodu un izvietošanas laika grafiku, ja tāds ir.
- Iemācīto liec rakstiski. Izveidojiet pēcnāves skici un uzskaitiet preventīvās darbības.
Trīs mini futrāļi
1. gadījums — 5 minūtēs apkopotas 40 000 rindiņas. Maksājumu pakalpojums ziņoja par periodisku kļūdu 12 minūtes. Komanda ievadīja AI attiecīgo 20 minūšu maskēto žurnālu logu (aptuveni 40 000 rindu, paraugi) un izveidoja laika grafiku. Modelis parādīja, ka kļūdu uzliesmojums sakrita ar brīdi, kad atkarības pakalpojuma reakcijas laiks palielinājās no 200 ms līdz 8 sekundēm. Komanda to apstiprināja informācijas panelī un 10 minūšu laikā noskaidroja iemeslu.
2. gadījums — maldinoša korelācija. Citā incidentā AI to vainoja, sakot, ka kļūdas notiek "vienlaikus" ar cron (plānotā uzdevuma) izpildi. Kad komanda pārbaudīja rādītājus, viņi redzēja, ka cron faktiski bija pabeidzis pirms notikuma; Korelācija bija nejaušība. Patiesais iemesls bija atmiņas noplūde. Nodarbība: AI noteiktā laika korelācija ir pavediens, nevis pierādījums.
3. gadījums — paātrināta pēcnāves darbība. Pēc pārtraukuma komanda ievadīja (maskētu) ziņojuma transkriptu un laika skalu no notikuma kanāla uz AI un lika tai izveidot pēcnāves skici: kopsavilkumu, ietekmi, laika grafiku, galveno cēloni, darbības. Cilvēku redaktors laboja faktus un iecēla darbību īpašniekus. Dokuments, kas parasti aizņem 2 stundas, tika pabeigts aptuveni 40 minūtēs ar konsekventāku struktūru.
Četras kopējamas veidnes
Žurnāla kopsavilkums un laika skala (ar maskētu žurnālu):
Zemāk ir maskētā ražošanas žurnāla notikumu logs.1) Ielejiet notikumu hronoloģiskā laika skalā (atzīmējiet pirmās novirzes brīdi).2) Saskaitiet un grupējiet visbiežāk sastopamos kļūdu/brīdinājumu veidus.3) "Kas mainījās tieši pirms tam?" Norādiet jautājuma kandidātu notikumus. Tās ir hipotēzes; Atzīmējiet to kā "jāpārbauda". {{logs}}
Kļūdas raksta ekstrakcija:
Atrodiet šajās žurnāla rindās atkārtotus kļūdu modeļus. Katram modelim: parauga līnija (maskēta), aprēķinātais avots un iespējamā nozīme. Apkopojiet retas, bet kritiskas atsevišķas kļūdas atsevišķā "uzmanības" sarakstā.{{logs}}
Strukturēta vaicājuma/filtra ģenerēšana:
{{žurnāla rīkam: grep/jq/Kibana KQL/CloudWatch Insights}} ierakstiet vaicājumu, kas atbilst šādam nosacījumam: {{piem. 5xx kļūdas pēdējo 15 minūšu laikā, izņemot lietotāju X}}.Izskaidrojiet vaicājumu; Pārliecinieties, ka neesat izdomājis domēna nosaukumus, jautājiet, ja neesat pārliecināts.
Pēcnāves skice:
Uzrakstiet pēcnāves skici no šādas (maskētas) notikuma laika skalas: Kopsavilkums / Ietekme (ilgums, ietekmēts lietotājs) / Laika skala / Galvenais iemesls / Kas notika labi / Darbības (atstājiet īpašnieka lauku tukšu katram). NELIETOJIET apsūdzošu valodu; Esiet faktisks un proaktīvs.{{timeline}}
Vāja uzvedne / spēcīga uzvedne
Vājš: "Paskaties uz šiem baļķiem, kas vainas?" (Neapstrādāts visas dienas žurnāls ar personas datiem, bez mērķa.)
Spēcīgs: "Zemāk ir maskēts ražošanas žurnāls no 14:02–14:20 (filtrēts līdz 5xxs). Šajā logā atrodiet brīdi, kad sākās kļūdas uzliesmojums, saskaitiet visbiežāk sastopamo kļūdu veidu un uzskaitiet novirzes, kas parādījās 60 sekunžu laikā tieši pirms sprādziena; atzīmējiet tās visas kā "pārbaudāmās hipotēzes"."
Jaudīga versija; Tas sašaurina laika logu, filtrē un maskē žurnālu, uzdod skaidru jautājumu un jau no paša sākuma nosaka, ka rezultāts ir hipotēze.
Meklējumi
AI ir spēcīgs
Ierobežojums / pārbaude
Liels žurnāla kopsavilkums
Jā, ātri
Var būt paraugu ņemšanas zudumi
Laika attiecību nodibināšana
ģenerē mājienus
Korelācija ≠ cēloņsakarība
Vaicājumu/filtru ģenerēšana
labs projekts
Vai domēna vārdi ir īsti?
Pēcnāves skice
Struktūra un valoda
Gadījumi ir cilvēku apstiprināti
Korelācija nav cēloņsakarība
Visbiežāk sastopamā kļūme žurnālu analīzē ir kļūda "tas notika vienlaikus, tāpēc". AI iekrīt šajā slazdā tikpat viegli, ja ne vieglāk, nekā cilvēki; jo uzskata, ka vienlaicīgums tekstā ir spēcīgs signāls. Lai varētu teikt, ka viens notikums patiesībā noved pie cita; ir nepieciešams laiks, mehānisms un, ja iespējams, atkārtojamība. Par katru apgalvojumu par cēloņsakarību, ko atklāj AI, mēs jautājam: "Kādi citi pierādījumi to apstiprina?" Pārbaudiet to ar jautājumu.
Padoms. Piesakoties AI, teksta izgāztuves vietā, ja iespējams, vispirms izdrukājiet vaicājumu/filtru un palaidiet to savā transportlīdzeklī; Tādā veidā jūs gan samazinat sensitīvos datus, gan atdala modeļa konteksta logu patiešām svarīgajās rindās.
Biežas kļūdas
- Neapstrādāta, neatklāta baļķa ielīmēšana. Personas datu un noslēpumu izpaušana; nopietns privātuma pārkāpums.
- Dodot visu dienu uzreiz. Tas pārsniedz konteksta logu, signāls ir noslīcis troksnī.
- Kļūdaina korelācija ar cēloņsakarību. AI noteiktā laika attiecība ir pavediens, nevis pierādījums.
- Paļaušanās uz vaicājumu ar izdomātu domēna nosaukumu. Modelis var ieteikt žurnāla lauka nosaukumu, kas neeksistē; pārbaudiet ar shēmu.
- Postmortem publicēšana bez pārbaudes. Fakti un ietekmes skaitļi ir jāapstiprina cilvēkiem.
Rezumējot
AI ir spēcīgs rīks, lai žurnālu analīzē pārspētu skaļumu un troksni: apkopojot lielus atšifrējumus, nosakot laika grafikus, iegūstot modeļus un sagatavojot pēcnāves skices. Taču atcerieties trīs ierobežojumus: neeksportējiet sensitīvus datus, tos neslēpjot, filtrējiet un izlasiet tos, lai tie atbilstu konteksta logam, un pārbaudiet katru apgalvojumu par cēloņsakarību, izmantojot metriku un kodu. Korelācija nav cēloņsakarība; AI sniedz norādes, jūs pieņemat lēmumu ar pierādījumiem.
Lietojumprogrammas uzdevums
Notikumu vai testa vides žurnālā atlasiet 15–20 minūšu logu. Vispirms maskējiet personas datus un noslēpumus (vai izveidojiet sintētisko žurnālu). Pēc tam izņemiet hronoloģiju un biežāk sastopamos kļūdu veidus no AI, izmantojot veidni “žurnāla kopsavilkums un laika skala”. Mēģiniet pārbaudīt pamatcēloņa hipotēzi, ko AI izvirzīja, izmantojot jūsu rīcībā esošo metriku vai koda daļu: vai hipotēze bija spēkā, vai arī tā bija maldinoša korelācija? Vienā teikumā pierakstiet savu atradumu.
kontrolsaraksts
- [ ] Es maskēju personas datus un noslēpumus pirms žurnāla nodošanas AI.
- [ ] Es samazināju analīzi līdz šauram laika logam un filtru.
- [ ] Es uzskatu AI noteiktās laika attiecības kā hipotēzes, nevis cēloņsakarības.
- [ ] Es pārbaudu pamatcēloņa pretenziju, izmantojot metriku un kodu.
- [ ] Es apstiprinu, ka manis ģenerēto vaicājumu/filtru domēna nosaukumi ir īsti.
- [ ] Es cilvēciski apliecinu faktus un skaitļus pēcnāves skicē.