Njësia 7 / 12

Analiza e regjistrave dhe vëzhgueshmëria

Fitimet:

  • Aftësia për të përmbledhur deponitë e mëdha të regjistrave duke i maskuar dhe filtruar ato në AI dhe për të krijuar një afat kohor
  • Të jesh në gjendje të vlerësosh marrëdhëniet kohore të vendosura nga AI si hipoteza, jo si shkakësi
  • Aftësia për të vërtetuar hipotezën e shkakut rrënjësor me metrikë dhe kod dhe për të përgatitur një skicë pas vdekjes

Kur një softuer po funksionon në prodhim (mjedis i drejtpërdrejtë), vetëm gjurmët, metrikat dhe regjistrat (linjat e regjistrimit të vulosura me kohë të prodhuara nga aplikacioni gjatë ekzekutimit) ju tregojnë se çfarë po bën. Tërheqja e një sinjali kuptimplotë nga mijëra, ndonjëherë miliona, linja logësh gjatë një ndërprerjeje është momenti më stresues dhe më kritik për kohën e një reagimi ndaj incidentit. Këtu, AI mund të jetë një ndihmës, duke përmbledhur tekste masive, duke nxjerrë modele dhe duke gjeneruar hipoteza - për sa kohë që ju respektoni kufijtë e privatësisë dhe verifikimit.

Në këtë njësi, ne mësojmë të përdorim AI në kontekstin e vëzhgimit - aftësia për të kuptuar gjendjen e brendshme të një sistemi duke parë rezultatet e tij të jashtme: nxjerrjen e kuptimit nga zhurma e regjistrit, vendosjen e afatit kohor të një gabimi, gjetjen e modeleve të përsëritura dhe hartimin e një postmortemi. Paralajmërim kritik përpara: regjistrat e prodhimit të papërpunuar shpesh përmbajnë të dhëna personale dhe sekrete; Ngjitja e tyre në mënyrë të rastësishme në një mjet AI është një shkelje serioze.

Pse regjistrat janë të vështirë, Pse është e dobishme AI?

Regjistrat janë të vështirë për tre arsye: vëllimi (ka shumë), zhurma (shumë rreshta janë të parëndësishëm) dhe rrëmujë (një ngjarje është e shpërndarë nëpër regjistrat e shërbimeve të ndryshme). Syri i njeriut lodhet në këtë grumbull dhe humbet vijën e rëndësishme.

Inteligjenca artificiale është e mirë në përmbledhjen e blloqeve të mëdha të tekstit, duke numëruar modele të përsëritura dhe duke pyetur "çfarë ndryshoi pak para atij shpërthimi të gabimeve?" Është i fuqishëm në krijimin e marrëdhënieve kohore si p.sh. Megjithatë, ka dy kufij. E para është dritarja e kontekstit: sasia e regjistrave që mund të futni në një model është e kufizuar, kështu që së pari duhet të filtroni dhe të provoni. Së dyti, vërtetimi: AI që thotë “këtu është shkaku kryesor” është një hipotezë; Mos merrni një vendim pa e konfirmuar atë me metrikë dhe kod.

Kujdes: Regjistrat e prodhimit të papërpunuar mund të përmbajnë adresë IP, email, token, ID të sesionit dhe ndonjëherë sekret të hapur. Maskojini ato përpara se t'i ushqeni me AI, ose përdorni vetëm mjete të siguruara nga të dhënat e miratuara nga ndërmarrja. Ne e thellojmë këtë temë në kapitullin 10.

Hap pas hapi: Nga regjistri në shkakun rrënjësor

  1. Ngushtoni dritaren e kohës. Përcaktoni procesverbalin kur filloi ngjarja; Shqyrtoni atë dritare, jo gjithë ditën.
  2. Filtro zhurmën. Zhduk linjat e njohura të përsëritura dhe të padëmshme; Përqendrohuni në gabimin (GABIM), paralajmërimin (PARALAJMËRIM) dhe momentin e parë të devijimit.
  3. Maskojini të dhënat e ndjeshme. Pastroni të dhënat personale dhe sekretet përpara se t'ia jepni AI.
  4. Krijoni një përmbledhje dhe afat kohor. Kërkojini AI-së të përmbledhë ngjarjen në një kronologji ("së pari kjo, pastaj ajo").
  5. Vërtetoni hipotezën me metrikë dhe kod. Arsyeja e theksuar nga AI; Konfirmo me panelin e kontrollit, kodin përkatës dhe afatin kohor të vendosjes, nëse është e aplikueshme.
  6. Shkruani me shkrim atë që mësohet. Bëni një skicë pas vdekjes dhe renditni veprimet parandaluese.

Tre Mini Rastet

Rasti 1 - 40,000 rreshta të përmbledhura në 5 minuta. Një shërbim pagese raportoi një gabim me ndërprerje për 12 minuta. Ekipi ushqeu dritaren përkatëse 20-minutëshe të regjistrave të maskuar (afërsisht 40,000 rreshta, të kampionuar) në AI dhe gjeneroi një afat kohor. Modeli tregoi se shpërthimi i gabimit përkoi me momentin kur koha e përgjigjes së një shërbimi varësie u rrit nga 200 ms në 8 sekonda. Ekipi e konfirmoi këtë në panelin e kontrollit dhe e kufizoi shkakun brenda 10 minutave.

Rasti 2 - Korrelacion mashtrues. Në një incident tjetër, AI e fajësoi atë duke thënë se gabimet po ndodhnin "në të njëjtën kohë" si një ekzekutim i cron (detyrës së planifikuar). Kur ekipi kontrolloi matjet, ata panë se cron në fakt kishte përfunduar përpara ngjarjes; Korrelacioni ishte rastësi. Shkaku i vërtetë ishte një rrjedhje e kujtesës. Mësimi: Korrelacioni kohor i vendosur nga AI është një e dhënë, jo provë.

Rasti 3 - Postmortem i përshpejtuar. Pas një ndërprerjeje, ekipi ushqeu transkriptin e mesazhit (të maskuar) dhe afatin kohor nga kanali i ngjarjes në AI dhe e bëri atë të prodhonte një skicë pas vdekjes: përmbledhje, ndikim, afat kohor, shkaku rrënjësor, veprime. Redaktori human korrigjoi faktet dhe caktoi pronarë të veprimeve. Dokumenti, i cili zakonisht zgjat 2 orë, u plotësua në afërsisht 40 minuta me një strukturë më të qëndrueshme.

Katër modele të kopjueshme

Përmbledhja e regjistrit dhe afati kohor (me regjistër të maskuar):

Më poshtë është një dritare e ngjarjeve të regjistrit të maskuar të prodhimit.1) Hidhni ngjarjen në një afat kohor kronologjik (shënoni momentin e devijimit të parë).2) Numëroni dhe gruponi llojet e gabimeve/paralajmërimeve më të përsëritura.3) "Çfarë ndryshoi pak më parë?" Listoni ngjarjet e kandidatëve për pyetjen. Këto janë hipoteza; Shënojeni si "duhet verifikuar". {{ regjistrat}}

Nxjerrja e modelit të gabimit:

Gjeni modele gabimesh të përsëritura në këto rreshta regjistri. Për çdo model: rreshti i mostrës (i maskuar), burimi i vlerësuar dhe kuptimi i mundshëm. Mblidhni gabime të rralla, por kritike të vetme në një listë të veçantë "vëmendjeje".{{ regjistrat}}

Gjenerimi i strukturuar i pyetjeve/filtrave:

Për {{mjet log: grep/jq/Kibana KQL/CloudWatch Insights}}, shkruani një pyetje që plotëson kushtin e mëposhtëm: {{p.sh. 5xx gabime në 15 minutat e fundit, duke përjashtuar përdoruesin X}}. Shpjegoni pyetjen; Sigurohuni që nuk jeni duke krijuar emrat e domenit, pyesni nëse nuk jeni të sigurt.

Skicë pas vdekjes:

Shkruani një skicë pas vdekjes nga afati kohor i mëposhtëm (i maskuar) i ngjarjes: Përmbledhje / Ndikimi (kohëzgjatja, përdoruesi i prekur) / Afati kohor / Shkaku kryesor / Çfarë shkoi mirë / Veprimet (lëreni bosh fushën e pronarit për secilën). MOS përdorni gjuhë akuzuese; Ji faktik dhe aktiv.{{timeline}}

Prompt i dobët / Prompt i fortë

I dobët: "Shiko këto shkrime, çfarë nuk shkon?" (Regjistri i papërpunuar i gjithë ditës, me të dhëna personale, të pa synuara.)
Strong: "Më poshtë është regjistri i maskuar i prodhimit nga ora 14:02–14:20 (i filtruar në 5xxs). Në këtë dritare, gjeni momentin kur filloi shpërthimi i gabimit, numëroni llojin e gabimit më të shpeshtë dhe renditni devijimet që u shfaqën në 60 sekondat menjëherë para shpërthimit; shënojini të gjitha si 'hipotezë' për t'u verifikuar."

Version i fuqishëm; Ai ngushton dritaren e kohës, filtron dhe maskon regjistrin, bën një pyetje të qartë dhe përcakton që në fillim se dalja është një hipotezë.

Kërkimi

AI është i fortë

Kufiri / verifikimi

Përmbledhje e regjistrit të madh

Po shpejt

Mund të ketë humbje të kampionimit

Krijimi i një marrëdhënie kohore

gjeneron sugjerime

Korrelacioni ≠ shkakësor

Gjenerimi i pyetjeve/filtrave

draft i mirë

A janë emrat e domain-eve reale?

Skicë pas vdekjes

Struktura dhe gjuha

Rastet janë të konfirmuara nga njeriu

Korrelacioni nuk është shkakësi

Gracka më e zakonshme në analizën e regjistrave është gabimi "ka ndodhur në të njëjtën kohë, prandaj kjo është arsyeja". Inteligjenca artificiale bie në këtë kurth po aq lehtë, nëse jo më lehtë, sesa njerëzit; sepse mendon se njëkohshmëria në tekst është një sinjal i fortë. Të jetë në gjendje të thotë se një ngjarje të çon në një tjetër; kërkohet koha, mekanizmi dhe, nëse është e mundur, përsëritshmëria. Për çdo pretendim të shkakësisë që AI vendos, ne pyesim "çfarë dëshmie të tjera e konfirmojnë këtë?" Provoni me pyetjen.

Këshillë: Kur regjistroheni në AI, në vend të një deponie teksti, nëse është e mundur, printoni fillimisht një pyetje/filtër dhe ekzekutoni atë në automjetin tuaj; Në këtë mënyrë ju reduktoni të dhënat e ndjeshme dhe ndani dritaren e kontekstit të modelit në rreshtat vërtet të rëndësishëm.

Gabimet e zakonshme

  • Ngjitja e regjistrit të papërpunuar dhe të demaskuar. Zbulimi i të dhënave dhe sekreteve personale; një shkelje e rëndë e privatësisë.
  • Dhënia e gjithë ditës menjëherë. Ajo tejkalon dritaren e kontekstit, sinjali është i mbytur në zhurmë.
  • Gabimi i korrelacionit për shkakun. Marrëdhënia kohore e krijuar nga AI është një e dhënë, jo provë.
  • Duke u mbështetur në një pyetje me një emër domaini të krijuar. Modeli mund të sugjerojë një emër të fushës së regjistrit që nuk ekziston; verifikoni me skemën.
  • Publikimi i postmortemit pa e verifikuar atë. Faktet dhe shifrat e ndikimit duhet të konfirmohen nga njeriu.

Në përmbledhje

AI është një mjet i fuqishëm për të mposhtur volumin dhe zhurmën në analizën e regjistrave: përmbledhja e transkripteve të mëdha, vendosja e afateve kohore, nxjerrja e modeleve dhe përgatitja e skicave pas vdekjes. Por mbani mend tre kufij: mos eksportoni të dhëna të ndjeshme pa i maskuar ato, filtroni dhe mostroni ato për t'iu përshtatur dritares së kontekstit dhe verifikoni çdo pretendim shkakësie me metrikë dhe kod. Korrelacioni nuk është shkakësi; AI jep të dhëna, ju e merrni vendimin me prova.

Detyra e aplikimit

Zgjidhni një dritare 15–20 minuta nga një regjistër i ngjarjeve ose mjedisit testues që keni. Fillimisht maskoni të dhënat personale dhe sekretet (ose prodhoni një regjistër sintetik). Pastaj nxirrni një kronologji dhe llojet më të shpeshta të gabimeve nga AI me shabllonin "përmbledhja e regjistrit dhe afati kohor". Përpiquni të verifikoni hipotezën e shkakut rrënjësor që AI ka paraqitur me një metrikë ose pjesë të kodit që keni: a qëndronte hipoteza apo ishte një korrelacion mashtrues? Shkruani gjetjet tuaja me një fjali.

listë kontrolli

  • [ ] Unë maskoj të dhënat personale dhe sekretet përpara se t'ia jap regjistrin AI.
  • [ ] Unë e reduktoj analizën në një dritare të ngushtë kohore dhe filtro.
  • [ ] Unë i shoh marrëdhëniet kohore të vendosura nga AI si hipoteza, jo si shkakësi.
  • [ ] Unë verifikoj pretendimin e shkakut rrënjësor me metrikë dhe kod.
  • [ ] Konfirmoj që emrat e domenit të pyetjeve/filtrave që gjeneroj janë realë.
  • [ ] Unë vërtetoj në mënyrë njerëzore faktet dhe shifrat në skicën pas vdekjes.