Eenheid 3 / 11

Loganalyse en analyse van de hoofdoorzaken: het signaal in de ruis vinden

Winst:

  • Vind snel signalen in ruis door AI te gebruiken om logboeken samen te vatten, te groeperen en te tijdlijnen
  • Vermogen om correlatie en causaliteit te scheiden en de suggesties voor de hoofdoorzaak van kunstmatige intelligentie te behandelen als hypothesen die moeten worden geverifieerd
  • Vermogen om de echte oorzaak te achterhalen door de '5 Why'-methode toe te passen met kunstmatige intelligentie en elke stap te ondersteunen met echt bewijs

Loganalyse en analyse van hoofdoorzaken: het signaal in ruis vinden met AI

Wanneer een systeem crasht, zijn de logbestanden de eerste plaats waar u naar kijkt. Logboek is een tekststroom die een tijdstempel bijhoudt van "wat ik heb gedaan, wat er is gebeurd, wat er kapot is gegaan" van een systeem of applicatie. Maar een moderne infrastructuur produceert miljoenen regels logbestanden per uur; het is geen zee van informatie, maar vaak een oceaan van lawaai. Loganalyse is de kunst van het vinden van het belangrijke signaal (fout, afwijking, patroon) in deze ruis. Het proces van het beantwoorden van de vraag "wat was de werkelijke oorzaak" na een gebeurtenis wordt root cause analyse (RCA - Root Cause Analysis) genoemd. Hier is AI zeer krachtig in het samenvatten van duizenden regels per seconde, het extraheren van patronen, het vaststellen van tijdlijnen en het opsommen van mogelijke oorzaken. Maar een waarschuwing: AI genereert mogelijke oorzaken; Jij bent degene die in het systeem verifieert welke echt is en de beslissing neemt.

In deze unit leer je hoe je logs vol vertrouwen kunt samenvatten met AI, hoe je een tijdlijn van een gebeurtenis kunt opstellen, hoe je onderscheid kunt maken tussen correlatie (samen veranderen) en causaliteit (het ene veroorzaakt het andere), en hoe je een RCA-methode kunt uitvoeren, zoals de "5 Whys" met AI.

Waarom is correlatie geen causaliteit?

Dit is het meest kritische concept van deze eenheid. Het feit dat twee gebeurtenissen tegelijkertijd plaatsvinden, veroorzaakt niet de ene gebeurtenis en de andere niet. Het CPU- en netwerkverkeer van een server kan tegelijkertijd toenemen; maar de een is niet het resultaat van de ander; beide kunnen het resultaat zijn van een derde gebeurtenis (bijvoorbeeld de start van een batchtaak). Wanneer AI statistieken samen ziet veranderen, wordt ervan uitgegaan dat “X waarschijnlijk Y heeft veroorzaakt.” Dit is een startpunt, geen conclusie. Om de causaliteit te verifiëren, moet je óf de variabele isoleren (trigger X in de testomgeving en kijken of Y gebeurt) óf het mechanisme bewijzen (laat de technische middelen zien waarmee X Y produceert).

Let op: neem de zin van de AI 'Dit heeft dit waarschijnlijk veroorzaakt' als een hypothese en niet als een bevinding. Bij RCA leidt een onjuiste hoofdoorzaak tot een onjuiste correctie en herhaling van de gebeurtenis. Je hebt de eerste verdachte gevonden, niet de oorzaak; Het werk begint daar.

Stap voor stap: Loganalyse met AI

  1. Beperk de reikwijdte. Geef het gebeurtenisvenster op, niet het hele logboek: "gebeurtenis gestart om 14:05, kritiek van 14:00–14:20". Vertel de AI het betreffende tijdslot en de dienst.
  2. Masker. Logboeken bevatten intern IP-adres, hostnaam, gebruiker en token. Maskeer ze (10.x.x.x, host-A, gebruiker1, REDACTED) en exporteer ze vervolgens.
  3. Vraag samenvatting en groepering aan. "Groepeer dit logboek op ernst, tel terugkerende fouten, vind de tijdstempel van de eerste fout." Vraag naar de structuur, niet naar het ruwe logboek.
  4. Stel een tijdlijn op. "Rangschik deze gebeurtenissen in tijdsvolgorde en laat zien wat op wat volgt." Het vinden van de eerste dominosteen is de weg naar de oorzaak.
  5. Vraag om hypotheses, niet om bewijzen. "Maak een lijst van de mogelijke hoofdoorzaken in volgorde van waarschijnlijkheid en geef me voor elk een verificatiecommando dat ik op het systeem kan uitvoeren." Vraag naar de diagnose, niet naar het resultaat.
  6. Verifieer in het systeem. Test elke hypothese met alleen-lezen diagnostische opdrachten (log grep, statusquery, metrisch). Elimineer totdat er nog maar één bevestigde oorzaak is.

5 Waarom methode

Het klassieke en krachtige instrument van RCA is de '5 Waarom': beginnen met één symptoom en vragen 'waarom?' vijf keer. Door te vragen kom je tot de kernoorzaak onder het oppervlakkige symptoom. Voorbeeld: "De site is gecrasht. Waarom? De applicatie is overleden omdat er onvoldoende geheugen beschikbaar was. Waarom? Een query heeft al het geheugen in beslag genomen. Waarom? De query heeft geen index gebruikt. Waarom? De index is in de laatste release verwijderd. Waarom? Dit is niet opgemerkt in de wijzigingsbeoordeling." De hoofdoorzaak is niet dat de website is gecrasht, maar dat het beoordelingsproces van de wijzigingen zwak is. AI zou een goede partner zijn bij het opbouwen van deze keten – maar je moet elke ‘waarom’-stap ondersteunen met echt bewijs, anders komt de AI misschien met een plausibele maar valse keten.

drie minikoffers

Geval 1 — 40.000 lijnen, 3 minuten. Een beheerder was tijdens een nachtelijke storing begonnen met het handmatig scannen van 40.000 regels applicatielogboeken. Hij gaf het relevante twintig minuten durende gedeelte van het gemaskeerde logboek aan de AI en vroeg om samenvatting en groepering. AI signaleerde de eerste OutOfMemory-bug om 02:14 uur, direct na de toegenomen time-outbugs. De machinist ontving de urenstaat binnen 3 minuten; bevestigde de oorspronkelijke diagnose op zijn eigen metrische paneel.

Geval 2 – Terugkeren vanuit de verkeerde hoofdoorzaak. Een team dacht dat de eerste hypothese van de AI ("logs vulden de schijf") correct was en wiste de logs. Maar het incident herhaalde zich de volgende dag. In de tweede ronde implementeerden ze de "5 Whys" met discipline: de echte reden was dat een applicatiefout het schrijven van honderden core dumps per seconde was. De eerste hypothese was correlatie; De echte reden was anders. Aanvaarding zonder verificatie had slechts één dag uitstel opgeleverd.

Geval 3 — Tijdlijn heeft de dader gevonden. Er waren logbestanden van tientallen apparaten tijdens een periodieke netwerkstoring. De ingenieur gaf de gemaskeerde logs aan de AI en liet deze een uniforme tijdlijn maken. Uit het diagram blijkt dat elke storing precies 30 seconden na een statuscontrolebericht over de redundantieschakelaar begon. Deze correlatie was een sterke aanwijzing; Het team controleerde de firmwarefout van de sleutel op het apparaat en verving deze.

Vier kopieerbare sjablonen

1) Logoverzicht en groepering:

Hieronder vindt u het gemaskeerde logboek voor [service] van 14:00-14:20. Vertel me: (1) groepeer en tel de regels op ernst (ERROR/WARN/INFO), (2) maak een lijst van de vijf belangrijkste terugkerende foutpatronen, (3) zoek de tijdstempel van de eerste FOUT. Herschrijf het onbewerkte logboek niet, maar geef gewoon een gestructureerde samenvatting. Een opgemaakte regel toevoegen.Log: [gemaskeerd log]

2) Een tijdlijn opzetten:

We hebben de volgende gemaskeerde gebeurtenisrecords in één tijdlijn gerangschikt (tijdstempel + bron + gebeurtenis). Laat zien wat op wat volgt en markeer de gebeurtenis die de eerste trigger lijkt te zijn. Merk op dat dit een HYPOTHESE is en dat de causaliteit geverifieerd moet worden. Opnames: [gemaskeerde opnames]

3) 5 Redenen RCA-partner:

Jouw rol: RCA-facilitator. Symptoom: [symptoom].Doe samen met mij de ‘5 Waarom’: een ‘waarom?’ bij elke stap. Vraag, ik zal antwoorden met het bewijs dat ik heb, jij stelt de volgende vraag. Als mijn bewijs zwak is, waarschuw mij dan en vertel mij welke gegevens ik moet verzamelen. Geef geen grondoorzaak aan zonder bewijs.

4) Hypothese + verificatiecommando:

Noem mogelijke grondoorzaken voor dit symptoom [symptoom] in volgorde van waarschijnlijkheid. Om elke reden: (a) wat vermoed je, (b) geef mij een READ-ONLY verificatiecommando om op mijn systeem uit te voeren (geen verwijderen/wijzigen). Leg uit welke uitkomst de hypothese bevestigt of weerlegt.

Zwakke prompt/sterke prompt

Zwakke prompt:

Wat is er mis met dit logboek? [10.000 regels onbewerkt logboek]

Deze prompt lekt gevoelige gegevens ontmaskerd en laat de AI zonder context achter. AI kan op een willekeurige regel stuiten en een oppervlakkige of zelfs verzonnen reden geven.

Krachtige prompt:

Jouw rol: senior SRE. Gebeurtenis: betalingsservice gaf 50% fout tussen 02:10-02:25. Hieronder ziet u het gemaskeerde logboek van dat venster. Geef me (1) de samenvatting gegroepeerd op ernst, (2) de tijdstempel van de eerste fout, (3) de mogelijke hoofdoorzaken in volgorde van waarschijnlijkheid, en een alleen-lezen verificatiecommando voor elke fout. Markeer causaliteitsclaims als hypothesen. Logboek: [gemaskeerd logboek]

stap

Doel

Rol van AI

de rol van de mens

Samenvatting/groepering

geluid verminderen

Duizenden rijen configureren

Bepaal de reikwijdte en het masker

tijdlijn

Het vinden van de eerste dominosteen

evenementen sorteren

Valideer stempels

hypothese generatie

het sorteren van de verdachten

zet de mogelijkheden op een rij

filter op context

verificatie

de echte reden vinden

Stel een diagnostisch commando voor

Voer de opdracht uit en geef commentaar

beslissing

Kiezen om te repareren

opties aanbieden

Neem de beslissing en bevestig

Veel voorkomende fouten

  • Correlatie verwarren met causaliteit. Het accepteren van twee statistieken die samen veranderen omdat 'de een de ander veroorzaakt', levert een valse correctie op.
  • Het onbewerkte logboek plakken zonder masker. Het doorgeven van het logbestand met IP, token en gebruiker aan een open tool is een inbreuk op de beveiliging.
  • Het verklaren van de eerste hypothese als de hoofdoorzaak. Het accepteren van de eerste suggestie van de AI zonder deze te verifiëren is een uitnodiging voor een herhaling van de gebeurtenis.
  • Het volledige logboek exporteren. Enorme log zonder context plugt de AI in een willekeurige regel; Samenvouwen naar het gebeurtenisvenster.
  • 5 redenen zonder bewijs. Als je elke 'waarom'-stap niet met echte gegevens onderbouwt, krijg je een plausibele maar verzonnen keten.
Tip: Voordat u een RCA beëindigt, vraagt ​​u zich af: "Als deze hoofdoorzaak daadwerkelijk is verholpen, zal dit dan niet nog een keer gebeuren?" Stel de vraag. Als het antwoord 'misschien' is, heb je de oorzaak nog niet ontdekt; Vraag nog een ‘waarom’.

Samengevat

Loganalyse gaat over het vinden van het signaal in een oceaan van ruis; AI vat en structureert deze oceaan in enkele seconden, stelt een tijdlijn vast en genereert hypothesen. Maar correlatie is geen oorzakelijk verband: de door de AI gesuggereerde oorzaak is een aanvankelijk vermoeden, en geen bevinding totdat deze wordt bevestigd. Vouw het logboek samen in het gebeurtenisvenster, maskeer het, vraag om structuur, graaf diep met de “5 Waaroms” en test elke hypothese op het systeem met alleen-lezen-opdrachten. Jij bent degene die de oorzaak vindt en de oplossing bevestigt; AI is je metgezel.

Applicatie taak

Neem de logboeken van een gebeurtenis uit het verleden (of een testgebeurtenis), vouw deze samen in het gebeurtenisvenster en maskeer eventuele gevoelige gebieden. Vraag een samenvatting en planning aan bij AI met de bovenstaande sjablonen “Logboekoverzicht” en “Tijdlijn”. Ga vervolgens van symptoom naar hoofdoorzaak met het sjabloon “5 Redenen RCA-partner”; Schrijf voor elke stap uw eigen bewijsmateriaal. Test ten slotte de initiële hypothese van de AI met een verificatiecommando en leg vast of deze wordt bevestigd of weerlegd. Vat het proces samen in 6 items.

controlelijst

  • [ ] Heb ik het logboek in het gebeurtenisvenster samengevouwen en gevoelige gebieden gemaskeerd?
  • [ ] Heb ik de AI om een ​​gestructureerde samenvatting en tijdlijn gevraagd, en niet om een ​​onbewerkt logboek?
  • [ ] Heb ik de causaliteitsclaims van AI als hypothesen gemarkeerd?
  • [ ] Heb ik elke hypothese op het systeem getest met een alleen-lezen verificatieopdracht?
  • [ ] Heb ik elke stap van de “5 Waaroms” ondersteund met echt bewijs?
  • [ ] Heb ik me afgevraagd en besloten of de hoofdoorzaak de gebeurtenis daadwerkelijk zou voorkomen?