Μονάδα 7 / 12

Ανάλυση καταγραφής και παρατηρησιμότητα

Κέρδη:

  • Δυνατότητα σύνοψης μεγάλων χωματερών κορμών με κάλυψη και φιλτράρισμα σε τεχνητή νοημοσύνη και δημιουργία χρονοδιαγράμματος
  • Να είναι σε θέση να αξιολογήσει τις χρονικές σχέσεις που δημιουργήθηκαν από την τεχνητή νοημοσύνη ως υποθέσεις, όχι ως αιτιότητα
  • Δυνατότητα επικύρωσης της υπόθεσης της βασικής αιτίας με μετρήσεις και κώδικα και προετοιμασία μεταθανάτιου σκίτσου

Όταν ένα λογισμικό εκτελείται σε παραγωγή (ζωντανό περιβάλλον), μόνο τα ίχνη, οι μετρήσεις και τα αρχεία καταγραφής (γραμμές καταγραφής με χρονική σήμανση που παράγονται από την εφαρμογή ενώ εκτελείται) σας λένε τι κάνει. Το τράβηγμα ενός σημαντικού σήματος από χιλιάδες, μερικές φορές εκατομμύρια, γραμμές καταγραφής κατά τη διάρκεια μιας διακοπής λειτουργίας είναι η πιο αγχωτική και χρονικά κρίσιμη στιγμή μιας απόκρισης ενός περιστατικού. Εδώ, η τεχνητή νοημοσύνη μπορεί να είναι βοηθητικός, συνοψίζοντας τεράστιο κείμενο, εξάγοντας μοτίβα και δημιουργώντας υποθέσεις — αρκεί να σέβεστε τα όρια απορρήτου και επαλήθευσης.

Σε αυτήν την ενότητα, μαθαίνουμε να χρησιμοποιούμε την τεχνητή νοημοσύνη στο πλαίσιο της παρατηρησιμότητας - την ικανότητα κατανόησης της εσωτερικής κατάστασης ενός συστήματος κοιτάζοντας τις εξωτερικές εξόδους του: εξαγωγή νοήματος από το θόρυβο καταγραφής, καθορισμός του χρονικού πλαισίου ενός σφάλματος, εύρεση επαναλαμβανόμενων μοτίβων και σύνταξη μεταθανάτιου. Κρίσιμη προειδοποίηση εκ των προτέρων: τα ακατέργαστα αρχεία καταγραφής παραγωγής συχνά περιέχουν προσωπικά δεδομένα και μυστικά. Η τυχαία προσκόλλησή τους σε ένα εργαλείο τεχνητής νοημοσύνης είναι σοβαρή παραβίαση.

Γιατί τα αρχεία καταγραφής είναι δύσκολα, γιατί η τεχνητή νοημοσύνη είναι χρήσιμη;

Τα αρχεία καταγραφής είναι δύσκολα για τρεις λόγους: ένταση (υπάρχουν πάρα πολλά), θόρυβος (πολλές γραμμές είναι άσχετες) και ακαταστασία (ένα συμβάν είναι διάσπαρτο στα αρχεία καταγραφής διαφορετικών υπηρεσιών). Το ανθρώπινο μάτι κουράζεται σε αυτό το σωρό και χάνει τη σημαντική γραμμή.

Η τεχνητή νοημοσύνη είναι καλή στο να συνοψίζει μεγάλα μπλοκ κειμένου, να μετράει επαναλαμβανόμενα μοτίβα και να ρωτά "τι άλλαξε λίγο πριν από αυτή την έκρηξη σφαλμάτων;" Είναι ισχυρό στη δημιουργία χρονικών σχέσεων όπως Ωστόσο, υπάρχουν δύο όρια. Το πρώτο είναι το παράθυρο περιβάλλοντος: ο αριθμός των αρχείων καταγραφής που μπορείτε να χωρέσετε σε ένα μοντέλο είναι περιορισμένος, επομένως πρέπει πρώτα να φιλτράρετε και να κάνετε δειγματοληψία. Δεύτερον, επικύρωση: η τεχνητή νοημοσύνη που λέει «εδώ είναι η βασική αιτία» είναι μια υπόθεση. Μην πάρετε μια απόφαση χωρίς να την επιβεβαιώσετε με μετρήσεις και κώδικα.

Προσοχή: Τα αρχεία καταγραφής πρωτογενούς παραγωγής μπορεί να περιέχουν διεύθυνση IP, email, διακριτικό, αναγνωριστικό περιόδου σύνδεσης και μερικές φορές ανοιχτό απόρρητο. Καλύψτε τα πριν τα τροφοδοτήσετε με τεχνητή νοημοσύνη ή χρησιμοποιήστε μόνο εγκεκριμένα από την επιχείρηση εργαλεία ασφαλισμένα με δεδομένα. Εμβαθύνουμε αυτό το θέμα στην ενότητα 10.

Βήμα προς βήμα: Από το αρχείο καταγραφής στη βασική αιτία

  1. Περιορίστε το χρονικό παράθυρο. Προσδιορίστε τα λεπτά κατά την έναρξη του συμβάντος. Εξετάστε αυτό το παράθυρο, όχι όλη την ημέρα.
  2. Φιλτράρετε τον θόρυβο. Εξαλείψτε γνωστές επαναλαμβανόμενες, αβλαβείς γραμμές. Εστιάστε στο σφάλμα (ΣΦΑΛΜΑ), στην προειδοποίηση (ΠΡΟΕΙΔΟΠΟΙΗΣΗ) και στην πρώτη στιγμή απόκλισης.
  3. Απόκρυψη ευαίσθητων δεδομένων. Καθαρίστε προσωπικά δεδομένα και μυστικά πριν τα δώσετε στην τεχνητή νοημοσύνη.
  4. Δημιουργήστε μια περίληψη και ένα χρονοδιάγραμμα. Ζητήστε από το AI να συνοψίσει το συμβάν σε μια χρονολογία ("πρώτα αυτό, μετά εκείνο").
  5. Επικυρώστε την υπόθεση με μετρήσεις και κώδικα. Ο λόγος που επισημαίνεται από την AI. Επιβεβαιώστε με τον πίνακα εργαλείων, τον σχετικό κωδικό και το χρονοδιάγραμμα ανάπτυξης, εάν υπάρχει.
  6. Βάλτε ό,τι μαθαίνετε γραπτώς. Κάντε ένα μεταθανάτιο σκίτσο και απαριθμήστε προληπτικές ενέργειες.

Τρεις Μίνι Θήκες

Περίπτωση 1 — 40.000 γραμμές συνοψίζονται σε 5 λεπτά. Μια υπηρεσία πληρωμών ανέφερε ένα διακοπτόμενο σφάλμα για 12 λεπτά. Η ομάδα τροφοδότησε το σχετικό παράθυρο 20 λεπτών με καλυμμένα αρχεία καταγραφής (περίπου 40.000 γραμμές, δειγματοληπτικά) στο AI και δημιούργησε ένα χρονοδιάγραμμα. Το μοντέλο έδειξε ότι η έκρηξη σφάλματος συνέπεσε με τη στιγμή που ο χρόνος απόκρισης μιας υπηρεσίας εξάρτησης αυξήθηκε από 200 ms σε 8 δευτερόλεπτα. Η ομάδα το επιβεβαίωσε στο ταμπλό και περιόρισε την αιτία μέσα σε 10 λεπτά.

Περίπτωση 2 — Παραπλανητική συσχέτιση. Σε ένα άλλο περιστατικό, η τεχνητή νοημοσύνη το κατηγόρησε λέγοντας ότι τα σφάλματα συνέβαιναν "ταυτόχρονα" με την εκτέλεση cron (προγραμματισμένης εργασίας). Όταν η ομάδα έλεγξε τις μετρήσεις, είδε ότι το cron είχε στην πραγματικότητα τελειώσει πριν από το συμβάν. Η συσχέτιση ήταν σύμπτωση. Η πραγματική αιτία ήταν μια διαρροή μνήμης. Μάθημα: Η χρονική συσχέτιση που καθιερώθηκε από το AI είναι μια ένδειξη, όχι απόδειξη.

Περίπτωση 3 — Η μεταθανάτια επιτάχυνση. Μετά από μια διακοπή, η ομάδα τροφοδότησε το (με καλυμμένο) μεταγραφή μηνύματος και το χρονοδιάγραμμα από το κανάλι του συμβάντος στο AI και το έβαλε να παράγει ένα σκίτσο μετά θάνατον: περίληψη, αντίκτυπο, χρονοδιάγραμμα, βασική αιτία, ενέργειες. Ο ανθρώπινος συντάκτης διόρθωσε τα γεγονότα και διόρισε ιδιοκτήτες ενεργειών. Το έγγραφο, το οποίο διαρκεί συνήθως 2 ώρες, ολοκληρώθηκε σε περίπου 40 λεπτά με μια πιο συνεπή δομή.

Τέσσερα αντιγράψιμα πρότυπα

Περίληψη αρχείου καταγραφής και χρονοδιάγραμμα (με καλυμμένο αρχείο καταγραφής):

Παρακάτω είναι ένα παράθυρο συμβάντων του καλυμμένου αρχείου καταγραφής παραγωγής.1) Μεταφέρετε το συμβάν σε μια χρονολογική γραμμή χρόνου (σημειώστε τη στιγμή της πρώτης απόκλισης).2) Μετρήστε και ομαδοποιήστε τους πιο συχνά επαναλαμβανόμενους τύπους σφαλμάτων/προειδοποίησης.3) "Τι άλλαξε λίγο πριν;" Καταγράψτε τα υποψήφια συμβάντα για την ερώτηση. Αυτές είναι υποθέσεις. Σημειώστε το ως "πρέπει να επαληθευτεί". {{ αρχεία καταγραφής}}

Εξαγωγή μοτίβου σφάλματος:

Βρείτε επαναλαμβανόμενα μοτίβα σφαλμάτων σε αυτές τις γραμμές καταγραφής. Για κάθε μοτίβο: δείγμα γραμμής (με μάσκα), εκτιμώμενη πηγή και πιθανή σημασία. Συλλέξτε σπάνια αλλά κρίσιμα μεμονωμένα σφάλματα σε μια ξεχωριστή λίστα "προσοχή".{{ αρχεία καταγραφής}}

Δημιουργία δομημένου ερωτήματος/φίλτρου:

Για το {{εργαλείο καταγραφής: grep/jq/Kibana KQL/CloudWatch Insights}}, γράψτε ένα ερώτημα που πληροί την ακόλουθη προϋπόθεση: {{π.χ. 5xx σφάλματα τα τελευταία 15 λεπτά, εξαιρουμένου του χρήστη X}}. Εξηγήστε το ερώτημα. Βεβαιωθείτε ότι δεν δημιουργείτε τα ονόματα τομέα, ρωτήστε εάν δεν είστε σίγουροι.

Μεταθανάτιο σκίτσο:

Γράψτε ένα μεταθανάτιο σκίτσο από το ακόλουθο (με καλυμμένο) χρονοδιάγραμμα συμβάντων: Σύνοψη / Αντίκτυπος (διάρκεια, επηρεασμένος χρήστης) / Χρονοδιάγραμμα / Βασική αιτία / Τι πήγε καλά / Ενέργειες (αφήστε το πεδίο κατόχου κενό για καθεμία). ΜΗΝ χρησιμοποιείτε καταγγελτική γλώσσα. Να είστε πραγματικοί και προληπτικοί.{{timeline}}

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμος: "Κοίτα αυτά τα κούτσουρα, τι συμβαίνει;" (Ακατέργαστο αρχείο καταγραφής ολόκληρης της ημέρας, με προσωπικά δεδομένα, χωρίς στόχο.)
Ισχυρό: "Ακολουθεί το καλυμμένο αρχείο καταγραφής παραγωγής από 14:02–14:20 (φιλτραρισμένο σε 5xxs). Σε αυτό το παράθυρο, βρείτε τη στιγμή που ξεκίνησε το σφάλμα, μετρήστε τον πιο συχνό τύπο σφάλματος και απαριθμήστε τις αποκλίσεις που εμφανίστηκαν στα 60 δευτερόλεπτα αμέσως πριν από την έκρηξη. Σημειώστε τις όλες ως "υπόθεση" για επαλήθευση."

Ισχυρή έκδοση. Περιορίζει το χρονικό παράθυρο, φιλτράρει και κρύβει το αρχείο καταγραφής, θέτει μια σαφή ερώτηση και καθορίζει από την αρχή ότι η έξοδος είναι μια υπόθεση.

Αναζήτηση

Το AI είναι ισχυρό

Όριο / επαλήθευση

Περίληψη μεγάλου ημερολογίου

Ναι γρήγορα

Μπορεί να υπάρξει απώλεια δειγματοληψίας

Δημιουργία χρονικής σχέσης

δημιουργεί υποδείξεις

Συσχέτιση ≠ αιτιότητα

Δημιουργία ερωτήματος/φίλτρου

καλό σχέδιο

Είναι αληθινά τα ονόματα τομέα;

Μεταθανάτιο σκίτσο

Δομή και γλώσσα

Τα κρούσματα είναι ανθρώπινα επιβεβαιωμένα

Η συσχέτιση δεν είναι αιτιότητα

Η πιο κοινή παγίδα στην ανάλυση ημερολογίου είναι η πλάνη "συνέβη την ίδια στιγμή, γι' αυτό". Η τεχνητή νοημοσύνη πέφτει σε αυτήν την παγίδα το ίδιο εύκολα, αν όχι πιο εύκολα, από τους ανθρώπους. γιατί πιστεύει ότι η ταυτόχρονη παρουσία στο κείμενο είναι ένα ισχυρό μήνυμα. Να μπορούμε να πούμε ότι ένα γεγονός οδηγεί στην πραγματικότητα σε ένα άλλο. Απαιτούνται χρονισμός, μηχανισμός και, εάν είναι δυνατόν, επαναληψιμότητα. Για κάθε ισχυρισμό αιτιότητας που εδραιώνει η τεχνητή νοημοσύνη, ρωτάμε "ποια άλλα στοιχεία το επιβεβαιώνουν αυτό;" Δοκιμάστε το με την ερώτηση.

Συμβουλή: Όταν συνδέεστε στο AI, αντί για απόσπαση κειμένου, εάν είναι δυνατόν, εκτυπώστε πρώτα ένα ερώτημα/φίλτρο και εκτελέστε το στο όχημά σας. Με αυτόν τον τρόπο μειώνετε τα ευαίσθητα δεδομένα και διαχωρίζετε το παράθυρο περιβάλλοντος του μοντέλου στις πολύ σημαντικές σειρές.

Συνήθη λάθη

  • Επικόλληση ακατέργαστου, ακάλυπτου κορμού. Αποκάλυψη προσωπικών δεδομένων και μυστικών. σοβαρή παραβίαση της ιδιωτικής ζωής.
  • Δίνοντας όλη την ημέρα ταυτόχρονα. Ξεπερνά το παράθυρο περιβάλλοντος, το σήμα πνίγεται στο θόρυβο.
  • Λανθασμένη συσχέτιση για αιτιότητα. Η χρονική σχέση που δημιούργησε η τεχνητή νοημοσύνη είναι μια ένδειξη, όχι απόδειξη.
  • Βασίζεται σε ένα ερώτημα με ένα κατασκευασμένο όνομα τομέα. Το μοντέλο μπορεί να προτείνει ένα όνομα πεδίου καταγραφής που δεν υπάρχει. επαληθεύστε με το σχηματικό.
  • Δημοσίευση της νεκροψίας χωρίς επαλήθευση. Τα γεγονότα και οι αριθμοί επιπτώσεων πρέπει να επιβεβαιώνονται από τον άνθρωπο.

Συνοπτικά

Η τεχνητή νοημοσύνη είναι ένα ισχυρό εργαλείο για την αντιμετώπιση του όγκου και του θορύβου στην ανάλυση αρχείων καταγραφής: σύνοψη μεγάλων μεταγραφών, καθορισμός χρονοδιαγραμμάτων, εξαγωγή μοτίβων και προετοιμασία μεταθανάτιων σκίτσων. Αλλά να θυμάστε τρία όρια: μην εξάγετε ευαίσθητα δεδομένα χωρίς να τα καλύπτετε, φιλτράρετε και δειγματίστε τα ώστε να ταιριάζουν στο παράθυρο περιβάλλοντος και επαληθεύστε κάθε αξίωση αιτιότητας με μετρήσεις και κώδικα. Η συσχέτιση δεν είναι αιτιότητα. Η τεχνητή νοημοσύνη δίνει ενδείξεις, εσείς αποφασίζετε με στοιχεία.

Εργασία εφαρμογής

Επιλέξτε ένα παράθυρο 15–20 λεπτών από ένα αρχείο καταγραφής συμβάντος ή δοκιμαστικού περιβάλλοντος που έχετε. Πρώτα αποκρύψτε προσωπικά δεδομένα και μυστικά (ή δημιουργήστε ένα συνθετικό αρχείο καταγραφής). Στη συνέχεια, εξαγάγετε μια χρονολογία και τους πιο συχνούς τύπους σφαλμάτων από το AI με το πρότυπο "σύνοψη καταγραφής και χρονοδιάγραμμα". Προσπαθήστε να επαληθεύσετε την υπόθεση της βασικής αιτίας που η τεχνητή νοημοσύνη πρότεινε με μια μέτρηση ή ένα κομμάτι κώδικα που έχετε: ίσχυε η υπόθεση ή ήταν παραπλανητική συσχέτιση; Καταγράψτε το εύρημα σας σε μια πρόταση.

λίστα ελέγχου

  • [ ] Αποκρύπτω προσωπικά δεδομένα και μυστικά πριν δώσω το αρχείο καταγραφής στο AI.
  • [ ] Μειώνω την ανάλυση σε ένα στενό χρονικό παράθυρο και φιλτράρω.
  • [ ] Βλέπω τις χρονικές σχέσεις που δημιουργήθηκαν από την τεχνητή νοημοσύνη ως υποθέσεις, όχι ως αιτιότητα.
  • [ ] Επαληθεύω την αξίωση βασικής αιτίας με μετρήσεις και κώδικα.
  • [ ] Επιβεβαιώνω ότι τα ονόματα τομέα των ερωτημάτων/φίλτρων που δημιουργώ είναι πραγματικά.
  • [ ] Πιστοποιώ ανθρώπινα τα γεγονότα και τα στοιχεία στο μεταθανάτιο σκίτσο.