Đơn vị 7 / 12

Phân tích nhật ký và khả năng quan sát

Lợi nhuận:

  • Khả năng tóm tắt các bãi chứa nhật ký lớn bằng cách che và lọc chúng theo AI và tạo dòng thời gian
  • Có thể đánh giá các mối quan hệ thời gian do AI thiết lập dưới dạng giả thuyết chứ không phải quan hệ nhân quả
  • Khả năng xác thực giả thuyết nguyên nhân gốc rễ bằng các số liệu và mã cũng như chuẩn bị bản phác thảo sau khi khám nghiệm tử thi

Khi một phần mềm đang chạy trong môi trường sản xuất (môi trường trực tiếp), chỉ có dấu vết, số liệu và nhật ký (dòng nhật ký có dấu thời gian do ứng dụng tạo ra khi nó đang chạy) mới cho bạn biết nó đang làm gì. Lấy tín hiệu có ý nghĩa từ hàng nghìn, đôi khi hàng triệu dòng nhật ký trong thời gian ngừng hoạt động là thời điểm căng thẳng và quan trọng nhất về thời gian trong quá trình ứng phó sự cố. Ở đây, AI có thể là người trợ giúp, tóm tắt văn bản lớn, trích xuất các mẫu và tạo ra các giả thuyết – miễn là bạn tôn trọng các giới hạn về quyền riêng tư và xác minh.

Trong bài học này, chúng ta học cách sử dụng AI trong bối cảnh có thể quan sát được — khả năng hiểu trạng thái bên trong của hệ thống bằng cách xem xét các kết quả đầu ra bên ngoài của nó: trích xuất ý nghĩa từ nhiễu nhật ký, thiết lập dòng thời gian của lỗi, tìm các mẫu lặp lại và soạn thảo bản khám nghiệm tử thi. Cảnh báo nghiêm trọng trước: nhật ký sản xuất thô thường chứa dữ liệu cá nhân và bí mật; việc dán chúng một cách bừa bãi vào công cụ AI là vi phạm nghiêm trọng.

Tại sao nhật ký lại khó, tại sao AI lại hữu ích?

Khó ghi nhật ký vì ba lý do: âm lượng (có quá nhiều), nhiễu (nhiều dòng không liên quan) và lộn xộn (một sự kiện nằm rải rác trên nhật ký của các dịch vụ khác nhau). Mắt người sẽ mệt mỏi với đống này và bỏ lỡ dòng quan trọng.

AI rất giỏi trong việc tóm tắt các khối văn bản lớn, đếm các mẫu lặp lại và hỏi “điều gì đã thay đổi ngay trước khi xảy ra lỗi đó?” Nó có tác dụng mạnh mẽ trong việc thiết lập các mối quan hệ về thời gian như Tuy nhiên, có hai giới hạn. Đầu tiên là cửa sổ ngữ cảnh: số lượng nhật ký bạn có thể đưa vào một mô hình bị hạn chế, vì vậy trước tiên bạn cần lọc và lấy mẫu. Thứ hai, xác thực: AI nói “đây là nguyên nhân gốc rễ” là một giả thuyết; Đừng đưa ra quyết định mà không xác nhận nó bằng các số liệu và mã.

Thận trọng: Nhật ký sản xuất thô có thể chứa địa chỉ IP, email, mã thông báo, ID phiên và đôi khi là bí mật mở. Che dấu chúng trước khi đưa chúng vào AI hoặc chỉ sử dụng các công cụ bảo mật dữ liệu, được doanh nghiệp phê duyệt. Chúng ta đào sâu chủ đề này ở bài 10.

Từng bước: Từ nhật ký đến nguyên nhân gốc rễ

  1. Thu hẹp cửa sổ thời gian. Xác định thời điểm sự kiện bắt đầu; Kiểm tra cửa sổ đó, không phải cả ngày.
  2. Lọc tiếng ồn. Loại bỏ những dòng lặp đi lặp lại, vô hại đã biết; Tập trung vào lỗi (ERROR), cảnh báo (WARN) và thời điểm sai lệch đầu tiên.
  3. Che giấu dữ liệu nhạy cảm. Làm sạch dữ liệu cá nhân và bí mật trước khi đưa chúng cho AI.
  4. Tạo một bản tóm tắt và dòng thời gian. Yêu cầu AI tóm tắt sự kiện theo trình tự thời gian (“đầu tiên là thế này, sau đó là thế kia”).
  5. Xác thực giả thuyết bằng số liệu và mã. Lý do được AI chỉ ra; Xác nhận bằng bảng thông tin, mã liên quan và tiến trình triển khai, nếu có.
  6. Viết những gì đã học được bằng văn bản. Lập bản phác thảo khám nghiệm tử thi và liệt kê các hành động phòng ngừa.

Ba hộp nhỏ

Trường hợp 1 - 40.000 dòng được tóm tắt trong 5 phút. Dịch vụ thanh toán đã báo cáo lỗi không liên tục trong 12 phút. Nhóm đã cung cấp khoảng thời gian 20 phút có liên quan của nhật ký được che giấu (khoảng 40.000 dòng, được lấy mẫu) cho AI và tạo ra dòng thời gian. Mô hình cho thấy đợt bùng phát lỗi trùng với thời điểm thời gian phản hồi của dịch vụ phụ thuộc tăng từ 200 mili giây lên 8 giây. Nhóm đã xác nhận điều này trên bảng điều khiển và thu hẹp nguyên nhân trong vòng 10 phút.

Trường hợp 2 - Tương quan gây hiểu lầm. Trong một sự cố khác, AI đã đổ lỗi cho nó bằng cách nói rằng các lỗi xảy ra "cùng lúc" khi chạy cron (tác vụ theo lịch trình). Khi nhóm kiểm tra số liệu, họ thấy rằng cron thực sự đã hoàn thành trước sự kiện; Mối tương quan là sự trùng hợp ngẫu nhiên. Nguyên nhân thực sự là do rò rỉ bộ nhớ. Bài học: Mối tương quan về thời gian do AI thiết lập là manh mối chứ không phải bằng chứng.

Trường hợp 3 - Quá trình khám nghiệm tử thi được đẩy nhanh. Sau khi ngừng hoạt động, nhóm đã cung cấp bản ghi thông báo (được che giấu) và dòng thời gian từ kênh sự kiện đến AI và yêu cầu nó tạo ra một bản phác thảo sau khám nghiệm: tóm tắt, tác động, dòng thời gian, nguyên nhân gốc rễ, hành động. Biên tập viên con người đã sửa chữa sự thật và chỉ định chủ sở hữu hành động. Tài liệu thường mất 2 giờ nhưng được hoàn thành trong khoảng 40 phút với cấu trúc nhất quán hơn.

Bốn mẫu có thể sao chép

Tóm tắt nhật ký và dòng thời gian (với nhật ký ẩn):

Dưới đây là cửa sổ sự kiện của nhật ký sản xuất được che giấu.1) Đổ sự kiện vào dòng thời gian theo trình tự thời gian (đánh dấu thời điểm sai lệch đầu tiên).2) Đếm và nhóm các loại cảnh báo/lỗi tái diễn thường xuyên nhất.3) "Điều gì đã thay đổi ngay trước đó?" Liệt kê các sự kiện ứng viên cho câu hỏi. Đây là những giả thuyết; Đánh dấu nó là "phải được xác minh". {{nhật ký}}

Trích xuất mẫu lỗi:

Tìm các mẫu lỗi lặp lại trong các dòng nhật ký này. Đối với mỗi mẫu: dòng mẫu (được che), nguồn ước tính và ý nghĩa có thể có. Thu thập các lỗi đơn lẻ hiếm gặp nhưng nghiêm trọng vào một danh sách "chú ý" riêng.{{logs}}

Tạo truy vấn/bộ lọc có cấu trúc:

Đối với {{log tool: grep/jq/Kibana KQL/CloudWatch Insights}}, hãy viết truy vấn đáp ứng điều kiện sau: {{e.g. 5xx lỗi trong 15 phút qua, không bao gồm người dùng X}}. Giải thích truy vấn; Hãy chắc chắn rằng bạn không bịa ra tên miền, hãy hỏi nếu bạn không chắc chắn.

Bản phác thảo sau khi chết:

Viết bản phác thảo khám nghiệm tử thi từ dòng thời gian sự kiện (được che giấu) sau đây: Tóm tắt / Tác động (thời lượng, người dùng bị ảnh hưởng) / Dòng thời gian / Nguyên nhân cốt lõi / Điều gì đã diễn ra tốt đẹp / Hành động (để trống trường chủ sở hữu cho mỗi sự kiện). KHÔNG sử dụng ngôn ngữ buộc tội; Hãy thực tế và chủ động.{{timeline}}

Dấu nhắc yếu / Dấu nhắc mạnh

Yếu: “Nhìn những bản ghi này, có chuyện gì thế?” (Nhật ký thô của cả ngày, có dữ liệu cá nhân, không có mục tiêu.)
Strong: "Dưới đây là nhật ký sản xuất được che giấu từ 14:02–14:20 (được lọc thành 5xxs). Trong cửa sổ này, hãy tìm thời điểm bắt đầu xảy ra lỗi, đếm loại lỗi thường gặp nhất và liệt kê các sai lệch xuất hiện trong 60 giây ngay trước vụ nổ; đánh dấu tất cả chúng là 'giả thuyết cần được xác minh'."

Phiên bản mạnh mẽ; Nó thu hẹp khoảng thời gian, lọc và che giấu nhật ký, đặt một câu hỏi rõ ràng và thiết lập ngay từ đầu rằng kết quả đầu ra là một giả thuyết.

Nhiệm vụ

AI rất mạnh

Giới hạn/xác minh

Tóm tắt nhật ký lớn

Vâng, nhanh

Có thể có mất mẫu

Thiết lập mối quan hệ về thời gian

tạo gợi ý

Tương quan ≠ nhân quả

Tạo truy vấn/bộ lọc

dự thảo tốt

Tên miền có thật không?

phác thảo khám nghiệm tử thi

Cấu trúc và ngôn ngữ

Các trường hợp được xác nhận bởi con người

Tương quan không phải là nhân quả

Cạm bẫy phổ biến nhất trong phân tích nhật ký là sai lầm "nó xảy ra cùng lúc, vì vậy đó là lý do". AI rơi vào cái bẫy này dễ dàng, nếu không muốn nói là dễ dàng hơn con người; bởi vì nó cho rằng tính đồng thời trong văn bản là một tín hiệu mạnh. Có thể nói rằng một sự kiện thực sự dẫn đến một sự kiện khác; cần có thời gian, cơ chế và nếu có thể, độ lặp lại. Đối với mọi tuyên bố về quan hệ nhân quả mà AI thiết lập, chúng tôi hỏi “bằng chứng nào khác xác nhận điều này?” Kiểm tra nó bằng câu hỏi.

Mẹo: Khi đăng nhập vào AI, thay vì kết xuất văn bản, nếu có thể, hãy in truy vấn/bộ lọc trước và chạy nó trong xe của bạn; Bằng cách này, bạn vừa giảm được dữ liệu nhạy cảm vừa tách cửa sổ ngữ cảnh của mô hình thành các hàng thực sự quan trọng.

Những lỗi thường gặp

  • Dán nhật ký thô, chưa được che đậy. Tiết lộ dữ liệu cá nhân và bí mật; sự vi phạm nghiêm trọng quyền riêng tư.
  • Cho cả ngày cùng một lúc. Nó vượt quá cửa sổ ngữ cảnh, tín hiệu bị chìm trong nhiễu.
  • Nhầm lẫn mối tương quan với quan hệ nhân quả. Mối quan hệ thời gian do AI thiết lập chỉ là manh mối chứ không phải bằng chứng.
  • Dựa vào một truy vấn với một tên miền được tạo sẵn. Mô hình có thể đề xuất tên trường nhật ký không tồn tại; xác minh bằng sơ đồ.
  • Xuất bản khám nghiệm tử thi mà không cần xác minh. Sự thật và số liệu tác động phải được con người xác nhận.

Tóm lại

AI là một công cụ mạnh mẽ để đánh bại âm lượng và tiếng ồn trong phân tích nhật ký: tóm tắt các bản ghi lớn, thiết lập các mốc thời gian, trích xuất mẫu và chuẩn bị các bản phác thảo sau khi khám nghiệm tử thi. Nhưng hãy nhớ ba giới hạn: không xuất dữ liệu nhạy cảm mà không che giấu dữ liệu đó, lọc và lấy mẫu dữ liệu đó để phù hợp với cửa sổ ngữ cảnh, đồng thời xác minh từng tuyên bố về quan hệ nhân quả bằng số liệu và mã. Tương quan không phải là nhân quả; AI đưa ra manh mối, bạn đưa ra quyết định bằng bằng chứng.

Nhiệm vụ ứng dụng

Chọn khoảng thời gian 15–20 phút từ nhật ký sự kiện hoặc môi trường thử nghiệm mà bạn có. Đầu tiên hãy che giấu dữ liệu cá nhân và bí mật (hoặc tạo nhật ký tổng hợp). Sau đó trích xuất trình tự thời gian và các loại lỗi thường gặp nhất từ ​​AI bằng mẫu “tóm tắt nhật ký và dòng thời gian”. Hãy thử xác minh giả thuyết về nguyên nhân cốt lõi mà AI đưa ra bằng một số liệu hoặc đoạn mã mà bạn có: giả thuyết đó có đúng hay đó là một mối tương quan sai lệch? Viết phát hiện của bạn trong một câu.

danh sách kiểm tra

  • [ ] Tôi che giấu dữ liệu cá nhân và bí mật trước khi đưa nhật ký cho AI.
  • [ ] Tôi giảm phân tích xuống một khoảng thời gian hẹp và lọc.
  • [ ] Tôi coi các mối quan hệ thời gian do AI thiết lập là giả thuyết chứ không phải quan hệ nhân quả.
  • [ ] Tôi xác minh xác nhận nguyên nhân gốc rễ bằng số liệu và mã.
  • [ ] Tôi xác nhận rằng tên miền của truy vấn/bộ lọc tôi tạo là có thật.
  • [ ] Tôi xác nhận một cách nhân đạo các sự kiện và số liệu trong bản phác thảo khám nghiệm tử thi.