Lợi nhuận:
- Hiểu rằng trí tuệ nhân tạo tóm tắt và phân cụm hàng nghìn dòng nhật ký, thiết lập dòng thời gian và nêu bật các mẫu đáng ngờ, nhưng nhà phân tích quyết định rằng sự kiện này là một cuộc tấn công thực sự với nhật ký thô
- Khả năng áp dụng đường cơ sở (hành vi bình thường) khi đánh giá cảnh báo SIEM và cách loại bỏ các kết quả dương tính giả mà không cần ngữ cảnh cũng như cách giải thích sự bất thường
- Khả năng hình thành thói quen xác minh chuỗi sự kiện do trí tuệ nhân tạo thiết lập trong nhật ký thô và loại bỏ các mối tương quan giả mạo
Một nhà phân tích chứng khoán dành phần lớn thời gian trong ngày để đọc nhật ký. Nhật ký là một dòng văn bản đánh dấu thời gian những gì đã xảy ra trên hệ thống: ai đăng nhập khi nào, tệp nào được truy cập, kết nối nào bị từ chối. Vấn đề không phải là có quá ít khúc gỗ mà là có quá nhiều khúc gỗ đến mức ngột ngạt. Một tổ chức cỡ trung bình tạo ra hàng trăm triệu dòng nhật ký mỗi ngày. Trong đống này, dấu vết của một cuộc tấn công thực sự là kim đáy bể. SIEM (Quản lý sự kiện và thông tin bảo mật - hệ thống thu thập và đối chiếu nhật ký từ các nguồn khác nhau trong một trung tâm duy nhất và tạo ra các cảnh báo dựa trên quy tắc) có mặt để tìm ra chiếc kim này; nhưng hầu hết các cảnh báo mà SIEM tạo ra đều là dương tính giả (các cảnh báo vô ích không thực sự là mối đe dọa). Công việc thực sự của nhà phân tích là trích xuất tín hiệu thực từ nhiễu này.
Trí tuệ nhân tạo là một trợ thủ đắc lực trong việc phân loại này. Nó có thể đọc hàng nghìn dòng nhật ký trong vài giây và tóm tắt chúng bằng ngôn ngữ của con người, tập hợp các mẫu lặp lại, mô tả một chuỗi sự kiện là “đầu tiên chuyện này xảy ra, sau đó chuyện kia” và giải thích lý do tại sao cảnh báo có vẻ đáng ngờ. Nhưng AI không biết nhật ký có ý nghĩa gì trong bối cảnh của tổ chức: "truy cập lúc 3 giờ sáng" là một cuộc tấn công ở một tổ chức, một ca đêm bình thường ở một tổ chức khác. Vì vậy, AI tóm tắt và gắn cờ nhật ký, nhưng nhà phân tích quyết định liệu một sự kiện có phải là một cuộc tấn công thực sự hay không và xác minh nó bằng nhật ký thô.
Các bước phân tích nhật ký
Dưới đây là cách bạn chạy phân tích nhật ký/SIEM từng bước bằng AI:
- Thu thập và ẩn danh. Xóa đoạn nhật ký có liên quan; thay thế IP thực, tên người dùng, tên máy chủ nội bộ bằng phần giữ chỗ (USER_A, IC_IP_1). Không bao giờ xuất dữ liệu thô sang một công cụ bên ngoài.
- Đưa ra bối cảnh. Cho AI biết nguồn của nhật ký (tường lửa, nhật ký sự kiện Windows, máy chủ web), hành vi bình thường là gì và bạn đang tìm kiếm điều gì. Phân tích nhật ký không có ngữ cảnh sẽ gây hiểu nhầm.
- Tóm tắt và tổng hợp. Yêu cầu AI nhóm hàng nghìn hàng theo loại sự kiện, trích xuất số lần xuất hiện và tạo dòng thời gian.
- Đã gắn cờ các mẫu đáng ngờ. Đánh dấu các mẫu như "một lần đăng nhập thành công sau những lần đăng nhập không thành công", "nhiều lần truy cập tệp trong một khoảng thời gian ngắn", "kết nối mạng thuộc một quy trình không xác định".
- Xác minh bằng bằng chứng thô. Tìm và xác nhận từng mẫu mà AI gắn cờ trong các dòng nhật ký thực tế. Đồng thời tự mình quét những khu vực mà AI bỏ sót.
- Quyết định và đăng ký. Khai báo sự kiện thực tế với tư cách là nhà phân tích, mở một yêu cầu và ghi lại rằng AI chỉ đơn thuần là một máy gia tốc.
Một số thuật ngữ: Nguồn nhật ký là hệ thống tạo ra nhật ký. Mối tương quan là tập hợp các sự kiện từ các nguồn khác nhau và hiểu ý nghĩa của chúng (đăng nhập VPN + truy cập tệp + truyền dữ liệu = có thể bị rò rỉ). Đường cơ sở là thước đo hoạt động bình thường của một hệ thống; Sự bất thường chỉ có ý nghĩa khi so sánh với đường cơ sở. UEBA (Phân tích hành vi người dùng và thực thể) là một phương pháp tiếp cận dựa trên AI nhằm tìm hiểu hành vi bình thường của từng người dùng và gắn cờ sai lệch.
biểu đồ so sánh
Cách tiếp cận
Nó hoạt động như thế nào
điểm mạnh
điểm yếu
SIEM dựa trên quy tắc
Đã sửa lỗi quy tắc "nếu-thì"
Minh bạch, có thể giải thích
Bỏ lỡ cuộc tấn công không xác định, rất nhiều kết quả sai
Phát hiện dựa trên chữ ký
Khớp với mẫu xấu đã biết
Nhanh chóng trước mối đe dọa đã biết
Bị mù trước cuộc tấn công mới/đã thay đổi
Bất thường/UEBA (AI)
Tìm thấy độ lệch so với bình thường
Có thể nắm bắt những điều chưa biết
Bất thường = không tấn công; nguy cơ dương tính giả
Tóm tắt bằng AI
Tóm tắt ngôn ngữ đăng nhập
Tốc độ, khả năng đọc
Không có bối cảnh, nguy cơ ảo giác
Nhà phân tích (con người)
Nhận xét có ngữ cảnh
quyết định, trách nhiệm
Chậm, mệt mỏi, không tăng quy mô
Thiết lập phù hợp không phải là chọn một mà là phân lớp: SIEM và chữ ký đại khái lọc nhiễu, AI tóm tắt và đánh dấu, nhà phân tích xác minh và quyết định.
ba trường hợp nhỏ
Trường hợp 1 - 50.000 dòng, 6 phút. Một nhà phân tích ẩn danh 50.000 dòng nhật ký truy cập từ máy chủ web đến AI. AI suy luận rằng một IP bên ngoài đã thu thập thông tin/các tuyến quản trị viên với 12.000 yêu cầu trong 3 giờ, đã thử 480 thông số khác nhau và nhận được 200 phản hồi 3 lần. Nhà phân tích tìm thấy 3 yêu cầu thành công này trong nhật ký thô, xác minh đây là cuộc tấn công liệt kê đường dẫn thực và chặn IP. Đọc 50.000 dòng bằng tay sẽ mất hàng giờ; Bản tóm tắt đã cắt giảm xuống còn 6 phút nhưng đó là quyết định của nhà phân tích.
Trường hợp 2 - Tương quan giả tạo. Một nhà phân tích khác nói với AI rằng “hãy mô tả chuỗi tấn công trong nhật ký này”. AI xây dựng một câu chuyện trôi chảy: "Vào lúc 02:11, USER_B đã nâng cao đặc quyền và xuất dữ liệu." Nhà phân tích mở nhật ký thô trước khi viết nó vào báo cáo; trong khi trong nhật ký không có leo thang đặc quyền hay truyền dữ liệu - mô hình này phù hợp với một chuỗi sự kiện điển hình trong “câu chuyện tấn công”. Nhà phân tích trích dẫn tuyên bố. Bài học: Mọi chuỗi mà AI yêu cầu đều phải được xác minh trong nhật ký.
Trường hợp 3 - Ca đêm dương tính giả. Mô hình UEBA gắn cờ người dùng truy cập 900 tệp vào lúc 3 giờ sáng là "sự bất thường có nguy cơ cao". Nhà phân tích kiểm tra bối cảnh: người dùng là người vận hành dự phòng và công việc này diễn ra vào lúc 03:00 hàng đêm; Đường cơ sở đã không được xem xét. Báo động là dương tính giả. Nhà phân tích đặt quy tắc và thêm toán tử này vào danh sách ngoại lệ. Sự bất thường không phải lúc nào cũng là một cuộc tấn công; Không có bối cảnh, báo động là tiếng ồn.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Kiểm tra nhật ký này, cho tôi biết nếu có cuộc tấn công.[10.14.2.7 - ahmet.yilmaz - 200 - /admin ...]
Lời nhắc này chứa IP thực và người dùng (vi phạm quyền riêng tư), không cho biết nguồn nhật ký và hành vi bình thường, không yêu cầu AI cung cấp bằng chứng và đánh giá dương tính giả. AI có thể đánh lừa bạn chỉ bằng một câu "vâng, có một cuộc tấn công".
Lời nhắc mạnh mẽ:
Vai trò của bạn: Trợ lý cho nhà phân tích SOC chuẩn bị BẢN THẢO phân tích. Đừng quyết định, đừng tuyên bố tấn công. Đây là nhật ký truy cập ẩn danh của máy chủ web (IP và người dùng bị ẩn). Lưu lượng truy cập bình thường: 100-300 yêu cầu/giờ trong giờ làm việc, chủ yếu là các tuyến đường/sản phẩm và/giỏ hàng. Nhiệm vụ của bạn: (1) phân cụm các sự kiện theo loại và nguồn, đưa ra số lần xuất hiện, (2) các mẫu cờ sai lệch so với đường cơ sở, (3) hiển thị cho mỗi cờ những dòng nhật ký mà nó dựa vào, (4) viết ra xác suất dương tính giả cho mỗi cờ và lý do. Dây nối/chèn IOC; Đánh dấu "[nhà phân tích xác minh]" ở chỗ bạn không chắc chắn.[nhật ký ẩn danh tại đây]
Tuyên bố mạnh mẽ sẽ giới hạn vai trò, cung cấp bối cảnh và đường cơ sở, đồng thời yêu cầu gắn kết với bằng chứng và đánh giá các kết quả dương tính giả.
Mẫu lời nhắc có thể sao chép
MẪU TÓM TẮT NHẬT KÝ [nguồn nhật ký ẩn danh sau đây: ví dụ: Tóm tắt nhật ký [tường lửa]: (1) nhóm theo loại sự kiện và đưa ra số lần xuất hiện của mỗi nhóm, (2) trích xuất số lượng nguồn/mục tiêu duy nhất, (3) thiết lập dòng thời gian (sự kiện đầu tiên đến sự kiện cuối cùng, giờ cao điểm), (4) liệt kê 5 điểm bất thường nổi bật kèm theo một dòng bằng chứng. Ra quyết định; tóm tắt thôi. Nhật ký: [dán]
MẪU TƯƠNG QUAN Tương quan các sự kiện ẩn danh theo thời gian và thực thể và xây dựng một chuỗi sự kiện có thể có; NHƯNG, đối với mỗi bước, hãy cho biết nó dựa trên dòng nhật ký nào và đánh dấu bước không có cơ sở là "[không có cơ sở - phải được xác minh]". Viết một lời giải thích thay thế có thiện chí là tốt. Sự kiện: [dán]
MẪU LOẠI BỎ TÍCH CỰC SAIĐối với cảnh báo này, hãy đưa ra ít nhất 3 lời giải thích có thiện chí (dương tính giả) cho cách diễn giải cuộc tấn công và viết ra nhật ký/bằng chứng bổ sung mà tôi cần xem xét để xác minh từng lời giải thích. Sau đó xác định bằng chứng bổ sung nào ủng hộ cuộc tấn công và bằng chứng nào chống lại nó. Cảnh báo: [dán]
MẪU TRÍCH DẪN THỜI GIAN: Một dòng thời gian theo trình tự thời gian duy nhất được trích xuất từ các nhật ký ẩn danh này: mỗi dòng có định dạng [thời gian] [thực thể] [sự kiện] [nhật ký nguồn]. Thêm sự kiện không có dấu thời gian. Đừng tạo nên những khoảng trống; Nếu thiếu thì ghi "[thiếu]". Nhật ký: [dán]
Những lỗi thường gặp
- Phân tích không có bối cảnh. Nhận xét được đưa ra mà không đề cập đến nguồn nhật ký và hành vi bình thường (cơ sở) là sai lệch; "bất thường" có ý nghĩa tùy theo ngữ cảnh.
- Không xác minh chuỗi do AI thiết lập. Mô hình có thể kết nối các sự kiện thông thường với một câu chuyện tấn công; Xác nhận từng bước trong nhật ký thô.
- Nhầm một sự bất thường với một cuộc tấn công. Dấu hiệu của UEBA là một giả thuyết; Loại bỏ các nguyên nhân vô tội như sao lưu, bảo trì, phần mềm mới.
- Xuất dữ liệu thô mà không cần che giấu. IP/người dùng/máy chủ thực vừa vi phạm KVKK vừa là quà tặng bản đồ mạng cho kẻ tấn công.
- Đừng tin vào bản tóm tắt tiêu cực và ngừng duyệt. Chạy truy vấn hệ thống của riêng bạn (các loại sự cố nghiêm trọng, IOC mới) ngay cả khi AI nói "không có gì quan trọng".
Mẹo: Luôn yêu cầu "hiển thị dòng bằng chứng" khi nhờ AI tóm tắt nhật ký. Đừng coi trọng bất kỳ phát hiện nào mà không có bằng chứng cụ thể; Quy tắc này loại bỏ hầu hết các ảo giác.
Thận trọng: Việc loại bỏ cảnh báo SIEM chỉ vì AI cho biết "dương tính giả" có thể đang che đậy một cuộc tấn công thực sự. Đồng thời kiểm tra độc lập cảnh báo mà AI gọi là "không quan trọng"; Quyết định đóng cửa thuộc về nhà phân tích và được ghi lại.
Tóm lại
Bản chất của phân tích nhật ký và SIEM là trích xuất tín hiệu thực từ một đống nhiễu lớn. Trong cách sắp xếp này, AI tóm tắt nhật ký theo giây, phân cụm các mẫu, thiết lập dòng thời gian và làm nổi bật nghi phạm – nhưng không biết bối cảnh thể chế và có thể bịa ra các sự kiện. Vì vậy, thiết lập chính xác được phân lớp: quy tắc/chữ ký được sàng lọc sơ bộ, AI tóm tắt và gắn cờ, nhà phân tích xác minh bằng nhật ký thô và đưa ra quyết định. Ba nguyên tắc bảo vệ bạn: bối cảnh (không giải thích bất thường mà không có cơ sở), bằng chứng (mỗi phát hiện được gắn với dòng nhật ký thô), kiểm soát độc lập (cái mà AI gọi là khu vực "sạch" cũng được quét). Và luôn làm việc ẩn danh.
Nhiệm vụ ứng dụng
Lấy một đoạn nhật ký mẫu (được ẩn danh từ hệ thống của riêng bạn hoặc từ tập dữ liệu mẫu). Đầu tiên, tóm tắt nó cho AI bằng mẫu "Tóm tắt nhật ký". Sau đó áp dụng mẫu “Loại bỏ dương tính giả” cho từng phát hiện trong số ba phát hiện đáng chú ý nhất và tự mình xác minh từng phát hiện đó trong nhật ký thô. Cuối cùng, hãy lưu ý sự khác biệt giữa bản tóm tắt của AI và bản đọc thô của bạn: AI đã bỏ sót điều gì, nó đã bù đắp điều gì, nó đã làm đúng điều gì?
danh sách kiểm tra
- [ ] Tôi đã ẩn danh nhật ký; IP thực/người dùng/máy chủ bị che giấu.
- [ ] Tôi đã cung cấp cho AI nguồn nhật ký và hành vi bình thường (đường cơ sở).
- [ ] Tôi đã yêu cầu một dòng nhật ký bằng chứng cho mỗi phát hiện và xác minh nó trong nhật ký thô.
- [ ] Tôi đã xác nhận từng bước trong chuỗi sự kiện do AI thiết lập, loại bỏ sự bịa đặt.
- [ ] Tôi đã xem xét ít nhất một lời giải thích tích cực sai cho mỗi cảnh báo.
- [ ] Tôi cũng đã quét những khu vực mà AI gọi là "sạch/không quan trọng".
- [ ] Với tư cách là người phân tích, tôi đưa ra quyết định và lập biên bản sự việc; Tôi đã ghi lại AI như một máy gia tốc.