Lợi nhuận:
- Hiểu rằng phân loại là kỷ luật xác định thứ tự kiểm tra mà không xóa bất cứ điều gì và có thể thực hiện tìm kiếm ngữ nghĩa và phân cụm nội dung bằng trí tuệ nhân tạo.
- Khả năng giảm nhiễu bằng cách loại bỏ dựa trên hàm băm (NSRL) và khử trùng lặp cũng như tuân thủ các giới hạn của các phương pháp này (thay đổi một bit)
- Khả năng xác nhận các kết quả dương tính giả theo cách thủ công của tìm kiếm ngữ nghĩa và ghi lại các quyết định phân loại với lý do chính đáng để làm cho chúng có thể phòng thủ được
Một cuộc điều tra pháp y hiện đại không còn giới hạn ở một máy tính duy nhất. Trong một sự cố của công ty, bạn có thể gặp phải hàng chục ổ đĩa, hàng trăm gigabyte kho lưu trữ email, bản sao lưu đám mây, ứng dụng trò chuyện và hàng terabyte tệp. Về mặt vật lý, không thể kiểm tra tất cả chúng, từng cái một, từ đầu đến cuối. Đây là lúc việc phân loại (một khái niệm mượn từ y học; phân bổ nguồn lực hạn chế cho trường hợp quan trọng nhất trước tiên, tức là nhanh chóng quyết định "cái gì cần xem trước") phát huy tác dụng. Trong phần này, chúng ta sẽ xem cách AI ưu tiên các khối dữ liệu lớn một cách thông minh, những lỗi nào nó dễ mắc phải và cách phân loại phù hợp với tính toàn vẹn của pháp y.
Tại sao cần phải phân loại?
Trong pháp y máy tính, hai thực tế xung đột: (1) tất cả bằng chứng đều có giá trị và không nên bỏ sót điều gì; (2) thời gian và nhân lực còn hạn chế. Phân loại giải quyết xung đột này - bằng cách không xóa bất cứ thứ gì, chỉ bằng cách xác định thứ tự kiểm tra. Nói cách khác, phân loại không phải là "loại bỏ" mà là "ưu tiên". Dữ liệu có xác suất chứng minh cao nhất sẽ được kiểm tra trước tiên; Dữ liệu có xác suất thấp được lưu trữ nhưng sẽ được đưa vào hàng đợi sau.
Việc phân loại xảy ra ở hai cấp độ: phân loại trực tiếp (quyết định tại hiện trường thiết bị nào sẽ chụp ảnh trước) và phân loại dữ liệu (sau khi hình ảnh được chụp, tệp/tập dữ liệu nào cần kiểm tra trước). AI đặc biệt mạnh ở khía cạnh thứ hai, cụ thể là ưu tiên dựa trên nội dung của các bộ dữ liệu lớn.
Khía cạnh nhạy cảm về mặt pháp lý của việc phân loại là quyết định ra lệnh xác định hướng điều tra. Một cụm được ưu tiên không chính xác có thể dẫn đến việc tìm thấy bằng chứng quan trọng muộn nhiều tuần hoặc thậm chí không được kiểm tra vì cuộc điều tra đã hết hạn. Vì vậy, việc phân loại không phải là một "thủ thuật tốc độ" mà là một quyết định mang tính phương pháp và cần được ghi lại bằng văn bản với lý do chính đáng, giống như bất kỳ bước điều tra nào khác. Trong những trường hợp có nguy cơ cao, việc phân loại không thay thế được việc điều tra đầy đủ; nó chỉ xác định phần nào được xem xét đầu tiên, duy trì nguyên tắc rằng toàn bộ tập hợp sẽ được đánh giá cuối cùng.
Mẹo: Hãy ghi lại các quyết định phân loại của bạn và lý do của chúng. "Tại sao chúng ta lại xem xét cụm này trước, tại sao chúng ta lại để nó đến cuối cùng?" Câu hỏi có thể được hỏi tại tòa án. Đưa cơ sở lý luận về mức độ ưu tiên của AI vào hồ sơ này; Minh bạch là khả năng phòng thủ.
Ưu tiên dựa trên nội dung với AI
Phân loại cổ điển xem xét tên tệp, kích thước và ngày tháng. AI bổ sung thêm khả năng hiểu ngữ cảnh vào điều này: nó có thể hiểu tài liệu nói về nội dung gì, hình ảnh chứa đựng nội dung gì, giọng điệu của cuộc trò chuyện. Bằng cách này:
- Tìm kiếm ngữ nghĩa - tìm nội dung có ý nghĩa tương tự ngay cả khi từ không khớp chính xác: Tìm kiếm "chuyển tiền" cũng trả về các tài liệu có chứa "chuyển tiền", "giao hàng", "hướng dẫn thanh toán".
- Phân cụm chủ đề: Tự động sắp xếp hàng nghìn tài liệu theo chủ đề (tài chính, nhân sự, kỹ thuật, cá nhân).
- Đánh dấu cảm xúc/giọng điệu: Làm nổi bật các thông điệp truyền tải các giọng điệu như đe dọa, hoảng loạn, vi phạm quyền riêng tư.
- Phân loại trực quan: Nhóm hàng nghìn hình ảnh theo thẻ đối tượng/cảnh (trong giới hạn pháp lý, ví dụ: chỉ nội dung được phép và phù hợp).
- Loại bỏ trùng lặp và rác: Tách các bản sao của cùng một tệp và tệp hệ thống (với danh sách băm đã biết) và hướng ánh nhìn của con người đến nội dung thực sự mới.
Loại bỏ tệp đã biết: NSRL và bộ băm
Công cụ tăng tốc thực tế nhất để phân loại dữ liệu lớn được biết đến là danh sách băm tốt/xấu. Các thư viện như NSRL (Thư viện tham khảo phần mềm quốc gia) lưu giữ các bản băm của hàng triệu tệp ứng dụng và hệ điều hành tiêu chuẩn. Các tệp "đã biết rõ" này bị loại bỏ trong quá trình phân loại, cho phép một tệp chỉ tập trung vào các tệp đáng ngờ và do người dùng tạo. Tương tự, các hàm băm "xấu đã biết" (phần mềm độc hại đã biết) sẽ tự động được gắn cờ. AI sẽ phát huy tác dụng trong cụm còn lại sau đợt loại bỏ này, điều này thực sự đòi hỏi ý nghĩa.
Thận trọng: Việc loại bỏ dựa trên hàm băm rất mạnh mẽ, nhưng một thay đổi bit duy nhất sẽ thay đổi hoàn toàn hàm băm. Bằng cách sửa đổi một chút tệp tiêu chuẩn, kẻ tấn công có thể xóa tệp đó khỏi danh sách "đã biết tốt" hoặc ngược lại, ẩn tệp xấu. Loại bỏ không phải là một điều tuyệt đối, mà là một phương tiện ưu tiên.
ba trường hợp nhỏ
Trường hợp 1 - Tìm kiếm ngữ nghĩa chia thời gian cho 20. Một cuộc điều tra nội bộ đã tìm thấy 480GB email. Tìm kiếm từ khóa cổ điển trả về 3 kết quả cho "hối lộ". Tìm kiếm ngữ nghĩa do AI cung cấp cũng phát hiện ra các uyển ngữ như “phí tư vấn”, “tạo điều kiện”, “cảm ơn thanh toán” và trích xuất 61 tin nhắn có liên quan. Quá trình xem xét được hoàn thành trong 2 ngày thay vì hàng tuần; Mỗi kết quả đều được xác nhận bằng tay.
Trường hợp 2 - Loại bỏ sự trùng lặp giúp tiết kiệm nhân lực. Trong một cụm gồm 1,7 triệu tệp, sau khi làm sạch trùng lặp dựa trên hàm băm và loại bỏ NSRL, các tệp người dùng duy nhất cần kiểm tra đã giảm xuống còn 92.000. Nhóm tập trung vào nội dung thực tế hơn là một đống nội dung có 95% tiếng ồn hệ thống.
Trường hợp 3 - Cái giá của sự tự tin thái quá Một nhóm chưa bao giờ mở cái mà AI gọi là cụm “phi tài chính”. Hóa ra, một hợp đồng quan trọng đã được giấu bên trong một album ảnh cá nhân (không phải steganography, chỉ là nhầm thư mục). Bằng chứng bị trì hoãn do cụm có mức độ ưu tiên thấp không được lấy mẫu. Bài học: phân loại xác định thứ tự, không hủy khám.
Bốn mẫu có thể sao chép
1) Chiến lược phân loại dự thảo:
Vai trò của bạn: chuyên gia phân loại pháp y cấp cao. Dữ liệu: [ví dụ: Email 480GB + chia sẻ tệp 1,2TB. Chủ đề câu hỏi: [ví dụ: rò rỉ dữ liệu + hối lộ). Hãy phác thảo chiến lược phân loại cho tôi: cụm nào nên được xem xét theo thứ tự nào, với tiêu chí nào; Cách sử dụng loại bỏ hàm băm và tìm kiếm ngữ nghĩa. Nhấn mạnh rằng không có cụm nào bị "hủy", chúng sẽ chỉ được sắp xếp.
2) Mở rộng thuật ngữ tìm kiếm ngữ nghĩa:
Chủ đề: [hối lộ / rò rỉ dữ liệu / quấy rối]. Để tìm tài liệu liên quan đến chủ đề này, hãy liệt kê các cách diễn đạt ngầm/đồng nghĩa (bao gồm tiếng lóng, từ mã, lời nói gián tiếp) cũng như các từ khóa theo nghĩa đen. Mục đích là mở rộng phạm vi tìm kiếm; Phân loại từng thuật ngữ.
3) Phân cụm nội dung:
Tôi sẽ cung cấp cho bạn tiêu đề/tóm tắt tài liệu. Nhóm chúng thành các chủ đề có ý nghĩa (tài chính, nhân sự, kỹ thuật, pháp lý, cá nhân) và đưa ra chủ đề + lý do ngắn gọn cho từng tài liệu. Đánh dấu riêng cụm "mơ hồ" mà bạn không thể ghép vào chủ đề; Cụm này sẽ không bị bỏ qua, nó sẽ được kiểm tra thủ công.
4) Báo cáo ưu tiên sau loại trừ:
Các tệp được biết đến tốt (NSRL) và trùng lặp sẽ bị loại bỏ. Đối với các tệp người dùng duy nhất còn lại: chỉ định mức độ ưu tiên cao/trung bình/thấp theo chủ đề điều tra và viết LÝ LUẬN. Nội dung tiện ích mở rộng không khớp, các tệp được mã hóa/mật khẩu và các tệp đã thay đổi trong 30 ngày qua cũng được đánh dấu.
Dấu nhắc yếu / Dấu nhắc mạnh
Dấu nhắc yếu:
Tìm các tập tin quan trọng trong dữ liệu này.
Không có logic về chủ đề, phạm vi và mức độ ưu tiên; AI có thể bỏ lỡ nội dung quan trọng theo định nghĩa riêng của nó là “quan trọng”.
Lời nhắc mạnh mẽ:
Vai trò của bạn: nhà phân tích phân loại pháp y. Điều tra: một nhân viên bị cáo buộc đã rò rỉ danh sách khách hàng trước khi rời đi. Tôi sẽ cung cấp cho bạn siêu dữ liệu tệp (tên, kích thước, ngày tháng, phần mở rộng, đường dẫn) và tóm tắt nội dung ngắn gọn. Nhiệm vụ: đánh dấu dữ liệu khách hàng, xuất/lưu trữ, theo dõi tải lên đám mây, USB/ổ đĩa ngoài và các tệp đã thay đổi trong 60 ngày qua là mức độ ưu tiên cao; Viết lý do cho mỗi quyết định. Đừng nói rằng bất kỳ cụm nào cũng không thể kiểm tra được; chỉ cần sắp xếp. Liệt kê những điều không chắc chắn một cách riêng biệt.
Chủ đề cụ thể, tiêu chí được nhắm mục tiêu và ràng buộc "không đánh giá" làm cho kết quả đầu ra vừa hiệu quả vừa an toàn.
Bảng so sánh các phương pháp phân loại
phương pháp
làm gì
điểm mạnh
rủi ro
Loại bỏ băm (NSRL)
Phân bổ tập tin đã biết
Rất nhanh chóng, chính xác
Tệp đã sửa đổi thoát
Khử trùng lặp
Sao chép từng cái một
Tiết kiệm nhân lực
Có thể bỏ qua bản sao đóng
từ khóa
Tìm kiếm các thuật ngữ chính xác
Đơn giản, có thể kiểm tra được
Bỏ lỡ tuyên bố ngầm
Tìm kiếm ngữ nghĩa (AI)
Tìm ý nghĩa gần nhất
Nắm bắt nội dung tiềm ẩn
Tạo ra kết quả dương tính giả
Phân cụm nội dung (AI)
chia thành các chủ đề
Cung cấp tổng quan
Nguy cơ sai chủ đề
Những lỗi thường gặp
- Phân loại nhầm để loại bỏ. Mức độ ưu tiên thấp không phải là “không được xem xét”; lấy mẫu là cần thiết.
- Tin tưởng tuyệt đối vào việc loại bỏ hàm băm. Một thay đổi bit duy nhất sẽ thay đổi hàm băm; trường hợp quan trọng có thể yêu cầu quét toàn bộ.
- Chỉ cần dựa vào từ khóa. Các câu lệnh ngầm và được mã hóa thoát ra; Hoàn thành với tìm kiếm ngữ nghĩa.
- Không xác nhận kết quả dương tính giả của tìm kiếm ngữ nghĩa. AI có thể hiển thị tài liệu không liên quan là “có liên quan”; Đọc và xác minh.
- Không ghi lại được lý do phân loại. Tại tòa "tại sao bạn lại nhìn vào cái này đầu tiên?" Bạn phải có câu trả lời cho câu hỏi.
Tóm lại
Phân loại dữ liệu lớn là nguyên tắc hướng thời gian có hạn đến khả năng có bằng chứng cao nhất - bằng cách không xóa bất cứ thứ gì, chỉ xác định thứ tự. AI; Nó cung cấp tốc độ cao trong tìm kiếm ngữ nghĩa, phân cụm nội dung, đánh dấu giai điệu và ưu tiên sau khi loại bỏ. Nhưng chuyên gia tuân thủ các giới hạn của việc loại bỏ hàm băm, nguy cơ dương tính/âm tính giả và nguyên tắc "mức độ ưu tiên thấp không phải là không được kiểm tra". Việc ghi lại các quyết định phân loại có lý do chính đáng giúp kết quả có thể được bào chữa trước tòa.
Nhiệm vụ ứng dụng
Chuẩn bị danh sách siêu dữ liệu tệp mẫu (tên, kích thước, ngày tháng, phần mở rộng, tóm tắt ngắn gọn) dài 30-40 dòng; đặt một vài tệp "gây hiểu lầm" vào đó (tài liệu quan trọng vào sai thư mục, tệp có phần mở rộng đã thay đổi). Ưu tiên bằng mẫu “báo cáo ưu tiên sau loại trừ”, sau đó lấy mẫu ít nhất 15% từ cụm có mức độ ưu tiên thấp để xem AI có bỏ sót điều gì không.
danh sách kiểm tra
- [ ] Tôi thiết lập việc phân loại theo mức độ ưu tiên; Tôi đã không hủy bất kỳ cụm nào.
- [ ] Tôi đã giảm tiếng ồn bằng cách loại bỏ hàm băm và loại bỏ trùng lặp, đồng thời lưu ý đến các giới hạn của nó.
- [ ] Tôi đã hoàn thành từ khóa bằng tìm kiếm ngữ nghĩa.
- [ ] Tôi đã xác nhận theo cách thủ công các kết quả dương tính giả của đầu ra ngữ nghĩa/phân cụm.
- [ ] Tôi đã ghi lại các quyết định phân loại và lý do biện minh cho chúng.