Jednostka 4 / 11

Segregacja dużych zbiorów danych: ustalanie priorytetów terabajtów danych

Zyski:

  • Zrozumienie, że segregacja to dyscyplina polegająca na ustaleniu kolejności badania bez usuwania czegokolwiek, oraz umiejętność przeprowadzania wyszukiwania semantycznego i grupowania treści za pomocą sztucznej inteligencji.
  • Możliwość redukcji szumów poprzez eliminację w oparciu o skrót (NSRL) i deduplikację oraz przestrzeganie ograniczeń tych metod (zmiana pojedynczego bitu)
  • Możliwość ręcznego potwierdzania fałszywych alarmów wyszukiwania semantycznego i dokumentowania decyzji segregacyjnych wraz z uzasadnieniem, aby można je było obronić

Współczesne dochodzenie kryminalistyczne nie ogranicza się już do jednego komputera. Podczas incydentu korporacyjnego możesz napotkać dziesiątki dysków, setki gigabajtów archiwów poczty e-mail, kopie zapasowe w chmurze, aplikacje do czatowania i terabajty plików. Fizycznie niemożliwe jest zbadanie ich wszystkich, jeden po drugim, od początku do końca. W tym miejscu wchodzi w grę triage (koncepcja zapożyczona z medycyny; przydzielanie ograniczonych zasobów najpierw najbardziej krytycznemu przypadkowi, czyli szybkie podejmowanie decyzji, „na co zwrócić uwagę w pierwszej kolejności”). W tej części zobaczymy, jak sztuczna inteligencja inteligentnie ustala priorytety dużych stosów danych, na jakie błędy jest podatna i jak segregacja łączy się z integralnością kryminalistyczną.

Dlaczego segregacja jest konieczna?

W kryminalistyce komputerowej ścierają się dwie rzeczywistości: (1) wszystkie dowody są cenne i niczego nie można przeoczyć; (2) czas i siła robocza są ograniczone. Triage rozwiązuje ten konflikt — niczego nie usuwając, tylko ustalając kolejność badania. Innymi słowy, segregacja nie jest „eliminacją”, ale „ustalaniem priorytetów”. W pierwszej kolejności badane są dane o najwyższym prawdopodobieństwie dowodowym; Dane o niskim prawdopodobieństwie są przechowywane, ale trafiają do kolejki później.

Selekcja odbywa się na dwóch poziomach: selekcja na żywo (decydowanie na miejscu zdarzenia, które urządzenie ma zostać wykonane jako pierwsze) i selekcja danych (po przechwyceniu obrazów, który plik/zestaw danych należy sprawdzić w pierwszej kolejności). Sztuczna inteligencja jest szczególnie silna w tym ostatnim, a mianowicie w ustalaniu priorytetów dużych zbiorów danych w oparciu o treść.

Kryminalistycznym aspektem segregacji jest to, że decyzja nakazująca wyznacza kierunek dochodzenia. Klaster o nieprawidłowym ustaleniu priorytetów może spowodować, że krytyczne dowody zostaną znalezione z tygodniowym opóźnieniem lub nawet w ogóle nie zostaną zbadane ze względu na wygaśnięcie dochodzenia. Zatem segregacja nie jest „sztuczką szybkości”, ale decyzją metodologiczną i powinna być udokumentowana wraz z uzasadnieniem, tak jak każdy inny krok medycyny sądowej. W przypadkach wysokiego ryzyka segregacja nie zastępuje pełnego badania; określa jedynie, która część jest brana pod uwagę jako pierwsza, zachowując zasadę, że ostatecznie oceniony zostanie cały zestaw.

Wskazówka: Prowadź rejestr swoich decyzji dotyczących segregacji i ich powodów. „Dlaczego najpierw przyjrzeliśmy się tej gromadzie, dlaczego zostawiliśmy ją na koniec?” Pytanie można zadać w sądzie. Uwzględnij w tym zapisie uzasadnienie ustalenia priorytetów przez sztuczną inteligencję; Przejrzystość to możliwość obrony.

Priorytetyzacja oparta na treści za pomocą sztucznej inteligencji

Klasyczna segregacja sprawdza nazwę, rozmiar i datę pliku. Sztuczna inteligencja dodaje do tego zrozumienie kontekstu: może zrozumieć, o czym jest dokument, co zawiera obraz, ton rozmowy. W ten sposób:

  • Wyszukiwanie semantyczne - znajdowanie treści o podobnym znaczeniu nawet jeśli słowo nie pasuje dokładnie: Wyszukiwanie hasła "przelew" zwraca również dokumenty zawierające "przelew", "przesyłka", "instrukcja płatnicza".
  • Grupowanie tematów: Automatyczne sortowanie tysięcy dokumentów według tematów (finansowe, kadrowe, techniczne, osobiste).
  • Oznaczenie emocji/tonu: wyróżnianie wiadomości o takim tonie, jak groźba, panika, naruszenie prywatności.
  • Segregacja wizualna: grupowanie tysięcy obrazów według znaczników obiektu/sceny (w granicach prawnych, np. tylko autoryzowana i odpowiednia treść).
  • Eliminacja duplikatów i śmieci: Oddzielenie deduplikacji tego samego pliku i plików systemowych (ze znanymi listami skrótów) i skierowanie ludzkiego wzroku na naprawdę nową zawartość.

Znana eliminacja plików: NSRL i zestawy skrótów

Najbardziej praktycznym akceleratorem selekcji dużych zbiorów danych są znane dobre/złe listy skrótów. Biblioteki takie jak NSRL (National Software Reference Library) przechowują skróty milionów standardowych plików systemów operacyjnych i aplikacji. Te „znane dobre” pliki są eliminowane podczas selekcji, dzięki czemu można skupić się wyłącznie na plikach generowanych przez użytkowników i podejrzanych. Podobnie skróty „znane złe” (znane złośliwe oprogramowanie) są automatycznie oznaczane. Sztuczna inteligencja wchodzi w grę w pozostałym klastrze po tej eliminacji, co naprawdę wymaga znaczenia.

Uwaga: eliminacja oparta na haszu jest potężna, ale pojedyncza zmiana całkowicie zmienia hash. Modyfikując nieznacznie standardowy plik, osoba atakująca może usunąć go z listy „znanych dobrych” lub odwrotnie, ukryć zły plik. Eliminacja nie jest absolutna, ale środkiem priorytetowym.

trzy mini etui

Przypadek 1 — Wyszukiwanie semantyczne podzieliło czas przez 20. Wewnętrzne dochodzenie wykazało 480 GB e-maili. Klasyczne wyszukiwanie słów kluczowych zwróciło 3 wyniki dla „przekupstwo”. Wyszukiwanie semantyczne oparte na sztucznej inteligencji wychwyciło także eufemizmy, takie jak „opłata za konsultację”, „ułatwienia”, „dziękuję za płatność” i wyodrębniło 61 odpowiednich wiadomości. Przegląd został ukończony w 2 dni zamiast tygodni; Każdy wynik był potwierdzany ręcznie.

Przypadek 2 — Deduplikacja pozwoliła zaoszczędzić siłę roboczą. W klastrze składającym się z 1,7 miliona plików, po oczyszczeniu duplikatów w oparciu o skrót i wyeliminowaniu NSRL, liczba unikalnych plików użytkowników do sprawdzenia została zredukowana do 92 000. Zespół skupił się na rzeczywistej zawartości, a nie na stosie, który w 95% składał się z szumu systemowego.

Przypadek 3 — Cena nadmiernej pewności siebie. Jeden zespół nigdy nie otworzył tego, co sztuczna inteligencja nazywa klastrem „niefinansowym”. Jak się okazuje, kluczowa umowa została ukryta w osobistym albumie ze zdjęciami (nie w steganografii, tylko w niewłaściwym folderze). Dowody zostały opóźnione, ponieważ nie pobrano próbki z klastra o niskim priorytecie. Lekcja: segregacja ustala kolejność, a nie anuluje egzamin.

Cztery szablony do kopiowania

1) Projekt strategii segregacji:

Twoja rola: starszy specjalista ds. segregacji sądowej. Dane: [np. 480 GB poczty e-mail + 1,2 TB udostępniania plików]. Temat zapytania: [np. wyciek danych + przekupstwo).Narysuj dla mnie strategię segregacji: który klaster należy sprawdzić, w jakiej kolejności i według jakich kryteriów; Jak korzystać z eliminacji skrótów i wyszukiwania semantycznego. Podkreśl, że żadne klastry nie zostaną „anulowane”, zostaną one po prostu posortowane.

2) Semantyczne rozwinięcie wyszukiwanego hasła:

Temat: [przekupstwo / wyciek danych / molestowanie]. Aby znaleźć dokumenty powiązane z tym tematem, wymień wyrażenia ukryte/synonimiczne (w tym slang, słowo kodowe, mowę pośrednią), a także dosłowne słowa kluczowe. Celem jest rozszerzenie zakresu wyszukiwania; Skategoryzuj każdy termin.

3) Grupowanie treści:

Prześlę Ci tytuły/streszczenia dokumentów. Pogrupuj je w znaczące tematy (finansowe, HR, techniczne, prawne, osobiste) i podaj temat + krótkie uzasadnienie każdego dokumentu. Zaznacz oddzielnie klaster „niejednoznaczny”, którego nie możesz zmieścić w temacie; Klaster ten nie zostanie pominięty, zostanie sprawdzony ręcznie.

4) Raport priorytetowy po eliminacji:

Znane dobre (NSRL) i duplikaty plików są eliminowane. Dla pozostałych unikalnych plików użytkownika: nadaj wysoki/średni/niski priorytet zgodnie z przedmiotem badania i napisz UZASADNIENIE. Podświetlane są również niezgodność zawartości rozszerzenia, pliki zaszyfrowane/hasło oraz pliki, które uległy zmianie w ciągu ostatnich 30 dni.

Słaba zachęta/silna zachęta

Słaba zachęta:

Znajdź ważne pliki w tych danych.

Brakuje logiki tematu, zakresu i priorytetyzacji; Sztuczna inteligencja może pominąć krytyczne treści zgodnie z własną definicją słowa „ważne”.

Potężny monit:

Twoja rola: analityk kryminalistyczny. Dochodzenie: pracownik rzekomo ujawnił listę klientów przed odejściem. Prześlę Ci metadane pliku (nazwę, rozmiar, datę, rozszerzenie, ścieżkę) oraz krótkie streszczenie treści. Zadanie: oznacz dane klienta, eksport/archiwum, śledzenie przesyłania w chmurze, dysk USB/zewnętrzny i pliki zmienione w ciągu ostatnich 60 dni jako wysoki priorytet; Napisz uzasadnienie każdej decyzji. Nie mów, że nie można zbadać żadnego skupienia; po prostu sortuj. Wymień niepewności osobno.

Konkretny temat, ukierunkowane kryteria i ograniczenie „braku przeglądu” sprawiają, że wyniki są zarówno wydajne, jak i bezpieczne.

Tabela porównawcza metod selekcji

Metoda

Co robi

mocny punkt

ryzyko

Eliminacja skrótu (NSRL)

Przydziela znany plik

Bardzo szybko, precyzyjnie

Zmodyfikowany plik ucieka

Deduplikacja

Kopiuje jeden po drugim

Oszczędność siły roboczej

Można pominąć bliską kopię

słowo kluczowe

Wyszukuje dokładne terminy

Proste, kontrolowane

Pomija ukryte stwierdzenie

Wyszukiwanie semantyczne (AI)

Znajduje najbliższe znaczenie

Przechwytuje niejawną treść

Daje fałszywe wyniki pozytywne

Klastrowanie treści (AI)

dzieli się na tematy

Zapewnia przegląd

Ryzyko złego motywu

Typowe błędy

  • Mylenie segregacji z eliminacją. Niski priorytet nie jest „nie do przeglądu”; pobieranie próbek jest niezbędne.
  • Całkowite zaufanie do eliminacji skrótów. Zmiana pojedynczego bitu powoduje zmianę skrótu; krytyczny przypadek może wymagać pełnego skanowania.
  • Po prostu opierając się na słowie kluczowym. Ukryte i zakodowane wypowiedzi wymykają się; W komplecie z wyszukiwaniem semantycznym.
  • Nie potwierdzanie fałszywego wyniku wyszukiwania semantycznego. Sztuczna inteligencja może pokazać nieistotny dokument jako „powiązany”; Przeczytaj i zweryfikuj.
  • Brak udokumentowania uzasadnienia segregacji. W sądzie: „Dlaczego najpierw na to spojrzałeś?” Musisz mieć odpowiedź na pytanie.

Podsumowując

Segregacja dużych zbiorów danych to dyscyplina polegająca na kierowaniu ograniczonego czasu na dowody o najwyższym prawdopodobieństwie — nie usuwając niczego, a jedynie ustalając kolejność. sztuczna inteligencja; Zapewnia dużą prędkość wyszukiwania semantycznego, grupowania treści, oznaczania tonowego i ustalania priorytetów po eliminacji. Ekspert przestrzega jednak granic eliminacji skrótu, ryzyka fałszywych wyników pozytywnych/negatywnych oraz zasady „niski priorytet nie jest niezbadany”. Dokumentowanie decyzji segregacyjnych wraz z uzasadnieniem sprawia, że ​​wynik jest możliwy do obrony w sądzie.

Zadanie aplikacji

Przygotuj przykładową listę metadanych pliku (nazwa, rozmiar, data, rozszerzenie, krótkie podsumowanie) o długości 30-40 linii; umieść w nim kilka „mylących” plików (dokument krytyczny w złym folderze, plik ze zmienionym rozszerzeniem). Ustal priorytety za pomocą szablonu „raportu o priorytetach po eliminacji”, a następnie pobierz co najmniej 15% próbki z klastra o niskim priorytecie, aby sprawdzić, czy sztuczna inteligencja niczego nie przeoczyła.

lista kontrolna

  • [ ] Ustawiłem segregację jako priorytet; Nie anulowałem żadnych klastrów.
  • [ ] Zmniejszyłem szum poprzez eliminację skrótu i ​​deduplikację, pamiętając o jego ograniczeniach.
  • [ ] Uzupełniłem słowo kluczowe o wyszukiwanie semantyczne.
  • [ ] Ręcznie potwierdziłem fałszywe alarmy wyników semantycznych/grupowania.
  • [ ] Dokumentowałem decyzje segregacyjne i ich uzasadnienia.