Jednostka 2 / 11

Gromadzenie dowodów i wsparcie w badaniach: przyspieszenie obrazowania, sortowania i analizy

Zyski:

  • Zrozumienie, że etapy zbierania, takie jak kolejność zmienności, pozyskiwanie obrazów, skrót i łańcuch dostaw, należą do odpowiedzialności człowieka, a sztuczna inteligencja tworzy tutaj jedynie plany i szablony
  • Możliwość bezpiecznego wykorzystania sztucznej inteligencji w celu przyspieszenia przeglądu plików, OCR, podsumowania i wyodrębnienia zasobów po wykonaniu obrazu
  • Umiejętność rozróżnienia, że segregacja nie polega na eliminacji, ale na ustalaniu priorytetów, oraz że pobieranie próbek z grupy o niskim priorytecie jest konieczne, aby uniknąć ryzyka uzyskania fałszywie negatywnych wyników.

Dotarłeś na miejsce zbrodni: komputer otwarty na stole, dysk zewnętrzny, dwa telefony i serwerownia. Każde urządzenie jest potencjalnym źródłem dowodów; Każdy zły ruch jest dowodem, który zostanie odrzucony w sądzie. Pozyskiwanie dowodów to proces utrwalania i kopiowania dowodów cyfrowych w stanie nienaruszonym, możliwym do sprawdzenia i zgodnym z prawem. W tym module dowiesz się, w których etapach tego procesu sztuczna inteligencja może bezpiecznie pomóc, a w których zdecydowanie powinna pozostać. Krytyczna zasada od początku: AI nie zbiera dowodów i nie robi zdjęć; Pomaga dokonać przeglądu i przyspieszyć wyprowadzenie zebranych i zweryfikowanych dowodów.

Kolejność odbioru i dane niestabilne

W zbieraniu dowodów obowiązuje zasada pierwszeństwa: kolejność zmienności — zbieranie danych od najszybciej zanikających do tych najbardziej trwałych. Na górze znajdują się dane ulotne — zawartość pamięci RAM tracona w przypadku wyłączenia urządzenia, otwartych połączeń sieciowych, uruchomionych procesów; Potem przychodzi dysk, potem nagrania zewnętrzne. Ulotne dane, raz utracone, nie wracają; Dlatego w działającym systemie pamięć RAM jest zrzucana przed dyskiem.

Sztuczna inteligencja na tym etapie nie podejmuje decyzji, ale jest przydatna do tworzenia list kontrolnych i zarysów procedur: „Co mam zebrać, w jakiej kolejności, za pomocą jakiego narzędzia, co udokumentować w tym scenariuszu?” Sam proces zbierania danych (powiązanie blokujące zapis, pozyskiwanie obrazu, weryfikacja skrótu, pieczętowanie) jest w rękach ludzi i każdy etap jest dokumentowany.

Wskazówka: zanim zaczniesz kompletować, wyjaśnij swój scenariusz sztucznej inteligencji i opracuj „plan sekwencyjnej kompletacji ze względu na zmienność”; następnie porównaj ten projekt ze standardową procedurą obowiązującą w Twojej instytucji (np. lokalnym ustawodawstwem i SOP laboratorium). AI to przypomnienie, a nie autorytet.

Obrazowanie i mieszanie: nienaruszalny łańcuch

Z każdego zebranego urządzenia pobierany jest dokładny obraz. Podczas importowania obrazu źródło jest chronione przez blokadę zapisu; Po ukończeniu obrazu obliczany jest skrót (preferowany jest SHA-256; samo MD5 jest obecnie uważane za słabe). Ten skrót jest odciskiem palca obrazu: musi być taki sam przy każdym sprawdzaniu skrótu podczas całego badania, w przeciwnym razie obraz zostanie uszkodzony. Formularz łańcucha dostaw (przez kogo, kiedy, gdzie zebrano dowód, gdzie go złożono, komu dostarczono) jest aktualizowany za każdym razem, gdy zmienia właściciela.

Sztuczna inteligencja wykonuje tutaj dwie bezpieczne zadania: (1) generuje szablony znaczników łańcucha dostaw i dowodów, które należy wypełnić podczas gromadzenia danych; (2) porządkuje skróty i znaczniki czasu zebrane w celu sprawdzenia spójności („czy te trzy skróty są takie same, który obraz należy do którego urządzenia?”). Sztuczna inteligencja sama nie oblicza skrótu – czyni z niego narzędzie kryminalistyczne; AI edytuje jedynie zapis.

Przeczytaj recenzję Przyspieszenie: Prawdziwa moc sztucznej inteligencji

Po zweryfikowaniu dowodów i przechwyceniu obrazu sztuczna inteligencja naprawdę błyszczy. Typowe obszary przyspieszeń:

  • Klasyfikacja plików: grupowanie dziesiątek tysięcy plików według typu, zawartości i możliwego znaczenia oraz rekomendowanie priorytetów.
  • Podsumowanie tekstu i dokumentu: wyodrębnianie tematów i stron w przypadku długich umów, e-maili, transkrypcji czatów.
  • OCR i treści wizualne: Wyodrębnianie tekstu ze zeskanowanych dokumentów (OCR — optyczne rozpoznawanie znaków, konwersja tekstu na obrazie) i oznaczanie obiektów/tekstu na obrazach.
  • Ekstrakcja jednostek (NER — rozpoznawanie nazwanych podmiotów, wyszukiwanie nazwanych podmiotów takich jak osoba, instytucja, konto, IP z tekstu): osoba wystawiająca wpis, IBAN, telefon, e-mail, adres portfela kryptowalutowego z tysięcy dokumentów.
  • Opis kodu i poleceń: Wyjaśnij prostym językiem, co robi znaleziony skrypt lub historia poleceń (do sprawdzenia).

W każdym przypadku wynik jest punktem wyjścia; Decyzja o przydatności i wartości dowodowej należy do biegłego.

Uwaga: sztuczna inteligencja mówiąca „ten plik jest nieistotny” nie wystarczy, aby wyeliminować ten plik bez jego sprawdzenia. Segregacja obniża priorytet, ale w krytycznych przypadkach pobieranie próbek odbywa się również z klastra o niskim priorytecie. Fałszywe negatywy (pomijanie prawdziwych dowodów jako „nieistotnych”) to najkosztowniejszy błąd w kryminalistyce komputerowej.

trzy mini etui

Przypadek 1 – Dokument poufny z OCR. W jednym dochodzeniu dotyczącym korupcji zeskanowano 14 000 stron; w żadnym z nich nie można było przeszukiwać tekstu. Dzięki OCR opartemu na sztucznej inteligencji wszystkie strony zostały przepisane i przeszukane pod kątem wzorców, takich jak „offshore”, konkretna nazwa firmy i IBAN. 9 krytycznych stron znalezionych w 40 minut; Ręczne czytanie zajęłoby tygodnie. Każda strona została następnie fachowo zweryfikowana.

Przypadek 2 — Sieć relacji wnioskowania o jednostce. Jeden plik dotyczący oszustw zawierał 6200 e-maili. Dzięki NER wyodrębniono wszystkie kontakty, konta i telefony i utworzono listę relacji; Tym samym pojawiły się dwa niezauważone wcześniej rachunki maklerskie. AI zaznaczyła połączenie; Prokurator potwierdził dowody zawarte w samych mailach.

Przypadek 3 – Niebezpieczeństwo fałszywie negatywnych wyników. Jeden zespół chciał całkowicie wyeliminować zestaw 30 000 plików, które sztuczna inteligencja określiła jako „małe zainteresowanie”. Starszy ekspert losowo pobrał 2% próbek z tego skupiska i znalazł w nim krytyczny zapis: sztuczna inteligencja błędnie sklasyfikowała plik ze względu na nietypowe rozszerzenie. Dyscyplina pobierania próbek uratowała sprawę.

Cztery szablony do kopiowania

1) Projekt planu zbiórki:

Twoja rola: specjalista ds. gromadzenia danych z miejsca zbrodni. Scenariusz: [na PC, 2 telefonach, 1 NAS, działającym serwerze]. Nakreśl mi plan zbiórki według zmienności: co zbierać dla każdego urządzenia, jakie narzędzie jest zalecane, co dokumentować. Należy pamiętać, że jest to wersja robocza i wymaga potwierdzenia zgodnie z lokalnymi przepisami.

2) Wzór łańcucha dostaw:

Wygeneruj dla mnie szablon formularza kontroli pochodzenia: podaj numer dowodu, opis urządzenia, numer seryjny, osobę zbierającą, datę/godzinę, metodę odbioru, skrót (SHA-256), odbiorcę, dostawcę, lokalizację przechowywania i wiersze dla każdego przekazania.

3) Żądanie zbiorczej selekcji plików:

Dam ci listę plików (nazwa, rozmiar, data, rozszerzenie). Pogrupuj według wysokiego/średniego/niskiego prawdopodobieństwa zainteresowania kryminalistyką i wpisz UZASADNIENIE. Uwaga: „niski” nie jest eliminowany, po prostu nadaje się mu priorytet. Oznacz osobno te, które mają niezgodność zawartości rozszerzenia.

4) Wyjaśnij znaleziony skrypt:

Wyjaśnij historię tego skryptu/poleceń w kontekście kryminalistycznym: co robi, jaki ma dostęp do plików/sieci, czy są jakieś ślady trwałości lub eksfiltracji danych? Połącz każde stwierdzenie z linią w skrypcie. Jeśli nie jesteś pewien, zaznacz to jako „należy zweryfikować”.

Słaba zachęta/silna zachęta

Słaba zachęta:

Oddziel te pliki według najważniejszych.

„Istotny” jest nieokreślony; Sztuczna inteligencja analizuje własne założenia i może przeoczyć najważniejsze dowody.

Potężny monit:

Twoja rola: analityk kryminalistyczny. Kontekst: badamy incydent związany z oprogramowaniem ransomware, szyfrowaniem i eksfiltracją danych. Podam Ci listę plików z nazwą, rozmiarem, datą utworzenia/modyfikacji i rozszerzeniem. Zadanie: narzędzie szyfrujące, kompresja/archiwizacja, nietypowe rozszerzenie, zmienione w ciągu ostatnich 72 godzin i oznaczenie dużych plików eksportu jako wysokiego priorytetu; Napisz uzasadnienie każdej decyzji. Jeśli rozszerzenie nie jest zgodne z oczekiwaną treścią, ostrzeż również. Nie mów „usuń/odrzuć” żadnego pliku; po prostu ustalaj priorytety.

Kontekst, cel i ograniczenie „nie mów usuń” sprawiają, że dane wyjściowe są zarówno użyteczne, jak i bezpieczne.

Kolekcja a recenzja: tabela roli AI

Scena

Czy sztuczna inteligencja jest bezpieczna?

Zadanie AI

praca człowieka

Zbieranie danych niestabilnych

Nie (decyzja)

projekt planu

Kolekcja, dokumentacja

pozyskiwanie obrazu

nie

szablon

Napisz blokadę, hash

Weryfikacja hasha

nie

rekordowa kolejność

Kalkulacja i potwierdzenie poprzez pojazd

Segregacja plików

Tak

priorytetyzacja

decyzja, pobieranie próbek

Ekstrakcja OCR/tekstu

Tak

konwersja

weryfikacja dokładności

wnioskowanie o istocie

Tak

Generowanie listy

Decyzja o znaczeniu

Typowe błędy

  • Próbuję zmusić sztuczną inteligencję do „zrobienia” wyboru. AI nie dodaje; Tworzy jedynie plany i szablony. Obraz i skrót są dziełem człowieka.
  • Mylenie wyniku segregacji z ostateczną eliminacją. Nie pomijaj próbkowania z klastra o „małym zainteresowaniu”.
  • Cytowanie wyników OCR bez ich weryfikacji. OCR może mieszać litery (0/0, 1/l); Potwierdź wartości krytyczne ze źródłem.
  • Ślepe zaufanie do rozszerzenia. Rozszerzenie mogło zostać zmienione; Sprawdź typ zawartości.
  • Wgranie danych osobowych do pojazdu bez maseczki. Dane dotyczące TC/IBAN/zdrowia mogą zostać ujawnione w wyniku masowego wnioskowania.

Podsumowując

Gromadzenie dowodów jest obowiązkiem człowieka: porządek zmienności, obraz, skrót i łańcuch dostaw są w ludzkich rękach; Tutaj sztuczna inteligencja tworzy tylko plany i szablony. Po zweryfikowaniu dowodów i przechwyceniu obrazu sztuczna inteligencja wnosi rzeczywistą wartość w postaci przyspieszenia przeglądu (segregacja, OCR, podsumowanie, ekstrakcja jednostek, adnotacja kodu). Ale każdy wynik jest znakiem, który należy sprawdzić; Decyzja o zasadności i wartości dowodowej należy do biegłego, który bierze pod uwagę także ryzyko fałszywie negatywnych wyników.

Zadanie aplikacji

Opisz fikcyjny scenariusz incydentu (np. podejrzenie pracownika o wydobywanie danych). Najpierw narysuj plan za pomocą szablonu „Projekt planu odbioru” i porównaj go z lokalną procedurą. Następnie przygotuj przykładową listę plików składającą się z 20 linii i nadaj jej priorytet za pomocą szablonu „Masowa segregacja plików”; ręcznie pobrać co najmniej 10% próbki i zweryfikować klasyfikację sztucznej inteligencji.

lista kontrolna

  • [ ] Ułożyłem plan zbiórki według zmienności i porównałem go z procedurą.
  • [ ] Otrzymałem obraz i skrót za pośrednictwem człowieka/narzędzia; Nie zleciłem tego AI.
  • [ ] Aktualizowałem formularz łańcucha dostaw za każdym razem, gdy zmieniał właściciela.
  • [ ] Pobrałem próbkę z „niskiego” skupienia wyniku segregacji.
  • [ ] Sprawdziłem OCR i dane wyjściowe zasobu ze źródłem; Zamaskowałem dane osobowe.