единици
1. Въведение в изкуствения интелект в криминалистиката: роли, граници, проверка, цялост на доказателствата и етика 2. Подкрепа за събиране на доказателства и изследване: ускоряване на изображения, сортиране и анализ 3. Анализ на дневник и времева линия: Поставяне на събитията в правилния ред 4. Сортиране на големи данни: Приоритетизиране на терабайти данни 5. Електронно откриване: Намиране на подходящи доказателства в корпоративни данни 6. Съдебномедицински анализ на зловреден софтуер и мрежа: обратно инженерство за отбраната 7. Мобилен, облачен и криминалистичен анализ на приложения: чат, местоположение и данни от приложения 8. Откриване на Deepfake и синтетични медии: Фалшиво изображение, аудио и видео проверка 9. Целостта на доказателствата, веригата на задържане и правната допустимост 10. Проект на доклад и експертна презентация: Писане на констатациите разбираемо и защитно 11. Работен процес от край до край, управление на лабораторията, валидиране и отговорна употреба
единица 4 / 11

Сортиране на големи данни: Приоритетизиране на терабайти данни

Печалби:

  • Разберете, че сортирането е дисциплината за определяне на реда на изследване, без да изтривате нищо, и можете да извършвате семантично търсене и групиране на съдържание с изкуствен интелект.
  • Възможност за намаляване на шума с хеш-базирано елиминиране (NSRL) и дедупликация и спазване на ограниченията на тези методи (промяна на един бит)
  • Възможност за ръчно потвърждаване на фалшиви положителни резултати от семантично търсене и документиране на решения за сортиране с обосновка, за да ги направи защитими

Модерното криминалистично разследване вече не се ограничава до един компютър. При корпоративен инцидент може да срещнете десетки дискове, стотици гигабайти имейл архиви, облачни резервни копия, приложения за чат и терабайти файлове. Физически е невъзможно да ги разгледаме всички, един по един, от началото до края. Това е мястото, където триажът (концепция, заимствана от медицината; разпределяне на ограничени ресурси първо за най-критичния случай, т.е. бързо решаване „какво да се гледа първо“) влиза в действие. В този раздел ще видим как изкуственият интелект интелигентно приоритизира големи купчини данни, към какви грешки е склонен и как сортирането се съчетава с почтеността на криминалистиката.

Защо е необходимо сортиране?

В компютърната криминалистика две реалности са в конфликт: (1) всички доказателства са ценни и нищо не трябва да се пропуска; (2) времето и работната сила са ограничени. Сортирането разрешава този конфликт — като не изтрива нищо, а просто като определя реда на изследване. С други думи, триажът не е „елиминиране“, а „приоритизиране“. Първо се изследват данните с най-висока вероятност за доказателство; Данните с ниска вероятност се съхраняват, но идват на опашката по-късно.

Сортирането се извършва на две нива: сортиране на живо (решаване на мястото кое устройство да се изобрази първо) и сортиране на данни (след като изображенията бъдат заснети, кой файл/набор от данни да се изследва първо). AI е особено силен в последното, а именно базирано на съдържание приоритизиране на големи набори от данни.

Съдебно-чувствителният аспект на триажа е, че решението за разпореждане определя посоката на разследването. Неправилно приоритизираният клъстер може да доведе до намиране на критично доказателство със седмици закъснение или дори да не бъде изследвано изобщо, защото разследването е изтекло. Така че триажът не е „бърз трик“, а методологично решение и трябва да бъде документиран с обосновка, както всяка друга криминалистична стъпка. При високорискови случаи триажът не замества пълното разследване; той просто определя коя част се разглежда първа, запазвайки принципа, че целият набор ще бъде оценен в крайна сметка.

Съвет: Записвайте решенията си за сортиране и причините за тях. „Защо първо разгледахме този клъстер, защо оставихме това за последно?“ Въпросът може да бъде зададен в съда. Включете обосновката за приоритизиране на AI в този запис; Прозрачността е защита.

Приоритизиране въз основа на съдържание с AI

Класическото сортиране разглежда името на файла, размера и датата. AI добавя разбиране на контекста към това: той може да разбере за какво става въпрос в даден документ, какво съдържа изображението, тона на разговор. По този начин:

  • Семантично търсене - намиране на съдържание, което е подобно по смисъл, дори ако думата не съвпада точно: Търсенето на "паричен превод" също връща документи, съдържащи "паричен превод", "пратка", "платежна инструкция".
  • Групиране на теми: Автоматично сортиране на хиляди документи по теми (финансови, човешки ресурси, технически, лични).
  • Маркиране на емоции/тонове: Маркиране на съобщения, които предават тонове като заплаха, паника, нарушаване на поверителността.
  • Визуално сортиране: Групиране на хиляди изображения по маркер на обект/сцена (в законови ограничения, напр. само разрешено и подходящо съдържание).
  • Елиминиране на дублирани и ненужни файлове: Разделяне на дедупликации на един и същ файл и системни файлове (с известни хеш списъци) и насочване на човешкия поглед към наистина ново съдържание.

Елиминиране на известни файлове: NSRL и хеш набори

Най-практичният ускорител за сортиране на големи данни са познатите добри/лоши хеш списъци. Библиотеки като NSRL (National Software Reference Library) съдържат хешове на милиони стандартни операционни системи и файлове на приложения. Тези „известно добри“ файлове се елиминират при сортиране, което позволява да се съсредоточи само върху генерирани от потребители и подозрителни файлове. По същия начин „известно лоши“ хешове (известен зловреден софтуер) автоматично се маркират. AI влиза в игра в оставащия клъстер след това елиминиране, което наистина изисква смисъл.

Внимание: Елиминирането на базата на хеш е мощно, но промяна на един бит напълно променя хеша. Като леко модифицира стандартен файл, атакуващият може да го премахне от списъка с „известни добри“ или, обратно, да скрие лошия файл. Елиминирането не е абсолютно, а средство за приоритет.

три мини калъфа

Случай 1 — Семантичното търсене раздели времето на 20. Вътрешно разследване откри 480 GB имейли. Класическото търсене по ключови думи даде 3 резултата за "подкуп". Задвижваното от AI семантично търсене също улови евфемизми като „консултантска такса“, „улеснение“, „благодаря за плащане“ и извлече 61 подходящи съобщения. Прегледът беше завършен за 2 дни вместо седмици; Всеки резултат беше потвърден ръчно.

Случай 2 — Дедупликацията спести работна сила. В клъстер от 1,7 милиона файла, след базирано на хеш почистване на дубликати и елиминиране на NSRL, уникалните потребителски файлове за изследване бяха намалени до 92 000. Екипът се фокусира върху действителното съдържание, а не върху купчина, която е 95% системен шум.

Случай 3 — Цената на прекалената самоувереност. Един екип никога не е отварял това, което AI нарича „нефинансов“ клъстер. Както се оказва, критичен договор е бил скрит в личен фотоалбум (не е стеганография, просто грешната папка). Доказателството беше забавено, тъй като клъстерът с нисък приоритет не беше взет извадка. Урок: триажът определя реда, а не отменя прегледа.

Четири копируеми шаблона

1) Проект на стратегия за сортиране:

Вашата роля: старши специалист по съдебномедицински триаж. Данни: [напр. 480 GB имейл + 1,2 TB споделяне на файлове]. Тема на запитване: [напр. изтичане на данни + подкуп]. Начертайте стратегия за сортиране за мен: кой клъстер трябва да се разглежда в какъв ред, с какви критерии; Как да използвате хеш елиминиране и семантично търсене. Подчертайте, че никакви клъстери няма да бъдат "анулирани", те просто ще бъдат сортирани.

2) Семантично разширяване на думата за търсене:

Относно: [подкуп/изтичане на данни/тормоз]. За да намерите документи, свързани с тази тема, избройте неявни/синонимни изрази (включително жаргон, кодова дума, непряка реч), както и буквални ключови думи. Целта е разширяване на обхвата на търсене; Категоризирайте всеки термин.

3) Групиране на съдържание:

Ще ви дам заглавия/обобщения на документи. Групирайте ги в смислени теми (финансови, човешки ресурси, технически, правни, лични) и дайте тема + кратка обосновка за всеки документ. Маркирайте отделно "двусмисления" клъстер, който не можете да вместите в темата; Този клъстер няма да бъде пропуснат, той ще бъде прегледан ръчно.

4) Доклад за приоритет след елиминиране:

Известно добрите (NSRL) и дублиращите се файлове се елиминират. За останалите уникални потребителски файлове: задайте висок/среден/нисък приоритет според обекта на изследване и напишете ОБОСНОВКА. Несъответствието на съдържанието на разширението, криптираните/с парола файлове и файловете, които са променени през последните 30 дни, също се маркират.

Слаба подкана / Силна подкана

Слаба подкана:

Намерете важни файлове в тези данни.

Няма логика на тема, обхват и приоритизация; AI може да пропусне критично съдържание според собственото си определение за „важно“.

Мощна подкана:

Вашата роля: съдебно-медицински анализатор. Разследване: предполага се, че служител е изтекъл списък с клиенти, преди да напусне. Ще ви предоставя метаданни на файла (име, размер, дата, разширение, път) и кратки резюмета на съдържанието. Задача: маркирайте клиентски данни, експортиране/архивиране, проследяване на качване в облак, USB/външен диск и файлове, променени през последните 60 дни, като висок приоритет; Напишете причините за всяко решение. Не казвайте, че нито един клъстер не може да бъде изследван; просто сортирайте. Избройте отделно несигурностите.

Конкретната тема, целевите критерии и ограничението „без преглед“ правят резултата едновременно ефективен и сигурен.

Таблица за сравнение на триажните методи

Метод

Какво прави

силна страна

риск

Хеш елиминиране (NSRL)

Разпределя известен файл

Много бързо, прецизно

Модифицираният файл излиза

Дедупликация

Копира едно по едно

Спестяване на работна сила

Може да пропусне затваряне на копие

ключова дума

Търси точни термини

Просто, подлежи на проверка

Пропуска имплицитното твърдение

Семантично търсене (AI)

Намира най-близкото по смисъл

Улавя имплицитно съдържание

Произвежда фалшиви положителни резултати

Групиране на съдържание (AI)

разделя на теми

Предоставя преглед

Риск от грешна тема

Често срещани грешки

  • Погрешно сортиране с елиминиране. Ниският приоритет не е „да не се преглежда“; вземането на проби е от съществено значение.
  • Абсолютно доверие в елиминирането на хеш. Една промяна на един бит променя хеша; критичен случай може да изисква пълно сканиране.
  • Просто разчитам на ключовата дума. Бягство от имплицитни и кодирани изявления; Допълнено със семантично търсене.
  • Не потвърждава фалшивия положителен резултат от семантичното търсене. AI може да покаже неподходящ документ като „свързан“; Прочетете и проверете.
  • Недокументиране на обосновката за сортиране. В съда "защо погледнахте това първо?" Трябва да имате отговор на въпроса.

В обобщение

Сортирането на големи данни е дисциплината за насочване на ограничено време към най-голяма вероятност за доказателство - като не изтривате нищо, а просто определяте реда. AI; Той осигурява голяма скорост при семантично търсене, групиране на съдържание, маркиране на тонове и приоритизиране след елиминиране. Но експертът спазва границите на елиминирането на хеша, риска от фалшиви положителни/отрицателни резултати и принципа „ниският приоритет не е непроверен“. Документирането на решенията за сортиране с обосновка прави резултата защитим в съда.

Задача за приложение

Подгответе примерен списък с метаданни на файла (име, размер, дата, разширение, кратко резюме) от 30-40 реда; поставете няколко "подвеждащи" файла в него (критичен документ в грешната папка, файл с променено разширение). Приоритезирайте с шаблона „доклад за приоритет след елиминиране“, след това вземете проби от поне 15% от клъстера с нисък приоритет, за да видите дали AI е пропуснал нещо.

контролен списък

  • [ ] Настроих триажа като приоритет; Не съм анулирал никакви клъстери.
  • [ ] Намалих шума с елиминиране на хеш и дедупликация, като имах предвид неговите ограничения.
  • [ ] Завърших ключовата дума със семантично търсене.
  • [ ] Ръчно потвърдих фалшивите положителни резултати на семантичния/клъстерен изход.
  • [ ] Документирах решенията за сортиране и техните обосновки.