Единици
1. Вовед во вештачката интелигенција во форензиката: улоги, граници, верификација, интегритет на докази и етика 2. Поддршка за собирање и испитување докази: забрзување на сликање, сортирање и анализа 3. Анализа на дневник и временска рамка: Ставање настани по правилен редослед 4. Тријажа на големи податоци: Приоритизирање на терабајти податоци 5. E-Discovery: Наоѓање релевантни докази во корпоративните податоци 6. Малициозен софтвер и мрежна форензичка анализа: обратно инженерство за одбрана 7. Форензичка анализа за мобилни, облак и апликации: податоци за разговор, локација и апликации 8. Откривање на длабоки и синтетички медиуми: верификација на лажни слики, аудио и видео 9. Интегритет на докази, синџир на притвор и законска допуштеност 10. Извештај за нацрт и презентација на експерт: Пишување наоди разбирливо и дефанзивно 11. Работен тек од крај до крај, управување со лабораторија, валидација и одговорна употреба
Единица 4 / 11

Тријажа на големи податоци: Приоритизирање на терабајти податоци

Добивки:

  • Разберете дека тријажата е дисциплина за одредување редослед на испитување без бришење ништо и бидете во можност да вршите семантичко пребарување и групирање содржини со вештачка интелигенција.
  • Способност да се намали шумот со елиминација базирана на хаш (NSRL) и де-дуплирање и да се набљудуваат границите на овие методи (промена со еден бит)
  • Способност рачно да се потврдат лажните позитиви на одлуките за семантичко пребарување и тријажа на документи со оправдување да се направат одбранливи

Современата форензичка истрага повеќе не е ограничена на еден компјутер. Во корпоративен инцидент, може да наидете на десетици дискови, стотици гигабајти архиви за е-пошта, резервни копии на облак, апликации за разговор и терабајти датотеки. Физички е невозможно да се испитаат сите, еден по еден, од почеток до крај. Овде доаѓа во игра тријажата (концепт позајмен од медицината; прво распределување на ограничени ресурси на најкритичниот случај, односно брзо одлучување „што да се погледне прво“). Во оваа единица, ќе видиме како вештачката интелигенција интелигентно дава приоритет на големи купишта податоци, на какви грешки е склона и како тријажата се усогласува со форензичкиот интегритет.

Зошто е неопходна тријажа?

Во компјутерската форензика, две реалности се судираат: (1) сите докази се вредни и ништо не треба да се пропушти; (2) времето и работната сила се ограничени. Тријаж го решава овој конфликт - не бришејќи ништо, само со одредување на редоследот на испитувањето. Со други зборови, тријажата не е „елиминација“ туку „приоритизација“. Прво се испитуваат податоците со најголема веројатност за докази; Податоците со мала веројатност се зачувуваат, но доаѓаат во редот подоцна.

Тријажата се случува на две нивоа: тријажа во живо (одлучување на местото на настанот кој уред прв да се слика) и тријажа на податоци (штом ќе се снимаат слики, која датотека/сет на податоци прво да се испита). Вештачката интелигенција е особено силна во второто, имено приоритизацијата врз основа на содржина на големи збирки податоци.

Форензички чувствителниот аспект на тријажата е дека одлуката за наредба ја одредува насоката на истрагата. Неправилно приоритизиран кластер може да доведе до пронаоѓање на критични докази со недели доцнење, па дури и да не се испитаат воопшто бидејќи истрагата е истечена. Значи, тријажата не е „трик за брзина“ туку методолошка одлука и треба да се документира со оправдување, исто како и секој друг форензички чекор. Во случаите со висок ризик, тријажата не ја заменува целосната истрага; тој само одредува кој дел прво ќе се земе предвид, зачувувајќи го принципот дека целиот сет ќе биде оценет на крајот.

Совет: Водете евиденција за вашите одлуки за тријажа и нивните причини. „Зошто прво го погледнавме овој кластер, зошто го оставивме ова до последно? Прашањето може да се постави на суд. Вклучете го образложението за приоритизирање на вештачката интелигенција во овој запис; Транспарентноста е одбрана.

Приоритизација врз основа на содржина со вештачка интелигенција

Класичната тријажа ги разгледува името, големината и датумот на датотеката. Вештачката интелигенција на ова додава разбирање на контекстот: може да разбере за што е документот, што содржи сликата, тонот на разговорот. На овој начин:

  • Семантичко пребарување - наоѓање содржина што е слична по значење дури и ако зборот точно не се совпаѓа: Пребарувањето за „пренос на пари“ враќа и документи што содржат „пренос на пари“, „праќање“, „упатство за плаќање“.
  • Групирање на теми: Автоматско сортирање на илјадници документи во теми (финансиски, човечки ресурси, технички, лични).
  • Обележување емоции/тонови: истакнување пораки кои пренесуваат тонови како закана, паника, нарушување на приватноста.
  • Визуелна тријажа: групирање на илјадници слики по ознака за објект/сцена (во законски граници, на пр. само овластена и соодветна содржина).
  • Елиминација на дупликати и ѓубре: Одвојување на де-дупликации на иста датотека и системски датотеки (со познати хаш листи) и насочување на човечкиот поглед кон навистина нова содржина.

Позната елиминација на датотеки: NSRL и хаш сетови

Најпрактичниот акцелератор за тријажа на големи податоци се познати списоци со добри/лоши хаш. Во библиотеките како што е NSRL (Национална референтна библиотека за софтвер) се чуваат хешови од милиони стандардни датотеки за оперативен систем и апликации. Овие „познати добри“ датотеки се елиминираат во тријажата, дозволувајќи му да се фокусира само на кориснички генерирани и сомнителни датотеки. Слично на тоа, „познати лоши“ хашови (познат малициозен софтвер) се автоматски означени. ВИ влегува во игра во преостанатиот кластер по оваа елиминација, што навистина бара значење.

Внимание: Елиминацијата базирана на хаш е моќна, но една промена на бит целосно го менува хашот. Со малку менување на стандардна датотека, напаѓачот може да ја отстрани од списокот „познато добро“ или, обратно, да ја скрие лошата датотека. Елиминацијата не е апсолутна, туку средство за приоритет.

три мини футроли

Случај 1 - Семантичкото пребарување го подели времето со 20. Внатрешната истрага откри 480 GB е-пошта. Класичното пребарување на клучни зборови врати 3 резултати за „поткуп“. Семантичкото пребарување напојувано со вештачка интелигенција, исто така, фати еуфемизми како што се „надоместок за консултации“, „олеснување“, „благодарност за плаќање“ и извлече 61 релевантна порака. Прегледот беше завршен за 2 дена наместо за недели; Секој резултат беше потврден рачно.

Случај 2 - Де-дупликација заштедена работна сила. Во кластер од 1,7 милиони датотеки, по чистењето на дупликатите базирани на хаш и елиминацијата на NSRL, единствените кориснички датотеки за испитување беа намалени на 92.000. Тимот се фокусираше на вистинската содржина, а не на куп што беше 95% системски шум.

Случај 3 - Цената на прекумерната доверба. Еден тим никогаш не го отворил она што вештачката интелигенција го нарекува „нефинансиски“ кластер. Како што се испоставува, критички договор бил скриен во личен фото албум (не стеганографија, само погрешна папка). Доказите беа одложени бидејќи не беше земен примерок од кластерот со низок приоритет. Лекција: тријажата го одредува редоследот, а не го откажува прегледот.

Четири шаблони за копирање

1) Нацрт стратегија за тријажа:

Вашата улога: виш специјалист за судска тријажа.Податоци: [на пр. 480 GB е-пошта + 1,2 TB споделување на датотеки]. Тема на барање: [на пр. истекување на податоци + поткуп]. Нацртајте ми стратегија за тријажа: кој кластер треба да се погледне по кој редослед, со кои критериуми; Како да користите елиминација на хаш и семантичко пребарување. Нагласете дека ниту еден кластер нема да биде „откажан“, туку само ќе се подреди.

2) Семантичко проширување на терминот за пребарување:

Предмет: [поткуп / истекување податоци / вознемирување]. За да најдете документи поврзани со оваа тема, наведете имплицитни/синонимни изрази (вклучувајќи сленг, коден збор, индиректен говор) како и буквални клучни зборови. Целта е да се прошири опсегот на пребарување; Категоризирајте го секој поим.

3) Групирање на содржини:

Ќе ви дадам наслови/резимеа на документи. Групирајте ги во значајни теми (финансиски, човечки ресурси, технички, правни, лични) и наведете тема + кратко образложение за секој документ. Обележете го одделно „двосмислениот“ кластер што не можете да го вклопите во темата; Овој кластер нема да се прескокне, ќе се испитува рачно.

4) Извештај за приоритет по елиминацијата:

Познати добри (NSRL) и дупликат датотеки се елиминирани. За преостанатите уникатни кориснички датотеки: доделете висок/среден/низок приоритет според предметот на истражување и напишете ОПРАВДУВАЊЕ. Неусогласеноста со наставката и содржината, шифрираните/лозинките и датотеките што се сменија во последните 30 дена се исто така нагласени.

Слаб промпт / Силен промпт

Слаба навестување:

Најдете важни датотеки во овие податоци.

Нема логика на тема, опсег и приоритизација; Вештачката интелигенција може да пропушти критична содржина според сопствената дефиниција за „важно“.

Моќен потсетник:

Вашата улога: форензички аналитичар. Истрага: вработен наводно протекол список со клиенти пред да замине. Ќе ви дадам метаподатоци на датотеката (име, големина, датум, наставка, патека) и кратки резимеа на содржината. Задача: означете ги податоците за клиентите, извозот/архивата, трагата за поставување во облак, USB/надворешниот диск и датотеките променети во последните 60 дена како висок приоритет; Напишете ги причините за секоја одлука. Не кажувајте дека ниту еден кластер не може да се испита; само сортирајте. Наведете ги несигурностите одделно.

Конкретната тема, целните критериуми и ограничувањето „без преглед“ го прават резултатот ефикасен и безбеден.

Табела за споредба на методите на тријажа

Метод

Што прави

силна точка

ризик

Елиминација на хеш (NSRL)

Доделува позната датотека

Многу брзо, прецизно

Изменетата датотека бега

Де-дуплирање

Копира еден по еден

Заштеда на работна сила

Може да прескокне затворање копирање

клучен збор

Пребарува точни термини

Едноставно, може да се ревидира

Ја промаши имплицитната изјава

Семантичко пребарување (ВИ)

Го наоѓа најблиското значење

Снима имплицитна содржина

Произведува лажни позитиви

Групирање содржини (ВИ)

се дели на теми

Обезбедува преглед

Ризик од погрешна тема

Вообичаени грешки

  • Погрешна тријажа за елиминација. Нискиот приоритет не е „да не се разгледува“; земање мостри е од суштинско значење.
  • Апсолутна доверба во елиминацијата на хашот. Една промена на бит го менува хашот; критичниот случај може да бара целосно скенирање.
  • Само потпирајќи се на клучниот збор. Имплицитните и кодираните изјави бегаат; Заврши со семантичко пребарување.
  • Не потврдување на лажното позитивно на семантичкото пребарување. ВИ може да прикаже ирелевантен документ како „поврзан“; Прочитајте и потврдете.
  • Неуспехот да се документира образложението за тријажа. На суд „зошто прво го погледна ова? Мора да имате одговор на прашањето.

Сумирано

Тријажата за големи податоци е дисциплина на насочување на ограниченото време на најголемата веројатност за докази - со тоа што не се брише ништо, само се одредува редоследот. ВИ; Обезбедува голема брзина во семантичкото пребарување, групирање содржини, означување на тонови и приоритизација по елиминацијата. Но, експертот ги почитува границите на елиминација на хашот, ризикот од лажни позитиви/негативи и принципот „низок приоритет не е неиспитан“. Документирањето на одлуките за тријажа со оправдување го прави исходот одбранлив на суд.

Задача за апликација

Подгответе примерок листа на метаподатоци на датотека (име, големина, датум, наставка, кратко резиме) од 30-40 линии; ставете неколку „лажни“ датотеки во него (критичен документ во погрешна папка, датотека со променета екстензија). Поставете приоритет со шаблонот „извештај за приоритет по елиминацијата“, а потоа земете примерок од најмалку 15% од кластерот со низок приоритет за да видите дали вештачката интелигенција пропуштила нешто.

листа за проверка

  • [ ] Поставив тријажа како приоритет; Не откажав ниту еден кластер.
  • [ ] Го намалив шумот со елиминација на хаш и де-дупликација, имајќи ги предвид нејзините граници.
  • [ ] Го комплетирав клучниот збор со семантичко пребарување.
  • [ ] Рачно ги потврдив лажните позитиви на излезот од семантички/кластерирање.
  • [ ] Ги документирав одлуките за тријажа и нивните оправдувања.