Enota 4 / 11

Triaža velikih podatkov: dajanje prednosti terabajtom podatkov

Dobički:

  • Razumeti, da je triaža disciplina določanja vrstnega reda pregleda, ne da bi karkoli izbrisali, in biti sposoben izvajati semantično iskanje in združevanje vsebine v gruče z umetno inteligenco.
  • Zmožnost zmanjševanja šuma z izločanjem na podlagi razpršitve (NSRL) in odstranjevanjem podvajanja ter upoštevanje omejitev teh metod (sprememba enega bita)
  • Sposobnost ročnega potrjevanja lažno pozitivnih rezultatov semantičnega iskanja in dokumentiranja odločitev o triaži z utemeljitvijo, da postanejo upravičljive

Sodobna forenzična preiskava ni več omejena na en računalnik. V poslovnem incidentu lahko naletite na desetine diskov, stotine gigabajtov e-poštnih arhivov, varnostnih kopij v oblaku, aplikacij za klepet in terabajtov datotek. Fizično je nemogoče pregledati vse, enega za drugim, od začetka do konca. Tu nastopi triaža (pojem, izposojen iz medicine; dodelitev omejenih sredstev najprej najbolj kritičnemu primeru, torej hitra odločitev, »kaj najprej pogledati«). V tej enoti bomo videli, kako AI inteligentno daje prednost velikim kupom podatkov, h katerim napakam je nagnjen in kako se triaža ujema s forenzično celovitostjo.

Zakaj je potrebna triaža?

V računalniški forenziki si nasprotujeta dve realnosti: (1) vsi dokazi so dragoceni in ničesar ne smemo zamuditi; (2) čas in delovna sila sta omejena. Triaža rešuje ta konflikt - tako, da ničesar ne izbriše, le da določi vrstni red pregleda. Z drugimi besedami, triaža ni "izločanje", ampak "določanje prednosti". Najprej se pregledajo podatki z največjo verjetnostjo dokaza; Podatki z nizko verjetnostjo so shranjeni, vendar kasneje pridejo v čakalno vrsto.

Triaža poteka na dveh ravneh: triaža v živo (odločanje na kraju dogodka, katero napravo najprej slikati) in triaža podatkov (ko so slike zajete, katero datoteko/nabor podatkov najprej pregledati). Umetna inteligenca je še posebej močna pri slednjem, in sicer pri določanju prednosti velikih naborov podatkov na podlagi vsebine.

Forenzično občutljiv vidik triaže je, da odločitev o odreditvi določa smer preiskave. Nepravilno določena prednostna skupina lahko privede do tega, da so kritični dokazi najdeni s tedni zamude ali pa se sploh ne pregledajo, ker je preiskava potekla. Torej triaža ni "hitri trik", temveč metodološka odločitev in jo je treba dokumentirati z utemeljitvijo, tako kot vsak drug forenzični korak. V primerih z visokim tveganjem triaža ne nadomesti celotne preiskave; le določa, kateri del je prvi obravnavan, pri čemer ohranja načelo, da bo na koncu ovrednoten celoten sklop.

Nasvet: Zabeležite svoje triažne odločitve in razloge zanje. "Zakaj smo najprej pogledali to gručo, zakaj smo to pustili za konec?" Vprašanje se lahko postavi na sodišču. V ta zapis vključite utemeljitev prednostne naloge AI; Transparentnost je ubranljivost.

Prednostno določanje vsebine z AI

Klasična triaža upošteva ime datoteke, velikost in datum. Umetna inteligenca temu doda razumevanje konteksta: lahko razume, o čem govori dokument, kaj vsebuje slika, ton pogovora. Na ta način:

  • Semantično iskanje – iskanje vsebine, ki je po pomenu podobna, tudi če se beseda ne ujema popolnoma: Iskanje »nakazilo denarja« vrne tudi dokumente, ki vsebujejo »nakazilo denarja«, »pošiljka«, »navodilo za plačilo«.
  • Združevanje tem: Samodejno razvrščanje na tisoče dokumentov v teme (finančne, kadrovske, tehnične, osebne).
  • Označevanje čustev/tonov: Označevanje sporočil, ki izražajo tone, kot so grožnja, panika, kršitev zasebnosti.
  • Vizualna triaža: združevanje na tisoče slik po oznaki predmeta/prizora (znotraj zakonskih omejitev, npr. samo dovoljena in ustrezna vsebina).
  • Odstranjevanje dvojnikov in smeti: ločevanje de-duplikacij iste datoteke in sistemskih datotek (z znanimi zgoščenimi seznami) in usmerjanje človeškega pogleda na resnično novo vsebino.

Izločanje znanih datotek: NSRL in zgoščeni nizi

Najbolj praktičen pospeševalnik za triažo velikih podatkov so znani seznami dobrih/slabih zgoščencev. Knjižnice, kot je NSRL (National Software Reference Library), hranijo zgoščene milijone datotek standardnega operacijskega sistema in aplikacij. Te "znano dobre" datoteke so pri triaži odstranjene, kar omogoča, da se osredotočimo le na sumljive datoteke, ki jih ustvarijo uporabniki. Podobno so "znano slabe" zgoščene vrednosti (znana zlonamerna programska oprema) samodejno označene. AI pride v poštev v preostali gruči po tej izločitvi, kar resnično zahteva smisel.

Pozor: Izločanje na podlagi zgoščevanja je močno, vendar ena sama sprememba bita popolnoma spremeni zgoščevanje. Z rahlo spremembo standardne datoteke jo lahko napadalec odstrani s seznama "znano dobrih" ali, nasprotno, skrije slabo datoteko. Izločanje ni absolutno, ampak prednostno sredstvo.

trije mini kovčki

1. primer – Semantično iskanje je čas delilo z 20. Notranja preiskava je odkrila 480 GB e-pošte. Klasično iskanje po ključnih besedah ​​je vrnilo 3 rezultate za "podkupovanje". Semantično iskanje, ki ga poganja umetna inteligenca, je prav tako ujelo evfemizme, kot so "provizija za svetovanje", "olajšanje", "hvala za plačilo" in izluščilo 61 ustreznih sporočil. Pregled je bil končan v 2 dneh namesto v tednih; Vsak rezultat je bil potrjen ročno.

Primer 2 – De-duplikacija je prihranila delovno silo. V gruči 1,7 milijona datotek se je po čiščenju dvojnikov na osnovi zgoščevanja in odstranitvi NSRL število edinstvenih uporabniških datotek, ki jih je treba pregledati, zmanjšalo na 92.000. Ekipa se je osredotočila na dejansko vsebino in ne na kup, ki je bil 95 % sistemskega šuma.

Primer 3 – Cena pretirane samozavesti. Ena ekipa še nikoli ni odprla tega, kar AI imenuje "nefinančni" grozd. Kot se je izkazalo, je bila kritična pogodba skrita v osebnem foto albumu (ne steganografija, samo napačna mapa). Dokazi so bili odloženi, ker gruča z nizko prioriteto ni bila vzorčena. Nauk: triaža določa vrstni red, ne razveljavlja izpita.

Štiri predloge za kopiranje

1) Osnutek triažne strategije:

Vaša vloga: višji strokovnjak za forenzično triažo. Podatki: [npr. 480 GB e-pošte + 1,2 TB skupna raba datotek]. Tema povpraševanja: [npr. uhajanje podatkov + podkupovanje]. Načrtujte triažno strategijo zame: kateri grozd je treba obravnavati v katerem vrstnem redu, s katerimi kriteriji; Kako uporabljati izločanje zgoščenih vrednosti in semantično iskanje. Poudarite, da noben grozd ne bo "preklican", le razvrščeni bodo.

2) Semantična razširitev iskalnega izraza:

Zadeva: [podkupovanje/uhajanje podatkov/nadlegovanje]. Če želite poiskati dokumente, povezane s to temo, navedite implicitne/sinonimne izraze (vključno s slengom, kodno besedo, posrednim govorom) kot tudi dobesedne ključne besede. Cilj je razširiti obseg iskanja; Kategorizirajte vsak izraz.

3) Združevanje vsebine v gruče:

Dal vam bom naslove/povzetke dokumentov. Združite jih v pomembne teme (finančne, kadrovske, tehnične, pravne, osebne) in navedite temo + kratko utemeljitev za vsak dokument. Ločeno označite "dvoumen" grozd, ki ga ne morete vključiti v temo; Ta gruča ne bo preskočena, pregledana bo ročno.

4) Poročilo o prednostni nalogi po izločitvi:

Znano dobre (NSRL) in podvojene datoteke so odstranjene. Za preostale unikatne uporabniške datoteke: dodelite visoko/srednjo/nizko prioriteto glede na predmet preiskave in napišite UTEMELJITEV. Označene so tudi neujemanje vsebine razširitve, šifrirane datoteke/datoteke z geslom in datoteke, ki so bile spremenjene v zadnjih 30 dneh.

Šibek poziv/močan poziv

Šibek poziv:

V teh podatkih poiščite pomembne datoteke.

Ni logike teme, obsega in prioritet; AI lahko zgreši kritično vsebino po lastni definiciji "pomembne".

Močan poziv:

Vaša vloga: forenzični triažni analitik. Preiskava: uslužbenec naj bi izdal seznam strank pred odhodom. Posredoval vam bom metapodatke o datoteki (ime, velikost, datum, končnica, pot) in kratke povzetke vsebine. Naloga: označite podatke o strankah, izvoz/arhiv, sled nalaganja v oblak, USB/zunanji disk in datoteke, spremenjene v zadnjih 60 dneh, kot visoko prioriteto; Za vsako odločitev napišite razloge. Ne recite, da nobenega grozda ni mogoče pregledati; samo razvrsti. Ločeno navedite negotovosti.

Konkretna tema, ciljana merila in omejitev "brez pregleda" poskrbijo, da je rezultat učinkovit in varen.

Primerjalna tabela triažnih metod

Metoda

Kaj počne

močna točka

tveganje

Odprava zgoščevanja (NSRL)

Dodeli znano datoteko

Zelo hitro, natančno

Spremenjena datoteka uide

Odstranjevanje podvajanja

Kopije eno za drugo

Varčevanje z delovno silo

Lahko preskoči zaprto kopijo

ključna beseda

Išče natančne izraze

Enostavno, pregledljivo

Zgreši implicitno izjavo

Semantično iskanje (AI)

Najde najbližje po pomenu

Zajame implicitno vsebino

Ustvari lažno pozitivne rezultate

Združevanje vsebine v gruče (AI)

razdeli na teme

Zagotavlja pregled

Tveganje napačne teme

Pogoste napake

  • Napačna triaža za izločanje. Nizka prioriteta ni "ni za pregled"; vzorčenje je bistveno.
  • Absolutno zaupanje v odpravo hash-a. Ena sama bitna sprememba spremeni zgoščeno vrednost; v kritičnem primeru bo morda potreben popoln pregled.
  • Samo zanašanje na ključno besedo. Implicitni in kodirani stavki pobegnejo; Skupaj s semantičnim iskanjem.
  • Ne potrjuje lažnega pozitivnega rezultata semantičnega iskanja. AI lahko nepomemben dokument prikaže kot »povezan«; Preberite in preverite.
  • Neupoštevanje utemeljitve triaže. Na sodišču "zakaj si to najprej pogledal?" Morate imeti odgovor na vprašanje.

Če povzamem

Triaža velikih podatkov je disciplina usmerjanja omejenega časa k najvišji verjetnosti dokazov – tako da ničesar ne izbrišete, le določite vrstni red. AI; Zagotavlja veliko hitrost pri semantičnem iskanju, združevanju vsebine v gruče, označevanju tonov in določanju prednosti po odstranitvi. Toda strokovnjak upošteva meje izločanja razpršitve, tveganje lažnih pozitivnih/negativnih rezultatov in načelo "nizke prioritete ni nepreverjeno". Dokumentiranje triažnih odločitev z utemeljitvijo omogoča, da je izid braniti na sodišču.

Aplikacijska naloga

Pripravite vzorčni seznam metapodatkov datoteke (ime, velikost, datum, končnica, kratek povzetek) v 30–40 vrsticah; vanj vstavite nekaj "zavajajočih" datotek (kritičen dokument v napačni mapi, datoteka s spremenjeno končnico). Določite prednost s predlogo »poročilo o prioriteti po izločitvi«, nato vzorčite vsaj 15 % iz gruče z nizko prioriteto, da vidite, ali je umetna inteligenca kaj spregledala.

kontrolni seznam

  • [ ] Nastavil sem triažo kot prioriteto; Nobenega grozda nisem preklical.
  • [ ] Šum sem zmanjšal z odpravo zgoščenih vrednosti in odstranjevanjem podvajanj, pri čemer sem upošteval njegove omejitve.
  • [ ] Ključno besedo sem zaključil s semantičnim iskanjem.
  • [ ] Ročno sem potrdil lažno pozitivne rezultate semantičnega/združevanja v gruče.
  • [ ] Dokumentiral sem triažne odločitve in njihove utemeljitve.