Vienetas 4 / 11

Didelis duomenų skirstymas: pirmenybė teikiama duomenų terabaitams

Pelnas:

  • Supraskite, kad triažas yra tyrimo eiliškumo nustatymo disciplina nieko neištrinant, ir gebėti atlikti semantinę paiešką ir turinio grupavimą dirbtiniu intelektu.
  • Galimybė sumažinti triukšmą naudojant maišos pagrindu pagrįstą pašalinimą (NSRL) ir dubliavimo panaikinimą bei laikytis šių metodų ribų (vieno bito pakeitimas)
  • Galimybė rankiniu būdu patvirtinti klaidingus semantinės paieškos teigiamus rezultatus ir dokumentuoti rūšiavimo sprendimus su pagrindimu, kad jie būtų pateisinami

Šiuolaikinis teismo medicinos tyrimas jau neapsiriboja vienu kompiuteriu. Įmonės incidento metu galite susidurti su dešimtimis diskų, šimtais gigabaitų el. pašto archyvų, debesies atsarginių kopijų, pokalbių programų ir terabaitų failų. Fiziškai neįmanoma jų visų, po vieną, išnagrinėti nuo pradžios iki pabaigos. Čia atsiranda triažas (sąvoka, pasiskolinta iš medicinos; ribotų išteklių paskirstymas pirmiausiai kritiškiausiam atvejui, tai yra, greitai apsisprendžiama, „į ką žiūrėti pirmiausia“). Šiame skyriuje pamatysime, kaip dirbtinis intelektas išmaniai teikia pirmenybę didelėms duomenų krūvoms, kokioms klaidoms jis yra linkęs ir kaip skirstymas suderinamas su teismo ekspertizės vientisumu.

Kodėl reikalingas skirstymas?

Kompiuterinėje kriminalistikoje prieštarauja dvi tikrovės: (1) visi įrodymai yra vertingi ir nieko nereikia praleisti; (2) laikas ir darbo jėgos yra riboti. Triažas išsprendžia šį konfliktą – nieko neištrindamas, tik nustatydamas tyrimo tvarką. Kitaip tariant, triažas yra ne „pašalinimas“, o „prioritetų nustatymas“. Pirmiausia tiriami didžiausią tikimybę įrodyti turintys duomenys; Mažos tikimybės duomenys saugomi, bet vėliau patenka į eilę.

Skirstymas vyksta dviem lygiais: tiesioginis suskirstymas (scenoje nusprendžiamas, kurį įrenginį fotografuoti pirmiausia) ir duomenų skirstymas (užfiksavus vaizdus, ​​kurį failą / duomenų rinkinį ištirti pirmiausia). AI yra ypač stiprus pastarajame, būtent turiniu pagrįstas didelių duomenų rinkinių prioritetų teikimas.

Kriminalistai jautrus triažo aspektas yra tas, kad įsakymo sprendimas nustato tyrimo kryptį. Neteisingai suskirstytas prioritetas gali lemti tai, kad svarbūs įrodymai gali būti rasti pavėluotai savaitėmis arba net iš viso neišnagrinėti, nes pasibaigęs tyrimo galiojimo laikas. Taigi triažas yra ne „greičio triukas“, o metodologinis sprendimas ir turėtų būti pagrįstas dokumentais, kaip ir bet kuris kitas teismo medicinos veiksmas. Didelės rizikos atvejais triažas nepakeičia viso tyrimo; ji tik nustato, kuri dalis bus svarstoma pirmiausia, išsaugant principą, kad galiausiai bus įvertinta visa rinkinys.

Patarimas: užrašykite savo sprendimus ir jų priežastis. „Kodėl mes pirmiausia pažvelgėme į šį klasterį, kodėl palikome tai iki paskutinio? Klausimą galima užduoti teisme. Į šį įrašą įtraukite AI prioritetų nustatymo pagrindimą; Skaidrumas yra gynybiškumas.

Turiniu pagrįstas prioritetų nustatymas naudojant AI

Klasikinis skirstymas žiūri į failo pavadinimą, dydį ir datą. AI prideda prie to konteksto supratimą: jis gali suprasti, apie ką yra dokumentas, kas yra paveikslėlyje, pokalbio tonas. Tokiu būdu:

  • Semantinė paieška – panašios reikšmės turinio radimas, net jei žodis tiksliai neatitinka: Paieškoje „pinigų pervedimas“ taip pat pateikiami dokumentai, kuriuose yra „pinigų pervedimas“, „siunta“, „mokėjimo nurodymas“.
  • Temų grupavimas: automatinis tūkstančių dokumentų rūšiavimas pagal temas (finansinės, personalo, techninės, asmeninės).
  • Emocijų / tonų žymėjimas: paryškinami pranešimai, perteikiantys tokius tonus kaip grėsmė, panika, privatumo pažeidimas.
  • Vizualinis skirstymas: tūkstančių vaizdų grupavimas pagal objektą / scenos žymą (neviršijant įstatymų nustatytų ribų, pvz., tik leistinas ir tinkamas turinys).
  • Pasikartojančių ir šlamšto pašalinimas: atskirkite tų pačių failų ir sistemos failų (su žinomais maišos sąrašais) dublikatus ir nukreipkite žmogaus žvilgsnį į tikrai naują turinį.

Žinomas failų pašalinimas: NSRL ir maišos rinkiniai

Pats praktiškiausias didelių duomenų skirstymo greitintuvas yra žinomi gerų / blogų maišos sąrašai. Tokios bibliotekos kaip NSRL (Nacionalinė programinės įrangos nuorodų biblioteka) saugo milijonus standartinių operacinės sistemos ir taikomųjų programų failų maišos. Šie „žinomi geri“ failai pašalinami atliekant skirstymą, todėl galima sutelkti dėmesį tik į vartotojo sukurtus ir įtartinus failus. Panašiai „žinoma bloga“ maiša (žinoma kenkėjiška programa) yra automatiškai pažymėta. Po šio pašalinimo AI pradeda žaisti likusioje grupėje, o tam tikrai reikia prasmės.

Atsargiai: maišos pašalinimas yra galingas, tačiau vienas bito pakeitimas visiškai pakeičia maišą. Šiek tiek pakeitęs standartinį failą, užpuolikas gali jį pašalinti iš „žinomo gero“ sąrašo arba, atvirkščiai, paslėpti blogą failą. Pašalinimas nėra absoliutus, o prioriteto priemonė.

trys mini dėklai

1 atvejis – Semantinė paieška laiką padalino iš 20. Vidinis tyrimas aptiko 480 GB el. laiškų. Klasikinė raktinių žodžių paieška pateikė 3 „kyšininkavimo“ rezultatus. AI pagrįsta semantinė paieška taip pat užfiksavo tokius eufemizmus kaip „konsultacijos mokestis“, „palengvinimas“, „ačiū už mokėjimą“ ir išgavo 61 atitinkamą pranešimą. Peržiūra buvo atlikta per 2 dienas, o ne savaites; Kiekvienas rezultatas buvo patvirtintas rankiniu būdu.

2 atvejis. Dubliavimo panaikinimas sutaupė darbo jėgos. 1,7 milijono failų grupėje po maišos dublikatų valymo ir NSRL pašalinimo unikalių vartotojų failų, kuriuos reikia ištirti, skaičius sumažėjo iki 92 000. Komanda sutelkė dėmesį į tikrąjį turinį, o ne į krūvą, kuri buvo 95 % sistemos triukšmo.

3 atvejis – per didelio pasitikėjimo kaina. Viena komanda niekada neatidarė to, ką dirbtinis intelektas vadina „ne finansų“ klasterio. Kaip paaiškėjo, asmeniniame nuotraukų albume buvo paslėpta svarbi sutartis (ne steganografija, tik netinkamas aplankas). Įrodymai buvo atidėti, nes žemo prioriteto grupė nebuvo atrinkta. Pamoka: triažas nustato eiliškumą, o ne atšaukia egzaminą.

Keturi kopijuojami šablonai

1) Triažo strategijos projektas:

Jūsų vaidmuo: vyresnysis teismo ekspertizės specialistas.Duomenys: [pvz. 480GB paštas + 1,2TB failų bendrinimas].Užklausos tema: [pvz. duomenų nutekėjimas + kyšininkavimas]. Nubraižykite man skirstymo strategiją: kurią klasterį, kokia tvarka, pagal kokius kriterijus reikia žiūrėti; Kaip naudoti maišos pašalinimą ir semantinę paiešką. Pabrėžkite, kad jokie klasteriai nebus „atšaukti“, jie bus tiesiog rūšiuojami.

2) Semantinės paieškos termino išplėtimas:

Tema: [kyšininkavimas / duomenų nutekinimas / priekabiavimas]. Norėdami rasti su šia tema susijusius dokumentus, išvardykite numanomus / sinoniminius posakius (įskaitant žargoną, kodinį žodį, netiesioginę kalbą) ir tiesioginius raktinius žodžius. Tikslas – išplėsti paieškos sritį; Suskirstykite kiekvieną terminą į kategorijas.

3) Turinio grupavimas:

Pateiksiu dokumentų pavadinimus/santraukas. Sugrupuokite jas į reikšmingas temas (finansų, žmogiškųjų išteklių, techninių, teisinių, asmeninių) ir pateikite temą + trumpą kiekvieno dokumento pagrindimą. Atskirai pažymėkite „dviprasmišką“ grupę, kurios negalite tilpti į temą; Šis klasteris nebus praleistas, jis bus išnagrinėtas rankiniu būdu.

4) Pirmenybės ataskaita po pašalinimo:

Pašalinami žinomi geri (NSRL) ir pasikartojantys failai. Likusiems unikaliems vartotojo failams: priskirkite aukštą/vidutinį/žemą prioritetą pagal tyrimo objektą ir parašykite PAGRINDIMAS. Taip pat paryškinami plėtinių ir turinio neatitikimai, užšifruoti / slaptažodžiu pažymėti failai ir failai, kurie pasikeitė per pastarąsias 30 dienų.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Šiuose duomenyse raskite svarbius failus.

Nėra temos, apimties ir prioritetų nustatymo logikos; AI gali praleisti kritinį turinį pagal savo apibrėžimą „svarbus“.

Galingas raginimas:

Jūsų vaidmuo: teismo ekspertizės analitikas. Tyrimas: tariamai darbuotojas prieš išeidamas nutekino klientų sąrašą. Pateiksiu failo metaduomenis (pavadinimą, dydį, datą, plėtinį, kelią) ir trumpas turinio santraukas. Užduotis: pažymėti kliento duomenis, eksportuoti/archyvuoti, įkelti į debesį sekimą, USB/išorinį diską ir per paskutines 60 dienų pakeistus failus kaip prioritetinius; Parašykite kiekvieno sprendimo priežastis. Nesakykite, kad bet kurio klasterio negalima ištirti; tiesiog rūšiuoti. Neaiškumus išvardykite atskirai.

Dėl konkrečios temos, tikslinių kriterijų ir „neperžiūrėjimo“ apribojimo rezultatas yra efektyvus ir saugus.

Triažo metodų palyginimo lentelė

Metodas

Kas daro

stiprioji vieta

rizika

Maišos pašalinimas (NSRL)

Priskiria žinomą failą

Labai greitai, tiksliai

Pakeistas failas pabėga

Dubliavimo panaikinimas

Kopijos po vieną

Darbo jėgos taupymas

Galima praleisti uždarytą kopiją

raktažodį

Ieško tikslių terminų

Paprasta, patikrinama

Praleidžia netiesioginį teiginį

Semantinė paieška (AI)

Suranda artimiausią reikšmę

Užfiksuoja numanomą turinį

Sukuria klaidingus teigiamus rezultatus

Turinio grupavimas (AI)

skirstomas į temas

Pateikiama apžvalga

Neteisingos temos rizika

Dažnos klaidos

  • Klaidingas pašalinimas. Žemas prioritetas nėra „nebūtina peržiūrimas“; mėginių ėmimas yra būtinas.
  • Absoliutus pasitikėjimas maišos pašalinimu. Vieno bito pakeitimas pakeičia maišą; kritiniu atveju gali prireikti viso nuskaitymo.
  • Tiesiog pasikliaukite raktiniu žodžiu. Netiesioginiai ir užkoduoti teiginiai pabėga; Su semantine paieška.
  • Nepatvirtina klaidingo teigiamo semantinės paieškos. AI gali rodyti nesusijusį dokumentą kaip „susijusį“; Perskaitykite ir patikrinkite.
  • Nesugebėjimas dokumentuoti skirstymo pagrindo. Teisme "kodėl jūs pirmiausia pažvelgėte į tai?" Turite turėti atsakymą į klausimą.

Apibendrinant

Didelių duomenų skirstymas yra disciplina, skirta ribotam laikui nukreipti didžiausią įrodymų tikimybę – nieko neištrinant, tik nustatant tvarką. AI; Tai užtikrina didelį semantinės paieškos, turinio grupavimo, tonų žymėjimo ir prioritetų nustatymo greitį po pašalinimo. Bet ekspertas laikosi maišos pašalinimo ribų, klaidingų teigiamų/neigiamų rezultatų rizikos ir principo „žemas prioritetas nėra neištirtas“. Dokumentuojant su pateisinimu susijusius sprendimus, rezultatas yra ginamas teisme.

Taikymo užduotis

Paruoškite pavyzdinį failo metaduomenų sąrašą (pavadinimas, dydis, data, plėtinys, trumpa santrauka) iš 30-40 eilučių; įdėkite keletą „klaidinančių“ failų (kritinis dokumentas netinkamame aplanke, failas su pakeistu plėtiniu). Suteikite prioritetus naudodami šabloną „Prioriteto ataskaita po pašalinimo“, tada paimkite bent 15 % žemo prioriteto grupės, kad pamatytumėte, ar AI ko nors nepraleido.

kontrolinis sąrašas

  • [ ] Nustačiau skirstymą kaip prioritetą; Neatšaukiau jokių grupių.
  • [ ] Sumažinau triukšmą pašalindamas maišą ir panaikindamas dubliavimą, turėdamas omenyje jo ribas.
  • [ ] Raktinį žodį užbaigiau semantine paieška.
  • [ ] Rankiniu būdu patvirtinau klaidingus teigiamus semantinio / grupavimo išvesties rezultatus.
  • [ ] Aš dokumentavau sprendimus dėl paskyrimo ir jų pagrindimą.