Vienība 4 / 11

Lielo datu šķirošana: datu terabaitu prioritātes noteikšana

Ieguvumi:

  • Saprotiet, ka šķirošana ir disciplīna, kurā tiek noteikta pārbaudes secība, neko neizdzēšot, un jāspēj veikt semantisko meklēšanu un satura klasterizāciju ar mākslīgo intelektu.
  • Spēja samazināt troksni ar hash-based elimination (NSRL) un dublēšanas atcelšanu un ievērot šo metožu robežas (viena bita maiņa)
  • Spēja manuāli apstiprināt semantiskās meklēšanas viltus pozitīvus rezultātus un dokumentēt šķirošanas lēmumus ar pamatojumu, lai padarītu tos aizsargājamus

Mūsdienu kriminālistikas izmeklēšana vairs neaprobežojas tikai ar vienu datoru. Korporatīvā incidentā jūs varat saskarties ar desmitiem disku, simtiem gigabaitu e-pasta arhīvu, mākoņa dublējumkopijas, tērzēšanas lietojumprogrammas un terabaitus failu. Fiziski nav iespējams tos visus pēc kārtas pārbaudīt no sākuma līdz beigām. Šeit tiek izmantota šķirošana (jēdziens, kas aizgūts no medicīnas; vispirms tiek piešķirti ierobežoti resursi viskritiskākajam gadījumam, tas ir, ātri jāizlemj, "ko vispirms apskatīt"). Šajā nodaļā mēs redzēsim, kā AI gudri nosaka prioritātes lielām datu kaudzēm, kādām kļūdām tas ir pakļauts un kā šķirošana tiek saskaņota ar kriminālistikas integritāti.

Kāpēc ir nepieciešama šķirošana?

Datoru kriminālistikā konfliktē divas realitātes: (1) visi pierādījumi ir vērtīgi un neko nedrīkst palaist garām; (2) laiks un darbaspēks ir ierobežots. Šķirošana šo konfliktu atrisina, neko neizdzēšot, tikai nosakot pārbaudes secību. Citiem vārdiem sakot, šķirošana nav "likvidēšana", bet gan "prioritātes noteikšana". Vispirms tiek pārbaudīti dati ar vislielāko pierādījumu varbūtību; Zemas varbūtības dati tiek saglabāti, bet vēlāk tiek ievietoti rindā.

Šķirošana notiek divos līmeņos: tiešā šķirošana (notikuma vietā izlemjot, kuru ierīci vispirms uzņemt) un datu šķirošanu (kad attēli ir uzņemti, kuru failu/datu kopu vispirms pārbaudīt). AI ir īpaši spēcīga pēdējā, proti, lielu datu kopu prioritāšu noteikšana uz saturu.

Kriminālistikas jutīgais šķirošanas aspekts ir tāds, ka pasūtījuma lēmums nosaka izmeklēšanas virzienu. Nepareizi noteiktas prioritātes klasteris var novest pie tā, ka kritiskie pierādījumi tiek atrasti ar nedēļu nokavēšanos vai pat vispār netiek pārbaudīti, jo ir beidzies izmeklēšanas termiņš. Tātad šķirošana nav "ātruma triks", bet gan metodoloģisks lēmums, un tas ir jādokumentē ar pamatojumu, tāpat kā jebkurš cits kriminālistikas solis. Augsta riska gadījumos šķirošana neaizstāj pilnu izmeklēšanu; tā tikai nosaka, kura daļa tiek izskatīta pirmā, saglabājot principu, ka galu galā tiks novērtēta visa kopa.

Padoms. Pierakstiet savus lēmumus par šķirošanu un to iemeslus. "Kāpēc mēs vispirms apskatījām šo kopu, kāpēc mēs to atstājām līdz pēdējam?" Jautājumu var uzdot tiesā. Šajā ierakstā iekļaujiet AI prioritāšu noteikšanas pamatojumu; Caurspīdība ir aizsargājamība.

Uz saturu balstīta prioritāšu noteikšana ar AI

Klasiskā šķirošana aplūko faila nosaukumu, lielumu un datumu. AI tam pievieno konteksta izpratni: tas var saprast, par ko ir dokuments, ko satur attēls, sarunas toni. Šādā veidā:

  • Semantiskā meklēšana - satura atrašana, kam ir līdzīga nozīme, pat ja vārds precīzi neatbilst: Meklējot "naudas pārvedums", tiek atgriezti arī dokumenti, kas satur "naudas pārvedums", "sūtījums", "maksājuma norādījums".
  • Tēmu grupēšana: automātiska tūkstošiem dokumentu kārtošana tēmās (finanšu, personāla, tehniskā, personiskā).
  • Emociju/skaņu marķēšana: tādu ziņojumu izcelšana, kas rada tādus signālus kā draudi, panika, privātuma pārkāpums.
  • Vizuālā šķirošana: tūkstošiem attēlu grupēšana pēc objekta/sižeta atzīmes (likuma robežās, piemēram, tikai atļauts un atbilstošs saturs).
  • Dublikātu un nevēlamā satura novēršana: viena un tā paša faila un sistēmas failu (ar zināmiem jaukšanas sarakstiem) dublikātu atdalīšana un cilvēka skatiena novirzīšana uz patiesi jaunu saturu.

Zināmā failu likvidēšana: NSRL un jaucējkopas

Vispraktiskākais paātrinātājs lielo datu šķirošanai ir zināmie labo/slikto hash saraksti. Bibliotēkās, piemēram, NSRL (National Software Reference Library) ir miljoniem standarta operētājsistēmu un lietojumprogrammu failu jaucējkoda. Šie "zināmie labie" faili tiek likvidēti šķirošanas laikā, ļaujot koncentrēties tikai uz lietotāju ģenerētiem un aizdomīgiem failiem. Līdzīgi, “zināma slikta” jaucējkoda (zināma ļaunprātīga programmatūra) tiek automātiski atzīmēta. AI stājas spēlē atlikušajā klasterī pēc šīs likvidēšanas, kas patiešām prasa nozīmi.

Uzmanību: uz hash balstīta likvidēšana ir spēcīga, taču viena bita maiņa pilnībā maina jaucējkodu. Nedaudz pārveidojot standarta failu, uzbrucējs var to noņemt no "zināmā labā" saraksta vai, gluži pretēji, paslēpt slikto failu. Likvidēšana nav absolūts, bet gan prioritātes līdzeklis.

trīs mini futrāļi

1. gadījums — semantiskā meklēšana sadalīja laiku ar 20. Iekšējā izmeklēšanā tika atrasti 480 GB e-pasta ziņojumi. Klasiskā atslēgvārdu meklēšana radīja 3 rezultātus vaicājumam "kukuļošana". Ar AI darbinātā semantiskā meklēšana arī uztvēra eifēmismus, piemēram, “maksa par konsultāciju”, “atvieglojums”, “pateicības maksājums” un ieguva 61 atbilstošu ziņojumu. Pārskatīšana tika pabeigta 2 dienās, nevis nedēļās; Katrs rezultāts tika apstiprināts manuāli.

2. gadījums — dublēšanās atcelšana ietaupīja darbaspēku. 1,7 miljonu failu klasterī pēc dublikātu tīrīšanas un NSRL likvidēšanas unikālo lietotāju failu skaits, kas jāpārbauda, ​​tika samazināts līdz 92 000. Komanda koncentrējās uz faktisko saturu, nevis uz kaudzi, kurā 95% bija sistēmas troksnis.

3. gadījums — pārmērīgas uzticēšanās cena. Viena komanda nekad nav atvērusi to, ko AI sauc par “nefinanšu” kopu. Kā izrādās, personīgā fotoalbumā bija paslēpts kritisks līgums (nevis steganogrāfija, tikai nepareizā mape). Pierādījumi tika aizkavēti, jo zemas prioritātes klasteris netika atlasīts. Nodarbība: šķirošana nosaka secību, nevis atceļ eksāmenu.

Četras kopējamas veidnes

1) Šķirošanas stratēģijas projekts:

Jūsu loma: vecākais tiesu ekspertīzes speciālists.Dati: [piem. 480 GB e-pasts + 1,2 TB failu koplietošana].Uzziņas tēma: [piem. datu noplūde + kukuļdošana].Ieskicēt man šķirošanas stratēģiju: kurā secībā, pēc kādiem kritērijiem kāds klasteris jāskatās; Kā izmantot hash likvidēšanu un semantisko meklēšanu. Uzsveriet, ka neviens klasteris netiks "atcelts", tie tiks vienkārši sakārtoti.

2) Semantiskā meklēšanas vienuma paplašināšana:

Temats: [kukuļošana / datu noplūde / uzmākšanās]. Lai atrastu dokumentus, kas saistīti ar šo tēmu, uzskaitiet netiešos/sinonīmus izteicienus (tostarp slengu, koda vārdu, netiešo runu), kā arī burtiskus atslēgvārdus. Mērķis ir paplašināt meklēšanas jomu; Sadaliet katru terminu kategorijās.

3) Satura klasterizācija:

Es došu jums dokumentu nosaukumus/kopsavilkumus. Sagrupējiet tos jēgpilnās tēmās (finanšu, HR, tehniskās, juridiskās, personiskās) un sniedziet katra dokumenta tēmu un īsu pamatojumu. Atzīmējiet atsevišķi "neviennozīmīgo" kopu, kuru nevarat iekļaut tēmā; Šis klasteris netiks izlaists, tas tiks pārbaudīts manuāli.

4) Ziņojums par prioritāti pēc likvidēšanas:

Pazīstamie labie (NSRL) un dublētie faili tiek likvidēti. Atlikušajiem unikālajiem lietotāju failiem: piešķiriet augstu/vidēju/zemu prioritāti atbilstoši izmeklēšanas priekšmetam un ierakstiet PAMATOJUMS. Tiek izcelta arī paplašinājuma satura neatbilstība, šifrēti/paroles faili un faili, kas ir mainīti pēdējo 30 dienu laikā.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Šajos datos atrodiet svarīgus failus.

Nav tēmas, apjoma un prioritāšu noteikšanas loģikas; AI var palaist garām kritisku saturu saskaņā ar tās definīciju “svarīgs”.

Spēcīga uzvedne:

Jūsu loma: tiesu ekspertīzes analītiķis. Izmeklēšana: darbinieks pirms aiziešanas esot nopludinājis klientu sarakstu. Es sniegšu jums faila metadatus (nosaukums, lielums, datums, paplašinājums, ceļš) un īsus satura kopsavilkumus. Uzdevums: atzīmēt klienta datus, eksportēšanu/arhivēšanu, mākoņa augšupielādes izsekošanu, USB/ārējo disku un pēdējo 60 dienu laikā mainītos failus kā augstu prioritāti; Uzrakstiet katra lēmuma iemeslus. Nesakiet, ka nevienu kopu nevar pārbaudīt; vienkārši šķiro. Neskaidrības uzskaitiet atsevišķi.

Konkrēta tēma, mērķtiecīgi kritēriji un ierobežojums "bez pārskatīšanas" padara rezultātu gan efektīvu, gan drošu.

Šķirošanas metožu salīdzināšanas tabula

Metode

Ko dara

stiprā puse

risku

Hash likvidēšana (NSRL)

Piešķir zināmo failu

Ļoti ātri, precīzi

Modificētais fails tiek izlaists

Dublēšanas atcelšana

Kopē pa vienam

Darbaspēka taupīšana

Var izlaist aizvērt kopiju

atslēgvārds

Meklē precīzus terminus

Vienkāršs, pārbaudāms

Pietrūkst netiešā paziņojuma

Semantiskā meklēšana (AI)

Atrod tuvāko pēc nozīmes

Tver netiešu saturu

Rada viltus pozitīvus rezultātus

Satura klasterēšana (AI)

sadalās tēmās

Sniedz pārskatu

Nepareizas tēmas risks

Biežas kļūdas

  • Kļūdaina šķirošana izslēgšanai. Zema prioritāte nav "nepārskatāms"; paraugu ņemšana ir būtiska.
  • Absolūta uzticēšanās jaucējkoda likvidēšanai. Viena bita maiņa maina hash; kritiskā gadījumā var būt nepieciešama pilnīga skenēšana.
  • Paļaujoties tikai uz atslēgvārdu. Netieši un kodēti paziņojumi aizbēgt; Komplektā ar semantisko meklēšanu.
  • Neapstiprina semantiskās meklēšanas kļūdaini pozitīvu rezultātu. AI var parādīt neatbilstošu dokumentu kā “saistītu”; Izlasiet un pārbaudiet.
  • Nespēja dokumentēt šķirošanas pamatojumu. Tiesā "kāpēc jūs to vispirms apskatījāt?" Jums ir jābūt atbildei uz jautājumu.

Rezumējot

Lielo datu šķirošana ir disciplīna ierobežota laika novirzīšanai uz vislielāko pierādījumu iespējamību — neko neizdzēšot, tikai nosakot secību. AI; Tas nodrošina lielu ātrumu semantiskajā meklēšanā, satura klasterizācijā, toņu iezīmēšanā un prioritāšu noteikšanā pēc likvidēšanas. Bet eksperts ievēro hash likvidēšanas robežas, viltus pozitīvu/negatīvu risku un principu "zema prioritāte nav nepārbaudīts". Šķirošanas lēmumu dokumentēšana ar pamatojumu padara rezultātu aizstāvamu tiesā.

Lietojumprogrammas uzdevums

Sagatavojiet faila metadatu saraksta paraugu (nosaukums, izmērs, datums, paplašinājums, īss kopsavilkums) ar 30-40 rindām; ievietojiet tajā dažus "maldinošus" failus (kritisks dokuments nepareizā mapē, fails ar mainītu paplašinājumu). Nosakiet prioritātes, izmantojot veidni “pēc likvidēšanas prioritātes ziņojums”, pēc tam no zemas prioritātes klastera izlasiet vismaz 15%, lai redzētu, vai AI nav kaut ko palaidis garām.

kontrolsaraksts

  • [ ] Es iestatīju šķirošanu kā prioritāti; Es neatcēlu nevienu kopu.
  • [ ] Es samazināju troksni, noņemot jaucējkodus un atceļot dublēšanos, paturot prātā tā ierobežojumus.
  • [ ] Atslēgvārdu pabeidzu ar semantisko meklēšanu.
  • [ ] Es manuāli apstiprināju semantiskās/klasterēšanas izvades kļūdainos pozitīvos rezultātus.
  • [ ] Es dokumentēju šķirošanas lēmumus un to pamatojumu.