Guadagni:
- Comprendere che le fasi di raccolta come l'ordine di volatilità, l'acquisizione di immagini, l'hash e la catena di custodia sono responsabilità umana e che l'intelligenza artificiale produce solo piani e modelli qui
- Possibilità di utilizzare in modo sicuro l'intelligenza artificiale per accelerare la revisione con classificazione dei file, OCR, riepilogo ed estrazione delle risorse dopo lo scatto dell'immagine
- Essere in grado di distinguere che il triage non è un'eliminazione ma una definizione delle priorità e che il campionamento dal gruppo a bassa priorità è necessario per evitare il rischio di falsi negativi.
Sei arrivato sulla scena del crimine: un computer aperto sul tavolo, un disco esterno, due telefoni e una sala server. Ogni dispositivo è una potenziale fonte di prova; Ogni mossa sbagliata è una prova che verrà respinta in tribunale. L'acquisizione delle prove è il processo di acquisizione e copia delle prove digitali intatte, verificabili e conformi alla legge. In questa unità imparerai in quali fasi di questo processo l’intelligenza artificiale può assistere in sicurezza e in quali fasi dovrebbe assolutamente restare indietro. La regola fondamentale fin dall’inizio: l’intelligenza artificiale non raccoglie prove e non scatta immagini; Aiuta a rivedere e accelerare la derivazione delle prove raccolte e verificate.
Ordine di raccolta e dati volatili
Esiste un principio di priorità nella raccolta delle prove: ordine di volatilità: raccolta dai dati che scompaiono più rapidamente a quelli più permanenti. In alto ci sono i dati volatili: il contenuto della RAM viene perso quando il dispositivo si spegne, si aprono connessioni di rete o si eseguono processi; Poi arriva il disco, poi le registrazioni esterne. I dati volatili, una volta persi, non ritornano; Pertanto, in un sistema in esecuzione, la RAM viene scaricata prima del disco.
L’intelligenza artificiale non prende decisioni in questa fase, ma è utile nella produzione di liste di controllo e schemi di procedure: “Cosa dovrei raccogliere, in quale ordine, con quale strumento, cosa dovrei documentare in questo scenario?” Il processo di raccolta stesso (associazione con blocco della scrittura, acquisizione di immagini, verifica dell'hash, sigillatura) è nelle mani dell'uomo e ogni passaggio è documentato.
Suggerimento: prima di iniziare la raccolta, spiega il tuo scenario all'IA e redige un "piano di raccolta sequenziale della volatilità"; quindi confrontare questa bozza con la procedura standard della propria istituzione (ad esempio legislazione locale e SOP di laboratorio). L’intelligenza artificiale è un promemoria, non un’autorità.
Imaging e hashing: catena inviolabile
Da ciascun dispositivo raccolto viene prelevata un'immagine esatta. Durante l'importazione dell'immagine, la sorgente è protetta da un blocco da scrittura; Una volta terminata l'immagine, viene calcolato un hash (si preferisce SHA-256; il solo MD5 è ora considerato debole). Questo hash è l'impronta digitale dell'immagine: deve essere uguale ad ogni controllo dell'hash durante l'esame, altrimenti l'immagine viene corrotta. Il modulo di catena di custodia (da chi, quando, dove è stata prelevata la prova, dove è stata collocata, a chi è stata consegnata) viene aggiornato ogni volta che passa di mano.
Qui l'intelligenza artificiale svolge due lavori sicuri: (1) genera modelli di catena di custodia e tag di prova da compilare durante la raccolta; (2) organizza gli hash e i timestamp raccolti per un controllo di coerenza ("questi tre hash sono uguali, quale immagine appartiene a quale dispositivo?"). L’intelligenza artificiale non calcola l’hash stesso, ma lo rende uno strumento forense; L'IA modifica solo il record.
Accelerazione delle revisioni: il vero potere dell'intelligenza artificiale
Una volta verificate le prove e catturata l’immagine, l’intelligenza artificiale brilla davvero. Aree di accelerazione tipiche:
- Classificazione dei file: raggruppamento di decine di migliaia di file per tipo, contenuto e possibile rilevanza e raccomandazione delle priorità.
- Riepilogo di testi e documenti: estrazione di soggetti e parti per contratti lunghi, email, trascrizioni di chat.
- OCR e contenuto visivo: estrazione di testo da documenti scansionati (OCR — riconoscimento ottico dei caratteri, conversione di testo in un'immagine) e taggatura di oggetti/testo nelle immagini.
- Estrazione di entità (NER - riconoscimento di entità denominate, ricerca di entità denominate come persona, istituzione, account, IP dal testo): elenco di persone, IBAN, telefono, e-mail, indirizzo di portafoglio crittografico da migliaia di documenti.
- Descrizione del codice e del comando: spiegare in un linguaggio semplice cosa fa uno script trovato o la cronologia dei comandi (da verificare).
In ciascuno di essi, l'output è un punto di partenza; La decisione sulla pertinenza e sul valore probatorio spetta all'esperto.
Attenzione: l'AI che dice "questo file è irrilevante" non è sufficiente per eliminare quel file senza esaminarlo. Il triage abbassa la priorità, ma in casi critici il campionamento viene effettuato anche dal cluster a bassa priorità. I falsi negativi (omettere prove reali come “irrilevanti”) sono l’errore più costoso nell’informatica forense.
tre mini custodie
Caso 1: documento riservato con OCR. In un'indagine sulla corruzione sono state scansionate 14.000 pagine; nessuno di loro era testo ricercabile. Con l'OCR basato sull'intelligenza artificiale, tutte le pagine sono state trascritte e cercate modelli come "offshore", un nome di società specifico e IBAN. 9 pagine critiche trovate in 40 minuti; La lettura a mano richiederebbe settimane. Ogni pagina è stata quindi verificata da esperti.
Caso 2: rete di relazioni di inferenza di entità. Un file di frode conteneva 6.200 e-mail. Con NER sono stati estratti tutti i contatti, account e telefoni ed è stata creata una lista di relazioni; Così sono emersi due conti di intermediazione precedentemente inosservati. L’IA ha segnato la connessione; Il pubblico ministero ha confermato le prove contenute nelle e-mail stesse.
Caso 3 – Pericolo di falsi negativi. Un team voleva eliminare completamente una serie di 30.000 file che l'intelligenza artificiale chiamava "a basso interesse". L'esperto senior ha campionato casualmente il 2% di questo cluster e vi ha trovato un record critico: l'intelligenza artificiale aveva classificato erroneamente il file a causa dell'estensione insolita. La disciplina del campionamento ha salvato il caso.
Quattro modelli copiabili
1) Bozza del piano di raccolta:
Il tuo ruolo: specialista nella raccolta forense sulla scena del crimine. Scenario: [su PC, 2 telefoni, 1 NAS, server in esecuzione]. Descrivimi un piano di raccolta in ordine di volatilità: cosa raccogliere per ciascun dispositivo, quale strumento è consigliato, cosa documentare. Tieni presente che questa è una bozza e richiede conferma secondo la legislazione locale.
2) Modello di catena di custodia:
Generami un modello di modulo di catena di custodia: includi numero di prova, descrizione del dispositivo, numero di serie, raccoglitore, data/ora, metodo di raccolta, hash (SHA-256), destinatario, recapito, posizione di archiviazione e righe per ogni trasferimento.
3) Richiesta di valutazione di file in blocco:
Ti fornirò un elenco di file (nome, dimensione, data, estensione). Raggruppare per alta/media/bassa probabilità di interesse forense e scrivere GIUSTIFICAZIONE. Nota: "basso" non viene eliminato, gli viene semplicemente data la priorità. Contrassegna separatamente quelli con mancata corrispondenza del contenuto dell'estensione.
4) Spiegare lo script trovato:
Spiegare questa cronologia di script/comandi in un contesto forense: cosa fa, quale accesso a file/rete ha, c'è qualche traccia di persistenza o esfiltrazione di dati? Collega ciascuna affermazione a una riga nello script. Se non sei sicuro, contrassegnalo come "deve essere verificato".
Prompt debole / Prompt forte
Suggerimento debole:
Separare questi file in base a quelli importanti.
"Sostanziale" non è definito; L’intelligenza artificiale esamina le proprie ipotesi e potrebbe perdere prove critiche.
Suggerimento potente:
Il tuo ruolo: analista di triage forense. Contesto: stiamo indagando su un incidente di ransomware, crittografia ed esfiltrazione di dati. Ti fornirò un elenco di file con nome, dimensione, data di creazione/modifica ed estensione. Compito: strumento di crittografia, compressione/archiviazione, estensione insolita, modificata nelle ultime 72 ore e contrassegnare i file di esportazione di grandi dimensioni come priorità alta; Scrivi la motivazione per ogni decisione. Se l'estensione non corrisponde al contenuto previsto, avvisa anche. Non dire "elimina/scarta" alcun file; basta dare la priorità.
Il contesto, la destinazione e il vincolo "non dire eliminare" rendono l'output utile e sicuro.
Raccolta e revisione: tabella dei ruoli dell'IA
Palcoscenico
L’intelligenza artificiale è sicura?
Il lavoro dell'intelligenza artificiale
lavoro dell'uomo
Raccolta dati volatile
No (decisione)
bozza di piano
Raccolta, documentazione
acquisizione di immagini
no
modello
Blocco scrittura, hash
Verifica dell'hash
no
ordine di registrazione
Calcolo e conferma tramite veicolo
Triage dei file
Sì
priorità
decisione, campionamento
OCR/estrazione testo
Sì
conversione
verifica dell'accuratezza
inferenza di entità
Sì
Generazione di elenchi
Decisione sulla pertinenza
Errori comuni
- Cercando di far "fare" la raccolta all'intelligenza artificiale. L'intelligenza artificiale non aggiunge; Produce solo piani e modelli. Immagine e hash sono opere umane.
- Confondendo il risultato del triage con l'eliminazione definitiva. Non saltare il campionamento dal cluster "basso interesse".
- Citazione dell'output OCR senza verificarlo. L'OCR può mescolare lettere (0/0, 1/l); Conferma i valori critici con la fonte.
- Fidarsi ciecamente dell'estensione. L'estensione potrebbe essere stata modificata; Controlla il tipo di contenuto.
- Caricamento dei dati personali su un veicolo senza maschera. TC/IBAN/dati sanitari potrebbero essere divulgati nell'inferenza collettiva.
In sintesi
La raccolta delle prove è una responsabilità umana: l’ordine della volatilità, dell’immagine, dell’hash e della catena di custodia sono nelle mani dell’uomo; Qui l’intelligenza artificiale produce solo piani e modelli. Una volta verificate le prove e acquisita l'immagine, l'intelligenza artificiale aggiunge valore reale accelerando la revisione (triage, OCR, riepilogo, estrazione di entità, annotazione del codice). Ma ogni output è un segno da verificare; La decisione sulla pertinenza e sul valore probatorio spetta all'esperto, che tiene conto anche del rischio di falsi negativi.
Compito dell'applicazione
Descrivere uno scenario di incidente fittizio (ad esempio, un dipendente è sospettato di aver sottratto dati). Per prima cosa redigere una planimetria con il modello “Bozza del piano di raccolta” e confrontarla con la procedura locale. Quindi preparare un elenco di file di esempio di 20 righe e assegnargli la priorità con il modello "Triage di file di massa"; campionare manualmente almeno il 10% e verificare la classificazione dell'IA.
lista di controllo
- [ ] Ho impostato il piano di incasso in ordine di volatilità e l'ho confrontato con la procedura.
- [] Ho ottenuto l'immagine e l'hash tramite human/tool; Non l'ho fatto fare all'IA.
- [ ] Ho aggiornato il modulo di catena di custodia ogni volta che cambiava di mano.
- [ ] Ho campionato dal cluster "basso" del risultato del triage.
- [] Ho verificato l'OCR e l'output delle risorse con la fonte; Ho mascherato i dati personali.