Gains :
- Comprendre que les étapes de collecte telles que l'ordre de volatilité, l'acquisition d'images, le hachage et la chaîne de traçabilité relèvent de la responsabilité humaine et que l'intelligence artificielle ne produit ici que des plans et des modèles
- Possibilité d'utiliser l'intelligence artificielle en toute sécurité pour accélérer la révision avec le tri des fichiers, l'OCR, le résumé et l'extraction des actifs après la prise de l'image.
- Être capable de distinguer que le triage n'est pas une élimination mais une priorisation, et que l'échantillonnage à partir du groupe peu prioritaire est nécessaire pour éviter le risque de faux négatifs.
Vous êtes arrivé sur une scène de crime : un ordinateur ouvert sur la table, un disque externe, deux téléphones et une salle de serveurs. Chaque appareil est une source potentielle de preuves ; Chaque faux pas constitue une preuve qui sera rejetée devant le tribunal. L'acquisition de preuves est le processus de capture et de copie de preuves numériques intactes, vérifiables et conformes à la loi. Dans cette unité, vous apprendrez à quelles étapes de ce processus l’IA peut contribuer en toute sécurité et quelles étapes elle doit absolument rester derrière. La règle critique depuis le début : l’IA ne rassemble pas de preuves et ne prend pas d’images ; Il permet d’examiner et d’accélérer l’obtention des preuves collectées et vérifiées.
Ordre de collecte et données volatiles
Il existe un principe de priorité dans la collecte de preuves : ordre de volatilité – collecte depuis les données qui disparaissent le plus rapidement jusqu'aux plus permanentes. En haut se trouvent les données volatiles : le contenu de la RAM est perdu lorsque l'appareil s'arrête, ouvre des connexions réseau, exécute des processus ; Vient ensuite le disque, puis les enregistrements externes. Les données volatiles, une fois perdues, ne reviennent pas ; Par conséquent, dans un système en cours d’exécution, la RAM est vidée avant le disque.
L’IA ne prend pas de décision à ce stade, mais est utile pour produire des listes de contrôle et des schémas de procédures : « Que dois-je collecter, dans quel ordre, avec quel outil, que dois-je documenter dans ce scénario ? Le processus de collecte lui-même (liaison avec blocage en écriture, acquisition d'images, vérification du hachage, scellement) est entre des mains humaines et chaque étape est documentée.
Astuce : Avant de commencer le picking, expliquez votre scénario à l'IA et rédigez un « plan de picking séquentiel de volatilité » ; comparez ensuite ce projet avec la procédure standard de votre établissement (par exemple, la législation locale et les SOP de laboratoire). L'IA est un rappel, pas une autorité.
Imagerie et hachage : chaîne inviolable
Une image exacte est prise à partir de chaque appareil collecté. Lors de l'importation de l'image, la source est protégée par un bloqueur d'écriture ; Lorsque l'image est terminée, un hachage (SHA-256 est préféré ; MD5 seul est désormais considéré comme faible) est calculé. Ce hachage est l'empreinte digitale de l'image : il doit être le même à chaque contrôle de hachage tout au long de l'examen, sinon l'image est corrompue. Le formulaire de chaîne de possession (par qui, quand, où les preuves ont été recueillies, où elles ont été déposées, à qui elles ont été remises) est mis à jour à chaque fois qu'elles changent de mains.
L'IA effectue ici deux tâches sécurisées : (1) génère des modèles de chaîne de traçabilité et d'étiquettes de preuves à remplir lors de la collecte ; (2) organise les hachages et les horodatages que vous avez collectés pour un contrôle de cohérence (« ces trois hachages sont-ils identiques, quelle image appartient à quel appareil ? »). L’IA ne calcule pas elle-même le hachage – elle en fait un outil médico-légal ; L'IA édite uniquement l'enregistrement.
Accélération des révisions : le vrai pouvoir de l'IA
Une fois les preuves vérifiées et l’image capturée, l’IA brille vraiment. Zones d'accélération typiques :
- Classification des fichiers : regrouper des dizaines de milliers de fichiers par type, contenu et pertinence possible et recommander des priorités.
- Résumé du texte et du document : extraction de sujets et de parties pour les contrats longs, les e-mails, les transcriptions de discussions.
- OCR et contenu visuel : extraction de texte à partir de documents numérisés (OCR – reconnaissance optique de caractères, conversion de texte dans une image) et marquage d'objets/texte dans des images.
- Extraction d'entités (NER — reconnaissance d'entité nommée, recherche d'entités nommées telles qu'une personne, une institution, un compte, une adresse IP à partir d'un texte) : liste de la personne, de l'IBAN, du téléphone, de l'e-mail, de l'adresse du portefeuille crypto à partir de milliers de documents.
- Description du code et de la commande : Expliquez en langage clair ce que fait un script trouvé ou un historique de commande (à vérifier).
Dans chacun d’eux, le résultat est un point de départ ; La décision sur la pertinence et la valeur probante appartient à l'expert.
Attention : l'IA disant "ce fichier n'est pas pertinent" ne suffit pas pour éliminer ce fichier sans l'examiner. Le tri réduit la priorité, mais dans les cas critiques, l'échantillonnage est également effectué à partir du cluster de faible priorité. Les faux négatifs (omettre des preuves réelles car « non pertinentes ») sont l’erreur la plus coûteuse en criminalistique informatique.
trois mini-cases
Cas 1 — Document confidentiel avec OCR. Une enquête de corruption comportait 14 000 pages numérisées ; aucun d’entre eux n’était un texte consultable. Grâce à l'OCR basé sur l'IA, toutes les pages ont été transcrites et recherchées des modèles tels que « offshore », un nom d'entreprise spécifique et un IBAN. 9 pages critiques trouvées en 40 minutes ; La lecture à la main prendrait des semaines. Chaque page a ensuite été vérifiée par des experts.
Cas 2 — Réseau de relations d'inférence d'entité. Un dossier de fraude contenait 6 200 e-mails. Avec NER, tous les contacts, comptes et téléphones ont été extraits et une liste de relations a été créée ; Ainsi, deux comptes de courtage inédits ont vu le jour. L'IA a marqué la connexion ; Le procureur a confirmé les preuves dans les courriels eux-mêmes.
Cas 3 — Risque de faux négatifs. Une équipe souhaitait éliminer complètement un ensemble de 30 000 fichiers que AI qualifiait de « faible intérêt ». L'expert principal a échantillonné au hasard 2 % de ce cluster et y a trouvé un enregistrement critique : l'IA avait mal classé le fichier en raison de l'extension inhabituelle. La discipline d'échantillonnage a sauvé l'affaire.
Quatre modèles copiables
1) Projet de plan de collecte :
Votre rôle : spécialiste des collections médico-légales sur les scènes de crime. Scénario : [sur PC, 2 téléphones, 1 NAS, serveur en cours d'exécution]. Décrivez-moi un plan de collecte par ordre de volatilité : ce qu'il faut collecter pour chaque appareil, quel outil est recommandé, ce qu'il faut documenter. Veuillez noter qu'il s'agit d'un projet qui nécessite une confirmation conformément à la législation locale.
2) Modèle de chaîne de traçabilité :
Générez-moi un modèle de formulaire de chaîne de traçabilité : incluez le numéro de preuve, la description de l'appareil, le numéro de série, le collecteur, la date/heure, la méthode de collecte, le hachage (SHA-256), le destinataire, le livreur, l'emplacement de stockage et les lignes pour chaque transfert.
3) Demande de tri de fichiers en masse :
Je vais vous donner une liste de fichiers (nom, taille, date, extension). Regroupez par probabilité élevée/moyenne/faible d’intérêt médico-légal et écrivez JUSTIFICATION. Remarque : « faible » n'est pas éliminé, il est simplement priorisé. Marquez séparément ceux dont le contenu de l'extension ne correspond pas.
4) Expliquez le script trouvé :
Expliquez cet historique de script/commande dans un contexte médico-légal : que fait-il, de quel accès fichier/réseau dispose-t-il, y a-t-il une trace de persistance ou d'exfiltration de données ? Liez chaque assertion à une ligne du script. Si vous n'êtes pas sûr, marquez-le comme « doit être vérifié ».
Invite faible/Invite forte
Invite faible :
Séparez ces fichiers selon les plus importants.
« substantiel » n'est pas défini ; L’IA passe au crible ses propres hypothèses et peut passer à côté de preuves cruciales.
Invite puissante :
Votre rôle : analyste médico-légal de triage. Contexte : Nous enquêtons sur un incident de ransomware, de chiffrement et d'exfiltration de données. Je vous donnerai une liste de fichiers avec nom, taille, date de création/modification et extension. Tâche : outil de chiffrement, compression/archivage, extension inhabituelle, modifiée au cours des dernières 72 heures et marquer les fichiers d'exportation volumineux comme haute priorité ; Écrivez la justification de chaque décision. Si l’extension ne correspond pas au contenu attendu, prévenez également. Ne dites pas « supprimer/rejeter » un fichier ; il suffit de prioriser.
Le contexte, la cible et la contrainte « ne pas dire supprimer » rendent la sortie à la fois utile et sûre.
Collecte ou révision : tableau des rôles de l'IA
Scène
L’IA est-elle sûre ?
Le travail de l'IA
le travail de l'homme
Collecte de données volatiles
Non (décision)
projet de plan
Collecte, documentation
acquisition d'images
non
modèle
Bloqueur d'écriture, hachage
Vérification du hachage
non
ordre d'enregistrement
Calcul et confirmation via véhicule
Tri des fichiers
Oui
priorisation
décision, échantillonnage
OCR/extraction de texte
Oui
transformation
vérification de l'exactitude
inférence d'entité
Oui
Génération de liste
Décision de pertinence
Erreurs courantes
- Essayer de faire en sorte que l'IA « fasse » la sélection. L'IA n'ajoute rien ; Il ne produit que des plans et des gabarits. L'image et le hachage sont des œuvres humaines.
- Confondre le résultat du tri avec une élimination définitive. Ne sautez pas l'échantillonnage du cluster « à faible intérêt ».
- Citer la sortie OCR sans la vérifier. L'OCR peut mélanger les lettres (0/0, 1/l) ; Confirmez les valeurs critiques avec la source.
- Faire aveuglément confiance à l’extension. L'extension a peut-être été modifiée ; Vérifiez le type de contenu.
- Téléchargement de données personnelles dans un véhicule sans masque. Les données TC/IBAN/santé peuvent être divulguées lors d’inférences groupées.
En résumé
La collecte de preuves est une responsabilité humaine : l’ordre de la volatilité, de l’image, du hachage et de la chaîne de contrôle est entre des mains humaines ; Ici, l’IA ne produit que des plans et des modèles. Une fois les preuves vérifiées et l’image capturée, l’IA apporte une réelle valeur ajoutée en accélérant la révision (triage, OCR, résumé, extraction d’entités, annotation de code). Mais chaque sortie est un signe à vérifier ; La décision sur la pertinence et la valeur probante appartient à l'expert, qui prend également en compte le risque de faux négatifs.
Tâche de candidature
Décrivez un scénario d'incident fictif (par exemple, un employé est soupçonné d'exfiltrer des données). Dessinez d'abord un plan avec le modèle "Projet de plan de collecte" et comparez-le avec la procédure locale. Préparez ensuite un exemple de liste de fichiers de 20 lignes et hiérarchisez-la avec le modèle « Triage de fichiers en masse » ; échantillonner manuellement au moins 10 % et vérifier la classification de l'IA.
liste de contrôle
- [ ] J'ai établi le plan de collecte par ordre de volatilité et je l'ai comparé à la procédure.
- [ ] J'ai obtenu l'image et le hachage via human/tool ; Je ne l'ai pas fait faire par l'IA.
- [ ] J'ai mis à jour le formulaire Chaîne de traçabilité à chaque fois qu'il changeait de mains.
- [ ] J'ai échantillonné à partir du cluster « faible » du résultat du triage.
- [ ] J'ai vérifié l'OCR et la sortie des actifs avec la source ; J'ai masqué des données personnelles.