Unidad 2 / 11

Apoyo a la recopilación y el examen de pruebas: aceleración de la obtención de imágenes, la clasificación y el análisis

Ganancias:

  • Comprender que los pasos de recopilación, como el orden de volatilidad, la adquisición de imágenes, el hash y la cadena de custodia, son responsabilidad humana, y la inteligencia artificial solo produce planes y plantillas aquí.
  • Capacidad de utilizar de forma segura la inteligencia artificial para acelerar la revisión con clasificación de archivos, OCR, resumen y extracción de activos después de tomar la imagen.
  • Poder distinguir que el triaje no es eliminación sino priorización, y que el muestreo del grupo de baja prioridad es necesario para evitar el riesgo de falsos negativos.

Has llegado a la escena del crimen: una computadora abierta sobre la mesa, un disco externo, dos teléfonos y una sala de servidores. Cada dispositivo es una fuente potencial de evidencia; Cada paso en falso es una prueba que será rechazada en los tribunales. La adquisición de evidencia es el proceso de capturar y copiar evidencia digital intacta, verificable y de conformidad con la ley. En esta unidad, aprenderá en qué pasos de este proceso la IA puede ayudar de manera segura y en qué pasos definitivamente debería quedarse atrás. La regla crítica desde el principio: la IA no recopila pruebas ni toma imágenes; Ayuda a revisar y acelerar la derivación de las pruebas recopiladas y verificadas.

Orden de cobro y datos volátiles

Existe un principio de prioridad en la recopilación de evidencia: orden de volatilidad: recopilación desde los datos que desaparecen más rápidamente hasta los más permanentes. En la parte superior se encuentran los datos volátiles: el contenido de la RAM se pierde cuando el dispositivo se apaga, se abren conexiones de red o se ejecutan procesos; Luego viene el disco, luego las grabaciones externas. Los datos volátiles, una vez perdidos, no regresan; Por lo tanto, en un sistema en ejecución, la RAM se descarga antes que el disco.

La IA no toma decisiones en esta etapa, pero es útil para producir listas de verificación y esquemas de procedimientos: "¿Qué debo recopilar, en qué orden, con qué herramienta, qué debo documentar en este escenario?" El proceso de recopilación en sí (vinculación con bloqueo de escritura, adquisición de imágenes, verificación de hash, sellado) está en manos humanas y cada paso está documentado.

Consejo: antes de comenzar a seleccionar, explique su escenario a la IA y redacte un "plan de selección secuencial de volatilidad"; luego compare este borrador con el procedimiento estándar de su institución (por ejemplo, legislación local y SOP de laboratorio). La IA es un recordatorio, no una autoridad.

Imágenes y hash: cadena inviolable

Se toma una imagen exacta de cada dispositivo recopilado. Mientras se importa la imagen, la fuente está protegida por un bloqueador de escritura; Cuando la imagen está terminada, se calcula un hash (se prefiere SHA-256; ahora solo MD5 se considera débil). Este hash es la huella digital de la imagen: debe ser el mismo en cada comprobación de hash durante todo el examen; de lo contrario, la imagen se corromperá. El formulario de cadena de custodia (quién, cuándo, dónde se tomaron las pruebas, dónde se colocaron, a quién se entregaron) se actualiza cada vez que cambia de manos.

La IA realiza aquí dos trabajos seguros: (1) genera plantillas de etiquetas de evidencia y cadena de custodia que se completarán durante la recolección; (2) organiza los hashes y las marcas de tiempo que recopiló para una verificación de coherencia (“¿son estos tres hashes iguales, qué imagen pertenece a qué dispositivo?”). La IA no calcula el hash en sí, sino que lo convierte en una herramienta forense; La IA sólo edita el registro.

Aceleración de reseñas: el verdadero poder de la IA

Una vez que se verifica la evidencia y se captura la imagen, la IA realmente brilla. Áreas típicas de aceleración:

  • Clasificación de archivos: Agrupar decenas de miles de archivos por tipo, contenido y posible relevancia y recomendar prioridades.
  • Resumen de texto y documento: extracción de sujeto y parte para contratos largos, correos electrónicos, transcripciones de chat.
  • OCR y contenido visual: extracción de texto de documentos escaneados (OCR: reconocimiento óptico de caracteres, conversión de texto en una imagen) y etiquetado de objetos/texto en imágenes.
  • Extracción de entidades (NER: reconocimiento de entidades nombradas, búsqueda de entidades nombradas como persona, institución, cuenta, IP a partir de texto): lista de personas, IBAN, teléfono, correo electrónico, dirección de billetera criptográfica de miles de documentos.
  • Descripción del código y del comando: explique en lenguaje sencillo qué hace un script encontrado o un historial de comandos (para ser verificado).

En cada uno, el resultado es un punto de partida; La decisión sobre la pertinencia y el valor probatorio corresponde al perito.

Atención: la IA que dice "este archivo es irrelevante" no es suficiente para eliminar ese archivo sin examinarlo. La clasificación reduce la prioridad, pero en casos críticos, el muestreo también se realiza del grupo de baja prioridad. Los falsos negativos (omitir evidencia real por considerarla “irrelevante”) son el error más costoso en informática forense.

tres mini casos

Caso 1: Documento confidencial con OCR. Una investigación de corrupción tenía 14.000 páginas escaneadas; Ninguno de ellos era texto con capacidad de búsqueda. Con OCR impulsado por IA, todas las páginas se transcribieron y se buscaron patrones como "offshore", el nombre de una empresa específica y el IBAN. 9 páginas críticas encontradas en 40 minutos; Leerlo a mano llevaría semanas. Luego, cada página fue verificada por expertos.

Caso 2: Red de relaciones de inferencia de entidades. Un archivo de fraude contenía 6.200 correos electrónicos. Con NER, se extrajeron todos los contactos, cuentas y teléfonos y se creó una lista de relaciones; Así surgieron dos cuentas de corretaje que antes habían pasado desapercibidas. La IA marcó la conexión; El fiscal confirmó la evidencia en los propios correos electrónicos.

Caso 3: Peligro de falsos negativos. Un equipo quería eliminar por completo un conjunto de 30.000 archivos que la IA denominó "bajo interés". El experto principal tomó una muestra aleatoria del 2% de este grupo y encontró un registro crítico en él: la IA había clasificado erróneamente el archivo debido a la extensión inusual. La disciplina de muestreo salvó el caso.

Cuatro plantillas copiables

1) Proyecto de plan de recaudación:

Su función: especialista en recolección forense de la escena del crimen. Escenario: [en PC, 2 teléfonos, 1 NAS, servidor en ejecución]. Describe un plan de recolección para mí en orden de volatilidad: qué recolectar para cada dispositivo, qué herramienta se recomienda, qué documentar. Tenga en cuenta que este es un borrador y requiere confirmación de acuerdo con la legislación local.

2) Plantilla de cadena de custodia:

Generarme una plantilla de formulario de cadena de custodia: incluya número de evidencia, descripción del dispositivo, número de serie, recolector, fecha/hora, método de recolección, hash (SHA-256), receptor, entregador, ubicación de almacenamiento y líneas para cada transferencia.

3) Solicitud de clasificación de archivos masivos:

Te daré una lista de archivos (nombre, tamaño, fecha, extensión). Agrupe por probabilidad alta/media/baja de interés forense y escriba JUSTIFICACIÓN. Nota: "bajo" no se elimina, solo se prioriza. Marque aquellos cuyo contenido de extensión no coincida por separado.

4) Explique el script encontrado:

Explique este historial de secuencias de comandos/comandos en un contexto forense: ¿qué hace, qué acceso a archivos/redes tiene, hay algún rastro de persistencia o filtración de datos? Vincula cada afirmación a una línea del guión. Si no está seguro, márquelo como "debe ser verificado".

Aviso débil / Aviso fuerte

Aviso débil:

Separe estos archivos según los importantes.

"Sustancial" no está definido; La IA examina sus propios supuestos y puede pasar por alto pruebas críticas.

Potente mensaje:

Su función: analista de triaje forense. Contexto: Estamos investigando un incidente de ransomware, cifrado y filtración de datos. Te daré una lista de archivos con nombre, tamaño, fecha de creación/modificación y extensión. Tarea: herramienta de cifrado, compresión/archivo, extensión inusual, cambios en las últimas 72 horas y marcar archivos de exportación grandes como de alta prioridad; Escribe la justificación de cada decisión. Si la extensión no coincide con el contenido esperado, avise también. No diga "eliminar/descartar" ningún archivo; solo prioriza.

El contexto, el objetivo y la restricción "no decir eliminar" hacen que el resultado sea útil y seguro.

Colección versus revisión: tabla de roles de la IA

etapa

¿Es segura la IA?

El trabajo de la IA

el trabajo del hombre

Recopilación de datos volátiles

No (decisión)

borrador del plan

Colección, documentación

adquisición de imágenes

no

plantilla

Bloqueador de escritura, hash

verificación de hash

no

orden de registro

Cálculo y confirmación vía vehículo

Clasificación de archivos

si

priorización

decisión, muestreo

OCR/extracción de texto

si

conversión

verificación de precisión

inferencia de entidad

si

Generación de lista

Decisión de relevancia

Errores comunes

  • Tratando de hacer que la IA "haga" la selección. La IA no suma; Sólo produce planos y plantillas. La imagen y el hash son obras humanas.
  • Confundir el resultado del triaje con una eliminación definitiva. No omita el muestreo del grupo de "bajo interés".
  • Citar la salida de OCR sin verificarla. OCR puede mezclar letras (0/0, 1/l); Confirmar valores críticos con la fuente.
  • Confiando ciegamente en la extensión. Es posible que se haya cambiado la extensión; Verifique el tipo de contenido.
  • Subir datos personales a un vehículo sin mascarilla. Los datos TC/IBAN/salud pueden filtrarse en forma de inferencia masiva.

En resumen

La recopilación de pruebas es una responsabilidad humana: el orden de la volatilidad, la imagen, el hash y la cadena de custodia están en manos humanas; Aquí la IA sólo produce planos y plantillas. Una vez que se verifica la evidencia y se captura la imagen, la IA agrega valor real para acelerar la revisión (clasificación, OCR, resumen, extracción de entidades, anotación de código). Pero cada salida es una señal que hay que verificar; La decisión sobre la pertinencia y el valor probatorio corresponde al perito, que también tiene en cuenta el riesgo de falsos negativos.

Tarea de aplicación

Describa un escenario de incidente ficticio (por ejemplo, se sospecha que un empleado está extrayendo datos). Primero dibuje un plano con la plantilla "Borrador de plan de recogida" y compárelo con el procedimiento local. Luego prepare una lista de archivos de muestra de 20 líneas y priorícela con la plantilla "Clasificación masiva de archivos"; Tome una muestra manual de al menos el 10 % y verifique la clasificación de la IA.

lista de verificación

  • [ ] Configuré el plan de cobranza en orden de volatilidad y lo comparé con el procedimiento.
  • [] Obtuve la imagen y el hash a través de humano/herramienta; No lo hice con IA.
  • [] Actualicé el formulario de Cadena de custodia cada vez que cambiaba de manos.
  • [] Tomé muestras del grupo "bajo" del resultado de clasificación.
  • [] Verifiqué el OCR y la salida de activos con la fuente; Oculté datos personales.