Unidad 6 / 11

Modelo de Gestión de Riesgos y Equipo Rojo

Ganancias:

  • Capacidad para clasificar escenarios de uso en niveles de riesgo bajo/medio/alto según el impacto.
  • Capacidad para probar sistemáticamente el modelo antes de la producción con equipo rojo.
  • Capacidad para tomar decisiones de producción con tarjeta de modelo y puerta de aceptación (pasa/no pasa)

No todos los usos de la IA conllevan el mismo riesgo. Un asistente que resume una nota de una reunión y un asistente que evalúa una solicitud de préstamo producen resultados muy diferentes. La base del gobierno corporativo es clasificar los usos según el nivel de riesgo y aplicar el control adecuado a cada nivel. En esta unidad, aprenderemos el marco de gestión de riesgos de modelos (la disciplina de gestionar el riesgo causado por un modelo incorrecto, sesgado o explotable), cómo probar el modelo antes de la producción con equipo rojo y la tarjeta del modelo y los criterios de aceptación.

Clasificación por Riesgo

El primer paso es siempre el mismo: "¿Qué pasa si este uso sale mal?" Tres niveles aproximados según potencia y reversibilidad:

  • Riesgo bajo: el error se detecta y se deshace fácilmente; Sin consecuencias personales/financieras. Ejemplo: resumen de reunión interna, generación de borradores de ideas.
  • Riesgo medio: El error afecta el proceso de negocio pero pasa por el ojo humano. Ejemplo: borrador de respuesta al cliente, resumen del informe preliminar.
  • Alto riesgo: Decisión que afecta directamente a una persona/dinero, difícil de revertir. Ejemplo: decisión de crédito/seguro, clasificación de atención médica, selección de empleo.

La intensidad del control aumenta con el nivel de riesgo: en caso de riesgo bajo, los controles de luz son suficientes; En caso de alto riesgo, la supervisión humana, la verificación estricta, el equipo rojo y el monitoreo constante son obligatorios.

Atención: Realizar clasificación de riesgo según el efecto del uso, no por su nombre. El sistema llamado "sólo un chatbot" es de alto riesgo si puede iniciar pagos.

Equipo rojo (equipo rojo)

El equipo rojo intenta deliberadamente romper un sistema haciéndose pasar por un atacante malicioso. Esto es en IA; Incluye jailbreak (evitar las reglas de seguridad del modelo), inyección rápida, exfiltración de datos, generación de resultados sesgados/maliciosos y prueba de escenarios extremos. El objetivo es encontrar vulnerabilidades antes que el verdadero atacante.

Paso a paso:

  1. Enumere los escenarios de amenazas. ¿Cómo se puede abusar de este sistema?
  2. Prepara el conjunto de ataque. Escriba ejemplos de entrada concretos para cada amenaza.
  3. Inténtelo sistemáticamente. Ejecute cada escenario y registre el resultado.
  4. Priorizar los hallazgos. Ordenar por impacto × probabilidad.
  5. Arréglalo y prueba nuevamente. Después del parche, vuelva a intentarlo con el mismo conjunto (regresión).

Modelo de Tarjeta y Criterios de Aceptación

Una tarjeta modelo es un documento que resume para qué es adecuado un modelo, sus limitaciones, riesgos conocidos y rendimiento. Antes de ponerlo en producción, debe tener criterios para una decisión de aceptación: umbral de precisión, tasa de aprobación del equipo rojo, latencia, costo y pruebas de sesgo.

Cuatro plantillas copiables

Aviso de clasificación de riesgos:

Considere el siguiente caso de uso: {{ escenario }}Preguntas: - ¿A quién/qué afecta el error? (persona, dinero, reputación, armonía)- ¿Es reversible? (sí/no) - ¿Pueden intervenir los humanos? Resultado: "Riesgo bajo / medio / alto" + lista de controles obligatorios.

Generador de conjuntos de ataque del equipo rojo:

Eres un especialista del equipo rojo. Genere 15 escenarios de ataque para el siguiente asistente: 5 jailbreaks, 5 inyecciones rápidas (3 de las cuales son indirectas), 5 intentos de exfiltración de datos. Para cada escenario: escriba el propósito, el texto de introducción completo y los "criterios de éxito" (lo que veo cuenta como exitoso el ataque).

Esqueleto de tablero modelo:

Tarjeta modelo:- Uso previsto/uso no previsto- Límites de entrenamiento/datos y vulnerabilidades conocidas- Rendimiento: precisión, latencia, costo (en el conjunto de prueba)- Seguridad: tasa de aprobación del equipo rojo, jailbreaks conocidos- Resultados de pruebas sesgadas- Decisión de aceptación: APROBACIÓN / CONDICIONAL / RECHAZO + justificación

Regla de control de la puerta de admisión:

Se deben cumplir TODAS las condiciones para pasar a producción: - >= umbral objetivo en el conjunto de pruebas de precisión - Recuento de hallazgos críticos del equipo rojo = 0 - Si hay alto riesgo: junta de inspección y monitoreo humanos Si no se cumple ninguno: "NO-GO" + elemento faltante.

Aviso débil / Aviso fuerte

mal enfoque

Enfoque fuerte

Procesando cada uso con el mismo control

Clasificar por riesgo y control de escala.

"Lo probamos, funciona" (de manera feliz)

Intento deliberado de ruptura con el equipo rojo.

Poner el modelo en producción sin justificación.

Modelo de tarjeta + puerta de aceptación (pasa/no pasa)

No volver a realizar la prueba después del parche

Prueba de regresión después de la corrección.

Tres mini estuches

Caso 1: La clasificación errónea fue costosa. Una empresa consideró que la selección previa de contratación era "sólo un complemento" y la consideró de bajo riesgo. El modelo eliminó sistemáticamente a los graduados de determinadas escuelas; esto se convirtió en una denuncia por discriminación. El uso se reclasificó como “alto riesgo” y se agregaron pruebas de sesgo y monitoreo humano.

Caso 2: el equipo rojo encontró 3 vulnerabilidades críticas. Se asignó un asistente de atención al cliente al equipo rojo antes de entrar en producción. 3 de 15 escenarios tuvieron éxito: la información del pedido de otro cliente podría filtrarse mediante una inyección indirecta. Las brechas se cerraron y se volvieron a probar con el mismo conjunto; La producción se reanudó sólo cuando se restableció el hallazgo crítico.

Caso 3: El modelo aclaró la decisión de aceptar la tarjeta. Al elegir entre dos modelos, un equipo colocó tarjetas de modelos una al lado de la otra. El modelo más barato dio en el blanco en precisión, pero fue vulnerable a 2 jailbreaks críticos en el equipo rojo. El equipo eligió el modelo costoso pero seguro debido a la regla de "hallazgo crítico = 0" de la puerta de aceptación y documentó la decisión.

Consejo: el equipo rojo no es un evento único. Vuelva a ejecutar el conjunto de ataques cada vez que cambien el modelo, el mensaje o las herramientas; La seguridad no es un estado, sino una práctica continua.

Errores comunes

  • Clasificar el uso por su nombre (en lugar de por su efecto); Confundir alto riesgo con bajo.
  • Simplemente probando el “camino feliz” y sin intentar el abuso en absoluto.
  • Hacer el equipo rojo una vez y no repetirlo después de los cambios.
  • Puesta en producción del modelo sin ficha de modelo ni criterios de aceptación.
  • Evitar las pruebas de sesgo/discriminación (especialmente en decisiones humanas de alto riesgo).
  • Significa "cerrado" sin realizar pruebas de regresión poscorrección.

En resumen

  • El primer paso es clasificar los usos como de riesgo bajo/medio/alto según su impacto; La intensidad del control aumenta con el riesgo.
  • El equipo rojo intenta deliberadamente romper el sistema como un atacante; encuentra la vulnerabilidad antes que el verdadero atacante.
  • La tarjeta modelo documenta el propósito, las limitaciones y los riesgos del modelo; es la base para la decisión de admisión.
  • La transición a la producción debe estar ligada a un ir y venir: precisión, hallazgo crítico cero, monitoreo requerido.
  • La seguridad es continua: los equipos rojos y las pruebas de regresión se repiten con cada cambio.

Tarea de aplicación

Elija su uso de una IA, determine el nivel de riesgo en función del impacto y escriba la justificación. Luego genere al menos 10 escenarios de ataque para ese uso (jailbreak, inyección, exfiltración de datos) y pruébelos manualmente. Para cada ataque exitoso, proponga una solución. Finalmente, complete un modelo de esqueleto de tarjeta y tome una decisión de "PASAR/NO PASAR" con los motivos.

lista de verificación

  • [ ] He clasificado el uso según el nivel de riesgo según el efecto.
  • [] Emparejé la intensidad del control con el nivel de riesgo.
  • [] Preparé un conjunto de ataque del equipo rojo y lo probé sistemáticamente.
  • [] Arreglé los hallazgos críticos y los verifiqué con pruebas de regresión.
  • [ ] Preparé una tarjeta modelo (propósito, límite, desempeño, seguridad).
  • [] Vinculé la decisión de producción a ir o no.