Ganancias:
- Capacidad para establecer capas de validación de salida basadas en esquemas y reglas.
- Capacidad para requerir de manera significativa la participación humana en decisiones de alto impacto
- Capacidad para diseñar enrutamiento basado en umbrales de confianza y verificación con el segundo modelo.
Un modelo de lenguaje produce fluidez, persuasión y, a menudo, precisión, pero "persuasivo" no es lo mismo que "correcto". El modelo puede ajustar silenciosamente una cantidad, una fecha o un campo JSON; Esto se llama alucinación (el modelo produce con seguridad información que no existe en la realidad). En un sistema empresarial, si ese resultado pasa al siguiente paso (un pago, un correo electrónico, una escritura en la base de datos), el error se extiende al mundo real. En esta unidad, aprenderemos a filtrar la salida con capas de verificación antes de que ingrese al sistema y a requerir la intervención humana en decisiones de alto impacto.
¿Por qué se requiere la validación de resultados?
La salida del modelo se puede dañar de dos maneras principales: formato (no se ajusta al esquema JSON esperado, falta o sobra campo) y contenido (el formato es correcto pero el valor es incorrecto: un código de producto inexistente, una fecha ilógica). Existe una tercera dimensión en términos de seguridad: salida maliciosa (un comando malicioso producido como resultado de una inyección o filtración). Un sólido sistema detiene a los tres en la puerta.
Precaución: "El modelo es generalmente preciso" no es un criterio de producción. En un sistema sin verificación, incluso un error entre mil significa 100 transacciones erróneas por día en 100.000 solicitudes por día.
Capas de autenticación: paso a paso
- Validación de esquemas. Verifique con la máquina que la salida se ajuste a la estructura esperada: ¿están presentes los campos, son correctos sus tipos, están completos los campos obligatorios?
- Validación de reglas/lógica de negocios. ¿Los valores coinciden con las reglas de negocio? (Cantidad > 0, la fecha no es futura, el código de producto pertenece al catálogo).
- Control de referencia/fuente. Si el modelo produce una afirmación, ¿se puede vincular a la fuente? (¿Está realmente la cita de RAG en el documento?)
- Validación con el segundo modelo (LLM-as-juez). Un modelo independiente evalúa el resultado como "correcto/incompleto/arriesgado".
- Umbral de confianza y orientación. Si el modelo o validador informa baja confianza, el resultado no pasa automáticamente; está dirigido a humanos.
- Control humano. Un resultado de alta potencia o baja seguridad depende de la aprobación de un experto.
Cuatro plantillas copiables
Esquema + "invéntalo si no lo sabes" juntos:
Devuelva la respuesta SÓLO en el siguiente esquema JSON: Escriba "bajo". NUNCA escriba una estimación como si fuera exacta.
Verificación con el segundo modelo (indicador de juez):
Eres un validador independiente. A continuación se muestra un texto <fuente> y un <reclamo>. Verifique si CADA número y fecha en el reclamo aparecen palabra por palabra en la fuente. Para cada uno, diga: "verificado | no en la fuente | contradice la fuente". Si incluso uno de ellos está "ausente/en conflicto", marque el resultado como "SE REQUIERE REVISIÓN HUMANA".<source>{{ text }}</source><claim>{{ model_output }}</claim>
Regla de enrutamiento de umbral de confianza:
Regla de enrutamiento: - emin_misin = "alto" Y monto < 10 000 TL -> procesamiento automático - emin_misin = "medio" O monto 10 000-100 000 TL -> segunda verificación del modelo - emin_misin = "bajo" O monto > 100 000 TL -> se requiere aprobación humana
Tarjeta de resumen de auditoría humana (acelera la revisión):
Al presentar la decisión a una persona, presente esta tarjeta:- ¿Qué se propone? (una frase)- ¿En qué fuente se basa? (referencia de artículo/documento) - ¿Cuáles son los 2 supuestos más débiles? - Si se aprueban, ¿se pueden revertir? (sí/no)
Aviso débil / Aviso fuerte
mal enfoque
Enfoque fuerte
"Restar importe de la factura" (texto libre)
Esquema JSON estricto + nulo + campo de confianza
Escribir el resultado directamente en el sistema de pago.
Esquema → regla → aprobación humana (si es necesario)
Simplemente diciéndole al modelo "asegúrate"
Validación de número/fecha con segundo modelo
Procesar cada resultado con la misma confianza
Enrutamiento basado en la influencia y la confianza
El enfoque fuerte no espera que el modelo sea correcto; Crea una puerta que te atrapará cuando te equivoques.
Tres mini estuches
Caso 1: El plan por sí solo no fue suficiente. Una automatización contable extraía el importe de las facturas como JSON. El esquema era correcto, pero el modelo produjo "125.000" en lugar de "1.250,00" en una factura (desplazamiento decimal). El plan no logró captar esto; Se detectó la verificación de la regla ("el importe debe coincidir con el total de los artículos de la factura en un ±1%") y se evitó el registro incorrecto de 112.500 TL.
Caso 2: El segundo modelo capturó la alucinación. “Aviso de terminación con 30 días de anticipación”, dijo un asistente de apoyo legal en el resumen del contrato; Sin embargo, en el contrato era de 90 días. Cuando el juez independiente marcó el modelo como "en conflicto con la fuente", el resultado fue enviado al humano y corregido. Si fuera automático, el cliente notificaría la cancelación por fecha equivocada.
Caso 3: El enrutamiento redujo la carga en un 70%. Un sistema de reclamaciones de seguros aprobaba automáticamente las reclamaciones de importe bajo y de alta seguridad y enviaba al experto sólo las que superaban el umbral o eran de baja seguridad. De las 3.200 demandas diarias, sólo 950 recayeron en humanos; Los expertos dedicaron su tiempo al 30% verdaderamente riesgoso, y el tiempo promedio de transacción cayó de 4 horas a 40 minutos.
Consejo: No establezca el control humano de modo que "la gente pueda verlo todo"; esto cansará a la gente y la aprobación se convertirá en un sello de goma. En su lugar, dirija únicamente los resultados de alto impacto y baja confianza al ser humano; Esto centra la atención en lo que realmente importa.
Hacer que el control humano sea significativo
Human-in-the-loop no se trata de poner una casilla de verificación en un papel. El revisor debe tener (1) el contexto para comprender la decisión, (2) acceso a la fuente y (3) la autoridad para decir "no". De lo contrario, el control sigue siendo cosmético. La tarjeta de revisión (cuarta plantilla anterior) está destinada a proporcionar precisamente ese contexto.
Errores comunes
- Simplemente validando el esquema y omitiendo errores de contenido/valor.
- Pensar que al decirle al modelo "asegúrate" estás haciendo una verificación real.
- Implementar automáticamente decisiones irreversibles y de alto impacto.
- Poner control humano en cada resultado y convertir la aprobación en un sello de goma sin sentido.
- Decir "aprobar" al revisor sin dar la fuente y el contexto.
- Procesar todas las salidas con el mismo riesgo sin establecer un umbral de confianza ni un enrutamiento.
En resumen
- El resultado se corrompe de tres maneras: forma, contenido e intención maliciosa; un sólido sistema detiene a los tres en la puerta.
- Capas: validación de esquema, lógica de reglas/negocios, control de fuente, segundo modelo (LLM-as-juez) y enrutamiento de umbral de confianza.
- La intervención humana debería ser obligatoria para resultados de alto impacto y baja seguridad.
- La revisión humana debe ser significativa: el revisor debe tener contexto, acceso a recursos y autoridad para decir "no".
- Tanto la seguridad como la eficiencia se obtienen dirigiendo sólo los riesgosos a los humanos, no todos los resultados.
Tarea de aplicación
Tome un ejemplo de su propia salida de IA. Primero defina un esquema JSON y fuerce la salida. Luego escriba al menos dos reglas comerciales (por ejemplo, "la cantidad coincide con el total de artículos"). Finalmente, configure una tabla de enrutamiento: ¿qué combinación de confianza/influencia va automáticamente, cuál va al segundo modelo, cuál va al humano? Genere una muestra defectuosa y observe dónde la captura cada capa.
lista de verificación
- [] Defino un esquema estricto para la salida y lo verifico con la máquina.
- [] Agregué al menos una validación de reglas/negocios (lógica de valor).
- [] Puedo vincular las afirmaciones a la fuente y verificarlas.
- [ ] Segundo modelo o validación humana disponible para resultados de alto impacto/baja seguridad.
- [] Regla de enrutamiento definida en función de la confianza y la influencia.
- [] El revisor recibe contexto, fuente y autoridad para rechazar.