Unidad 4 / 11

Indicadores del sistema y parámetros del modelo

Ganancias:

  • Puede diseñar cómo el mensaje del sistema guía al modelo a lo largo de toda la conversación.
  • Entiende el papel y el impacto en los costos del pensamiento adaptativo y los parámetros de esfuerzo.
  • implementa controles de salida como max_tokens, secuencias de parada y salida estructurada

Dos productos diferentes del mismo modelo pueden comportarse de forma completamente diferente. La diferencia no está en el modelo en sí, sino en el mensaje del sistema y los parámetros que se le asignan. El mensaje del sistema es el "contrato de trabajo" del modelo y los parámetros son "configuraciones de trabajo". En esta unidad, aprenderá cómo diseñar un potente sistema de indicaciones, qué hacen las configuraciones de pensamiento y esfuerzo en los modelos modernos y cómo controlar la salida en cuanto a formato/longitud. Establecer estas configuraciones correctamente le permite administrar tanto la calidad como el costo al mismo tiempo.

Aviso del sistema: directiva permanente del modelo

El mensaje del sistema es la instrucción de alto nivel que se aplica a lo largo de toda la conversación. Estas reglas siguen siendo válidas sin importar lo que escriba el usuario. Un buen aviso del sistema incluye los siguientes componentes:

  1. Rol/identidad: ¿Quién es el modelo? ("Usted es un asistente de soporte corporativo").
  2. Alcance y límites: ¿Qué hace y qué no hace? (“Basado únicamente en el documento de política proporcionado”).
  3. Reglas de formato: ¿Cómo debería verse el resultado? ("Máximo 3 artículos, idioma oficial.")
  4. Comportamiento en incertidumbre: ¿Qué hacer cuando uno no está seguro? ("Si no hay información, invéntela, diríjala a la unidad correspondiente").
  5. Seguridad/privacidad: ¿Qué no quiere/no quiere? ("Solicitar datos personales.")
Consejo: Mantenga fijo el mensaje del sistema. No incorpore información que cambie con cada solicitud (fecha actual, nombre de usuario, ID de sesión). Esto rompe la coherencia e invalida el caché de avisos en la unidad 6. Coloque la información de la variable en el mensaje del usuario.

La trampa de la instrucción demasiado agresiva

Los modelos modernos siguen las instrucciones muy de cerca. Frases agresivas como "DEBE", "SIEMPRE", "DEFINITIVAMENTE hacer esto", etc., que funcionaban en modelos más antiguos, hoy conducen a una activación excesiva: el modelo llama a un agente cuando no es necesario o se ejecuta durante un tiempo innecesariamente largo. Suaviza la regla: en lugar de "DEBE usar la herramienta de búsqueda", "Si la respuesta no está en la conversación, usa la herramienta de búsqueda" es más preciso.

Parámetros del modelo: pensamiento y esfuerzo

Los LLM clásicos tenían un parámetro de temperatura: un valor más bajo producía resultados más específicos/consistentes, un valor más alto producía resultados más variados/creativos. Los modelos de generación moderna (como Opus 4.8, Sonnet 5) reemplazan este enfoque con dos mecanismos más potentes y ya no aceptan parámetros de muestreo como la temperatura.

  • Pensamiento adaptativo: el modelo razona paso a paso en su "cabeza" antes de responder. El modelo decide cuánto pensar en función de la dificultad de la tarea. Mejora significativamente la precisión en problemas complejos de varios pasos; Piensa menos para evitar demoras innecesarias en cuestiones sencillas.
  • Esfuerzo: Perilla de alto nivel que ajusta qué tan profundamente el modelo se sumerge en una tarea y cuántas fichas gasta en total. Niveles típicos: bajo, medio, alto y superior. Un gran esfuerzo puede mejorar la calidad, pero también aumenta la demora y el costo; El bajo esfuerzo aporta rapidez y ahorro.

Configuración

¿Qué hace?

cuando

Pensar fuera/bajo esfuerzo

Rápido, barato, superficial.

Clasificación simple, respuesta corta, tareas sensibles al retraso.

Pensamiento adaptativo + esfuerzo medio

Equilibrio calidad/coste

La mayoría de las tareas de propósito general

Pensamiento adaptativo + alto esfuerzo

máxima precisión

Razonamiento complejo, codificación, trabajo de agentes a largo plazo.

Precaución: El reflejo de "esfuerzo máximo pase lo que pase" infla los costos. Ajustar el esfuerzo a la tarea; En tareas sencillas, un poco esfuerzo suele dar el mismo resultado preciso a un precio mucho más económico. Vaya alto donde se necesita precisión crítica.

Control de salida: formato, longitud, estructura

Además de los parámetros, también controlas la salida misma:

  • max_tokens: Techo rígido de la salida (1.ª y 3.ª unidad).
  • Detener secuencias: detener el modelo cuando ve una determinada cadena. Útil para establecer puntos de interrupción en producción estructurada.
  • Salida estructurada: fuerce la respuesta del modelo para que se ajuste a un esquema JSON que usted proporcione. Garantiza que la salida sea analizable y válida mediante programación. Es más confiable que decir "simplemente devuelva JSON" con un mensaje.

{ "output_config": { "format": { "type": "json_schema", "schema": { "type": "object", "additionalProperties": false, "properties": { "category": { "type": "string", "enum": ["invoice", "technical", "return", "other"] }, "ugency": { "type": "string", "enum": ["low", "medium", "high"] } }, "requerido": ["categoría", "urgencia"] } } }}

Plantillas de avisos del sistema copiables

# Asistente de soporte corporativo Usted es un asistente de soporte corporativo. - Confíe únicamente en el documento de política proporcionado; Si no está en el documento, diga "No tengo esta información". - Dar una respuesta formal y clara en un máximo de 3 frases. - Solicitar datos personales (número de identificación TC, número de tarjeta) y no repetirlos en su respuesta. - Si no estás seguro, no adivines.

# Clasificador de forzado de salida estructurada. Eres un clasificador de demanda. La entrada es un mensaje de cliente. Devuelve sólo los campos solicitados, no escribas comentarios. Si no está seguro, utilice "otro".

# Analista con comportamiento definido de estar en incertidumbre. Eres analista de datos. Saque sólo inferencias verificables de la tabla proporcionada. Nunca saques una conclusión que no exista en los datos. Si una inferencia no está clara, escriba "datos insuficientes".

# Redactor de contenido con control de tono y duración. Eres un redactor de contenido. Utilice un tono cálido pero profesional. Limite cada texto a 120 palabras o menos. Evite el lenguaje cliché de marketing.

Aviso débil / Aviso fuerte

# DÉBIL Sea útil y dé buenas respuestas. Haz tu mejor esfuerzo.

# STRONGRole: Especialista en soporte técnico. Alcance: Se proporciona únicamente la guía del producto. Formato: Paso a paso, lista numerada, 5 pasos como máximo. Límite: Solución recomendada que no está en la guía; Diga "No pude encontrarlo en el manual". Privacidad: No repetir el número de serie compartido por el usuario en la respuesta.

Versión potente; Determina por separado la función, el alcance, el formato, los límites y la confidencialidad. La coherencia del resultado proviene directamente de esta claridad.

Tres mini estuches

Caso 1: Reducción de costos mediante ajuste del esfuerzo. Un equipo estaba ejecutando todas sus llamadas con gran esfuerzo + pensamiento; Incluso los resúmenes de correo electrónico simples eran costosos y lentos de producir. Asignaron tareas simples como resúmenes a bajo esfuerzo y análisis de contratos a alto esfuerzo. Se mantuvo la precisión, la latencia promedio se redujo a la mitad y el costo mensual se redujo en un tercio.

Caso 2: garantía JSON. Un equipo de operaciones solicitó el resultado de la clasificación con un mensaje que decía "solo proporcione JSON", pero el modelo ocasionalmente escribía "Aquí está el resultado:" y el analizador fallaba. Cuando conecté el esquema de salida configurado, la salida devolvió JSON válido cada vez; Los errores de análisis se han restablecido.

Caso 3: retroceso rápido y agresivo. Un mensaje del asistente decía: "DEBE buscar CADA PREGUNTA"; El modelo realizó búsquedas innecesarias incluso de preguntas sencillas cuya respuesta ya conocía, lo que ralentizó y aumentó los costos. Flexibilizaron la regla a "Si la respuesta no está en contexto, busca"; Las llamadas innecesarias disminuyeron en un 70% y las respuestas se aceleraron.

Errores comunes

  • Incrustar datos variables en el indicador del sistema: rompe la coherencia e invalida el caché.
  • Instrucción demasiado agresiva: Activación excesiva y coste innecesario en los modelos modernos.
  • Alto esfuerzo en cada tarea: Desperdicio en tareas sencillas; ajustar el esfuerzo a la tarea.
  • Solicitar JSON solo mediante mensaje: se rompe ocasionalmente; si es crítico, utilice resultados estructurados.
  • No definir límite/comportamiento de ambigüedad: el modelo llena el vacío con fabricación (alucinación).
  • Viejo hábito de la "temperatura": los modelos modernos no aceptan esto; Guíe el comportamiento con prontitud y esfuerzo.

Más profundo: escribir el mensaje como un contrato

Los equipos experimentados tratan el sistema como un contrato, no como un texto literario: cláusulas claras, reglas mensurables, límites inequívocos. Este enfoque tiene tres beneficios concretos. La primera es la coherencia: la misma entrada produce resultados similares en diferentes momentos. En segundo lugar está la capacidad de prueba: puede probar cada elemento por separado con una muestra. En tercer lugar está la facilidad de mantenimiento: si un comportamiento es incorrecto, sabes qué elemento reemplazar.

Una buena práctica es liderar con ejemplos positivos. En lugar de proporcionar una lista de "no hacer esto", es mucho más eficaz en los modelos modernos proporcionar un ejemplo que diga "así es exactamente como se ve el resultado deseado". Por ejemplo, en un clasificador, agregar una o dos muestras del JSON esperado al mensaje reduce significativamente los errores de formato.

Otra técnica poderosa es escribir explícitamente el comportamiento de incertidumbre. Una cláusula como "Si no está seguro, no adivine; diga 'datos insuficientes'" suprime la tendencia del modelo a llenar el espacio en blanco con mentiras (alucinaciones). Esta única frase descarga la capa de verificación, que cubriremos en la unidad 11: una vez que el modelo ya ha señalado la incertidumbre, resulta más fácil conducir a la validación humana.

Finalmente, consideren el esfuerzo y la insistencia juntos. Con un esfuerzo elevado, el modelo explora más y, a veces, realiza “trabajo extra” no deseado (explicaciones innecesarias, sugerencias adicionales). Decir "solo proporcione el resultado deseado, no agregue comentarios adicionales" en el mensaje compensa este efecto secundario del gran esfuerzo.

En resumen

El indicador del sistema es la directiva permanente del modelo: define la función, el alcance, el formato, el comportamiento de oscuridad y la confidencialidad. En los modelos modernos, el comportamiento está impulsado por el pensamiento adaptativo y los parámetros de esfuerzo más que por la temperatura; Alinear el esfuerzo con la tarea gestiona la calidad y el costo simultáneamente. La salida se asegura con max_tokens, matrices de parada y salida estructurada.

Tarea de aplicación

Elige una tarea. (1) Escriba un mensaje del sistema con cinco componentes (función, alcance, formato, ambigüedad, confidencialidad). (2) Indique qué nivel de esfuerzo elegiría para esta tarea y por qué. (3) Si el resultado debe estar estructurado, esboce un pequeño esquema JSON. (4) Verifique si hay un patrón demasiado agresivo en su mensaje y suavicéelo.

lista de verificación

  • [] Puedo nombrar cinco componentes de un buen aviso del sistema.
  • [ ] Puedo explicar qué hacen los parámetros de esfuerzo y pensamiento adaptativo.
  • [ ] Puedo equilibrar calidad/costo ajustando el esfuerzo según la tarea.
  • [] Sé por qué la salida estructurada es más segura que solicitar JSON mediante un mensaje.
  • [ ] Puedo reconocer el riesgo en los modelos modernos de instrucciones demasiado agresivas.