Unidad 5 / 11

Selección de modelo: el modelo adecuado para el trabajo adecuado

Ganancias:

  • Puede comparar familias de modelos (rápidos/equilibrados/potentes) en cuanto a capacidad, velocidad y costo
  • Diseña estrategias de selección y enrutamiento de modelos según la complejidad de la tarea.
  • Basa la selección del modelo en evidencia con un pequeño conjunto de evaluaciones.

La única decisión que determina el máximo rendimiento de su inversión y la calidad en la integración de LLM es qué modelo utiliza. El reflejo común es “elegir el modelo más fuerte”; Sin embargo, esto a menudo implica costes y retrasos innecesarios. El enfoque correcto es elegir el modelo más liviano que cumpla cada tarea y basar esa elección en mediciones, no en conjeturas. En esta unidad, comparará la familia de modelos en el eje capacidad/velocidad/costo, establecerá una estrategia de enrutamiento del modelo según la complejidad de la tarea y evidenciará la selección con un pequeño conjunto de evaluaciones.

Comprender la familia modelo

Los proveedores generalmente ofrecen tres clases: rápido/barato, estable y potente. La relación entre ellos se resume en tres ejes: capacidad (poder para resolver tareas difíciles), velocidad (latencia), costo (precio simbólico).

clase

ejemplo

talento

velocidad

Costo

Tareas disponibles

rapido

Haikú 4.5

medio

muy alto

bajo

Clasificación, etiquetado, breve resumen, orientación.

equilibrado

soneto 5

alto

alto

medio

Propósito general, codificación, flujo de varios pasos, la mayoría del trabajo de agente

fuerte

Obra 4.8

más alto

medio

alto

Razonamiento complejo, tareas autónomas de largo alcance, análisis difíciles.

Idea crítica: el modelo más potente no funciona mejor en todos los trabajos. En un simple etiquetado de "urgente o no", el modelo fuerte y el modelo rápido dan la misma respuesta correcta; la única diferencia es que el potente es 5 veces más caro y más lento. El talento extra produce valor sólo cuando la misión lo requiere.

Paso a paso: ¿Cómo elegir un modelo?

  1. Clasifica la tarea. ¿Es rutinario/modelado (etiquetado, inferencia) o abierto/de múltiples pasos (análisis, planificación, código)?
  2. Comience con el candidato más ligero. Pruébalo con el modelo rápido. Si eso es suficiente, detente.
  3. Si no es suficiente, asciende a una clase superior. Si la precisión es baja, ve al equilibrado, si eso no es suficiente, ve al fuerte.
  4. Mide, no adivines. Compare la precisión y el costo de cada candidato con un pequeño conjunto de evaluaciones (a continuación).
  5. Configurar la redirección. En lugar de conectarse a un solo modelo, distribuya la tarea al modelo correcto con un "enrutador".

Modelo de enrutamiento

Las cargas de trabajo reales son variadas: la mayoría de las solicitudes entrantes son simples, algunas son difíciles. Es un desperdicio enviarlos a todos al modelo poderoso; Enviarlos a todos al modelo rápido reduce la calidad. El enrutamiento resuelve esto: un modelo económico (o una regla simple) clasifica la tarea primero y luego el trabajo pasa al modelo apropiado.

# Aviso del enrutador (funciona con el modelo económico) Clasifica la solicitud entrante según su dificultad. Devuelve solo el siguiente JSON:{"dificultad": "simple|complejo"}Simple: de un solo paso, formulado, de respuesta corta. Complejo: requiere razonamiento de varios pasos, análisis o generación larga. Solicitud: """{{request}}"""

  • vaya al modelo simple → rápido (barato, rápido).
  • vaya al modelo complejo → poderoso (caro pero necesario).

Este patrón reduce significativamente el costo promedio porque la mayor parte del tráfico es generalmente simple.

Consejo: una decisión de recomendación no siempre requiere un LLM. Reglas simples como "Ir al modelo rápido si el texto tiene menos de 20 palabras" también son una guía y no generan ningún costo simbólico adicional. Pruebe la regla primero.

Vincular la elección con la evidencia: el pequeño grupo de evaluación

No elijas un modelo basándose en "me queda mejor". Eval (conjunto de evaluación) es un pequeño conjunto de muestras para las cuales se conoce la respuesta correcta; ejecuta cada modelo en este conjunto y mide la precisión, el costo y la latencia.

# Plantilla de configuración de evaluación1) Recopile entre 20 y 50 ejemplos reales, escriba a mano la "respuesta correcta" en cada uno.2) Ejecute cada modelo (rápido/equilibrado/fuerte) en este conjunto.3) Para cada modelo: número de correcciones, tokens de rendimiento promedio, costo por solicitud, tiempo promedio.4) Elija el modelo que "ofrezca suficiente precisión y sea más económico".

# Tabla de comparación de evaluaciones (relleno) Modelo | Precisión | Costo por solicitud | Duración mediaHaiku | ...% | ... $ | ... snSoneto | ...% | ... $ | ... snOpus | ...% | ... $ | ...segundo

Aviso débil / Aviso fuerte (decisión de selección de modelo)

# DÉBIL (sin base para tomar una decisión) Usemos el mejor modelo, el presupuesto no es importante.

# FUERTE (decisión basada en la medición) En una evaluación de 50 muestras, Haiku dio un 96 % de precisión, Sonnet dio un 97 % de precisión; La diferencia es estadísticamente insignificante. Se eligió el haiku porque es 5 veces más barato y 2 veces más rápido. Si la precisión cae por debajo del 95%, la decisión de actualizar a Sonnet se tomará automáticamente.

Versión potente; vincula la selección a un número, un umbral y una regla de escalada. Esto defiende la decisión de hoy y gestiona el cambio futuro.

Tres mini estuches

Caso 1: Escape del modelo abrumador. Un call center producía todos los resúmenes de las conversaciones con Opus; la factura mensual era alta. En una evaluación de 40 muestras, Sonnet estaba un 1% por detrás de Opus en precisión, pero costaba un tercio. Trasladaron la obra resumida al Soneto; El costo mensual cayó de $9,000 a $3,100, sin quejas de calidad.

Caso 2: Tráfico mixto con redireccionamiento. El 80% de las solicitudes de un equipo de tecnología legal fueron simples etiquetado de documentos, el 20% fueron análisis de contratos complejos. Los estaban enviando a todos al poderoso modelo. Agregaron un enrutador barato y distribuyeron trabajos simples a Haiku y trabajos complejos a Opus; El costo promedio de las solicitudes se redujo en un 64 %, mientras que la calidad del análisis se mantuvo.

Caso 3: El costo de reducir el tamaño sin medir. Para reducir costos, un equipo redujo la extracción de códigos médicos complejos directamente al modelo rápido; No evaluaron. En vivo, la precisión cayó del 92% al 78%, lo que resultó en un retorno de inferencias incorrectas. Primero tenían que evaluar: esa tarea requería un modelo poderoso. Lección: tanto la reducción como la elevación se realizan mediante medición.

Errores comunes

  • El reflejo del “modelo más fuerte”: desperdicio y retraso innecesario en tareas simples.
  • Cambiar el modelo sin medir: Tanto la reducción como la ampliación son riesgosas sin evaluación.
  • Bloquear en un solo modelo: el enrutamiento en tráfico mixto suele ser más eficiente.
  • Confundir siempre el enrutador con LLM: las reglas simples pueden funcionar sin costo alguno.
  • No establecer un umbral de impulso: lo que sucede si la precisión disminuye debe definirse de antemano.
  • No corregir la versión del modelo: registre en qué modelo/versión está trabajando en producción; El cambio de versión puede cambiar el comportamiento.

Más profundo: evaluación perpetua y prueba incremental

La selección del modelo no es una decisión única. Los proveedores introducen nuevos modelos, los precios cambian, la descripción de su trabajo evoluciona. Configure el clúster de evaluación una vez y no lo olvide; sosténgalo como un ser vivo. Cuando sale un nuevo modelo, analiza las mismas entre 20 y 50 muestras, actualiza la tabla y toma una decisión nuevamente. Esto lo protege de la trampa de la “intuición de cambio de patrón”.

La segunda técnica avanzada es el patrón de retroceso/cascada. Primero le das la tarea al modelo barato; Si el resultado tiene poca confianza o la capa de verificación (unidad 11) lo rechaza, escala la misma solicitud. Por lo tanto, la mayor parte del tráfico se resuelve en el modelo barato, y sólo la minoría restante se dirige al modelo caro. Esto es más barato y más duradero que el enfoque de modelo único fijo.

El tercer punto es que la evaluación incluye no solo la precisión sino también el costo y la latencia. Si un modelo es un 1% más preciso pero 3 veces más caro y 2 veces más lento, la compensación no vale la pena para la mayoría de los trabajos. Tome la decisión según tres ejes (precisión, costo, latencia) y defina un “umbral de suficiencia”: “si la precisión es superior al 95%, elija el más barato”.

Finalmente, registre qué modelo/versión utilizó en producción. Si algún día la calidad de salida cambia, lo primero que mirará es si la versión del modelo ha cambiado. La trazabilidad de versiones agiliza la búsqueda de la causa raíz de los problemas de calidad.

Una advertencia más: el clúster de evaluación debe representar su carga de trabajo real. Una evaluación que consta únicamente de ejemplos sencillos oculta dónde tropieza el modelo en casos difíciles y le infunde una falsa confianza. Una buena evaluación; Incluye ejemplos sencillos y comunes, así como casos extremos que encontrará en la realidad (entradas ambiguas, incompletas y contradictorias). Esta minoría difícil determina su elección de modelo, porque de todos modos cada modelo tiene éxito en la mayoría fácil. Mantenga su Eval actualizado y representativo alimentándolo periódicamente con nuevos ejemplos reales.

En resumen

El modelo correcto es el modelo más liviano que hace el trabajo; Más potente no es mejor en todos los trabajos, simplemente es más caro y más lento. Clasificar la tarea y comenzar desde el candidato más ligero, distribuir el tráfico mixto con enrutamiento y fundamentar la selección con un pequeño conjunto de evaluaciones reduce el costo muchas veces manteniendo la calidad.

Tarea de aplicación

Elija una carga de trabajo. (1) Clasifique la tarea como simple/compleja. (2) Diseñar un pequeño conjunto de evaluación de 20 ejemplos reales (con sus respuestas correctas). (3) Elaborar un plan para completar la tabla de comparación de precisión/costo/tiempo para las tres clases de modelos. (4) Si tiene tráfico mixto, escriba una regla de enrutamiento y establezca un umbral de escalada.

lista de verificación

  • [ ] Puedo comparar la familia de modelos en el eje capacidad/velocidad/costo.
  • [] Puedo aplicar el principio del "modelo exitoso más ligero".
  • [] Puedo configurar el enrutamiento del modelo según la complejidad de la tarea.
  • [] Con un pequeño conjunto de evaluación puedo vincular la selección a la evidencia.
  • [] Puedo definir un umbral de mejora/degradación.