Unidad 6 / 11

Bases de ajuste: cuándo, cómo y con qué riesgo

Ganancias:

  • Capacidad para distinguir si un problema es información o comportamiento y evaluar el ajuste fino para problemas de comportamiento solo después de que se agoten las indicaciones, los pocos disparos y el RAG.
  • Comprender los métodos de ajuste (SFT, LoRA/PEFT, RLHF) y los atributos de los datos que determinan la calidad (coherencia, diversidad, confidencialidad)
  • Capacidad para medir el verdadero valor del ajuste con pruebas de evaluación antes y después, sobreaprendizaje y olvido catastrófico.

El ajuste fino (personalizar su comportamiento entrenando más un modelo previamente entrenado con sus propios datos) es una herramienta poderosa pero costosa en el arsenal del ingeniero que trabaja con LLM. Cuando se utiliza en el lugar equivocado, es una pérdida de dinero y tiempo, pero cuando se utiliza en el lugar correcto, proporciona una calidad que no se puede lograr de otra manera. En esta unidad, cubrimos cuándo es necesario realizar ajustes, sus métodos básicos y sus riesgos. El objetivo es que usted tome decisiones.

Primero la pregunta correcta: ¿es necesario un ajuste fino?

El error más caro de los principiantes es apresurarse inmediatamente a perfeccionar un problema que puede resolverse. Configura el orden así:

  1. Ingeniería rápida: una buena indicación que explique claramente la tarea resuelve la mayoría de los problemas. Consume aquí primero.
  2. Aprendizaje en pocas oportunidades: poner algunos ejemplos en el mensaje muestra al modelo el formato y el comportamiento deseados.
  3. RAG: Si el problema es "falta de información" (necesidad de datos que el modelo desconoce), la solución es RAG (unidad 4), no ajuste fino.
  4. Ajuste: entra en juego si lo anterior no es suficiente y el problema es "comportamiento/formato/estilo".

Distinción clave: el ajuste fino es débil y arriesgado a la hora de enseñar nueva información al modelo; pero es bueno para enseñar cómo comportarse (un formato específico, tono, jerga de campo, estructura consistente). “Mi modelo no conoce la información de nuestra empresa” → RAG. "Deje que mi modelo siempre proporcione el resultado en el formato exacto que queremos" → candidato de ajuste fino.

Consejo: antes de decidirse por un ajuste fino, pregunte: "¿Es esto un problema de conocimiento o un problema de conducta?" Los problemas de información se resuelven mejor con RAG, los problemas de comportamiento se resuelven mejor con un ajuste fino.

Métodos de ajuste

Ajuste completo: reentrenamiento de todos los parámetros del modelo. El más potente pero el más caro; Requiere hardware grande (GPU) y datos cuidadosos. Es innecesario para la mayoría de los equipos.

Ajuste eficiente de parámetros (PEFT): métodos que congelan la gran mayoría del modelo y entrenan solo un pequeño conjunto de parámetros adicionales. El más común es LoRA (adaptación de bajo rango: entrenamiento de pequeñas capas de "adaptadores" agregadas al modelo). LoRA proporciona resultados cercanos al ajuste completo, con mucha menos memoria y costo; Por eso es la primera opción en la práctica.

Ajuste fino supervisado (SFT): enseñar al modelo a "responder a esta entrada de esta manera" con datos que consisten en pares de entrada-salida ideal. Es el escenario más común.

Aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF): alinear el comportamiento del modelo a partir de las respuestas preferidas de las personas. Es complejo y costoso; Las necesidades de la mayoría de los equipos de aplicaciones se satisfacen con SFT. Basta conocer RLHF como concepto.

Datos: el corazón del ajuste

La calidad del ajuste depende completamente de la calidad de los datos de entrenamiento. Unos cientos de muestras consistentes y de alta calidad son mejores que miles de muestras descuidadas. Al preparar datos:

  • Consistencia: todos los ejemplos muestran consistentemente el formato y el tono que desea. Los ejemplos contradictorios confunden el modelo.
  • Variedad: Los ejemplos cubren la variedad en uso real, pero no son uniformes.
  • Limpieza: las instancias que contienen datos incorrectos, sesgados u ocultos se pasan permanentemente al modelo. Los datos de ajuste deben leerse con tanta atención como un contrato.
Precaución: Cada sesgo, error e información oculta que ingresa a los datos de ajuste queda grabado en el modelo y reaparece en sus resultados. Audita tus datos de entrenamiento tan meticulosamente como si los estuvieras publicando; No publicar datos personales.

Revisión: ¿funcionó el ajuste fino?

Antes de realizar un ajuste fino, reserve un conjunto de evaluación reservado y mida la puntuación del modelo sin realizar un ajuste fino (modelo base). Después del ajuste fino, mida nuevamente en el mismo banco. No se puede decir "mejoró" sin comparar. También dos trampas a tener en cuenta:

  • Sobreaprendizaje: el sobreentrenamiento con datos pequeños hace que el modelo pierda su capacidad para memorizar y generalizar ejemplos de entrenamiento.
  • Olvido catastrófico: el sobreentrenamiento en una tarea limitada puede afectar las habilidades generales del modelo. Pruebe si se conservan las viejas habilidades mientras se adquiere el nuevo comportamiento.

Enfoque débil / Enfoque fuerte

Débil: "Tengo 3000 registros de chat, vamos a ajustarlos todos para que el modelo pueda hablar como nosotros".

Güçlü: "Primero evalué el modelo base con 100 tareas reales, tomé nota de la puntuación. Medí cuánto mejoró con indicaciones y algunos disparos; no fue suficiente. Luego, de los 3000 registros, seleccioné y limpié solo 400 muestras con alta calidad, formato consistente y sin datos ocultos. Ajusté con LoRA, volví a medir con las mismas 100 tareas y confirmé con una prueba separada que las capacidades generales estaban intactas".

La diferencia: el enfoque fuerte agota primero las alternativas, selecciona datos, mide el antes y el después y prueba los efectos secundarios.

La realidad del costo y el mantenimiento.

El ajuste no es un trabajo de una sola vez; Es un deber de cuidado. Puede que sea necesario volver a entrenar cuando el modelo base se actualiza, necesita cambios o se pierden datos. Además, albergar un modelo ajustado conlleva costos y operaciones adicionales. Compare este costo total de propiedad con el aumento en la calidad que proporciona. La mayoría de las veces, un buen aviso + RAG es más económico y flexible que un ajuste fino.

tres mini casos

Caso 1: Ajustes innecesarios. Un equipo se embarcó en un costoso proyecto de ajuste porque "nuestro modelo no conoce nuestros productos". Se gastaron meses y presupuesto, el resultado fue frágil: el modelo quedó obsoleto cada vez que cambiaba el catálogo de productos. Finalmente se cambiaron a RAG: obtuvieron los datos del producto de la base de documentos, la actualización fue instantánea y el coste bajó. Lección: el problema de la información no se resuelve mediante ajustes.

Caso 2 - Ajuste correcto. Una compañía de seguros quería que el modelo produjera siempre resúmenes de pólizas en la misma estructura rígida (elemento por cláusula, con títulos específicos). La coherencia con las indicaciones está estancada en un 70 %. Después del ajuste de LoRA con 300 muestras buenas, la consistencia del formato aumentó al 98%. Se trataba de un problema de comportamiento y el ajuste era la herramienta adecuada.

Caso 3: La privacidad se escapa a los datos. Un equipo envió los registros de chat para realizar ajustes sin limpiarlos. Los registros contenían nombres de clientes reales y números de identificación. El modelo ajustado comenzó a "filtrar" estos nombres como resultados en preguntas no relacionadas. El modelo fue retirado, los datos enmascarados y reentrenados. Lección: La información oculta en los datos de ajuste se transfiere permanentemente al modelo.

Plantillas copiables

Ayúdame a decidir si es necesario realizar ajustes para este problema mío. Problema: [descripción] ¿Es esto un problema de INFORMACIÓN (el modelo no sabe algo) o un problema de COMPORTAMIENTO (el modelo no produce el formato/tono/estructura que quiero)? ¿Se puede solucionar con rapidez, pocos disparos y RAG primero? ¿Por qué probar o no cada uno de ellos? ¿Solo bajo qué condiciones recomendaría realizar un ajuste fino?

Consulte este conjunto de datos de ajuste: 1) ¿Los ejemplos son consistentes en formato y tono? 2) ¿Cubren la variación en el uso real? 3) ¿Contiene datos confidenciales/personales (deben estar enmascarados)? 4) ¿Hay ejemplos contradictorios? Un subconjunto de los ejemplos: [ejemplos] Enumere cada problema y solución que encontró.

Elaborar un plan de evaluación antes y después del ajuste. Tarea: [explicación]- ¿Cómo se debe seleccionar el conjunto de evaluación retenido?- ¿Cómo se mide la puntuación del modelo base?- ¿Con qué métrica se compara después del ajuste fino?- ¿Cómo pruebo que las capacidades generales no se vean afectadas (olvido catastrófico)?

Sugiera hiperparámetros iniciales para realizar ajustes con LoRA. Tamaño de datos: [número de muestras] Propósito: [enseñanza de formato/tono] Sugiera época, tasa de aprendizaje y detención temprana para evitar el aprendizaje excesivo.

Tabla de decisiones: qué herramienta y cuándo

necesitar

prueba primero

¿Afinando?

El modelo no conoce ninguna información.

trapo

no

Datos actuales requeridos

trapo

no

Formato rígido específico

pocos tiros

Si no es suficiente si

Tono/estilo consistente

rápido + pocos disparos

Si no es suficiente si

Jerga/estilo de campo

rápido

Si eso no es suficiente, LoRA

Optimización de tareas sencillas

pronta ingeniería

Generalmente no

Errores comunes

  • Intentando resolver el problema de la información con ajustes. RAG es la herramienta adecuada.
  • Realizar ajustes sin consumir avisos, pocos disparos o RAG. Caro e innecesario.
  • Capacitación con datos de baja calidad o contradictorios. Menos datos, pero claros, es mejor.
  • Poner datos confidenciales en la educación. Se infiltra permanentemente en el modelo.
  • No medir antes y después. No se puede probar la recuperación.
  • No probar el olvido catastrófico. La nueva habilidad puede alterar la anterior.

En resumen

El ajuste fino es una herramienta poderosa pero costosa y solo debe considerarse para problemas de comportamiento/formato después de consumir el RAG de pocos disparos; Los problemas de información pertenecen a RAG. Los métodos eficientes en parámetros, como LoRA, son la primera opción práctica. La calidad depende enteramente de la calidad de los datos; Utilice datos pequeños pero limpios, consistentes y confidenciales. Mida antes y después, pruebe si hay exceso de aprendizaje y pérdida de capacidad. El ajuste fino es un deber de cuidado; Compare su costo total con la calidad que ofrece.

Tarea de aplicación

Elija un problema y decida si es necesario realizar ajustes distinguiendo entre "conocimiento o comportamiento" y escriba su justificación. Si se trata de un problema de conducta, prepare de 20 a 30 muestras consistentes, verifique si hay datos ocultos y documente un plan de evaluación de antes y después (grupo retenido, puntaje base, métrica de comparación, prueba de olvido). Si se puede resolver con RAG/pocos disparos en lugar de realizar ajustes finos, tome nota de esto también.

lista de verificación

  • [ ] Determiné si el problema es de conocimiento o de conducta.
  • [] Primero evalué las alternativas rápidas, de pocos disparos y RAG.
  • [] Audité los datos de ajuste para verificar su coherencia, diversidad y confidencialidad.
  • [] Asigné un grupo de evaluación retenido y medí la puntuación base.
  • [] Planeé una prueba de comparación y olvido de antes y después.
  • [ ] Comparé el costo total con la calidad que brinda.