Unité 6 / 11

Base de réglage fin : quand, comment et avec quel risque

Gains :

  • Capacité à distinguer si un problème est lié à l'information ou au comportement et à évaluer le réglage fin des problèmes de comportement seulement après avoir épuisé les invites, les tirs à quelques coups et les RAG.
  • Comprendre les méthodes de réglage fin (SFT, LoRA/PEFT, RLHF) et les attributs des données qui déterminent la qualité (cohérence, diversité, confidentialité)
  • Capacité à mesurer la véritable valeur du réglage fin avec des tests d'évaluation avant-après, de surapprentissage et d'oubli catastrophique

Le réglage fin (personnalisation de son comportement en entraînant davantage un modèle pré-entraîné avec vos propres données) est un outil puissant mais coûteux dans l'arsenal de l'ingénieur travaillant avec les LLM. Lorsqu’il est utilisé au mauvais endroit, c’est une perte de temps et d’argent, mais lorsqu’il est utilisé au bon endroit, il offre une qualité qui ne pourrait être obtenue autrement. Dans cette unité, nous abordons les cas où un réglage fin est nécessaire, ses méthodes de base et ses risques. Le but est de vous aider à prendre des décisions.

Tout d’abord, la bonne question : un réglage fin est-il nécessaire ?

L’erreur la plus coûteuse des débutants est de se précipiter immédiatement pour peaufiner un problème qui peut être résolu. Configurez la commande comme ceci :

  1. Ingénierie rapide : une bonne invite qui explique clairement la tâche résout la plupart des problèmes. Consommez ici en premier.
  2. Apprentissage en quelques étapes : mettre quelques exemples dans l'invite montre au modèle le format et le comportement souhaités.
  3. RAG : Si le problème est le « manque d'informations » (besoin de données que le modèle ne connaît pas), la solution est RAG (unité 4), et non un réglage fin.
  4. Mise au point : elle entre en jeu si ce qui précède ne suffit pas et que le problème est « comportement/format/style ».

Distinction clé : le réglage fin est faible et risqué lorsqu'il s'agit d'enseigner de nouvelles informations au modèle ; mais il est fort pour enseigner comment se comporter (un format spécifique, un ton, un jargon de terrain, une structure cohérente). « Mon modèle ne connaît pas les informations de notre entreprise » → RAG. "Laisser mon modèle toujours donner le résultat dans le format exact souhaité" → candidat à la mise au point fine.

Astuce : Avant de décider d'un réglage fin, demandez-vous : « Est-ce un problème de connaissances ou un problème de comportement ? » Les problèmes d'information sont mieux résolus avec RAG, les problèmes de comportement sont mieux résolus avec un réglage fin.

Méthodes de réglage fin

Mise au point complète : recyclage de tous les paramètres du modèle. Le plus puissant mais le plus cher ; Cela nécessite un matériel volumineux (GPU) et des données soignées. C'est inutile pour la plupart des équipes.

Ajustement efficace des paramètres (PEFT) : méthodes qui gèlent la grande majorité du modèle, en entraînant uniquement un petit ensemble de paramètres supplémentaires. La plus courante est la LoRA (Low-Rank Adaptation : formation de petites couches « adaptateurs » ajoutées au modèle). LoRA fournit des résultats proches d'un réglage fin complet, avec beaucoup moins de mémoire et de coût ; C'est pourquoi c'est le premier choix dans la pratique.

Réglage fin supervisé (SFT) : apprendre au modèle à « répondre à cette entrée comme ceci » avec des données constituées de paires entrée-sortie idéales. C'est le scénario le plus courant.

Apprentissage par renforcement à partir de la rétroaction humaine (RLHF) : aligner le comportement du modèle sur les réponses préférées des gens. C’est complexe et coûteux ; Les besoins de la plupart des équipes d’application sont satisfaits avec SFT. Il suffit de connaître le RLHF en tant que concept.

Les données : au cœur du réglage fin

La qualité du réglage fin dépend entièrement de la qualité des données d'entraînement. Quelques centaines d’échantillons cohérents et de haute qualité valent mieux que des milliers d’échantillons bâclés. Lors de la préparation des données :

  • Cohérence : tous les exemples montrent systématiquement le format et le ton souhaités. Des exemples contradictoires laissent le modèle confus.
  • Variété : les exemples couvrent la variété réellement utilisée, mais ne sont pas uniformes.
  • Nettoyage : les instances contenant des données incorrectes, biaisées ou masquées sont définitivement transmises au modèle. Les données de réglage fin doivent être lues avec autant d’attention qu’un contrat.
Attention : tous les biais, erreurs et informations cachées qui entrent dans les données de réglage fin sont gravés dans le modèle et réapparaissent dans ses sorties. Auditez vos données de formation aussi méticuleusement que si vous les publiiez ; Ne publiez pas de données personnelles.

Bilan : la mise au point a-t-elle fonctionné ?

Avant d'effectuer un réglage fin, réservez un ensemble d'évaluation retenu et mesurez le score du modèle sans réglage fin (modèle de base). Après un réglage fin, mesurez à nouveau dans la même banque. On ne peut pas dire « ça s’est amélioré » sans comparaison. Egalement deux pièges à connaître :

  • Surapprentissage : le surentraînement avec de petites données fait perdre au modèle sa capacité à mémoriser et à généraliser les exemples de formation.
  • Oubli catastrophique : un surentraînement sur une tâche restreinte peut altérer les capacités globales du modèle. Testez si les anciennes compétences sont conservées lors de l’acquisition du nouveau comportement.

Approche faible / Approche forte

Faible : "J'ai 3000 journaux de discussion, donnons-les tous à peaufiner, pour que le modèle puisse parler comme nous."

Güçlü : "J'ai d'abord évalué le modèle de base avec 100 tâches réelles, noté le score. J'ai mesuré son amélioration avec des invites et quelques tirs - ce n'était pas suffisant. Ensuite, à partir des 3 000 journaux, j'ai sélectionné et nettoyé seulement 400 échantillons de haute qualité, au format cohérent et sans données cachées. J'ai affiné avec LoRA, mesuré à nouveau avec les mêmes 100 tâches et confirmé par un test séparé que les capacités générales étaient intactes."

La différence : l’approche forte épuise d’abord les alternatives, sélectionne les données, mesure avant et après et teste les effets secondaires.

La réalité du coût et de la maintenance

La mise au point n'est pas une tâche ponctuelle ; C'est un devoir de diligence. Il peut être nécessaire de procéder à une nouvelle formation lorsque le modèle de base est mis à jour, que les besoins changent ou que des données sont perdues. De plus, l’hébergement d’un modèle affiné entraîne des coûts et des opérations supplémentaires. Comparez ce coût total de possession avec l’augmentation de la qualité qu’il procure. La plupart du temps, une bonne invite + RAG est moins chère et plus flexible qu'un réglage fin.

trois mini-cases

Cas 1 – Mise au point inutile. Une équipe s'est lancée dans un coûteux projet de mise au point car « notre modèle ne connaît pas nos produits ». Des mois et du budget ont été dépensés, le résultat était fragile : le modèle devenait obsolète à chaque changement de catalogue de produits. Finalement, ils sont passés à RAG : ils ont récupéré les données produits dans la base documentaire, la mise à jour a été instantanée et le coût a baissé. Leçon : le problème de l’information ne se résout pas par un réglage fin.

Cas 2 - Mise au point correcte. Une compagnie d'assurance souhaitait que le modèle produise toujours des résumés de police dans la même structure rigide (article par clause, avec des titres spécifiques). La cohérence avec l'invite est bloquée à 70 %. Après un réglage fin de LoRA avec 300 bons échantillons, la cohérence du format est passée à 98 %. Il s’agissait d’un problème de comportement et un réglage fin était le bon outil.

Cas 3 – La confidentialité s’échappe dans les données. Une équipe a soumis les journaux de discussion à un réglage fin sans les nettoyer. Les journaux contenaient de vrais noms de clients et des numéros d’identification. Le modèle affiné a commencé à « divulguer » ces noms sous forme de résultats dans des questions sans rapport. Le modèle a été retiré, les données masquées et recyclées. Leçon : Les informations cachées dans les données de réglage fin sont transférées de manière permanente au modèle.

Modèles copiables

Aidez-moi à décider si un réglage fin est nécessaire pour résoudre mon problème. Problème : [description] S'agit-il d'un problème d'INFORMATION (le modèle ne sait pas quelque chose) ou d'un problème de COMPORTEMENT (le modèle ne produit pas le format/ton/structure que je souhaite) ? Peut-il être résolu avec promptitude, quelques tirs et RAG d'abord ? Pourquoi essayer/ne pas essayer chacun d’entre eux ? Seulement dans quelles conditions recommanderiez-vous un réglage fin ?

Vérifiez cet ensemble de données de réglage précis : 1) Les exemples sont-ils cohérents dans le format et le ton ? 2) Couvrent-ils la variation dans l'utilisation réelle ? 3) Contiennent-ils des données confidentielles/personnelles (doivent être masquées) ?

Produire un plan d’évaluation avant et après la mise au point. Tâche : [explication] - Comment sélectionner l'ensemble d'évaluation retenu ? - Comment le score du modèle de base est-il mesuré ? - Avec quelle métrique est-il comparé après un réglage fin ?

Suggérer des hyperparamètres initiaux pour un réglage fin avec LoRA. Taille des données : [nombre d'échantillons] Objectif : [enseignement du format/ton] Suggérer l'époque, le taux d'apprentissage et l'arrêt précoce pour éviter le surapprentissage.

Table de décision : quel outil quand

besoin

essaie d'abord

Un réglage fin ?

Le modèle ne connaît aucune information

CHIFFON

non

Données actuelles requises

CHIFFON

non

Format rigide spécifique

quelques clichés

Si ce n'est pas assez, oui

Ton/style cohérent

invite + quelques coups

Si ce n'est pas assez, oui

Jargon/style de terrain

invite

Si cela ne suffit pas, LoRA

Optimisation simple des tâches

ingénierie rapide

Généralement non

Erreurs courantes

  • Essayer de résoudre le problème de l'information avec un réglage fin. RAG est le bon outil.
  • Se lancer dans un réglage fin sans consommer d'invite/quelques plans/RAG. Cher et inutile.
  • Formation avec des données de mauvaise qualité/conflits. Il est préférable de disposer de données moins nombreuses mais claires.
  • Mettre des données confidentielles dans l'éducation. Infiltre définitivement le modèle.
  • Ne pas mesurer avant et après. Vous ne pouvez pas prouver le rétablissement.
  • Ne pas tester l'oubli catastrophique. La nouvelle compétence peut perturber l’ancienne.

En résumé

Le réglage fin est un outil puissant mais coûteux et ne doit être pris en compte que pour les problèmes de comportement/format après avoir consommé prompt-few-shot-RAG ; les problèmes d’information appartiennent à RAG. Les méthodes efficaces en termes de paramètres telles que LoRA constituent le premier choix pratique. La qualité dépend entièrement de la qualité des données ; Utilisez des données petites mais propres, cohérentes et confidentielles. Mesurez avant et après, testez le surapprentissage et la perte de capacité. La mise au point est un devoir de diligence ; Pesez son coût total par rapport à la qualité qu’il offre.

Tâche de candidature

Choisissez un problème et décidez si un ajustement est nécessaire en distinguant « connaissance ou comportement » et rédigez votre justification. S'il s'agit d'un problème de comportement, préparez 20 à 30 échantillons cohérents, recherchez les données cachées et documentez un plan d'évaluation avant et après (cluster retenu, score de base, mesure de comparaison, test d'oubli). Si le problème peut être résolu avec RAG/quelques plans au lieu d'un réglage fin, notez-le également.

liste de contrôle

  • [ ] J'ai déterminé si le problème était la connaissance ou le comportement.
  • [ ] J'ai d'abord évalué les alternatives promptes, à quelques coups et RAG.
  • [ ] J'ai audité les données de mise au point pour en vérifier la cohérence, la diversité et la confidentialité.
  • [ ] J'ai attribué un cluster d'évaluation retenu et mesuré le score de base.
  • [ ] J'ai prévu un test de comparaison et d'oubli avant-après.
  • [ ] J'ai comparé le coût total avec la qualité qu'il offre.