Gains :
- Définir des métriques qui mesurent séparément la rétention et la qualité de la génération
- Configurez un ensemble de questions d'or et exécutez une évaluation automatique avec LLM-as-juge
- Maintenir la qualité grâce au feedback, au suivi et aux tests de régression en production
La phrase « J'ai installé l'assistant, il semble fonctionner correctement » n'est pas une déclaration technique. Les systèmes RAG tombent en panne silencieusement : un nouveau type de document trompe la récupération, une modification rapide réduit la précision, l'index devient obsolète. La seule façon de s’en rendre compte est de mesurer. Dans cette unité, nous expliquons comment mesurer la qualité du RAG (récupération et génération séparément), l'évaluation automatique (LLM-as-juge) et maintenir la qualité en production (surveillance, régression). "On ne peut pas améliorer ce qu'on ne mesure pas" est la devise de cette unité.
Mesurer deux choses distinctes
RAG a deux pattes et doit être mesuré séparément car le problème peut provenir de l'une ou l'autre :
- Qualité de récupération : la bonne pièce est-elle arrivée ?
- Qualité de la génération : la bonne réponse a-t-elle été produite à partir de la pièce entrante ?
Si la réponse est mauvaise, vous devez d’abord savoir quelle jambe est mauvaise. Si la bonne pièce n'arrive jamais, même la meilleure invite ne peut pas être enregistrée (problème de récupération). Si la bonne pièce est arrivée mais que le modèle l'a mal interprétée, améliorer la récupération est inutile (problème de génération).
Métriques de récupération
La récupération est un problème de tri/accès ; mesuré par des mesures classiques de recherche d’informations. Pour cela, vous devez disposer du cluster doré : savoir quelle pièce est « correcte » pour chaque question.
métrique
Quelles mesures
Définition simple
Rappel@k
La bonne pièce est-elle dans le k supérieur ?
Taux de capture de pièces correct
précision@k
Parmi les k pièces renvoyées, combien sont pertinentes ?
Nettoyage de ce qui est apporté
MRR (rang réciproque moyen)
Dans quel ordre se trouve la bonne pièce ?
Les récompenses étant dans les premiers rangs
Taux de réussite
Est-ce qu'au moins une pièce correcte est arrivée ?
La mesure la plus élémentaire du succès
Commentaire pratique : si Recall@k est faible, la stratégie de chunking ou de recherche (hybride, k, re-ranking) doit être retravaillée. Si la précision est faible mais que le rappel est élevé, l’ajout d’un reclassement est une bonne chose.
Métriques de génération
Lorsque la bonne pièce arrive, nous mesurons la qualité de la réponse produite par le modèle. Trois dimensions fondamentales :
- Fidélité : chaque affirmation de la réponse est-elle étayée par le contexte ? Y a-t-il un raccord ? C'est une mesure directe de l'hallucination.
- Pertinence de la réponse : la réponse répond-elle réellement à la question ou est-elle hors sujet ?
- exhaustivité : toutes les informations pertinentes dans le contexte ont-elles été utilisées ou sont-elles manquantes ?
Celles-ci sont souvent notées sur une base graduée (par exemple 1 à 5), plutôt que sur une base binaire comme « vrai/faux ».
Astuce : suivez la fidélité en tant que mesure distincte. Si la fidélité diminue à mesure que la précision diminue, le problème est la génération ; Si la fidélité est élevée mais que la réponse est fausse, le problème vient du mauvais morceau (récupération). Ensemble, ces deux mesures constituent une boussole qui indique l’emplacement de la panne.
Établir un ensemble de questions en or
Chaque mesure nécessite un ensemble d'or/ensemble de données d'évaluation : questions réalistes + réponses correctes attendues + éléments sources corrects. Commencer par 30 à 50 questions bien choisies vaut mieux que 500 questions aléatoires. Incluez les éléments suivants dans l'ensemble : des questions réelles fréquemment posées, des questions difficiles connues, des questions pièges sans réponse (il faut dire « je ne sais pas »), des questions avec des sources contradictoires.
# Exemple de cluster doré (conceptuel)[ {"question": "Combien de jours de congé annuel ?", "expected_answer": "14 jours pour 1 à 5 ans d'ancienneté", "correct_part_id": "two-part-3", "category": "leave"}, {"question": "Où est le bureau de l'entreprise sur Mars ?", "expected_answer": "NO_INFORMATION", # piège : je ne sais pas "correct_part_id": null, "category": "piège"}]
LLM-as-Judge : évaluation automatique
Noter des centaines de réponses à la main est fatiguant. Le modèle LLM-as-juge est celui où un modèle note et justifie la réponse d'un autre modèle en fonction de certains critères. Un bon juge définit clairement les critères, donne des exemples et demande une justification.
# Invite LLM-as-juge (conceptuel) Vous êtes un évaluateur impartial. Évaluez la RÉPONSE ci-dessous en fonction du CONTEXTE donné et de la RÉPONSE ATTENDUE. Notez (1-5) et justifiez : - fidélité : chaque affirmation de la réponse est-elle étayée dans son contexte ? - exactitude : la réponse correspond-elle à la réponse attendue ? - exhaustivité : les informations pertinentes sont-elles complètes ? En particulier : si la réponse contient des informations qui ne sont pas dans le contexte, donnez la fidélité1 et indiquez quelle affirmation est fabriquée. CONTEXTE : {contexte}ATTENDU : {attendu}RÉPONSE : {réponse}Résultat : {fidélité, exactitude, exhaustivité, justification}
Attention : LLM-as-juge n'est pas parfait ; Ils peuvent avoir leurs propres préjugés (réponse longue, préférant leur propre style). Vérifiez également le juge : faites noter certaines réponses par le juge et l'humain et mesurez l'accord entre eux. Si Judge est cohérent avec les scores humains, vous pouvez lui faire confiance.
Note faible/forte
Faible (« c'était bien pour moi ») :
J'ai posé quelques questions et les réponses semblaient bonnes. Je l'ai en direct.# Problème : pas de mesures, régression imperceptible, amélioration aveugle.
Puissant (gold cluster + métriques discrètes + jugement automatique + régression) :
Groupe doré de 40 questions. À chaque changement, rappel@5, la fidélité et la précision sont mesurées automatiquement. Si le score baisse, la modification est annulée. En production, les commentaires des utilisateurs sont collectés et ajoutés à l’ensemble.
Surveillance et régression en production
L'évaluation n'est pas faite une fois et terminée. Trois pratiques constantes :
- Tests de régression : exécution automatique du cluster doré à chaque changement d'invite/récupération/modèle. Si le score diminue, le changement est inversé. Cela évite de "le casser en essayant de le rendre meilleur".
- Suivi de production : le taux de "je n'ai pas trouvé d'information" en questions réelles, le délai moyen, le coût, les retours utilisateurs (👍/👎) sont suivis. Une augmentation soudaine du nombre de réponses « Je ne sais pas » est souvent le premier signe d'un dysfonctionnement de l'indexation ou de la récupération.
- Boucle de rétroaction : les vraies questions fournies par l'utilisateur 👎 sont examinées et ajoutées à la pile d'or ; Ainsi, l’ensemble s’enrichit au fil du temps et les angles morts du système se comblent.
Trois mini-étuis
Cas 1 — Régression silencieuse. Une équipe a modifié l'invite pour « l'améliorer » ; La précision générale a augmenté, mais la fidélité a diminué de 30 % dans les questions pièges (le modèle a commencé à s'adapter davantage). Cela n'aurait pas été remarqué sans les questions pièges dans le cluster doré ; Les tests de régression ont annulé le changement.
Cas 2 — Redresser la mauvaise jambe. Chez un assistant, les réponses étaient mauvaises ; L’équipe a travaillé sur l’invite pendant des semaines. Lorsque nous avons mesuré les métriques de récupération, le rappel @ 5 n'était que de 48 % – le problème résidait dans la récupération, pas dans la génération. Lorsque le reclassement hybride + a été ajouté, le rappel a augmenté à 89 % et la précision a également augmenté.
Cas 3 — Alerte de production. Un jour, le taux de « Je n'ai pas trouvé d'informations » pour un assistant de support est passé de 6 % à 34 %. Le trackpad a prévenu ; La raison en était que le travail d’indexation, exécuté la nuit, échouait silencieusement et que les nouveaux articles n’étaient pas téléchargés. Sans surveillance, les déclarations incorrectes « Je ne sais pas » auraient continué pendant des jours.
Erreurs courantes
- Se contenter du « ça a bien fonctionné pour moi » : Sans mesure, la régression passe inaperçue.
- Ne pas séparer la récupération et la génération : vous corrigerez la mauvaise jambe et perdrez du temps.
- Ne pas poser de questions pièges : la tendance à inventer n’apparaît pas dans l’amas doré.
- Juge non vérificateur : un jury partial donne une fausse confiance.
- Ne pas surveiller la production : échec de l’index et explosion des coûts se poursuit silencieusement.
En résumé
- Dans RAG, la qualité de la récupération et de la génération est mesurée séparément ; Il faut d’abord déterminer quelle jambe est endommagée.
- rappel@k, précision@k, MRR pour la récupération ; La fidélité, l'adéquation, l'exhaustivité sont utilisées pour la génération.
- Chaque mesure nécessite un cluster d'or ; Mettez-y des questions réelles, difficiles, pièges et contradictoires.
- LLM-as-juge définit de grands scores automatiques ; mais le juge lui-même doit être justifié contre l'homme.
- Les tests de régression, le suivi de la production et une boucle de rétroaction maintiennent la qualité au fil du temps.
Tâche de candidature
(1) Créez un ensemble doré d'au moins 15 questions pour votre propre assistant : incluez au moins 3 pièges (pas de réponses), 3 questions sources difficiles et 2 contradictoires. Écrivez la réponse attendue et la partie correcte pour chaque question. (2) Comparez manuellement deux versions d'invite différentes avec cet ensemble ; Donnez à chaque réponse 1 à 5 points pour sa fidélité et son exactitude. (3) Adaptez l'invite LLM-as-juge ci-dessus à vos propres critères. (4) Identifiez 3 métriques que vous suivrez en production et pour chacune demandez « à quel seuil dois-je déclencher une alarme ? écrire la valeur.
liste de contrôle
- [ ] Je peux mesurer la rétention et la qualité de la génération avec des mesures distinctes.
- [ ] Je sais ce que signifient des mesures comme rappel@k, fidélité.
- [ ] Je peux construire un cluster doré qui comprend des questions réelles, difficiles, pièges et contradictoires.
- [ ] Je peux configurer une évaluation automatique et vérifier le juge avec LLM-as-juge.
- [ ] Je peux effectuer des tests de régression, du suivi de production et des boucles de rétroaction.