Gains :
- Comprendre que l'intégration transforme le texte en vecteur dans l'espace sémantique et que les significations similaires sont des vecteurs proches
- Expliquer comment la recherche ANN fonctionne avec les métriques de similarité de cosinus et de points
- Sélection de bases de données vectorielles communes en fonction du coût, de l'échelle et du besoin de filtrage des métadonnées
Au cœur de RAG se trouve une seule question : « Quel morceau de texte ressemble le plus à la question de l’utilisateur ? » L'ordinateur traite le texte avec des chiffres, pas littéralement. C'est pourquoi nous devons d'abord convertir le texte en chiffres qui portent sa signification. C'est ce qu'est l'intégration : le processus de conversion d'un texte en une séquence de nombres (vecteur) qui représente la signification de ce texte. Lorsque vous aurez terminé cette unité, vous saurez comment fonctionne l'intégration, comment la similarité est mesurée et comment choisir la bonne base de données vectorielles.
Intégration : traduire le sens en coordonnées
Un modèle d'intégration (une intelligence artificielle spécialement entraînée) convertit le texte que vous fournissez en un vecteur de, par exemple, 1024 nombres. Considérez ce vecteur comme une coordonnée dans un espace multidimensionnel. La magie est la suivante : des textes dont le sens est similaire tombent dans des coordonnées proches dans cet espace.
Un exemple simple : « congé annuel », « droit aux vacances » et « congé annuel payé » utilisent des mots différents mais signifient la même chose : leurs vecteurs sont proches les uns des autres. Le « compte de paie » est une autre affaire : son vecteur est lointain. L'utilisateur demande alors « de combien de jours de vacances ai-je ? » Quand on le demande, on peut même trouver un document qui ne contient pas le mot « vacances » mais dit « le congé annuel est de 14 jours ». C’est ce que la recherche classique par mot-clé (recherche qui correspond exactement au mot) ne peut pas faire.
Astuce : considérez l’intégration comme une « empreinte digitale de sens ». Les empreintes digitales de deux phrases ayant le même sens semblent similaires ; Même si les mots sont différents.
Une règle importante : le modèle que vous utilisez lors de l'intégration de la question doit être le même que celui que vous utilisez lors de l'intégration des documents. Différents modèles produisent différents espaces ; les coordonnées deviennent incomparables.
Comment mesurer la similarité ?
Il existe plusieurs méthodes pour mesurer la similitude de deux vecteurs. La plus courante est la similarité cosinus : elle mesure l’angle entre deux vecteurs. Si l’angle est petit (vecteurs pointant dans la même direction), la similarité est grande. La valeur est comprise entre −1 et 1 ; Proche de 1 = très similaire.
critère
Que mesure-t-il ?
Quand est-il préféré ?
Cosinus
Angle (direction) entre les vecteurs
Le plus courant ; par défaut dans la similarité sémantique du texte
Produit scalaire
Direction + magnitude ensemble
Si les vecteurs sont normalisés, cela donne le même résultat que le cosinus ; est rapide
Euclidienne (distance euclidienne)
Distance droite entre les coordonnées
Dans certains scénarios de clustering ; moins utilisé dans le texte
En pratique, la plupart des modèles d'intégration produisent des vecteurs normalisés (taille fixée à 1) ; Dans ce cas, le cosinus et le produit scalaire donnent le même ordre. Ne soyez pas paralysé par la décision : commencez par le cosinus.
Parmi des millions de vecteurs, les comparer un par un est lent. C'est pourquoi les bases de données vectorielles utilisent les algorithmes ANN (Approximate Nearest Neighbor). ANN trouve très rapidement "presque exactement le plus proche" plutôt que "exactement le plus proche". Par exemple, la méthode appelée HNSW peut renvoyer des résultats en quelques millisecondes, même pour 10 millions de vecteurs. Vous gagnez une grande vitesse pour un petit sacrifice de précision.
À quoi sert la base de données vectorielles ?
Une base de données vectorielles fait trois choses à la fois : (1) stocke les vecteurs, (2) trouve rapidement les vecteurs les plus similaires à un vecteur de requête, (3) filtre par métadonnées à côté de chaque vecteur. Les métadonnées sont les balises que vous attachez à cet élément : fichier source, date, service, niveau de confidentialité, etc. Le filtrage des métadonnées est essentiel dans le RAG d'entreprise ; car il faut pouvoir définir des restrictions telles que "rechercher uniquement dans les documents 2025 du service financier".
# Inscrivez-vous à la base de données vectorielle (conceptuelle)vektor_db.add( id="izin-politikasi-parca-3", vektor=embed("Le congé annuel payé est de 14 jours..."), text="Le congé annuel payé est de 14 jours...", metadata={"source": "ik_el_kitabi.pdf", "department": "IK", "date": "2025-06", "privacy": "ic"})
# Recherche filtrée par métadonnées (conceptuelle)result = vektor_db.search( vektor=embed("de combien de jours de congé ai-je?"), top_k=4, filter={"department": "HR", "privacy": ["interne", "on"]})
Choisir la bonne base de données
véhicule
Aspect vedette
Situation appropriée
Intégré/basé sur des fichiers (bibliothèque intégrée)
Aucune installation, une seule machine
Prototype, petit kit (< quelques centaines de milliers de pièces)
Service cloud géré
La mise à l'échelle et la maintenance ne relèvent pas de votre responsabilité
Production, données à croissance rapide, petite équipe
Open source sur votre propre serveur
Contrôle total, vos données restent les vôtres
Obligation de confidentialité, infrastructure existante
Ajout à la base de données existante
Vous ne gérez pas de systèmes distincts
Ajout du support vectoriel à la base de données que vous utilisez déjà
Demandez lors du choix : combien de pièces y aura-t-il ? Dans quelle mesure le filtrage des métadonnées est-il crucial ? Les données peuvent-elles sortir de l’entreprise (confidentialité) ? L’équipe peut-elle exploiter une infrastructure ? Il est souvent sage de commencer petit et de s’étendre selon les besoins.
Approche faible / Approche forte
Faible (stockage de l'intégration simple, pas de métadonnées) :
Enregistrez simplement le texte et le vecteur. Recherche : renvoie les 4 vecteurs les plus similaires.# Problème : impossible de filtrer comme "uniquement les documents RH actuels" ;# des parties anciennes/non autorisées peuvent également être incluses dans la réponse.
Puissant (métadonnées riches + recherche filtrée) :
Ajoutez la source, la date, le département et la balise de confidentialité à chaque pièce. Filtrer en fonction de l'autorité et de l'actualité de l'utilisateur lors de la recherche : filter = {"privacy": user_authority, "date_date": "2024-01"}# Ainsi, le résultat est à la fois sûr et à jour.
Trois mini-étuis
Cas 1 – Mauvaise combinaison de modèles. Une équipe a intégré des documents avec le modèle A et des questions avec le modèle B. Les recherches ont renvoyé des résultats dénués de sens et le taux de réponses correctes est resté à 31 %. Lorsque je suis passé à un seul modèle (les deux étant le même modèle d'intégration), le taux est passé à 88 %. Leçon : la question et le document doivent être dans le même espace.
Cas 2 — Risque pour la vie privée sans métadonnées. Dans une entreprise de soins de santé, tous les documents du service étaient regroupés dans un seul pool, sans métadonnées. Lorsqu'un vendeur posait une question, le système contextualisait une donnée du patient. Lorsque métadonnées + filtre ont été ajoutés (selon le niveau d'autorisation), ce risque a été éliminé ; Lors de la récupération, 12 pièces non autorisées ne sont pas du tout apportées.
Cas 3 — Goulot d’étranglement à l’échelle. Une entreprise de commerce électronique a recherché 8 millions de descriptions de produits avec une simple méthode de « scanner tout » ; Chaque requête prenait 6 secondes. Lorsque nous sommes passés à l'ANN basé sur HNSW, le temps est tombé à 45 millisecondes, avec seulement 1 % de perte de précision. Leçon : ANN est obligatoire dans le big set.
Erreurs courantes
- Intégrer la question et le document avec différents modèles : les résultats n'ont aucun sens ; toujours un modèle.
- Ignorer les métadonnées : vous ne pouvez pas filtrer ; Vous perdez le contrôle de la confidentialité et de l’actualité.
- Confondre l'intégration avec le chiffrement : l'intégration transporte des informations réversibles ; Il est faux de supposer que les données sensibles sont « cachées ».
- Construire une infrastructure inutilement volumineuse sur un petit ensemble : un cluster géant géré pour 5 000 parties représente une complexité inutile.
- Ne vous souciez pas trop du critère de similarité : commencez par le cosinus dans le texte ; La mise au point vient plus tard.
Attention : L'intégration intègre la signification du texte dans des chiffres, mais ne "détruit" pas le contenu. Si une base de données vectorielles est divulguée, les textes stockés d'origine (dans la plupart des installations, le texte est également stocké) sont également compromis. Gardez le référentiel vectoriel aussi confidentiel que les documents qu'il contient.
En résumé
- L'intégration transforme le texte en un vecteur de nombres qui porte sa signification ; Des significations similaires sont des vecteurs proches.
- La similarité est souvent mesurée par le cosinus ; Pour les vecteurs normalisés, le produit scalaire donne le même résultat.
- Dans le Big Data, l'ANN (par exemple HNSW) remplace la recherche exacte : une grande vitesse avec peu de sacrifices en termes de précision.
- La base de données vectorielles effectue le stockage vectoriel + la recherche de similarité + le filtrage des métadonnées ; les métadonnées sont essentielles pour l’entreprise RAG.
- La question et le document doivent être traduits avec le même modèle d'intégration ; sinon les coordonnées ne peuvent pas être comparées.
Tâche de candidature
Extrayez 10 passages courts (3 à 6 phrases chacun) du document que vous avez sélectionné dans l'unité précédente. (1) Concevez au moins trois balises de métadonnées pour chaque élément (source, date et une troisième adaptée à votre contexte métier : service, produit, confidentialité, etc.). (2) Écrivez quel filtre de métadonnées doit être appliqué pour 3 questions d'utilisateur différentes. (3) Trouvez 3 paires de parties de questions qui expriment la même signification dans des mots différents (par exemple « droit aux vacances » ↔ « congé annuel ») et expliquez en une phrase pourquoi elles ne correspondront pas à la recherche par mot-clé mais correspondront à l'intégration.
liste de contrôle
- [ ] Je peux dire que l'intégration transforme le texte en vecteur dans l'espace sémantique et que les significations similaires sont proches.
- Je sais que la similarité cosinus [] mesure l'angle et constitue la préférence par défaut dans le texte.
- [ ] Je peux expliquer pourquoi ANN est nécessaire dans le big data.
- [ ] Je sais pourquoi les métadonnées sont essentielles au contrôle de la confidentialité et de la fraîcheur.
- [ ] Je suis la règle de traduire la question et le document avec le même modèle d'intégration.