Einheit 2 / 11

Einbettung und Vektordatenbanklogik

Gewinne:

  • Verstehen Sie, dass die Einbettung den Text in einen Vektor im semantischen Raum verwandelt und dass ähnliche Bedeutungen nahe beieinander liegende Vektoren sind
  • Erklären, wie die ANN-Suche mit Kosinus- und Punktähnlichkeitsmetriken funktioniert
  • Auswahl gängiger Vektordatenbanken basierend auf Kosten, Umfang und Bedarf an Metadatenfilterung

Im Zentrum von RAG steht eine einzige Frage: „Welcher Text ähnelt der Frage des Benutzers am meisten?“ Der Computer verarbeitet Texte mit Zahlen, nicht wörtlich. Deshalb müssen wir den Text zunächst in Zahlen umwandeln, die seine Bedeutung tragen. Das ist Einbettung: der Vorgang der Umwandlung eines Textes in eine Zahlenfolge (Vektor), die die Bedeutung dieses Textes darstellt. Wenn Sie diese Einheit abgeschlossen haben, wissen Sie, wie das Einbetten funktioniert, wie Ähnlichkeit gemessen wird und wie Sie die richtige Vektordatenbank auswählen.

Einbettung: Bedeutung in Koordinaten übersetzen

Ein Einbettungsmodell (eine speziell trainierte künstliche Intelligenz) wandelt den von Ihnen bereitgestellten Text in einen Vektor aus beispielsweise 1024 Zahlen um. Stellen Sie sich diesen Vektor als eine Koordinate in einem mehrdimensionalen Raum vor. Der Zauber liegt darin: Texte mit ähnlicher Bedeutung fallen in diesem Raum in enge Koordinaten.

Ein einfaches Beispiel: „Jahresurlaub“, „Urlaubsanspruch“ und „bezahlter Jahresurlaub“ verwenden unterschiedliche Wörter, bedeuten aber dasselbe – ihre Vektoren liegen nahe beieinander. „Lohnkonto“ ist eine andere Sache – sein Vektor ist weit entfernt. Der Benutzer fragt also: „Wie viele Tage Urlaub habe ich?“ Wenn Sie danach fragen, können wir sogar ein Dokument finden, in dem nicht das Wort „Urlaub“ vorkommt, sondern „der Jahresurlaub beträgt 14 Tage“. Das ist es, was die klassische Stichwortsuche (Suche, die genau zum Wort passt) nicht leisten kann.

Tipp: Betrachten Sie die Einbettung als einen „Fingerabdruck der Bedeutung“. Die Fingerabdrücke zweier Sätze mit derselben Bedeutung erscheinen ähnlich; Auch wenn die Wörter unterschiedlich sind.

Eine wichtige Regel: Das Modell, das Sie beim Einbetten der Frage verwenden, sollte dasselbe Modell sein, das Sie beim Einbetten von Dokumenten verwenden. Unterschiedliche Modelle erzeugen unterschiedliche Räume; Koordinaten werden unvergleichbar.

Wie misst man Ähnlichkeit?

Es gibt verschiedene Methoden, um zu messen, wie ähnlich zwei Vektoren sind. Am gebräuchlichsten ist die Kosinusähnlichkeit: Sie misst den Winkel zwischen zwei Vektoren. Wenn der Winkel klein ist (Vektoren zeigen in die gleiche Richtung), ist die Ähnlichkeit hoch. Der Wert liegt zwischen −1 und 1; Nahezu 1 = sehr ähnlich.

Kriterium

Was misst es?

Wann wird es bevorzugt?

Kosinus

Winkel (Richtung) zwischen Vektoren

Am häufigsten; Standard in der semantischen Textähnlichkeit

Punktprodukt

Richtung + Betrag zusammen

Wenn die Vektoren normalisiert werden, erhält man das gleiche Ergebnis wie der Kosinus; ist schnell

Euklidisch (euklidischer Abstand)

Gerader Abstand zwischen Koordinaten

In einigen Clustering-Szenarien; wird im Text seltener verwendet

In der Praxis erzeugen die meisten Einbettungsmodelle normalisierte Vektoren (Größe auf 1 eingestellt); In diesem Fall ergeben Kosinus und Skalarprodukt die gleiche Ordnung. Seien Sie nicht entscheidungsunfähig: Beginnen Sie mit dem Kosinus.

Unter Millionen von Vektoren ist es langsam, sie einzeln zu vergleichen. Aus diesem Grund verwenden Vektordatenbanken ANN-Algorithmen (Approximate Nearest Neighbor). ANN findet sehr schnell „fast genau am nächsten“ statt „exakt am nächsten“. Beispielsweise kann die Methode namens HNSW selbst für 10 Millionen Vektoren Ergebnisse in wenigen Millisekunden zurückgeben. Sie gewinnen große Geschwindigkeit bei einem kleinen Einbußen bei der Genauigkeit.

Was macht die Vektordatenbank?

Eine Vektordatenbank erledigt drei Dinge gleichzeitig: (1) speichert Vektoren, (2) findet schnell Vektoren, die einem Abfragevektor am ähnlichsten sind, (3) filtert nach Metadaten neben jedem Vektor. Metadaten sind die Tags, die Sie diesem Teil hinzufügen: Quelldatei, Datum, Abteilung, Datenschutzstufe usw. Die Metadatenfilterung ist in Unternehmens-RAGs von entscheidender Bedeutung. weil Sie in der Lage sein müssen, Einschränkungen wie „Suche nur in den 2025-Dokumenten der Finanzabteilung“ festzulegen.

# Registrieren Sie sich in der Vektordatenbank (konzeptionell)vektor_db.add( id="izin-politikasi-parca-3", vektor=embed("Der bezahlte Jahresurlaub beträgt 14 Tage..."), text="Der bezahlte Jahresurlaub beträgt 14 Tage...", metadata={"source": "ik_el_kitabi.pdf", "department": "IK", "date": "2025-06", "privacy": "ic"})

# Metadatengefilterte Suche (konzeptionell)result = vektor_db.search( vektor=embed("Wie viele Tage Urlaub habe ich?"), top_k=4, filter={"department": "HR", "privacy": ["internal", "on"]})

Auswahl der richtigen Datenbank

Fahrzeug

Besonderer Aspekt

Passende Situation

Integriert / dateibasiert (eingebettete Bibliothek)

Keine Installation, Einzelmaschine

Prototyp, kleiner Bausatz (< wenige hunderttausend Teile)

Verwalteter Cloud-Dienst

Die Skalierung und Wartung liegt nicht in Ihrer Verantwortung

Produktion, schnell wachsende Daten, kleines Team

Open Source auf Ihrem eigenen Server

Volle Kontrolle, Ihre Daten bleiben Ihr Eigentum

Datenschutzpflicht, vorhandene Infrastruktur

Ergänzung zur bestehenden Datenbank

Sie verwalten keine separaten Systeme

Hinzufügen von Vektorunterstützung zur bereits verwendeten Datenbank

Fragen Sie bei der Auswahl: Wie viele Teile werden es sein? Wie wichtig ist die Metadatenfilterung? Können Daten außerhalb des Unternehmens gelangen (Vertraulichkeit)? Kann das Team eine Infrastruktur betreiben? Es ist oft ratsam, klein anzufangen und nach Bedarf zu erweitern.

Schwacher Ansatz / Starker Ansatz

Schwach (speichert einfache Einbettung, keine Metadaten):

Speichern Sie einfach den Text und den Vektor. Suche: Gibt die 4 ähnlichsten Vektoren zurück.# Problem: Kann nicht nach „nur aktuelle HR-Dokumente“ filtern;# Möglicherweise sind auch alte/nicht autorisierte Teile in der Antwort enthalten.

Leistungsstark (umfangreiche Metadaten + gefilterte Suche):

Fügen Sie jedem Artikel Quelle, Datum, Abteilung und Datenschutz-Tag hinzu. Filtern Sie bei der Suche nach der Berechtigung und Aktualität des Benutzers: filter = {"privacy": user_authority, "date_date": "2024-01"}# Somit ist das Ergebnis sowohl sicher als auch aktuell.

Drei Mini-Hüllen

Fall 1 – Falscher Modellmix. Ein Team bettete Dokumente mit Modell A und Fragen mit Modell B ein. Die Suchanfragen lieferten bedeutungslose Ergebnisse und die richtige Antwortquote blieb bei 31 %. Als ich zu einem einzelnen Modell wechselte (beide das gleiche Einbettungsmodell), stieg die Rate sprunghaft auf 88 %. Lektion: Frage und Dokument sollten sich im selben Bereich befinden.

Fall 2 – Datenschutzrisiko ohne Metadaten. In einem Gesundheitsunternehmen wurden alle Abteilungsdokumente ohne Metadaten in einem einzigen Pool zusammengefasst. Wenn ein Vertriebsmitarbeiter eine Frage stellte, kontextualisierte das System die Patientendaten. Durch das Hinzufügen von Metadaten + Filter (je nach Autorisierungsebene) wurde dieses Risiko beseitigt; Bei der Rückholung werden 12 nicht autorisierte Stücke überhaupt nicht mitgebracht.

Fall 3 – Skalenengpass. Ein E-Commerce-Unternehmen durchsuchte 8 Millionen Produktbeschreibungen mit einer einfachen „Alle scannen“-Methode. Jede Abfrage dauerte 6 Sekunden. Als wir auf HNSW-basiertes ANN umstiegen, verkürzte sich die Zeit auf 45 Millisekunden, mit nur 1 % Genauigkeitsverlust. Lektion: ANN ist im großen Satz obligatorisch.

Häufige Fehler

  • Einbettung der Frage und des Dokuments mit unterschiedlichen Modellen: Die Ergebnisse sind bedeutungslos; immer ein Modell.
  • Metadaten überspringen: Sie können nicht filtern; Sie verlieren die Kontrolle über Privatsphäre und Aktualität.
  • Einbettung mit Verschlüsselung verwechseln: Einbettung enthält umkehrbare Informationen; Es ist falsch anzunehmen, dass sensible Daten „verheimlicht“ werden.
  • Der Aufbau einer unnötig großen Infrastruktur auf einer kleinen Menge: Ein riesiger Cluster, der für 5.000 Teile verwaltet wird, ist unnötig komplex.
  • Machen Sie sich nicht zu viele Gedanken über das Ähnlichkeitskriterium: Beginnen Sie mit dem Kosinus im Text; Die Feinabstimmung kommt später.
Achtung: Durch das Einbetten wird die Bedeutung des Textes in Zahlen eingebettet, der Inhalt wird jedoch nicht „zerstört“. Wenn eine Vektordatenbank geleakt wird, sind auch die ursprünglich gespeicherten Texte (in den meisten Installationen wird der Text auch gespeichert) gefährdet. Halten Sie das Vektor-Repository genauso vertraulich wie die darin enthaltenen Dokumente.

Zusammenfassend

  • Durch die Einbettung wird Text in einen Zahlenvektor umgewandelt, der seine Bedeutung trägt; Ähnliche Bedeutungen sind naheliegende Vektoren.
  • Ähnlichkeit wird oft anhand des Kosinus gemessen; Für normalisierte Vektoren liefert das Skalarprodukt das gleiche Ergebnis.
  • Bei Big Data ersetzt ANN (z. B. HNSW) die exakte Suche: hohe Geschwindigkeit bei geringem Einbußen bei der Genauigkeit.
  • Die Vektordatenbank führt Vektorspeicherung + Ähnlichkeitssuche + Metadatenfilterung durch. Metadaten sind für Enterprise RAG von wesentlicher Bedeutung.
  • Die Frage und das Dokument müssen mit demselben Einbettungsmodell übersetzt werden; Andernfalls können die Koordinaten nicht verglichen werden.

Anwendungsaufgabe

Extrahieren Sie 10 kurze Passagen (jeweils 3–6 Sätze) aus dem Dokument, das Sie in der vorherigen Einheit ausgewählt haben. (1) Entwerfen Sie für jedes Element mindestens drei Metadaten-Tags (Quelle, Datum und ein drittes, das Ihrem Geschäftskontext entspricht: Abteilung, Produkt, Datenschutz usw.). (2) Schreiben Sie, welcher Metadatenfilter auf drei verschiedene Benutzerfragen angewendet werden soll. (3) Finden Sie 3 Frage-Teil-Paare, die dieselbe Bedeutung in unterschiedlichen Wörtern ausdrücken (z. B. „Urlaubsanspruch“ ↔ „Jahresurlaub“) und erläutern Sie in einem Satz, warum sie nicht mit der Stichwortsuche, aber mit der Einbettung übereinstimmen.

Checkliste

  • [ ] Ich kann erkennen, dass die Einbettung den Text in einen Vektor im semantischen Raum verwandelt und ähnliche Bedeutungen nahe beieinander liegen.
  • Ich weiß, dass die Kosinusähnlichkeit [ ] den Winkel misst und die Standardeinstellung im Text ist.
  • [ ] Ich kann erklären, warum ANN in Big Data notwendig ist.
  • [ ] Ich weiß, warum Metadaten für die Vertraulichkeit und Aktualitätskontrolle von entscheidender Bedeutung sind.
  • [ ] Ich befolge die Regel, die Frage und das Dokument mit demselben Einbettungsmodell zu übersetzen.