Einheit 1 / 11

Was ist RAG und warum ist es notwendig?

Gewinne:

  • Erklären, dass RAG Kontext einfügt, ohne die Gewichtungen des Modells zu ändern, und mit einer „Open-Book-Prüfung“-Logik arbeitet
  • Vergleich von RAG mit Feinabstimmungs- und Long-Context-Ansätzen nach Kosten, Pünktlichkeit und Nutzungsszenario
  • Auflistung der Schritte einer typischen RAG-Pipeline, bestehend aus Indizierungs- und Abfragephasen

Egal wie leistungsfähig ein Sprachmodell (künstliche Intelligenz, die Text versteht und produziert; wir nennen es von nun an kurz Modell) ist, es kennt nicht den Vertrag, den Ihr Unternehmen gestern unterzeichnet hat, Ihre interne Wiki-Seite (interne Wissensdatenbank) oder die heute Morgen veröffentlichte Versionsmitteilung. Das Modell ist auf Allgemeinwissen bis zum Zeitpunkt seiner Schulung beschränkt; Dies wird als „Ausbildungsstichtag“ bezeichnet. RAG (Retrieval-Augmented Generation) füllt genau diese Lücke: Es findet die mit der Frage verbundenen Unternehmensdokumente, übergibt sie dem Modell als Kontext (also den zusätzlichen Text, den es bei der Antworterstellung liest) und lässt die Antwort auf Basis dieses Kontexts produzieren.

In dieser Einheit werden wir deutlich sehen, was RAG ist, wann es welchen Alternativen vorgezogen wird und welche Schritte eine typische RAG-Pipeline umfasst. Alle weiteren Einheiten werden die Teile dieser Karte nach und nach vertiefen.

Die Grundidee von RAG: Open-Book-Prüfung

Lassen Sie uns RAG in einem Satz erklären: „Suchen Sie zuerst das relevante Dokument, lassen Sie dann das Modell dieses Dokument lesen und drucken Sie die Antwort entsprechend aus.“

Die nützlichste Analogie ist diese: RAG verschiebt das Modell von einer „Closed-Book-Prüfung“ zu einer „Open-Book-Prüfung“. Bei der Prüfung mit geschlossenem Buch antwortet der Student nur aus dem Gedächtnis; Es besteht ein hohes Risiko, dass Sie etwas nachholen, woran Sie sich nicht erinnern. Bei der Open-Book-Prüfung antwortet der Student, indem er die vor ihm liegende Quelle betrachtet. In RAG antwortet das Modell nicht mehr aus seinem eigenen Gedächtnis, sondern aus dem aktuellen und spezifischen Text, den Sie ihm geben.

Kritischer Punkt: RAG verändert nicht die Gewichte des Modells, also die Milliarden numerischer Parameter, die das Modell gelernt hat. Sie trainieren das Modell nicht neu. Für jede Frage fügen Sie für diese Frage relevante Textabschnitte in die Eingabeaufforderung ein (Anweisungstext, der an das Modell gesendet wird). Sie müssen das Modell also nicht neu trainieren, wenn ein Dokument aktualisiert wird; Sie aktualisieren einfach den relevanten Datensatz in der Suchdatenbank.

Hinweis: Zwei Fragen bestimmen die Qualität des RAG: (1) Haben Sie das richtige Dokument gefunden? (2) Hat das Modell es richtig gelesen? Das erste ist „Abrufqualität“, das zweite ist „Generationsqualität“. Beide werden getrennt gemessen und verbessert.

RAG, Feinabstimmung oder langer Kontext?

Bei der Suche nach einer Lösung für ein organisatorisches Problem werden oft drei Wege verwechselt. Lassen Sie uns ihre Unterschiede klären. Bei der Feinabstimmung werden die Gewichte des Modells mit Ihren Daten aktualisiert und ihm ein neues Verhalten/ein neuer Stil beigebracht. Langer Kontext bedeutet, dass alle Dokumente ohne Auswahl direkt in die Eingabeaufforderung eingegeben werden.

Ansatz

Was bedeutet

Wann ist es angemessen?

Kosten/Risiko

RAG

Fügt das relevante Dokument als Kontext ein

Häufig wechselnde, umfangreiche, spezifische Informationen

Niedrig; Leicht zu aktualisieren, Quelle kann angegeben werden

Feinabstimmung

Aktualisiert Gewichte mit neuen Daten

Fester Stil/Format/Sprachunterricht

Hoch; Bei jedem Update ist eine erneute Schulung erforderlich

Nur langer Kontext

Füllt alle Dokumente in die Eingabeaufforderung ein

Kleines, stationäres Dokumentenset

Die Token-Kosten und das Risiko des „Verlusts des Mittelteils“ steigen

Als Regel gilt: Durch die Feinabstimmung wird dem Modell das Sprechen beigebracht; RAG teilt dem Modell mit, was es wissen muss. In den meisten Unternehmensszenarien wird RAG zuerst ausprobiert, da es kostengünstig und aktualisierbar ist und die Quelle der Antwort anzeigen kann. Ein langer Kontext ist sinnvoll, wenn der Dokumentensatz wirklich klein und fest ist (z. B. ein einzelnes 20-seitiges Handbuch); Aber bei Tausenden von Seiten ist es teuer und dem Modell fehlen möglicherweise Informationen mitten im Langtext.

Eine typische RAG-Pipeline

RAG besteht aus zwei Hauptphasen: Indizierung (Vorbereitung, einmalig oder regelmäßig durchgeführt) und Abfrage (wird bei jeder Benutzerfrage ausgeführt).

Schritt-für-Schritt-Indizierung (offline, ohne Benutzerwartezeit):

  1. Sammeln: Dokumente aus Quellen abrufen (PDF, Wiki, Ticketsystem, Datenbank, E-Mail).
  2. Chunking: Teilen Sie langen Text in kleinere, überschaubare Teile auf.
  3. Einbetten: Konvertieren Sie jeden Teil in Einbettung (den Zahlenvektor, der die Bedeutung des Textes trägt).
  4. Speichern: Schreiben Sie die Vektoren zusammen mit dem Text und den Metadaten (Quelle, Datum, Autorisierungsinformationen) in die Vektordatenbank.

Schritt-für-Schritt-Abfrage (online, während der Benutzer wartet):

  1. Konvertieren Sie die Frage des Benutzers in eine Einbettung.
  2. Rufen Sie die ähnlichsten Teile aus der Vektordatenbank ab.
  3. Platzieren Sie diese Teile + Frage in einer Eingabeaufforderungsvorlage.
  4. Erhalten Sie die kontextbezogene Antwort und ihre Quellen aus dem Modell.

# Konzeptioneller Überblick über die Anfragephase (unabhängig von der Sprache)question = "Wie viele Tage Jahresurlaub?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # most Similar partsprompt = f"""Beantworten Sie die FRAGE mit dem unten stehenden KONTEXT. Wenn die Antwort nicht im Kontext steht, sagen Sie „Ich habe keine Informationen darüber.“ Fitting.CONTEXT:{parts}FRAGE: {question}"""answer = model.uret(prompt) # z.B. Modell: Claude-Opus-4-8

Dieser Ablauf ist eine Karte jeder Phase, die wir in den folgenden Einheiten einzeln entpacken werden.

Schwache Eingabeaufforderung / Starke Eingabeaufforderung

Selbst bei demselben RAG-Kontext ändert die Qualität der Eingabeaufforderung die Antwort.

Schwache Eingabeaufforderung (offen für Modellanpassung, erfordert keine Ressourcen):

Nutzen Sie diese Informationen und sagen Sie Jahresurlaub: {parts}. Frage: {Frage}

Leistungsstarke Aufforderung (Begründung + „Ich weiß nicht“-Erlaubnis + Ressourcenanfrage):

Antworten Sie nur basierend auf dem KONTEXT unten. Wenn es im Kontext keine eindeutige Antwort gibt, schreiben Sie „Ich konnte in der Dokumentation keine Informationen dazu finden“; Raten Sie nicht. Fügen Sie am Ende Ihrer Antwort das Tag [Source: file_name] des Stücks hinzu, auf das Sie sich verlassen. KONTEXT: {Stücke} FRAGE: {Frage}

Drei Mini-Hüllen

Fall 1 – HR-Assistent (Personalwesen). Ein Unternehmen verfügt über ein 340-seitiges HR-Handbuch und Mitarbeiter stellen durchschnittlich 90 Fragen pro Tag. Es wurde eine Feinabstimmung versucht, aber da das Handbuch monatlich aktualisiert wurde, war jedes Mal eine erneute Schulung erforderlich; Die Kosten beliefen sich auf Tausende von Dollar pro Monat. Nach der Umstellung auf RAG wurde das Update auf den Schritt „Dokument neu indizieren“ (Minuten) reduziert und die Rate der richtigen Antworten stieg bei manueller Messung von 71 % auf 93 %.

Fall 2 – Kundensupport. Das Support-Team verfügt über 12.000 gelöste Tickets und 800 Hilfeartikel. Es dauert durchschnittlich 4 Minuten, bis ein Vertreter manuell eine Antwort findet. Als der RAG-Assistent die fünf relevantesten Datensätze brachte und einen Antwortentwurf erstellte, wurde die Zeit auf 40 Sekunden verkürzt; Das Team erkannte jedoch das Risiko, „unsicher zu wirken, wenn man den falschen Artikel mitbringt“, und machte die Angabe der Quelle zur Pflicht.

Fall 3 – Recht. Ein Vertragsteam fragte: „In welchen Verträgen gilt die Vertraulichkeitsklausel für 5 Jahre?“ er stellt die Frage. Im langen Kontextversuch wurden 60 Verträge in einer einzigen Eingabeaufforderung ausgefüllt; Das Modell hat die beiden mittleren Verträge übersprungen. Wenn mit RAG nur die relevanten Gegenstände eingeführt wurden, sanken die Token-Kosten um 80 % und das fehlende Überspringen wurde zurückgesetzt.

Warum wird RAG benötigt?

  • Aktualität: Sie erhalten Informationen nach dem Schulungsschluss.
  • Besonderer Hinweis: Ihre internen Unterlagen fließen nicht in die Ausbildung eines Models ein; Nur du kannst geben.
  • Überprüfbarkeit: Sie können die Quelle der Antwort angeben (Zitat) – wichtig für Prüfung und Vertrauen.
  • Halluzinationskontrolle: Sie beruht auf dem davor platzierten Text und nicht auf der Erstellung eines Modells.
  • Kosten: Die Inbetriebnahme ist wesentlich günstiger und schneller als die Feinabstimmung.
Achtung: RAG ist keine Zauberei. Wenn Sie das falsche Teil einbringen, gelangt das Modell zur falschen Antwort und sieht „selbstbewusst“ aus. Beachten Sie den Satz „Abrufqualität = RAG-Qualität“.

Häufige Fehler

  • Verwechseln Sie RAG mit Feinabstimmung: RAG ändert die Gewichte nicht; Es fügt lediglich Kontext hinzu. Eine Verwechslung dieser beiden führt zur Wahl der falschen Architektur.
  • „Ich weiß nicht“ nicht zulassen: Wenn die Aufforderung dem Modell die Möglichkeit lässt, die Lücke auszufüllen, wird es sich versöhnen.
  • Keine Quellenangabe: Eine Antwort ohne Quellenangabe kann nicht überprüft werden; Der Benutzer kann den Fehler nicht bemerken.
  • Alles in einer Eingabeaufforderung zusammenpacken: Langer Kontext sieht billig aus, ist aber teuer und es fehlen die mittleren Informationen.
  • In der Generierung stecken bleiben, ohne den Abruf zu messen: Wenn die Antwort schlecht ist, fragen Sie zuerst: „Ist das richtige Teil angekommen?“ sollte gefragt werden.

Zusammenfassend

  • RAG ist ein Ansatz, der für die Fragestellung relevante Dokumente als Kontext in das Modell einfügt; verändert die Gewichte nicht („Open-Book-Prüfung“).
  • Die Feinabstimmung lehrt Stil/Format, RAG liefert aktuelle und spezifische Informationen; Der lange Kontext eignet sich gut für kleine feste Mengen. In den meisten Szenarien wird zuerst RAG ausprobiert.
  • Die Pipeline besteht aus zwei Phasen: Offline-Indizierung (Chunk + Einbettung + Speichern) und Online-Abfrage (Abruf + Eingabeaufforderung + Generieren).
  • RAG bietet Aktualität, spezifische Informationen, Überprüfbarkeit, Halluzinationskontrolle und niedrige Kosten.
  • Die Qualität des Systems hängt direkt von der Qualität des Abrufs ab: Falsches Stück bedeutet falsche Antwort.

Anwendungsaufgabe

Wählen Sie eine echte Informationsquelle aus Ihrem eigenen Team (z. B. ein Verfahrensdokument oder eine FAQ-Seite). (1) Schreiben Sie 5 sachliche Fragen zu dieser Quelle. (2) Notieren Sie, welcher Teil des Dokuments die richtige Antwort für jede Frage enthält – dies wird Ihre „Goldene Antwort“-Liste. (3) Fügen Sie mithilfe der Vorlage „starke Aufforderung“ oben den relevanten Abschnitt manuell als Kontext ein und fragen Sie ein Modell. (4) Vergleichen Sie die vom Modell gegebene Antwort mit der goldenen Antwort und markieren Sie sie als wahr/falsch. Dies ist die erste manuelle Version der Bewertung, die Sie in zukünftigen Einheiten automatisieren werden.

Checkliste

  • [ ] Ich kann in einem Satz erklären, dass RAG die Gewichte nicht ändert, sondern lediglich Kontext hinzufügt.
  • [ ] Ich kann zwischen RAG, Feinabstimmung und langem Kontext unterscheiden und wann was angemessen ist.
  • [ ] Ich kann die Phasen der Indizierung (Collect-Shred-Embed-Save) und der Abfrage (Embed-Fetch-Prompt-Generate) der Reihe nach zählen.
  • [ ] Ich weiß, warum ich der Eingabeaufforderung die Anweisungen „Wenn es nicht im Kontext steht, sagen Sie, ich weiß es nicht“ und „Quelle angeben“ hinzugefügt habe.
  • [ ] Das Prinzip „Retrieval-Qualität = RAG-Qualität“ kann ich auf meinen eigenen Fall anpassen.