Einheit 4 / 11

Retrieval-Strategien: Top-k, Hybrid, Re-Ranking

Gewinne:

  • Implementierung einer Hybridsuche, die Top-K-Auswahl sowie Semantik- und Schlüsselwortsuche kombiniert
  • Erhöhung der Genauigkeit der ersten Suche durch Re-Ranking
  • Schwierige Fragen durch Techniken wie Abfragetransformation und HyDE leichter durchsuchbar machen

Du hast die Dokumente schön geschreddert und in die Vektordatenbank gestellt. Jetzt kommt die eigentliche Arbeit: die richtigen Teile herauszuholen, wenn der Benutzer eine Frage stellt. Dies wird als Retrieval bezeichnet und ist das Rückgrat der RAG-Qualität. Denken Sie an den Satz „Abrufqualität = RAG-Qualität“; Dieses Gerät ist genau die Kunst, diese Qualität zu verbessern. Wir werden praktische Techniken von der Top-K-Auswahl bis zur Hybridsuche, vom Re-Ranking bis zur Abfragetransformation behandeln.

Top-k: Wie viele Teile werden wir mitbringen?

Die grundlegendste Einstellung: wie viele Teile (k) von der Suche zurückgegeben werden sollen. Wenn Sie weniger mitbringen (k=1), besteht ein hohes Risiko, dass Sie das richtige Teil verpassen; Wenn Sie zu viel hinzufügen (k=20), wird das Modell verrauscht und die Token-Kosten steigen.

Unterscheiden Sie zwischen zwei Konzepten. Rückruf: Die Rate, mit der das richtige Stück unter den abgerufenen ist. Präzision: Die Geschwindigkeit, mit der das, was abgerufen wird, relevant ist. Durch Erhöhen von k wird die Erinnerung erhöht, aber die Präzision verringert. Ziel ist es, beides in Einklang zu bringen.

top-k

Auswirkungen

passende Situation

1-3

Hohe Präzision, Gefahr eines Fehlschlags

Einfache Fragen mit einer Antwort

4-8

Gleichgewicht; die meisten Szenarien

Allgemeines Unternehmens-RAG

10-20

Höhere Erinnerung, Lärm nimmt zu

Mit Neubewertung (unten)

Tipp: Gängiges und wirkungsvolles Muster: weit holen (k=20), dann eingrenzen mit Neu-Rangfolge (Top 4). Auf diese Weise verpassen Sie nichts und geben dem Modell einen klaren Kontext.

Hybridsuche: Die Kraft zweier Suchen

Die semantische (Vektor-)Suche erfasst die Bedeutung, übersieht aber Dinge: vollständigen Produktcode („XR-4471“), seltene Abkürzung, Eigenname, Versionsnummer. Für diese exakt passenden Aufgaben eignet sich die altmodische Stichwortsuche – insbesondere der klassische Algorithmus namens BM25 – sehr gut.

Die Hybridsuche kombiniert beides: Sowohl die semantische Suche als auch die Stichwortsuche funktionieren und kombinieren die Ergebnisse. Bei einer Frage wie „Gewährleistungsfrist des

Das Zusammenführen erfolgt in der Regel mit RRF (Reciprocal Rank Fusion): Der Titel, der in beiden Listen höher liegt, kommt nach vorne.

# Hybrider Abruf (konzeptionell)sem = vector_search(question, k=20) # meaningkey = bm25_search(question, k=20) # fullwordresult = rrf_merge(sem, key)[:8] # Verschmelzung der beiden, Top 8

Neubewertung: Zweiter und intelligenterer Pass

Der erste Anruf kann schnell, aber unhöflich sein. Bei der Neubewertung werden die bei der ersten Suche zurückgegebenen Kandidaten nacheinander mit einem leistungsfähigeren Modell bewertet (normalerweise ein Cross-Encoder – ein Modell, das die Frage und die Passage zusammen liest und die Relevanz bewertet) und die relevantesten Kandidaten an die Spitze verschoben.

Die Logik ist folgende: Die erste Suche weist eine große Anzahl von Kandidaten für den Rückruf zu (20 Kandidaten), der Re-Ranker wählt aus Präzisionsgründen die besten 4 aus. Dieser zweistufige Ansatz ist wesentlich genauer als eine einstufige Suche. Es kostet einige Verzögerung und zusätzliche Bearbeitung; Der Gewinn ist eine deutliche Qualitätssteigerung.

# Zweistufiger Abruf (konzeptionell)candidates = hybrid_search(question, k=20) # broad, quickscore = reranker.score(question,candidates) # Relevanzbewertung für jeden Kandidaten context =rated.rank()[:4] # top 4

Transformieren der Abfrage

Manchmal liegt das Problem nicht in der Suche, sondern in der Frage selbst. Wenn der Benutzer fragt: „Was ist mit Remote-Mitarbeitern?“ ', kann dies nicht allein erreicht werden (es ist nicht klar, was für Telearbeiter gilt). Hier sind die Abfragetransformationstechniken:

  • Umschreiben: Verwenden Sie den Gesprächsverlauf, um die Frage eigenständig zu machen: „Welche Rechte haben Telearbeiter auf Jahresurlaub?“
  • Mehrfachabfrage: Erzeugen Sie drei verschiedene Ausdrücke derselben Frage, suchen Sie mit allen und kombinieren Sie die Ergebnisse. Unterschiedliche Wörter finden unterschiedliche Teile.
  • HyDE (Hypothetical Document Embeddings): Geben Sie zunächst eine „mögliche Antwort“ auf das Modell aus, betten Sie dann diese imaginäre Antwort ein und suchen Sie danach. Die imaginäre Antwort wird manchmal als besser empfunden, weil sie dem echten Dokument in Worten näher kommt.

# Multi-Abfrage (konzeptionell)variants = model.uret("Drücken Sie diese Frage auf drei verschiedene Arten aus: " + Frage)tum_sonuc = []für v in Varianten: all_sonuc += vector_intermediate(v, k=6)context = singular_and_order(tum_result)[:6]

Schwacher Abruf / Starker Abruf

Schwach (einstufig, nur Semantik, konstant k=3):

result = vector_search(question, k=3)# Problem: Produktcode fehlt, bei schwierigen Fragen kann Teil 3 nicht korrekt eingegeben werden.

Leistungsstark (Hybrid + Widek + Re-Ranking + ggf. Mehrfachabfrage):

Kandidaten = hybrid_search(rewrite(Frage, Vergangenheit), k=20)context = reranker.score(Frage, Kandidaten).first(4)# Sowohl die genaue Übereinstimmung als auch die Bedeutung werden erfasst; Es geht an die besten 4 Modelle.

Drei Mini-Hüllen

Fall 1 – Der Produktcode wurde maskiert. Eine rein semantische Suche bei einem Support-Team konnte „RTX-9080“ nicht wörtlich in der Frage „RTX-9080-Treiberfehler“ finden; Er brachte andere Produkte mit ähnlichen Namen mit. Als die Hybridsuche hinzugefügt wurde, kam es zu einer exakten Codeübereinstimmung und die Rate der zurückgegebenen korrekten Artikel stieg von 58 % auf 92 %.

Fall 2 – Unterschied in der Neubewertung. Ein Rechtsanwaltsgehilfe hat mit k=5 gearbeitet, aber der richtige Wert ist meistens 7-10. Er blieb in den Reihen. Als k=20 + Re-Ranking eingeführt wurde, stieg die Rate, mit der der richtige Artikel in den Top 3 landete, von 61 % auf 94 %; Die Latenz erhöhte sich nur um 300 ms – ein akzeptabler Kompromiss.

Fall 3 – Folgefrage ohne Kontext. In einem HR-Assistenten fragt der Benutzer: „Was ist mit Teilzeitbeschäftigten?“ Als ich nachfragte, brachte das System irrelevante Teile. Durch Umschreiben der Abfrage (Herausziehen des Kontexts „Jahresurlaub“ aus der Vergangenheit und Hinzufügen von „Teilzeitbeschäftigte haben Anspruch auf Jahresurlaub“) erhöhte sich die richtige Antwortquote von 40 % auf 86 %.

Häufige Fehler

  • Ausschließlich semantische Suche: Produktcode, Abkürzung, Eigenname fehlen; Hybrid hinzufügen.
  • k zu klein halten: Das richtige Stück kann nicht in die Liste aufgenommen werden; Machen Sie es breiter und verengen Sie es mit Re-Rank.
  • Denken Sie nie an eine Neubewertung: Die erste Suche ist unhöflich; Der zweite Smart Pass verbessert die Qualität deutlich.
  • Suche nach Folgefragen wie sie ist: Eine Frage ohne Kontext sucht nach bedeutungslosem; umschreiben.
  • Blindes Erhöhen von k (ohne Neubewertung): Das Modell ist mit Rauschen gefüllt, die Antwort ist verzerrt und die Kosten steigen.
Achtung: Jede Technik verursacht zusätzliche Kosten und Verzögerungen. Multi-Query bedeutet 3-fache Suche, Re-Ranking bedeutet zusätzlicher Modellaufruf. Beginnen Sie zuerst mit einem einfachen Hybrid + einem vernünftigen k; Messen Sie schwere Techniken ab und fügen Sie sie dort hinzu, wo sie wirklich benötigt werden. Addieren ohne Messen.

Zusammenfassend

  • Top-k ist die Balance zwischen Erinnerung und Präzision; Im Allgemeinen ist 4-8 ein guter Anfang.
  • Die Hybridsuche kombiniert semantische Suche mit Schlüsselwortsuche (BM25); Stellt exakte Übereinstimmungen wieder her.
  • Beim Re-Ranking werden die Kandidaten aus der breiten Erstsuche mit einem robusten Modell neu bewertet und die besten ausgewählt.
  • Die Abfragetransformation (Rewriting, Multi-Query, HyDE) macht schwierige und kontextfreie Fragen durchsuchbar.
  • Starkes Muster: Broad Fetch → Merge mit Hybrid → Enge mit Re-Rank; aber fügen Sie jede Technik hinzu, indem Sie sie messen.

Anwendungsaufgabe

Bereiten Sie 6 schwierige Fragen mit Daten aus vorherigen Einheiten vor: mindestens 2 erfordern genaue Übereinstimmungen (Produktcode, Abkürzung, Datum), 2 semantische (gleiches Thema mit unterschiedlichen Wörtern) und 2 Folgefragen ohne Kontext. (1) Stellen Sie sich jede Frage zunächst als reine semantische Suche vor und markieren Sie manuell, welche Teile angezeigt werden. (2) Bewerten Sie dieselben Fragen noch einmal mit Hybrid und Neubewertung. (3) Folgefragen ohne Kontext neu formulieren. Notieren Sie in tabellarischer Form, welche Technik bei welchem ​​Fragetyp einen Unterschied macht.

Checkliste

  • [ ] Ich weiß, dass Top-K ein Rückrufpräzisionsgleichgewicht und einen angemessenen Startbereich ist.
  • [ ] Ich kann erklären, warum die Hybridsuche exakte Übereinstimmungen wiederherstellt.
  • [ ] Ich kann die zweistufige Logik der Neubewertung anwenden (breit → intelligent schmal).
  • [ ] Ich erkenne die Notwendigkeit, Folgefragen ohne Kontext neu zu formulieren.
  • [ ] Ich bestätige, dass ich schwere Techniken durch Messen und nicht durch Messen hinzugefügt habe.