zisky:
- Vysvětlení, že RAG vkládá kontext bez změny vah modelu a pracuje s logikou „otevřené knihy“
- Porovnání RAG s přístupy jemného ladění a dlouhého kontextu podle nákladů, včasnosti a scénáře použití
- Výpis kroků typického kanálu RAG sestávajícího z indexování a fáze dotazování
Bez ohledu na to, jak mocný je jazykový model (umělá inteligence, která rozumí textu a vytváří ho; od této chvíle mu budeme zkráceně říkat model), nezná smlouvu, kterou vaše společnost podepsala včera, vaši interní stránku wiki (interní znalostní báze) ani poznámku k vydání zveřejněnou dnes ráno. Model je omezen na všeobecné znalosti až do data, kdy byl trénován; Říká se tomu „datum ukončení vzdělávání“. RAG (Retrieval-Augmented Generation) přesně zaplňuje tuto mezeru: najde firemní dokumenty vztahující se k otázce, dá je modelu jako kontext (tj. doplňkový text, který bude číst při vytváření odpovědi) a nechá na základě tohoto kontextu vytvořit odpověď.
V této jednotce jasně uvidíme, co je RAG, kdy je preferováno před jakými alternativami, a kroky typického potrubí RAG. Všechny následující jednotky budou postupně prohlubovat části této mapy.
Základní myšlenka RAG: Zkouška z otevřené knihy
Vysvětleme RAG jednou větou: "Nejprve najděte příslušný dokument, poté nechte model, aby si tento dokument přečetl a podle toho vytiskl odpověď."
Nejužitečnější analogie je tato: RAG posouvá model z „uzavřené knihy zkoušky“ na „zkoušku z otevřené knihy“. V uzavřené knižní zkoušce student odpovídá pouze zpaměti; Existuje vysoké riziko, že si vymyslíte, co si nepamatujete. Při zkoušce z otevřené knihy student odpovídá pohledem na pramen umístěný před ním. V RAG už model neodpovídá z vlastní paměti, ale z aktuálního a konkrétního textu, který mu dáte.
Kritický bod: RAG nemění váhy modelu, tedy miliardy numerických parametrů, které se model naučil. Model nepřeškolíte. U každé otázky vložíte do výzvy (instrukční text odeslaný do modelu) kusy textu relevantní pro danou otázku. Při aktualizaci dokumentu tedy nemusíte model znovu trénovat; jednoduše obnovíte příslušný záznam ve vyhledávací databázi.
Tip: Kvalitu RAG určují dvě otázky: (1) Našli jste správný dokument? (2) Přečetl to model správně? První je „kvalita vyhledávání“, druhá „kvalita generace“. Oba se měří a zlepšují samostatně.
RAG, jemné doladění nebo dlouhý kontext?
Při hledání řešení organizačního problému se často zaměňují tři cesty. Pojďme si ujasnit jejich rozdíly. Jemné doladění je aktualizace vah modelu s vašimi daty a naučení nového chování/stylu. Dlouhý kontext znamená vyplnění všech dokumentů přímo do výzvy bez jakéhokoli výběru.
Přístup
Co dělá
Kdy je to vhodné?
Cena / riziko
RAG
Vloží relevantní dokument jako kontext
Často se měnící, rozsáhlé, konkrétní informace
Nízká; snadno aktualizovat, zdroj lze citovat
Jemné doladění
Aktualizuje váhy novými daty
Pevný styl/formát/výuka jazyků
vysoká; Při každé aktualizaci je vyžadováno přeškolení
Pouze dlouhý kontext
Vyplní všechny dokumenty do výzvy
Malá, pevná sada dokumentů
Náklady na token a riziko „ztráty střední části“ se zvyšují
Zpravidla: Jemné ladění učí model mluvit; RAG říká modelu, co má vědět. Ve většině podnikových scénářů se nejprve zkouší RAG, protože je levný, aktualizovatelný a může ukázat zdroj odpovědi. Dlouhý kontext je rozumný, pokud je sada dokumentů opravdu malá a pevná (např. jeden 20stránkový manuál); Ale s tisíci stránkami je to drahé a modelu mohou uprostřed dlouhého textu chybět informace.
Typické potrubí RAG
RAG se skládá ze dvou hlavních fází: indexování (příprava, provádí se jednou nebo pravidelně) a dotazování (běží na každou uživatelskou otázku).
Indexování krok za krokem (offline, bez čekání uživatele):
- Sbírejte: Vytáhněte dokumenty ze zdrojů (PDF, wiki, lístkový systém, databáze, e-mail).
- Chunking: Rozdělte dlouhý text na menší zvládnutelné části.
- Vložit: Převede každou část na vložení (číselný vektor, který nese význam textu).
- Uložit: Zapište vektory spolu s textem a metadaty (zdroj, datum, informace o autorizaci) do databáze vektorů.
Dotaz krok za krokem (online, zatímco uživatel čeká):
- Převeďte uživatelovu otázku na vložení.
- Získejte nejpodobnější části z vektorové databáze.
- Umístěte tyto kousky + otázku do šablony výzvy.
- Získejte kontextovou odpověď a její zdroje z modelu.
# Koncepční náčrt fáze dotazování (nezávisí na jazyce)question = "Kolik dní roční dovolené?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # nejpodobnější částiprompt = f"""Odpovězte na OTÁZKU pomocí KONTEXTU níže. Pokud odpověď nemá žádné informace o kontextu." Fitting.CONTEXT:{parts}OTÁZKA: {question}"""odpověď = model.uret(prompt) # např. model: claude-opus-4-8
Tento tok je mapou každé etapy, kterou si postupně rozbalíme v následujících celcích.
Slabá výzva / Silná výzva
I při stejném kontextu RAG změní kvalita výzvy odpověď.
Slabá výzva (otevřená pro montáž modelu, nevyžaduje zdroje):
Použijte tyto informace a řekněte roční dovolenou: {části}. Otázka: {question}
Výkonná výzva (uzemnění + oprávnění „nevím“ + požadavek na zdroj):
Odpovězte pouze na základě KONTEXTU níže. Pokud v kontextu neexistuje jednoznačná odpověď, napište „Informace o tom jsem v dokumentaci nenašel“; Nehádejte. Na konec své odpovědi přidejte tag [Source: file_name] kusu, na který spoléháte. KONTEXT: {kusy} OTÁZKA: {question}
Tři mini pouzdra
Případ 1 — HR asistent (lidské zdroje). Společnost má 340stránkovou HR příručku a zaměstnanci položí průměrně 90 otázek denně. Bylo vyzkoušeno jemné doladění, ale protože manuál byl aktualizován měsíčně, bylo nutné pokaždé přeškolit; Náklady dosáhly tisíců dolarů měsíčně. Po přepnutí na RAG byla aktualizace snížena na krok „přeindexování dokumentu“ (minuty) a míra správných odpovědí se zvýšila ze 71 % na 93 % při ručním měření.
Případ 2 — Zákaznická podpora. Tým podpory má 12 000 vyřešených lístků a 800 článků nápovědy. Ruční nalezení odpovědi zástupci trvá v průměru 4 minuty. Když asistent RAG přinesl 5 nejdůležitějších záznamů a vytvořil návrh odpovědi, čas se zkrátil na 40 sekund; Ale tým si uvědomil riziko, že „bude vypadat nejistě tím, že přinese nesprávný článek“ a učinil povinné uvedení zdroje.
Případ 3 — Právo. Smluvní tým se zeptal: "ve kterých smlouvách platí doložka o důvěrnosti 5 let?" položí otázku. V dlouhém kontextu procesu bylo 60 smluv vyplněno do jediné výzvy; model přeskočil prostřední dvě smlouvy. Když byly s RAG zavedeny pouze relevantní položky, cena tokenu se snížila o 80 % a chybějící přeskakování bylo resetováno.
Proč je potřeba RAG?
- Aktuálnost: Informace získáte po datu ukončení školení.
- Zvláštní informace: Vaše interní dokumenty nejsou součástí školení žádného modelu; Jen ty můžeš dát.
- Ověřitelnost: Můžete uvést zdroj odpovědi (citace) – zásadní pro audit a důvěru.
- Kontrola halucinací: Spoléhá se spíše na text umístěný před ní než na vytváření modelu.
- Cena: Uvedení do provozu je mnohem levnější a rychlejší než jemné doladění.
Pozor: RAG není magie. Pokud přinesete špatný kus, model dospěje ke špatné odpovědi a bude vypadat „sebevědomě“. Mějte na paměti frázi „Kvalita vyhledávání = kvalita RAG“.
Časté chyby
- Záměna RAG za jemné doladění: RAG nemění hmotnosti; Jen dodává kontext. Záměna těchto dvou povede k výběru špatné architektury.
- Nepovolení „nevím“: Pokud výzva ponechá modelu volnost ve vyplnění prázdného místa, vyrovná se.
- Neuvádění zdrojů: Odpověď bez zdroje nelze zkontrolovat; Uživatel si nemůže všimnout chyby.
- Nacpat vše do jedné výzvy: Dlouhý kontext vypadá lacině, ale je drahý a postrádá střední informace.
- Zaseknutí se v generování bez měření vyhledávání: Pokud je odpověď špatná, nejprve se zeptejte "Dorazila správná část?" je třeba se zeptat.
V souhrnu
- RAG je přístup, který vkládá dokumenty relevantní pro danou otázku do modelu jako kontextu; nemění váhy ("otevřená zkouška").
- Jemné ladění učí styl/formát, RAG poskytuje aktuální a konkrétní informace; dlouhý kontext funguje dobře pro malé pevné sady. Ve většině scénářů se nejprve zkouší RAG.
- Potrubí má dvě fáze: offline indexování (chunk + vkládání + uložení) a online dotazování (načítání + výzva + generování).
- RAG poskytuje včasnost, konkrétní informace, ověřitelnost, kontrolu halucinací a nízkou cenu.
- Kvalita systému přímo závisí na kvalitě vyhledávání: špatný kus znamená špatnou odpověď.
Aplikační úkol
Vyberte si skutečný zdroj informací ze svého vlastního týmu (např. postupový dokument nebo stránku s často kladenými dotazy). (1) Napište 5 faktických otázek o tomto zdroji. (2) Všimněte si, která část dokumentu obsahuje správnou odpověď na každou otázku – toto se stane vaším seznamem „zlatých odpovědí“. (3) Pomocí výše uvedené šablony „silné výzvy“ ručně vložte příslušnou sekci jako kontext a zeptejte se modelu. (4) Porovnejte odpověď danou modelem se zlatou odpovědí a označte ji jako pravdivou/nepravdivou. Toto je první manuální verze hodnocení, kterou budete v budoucích jednotkách automatizovat.
kontrolní seznam
- [ ] Jednou větou mohu vysvětlit, že RAG nemění váhy, jen dodává kontext.
- [ ] Dokážu rozlišit mezi RAG, doladěním a dlouhým kontextem a kdy je to vhodné.
- [ ] Fáze indexování (sbírat-skartovat-vložit-uložit) a dotazovat (vložit-načíst-prompt-generovat) mohu spočítat v pořádku.
- [ ] Vím, proč jsem do výzvy přidal pokyny „pokud to není v kontextu, řekni, že nevím“ a „uveďte zdroj“.
- [ ] Princip „Kvalita vyhledávání = kvalita RAG“ mohu přizpůsobit vlastnímu případu.