zisky:
- Vysvetlenie, že RAG vkladá kontext bez zmeny váh modelu a pracuje s logikou „otvorenej knihy“
- Porovnanie RAG s dolaďovacími a dlhými kontextovými prístupmi podľa nákladov, včasnosti a scenára použitia
- Výpis krokov typického potrubia RAG pozostávajúceho z fáz indexovania a dotazovania
Bez ohľadu na to, aký silný je jazykový model (umelá inteligencia, ktorá rozumie a vytvára text; odteraz ho budeme skrátene nazývať model), nepozná zmluvu, ktorú vaša spoločnosť podpísala včera, vašu internú stránku wiki (interná vedomostná báza) ani poznámku k vydaniu zverejnenú dnes ráno. Model je obmedzený na všeobecné znalosti až do dátumu, kedy bol vyškolený; Toto sa nazýva „terminálny termín vzdelávania“. RAG (Retrieval-Augmented Generation) presne vypĺňa túto medzeru: nájde firemné dokumenty súvisiace s otázkou, poskytne ich modelu ako kontext (to znamená dodatočný text, ktorý bude čítať pri vytváraní odpovede) a nechá vypracovať odpoveď na základe tohto kontextu.
V tejto jednotke jasne uvidíme, čo je RAG, kedy sa uprednostňuje pred akými alternatívami a kroky typického potrubia RAG. Všetky nasledujúce jednotky budú postupne prehlbovať časti tejto mapy.
Základná myšlienka RAG: Skúška z otvorenej knihy
Vysvetlime RAG jednou vetou: "Najprv nájdite príslušný dokument, potom nechajte model, aby si tento dokument prečítal a podľa toho vytlačil odpoveď."
Najužitočnejšia analógia je toto: RAG posúva model z „uzavretej knihy“ na „skúšku z otvorenej knihy“. Pri skúške z uzavretej knihy žiak odpovedá len spamäti; Existuje vysoké riziko, že si vymyslíte, čo si nepamätáte. Pri skúške z otvorenej knihy študent odpovedá pohľadom na prameň umiestnený pred ním. V RAG už model neodpovedá z vlastnej pamäte, ale z aktuálneho a konkrétneho textu, ktorý mu zadáte.
Kritický bod: RAG nemení váhy modelu, teda miliardy numerických parametrov, ktoré sa model naučil. Modelku nepreškolíte. Pre každú otázku vložíte kúsky textu relevantné pre danú otázku do výzvy (text pokynov odoslaný modelu). Takže pri aktualizácii dokumentu nemusíte preškolovať model; jednoducho obnovíte príslušný záznam vo vyhľadávacej databáze.
Tip: Dve otázky určujú kvalitu RAG: (1) Našli ste správny dokument? (2) Prečítal to model správne? Prvým je „kvalita vyhľadávania“, druhým „kvalita generácie“. Tieto dva sa merajú a zlepšujú samostatne.
RAG, jemné ladenie alebo dlhý kontext?
Pri hľadaní riešenia organizačného problému sa často zamieňajú tri cesty. Ujasnime si ich rozdiely. Jemné ladenie je aktualizácia váh modelu vašimi údajmi a naučenie nového správania/štýlu. Dlhý kontext znamená vyplnenie všetkých dokumentov priamo do výzvy bez akéhokoľvek výberu.
Prístup
Čo robí
Kedy je to vhodné?
Cena / riziko
RAG
Vloží príslušný dokument ako kontext
Často sa meniace, rozsiahle, špecifické informácie
Nízka; ľahko aktualizovať, zdroj je možné citovať
Jemné dolaďovanie
Aktualizuje váhy novými údajmi
Pevný štýl/formát/výučba jazyka
Vysoká; Pri každej aktualizácii sa vyžaduje preškolenie
Len dlhý kontext
Vyplní všetky dokumenty do výzvy
Malá, pevná súprava dokumentov
Náklady na symbol a riziko „straty strednej časti“ sa zvyšujú
Spravidla: Jemné ladenie učí model hovoriť; RAG hovorí modelu, čo má vedieť. Vo väčšine podnikových scenárov sa najskôr skúša RAG, pretože je lacný, dá sa aktualizovať a môže ukázať zdroj odpovede. Dlhý kontext je primeraný, ak je súbor dokumentov skutočne malý a pevný (napr. jeden 20-stranový manuál); Ale s tisíckami strán je to drahé a modelke môžu uprostred dlhého textu chýbať informácie.
Typické RAG potrubie
RAG pozostáva z dvoch hlavných fáz: indexovanie (príprava, vykonáva sa raz alebo pravidelne) a dotazovanie (beží na každú otázku používateľa).
Indexovanie krok za krokom (offline, bez čakania používateľa):
- Zhromažďovanie: Stiahnite si dokumenty zo zdrojov (PDF, wiki, tiketový systém, databáza, e-mail).
- Rozdeľovanie: Rozdeľte dlhý text na menšie zvládnuteľné časti.
- Vložiť: Prevedie každú časť na vloženie (číselný vektor, ktorý nesie význam textu).
- Uložiť: Zapíšte vektory spolu s textom a metaúdajmi (zdroj, dátum, autorizačné informácie) do databázy vektorov.
Podrobný dopyt (online, kým používateľ čaká):
- Skonvertujte otázku používateľa na vkladanie.
- Získajte najpodobnejšie časti z vektorovej databázy.
- Umiestnite tieto kúsky + otázku do šablóny výzvy.
- Získajte kontextovú odpoveď a jej zdroje z modelu.
# Koncepčný náčrt fázy dopytovania (nezávisí od jazyka)question = "Koľko dní ročnej dovolenky?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # najpodobnejšie dielyprompt = f"""Na OTÁZKU odpovedzte pomocou KONTEXTU nižšie. Ak odpoveď nie je v kontexte, povedzte "Nemám žiadne informácie o." Fitting.CONTEXT:{parts}OTÁZKA: {question}"""odpoveď = model.uret(prompt) # napr. model: claude-opus-4-8
Tento tok je mapou každej etapy, ktorú postupne rozbalíme v nasledujúcich celkoch.
Slabá výzva / silná výzva
Aj pri rovnakom kontexte RAG kvalita výzvy mení odpoveď.
Slabá výzva (otvorená pre montáž modelu, nevyžaduje zdroje):
Použite tieto informácie a povedzte ročná dovolenka: {časti}. Otázka: {question}
Výkonná výzva (uzemnenie + povolenie „neviem“ + požiadavka na zdroj):
Odpovedzte len na základe KONTEXTU nižšie. Ak v kontexte neexistuje jednoznačná odpoveď, napíšte „V dokumentácii som o tom nenašiel informácie“; Nehádajte. Na koniec odpovede pridajte značku [Source: file_name] časti, na ktorú sa spoliehate. KONTEXT: {kúskov} OTÁZKA: {question}
Tri mini puzdrá
Prípad 1 – HR asistent (ľudské zdroje). Firma má 340-stranovú HR príručku a zamestnanci sa jej pýtajú v priemere 90 otázok denne. Skúšalo sa dolaďovanie, ale keďže manuál bol aktualizovaný mesačne, zakaždým bolo potrebné preškolenie; Náklady dosiahli tisíce dolárov mesačne. Po prepnutí na RAG sa aktualizácia zredukovala na krok „preindexovanie dokumentu“ (minúty) a miera správnych odpovedí sa zvýšila zo 71 % na 93 % pri manuálnom meraní.
Prípad 2 – Zákaznícka podpora. Tím podpory má 12 000 vyriešených lístkov a 800 článkov pomocníka. Manuálne nájdenie odpovede zástupcovi trvá v priemere 4 minúty. Keď asistent RAG priniesol 5 najrelevantnejších záznamov a vytvoril návrh odpovede, čas sa skrátil na 40 sekúnd; Ale tím si uvedomil riziko, že „bude vyzerať neisto tým, že prinesie nesprávny článok“ a zaviedol povinné uvádzanie zdroja.
Prípad 3 – Zákon. Zmluvný tím sa opýtal, "v ktorých zmluvách platí doložka o dôvernosti 5 rokov?" kladie otázku. V dlhej kontextovej skúške bolo vyplnených 60 zmlúv do jednej výzvy; model preskočil prostredné dve zmluvy. Keď boli s RAG zavedené iba príslušné položky, cena tokenu sa znížila o 80 % a chýbajúce preskakovanie bolo vynulované.
Prečo je potrebná RAG?
- Aktuálnosť: Informácie získate po dátume uzávierky školenia.
- Špeciálne informácie: Vaše interné dokumenty nie sú zahrnuté do školenia žiadneho modelu; Len ty môžeš dať.
- Overiteľnosť: Môžete uviesť zdroj odpovede (citáciu), čo je nevyhnutné pre audit a dôveru.
- Kontrola halucinácií: Spolieha sa skôr na text umiestnený pred ňou, než na vytvorenie modelu.
- Náklady: Uvedenie do prevádzky je oveľa lacnejšie a rýchlejšie ako jemné dolaďovanie.
Pozor: RAG nie je mágia. Ak prinesiete nesprávny kus, model dospeje k nesprávnej odpovedi a bude vyzerať „isto“. Majte na pamäti frázu „Kvalita zberu = kvalita RAG“.
Časté chyby
- Chyba RAG pre jemné doladenie: RAG nemení hmotnosti; Len to pridáva kontext. Zámena týchto dvoch povedie k výberu nesprávnej architektúry.
- Nepovoliť „neviem“: Ak výzva ponechá modelu voľnú ruku na vyplnenie prázdneho miesta, vyrovná sa.
- Neuvádzanie zdrojov: Odpoveď bez zdroja nie je možné skontrolovať; Používateľ si chybu nemôže všimnúť.
- Vtesnať všetko do jednej výzvy: Dlhý kontext vyzerá lacno, ale je drahý a chýba mu stredná informácia.
- Uviaznutie v generácii bez merania vyhľadávania: Ak je odpoveď zlá, najskôr sa opýtajte: „Dorazila správna časť?“ treba sa opýtať.
V súhrne
- RAG je prístup, ktorý vkladá dokumenty relevantné pre danú otázku do modelu ako kontextu; nemení váhy („skúška z otvorenej knihy“).
- Jemné ladenie učí štýl/formát, RAG poskytuje aktuálne a špecifické informácie; dlhý kontext funguje dobre pre malé pevné množiny. Vo väčšine scenárov sa najskôr skúša RAG.
- Potrubie má dve fázy: offline indexovanie (chunk + embedding + save) a online dotazovanie (získanie + výzva + generovanie).
- RAG poskytuje včasnosť, špecifické informácie, overiteľnosť, kontrolu halucinácií a nízke náklady.
- Kvalita systému priamo závisí od kvality vyhľadávania: nesprávny kus znamená nesprávnu odpoveď.
Aplikačná úloha
Vyberte si skutočný zdroj informácií z vlastného tímu (napr. dokument o postupe alebo stránku s často kladenými otázkami). (1) Napíšte 5 faktických otázok o tomto zdroji. (2) Všimnite si, ktorá časť dokumentu obsahuje správnu odpoveď na každú otázku – toto sa stane vaším zoznamom „zlatých odpovedí“. (3) Pomocou vyššie uvedenej šablóny „silnej výzvy“ manuálne prilepte príslušnú časť ako kontext a požiadajte o model. (4) Porovnajte odpoveď modelu so zlatou odpoveďou a označte ako pravdivú/nepravdivú. Toto je prvá manuálna verzia hodnotenia, ktorú budete automatizovať v budúcich jednotkách.
kontrolný zoznam
- [ ] Jednou vetou môžem vysvetliť, že RAG nemení váhy, len pridáva kontext.
- [ ] Viem rozlíšiť medzi RAG, dolaďovaním a dlhým kontextom a kedy je to vhodné.
- [ ] Fázy indexovania (zhromaždiť-skartovať-vložiť-uložiť) a dotazovať (vložiť-načítať-prompt-generovať) môžem spočítať v poradí.
- [ ] Viem, prečo som do výzvy pridal pokyny „ak to nie je v kontexte, povedz, že neviem“ a „uveďte zdroj“.
- [ ] Princíp „Kvalita získavania = kvalita RAG“ môžem prispôsobiť svojmu prípadu.