Dobici:
- Objašnjavanje da RAG ubacuje kontekst bez promjene težine modela i radi s logikom 'ispita otvorene knjige'
- Poređenje RAG-a sa finim podešavanjem i pristupima dugog konteksta prema scenariju troškova, pravovremenosti i upotrebe
- Navođenje koraka tipičnog RAG cevovoda koji se sastoji od faza indeksiranja i upita
Bez obzira na to koliko je moćan jezički model (vještačka inteligencija koja razumije i proizvodi tekst; od sada ćemo ga skraćeno zvati model), on ne poznaje ugovor koji je vaša kompanija potpisala jučer, vašu internu wiki stranicu (interna baza znanja) ili belešku objavljenu jutros. Model je ograničen na opšte znanje do dana kada je obučen; To se zove "datum prekida obrazovanja". RAG (Retrieval-Augmented Generation) popunjava upravo ovu prazninu: pronalazi dokumente kompanije koji se odnose na pitanje, daje ga modelu kao kontekst (tj. dodatni tekst koji će pročitati dok proizvodi odgovor) i daje odgovor na osnovu tog konteksta.
U ovoj jedinici ćemo jasno vidjeti šta je RAG, kada je poželjnije u odnosu na koje alternative, i korake tipičnog RAG cevovoda. Sve naredne jedinice će produbljivati dijelove ove karte jedan po jedan.
Osnovna ideja RAG-a: Otvoreni ispit iz knjige
Objasnimo RAG u jednoj rečenici: "Prvo pronađite relevantni dokument, a zatim neka model pročita taj dokument i odštampa odgovor u skladu s tim."
Najkorisnija analogija je ova: RAG pomiče model sa „ispita zatvorene knjige“ na „ispit otvorene knjige“. Na ispitu iz zatvorene knjige student odgovara samo napamet; Postoji veliki rizik da ćete izmisliti ono čega se ne sećate. Na ispitu iz otvorene knjige student odgovara gledajući u izvor koji se nalazi ispred njega. U RAG-u model više ne odgovara iz svoje memorije, već iz trenutnog i specifičnog teksta koji mu date.
Kritična tačka: RAG ne mijenja težine modela, odnosno milijarde numeričkih parametara koje je model naučio. Ne obučavate model. Za svako pitanje, vi ubacujete komade teksta relevantnog za to pitanje u prompt (tekst instrukcije poslat modelu). Dakle, ne morate ponovo obučavati model kada se dokument ažurira; jednostavno osvježite relevantni zapis u bazi podataka pretraživanja.
Savjet: Dva pitanja određuju kvalitet RAG-a: (1) Da li ste pronašli pravi dokument? (2) Da li ga je model ispravno pročitao? Prvi je "kvalitet preuzimanja", drugi je "kvalitet generacije". To dvoje se mjere i poboljšavaju zasebno.
RAG, fino podešavanje ili dug kontekst?
Tri puta se često brkaju kada se traži rješenje za organizacijski problem. Hajde da razjasnimo njihove razlike. Fino podešavanje je ažuriranje težina modela vašim podacima i učenje novog ponašanja/stila. Dugi kontekst znači popunjavanje svih dokumenata direktno u prompt bez ikakvog odabira.
Pristup
Šta radi
Kada je prikladno?
Trošak / Rizik
RAG
Ubacuje relevantni dokument kao kontekst
Često mijenjane, opsežne, specifične informacije
Low; lako se ažurira, izvor se može citirati
Fino podešavanje
Ažurira težine novim podacima
Nastava fiksnog stila/formata/jezika
High; Potrebna je ponovna obuka sa svakim ažuriranjem
Samo dugi kontekst
Popunjava sve dokumente u prompt
Mali, stacionarni set dokumenata
Cijena tokena i rizik od "gubljenja srednjeg dijela" se povećavaju
Po pravilu: Fino podešavanje uči model kako da govori; RAG govori modelu šta treba da zna. U većini poslovnih scenarija prvo se isprobava RAG jer je jeftin, ažuriran i može pokazati izvor odgovora. Dugačak kontekst je razuman ako je skup dokumenata zaista mali i fiksiran (npr. jedan priručnik od 20 stranica); Ali sa hiljadama stranica, to je skupo i modelu mogu nedostajati informacije usred dugog teksta.
Tipičan RAG cjevovod
RAG se sastoji od dvije glavne faze: indeksiranja (priprema, radi se jednom ili periodično) i upita (pokreće se na svako pitanje korisnika).
Indeksiranje korak po korak (offline, bez čekanja korisnika):
- Prikupite: Povucite dokumente iz izvora (PDF, wiki, sistem ulaznica, baza podataka, e-pošta).
- Sjeckanje: razdvojite dugi tekst na manje komade kojima se može upravljati.
- Embed: Pretvorite svaki dio u embedding (vektor brojeva koji nosi značenje teksta).
- Sačuvaj: Zapišite vektore zajedno sa tekstom i metapodacima (izvor, datum, informacije o autorizaciji) u vektorsku bazu podataka.
Korak po korak upit (online, dok korisnik čeka):
- Pretvorite korisničko pitanje u ugrađivanje.
- Dohvatite najsličnije dijelove iz vektorske baze podataka.
- Stavite ove komade + pitanje u šablon za brzi upit.
- Dobijte kontekstualni odgovor i njegove izvore iz modela.
# Konceptualni nacrt faze upita (ne zavisi od jezika)question = "Koliko dana godišnjeg odmora?"question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # najsličniji dijeloviprompt = f"""Odgovorite na PITANJE koristeći donji kontekst, recite da ovaj odgovor nema KONTEKST." Fitting.KONTEKST:{dijelovi}PITANJE: {pitanje}"""odgovor = model.uret(prompt) # npr. model: claude-opus-4-8
Ovaj tok je mapa svake faze, koju ćemo raspakovati jednu po jednu u narednim jedinicama.
Slaba prompt / jaka prompt
Čak i uz isti RAG kontekst, kvalitet prompta mijenja odgovor.
Slab upit (otvoreno za prilagođavanje modela, ne zahtijeva resurse):
Koristite ove informacije i recite godišnji odmor: {parts}. Pitanje: {question}
Snažan prompt (uzemljenje + dozvola "ne znam" + zahtjev za resurse):
Odgovorite samo na osnovu KONTEKSTA u nastavku. Ako nema jasnog odgovora u kontekstu, napišite "Nisam mogao pronaći informacije o ovome u dokumentaciji"; Ne pogađaj. Dodajte oznaku [Source: file_name] komada na koji se oslanjate na kraju vašeg odgovora. KONTEKST: {pieces} PITANJE: {pitanje}
Tri mini futrole
Slučaj 1 — Pomoćnik za ljudske resurse (ljudski resursi). Kompanija ima HR priručnik od 340 stranica i zaposleni postavljaju u prosjeku 90 pitanja dnevno. Pokušano je fino podešavanje, ali pošto je priručnik ažuriran mjesečno, svaki put je bila potrebna ponovna obuka; Troškovi su dostizali hiljade dolara mjesečno. Nakon prelaska na RAG, ažuriranje je smanjeno na korak "ponovno indeksiranje dokumenta" (minuta), a stopa tačnih odgovora je povećana sa 71% na 93% u ručnom mjerenju.
Slučaj 2 — Korisnička podrška. Tim za podršku ima 12.000 riješenih tiketa i 800 članaka pomoći. Predstavniku je potrebno u prosjeku 4 minute da ručno pronađe odgovor. Kada je RAG asistent donio 5 najrelevantnijih zapisa i izradio nacrt odgovora, vrijeme je smanjeno na 40 sekundi; Ali tim je shvatio rizik da "izgleda nesigurno donošenjem pogrešnog članka" i učinio je navođenje izvora obaveznim.
Slučaj 3 — Pravo. Ugovorni tim je pitao "u kojim ugovorima klauzula o povjerljivosti traje 5 godina?" postavlja pitanje. U dugom kontekstualnom suđenju, 60 ugovora je popunjeno u jednom upitu; model je preskočio srednja dva ugovora. Kada su samo relevantne stavke uvedene sa RAG-om, trošak tokena se smanjio za 80% i preskakanje koje nedostaje je poništeno.
Zašto je potreban RAG?
- Aktuelnost: Pristupate informacijama nakon datuma prekida obuke.
- Posebne informacije: Vaši interni dokumenti nisu uključeni u obuku nijednog modela; Samo ti možeš dati.
- Provjerljivost: Možete navesti izvor odgovora (citiranje) – što je bitno za reviziju i povjerenje.
- Kontrola halucinacija: Ona se oslanja na tekst koji se nalazi ispred njega, a ne na izmišljanje modela.
- Trošak: Puno je jeftinije i brže za puštanje u rad od finog podešavanja.
Oprez: KRPPA nije magija. Ako unesete pogrešan komad, model dolazi do pogrešnog odgovora i izgleda "samouvjereno". Imajte na umu frazu "Kvaliteta preuzimanja = kvalitet RAG-a".
Uobičajene greške
- Greška RAG za fino podešavanje: RAG ne menja težine; To samo dodaje kontekst. Brkanje ovo dvoje će dovesti do odabira pogrešne arhitekture.
- Ne dozvoljavajući "Ne znam": Ako upit ostavi modelu slobodan da popuni prazno, to će nadoknaditi.
- Ne citiranje izvora: Odgovor bez izvora se ne može provjeriti; Korisnik ne može primijetiti grešku.
- Trpanje svega u jedan prompt: Dugi kontekst izgleda jeftino, ali je skup i propušta središnje informacije.
- Zaglavljivanje u generaciji bez mjerenja preuzimanja: Ako je odgovor loš, prvo pitajte "Je li stigao pravi dio?" treba pitati.
Ukratko
- RAG je pristup koji dokumente relevantne za pitanje ubrizgava u model kao kontekst; ne mijenja pondere ("ispit otvorene knjige").
- Fino podešavanje uči stil/format, RAG daje trenutne i specifične informacije; dugi kontekst dobro radi za male fiksne skupove. U većini scenarija prvo se isprobava RAG.
- Cjevovod ima dvije faze: vanmrežno indeksiranje (komad + ugrađivanje + spremanje) i online upit (preuzimanje + prompt + generiranje).
- RAG pruža pravovremenost, specifične informacije, provjerljivost, kontrolu halucinacija i nisku cijenu.
- Kvalitet sistema direktno zavisi od kvaliteta pronalaženja: pogrešan komad znači pogrešan odgovor.
Zadatak aplikacije
Odaberite pravi izvor informacija iz vlastitog tima (npr. dokument o proceduri ili stranica s čestim pitanjima). (1) Napišite 5 činjeničnih pitanja o ovom izvoru. (2) Zabilježite koji dio dokumenta sadrži tačan odgovor za svako pitanje — ovo postaje vaša „zlatna lista odgovora“. (3) Koristeći gornji predložak "jaka prompt", ručno zalijepite relevantni odjeljak kao kontekst i pitajte model. (4) Uporedite odgovor koji je dao model sa zlatnim odgovorom i označite kao tačno/netačno. Ovo je prva ručna verzija procjene koju ćete automatizirati u budućim jedinicama.
kontrolna lista
- [ ] Mogu objasniti u jednoj rečenici da RAG ne mijenja težine, već samo dodaje kontekst.
- [ ] Mogu razlikovati RAG, fino podešavanje i dug kontekst i kada je to prikladno.
- [ ] Mogu izbrojati faze indeksiranja (collect-shred-embed-save) i upita (embed-fetch-prompt-generate) po redu.
- [ ] Znam zašto sam u prompt dodao instrukcije "ako nije u kontekstu, reci da ne znam" i "navedi izvor".
- [ ] Princip "kvaliteta preuzimanja = kvalitet RAG" mogu prilagoditi svom slučaju.