Fitimet:
- Duke shpjeguar se RAG injekton kontekstin pa ndryshuar peshën e modelit dhe punon me një logjikë të 'provimit të librit të hapur'
- Krahasimi i RAG me rregullimin e imët dhe qasjet e kontekstit të gjatë sipas kostos, afatit kohor dhe skenarit të përdorimit
- Renditja e hapave të një tubacioni tipik RAG që përbëhet nga fazat e indeksimit dhe pyetjes
Pavarësisht se sa i fuqishëm është një model gjuhësor (inteligjencë artificiale që kupton dhe prodhon tekst; ne do ta quajmë atë shkurtimisht model), ai nuk e njeh kontratën që kompania juaj nënshkroi dje, faqen tuaj të brendshme të wiki (baza e njohurive të brendshme) ose shënimin e publikimit të publikuar këtë mëngjes. Modeli është i kufizuar në njohuri të përgjithshme deri në datën kur është trajnuar; Kjo quhet "data e ndërprerjes së arsimit". RAG (Retrieval-Augmented Generation) plotëson pikërisht këtë boshllëk: gjen dokumentet e kompanisë në lidhje me pyetjen, ia jep modelit si kontekst (d.m.th. tekstin shtesë që do të lexojë gjatë prodhimit të përgjigjes) dhe ka përgjigjen e prodhuar bazuar në këtë kontekst.
Në këtë njësi, ne do të shohim qartë se çfarë është RAG, kur preferohet se cilat alternativa dhe hapat e një tubacioni tipik RAG. Të gjitha njësitë e mëvonshme do të thellojnë pjesët e kësaj harte një nga një.
Ideja themelore e RAG: Provimi i Librit të Hapur
Le ta shpjegojmë RAG-në me një fjali: "Së pari gjeni dokumentin përkatës, më pas bëni modelin të lexojë atë dokument dhe të printojë përgjigjen në përputhje me rrethanat."
Analogjia më e dobishme është kjo: RAG e zhvendos modelin nga një "provim i librit të mbyllur" në një "provim të librit të hapur". Në provimin e librit të mbyllur studenti përgjigjet vetëm nga kujtesa; Ekziston një rrezik i lartë për të krijuar atë që nuk e mbani mend. Në provimin e librit të hapur, studenti përgjigjet duke parë burimin e vendosur përballë. Në RAG, modeli nuk përgjigjet më nga kujtesa e tij, por nga teksti aktual dhe specifik që ju i jepni.
Pika kritike: RAG nuk ndryshon peshat e modelit, domethënë miliarda parametrat numerikë që modeli ka mësuar. Ju nuk e rikualifikoni modelin. Për çdo pyetje, ju injektoni pjesë të tekstit që lidhen me atë pyetje në prompt (teksti i udhëzimit dërguar modelit). Pra, nuk keni nevojë të ritrajnoni modelin kur një dokument përditësohet; ju thjesht rifreskoni rekordin përkatës në bazën e të dhënave të kërkimit.
Këshillë: Dy pyetje përcaktojnë cilësinë e RAG: (1) A e gjetët dokumentin e duhur? (2) A e lexoi modeli saktë? E para është "cilësia e rikthimit", e dyta është "cilësia e gjeneratës". Të dyja maten dhe përmirësohen veçmas.
RAG, rregullim i imët apo kontekst i gjatë?
Tre rrugë shpesh ngatërrohen kur kërkoni një zgjidhje për një problem organizativ. Le të sqarojmë dallimet e tyre. Rregullimi i imët është përditësimi i peshave të modelit me të dhënat tuaja dhe mësimi i një sjellje/stili të ri. Konteksti i gjatë nënkupton plotësimin e të gjitha dokumenteve direkt në kërkesë pa asnjë përzgjedhje.
Qasje
Çfarë bën
Kur është e përshtatshme?
Kosto/Rreziku
RREGULL
Injekton dokumentin përkatës si kontekst
Ndryshime të shpeshta, të gjera, informacione specifike
E ulët; lehtë për t'u përditësuar, burimi mund të citohet
Rregullimi i imët
Përditëson peshat me të dhëna të reja
Mësimdhënie me stil/format/gjuhë fikse
E lartë; Kërkohet rikualifikim me çdo përditësim
Vetëm kontekst i gjatë
Plotëson të gjitha dokumentet në prompt
Set i vogël, i palëvizshëm i dokumenteve
Kostoja e tokenit dhe rreziku i "humbjes së pjesës së mesme" rritet
Si rregull: Rregullimi i imët i mëson modeles se si të flasë; RAG i tregon modelit se çfarë duhet të dijë. Në shumicën e skenarëve të ndërmarrjeve, RAG provohet së pari sepse është i lirë, i azhurnueshëm dhe mund të tregojë burimin e përgjigjes. Konteksti i gjatë është i arsyeshëm nëse grupi i dokumenteve është vërtet i vogël dhe fiks (p.sh. një manual i vetëm 20 faqesh); Por me mijëra faqe, është e shtrenjtë dhe modelit mund t'i mungojë informacioni në mes të tekstit të gjatë.
Një tubacion tipik RAG
RAG përbëhet nga dy faza kryesore: indeksimi (përgatitja, bërë një herë ose periodikisht) dhe pyetja (kryhet në çdo pyetje të përdoruesit).
Indeksimi hap pas hapi (jashtë linje, pa pritur përdorues):
- Mblidhni: Tërhiqni dokumente nga burimet (PDF, wiki, sistemi i biletave, baza e të dhënave, emaili).
- Copëtimi: Ndani tekstin e gjatë në pjesë më të vogla të menaxhueshme.
- Embed: Shndërroni secilën pjesë në embedding (vektori i numrave që mbart kuptimin e tekstit).
- Ruaj: Shkruani vektorët së bashku me tekstin dhe meta të dhënat (burimi, data, informacioni i autorizimit) në bazën e të dhënave vektoriale.
Pyetje hap pas hapi (në internet, ndërsa përdoruesi është duke pritur):
- Konvertoni pyetjen e përdoruesit në embedding.
- Merrni pjesët më të ngjashme nga baza e të dhënave vektoriale.
- Vendosni këto pjesë + pyetje në një shabllon të shpejtë.
- Merrni përgjigjen kontekstuale dhe burimet e saj nga modeli.
# Përvijimi konceptual i fazës së hetimit (jo i varur nga gjuha) pyetje = "Sa ditë pushim vjetor?"question_vektor = embed(pyetje)parts = vektor_db.search(question_vektor, top_k=4) # pjesët më të ngjashme prompt = f"""Përgjigjuni PYETJES nuk kam informacion në lidhje me CONTEXT. kjo." Fitting.CONTEXT:{pjese}PYETJE: {pyetje}"""answer = model.uret(prompt) # p.sh. modeli: claude-opus-4-8
Kjo rrjedhë është një hartë e çdo faze, të cilën do ta shpaketojmë një nga një në njësitë vijuese.
Prompt i dobët / Prompt i fortë
Edhe me të njëjtin kontekst RAG, cilësia e kërkesës ndryshon përgjigjen.
Prompt i dobët (i hapur për përshtatjen e modelit, nuk kërkon burime):
Përdorni këtë informacion dhe thoni pushim vjetor: {pjese}. Pyetje: {pyetje}
Prompt i fuqishëm (bazimi + "Nuk e di" leje + kërkesë për burime):
Përgjigjuni vetëm bazuar në KONTEKSTIN e mëposhtëm. Nëse nuk ka përgjigje të qartë në kontekst, shkruani "Nuk mund të gjeja informacion për këtë në dokumentacion"; Mos merr me mend. Shtoni etiketën [Source: file_name] të pjesës në të cilën po mbështeteni në fund të përgjigjes suaj. KONTEKSTI: {copë} PYETJE: {pyetje}
Tre Mini Rastet
Rasti 1 — Asistent HR (Burimet Njerëzore). Një kompani ka një manual HR prej 340 faqesh dhe punonjësit bëjnë mesatarisht 90 pyetje në ditë. U provua rregullimi i imët, por meqenëse manuali përditësohej çdo muaj, kërkohej rikualifikim çdo herë; Kostoja arriti në mijëra dollarë në muaj. Pas kalimit në RAG, përditësimi u reduktua në hapin "ri-indeksoni dokumentin" (minuta) dhe shkalla e përgjigjes së saktë u rrit nga 71% në 93% në matjen manuale.
Rasti 2 — Mbështetja e klientit. Ekipi mbështetës ka 12,000 bileta të zgjidhura dhe 800 artikuj ndihmës. I duhen mesatarisht 4 minuta që një përfaqësues të gjejë manualisht një përgjigje. Kur asistenti i RAG solli 5 regjistrimet më të rëndësishme dhe dha një draft përgjigje, koha u reduktua në 40 sekonda; Por ekipi kuptoi rrezikun e "dukjes së pasigurt duke sjellë artikullin e gabuar" dhe e bëri të detyrueshëm citimin e burimit.
Rasti 3 — Ligji. Një ekip kontraktues pyeti "në cilat kontrata klauzola e konfidencialitetit zgjat 5 vjet?" ai bën pyetjen. Në provën e gjatë të kontekstit, 60 kontrata u plotësuan në një kërkesë të vetme; modelja anashkaloi dy kontratat e mesme. Kur vetëm artikujt përkatës u prezantuan me RAG, kostoja e tokenit u ul me 80% dhe kapërcimi që mungonte u rivendos.
Pse nevojitet RAG?
- Aktualiteti: Ju aksesoni informacionin pas datës së përfundimit të trajnimit.
- Informacion i veçantë: Dokumentet tuaja të brendshme nuk përfshihen në trajnimin e asnjë modeli; Vetëm ju mund të jepni.
- Verifikueshmëria: Ju mund të citoni burimin e përgjigjes (citim) - thelbësor për auditimin dhe besimin.
- Kontrolli i halucinacioneve: Ai mbështetet në tekstin e vendosur përpara tij në vend që të krijojë një model.
- Kostoja: Është shumë më lirë dhe më e shpejtë për t'u vënë në punë sesa rregullimi i imët.
Kujdes: RAG nuk është magji. Nëse sjell pjesën e gabuar, modelja arrin në përgjigjen e gabuar duke u dukur "e sigurt". Mbani parasysh shprehjen "Cilësia e rikthimit = cilësia RAG".
Gabimet e zakonshme
- Gabimi i RAG për rregullimin e imët: RAG nuk ndryshon peshat; Thjesht shton kontekstin. Ngatërrimi i këtyre të dyjave do të çojë në zgjedhjen e arkitekturës së gabuar.
- Moslejimi i "Nuk e di": Nëse kërkesa e lë modelin të lirë të plotësojë boshllëkun, do të plotësohet.
- Mos citimi i burimeve: Një përgjigje pa burim nuk mund të kontrollohet; Përdoruesi nuk mund ta vërejë gabimin.
- Grumbullimi i gjithçkaje në një kërkesë: Konteksti i gjatë duket i lirë, por është i shtrenjtë dhe i mungon informacioni i mesëm.
- Duke u ngecur në brez pa matur rikthimin: Nëse përgjigja është e keqe, fillimisht pyesni "A mbërriti pjesa e duhur?" duhet pyetur.
Në përmbledhje
- RAG është një qasje që injekton dokumente të rëndësishme për pyetjen në model si kontekst; nuk ndryshon peshat (“provimi i librit të hapur”).
- Rregullimi i imët mëson stilin/formatin, RAG jep informacion aktual dhe specifik; konteksti i gjatë funksionon mirë për grupe të vogla fikse. Në shumicën e skenarëve, RAG provohet së pari.
- Gazsjellësi ka dy faza: indeksimi jashtë linje (copë + ngulitje + ruaj) dhe kërkimi në internet (rimarrje + prompt + gjenerim).
- RAG ofron afate kohore, informacion specifik, verifikueshmëri, kontroll të halucinacioneve dhe kosto të ulët.
- Cilësia e sistemit varet drejtpërdrejt nga cilësia e rikthimit: pjesa e gabuar do të thotë përgjigje e gabuar.
Detyra e aplikimit
Zgjidhni një burim të vërtetë informacioni nga ekipi juaj (p.sh. një dokument procedurash ose faqe FAQ). (1) Shkruani 5 pyetje faktike rreth këtij burimi. (2) Vini re se cila pjesë e dokumentit përmban përgjigjen e saktë për secilën pyetje - kjo bëhet lista juaj e "përgjigjeve të arta". (3) Duke përdorur shabllonin "forte prompt" më sipër, ngjitni manualisht seksionin përkatës si kontekst dhe kërkoni një model. (4) Krahasoni përgjigjen e dhënë nga modeli me përgjigjen e artë dhe shënojeni si e vërtetë/e gabuar. Ky është versioni i parë manual i vlerësimit që do të automatizoni në njësitë e ardhshme.
listë kontrolli
- [ ] Mund të shpjegoj me një fjali se RAG nuk i ndryshon peshat, thjesht shton kontekstin.
- [ ] Mund të bëj dallimin midis RAG, rregullimit të imët dhe kontekstit të gjatë dhe kur është e përshtatshme.
- [ ] Mund të numëroj me radhë fazat e indeksimit (mbledh-shred-embed-save) dhe pyetjes (embed-fetch-prompt-generate).
- [ ] Unë e di pse shtova udhëzimet "nëse nuk është në kontekst, thuaj se nuk e di" dhe "citoj burimin" në kërkesë.
- [ ] Unë mund ta përshtat parimin e "Cilësia e rikthimit = cilësia RAG" me rastin tim.