Kasu:
- Selgitades, et RAG sisestab konteksti ilma mudeli kaalu muutmata ja töötab "avatud raamatu eksami" loogikaga
- RAG-i võrdlemine peenhäälestus- ja pika konteksti lähenemisviisidega vastavalt kuludele, õigeaegsusele ja kasutusstsenaariumile
- Tüüpilise RAG-konveieri etappide loetelu, mis koosneb indekseerimise ja päringu faasidest
Ükskõik kui võimas keelemudel (tehisintellekt, mis mõistab ja toodab teksti; edaspidi nimetame seda lühidalt mudeliks), ei tea see lepingut, mille teie ettevõte eile allkirjastas, teie sisemist viki (sisemiste teadmistebaasi) lehte ega täna hommikul avaldatud väljalaskemärkust. Mudel on piiratud üldiste teadmistega kuni selle väljaõppe kuupäevani; Seda nimetatakse "hariduse lõppkuupäevaks". RAG (Retrieval-Augmented Generation) täidab täpselt selle lünga: otsib üles küsimusega seotud ettevõtte dokumendid, annab selle mudelile kontekstina (st lisateksti, mida ta vastuse koostamisel loeb) ja laseb selle konteksti põhjal vastuse koostada.
Selles üksuses näeme selgelt, mis on RAG, millal seda eelistatakse millistele alternatiividele ja millised on tüüpilise RAG torujuhtme etapid. Kõik järgnevad üksused süvendavad selle kaardi osi ükshaaval.
RAGi põhiidee: avatud raamatu eksam
Selgitame RAG-i ühe lausega: "Kõigepealt otsige üles vastav dokument, seejärel laske mudelil see dokument läbi lugeda ja printige vastus vastavalt."
Kõige kasulikum analoogia on järgmine: RAG teisaldab mudeli "kinnise raamatu eksamilt" "avatud raamatu eksamile". Kinnise raamatu eksamil vastab õpilane ainult mälu järgi; On suur oht mõelda välja see, mida te ei mäleta. Avatud raamatu eksamil vastab õpilane enda ette asetatud allikat vaadates. RAG-is ei vasta mudel enam oma mälu järgi, vaid praeguse ja konkreetse teksti järgi, mille te talle annate.
Kriitiline punkt: RAG ei muuda mudeli kaalusid, st miljardeid arvparameetreid, mille mudel on õppinud. Te ei koolita modelli ümber. Iga küsimuse puhul sisestate viipasse selle küsimusega seotud tekstitükid (mudelile saadetud juhiste tekst). Seega ei pea te mudelit dokumendi värskendamisel ümber õpetama; lihtsalt värskendate vastavat kirjet otsinguandmebaasis.
Vihje: RAGi kvaliteedi määravad kaks küsimust: (1) Kas leidsite õige dokumendi? (2) Kas mudel luges seda õigesti? Esimene on "otsingu kvaliteet", teine on "põlvkonna kvaliteet". Neid kahte mõõdetakse ja täiustatakse eraldi.
RAG, peenhäälestus või pikk kontekst?
Organisatsioonilisele probleemile lahendust otsides aetakse sageli segi kolm teed. Selgitame nende erinevusi. Peenhäälestus on mudeli kaalude värskendamine teie andmetega ja sellele uue käitumise/stiili õpetamine. Pikk kontekst tähendab kõigi dokumentide täitmist otse viipa ilma valikuta.
Lähenemine
Mis teeb
Millal see on asjakohane?
Kulud / risk
RAG
Sisestab kontekstina vastava dokumendi
Tihti muutuv, ulatuslik, spetsiifiline teave
Madal; lihtne värskendada, allikale võib viidata
Peenhäälestus
Värskendab kaalusid uute andmetega
Fikseeritud stiil/formaat/keeleõpetus
kõrge; Iga värskenduse korral on vajalik ümberõpe
Ainult pikk kontekst
Täidab kõik dokumendid viipasse
Väike, statsionaarne dokumendikomplekt
Suureneb sümboolne hind ja risk "keskosa kaotamiseks".
Reeglina: Peenhäälestus õpetab modellile rääkima; RAG ütleb mudelile, mida peab teadma. Enamikus ettevõtete stsenaariumides proovitakse kõigepealt RAG-i, kuna see on odav, värskendatav ja suudab näidata vastuse allikat. Pikk kontekst on mõistlik, kui dokumendikomplekt on tõesti väike ja fikseeritud (nt üksik 20-leheküljeline käsiraamat); Kuid tuhandete lehekülgede tõttu on see kallis ja mudelil võib pika teksti keskel info puudu jääda.
Tüüpiline RAG torujuhe
RAG koosneb kahest põhifaasist: indekseerimine (ettevalmistamine, tehakse üks kord või perioodiliselt) ja päring (töötab iga kasutaja küsimuse kohta).
Samm-sammult indekseerimine (võrguühenduseta, ilma kasutaja ootamiseta):
- Koguge: hankige dokumente allikatest (PDF, wiki, piletisüsteem, andmebaas, e-post).
- Tükeldamine: jagage pikk tekst väiksemateks hallatavateks tükkideks.
- Manustamine: teisendage iga osa manustamiseks (arvuvektor, mis kannab teksti tähendust).
- Salvesta: kirjutage vektorid koos teksti ja metaandmetega (allikas, kuupäev, autoriseerimise teave) vektorite andmebaasi.
Samm-sammuline päring (võrgus, kui kasutaja ootab):
- Teisendage kasutaja küsimus manustamiseks.
- Otsige vektorandmebaasist välja kõige sarnasemad osad.
- Asetage need tükid + küsimus viipamalli.
- Hankige mudelist kontekstuaalne vastus ja selle allikad.
# Küsitlusfaasi kontseptuaalne ülevaade (keelest mitte sõltuv)question = "Mitu päeva põhipuhkust?"Question_vektor = embed(question)parts = vektor_db.search(question_vektor, top_k=4) # kõige sarnasemad partsprompt = f"""Vastake KÜSIMUSELE, kasutades allolevat vastust "KONTEKST ei ole allolevas kontekstis". Fitting.CONTEXT:{parts}KÜSIMUS: {question}"""vastus = model.uret(prompt) # nt. mudel: claude-opus-4-8
See voog on iga etapi kaart, mille me järgnevates ühikutes ükshaaval lahti pakime.
Nõrk viip / Tugev viip
Isegi sama RAG-konteksti korral muudab viipa kvaliteet vastust.
Nõrk viip (avatud mudeli sobitamiseks, ei vaja ressursse):
Kasutage seda teavet ja öelge iga-aastane puhkus: {parts}. Küsimus: {question}
Võimas viip (maandus + "ma ei tea" luba + ressursitaotlus):
Vastake ainult alloleva KONTEKSTI alusel. Kui kontekstis pole selget vastust, kirjutage "Ma ei leidnud dokumentatsioonist selle kohta teavet"; Ära arva. Lisage vastuse lõppu selle kirjatüki märgend [Source: file_name], millele tuginete. KONTEKST: {tükki} KÜSIMUS: {question}
Kolm miniümbrist
Juhtum 1 – personali assistent (personalitööstus). Ettevõttes on 340-leheküljeline personalikäsiraamat ja töötajad esitavad keskmiselt 90 küsimust päevas. Prooviti peenhäälestust, kuid kuna käsiraamatut uuendati iga kuu, oli iga kord vaja ümberõpet; Maksumus ulatus tuhandetesse dollaritesse kuus. Pärast RAG-ile üleminekut vähendati uuendust "dokumendi uuesti indekseerimise" sammuni (minutites) ja õigete vastuste määr kasvas käsitsi mõõtmisel 71%-lt 93%-le.
Juhtum 2 – klienditugi. Tugimeeskonnal on 12 000 lahendatud piletit ja 800 abiartiklit. Esindajal kulub käsitsi vastuse leidmiseks keskmiselt 4 minutit. Kui RAGi assistent tõi 5 kõige olulisemat kirjet ja koostas vastuse mustandi, vähendati aega 40 sekundini; Kuid meeskond mõistis ohtu, et "vale artikli toomise tõttu ebakindel näib" ja muutis allikale viitamise kohustuslikuks.
3. juhtum – seadus. Lepingu sõlminud meeskond küsis "milliste lepingute puhul kehtib konfidentsiaalsusklausel 5 aastat?" esitab ta küsimuse. Pika kontekstikatse käigus täideti 60 lepingut ühele viipale; modell jättis kaks keskmist lepingut vahele. Kui RAG-iga tutvustati ainult asjakohaseid üksusi, vähenes märgi maksumus 80% ja puuduv vahelejätmine lähtestati.
Miks on RAG-i vaja?
- Aktuaalsus: pääsete teabele juurde pärast koolituse lõppkuupäeva.
- Eriinfo: Teie sisedokumendid ei kuulu ühegi mudeli koolitusse; Ainult sina saad anda.
- Kontrollitavus: võite viidata vastuse allikale (tsitaat) – see on auditi ja usalduse jaoks hädavajalik.
- Hallutsinatsioonide kontroll: see tugineb selle ette asetatud tekstile, mitte ei moodusta mudelit.
- Maksumus: see on palju odavam ja kiirem kasutusele võtta kui peenhäälestus.
Ettevaatust: RAG ei ole maagia. Kui tood sisse vale tüki, jõuab modell vale vastuseni, näib “enesekindel”. Pidage meeles fraasi "Retrieval quality = RAG quality".
Levinud vead
- RAG-i eksitamine peenhäälestamiseks: RAG ei muuda raskusi; See lihtsalt lisab konteksti. Nende kahe segi ajamine toob kaasa vale arhitektuuri valimise.
- "Ma ei tea" keelamine: kui viip jätab mudelile vaba vaba lünka, siis see korvab.
- Allikatele viitamata: ilma allikata vastust ei saa kontrollida; Kasutaja ei saa viga märgata.
- Kõikide ühte viipa koondamine: pikk kontekst tundub odav, kuid on kallis ja jätab vahele keskmise teabe.
- Põlvkonda takerdumine ilma otsimist mõõtmata: kui vastus on halb, küsige esmalt "Kas õige osa saabus?" tuleks küsida.
Kokkuvõttes
- RAG on lähenemine, mis süstib mudelisse kui konteksti küsimusega seotud dokumendid; ei muuda kaalusid ("avatud raamatu eksam").
- Peenhäälestus õpetab stiili/vormingut, RAG annab jooksvat ja spetsiifilist infot; pikk kontekst sobib hästi väikeste fikseeritud kogumite jaoks. Enamikul juhtudel proovitakse kõigepealt RAG-i.
- Konveieril on kaks faasi: võrguühenduseta indekseerimine (tükk + manustamine + salvestamine) ja võrgupäring (otsing + viip + genereerimine).
- RAG pakub õigeaegsust, spetsiifilist teavet, kontrollitavust, hallutsinatsioonide kontrolli ja madalat hinda.
- Süsteemi kvaliteet sõltub otseselt otsimise kvaliteedist: vale tükk tähendab vale vastust.
Rakenduse ülesanne
Valige oma meeskonnalt tõeline teabeallikas (nt protseduuri dokument või KKK leht). (1) Kirjutage selle allika kohta 5 faktilist küsimust. (2) Pange tähele, milline osa dokumendist sisaldab iga küsimuse jaoks õiget vastust – sellest saab teie "kuldsete vastuste" loend. (3) Kasutades ülaltoodud "tugeva viipa" malli, kleepige asjakohane jaotis kontekstina käsitsi ja küsige mudelit. (4) Võrrelge mudeli antud vastust kuldse vastusega ja märkige tõeseks/valeks. See on hindamise esimene käsitsi versioon, mida tulevastes üksustes automatiseerite.
kontrollnimekiri
- [ ] Võin ühe lausega selgitada, et RAG ei muuda kaalusid, vaid lisab konteksti.
- [ ] Oskan eristada RAG-i, peenhäälestust ja pika konteksti ning seda, millal see on asjakohane.
- [ ] Oskan indekseerimise (koguda-tükelda-manusta-salvesta) ja päringu (manusta-too-viipa-genereeri) faase üles lugeda järjekorras.
- [ ] Ma tean, miks ma lisasin viipale juhised "kui see pole kontekstis, öelge, et ma ei tea" ja "viita allikale".
- [ ] Saan põhimõtet "Retrieval quality = RAG quality" kohandada enda juhtumile.