Fitimet:
- Projektimi i komponentëve dhe rrjedhës së të dhënave të një asistenti RAG të ndërmarrjes nga fundi në fund
- Kombinimi i të dhënave me shumë burime (wiki, bileta, PDF, baza e të dhënave) në një asistent të vetëm
- Merrni vendime arkitekturore për shkallëzueshmërinë, ruajtjen e memories dhe vonesën
Në njësitë e mëparshme, ne mësuam pjesët një nga një: ngulitjen, bazën e të dhënave vektoriale, copëzimin, rikthimin. Tani le t'i kombinojmë këto dhe të ndërtojmë një arkitekturë nga fundi në fund të një asistenti që flet me të dhënat e kompanisë suaj. Qëllimi është që një punonjës të pyesë: "Cila është politika jonë e pushimit?" Një sistem ku njerëzit mund të bëjnë pyetje, përgjigjet bazohen në dokumente të brendshme reale, citate dhe kombinojnë burime të shumta të dhënash. Kjo njësi përpunon të gjithë arkitekturën, rrjedhën e të dhënave dhe vendimet e nivelit të prodhimit.
Komponentët nga fundi në fund
Një asistent i korporatës RAG përbëhet nga dy linja të veçanta. Linja e indeksimit (offline) përgatit të dhënat; Linja e pyetjes (online) i përgjigjet pyetjes.
Indeksimi i komponentëve të linjës:
- Lidhës: Lidhës që tërheqin të dhëna nga burimet - wiki, sistemi i biletave, ruajtja e skedarëve, baza e të dhënave, emaili.
- Normalizimi: Konvertimi i formateve të ndryshme (PDF, HTML, DOCX) në tekst të pastër; pastrimi i kokës/fundit.
- Ndarja + metadata: Ndarja dhe etiketimi (burimi, data, autoriteti).
- Embedding + loading: Shkrimi i vektorëve dhe meta të dhënave në bazën e të dhënave vektoriale.
Pyetni përbërësit e tubacionit:
- Parapërpunimi i pyetjeve: Rishkrimi, decentralizimi.
- Rikthimi: Kërkimi hibrid + filtri i meta të dhënave + rirenditja.
- Krijimi i shpejtë: Vendosja e kontekstit + pyetjes + udhëzimeve në shabllon.
- Gjenerimi: Përgjigje e bazuar (kontekstuale) nga modeli + burimet.
- Pas-përpunimi: Formatimi i citimit, kontrolli i sigurisë, regjistrimi.
Këshillë: Ndani fizikisht linjën e indeksimit nga linja e pyetjes. Indeksimi është i ngadalshëm dhe periodik (kryhet në grupe gjatë natës); Linja e hetimit duhet të jetë e lehtë dhe e menjëhershme. Përzierja e dy linjave detyron përpunim të rëndë ndërsa përdoruesi pret.
Vizualizimi i rrjedhës së të dhënave
[INDEKSIMI - jashtë linje]Burimet → Normalizo → Çunk+Metadata → Vendos → DB vektoriale (wiki, biletë, PDF, DB)[QUERY - në linjë]Pyetja e përdoruesit → Përpunim paraprak → Rikthim (hibrid+filtër+rirenditje) → Prompt (kontekst+Një pyetje)
Kombinimi i të dhënave me shumë burime
Në kompanitë reale, përgjigja nuk ndalet në një vend. "Si t'i lëshoni një rimbursim një klienti?" Përgjigja e pyetjes mund të gjendet si në artikullin e ndihmës (procedurën), në historikun e biletave (shembuj realë) dhe në politikën PDF (rregullat). Asistenti duhet t'i kontrollojë të gjitha në një pishinë.
Pika kritike: kur kombinohen burimet në një magazinë të vetme vektoriale, çdo copëz duhet të mbajë metadatat `source_tour`. Kështu që ju mund t'i kërkoni të gjitha dhe t'i filtroni nëse është e nevojshme, si p.sh. "sillni vetëm politika zyrtare". Gjithashtu, burime të ndryshme kanë nivele të ndryshme besueshmërie: politika zyrtare > artikulli i ndihmës > shënimi i biletës së një punonjësi. Ju mund ta specifikoni këtë prioritet në rirenditje ose kërkesë.
Burimi
Lloji i përmbajtjes
besimin
Frekuenca e përditësimit
Politika PDF
rregull zyrtar
lartë
mujore
Artikulli ndihmës
Procedura
mesatar-i lartë
javore
Historia e biletave
mostër reale
e mesme
E vazhdueshme
wiki
Shënim i përzier/aktual
E ndryshueshme
E vazhdueshme
Shkallueshmëria, cache dhe vonesa
Tre çështje dallohen në prodhim. Vonesa: Përvoja përkeqësohet kur përdoruesi pret më shumë se 2 sekonda. Zgjidhja: shfaqni përgjigjen në formë transmetimi - ajo derdhet në ekran ndërsa shkruan modeli. Cache: Për pyetjet e bëra shpesh dhe kontekste të përsëritura, cache rrit shpejtësinë dhe zvogëlon koston. Shkalla: Ndërsa përdoruesi rritet, është e nevojshme të jetë në gjendje të shkallëzojë marrjen dhe modelimin e thirrjeve horizontalisht.
Rregulli i madh në anën e kostos: hapi më i shtrenjtë është zakonisht numri i argumenteve që shkojnë në modelin më të madh. Prandaj, zvogëlimi i kontekstit në 4 pjesë të mira duke rirenditur përmirëson cilësinë dhe koston. Një dizajn i zakonshëm është përdorimi i një modeli më të vogël/më të shpejtë për klasifikim ose rrugëtim të thjeshtë, dhe një model më i fuqishëm për përgjigjen përfundimtare (p.sh. claude-opus-4-8).
Kujdes: Mos e vendosni indeksimin si "bëje një herë, harroje". Dokumentet ndryshohen, fshihen, shtohen. Krijoni një strategji riindeksimi: zbuloni dokumentet e ndryshuara dhe ripërpunoni vetëm ato. Indeksi i ndenjur prodhon një përgjigje që duket aktuale, por është e gabuar.
Arkitekturë e dobët / Arkitekturë e fortë
E dobët (skenar i vetëm, gjithçka e përzier):
Kur përdoruesi pyet: lexoni dokumentet në atë moment, copëtojini ato, futini ato, kërkojini, përgjigjuni atyre.# Problem: i gjithë indeksimi përsëritet për secilën pyetje; sekonda vonesë, # pa ndarje burimi, pa filtër, pa rifreskim.
I fuqishëm (tubacione të ndara + meta të dhëna + cache + transmetim):
Indeksimi: grupi funksionon gjatë natës, duke rifreskuar dokumentet e ndryshuara. Pyetje: linjë e lehtë — përpunim paraprak → rikthim hibrid+filtër → rirenditje → prompt → model (transmetim) → citim → regjistër. Pyetjet e bëra më shpesh dhe burimi ruhen në memorie të fshehtë.
Tre Mini Rastet
Rasti 1 - Linjë e hutuar, vonesë e madhe. Një startup shkroi një skript që ripërpunon PDF-të me secilën pyetje; Çdo përgjigje zgjati mesatarisht 11 sekonda. Kur linja e indeksimit u nda dhe të dhënat u transferuan më parë në dyqanin e vektorit, koha e pyetjes u ul në 1.3 sekonda dhe me transmetim, "fjala e parë" u shfaq në 400 ms.
Rasti 2 - Shumë burime, prioritet i gabuar. Një asistent mbështetës i dha peshë të barabartë PDF-së së politikës dhe shënimeve të vjetra të biletave; Modeli ndonjëherë paraqiste vlerësimin e gabuar të një punonjësi nga dy vjet më parë si rregull zyrtar. Kur metadatat e source_tour dhe udhëzimi "konsideroni politikën zyrtare në rast konflikti" iu shtuan kërkesës, gabimet me prioritet të rremë u reduktuan me 89%.
Rasti 3 - Indeksi i ndenjur. Një asistent i burimeve njerëzore po punonte me një indeks që nuk ishte përditësuar për 3 muaj; Politika e pushimit ka ndryshuar, por asistenti po thoshte ditët e vjetra. Kur u instalua rifreskimi ditor, i cili zbulon skedarët e ndryshuar, shkalla e përgjigjes aktuale u rrit nga 70% në 99%.
Gabimet e zakonshme
- Përzierja e indeksimit dhe linjave të pyetjeve: Përpunimi i rëndë kryhet ndërsa përdoruesi pret; vonesa shpërthen.
- Mos vendosja e llojit të burimit në metadata: Nuk ka prioritet dhe filtrim; Burimi i pabesueshëm duket se është zyrtar.
- Mos vendosja e një strategjie rifreskimi: Indeksi bëhet bajat; Prodhohen përgjigje të gabuara që duken aktuale.
- Kapërceje transmetimin: Përdoruesi shikon një ekran bosh; Vonesa e perceptuar bëhet e lartë.
- Përdorimi i modelit më të madh në çdo hap: Kostoja rritet në mënyrë të panevojshme; Lëreni timonin modelit më të vogël.
Në përmbledhje
- Asistenti i korporatës RAG përbëhet nga dy linja të veçanta: indeksimi offline dhe pyetja online; ndani ato fizikisht.
- Indeksimi = lidhës + normalizim + copë / meta të dhëna + ngulitje / ngarkim; pyetje = para-proces + rikthim + prompt + gjenerim + pas-proces.
- Të dhënat me shumë burime kombinohen në një depo të vetme, por të dhënat meta të tipit_burim dhe përparësia e besimit ruhen.
- Transmetimi dhe cache për vonesën, frenimi i kontekstit dhe zgjedhja e modelit për kosto janë kritike.
- Pa ri-indeksimin, indeksi bëhet bajat; Ripërpunoni rregullisht ndryshimin e dokumenteve.
Detyra e aplikimit
Vizatoni një diagram arkitektonik të një asistenti për ekipin tuaj. (1) Identifikoni të paktën tre burime reale të të dhënave dhe shkruani nevojën e lidhësit, frekuencën e përditësimit dhe nivelin e besimit për secilin. (2) Vizatoni veçmas linjat e indeksimit dhe pyetjes me një diagram kuti-shigjeta. (3) "Ku mund ta zvogëloj vonesën dhe koston në këtë asistent?" Shkruani të paktën dy vendime konkrete për pyetjen. (4) Përshkruani strategjinë tuaj të rifreskimit me një fjali: cili burim do të riindeksohet dhe sa shpesh?
listë kontrolli
- [ ] Mund të vizatoj linjat e indeksimit dhe të pyetjes veçmas dhe me komponentët e duhur.
- [ ] Mund të kombinoj të dhënat me shumë burime me prioritetin e llojit të burimit dhe besimit.
- [ ] Mund të marr vendime për transmetimin/cache për vonesën dhe zgjedhjen e modelit për kosto.
- [ ] Unë e di pse një strategji riindeksimi është thelbësore.
- [ ] Mbaj parasysh se hapi më i shtrenjtë në arkitekturën time është zakonisht shenja që i shkon modelit më të madh.