Njësia 3 / 11

Copëtimi dhe përgatitja e dokumenteve

Fitimet:

  • Vlerësoni numerikisht madhësinë e pjesës, mbivendosjen dhe shkëmbimet e ndarjes semantike
  • Zgjedhja e strategjisë së duhur të ndarjes për lloje të ndryshme dokumentesh (PDF, tabela, kodi, regjistri i bisedës)
  • Forconi cilësinë e rikthimit dhe filtrimin duke shtuar meta të dhëna në secilën pjesë

Ky është hapi më i anashkaluar, por më vendimtar në RAG: si e zbërtheni dokumentin. Kjo quhet copëtim. Edhe nëse i jepni të njëjtin dokument të njëjtit model, për shkak të copëzimit të keq, rikthimi kthen pjesën e gabuar dhe modeli nuk do të japë kurrë një përgjigje të mirë. Në këtë njësi, ne mbulojmë strategjitë e fragmentimit, si t'i përshtatim ato sipas llojit të dokumentit dhe si të shtojmë meta të dhëna kuptimplota për secilin fragment.

Pse i copëtojmë?

Ka tre arsye. Së pari, modelet e integruara e konvertojnë tekstin deri në një gjatësi të caktuar në një vektor kuptimplotë; Nëse një kapitull i tërë prej 40 faqesh grumbullohet në një vektor të vetëm, kuptimi bëhet "i paqartë". Së dyti, duam t'i japim modelit vetëm pjesën që nevojitet si kontekst; dorëzimi i të gjithë dokumentit është i shtrenjtë dhe shpërqendrues. Së treti, që rikthimi të jetë i saktë, njësia e kërkimit duhet të jetë e vogël dhe e fokusuar.

Pra, pjesa është njësia më e vogël e marrjes. Nuk duhet të jetë shumë i madh ose shumë i vogël - ashtu siç duhet.

Madhësia e pjesës dhe bilanci i mbivendosjes

Ekzistojnë dy cilësime kryesore: madhësia e pjesës (sa argumente/fjalë do të jenë në një copë) dhe mbivendosje (pjesa e ndarë nga pjesët fqinje).

Pjesë shumë të vogla (p.sh. 100 shenja): të fokusuara, por të shkëputura nga konteksti. Ai thotë “për 14 ditë”, por sa janë 14 ditë, lihet në fjalinë e mëparshme. Copa shumë të mëdha (p.sh. 2000 argumente): ruan kontekstin, por shumë tema janë të përziera; futja ngatërrohet dhe tema të parëndësishme bashkohen.

Mbivendosja zgjidh problemin e kufirit. Nëse një fjali bie saktësisht në kufirin e dy pjesëve, ajo ndahet në dysh pa mbivendosje dhe humbet kuptimi i saj. Mbivendosja e 50-100 shenjave siguron që informacioni që bie brenda kufirit të mbetet i paprekur në të paktën një pjesë.

Madhësia e copës

Avantazhi

Disavantazhi

përmbajtjen e duhur

Të vogla (100-250 argumente)

Ndjeshmëri e lartë, e fokusuar

Konteksti mund të prishet

FAQ, artikuj të shkurtër, përkufizime

E mesme (300-600 argumente)

Bilanci; shumica e skenarëve

-

Procedurat, tekstet e politikave

I madh (800-1500 argumente)

Integriteti i kontekstit

ngulitje e paqartë

Tregim, shpjegime të gjata

Këshillë: Nëse nuk dini nga të filloni, filloni me 400-500 copë token dhe mbivendosje 50-80 token; pastaj matni dhe rregulloni me të dhënat tuaja. Madhësia "e duhur" nuk është universale, varet nga konteksti.

Strategjitë e copëtimit

Madhësia fikse: Shkurton tekstin çdo N shenja. Është e thjeshtë dhe e shpejtë, por mund të ndërpresë në mes të fjalisë.

Me bazë ndarëse (rekurzive/ndarëse): Ndan sipas paragrafit dhe më pas kufijve të fjalisë; Ajo ruan më mirë integritetin e kuptimit. Shumica e sistemeve të prodhimit fillojnë me këtë.

Copëtimi semantik: Shikon futjet e fjalive dhe i ndan ato ku ndodh ndryshimi i temës. Është metoda më cilësore por më e shtrenjtë; Me vëllime të mëdha, kostot e transaksionit rriten.

Strukture-ware: Përdor strukturën e dokumentit si titujt, seksionet, tabelat. Për shembull, ndarja e një dokumenti Markdown sipas titujve siguron që secila pjesë të ketë titullin e vet.

Përshtatja sipas llojit të dokumentit

Jo çdo dokument është i njëjtë. Strategjia ndryshon sipas llojit:

  • PDF/teksti i politikës: bazuar në faqeshënues, madhësi mesatare. Pastro përsëritjet e faqes lart/poshtë (header/footer).
  • Tabelat: Mos e hiqni rreshtin jashtë kontekstit; mbani çdo rresht me informacionin e kokës ("Artikulli: X, Çmimi: Y, stoku: Z"). Konvertimi i tabelës së papërpunuar në tekst të thjeshtë është shpesh thelbësor.
  • Kodi: Ndarë sipas kufijve të funksionit/klasës; Mos e shkëputni funksionin.
  • Regjistrimi i bisedës/biletës: Ndarë me mesazh ose raund bisede; Mbani njohuri se kush tha çfarë.

# copëza (konceptuale) të bazuara në kllapa = bol( teksti, madhësia_objektiv=450, # mbivendosje e shenjës=70, # kllapa token=["\n\n", "\n", ". ", " "] # paragrafi i pari, fjala e fundit)

Shtoni metadata në çdo këngë

Shkëputja nuk është thjesht "përça"; është për të pasuruar çdo pjesë. Çdo etiketë që i bashkëngjitni këngës ia vlen peshën e saj në ar për filtrim dhe citim të burimit në të ardhmen.

# Pjesë e pasuruar (konceptuale){ "tekst": "Leja vjetore me pagesë është 14 ditë me 1-5 vite shërbim...", "metadata": { "burimi": "ik_el_kitabi_v7.pdf", "seksioni": "5.2 Pushimi vjetor", "faqe": 23, "data": "Pjesa-0", "20" "5 pjesë": "20". "e brendshme" }}

Një teknikë tjetër e fuqishme është shtimi i një titulli kontekstual: shkrimi i titullit të kapitullit të cilit i përket në fillim të çdo pjese. Kështu, edhe një pjesë e shkëputur si "Për 14 ditë" është edhe më e ngulitur dhe më kuptimplotë si "Leja vjetore - 14 ditë".

Copëtim i dobët / copëtim i fortë

E dobët (prerje e verbër, pa meta të dhëna):

Shkurtoni tekstin çdo 1000 karaktere. Mbani vetëm tekstin.# Rezultati: tabelat ndahen në mes, "14 ditë" mbetet pa kontekst,# nuk dihet nga cili dokument ka ardhur, filtër nuk mund të bëhet.

I fuqishëm (i vetëdijshëm për strukturën + kokën + meta të dhënat):

Ndani dokumentin sipas titujve; shtoni titullin e seksionit në secilën pjesë; bashkëngjitni burimin, faqen, datën dhe të dhënat meta të privatësisë; konvertoni tabelat në tekst të thjeshtë me titujt e tyre.# Rezultati: i fokusuar, kontekstual, i filtueshëm, i burimshëm.

Tre Mini Rastet

Rasti 1 - Fatkeqësi pikture. Një ekip financiar ndau listën e çmimeve prej 200 faqesh me prerje të verbër; Rreshtat e tabelave u ndanë rastësisht. "Cili është çmimi i produktit X?" Modeli lexoi rreshtin e gabuar dhe dha çmimin e gabuar (9 nga 12 raste janë të gabuara). Kur i konvertova rreshtat e tabelës në tekst të thjeshtë në formatin "Produkt: ... | Çmimi: ... | Njësia: ...", gabimi u ul në 0 nga 12.

Rasti 2 - Copë jashtëzakonisht e madhe. Në një wiki, çdo faqe përbëhet nga një pjesë e vetme (disa thonë 3000 argumente). Përfshirja është e paqartë sepse ka "leje", "jashtë orarit" dhe "paga" në një faqe; Seksioni i orarit të punës hyri në lojë edhe për çështjen e pushimit. Kur faqet u ndanë në madhësi mesatare sipas titullit, kujtesa@5 u rrit nga 64% në 91%.

Rasti 3 — Fjali e cunguar pa mbivendosje. Prerje fikse 250 token për një ekip ligjor, pa mbivendosje. Një përkufizim kritik ra pikërisht në kufirin e dy pjesëve dhe u nda në dysh; As njëra dhe as tjetra nuk e përmbajnë përgjigjen e plotë. Kur u shtua mbivendosje 60 token, i njëjti përkufizim mbeti i paprekur në një pjesë dhe përgjigja e saktë u kthye.

Gabimet e zakonshme

  • Prerje fikse e verbër: Ndan fjalitë dhe tabelat në mes; kuptimi ka humbur.
  • Lënia e mbivendosjes në zero: Informacioni që bie në kufi ndahet dhe humbet.
  • Mos shtimi i meta të dhënave: Filtrimi dhe shfaqja e burimit bëhen të pamundura.
  • Lënia e tabelave të papërpunuara: Modeli nuk mund të zgjidhë strukturën e tabelës; Konvertoni rreshtat në tekst të thjeshtë.
  • Imponimi i një strategjie: PDF, kodi dhe tabela nuk ndahen me të njëjtën metodë; Përshtatuni me zhanrin.
Kujdes: Mos e vendosni Chunking një herë dhe harroni atë. Rimatni cilësinë e marrjes kur vijnë llojet e reja të dokumenteve (bileta nga një sistem i ri, PDF të skanuara). Të dhënat hyrëse të këqija do të thotë përgjigje e keqe ("mbeturi brenda, mbeturina jashtë").

Në përmbledhje

  • Copë është njësia më e vogël e marrjes; As shumë i madh dhe as shumë i vogël - duhet të balancohet sipas përmbajtjes.
  • Madhësia e pjesës tregon ekuilibrin fokus-kontekst; Mbivendosja menaxhon humbjen e kufirit.
  • Ndarja e bazuar në kllapa dhe e vetëdijshme për strukturën është pika fillestare e shumicës së sistemeve të gjenerimit; copëzimi semantik është me cilësi të mirë, por i kushtueshëm.
  • Llojet si tabela, skripti dhe biseda kërkojnë strategjitë e tyre; Konvertoni tabelat në tekst të thjeshtë.
  • Shtoni burimin/datën/kapitullin/metadënat e privatësisë dhe titullin e seksionit në secilën pjesë; Kjo është baza e filtrimit dhe citimit.

Detyra e aplikimit

Ndani një pjesë të dokumentit që zgjidhni në tre mënyra të ndryshme: (1) copa të vogla me 200 argumente, (2) copa mesatare prej 500 shenjash (70 mbivendosje tokenash), (3) copa të vetme të mëdha. Bëni të njëjtat 3 pyetje për secilën strategji, shënoni manualisht se cilën pjesë duhet të sillni dhe shkruani arsyetimin se cila strategji funksionon më mirë për atë dokument. Më pas shtoni të paktën katër fusha të meta të dhënave dhe një “titull kapitulli” në secilën pjesë. Nëse dokumenti përmban një tabelë, konvertoni një rresht tabele në tekst të thjeshtë në formatin "field:value".

listë kontrolli

  • [ ] Mund të them se pjesa është njësia më e vogël e marrjes dhe madhësia është ekuilibri fokus-kontekst.
  • [ ] Unë e di pse Mbivendosja parandalon humbjen e kufirit.
  • [ ] Mund të bëj dallimin midis ndarjes së bazuar në kllapa, semantike dhe të vetëdijshme për strukturën.
  • [ ] Unë mund të përshtat strategjinë për tabelën, kodin dhe bisedën.
  • [ ] Unë e përforcoj rikthimin duke shtuar meta të dhëna dhe titull kapitulli në çdo pjesë.