Јединица 3 / 11

Сечење и припрема докумената

Добици:

  • Нумерички процените компромисе величине комада, преклапања и семантичког раздвајања
  • Одабир одговарајуће стратегије раздвајања за различите типове докумената (ПДФ, табела, код, дневник ћаскања)
  • Ојачајте квалитет преузимања и филтрирање додавањем метаподатака у сваки део

Ово је најпревиђенији али најодлучнији корак у РАГ-у: како рашчланити документ. Ово се зове цхункинг. Чак и ако дате исти документ истом моделу, због лошег комадања, преузимање враћа погрешан део и модел никада неће дати одличан одговор. У овој јединици покривамо стратегије фрагментације, како их прилагодити према типу документа и како додати смислене метаподатке сваком фрагменту.

Зашто уситњавамо?

Постоје три разлога. Прво, модели за уграђивање претварају текст до одређене дужине у смислени вектор; Ако се цело поглавље од 40 страница угура у један вектор, значење постаје „замагљено“. Друго, желимо да моделу дамо само део који је потребан као контекст; предаја целог документа је скупа и омета. Треће, да би проналажење било прецизно, јединица за претрагу мора бити мала и фокусирана.

Дакле, комад је најмања јединица за проналажење. Не би требало да буде превелика или премала - таман.

Величина комада и баланс преклапања

Постоје две главне поставке: величина комада (колико ће токена/речи бити у комаду) и преклапање (део који деле суседни делови).

Веома мали делови (нпр. 100 токена): фокусирани, али одвојени од контекста. Каже „14 дана“, али оно што је 14 дана је остало у претходној реченици. Веома велики делови (нпр. 2000 токена): чува контекст, али је умешано много нити; уграђивање постаје збркано и небитне теме се спајају.

Преклапање решава гранични проблем. Ако реченица пада тачно на границу два дела, дели се на два без преклапања и губи јој се значење. Преклапање од 50-100 токена осигурава да информације које спадају у ограничење остају нетакнуте у најмање једном делу.

Величина комада

Предност

Недостатак

одговарајући садржај

Мали (100-250 жетона)

Висока осетљивост, фокусиран

Контекст се може покварити

Често постављана питања, кратки чланци, дефиниције

Средње (300-600 жетона)

Баланце; већина сценарија

Процедуре, текстови политика

Велики (800-1500 жетона)

Интегритет контекста

мутно уграђивање

Наратив, дуга објашњења

Савет: Ако не знате одакле да почнете, почните са 400-500 комада токена и 50-80 преклапања токена; затим измерите и прилагодите сопственим подацима. „Права“ величина није универзална, зависи од контекста.

Цхункинг Стратегиес

Фиксна величина: Скраћује текст на сваких Н токена. Једноставно је и брзо, али може прекинути усред реченице.

Засновано на сепаратору (рекурзивно/сепаратор): Подели према границама пасуса, а затим и реченица; Боље чува интегритет значења. Већина производних система почиње са овим.

Семантичко раздвајање: Гледа на уградњу реченица и дели их тамо где долази до промене субјекта. То је најквалитетнији али најскупљи метод; Са великим количинама, трошкови трансакције се повећавају.

Свесни структуре: Користи структуру документа као што су наслови, одељци, табеле. На пример, подела Маркдовн документа по насловима осигурава да сваки део носи свој наслов.

Адаптација према врсти документа

Није сваки документ исти. Стратегија се разликује у зависности од типа:

  • ПДФ/текст политике: заснован на обележивачима, средње величине. Обришите понављања на врху/у дну странице (заглавље/подножје).
  • Табеле: Не вадите ред из контекста; задржите сваки ред са информацијама заглавља („Артикал: Кс, Цена: И, Залиха: З“). Претварање необрађене табеле у обичан текст је често неопходно.
  • Код: Подели по границама функције/класе; Не скидајте функцију са пута.
  • Снимање ћаскања/улазнице: Подели по поруци или кругу разговора; Одржавајте знање о томе ко је шта рекао.

# цхункс-басед (концептуални) цхункс = бол( тект, таргет_сизе=450, # токен оверлап=70, # токен брацкетс=["\н\н", "\н", ". ", " "] # пасус први, реч последња)

Додајте метаподатке свакој стази

Сецкање није само "подела"; је да обогати сваки комад. Свака ознака коју прикачите на нумеру је злата вредна за будуће филтрирање и цитирање извора.

# Обогаћени део (концептуално){ "текст": "Годишње плаћено одсуство је 14 дана са 1-5 година стажа...", "метаподаци": { "извор": "ик_ел_китаби_в7.пдф", "секција": "5.2 Годишњи одмор", "страница": 23, "датум": "2025": "2025"- "интерно" }}

Још једна моћна техника је додавање контекстуалног заглавља: ​​писање наслова поглавља којем припада на почетку сваког дела. Стога је чак и неповезани комад попут „За 14 дана“ и боље уграђен и значајнији као „Годишњи одмор – 14 дана“.

Слабо ломљење / јако ломљење

Слаб (слепи рез, без метаподатака):

Скратите текст на сваких 1000 знакова. Задржи само текст.# Резултат: табеле су подељене на средини, "14 дана" остаје без контекста,# не зна се из ког документа долази, не може се направити филтер.

Моћан (свестан структуре + заглавље + метаподаци):

Поделити документ по насловима; додајте наслов одељка сваком делу; приложите извор, страницу, датум и метаподатке о приватности; претворити редове табеле у обичан текст са њиховим заглављима. # Резултат: фокусиран, контекстуалан, филтриран, изворни.

Три мини кућишта

Случај 1 — Сликарска катастрофа. Тим за финансије поделио је ценовник од 200 страница слепим резањем; редови табеле су насумично подељени. „Која је цена производа Кс?“ Модел је прочитао погрешну линију и дао погрешну цену (9 од 12 случајева је погрешно). Када сам конвертовао редове табеле у обичан текст у формату „Производ: … | Цена: … | Јединица: …“ грешка се смањила на 0 од 12.

Случај 2 — Изузетно велики комад. На викију, свака страница је направљена од једног дела (неки кажу 3.000 токена). Уградња је замагљена јер на једној страници има „одсуство“, „прековремени рад“ и „платни списак“; Одељак о радном времену је такође дошао у обзир у вези са питањем одсуства. Када су странице подељене на средње величине према наслову, рецалл@5 ​​се повећао са 64% на 91%.

Случај 3 — Скраћена реченица без преклапања. Фиксни рез од 250 токена за правни тим, без преклапања. Критичка дефиниција пала је тачно на границу два дела и поделила се на два; Ни једно ни друго не садржи потпун одговор. Када је додато 60 преклапања токена, иста дефиниција је остала нетакнута у једном комаду и враћен је тачан одговор.

Уобичајене грешке

  • Слепи фиксни рез: дели реченице и табеле у средини; смисао се губи.
  • Остављање преклапања на нули: Информације које падају на границу се деле и губе.
  • Недодавање метаподатака: Филтрирање и приказ извора постају немогући.
  • Остављање табела необрађених: модел не може да реши структуру табеле; Претворите редове у обичан текст.
  • Наметање једне стратегије: ПДФ, код и табела се не деле истим методом; Прилагодите се жанру.
Опрез: Не постављајте Цхункинг једном и заборавите. Поново измерите квалитет преузимања како стигну нови типови докумената (улазнице из новог система, скенирани ПДФ-ови). Лоши улазни подаци значе лош одговор („смеће улази, смеће излази“).

Укратко

  • Комад је најмања јединица за проналажење; Ни превелика ни премала – требало би да буде уравнотежена према садржају.
  • Величина комада означава равнотежу фокуса и контекста; Преклапање управља губитком граница.
  • Компањање засновано на заградама и свесно структуре је почетна тачка већине генерацијских система; семантичко раздвајање је доброг квалитета, али скупо.
  • Типови као што су табела, скрипта и ћаскање захтевају сопствене стратегије; Претворите табеле у обичан текст.
  • Додајте метаподатке о извору/датуму/поглављу/приватности и наслову одељка свакој нумери; Ово је основа филтрирања и цитирања.

Задатак апликације

Раздвојите део документа који изаберете на три различита начина: (1) мали делови од 200 жетона, (2) средњи делови од 500 жетона (70 токена се преклапају), (3) појединачни велики делови. Поставите иста 3 питања за сваку стратегију, ручно означите који део желите да унесете и запишите образложење која стратегија најбоље функционише за тај документ. Затим додајте најмање четири поља метаподатака и „наслов поглавља“ свакој нумери. Ако документ садржи табелу, претворите ред табеле у обичан текст у формату „поље: вредност“.

контролна листа

  • [ ] Могу рећи да је комад најмања јединица за проналажење и да је величина баланс фокус-контекст.
  • [ ] Знам зашто преклапање спречава губитак граница.
  • [ ] Могу да разликујем цхункинг засновано на загради, семантичко и структурно свесно.
  • [ ] Могу да прилагодим стратегију за сто, код и ћаскање.
  • [ ] Појачавам проналажење додавањем метаподатака и наслова поглавља свакој нумери.