Јединица 1 / 11

Шта је РАГ и зашто је неопходан?

Добици:

  • Објашњавајући да РАГ убацује контекст без промене тежине модела и ради са логиком 'испита отворене књиге'
  • Поређење РАГ-а са финим подешавањем и приступима дугог контекста према сценарију цене, правовремености и коришћења
  • Навођење корака типичног РАГ цевовода који се састоји од фаза индексирања и упита

Без обзира на то колико моћан је језички модел (вештачка интелигенција која разуме и производи текст; од сада ћемо га скраћено звати модел), он не познаје уговор који је ваша компанија потписала јуче, вашу интерну вики страницу (интерна база знања) или белешку објављену јутрос. Модел је ограничен на опште знање до дана када је обучен; Ово се зове "датум прекида образовања". РАГ (Ретриевал-Аугментед Генератион) попуњава управо ову празнину: проналази документе компаније у вези са питањем, даје их моделу као контекст (то јест, додатни текст који ће прочитати док производи одговор) и даје одговор на основу овог контекста.

У овој јединици ћемо јасно видети шта је РАГ, када се даје предност у односу на које алтернативе, и кораке типичног РАГ цевовода. Све наредне јединице ће продубљивати делове ове карте један по један.

Основна идеја РАГ-а: Испит отворене књиге

Хајде да објаснимо РАГ у једној реченици: „Прво пронађите релевантни документ, а затим нека модел прочита тај документ и у складу с тим одштампа одговор.“

Најкориснија аналогија је следећа: РАГ помера модел са „затвореног испита из књиге“ на „испит из отворене књиге“. На испиту из затворене књиге студент одговара само напамет; Постоји велики ризик да измислите оно чега се не сећате. На испиту из отворене књиге ученик одговара гледањем у извор који се налази испред њега. У РАГ-у модел више не одговара из сопственог памћења, већ из тренутног и специфичног текста који му дате.

Критична тачка: РАГ не мења тежине модела, односно милијарде нумеричких параметара које је модел научио. Не обучавате модел. За свако питање, у промпт (текст инструкције послат моделу) убацујете делове текста релевантног за то питање. Дакле, не морате поново да обучавате модел када се документ ажурира; једноставно освежите релевантни запис у бази података за претрагу.

Савет: Два питања одређују квалитет РАГ-а: (1) Да ли сте пронашли прави документ? (2) Да ли је модел исправно прочитао? Први је "квалитет преузимања", други је "квалитет генерације". То двоје се мери и побољшава одвојено.

РАГ, фино подешавање или дуг контекст?

Три пута се често бркају када се тражи решење за организациони проблем. Хајде да разјаснимо њихове разлике. Фино подешавање је ажурирање тежине модела вашим подацима и учење новог понашања/стила. Дуг контекст значи попуњавање свих докумената директно у промпт без икаквог избора.

Приступ

Шта ради

Када је то прикладно?

Цена / ризик

РАГ

Убацује релевантни документ као контекст

Информације које се често мењају, опсежне, специфичне

Лов; лако се ажурира, извор се може навести

Фино подешавање

Ажурира тежине новим подацима

Настава фиксног стила/формата/језика

Хигх; Потребна је поновна обука са сваким ажурирањем

Само дугачак контекст

Попуњава све документе у промпт

Мали, стационарни сет докумената

Цена токена и ризик од "губљења средњег дела" се повећава

По правилу: Фино подешавање учи модел како да говори; РАГ говори моделу шта треба да зна. У већини пословних сценарија прво се испробава РАГ јер је јефтин, ажуриран и може да покаже извор одговора. Дугачак контекст је разуман ако је скуп докумената заиста мали и фиксиран (нпр. један приручник од 20 страница); Али са хиљадама страница, то је скупо и моделу могу недостајати информације усред дугог текста.

Типичан РАГ цевовод

РАГ се састоји од две главне фазе: индексирања (припрема, ради се једном или периодично) и упита (покреће се на свако питање корисника).

Индексирање корак по корак (ван мреже, без чекања корисника):

  1. Прикупљајте: Повуците документе из извора (ПДФ, вики, систем тикета, база података, е-пошта).
  2. Сецкање: Преломите дугачак текст на мање делове којима се може управљати.
  3. Угради: Претворите сваки део у уграђивање (вектор бројева који носи значење текста).
  4. Сачувај: Запишите векторе заједно са текстом и метаподацима (извор, датум, информације о ауторизацији) у векторску базу података.

Корак по корак упит (онлине, док корисник чека):

  1. Претворите корисничко питање у уграђивање.
  2. Преузми најсличније делове из векторске базе података.
  3. Ставите ове делове + питање у шаблон за брзи одговор.
  4. Узмите контекстуални одговор и његове изворе из модела.

# Концептуални нацрт фазе упита (не зависи од језика)куестион = "Колико дана годишњег одмора?"куестион_вектор = ембед(куестион)партс = вектор_дб.сеарцх(куестион_вектор, топ_к=4) # најсличнији деловипромпт = ф"""Одговорите на ПИТАЊЕ користећи да се у контексту "немају информације о КОНТЕКСТ." Уклапање.КОНТЕКСТ:{делови}ПИТАЊЕ: {питање}"""одговор = модел.урет(промпт) # нпр. модел: цлауде-опус-4-8

Овај ток је мапа сваке фазе, коју ћемо распаковати једну по једну у наредним јединицама.

Слаба порука / јака промпт

Чак и са истим РАГ контекстом, квалитет промпта мења одговор.

Слабо обавештење (отворено за прилагођавање модела, не захтева ресурсе):

Користите ове информације и реците годишњи одмор: {партс}. Питање: {куестион}

Снажан упит (уземљење + дозвола „не знам“ + захтев за ресурсе):

Одговорите само на основу КОНТЕКСТА у наставку. Ако у контексту нема јасног одговора, напишите „Нисам могао да пронађем информације о овоме у документацији“; Не погађај. Додајте ознаку [Соурце: филе_наме] дела на који се ослањате на крају свог одговора. КОНТЕКСТ: {пиецес} ПИТАЊЕ: {куестион}

Три мини кућишта

Случај 1 — Помоћник за људске ресурсе (људски ресурси). Компанија има ХР приручник од 340 страница и запослени постављају у просеку 90 питања дневно. Покушано је фино подешавање, али пошто је приручник ажуриран месечно, преквалификација је била потребна сваки пут; Трошак је достигао хиљаде долара месечно. Након преласка на РАГ, ажурирање је сведено на корак „поновно индексирање документа“ (минути), а стопа тачних одговора је повећана са 71% на 93% у ручном мерењу.

Случај 2 — Корисничка подршка. Тим за подршку има 12.000 решених тикета и 800 чланака помоћи. У просеку је потребно 4 минута да представник ручно пронађе одговор. Када је РАГ асистент донео 5 најрелевантнијих записа и израдио нацрт одговора, време је смањено на 40 секунди; Али тим је схватио ризик да „изгледа несигурно доношењем погрешног чланка“ и учинио је навођење извора обавезним.

Случај 3 — Право. Тим за уговарање је питао „у којим уговорима клаузула о поверљивости траје 5 година?“ поставља питање. У дугом контексту суђења, 60 уговора је попуњено у једном тренутку; модел је прескочио средња два уговора. Када су само релевантне ставке уведене са РАГ-ом, цена токена се смањила за 80% и недостајуће прескакање је ресетовано.

Зашто је потребан РАГ?

  • Актуелност: Приступате информацијама након датума прекида обуке.
  • Посебне информације: Ваши интерни документи нису укључени у обуку ниједног модела; Само ти можеш дати.
  • Проверљивост: Можете навести извор одговора (цитирање) — што је неопходно за ревизију и поверење.
  • Контрола халуцинација: Она се ослања на текст који се налази испред њега, а не на измишљање модела.
  • Цена: Много је јефтиније и брже за пуштање у рад од финог подешавања.
Опрез: КРППА није магија. Ако унесете погрешан комад, модел долази до погрешног одговора и изгледа „самоуверено“. Имајте на уму фразу „Квалитет преузимања = квалитет РАГ-а“.

Уобичајене грешке

  • Грешка РАГ за фино подешавање: РАГ не мења тежине; То само додаје контекст. Збуњивање ова два довешће до избора погрешне архитектуре.
  • Не дозвољавајући „Не знам“: Ако упит остави моделу слободан да попуни празно, то ће надокнадити.
  • Не навођење извора: Одговор без извора се не може проверити; Корисник не може приметити грешку.
  • Сажимање свега у једном промпту: Дугачак контекст изгледа јефтино, али је скуп и пропушта средњу информацију.
  • Заглављивање у генерацији без мерења преузимања: Ако је одговор лош, прво питајте „Да ли је стигао прави део?“ треба питати.

Укратко

  • РАГ је приступ који документе релевантне за питање убризгава у модел као контекст; не мења тежине („испит отворене књиге“).
  • Фино подешавање учи стил/формат, РАГ даје актуелне и специфичне информације; дуги контекст добро функционише за мале фиксне скупове. У већини сценарија прво се испробава РАГ.
  • Цевовод има две фазе: офлајн индексирање (комад + уграђивање + чување) и онлајн упит (преузимање + промпт + генерисање).
  • РАГ обезбеђује благовременост, специфичне информације, могућност провере, контролу халуцинација и ниску цену.
  • Квалитет система директно зависи од квалитета проналажења: погрешан комад значи погрешан одговор.

Задатак апликације

Изаберите прави извор информација из свог тима (нпр. документ о процедури или страница са честим питањима). (1) Напишите 5 чињеничних питања о овом извору. (2) Забележите који део документа садржи тачан одговор за свако питање — ово постаје ваша „златна листа одговора“. (3) Користећи горњи шаблон „јака промпт“, ручно налепите релевантни одељак као контекст и питајте модел. (4) Упоредите одговор који је дао моделом са златним одговором и означите као тачно/нетачно. Ово је прва ручна верзија процене коју ћете аутоматизовати у будућим јединицама.

контролна листа

  • [ ] Могу да објасним у једној реченици да РАГ не мења тежине, већ само додаје контекст.
  • [ ] Могу да разликујем РАГ, фино подешавање и дуг контекст и када је то прикладно.
  • [ ] Могу да бројим фазе индексирања (цоллецт-схред-ембед-саве) и упита (ембед-фетцх-промпт-генерате) по реду.
  • [ ] Знам зашто сам у промпт додао упутства „ако није у контексту, реци да не знам“ и „наведи извор“.
  • [ ] Могу да прилагодим принцип „квалитет преузимања = квалитет РАГ“-а свом сопственом случају.