Јединица 8 / 11

РАГ евалуација и праћење

Добици:

  • Дефинисање метрика које мере задржавање и квалитет производње одвојено
  • Поставите златни скуп питања и покрените аутоматску евалуацију са ЛЛМ-као судија
  • Одржавање квалитета путем повратних информација, праћења и регресионог тестирања у производњи

Реченица „Инсталирао сам помоћника, изгледа да ради добро“ није инжењерска изјава. РАГ системи се тихо кваре: нови тип документа заварава проналажење, брза промена смањује тачност, индекс постаје застарео. Једини начин да се то схвати је мерење. У овој јединици покривамо како мерити квалитет РАГ-а (преузимање и генерисање одвојено), аутоматску евалуацију (ЛЛМ-као судија) и одржавати квалитет у производњи (праћење, регресија). „Не можете побољшати оно што не мерите“ је мото ове јединице.

Измерите две одвојене ствари

РАГ има две ноге и мора се мерити одвојено јер проблем може бити у било којој од њих:

  1. Квалитет преузимања: Да ли је стигао прави део?
  2. Квалитет генерисања: Да ли је тачан одговор произведен из долазног дела?

Ако је одговор лош, прво морате знати која је нога лоша. Ако прави део никада не стигне, чак ни најбољи промпт не може да сачува (проблем при преузимању). Ако је стигао исправан део, али га је модел погрешно прочитао, побољшање преузимања је узалудно (проблем са генерисањем).

Ретриевал Метрицс

Преузимање је проблем сортирања/приступа; мерено класичним метрикама проналажења информација. За ово морате имати златни грозд: знање о томе који комад је „тачан“ за свако питање.

метрички

Какве мере

Једноставна дефиниција

Рецалл@к

Да ли је прави комад у горњем к?

Исправна стопа хватања делова

прецизност@к

Колико је од к враћених комада релевантно?

Чишћење оног што се донесе

МРР (средњи реципрочни ранг)

Којим редоследом је прави комад?

Награде су у највишим ранговима

Стопа погодака

Да ли је стигао бар један исправан комад?

Најосновније мерило успеха

Практични коментар: Ако је Рецалл@к низак, треба прерадити стратегију раздвајања или претраживања (хибрид, к, поновно рангирање). Ако је прецизност ниска, али је памћење високо, додавање поновног рангирања је добар потез.

Генератион Метрицс

Када стигне исправан део, меримо квалитет одговора који производи модел. Три основне димензије:

  • Верност: Да ли је свака тврдња у одговору подржана контекстом? Има ли икаквог уклапања? То је директна мера халуцинације.
  • Релевантност одговора: Да ли одговор заправо одговара на питање или је ван теме?
  • Потпуност: Да ли су све релевантне информације у контексту коришћене или недостају?

Они се често бодују на основу степена (нпр. 1-5), а не бинарно попут „тачно/нетачно“.

Савет: Пратите верност као посебну метрику. Ако се верност смањује како се тачност смањује, проблем је генерација; Ако је верност висока, али је одговор погрешан, проблем је погрешан комад (преузимање). Заједно, ове две метрике су компас који показује локацију квара.

Успостављање скупа златних питања

Свако мерење захтева златни скуп / скуп података за евалуацију: реална питања + очекивани тачни одговори + тачни изворни делови. Боље је започети са 30-50 добро одабраних питања од 500 насумичних питања. У сет укључите следеће: често постављана права питања, позната тешка питања, замка питања без одговора (треба рећи "не знам"), питања са контрадикторним изворима.

# Пример златне групе (концептуални)[ {"куестион": "Колико дана годишњег одмора?", "екпецтед_ансвер": "14 дана за 1-5 година стажа", "цоррецт_парт_ид": "тво-парт-3", "цатегори": "леаве"}, {"куестион": "Где је канцеларија компаније?", "Мрец'с екпецтед_ИН", "Мрец'с" # трап: не знам "цоррецт_парт_ид": нулл, "цатегори": "трап"}]

ЛЛМ-као судија: Аутоматско оцењивање

Бодовање стотина одговора руком је заморно. Модел ЛЛМ као судије је када један модел даје резултате и оправдава одговор другог модела на основу одређених критеријума. Добар судија јасно дефинише критеријуме, даје примере и тражи оправдање.

# ЛЛМ-као судија промпт (концептуално)Ви сте непристрасни евалуатор. Оцените ОДГОВОР у наставку према датом КОНТЕКСТУ и ОЧЕКИВАНОМ ОДГОВОРУ. Оцените (1-5) и оправдајте:- верност: да ли је свака тврдња у одговору подржана у контексту?- тачност: да ли одговор одговара очекиваном одговору?- потпуност: да ли су релевантне информације потпуне? Конкретно: ако одговор садржи информације које нису у контексту, наведите верност1 и наведите која је тврдња измишљена. КОНТЕКСТ: {контекст}ОЧЕКИВАНО: {очекивано}ОДГОВОР: {ансвер}Излаз: {верност, тачност, потпуност, оправданост}

Опрез: ЛЛМ-као судија није савршен; Они могу имати своје предрасуде (дугачак одговор, преферирају свој стил). Такође проверите судију: нека одговоре дају и судија и човек и измерите споразум између њих. Ако је судија у складу са људским резултатима, можете му веровати.

Слаба/јака оцена

Слабо („било је добро за мене“):

Поставио сам неколико питања и одговори су били добри. Имам га уживо.# Проблем: нема мерења, регресија неприметна, побољшање слепо.

Моћан (златни кластер + дискретна метрика + аутоматска процена + регресија):

Златни скуп од 40 питања. Са сваком променом, опозив@5, верност и тачност се мере аутоматски. Ако резултат падне, промена се поништава. У производњи се прикупљају повратне информације корисника и додају у сет.

Мониторинг и регресија у производњи

Евалуација се не ради једном и завршава. Три сталне праксе:

  • Регресионо тестирање: Аутоматски покрени златни кластер при свакој промпт/преузимању/промени модела. Ако се резултат смањи, промена се поништава. Ово спречава „сломљење док покушавате да га побољшате“.
  • Праћење производње: прати се стопа „Нисам могао да пронађем информације“ у стварним питањима, просечно кашњење, цена, повратне информације корисника (👍/👎). Нагло повећање „не знам“ је често први знак неисправности индекса или преузимања.
  • Петља повратних информација: Права питања која поставља корисник 👎 се прегледају и додају у златну гомилу; Тако скуп временом постаје богатији и слепе тачке система се затварају.

Три мини кућишта

Случај 1 — Тиха регресија. Тим је модификовао промпт да га "побољша"; Општа тачност се повећала, али је верност смањена за 30% у питањима замке (модел је почео да се уклапа више). То се не би приметило да није било питања о замкама у златном грозду; Регресионо тестирање је вратило промену.

Случај 2 — Исправљање погрешне ноге. Код једног асистента одговори су били лоши; Тим је недељама радио на хитном поступку. Када смо мерили метрику преузимања, опозив@5 је био само 48% — проблем је био у проналажењу, а не у генерисању. Када је додат хибрид + поновно рангирање, опозив се повећао на 89%, а прецизност се такође повећала.

Случај 3 — Упозорење о производњи. Једног дана, стопа „нисам могао да пронађем информације“ за помоћника за подршку скочила је са 6% на 34%. Тракпад је упозорио; Разлог је тај што је посао индексирања, који ради ноћу, тихо пропао и нови чланци нису учитани. Без праћења, нетачне изјаве „не знам“ би се наставиле данима.

Уобичајене грешке

  • Бити задовољан са „мени је добро функционисало“: Без мерења, регресија остаје непримећена.
  • Не раздвајајући проналажење и генерисање: исправићете погрешну ногу и изгубити време.
  • Не постављати питања замке: Тенденција да се ствари измишљају не појављује се у златном кластеру.
  • Не верификује судија: Пристрасна порота даје лажно поверење.
  • Не прати производњу: Индекс неуспјех, експлозија трошкова се наставља тихо.

Укратко

  • У РАГ-у, квалитет преузимања и производње се мере одвојено; Прво се мора утврдити која је нога оштећена.
  • опозив@к, прецизност@к, МРР за преузимање; За генерисање се користе верност, подобност, потпуност.
  • Свако мерење захтева златни кластер; Ставите права, тешка, замка и контрадикторна питања.
  • ЛЛМ-као судија велики сетови аутоматски резултати; али сам судија мора бити оправдан против човека.
  • Регресионо тестирање, праћење производње и повратна спрега одржавају квалитет током времена.

Задатак апликације

(1) Направите златни сет од најмање 15 питања за сопственог помоћника: укључите најмање 3 замке (без одговора), 3 тешка, 2 контрадикторна изворна питања. За свако питање напишите очекивани одговор и тачан део. (2) Ручно упоредите две различите верзије одзивника са овим скупом; Дајте сваком одговору 1-5 поена за верност и тачност. (3) Прилагодите упит ЛЛМ-као судија изнад вашим критеријумима. (4) Идентификујте 3 метрике које ћете пратити у производњи и за сваку питајте „на ком прагу да алармирам?“ напиши вредност.

контролна листа

  • [ ] Могу да мерим квалитет задржавања и генерисања помоћу засебних метрика.
  • [ ] Знам шта значе метрика попут рецалл@к, верност.
  • [ ] Могу да направим златни кластер који укључује стварна, тешка, замка и контрадикторна питања.
  • [ ] Могу да подесим аутоматско оцењивање и верификујем судију са ЛЛМ-као судија.
  • [ ] Могу да управљам регресионим тестирањем, праћењем производње и повратном спрегом.