Добивки:
- Способност да се препознаат тивките причини за деградација на моделот (поднесување на податоци, поместување концепт, грешка нагоре) и да се воспостави трислоен (оперативен, влезен, излез) мониторинг
- Способност да се проценат LLM системи во повеќе слоеви со проверки на правила, LLM-судија и проценка од луѓе, и калибрирање со човечки сидро за LLM-судија
- Способност да се дизајнира евална гарнитура што содржи рабови и безбедносни кутии и да се претвори секоја фатена грешка во трајна тест-кутија
Штом моделот оди во производство, вашата работа не е завршена; Вистинската одговорност само што почнува. Затоа што моделот може тивко да се расипе кога никој не гледа. Во оваа единица опфаќаме две комплементарни дисциплини: евалуација (систематско мерење на квалитетот на моделот) и мониторинг (постојано следење на моделот во производството). Особено во LLM системите, eval е потежок и бара поголема грижа од класичниот ML.
Зошто серискиот модел тивко се распаѓа
Паѓа бубачка, се печати дневникот, алармот се вклучува. Моделот ML, од друга страна, може да биде погрешен без да предизвика грешки. Три главни причини за деградација:
- Поместување на податоците: Дистрибуцијата на влезните податоци се менува со текот на времето (нови производи, менување на однесувањето на корисниците, сезонска состојба). Моделот останува ист, но светот се менува.
- Поместување на концептот: Односот влез-излез се менува. Се развиваат тактиките за измама и шемите на спам; Она што беше правилно вчера, денес ќе биде погрешно.
- Корупција нагоре: изворот на податоци го менува форматот, областа станува бесплатна; Моделот тивко се лигави со оштетен влез.
Следењето ги прави звучни овие тивки изобличувања.
Што да гледате: три слоја
Добриот мониторинг опфаќа три слоја:
- Оперативна метрика: латентност, стапка на грешки, волумен на барање, искористеност на ресурси. „Дали системот стои?
- Метрика на податоци/влезни: Дали дистрибуцијата на влезот е слична на онаа во обуката? Дали е зголемена стапката на исчезнатата вредност? Дали пристигнаа нови категории? „Дали моделот гледа познати податоци?
- Метрика на модел/излез: Дневник на дистрибуција на предвидување? Дали оценките за доверба паднаа? И ако е можно, која е точноста во споредба со основната вистина? „Дали моделот е сè уште точен?
Третиот слој е највреден, но најтежок; бидејќи вистинскиот резултат обично доаѓа со задоцнување (по месеци станува јасно дали ќе се отплати заем или не).
Совет: Ако вистинскиот резултат е одложен, прво следете ја дистрибуцијата на внесување и предвидување. Поместувањето на влезната дистрибуција е ран знак за деградација на точноста и може да вклучи аларм без да се чека вистинскиот резултат.
Евалуација на LLM системи: посебен предизвик
Во класичната МЛ, „точниот одговор“ е јасен (класа 0 или 1). Исходот од LLM, од друга страна, е отворен: може да има многу точни одговори на истото прашање, „коректноста“ не се вклопува во еден број. Пристапи за вреднување на LLM:
- Референтна метрика: Споредување на излезот со идеалниот одговор. Ограничено; бидејќи може да го смета точниот одговор изразен поинаку како „погрешен“.
- Проверки засновани на правила: Дали излезот е валиден JSON? Дали има забранети зборови? Дали ги содржи саканите полиња? Евтин, сигурен, тесен.
- LLM-judge (LLM-as-judge): Не терајте модел да праша „дали овој одговор е добар според овој критериум?“ Се размери, но самиот судија мора да биде проверен.
- Човечки преглед: Златен стандард, но скап и бавен. Се користи на примерокот.
Во пракса тие се користат заедно: евтини проверки на правила на секој излез, LLM-судија на голем примерок, човечка евалуација на мал, но ригорозен примерок.
Слаб пристап / Силен пристап
Слаб: „LLM-Го прашав судијата, 92% од нашите одговори беа добри. Системот е одличен“.
Ѓучлу: „Прво означивме човечки етикети 100 отпечатоци. Направивме LLM-судија на истите 100 отпечатоци и го измеривме договорот човек-судија - 85% договор, прифатливо. Документиравме каде судијата систематски погрешил (тенденција да најде долги одговори неправедно добри) и го поправивме неговото барање.
Разликата: силниот пристап го потврдува судијата со човечко сидро, а не слепо. Непроверениот LLM-судија дава убав изглед, но лажна доверба.
Внимание: LLM-судија е исто така модел; халуциноген, пристрасен (фаворизира долги/сигурни одговори), може да биде неконзистентен. Калибрирајте ги судиските резултати со човечки ознаки пред да донесете одлуки за производство.
Комплет за евалуација: внимателно дизајниран
Добриот евал сет претставува разновидност на вистинска употреба и тешки случаи. Евалот исполнет со само лесни примери ќе ве остави во лажна доверба. Погрижете се да го ставите во евалниот кластер:
- Куќишта на рабовите: празен влез, многу долг влез, необичен формат.
- Познати тешки случаи: Примери каде моделот направил грешки во минатото (како регресивен тест).
- Безбедносни инциденти: брзи обиди за инјектирање, злонамерни барања, замки за нарушување на приватноста.
Евалентниот кластер расте со текот на времето: секоја нова грешка што ќе ја фатите во производството станува тест случај за следната евалуација.
Аларм и интервенција
Мониторингот останува нецелосен без аларм. Треба да има праг и план за одговор за секоја важна метрика: „Известете го инженерот ако поместувањето на влезот надминува X“, „Автоматско враќање назад ако стапката на грешка надминува Y“. Чувајте ги алармите значајни - премногу лажни аларми го десензибилизираат тимот и го прават да го пропуштат вистинскиот аларм.
три мини футроли
Случај 1 - Рано предупредување. Вистинската точност на моделот за прогноза на побарувачката стана очигледна дури на крајот на неделата. Тимот ја следеше дистрибуцијата на влезните податоци и забележа ненадеен пораст на нова категорија на производи во вторник - нешто што моделот никогаш не го видел. Тие го ажурираа моделот без да чекаат пад на точноста. Зачувани денови за следење на влезот.
Случај 2 - Непроверен судија. Еден тим објави „нашиот квалитет е одличен“ врз основа на LLM-reviewer. Кога се зголемија поплаките од клиентите, беше воведен човечки мониторинг: судијата ги броеше сигурните, но неточни одговори како „добри“. Откако судијата беше калибриран со човечки ознаки, вистинскиот квалитет беше откриен и беше многу помал. Поука: не му верувајте на судијата без да го потврдите тоа.
Случај 3 - Регресивно тестирање. Навремената промена реши едно прашање, додека тивко прекинуваше друго. Но, тимот ги чуваше грешките од минатото во евалната корпа; Кога новата промена беше тестирана на овој кластер, скршеното куќиште веднаш беше фатено и промената беше поправена. Поука: секоја поправена грешка треба да стане постојан тест случај.
Шаблони за копирање
Направете план за следење на овој производствен модел. Покријте три слоја:1) Оперативни (латентност, стапка на грешка, волумен)2) Влез/податоци (поместување на дистрибуцијата, вредност што недостасува, нова категорија)3) Модел/излез (дистрибуција на предвидување, доверба, точност ако е можно) Модел: [опис]. Колку време е потребно за да пристигне вистинскиот резултат: [времетраење]Додајте праг и препорака за интервенција за секоја метрика.
Предложете стратегија за евалуација (евалуација) за овој систем за LLM. Задача: [опис]Одредете слоеви:- Кои проверки засновани на правила треба да се извршат на секој излез?- Кои критериуми треба да ги оцени LLM-арбитерот и како тие треба да бидат потврдени (човечко сидро)?- Во кој примерок треба да се изврши евалуација на човекот? Наведете ги рабовите и безбедносните случаи што треба да ги поставам.
Проверете го ова известување за LLM-судија:- Дали критериумите за оценување се јасни или субјективни?- Дали е склон кон пристрасност за должина/доверба?- Како да го калибрирам судијата со човечки ознаки?Прашање на судијата: [prompt]
Напишете книга за одговор за овој аларм за следење. Аларм: [на пр. Надмината прагот на повлекување на влезот]Мора да содржи: почетни контролни чекори, можни причини, критериуми за враќање, кој да се информира.
Табела за причина за влошување
искривување
симптом
Начин за рано откривање
дрифт на податоци
Промени на влезната дистрибуција
Следење на дистрибуција на влезови
промена на концептот
Праведноста тивко паѓа
Предвидување + вистинска споредба
горната грешка
Полињата стануваат празни/промени во форматот
Потврда на шемата + стапка што недостасува
Неконзистентност на моделот
Поместувања на дистрибуцијата на излезот
Следење на дистрибуцијата на излезот
Вообичаени грешки
- Не воспоставување мониторинг. Моделот тивко се распаѓа, никој не го гледа.
- Следете ги само оперативните метрики. Системот е во функција, но предвидувањата може да бидат погрешни.
- Користење на LLM без потврдување на судијата. Тоа дава лажна самодоверба.
- Евал со лесни примери. Тоа не укажува на вистинска тешкотија.
- Не вклучувајќи ги минатите грешки во евал. Истата грешка се враќа повторно.
- Гласни аларми. Тимот станува десензибилизиран, пропуштајќи го вистинскиот аларм.
Сумирано
Моделот може да биде неточен без да предизвика грешки во производството; така што евалуацијата и следењето се исто толку важни како и развојот. Воспоставете мониторинг во три слоја (оперативен, влезен, излез); Користете го повлекувањето на влезот како рано предупредување ако вистинскиот резултат е одложен. Во системите за LLM, eval е отворен; Користете ги проверките на правилата, LLM-судијата и човечката евалуација заедно - но не заборавајте да го потврдите LLM-судијата со човечко сидро. Збогатете го вашиот Eval кластер со рабови и безбедносни кутии и претворете ја секоја фатена грешка во постојан тест случај.
Задача за апликација
Напишете трослоен план за следење за производствен (или скоро производствен) модел и дефинирајте праг + аларм за најмалку една метрика за влезно-дистрибуција. Ако имате LLM систем: означете 30 резултати со луѓе, водете LLM-судија на истите излези и измерете го договорот човек-судија; Забележете ја систематската пристрасност на судијата. Додајте најмалку 3 рабови и 2 безбедносни футроли во вашата евална група.
листа за проверка
- [ ] Мониторингот ги опфаќа сите три слоја (оперативен, влезен, излез).
- [ ] Го користам влезното повлекување како рано предупредување ако вистинскиот резултат е одложен.
- [ ] Го калибрирав LLM-арбитерот со човечки етикети.
- [ ] Кластерот Eval содржи рабови и безбедносни кутии.
- [ ] Секоја грешка што ќе ја фатев ја претворив во постојан тест случај.
- [ ] Секоја важна метрика има праг и план за одговор.