Добици:
- Способност препознавања тихих узрока деградације модела (померање података, померање концепта, узводна грешка) и успостављање трослојног (оперативног, улазног, излазног) праћења
- Способност процене ЛЛМ система у више слојева помоћу провера правила, ЛЛМ-рефере и људске евалуације, и калибрације помоћу ЛЛМ-рефере људског сидра
- Способност дизајнирања евал скупа који садржи ивице и сигурносне случајеве и претварање сваке ухваћене грешке у трајни тест случај
Једном када модел крене у производњу, ваш посао није завршен; Права одговорност тек почиње. Јер модел може нечујно да се поквари када нико не гледа. У овој целини покривамо две комплементарне дисциплине: евалуацију (систематско мерење квалитета модела) и праћење (стално праћење модела у производњи). Нарочито у ЛЛМ системима, евал је тежи и захтева више пажње од класичног МЛ.
Зашто се производни модел тихо квари
Грешка се руши, дневник се штампа, аларм се укључује. МЛ модел, с друге стране, може бити погрешан, а да не изазове грешке. Три главна узрока деградације:
- Померање података: Дистрибуција улазних података се мења током времена (нови производи, мењање понашања корисника, сезонско). Модел остаје исти, али свет се мења.
- Померање концепта: мења се однос улаз-излаз. Тактике преваре и обрасци нежељене поште се развијају; Оно што је јуче било исправно, данас ће бити погрешно.
- Упстреам корупција: извор података мења формат, област постаје слободна; Модел тихо слини од поквареног уноса.
Праћење чини ове тихе дисторзије чујним.
Шта гледати: три слоја
Добро праћење покрива три слоја:
- Оперативни показатељи: кашњење, стопа грешака, обим захтева, коришћење ресурса. „Да ли систем стоји?“
- Подаци/улазни показатељи: Да ли је дистрибуција улаза слична оној у обуци? Да ли се стопа вредности која недостаје повећала? Да ли су стигле нове категорије? „Да ли модел види познате податке?“
- метрика модела/излаза: Дневник дистрибуције предвиђања? Да ли су резултати самопоуздања пали? И ако је могуће, која је тачност у поређењу са основном истином? „Да ли је модел још увек тачан?“
Трећи слој је највреднији али најтежи; јер прави резултат обично долази са закашњењем (постаје јасно после месеци да ли ће кредит бити отплаћен или не).
Савет: Ако стварни резултат касни, прво пратите дистрибуцију улаза и предвиђања. Померање дистрибуције улаза је рани знак деградације тачности и може изазвати аларм без чекања на стварни резултат.
Евалуација ЛЛМ система: посебан изазов
У класичном МЛ, „тачан одговор“ је јасан (класа 0 или 1). С друге стране, исход ЛЛМ-а је отворен: може бити много тачних одговора на исто питање, „тачност“ се не уклапа у један број. Приступи оцењивања ЛЛМ:
- Референтне метрике: Поређење резултата са идеалним одговором. Лимитед; јер може сматрати тачан одговор другачије изражен као „погрешан”.
- Провере засноване на правилима: Да ли је излаз важећи ЈСОН? Има ли забрањених речи? Да ли садржи жељена поља? Јефтино, поуздано, чврсто.
- ЛЛМ-судија (ЛЛМ-као судија): Немојте терати модел да пита „да ли је овај одговор добар према овом критеријуму?“ Скала је, али сам судија мора бити верификован.
- Људски преглед: Златни стандард, али скуп и спор. Користи се на узорку.
У пракси се ово користи заједно: јефтине провере правила за сваки излаз, ЛЛМ-процена на великом узорку, људска евалуација на малом, али ригорозном узорку.
Слаб приступ / Снажан приступ
Слабо: "ЛЛМ-питао сам судију, 92% наших одговора је било добро. Систем је одличан."
Гуцлу: „Прво смо означили 100 исписа људи. Провели смо ЛЛМ-судију на истих 100 исписа и измерили слагање човека и судије — 85% сагласности, прихватљиво. Документовали смо где је судија систематски погрешио (склоност да дуги одговори буду неправедно добри) и исправили смо његов резултат на који смо веровали судији.“ Тек тада смо веровали судији.“
Разлика: снажан приступ верификује судију људским сидром, а не слепо. Неверификовани ЛЛМ судија даје леп изглед, али лажно самопоуздање.
Пажња: ЛЛМ-рефере је такође модел; халуциногена, пристрасна (фаворизује дуге/поуздане одговоре), може бити недоследна. Калибрирајте судијске резултате помоћу људских ознака пре доношења одлука о продукцији.
Сет за евалуацију: пажљиво дизајниран
Добар сет за процену представља разноврсност стварне употребе и тешких случајева. Евал испуњен само лаким примерима оставиће вас у лажном поверењу. Обавезно га ставите у евал кластер:
- Рубни случајеви: празан унос, веома дуг унос, необичан формат.
- Познати тешки случајеви: Примери у којима је модел направио грешке у прошлости (као регресиони тест).
- Безбедносни инциденти: брзи покушаји убризгавања, злонамерни захтеви, замке за кршење приватности.
Евал кластер временом расте: свака нова грешка коју ухватите у производњи постаје тест случај за следећу евалуацију.
Аларм и интервенција
Мониторинг остаје непотпун без аларма. Требало би да постоји праг и план одговора за сваку важну метрику: „Обавести инжењера ако одступање уноса премаши Кс“, „Аутоматско враћање уназад ако стопа грешке премаши И“. Нека аларми буду смислени — превише лажних аларма десензибилизира тим и чини их да пропусте прави аларм.
три мини кофера
Случај 1 - Рано упозорење. Права тачност модела предвиђања потражње постала је очигледна тек крајем недеље. Тим је пратио дистрибуцију инпута и видео је нагли пораст нове категорије производа у уторак - нешто што модел никада није видео. Ажурирали су модел не чекајући пад тачности. Надгледање уноса уштеђених дана.
Случај 2 - Непроверени судија. Један тим је известио да је „наш квалитет одличан“ на основу ЛЛМ-рецензента. Када су се притужбе купаца повећале, уведен је људски надзор: судија је сматрао самоуверене, али нетачне одговоре као „добре“. Када је судија калибрисан људским ознакама, откривен је прави квалитет и био је много нижи. Поука: не верујте судији а да то не проверите.
Случај 3 – Регресионо тестирање. Брза промена решила је један проблем док је тихо прекинула други. Али тим је држао грешке из прошлости у канти за процену; Када је нова промена тестирана на овом кластеру, покварени случај је одмах ухваћен и промена је поправљена. Поука: свака исправљена грешка треба да постане стални тест случај.
Шаблони који се могу копирати
Направите план праћења за овај производни модел. Покријте три слоја: 1) Оперативни (латенција, стопа грешке, обим)2) Улаз/подаци (померање дистрибуције, недостајућа вредност, нова категорија)3) Модел/излаз (дистрибуција предвиђања, поузданост, тачност ако је могуће) Модел: [опис]. Колико времена је потребно да стигне стварни резултат: [трајање]Додајте праг и препоруку за интервенцију за сваки показатељ.
Предложите стратегију евалуације (евалуације) за овај ЛЛМ систем. Задатак: [опис] Одредите слојеве:- Које провере засноване на правилима треба да се покрећу на сваком излазу?- Које критеријуме ЛЛМ-арбитар треба да процени и како треба да буду валидирани (људско сидро)?- У ком узорку треба да се изврши људска евалуација? Наведите ивице и безбедносне случајеве које треба да поставим у .
Проверите ово обавештење ЛЛМ-рефере:- Да ли су критеријуми оцењивања јасни или субјективни?- Да ли су склони пристрасности дужине/поуздања?- Како да калибрирам судију са људским ознакама?
Напишите рунбоок одговора за овај надзорни аларм. Аларм: [нпр. праг померања улаза је прекорачен]Мора да садржи: почетне контролне кораке, могуће узроке, критеријуме враћања, кога треба обавестити.
Табела узрока погоршања
изобличење
симптом
Пут до раног откривања
дрифт података
Промене дистрибуције улаза
Надзор дистрибуције улаза
промена концепта
Праведност тихо пада
Предвиђање + стварно поређење
узводна грешка
Поља постају празна/формат се мења
Валидација шеме + стопа која недостаје
Недоследност модела
Расподела излаза се помера
Мониторинг дистрибуције излаза
Уобичајене грешке
- Неуспостављање мониторинга. Модел се нечујно квари, нико то не види.
- Пратите само оперативне метрике. Систем је покренут, али предвиђања могу бити погрешна.
- Коришћење ЛЛМ без верификације судије. То даје лажно самопоуздање.
- Евал са лаким примерима. То не указује на стварне потешкоће.
- Не укључујући претходне грешке у евалуацији. Поново се враћа иста грешка.
- Гласни аларми. Тим постаје десензибилизован, недостаје прави аларм.
Укратко
Модел може бити нетачан без изазивања грешака у производњи; па су евалуација и праћење једнако важни као и развој. Успоставити праћење на три нивоа (оперативни, улазни, излазни); Користите померање уноса као рано упозорење ако стварни резултат касни. У ЛЛМ системима, евал је отвореног типа; Користите проверу правила, ЛЛМ-рефере и људску процену заједно — али обавезно потврдите ЛЛМ-рефере помоћу људског сидра. Обогатите свој Евал кластер рубним и сигурносним случајевима и претворите сваку ухваћену грешку у трајни тест случај.
Задатак апликације
Напишите трослојни план праћења за производни (или скоро производни) модел и дефинишите праг + аларм за најмање једну метрику дистрибуције улаза. Ако имате ЛЛМ систем: означите 30 излаза са људима, покрените ЛЛМ-рефере на истим излазима и измерите споразум између људи и судије; Обратите пажњу на систематску пристрасност судије. Додајте најмање 3 ивице и 2 сигурносна кућишта у свој евал кластер.
контролна листа
- [ ] Мониторинг покрива сва три слоја (оперативни, улазни, излазни).
- [ ] Користим инпут дрифт као рано упозорење ако стварни резултат касни.
- [ ] Калибрирао сам ЛЛМ-арбитар са људским ознакама.
- [ ] Евал кластер садржи рубне и сигурносне случајеве.
- [ ] Претворио сам сваку грешку коју сам ухватио у стални тест случај.
- [ ] Сваки важан показатељ има праг и план одговора.