Ieguvumi:
- Spēja atpazīt klusos modeļa degradācijas cēloņus (datu novirze, koncepcijas novirze, augšupvērsta kļūda) un izveidot trīs slāņu (darbības, ievades, izejas) uzraudzību
- Spēja novērtēt LLM sistēmas vairākos slāņos ar noteikumu pārbaudēm, LLM tiesneša un cilvēka novērtējumu, kā arī kalibrēt ar LLM tiesneša cilvēka enkuru
- Spēja izveidot eval komplektu, kas satur malas un drošības gadījumus, un pārvērst katru pieķerto kļūdu pastāvīgā testa gadījumā
Kad modelis nonāk ražošanā, jūsu darbs nav pabeigts; Īstā atbildība tikai sākas. Jo modelis var klusībā salūzt, kad neviens neskatās. Šajā nodaļā mēs aptveram divas viena otru papildinošas disciplīnas: novērtēšanu (sistemātiska modeļa kvalitātes mērīšana) un uzraudzību (pastāvīga modeļa uzraudzība ražošanā). Īpaši LLM sistēmās eval ir grūtāks un prasa lielāku piesardzību nekā klasiskais ML.
Kāpēc ražošanas modelis klusi sabojājas
Kļūda avārijā, žurnāls tiek izdrukāts, signalizācija nostrādā. No otras puses, ML modelis var būt nepareizs, neizraisot kļūdas. Trīs galvenie degradācijas cēloņi:
- Datu novirze: ievades datu sadalījums laika gaitā mainās (jauni produkti, mainīga lietotāju uzvedība, sezonalitāte). Modelis paliek nemainīgs, bet pasaule mainās.
- Jēdziena novirze: mainās ievades-izejas attiecības. Krāpšanas taktika un surogātpasta modeļi attīstās; Kas vakar bija pareizi, šodien būs nepareizi.
- Augšējā korupcija: datu avots maina formātu, apgabals kļūst brīvs; Modelis klusi skraida ar bojātu ievadi.
Izsekošana padara šos klusos traucējumus dzirdamus.
Ko skatīties: trīs slāņi
Laba uzraudzība aptver trīs slāņus:
- Darbības rādītāji: latentums, kļūdu līmenis, pieprasījumu apjoms, resursu lietojums. "Vai sistēma darbojas?"
- Datu/ievades metrika: vai ievades sadalījums ir līdzīgs apmācībai? Vai trūkstošās vērtības rādītājs ir palielinājies? Vai ir ienākušas jaunas kategorijas? "Vai modelis redz pazīstamus datus?"
- Modeļa/izejas metrika: prognozēšanas izplatīšanas žurnāls? Vai pārliecības rādītāji ir kritušies? Un, ja iespējams, kāda ir precizitāte salīdzinājumā ar pamata patiesību? "Vai modelis joprojām ir precīzs?"
Trešais slānis ir visvērtīgākais, bet visgrūtākais; jo reālais rezultāts parasti nāk ar kavēšanos (tas kļūst skaidrs pēc mēnešiem, vai kredīts tiks atmaksāts vai nē).
Padoms. Ja faktiskais rezultāts tiek aizkavēts, vispirms pārraugiet ievades un prognozēšanas sadalījumu. Ievades sadalījuma maiņa ir agrīna precizitātes pasliktināšanās pazīme un var izraisīt trauksmi, negaidot faktisko rezultātu.
LLM sistēmu novērtēšana: īpašais izaicinājums
Klasiskajā ML "pareizā atbilde" ir skaidra (0. vai 1. klase). Savukārt LLM iznākums ir beztermiņa: uz vienu un to pašu jautājumu var būt daudz pareizo atbilžu, "pareizība" neietilpst vienā ciparā. LLM eval pieejas:
- Atsauces metrika: izvades salīdzināšana ar ideālo atbildi. Ierobežots; jo tas var uzskatīt par "nepareizu" pareizo atbildi, kas izteikta atšķirīgi.
- Uz kārtulām balstītas pārbaudes: vai izvade ir derīga JSON? Vai ir kādi aizliegti vārdi? Vai tajā ir vēlamie lauki? Lēti, uzticami, blīvi.
- LLM-tiesnesis (LLM-as-judge): Nelieciet modelim jautāt "vai šī atbilde ir laba saskaņā ar šo kritēriju?" Tas mērogojas, bet pats tiesnesis ir jāpārbauda.
- Cilvēku apskats: zelta standarts, bet dārgs un lēns. To izmanto paraugā.
Praksē tos izmanto kopā: lētas noteikumu pārbaudes katrai produkcijai, LLM-tiesnesis lielai izlasei, cilvēka novērtējums mazā, bet stingrā paraugā.
Vāja pieeja / spēcīga pieeja
Vāji: "LLM-Es jautāju tiesnesim, 92% mūsu atbildes bija labas. Sistēma ir lieliska."
Güçlü: "Mēs vispirms apzīmējām 100 izdrukas ar cilvēkiem. Mēs izmantojām LLM tiesnesi uz tām pašām 100 izdrukām un izmērījām cilvēka un tiesneša vienošanos — 85% vienošanās, pieņemama. Mēs dokumentējām, kur tiesnesis sistemātiski kļūdījās (tieksme uzskatīt, ka garās atbildes ir netaisnīgi labas), un labojām viņa uzvedni. Tikai tad mēs uzticējāmies tiesneša rezultātiem."
Atšķirība: spēcīga pieeja pārbauda tiesnesi ar cilvēka enkuru, nevis akli. Nepārbaudīts LLM tiesnesis sniedz izskatīgu, bet nepatiesu pārliecību.
Uzmanību: LLM tiesnesis ir arī modelis; halucinogēni, neobjektīvi (labvēlīgi sniedz garas/pārliecinātas atbildes), var būt nekonsekventi. Pirms ražošanas lēmumu pieņemšanas kalibrējiet tiesnešu rezultātus, izmantojot cilvēku atzīmes.
Novērtēšanas komplekts: rūpīgi izstrādāts
Labs eval komplekts atspoguļo reālu lietojumu un sarežģītus gadījumus. Eval, kas piepildīts ar vienkāršiem piemēriem, atstās jūs nepatiesā pārliecībā. Noteikti ievietojiet to eval klasterī:
- Malas gadījumi: tukša ievade, ļoti gara ievade, neparasts formāts.
- Zināmi smagi gadījumi: piemēri, kad modelis pagātnē ir pieļāvis kļūdas (kā regresijas tests).
- Drošības incidenti: tūlītēji injekcijas mēģinājumi, ļaunprātīgi pieprasījumi, privātuma pārkāpumu slazdi.
Eval klasteris laika gaitā palielinās: katra jauna kļūda, ko uztverat ražošanā, kļūst par pārbaudes gadījumu nākamajam novērtējumam.
Trauksme un iejaukšanās
Uzraudzība paliek nepilnīga bez trauksmes. Katrai svarīgai metrikai jābūt noteiktam slieksnim un atbildes plānam: "Paziņot inženierim, ja ievades novirze pārsniedz X", "Automātiska atgriešana, ja kļūdu līmenis pārsniedz Y". Saglabājiet trauksmes signālus jēgpilnus — pārāk daudz viltus trauksmju padara komandu desensibilizētu un liek tai palaist garām īsto trauksmi.
trīs mini futrāļi
1. gadījums — agrīna brīdināšana. Pieprasījuma prognozes modeļa patiesā precizitāte kļuva acīmredzama tikai nedēļas beigās. Komanda uzraudzīja ievades izplatīšanu un otrdien novēroja jaunas produktu kategorijas pēkšņu pieaugumu — ko modelis nekad nebija redzējis. Viņi atjaunināja modeli, negaidot precizitātes kritumu. Ievades uzraudzības saglabātās dienas.
2. gadījums — nepārbaudīts tiesnesis. Viena komanda ziņoja, ka "mūsu kvalitāte ir lieliska", pamatojoties uz LLM recenzentu. Kad klientu sūdzības pieauga, tika ieviesta cilvēku uzraudzība: tiesnesis pārliecinošas, bet nepareizas atbildes uzskaitīja kā "labas". Kad tiesnesis tika kalibrēts ar cilvēku zīmēm, tika atklāta patiesā kvalitāte, un tā bija daudz zemāka. Mācība: neuzticieties tiesnesim, to nepārbaudot.
3. gadījums — regresijas pārbaude. Ātra izmaiņa atrisināja vienu problēmu, bet klusi pārtrauca citu. Bet komanda saglabāja pagātnes kļūdas eval spainī; Kad jaunās izmaiņas tika pārbaudītas šajā klasterī, bojātais korpuss tika nekavējoties notverts un izmaiņas tika novērstas. Nodarbība: katrai izlabotajai kļūdai jākļūst par pastāvīgu pārbaudes gadījumu.
Kopējamas veidnes
Izveidojiet izsekošanas plānu šim ražošanas modelim. Aptver trīs slāņus:1) Darbības (latents, kļūdu līmenis, apjoms)2) Ievades/dati (sadales maiņa, trūkstošās vērtības, jauna kategorija)3) Modelis/izeja (prognozes sadalījums, ticamība, precizitāte, ja iespējams)Modelis: [apraksts]. Cik ilgs laiks nepieciešams, līdz tiek parādīts faktiskais rezultāts: [duration]Pievienojiet katrai metrikai slieksni un iejaukšanās ieteikumu.
Ierosiniet šīs LLM sistēmas novērtēšanas (vērtēšanas) stratēģiju.Uzdevums: [apraksts]Nosakiet slāņus:- Kuras uz kārtulām balstītas pārbaudes jāveic katrā izvadā?- Kādi kritēriji LLM šķīrējtiesnesim jānovērtē un kā tie ir jāvalidē (cilvēka enkurs)?- Kurā paraugā jāveic cilvēka novērtējums?Uzskaitiet malas un drošības gadījumus, kas man jāievieto vērtēšanā.
Pārbaudiet šo LLM tiesneša uzvedni:- Vai vērtēšanas kritēriji ir skaidri vai subjektīvi?- Vai tie ir pakļauti garuma/pārliecības novirzēm?- Kā kalibrēt tiesnesi, izmantojot cilvēku atzīmes? Tiesneša uzvedne: [prompt]
Uzrakstiet atbildes izpildgrāmatu šim pārraudzības trauksmei.Trauksme: [piem. Pārsniegts ievades novirzes slieksnis]Ir jāietver: sākotnējās kontroles darbības, iespējamie cēloņi, atcelšanas kritēriji, kam jāinformē.
Pasliktināšanās cēloņu tabula
izkropļojumu
simptoms
Veids uz agrīnu atklāšanu
datu novirze
Ievades sadalījuma izmaiņas
Ievades sadales uzraudzība
koncepcijas maiņa
Taisnība krīt klusi
Prognoze + faktiskais salīdzinājums
augšteces kļūda
Lauki kļūst brīvi/formāta izmaiņas
Shēmas validācija + trūkstošais rādītājs
Modeļa nekonsekvence
Izvades sadales nobīdes
Izejas sadales uzraudzība
Biežas kļūdas
- Nav izveidota uzraudzība. Modele saplīst klusi, neviens to neredz.
- Izsekojiet tikai darbības rādītājus. Sistēma ir izveidota, taču prognozes var būt kļūdainas.
- LLM izmantošana bez tiesneša pārbaudes. Tas dod viltus pārliecību.
- Eval ar viegliem piemēriem. Tas neliecina par patiesām grūtībām.
- Neiekļaujot pagātnes kļūdas vērtēšanā. Tā pati kļūda atgriežas vēlreiz.
- Skaļi trauksmes signāli. Komanda kļūst desensibilizēta, trūkst īstās trauksmes.
Rezumējot
Modelis var būt neprecīzs, neradot kļūdas ražošanā; tāpēc eval un monitorings ir tikpat svarīgi kā attīstība. Izveidot uzraudzību trīs līmeņos (darbības, ievades, izejas); Izmantojiet ievades novirzi kā agrīnu brīdinājumu, ja faktiskais rezultāts tiek aizkavēts. LLM sistēmās eval ir beztermiņa; Izmantojiet noteikumu pārbaudes, LLM tiesnesi un cilvēka novērtējumu kopā, taču noteikti apstipriniet LLM tiesnesi ar cilvēka enkuru. Bagātiniet savu Eval kopu ar malām un drošības gadījumiem un pārvērtiet katru pieļauto kļūdu pastāvīgā testa gadījumā.
Lietojumprogrammas uzdevums
Uzrakstiet trīs slāņu uzraudzības plānu ražošanas (vai gandrīz ražošanas) modelim un definējiet slieksni + trauksmi vismaz vienai ievades sadales metrikai. Ja jums ir LLM sistēma: atzīmējiet 30 rezultātus ar cilvēkiem, palaidiet LLM tiesnesi uz tiem pašiem rezultātiem un izmēriet cilvēka un tiesneša vienošanos; Ņemiet vērā tiesneša sistemātisko neobjektivitāti. Pievienojiet savai eval klasterim vismaz 3 malas un 2 drošības korpusus.
kontrolsaraksts
- [ ] Uzraudzība aptver visus trīs slāņus (darbības, ievades, izejas).
- [ ] Es izmantoju ievades novirzi kā agrīnu brīdinājumu, ja faktiskais rezultāts tiek aizkavēts.
- [ ] Es kalibrēju LLM arbitru ar cilvēka etiķetēm.
- [ ] Eval klasterī ir malas un drošības gadījumi.
- [ ] Es katru noķerto kļūdu pārvērtu par pastāvīgu pārbaudes gadījumu.
- [ ] Katram svarīgajam rādītājam ir slieksnis un atbildes plāns.