Pelnas:
- Gebėjimas atpažinti tylias modelio pablogėjimo priežastis (duomenų poslinkis, koncepcijos poslinkis, paklaida prieš srovę) ir nustatyti trijų sluoksnių (veikimo, įvesties, išvesties) stebėjimą.
- Galimybė įvertinti LLM sistemas keliais lygmenimis, naudojant taisyklių patikrinimus, LLM teisėjo ir žmogaus vertinimą, ir kalibruoti naudojant LLM teisėjo žmogaus inkarą
- Galimybė sukurti eval rinkinį, kuriame būtų briaunos ir saugos atvejai, ir kiekvieną užfiksuotą klaidą paversti nuolatiniu bandomuoju atveju
Kai modelis pradedamas gaminti, jūsų darbas nėra atliktas; Tikroji atsakomybė tik prasideda. Nes modelis gali tyliai sulūžti, kai niekas nežiūri. Šiame skyriuje mes aprėpiame dvi viena kitą papildančias disciplinas: vertinimą (sistemingas modelio kokybės matavimas) ir stebėjimą (nuolatinis modelio stebėjimas gamyboje). Ypač LLM sistemose eval yra sunkesnis ir reikalauja daugiau priežiūros nei klasikinis ML.
Kodėl gamybinis modelis tyliai genda
Sugenda klaida, išspausdinamas žurnalas, suveikia signalizacija. Kita vertus, ML modelis gali būti klaidingas, nesukeldamas klaidų. Trys pagrindinės degradacijos priežastys:
- Duomenų dreifas: įvesties duomenų pasiskirstymas laikui bėgant kinta (nauji produktai, besikeičianti vartotojų elgsena, sezoniškumas). Modelis išlieka tas pats, bet pasaulis keičiasi.
- Sąvokos dreifas: keičiasi įvesties ir išvesties santykis. Tobulėja sukčiavimo taktika ir nepageidaujamų laiškų modeliai; Kas buvo teisinga vakar, bus neteisinga šiandien.
- Viršutinė korupcija: duomenų šaltinis keičia formatą, sritis tampa laisva; Modelis tyliai seilėjo su sugadinta įvestis.
Sekant šie tylūs iškraipymai tampa girdimi.
Ką žiūrėti: trys sluoksniai
Geras stebėjimas apima tris sluoksnius:
- Veiklos metrika: delsa, klaidų dažnis, užklausų apimtis, išteklių naudojimas. "Ar sistema stovi?"
- Duomenų / įvesties metrika: ar įvesties pasiskirstymas panašus į treniruotėse? Ar trūkstamos vertės rodiklis padidėjo? Ar atsirado naujų kategorijų? „Ar modelis mato pažįstamus duomenis?
- Modelio / išvesties metrika: prognozės paskirstymo žurnalas? Ar pasitikėjimo balai sumažėjo? Ir jei įmanoma, koks yra tikslumas, palyginti su pagrindine tiesa? "Ar modelis vis dar tikslus?"
Trečiasis sluoksnis yra vertingiausias, bet pats sunkiausias; nes realus rezultatas dažniausiai ateina vėluojant (pasireiškia po mėnesių ar paskola bus grąžinta ar ne).
Patarimas: jei faktinis rezultatas vėluoja, pirmiausia stebėkite įvesties ir numatymo pasiskirstymą. Įvesties paskirstymo poslinkis yra ankstyvas tikslumo pablogėjimo požymis ir gali sukelti pavojaus signalą nelaukiant tikrojo rezultato.
LLM sistemų įvertinimas: ypatingas iššūkis
Klasikinėje ML „teisingas atsakymas“ yra aiškus (0 arba 1 klasė). Kita vertus, LLM rezultatas yra atviras: į tą patį klausimą gali būti daug teisingų atsakymų, „teisingumas“ netelpa į vieną skaičių. LLM eval metodai:
- Nurodyta metrika: išvesties palyginimas su idealiu atsakymu. Ribotas; nes kitaip išreikštą teisingą atsakymą gali laikyti „neteisinga“.
- Taisyklėmis pagrįsti patikrinimai: ar išvestis galioja JSON? Ar yra kokių nors uždraustų žodžių? Ar jame yra norimi laukai? Pigus, patikimas, sandarus.
- LLM teisėjas (LLM-as-judge): Neverskite modelio klausti "ar šis atsakymas geras pagal šį kriterijų?" Jis skalauja, bet pats teisėjas turi būti patikrintas.
- Žmonių apžvalga: aukso standartas, bet brangus ir lėtas. Jis naudojamas pavyzdyje.
Praktikoje jie naudojami kartu: pigūs taisyklių patikrinimai kiekvienam išėjimui, LLM teisėjas didelėje imtyje, žmogaus vertinimas mažoje, bet griežtoje imtyje.
Silpnas požiūris / Stiprus požiūris
Silpnas: "LLM-paklausiau teisėjo, 92% mūsų atsakymų buvo geri. Sistema puiki."
Güçlü: "Pirmiausia 100 spaudinių pažymėjome žmonėmis. LLM teisėją atlikome ant tų pačių 100 spaudinių ir įvertinome žmogaus ir teisėjo susitarimą – 85% susitarimas, priimtinas. Mes dokumentavome, kur teisėjas sistemingai klydo (polinkis, kad ilgi atsakymai buvo nesąžiningi) ir ištaisėme jo raginimą. Tik tada pasitikėjome teisėju."
Skirtumas: stiprus požiūris patikrina teisėją žmogaus inkaru, o ne aklai. Nepatvirtintas LLM teisėjas suteikia gražiai atrodantį, bet klaidingą pasitikėjimą.
Dėmesio: LLM teisėjas taip pat yra modelis; haliucinogeniškas, neobjektyvus (linkęs atsakyti į ilgus / pasitikinčius atsakymus), gali būti nenuoseklus. Prieš priimdami sprendimus dėl gamybos, sukalibruokite teisėjo balus su žmogaus žymomis.
Vertinimo rinkinys: kruopščiai sukurtas
Geras eval rinkinys atspindi realaus naudojimo įvairovę ir sudėtingus atvejus. Eval, užpildytas tiesiog paprastų pavyzdžių, paliks jus klaidingu pasitikėjimu. Būtinai įdėkite jį į eval klasterį:
- Kraštiniai dėklai: tuščia įvestis, labai ilga įvestis, neįprastas formatas.
- Žinomi sudėtingi atvejai: pavyzdžiai, kai modelis praeityje padarė klaidų (kaip regresijos testas).
- Saugumo incidentai: greiti injekcijos bandymai, kenkėjiškos užklausos, privatumo pažeidimo spąstai.
Eval klasteris laikui bėgant plečiasi: kiekviena nauja klaida, kurią pastebėjote gamyboje, tampa išbandymu kitam vertinimui.
Signalizacija ir intervencija
Stebėjimas lieka neužbaigtas be pavojaus signalo. Kiekvienai svarbiai metrikai turėtų būti nustatytas slenkstis ir atsako planas: „Pranešti inžinieriui, jei įvesties poslinkis viršija X“, „Automatinis atšaukimas, jei klaidų dažnis viršija Y“. Pasirūpinkite, kad pavojaus signalai būtų prasmingi – per daug klaidingų pavojaus signalų sumažina komandos jautrumą ir priverčia ją praleisti tikrąjį pavojaus signalą.
trys mini dėklai
1 atvejis – išankstinis įspėjimas. Tikrasis paklausos prognozės modelio tikslumas paaiškėjo tik savaitės pabaigoje. Komanda stebėjo įvesties paskirstymą ir antradienį pastebėjo staigų naujos produktų kategorijos kilimą – tai, ko modelis dar nebuvo matęs. Jie atnaujino modelį nelaukdami tikslumo kritimo. Įvesties stebėjimo išsaugotos dienos.
2 atvejis – nepatvirtintas teisėjas. Viena komanda pranešė, kad „mūsų kokybė yra puiki“, remdamasi LLM apžvalgininku. Kai padaugėjo klientų skundų, buvo pradėtas žmogaus stebėjimas: teisėjas pasitikinčius, bet neteisingus atsakymus įvertino kaip „gerus“. Kai teisėjas buvo sukalibruotas su žmogaus etiketėmis, tikroji kokybė buvo atskleista ir buvo daug prastesnė. Pamoka: nepasitikėkite teisėju jo nepatvirtinus.
3 atvejis – Regresijos testavimas. Greitas pakeitimas išsprendė vieną problemą ir tyliai pašalino kitą. Tačiau komanda laikė ankstesnes klaidas eval kibire; Išbandžius naują pakeitimą šiame klasteryje, sugedęs dėklas buvo nedelsiant užfiksuotas ir pakeitimas buvo pataisytas. Pamoka: kiekviena ištaisyta klaida turėtų tapti nuolatiniu bandomuoju atveju.
Kopijuojami šablonai
Sukurkite šio gamybos modelio stebėjimo planą. Apima tris sluoksnius:1) Veikimo laikas (delsa, klaidų dažnis, apimtis)2) Įvestis / duomenys (paskirstymo poslinkis, trūkstamos vertės, nauja kategorija)3) Modelis / išvestis (numatymo pasiskirstymas, patikimumas, tikslumas, jei įmanoma)Modelis: [aprašas]. Kiek užtrunka, kol gaunamas tikrasis rezultatas: [duration]Pridėkite kiekvienos metrikos slenkstį ir intervencijos rekomendaciją.
Pasiūlykite šios LLM sistemos vertinimo (įvertinimo) strategiją.Užduotis: [aprašymas]Nustatykite sluoksnius:- Kokie taisyklėmis pagrįsti patikrinimai turėtų būti atliekami kiekvienam išėjimui?- Kokius kriterijus turėtų įvertinti LLM arbitras ir kaip jie turėtų būti patvirtinti (žmogaus inkaras)?- Kuriame pavyzdyje turėtų būti atliktas žmogaus vertinimas? Išvardykite kraštus ir saugos atvejus, kuriuos turėčiau įtraukti į eval.
Patikrinkite šį LLM teisėjo raginimą:- Ar vertinimo kriterijai aiškūs ar subjektyvūs?- Ar jis linkęs į ilgio / pasitikėjimo šališkumą?- Kaip sukalibruoti teisėją naudojant žmogaus žymes? Teisėjo raginimas: [prompt]
Parašykite šio stebėjimo aliarmo atsakymų knygelę.Aliarmas: [pvz.,. Viršytas įvesties dreifo slenkstis]Turi būti: pradiniai valdymo žingsniai, galimos priežastys, atšaukimo kriterijai, kam informuoti.
Pablogėjimo priežasčių lentelė
iškraipymas
simptomas
Būdas ankstyvam aptikimui
duomenų dreifas
Įvesties paskirstymo pokyčiai
Įvesties paskirstymo stebėjimas
koncepcijos pokytis
Teisumas krenta tyliai
Numatymas + faktinis palyginimas
prieš srovę klaida
Laukai tampa laisvi / keičiasi formatas
Schemos patvirtinimas + trūkstamas rodiklis
Modelio nenuoseklumas
Išėjimo paskirstymo poslinkiai
Išėjimo paskirstymo stebėjimas
Dažnos klaidos
- Stebėsenos nenustatymas. Modelis sugenda tyliai, niekas to nemato.
- Stebėkite tik veiklos metrikas. Sistema veikia, bet prognozės gali būti klaidingos.
- LLM naudojimas nepatikrinus teisėjo. Tai suteikia klaidingą pasitikėjimą.
- Eval su lengvais pavyzdžiais. Tai nerodo tikrų sunkumų.
- Neįtraukiant ankstesnių klaidų į vertinimą. Vėl grįžta ta pati klaida.
- Garsūs aliarmai. Komanda tampa nejautrus, trūksta tikro pavojaus signalo.
Apibendrinant
Modelis gali būti netikslus, nesukeldamas klaidų gamyboje; todėl vertinimas ir stebėjimas yra tokie pat svarbūs kaip plėtra. Stebėti trimis lygmenimis (darbo, įvesties, išvesties); Jei faktinis rezultatas vėluoja, naudokite įvesties poslinkį kaip išankstinį įspėjimą. LLM sistemose eval yra neribotas; Naudokite taisyklių patikrinimus, LLM teisėją ir žmogaus vertinimą kartu, tačiau būtinai patvirtinkite LLM teisėją su žmogaus inkaru. Praturtinkite savo „Eval“ grupę krašto ir saugos dėklais ir paverskite kiekvieną užfiksuotą klaidą nuolatiniu bandomuoju atveju.
Taikymo užduotis
Parašykite gamybos (arba beveik gamybos) modelio trijų sluoksnių stebėjimo planą ir nustatykite slenkstį + aliarmą bent vienai įvesties paskirstymo metrikai. Jei turite LLM sistemą: pažymėkite 30 išėjimų su žmonėmis, paleiskite LLM teisėją tais pačiais išėjimais ir išmatuokite žmogaus ir teisėjo susitarimą; Atkreipkite dėmesį į sistemingą teisėjo šališkumą. Į savo „eval“ grupę pridėkite bent 3 kraštus ir 2 saugos dėklus.
kontrolinis sąrašas
- [ ] Stebėjimas apima visus tris sluoksnius (operacinį, įvesties, išvesties).
- [ ] Įvesties poslinkį naudoju kaip išankstinį įspėjimą, jei tikrasis rezultatas vėluoja.
- [ ] Sukalibravau LLM arbitrą su žmogaus etiketėmis.
- [ ] Eval klasteryje yra krašto ir saugos dėklai.
- [ ] Kiekvieną pastebėtą klaidą paverčiau nuolatiniu bandomuoju atveju.
- [ ] Kiekviena svarbi metrika turi slenkstį ir atsako planą.