Enota 9 / 11

Neprekinjeno spremljanje, opaznost in odmik

Dobički:

  • Sposobnost definiranja meritev, ki spremljajo signale uporabe, varnosti, kakovosti in učinkovitosti
  • Sposobnost zaznavanja odstopanja kakovosti izpisa z osnovno linijo in vzorčenjem
  • Možnost nastavitve alarma in povratne zanke za anomalije in valove bega iz zapora

Uvedba sistema AI v proizvodnjo je začetek, ne konec. Tudi če model ostane enak, se svet spremeni: vedenje uporabnikov, vhodni podatki, tehnike napadov in poslovni kontekst se nenehno spreminjajo. Včerajšnji pravilni odgovor je lahko danes napačen. Zadnji steber varnosti je torej stalno spremljanje in opazovanje – zmožnost videti od zunaj, kaj se dogaja znotraj sistema. V tej enoti se bomo naučili, katere meritve spremljati, kako zajeti odstopanje kakovosti izhoda in kako opozoriti na anomalije.

Zakaj stalno spremljanje?

V klasični programski opremi je "ali deluje" binarno vprašanje: ali odgovori ali ne. V AI, medtem ko se zdi, da sistem "deluje", se lahko tiho poslabša: odgovori počasi postanejo netočni, stroški se stopnjujejo, poskusi bega iz zapora se povečajo. Edini način za zajemanje teh je nenehno merjenje pravih signalov.

Pozor: najbolj nevarna okvara je tiha, ne hrupna. Sistem ne povzroča napak, njegova kakovost se samo zmanjša. Če ne nastavite spremljanja, bo prva oseba, ki bo to opazila, vaša stranka ali revizor, ne vi.

Štiri signalne družine, ki si jih morate ogledati

  • Uporaba in stroški: obseg zahteve, poraba žetona, cena na uporabnika. Nenaden skok; Lahko je znak zlorabe, zanke integracije ali puščajočega stikala.
  • Varnostni signali: poskusi bega iz zapora/vbrizgavanja, zavrnjeni klici vozila, napake pri avtorizaciji. Povečanje lahko pomeni aktivno kampanjo napada.
  • Kakovost in nihanje: Zmanjšanje kakovosti izpisa skozi čas (odklon). Na primer stopnja uspešnosti preverjanja, stopnja popravkov pri odobritvi ljudi, zadovoljstvo uporabnikov.
  • Zmogljivost: zakasnitev, stopnja napak, časovna omejitev. Neposredno vpliva na uporabniško izkušnjo in stroške.

Kaj je drift in kako ga ujeti?

Odmik je, ko se kakovost vnosov ali izhodov modela sčasoma neopazno spremeni. Obstajata dve vrsti: zamik podatkov (razporeditev dohodnih zahtev se spremeni — nova tema, nov jezik) in zamik kakovosti (izhod za isto delo postopoma slabša). Izhodišče je potrebno za zajemanje: beleženje običajnega obsega meritev, ko je sistem zdrav; Naj odstopanje postane alarm.

Korak za korakom: Nastavitev nadzora

  1. Izmerite osnovno črto. Zabeležite normalno območje vsakega signala, ko je sistem zdrav.
  2. Določite prag in alarm. Katero odstopanje bo koga opozorilo in kako?
  3. Vzorčenje + človeški pregled. Redno naj človeški pregleduje vzorec rezultatov (odklon kakovosti je pogosto samo viden).
  4. Namestite nadzorno ploščo. Spremljajte štiri družine signalov na enem zaslonu.
  5. Povratna zanka. Povežite ugotovitve iz spremljanja s hitrim/nadzornim izboljšanjem.

Štiri kopirane predloge

Poziv za vrednotenje vzorčenja kakovosti (sledenje drsenja z LLM-as-judge):

Spodaj je 20 naključnih natisov iz tega tedna. Vsako ocenite kot "dobro/sprejemljivo/slabo" in napišite kratko utemeljitev. Na koncu bom primerjal slabo stopnjo s stopnjo prejšnjega tedna; Če obstaja vzorec (ponovitev iste vrste napake), ki ta teden izstopa, ga označite.<outputs>{{ examples }}</outputs>

Poziv za povzetek anomalij:

Preglejte naslednje dnevne meritve: število zahtev, žetoni, stroški, zavrnjen klic orodja, poskusi bega iz zapora, povprečna zakasnitev. Vsako meritev, ki odstopa od izhodišča za več kot 30 %, označite kot "ANOMALIT" in ocenite možen vzrok (napad, napaka, zloraba).<metrics>{{ daily_data }}</metrics>

Pravilo za določitev praga alarma:

Določite alarme za vsak signal:- Cena: če presega 2-kratno dnevno povprečje -> opozorilo visoke prioritete- Poskusi bega iz zapora: če jih je več kot 10 na uro -> obvestite varnostno ekipo- Stopnja uspešnosti preverjanja: če pade pod 90 % -> pregled kakovosti- Zakasnitev: če p95 preseže cilj za 2-krat -> pregled delovanja

Poziv za raziskavo drsenja:

Stopnja uspešnosti preverjanja je padla s 94 % na 78 % v zadnjih 2 tednih. Pomagajte mi odgovoriti na ta vprašanja: (1) Ali se je v dohodnih zahtevah pojavila nova tema/jezik/oblika? (2) Ali so napake koncentrirane v določeni kategoriji? (3) Ali čas sovpada s spremembo poziva/modela/orodja? Za vsakega poimenujte podatke, ki jih želite preveriti.

Šibek poziv / močan poziv

slab pristop

Močan pristop

"Če je napaka, bomo videli"

Osnovna vrednost + prag + proaktivni alarm

Samo preverjam, ali sistem stoji.

Spremljanje štirih družin signalov (uporaba, varnost, kakovost, zmogljivost)

Sploh ne vzorči kakovosti izpisa

Redno vzorčenje ljudi + LLM-as-judge

Brez zbiranja in gledanja meritev

Nadzorna plošča + povratna zanka

Trije mini kovčki

1. primer — Alarm stroškov je zalotil ključ, ki pušča. Dnevni strošek žetona podjetja se je čez noč potrojil. Alarm praga je opozoril varnostno ekipo; preiskava je pokazala, da je testni ključ ušel in ga je uporabil bot. Ključ je bil preklican v 25 minutah; Če alarma ne bi bilo, bi se račun poznal ob koncu meseca.

Primer 2 – Tiho kakovostno premikanje. Stopnja uspešnosti preverjanja pomočnika podpore je v treh tednih tiho padla s 95 % na 80 %. Tedensko vzorčenje je to zajelo; Razlog je bil v tem, da so stranke začele spraševati o novi liniji izdelkov in da je bila baza znanja o tem modelu nepopolna. Stopnja se je obnovila, ko je bila baza znanja posodobljena.

Primer 3 – Val bega iz zapora je bil zgodnji. Število poskusov injiciranja pomočnika se je povečalo z 2 na 40 na uro v enem dnevu. Sprožen varnostni alarm; Videti je bilo, da so na forumu delili "recept" za vdiranje sistema. Ekipa je posodobila obrambni poziv in sumljive račune z omejeno hitrostjo; Val je zamrl, preden se je spremenil v pravo puščanje.

Namig: Ne zadovoljite se samo s strojnimi meritvami. Odmik kakovosti se pogosto ujame tako, da človek samo prebere vzorčne rezultate. Majhna rutina pregledovanja 15–20 naključnih izpisov na teden bo zgodaj odkrila najdražje tihe okvare.

Pogoste napake

  • Ne dajanje v proizvodnjo in vzpostavitev nadzora ("deluje, v redu").
  • Nezmožnost prepoznavanja anomalije brez merjenja osnovne vrednosti.
  • Pogrešamo kakovostno premikanje, če samo pogledamo, "ali zdrži".
  • Sploh ni vzorčenje izhodne kakovosti skozi človeške oči.
  • Neproženje alarma in ugotavljanje težave pri stranki/nadrejenem.
  • Nepovezovanje ugotovitev spremljanja z izboljšavami (brez povratne zanke).

Če povzamem

  • Sistemi AI se lahko tiho poslabšajo; Najnevarnejša okvara je tista, ki ne povzroči napak, ampak le zmanjša kakovost.
  • Sledite štirim družinam signalov: uporaba/cena, varnost, kakovost/odmik in zmogljivost.
  • Premik (premik vhodne ali izhodne kakovosti skozi čas) je zajet le v primerjavi z izhodiščem.
  • Redno človeško vzorčenje poleg meritev stroja zajame nihanje kakovosti.
  • Priključite nadzor na alarmno in povratno zanko; Merjenje in negledanje ni spremljanje.

Aplikacijska naloga

Izberite vsaj eno metriko iz vsake od štirih družin signalov za svoj sistem AI in zapišite njihove trenutne (ali ocenjene) osnovne vrednosti. Za vsako metriko določite alarmni prag. Nato vzemite 15 rezultatov zadnjega semestra in jih ocenite z zgornjim pozivom za vzorčenje; Upoštevajte "slabo" stopnjo. Naj bo to vaša prva osnova, s katero boste v prihodnosti primerjali drift.

kontrolni seznam

  • [ ] Definiral sem meritve iz štirih družin signalov (uporaba, varnost, kakovost, zmogljivost).
  • [ ] Za vsako metriko nastavim izhodiščno vrednost in alarmni prag.
  • [ ] Redno preverjam kakovost izhoda skozi človeške oči.
  • [ ] Signale spremljam na enem samem zaslonu z zaslonsko ploščo.
  • [ ] Alarm gre varnostni ekipi za anomalije in valove bega iz zapora.
  • [ ] Ugotovitve spremljanja pripisujem hitremu/nadzornemu izboljšanju.