Egység 3 / 11

Kimenet ellenőrzése és emberi ellenőrzés

Nyereség:

  • Képes séma- és szabályalapú kimeneti érvényesítési rétegek létrehozására
  • Az a képesség, hogy a nagy hatású döntések során értelmesen megköveteljük az embert a hurokban
  • Képesség ellenőrzési és megbízhatósági küszöb alapú útválasztás tervezésére a második modellel

A nyelvi modell gördülékeny, meggyőző és gyakran pontos – de a „meggyőző” nem ugyanaz, mint a „helyes”. A modellben csendben elfér egy összeg, egy dátum vagy egy JSON-mező; Ezt nevezik hallucinációnak (a modell magabiztosan állít elő olyan információkat, amelyek a valóságban nem léteznek). Egy vállalati rendszerben, ha ez a kimenet a következő lépéshez – fizetéshez, e-mailhez, adatbázis íráshoz – áramlik, a hiba átterjed a való világba. Ebben az egységben megtanuljuk, hogy a kimenetet ellenőrző rétegekkel szűrjük, mielőtt az bekerülne a rendszerbe, és megköveteljük, hogy a nagy hatású döntések meghozatalakor humán-in-the-loop.

Miért szükséges a kimenet érvényesítése?

A modellkimenet két elsődleges módon sérülhet meg: a formátum (nem felel meg a várt JSON-sémának, a mező hiányzik/többlet) és a tartalom (a formátum helyes, de az érték rossz – nem létező termékkód, logikátlan dátum). Van egy harmadik dimenzió a biztonság szempontjából: rosszindulatú kimenet (injektálás vagy szivárgás eredményeként létrejött rosszindulatú parancs). Egy szilárd rendszer mindhármat megállítja az ajtó előtt.

Figyelem: A „modell általában pontos” nem gyártási kritérium. Egy ellenőrzés nélküli rendszerben ezerből egy hiba is napi 100 hibás tranzakciót jelent 100 000 kérésből naponta.

Hitelesítési rétegek: lépésről lépésre

  1. Sémaellenőrzés. Ellenőrizze a géppel, hogy a kimenet megfelel-e az elvárt szerkezetnek: megvannak-e a mezők, megfelelő-e a típusuk, a kötelező mezők kitöltve?
  2. Szabály/üzleti logika érvényesítése. Az értékek egyeznek az üzleti szabályokkal? (Összeg > 0, a dátum nem a jövőben van, a termékkód a katalógushoz tartozik.)
  3. Referencia/forrás vezérlés. Ha a modell állítást produkál, kapcsolható-e a forráshoz? (A RAG idézet valóban benne van a dokumentumban?)
  4. Érvényesítés a második modellel (LLM-as-judge). Egy független modell a kimenetet "helyes/hiányos/kockázatos"-ként értékeli.
  5. Bizalmi küszöb és orientáció. Ha a modell vagy az érvényesítő alacsony megbízhatóságot jelez, a kimenet nem megy automatikusan; emberekre irányul.
  6. Emberi kontroll. A nagy hatékonyságú vagy alacsony biztonságos eredmény a szakértő jóváhagyásától függ.

Négy másolható sablon

Séma + "pótold ki, ha nem tudod" együtt:

A választ CSAK a következő JSON-sémában adja vissza: Írja be, hogy „alacsony”. SOHA ne írjon becslést úgy, mintha pontos lenne.

Ellenőrzés második modellel (bírói felszólítás):

Ön független érvényesítő. Az alábbiakban egy <source> szöveg és egy <claim> található. Ellenőrizze, hogy az állításban szereplő MINDEN szám és dátum szó szerint szerepel-e a forrásban. Mindegyikhez mondja azt: "ellenőrzött | nincs a forrásban | ellentmond a forrásnak." Ha ezek közül akár az egyik is „hiányzik/ütköző”, jelölje meg az eredményt „EMBERI FELÜLVIZSGÁLAT SZÜKSÉGES”ként.<source>{{ text }}</source><claim>{{ model_output }}</claim>

Megbízhatósági küszöb-útválasztási szabály:

Útválasztási szabály:- emin_misin = "magas" ÉS összeg < 10 000 TL -> automatikus feldolgozás - emin_misin = "közepes" VAGY mennyiség 10 000-100 000 TL -> második modell ellenőrzése- emin_misin = "alacsony" VAGY összeg > 100 000 TL -> emberi jóváhagyás szükséges

Humán audit összefoglaló kártya (felgyorsítja az ellenőrzést):

Amikor bemutatja a döntést egy személynek, mutassa be ezt a kártyát: - Mit javasol? (egy mondat)- Milyen forrásra épül? (cikk/dokumentum hivatkozás)- Mi a 2 leggyengébb feltételezés?- Ha jóváhagyják, megfordíthatók? (igen/nem)

Gyenge felszólítás / Erős felszólítás

rossz megközelítés

Erős megközelítés

"Összeg levonása a számlából" (szabad szöveg)

Szigorú JSON-séma + null + megbízhatósági mező

A kimenet közvetlenül a fizetési rendszerbe írása

Séma → szabály → emberi jóváhagyás (ha szükséges)

Csak annyit mond a modellnek, hogy "legyen biztos"

Szám/dátum érvényesítés második modellel

Minden kimenet feldolgozása ugyanolyan magabiztossággal

Befolyáson és bizalomon alapuló útválasztás

Az erős megközelítés nem reméli, hogy a modell helyes; Olyan ajtót hoz létre, amely elkap, ha téved.

Három mini tok

1. eset – A program önmagában nem volt elég. Egy könyvelési automatizálás JSON-ként kinyerte az összeget a számlákból. A séma helyes volt, de a modell "1250,00" helyett "125 000"-et produkált egy számlán (tizedes eltolás). A séma ezt nem tudta megragadni; szabályellenőrzést ("az összegnek ±1%-kal összhangban kell lennie a számlatételek végösszegével") elkapták, és megakadályozták a 112 500 TL hibás rögzítését.

2. eset – A második modell megörökítette a hallucinációt. „30 napos felmondási idő” – mondta egy jogi asszisztens a szerződés összefoglalójában; A szerződésben azonban 90 nap volt. Amikor a független bíró a modellt "a forrással ütközőnek" jelölte meg, a kimenetet továbbították az embernek, és kijavították. Ha ez automatikus lenne, akkor az ügyfél rossz dátum alapján értesítené az elállást.

3. eset – Az útválasztás 70%-kal csökkentette a terhelést. Egy biztosítási kárigénylési rendszer automatikusan jóváhagyta az alacsony összegű és magas biztosítékú károkat, és csak a küszöbérték feletti/alacsony biztonságú károkat küldte el a szakértőnek. A napi 3200 szükségletből csak 950 esett az emberekre; A szakértők az igazán kockázatos 30%-nak szentelték idejüket, az átlagos tranzakciós idő 4 óráról 40 percre csökkent.

Tipp: Ne állítson be emberi irányítást úgy, hogy „az emberek mindent láthassanak” – ez kifárasztja az embereket, és a jóváhagyás gumibélyegzővé válik. Ehelyett csak a nagy hatású és alacsony megbízhatóságú kimeneteket irányítsa az emberhez; Ez arra irányítja a figyelmet, ami igazán számít.

Az emberi irányítás értelmessé tétele

A Human-in-the-loop nem arról szól, hogy papírra helyezzük a jelölőnégyzetet. A bírálónak rendelkeznie kell (1) a kontextussal, hogy megértse a döntést, (2) hozzá kell férnie a forráshoz, és (3) felhatalmazással kell rendelkeznie arra, hogy „nem”-et mondjon. Ellenkező esetben a vezérlés kozmetikai marad. A felülvizsgálati kártya (a fenti negyedik sablon) éppen ezt a kontextust hivatott megadni.

Gyakori hibák

  • Csak sémaellenőrzést végez, és kihagyja a tartalom/érték hibákat.
  • Azt gondolva, hogy ha azt mondja a modellnek, hogy „bizonyosodj meg róla”, valódi ellenőrzést végez.
  • Nagy hatású, visszafordíthatatlan döntések automatikus végrehajtása.
  • Minden kimenet emberi irányítása, és a jóváhagyás értelmetlen gumibélyegzővé alakítása.
  • A „jóváhagyás” mondása a lektornak a forrás és a kontextus megadása nélkül.
  • Az összes kimenet feldolgozása azonos kockázattal anélkül, hogy megbízhatósági küszöböt és útválasztást határozna meg.

Összefoglalva

  • A kimenet háromféleképpen sérült: forma, tartalom és rosszindulatú szándék; szilárd rendszer mindhármat megállítja az ajtóban.
  • Rétegek: sémaérvényesítés, szabály/üzleti logika, forrásvezérlés, második modell (LLM-as-judge) és megbízhatósági küszöb-útválasztás.
  • Az ember a hurokban kötelezőnek kell lennie a nagy hatású és alacsony biztonsági kimenetek esetén.
  • Az emberi felülvizsgálatnak értelmesnek kell lennie: a bírálónak rendelkeznie kell kontextussal, hozzáféréssel az erőforrásokhoz, és felhatalmazással kell rendelkeznie arra, hogy „nem”-et mondjon.
  • Mind a biztonság, mind a hatékonyság érhető el, ha csak a kockázatosakat irányítjuk az emberekre, nem minden kimenetet.

Pályázati feladat

Vegyünk egy példát a saját AI-kimenetünkből. Először határozzon meg egy JSON-sémát, és kényszerítse rá a kimenetet. Ezután írjon be legalább két üzleti szabályt (például „az összeg megfelel az összes tételnek”). Végül állíts fel egy útválasztó táblát: melyik bizalom/befolyásolás kombináció megy automatikusan, melyik a második modellhez, melyik az emberhez? Hozzon létre egy hibás mintát, és figyelje meg, hogy az egyes rétegek hol rögzítik azt.

ellenőrző lista

  • [ ] Szigorú sémát definiálok a kimenethez, és ellenőrzöm a géppel.
  • [ ] Hozzáadtam legalább egy üzleti/szabályellenőrzést (értéklogikát).
  • [ ] Az állításokat a forráshoz tudom kapcsolni és ellenőrizni tudom.
  • [ ] Második modell vagy emberi hitelesítés elérhető a nagy hatású/alacsony biztonsági eredményekhez.
  • [ ] A bizalom és befolyás alapján meghatározott útválasztási szabály.
  • [ ] A bíráló megkapja a kontextust, a forrást és az elutasításhoz szükséges jogosultságot.