Nyereség:
- Képes séma- és szabályalapú kimeneti érvényesítési rétegek létrehozására
- Az a képesség, hogy a nagy hatású döntések során értelmesen megköveteljük az embert a hurokban
- Képesség ellenőrzési és megbízhatósági küszöb alapú útválasztás tervezésére a második modellel
A nyelvi modell gördülékeny, meggyőző és gyakran pontos – de a „meggyőző” nem ugyanaz, mint a „helyes”. A modellben csendben elfér egy összeg, egy dátum vagy egy JSON-mező; Ezt nevezik hallucinációnak (a modell magabiztosan állít elő olyan információkat, amelyek a valóságban nem léteznek). Egy vállalati rendszerben, ha ez a kimenet a következő lépéshez – fizetéshez, e-mailhez, adatbázis íráshoz – áramlik, a hiba átterjed a való világba. Ebben az egységben megtanuljuk, hogy a kimenetet ellenőrző rétegekkel szűrjük, mielőtt az bekerülne a rendszerbe, és megköveteljük, hogy a nagy hatású döntések meghozatalakor humán-in-the-loop.
Miért szükséges a kimenet érvényesítése?
A modellkimenet két elsődleges módon sérülhet meg: a formátum (nem felel meg a várt JSON-sémának, a mező hiányzik/többlet) és a tartalom (a formátum helyes, de az érték rossz – nem létező termékkód, logikátlan dátum). Van egy harmadik dimenzió a biztonság szempontjából: rosszindulatú kimenet (injektálás vagy szivárgás eredményeként létrejött rosszindulatú parancs). Egy szilárd rendszer mindhármat megállítja az ajtó előtt.
Figyelem: A „modell általában pontos” nem gyártási kritérium. Egy ellenőrzés nélküli rendszerben ezerből egy hiba is napi 100 hibás tranzakciót jelent 100 000 kérésből naponta.
Hitelesítési rétegek: lépésről lépésre
- Sémaellenőrzés. Ellenőrizze a géppel, hogy a kimenet megfelel-e az elvárt szerkezetnek: megvannak-e a mezők, megfelelő-e a típusuk, a kötelező mezők kitöltve?
- Szabály/üzleti logika érvényesítése. Az értékek egyeznek az üzleti szabályokkal? (Összeg > 0, a dátum nem a jövőben van, a termékkód a katalógushoz tartozik.)
- Referencia/forrás vezérlés. Ha a modell állítást produkál, kapcsolható-e a forráshoz? (A RAG idézet valóban benne van a dokumentumban?)
- Érvényesítés a második modellel (LLM-as-judge). Egy független modell a kimenetet "helyes/hiányos/kockázatos"-ként értékeli.
- Bizalmi küszöb és orientáció. Ha a modell vagy az érvényesítő alacsony megbízhatóságot jelez, a kimenet nem megy automatikusan; emberekre irányul.
- Emberi kontroll. A nagy hatékonyságú vagy alacsony biztonságos eredmény a szakértő jóváhagyásától függ.
Négy másolható sablon
Séma + "pótold ki, ha nem tudod" együtt:
A választ CSAK a következő JSON-sémában adja vissza: Írja be, hogy „alacsony”. SOHA ne írjon becslést úgy, mintha pontos lenne.
Ellenőrzés második modellel (bírói felszólítás):
Ön független érvényesítő. Az alábbiakban egy <source> szöveg és egy <claim> található. Ellenőrizze, hogy az állításban szereplő MINDEN szám és dátum szó szerint szerepel-e a forrásban. Mindegyikhez mondja azt: "ellenőrzött | nincs a forrásban | ellentmond a forrásnak." Ha ezek közül akár az egyik is „hiányzik/ütköző”, jelölje meg az eredményt „EMBERI FELÜLVIZSGÁLAT SZÜKSÉGES”ként.<source>{{ text }}</source><claim>{{ model_output }}</claim>
Megbízhatósági küszöb-útválasztási szabály:
Útválasztási szabály:- emin_misin = "magas" ÉS összeg < 10 000 TL -> automatikus feldolgozás - emin_misin = "közepes" VAGY mennyiség 10 000-100 000 TL -> második modell ellenőrzése- emin_misin = "alacsony" VAGY összeg > 100 000 TL -> emberi jóváhagyás szükséges
Humán audit összefoglaló kártya (felgyorsítja az ellenőrzést):
Amikor bemutatja a döntést egy személynek, mutassa be ezt a kártyát: - Mit javasol? (egy mondat)- Milyen forrásra épül? (cikk/dokumentum hivatkozás)- Mi a 2 leggyengébb feltételezés?- Ha jóváhagyják, megfordíthatók? (igen/nem)
Gyenge felszólítás / Erős felszólítás
rossz megközelítés
Erős megközelítés
"Összeg levonása a számlából" (szabad szöveg)
Szigorú JSON-séma + null + megbízhatósági mező
A kimenet közvetlenül a fizetési rendszerbe írása
Séma → szabály → emberi jóváhagyás (ha szükséges)
Csak annyit mond a modellnek, hogy "legyen biztos"
Szám/dátum érvényesítés második modellel
Minden kimenet feldolgozása ugyanolyan magabiztossággal
Befolyáson és bizalomon alapuló útválasztás
Az erős megközelítés nem reméli, hogy a modell helyes; Olyan ajtót hoz létre, amely elkap, ha téved.
Három mini tok
1. eset – A program önmagában nem volt elég. Egy könyvelési automatizálás JSON-ként kinyerte az összeget a számlákból. A séma helyes volt, de a modell "1250,00" helyett "125 000"-et produkált egy számlán (tizedes eltolás). A séma ezt nem tudta megragadni; szabályellenőrzést ("az összegnek ±1%-kal összhangban kell lennie a számlatételek végösszegével") elkapták, és megakadályozták a 112 500 TL hibás rögzítését.
2. eset – A második modell megörökítette a hallucinációt. „30 napos felmondási idő” – mondta egy jogi asszisztens a szerződés összefoglalójában; A szerződésben azonban 90 nap volt. Amikor a független bíró a modellt "a forrással ütközőnek" jelölte meg, a kimenetet továbbították az embernek, és kijavították. Ha ez automatikus lenne, akkor az ügyfél rossz dátum alapján értesítené az elállást.
3. eset – Az útválasztás 70%-kal csökkentette a terhelést. Egy biztosítási kárigénylési rendszer automatikusan jóváhagyta az alacsony összegű és magas biztosítékú károkat, és csak a küszöbérték feletti/alacsony biztonságú károkat küldte el a szakértőnek. A napi 3200 szükségletből csak 950 esett az emberekre; A szakértők az igazán kockázatos 30%-nak szentelték idejüket, az átlagos tranzakciós idő 4 óráról 40 percre csökkent.
Tipp: Ne állítson be emberi irányítást úgy, hogy „az emberek mindent láthassanak” – ez kifárasztja az embereket, és a jóváhagyás gumibélyegzővé válik. Ehelyett csak a nagy hatású és alacsony megbízhatóságú kimeneteket irányítsa az emberhez; Ez arra irányítja a figyelmet, ami igazán számít.
Az emberi irányítás értelmessé tétele
A Human-in-the-loop nem arról szól, hogy papírra helyezzük a jelölőnégyzetet. A bírálónak rendelkeznie kell (1) a kontextussal, hogy megértse a döntést, (2) hozzá kell férnie a forráshoz, és (3) felhatalmazással kell rendelkeznie arra, hogy „nem”-et mondjon. Ellenkező esetben a vezérlés kozmetikai marad. A felülvizsgálati kártya (a fenti negyedik sablon) éppen ezt a kontextust hivatott megadni.
Gyakori hibák
- Csak sémaellenőrzést végez, és kihagyja a tartalom/érték hibákat.
- Azt gondolva, hogy ha azt mondja a modellnek, hogy „bizonyosodj meg róla”, valódi ellenőrzést végez.
- Nagy hatású, visszafordíthatatlan döntések automatikus végrehajtása.
- Minden kimenet emberi irányítása, és a jóváhagyás értelmetlen gumibélyegzővé alakítása.
- A „jóváhagyás” mondása a lektornak a forrás és a kontextus megadása nélkül.
- Az összes kimenet feldolgozása azonos kockázattal anélkül, hogy megbízhatósági küszöböt és útválasztást határozna meg.
Összefoglalva
- A kimenet háromféleképpen sérült: forma, tartalom és rosszindulatú szándék; szilárd rendszer mindhármat megállítja az ajtóban.
- Rétegek: sémaérvényesítés, szabály/üzleti logika, forrásvezérlés, második modell (LLM-as-judge) és megbízhatósági küszöb-útválasztás.
- Az ember a hurokban kötelezőnek kell lennie a nagy hatású és alacsony biztonsági kimenetek esetén.
- Az emberi felülvizsgálatnak értelmesnek kell lennie: a bírálónak rendelkeznie kell kontextussal, hozzáféréssel az erőforrásokhoz, és felhatalmazással kell rendelkeznie arra, hogy „nem”-et mondjon.
- Mind a biztonság, mind a hatékonyság érhető el, ha csak a kockázatosakat irányítjuk az emberekre, nem minden kimenetet.
Pályázati feladat
Vegyünk egy példát a saját AI-kimenetünkből. Először határozzon meg egy JSON-sémát, és kényszerítse rá a kimenetet. Ezután írjon be legalább két üzleti szabályt (például „az összeg megfelel az összes tételnek”). Végül állíts fel egy útválasztó táblát: melyik bizalom/befolyásolás kombináció megy automatikusan, melyik a második modellhez, melyik az emberhez? Hozzon létre egy hibás mintát, és figyelje meg, hogy az egyes rétegek hol rögzítik azt.
ellenőrző lista
- [ ] Szigorú sémát definiálok a kimenethez, és ellenőrzöm a géppel.
- [ ] Hozzáadtam legalább egy üzleti/szabályellenőrzést (értéklogikát).
- [ ] Az állításokat a forráshoz tudom kapcsolni és ellenőrizni tudom.
- [ ] Második modell vagy emberi hitelesítés elérhető a nagy hatású/alacsony biztonsági eredményekhez.
- [ ] A bizalom és befolyás alapján meghatározott útválasztási szabály.
- [ ] A bíráló megkapja a kontextust, a forrást és az elutasításhoz szükséges jogosultságot.