Μονάδα 3 / 11

Επαλήθευση εξόδου και ανθρώπινη επιθεώρηση

Κέρδη:

  • Δυνατότητα δημιουργίας σχημάτων και επιπέδων επικύρωσης εξόδου βάσει κανόνων
  • Ικανότητα ουσιαστικής απαίτησης ανθρώπινου δυναμικού σε αποφάσεις υψηλού αντίκτυπου
  • Δυνατότητα σχεδίασης επαλήθευσης και δρομολόγησης βάσει κατωφλίου εμπιστοσύνης με το δεύτερο μοντέλο

Ένα γλωσσικό μοντέλο παράγει ρευστό, πειστικό και συχνά ακριβές — αλλά το «πειστικό» δεν είναι το ίδιο με το «σωστό». Το μοντέλο μπορεί να χωρέσει αθόρυβα ένα ποσό, μια ημερομηνία ή ένα πεδίο JSON. Αυτό ονομάζεται παραίσθηση (το μοντέλο παράγει με σιγουριά πληροφορίες που δεν υπάρχουν στην πραγματικότητα). Σε ένα εταιρικό σύστημα, εάν αυτό το αποτέλεσμα ρέει στο επόμενο βήμα - μια πληρωμή, ένα email, μια εγγραφή βάσης δεδομένων - το σφάλμα διαχέεται στον πραγματικό κόσμο. Σε αυτήν την ενότητα, θα μάθουμε να φιλτράρουμε την έξοδο με επίπεδα επαλήθευσης προτού εισέλθει στο σύστημα και να απαιτούμε τη λειτουργία του ανθρώπου στον βρόχο σε αποφάσεις με μεγάλο αντίκτυπο.

Γιατί απαιτείται επικύρωση εξόδου;

Η έξοδος του μοντέλου μπορεί να καταστραφεί με δύο βασικούς τρόπους: μορφή (δεν συμμορφώνεται με το αναμενόμενο σχήμα JSON, το πεδίο λείπει/περισσεύει) και περιεχόμενο (η μορφή είναι σωστή αλλά η τιμή είναι λάθος — ένας ανύπαρκτος κωδικός προϊόντος, μια παράλογη ημερομηνία). Υπάρχει μια τρίτη διάσταση όσον αφορά την ασφάλεια: κακόβουλη έξοδος (μια κακόβουλη εντολή που παράγεται ως αποτέλεσμα ένεσης ή διαρροής). Ένα συμπαγές σύστημα σταματά και τα τρία στην πόρτα.

Προσοχή: Το "Μοντέλο γενικά ακριβές" δεν είναι κριτήριο παραγωγής. Σε ένα σύστημα χωρίς επαλήθευση, ακόμη και ένα σφάλμα στα χίλια σημαίνει 100 λανθασμένες συναλλαγές την ημέρα σε 100.000 αιτήματα την ημέρα.

Επίπεδα ελέγχου ταυτότητας: Βήμα προς βήμα

  1. Επικύρωση σχήματος. Ελέγξτε με το μηχάνημα ότι η έξοδος είναι σύμφωνη με την αναμενόμενη δομή: υπάρχουν τα πεδία, είναι σωστοί οι τύποι τους, είναι συμπληρωμένα τα απαιτούμενα πεδία;
  2. Επικύρωση κανόνα/επιχειρηματικής λογικής. Οι αξίες ταιριάζουν με τους επιχειρηματικούς κανόνες; (Ποσό > 0, η ημερομηνία δεν είναι μελλοντική, ο κωδικός προϊόντος ανήκει στον κατάλογο.)
  3. Έλεγχος αναφοράς/πηγής. Εάν το μοντέλο παράγει έναν ισχυρισμό, μπορεί να συνδεθεί με την πηγή; (Είναι πράγματι το απόσπασμα RAG στο έγγραφο;)
  4. Επικύρωση με το δεύτερο μοντέλο (LLM-as-judge). Ένα ανεξάρτητο μοντέλο αξιολογεί το αποτέλεσμα ως "σωστό/ατελές/επικίνδυνο".
  5. Όριο εμπιστοσύνης και προσανατολισμός. Εάν το μοντέλο ή ο επικυρωτής αναφέρει χαμηλή εμπιστοσύνη, η έξοδος δεν περνά αυτόματα. απευθύνεται στους ανθρώπους.
  6. Ανθρώπινος έλεγχος. Ένα αποτέλεσμα υψηλής ισχύος ή χαμηλής ασφάλειας εξαρτάται από την έγκριση ενός ειδικού.

Τέσσερα αντιγράψιμα πρότυπα

Σχέδιο + "Φτιάξτε το αν δεν ξέρετε" μαζί:

Επιστρέψτε την απάντηση ΜΟΝΟ στο ακόλουθο σχήμα JSON: Γράψτε "χαμηλό". ΠΟΤΕ μην γράφετε μια εκτίμηση σαν να ήταν ακριβής.

Επαλήθευση με δεύτερο μοντέλο (προτροπή κριτή):

Είστε ανεξάρτητος επικυρωτής. Ακολουθεί ένα κείμενο <πηγή> και ένα <αξίωση>. Ελέγξτε για να δείτε αν ΚΑΘΕ αριθμός και ημερομηνία στην αξίωση εμφανίζονται αυτολεξεί στην πηγή. Για καθένα, πείτε: "επαληθεύτηκε | δεν βρίσκεται στην πηγή | έρχεται σε αντίθεση με την πηγή." Εάν έστω και ένα από αυτά είναι "απούσα/σε σύγκρουση", επισημάνετε το αποτέλεσμα ως "ΑΠΑΙΤΕΙΤΑΙ ΑΝΘΡΩΠΙΝΗ ΕΠΙΣΚΟΠΗΣΗ".<source>{{ κείμενο }}</source><claim>{{ model_output }}</claim>

Κανόνας δρομολόγησης ορίου αξιοπιστίας:

Κανόνας δρομολόγησης:- emin_misin = "υψηλό" ΚΑΙ ποσό < 10.000 TL -> αυτόματη επεξεργασία- emin_misin = "μεσαίο" Ή ποσό 10.000-100.000 TL -> επαλήθευση δεύτερου μοντέλου- emin_misin = "χαμηλό" Ή ποσό > 100.000 TL απαιτείται ανθρώπινη έγκριση ->

Κάρτα περίληψης ανθρώπινου ελέγχου (επιταχύνει τον έλεγχο):

Όταν παρουσιάζετε την απόφαση σε ένα άτομο, προσκομίστε αυτήν την κάρτα: - Τι προτείνεται; (μία πρόταση)- Σε ποια πηγή βασίζεται; (αναφορά άρθρου/έγγραφου)- Ποιες είναι οι 2 πιο αδύναμες υποθέσεις;- Εάν εγκριθούν, μπορούν να αντιστραφούν; (ναι/όχι)

Αδύναμη προτροπή / Ισχυρή προτροπή

κακή προσέγγιση

Ισχυρή προσέγγιση

"Αφαίρεση ποσού από το τιμολόγιο" (ελεύθερο κείμενο)

Αυστηρό σχήμα JSON + null + πεδίο εμπιστοσύνης

Εγγραφή της εξόδου απευθείας στο σύστημα πληρωμών

Σχήμα → κανόνας → ανθρώπινη έγκριση (εάν είναι απαραίτητο)

Απλώς λέω στο μοντέλο "να είσαι σίγουρος"

Επικύρωση αριθμού/ημερομηνίας με δεύτερο μοντέλο

Επεξεργασία κάθε εξόδου με την ίδια σιγουριά

Δρομολόγηση με βάση την επιρροή και την εμπιστοσύνη

Η ισχυρή προσέγγιση δεν ελπίζει ότι το μοντέλο είναι σωστό. Δημιουργεί μια πόρτα που θα σας πιάσει όταν κάνετε λάθος.

Τρεις Μίνι Θήκες

Περίπτωση 1 — Το σύστημα από μόνο του δεν ήταν αρκετό. Ένας λογιστικός αυτοματισμός έβγαζε το ποσό από τα τιμολόγια ως JSON. Το σχέδιο ήταν σωστό, αλλά το μοντέλο παρήγαγε "125.000" αντί για "1.250,00" σε ένα τιμολόγιο (δεκαδική μετατόπιση). Το σύστημα απέτυχε να συλλάβει αυτό. Η επαλήθευση κανόνα ("το ποσό πρέπει να είναι σύμφωνο με το σύνολο των ειδών τιμολογίου κατά ±1%") καταλήφθηκε και αποτράπηκε η εσφαλμένη καταγραφή των 112.500 TL.

Περίπτωση 2 — Το δεύτερο μοντέλο απαθανάτισε την ψευδαίσθηση. «Ειδοποίηση καταγγελίας 30 ημερών», είπε ένας βοηθός νομικής υποστήριξης στη σύνοψη της σύμβασης. Ωστόσο, στο συμβόλαιο ήταν 90 ημέρες. Όταν ο ανεξάρτητος κριτής επισήμανε το μοντέλο ως "σε σύγκρουση με την πηγή", το αποτέλεσμα προωθήθηκε στον άνθρωπο και διορθώθηκε. Εάν ήταν αυτόματη, ο πελάτης θα ειδοποιούσε την ακύρωση με βάση τη λάθος ημερομηνία.

Περίπτωση 3 — Η δρομολόγηση μείωσε το φορτίο κατά 70%. Ένα σύστημα ασφαλιστικών αποζημιώσεων ενέκρινε αυτόματα απαιτήσεις χαμηλού και υψηλής ασφάλειας και έστελνε στον εμπειρογνώμονα μόνο αυτές που υπερβαίνουν το όριο/χαμηλής ασφάλειας. Από τις 3.200 καθημερινές απαιτήσεις, μόνο 950 έπεσαν σε ανθρώπους. Οι ειδικοί αφιέρωσαν τον χρόνο τους στο πραγματικά επικίνδυνο 30%, με τον μέσο χρόνο συναλλαγής να πέφτει από 4 ώρες σε 40 λεπτά.

Συμβουλή: Μην ρυθμίζετε τον ανθρώπινο έλεγχο έτσι ώστε «οι άνθρωποι να μπορούν να δουν τα πάντα» — αυτό θα κουράσει τους ανθρώπους και η έγκριση θα γίνει σφραγίδα από καουτσούκ. Αντίθετα, δρομολογήστε μόνο εκροές υψηλού αντίκτυπου και χαμηλής εμπιστοσύνης στον άνθρωπο. Αυτό εστιάζει την προσοχή σε αυτό που πραγματικά έχει σημασία.

Κάνοντας νόημα τον ανθρώπινο έλεγχο

Το "Human-in-the-loop" δεν έχει να κάνει με την τοποθέτηση ενός πλαισίου ελέγχου σε χαρτί. Ο αναθεωρητής πρέπει να έχει (1) το πλαίσιο για να κατανοήσει την απόφαση, (2) πρόσβαση στην πηγή και (3) την εξουσία να πει «όχι». Διαφορετικά, ο έλεγχος παραμένει κοσμητικός. Η κάρτα αξιολόγησης (τέταρτο πρότυπο παραπάνω) προορίζεται να παρέχει ακριβώς αυτό το πλαίσιο.

Συνήθη λάθη

  • Απλώς κάνουμε επικύρωση σχήματος και παραλείπουμε σφάλματα περιεχομένου/τιμής.
  • Νομίζοντας ότι λέγοντας στο μοντέλο «βεβαιωθείτε» κάνετε πραγματική επαλήθευση.
  • Εφαρμόστε αυτόματα αποφάσεις υψηλού αντίκτυπου, μη αναστρέψιμες.
  • Θέτοντας τον ανθρώπινο έλεγχο σε κάθε έξοδο και μετατρέποντας την έγκριση σε μια ανούσια σφραγίδα από καουτσούκ.
  • Λέγοντας «έγκριση» στον κριτικό χωρίς να αναφέρετε την πηγή και το πλαίσιο.
  • Επεξεργασία όλων των εκροών με τον ίδιο κίνδυνο χωρίς να καθοριστεί όριο εμπιστοσύνης και δρομολόγηση.

Συνοπτικά

  • Η έξοδος είναι κατεστραμμένη με τρεις τρόπους: μορφή, περιεχόμενο και κακόβουλη πρόθεση. ένα συμπαγές σύστημα σταματά και τα τρία στην πόρτα.
  • Επίπεδα: επικύρωση σχήματος, λογική κανόνων/επιχειρήσεων, έλεγχος πηγής, δεύτερο μοντέλο (LLM-as-judge) και δρομολόγηση ορίου εμπιστοσύνης.
  • Το Human-in-the-Loop θα πρέπει να είναι υποχρεωτικό για εξόδους υψηλής πρόσκρουσης και χαμηλής ασφάλειας.
  • Η ανθρώπινη αναθεώρηση πρέπει να έχει νόημα: ο αναθεωρητής πρέπει να έχει το πλαίσιο, την πρόσβαση στους πόρους και την εξουσία να λέει «όχι».
  • Τόσο η ασφάλεια όσο και η αποτελεσματικότητα επιτυγχάνονται κατευθύνοντας μόνο τα επικίνδυνα στον άνθρωπο και όχι σε κάθε αποτέλεσμα.

Εργασία εφαρμογής

Πάρτε ένα παράδειγμα από τη δική σας έξοδο AI. Πρώτα ορίστε ένα σχήμα JSON και πιέστε την έξοδο σε αυτό. Στη συνέχεια, γράψτε τουλάχιστον δύο επιχειρηματικούς κανόνες (για παράδειγμα, "το ποσό αντιστοιχεί στο σύνολο των αντικειμένων"). Τέλος, δημιουργήστε έναν πίνακα δρομολόγησης: ποιος συνδυασμός εμπιστοσύνης/επιρροής πηγαίνει αυτόματα, ποιος πηγαίνει στο δεύτερο μοντέλο, ποιος στον άνθρωπο; Δημιουργήστε ένα ελαττωματικό δείγμα και παρατηρήστε πού το συλλαμβάνει κάθε στρώμα.

λίστα ελέγχου

  • [ ] Ορίζω ένα αυστηρό σχήμα για την έξοδο και το επαληθεύω με το μηχάνημα.
  • [ ] Πρόσθεσα τουλάχιστον μία επικύρωση επιχείρησης/κανόνων (λογική αξίας).
  • [ ] Μπορώ να συνδέσω τους ισχυρισμούς με την πηγή και να τους ελέγξω.
  • [ ] Διατίθεται δεύτερο μοντέλο ή ανθρώπινη επικύρωση για αποτελέσματα υψηλών επιπτώσεων/χαμηλών ασφάλειας.
  • [ ] Κανόνας δρομολόγησης που ορίζεται με βάση την εμπιστοσύνη και την επιρροή.
  • [ ] Ο αναθεωρητής έχει το πλαίσιο, την πηγή και την εξουσία για απόρριψη.