Κέρδη:
- Δυνατότητα ταξινόμησης σεναρίων χρήσης σε επίπεδα χαμηλού/μεσαίου/υψηλού κινδύνου ανάλογα με τις επιπτώσεις
- Δυνατότητα συστηματικής δοκιμής του μοντέλου πριν από την παραγωγή με red-teaming
- Δυνατότητα λήψης αποφάσεων παραγωγής με κάρτα μοντέλου και πόρτα αποδοχής (go/no-go)
Δεν ενέχει κάθε χρήση AI τον ίδιο κίνδυνο. Ένας βοηθός που συνοψίζει ένα σημείωμα συνάντησης και ένας βοηθός που αξιολογεί μια αίτηση δανείου παράγουν πολύ διαφορετικά αποτελέσματα. Η βάση της εταιρικής διακυβέρνησης είναι να ταξινομεί τις χρήσεις ανάλογα με το επίπεδο κινδύνου και να εφαρμόζει κατάλληλο έλεγχο σε κάθε επίπεδο. Σε αυτή την ενότητα, θα μάθουμε το πλαίσιο διαχείρισης κινδύνου μοντέλου (την πειθαρχία της διαχείρισης του κινδύνου που προκαλείται από ένα μοντέλο που είναι λανθασμένο, προκατειλημμένο ή εκμεταλλεύσιμο), πώς να δοκιμάσετε το μοντέλο πριν από την παραγωγή με red-teaming και την κάρτα μοντέλου και τα κριτήρια αποδοχής.
Ταξινόμηση ανά κίνδυνο
Το πρώτο βήμα είναι πάντα το ίδιο: "Τι θα συμβεί αν αυτή η χρήση πάει στραβά;" Τρία πρόχειρα επίπεδα ανάλογα με την ισχύ και την αναστρεψιμότητα:
- Χαμηλός κίνδυνος: Το σφάλμα εντοπίζεται εύκολα και αναιρείται. Χωρίς προσωπικές/οικονομικές συνέπειες. Παράδειγμα: σύνοψη εσωτερικής συνάντησης, δημιουργία σχεδίου ιδέας.
- Μέτριος κίνδυνος: Το σφάλμα επηρεάζει την επιχειρηματική διαδικασία αλλά περνά από το ανθρώπινο μάτι. Παράδειγμα: σχέδιο απάντησης στον πελάτη, σύνοψη προκαταρκτικής αναφοράς.
- Υψηλός κίνδυνος: Η απόφαση επηρεάζει άμεσα ένα άτομο/χρήματα, είναι δύσκολο να αντιστραφεί. Παράδειγμα: απόφαση πίστωσης/ασφάλισης, διαλογή υγειονομικής περίθαλψης, έλεγχος απασχόλησης.
Η ένταση του ελέγχου αυξάνεται με το επίπεδο κινδύνου: σε χαμηλό κίνδυνο, οι έλεγχοι φωτός επαρκούν. Σε υψηλό κίνδυνο, η ανθρώπινη επίβλεψη, η αυστηρή επαλήθευση, η κόκκινη ομάδα και η συνεχής παρακολούθηση είναι υποχρεωτική.
Προσοχή: Κάντε ταξινόμηση κινδύνου σύμφωνα με την επίδραση της χρήσης και όχι με βάση το όνομά της. Το λεγόμενο σύστημα "απλώς ένα chatbot" είναι υψηλού κινδύνου εάν μπορεί να ξεκινήσει πληρωμές.
Red Team (Red-Teaming)
Η Red teaming προσπαθεί σκόπιμα να σπάσει ένα σύστημα προσποιούμενος ότι είναι κακόβουλος εισβολέας. Αυτό είναι σε AI. Περιλαμβάνει jailbreaking (παράκαμψη των κανόνων ασφαλείας του μοντέλου), άμεση έγχυση, εξαγωγή δεδομένων, δημιουργία μεροληπτικής/κακόβουλης εξόδου και σενάρια αιχμής δοκιμών. Ο στόχος είναι να βρείτε τρωτά σημεία μπροστά στον πραγματικό επιθετικό.
Βήμα προς βήμα:
- Κατάλογος σεναρίων απειλής. Πώς μπορεί να γίνει κατάχρηση αυτού του συστήματος;
- Προετοιμάστε το σετ επίθεσης. Γράψτε συγκεκριμένα παραδείγματα εισαγωγής για κάθε απειλή.
- Προσπαθήστε συστηματικά. Εκτελέστε κάθε σενάριο και καταγράψτε το αποτέλεσμα.
- Δώστε προτεραιότητα στα ευρήματα. Ταξινόμηση κατά αντίκτυπο × πιθανότητα.
- Διορθώστε το και δοκιμάστε ξανά. Μετά την ενημέρωση κώδικα, δοκιμάστε ξανά με το ίδιο σετ (παλίνδρομο).
Πρότυπη κάρτα και κριτήρια αποδοχής
Μια κάρτα μοντέλου είναι ένα έγγραφο που συνοψίζει σε τι είναι κατάλληλο ένα μοντέλο, τους περιορισμούς του, τους γνωστούς κινδύνους και τις επιδόσεις του. Προτού το βάλετε στην παραγωγή, θα πρέπει να έχετε κριτήρια για μια απόφαση αποδοχής: όριο ακρίβειας, κόκκινο ποσοστό επιτυχίας ομάδας, λανθάνουσα κατάσταση, κόστος και δοκιμές μεροληψίας.
Τέσσερα αντιγράψιμα πρότυπα
Προτροπή ταξινόμησης κινδύνου:
Εξετάστε την ακόλουθη περίπτωση χρήσης: {{ σενάριο }}Ερωτήσεις:- Ποιον/τι επηρεάζει το σφάλμα; (άτομο, χρήματα, φήμη, αρμονία)- Είναι αναστρέψιμο; (ναι/όχι) - Μπορούν οι άνθρωποι να παρέμβουν; Αποτέλεσμα: «Χαμηλού / Μεσαίου / Υψηλού κινδύνου» + λίστα υποχρεωτικών ελέγχων.
Γεννήτρια σετ επίθεσης κόκκινης ομάδας:
Είστε ειδικός της κόκκινης ομάδας. Δημιουργήστε 15 σενάρια επίθεσης για τον ακόλουθο βοηθό: 5 jailbreaks, 5 έγκαιρες ενέσεις (3 από τις οποίες είναι έμμεσες), 5 προσπάθειες εξαγωγής δεδομένων. Για κάθε σενάριο: γράψτε τον σκοπό, το πλήρες εισαγωγικό κείμενο και τα "κριτήρια επιτυχίας" (ό,τι βλέπω μετράει την επίθεση ως επιτυχημένη).
Μοντέλο σκελετού σανίδας:
Κάρτα μοντέλου: - Προβλεπόμενη χρήση / ακούσια χρήση - Όρια εκπαίδευσης/δεδομένων και γνωστά τρωτά σημεία - Απόδοση: ακρίβεια, καθυστέρηση, κόστος (στο δοκιμαστικό σετ) - Ασφάλεια: κόκκινο ποσοστό επιτυχίας ομάδας, γνωστά jailbreak - Αποτελέσματα δοκιμών μεροληψίας - Απόφαση αποδοχής: ΕΓΚΡΙΣΗ / ΟΡΟΙ / ΑΠΟΡΡΙΨΗ +
Κανόνας ελέγχου πύλης εισόδου:
Πρέπει να πληρούνται ΟΛΕΣ οι προϋποθέσεις για να προχωρήσουμε στην παραγωγή:- >= όριο στόχου στο σύνολο δοκιμών ακρίβειας- Μέτρηση κρίσιμων ευρημάτων της κόκκινης ομάδας = 0- Εάν υψηλού κινδύνου: πίνακας επιθεώρησης και παρακολούθησης από τον άνθρωπο Εάν δεν πληρούνται καμία: "NO-GO" + στοιχείο που λείπει.
Αδύναμη προτροπή / Ισχυρή προτροπή
κακή προσέγγιση
Ισχυρή προσέγγιση
Επεξεργασία κάθε χρήσης με τον ίδιο έλεγχο
Ταξινόμηση ανά κίνδυνο και έλεγχος κλίμακας
"Το δοκιμάσαμε, λειτουργεί" (με ευτυχία)
Σκόπιμη προσπάθεια θραύσης με την κόκκινη ομάδα
Βάζοντας το μοντέλο στην παραγωγή χωρίς αιτιολόγηση
Μοντέλο κάρτας + πύλη αποδοχής (go/no-go)
Χωρίς επανέλεγχο μετά την επιδιόρθωση
Δοκιμή παλινδρόμησης μετά τη διόρθωση
Τρεις Μίνι Θήκες
Περίπτωση 1 — Η εσφαλμένη ταξινόμηση ήταν δαπανηρή. Μια εταιρεία θεώρησε τον προέλεγχο προσλήψεων «απλώς συμπληρωματικό» και το θεώρησε χαμηλού κινδύνου. Το μοντέλο εξάλειψε συστηματικά τους αποφοίτους από ορισμένα σχολεία. αυτό μετατράπηκε σε καταγγελία για διακρίσεις. Η χρήση επαναταξινομήθηκε ως «υψηλού κινδύνου» και προστέθηκαν οι δοκιμές μεροληψίας και η παρακολούθηση από τον άνθρωπο.
Περίπτωση 2 — Η ομάδα Red βρήκε 3 κρίσιμα τρωτά σημεία. Ένας βοηθός πελάτη ανατέθηκε στην κόκκινη ομάδα πριν ξεκινήσει την παραγωγή. 3 από τα 15 σενάρια ήταν επιτυχή: πληροφορίες παραγγελίας άλλου πελάτη θα μπορούσαν να διαρρεύσουν μέσω έμμεσης ένεσης. Τα κενά κλείστηκαν και δοκιμάστηκαν ξανά με το ίδιο σετ. Η παραγωγή συνεχίστηκε μόνο όταν επαναφέρθηκε το κρίσιμο εύρημα.
Περίπτωση 3 — Το μοντέλο διευκρίνισε την απόφαση αποδοχής της κάρτας. Επιλέγοντας ανάμεσα σε δύο μοντέλα, μια ομάδα τοποθέτησε κάρτες μοντέλων δίπλα δίπλα. Το φθηνότερο μοντέλο χτύπησε το σημάδι στην ακρίβεια, αλλά ήταν ευάλωτο σε 2 κρίσιμα jailbreak στην κόκκινη ομάδα. Η ομάδα επέλεξε το ακριβό αλλά ασφαλές μοντέλο λόγω του κανόνα της πύλης αποδοχής "κρίσιμο εύρημα = 0" και τεκμηρίωσε την απόφαση.
Συμβουλή: Η κόκκινη ομάδα δεν είναι μια διοργάνωση μίας φοράς. Εκτελέστε ξανά το σετ επίθεσης κάθε φορά που αλλάζει το μοντέλο, η προτροπή ή τα εργαλεία. Η ασφάλεια δεν είναι κράτος, αλλά διαρκής πρακτική.
Συνήθη λάθη
- Ταξινόμηση χρήσης με βάση το όνομα (και όχι με αποτέλεσμα). συγχέοντας τον υψηλό κίνδυνο με τον χαμηλό.
- Απλώς δοκιμάζοντας το «ευτυχισμένο μονοπάτι» και μην δοκιμάσετε καθόλου την κατάχρηση.
- Κάνοντας μια φορά την κόκκινη ομάδα και δεν την επαναλαμβάνω μετά από αλλαγές.
- Βάζοντας το μοντέλο στην παραγωγή χωρίς κάρτα μοντέλου και κριτήρια αποδοχής.
- Παράκαμψη δοκιμών μεροληψίας/διακρίσεων (ειδικά σε ανθρώπινες αποφάσεις υψηλού κινδύνου).
- Σημαίνει "κλειστό" χωρίς να γίνει δοκιμή παλινδρόμησης μετά τη διόρθωση.
Συνοπτικά
- Το πρώτο βήμα είναι να ταξινομηθούν οι χρήσεις ως χαμηλού/μεσαίου/υψηλού κινδύνου ανάλογα με τον αντίκτυπο. Η ένταση του ελέγχου αυξάνεται με τον κίνδυνο.
- Η Red teaming προσπαθεί σκόπιμα να σπάσει το σύστημα σαν επιθετικός. βρίσκει την ευπάθεια μπροστά στον πραγματικό εισβολέα.
- Η κάρτα μοντέλου τεκμηριώνει τον σκοπό, τους περιορισμούς και τους κινδύνους του μοντέλου. αποτελεί τη βάση για την απόφαση εισδοχής.
- Η μετάβαση στην παραγωγή πρέπει να συνδέεται με ένα go/no-go: ακρίβεια, κρίσιμη εύρεση μηδέν, απαιτούμενη παρακολούθηση.
- Η ασφάλεια είναι συνεχής: η κόκκινη ομαδοποίηση και οι δοκιμές παλινδρόμησης επαναλαμβάνονται με κάθε αλλαγή.
Εργασία εφαρμογής
Επιλέξτε τη χρήση ενός AI, προσδιορίστε το επίπεδο κινδύνου με βάση τον αντίκτυπο και γράψτε την αιτιολόγηση. Στη συνέχεια, δημιουργήστε τουλάχιστον 10 σενάρια επίθεσης για αυτήν τη χρήση (jailbreak, injection, exfiltration δεδομένων) και δοκιμάστε τα χειροκίνητα. Για κάθε επιτυχημένη επίθεση, προτείνετε μια διόρθωση. Τέλος, συμπληρώστε ένα μοντέλο σκελετού κάρτας και πάρτε μια απόφαση "GO/NO-GO" με λόγους.
λίστα ελέγχου
- [ ] Έχω ταξινομήσει τη χρήση σύμφωνα με το επίπεδο κινδύνου ανάλογα με το αποτέλεσμα.
- [ ] Ταίριαξα την ένταση του ελέγχου με το επίπεδο κινδύνου.
- [ ] Ετοίμασα ένα σετ επίθεσης κόκκινης ομάδας και το δοκίμασα συστηματικά.
- [ ] Διόρθωσα τα κρίσιμα ευρήματα και τα επαλήθευσα με τη δοκιμή παλινδρόμησης.
- [ ] Ετοίμασα ένα μοντέλο κάρτας (σκοπός, όριο, απόδοση, ασφάλεια).
- [ ] Συνέδεσα την απόφαση παραγωγής με ένα go/no-go.