Κέρδη:
- Διακρίνοντας τρία μοντέλα ανθρώπινου ελέγχου (στο βρόχο, στο βρόχο, στην εντολή)
- Αναγνώριση και μετριασμός των κινδύνων μεροληψίας και διάκρισης στην παραγωγή τεχνητής νοημοσύνης
- Μεταφράζοντας τις αρχές της διαφάνειας και της επεξήγησης σε συγκεκριμένες εφαρμογές
Ένα σύστημα τεχνητής νοημοσύνης μπορεί τεχνικά να λειτουργεί τέλεια, αλλά εξακολουθεί να είναι λάθος: μπορεί να εξαλείψει συστηματικά μια ομάδα, να αποτύχει να εξηγήσει τον λόγο της απόφασής της ή να οδηγήσει τους ανθρώπους να την αποδεχτούν χωρίς αμφισβήτηση. Σε αυτή την ενότητα, μεταφράζουμε την «ήπια» αλλά πιο αποφασιστική πλευρά της διακυβέρνησης - τον ανθρώπινο έλεγχο, τη διαχείριση μεροληψίας, τη διαφάνεια και την ηθική - σε συγκεκριμένες πρακτικές. Ο στόχος δεν είναι ασαφή συνθήματα όπως "μην εμπιστεύεσαι την τεχνητή νοημοσύνη". Είναι λειτουργικοί μηχανισμοί που δείχνουν πώς να ελέγχει ένα αποτέλεσμα, να μειώνει την προκατάληψη και να δημιουργεί διαφάνεια.
Τρία μοντέλα ανθρώπινου ελέγχου
Η ανθρώπινη επίβλεψη σημαίνει ότι ο άνθρωπος διατηρεί τον έλεγχο των αποφάσεων που λαμβάνονται από την τεχνητή νοημοσύνη. Υπάρχουν τρία βασικά μοντέλα και είναι απαραίτητο να επιλέξετε το σωστό μοντέλο ανάλογα με τον κίνδυνο.
μοντέλο
Σημασία
Εκεί που ταιριάζει
Άνθρωπος στο βρόχο
Ένα άτομο εγκρίνει κάθε απόφαση
Αποφάσεις υψηλού κινδύνου και επιρροής
Άνθρωπος στο βρόχο
Το AI λειτουργεί, οι άνθρωποι παρακολουθούν και επεμβαίνουν εάν είναι απαραίτητο
Συναλλαγές μεσαίου κινδύνου, μεγάλου όγκου
Άνθρωπος στην εντολή
Ο άνθρωπος σχεδιάζει το σύστημα, θέτει τα όριά του, μπορεί να το κλείσει
Συνολικό επίπεδο διακυβέρνησης
Για αποφάσεις που επηρεάζουν σημαντικά το άτομο (απασχόληση, πίστωση, υγειονομική περίθαλψη), προτιμάται το μοντέλο «ανθρωπινός κύκλος»: η τεχνητή νοημοσύνη δίνει συμβουλές, αλλά ένας ικανός άνθρωπος παίρνει την τελική απόφαση. Το "AI είπε έτσι" δεν είναι ποτέ δικαιολογία. Η ευθύνη βαραίνει πάντα τον άνθρωπο.
Προσοχή: Δεν αρκεί ο ανθρώπινος έλεγχος να είναι «στα χαρτιά». Εάν ο άνθρωπος εγκρίνει αυτόματα την πρόταση του AI (λάστιχο), δεν υπάρχει πραγματικός έλεγχος. Για να έχει νόημα ο έλεγχος, πρέπει να μπορεί κανείς να δει το σκεπτικό, να το αμφισβητήσει και να πει πραγματικά «όχι».
Κίνδυνος προκατάληψης και διακρίσεων
Μεροληψία είναι όταν το AI συστηματικά μειονεκτήματα ή πλεονεκτήματα σε ορισμένες ομάδες. Η πηγή του είναι συχνά δεδομένα εκπαίδευσης: εάν υπάρχει διάκριση στα ιστορικά δεδομένα, η τεχνητή νοημοσύνη τα μαθαίνει και τα διατηρεί — ακόμη και τα κλιμακώνει.
Πρακτικά βήματα για τη μείωση της προκατάληψης:
- Ελέγξτε τις ευαίσθητες μεταβλητές: Ελέγξτε την επίδραση τομέων όπως το φύλο, η ηλικία, η εθνικότητα στην απόφαση.
- Αποτελέσματα δοκιμών ανά ομάδες: Παράγει το σύστημα διαφορετικά ποσοστά απόρριψης/αποδοχής σε διαφορετικές ομάδες;
- Προσοχή στις μεταβλητές μεσολάβησης: Πεδία όπως «γειτονιά» ή «σχολείο» μπορεί να υποδηλώνουν έμμεσα εθνοτική/ταξική διάκριση.
- Καθιερώστε τακτική παρακολούθηση: Η προκατάληψη δοκιμάζεται συνεχώς, όχι μόνο μία φορά. Μπορεί να επανέλθει καθώς αλλάζουν τα δεδομένα.
τρεις μίνι θήκες
Περίπτωση 1 — Σφραγίδα από καουτσούκ. Σε μια τράπεζα, οι υπάλληλοι δανείων εγκρίνουν τη βαθμολογία AI χωρίς να την αναθεωρήσουν. Λένε «το σύστημα το έχει ήδη υπολογίσει». Ένας έλεγχος δείχνει ότι σε 498 από τις 500 υποβολές, ο άνθρωπος πήρε την ίδια ακριβώς απόφαση με το AI - επομένως δεν υπάρχει πραγματική αναθεώρηση. Λύση: ζητήστε από τους ανθρώπους να δουν το σκεπτικό, να μαντέψουν την απόφαση σε κάποιο βαθμό και να απαιτήσουν μια σημείωση "γιατί συμφωνώ/διαφωνώ".
Περίπτωση 2 — Έμμεση μεροληψία. Μια τεχνητή νοημοσύνη προσλήψεων βαθμολογεί χαμηλότερα τις γυναίκες υποψήφιες, παρόλο που δεν χρησιμοποιεί καθόλου φύλο. Από πού; Επειδή τα προηγούμενα δεδομένα περιελάμβαναν κυρίως άνδρες σε μια δεδομένη θέση, το μοντέλο έμαθε την έμμεση διάκριση μέσω μεταβλητών αντιπροσώπων όπως η «αδιάλειπτη καριέρα». Οι δοκιμές που βασίζονται σε ομάδες το αποκαλύπτουν αυτό. Η ομάδα εξάγει υποκατάστατες μεταβλητές και παρακολουθεί το αποτέλεσμα.
Περίπτωση 3 — Εμπιστοσύνη στη διαφάνεια. Στην αξιολόγηση ζημιών που βασίζεται σε τεχνητή νοημοσύνη, μια ασφαλιστική εταιρεία ενημερώνει κάθε πελάτη ότι «η απόφαση βασίζεται σε τεχνητή νοημοσύνη, μπορούν να κάνουν έφεση και να ζητήσουν επανεξέταση από τον άνθρωπο». Το ποσοστό αντιρρήσεων είναι χαμηλότερο από το αναμενόμενο, επειδή οι πελάτες κατανοούν και εμπιστεύονται τη διαδικασία. Η διαφάνεια αυξάνει την εμπιστοσύνη ενώ μειώνει τον κίνδυνο.
Διαφάνεια και επεξήγηση
Η διαφάνεια είναι να καταστεί σαφές στους σχετικούς ανθρώπους ότι μια τεχνητή νοημοσύνη είναι σε δράση και πώς λειτουργεί. Επεξηγησιμότητα σημαίνει να μπορείς να εξηγήσεις τον λόγο μιας απόφασης με κατανοητό τρόπο. Συγκεκριμένες εφαρμογές:
- Ειδοποίηση "Μιλάτε με ένα AI" σχετικά με την τεχνητή νοημοσύνη που αλληλεπιδρά με το άτομο.
- "Αυτή η απόφαση βασίστηκε στους ακόλουθους παράγοντες" εξήγηση στις αυτόματες αποφάσεις.
- Παρουσιάστε με σαφήνεια τη διαδρομή για την επανεξέταση και ζητήστε τον ανθρώπινο έλεγχο.
- Για εσωτερικές ομάδες: τεκμηρίωση και καταγραφή του τι κάνει το μοντέλο.
Συμβουλή: Ρωτήστε μια απόφαση AI "ποιοι ήταν οι τρεις κύριοι παράγοντες που επηρέασαν αυτήν την απόφαση;" Δοκιμάστε το με την ερώτηση. Εάν το σύστημα δεν μπορεί να το κάνει κατανοητό και η απόφαση επηρεάζει σημαντικά το άτομο, αυτό το σύστημα δεν είναι ακόμη έτοιμο για υπεύθυνη χρήση.
Μεροληψία αυτοματισμού: η δική του παγίδα
Ακόμα κι αν εδραιωθεί η διαφάνεια και η ανθρώπινη εποπτεία, υπάρχει ένας ύπουλος κίνδυνος από την ανθρώπινη πλευρά: μεροληψία αυτοματισμού. Αυτή είναι η τάση των ανθρώπων να εμπιστεύονται την παραγωγή μιας μηχανής περισσότερο από τη δική τους κρίση. Επειδή η πρόταση τεχνητής νοημοσύνης στην οθόνη εμφανίζεται «αντικειμενική και υπολογισμένη», μπαίνει στον πειρασμό να την αποδεχθεί χωρίς αμφισβήτηση — αυτή είναι η ψυχολογική προέλευση της σφραγίδας από καουτσούκ.
Υπάρχουν συγκεκριμένοι τρόποι για να μειωθεί αυτό. Ενθαρρύνετε πρώτα την αντίθετη γνώμη: ρωτήστε το άτομο που εγκρίνει την απόφαση "Γιατί μπορεί να διαφωνήσω με την τεχνητή νοημοσύνη;" Ζητήστε του να σκεφτεί την ερώτηση. Στη συνέχεια, δείξτε το σκορ εμπιστοσύνης: υποδείξτε πόσο σίγουρο είναι το AI · Σημειώστε ξεχωριστά τις εξόδους χαμηλής εμπιστοσύνης. Στη συνέχεια, ορίστε μια ειδοποίηση σύγκρουσης: Εάν η σύσταση AI παραβιάζει τον κανόνα του ιδρύματος ή τα δεδομένα που είναι διαθέσιμα στον άνθρωπο, το σύστημα θα το επισημάνει. Τέλος, εφαρμόστε τις δύο ανθρώπινες αρχές σε κρίσιμες αποφάσεις. Ένας μεμονωμένος εγκριτής είναι πιο επιρρεπής σε μεροληψία αυτοματισμού.
Προσοχή: Το να λέτε «υπάρχει ανθρώπινη έγκριση» δεν σημαίνει ότι είστε απαλλαγμένοι από προκατάληψη αυτοματισμού. Ο άνθρωπος πρέπει να έχει και την εξουσία, το χρόνο και τις σωστές πληροφορίες για να αμφισβητήσει την τεχνητή νοημοσύνη. Ένα σύστημα που αναγκάζει τον εγκρίνοντα να λάβει 200 αποφάσεις σε 3 δευτερόλεπτα δεν προσφέρει στην πραγματικότητα αληθινό ανθρώπινο έλεγχο.
Αντιγράψιμα πρότυπα
ΠΡΟΤΥΠΟ 1 — Επιλογή μοντέλου ανθρώπινου ελέγχου: "Ποιο μοντέλο ανθρώπινου ελέγχου είναι κατάλληλο για την ακόλουθη χρήση τεχνητής νοημοσύνης [περιγράψτε τη χρήση]: στον βρόχο, στον βρόχο ή στην εντολή; Προτείνετε αιτιολογημένα, λαμβάνοντας υπόψη τον κίνδυνο και τον αντίκτυπο στο άτομο. Προσδιορίστε ποιο στοιχείο ελέγχου πρέπει να προσθέσω για να αποφύγω τον κίνδυνο της σφραγίδας από καουτσούκ."
ΠΡΟΤΥΠΟ 2 — Σχέδιο δοκιμών μεροληψίας: "Σχεδιάστε ένα σχέδιο δοκιμής μεροληψίας [περιγράψτε τη χρήση] για την ακόλουθη τεχνητή νοημοσύνη υποστήριξης αποφάσεων: ποιες ομάδες πρέπει να συγκρίνω, ποια μέτρηση πρέπει να μετρήσω (ποσοστό απόρριψης/αποδοχής, κ.λπ.), ποιες υποκατάστατες μεταβλητές πρέπει να αναζητήσω, πόσο συχνά πρέπει να επαναλαμβάνω τη δοκιμή; Γράψτε το βήμα προς βήμα."
ΠΡΟΤΥΠΟ 3 — Κείμενο περιγραφής απόφασης: "Γράψτε ένα απλό κείμενο περιγραφής για μια εξατομικευμένη αυτοματοποιημένη απόφαση: εάν η απόφαση βασιζόταν σε τεχνητή νοημοσύνη, βασικοί παράγοντες που επηρεάζουν την απόφαση, τρόπος υποβολής ένστασης και αίτησης ανθρώπινης επανεξέτασης. Μη καταγγελτικός, σεβαστός τόνος, 120 λέξεις ή λιγότερο."
ΠΡΟΤΥΠΟ 4 — Λίστα ελέγχου ηθικής αξιολόγησης: "Προετοιμάστε μια λίστα ελέγχου δεοντολογίας πριν δημοσιεύσετε μια χρήση τεχνητής νοημοσύνης: δικαιοσύνη/διακρίσεις, διαφάνεια, ανθρώπινος έλεγχος, απόρρητο, ασφάλεια, λογοδοσία. Συμπεριλάβετε 1-2 σαφείς ερωτήσεις που πρέπει να απαντηθούν σε κάθε τίτλο."
Αδύναμη προτροπή / Ισχυρή προτροπή
ΑΔΥΝΑΜΟΣ: "Είναι δίκαιη αυτή η πρόσληψη τεχνητής νοημοσύνης;"-> Το μοντέλο δίνει μια γενική απάντηση όπως "θα έπρεπε να είναι δίκαιο". δεν παρέχει δοκιμαστή μέθοδο και μέτρηση μεροληψίας. STRONG: "Ρυθμίστε ένα σχέδιο δοκιμών μεροληψίας για αυτήν την τεχνητή νοημοσύνη υποστήριξης προσλήψεων: μια μέθοδος σύγκρισης ποσοστών αποδοχής μεταξύ φύλου και ηλικιακών ομάδων, μεταβλητών μεσολάβησης προς εξέταση, αποδεκτού ορίου διαφοράς και συχνότητας παρακολούθησης. Προσθέστε επίσης έλεγχο για να διασφαλίσετε ότι ο άνθρωπος θα λάβει την τελική απόφαση." -> Το μοντέλο παράγει έναν μετρήσιμο, επαναλαμβανόμενο μηχανισμό δικαιοσύνης.
Συνήθη λάθη
- Αφήνοντας τον ανθρώπινο έλεγχο «στα χαρτιά» και εγκρίνοντας αυτόματα τη σύσταση AI (λάστιχο).
- Αφήνοντας αποφάσεις που επηρεάζουν σημαντικά το άτομο χωρίς επίβλεψη και όχι στο βρόχο.
- Θεωρώντας ότι η μεροληψία επιλύθηκε μόνο και μόνο επειδή "διέγραψα την ευαίσθητη μεταβλητή". παράλειψη μεταβλητών διακομιστή μεσολάβησης.
- Δοκιμάζοντας μια φορά την προκατάληψη και όχι συνεχή παρακολούθηση.
- Παράλειψη διαφάνειας γιατί "είναι τεχνική λεπτομέρεια, ο χρήστης δεν θα καταλάβει".
- Χρησιμοποιώντας ένα σύστημα που δεν μπορεί να εξηγήσει τον λόγο της απόφασης σε κρίσιμες αποφάσεις.
- Αφήνοντας την ηθική αξιολόγηση για μετά τη δημοσίευση, λέγοντας «θα δούμε αργότερα».
Συνοπτικά
- Ο ανθρώπινος έλεγχος εφαρμόζεται σε τρία μοντέλα. Σε αποφάσεις που επηρεάζουν τους ανθρώπους, οι άνθρωποι προτιμώνται στον κύκλο.
- Ο έλεγχος πρέπει να έχει νόημα. Η σφραγίδα (αυτόματη έγκριση) δεν είναι ο πραγματικός έλεγχος.
- Η μεροληψία προέρχεται συχνά από τα δεδομένα εκπαίδευσης. Οι ευαίσθητες και υποκατάστατες μεταβλητές θα πρέπει να ελέγχονται και να παρακολουθούνται συνεχώς.
- Η διαφάνεια και η επεξήγηση απαιτούν ξεκάθαρη παρουσίαση στον χρήστη ότι η τεχνητή νοημοσύνη παίζει και ο λόγος της απόφασης.
- Ο ηθικός έλεγχος πραγματοποιείται πριν από τη δημοσίευση. η ευθύνη βαρύνει πάντα τον άνθρωπο, "το είπε ο AI" δεν αποτελεί δικαιολογία.
Εργασία εφαρμογής
Επιλέξτε μια διαδικασία απόφασης AI που επηρεάζει τα άτομα στον οργανισμό σας (για παράδειγμα, αξιολόγηση εφαρμογών). Προσδιορίστε το κατάλληλο μοντέλο ανθρώπινου ελέγχου για αυτή τη διαδικασία με αιτιολόγηση και σχεδιάστε ένα συγκεκριμένο χειριστήριο για να αποτρέψετε τη σφράγιση από καουτσούκ (π.χ. απαίτηση να δείτε αιτιολόγηση, ανασκόπηση δείγματος). Στη συνέχεια, γράψτε ένα σχέδιο δοκιμής μεροληψίας: καθορίστε ποιες ομάδες θα συγκρίνετε, με ποια μέτρηση, πόσο συχνά και ποιες μεταβλητές μεσολάβησης θα δώσετε προσοχή. Τέλος, συντάξτε ένα κείμενο επεξήγησης απόφασης που θα εμφανιστεί στο άτομο κατά τη διάρκεια αυτής της διαδικασίας και θα περιλαμβάνει μια διαδρομή προσφυγής/ανθρώπινου ελέγχου.
λίστα ελέγχου
- [ ] Επέλεξα το μοντέλο ανθρώπινου ελέγχου που είναι κατάλληλο για τη διαδικασία.
- [ ] Σχεδίασα ένα χειριστήριο από σκυρόδεμα που θα αποτρέψει τη σφραγίδα από καουτσούκ.
- [ ] Ετοίμασα ένα σχέδιο δοκιμής μεροληψίας (ομάδες, μετρήσεις, συχνότητα).
- [ ] Αξιολόγησα τον κίνδυνο υποκατάστατων μεταβλητών.
- [ ] Έγραψα ένα κείμενο επεξήγησης απόφασης για το άτομο.
- [ ] Έχω παρουσιάσει ξεκάθαρα τον δρόμο προς την ένσταση και τον ανθρώπινο έλεγχο.
- [ ] Διεξήγαγα την αναθεώρηση δεοντολογίας πριν από τη δημοσίευση.