Μονάδα 10 / 12

Ασφαλής χρήση: Χωρίς διαρροές και εμπιστευτικότητα

Κέρδη:

  • Δυνατότητα ταξινόμησης δεδομένων που περιέχουν μυστικά, προσωπικά δεδομένα και εμπιστευτικά επιχειρηματικά περιουσιακά στοιχεία και αναγνώριση κόκκινων γραμμών
  • Απόκρυψη, ανωνυμοποίηση και ασφάλιση με συνθετικά δεδομένα πριν από την εισαγωγή δεδομένων
  • Εγκεκριμένη επιλογή εργαλείου, ελαχιστοποίηση περιβάλλοντος και δυνατότητα εφαρμογής αντανακλαστικού περιστροφής πλήκτρων σε περίπτωση διαρροής

Οτιδήποτε επικολλήσετε σε έναν βοηθό κωδικοποίησης είναι δυνητικά εκτός ελέγχου. Ένα κλειδί API, μια απόρριψη βάσης δεδομένων πελατών, ιδιόκτητος πηγαίος κώδικας που δεν έχει ακόμη ανακοινωθεί ή ένα αρχείο ασθενούς — αυτά μπορεί να γίνουν μη αναστρέψιμη διαρροή μόλις μπουν σε ένα μη εγκεκριμένο εργαλείο. Ο μεγαλύτερος κίνδυνος της τεχνητής νοημοσύνης για τις ομάδες λογισμικού δεν προέρχεται από ένα σφάλμα γραμμής, αλλά από μια απρόσεκτη αντιγραφή-επικόλληση. Αυτή η ενότητα έχει να κάνει με την ασφαλή αντιγραφή-επικόλληση.

Εδώ διακρίνουμε τρία πράγματα: ποια δεδομένα δεν πρέπει ποτέ να εισάγονται, ποια εργαλεία μπορούν να χρησιμοποιηθούν με ποιες διασφαλίσεις και πώς να ασφαλιστούν τα δεδομένα πριν την εισαγωγή τους (απόκρυψη, συνθετικά δεδομένα, τοπική εργασία). Αυτό δεν είναι προαιρετικό "θα ήταν ωραίο"? Αποτελεί συμβατική και νομική υποχρέωση στα περισσότερα ιδρύματα.

Γιατί είναι τόσο κρίσιμο;

Δεδομένα που στέλνετε σε ένα εργαλείο τεχνητής νοημοσύνης. που υποβάλλονται σε επεξεργασία στους διακομιστές του παρόχου, μερικές φορές αποθηκεύονται για κάποιο χρονικό διάστημα, μπορούν να χρησιμοποιηθούν για τη βελτίωση του μοντέλου σε ορισμένες ρυθμίσεις προϊόντος. Το να λέτε "διέγραψα τη συνομιλία" συχνά δεν είναι αρκετό. Τη στιγμή που τα δεδομένα φεύγουν από το δίκτυο, προκύπτει κίνδυνος. Επιπλέον, το κόστος της διαρροής είναι υψηλό: ένα κλειδί cloud που έχει διαρρεύσει μπορεί να γίνει κατάχρηση μέσα σε λίγα λεπτά, τα δεδομένα πελατών που διέρρευσαν μπορεί να οδηγήσουν σε ειδοποίηση και κυρώσεις βάσει κανονισμών όπως το KVKK/GDPR και ο ιδιωτικός πηγαίος κώδικας που διέρρευσε μπορεί να καταστρέψει το ανταγωνιστικό πλεονέκτημα.

Ο εμπειρικός κανόνας λοιπόν είναι απλός: Μην εισάγετε τίποτα σε ένα μη εγκεκριμένο όχημα που δεν έχετε την πολυτέλεια να χάσετε. Εάν έχετε αμφιβολίες, μην εισέλθετε.

Προσοχή: Η νοοτροπία «μόνο μια φορά, γρήγορα» είναι η πιο κοινή αιτία διαρροών. Η επικόλληση ενός αρχείου καταγραφής παραγωγής ή ενός αρχείου διαμόρφωσης όπως είναι κατά την επίλυση ενός επείγοντος σφάλματος είναι ακριβώς αυτό που συμβαίνει με τέτοιες αποφάσεις που λαμβάνονται υπό πίεση. Το επείγον δεν αναστέλλει τον κανόνα της εμπιστευτικότητας.

Τι δεν πρέπει ποτέ να εισάγεται (κόκκινη γραμμή)

  • Μυστικά: Κλειδιά API, κωδικοί πρόσβασης, κλειδιά πρόσβασης στο cloud, ιδιωτικά πιστοποιητικά, διακριτικά, συμβολοσειρές σύνδεσης.
  • Προσωπικά δεδομένα (PII): Όνομα-επώνυμο, αριθμός TR ID, e-mail, τηλέφωνο, διεύθυνση, υγειονομικά/οικονομικά αρχεία, δεδομένα πελατών.
  • Εμπιστευτικά περιουσιακά στοιχεία της επιχείρησης: Ακοινοποίητος πηγαίος κώδικας, αποκλειστικοί αλγόριθμοι, μυστικά εσωτερικής αρχιτεκτονικής, λεπτομέρειες συμβολαίου.
  • Ρυθμιζόμενα δεδομένα: Ειδικές προστατευόμενες κατηγορίες όπως υγειονομική περίθαλψη, κάρτα πληρωμής (PCI), προσωπικά οικονομικά.

Βήμα προς βήμα: Ροή ασφαλούς χρήσης

  1. Ταξινόμηση των δεδομένων. Ποια κατηγορία είναι αυτό που έχετε — δημόσιο, εσωτερικό, εμπιστευτικό, ρυθμιζόμενο;
  2. Επιλέξτε όχημα ανά κατηγορία. Τα εμπιστευτικά/ρυθμιζόμενα δεδομένα υποβάλλονται σε επεξεργασία μόνο σε θεσμικά εγκεκριμένα εργαλεία που παρέχουν διασφάλιση δεδομένων (μη χρήση στην εκπαίδευση, όριο διατήρησης, περιφερειακή επεξεργασία).
  3. Ασφαλίστε πριν μπείτε. Απογυμνώστε τα μυστικά, καλύψτε/ανωνυμοποιήστε τα PII, χρησιμοποιήστε συνθετικά (κατασκευασμένα αλλά ρεαλιστικά) δεδομένα αντί για πραγματικά, αν είναι δυνατόν.
  4. Ελαχιστοποιήστε το πλαίσιο. Μειώστε το πρόβλημά σας στο μικρότερο αναπαραγόμενο παράδειγμα που δεν περιλαμβάνει ευαίσθητα μέρη.
  5. Ελέγξτε επίσης την έξοδο. Βεβαιωθείτε ότι δεν υπάρχει κρυφό μυστικό ή υπόλειμμα των δεδομένων σας στον κώδικα που δημιουργείται από το AI.

Τρεις Μίνι Θήκες

Περίπτωση 1 — Το επικολλημένο κλειδί ακυρώθηκε. Ένας προγραμματιστής επικόλλησε ολόκληρο το αρχείο διαμόρφωσης στο AI, ενώ διόρθωσε ένα σφάλμα. Το αρχείο περιείχε ένα ζωντανό κλειδί API τρίτου μέρους. Όταν η ομάδα το παρατήρησε, αμέσως ακύρωσε (περιέστρεψε) το κλειδί και δημιούργησε ένα νέο. Δεν υπήρξε καμία κατάχρηση, αλλά ήταν ένα «φτηνό» περιστατικό. Μάθημα: αφαιρέστε το λούστρο πριν το κολλήσετε—και γυρίστε αμέσως το κλειδί αν έχει διαρρεύσει.

Περίπτωση 2 — Τα συνθετικά δεδομένα έσωσαν την επιχείρηση. Μια ομάδα αντιμετώπιζε σφάλμα ανάλυσης με πραγματικές εγγραφές πελατών. Αντί να εισάγουν πραγματικά δεδομένα, παρήγαγαν 20 γραμμές συνθετικών δεδομένων με την ίδια δομή αλλά εντελώς ψεύτικα, αναπαρήγαγαν το σφάλμα με αυτό και το έλυσαν με AI. Ούτε το PII διέρρευσε ούτε η διάγνωση επιβραδύνθηκε. τα συνθετικά δεδομένα ήταν ασφαλή και επαρκή.

Περίπτωση 3 — Κρυμμένο μυστικό στην εκτύπωση. Κατά τη δημιουργία μιας διαμόρφωσης δείγματος, η τεχνητή νοημοσύνη ενσωμάτωσε ένα κλειδί "δείγματος" ρεαλιστικής εμφάνισης σε αυτό και το εισήγαγε στον κώδικα χωρίς να το αντιληφθεί ο προγραμματιστής. Η σάρωση βάσης κώδικα (μυστικός σαρωτής) το έπιασε και προειδοποίησε. Το αμετάβλητο μυστικό δεν θα έπρεπε ποτέ να μπει στον κώδικα. Ο σωστός τρόπος ήταν να χρησιμοποιήσετε μια μεταβλητή περιβάλλοντος ή έναν διαχειριστή μυστικών. Μάθημα: σαρώστε και την έξοδο για μυστικά.

Τέσσερα αντιγράψιμα πρότυπα

Λίστα ελέγχου κάλυψης πριν από την είσοδο (αυτο):

Προτού δώσω αυτό το κείμενο στην τεχνητή νοημοσύνη, βεβαιωθείτε ότι έχω αφαιρέσει τα ακόλουθα και αντικαταστήσω ό,τι βρείτε με [ΜΑΣΚΗ]: κλειδί API, κωδικός πρόσβασης, διακριτικό, συμβολοσειρά σύνδεσης, όνομα-επώνυμο, email, τηλέφωνο, αριθμός ταυτότητας, δεδομένα πελάτη. Κείμενο:{{text}}

Δημιουργία συνθετικών δεδομένων δοκιμής:

Δημιουργήστε ΠΛΗΡΩΣ κατασκευασμένα (που δεν σχετίζονται με πραγματικό πρόσωπο/ίδρυμα) {{N}}δεδομένα δοκιμής σειράς σύμφωνα με το παρακάτω σχήμα. Κάντε το να φαίνεται ρεαλιστικό, αλλά μην χρησιμοποιείτε κανένα πραγματικό PII. Σχήμα: {{πεδία και τύποι}}Περιλαμβάνει περιπτώσεις ακμών (κενό, όριο, κακή μορφή).

Διορθώθηκε μυστικό κυνήγι (σε ​​κωδικό):

Αναζητήστε μυστικό με σκληρό κώδικα σε αυτόν τον κώδικα/διαμόρφωση: κλειδί, κωδικός πρόσβασης, διακριτικό, προσαρμοσμένη διεύθυνση URL. Εάν το βρείτε, καθορίστε τη θέση του και προτείνετε τη σωστή μέθοδο (μεταβλητή περιβάλλοντος / μυστικός διαχειριστής). Κωδικός:{{κωδικός}}

Αξιολόγηση συμμόρφωσης οχήματος (ανά κατηγορία δεδομένων):

Διαθέτω τον ακόλουθο τύπο δεδομένων: {{κλάση: δημόσια / εσωτερική / εμπιστευτική / ρυθμιζόμενη}}. Το εργαλείο που σκοπεύω να χρησιμοποιήσω είναι: {{εργαλείο}}. Ποιες διασφαλίσεις (αποθήκευση, μη χρήση στην εκπαίδευση, περιοχή, πρόσβαση) πρέπει να επιβεβαιώσω πριν επεξεργαστώ αυτά τα δεδομένα σε αυτό το εργαλείο; Δώστε μια λίστα ελέγχου. Η απόφαση είναι δική μου. Διευκρινίζεις τα κριτήρια.

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμο: (Επικόλληση 200 σειρών πραγματικών χρηστών από τη βάση δεδομένων παραγωγής) "Γιατί υπάρχει σφάλμα ανάλυσης σε αυτά τα δεδομένα;"
Ισχυρή: "Ακολουθούν 15 σειρές με την ίδια δομή με τα πραγματικά δεδομένα αλλά εντελώς συνθετικές (χωρίς PII). Η parse_user() ρίχνει ValueError στις 3, 8 και 12 από αυτές τις σειρές. Ποιο θα μπορούσε να είναι το κοινό μοτίβο, πώς μπορώ να το διορθώσω;

Η ισχυρή έκδοση δεν περιέχει πραγματικά προσωπικά δεδομένα, διατηρώντας παράλληλα τη δομή που απαιτείται για την αναπαραγωγή του σφάλματος. Η διάγνωση παραμένει η ίδια, ο κίνδυνος επαναφέρεται.

Κατηγορία δεδομένων

Μπορεί να υποβληθεί σε επεξεργασία σε AI;

Προαπαιτούμενο

δημόσιο

Ναι

Εσωτερική χρήση (χωρίς ακρίβεια)

Γενικά

Συμμορφωθείτε με την εταιρική πολιτική

Εμπιστευτικό (πηγαίος κώδικας, επιχειρηματικό απόρρητο)

Μόνο εγκεκριμένο όχημα

Εταιρική διασφάλιση + ελαχιστοποίηση

PII / ρυθμίζεται

Κατά κανόνα όχι

Κάλυψη/ανωνυμοποίηση ή χρήση συνθετικών

Συμμόρφωση και ανίχνευση πολιτικής

Η ασφαλής χρήση είναι κάτι περισσότερο από μια προσωπική συνήθεια, είναι ένα εταιρικό σύστημα: ποια εργαλεία είναι εγκεκριμένα, ποια κατηγορία δεδομένων μπορεί να πάει και τι πρέπει να γίνει σε περίπτωση παραβίασης θα πρέπει να ορίζεται σε μια γραπτή πολιτική. Εάν ένα μυστικό διαρρεύσει, το πιο σημαντικό πρώτο βήμα δεν είναι να πανικοβληθείτε, αλλά να επαναφέρετε αμέσως (ακυρώσετε και δημιουργήσετε ένα νέο) τα διαπιστευτήρια που διέρρευσαν και να αναφέρετε το περιστατικό. Εάν δεν γνωρίζετε τη λίστα με τα εγκεκριμένα εργαλεία του οργανισμού σας και τους κανόνες ταξινόμησης δεδομένων, το πρώτο σας καθήκον είναι να τα μάθετε.

Συμβουλή: Ορίστε μια λίστα "αγνοίας" για συγκεκριμένο έργο (π.χ. .env, κρυφοί φάκελοι, αρχεία ταυτότητας) στο εργαλείο Editor/CLI, ώστε αυτά τα αρχεία να μην περιλαμβάνονται κατά λάθος στο περιβάλλον του βοηθού. Η πρόληψη είναι πάντα φθηνότερη από τον καθαρισμό.

Συνήθη λάθη

  • Επικόλληση ευαίσθητων δεδομένων "μόνο μία φορά". Το επείγον δεν αναστέλλει την κόκκινη γραμμή. Η πιο συνηθισμένη διαρροή εμφανίζεται εδώ.
  • Σκεπτόμενος «θα διαγράψω τη συνομιλία». Τη στιγμή που τα δεδομένα φεύγουν από το δίκτυο, προκύπτει κίνδυνος. Η διαγραφή δεν αναιρεί.
  • Επιλέγοντας το όχημα χωρίς να κοιτάτε την κατηγορία του. Η επεξεργασία εμπιστευτικών εταιρικών δεδομένων με προσωπικό λογαριασμό αποτελεί σοβαρή παραβίαση.
  • Δεν γίνεται σάρωση της εξόδου. Το AI μπορεί να ενσωματώσει ένα αμετάβλητο μυστικό στον κώδικα. Επιθεωρήστε επίσης την παραγωγή με τον μυστικό σαρωτή.
  • Δεν το γυρίζει όταν διαρρέει το μυστικό. Η μη ανάκληση του κλειδιού που έχει διαρρεύσει μετατρέπει τη διαρροή σε ζωντανή εκμετάλλευση.

Συνοπτικά

Ο μεγαλύτερος κίνδυνος της τεχνητής νοημοσύνης στο λογισμικό είναι η διαρροή απορρήτου και το μεγαλύτερο μέρος του προκύπτει από μια απόφαση αντιγραφής-επικόλλησης που ελήφθη υπό πίεση. Ο κανόνας είναι σαφής: τα μυστικά, τα προσωπικά δεδομένα, τα εμπιστευτικά επιχειρηματικά περιουσιακά στοιχεία και τα ρυθμιζόμενα δεδομένα δεν εισάγονται σε μη εγκεκριμένα εργαλεία. Ταξινόμηση δεδομένων πριν από την εισαγωγή, επιλογή πράκτορα ανά τάξη, εξαγωγή μυστικών, κάλυψη PII ή χρήση συνθετικών δεδομένων, ελαχιστοποίηση του περιβάλλοντος και σάρωση εξόδου για μυστικά επίσης. Εάν υπάρχει διαρροή, το πρώτο πράγμα: επιστρέψτε τα διαπιστευτήρια και αναφέρετέ το.

Εργασία εφαρμογής

Πάρτε ένα κομμάτι κώδικα/καταγραφής/δεδομένων που έχετε δώσει πρόσφατα (ή σκέφτεστε να δώσετε) στο AI. Αρχικά, προσδιορίστε τους υποψηφίους μυστικούς και PII μέσα με το πρότυπο "list checklist masking". Στη συνέχεια, εάν περιέχει πραγματικά δεδομένα, δημιουργήστε μια έκδοση πανομοιότυπη με το πρότυπο "παραγωγή δεδομένων συνθετικής δοκιμής", αλλά πλήρως κατασκευασμένη και κάντε το πρόβλημά σας αναπαραγώγιμο με αυτό. Τέλος, βρείτε και διαβάστε την εγκεκριμένη λίστα εργαλείων και την πολιτική ταξινόμησης δεδομένων του ιδρύματός σας. Διαφορετικά, σημειώστε αυτή την παράλειψη.

λίστα ελέγχου

  • [ ] Ταξινομώ δεδομένα πριν τα καταχωρίσω (ανοικτά/εσωτερικά/εμπιστευτικά/υπόκεινται σε ρύθμιση).
  • [ ] Δεν εισάγω ποτέ μυστικά, PII και εμπιστευτικά επιχειρηματικά περιουσιακά στοιχεία σε μη εγκεκριμένα εργαλεία.
  • [ ] Χρησιμοποιώ συγκαλυπτικά ή συνθετικά δεδομένα όποτε είναι δυνατόν αντί για πραγματικά δεδομένα.
  • [ ] Μειώνω το πλαίσιο στο μικρότερο παράδειγμα που δεν περιλαμβάνει ευαίσθητα μέρη.
  • [ ] Σαρώνω την έξοδο AI ​​για σκληρά θαμμένο μυστικό.
  • [ ] Γνωρίζω ότι εάν το μυστικό διαρρεύσει, θα επιστρέψω αμέσως τα στοιχεία ταυτότητας και θα αναφέρω το περιστατικό.