Μονάδα 1 / 11

Τεχνητή Νοημοσύνη στη Μηχανική ML: Ρόλος, Όρια, Επικύρωση και Υπευθυνότητα

Κέρδη:

  • Το να μπορείς να διακρίνεις πού στη ροή εργασίας ML (κώδικας, δεδομένα, έγγραφο) η τεχνητή νοημοσύνη εξοικονομεί χρόνο με χαμηλό ρίσκο και πού αποφάσεις όπως μετρήσεις / δεδομένα / θέση σε παραγωγή αφήνονται στον άνθρωπο, ανάλογα με το επίπεδο κινδύνου της εργασίας.
  • Δυνατότητα εφαρμογής μιας πειθαρχίας που επαληθεύει κάθε έξοδο AI ​​συνδέοντάς την με την πηγή, εκτελώντας την ξανά, μετρώντας την και περνώντας την από ένα φίλτρο μηχανικής.
  • Δυνατότητα απόκτησης της συνήθειας να μην αποστέλλονται ακατέργαστα εμπιστευτικά και προσωπικά δεδομένα σε εξωτερικά εργαλεία, να χρησιμοποιούν εργαλεία εγκεκριμένα από την εταιρεία και να χειρίζονται θέματα ασφάλειας μόνο για αμυντικούς σκοπούς.

Τεχνητή Νοημοσύνη στη Μηχανική Μηχανικής Μάθησης: Ρόλος, Όρια, Επικύρωση και Ευθύνη

Ένας μηχανικός μηχανικής μάθησης (ML engineer: επαγγελματίας λογισμικού που σχεδιάζει, εκπαιδεύει και φέρνει μοντέλα που μαθαίνουν από τα δεδομένα στην παραγωγή) σήμερα εργάζεται με ένα άλλο εργαλείο τεχνητής νοημοσύνης σε κάθε βήμα της δουλειάς του. Ένας βοηθός κωδικοποίησης είναι σε ισχύ κατά τη σύνταξη κώδικα, ένα μοντέλο συνομιλίας κατά την εξερεύνηση δεδομένων και ένα μοντέλο μεγάλης γλώσσας (LLM: ένα νευρωνικό δίκτυο με δισεκατομμύρια παραμέτρους που κατανοεί και παράγει κείμενο) κατά την παραγωγή τεκμηρίωσης. Αυτή η ενότητα θεωρεί την τεχνητή νοημοσύνη τόσο ως το προϊόν που αναπτύχθηκε όσο και ως το καθημερινό εργαλείο εργασίας ενός μηχανικού ML. Λειτουργεί με σαφή οριοθέτηση των ορίων ευθύνης χωρίς να αναμιγνύονται οι δύο ρόλοι.

Σε αυτήν την πρώτη ενότητα, απαντάμε στη βασική ερώτηση: Πού στη μηχανική ML εξοικονομεί πραγματικό χρόνο η τεχνητή νοημοσύνη και πού πρέπει να αφήσουμε την απόφαση στους ανθρώπους; Η απάντηση βρίσκεται στο επίκεντρο της πειθαρχίας της μηχανικής: αυτός που κατασκευάζει είναι γρήγορος, αυτός που επαληθεύει είναι υπεύθυνος.

Πού είναι χρήσιμη η τεχνητή νοημοσύνη στη μηχανική ML;

Ένα έργο ML διέρχεται περίπου από τις ακόλουθες γραμμές: συλλογή δεδομένων, καθαρισμός δεδομένων, μηχανική χαρακτηριστικών (μεταφράζοντας ακατέργαστα δεδομένα σε ψηφιακά σήματα που μπορεί να κατανοήσει το μοντέλο), εκπαίδευση μοντέλου, αξιολόγηση, ανάπτυξη (ανάπτυξη: άνοιγμα του μοντέλου στον πραγματικό χρήστη) και παρακολούθηση. Η τεχνητή νοημοσύνη βοηθά σε κάθε στάση αυτής της γραμμής, αλλά το επίπεδο εξουσίας της ποικίλλει.

Τομείς υψηλής ανταμοιβής και χαμηλού κινδύνου: παραγωγή ενός σκελετού κώδικα, σύνταξη συνάρτησης μετασχηματισμού δεδομένων, ερμηνεία μηνυμάτων καταγραφής, περιγραφή ενός ίχνους στοίβας, σύνοψη σημειώσεων πειράματος, σύνταξη τεκμηρίωσης και README, πρόταση δοκιμής. Εδώ, τα λάθη της τεχνητής νοημοσύνης είναι φθηνά. γιατί το αποτέλεσμα θα περάσει ήδη από δοκιμή και αναθεώρηση.

Τομείς υψηλού κινδύνου: απόφαση για τα δεδομένα που θα χρησιμοποιηθούν στην εκπαίδευση, επιβεβαίωση εάν ένα μοντέλο πρέπει να βγει στην παραγωγή, η κρίση μιας μέτρησης είναι "αρκετά καλή", απόφαση επεξεργασίας προσωπικών δεδομένων, κλείσιμο μιας ευπάθειας ασφαλείας ως "σκουπίδια". Αυτά επηρεάζουν τα χρήματα, το απόρρητο, τη νομική ευθύνη και την εμπιστοσύνη των χρηστών. Η τεχνητή νοημοσύνη δίνει προτάσεις εδώ. Η απόφαση λαμβάνεται από τον αρμόδιο μηχανικό και την αρμόδια ομάδα.

Συμβουλή: Προτού αναθέσετε σε τρίτους μια εργασία στην τεχνητή νοημοσύνη, ρωτήστε: "Ποιο είναι το κόστος εάν αυτό το αποτέλεσμα είναι λάθος και πόσο εύκολα θα πιάσει κάποιος το λάθος;" Εάν η τιμή είναι χαμηλή και η λήψη είναι εύκολη, μεταδώστε την. Εάν η τιμή είναι υψηλή ή η λήψη είναι δύσκολη, χρησιμοποιήστε AI μόνο για το σχέδιο και αποφασίζετε.

Πειθαρχία επαλήθευσης: τρία βήματα

Στη μηχανική ML, η έξοδος AI δεν είναι ποτέ «τελειωμένη δουλειά». Είναι προσχέδιο. Εκτελέστε κάθε έξοδο μέσω αυτών των τριών βημάτων:

  1. Συνδέστε το στην πηγή. Εάν το μοντέλο έλεγε έναν αριθμό, ένα όριο ή μια "βέλτιστη πρακτική", βασίστε το σε επίσημη τεκμηρίωση, στην πραγματική τιμή στη βάση κώδικα ή σε μια μετρημένη μέτρηση. Η «προσαρμογή του μοντέλου» (ψευδαίσθηση: η σίγουρη παραγωγή μη πραγματικών πληροφοριών από το γλωσσικό μοντέλο) συλλαμβάνεται συχνότερα εδώ.
  2. Επανεκκινήστε και μετρήστε. Εκτελέστε τον κώδικα που δημιουργήθηκε, υπολογίστε ξανά τη μέτρηση που παράγει στο δικό σας σύνολο δοκιμών, επικυρώστε το προτεινόμενο ερώτημα SQL σε ένα μικρό δείγμα. Ο κώδικας που δεν λειτουργεί είναι άχρηστος, ακόμα κι αν φαίνεται ωραίος.
  3. Περάστε το από ένα μηχανικό φίλτρο. Αντέχει η έξοδος σε κλίμακα; Έχουν ληφθεί υπόψη περιπτώσεις ακμών (κενά δεδομένα, πολύ μεγάλη είσοδος, πεδία που λείπουν); Υπάρχει παραβίαση ασφάλειας και απορρήτου; Μόνο ένα άτομο που γνωρίζει το πεδίο μπορεί να κάνει αυτό το βήμα.

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμο μήνυμα: "Γράψε μου κάποιο μοντέλο εκπαίδευσης."

Ισχυρή προτροπή: "Γράψτε ένα σενάριο εκπαίδευσης για δυαδική ταξινόμηση με το scikit-learn. Εισαγωγή: data/train.parquet, στήλη στόχος is_churn. Υπάρχει ανισορροπία κλάσης (θετικό ποσοστό ~8%), χειριστείτε το με class_weight. Χρησιμοποιήστε PR-AUC (περιοχή κάτω από την καμπύλη ακριβείας-ανάκλησης), επειδή η ακρίβεια της καταμέτρησης είναι λανθασμένη αξιολόγηση δεδομένων. τυχαίος σπόρος στο 42. Δοκιμάστε στο τέλος του σετ εκτύπωσης κώδικα PR-AUC."

Διαφορά: η δεύτερη άμεση εργασία περιέχει την αλήθεια των δεδομένων, τη σωστή μέτρηση, τις πληροφορίες ανισορροπίας και την απαίτηση επαναληψιμότητας. Από αυτό το πλαίσιο η έξοδος είναι επαληθεύσιμη και χρησιμοποιήσιμη.

Απόρρητο και ασφάλεια δεδομένων: η πρώτη ευθύνη του μηχανικού

Ο μηχανικός ML αγγίζει συχνά τα πιο ευαίσθητα δεδομένα της εταιρείας: αρχεία πελατών, ιστορικό συναλλαγών, δεδομένα υγείας ή οικονομικά, αρχεία καταγραφής συστημάτων παραγωγής. Τρεις κανόνες όταν δίνετε δεδομένα σε εργαλεία τεχνητής νοημοσύνης:

  • Μην στέλνετε ακατέργαστα προσωπικά και εμπιστευτικά δεδομένα σε εξωτερικά εργαλεία. Για παράδειγμα, αντί να επικολλήσετε μηνύματα ηλεκτρονικού ταχυδρομείου πελατών στο μήνυμα προτροπής, στείλτε το σχήμα και τα εικονικά (συνθετικά) δείγματα. Χρησιμοποιήστε καλυμμένο παράδειγμα όπως "π.χ. ahmet@example.com" αντί για πραγματικά δεδομένα.
  • Χρησιμοποιήστε εταιρικά εγκεκριμένα οχήματα. Επιλέξτε εργαλεία που είναι συμβατικά ξεκάθαρα πού γίνεται η επεξεργασία των δεδομένων, αν αποθηκεύονται, αν χρησιμοποιούνται για εκπαίδευση ή όχι. Η επεξεργασία εταιρικών δεδομένων με προσωπικό λογαριασμό αποτελεί παράβαση στις περισσότερες εταιρείες.
  • Πολιτική ελάχιστων δεδομένων. Δώστε το ελάχιστο πλαίσιο που απαιτείται για την επίλυση της εργασίας. Όχι ολόκληρος ο πίνακας, αλλά οι σχετικές 5 στήλες και το σχήμα.
Προσοχή: Ας υποθέσουμε ότι το κείμενο που δίνετε σε ένα μοντέλο γλώσσας δεν μπορεί να αναιρεθεί. Μην στέλνετε ακατέργαστα προσωπικά δεδομένα με τη σκέψη "θα τα διαγράψω αργότερα". Ο κίνδυνος προέκυψε τη στιγμή της αποστολής.

Αμυντική χρήση στον τομέα της ασφάλειας

Οι μηχανικοί ML εγκαθιστούν συχνά συστήματα ασφαλείας: ανίχνευση απάτης, ταξινόμηση κακόβουλης κυκλοφορίας, έλεγχος ταυτότητας. Σε όλη αυτή την ενότητα, καλύπτουμε θέματα ασφάλειας μόνο για αμυντικούς σκοπούς: ανίχνευση της επίθεσης, σκλήρυνση του συστήματος, κλείσιμο της ευπάθειας. Η χρήση τεχνητής νοημοσύνης για μη εξουσιοδοτημένη πρόσβαση, διαρροή δεδομένων ή μη εξουσιοδοτημένη παρέμβαση στο σύστημα κάποιου άλλου είναι παράνομη και αντίκειται στην επαγγελματική δεοντολογία. Όταν βρίσκετε ένα θέμα ευπάθειας, ο σωστός τρόπος είναι να το αναφέρετε υπεύθυνα και να το διορθώσετε. δεν εκμεταλλεύονται.

τρεις μίνι θήκες

Περίπτωση 1 - Εξοικονόμηση χρόνου. Ένας μηχανικός ML συνήθως περνούσε μισή μέρα κάνοντας διερευνητική ανάλυση δεδομένων (EDA) ενός συνόλου δεδομένων 40 στηλών. Έδωσε το σχήμα και την έξοδο df.describe() στην τεχνητή νοημοσύνη και ρώτησε, "Ποιες στήλες έχουν υψηλό ποσοστό ακραίας τιμής και έλλειψης, ποιους μετασχηματισμούς προτείνετε;" Σε 20 λεπτά, έλαβε μια λίστα με προτεραιότητα, επαληθεύοντας κάθε στοιχείο με τον δικό του κωδικό. Εξοικονόμηση: ~3 ώρες, χαμηλός κίνδυνος λάθους επειδή μετρήθηκε κάθε αξίωση.

Περίπτωση 2 - Σφάλμα εντοπισμού. «Η ακρίβεια της προπόνησης είναι 99%, εξαιρετική», είπε το μοντέλο ένας βοηθός συνομιλίας. Ο μηχανικός εφάρμοσε το τρίτο βήμα (μηχανικό φίλτρο) και συνειδητοποίησε: η στήλη στόχος διέρρευσε κατά λάθος χαρακτηριστικά (διαρροή δεδομένων: το μοντέλο βλέπει πληροφορίες που δεν πρέπει να δει στην εκπαίδευση). Η πραγματική απόδοση ήταν πολύ χαμηλότερη. Ο σκεπτικισμός του μηχανικού και όχι η «μεγάλη» ερμηνεία του AI, έσωσαν τη δουλειά.

Περίπτωση 3 - Πρόληψη παραβίασης της ιδιωτικής ζωής. Μια ομάδα επικολλούσε τα αρχεία καταγραφής σφαλμάτων παραγωγής σε ένα εξωτερικό μοντέλο και έλεγε "διορθώστε αυτό το σφάλμα". Στα αρχεία καταγραφής υπήρχαν αριθμοί αναγνώρισης πελατών. Η ομάδα έφτιαξε έναν κανόνα γράφοντας ένα μικρό σενάριο που καλύπτει πρώτα τα αρχεία καταγραφής (κάνοντας τους αριθμούς ταυτότητάς τους ***) και στέλνοντάς τα με αυτόν τον τρόπο. Ο κίνδυνος παραβίασης έχει εξαφανιστεί, η ταχύτητα βοήθειας δεν έχει αλλάξει.

Αντιγράψιμα πρότυπα

Εργασία: [τι να κάνω, μία πρόταση]Πλαίσιο: [σχήμα δεδομένων, μέγεθος, περιορισμοί; ΟΧΙ ΠΡΑΓΜΑΤΙΚΑ προσωπικά δεδομένα]Περιορισμοί: [γλώσσα/βιβλιοθήκη, απόδοση, αναπαραγωγιμότητα]Μετρήσεις: [τρόπος μέτρησης της επιτυχίας]Επιθυμητή έξοδος: [κωδικός/περιγραφή/λίστα] και γιατί σε αυτήν τη μορφή

Ελέγξτε αυτόν τον κωδικό. Αξιολογήστε όχι μόνο ότι λειτουργεί, αλλά και ως προς τα εξής:1) Περιπτώσεις άκρων (κενή είσοδος, στήλη που λείπει, πολύ μεγάλα δεδομένα) 2) Κίνδυνος διαρροής δεδομένων3) Αναπαραγωγιμότητα (seed, έκδοση) Προτείνετε διορθώσεις για κάθε πρόβλημα που βρίσκετε. Σημειώστε "επαλήθευση" όπου δεν είστε σίγουροι. Κωδικός: [κωδικός]

Ερμηνεύστε το αποτέλεσμα αυτής της μέτρησης, αλλά πρώτα ρωτήστε: είναι αυτή η μέτρηση σωστή για αυτό το πρόβλημα; Πρόβλημα: [ισορροπημένη/μη ισορροπημένη ταξινόμηση, παλινδρόμηση, κατάταξη...]Αναφερόμενη μέτρηση και τιμή: [π.χ. ακρίβεια 0,99]Ποια μέτρηση θα προτείνατε και γιατί και ποια σημάδια πρέπει να αναζητήσω για να με κάνουν να αμφιβάλλω για το τρέχον αποτέλεσμα;

Ελέγξτε εάν υπάρχουν προσωπικές/εμπιστευτικές πληροφορίες στα δεδομένα που θα δώσω στην παρακάτω προτροπή. Αναφέρετε τα πεδία (όνομα, e-mail, αριθμός ταυτότητας, τηλέφωνο, διεύθυνση) που πρέπει να καλύπτονται στο παρακάτω κείμενο. Κείμενο: [κείμενο]

Πίνακας ρόλων και εξουσίας

Αναζήτηση

Ο ρόλος της τεχνητής νοημοσύνης

Κύριος της απόφασης

Σκελετός κώδικα / συνάρτηση μετασχηματισμού

γεννήτρια ρεύματος

Μηχανικός (κριτικές)

EDA / περίληψη δεδομένων

επιταχυντής

Μηχανικός (επαληθεύει με μέτρηση)

Μετρική ερμηνεία

Πρόταση

μηχανικός

Ποια δεδομένα θα συμπεριληφθούν στην εκπαίδευση;

Πρόταση

Ομάδα + κάτοχος δεδομένων

Βάλτε το μοντέλο στην παραγωγή

Υπενθύμιση λίστας ελέγχου

Υπεύθυνος μηχανικός + ομάδα

Επεξεργασία προσωπικών δεδομένων

Κανένα (δεν χρησιμοποιείται)

Νομικός + υπεύθυνος επεξεργασίας δεδομένων

Συνήθη λάθη

  • Χρήση της εξόδου χωρίς επικύρωσή της. Το πιο συνηθισμένο και πιο ακριβό λάθος. Ο κώδικας ή η μέτρηση που φαίνεται ωραίο δεν σημαίνει ότι είναι σωστή.
  • Επικόλληση ακατέργαστων εμπιστευτικών δεδομένων στο εργαλείο. Μόλις σταλεί, δεν μπορεί να ληφθεί πίσω.
  • Στηριζόμενη σε λάθος μέτρηση. Ασυμβίβαστες μετρήσεις όπως η ακρίβεια σε μη ισορροπημένα δεδομένα και το RMSE στα προβλήματα κατάταξης είναι παραπλανητικές.
  • Λάθος η τεχνητή νοημοσύνη ως ο υπεύθυνος λήψης αποφάσεων. Δίνει προτάσεις. Η ευθύνη βαρύνει τον υπογράφοντα.
  • Προτροπή χωρίς πλαίσιο. Διφορούμενα αιτήματα όπως «γράψτε ένα μοντέλο» παράγουν μη επαληθεύσιμο αποτέλεσμα.

Συνοπτικά

Η τεχνητή νοημοσύνη είναι τόσο το προϊόν που αναπτύχθηκε από τον μηχανικό ML όσο και ο καθημερινός αντιγραφέας του. Η αξία του είναι υψηλότερη σε εργασίες χαμηλού κινδύνου, εύκολα επαληθευμένες, όπως το code-data-document. Οι αποφάσεις που επηρεάζουν τα χρήματα, το απόρρητο και την ασφάλεια παραμένουν στο άτομο. Συνδέστε κάθε έξοδο στην πηγή, μετρήστε ξανά, περάστε από το μηχανικό φίλτρο. Προστατέψτε τα εμπιστευτικά δεδομένα, χρησιμοποιήστε εγκεκριμένα οχήματα, εργαστείτε με ασφάλεια μόνο για αμυντικούς σκοπούς. Αυτή η πειθαρχία είναι η βάση για όλες τις επόμενες ενότητες.

Εργασία εφαρμογής

Επιλέξτε μια εργασία από το δικό σας έργο (π.χ. σύνταξη μιας συνάρτησης καθαρισμού δεδομένων). Πρώτα γράψτε μια αδύναμη προτροπή και μετά γράψτε μια ισχυρή προτροπή χρησιμοποιώντας το πρότυπο αυτής της μονάδας. Πάρτε και τις δύο εξόδους, εφαρμόστε επαλήθευση σε τρία βήματα (σύνδεση με την πηγή, επανάληψη, φίλτρο μηχανικής). Σημειώστε ποια προτροπή αποθηκεύει πόσα λεπτά και πόσες διορθώσεις.

λίστα ελέγχου

  • [ ] Έχω καθορίσει το επίπεδο κινδύνου (χαμηλό/υψηλό) της εργασίας μου.
  • [ ] Δεν έβαλα πραγματικά προσωπικά/εμπιστευτικά δεδομένα στην προτροπή. Το κάλυψα ή χρησιμοποίησα ένα συνθετικό δείγμα.
  • [ ] Συνέδεσα την έξοδο με την πηγή, την έτρεξα ξανά, τη φιλτράρωσα από μηχανολογική άποψη.
  • [ ] Έλεγξα ότι επέλεξα τη σωστή μέτρηση.
  • [ ] Πήρα την κρίσιμη απόφαση (να το βάλω σε παραγωγή, επεξεργασία δεδομένων) ο ίδιος/με την ομάδα, δεν το άφησα στην τεχνητή νοημοσύνη.
  • [ ] Χρησιμοποίησα ένα εταιρικό εγκεκριμένο όχημα.