Μονάδες
1. Εισαγωγή στην Τεχνητή Νοημοσύνη στην Επιστήμη Δεδομένων και την Ανάλυση: Ροή εργασιών, Ρόλοι, Όρια, Επικύρωση και Δεοντολογία 2. Συλλογή δεδομένων και κατανόηση πηγών: Σχήμα, δειγματοληψία, ποιότητα και επίγνωση διαρροών 3. Καθαρισμός και προεπεξεργασία δεδομένων: Λείπει τιμή, ακραία τιμή και μετατροπή τύπου 4. Διερευνητική Ανάλυση Δεδομένων (EDA): Διανομές, Σχέσεις και Αρχικές πληροφορίες 5. Μηχανική Χαρακτηριστικών: Δημιουργία παραλλαγών, Κωδικοποίηση, Κλιμάκωση και Αποφυγή Διαρροής 6. Κατασκευή μοντέλου: Ορισμός προβλήματος, επιλογή αλγορίθμου και διαίρεση εκπαίδευσης/δοκιμής 7. Αξιολόγηση μοντέλου: Μετρήσεις, Διασταυρούμενη επικύρωση και Ακραία Μάθηση 8. Οπτικοποίηση και αφήγηση: Ακριβή γραφικά, ειλικρινή γραφικά 9. Δημιουργία κώδικα: Ανάλυση υποβοηθούμενη από AI με Python (pandas) και SQL 10. Διαρροή δεδομένων και αναπαραγωγιμότητα: Σιωπηλές καταστροφές και πειθαρχία 11. Molps foundation, ηθική, ιδιωτικότητα και υπεύθυνη ανάλυση
Μονάδα 11 / 11

Molps foundation, ηθική, ιδιωτικότητα και υπεύθυνη ανάλυση

Κέρδη:

  • Ικανότητα κατανόησης φάσεων MLOps (απελευθέρωση, ανάπτυξη, παρακολούθηση, επανεκπαίδευση, επαναφορά) και μετατόπιση μοντέλου και σχεδιασμός παρακολούθησης ανάπτυξης
  • Ικανότητα εφαρμογής των αρχών της δικαιοσύνης, της διαφάνειας και της λογοδοσίας του μοντέλου και η διάκριση της στατιστικής ακρίβειας από την ηθική αποδοχή
  • Δυνατότητα προστασίας προσωπικών δεδομένων με τις αρχές KVKK/GDPR και ανάθεση της τελικής ευθύνης σε έναν άνθρωπο σε αποφάσεις υψηλού αντίκτυπου

Το να εκπαιδεύεις ένα μοντέλο και να παίρνεις υψηλή βαθμολογία δεν είναι το τέλος, αλλά η μέση. Η πραγματική αξία έρχεται όταν το μοντέλο τίθεται σε παραγωγή και λειτουργεί αξιόπιστα, παρακολουθείται με την πάροδο του χρόνου χωρίς αλλοίωση και η όλη διαδικασία πραγματοποιείται εντός ηθικών και νομικών ορίων. Αυτή η τελική ενότητα συνδυάζει τρία θέματα: MLOps (η πειθαρχία της ζωντανής μετάδοσης, η παρακολούθηση και η διατήρηση μοντέλων), η ηθική (δικαιοσύνη, διαφάνεια, μη κακοήθεια) και το απόρρητο (προστασία προσωπικών δεδομένων). Η τεχνητή νοημοσύνη παράγει κώδικα, λίστες ελέγχου και σχεδιαγράμματα σε αυτούς τους τομείς. Αλλά οι άνθρωποι αποφασίζουν εάν ένα μοντέλο θα κυκλοφορήσει, ποιος θα επηρεαστεί και ποια δεδομένα μπορούν να χρησιμοποιηθούν. Αυτές οι αποφάσεις δεν είναι τεχνικές, αλλά αποφάσεις ευθύνης.

MLOps: το μοντέλο ζει σαν προϊόν

Το MLOps (Machine Learning Operations - η πρακτική εκτέλεσης, παρακολούθησης και ενημέρωσης μοντέλων μηχανικής μάθησης στην παραγωγή) είναι η προσαρμογή των DevOps στην ανάπτυξη λογισμικού στην επιστήμη δεδομένων. Η βασική ιδέα: ένα μοντέλο δεν είναι ένα αρχείο που εκπαιδεύεται μια φορά και ξεχαστεί, αλλά ένα ζωντανό προϊόν που απαιτεί συνεχή συντήρηση. Κύρια στάδια:

1. Έκδοση: Ο κώδικας (Git), τα δεδομένα και το μοντέλο εκδίδονται μαζί. Καταγράφεται ποιο μοντέλο παρήχθη με ποια δεδομένα και κωδικό.

2. Ανάπτυξη: Το μοντέλο τίθεται ζωντανά ως API ή ομαδική εργασία. Συνήθως δίνεται πρώτα σε μικρό κοινό (διανομή σκιάς/καναρίνι).

3. Παρακολούθηση: Η απόδοση του μοντέλου και τα δεδομένα εισόδου παρακολουθούνται συνεχώς.

4. Επανεκπαίδευση: Όταν πέφτει η απόδοση, το μοντέλο επανεκπαιδεύεται με ενημερωμένα δεδομένα.

Αλλαγή προτύπου: αθόρυβη παραμόρφωση

Ο μεγαλύτερος κίνδυνος στην παραγωγή είναι το μοντέλο drift (model drift / data drift). Ο κόσμος αλλάζει. Οι συνθήκες υπό τις οποίες εκπαιδεύσατε το μοντέλο σας (συμπεριφορά πελατών, τιμές, εποχή, νομοθεσία) αλλάζουν με την πάροδο του χρόνου και το μοντέλο αρχίζει να ξεπερνιέται. Για παράδειγμα, ένα μοντέλο ζήτησης που έχει εκπαιδευτεί πριν από την πανδημία είναι εντελώς λάθος κατά τη διάρκεια της πανδημίας. Η μετατόπιση εμφανίζεται με δύο μορφές: μετατόπιση δεδομένων (η κατανομή των αλλαγών δεδομένων εισόδου) και μετατόπιση εννοιών (η σχέση μεταξύ των αλλαγών εισόδου και στόχου). Ο τρόπος για να τα καταγράψετε είναι η παρακολούθηση: παρακολουθείτε συνεχώς την κατανομή εισόδου, την κατανομή πρόβλεψης και (αν είναι δυνατόν) την απόδοση σε σύγκριση με το πραγματικό αποτέλεσμα.

Προσοχή: Ένα μοντέλο που τίθεται σε παραγωγή θα φθαρεί από μόνο του. Δεν είναι θέμα «αν» αλλά «πότε». Η ανάπτυξη μοντέλων χωρίς ρύθμιση παρακολούθησης είναι σαν να οδηγείς ένα αυτοκίνητο χωρίς να ελέγχεις ποτέ τον κινητήρα του. Μια μέρα απλά κάθεται εκεί ήσυχα και δεν το προσέχεις.

Στοιχείο MLOps

Σκοπός

Αν παραμεληθεί

Εκδόσεις

Γνωρίζοντας τι παράγεται

Μη αναπαραγώγιμη, μη ανιχνεύσιμη

Παρακολούθηση

Βλέποντας νωρίς το ολίσθημα

Το μοντέλο καταρρέει σιωπηλά

επανεκπαίδευση

μείνετε ενημερωμένοι

Οι προβλέψεις παλιώνουν

Επαναφορά

επιστροφή στο κακό μοντέλο

Το ελαττωματικό μοντέλο παραμένει ζωντανό

Απόδειξη με έγγραφα

διαφάνεια, κύκλος εργασιών

Οι πληροφορίες κολλάνε σε ένα άτομο

Ηθική: οι αποφάσεις του μοντέλου επηρεάζουν τους ανθρώπους

Τα μοντέλα δεδομένων χρησιμοποιούνται όλο και περισσότερο σε αποφάσεις που επηρεάζουν τη ζωή των ανθρώπων: πίστωση, προσλήψεις, ασφάλειες, δικαιοσύνη. Με αυτή τη δύναμη έρχεται η ευθύνη. Κύριοι ηθικοί κίνδυνοι:

Μεροληψία και διακρίσεις: Το μοντέλο μπορεί να μάθει και να διαιωνίσει τις αδικίες στα ιστορικά δεδομένα. Εάν σε μια συγκεκριμένη ομάδα έχει δοθεί λιγότερη πίστωση στο παρελθόν, το μοντέλο υποθέτει ότι αυτός είναι ένας «κανόνας» και αυτοματοποιεί τις διακρίσεις. Αυτός είναι ο λόγος για τον οποίο η ανάλυση δικαιοσύνης — ο έλεγχος εάν το μοντέλο έχει παρόμοια απόδοση για διαφορετικές ομάδες (φύλο, ηλικία, περιοχή) — είναι απαραίτητη.

Διαφάνεια και επεξήγηση: Θα πρέπει να μπορείτε να εξηγήσετε γιατί ένα μοντέλο απέρριψε ένα άτομο. «Το είπε το μαύρο κουτί» είναι ηθικά και συχνά νομικά απαράδεκτο. Γι' αυτό τα εργαλεία επεξήγησης (σημασία χαρακτηριστικών, τιμές SHAP) είναι πολύτιμα.

Υπευθυνότητα: Ποιος είναι υπεύθυνος εάν το μοντέλο πάρει τη λάθος απόφαση; Η απάντηση είναι πάντα ένα άτομο/θεσμός, όχι ένα μοντέλο. Η ανθρώπινη εποπτεία (human-in-the-loop — ένας άνθρωπος που εγκρίνει την τελική απόφαση) θα πρέπει να διατηρηθεί σε αποφάσεις υψηλού αντίκτυπου.

Προσοχή: Ένα μοντέλο μπορεί να είναι στατιστικά «σωστό» αλλά ηθικά απαράδεκτο. Ένα μοντέλο υψηλής ακρίβειας που θέτει συστηματικά σε μειονεκτική θέση μια ομάδα δεν είναι καλό μοντέλο. Η ειλικρίνεια δεν υποκαθιστά τη δικαιοσύνη.

Απόρρητο: τα προσωπικά δεδομένα προστατεύονται προσεκτικά

Η πρώτη ύλη της επιστήμης δεδομένων είναι συχνά προσωπικά δεδομένα και αυτά τα δεδομένα προστατεύονται από το νόμο: KVKK στην Τουρκία, GDPR στην Ευρώπη. Οι βασικές αρχές είναι: περιορισμός σκοπού (τα δεδομένα δεν χρησιμοποιούνται για σκοπούς άλλους από τον σκοπό για τον οποίο συλλέχθηκαν), ελαχιστοποίηση δεδομένων (δεν συλλέγονται/διατηρούνται περισσότερα δεδομένα από όσο χρειάζεται), ανωνυμοποίηση (καταργούνται οι πληροφορίες αναγνώρισης) και ασφάλεια (τα δεδομένα διατηρούνται κρυπτογραφημένα και περιορισμένη πρόσβαση). Κρίσιμος κανόνας κατά την εργασία με εργαλεία τεχνητής νοημοσύνης: μην επικολλάτε ποτέ πραγματικά προσωπικά δεδομένα σε ένα δημόσιο εργαλείο τεχνητής νοημοσύνης. Τις περισσότερες φορές, ένα διάγραμμα και ένα ανώνυμο/συνθετικό δείγμα αρκούν για ανάλυση.

Μια πρόσθετη έμφαση στο πλαίσιο της ασφάλειας πληροφοριών: χρησιμοποιήστε εργαλεία και τεχνικές επιστήμης δεδομένων μόνο σε δεδομένα και συστήματα για τα οποία έχετε εξουσία, για αμυντικούς και νόμιμους σκοπούς ανάλυσης. Η μη εξουσιοδοτημένη πρόσβαση στα δεδομένα κάποιου άλλου, η εκ νέου αναγνώριση ατόμων (εξαγωγή ταυτότητας από ανώνυμα δεδομένα) ή η μη εξουσιοδοτημένη δημιουργία προφίλ είναι παράνομη και ανήθικη.

τρεις μίνι θήκες

Περίπτωση 1 — Κατάρρευση χωρίς παρακολούθηση. Μια εταιρεία ηλεκτρονικού εμπορίου κυκλοφόρησε με το μοντέλο συστάσεών της και δεν δημιούργησε παρακολούθηση. Μετά από 4 μήνες ο κατάλογος προϊόντων έχει αλλάξει πολύ. το μοντέλο συνέχισε να προτείνει ξεπερασμένα προϊόντα και το ποσοστό μετατροπής μειώθηκε αθόρυβα κατά 30%. Κανείς δεν το πρόσεξε για μήνες. Μάθημα: η ανάπτυξη χωρίς παρακολούθηση γίνεται τυφλή.

Περίπτωση 2 — Κρυφή διάκριση. Ένα μοντέλο ελέγχου προσλήψεων έμαθε για την ανισορροπία των φύλων στα ιστορικά δεδομένα και υποτίμησε συστηματικά τις γυναίκες υποψήφιες. Δεν έγινε αντιληπτό επειδή δεν υπήρχε ανάλυση δικαιοσύνης. Αποκαλύφθηκε σε έλεγχο και το ίδρυμα αντιμετώπισε σοβαρό κίνδυνο φήμης/νομικής φήμης. Μάθημα: Ο έλεγχος δικαιοσύνης που βασίζεται σε ομάδες είναι απαραίτητος σε μοντέλα υψηλής απήχησης.

Περίπτωση 3 — Παραβίαση του απορρήτου. Ένας αναλυτής φόρτωσε ένα αρχείο που περιείχε πραγματικά μηνύματα ηλεκτρονικού ταχυδρομείου πελατών και ιστορικό αγορών σε ένα δημόσιο εργαλείο τεχνητής νοημοσύνης και είπε, "συνοψίστε τμήματα". Τα προσωπικά δεδομένα έχουν εγκαταλείψει το ίδρυμα. Η διαδικασία KVKK έχει ξεκινήσει. Ο σωστός τρόπος ήταν να αφαιρέσετε πεδία ταυτότητας και να μοιραστείτε μόνο ανώνυμες ιδιότητες. Μάθημα: τα πραγματικά προσωπικά δεδομένα δεν εισέρχονται στο ανοιχτό εργαλείο.

Τέσσερα πρότυπα με δυνατότητα αντιγραφής

1) Λίστα ελέγχου πριν από την ανάπτυξη:

Ο ρόλος σας: σύμβουλος MLOps. Αναφέρετε τα πράγματα που πρέπει να ελέγξω πριν βάλω ένα μοντέλο στην παραγωγή: έκδοση εκδόσεων, μετρήσεις παρακολούθησης, σχέδιο επαναφοράς, όριο απόδοσης, ειδοποίηση μετατόπισης δεδομένων, υπεύθυνο άτομο. Προσθέστε μια εξήγηση μιας πρότασης "γιατί έχει σημασία" για κάθε στοιχείο. θα αποφασίσω.

2) Σχεδιασμός παρακολούθησης αλλαγής μοντέλου:

Προτείνετε ένα σχέδιο παρακολούθησης μετατόπισης για ένα μοντέλο ταξινόμησης στην παραγωγή: (1) ποιες κατανομές εισροών πρέπει να παρακολουθώ, (2) ποιος συναγερμός για την κατανομή πρόβλεψης, (3) πώς να συγκρίνεται η απόδοση όταν φτάσει το πραγματικό αποτέλεσμα, (4) σε ποιο όριο πρέπει να ενεργοποιηθεί η επανεκπαίδευση. Παρέχετε επίσης έναν σκελετό κώδικα.

3) Έλεγχος δικαιοσύνης:

Γράψτε κώδικα που συγκρίνει την απόδοση του μοντέλου μου για διαφορετικές ομάδες (π.χ. ηλικιακή ζώνη, περιοχή): ανάκληση/ακρίβεια και θετικό ποσοστό απόφασης για κάθε ομάδα. Προειδοποιήστε εάν υπάρχει σημαντική διαφορά μεταξύ των ομάδων. Κάνοντας αιτιώδεις/πολιτικές ερμηνείες. Απλά δείξτε μου τις διαφορές και θα εξετάσω την απόφαση.

4) Προέλεγχος απορρήτου:

Πριν δώσετε δεδομένα σε ένα εργαλείο τεχνητής νοημοσύνης, ελέγξτε: υπάρχουν δεδομένα προσωπικού χαρακτήρα/ταυτότητας (όνομα, email, ταυτότητα, τηλέφωνο, διεύθυνση, IP) στη λίστα στηλών παρακάτω; Εάν ναι, αναφέρετε ποια πρέπει να αφαιρεθούν ή να ανωνυμοποιηθούν. Στήλες: [λίστα]. Σκοπός: για κοινή χρήση μόνο ανώνυμου σχήματος.

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμη προτροπή:

Το μοντέλο μου είναι έτοιμο, βγείτε ζωντανά.

Η ανάπτυξη δεν είναι ένα μόνο βήμα. Η μετάδοση live χωρίς παρακολούθηση, επαναφορά, δικαιοσύνη και έλεγχο απορρήτου είναι μια σιωπηλή πρόσκληση για καταστροφή.

Ισχυρή προτροπή:

Ο ρόλος σας: υπεύθυνος σύμβουλος MLOps. Το μοντέλο μου έχει εκπαιδευτεί, θέλω πλήρη προετοιμασία πριν βγω ζωντανά. Δημιουργία: (1) λίστα ελέγχου πριν από την ανάπτυξη, (2) σχέδιο παρακολούθησης μετατόπισης, (3) κωδικός ελέγχου δικαιοσύνης βάσει ομάδας, (4) έλεγχος απορρήτου (υπάρχουν προσωπικά δεδομένα). Προτείνετε επίσης πώς να προστατεύσετε την ανθρώπινη συναίνεση σε αποφάσεις υψηλού αντίκτυπου. Οι τελικές αποφάσεις είναι δικές μου.

Εδώ η διανομή, η παρακολούθηση, η δικαιοσύνη και το απόρρητο αντιμετωπίζονται ως μια ενιαία υπεύθυνη διαδικασία.

Συνήθη λάθη

  • Ανάπτυξη μοντέλου χωρίς ρύθμιση παρακολούθησης. Το μοντέλο σιωπηλά γλιστρά και παραμορφώνεται. Μπορεί να χρειαστούν μήνες για να το παρατηρήσετε.
  • Παράκαμψη του δικαστικού ελέγχου. Ένα μοντέλο υψηλής πιστότητας μπορεί συστηματικά να θέτει σε μειονεκτική θέση μια ομάδα.
  • Λήψη μιας ανεξήγητης απόφασης για το μαύρο κουτί. Οι αποφάσεις με μεγάλο αντίκτυπο πρέπει να είναι εξηγήσιμες. «Το είπε το μοντέλο» δεν αρκεί.
  • Παροχή πραγματικών προσωπικών δεδομένων για άνοιγμα εργαλείου AI. Παραβίαση KVKK/GDPR. Το διάγραμμα και το ανώνυμο παράδειγμα αρκούν.
  • Ανάθεση της απόφασης στο μοντέλο. Η ευθύνη βαραίνει πάντα ένα άτομο. Διατηρείται η ανθρώπινη επιτήρηση υψηλών επιπτώσεων.
Συμβουλή: Πριν βγείτε ζωντανά με κάθε μοντέλο, κάντε μια ερώτηση δυνατά: "Αν αυτό το μοντέλο χαλάσει ήσυχα αύριο ή τιμωρήσει άδικα μια ομάδα, πώς θα το παρατηρήσω και θα το επαναφέρω;" Εάν δεν έχετε ξεκάθαρη απάντηση σε αυτή την ερώτηση, το μοντέλο δεν είναι ακόμα έτοιμο για παραγωγή.

Συνοπτικά

Η δουλειά ενός μοντέλου δεν τελειώνει με υψηλή βαθμολογία, αλλά με το να δουλεύει αξιόπιστα και υπεύθυνα στην παραγωγή. Το MLOps είναι η πειθαρχία της ζωντανής μετάδοσης, της παρακολούθησης για drift, της επανεκπαίδευσης και της επαναφοράς του μοντέλου. Η ανάπτυξη χωρίς παρακολούθηση είναι αθόρυβη κατάρρευση. Η ηθική απαιτεί δικαιοσύνη, διαφάνεια και υπευθυνότητα του μοντέλου. Η στατιστική ακρίβεια δεν υποκαθιστά την ηθική αποδοχή. Απόρρητο σημαίνει προστασία των προσωπικών δεδομένων με τις αρχές KVKK/GDPR και διατήρηση των πραγματικών δεδομένων μακριά από ανοιχτά εργαλεία. Όλες αυτές οι αποφάσεις δεν είναι τεχνικές αλλά αποφάσεις ευθύνης και ανήκουν πάντα σε έναν άνθρωπο.

Εργασία εφαρμογής

Σκεφτείτε το σαν να πρόκειται να βάλετε ένα μοντέλο που έχετε δημιουργήσει (ή υποθετικό) στην παραγωγή και συμπληρώστε τέσσερις λίστες: (1) λίστα ελέγχου πριν από την ανάπτυξη, (2) μετρήσεις μετατόπισης που θα παρακολουθείτε, (3) σχέδιο ελέγχου δικαιοσύνης βάσει ομάδας, (4) έλεγχο απορρήτου. Στη συνέχεια, γράψτε μια συγκεκριμένη απάντηση στην ερώτηση "Πώς θα παρατηρήσω εάν σπάσει σιωπηλά αύριο και θα το πάρω πίσω;"

λίστα ελέγχου

  • [ ] Αναπτύξω το μοντέλο με σχέδιο παρακολούθησης (ειδοποίηση ολίσθησης) και επαναφοράς;
  • [ ] Έχω ελέγξει το χάσμα δικαιοσύνης/απόδοσης για διαφορετικές ομάδες;
  • [ ] Έχω διατηρήσει τον άνθρωπο-in-the-loop σε αποφάσεις υψηλού αντίκτυπου;
  • [ ] Έχω προστατεύσει προσωπικά δεδομένα με τις αρχές KVKK/GDPR και τα κράτησα μακριά από ανοιχτά εργαλεία;
  • [ ] Έβαλα την τελική ευθύνη σε έναν άνθρωπο, όχι στο μοντέλο;

Εξέταση Ενοτήτων

1. Ένας επιστήμονας δεδομένων ρωτά την τεχνητή νοημοσύνη, "Πόσο ακριβές είναι το τυχαίο δάσος σε αυτά τα δεδομένα;" χωρίς να εκπαιδεύσει καθόλου το μοντέλο και βάζει άμεσα την απάντηση του "89%" στην παρουσίαση. Ποιο είναι το θεμελιώδες λάθος σε αυτή την προσέγγιση;

  • Α) Αναμονή για μετρήσεις χωρίς να δίνονται δεδομένα και μοντέλα στην τεχνητή νοημοσύνη. Αγνοώντας ότι ο αριθμός που παράγει είναι πλαστός και ότι η πραγματική μέτρηση μπορεί να βρεθεί μόνο μέσω εκπαίδευσης και δοκιμών ✔
  • Β) Πρέπει να χρησιμοποιεί λογιστική παλινδρόμηση αντί για τυχαίο δάσος
  • Γ) Το ποσοστό ακρίβειας πρέπει να είναι πάντα πάνω από 90%.
  • Δ) Απαγορεύεται αυστηρά η συμπερίληψη μετρήσεων στην παρουσίαση

Εξήγηση: Η τεχνητή νοημοσύνη δεν μπορεί να παράγει μια μέτρηση χωρίς πρόσβαση στο μοντέλο και τα δεδομένα. Ο αριθμός που δίνει είναι παραίσθηση (κατασκευασμένη). Η μέτρηση λαμβάνεται από τον υπολογισμό του ίδιου του επιστήμονα δεδομένων μόνο αφού το μοντέλο έχει πραγματικά εκπαιδευτεί και δοκιμαστεί. Η μη επαληθευμένη έξοδος είναι σαν μια ανυπόγραφη αναφορά.

2. Η στήλη «αιτία κλεισίματος λογαριασμού» περιλαμβάνεται κατά τη συλλογή δεδομένων για μια πρόβλεψη εκτροπής. Αυτή η στήλη συμπληρώνεται μόνο μετά την αποχώρηση του πελάτη. Το μοντέλο δίνει 97% στο σετ δοκιμής, αλλά δεν λειτουργεί στην παραγωγή. Ποιο είναι το όνομα και η αιτία αυτής της πάθησης;

  • Α) Υπερμάθηση. Το μοντέλο είναι πολύ περίπλοκο
  • Β) Διαρροή δεδομένων. ✔ Χρήση πληροφοριών που δεν θα είναι διαθέσιμες τη στιγμή της πρόβλεψης, αλλά είναι το αποτέλεσμα του στόχου, ως χαρακτηριστικό
  • Γ) Ανεπαρκής μάθηση. Το μοντέλο είναι πολύ απλό
  • Δ) Προκατάληψη επιλογής. μικρό μέγεθος δείγματος

Επεξήγηση: Πρόκειται για μια κλασική διαρροή δεδομένων: η «αιτία κλεισίματος» είναι αποτέλεσμα του στόχου και εξακολουθεί να είναι κενή τη στιγμή της πρόβλεψης. Το μοντέλο κάνει το κόλπο με αυτή τη μελλοντική γνώση, φαίνεται υπέροχο στο σετ δοκιμών αλλά κολλάει στην παραγωγή επειδή αυτή η στήλη είναι άδεια. Η ερώτηση «το έχω τη στιγμή της πρόβλεψης» πρέπει να τίθεται σε κάθε στήλη.

3. Ένας αναλυτής συμπληρώνει τις τιμές που λείπουν στη στήλη εσόδων με τον μέσο όρο. αλλά οι αγνοούμενοι ανήκουν στην πραγματικότητα στο τμήμα των χαμηλών εισοδημάτων που δεν έχει δηλώσει ποτέ εισόδημα (συστηματική έλλειψη). Γιατί αυτή η γέμιση είναι λανθασμένη;

  • Α) Ο μέσος όρος είναι πάντα μεγαλύτερος από τον διάμεσο, άρα είναι λάθος
  • Β) Οι τιμές που λείπουν δεν πρέπει ποτέ να συμπληρώνονται, πρέπει πάντα να διαγράφονται
  • Γ) Η πλήρωση του συστηματικού κενού με τον μέσο όρο παραμορφώνει τα δεδομένα με την τεχνητή αναπαράσταση αυτής της ομάδας. Το γέμισμα έγινε χωρίς να τεθεί η ερώτηση "γιατί είναι άδειο;" ✔
  • Δ) Ο υπολογισμός του μέσου όρου δημιουργεί πρόβλημα απόδοσης επειδή είναι πολύ αργός

Εξήγηση: Η αιτία της ανεπάρκειας καθορίζει τη λύση. Όταν η συστηματική έλλειψη (κενό που συγκεντρώνεται σε μια συγκεκριμένη ομάδα) καλυφθεί με τον μέσο όρο, αυτή η ομάδα γίνεται τεχνητά «μέσο εισόδημα» και τα δεδομένα παραμορφώνονται. Πριν τη συμπληρώσετε, θα πρέπει να τεθεί η ερώτηση «γιατί είναι άδειο». συστηματικός/σημαντικός μέσος όρος που λείπει δεν πρέπει να συμπληρωθεί.

4. Μια ομάδα βρίσκει μια συσχέτιση 0,78 μεταξύ «δαπανών διαφήμισης» και «πωλήσεων» και διπλασιάζει τον προϋπολογισμό. Ωστόσο, αυτό που πραγματικά ενεργοποιεί και τα δύο είναι οι εποχιακές καμπάνιες. Ποια αρχή στα στατιστικά εξηγεί αυτό το σφάλμα;

  • Α) Η συσχέτιση δεν είναι αιτιότητα. Μια κρυφή τρίτη μεταβλητή μπορεί να επηρεάζει και τις δύο μεταβλητές ✔
  • Β) Επειδή η συσχέτιση του 0,78 είναι πολύ χαμηλή, η σχέση θα πρέπει να αγνοηθεί
  • Γ) Η συσχέτιση αποδεικνύει πάντα την αιτιότητα, η ομάδα το πήρε σωστά
  • Δ) Η συσχέτιση μεταξύ διαφήμισης και πωλήσεων δεν μπορεί να υπολογιστεί μαθηματικά.

Εξήγηση: Η συσχέτιση δεν είναι αιτιότητα. Οι δύο μεταβλητές ενδέχεται να λειτουργούν μαζί επειδή μια κρυφή τρίτη μεταβλητή (εδώ οι εποχιακές καμπάνιες) τις επηρεάζει και τις δύο. Το συμπέρασμα ότι το ένα προκαλεί το άλλο μπορεί να εξακριβωθεί μόνο μέσω πειράματος και γνώσης πεδίου. Ο αριθμός των συσχετίσεων από μόνος του δεν είναι απόδειξη της αιτιότητας.

5. Ένα μοντέλο ανίχνευσης απάτης δείχνει 99,2% ακρίβεια και η ομάδα πανηγυρίζει. Ωστόσο, το ποσοστό ψεύτικων συναλλαγών στα δεδομένα είναι μόνο 0,8% και η ανάκληση του μοντέλου είναι 6%. Τι δείχνει αυτός ο πίνακας;

  • Α) Το μοντέλο είναι τέλειο γιατί η ακρίβεια είναι πάνω από 99%
  • Β) Η ακρίβεια είναι παραπλανητική με μη ισορροπημένα δεδομένα. Το μοντέλο χάνει σχεδόν όλα τα ψεύτικα (χαμηλή ανάκληση), θα πρέπει να εξεταστεί η κατάλληλη μέτρηση ✔
  • Γ) Δεν υπάρχει πρόβλημα αφού η ανάκληση του μοντέλου είναι υψηλή
  • Δ) Δεν χρειαζόταν να κατασκευαστεί μοντέλο γιατί το ψεύτικο ποσοστό ήταν χαμηλό

Εξήγηση: Η «ακρίβεια» είναι παραπλανητική σε μη ισορροπημένα δεδομένα. Όταν το μοντέλο αποκαλεί σχεδόν κάθε συναλλαγή «καθαρή», αποκτά υψηλή ακρίβεια επειδή τα πλαστά είναι πολύ λίγα, αλλά αποτυγχάνει να πιάσει τα ψεύτικα, που είναι ο κύριος σκοπός του (ανάκληση 6%). Επομένως, σε μη ισορροπημένα προβλήματα, η εστίαση δεν είναι στην ακρίβεια, αλλά στον πίνακα σύγχυσης και στις μετρήσεις που είναι κατάλληλες για το σκοπό της εργασίας, όπως η ανάκληση/ακρίβεια.

6. Σε ένα έργο πρόβλεψης ζήτησης, τα δεδομένα που εξαρτώνται από το χρόνο χωρίζονται τυχαία σε εκπαίδευση/δοκιμές. Το μοντέλο δίνει 93% ακρίβεια αλλά κολλάει στην παραγωγή. Ποια πρέπει να είναι η σωστή προσέγγιση διαίρεσης;

  • Α) Μεγέθυνση του δοκιμαστικού σετ, π.χ. διαίρεση 50%/50%
  • Β) Χρησιμοποιώντας ένα πιο σύνθετο μοντέλο
  • Γ) Καταργήστε τελείως το διαμέρισμα και εκπαιδεύστε με όλα τα δεδομένα
  • Δ) Χρονολογική διάσπαση: εκπαίδευση με την παλιά περίοδο και δοκιμή με τη νέα περίοδο, εμποδίζοντας έτσι το μοντέλο να δει το μέλλον ✔

Εξήγηση: Εάν η τυχαία διαίρεση γίνεται σε δεδομένα χρονοσειρών, το μοντέλο βλέπει το μέλλον και προβλέπει το παρελθόν στην εκπαίδευση. είναι μια διαρροή και παράγει επιτυχία που στην πραγματικότητα δεν υπάρχει. Η σωστή προσέγγιση είναι η χρονολογική διάσπαση: εκπαίδευση με την παλιά περίοδο και δοκιμή με τη νέα περίοδο, μίμηση της πραγματικής κατάστασης στην παραγωγή (πρόβλεψη από το παρελθόν στο μέλλον).

7. Από ποια δεδομένα πρέπει να υπολογίζονται οι παράμετροι κλιμάκωσης (StandardScaler) στη μηχανική χαρακτηριστικών και πώς πρέπει να εφαρμόζονται;

  • Α) Θα πρέπει να υπολογίζεται από όλα τα δεδομένα (προπόνηση + δοκιμές μαζί) ώστε να είναι πιο ακριβές
  • Β) Θα πρέπει να υπολογίζεται χωριστά για κάθε σειρά, από την τιμή της ίδιας της σειράς
  • Γ) Θα πρέπει να υπολογίζεται μόνο από τα δεδομένα της δοκιμής
  • Δ) Θα πρέπει να υπολογίζεται μόνο από τα δεδομένα εκπαίδευσης και στη συνέχεια να εφαρμόζονται οι ίδιες παράμετροι στα δεδομένα της δοκιμής. αλλιώς θα διαρρεύσει ✔

Επεξήγηση: Οι παράμετροι όλων των μετασχηματισμών (μέσος όρος, τυπική απόκλιση, κ.λπ.) όπως η κλιμάκωση, η κωδικοποίηση και η συμπλήρωση πρέπει να μαθαίνονται μόνο από τα δεδομένα εκπαίδευσης και, στη συνέχεια, το ίδιο θα πρέπει να εφαρμόζεται στα δεδομένα δοκιμής. Η λήψη υπόψη δεδομένων δοκιμής προκαλεί επίσης παρεμβολές στις πληροφορίες δοκιμής στην εκπαίδευση, δηλαδή διαρροή, και κάνει το μοντέλο να φαίνεται καλύτερο από ό,τι είναι. Η χρήση του Pipeline διασφαλίζει αυτό.

8. Ένα μοντέλο δίνει 98% ακρίβεια στο σετ εκπαίδευσης και 72% ακρίβεια στο σετ δοκιμής. Τι δείχνει αυτό το σύμπτωμα και τι πρέπει να γίνει;

  • Α) Ανεπαρκής μάθηση. το μοντέλο θα πρέπει να γίνει πιο σύνθετο
  • Β) Διαρροή δεδομένων. Το σετ δοκιμής πρέπει να αλλάξει
  • Γ) Υπερπροσαρμογή. το μοντέλο θα πρέπει να απλοποιηθεί, θα πρέπει να εφαρμοστεί τακτοποίηση και διασταυρούμενη επικύρωση ✔
  • Δ) Μια φυσιολογική κατάσταση. Ο βαθμός εκπαίδευσης είναι πάντα υψηλότερος ούτως ή άλλως, οι προφυλάξεις είναι περιττές

Εξήγηση: Μια πολύ υψηλή βαθμολογία στην προπόνηση και μια σημαντικά χαμηλή βαθμολογία στις δοκιμές είναι ένα κλασικό σύμπτωμα της υπερπροσαρμογής: το μοντέλο έχει απομνημονεύσει τον θόρυβο των δεδομένων εκπαίδευσης και όχι το πραγματικό μοτίβο. Οι λύσεις περιλαμβάνουν την απλοποίηση του μοντέλου, περισσότερα δεδομένα, τακτοποίηση και επαλήθευση της κατάστασης με διασταυρούμενη επικύρωση. Το να βασίζεσαι αποκλειστικά στη βαθμολογία της εκπαίδευσης κρύβει αυτή την παγίδα.

9. Σε μια παρουσίαση διαχείρισης, ο άξονας y ενός ραβδωτού γραφήματος στο οποίο οι πωλήσεις αυξάνονται από 1.000 σε 1.020 ξεκινά από το 980 για να κάνει την αύξηση να φαίνεται τεράστια. Η πραγματική αύξηση είναι 2%. Γιατί είναι αυτό ένα ηθικό ζήτημα;

  • Α) Ένας περικομμένος άξονας y υπερβάλλει οπτικά μια μικρή διαφορά και παραπλανά τον θεατή. Για λόγους δικαιοσύνης, ο άξονας στις ράβδους σύγκρισης πρέπει να ξεκινά από 0 ✔
  • Β) Τα γραφήματα ράβδων δεν μπορούν ποτέ να χρησιμοποιηθούν για δεδομένα πωλήσεων
  • Γ) Δεν υπάρχει πρόβλημα. Είναι πάντα καλό να κάνετε το γράφημα να φαίνεται εντυπωσιακό
  • Δ) Ο άξονας Υ πρέπει πάντα να ξεκινά από τη μεγαλύτερη τιμή των δεδομένων

Επεξήγηση: Στα γραφήματα ράβδων για συγκριτικούς σκοπούς, ο άξονας y πρέπει γενικά να ξεκινά από το 0. Αν κόψετε τον άξονα και ξεκινήσετε από το 980, μια μικρή διαφορά 2% φαίνεται οπτικά τεράστια και παραπλανά τον θεατή. Η ηθική ευθύνη του επαγγελματία δεδομένων είναι να σχεδιάζει ειλικρινή γραφήματα που δεν υπερεκτιμούν ή υποτιμούν τα δεδομένα.

10. Ένας αναλυτής βρίσκει τον συνολικό τζίρο 3 φορές μετά την ΕΝΩΣΗ των παραγγελιών με τον πίνακα προϊόντων. Ο αριθμός των γραμμών αυξήθηκε από 240 χιλιάδες σε 690 χιλιάδες. Τι θα έπρεπε να είχε γίνει για να αποφευχθεί αυτό το σιωπηλό σφάλμα;

  • Α) Διαιρέστε τον συνολικό κύκλο εργασιών με το 3
  • Β) Να χρησιμοποιείτε πάντα ξεχωριστά ερωτήματα αντί για JOIN
  • Γ) Πλήρης διαγραφή του πίνακα προϊόντων
  • Δ) Έλεγχος του αριθμού των σειρών μετά τη συγχώνευση/ΣΥΝΔΕΣΗ και επαλήθευση ότι έχουν συνδεθεί μέσω του σωστού κλειδιού. Έγκαιρη σύλληψη της αναπαραγωγής ✔

Επεξήγηση: Όταν υπάρχουν πολλές σειρές για κάθε προϊόν (διαφορετικό χρώμα, για παράδειγμα) στον πίνακα προϊόντων, το JOIN μέσω λανθασμένου κλειδιού θα αντιγράψει κάθε παραγγελία και θα διογκώσει τα σύνολα. Ο κώδικας εκτελείται χωρίς σφάλματα, αλλά το αποτέλεσμα είναι λάθος. Ο τρόπος για να αποφευχθεί αυτό είναι να ελέγξετε τον αριθμό των σειρών μετά από κάθε συγχώνευση/ΣΥΝΔΕΣΗ και να συγχωνεύσετε με το σωστό κλειδί.

11. Ένα μοντέλο ελέγχου προσλήψεων μαθαίνει για την ανισορροπία των φύλων στα ιστορικά δεδομένα και βαθμολογεί συστηματικά τις γυναίκες υποψήφιες, αλλά η συνολική ακρίβειά του είναι υψηλή. Τι σημαίνει αυτό;

  • Α) Δεν υπάρχει πρόβλημα γιατί το μοντέλο έχει υψηλή ακρίβεια
  • Β) Η στατιστική ακρίβεια δεν υποκαθιστά την ηθική αποδοχή. Το μοντέλο έχει μάθει για παλαιότερες διακρίσεις, απαιτείται έλεγχος δικαιοσύνης βάσει ομάδας ✔
  • Γ) Η περαιτέρω αύξηση της ακρίβειας του μοντέλου λύνει το πρόβλημα
  • Δ) Η δικαιοσύνη είναι εκτός του πεδίου εφαρμογής της επιστήμης δεδομένων

Εξήγηση: Ακόμα κι αν ένα μοντέλο είναι στατιστικά σωστό, μπορεί να είναι ηθικά απαράδεκτο. Το μοντέλο μαθαίνει την αδικία σε δεδομένα του παρελθόντος και αυτοματοποιεί τις διακρίσεις. Η υψηλή ακεραιότητα δεν υποκαθιστά τη δικαιοσύνη. Στα μοντέλα υψηλού αντίκτυπου, ο έλεγχος δικαιοσύνης, ο οποίος μετρά τη διαφορά απόδοσης/απόφασης για διαφορετικές ομάδες, είναι απαραίτητος και η τελική ευθύνη ανήκει στον άνθρωπο.

12. Ένας υπάλληλος ανεβάζει ένα αρχείο που περιέχει πραγματικά email πελατών και ιστορικό αγορών σε ένα δημόσιο εργαλείο τεχνητής νοημοσύνης και λέει «συνοψίστε τμήματα». Γιατί είναι αυτό ένα σοβαρό λάθος και ποιος είναι ο σωστός τρόπος;

  • Α) Δεν υπάρχει πρόβλημα. Τα εργαλεία AI δεν αποθηκεύουν ποτέ δεδομένα
  • Β) Το σφάλμα είναι ότι το αρχείο είναι πολύ μεγάλο. έπρεπε να μειωθεί
  • Γ) Η παροχή πραγματικών προσωπικών δεδομένων σε ανοιχτό εργαλείο αποτελεί παραβίαση του KVKK/GDPR. Τα πεδία ταυτότητας θα έπρεπε να έχουν αφαιρεθεί και να έχουν κοινοποιηθεί μόνο ανώνυμα σχήματα/ιδιότητα ✔
  • Δ) Θα έπρεπε να είχε χρησιμοποιηθεί το CSV αντί μόνο του Excel

Εξήγηση: Όταν τα πραγματικά προσωπικά δεδομένα (όπως e-mail, όνομα κ.λπ.) δίνονται σε ένα δημοσίως διαθέσιμο εργαλείο τεχνητής νοημοσύνης, θα υπάρξει παραβίαση απορρήτου εντός του πεδίου εφαρμογής του KVKK / GDPR. δεδομένα εγκαταλείπουν τον οργανισμό. Τις περισσότερες φορές, ένα διάγραμμα και ένα ανώνυμο/συνθετικό δείγμα αρκούν για ανάλυση. Ο σωστός τρόπος είναι να αφαιρέσετε πεδία ταυτότητας και να μοιραστείτε μόνο ανώνυμες ιδιότητες.

13. Ένα μοντέλο σύστασης τίθεται σε παραγωγή, αλλά η παρακολούθηση δεν έχει καθιερωθεί. Όταν ο κατάλογος προϊόντων αλλάζει μετά από 4 μήνες, το μοντέλο συνεχίζει να προτείνει παλιά προϊόντα και το ποσοστό μετατροπής μειώνεται σιωπηλά κατά 30%. Πώς ονομάζεται αυτό το φαινόμενο;

  • Α) Υπερμάθηση. Το μοντέλο απομνημονεύει το σετ εκπαίδευσης
  • Β) Μοντέλο drift. Καθώς ο κόσμος αλλάζει, το μοντέλο ξεπερνάει σιωπηλά, απαρατήρητο, επειδή η παρακολούθηση δεν έχει καθιερωθεί ✔
  • Γ) Προκατάληψη επιλογής. δείγμα προκατάληψης
  • Δ) Παραβίαση ελαχιστοποίησης δεδομένων

Επεξήγηση: Πρόκειται για μετατόπιση μοντέλου (model/data drift): όταν ο κόσμος αλλάζει (κατάλογος, συμπεριφορά, εποχή), οι συνθήκες υπό τις οποίες εκπαιδεύτηκε το μοντέλο αλλάζουν και το μοντέλο καταρρέει σιωπηλά. Ένα μοντέλο που τίθεται σε παραγωγή φθείρεται από μόνο του. Είναι θέμα «πότε». Η ανάπτυξη χωρίς παρακολούθηση (εισόδου παρακολούθησης και απόδοση) καθιστά αδύνατο τον εντοπισμό υποβάθμισης.

14. Ένα μοντέλο που λαμβάνει ακρίβεια 88% σε μια μεμονωμένη διαίρεση εκπαίδευσης/δοκιμής έχει 5πλάσιες βαθμολογίες διασταυρούμενης επικύρωσης 88%, 71%, 83%, 64%, 79%. Τι υποδηλώνει αυτό και γιατί είναι σημαντική η διασταυρούμενη επικύρωση;

  • Α) Το μοντέλο είναι σταθερό. Το 88% είναι πραγματική απόδοση
  • Β) Η διασταυρούμενη επικύρωση δεν είναι απαραίτητη. Ένα διαμέρισμα είναι αρκετό
  • Γ) Η μεγάλη μεταβλητότητα των βαθμολογιών δείχνει ότι το μοντέλο είναι ασταθές. Η διασταυρούμενη επικύρωση βασίζει την απόδοση στον μέσο όρο και τη διανομή πολλαπλών δοχείων, όχι σε έναν τυχερό κάδο ✔
  • Δ) Είναι καλύτερο να αναφέρετε την υψηλότερη βαθμολογία (88%)

Εξήγηση: Ένα μόνο διαμέρισμα μπορεί να είναι τυχερό ή άτυχο. Το 88% ήταν μόνο το αποτέλεσμα αυτής της εύκολης διαίρεσης. Η διασταυρούμενη επικύρωση χωρίζει τα δεδομένα πολλές φορές, βασίζοντας την απόδοση στον μέσο όρο (εδώ ~77%) και δείχνοντας τη μεταβλητότητα των βαθμολογιών. Η υψηλή μεταβλητότητα εδώ υποδηλώνει ότι το μοντέλο είναι ασταθές. Το να βασίζεσαι σε ένα μόνο διαμέρισμα είναι παραπλανητικό.