Κέρδη:
- Ικανότητα διάκρισης της ροής εργασίας έξι σταδίων της επιστήμης δεδομένων (ορισμός προβλήματος, συλλογή, καθαρισμός, ανακάλυψη, μοντελοποίηση, επικοινωνία) και η αρχή κάτω από την οποία λειτουργεί η τεχνητή νοημοσύνη σε κάθε στάδιο, σύμφωνα με το επίπεδο κινδύνου της εργασίας
- Δυνατότητα εφαρμογής μιας πειθαρχίας που επαληθεύει κάθε έξοδο τεχνητής νοημοσύνης συνδέοντάς την με την πηγή, εκτελώντας και συγκρίνοντάς την και περνώντας την από ειδικό φιλτράρισμα.
- Δυνατότητα μετατροπής των αρχών αναπαραγωγιμότητας και απορρήτου (εγγραφή σε κώδικα, ανωνυμοποίηση) σε συνήθειες ανάλυσης από την πρώτη μέρα
Ακατέργαστα, ακατάστατα και συχνά «ψέματα» δεδομένα προσγειώνονται στο γραφείο ενός επιστήμονα δεδομένων κάθε μέρα. Στον πίνακα πωλήσεων, η στήλη ημερομηνία είναι γραμμένη σε τρεις διαφορετικές μορφές. Οι αριθμοί πελατών είναι κενοί σε ορισμένες γραμμές. Το όνομα μιας στήλης είναι "εισόδημα", αλλά περιέχει και τιμές TL και USD. Η δουλειά της επιστήμης δεδομένων είναι να λάβει μια αξιόπιστη απόφαση από αυτό το χάος: να συλλέξει τα δεδομένα, να τα καθαρίσει, να τα εξερευνήσει, να δημιουργήσει ένα μοντέλο, να επικυρώσει το αποτέλεσμα και να τα μετατρέψει σε ιστορία. Η τεχνητή νοημοσύνη (τεχνητή νοημοσύνη ή AI για συντομία—συστήματα υπολογιστών που μπορούν να δημιουργήσουν κείμενο και κώδικα, να αναγνωρίζουν μοτίβα, να συνοψίζουν και να κάνουν προβλέψεις) μπορεί να αγγίξει κάθε κρίκο αυτής της αλυσίδας: σύνταξη κώδικα εκκαθάρισης σε λίγα λεπτά, πρόταση γραφημάτων για διερευνητική ανάλυση, ερμηνεία της μέτρησης ενός μοντέλου, διόρθωση ερωτήματος SQL. Αλλά το ίδιο AI μπορεί επίσης να σας δώσει μια σίγουρη κατασκευή, όπως "συσχέτιση 0,72" για δεδομένα που δεν έχει δει ποτέ.
Αυτή η πρώτη ενότητα δεν είναι μια εισαγωγή βιβλιοθήκης. Σκοπός του είναι να διευκρινίσει πού να τοποθετηθεί η τεχνητή νοημοσύνη στη ροή εργασιών της επιστήμης δεδομένων και πού να μην τοποθετηθεί ποτέ. Ας διατυπώσουμε τη βασική αρχή από την αρχή: Η τεχνητή νοημοσύνη είναι βοηθός, όχι επιστήμονας δεδομένων. Η απόφαση για το ποια δεδομένα να συλλεχθούν, ποια μέτρηση θα αποφασίσετε, εάν θα τεθεί σε παραγωγή ένα μοντέλο και πού θα καθοριστούν τα ηθικά όρια εναπόκειται στον αρμόδιο εμπειρογνώμονα. Ένα μη επαληθευμένο αποτέλεσμα AI είναι επικίνδυνο, όπως και μια ανυπόγραφη αναφορά ανάλυσης.
Ροή εργασιών επιστήμης δεδομένων: χάρτης από άκρο σε άκρο
Για να κατανοήσετε ένα έργο δεδομένων, είναι χρήσιμο να το αναλύσετε σε έξι φάσεις. Ολόκληρη αυτή η ενότητα ακολουθεί αυτόν τον χάρτη.
1. Ορισμός προβλήματος: Τι μετράμε, γιατί, για να υποστηρίξουμε ποια απόφαση; Αυτή η φάση δεν ανατίθεται στο AI. Είναι το άτομο που ορίζει τη δουλειά.
2. Συλλογή δεδομένων: Προσδιορισμός πηγών, εξαγωγή δεδομένων, δειγματοληψία. (Ενότητα 2)
3. Καθαρισμός και προεπεξεργασία δεδομένων: Λείπει τιμή, ακραία τιμή, μετατροπή τύπου. (Ενότητα 3)
4. Διερευνητική ανάλυση δεδομένων (EDA - Exploratory Data Analysis, το στάδιο της αναγνώρισης της κατανομής και των σχέσεων των δεδομένων «με το μάτι»): (Ενότητα 4)
5. Μηχανική και μοντελοποίηση χαρακτηριστικών: Μεταβλητή παραγωγή, επιλογή αλγορίθμου, εκπαίδευση, αξιολόγηση. (Ενότητα 5, 6, 7)
6. Επικοινωνία και παραγωγή: Οπτικοποίηση, ιστορία, MLOps (πειθαρχία λήψης του μοντέλου ζωντανά και παρακολούθηση του). (Ενότητα 8, 11)
Το AI λειτουργεί με διαφορετική αρχή σε καθένα από αυτά τα έξι στάδια. Ο παρακάτω πίνακας συνοψίζει αυτή την κατανομή εξουσίας. Αυτός είναι ο πιο σημαντικός πίνακας της ενότητας.
Σκηνή
Ο ρόλος της AI
Επίπεδο κινδύνου
Ποιος εγκρίνει
Ορισμός προβλήματος
συνεργάτης καταιγισμού ιδεών
χαμηλά
Επιστήμονας δεδομένων + ενδιαφερόμενος
Γράψτε έναν κωδικό εκκαθάρισης
Γεννήτρια σκίτσων κώδικα
μεσαίο
Επιστήμονας δεδομένων (διαβάζει κώδικα)
Σχόλιο της ΕΔΑ
προτεινόμενος μοτίβος
μεσαίο
επιστήμονας δεδομένων
Δημιουργία χαρακτηριστικών
Δημιουργία ιδεών και κωδικών
μέτρια-υψηλή
Ο έλεγχος διαρροών είναι απαραίτητος
Επιλογή/μετρική μοντέλου
σύμβουλος
ψηλά
επιστήμονας δεδομένων
Απόφαση να τεθεί σε παραγωγή
βοηθητική είσοδος
πολύ ψηλά
Ομάδα + ιδιοκτήτης επιχείρησης
Δεοντολογία/έγκριση απορρήτου
διεγερτικό
πολύ ψηλά
άνθρωπος, πάντα
Λάβετε υπόψη σας τη μία φράση από αυτό το διάγραμμα: καθώς αυξάνονται τα στοιχήματα, ο ρόλος της τεχνητής νοημοσύνης συρρικνώνεται και η ανθρώπινη αποδοχή αυξάνεται.
Γιατί η επαλήθευση είναι η καρδιά αυτής της επιχείρησης
Τα μοντέλα γλώσσας AI φαίνονται σίγουροι, αλλά μπορεί να μην είναι σίγουροι. Στην τεχνική γλώσσα, αυτό ονομάζεται ψευδαίσθηση: είναι η κατασκευή από το μοντέλο για ανύπαρκτες πληροφορίες σε μια ευχάριστη πρόταση σαν να ήταν αληθινή. Στην επιστήμη δεδομένων, αυτό έρχεται σε τρεις μορφές. Ο πρώτος είναι ένας ψεύτικος αριθμός: αν ρωτήσετε το μοντέλο "ποιο είναι το μέσο ποσό παραγγελίας" χωρίς να δώσει δεδομένα, θα σας πει με σιγουριά έναν αριθμό, παρόλο που δεν έχει δει ποτέ τα δεδομένα σας. Η δεύτερη είναι μια συνάρτηση που δεν υπάρχει: το μοντέλο μπορεί να προτείνει μια συνάρτηση που δεν υπάρχει καθόλου, όπως η pandas.read_excel_fast(). Τρίτον, εσφαλμένη στατιστική ερμηνεία: το μοντέλο μπορεί να επαναλάβει ομαλά ένα κλασικό στατιστικό σφάλμα όπως «η τιμή p είναι 0,04, επομένως η υπόθεση είναι 96% σωστή».
Η πειθαρχία επαλήθευσης αποτελείται από τρία βήματα:
- Σύνδεσμος προς την πηγή: Κάθε αριθμός, ποσοστό και τάση πρέπει να προέρχεται από τα δεδομένα σας και όχι από τη μνήμη του AI. Χρησιμοποιήστε το AI για κώδικα που λειτουργεί σε δεδομένα, όχι για να θυμάται δεδομένα.
- Εκτελέστε και συγκρίνετε: Εκτελέστε κάθε κομμάτι κώδικα που δίνεται από το AI μόνοι σας. Συγκρίνετε κάθε μέτρηση που παράγει με μια ανεξάρτητη γραμμή βάσης.
- Εξειδικευμένο φίλτρο: Ελέγξτε μόνοι σας εάν η έξοδος έρχεται σε αντίθεση με στατιστικά στοιχεία και γνώσεις τομέα.
Προσοχή: Η τοποθέτηση μιας ανάλυσης γραμμένης από το AI σε μια παρουσίαση χωρίς εκτέλεση και ανάγνωση είναι σαν να παρουσιάζετε μια ανυπόγραφη αναφορά. Ακριβώς επειδή ο κώδικας λειτουργεί δεν σημαίνει ότι είναι σωστός. Ένας κωδικός που αθροίζει τη λάθος στήλη λειτουργεί επίσης χωρίς σφάλματα.
Αναπαραγωγιμότητα: είναι σε θέση να παράγει το ίδιο αποτέλεσμα δύο φορές
Η σιωπηλή αλλά κρίσιμη αρχή της επιστήμης δεδομένων είναι η αναπαραγωγιμότητα: όταν εκτελείτε ξανά μια ανάλυση έξι μήνες αργότερα ή σε διαφορετικό υπολογιστή, έχετε το ίδιο αποτέλεσμα. Αυτός ο κίνδυνος αυξάνεται όταν εργάζεστε με AI, επειδή όταν λέτε στο AI να "φτιάξει αυτό το γράφημα" και να το παίξει χειροκίνητα, τα βήματα εξαφανίζονται. Κανόνας: κάθε βήμα πρέπει να καταχωρείται στον κώδικα και τον έλεγχο έκδοσης (όπως το Git). Στα βήματα που περιλαμβάνουν την τυχαιότητα, ο τυχαίος σπόρος (η αρχική τιμή της γεννήτριας τυχαίων αριθμών· εάν καθοριστεί, το αποτέλεσμα θα είναι επαναλαμβανόμενο) πρέπει να καθοριστεί. Θα εμβαθύνουμε αυτό το θέμα στην Ενότητα 10. Προς το παρόν, αποκτήστε αυτή τη συνήθεια: «Μην κάνετε κλικ με το χέρι, γράψτε με κώδικα».
τρεις μίνι θήκες
Περίπτωση 1 — Ασφαλής επιτάχυνση. Ένας αναλυτής ηλεκτρονικού εμπορίου κανονικά θα περνούσε μισή μέρα καθαρίζοντας έναν πίνακα παραγγελιών 240 χιλιάδων σειρών. Έδωσε τα ονόματα των στηλών και τις 5 πρώτες σειρές (χωρίς προσωπικά δεδομένα) στο AI και ζήτησε τον κωδικό καθαρισμού των pandas. Η τεχνητή νοημοσύνη παρήγαγε βύθισμα σε 8 δευτερόλεπτα. Ο αναλυτής διάβασε τον κώδικα γραμμή προς γραμμή, διόρθωσε ένα σφάλμα στην ανάλυση ημερομηνιών και τον έτρεξε. Διάρκεια: 35 λεπτά αντί για 4 ώρες. Το AI παρείχε κωδικό, η επαλήθευση παρέμεινε στον άνθρωπο.
Περίπτωση 2 — Η κατασκευασμένη μετρική παγίδα. Ένας ασκούμενος ρώτησε την AI, "Πόσο ακριβές είναι το τυχαίο δάσος σε αυτά τα δεδομένα;" χωρίς καθόλου εκπαίδευση του μοντέλου. «Περίπου το 89%,» είπε η AI. Ο ασκούμενος το έβαλε αυτό στην παρουσίαση. Όταν εκπαιδεύτηκε το πραγματικό μοντέλο, η ακρίβεια ήταν 71%. Λάθος: Αναμονή για μετρήσεις χωρίς να δίνετε δεδομένα και μοντέλα στην τεχνητή νοημοσύνη.
Περίπτωση 3 — Αθόρυβη διαρροή. Μια ομάδα εφάρμοσε την ιδέα που προτείνει η τεχνητή νοημοσύνη «προσθήκη του μέσου όρου της μεταβλητής στόχου ως χαρακτηριστικό» χωρίς να την αμφισβητήσει. Το μοντέλο απέδωσε 98% στο σετ δοκιμών, αλλά κατέρρευσε στην παραγωγή επειδή το χαρακτηριστικό διέρρεε μελλοντικές πληροφορίες (διαρροή δεδομένων, Μονάδα 10). Λάθος: Δεν φιλτράρεται στατιστικά η σύσταση AI.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμη προτροπή:
Αναλύστε αυτά τα δεδομένα πωλήσεων και πείτε μου τα μέσα έσοδα.
Αυτός ο ισχυρισμός είναι εσφαλμένος: η τεχνητή νοημοσύνη δεν έλαβε δεδομένα, επομένως το "μέσο εισόδημα" μπορεί να σχηματιστεί μόνο. Ούτε οι στήλες, ούτε η περίοδος, ούτε το νόμισμα είναι ξεκάθαρα.
Ισχυρή προτροπή:
Ο ρόλος σας: βοηθός που βοηθά έναν επιστήμονα δεδομένων. Έχω ένα pandas DataFrame: df. Στήλες:- order_date (κείμενο, σε μορφή "2024-03-01")- ποσό_tl (δεκαδικό, NaN σε ορισμένες σειρές)- client_id (ακέραιος) Εργασία: (1) γράψτε τον κωδικό pandas που υπολογίζει το μέσο ποσό, (2) εξηγήστε πώς χειρίζεται τις τιμές NaN, (3) παραθέστε τον κώδικα που κάνει υποθέσεις. Μην δημιουργείτε το περιεχόμενο των δεδομένων. απλώς δημιουργήστε κώδικα και θα τρέξω και θα επαληθεύσω το αποτέλεσμα.
Στο αίτημα αυτό είναι ξεκάθαρο το σχήμα, η προσδοκία και η «απαγόρευση κατασκευής». Εξακολουθείτε να τρέχετε και να επαληθεύετε μόνοι σας την έξοδο.
Οι απαρχές της ηθικής και της ιδιωτικής ζωής
Η επιστήμη δεδομένων συχνά λειτουργεί με προσωπικά δεδομένα: αρχεία πελατών, ασθενών, εργαζομένων. Ο KVKK (Νόμος για την Προστασία Δεδομένων Προσωπικού Χαρακτήρα) στην Τουρκία και ο GDPR στην Ευρώπη προστατεύουν αυτά τα δεδομένα. Η επικόλληση του πραγματικού σας ονόματος, ταυτότητας, email ή διεύθυνσής σας σε ένα δημόσιο εργαλείο AI αποτελεί παράβαση. Κανόνας: ανωνυμοποιήστε τα δεδομένα πριν από την κοινή χρήση, παρέχετε μόνο σχήμα (ονόματα στηλών, τύποι) και εικονικό παράδειγμα σειράς εάν είναι απαραίτητο. Θα εμβαθύνουμε το θέμα της ηθικής στην Ενότητα 11. Ας βάλουμε την αρχή από την αρχή: Για να κατανοήσουμε τα δεδομένα, συχνά αρκεί η κοινή χρήση της δομής τους και όχι του περιεχομένου τους.
Συνήθη λάθη
- Αναμονή για αριθμούς/μετρήσεις χωρίς να δίνονται δεδομένα στο AI. Το μοντέλο δεν έχει πρόσβαση στα δεδομένα. Ο αριθμός που δίνει είναι ψεύτικο. Να έχετε πάντα το αποτέλεσμα να υπολογίζεται και να τρέχει.
- Νομίζοντας ότι ο κώδικας εργασίας είναι σωστός. Ο κώδικας που χειρίζεται τη λάθος στήλη εκτελείται επίσης χωρίς σφάλματα. Μην εμπιστεύεστε χωρίς να διαβάσετε τη λογική.
- Επικόλληση πραγματικών προσωπικών δεδομένων στο ανοιχτό εργαλείο. Το όνομα, ο αριθμός ταυτότητας, το e-mail δεν κοινοποιούνται ποτέ. Το διάγραμμα είναι αρκετό.
- Κάνοντας τα βήματα χειροκίνητα και όχι εγγραφή τους στον κώδικα. Η ανάλυση που δεν είναι αναπαραγώγιμη είναι αναξιόπιστη.
- Αποδοχή της ερμηνείας των στατιστικών από την τεχνητή νοημοσύνη χωρίς αμφιβολία. Η τεχνητή νοημοσύνη μπορεί να επαναλάβει κλασικά λάθη σε έννοιες όπως η τιμή p και η συσχέτιση.
Συμβουλή: Συμπεριλάβετε μια σύντομη "γραμμή κανόνα" σε κάθε περίοδο λειτουργίας AI: "Μην δημιουργείτε το περιεχόμενο δεδομένων, απλώς δημιουργήστε κώδικα/ανάλυση και θα τρέξω και θα επαληθεύσω το αποτέλεσμα. Υποδείξτε "δεν είμαι σίγουρος" όπου δεν είστε σίγουροι". Αυτή η μοναδική πρόταση μειώνει σημαντικά τον κίνδυνο παραισθήσεων.
Συνοπτικά
Η τεχνητή νοημοσύνη είναι ένας ισχυρός βοηθός στην επιστήμη δεδομένων: επιταχύνει τον κώδικα καθαρισμού, την ερμηνεία EDA, τη σύσταση μοντέλων και την οπτικοποίηση. Αλλά ο ορισμός του προβλήματος, η μετρική επιλογή, η απόφαση παραγωγής και τα ηθικά όρια ανήκουν στους ανθρώπους. Η ροή εργασίας έχει έξι στάδια και ο ρόλος του AI γίνεται μικρότερος όσο αυξάνεται ο κίνδυνος. Τρεις συνήθειες είναι το θεμέλιο των πάντων: η σύνδεση πηγών (επικύρωση), η αναπαραγωγιμότητα (κωδικοποίηση) και η ανωνυμοποίηση (εμπιστευτικότητα). Μόλις εσωτερικεύσετε αυτά τα τρία, κάθε εργαλείο στην υπόλοιπη ενότητα γίνεται ένας ασφαλής επιταχυντής για εσάς.
Εργασία εφαρμογής
Απλώς δημιουργήστε ένα σχήμα ενός μικρού πίνακα που έχετε (ή ενός υποθετικού): ονόματα στηλών, τύποι και 2-3 εικονικές σειρές παραδειγμάτων (χωρίς πραγματικά προσωπικά δεδομένα). Ζητήστε από το AI έναν κωδικό περίληψης στατιστικών στοιχείων χρησιμοποιώντας το πρότυπο "Ισχυρή προτροπή" παραπάνω. Εκτελέστε τον κώδικα, συγκρίνετε την έξοδο με μια μη αυτόματη τιμή, ελέγξτε για τυχόν ψευδείς υποθέσεις και σημειώστε τα ευρήματά σας σε 5 σημεία.
λίστα ελέγχου
- [ ] Έδωσα απλώς στο AI ένα σχήμα και ένα ψεύτικο δείγμα αντί για πραγματικά προσωπικά δεδομένα;
- [ ] Διάβασα και έτρεξα τον κώδικα που παρήγαγε γραμμή προς γραμμή;
- [ ] Έχω επαληθεύσει ανεξάρτητα κάθε αριθμό στην έξοδο;
- [ ] Έχω γράψει κάθε βήμα της ανάλυσης στον κώδικα και τον έχω κάνει επαναλήψιμο;
- [ ] Έχω καθορίσει το επίπεδο κινδύνου της αποστολής και έχω αναθέσει την τελική απόφαση σε άνθρωπο;