Μονάδες
1. Εισαγωγή στην Τεχνητή Νοημοσύνη στην Επιστήμη Δεδομένων και την Ανάλυση: Ροή εργασιών, Ρόλοι, Όρια, Επικύρωση και Δεοντολογία 2. Συλλογή δεδομένων και κατανόηση πηγών: Σχήμα, δειγματοληψία, ποιότητα και επίγνωση διαρροών 3. Καθαρισμός και προεπεξεργασία δεδομένων: Λείπει τιμή, ακραία τιμή και μετατροπή τύπου 4. Διερευνητική Ανάλυση Δεδομένων (EDA): Διανομές, Σχέσεις και Αρχικές πληροφορίες 5. Μηχανική Χαρακτηριστικών: Δημιουργία παραλλαγών, Κωδικοποίηση, Κλιμάκωση και Αποφυγή Διαρροής 6. Κατασκευή μοντέλου: Ορισμός προβλήματος, επιλογή αλγορίθμου και διαίρεση εκπαίδευσης/δοκιμής 7. Αξιολόγηση μοντέλου: Μετρήσεις, Διασταυρούμενη επικύρωση και Ακραία Μάθηση 8. Οπτικοποίηση και αφήγηση: Ακριβή γραφικά, ειλικρινή γραφικά 9. Δημιουργία κώδικα: Ανάλυση υποβοηθούμενη από AI με Python (pandas) και SQL 10. Διαρροή δεδομένων και αναπαραγωγιμότητα: Σιωπηλές καταστροφές και πειθαρχία 11. Molps foundation, ηθική, ιδιωτικότητα και υπεύθυνη ανάλυση
Μονάδα 2 / 11

Συλλογή δεδομένων και κατανόηση πηγών: Σχήμα, δειγματοληψία, ποιότητα και επίγνωση διαρροών

Κέρδη:

  • Δυνατότητα αναγνώρισης διαφορετικών πηγών δεδομένων (βάση δεδομένων, API, αρχείο, απόξεση ιστού) και τις παγίδες καθεμιάς και σωστή κατανόηση του σχήματος
  • Δυνατότητα εκτέλεσης επαναλαμβανόμενης δειγματοληψίας αξιολογώντας εάν το δείγμα αντιπροσωπεύει τον πληθυσμό και την προκατάληψη επιλογής
  • Δυνατότητα εξάλειψης της διαρροής δεδομένων στο στάδιο της συλλογής και τήρησης νομικών/δεοντολογικών ορίων θέτοντας την ερώτηση «Θα το έχω τη στιγμή της πρόβλεψης» σε κάθε στήλη;

Κάθε ανάλυση είναι τόσο καλή όσο και η ποιότητα των δεδομένων που συλλέγετε. Ακόμη και το πιο προηγμένο μοντέλο στον κόσμο θα παράγει αναξιόπιστα αποτελέσματα εάν λειτουργεί με δεδομένα που συλλέγονται εσφαλμένα, δειγματοληπτούνται με προκατάληψη ή περιέχουν πληροφορίες για το μέλλον. Στην επιστήμη των υπολογιστών, αυτή η αρχή συνοψίζεται ως "σκουπίδια μέσα, σκουπίδια έξω" (σκουπίδια μέσα, σκουπίδια έξω). Σε αυτήν την ενότητα, θα καλύψουμε τη φάση συλλογής δεδομένων: κατανόηση της πηγής, δειγματοληψία, υποβολή ερωτήσεων ποιότητας και επαγρύπνηση για τον κίνδυνο διαρροής δεδομένων από την πρώτη μέρα. Η τεχνητή νοημοσύνη είναι ένα ισχυρό βοήθημα σε αυτό το στάδιο. Γράφει ερώτημα SQL, συνοψίζει έγγραφο API, συντάσσει συμβόλαιο δεδομένων. Αλλά είναι ο άνθρωπος που αποφασίζει ποια δεδομένα συλλέγετε και εάν αυτά τα δεδομένα σας αντιπροσωπεύουν.

Γνωριμία με πηγές δεδομένων

Τα δεδομένα προέρχονται από διαφορετικά μέρη και κάθε πηγή έχει τις δικές της παγίδες. Η βάση δεδομένων (δομημένα δεδομένα που αποθηκεύονται σε πίνακες, συνήθως ερωτήματα με SQL) είναι η πιο κοινή πηγή. Είναι αξιόπιστο, αλλά είναι απαραίτητο να κατανοήσουμε καλά το σχήμα του. Το API (Application Programming Interface) παρέχει ζωντανά δεδομένα αλλά ενέχει τον κίνδυνο ορίων ταχύτητας και αλλαγών μορφής. Τα αρχεία (CSV, Excel, JSON) είναι ευέλικτα αλλά επιρρεπή σε ασυνέπειες μορφοποίησης. Το web scraping είναι ισχυρό, αλλά έχει νομικά και ηθικά όρια. Δεν είναι δυνατή η απόξεση κάθε τοποθεσίας.

Προσοχή: Για την απόξεση ιστού και την αυτόματη συλλογή δεδομένων, συμμορφωθείτε με τους όρους χρήσης του ιστότοπου, το αρχείο robots.txt και το KVKK/GDPR. Η μη εξουσιοδοτημένη συλλογή δεδομένων δημιουργεί νομική ευθύνη. Στο πλαίσιο της ασφάλειας των πληροφοριών, χρησιμοποιήστε εργαλεία συλλογής δεδομένων μόνο σε συστήματα για τα οποία είστε εξουσιοδοτημένοι και για σκοπούς άμυνας/ανάλυσης. Απαγορεύεται η μη εξουσιοδοτημένη πρόσβαση ή το ξύσιμο.

Κατανόηση του σχήματος: εξοικείωση με τα δεδομένα

Πριν συλλέξετε ένα σύνολο δεδομένων, πρέπει να κατανοήσετε το σχήμα του (τα ονόματα των στηλών, τους τύπους δεδομένων τους, τις έννοιές τους και τις σχέσεις τους μεταξύ τους). Το AI είναι πολύ χρήσιμο εδώ για τη δημιουργία ενός "λεξικού δεδομένων" — έναν πίνακα που εξηγεί τι σημαίνει κάθε στήλη. Αλλά οι εξηγήσεις που παράγει η τεχνητή νοημοσύνη είναι προβλέψεις. Επιβεβαιώστε την πραγματική σημασία κάθε στήλης με την ομάδα που παρήγαγε τα δεδομένα. Για παράδειγμα, μια στήλη με το όνομα "status" μπορεί να περιέχει 0/1/2. Μόνο η αρχική ομάδα γνωρίζει εάν αυτά είναι "εκκρεμή/εγκεκριμένα/ακυρωμένα" ή κάτι άλλο.

Ο παρακάτω πίνακας συνοψίζει τους βασικούς τύπους πόρων και τις προφυλάξεις:

Πηγή

δυνατό σημείο

παγίδα

Πώς βοηθά το AI

Βάση δεδομένων SQL

Δομικό, αξιόπιστο

Σύνθετες ΣΥΝΔΕΣΕΙΣ

Γράφει ένα προσχέδιο ερωτήματος

API

ζωντανά δεδομένα

Όριο ταχύτητας, αλλαγή σχήματος

Περιλήψεις εγγράφων, pull code

CSV/Excel

Ευέλικτο, γρήγορο

Ασυνέπεια μορφής

Ανάγνωση/ανάλυση κώδικα

απόξεση ιστού

Μεγάλη εμβέλεια

Νομικό/ηθικό όριο

Ανάλυση σχεδίου (εντός εξουσίας)

Δεδομένα καταγραφής/συμβάντος

λεπτομερής

τεράστιος όγκος

Ερώτημα φιλτραρίσματος

Εικονογράφηση: το μέρος αντιπροσωπεύει το σύνολο;

Τις περισσότερες φορές, εργάζεστε με ένα δείγμα (ένα υποσύνολο επιλεγμένο από τον πληθυσμό) και όχι με όλα τα δεδομένα. Το κρίσιμο ερώτημα είναι: αντιπροσωπεύει αυτό το δείγμα τον πληθυσμό; Η προκατάληψη επιλογής είναι η πιο κοινή παγίδα. Για παράδειγμα, εάν δειγματίζετε χρήστες μόνο από την εφαρμογή για κινητά, δεν θα βλέπετε χρήστες ιστού και τα αποτελέσματά σας θα είναι παραπλανητικά. Η τυχαία δειγματοληψία (κάθε εγγραφή έχει ίσες πιθανότητες να επιλεγεί) είναι ασφαλέστερη στις περισσότερες περιπτώσεις. αλλά στα δεδομένα χρονοσειρών, ο διαχωρισμός γίνεται χρονολογικά και όχι τυχαία (θα το δούμε στις Ενότητες 7 και 10).

Διαρροή επίγνωσης από την πρώτη μέρα

Η διαρροή δεδομένων είναι η πηγή των περισσότερων καταστροφών και συνήθως προκύπτει κατά τη φάση της συλλογής δεδομένων. Παράδειγμα: κατά την πρόβλεψη "ακυρώθηκε", εάν προσθέσετε τη στήλη "ημερομηνία ακύρωσης" στα δεδομένα, το μοντέλο κοιτάζει στο μέλλον. Κατά τη φάση της συγκέντρωσης, κάντε μια ερώτηση για κάθε στήλη: «Θα έχω πραγματικά αυτές τις πληροφορίες τη στιγμή που θα κάνω την πρόβλεψη;» Εάν η απάντηση είναι όχι, αυτή η στήλη διαρρέει. Θα καλύψουμε αυτό το θέμα σε βάθος στην Ενότητα 10. Αλλά η ευαισθητοποίηση πρέπει να ξεκινήσει από την πρώτη μέρα.

τρεις μίνι θήκες

Περίπτωση 1 — Το πρόβλημα της εκπροσώπησης. Μία τράπεζα συνέλεξε δεδομένα μόνο για εγκεκριμένα δάνεια για το μοντέλο πιστωτικού κινδύνου της (18.500 εγγραφές). Οι απορρίψεις δεν υπήρχαν στα δεδομένα. Το μοντέλο έκανε λάθος στον πραγματικό κόσμο γιατί δεν είδε ποτέ πώς θα συμπεριφερθούν οι απορριφθέντες. Μάθημα: το δείγμα πρέπει να είναι αντιπροσωπευτικό ολόκληρου του πληθυσμού από τον οποίο παίρνετε την απόφασή σας.

Περίπτωση 2 — Αθόρυβη αλλαγή μορφής. Μια ομάδα έβγαζε δεδομένα τιμών από ένα API κάθε μέρα. Μια μέρα, ο πάροχος API άλλαξε το νόμισμα από USD σε EUR, αλλά το όνομα τομέα παρέμεινε το ίδιο. Τα δεδομένα συλλέχθηκαν σε λάθος μονάδα για 12 ημέρες. 3.200 γραμμές ήταν κατεστραμμένες. Μάθημα: Ελέγχετε τακτικά τη συνοχή του όγκου και της μορφής στα δεδομένα API.

Περίπτωση 3 — Πρώιμη διαρροή. Ένας αναλυτής συμπεριέλαβε τη στήλη "αιτία κλεισίματος λογαριασμού" κατά τη συλλογή δεδομένων για μια εκτίμηση "κλεισίματος". Αυτή η στήλη συμπληρώθηκε μόνο μετά την αποχώρηση του πελάτη. Το μοντέλο απέδωσε 97% ακρίβεια στο σετ δοκιμής. Δεν λειτούργησε στην παραγωγή επειδή αυτή η στήλη ήταν άδεια κατά τη στιγμή της πρόβλεψης. Μάθημα: Κάντε σε κάθε στήλη την ερώτηση "το έχω τη στιγμή της πρόβλεψης;"

Τέσσερα πρότυπα με δυνατότητα αντιγραφής

1) Εξαγωγή δεδομένων από λεξικό:

Ο ρόλος σας: βοηθός επιστήμονα δεδομένων. Παρακάτω είναι τα ονόματα στηλών και οι δειγματοληπτικές (ανώνυμες) τιμές ενός πίνακα. Για κάθε στήλη, καταχωρίστε την εκτιμώμενη σημασία, τον τύπο δεδομένων και τους πιθανούς κινδύνους ποιότητας σε έναν πίνακα. Επισημάνετε τις στήλες για τις οποίες δεν είστε σίγουροι ως "απαιτείται επιβεβαίωση". που σημαίνει κατασκευή.Στήλες: [επικολλήστε εδώ]

2) Κώδικας δειγματοληψίας (τυχαίο, επαναλαμβανόμενο):

Έχω pandas df. Γράψτε κώδικα που εξάγει ένα αντιπροσωπευτικό 5% τυχαίο δείγμα από 200.000 σειρές. Χρησιμοποιήστε random_state=42 (για αναπαραγωγιμότητα). Προσθέστε κώδικα για να ελέγξετε ότι η κατανομή κλάσεων του δείγματος είναι παρόμοια με τον πληθυσμό.

3) Ερώτηση σάρωσης διαρροής:

Θα σας δώσω αυτόν τον κατάλογο στηλών. Στόχος μου είναι να προβλέψω «μήπως ακυρώνεται» (0/1). Για κάθε στήλη, αξιολογήστε αν θα την έχω πραγματικά τη στιγμή της πρόβλεψης και επισημάνετε την ως "ασφαλής / ύποπτη / διαρροή". Γράψε το σκεπτικό σου με μια πρόταση. Στήλες: [λίστα]

4) Προσχέδιο ερωτήματος έλξης SQL:

Έχω πίνακες "παραγγελίες" και "πελάτες" στην PostgreSQL. Γράψτε ένα ερώτημα JOIN που συνδυάζει τις παραγγελίες των τελευταίων 90 ημερών με την πόλη του πελάτη και επιστρέφει το συνολικό ποσό και τον αριθμό των παραγγελιών ανά πόλη. Εξηγήστε το φίλτρο ημερομηνίας και τον τρόπο χειρισμού των NULL πόλεις. Θα εκτελέσω το ερώτημα και θα το επαληθεύσω.

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμη προτροπή:

Τραβήξτε μου ένα καλό δείγμα δεδομένων από αυτήν τη βάση δεδομένων.

Το "καλό" είναι διφορούμενο. Ποιος πίνακας, ποια περίοδος, ποιο μέγεθος, ποιος σκοπός δεν είναι ξεκάθαρος. Το AI θα παράγει μόνο ένα γενικό, πιθανώς λάθος ερώτημα.

Ισχυρή προτροπή:

Ο ρόλος σας: Βοηθός SQL. Έχω έναν πίνακα "συναλλαγές": αναγνωριστικό στηλών, αναγνωριστικό_πελάτη, ημερομηνία (χρονοσήμανση), ποσό (αριθμητικό), κανάλι (κείμενο: 'ιστός'/'κινητό'). Εργασία: Γράψτε ένα επαναλαμβανόμενο (ντετερμινιστικό με ORDER BY) ερώτημα που επιστρέφει 10.000 αντιπροσωπευτικές σειρές από κάθε κανάλι για το έτος 2024. Σκοπός: συγκριτική ανάλυση καναλιών. Καταγράψτε τις υποθέσεις του ερωτήματός σας.

Εδώ ο πίνακας, ο σκοπός, το μέγεθος και η επαναληψιμότητα είναι σαφής.

Συνήθη λάθη

  • Δεν αμφισβητείται η αντιπροσωπευτικότητα του δείγματος. Τα εύκολα προσβάσιμα δεδομένα δεν είναι ακριβή δεδομένα. Η μεροληψία επιλογής στρεβλώνει το αποτέλεσμα.
  • Προσαρμογή σημασιών στηλών στο AI. Η ομάδα πηγής γνωρίζει το νόημα. Μην χρησιμοποιείτε την πρόβλεψη AI χωρίς να την επιβεβαιώσετε.
  • Δεν παρακολουθείται η αλλαγή μορφής/μονάδας API. Η σιωπηλή αλλαγή συλλέγει διεφθαρμένα δεδομένα για μέρες.
  • Αγνοώντας τη διαρροή στο στάδιο της συλλογής. Εάν η ερώτηση "Το έχω τη στιγμή της πρόβλεψης" δεν τεθεί νωρίς, το μοντέλο θα δώσει ψευδή επιτυχία.
  • Συλλογή μη εξουσιοδοτημένων ή παράνομων δεδομένων. Η παραβίαση του robots.txt, των όρων χρήσης και του KVKK αποτελεί σοβαρό κίνδυνο.
Συμβουλή: Διατηρήστε μια "κάρτα δεδομένων" μίας σελίδας για κάθε νέα πηγή δεδομένων: πηγή, ημερομηνία λήψης, αριθμός σειρών, γνωστά όρια και στήλες σε κίνδυνο διαρροής. Αυτή η κάρτα αποθηκεύει την ερώτηση "τι ήταν αυτά τα δεδομένα" και την αναπαραγωγιμότητα μήνες αργότερα.

Συνοπτικά

Η ποιότητα της ανάλυσης περιορίζεται από την ποιότητα των δεδομένων που συλλέγονται. Γνωρίστε καλά την πηγή (βάση δεδομένων, API, αρχείο, scrape) και το σχήμα. βεβαιωθείτε ότι το δείγμα είναι αντιπροσωπευτικό του πληθυσμού· Εξαλείψτε τη διαρροή από την πρώτη μέρα ρωτώντας κάθε στήλη «την έχω τη στιγμή της πρόβλεψης;» Η τεχνητή νοημοσύνη είναι ένας εξαιρετικός επιταχυντής για την εργασία ερωτημάτων και εγγράφων, αλλά οι άνθρωποι αποφασίζουν ποια δεδομένα θα συλλέξουν και την αντιπροσωπευτικότητά τους. Τα όρια εξουσίας, ο νόμος και η εμπιστευτικότητα είναι πάντα πρώτα.

Εργασία εφαρμογής

Επιλέξτε μια πηγή δεδομένων (από τη δική σας επιχείρηση ή υποθετική). Λάβετε ένα προσχέδιο ενός λεξικού δεδομένων από την τεχνητή νοημοσύνη με το πρότυπο "εξαγωγή λεξικού δεδομένων" παραπάνω. Στη συνέχεια, αξιολογήστε χειροκίνητα κάθε στήλη για να δείτε εάν έχει διαρρεύσει. Προσπαθήστε να βρείτε τουλάχιστον μία ύποπτη στήλη/διαρροή και γράψτε με μια πρόταση γιατί είναι επικίνδυνη.

λίστα ελέγχου

  • [ ] Έχω επιβεβαιώσει την πηγή δεδομένων και το σχήμα με την ομάδα προέλευσης;
  • [ ] Έχω ελέγξει ότι το δείγμα είναι αντιπροσωπευτικό του πληθυσμού;
  • [ ] Έχω κάνει σε κάθε στήλη την ερώτηση "θα το έχω τη στιγμή της εκτίμησης;"
  • [ ] Έχω κάνει τη δειγματοληψία επαναλήψιμη (σταθερός σπόρος);
  • [ ] Έχω ελέγξει τα νομικά/δεοντολογικά όρια συλλογής (αρχή, robots.txt, KVKK);