Κέρδη:
- Δυνατότητα διερεύνησης της κατανομής, του κέντρου, της εξάπλωσης και των ανωμαλιών των μεταβλητών με κατάλληλα γραφήματα (ιστόγραμμα, διάγραμμα πλαισίου, διάγραμμα διασποράς).
- Ικανότητα σωστής ερμηνείας της συσχέτισης και ανάγνωσης μαζί με την γραφική παράσταση διασποράς, χωρίς να τη συγχέουμε με την αιτιότητα
- Ικανότητα κατανόησης ότι τα συνοπτικά στατιστικά στοιχεία μπορεί να είναι παραπλανητικά (μάθημα Anscombe) και να αναπτύσσουν υποθέσεις που καθορίζουν την κατεύθυνση της μοντελοποίησης.
Πριν από την κατασκευή ενός μοντέλου, είναι απαραίτητο να γνωρίζουμε τα δεδομένα. Όπως ένας γιατρός δεν συνταγογραφεί φάρμακα χωρίς να εξετάσει τον ασθενή, έτσι και ένας επιστήμονας δεδομένων δεν κατασκευάζει ένα μοντέλο χωρίς να «εξετάσει» τα δεδομένα. Αυτή η εξέταση ονομάζεται διερευνητική ανάλυση δεδομένων (EDA για συντομία): είναι η φάση της ανακάλυψης της κατανομής, των σχέσεων, των εκπλήξεων και των παγίδων των δεδομένων οπτικά και γραφικά. Ο σκοπός του EDA είναι να δημιουργήσει υποθέσεις, να εντοπίσει σφάλματα και να καθορίσει την κατεύθυνση μοντελοποίησης. Η τεχνητή νοημοσύνη είναι ένας πολύ ισχυρός βοηθός σε αυτό το στάδιο: προτείνει ποιο γράφημα είναι κατάλληλο, γράφει τον κώδικά του, ερμηνεύει μια διανομή. Αλλά ένα άτομο αποφασίζει, με τις γνώσεις του στο πεδίο, εάν το μοτίβο που βλέπει είναι πραγματικό ή σύμπτωση.
Τι αναζητά η EDA;
Η ΕΔΑ αναζητά απαντήσεις σε τέσσερα ερωτήματα. Κατανομή: Πώς κατανέμεται κάθε μεταβλητή — είναι συμμετρική, λοξή ή με δύο κορυφές; Κεντρική τάση και εξάπλωση: Ποια είναι η μέση, διάμεση, τυπική απόκλιση; Σχέσεις: Πώς συνδέονται οι μεταβλητές μεταξύ τους; Ανωμαλίες: Υπάρχουν απροσδόκητες τιμές, κενά, ομαδοποιήσεις; Αυτές οι τέσσερις ερωτήσεις καθορίζουν ποια δυνατότητα θα λειτουργήσει και ποιο μοντέλο είναι κατάλληλο.
Ας ορίσουμε μερικές βασικές έννοιες. Το ιστόγραμμα είναι ένα γράφημα που διαιρεί τις τιμές μιας αριθμητικής μεταβλητής σε διαστήματα και δείχνει πόσες παρατηρήσεις υπάρχουν σε κάθε διάστημα. Είναι ο πιο γρήγορος τρόπος για να δείτε τη διανομή. Η λοξότητα είναι η μετατόπιση της κατανομής προς μία κατεύθυνση. Μεταβλητές όπως το εισόδημα είναι λοξές προς τα δεξιά (η πλειοψηφία χαμηλή, λίγες πολύ υψηλά). Ένα διάγραμμα πλαισίου δείχνει τη διάμεση τιμή, τα τεταρτημόρια και τις ακραίες τιμές με μια ματιά. Ένα διάγραμμα διασποράς δείχνει τη σχέση δύο αριθμητικών μεταβλητών με ένα σύννεφο σημείων.
Συσχέτιση: υπάρχει σχέση αλλά να είστε προσεκτικοί
Συσχέτιση — ένα μέτρο του τρόπου με τον οποίο δύο μεταβλητές κινούνται μαζί. ένας αριθμός μεταξύ -1 και +1 — είναι το πιο χρησιμοποιημένο και πιο παρεξηγημένο εργαλείο του EDA. +1 σημαίνει τέλεια συν-αύξηση, -1 σημαίνει τέλεια αντίστροφη σχέση, 0 σημαίνει καμία γραμμική σχέση. Υπάρχουν δύο μεγάλες παγίδες. Πρώτον, ο περίφημος κανόνας: η συσχέτιση δεν είναι αιτιότητα. Οι περιπτώσεις πνιγμού αυξάνονται με τις πωλήσεις παγωτού. όχι επειδή το ένα οδηγεί στο άλλο, αλλά επειδή το καλοκαίρι (η κρυφή τρίτη μεταβλητή) ενεργοποιεί και τα δύο. Δεύτερον, η συσχέτιση μετρά μόνο τη γραμμική σχέση. Μπορεί να υποδηλώνει μια ισχυρή αλλά καμπυλόγραμμη σχέση κοντά στο 0. Επομένως, όταν εξετάζετε τη συσχέτιση, φροντίστε να κοιτάξετε και το διάγραμμα διασποράς.
Προσοχή: Όταν η τεχνητή νοημοσύνη δίνει έναν αριθμό συσχέτισης, μπορεί να γλιστρήσει σε αιτιολογική γλώσσα όπως "Το Α αυξάνει το Β". Αυτό είναι επικίνδυνο. Η συσχέτιση δείχνει μόνο κίνηση μαζί. Μόνο η εμπειρία, η γνώση του τομέα και το προσεκτικό συμπέρασμα καθορίζουν τον λόγο.
Κουαρτέτο Anscombe: γιατί να μην κοιτάξετε απλώς τον αριθμό
Υπάρχει ένα διάσημο παράδειγμα στη στατιστική: το κουαρτέτο Anscombe. Τέσσερα διαφορετικά σύνολα δεδομένων έχουν σχεδόν τον ίδιο μέσο όρο, την ίδια διακύμανση και την ίδια συσχέτιση (0,82). Αλλά όταν σχηματίζονται γραφικά, φαίνονται εντελώς διαφορετικά - μια ευθεία γραμμή, μια κυρτή, μια ένα σύννεφο που τραβιέται από ένα μόνο ακραίο σημείο. Το μάθημα είναι σαφές: τα συνοπτικά στατιστικά στοιχεία είναι παραπλανητικά, η εξέταση του γραφήματος είναι απαραίτητη. Η τεχνητή νοημοσύνη μπορεί να σας δώσει μέσους όρους και συσχετίσεις, αλλά το να εμπιστεύεστε αυτούς τους αριθμούς χωρίς να βλέπετε το γράφημα, πέφτετε στην παγίδα του Anscombe.
Ο παρακάτω πίνακας συνοψίζει ποιο διάγραμμα ταιριάζει σε ποια ερώτηση:
Ερώτηση
κατάλληλο γραφικό
Τι δείχνει
Κατανομή μιας μεμονωμένης μεταβλητής
Ιστόγραμμα / KDE
Σχήμα, λοξότητα, αριθμός κορυφών
Κέντρο και ακραία σημεία
Οικόπεδο κουτιού
Διάμεσος, τεταρτημόριο, ακραίες τιμές
Σχέση δύο αριθμών
διάγραμμα διασποράς
Κατεύθυνση, δύναμη, καμπυλότητα
Σύγκριση κατηγοριών
ραβδόγραμμα
Διαφορά μεταξύ ομάδων
αλλάζουν με την πάροδο του χρόνου
γραμμικό διάγραμμα
Τάση, εποχικότητα
Πολυμεταβλητή σχέση
Χάρτης θερμότητας συσχέτισης
Γενικός πίνακας σχέσεων
Το παράδοξο του Simpson: τα συγκεντρωτικά δεδομένα μπορεί να λένε ψέματα
Μια ύπουλη παγίδα στο EDA που πρέπει να γνωρίζετε είναι το παράδοξο του Simpson: ένα μοτίβο μπορεί να δείχνει μια κατεύθυνση όταν εξετάζονται όλα τα δεδομένα μαζί, αλλά να αντιστρέφεται όταν τα δεδομένα χωρίζονται σε σημαντικές υποομάδες. Κλασικό παράδειγμα: το συνολικό ποσοστό αποδοχής για τις γυναίκες υποψήφιες σε ένα πανεπιστήμιο φαίνεται να είναι χαμηλότερο από ό,τι για τους άνδρες. Αλλά όταν εξετάζεται ανά τμήμα, το ποσοστό αποδοχής των γυναικών είναι υψηλότερο από τους άνδρες στα περισσότερα τμήματα. Από πού; Οι γυναίκες έκαναν αίτηση σε πιο ανταγωνιστικά τμήματα (χαμηλότερα ποσοστά αποδοχής). Ο συνδυασμένος αριθμός αποθηκεύει αυτήν την κρυφή μεταβλητή. Το μάθημα είναι σαφές: όταν εξετάζετε ένα σύνολο ή έναν μέσο όρο, φροντίστε να ελέγξετε αν αυτός ο αριθμός λέει την ίδια ιστορία όταν αναλύεται σε σημαντικές υποομάδες (τμήμα, περίοδος, κανάλι). Όταν η τεχνητή νοημοσύνη σάς δίνει ένα συνδυασμένο ποσοστό, το να ρωτήσετε «είναι ακόμη έγκυρο όταν το τμηματοποιείτε» θα πιάσει τα περισσότερα παραπλανητικά αποτελέσματα από νωρίς.
τρεις μίνι θήκες
Περίπτωση 1 — Δύο κρυμμένοι λόφοι. Ένας αναλυτής βρήκε ότι ο μέσος όρος ηλικίας των πελατών είναι τα 41 και το ανέφερε ως «πλήθος μέσης ηλικίας». Όμως το ιστόγραμμα έδειξε δύο κορυφές: τις ηλικιακές ομάδες 22-28 και 55-62. Ο μέσος όρος 41 δεν αντιπροσώπευε κανέναν. Μάθημα: σχεδιάστε την κατανομή πριν εμπιστευτείτε τον μέσο όρο.
Περίπτωση 2 — Ψευδής συσχέτιση. Μια ομάδα βρήκε συσχέτιση 0,78 μεταξύ "δαπανών διαφήμισης" και "πωλήσεων" και διπλασίασε τον προϋπολογισμό. Ωστόσο, αυτό που πυροδότησε και τα δύο ήταν εποχιακές καμπάνιες. κατά την περίοδο εκτός εκστρατείας, η σχέση μειώθηκε στο 0,10. 340 χιλιάδες TL πρόσθετη διαφήμιση δεν απέδωσε την αναμενόμενη απόδοση. Μάθημα: η λάθος συσχέτιση με την αιτιότητα είναι ακριβή.
Περίπτωση 3 — Η γραμμή που χαράσσει ο μοναχικός αντίθετος. Μια ανάλυση ακινήτων έδειξε μια ισχυρή σχέση μεταξύ τετραγωνικών μέτρων και τιμής (r=0,80). Όταν σχεδιάστηκε το οικόπεδο διασποράς, σχεδόν ολόκληρη η σχέση δημιουργήθηκε από μια και μόνο πολυτελή βίλα 12 εκατομμυρίων TL. Όταν αφαιρέθηκε αυτό το σημείο, η συσχέτιση έπεσε στο 0,31. Μάθημα: να διαβάζετε πάντα τη συσχέτιση μαζί με το διάγραμμα διασποράς.
Τέσσερα πρότυπα με δυνατότητα αντιγραφής
1) Αυτόματη σύνοψη EDA:
Έχω pandas df. Γράψτε κώδικα που παράγει: (1) df.info() και df.describe(), (2) ιστόγραμμα για κάθε αριθμητική στήλη, (3) μέτρηση για κάθε κατηγορική στήλη. Μην σχολιάζετε, απλώς δημιουργήστε τον κωδικό ανακάλυψης. Ερμηνεύω τα μοτίβα.
2) Συσχέτιση + οπτική (με την προειδοποίηση της αιτιότητας):
Γράψτε κώδικα που σχεδιάζει έναν πίνακα συσχέτισης και έναν θερμικό χάρτη για τις αριθμητικές στήλες. Σχεδιάστε επίσης ένα διάγραμμα διασποράς των 3 υψηλότερων συσχετισμένων ζευγών. Προσθέστε μια γραμμή σχολίου στην έξοδο που σας υπενθυμίζει ότι η συσχέτιση δεν συνεπάγεται αιτιότητα. Μην κάνετε αιτιώδεις ισχυρισμούς.
3) Διάγνωση κατανομής:
Για τη στήλη "income_tl": γράψτε κώδικα που παράγει ιστόγραμμα, διάγραμμα πλαισίου, τιμή λοξότητας και σύγκριση διάμεσων/μέσου. Θα ερμηνεύσω αν η κατανομή είναι λοξή ή όχι. απλά δώστε τον κωδικό.
4) Σύγκριση τμημάτων:
Συγκρίνετε πελάτες ανά "κανάλι" (ιστός/κινητό): γράψτε κώδικα που παράγει ένα τετραγωνίδιο του μέσου ποσού, του μέσου ποσού, του αριθμού παραγγελιών και της διανομής ποσού για κάθε κανάλι. Προτείνετε ποιο τεστ είναι κατάλληλο για τη στατιστική σημασία της διαφοράς μεταξύ των δύο καναλιών, αλλά η απόφαση εξαρτάται από εμένα.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμη προτροπή:
Βρείτε κάτι ενδιαφέρον σε αυτά τα δεδομένα.
Το "ενδιαφέρον" είναι απροσδιόριστο. Το AI δεν βλέπει τα δεδομένα, επομένως είτε τα συνθέτει είτε κάνει γενικές δηλώσεις. Δεν υπάρχει κατεύθυνση, μεταβλητές, σκοπός.
Ισχυρή προτροπή:
Ο ρόλος σας: βοηθός EDA. Στήλες df: ηλικία (int), εισόδημα_tl (float), πόλη (κατηγορία), κανάλι (ιστό/κινητό), ποσό (float). Σκοπός: να ανακαλύψει τους παράγοντες που επηρεάζουν το «ποσό». Εργασία: (1) ο κωδικός που απεικονίζει την κατανομή του ποσού, (2) τα γραφήματα κατανομής μεταξύ ποσού και ηλικίας και εισοδήματος_tl, (3) διάγραμμα πλαισίου ποσού σε ανάλυση καναλιού. Δημιουργία αιτιώδους αιτιώδους αιτήματος. Απλώς δημιουργήστε τον κώδικα ανακάλυψης και θα ερμηνεύσω το μοτίβο.
Εδώ, ο σκοπός, οι μεταβλητές και το όριο της «αξίωσης αιτιότητας» είναι ξεκάθαρα.
Συνήθη λάθη
- Βασιζόμενοι αποκλειστικά σε συνοπτικά στατιστικά στοιχεία. Όπως δείχνει το κουαρτέτο Anscombe, ο ίδιος μέσος όρος κρύβει πολύ διαφορετικές διανομές. δείτε γράφημα.
- Λανθασμένη συσχέτιση για αιτιότητα. Η συν-δράση δεν υποδηλώνει ότι το ένα οδηγεί στο άλλο. Προσοχή στις κρυφές μεταβλητές.
- Εξετάζοντας τη συσχέτιση χωρίς γραφική παράσταση διασποράς. Μια μεμονωμένη ακραία τιμή ή καμπυλότητα παραπλανά τον αριθμό.
- Συνοψίζοντας μια κατανομή δύο κορυφών/λοξής με τη μέση τιμή. Ο μέσος όρος μπορεί να μην αντιπροσωπεύει κανέναν.
- Παρακάμπτοντας το EDA και πηγαίνετε κατευθείαν στο μοντέλο. Μη αναγνωρισμένα δεδομένα σημαίνει τυφλό μοντέλο.
Συμβουλή: Με κάθε νέο σύνολο δεδομένων, αφιερώστε τα πρώτα 30 λεπτά απλώς σχεδιάζοντας γραφήματα: ιστόγραμμα κάθε αριθμητικού, διάγραμμα διασποράς σημαντικών ζευγών, διάγραμμα ράβδων κατηγοριών. Αυτά τα 30 λεπτά αποτρέπουν μελλοντικά σφάλματα μοντελοποίησης για τις επόμενες μέρες.
Συνοπτικά
Το EDA είναι η φάση της εξοικείωσης με τα δεδομένα πριν από την κατασκευή ενός μοντέλου και αναζητά απαντήσεις σε τέσσερα ερωτήματα: διανομή, εξάπλωση στο κέντρο, σχέσεις και ανωμαλίες. Οι συνοπτικές στατιστικές μπορεί να είναι παραπλανητικές. Η εξέταση του γραφήματος είναι απαραίτητη (διάλεξη Anscombe). Η συσχέτιση είναι ένα ισχυρό εργαλείο, αλλά η αιτιότητα δεν διαβάζεται και πρέπει οπωσδήποτε να διαβαστεί σε συνδυασμό με μια γραφική παράσταση διασποράς. Το AI είναι ένας εξαιρετικός επιταχυντής για την πρόταση γραφικών και τη σύνταξη κώδικα. Αλλά οι άνθρωποι ερμηνεύουν με τις γνώσεις τους στο πεδίο εάν το μοτίβο που βλέπουν είναι πραγματικό ή σύμπτωση.
Εργασία εφαρμογής
Επιλέξτε ένα σύνολο δεδομένων και απλώς κάντε EDA: εξάγετε ένα ιστόγραμμα τουλάχιστον τριών αριθμητικών μεταβλητών, ένα διάγραμμα διασποράς δύο ζευγών μεταβλητών και έναν χάρτη θερμότητας συσχέτισης. Βρείτε τουλάχιστον μία «έκπληξη» (όπως μια κατανομή με δύο κορυφές, μια υποψήφια για ψευδή συσχέτιση, μια σχέση που έλκεται από ένα μόνο ακραίο στοιχείο) και εξηγήστε τη με μια πρόταση. Γράψτε χωρίς να κάνετε αιτιώδεις ισχυρισμούς.
λίστα ελέγχου
- [ ] Έχω γράψει γραφικά την κατανομή κάθε αριθμητικής μεταβλητής;
- [ ] Κοίταξα τους συσχετισμούς με το scatterplot;
- [ ] Έχω κρατήσει χωριστά την αιτιότητα και τη συσχέτιση;
- [ ] Δεν παρατήρησα λοξές ή δύο κορυφές διανομές και εμπιστεύτηκα τυφλά τη μέση τιμή;
- [ ] Έχω αντλήσει τουλάχιστον μία πτυχή/υπόθεση μοντελοποίησης από τα ευρήματά μου στο EDA;