Κέρδη:
- Δυνατότητα παραγωγής περιγραφικών στατιστικών και διαγραμμάτων διανομής/σχέσεων με υποστήριξη τεχνητής νοημοσύνης και επιλογή του σωστού τύπου γραφήματος σύμφωνα με τα δεδομένα και την ερώτηση
- Ικανότητα αναγνώρισης παραπλανητικών επιλογών (διακεκομμένος άξονας, ακατάλληλη κλίμακα, υπερβολική εξομάλυνση) σε εικόνες που παράγονται από τεχνητή νοημοσύνη και εφαρμογή ειλικρινών αρχών οπτικοποίησης
- Το να μπορείς να διακρίνεις ότι η διερευνητική ανάλυση είναι για τη δημιουργία υποθέσεων και την παγίδα της ανακάλυψης και της επιβεβαίωσης με τα ίδια δεδομένα (που ανοίγει την πόρτα στο p-hacking).
Αφού καθαρίσει τα δεδομένα, η πρώτη δουλειά του εμπειρικού ερευνητή είναι να τα γνωρίσει. Αυτό το στάδιο ονομάζεται διερευνητική ανάλυση δεδομένων (EDA - Exploratory Data Analysis): είναι η διαδικασία εξέτασης των δεδομένων με γραφήματα και συνοπτικά στατιστικά στοιχεία και προβολή της δομής, των μοτίβων και των εκπλήξεων. Ο στόχος δεν είναι να δοκιμάσετε ακόμα μια υπόθεση, αλλά να εξοικειωθείτε με τα δεδομένα, να δημιουργήσετε ερωτήσεις και να θέσετε τις βάσεις για το μοντέλο που θα φτιάξετε στο μέλλον. Σε αυτήν την ενότητα, θα δούμε πώς η τεχνητή νοημοσύνη (AI) επιταχύνει το EDA και την οπτικοποίηση, αλλά γιατί τα γραφικά που παράγει πρέπει να ελεγχθούν προσεκτικά.
Ας κάνουμε πρώτα δύο βασικές διακρίσεις. Πρώτον, η περιγραφική στατιστική (αριθμοί που συνοψίζουν δεδομένα όπως ο μέσος όρος, η διάμεσος, η τυπική απόκλιση, τα τεταρτημόρια) και η οπτικοποίηση (που εμφανίζουν τις ίδιες πληροφορίες γραφικά) αλληλοσυμπληρώνονται. Μαζί περιγράφουν τα δεδομένα. Δεύτερο, και πιο κρίσιμο: η ανακάλυψη και η επιβεβαίωση πρέπει να διακρίνονται. Η διερευνητική ανάλυση είναι για τη δημιουργία υποθέσεων. Εξερευνώντας την υπόθεση με τα ίδια δεδομένα και λέγοντας «Το δοκίμασα και το βρήκα σημαντικό» ανοίγει την πόρτα στο p-hacking, το οποίο θα δούμε στην επόμενη ενότητα. Είναι ελεύθερο να κοιτάξετε τα δεδομένα και να δείτε ένα μοτίβο. Αλλά η δήλωση αυτού του μοτίβου ως «αποδεδειγμένης διαπίστωσης» στα ίδια δεδομένα είναι παραπλανητική.
Βήμα προς βήμα διερευνητική ανάλυση
1. Μονομεταβλητή προβολή. Εξετάστε κάθε μεταβλητή ξεχωριστά: είναι η κατανομή της συμμετρική ή λοξή; πόσοι λόφοι υπάρχουν? Πού είναι τα ακραία σημεία; Για αριθμητικές μεταβλητές, ιστόγραμμα (γραφική παράσταση που δείχνει συχνότητα διαιρώντας τις τιμές σε εύρη) και τετράγωνο (πλαίσιο — διάγραμμα που δείχνει διάμεσες τιμές, τεταρτημόριο και ακραίες τιμές). Για κατηγορικές μεταβλητές, χρησιμοποιήστε πίνακες συχνοτήτων και ραβδόγραμμα.
2. Διμεταβλητή άποψη. Δείτε τη σχέση μεταξύ δύο μεταβλητών: διάγραμμα διασποράς για δύο αριθμητικές μεταβλητές (εμφανίζει κάθε παρατήρηση ως σημείο στο επίπεδο x-y), γραφική παράσταση ομαδοποιημένου πλαισίου για αριθμητική-κατηγορική, διασταύρωση για δύο κατηγορίες. Πριν κοιτάξετε τον συντελεστή συσχέτισης, φροντίστε να κοιτάξετε το διάγραμμα διασποράς: η ίδια συσχέτιση μπορεί να δείξει πολύ διαφορετικά μοτίβα (το περίφημο κουαρτέτο Anscombe το αποδεικνύει· τέσσερα σύνολα δεδομένων έχουν σχεδόν πανομοιότυπα στατιστικά στοιχεία, αλλά όταν σχεδιάζονται αποδεικνύονται εντελώς διαφορετικά).
3. Επιλέξτε τον σωστό τύπο γραφήματος. Ο τύπος γραφήματος εξαρτάται από την ερώτηση και τον τύπο δεδομένων σας. Ιστόγραμμα για διανομή. διασκορπισμός για σχέση? γραμμικό γράφημα για αλλαγή με την πάροδο του χρόνου. ραβδόγραμμα για σύγκριση κατηγοριών. (προσεκτικά) στοιβαγμένη μπάρα για την αναλογία των μερών προς το σύνολο. Το AI δημιουργεί γρήγορα κώδικα για εσάς, αλλά η απόφαση "ποιο γράφημα για ποια ερώτηση" είναι δική σας.
4. Σημειώστε το μοτίβο, μην δηλώνετε αποτελέσματα. Καταγράψτε οποιοδήποτε ενδιαφέρον μοτίβο βλέπετε ως "σημείωση ανακάλυψης", αλλά μην το θεωρήσετε επιβεβαιωμένο εύρημα. Η επιβεβαίωση γίνεται σε ξεχωριστό βήμα, κατά προτίμηση με ξεχωριστά δεδομένα ή προκαθορισμένο χρονοδιάγραμμα.
Ειλικρινείς αρχές οπτικοποίησης
Το γραφικό πείθει? Ως εκ τούτου, η παραπλανητική του δύναμη είναι επίσης υψηλή. Η τεχνητή νοημοσύνη μπορεί να κάνει αισθητικές αλλά μερικές φορές παραπλανητικές επιλογές. Ελέγξτε αυτές τις πολιτικές:
- Στα γραφήματα ράβδων, ο άξονας y πρέπει να ξεκινά από το μηδέν. Ο διακεκομμένος άξονας δείχνει μικρές διαφορές ως μεγάλες.
- Η κλίμακα πρέπει να είναι συνεπής. Εάν συγκρίνονται δύο γραφήματα, χρησιμοποιήστε το ίδιο εύρος αξόνων.
- Η υπερβολική εξομάλυνση μπορεί να κρύψει το πραγματικό μοτίβο. Μια γραμμή τάσης φαίνεται ωραία, αλλά αν «εξομαλύνει» τα δεδομένα πάρα πολύ, μπορεί να είναι παραπλανητική.
- Το χρώμα και η τρισδιάστατη διακόσμηση παραμορφώνουν την προσοχή και όχι τα δεδομένα. Επιλέξτε την απλότητα.
- Τα δεδομένα που λείπουν και το μέγεθος του δείγματος θα πρέπει να είναι ορατά. Το "n=12" και το "n=12.000" δεν πρέπει να είναι το ίδιο.
Προσοχή: Ακριβώς επειδή τα γραφικά που παράγονται από την AI είναι όμορφα, δεν είναι αληθινά. Το πιο συνηθισμένο λάθος που κάνει είναι ότι δεν ξεκινά τον άξονα από το μηδέν στο ραβδόγραμμα και υπερβάλλει τη διαφορά μεταξύ των δύο ομάδων. Ελέγχετε πάντα τον άξονα.
Διάγραμμα σύγκρισης: ερώτηση → γράφημα
Ρωτήστε
σωστό διάγραμμα
Συνηθισμένο λάθος
Πώς κατανέμεται αυτή η μεταβλητή;
Ιστόγραμμα/γραφικό πλαίσιο
χρησιμοποιήστε γράφημα πίτας
Συνδέονται δύο αριθμητικές μεταβλητές;
Οικόπεδο διασποράς
Κοιτάζοντας μόνο τον αριθμό των συσχετισμών
Πώς έχει αλλάξει με την πάροδο του χρόνου;
γραμμικό διάγραμμα
Λέγοντας μια τάση με ένα γράφημα ράβδων
Ποια είναι η διαφορά μεταξύ των ομάδων;
Ομαδοποιημένο πλαίσιο/μπάρα (από την αρχή)
Ράβδος κόλουρου άξονα
Αναλογία μέρους προς όλο;
Στοιβαγμένη γραμμή (με προσοχή)
Διάγραμμα πίτας πολλαπλών τμημάτων
Τέσσερα μηνύματα με δυνατότητα αντιγραφής
1. Κωδικός αυτόματης ανακάλυψης:
Ο ρόλος σας: βοηθός EDA. Δεν κοινοποιώ τα δεδομένα, θέλω τον κωδικό R (ggplot2). Υπάρχουν αριθμητικές (έσοδα, ηλικία, δαπάνες) και κατηγορικές μεταβλητές (περιοχή, εκπαίδευση) στο data.frame 'data'. Εργασία: γράψτε κώδικα που παράγει ένα ιστόγραμμα για κάθε αριθμητικό, ένα γράφημα ράβδων για κάθε κατηγορία και μια γραφική παράσταση διασποράς για την ηλικία εισοδήματος. Στα γραφήματα ράβδων, αφήστε τον άξονα y να ξεκινά από το ΜΗΔΕΝ. Προσθήκη γραμμής σχολίων.
2. Ανασκόπηση συσχέτισης (συσχέτιση + οπτική μαζί):
Γράψτε κώδικα που να υπολογίζει τη συσχέτιση Pearson για το εισόδημα και τις δαπάνες και να σχεδιάζει μια γραφική παράσταση διασποράς + γραμμική τάση. Προσθέστε μια γραμμή σχολίων που μου υπενθυμίζει να εξετάσω το γράφημα πριν ΝΑ ΕΜΠΙΣΤΕΥΩ τον αριθμό συσχέτισης (προειδοποίηση Anscombe). Μην εξομαλύνετε υπερβολικά τη γραμμή τάσης.
3. Έλεγχος ακεραιότητας:
Ελέγξτε τον ακόλουθο κώδικα ggplot για ειλικρινή απεικόνιση:[code]. Ελέγξτε και διορθώστε τα εξής: ο άξονας y ξεκινά από το μηδέν, είναι η κλίμακα συνεπής, είναι ορατό το μέγεθος του δείγματος, υπάρχει υπερβολική εξομάλυνση; Εξηγήστε την αιτιολόγηση για κάθε διόρθωση που κάνατε.
4. Παραγωγή ενός σημειώματος ανακάλυψης (όχι ευρήματος):
Με βάση τα γραφήματα που παράγω, αναφέρετε τις ΠΑΡΑΤΗΡΗΣΕΙΣ ως «σημείωση ανακάλυψης». γράψτε κάθε στοιχείο στη γλώσσα της «υπόθεσης που θα ελεγχθεί», όχι της «τελικής εύρεσης». Παράδειγμα: «Το εισόδημα στην τριτοβάθμια εκπαίδευση ΦΑΙΝΕΤΑΙ πιο διαδεδομένο. θα πρέπει να ελεγχθεί με ξεχωριστά δεδομένα». Αποφύγετε αιτιώδεις και οριστικές δηλώσεις.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμη προτροπή:
Κάντε ωραία γραφήματα από την απόδοση και πείτε μου τι σημαίνουν.
Αυτή η προτροπή προκαλεί παραπλανητικά αποτελέσματα: το "όμορφο" εστιάζει στην αισθητική, ενώ το "τι σημαίνει" ωθεί την τεχνητή νοημοσύνη να μεταπηδήσει από την ανακάλυψη στο οριστικό συμπέρασμα. Ακολουθούν αιτιολογικά, υπερβολικά σχόλια.
Ισχυρή προτροπή:
Ο ρόλος σας: ειλικρινής βοηθός EDA. Εργασία: (1) επιλέξτε τον τύπο γραφήματος που ταιριάζει στην ερώτησή μου και γράψτε την αιτιολόγηση, (2) ξεκινήστε τον άξονα από το μηδέν στα γραφήματα ράβδων, (3) ερμηνεύστε την έξοδο σε γλώσσα ΣΗΜΕΙΩΣΗΣ DISCOVERY: κανένας οριστικός/αιτιωτικός ισχυρισμός δεν προτείνει υπόθεση στη γλώσσα "πρέπει να δοκιμαστεί", (4) προειδοποιώ ότι το διάγραμμα είναι μικρό (θα με προειδοποιήσει το δείγμα μου, εάν το δείγμα θα εκτελεστεί<0). αυτό.
Διαφορά: η ισχυρή θέληση δικαιολογεί τον τύπο του γραφήματος, επιβάλλει κανόνες ειλικρίνειας και δεν συγχέει την ανακάλυψη με την επιβεβαίωση.
τρεις μίνι θήκες
Περίπτωση 1 — Υπερβολή διακριτού άξονα. Ένας αναλυτής έδειξε τις βαθμολογίες ικανοποίησης δύο κλάδων (7,8 και 8,0, από 10) σε ένα γράφημα ράβδων. Κατά την εκκίνηση του άξονα YZ από το 7,5, ο δεύτερος κλάδος εμφανίστηκε σχεδόν διπλάσιος από τον πρώτο. ενώ η διαφορά ήταν μόνο 2,5%. Η διοίκηση επρόκειτο να επιβραβεύσει ένα υποκατάστημα με λανθασμένη εντύπωση. Όταν ξεκίνησα τον άξονα από το μηδέν η διαφορά ήταν σχεδόν αόρατη. Μάθημα: η επιλογή άξονα από μόνη της αλλάζει την αντίληψη.
Περίπτωση 2 — Εμπιστοσύνη στη συσχέτιση και παράλειψη του γραφήματος. Ένας ερευνητής είδε r = 0,81 μεταξύ δύο μεταβλητών και έγραψε "ισχυρή γραμμική σχέση". Όταν ο σύμβουλός του ζήτησε την γραφική παράσταση διασποράς, φάνηκε ότι η σχέση οφειλόταν στην πραγματικότητα σε μία μόνο ακραία παρατήρηση, και όταν αυτό το σημείο αφαιρέθηκε, η συσχέτιση έπεσε στο 0,12. Μάθημα: ο αριθμός συσχέτισης δεν υποκαθιστά ένα γράφημα. κοίτα πάντα τη διασπορά.
Περίπτωση 3 — Συγχέοντας την ανακάλυψη με την επιβεβαίωση. Ένας μαθητής εξέτασε όλες τις συσχετίσεις ανά ζεύγη σε ένα σύνολο δεδομένων 40 μεταβλητών, επέλεξε την υψηλότερη (r=0,52) και έγραψε, "βρήκαμε μια σημαντική σχέση μεταξύ εκπαίδευσης και αποταμίευσης (p=0,004)." Ωστόσο, υπήρχαν εκατοντάδες ζεύγη σε 40 μεταβλητές. Η επιλογή του υψηλότερου ήταν ψευδές εύρημα λόγω τύχης. Μάθημα: το μοτίβο που ανακαλύφθηκε δεν μπορεί να «ελεγχθεί και να χαρακτηριστεί σημαντικό» στα ίδια δεδομένα. Απαιτείται ξεχωριστή επιβεβαίωση.
Συνήθη λάθη
- Δεν ξεκινά ο άξονας από το μηδέν στο ραβδόγραμμα. Υπερβάλλει τη μικρή διαφορά. Το πιο συνηθισμένο οπτικό ψέμα. Ελέγχετε πάντα.
- Κοιτάζοντας τη συσχέτιση και παρακάμπτοντας το γράφημα. Ο ίδιος συσχετισμός προέρχεται από πολύ διαφορετικά μοτίβα. μπορεί να ταιριάζει σε μια ακραία σχέση. Πρώτον, διασπορά.
- Θεωρώντας το μοτίβο που βρέθηκε στην ανακάλυψη ως «απόδειξη» στα ίδια δεδομένα. Αυτή είναι η πύλη για το p-hacking. Η επιβεβαίωση γίνεται χωριστά.
- Λάθος τύπος γραφήματος. Ταίρια όπως η μπάρα για τάση και η πίτα για διανομή είναι παραπλανητικά. Επιλέξτε ένα είδος με βάση την ερώτηση.
- Απόκρυψη του μεγέθους του δείγματος. Τα n=8 και n=8.000 δεν πρέπει να φαίνονται ίδια στο ίδιο γράφημα. πρέπει να φανεί αβεβαιότητα.
Συμβουλή: Πριν δημοσιεύσετε ένα γράφημα, αναρωτηθείτε: "Θα άλλαζε η ιστορία αν άλλαζα τον άξονα;" Εάν η απάντηση είναι ναι, πιθανότατα ξεκινήσατε το pivot από ένα ανέντιμο μέρος.
Συνοπτικά
Η διερευνητική ανάλυση δεδομένων είναι η φάση της συνάντησης των δεδομένων, της προβολής προτύπων και της δημιουργίας υποθέσεων. Δεν είναι επιβεβαίωση. Το AI δημιουργεί γρήγορα περιγραφικά στατιστικά στοιχεία και κώδικα γραφήματος, αλλά εσείς επιλέγετε τον τύπο γραφήματος με βάση την ερώτησή σας και ελέγχετε τις αρχές της δικαιοσύνης (μηδενικός άξονας, συνεπής κλίμακα, φαινομενική αβεβαιότητα). Κοιτάξτε τη διασπορά πριν εμπιστευτείτε τον αριθμό συσχέτισης. Μην δηλώσετε το μοτίβο που βρήκατε στην ανακάλυψη ως «αποδεικτικό στοιχείο» στα ίδια δεδομένα. Ένα όμορφο γράφημα της τεχνητής νοημοσύνης δεν σημαίνει σωστό γράφημα.
Εργασία εφαρμογής
Επιλέξτε τουλάχιστον τρεις μεταβλητές σε ένα σύνολο δεδομένων. Ζητήστε από το AI και εκτελέστε τον κώδικα που παράγει διερευνητικά γραφήματα (ιστόγραμμα, scatter, boxed) με μια προτροπή που επιβάλλει κανόνες ειλικρίνειας. Για κάθε γράφημα: ελέγξτε (1) την καταλληλότητα του τύπου γραφήματος στην ερώτηση, (2) την ειλικρίνεια του άξονα, (3) την ορατότητα του μεγέθους του δείγματος. Γράψτε τουλάχιστον ένα «σημείωμα ανακάλυψης» στη γλώσσα της υπόθεσης («…εμφανίζεται να ελέγχεται χωριστά»). Εξετάστε μια συσχέτιση τόσο με την καταμέτρηση όσο και με τη διασπορά και αναφέρετε εάν υπάρχει ασυμφωνία μεταξύ τους.
λίστα ελέγχου
- [ ] Επέλεξα τον τύπο γραφήματος με βάση την ερώτησή μου και τον τύπο δεδομένων μου.
- [ ] Στα γραφήματα ράβδων, ξεκινάω τον άξονα y από το μηδέν. Έλεγξα την ειλικρίνεια του άξονα.
- [ ] Κοίταξα το scatterplot πριν εμπιστευτώ τη συσχέτιση.
- [ ] Αντικατοπτρίζω το μέγεθος του δείγματος και την αβεβαιότητα στο γράφημα.
- [ ] Έγραψα τα μοτίβα που βρήκα στην εξερεύνηση ως «υπόθεση προς δοκιμή» και όχι ως «αποδεικτικά στοιχεία».
- [ ] Σημείωσα ότι δεν θα χρησιμοποιούσα τα ίδια δεδομένα για επιβεβαίωση και ότι απαιτείται ξεχωριστό βήμα.