Μονάδες
1. Τεχνητή Νοημοσύνη στην Οικονομετρία και τη Στατιστική: Ρόλοι, Όρια, Έλεγχος ταυτότητας και Απόρρητο 2. Καθαρισμός και προετοιμασία δεδομένων: Λείπουν δεδομένα, ακραίες τιμές και κωδικοποίηση 3. Διερευνητική Ανάλυση και Οπτικοποίηση Δεδομένων: Γραφήματα και Ερμηνεία με Τεχνητή Νοημοσύνη 4. Γραμμική Παλινδρόμηση: Δόμηση Μοντέλου, Ερμηνεία Συντελεστών και Υποθέσεις 5. Παλινδρόμηση Διαγνωστικά και Παραβιάσεις: Συγγραμμικότητα, Ετεροσκεδαστικότητα, Αυτοσυσχέτιση 6. Έλεγχος υποθέσεων και τιμή p: Σημασία, ισχύς και πολλαπλές συγκρίσεις 7. p-hacking, HARKing και στατιστική ακεραιότητα: παγίδες στην εποχή της τεχνητής νοημοσύνης 8. Ανάλυση Χρονοσειρών: Σταθερότητα, ARIMA και Πρόβλεψη 9. Ανάλυση αιτιών και πολιτικής: DiD, IV, RDD και Τεχνητή Νοημοσύνη 10. Δημιουργία κώδικα και αναπαραγωγιμότητα: R/Python, Versioning και Reproducibility 11. Συγγραφή Αναφοράς, Επικοινωνία και Δεοντολογία: Παρουσίαση Αποτελεσμάτων και Όρια Επικοινωνίας
Μονάδα 2 / 11

Καθαρισμός και προετοιμασία δεδομένων: Λείπουν δεδομένα, ακραίες τιμές και κωδικοποίηση

Κέρδη:

  • Δυνατότητα αναγνώρισης τύπων δεδομένων που λείπουν (MCAR/MAR/MNAR), ακραίων τιμών και σφαλμάτων κωδικοποίησης και χρήσης τεχνητής νοημοσύνης με τα σωστά δεδομένα για την παραγωγή κώδικα εκκαθάρισης και διαγνωστικών
  • Δυνατότητα να δείτε πώς κάθε βήμα καθαρισμού (διαγραφή, ανάθεση, μετασχηματισμός) που προτείνεται από την τεχνητή νοημοσύνη θα επηρεάσει το αποτέλεσμα της ανάλυσης και θα δημιουργήσει μια αναστρέψιμη και τεκμηριωμένη ροή εργασίας
  • Διατήρηση ότι οι αποφάσεις καθαρισμού βασίζονται στη γνώση της διαδικασίας που δημιουργεί δεδομένα και ότι η τεχνητή νοημοσύνη είναι ένας εποπτευόμενος βοηθός, όχι ένα τυφλό αυτόματο

Κάθε έμπειρος αναλυτής γνωρίζει μια αλήθεια: τις περισσότερες φορές ενός εμπειρικού έργου δεν είναι η μοντελοποίηση, αλλά ο καθαρισμός δεδομένων (το έργο της διόρθωσης σφαλμάτων, παραλείψεων και ασυνεπειών στα δεδομένα και ετοιμασίας για ανάλυση). Ως γενικός κανόνας, περίπου το 70-80% του χρόνου πηγαίνει στην κατανόηση, τον καθαρισμό και τη μετατροπή δεδομένων. απομένει μόνο 20-30% για την πραγματική ανάλυση. Σε αυτή την ενότητα, θα δούμε βήμα προς βήμα πώς η τεχνητή νοημοσύνη (AI) μειώνει αυτό το βαρύ φορτίο, αλλά ποιες αποφάσεις θα πρέπει να παραμείνουν μαζί σας και γιατί.

Ας βάλουμε πρώτα δύο βασικά δεδομένα. Πρώτον, οι αποφάσεις καθαρισμού βασίζονται στη γνώση σας για τη διαδικασία που παράγει τα δεδομένα: μόνο εσείς γνωρίζετε γιατί λείπει μια τιμή, γιατί ένας αριθμός είναι υπερβολικά μεγάλος. Το AI δεν βλέπει τα δεδομένα, δεν γνωρίζει το πλαίσιο. Γράφει κώδικα, δεν παίρνει αποφάσεις. Δεύτερον, κάθε βήμα καθαρισμού μπορεί να αλλάξει το αποτέλεσμα της ανάλυσης. Η διαγραφή ενός ακραίου σημείου μπορεί να αντιστρέψει τον συντελεστή. Η συμπλήρωση του ελλείποντος με τον μέσο όρο μπορεί να μειώσει τεχνητά τη διακύμανση. Επομένως, η εκκαθάριση πρέπει να είναι αναστρέψιμη και τεκμηριωμένη: μην αγγίζετε ποτέ τα ανεπεξέργαστα δεδομένα, κάντε κάθε βήμα στον κώδικα, καταγράψτε τον αντίκτυπο κάθε βήματος.

Ροή εργασιών καθαρισμού βήμα προς βήμα

1. Γνωρίστε τα δεδομένα. Πρώτα δείτε τη δομή: αριθμός γραμμών (παρατηρήσεις) και στηλών (μεταβλητές), τύπος κάθε μεταβλητής (αριθμητική, κατηγορία, ημερομηνία), συνοπτικά στατιστικά στοιχεία, αριθμός ελλειπόντων. Μπορείτε να ζητήσετε από το AI αυτόν τον κωδικό "προφίλ δεδομένων". Αλλά διαβάζετε την έξοδο και κάνετε ερωτήσεις όπως "γιατί αυτή η μεταβλητή ήρθε ως κείμενο;"

2. Κατανόηση και ταξινόμηση δεδομένων που λείπουν. Τα δεδομένα που λείπουν χωρίζονται σε τρεις τύπους. MCAR (Λείπει εντελώς τυχαία): η έλλειψη δεν οφείλεται σε τίποτα, για παράδειγμα ένας αισθητήρας απέτυχε τυχαία. MAR (Λείπει τυχαία): η έλλειψη εξαρτάται από άλλες παρατηρούμενες μεταβλητές, για παράδειγμα οι ηλικιωμένοι αφήνουν μια ερώτηση κενή πιο συχνά, αλλά γνωρίζετε την ηλικία. MNAR (Missing Not At Random): η έλλειψη εξαρτάται από την ίδια την αξία που δεν παρατηρείται, για παράδειγμα οι υψηλά εισοδήματα δεν αναφέρουν το εισόδημά τους. Αυτή η διάκριση είναι κρίσιμη γιατί καθορίζει τη μέθοδο λύσης και το AI δεν μπορεί να το αποφασίσει αυτό για εσάς.

3. Αντιμετωπίστε την έλλειψη. Επιλογές: διαγραφή κατά λίστα, καταλογισμός μέσου/μέσου, πολλαπλός καταλογισμός βάσει μοντέλου. Η διαγραφή στο MCAR είναι σχετικά ασφαλής, αλλά μειώνει το μέγεθος του δείγματος. Η πολλαπλή ανάθεση είναι πιο κατάλληλη στο MAR. Καμία απλή μέθοδος δεν εγγυάται την αμερόληπτη λειτουργία στο MNAR. Ο μηχανισμός ανεπάρκειας θα πρέπει να μοντελοποιηθεί ή τουλάχιστον να γίνει ανάλυση ευαισθησίας. Η πλήρωση του μέσου όρου είναι εύκολη αλλά επικίνδυνη: μειώνει τη διακύμανση, αποδυναμώνει τις σχέσεις και κρύβει την αβεβαιότητα.

4. Εξετάστε ακραίες τιμές. Μια ακραία είναι μια παρατήρηση που βρίσκεται πολύ μακριά από τις άλλες. Διαχωρίστε τις δύο ερωτήσεις: Είναι αυτό ένα σφάλμα (η ηλικία 999 γράφτηκε στην καταχώριση δεδομένων) ή είναι μια πραγματική αλλά ακραία τιμή (εισόδημα δισεκατομμυριούχου); Διορθώστε σφάλματα. Μην διαγράφετε τα αληθινά ακραία στοιχεία γιατί αντιπροσωπεύουν δεδομένα. Διαγράφοντας το ακραίο στοιχείο "επειδή ενοχλεί" στρέφετε τα δεδομένα προς το αποτέλεσμα.

5. Κωδικοποίηση και συνέπεια. Τυποποιήστε τις κατηγορίες ("Male", "Male", "E" όλες σε έναν κωδικό), φέρτε τις ημερομηνίες σε μία μορφή, τις μονάδες σε μία κλίμακα, τον εντοπισμό διπλών σειρών. Αυτή είναι η λιγότερο επικίνδυνη φάση όπου η τεχνητή νοημοσύνη βοηθάει καλύτερα.

6. Τεκμηριώστε και παγώστε. Καταγράψτε κάθε βήμα με κώδικα και μια γραμμή σχολίων, διατηρώντας ξεχωριστά τα ακατέργαστα και τα καθαρισμένα δεδομένα. Έτσι, όταν ένας διαιτητής ρωτά "γιατί αυτές οι παρατηρήσεις απορρίφθηκαν;" έχεις έτοιμη την απάντησή σου.

Προσοχή: Μην λαμβάνετε αποφάσεις καθαρισμού βάσει αποτελεσμάτων. Η διαγραφή μιας γραμμής που λέει "Όταν διαγράφετε αυτήν τη γραμμή, ο συντελεστής γίνεται σημαντικός" είναι η πιο ύπουλη μορφή p-hacking, την οποία θα δούμε στην επόμενη ενότητα.

Πίνακας σύγκρισης: μέθοδοι δεδομένων που λείπουν

Μέθοδος

Πότε είναι κατάλληλο;

κίνδυνος

Ο ρόλος της AI

Διαγραφή μιας σειράς

MCAR, χαμηλό ποσοστό ελλείψεων

Το δείγμα γίνεται μικρότερο, προκατάληψη σε MAR/MNAR

Γράφει τον κωδικό. εσύ αποφασίζεις

Μέση/μέση ανάθεση

Γρήγορη προκαταρκτική ανάλυση

Μειώνει τη διακύμανση, κρύβει τη σχέση

Είναι εύκολο αλλά δεν το συνιστώ. θα πρέπει να προειδοποιήσει

Πολλαπλή ανάθεση (MI)

MAR, σημαντικές μεταβλητές

Εάν δεν εγκατασταθεί σωστά, θα είναι παραπλανητικό

Προτείνει κωδικό και πακέτο (ποντίκια)

Μοντελοποίηση μηχανισμού

MNAR

Πολύπλοκο, εντάσεως υποθέσεων

Μόνο σχέδιο. απαιτείται ειδικός

Τέσσερα μηνύματα με δυνατότητα αντιγραφής

1. Δημιουργία προφίλ δεδομένων:

Ο ρόλος σας: βοηθός καθαρισμού δεδομένων. Δεν κοινοποιώ τα δεδομένα, θέλω τον κωδικό R. Έχω ένα data.frame που ονομάζεται 'ψηφίο'. μεταβλητές: ταυτότητα, ηλικία (αριθμητικό), εισόδημα (αριθμητικό), εκπαίδευση (κατηγορική), περιοχή (κατηγορική), ημερομηνία (ημερομηνία). Εργασία: γράψτε κώδικα που παράγει τον τύπο, τον αριθμό που λείπει και τον ρυθμό για κάθε μεταβλητή, συνοπτικά στατιστικά στοιχεία για τις αριθμητικές και τον πίνακα συχνοτήτων για τις κατηγορίες. Προσθήκη γραμμής σχολίων.

2. Διάγνωση ελλιπών δεδομένων:

Γράψτε κώδικα που να εξετάζει το μοτίβο που λείπει για τα «ψηφία» παραπάνω δεδομένα: - το ποσοστό που λείπει από κάθε μεταβλητή, - έναν απλό πίνακα/γραφικό που δείχνει τη σχέση της έλλειψης με άλλες μεταβλητές. Θα κοιτάξω την έξοδο του κώδικα και θα κάνω τη διάκριση MCAR/MAR/MNAR. Απλώς παράγετε το διαγνωστικό εργαλείο, ΜΗΝ αποφασίζετε για τη μέθοδο ανάθεσης.

3. Επιθεώρηση ακραίων στοιχείων (όχι διαγραφή):

Γράψτε κώδικα για τη μεταβλητή «εισόδημα» που εξετάζει ακραίες τιμές ΧΩΡΙΣ ΔΙΑΓΡΑΦΗ: τετράγωνο, όρια βάσει IQR και κατάλογος πινάκων ακραίων παρατηρήσεων + τιμές. Θα δω αν είναι λάθη ή αληθινά. Προσθήκη αυτόματης διαγραφής.

4. Τυποποίηση κωδικοποίησης:

Στη μεταβλητή 'εκπαίδευση', οι τιμές γράφονται μεικτές: "Primary school", "primary school", "PRIMARY", "Gule school", "gly school", "University", "univ". Γράψτε τον κώδικα R που τα επανακωδικοποιεί σε συνεπείς κατηγορίες. Δείξτε καθαρά τον πίνακα αντιστοίχισης, ώστε να μπορώ να επιβεβαιώσω κάθε μετατροπή. Ορίστε την τιμή που δεν αναγνωρίζετε σε "ΑΓΝΩΣΤΟ".

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμη προτροπή:

Καθαρίστε τα δεδομένα, συμπληρώστε τα κενά, απορρίψτε τα ακραία στοιχεία.

Αυτή η απαίτηση είναι επικίνδυνη: δίνει τυφλή εξουσία στην τεχνητή νοημοσύνη. Τι είδους λείπει, τι είδους πλήρωση, τι αντιφατική αλήθεια - τίποτα από αυτά δεν είναι ξεκάθαρο. Το αποτέλεσμα μπορεί να είναι ένα κρυφά προκατειλημμένο σύνολο δεδομένων.

Ισχυρή προτροπή:

Ο ρόλος σας: βοηθός καθαρισμού, δεν είστε εσείς ο υπεύθυνος λήψης αποφάσεων. Πηγαίνετε βήμα-βήμα και γράψτε κώδικα που αναφέρει τον αντίκτυπο ΚΑΘΕ βήματος: 1) εμφανίστε το μοτίβο που λείπει (ΜΗ διαγραφή/συμπλήρωση), 2) λίστα υποψηφίων ακραίων τιμών (ΜΗ διαγραφή), 3) διορθώστε τις ασυνέπειες της κατηγορίας με τον πίνακα αντιστοίχισης. Εκτυπώστε το πλήθος σειρών και το στατιστικό περίληψης μετά από κάθε βήμα, ώστε να μπορώ να δω και να επιβεβαιώσω την αλλαγή. Αυτόματη εισαγωγή/διαγραφή.

Η διαφορά είναι ξεκάθαρη: η ισχυρή θέληση τοποθετεί το AI ως εποπτευόμενο βοηθό, παράγοντας αναστρέψιμα και τεκμηριωμένα βήματα.

τρεις μίνι θήκες

Περίπτωση 1 — Μέση παγίδα ανάθεσης. Τα στοιχεία εισοδήματος ενός αναλυτή για 5.000 άτομα έλειπαν κατά 18%. Είπε στην τεχνητή νοημοσύνη να «γεμίσει τα κενά». Το AI μέτρησε κατά μέσο όρο όλα. Αποτέλεσμα: η διακύμανση του εισοδήματος μειώθηκε κατά 22% και ο συντελεστής της σχέσης εκπαίδευσης-εισοδήματος αποδείχθηκε ασθενέστερος από ό,τι ήταν. Σωστός τρόπος: η έλλειψη ήταν MAR (λόγω εκπαίδευσης), έπρεπε να καλυφθεί με πολλαπλή ανάθεση (ποντίκια). Μάθημα: η μέθοδος πλήρωσης εξαρτάται από τον μηχανισμό.

Περίπτωση 2 — Ο καθαρισμός εξωγενών αντιστρέφει το εύρημα. Υπήρχαν 3 πολύ μεγάλες επιχειρήσεις (0,6% της συνολικής παρατήρησης) σε δεδομένα μιας εταιρείας. Αυτά διαγράφηκαν από την πρόταση "καθαρισμού" της AI. Ο συντελεστής οικονομιών κλίμακας έγινε από θετικός σε αρνητικός. Ωστόσο, αυτές οι 3 εταιρείες ήταν πραγματικές και σημαντικό μέρος του κλάδου. Ο σωστός τρόπος ήταν η αναφορά με πλήρη και εύρωστη εκτίμηση αντί για διαγραφή. Μάθημα: οι πραγματικές ακραίες τιμές είναι δεδομένα, όχι θόρυβος.

Περίπτωση 3 — Αθόρυβο σφάλμα κωδικοποίησης. Σε ένα πλαίσιο, η μεταβλητή ημερομηνία ήρθε σε δύο διαφορετικές μορφές ("2020-03-01" και "01/03/2020"). Όταν ο κωδικός συνδυασμού που παρήγαγε το AI τους παρέκαμψε για διαφορετικές τιμές, 1.400 παρατηρήσεις δεν ταιριάστηκαν και οι ρυθμοί ανάπτυξης έγιναν γελοίοι. Δεν θα είχε σημασία αν ο αναλυτής δεν έλεγχε τον αριθμό των σειρών. Μάθημα: οι μετρήσεις παρατήρησης και οι έλεγχοι ευεξίας μετά από κάθε βήμα είναι απαραίτητοι.

Συνήθη λάθη

  • Γεμίζοντας τυφλά το κενό με τον μέσο όρο. Μειώνει τη διακύμανση, κρύβει την αβεβαιότητα και δημιουργεί μεροληψία στο MAR/MNAR. Αρχικά ταξινομήστε τον μηχανισμό.
  • Διαγραφή του outlier «γιατί ενοχλεί». Οι πραγματικές ακραίες τιμές αντιπροσωπεύουν τα δεδομένα. η διαγραφή κάμπτει το αποτέλεσμα. Διορθώστε αυτό που είναι λάθος, κρατήστε αυτό που είναι αληθινό.
  • Πατώντας ακατέργαστα δεδομένα. Μην τροποποιείτε ποτέ ανεπεξέργαστα δεδομένα. Κάντε όλη την εκκαθάριση με τον κωδικό σε ξεχωριστό αντίγραφο, ώστε να είναι δυνατή η επαναφορά του.
  • Μη μέτρηση του αντίκτυπου των βημάτων. Εάν το πλήθος σειρών και τα στατιστικά σύνοψης δεν ελέγχονται μετά από κάθε βήμα, θα συσσωρεύονται σιωπηρά σφάλματα.
  • Καθαρισμός ως αποτέλεσμα. Η λογική του "Όταν προσθέτεις αυτή τη γραμμή, το αποτέλεσμα γίνεται καλύτερο" είναι το p-hacking. Ο καθαρισμός πρέπει να προγραμματίζεται πριν και ανεξάρτητα από το αποτέλεσμα της ανάλυσης.
Συμβουλή: Διατηρήστε έναν πίνακα "πριν/μετά" που τοποθετεί τα ίδια βασικά στατιστικά στοιχεία (μέσος όρος, διάμεσος, αριθμός παρατηρήσεων, μερικές συσχετίσεις) δίπλα-δίπλα πριν και μετά τον καθαρισμό. Ένα απροσδόκητο άλμα είναι ο καλύτερος προάγγελος ενός κρυφού λάθους.

Συνοπτικά

Ο καθαρισμός δεδομένων είναι η πιο χρονοβόρα και απαιτητική φάση της εμπειρικής εργασίας. Το AI είναι μια ισχυρή δημιουργία κώδικα σε αυτό, αλλά δεν μπορεί να καλέσει τις λήψεις: ταξινομείτε τον τύπο δεδομένων που λείπει (MCAR/MAR/MNAR), προσδιορίζετε εάν το ακραίο στοιχείο είναι σφάλμα ή πραγματικό, διατηρείτε κάθε βήμα αναστρέψιμο και τεκμηριωμένο. Αντί να δίνετε «καθαρή» εξουσιοδότηση στην τυφλή τεχνητή νοημοσύνη, δημιουργήστε μια βήμα προς βήμα ροή εργασίας της οποίας ο αντίκτυπος μετράται και επικυρώνεται. Ο έλεγχος του αριθμού των παρατηρήσεων και των συνοπτικών στατιστικών μετά από κάθε βήμα είναι το καλύτερο αντίδοτο στα σιωπηλά σφάλματα.

Εργασία εφαρμογής

Επιλέξτε τουλάχιστον δύο μεταβλητές που περιέχουν ελλείψεις και ακραίες τιμές σε ένα σύνολο δεδομένων (τα δικά σας δεδομένα ή ένα σύνολο δείγματος). Ζητήστε έναν διαγνωστικό κωδικό από το AI μέσω της προτροπής "βήμα προς βήμα, μη διαγράψετε/συμπληρώστε" παραπάνω και εκτελέστε τον. Κατατάξτε την έλλειψη ως MCAR/MAR/MNAR και γράψτε την αιτιολόγησή σας σε μία πρόταση. Εξετάστε έναν προς έναν τους αντιφατικούς υποψηφίους και αποφασίστε ποιος είναι λάθος και ποιος αληθινός. Τέλος, δημιουργήστε έναν πίνακα "πριν-μετά" πριν/μετά τον καθαρισμό και αναφέρετε εάν υπάρχουν απροσδόκητες αλλαγές.

λίστα ελέγχου

  • [ ] Καθάρισα τα ανεπεξέργαστα δεδομένα σε ξεχωριστό αντίγραφο χωρίς να τα αλλάξω.
  • [ ] Ταξινόμησα την ανεπάρκεια ως MCAR/MAR/MNAR και επέλεξα τη μέθοδο ανάλογα.
  • [ ] Εξέτασα τα ακραία στοιχεία ένα προς ένα αν ήταν λάθη ή αληθινά. Δεν το διέγραψα στα τυφλά.
  • [ ] Έλεγξα τον αριθμό των παρατηρήσεων και των συνοπτικών στατιστικών μετά από κάθε βήμα καθαρισμού.
  • [ ] Τεκμηρίωσα όλα τα βήματα με κώδικα και μια γραμμή σχολίων. αναστρεπτός.
  • [ ] Βασίστηκα τον καθαρισμό στη γνώση της διαδικασίας που παράγει τα δεδομένα, όχι στο αποτέλεσμα της ανάλυσης.