Μονάδες
1. Τεχνητή Νοημοσύνη στην Οικονομετρία και τη Στατιστική: Ρόλοι, Όρια, Έλεγχος ταυτότητας και Απόρρητο 2. Καθαρισμός και προετοιμασία δεδομένων: Λείπουν δεδομένα, ακραίες τιμές και κωδικοποίηση 3. Διερευνητική Ανάλυση και Οπτικοποίηση Δεδομένων: Γραφήματα και Ερμηνεία με Τεχνητή Νοημοσύνη 4. Γραμμική Παλινδρόμηση: Δόμηση Μοντέλου, Ερμηνεία Συντελεστών και Υποθέσεις 5. Παλινδρόμηση Διαγνωστικά και Παραβιάσεις: Συγγραμμικότητα, Ετεροσκεδαστικότητα, Αυτοσυσχέτιση 6. Έλεγχος υποθέσεων και τιμή p: Σημασία, ισχύς και πολλαπλές συγκρίσεις 7. p-hacking, HARKing και στατιστική ακεραιότητα: παγίδες στην εποχή της τεχνητής νοημοσύνης 8. Ανάλυση Χρονοσειρών: Σταθερότητα, ARIMA και Πρόβλεψη 9. Ανάλυση αιτιών και πολιτικής: DiD, IV, RDD και Τεχνητή Νοημοσύνη 10. Δημιουργία κώδικα και αναπαραγωγιμότητα: R/Python, Versioning και Reproducibility 11. Συγγραφή Αναφοράς, Επικοινωνία και Δεοντολογία: Παρουσίαση Αποτελεσμάτων και Όρια Επικοινωνίας
Μονάδα 7 / 11

p-hacking, HARKing και στατιστική ακεραιότητα: παγίδες στην εποχή της τεχνητής νοημοσύνης

Κέρδη:

  • Κατανοήστε ότι το p-hacking, το HARKing, η επιλεκτική αναφορά και ο κήπος των μονοπατιών διακλάδωσης παράγουν ψευδή ευρήματα και δείτε πώς η τεχνητή νοημοσύνη μπορεί να επιταχύνει αυτές τις παγίδες
  • Δυνατότητα δημιουργίας άμυνες όπως προεγγραφή, σχέδιο ανάλυσης, πειθαρχία πολλαπλών συγκρίσεων και ανάλυση ευαισθησίας με υποστήριξη τεχνητής νοημοσύνης
  • Η δυνατότητα εσωτερίκευσης του ειλικρινούς σχεδιασμού αιτήματος που θα επιτρέψει στην τεχνητή νοημοσύνη να απορρίψει αιτήματα τύπου «εύρεσης του ουσιαστικού αποτελέσματος» και ότι η τελική ευθύνη ανήκει στον ερευνητή.

Στην προηγούμενη ενότητα είδαμε τι είναι η τιμή p και τι όχι. Σε αυτή την ενότητα θα εξετάσουμε ένα πιο σκοτεινό θέμα, τις συστηματικές παγίδες που απειλούν τη στατιστική ακεραιότητα. Τα περισσότερα από αυτά δεν είναι σκόπιμη εξαπάτηση. Αυτοί είναι ύπουλοι μηχανισμοί στους οποίους πέφτουν ακόμη και καλοπροαίρετοι ερευνητές χωρίς να το καταλαβαίνουν. Και η τεχνητή νοημοσύνη (AI) κάνει αυτές τις παγίδες ευκολότερες και ταχύτερες, καθώς καθιστά δυνατή την εκτέλεση δεκάδων αναλύσεων σε δευτερόλεπτα. Ο στόχος αυτής της ενότητας είναι να καθιερώσει την πειθαρχία που θα μετατρέψει την τεχνητή νοημοσύνη από μια «μηχανή εύρεσης ουσιαστικών αποτελεσμάτων» σε έναν έντιμο βοηθό.

Βασικές παγίδες

p-hacking (p-value hunting): Δοκιμάζει ξανά την ανάλυση με διαφορετικούς τρόπους μέχρι να ληφθεί ένα σημαντικό αποτέλεσμα (p<0,05). Προσθήκη και αφαίρεση μεταβλητών, επιλογή υποδειγμάτων, αλλαγή του ορισμού των ακραίων τιμών, δοκιμή διαφορετικών μετασχηματισμών, χρήση διαφορετικών μεταβλητών αποτελέσματος, διακοπή της συλλογής δεδομένων όταν αποκτήσει νόημα... Κάθε προσπάθεια δίνει μια νέα "ευκαιρία". Εάν προσπαθήσετε αρκετά σκληρά, ένα από αυτά θα αποδειχθεί σημαντικό, ακόμα κι αν στην πραγματικότητα δεν έχει κανένα αποτέλεσμα. Το αποτέλεσμα: ψευδή ευρήματα που δημοσιεύθηκαν αλλά δεν μπορούν να αναπαραχθούν.

HARKing (Hypothesizing After the Results Known): Κάνοντας μια υπόθεση αφού δω τα αποτελέσματα και παρουσιάζοντάς την ως «το είχα προβλέψει έτσι από την αρχή». Εξετάζετε τα δεδομένα και βρίσκετε την πιο εντυπωσιακή σχέση και, στη συνέχεια, γράφετε το χαρτί σαν να ήταν σχεδιασμένο για να ελέγξει αυτήν την υπόθεση. Αυτό παραπλανά τον αναγνώστη κάνοντας την ανακάλυψη να φαίνεται σαν επιβεβαίωση.

Επιλεκτική αναφορά (cherry-picking): Αναφορά μόνο των «καλών» από δεκάδες αναλύσεις και θάβοντας σιωπηλά τα υπόλοιπα. Αυτό είναι γνωστό και ως "πρόβλημα συρταριού αρχείων": τα ανούσια αποτελέσματα παραμένουν στο συρτάρι, καθιστώντας τη βιβλιογραφία συστηματικά προκατειλημμένη.

Garden of forking paths: Ο όρος του Andrew Gelman. Ακόμη και χωρίς ένα σκόπιμο p-hacking, ο ερευνητής κάνει πολλές λογικές επιλογές με βάση τα δεδομένα (ποια μεταβλητή, ποιο όριο, ποια υποομάδα, ποιος μετασχηματισμός). Αυτοί οι ερευνητικοί βαθμοί ελευθερίας είναι τόσο πολλοί που ουσιαστικά επιλέγετε τον ουσιαστικό από μια πληθώρα αναλύσεων—ακόμα και χωρίς κακή πρόθεση. Το αποτέλεσμα είναι και πάλι ένα αυξανόμενο ποσοστό ψευδώς θετικών.

Προσοχή: Οι περισσότερες από αυτές τις παγίδες δεν είναι σκόπιμα κόλπα. Το άθροισμα των φαινομενικά αθώων βημάτων όπως "μόλις δοκίμασα μερικά ακόμη μοντέλα", "ήταν πιο καθαρό όταν αφαίρεσα το outlier", "το αποτέλεσμα είναι πιο ξεκάθαρο σε αυτήν την υποομάδα" μπορεί να δημιουργήσει ένα ψεύτικο εύρημα. Η ειλικρίνεια είναι θέμα μεθόδου, όχι πρόθεσης.

Γιατί η τεχνητή νοημοσύνη διευρύνει αυτές τις παγίδες;

Η δοκιμή 3 μοντέλων με το χέρι απαιτεί χρόνο. Η YZ παράγει 50 παραλλαγές μοντέλων, 10 διαφορετικές μετατροπές, 8 υποομάδες μέσα σε λίγα λεπτά. Αυτή η δύναμη είναι καταστροφική χωρίς ένα ειλικρινές σχέδιο: ένα αίτημα όπως "να βρείτε μια ουσιαστική σχέση σε αυτά τα δεδομένα" ή "να δημιουργήσετε ένα μοντέλο που να υποστηρίζει αυτήν την υπόθεση" μετατρέπει το AI απευθείας σε μηχανή p-hacking. Το AI θέλει επίσης να είναι χρήσιμο. έχει την τάση να βρίσκει ένα «ουσιαστικό» αποτέλεσμα που θα σας ικανοποιήσει. Γι' αυτό το άμεσο σχέδιο σας είναι η πρώτη γραμμή άμυνας της ειλικρίνειας.

Υπεράσπιση: δίκαιη πορεία των επιχειρήσεων

1. Προεγγραφή: Σημαίνει εγγραφή της υπόθεσης, των μεταβλητών, του μοντέλου και των δοκιμών σας γραπτώς (πιθανώς σε μια πλατφόρμα με χρονική σήμανση) πριν από την εκτέλεση της ανάλυσης. Έτσι, η ανακάλυψη διαχωρίζεται από την επιβεβαίωση. οτιδήποτε αλλάζετε μετά επισημαίνεται ως "explorer".

2. Σχέδιο ανάλυσης: Ακόμα κι αν δεν μπορείτε να προκαταγράψετε, γράψτε ένα σχέδιο ανάλυσης προτού βουτήξετε στα δεδομένα: κύρια υπόθεση, μεταβλητή πρωτογενούς αποτελέσματος, κύριο μοντέλο. Καθιερώστε τη διάκριση μεταξύ «κύριας ανάλυσης» και «πρόσθετης/διερευνητικής ανάλυσης» από την αρχή και διατηρήστε την στην έκθεση.

3. Αναφέρετε τα πάντα: Μην κρύβετε τα μοντέλα που έχετε δοκιμάσει. Στην ενότητα "Ανάλυση ευαισθησίας" (έλεγχος ευρωστίας), δείξτε πώς οι διαφορετικές προδιαγραφές αλλάζουν το αποτέλεσμα. Το εύρημα είναι ισχυρό μόνο εάν αντέχει σε πολλές εύλογες επιλογές.

4. Πειθαρχία πολλαπλής σύγκρισης: Αν έχετε κάνει πάρα πολλά τεστ, διορθώστε τα (ενότητα 6). Απαντήστε στην ερώτηση "Πόσες εξετάσεις έχω κάνει;" τίμια.

5. Ανάλυση ευαισθησίας: Επαναλάβετε το κύριο εύρημα με διαφορετικό δείγμα, διαφορετικό σύνολο ελέγχου και διαφορετικό μετασχηματισμό. Εάν το αποτέλεσμα αλλάξει, μην το κρύβετε, αναφέρετέ το.

Διάγραμμα σύγκρισης: ειλικρινής εναντίον παγίδα

Εφαρμογή

σχήμα παγίδας

Τίμιο ισοδύναμο

Επιλογή μοντέλου

Προσπαθώντας μέχρι να βγει νόημα (p-hacking)

Προσχεδιασμένο κύριο μοντέλο

υπόθεση

Εφαρμογή μετά το γεγονός (HARKing)

Προκαταγραφή, πριν από τα δεδομένα

Αναφορά

Μην δείχνεις μόνο τις όμορφες

Όλες οι προδιαγραφές + ευαισθησία

υποομάδα

Επιλέγοντας το πιο εντυπωσιακό

Προκαθορισμένο, διορθώσιμο

συλλογή δεδομένων

Σταματήστε όταν έχει νόημα

προκαθορισμένο δείγμα

Τέσσερα μηνύματα με δυνατότητα αντιγραφής

1. Ειλικρινές πλαίσιο αξίωσης:

Ο ρόλος σας: ειλικρινής βοηθός στατιστικών. Στόχος μου ΔΕΝ είναι να βρω ένα ουσιαστικό αποτέλεσμα, αλλά να βρω το σωστό αποτέλεσμα. ΚΑΝΟΝΕΣ:- ΜΗΝ μου δίνετε προτάσεις τύπου "δοκιμάζω μοντέλα μέχρι να βγει νόημα", - πείτε μου αν προτείνετε πολλές προδιαγραφές, όλες πρέπει να αναφέρονται, - προειδοποιήστε με για τυχόν βήματα που θα μπορούσαν να οδηγήσουν σε p-hacking. Βοηθήστε με να διευκρινίσω πρώτα το κύριο μοντέλο μου, να διαχωρίσετε την ανακάλυψη από την επιβεβαίωση.

2. Σχέδιο σχεδίου ανάλυσης:

Βοηθήστε με να συντάξω ένα προκαταρκτικό σχέδιο ανάλυσης για μια μελέτη: πρωταρχική υπόθεση, μεταβλητή πρωτεύοντος αποτελέσματος, κύρια προδιαγραφή μοντέλου, προκαθορισμένες υποομάδες, στρατηγική πολλαπλής σύγκρισης. Βάλτε «διερευνητικές» και «επιβεβαιωτικές» αναλύσεις σε ξεχωριστές επικεφαλίδες. Υπενθύμισέ μου να το συμπληρώσω ΧΩΡΙΣ ΝΑ ΚΟΙΤΑΩ τα δεδομένα.

3. Ανάλυση ευαισθησίας:

Το βασικό μου εύρημα είναι να γράψω τον κωδικό ανάλυσης ευαισθησίας (R) για τον στόχο μου είναι να ΔΩ πόσο σταθερό είναι το αποτέλεσμα, ΟΧΙ να επιλέξω το καλύτερο. εμφάνιση όλων των αποτελεσμάτων.

4. Αυτο-παρακολούθηση:

Θα εξηγήσω τη διαδικασία ανάλυσής μου. Δώστε μου μια λίστα ελέγχου για p-hacking / HARKing / επιλεκτική αναφορά και σημειώστε ποια από τα βήματά μου είναι επικίνδυνα. Ρωτήστε με πίσω πόσα μοντέλα/δοκιμές έχω δοκιμάσει και ποια σκοπεύω να αναφέρω.

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμη προτροπή:

Ποιες μεταβλητές δείχνουν σημαντικές σχέσεις σε αυτά τα δεδομένα, βρείτε το καλύτερο μοντέλο.

Αυτή η προτροπή είναι μια άμεση οδηγία p-hacking: η τεχνητή νοημοσύνη δοκιμάζει δεκάδες συνδυασμούς και παρουσιάζει αυτόν που "βγάζει περισσότερο νόημα". Το αποτέλεσμα είναι σχεδόν σίγουρα ένα ψευδές εύρημα που δεν μπορεί να αναπαραχθεί.

Ισχυρή προτροπή:

Ο ρόλος σας: έντιμος βοηθός. Το ΚΥΡΙΟ μοντέλο που έχω προκαθορίσει είναι: Y ~ X + χειριστήρια. Γράψτε κώδικα που προβλέπει αυτό το μοντέλο. ΜΗΝ ψάχνετε για άλλο μοντέλο «πιο ουσιαστικό». Προτείνετε επίσης μια ανάλυση ευαισθησίας για να μπορώ να δω τη στιβαρότητα του αποτελέσματος, αλλά να ξέρετε ότι θα αναφέρω ΟΛΑ τα αποτελέσματα, όχι να διαλέξω το καλύτερο. Μην επιτρέψετε να διαγράψω οποιαδήποτε διερευνητικά ευρήματα ως «επιβεβαιωμένα».

Διαφορά: η ισχυρή βούληση διορθώνει το κύριο μοντέλο, απαγορεύει την αναζήτηση και απαιτεί την αναφορά όλων των αποτελεσμάτων.

τρεις μίνι θήκες

Περίπτωση 1 — Κυνήγι υποομάδας. Ένας ερευνητής δεν βρήκε καμία επίδραση στο συνολικό δείγμα. Ρώτησε την AI "σε ποια υποομάδα είναι σημαντική;" Ο YZ σάρωσε τους συνδυασμούς ηλικίας, φύλου και περιοχής και βρήκε "p = 0,03 σε αστικές γυναίκες ηλικίας 35-44 ετών". Το άρθρο βασίστηκε σε αυτήν την υποομάδα. Η αναπαραγωγή του δεν βρήκε κανένα αποτέλεσμα: αυτό ήταν αποτέλεσμα της τύχης από δεκάδες υποομάδες. Μάθημα: επιλεγμένη υποομάδα αφού τα δεδομένα είναι HARKing, δεν επιβεβαιώνονται.

Περίπτωση 2 — Κυνήγι μετατροπής. Η σχέση που αποδεικνύεται ανούσια σε μορφή μαθητικού επιπέδου. το δοκίμασα σε μορφές κορμού, τετραγωνικής ρίζας, τετραγώνου και υστέρησης. Βρήκε p=0,048 σε μορφή log-log και ανέφερε μόνο αυτό. Ευτυχώς, μία από τις 5 φόρμες που δοκιμάστηκαν πέρασε το κατώφλι. Ο σωστός τρόπος ήταν: να προεπιλέξουμε τη φόρμα με τη θεωρία και να δείξουμε το αποτέλεσμα όλων των μορφών στον πίνακα ευαισθησίας. Μάθημα: η επιλεκτική αναφορά παράγει ψευδή σημασία.

Περίπτωση 3 — Πώς λειτουργεί το ειλικρινές καδράρισμα. Μία ομάδα προεγγράφηκε πριν από την ανάλυση: μοναδική κύρια υπόθεση, μεμονωμένο κύριο μοντέλο, δύο προκαθορισμένες υποομάδες, διόρθωση Bonferroni. Το κύριο αποτέλεσμα δεν ήταν σημαντικό, αλλά η ομάδα το ανέφερε ειλικρινά. Το διερευνητικό άτομο επισήμανε ένα εύρημα ως "χρειάζεται να δοκιμαστεί στο μέλλον". Η μελέτη ήταν αναπαραγώγιμη και αξιόπιστη. Μάθημα: ο ειλικρινής σχεδιασμός κάνει ακόμη και το αποτέλεσμα «αποτυχίας» να αξίζει τον κόπο.

Συνήθη λάθη

  • Λέμε στην τεχνητή νοημοσύνη να "βρίσκει ουσιαστικά αποτελέσματα". Αυτό είναι απευθείας p-hacking? Βάλτε την AI σε ένα ειλικρινές πλαίσιο, ζητώντας ακρίβεια, όχι αποτελέσματα.
  • Παρουσίαση της ανακάλυψης ως επιβεβαίωση (HARKing). Είναι παραπλανητικό να γράφουμε την υπόθεση που δημιουργήθηκε μετά τα δεδομένα ως "το είχα προβλέψει από την αρχή". Επισημάνετε το διερευνητικό εύρημα.
  • Απλώς αναφέρω καλά αποτελέσματα. Εμφάνιση όλων των προδιαγραφών που έχουν δοκιμαστεί. Η απόκρυψη της ανάλυσης συναισθημάτων θέτει σε κίνδυνο την ακεραιότητα.
  • Έλεγχος υποομάδας/μετατροπής. Η επιλογή της πιο σημαντικής από τις δεκάδες υποομάδες ή μετασχηματισμούς παράγει ψευδή ευρήματα. προσδιορίσει και διορθώσει εκ των προτέρων.
  • Ξεχνώντας πόσες δοκιμές έχετε κάνει. Παρακολουθήστε τον συνολικό αριθμό προσπαθειών. Καμία τιμή p δεν μπορεί να ερμηνευτεί με ειλικρίνεια χωρίς να γνωρίζουμε αυτόν τον αριθμό.
Συμβουλή: Πριν γράψετε ένα εύρημα, αναρωτηθείτε: "Πόσους τρόπους έχω δοκιμάσει σιωπηλά μέχρι να βρω αυτό το αποτέλεσμα και τους αναφέρω όλους;" Εάν μερικά από τα δοκίμια παραμένουν στο συρτάρι, η αναφορά σας φαίνεται πιο δυνατή από ό,τι είναι.

Συνοπτικά

p-hacking, HARKing, επιλεκτική αναφορά και ο κήπος των μονοπατιών διακλάδωσης. Πολλές είναι παγίδες που λειτουργούν ακούσια αλλά παράγουν ψευδή, μη αναπαραγώγιμα ευρήματα. Η τεχνητή νοημοσύνη επιταχύνει αυτές τις παγίδες επειδή μπορεί να δοκιμάσει δεκάδες αναλύσεις αμέσως. Τα αιτήματα τύπου «εύρεση ουσιαστικών αποτελεσμάτων» μετατρέπουν το AI σε μηχανή p-hacking. Αμυνα; Διαχωρισμός της ανακάλυψης από την επιβεβαίωση με ένα σχέδιο προκαταχώρισης και ανάλυσης, αναφορά όλων των προδιαγραφών και ανάλυση ευαισθησίας, διόρθωση πολλαπλών συγκρίσεων και τοποθέτηση της τεχνητής νοημοσύνης σε ένα ειλικρινές πλαίσιο που απαιτεί το "σωστό αποτέλεσμα". Η τελική ευθύνη ανήκει πάντα στον ερευνητή.

Εργασία εφαρμογής

Επιλέξτε μια ερώτηση έρευνας και γράψτε ένα σύντομο σχέδιο ανάλυσης πριν εξετάσετε τα δεδομένα: πρωταρχική υπόθεση, κύριο μοντέλο, μεταβλητή πρωτογενούς αποτελέσματος, προκαθορισμένες υποομάδες, στρατηγική πολλαπλής σύγκρισης. Στη συνέχεια, υπολογίστε το κύριο μοντέλο. Στη συνέχεια, κάντε μια ανάλυση ευαισθησίας (διαφορετικοί έλεγχοι, ακραίες τιμές περιλαμβάνονται/εξαιρούνται, διαφορετική μορφή συνάρτησης) και εμφανίστε όλα τα αποτελέσματα σε έναν μόνο πίνακα. Σε μια παράγραφο, αξιολογήστε ποια βήματα ενέχουν κίνδυνο p-hacking και πώς τα περιορίζει το ειλικρινές σας πλαίσιο.

λίστα ελέγχου

  • [ ] Έγραψα το σχέδιο ανάλυσης/κύριο μοντέλο πριν βουτήξω στα δεδομένα.
  • [ ] Επισήμανα τις διερευνητικές και τις επιβεβαιωτικές αναλύσεις χωριστά. Δεν έκανα HARKing.
  • [ ] Έχω αναφέρει όλες τις προδιαγραφές που έχω δοκιμάσει. Δεν διάλεξα μόνο την όμορφη.
  • [ ] Όρισα τις υποομάδες και τους μετασχηματισμούς εκ των προτέρων, δεν τις σάρωση μετά τα δεδομένα.
  • [ ] Παρακολούθησα πόσες δοκιμές είχα κάνει και εφάρμοσα την απαραίτητη διόρθωση.
  • [ ] Χρησιμοποίησα την τεχνητή νοημοσύνη στο πλαίσιο του «βρίσκω την αλήθεια» αντί για το «βρίσκω νόημα». Ανέλαβα την ευθύνη.