Κέρδη:
- Δυνατότητα επιλογής και ερμηνείας μετρήσεων ταξινόμησης και παλινδρόμησης (πίνακας σύγχυσης, ακρίβεια/ανάκληση/F1, MAE/RMSE/R²) σύμφωνα με το σκοπό της εργασίας
- Δυνατότητα ανίχνευσης υπερμάθησης συγκρίνοντας τις βαθμολογίες εκπαίδευσης και τεστ και απόκτηση αξιόπιστης απόδοσης με διασταυρούμενη επικύρωση
- Δυνατότητα αξιολόγησης εάν κάθε μοντέλο προσθέτει πραγματική αξία συγκρίνοντάς το με μια γραμμή βάσης
Είναι εύκολο να ρυθμίσετε ένα μοντέλο. Είναι δύσκολο να μετρηθεί με ειλικρίνεια εάν λειτουργεί πραγματικά. Το θέμα αυτής της ενότητας είναι η πιο κρίσιμη δεξιότητα ενός επιστήμονα δεδομένων: η αξιολόγηση του μοντέλου με τις σωστές μετρήσεις, η επίτευξη αξιόπιστης προγνωστικής απόδοσης και η σύλληψη της πιο ύπουλης παγίδας: υπερμάθησης (απομνημόνευση). Το AI υπολογίζει, ερμηνεύει και συγκρίνει μετρήσεις. αλλά εναπόκειται στον άνθρωπο να αποφασίσει ποια μέτρηση είναι κατάλληλη για την επιχείρησή σας και εάν ένα μοντέλο είναι "αρκετά καλό". Μια ομάδα που εξετάζει τη λάθος μέτρηση μπορεί να μπερδέψει ένα κακό μοντέλο για μήνες ως «επιτυχία».
Γιατί δεν αρκεί η ακρίβεια: μήτρα σύγχυσης
Η πρώτη μέτρηση που έρχεται στο μυαλό στην ταξινόμηση είναι η ακρίβεια (ακρίβεια — ο συνολικός λόγος των σωστών προβλέψεων). Αλλά όπως είδαμε στην Ενότητα 6, η ακρίβεια είναι παραπλανητική με μη ισορροπημένα δεδομένα. Μια καλύτερη αρχή είναι ο πίνακας σύγχυσης - ένας πίνακας που χωρίζει τις προβλέψεις σε τέσσερις κάδους:
- Αληθινό θετικό (TP): Ονομάσαμε ψεύτικο αυτό που είναι πραγματικά ψεύτικο. (Καλό)
- Αληθινό αρνητικό (TN): Είπαμε πολύ καθαρό. (Καλό)
- Λάθος θετικό (FP): Εσφαλμένα είπαμε ότι το καθαρό ήταν ψεύτικο. (Εσφαλμένος συναγερμός)
- Λάθος αρνητικό (FN): Μας έλειψε το ψεύτικο και το ονομάσαμε καθαρό. (Χαμένη απειλή)
Δύο βασικές μετρήσεις προέρχονται από αυτά τα τέσσερα πλαίσια. Ακρίβεια: "Πόσα από αυτά που αποκαλώ ψεύτικα είναι στην πραγματικότητα ψεύτικα;" — σημαντικό εάν το κόστος ψευδούς συναγερμού είναι υψηλό. Ευαισθησία (ανάκληση στα αγγλικά): "Πόσα αληθινά ψεύτικα έπιασα;" — σημαντικό όταν η απώλεια μιας απειλής είναι ακριβή. Τα δύο είναι συχνά σε αντίθεση μεταξύ τους: αν χαμηλώσετε το όριο και πείτε περισσότερο "ψεύτικο", η ανάκληση αυξάνεται αλλά η ακρίβεια μειώνεται. Η βαθμολογία F1 είναι ο ισορροπημένος μέσος όρος (αρμονικός μέσος όρος) αυτών των δύο.
Προσοχή: Η απάντηση στην ερώτηση «Ποια μέτρηση είναι σημαντική» είναι επιχειρηματική απόφαση και όχι τεχνική. Η απώλεια μιας περίπτωσης (χαμηλή ανάκληση) στον προσυμπτωματικό έλεγχο καρκίνου είναι καταστροφική. Είναι ενοχλητικό να στέλνετε ένα σημαντικό email στο spam (χαμηλής ακρίβειας) στο φίλτρο ανεπιθύμητης αλληλογραφίας. Το κόστος καθορίζει τη μέτρηση.
Μετρήσεις παλινδρόμησης
Εάν η έξοδος είναι αριθμοί, χρησιμοποιούνται διαφορετικές μετρήσεις. MAE (Mean Absolute Error): πόσο οι εκτιμήσεις αποκλίνουν από τον πραγματικό μέσο όρο, στην ίδια μονάδα (π.χ. "κάνουμε λάθος κατά 4.200 TL κατά μέσο όρο"). RMSE (Root Mean Squared Error): τιμωρεί τα μεγάλα σφάλματα πιο αυστηρά και είναι ευαίσθητο σε ακραίες τιμές. R² (R-τετράγωνο — συντελεστής προσδιορισμού): πόσο μεγάλο μέρος της μεταβλητότητας του στόχου εξηγεί το μοντέλο (κοντά στο 1 είναι καλό, το 0 είναι τόσο κακό όσο η πρόβλεψη του μέσου όρου, το αρνητικό είναι ακόμη χειρότερο).
Η πιο ύπουλη παγίδα: η υπερμάθηση
Η υπερβολική προσαρμογή — όπου το μοντέλο απομνημονεύει δεδομένα εκπαίδευσης αλλά αποτυγχάνει σε νέα δεδομένα — είναι το πιο συνηθισμένο λάθος στην επιστήμη δεδομένων. Το σύμπτωμα είναι ξεκάθαρο: το μοντέλο είναι εξαιρετικό στο σετ προπόνησης (98%), κακό στο σετ δοκιμών (72%). Το μοντέλο έχει απομνημονεύσει τον θόρυβο του συγκεκριμένου δείγματος, όχι το πραγματικό μοτίβο στα δεδομένα. Υπάρχει επίσης το αντίθετο: η υποκατάσταση — το μοντέλο είναι κακό τόσο στην εκπαίδευση όσο και στις δοκιμές, επειδή είναι πολύ απλό να αποτυπωθεί το μοτίβο.
Τρόποι για την καταπολέμηση της υπερμάθησης: απλοποίηση του μοντέλου, περισσότερα δεδομένα, τακτοποίηση — το μαθηματικό φρένο που εμποδίζει το μοντέλο να γίνει πολύ περίπλοκο — και το πιο σημαντικό, διασταυρούμενη επικύρωση.
Διασταυρούμενη επικύρωση: μην εμπιστεύεστε ένα μόνο παράθυρο
Ένα μόνο προπόνηση/δοκιμαστικό pod μπορεί να είναι τυχερό ή άτυχο. Μπορείτε να λάβετε υψηλούς βαθμούς για το σετ δοκιμής μόνο και μόνο επειδή αυτό το δείγμα είναι εύκολο. Η διασταυρούμενη επικύρωση (CV για συντομία) το λύνει αυτό. Η πιο κοινή μορφή είναι το k-fold CV: τα δεδομένα χωρίζονται σε k μέρη (π.χ. 5). Σε κάθε γύρο, ένα μέρος είναι τεστ και το υπόλοιπο είναι προπόνηση. αυτό κυλάει 5 φορές και οι 5 βαθμολογίες υπολογίζονται κατά μέσο όρο. Έτσι, θα δείτε ότι η απόδοση βασίζεται στον μέσο όρο των πολλαπλών διαχωρισμών, όχι σε ένα τυχερό μοίρασμα. Η κατανομή των βαθμολογιών είναι επίσης ενημερωτική: πολύ ασταθείς βαθμολογίες (85% στον έναν όροφο, 62% στον άλλο) δείχνουν ότι το μοντέλο είναι ασταθές.
Το κανονικό k-fold δεν χρησιμοποιείται σε χρονοσειρές (διαρροές στο μέλλον). Αντίθετα, κάνετε "προς τα εμπρός" (διάσπαση χρονοσειρών): πάντα προπονείστε με το παρελθόν και δοκιμάζετε το μέλλον.
μετρική
Τύπος προβλήματος
Πότε έχει σημασία;
Ακρίβεια
Ταξινόμηση
Εάν οι τάξεις είναι ισορροπημένες
Ακρίβεια
Ταξινόμηση
Ο ψευδής συναγερμός είναι ακριβός
Ευαισθησία (ανάκληση)
Ταξινόμηση
Αν είναι ακριβό να το χάσετε
F1
Ταξινόμηση
Εάν απαιτείται ισορροπία
MAE
παλινδρόμηση
Ερμηνεύσιμο λάθος
RMSE
παλινδρόμηση
Αν τα μεγάλα λάθη είναι κρίσιμα
R²
παλινδρόμηση
εξηγητική δύναμη
τρεις μίνι θήκες
Περίπτωση 1 — Η ψευδαίσθηση της υψηλής ακρίβειας. Ένα μοντέλο απάτης έδειξε 99,2% ακρίβεια και η ομάδα πανηγύρισε. Εξετάζοντας τον πίνακα σύγχυσης, το πραγματικό: το ψεύτικο ποσοστό στα δεδομένα ήταν 0,8%. το μοντέλο δεν έπιασε σχεδόν κανένα ψεύτικο, λέγοντας απλώς "όλα καθαρά". Η ανάκληση ήταν 6%. Μάθημα: κοιτάξτε τις μετρήσεις, όχι την ακρίβεια.
Περίπτωση 2 — Λανθάνουσα υπερμάθηση. Μία ομάδα παρέδωσε και αύξησε το XGBoost στο 97% στο σετ εκπαίδευσης. Το σετ δοκιμών ήταν 69%, αλλά κανείς δεν είχε κοιτάξει. Το μοντέλο κατέρρευσε στην παραγωγή. Εάν είχε γίνει cross-validation, η μεγάλη διαφορά μεταξύ των folds (overlearning) θα ήταν ορατή από την αρχή. Μάθημα: εμπιστευτείτε το βιογραφικό σημείωμα και τη βαθμολογία του τεστ, όχι τη βαθμολογία εκπαίδευσης.
Περίπτωση 3 — Τυχερός χωρισμός. Ένας αναλυτής ήταν στην ευχάριστη θέση να λάβει το 88% σε ένα μόνο διαχωρισμό. Όταν ο συνάδελφός του έκανε ένα πενταπλάσιο βιογραφικό, οι βαθμολογίες ήταν 88%, 71%, 83%, 64%, 79% — ο μέσος όρος είναι 77%, αλλά είναι πολύ ασταθές. Το μοντέλο ήταν ασταθές. Το ενιαίο διαμέρισμα ήταν παραπλανητικό. Μάθημα: κοιτάξτε τον μέσο όρο και την κατανομή του βιογραφικού, όχι τον ατομικό κάδο.
Τέσσερα πρότυπα με δυνατότητα αντιγραφής
1) Πλήρης αναφορά ταξινόμησης:
Έχω εκπαιδευμένο μοντέλο και σετ δοκιμών. Δημιουργία: μήτρα σύγχυσης, ακρίβεια, ανάκληση, F1 (για κάθε τάξη) και μετρήσεις υποστήριξης. Συμπεραίνω, αλλά εξαρτάται από εμένα: Θα σας πω ποια μέτρηση είναι σημαντική. Σημειώστε ότι η ακρίβεια μπορεί να είναι παραπλανητική με μη ισορροπημένα δεδομένα.
2) Έλεγχος υπερμάθησης:
Εκτυπώστε τις βαθμολογίες του μοντέλου μου και στα σετ TRAINING και TEST δίπλα δίπλα. Υπολογίστε τη διαφορά μεταξύ τους και προειδοποιήστε καθώς η μεγάλη διαφορά είναι σημάδι υπερμάθησης. Εάν η διαφορά είναι μεγάλη, προτείνετε τακτοποίηση ή απλοποίηση.
3) Διασταυρούμενη επικύρωση:
Εκτελέστε πενταπλάσια διασταυρούμενη επικύρωση (για στρωματοποιημένη, ταξινόμηση). Εκτυπώστε τη βαθμολογία, τη μέση τιμή και την τυπική απόκλιση κάθε πτυχής. Εάν οι βαθμολογίες είναι πολύ ασταθείς (υψηλό std), υποδείξτε ότι το μοντέλο είναι ασταθές. Χρησιμοποιήστε αγωγούς έτσι ώστε οι μετασχηματισμοί να μαθαίνονται μόνο από το κομμάτι εκπαίδευσης σε κάθε στρώμα.
4) Σύγκριση βασικής γραμμής:
Βάλτε τη μέτρηση του μοντέλου μου δίπλα-δίπλα με μια γραμμή βάσης DummyClassifier. Το μοντέλο ξεπερνά σημαντικά τη βασική γραμμή; Εάν δεν περάσει, διευκρινίστε ότι το μοντέλο δεν προσθέτει πραγματική αξία.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμη προτροπή:
Είναι καλό το μοντέλο μου;
Το "καλό" είναι απροσδιόριστο. Δεν είναι σαφές ποια μέτρηση, ποιο όριο, ποια γραμμή βάσης. Το AI μπορεί να δώσει έναν μόνο αριθμό ακρίβειας και να παραπλανήσει.
Ισχυρή προτροπή:
Ο ρόλος σας: βοηθός αξιολόγησης. Ταξινόμηση, μη ισορροπημένα στοιχεία (12% θετικά). Προτεραιότητα: ανάκληση (να μην λείπουν τα θετικά). Εργασία: (1) μήτρα σύγχυσης, (2) ακρίβεια/ανάκληση/F1, (3) πενταπλάσια στρωματοποιημένη μέση τιμή CV και std, (4) Σύγκριση βασικής γραμμής DummyClassifier. Εστιάστε στην ανάκληση και τη διαφορά στη γραμμή βάσης, όχι στην ακρίβεια. Σχολιάστε, αλλά εγώ παίρνω την τελική απόφαση.
Εδώ, η μετρική προτεραιότητα, το βιογραφικό σημείωμα και η βασική συνθήκη είναι σαφείς.
Συνήθη λάθη
- Εμπιστοσύνη στην ακρίβεια σε μη ισορροπημένα δεδομένα. Η ακρίβεια 99% μπορεί να μην καταγράφει καθόλου την κατηγορία μειοψηφίας. Κοιτάξτε τη μήτρα σύγχυσης.
- Απλώς κοιτάζοντας τη βαθμολογία της εκπαίδευσής σας. Η υψηλή εκπαίδευση, η χαμηλή βαθμολογία στις εξετάσεις είναι υπερμάθηση. Να συγκρίνετε πάντα δύο βαθμολογίες.
- Βασίζεται σε ένα ενιαίο διαμέρισμα. Η τυχερή διαίρεση είναι παραπλανητική. Δείτε τον μέσο όρο και την κατανομή με διασταυρούμενη επικύρωση.
- Δεν συγκρίνεται με τη γραμμή βάσης. Δεν μπορείς να πεις «καλό» χωρίς να ξέρεις αν το μοντέλο κερδίζει έναν ηλίθιο προγνωστικό.
- Χρήση κανονικής αναδίπλωσης k σε χρονοσειρές. Διαρρέει το μέλλον. Απαιτείται διαχωρισμός χρονοσειρών.
Συμβουλή: Γράψτε τρεις αριθμούς δίπλα σε κάθε μοντέλο: βαθμολογία εκπαίδευσης, μέσος όρος διασταυρούμενης επικύρωσης και βαθμολογία βάσης. Αυτό το τρίο αποκαλύπτει με μια ματιά την υπερμάθηση (εκπαίδευση >> CV) και την υποτίμηση (CV ≈ βασική γραμμή).
Συνοπτικά
Η κατασκευή ενός μοντέλου είναι εύκολη, αλλά η αξιολόγησή του με ειλικρίνεια είναι δύσκολη. Στην ταξινόμηση, η μήτρα σύγχυσης, η ακρίβεια και η ανάκληση είναι πολύ πιο ενημερωτικές από την ακρίβεια. Το κόστος της εργασίας καθορίζει ποια είναι σημαντική. Τα MAE, RMSE και R² χρησιμοποιούνται στην παλινδρόμηση. Η πιο ύπουλη παγίδα είναι η υπερμάθηση: πάντα να συγκρίνετε την προπόνηση και τη βαθμολογία των τεστ. Βασιστείτε στον μέσο όρο και την κατανομή της διασταυρούμενης επικύρωσης, όχι σε έναν διαχωρισμό. Συγκρίνετε τα πάντα με μια γραμμή βάσης. Το AI υπολογίζει όλα αυτά, αλλά εξαρτάται από τον άνθρωπο να αποφασίσει ποια μέτρηση θα χρησιμοποιήσει.
Εργασία εφαρμογής
Εξαγωγή μήτρας σύγχυσης, ακρίβειας, ανάκλησης και F1 για ένα μοντέλο ταξινόμησης. Στη συνέχεια, κάντε πενταπλάσια διασταυρούμενη επικύρωση και κοιτάξτε την κατανομή βαθμολογίας στις πτυχές. Τέλος, σημειώστε τη βαθμολογία εκπαίδευσης, τον μέσο όρο του βιογραφικού σημειώματος και τη βαθμολογία βάσης δίπλα-δίπλα. Σχολιάστε με μία φράση εάν το μοντέλο σας υπερμαθαίνει και περνάει τη βασική γραμμή.
λίστα ελέγχου
- [ ] Έχω εξετάσει την πραγματική μέτρηση της εργασίας (ακρίβεια/ανάκληση/F1 κ.λπ.) αντί για ακρίβεια;
- [ ] Έχω εξετάσει τον πίνακα σύγχυσης;
- [ ] Έχω συγκρίνει τη βαθμολογία εκπαίδευσης και τεστ και έχω ελέγξει για υπερμάθηση;
- [ ] Έχω εξετάσει τον μέσο όρο και την κατανομή με διασταυρούμενη επικύρωση;
- [ ] Έχω συγκρίνει το μοντέλο με μια γραμμή βάσης;