Κέρδη:
- Δυνατότητα επιλογής της μέτρησης κατάλληλης για τον τύπο προβλήματος και το επιχειρηματικό πλαίσιο (PR-AUC/ανάκληση σε μη ισορροπημένα δεδομένα, MAE/RMSE σε παλινδρόμηση) και αναγνώριση υπερ/υπό μάθηση
- Δυνατότητα ερμηνείας κάθε μέτρησης σε σχέση με μια γραμμή βάσης και μέτρησης της απόκλισης και διαχωρισμού του θορύβου από την πρόοδο με διασταυρούμενη επικύρωση
- Δυνατότητα αναφοράς μη αισιόδοξων αποτελεσμάτων με συντονισμό υπερπαραμέτρων με το σύνολο επικύρωσης και χρησιμοποιώντας το σύνολο δοκιμής μόνο στο τέλος
Η εκπαίδευση μοντέλου (εκπαίδευση: η διαδικασία εκμάθησης προτύπων από δεδομένα) είναι το πιο ορατό αλλά πιο παραπλανητικό βήμα της μηχανικής ML. Εμφανίζεται επειδή παράγει έναν ικανοποιητικό αριθμό όπως "ακρίβεια 95%". Παραπλανητικό γιατί αυτός ο αριθμός είναι συχνά η σωστή απάντηση σε λάθος ερώτηση. Σε αυτή την ενότητα, η εκπαίδευση και η αξιολόγηση συζητούνται με τον κλάδο της μηχανικής. Χρησιμοποιούμε την τεχνητή νοημοσύνη ως συνεργάτη στον πειραματικό σχεδιασμό και βασίζουμε την απόφαση στη μέτρηση.
Λογική του προπονητικού κύκλου
Ένα μοντέλο μαθαίνει το μοτίβο στα δεδομένα ελαχιστοποιώντας μια συνάρτηση απώλειας: μια συνάρτηση που μετρά αριθμητικά το σφάλμα του μοντέλου. Ο αλγόριθμος βελτιστοποίησης (π.χ. gradient descent) μειώνει την απώλεια προσαρμόζοντας τις παραμέτρους βήμα προς βήμα. Ο στόχος δεν είναι η απομνημόνευση των δεδομένων εκπαίδευσης, αλλά η γενίκευσή τους σε πρωτόγνωρα δεδομένα.
Δύο βασικοί κίνδυνοι:
- Υπερπροσαρμογή: Το μοντέλο απομνημονεύει τα δεδομένα εκπαίδευσης και αποτυγχάνει στα νέα δεδομένα. Η επιτυχία της εκπαίδευσης είναι υψηλή, η επιτυχία της επαλήθευσης είναι χαμηλή.
- Υποπροσαρμογή: Το μοντέλο δεν μπορεί να αποτυπώσει το μοτίβο. Η επιτυχία τόσο της εκπαίδευσης όσο και της επικύρωσης είναι χαμηλή.
Η εύρεση της ισορροπίας είναι η τέχνη της εκπαίδευσης. Το σύνολο επικύρωσης υπάρχει για να παρακολουθεί αυτήν την ισορροπία: εάν η επιτυχία επικύρωσης αρχίσει να μειώνεται ενώ η επιτυχία της εκπαίδευσης αυξάνεται, η υπερμάθηση έχει ξεκινήσει.
Συμβουλή: Σχεδιάστε την απώλεια εκπαίδευσης και επικύρωσης μαζί σε κάθε βήμα. Το σημείο στο οποίο οι δύο καμπύλες αρχίζουν να αποκλίνουν είναι εκεί που αρχίζει η υπερμάθηση και είναι η κατάλληλη στιγμή για να «σταματήσει νωρίς».
Μετρική επιλογή: η πιο κρίσιμη απόφαση
Η λάθος μέτρηση κάνει ένα καλό μοντέλο να φαίνεται κακό και ένα κακό μοντέλο να φαίνεται καλό. Το πρόβλημα καθορίζει τη μέτρηση:
- Μη ισορροπημένη ταξινόμηση (μια κατηγορία είναι πολύ σπάνια, π.χ. απάτη): Η ακρίβεια είναι παραπλανητική. Ένα μοντέλο που λέει "καλέστε τα πάντα κανονικά" θα έχει 99% ακρίβεια, αλλά δεν θα πιάσει ούτε μια απάτη. Αντίθετα, χρησιμοποιείται η ακρίβεια (πόσο από αυτά που έπιασα είναι πραγματικά θετικά), η ανάκληση (πόσο από αυτά που έπιασα είναι αληθινά θετικά) και η ισορροπία τους F1 ή PR-AUC.
- Ισορροπημένη ταξινόμηση: Η ακρίβεια και η ROC-AUC μπορεί να είναι κατάλληλα.
- Παλινδρόμηση (εκτίμηση αριθμού): MAE (μέσο απόλυτο σφάλμα), RMSE (τιμωρεί μεγάλα σφάλματα), MAPE (ποσοστό σφάλματος).
- Κατάταξη/σύσταση: NDCG, MRR, Recall@K.
Το εάν η ακρίβεια ή η ανάκληση είναι σημαντική εξαρτάται από το επιχειρηματικό πλαίσιο. Η ανάκληση (να μην λείπει κανένας ασθενής) αποτελεί προτεραιότητα στον προσυμπτωματικό έλεγχο του καρκίνου. Η ακρίβεια στο φίλτρο ανεπιθύμητης αλληλογραφίας (όχι αποστολή σημαντικών μηνυμάτων ηλεκτρονικού ταχυδρομείου σε ανεπιθύμητα μηνύματα) είναι σημαντική. Αυτή είναι μια επιχειρηματική απόφαση, όχι τεχνική, και λαμβάνεται από κοινού από τον μηχανικό και τον ιδιοκτήτη.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμη προτροπή: "Αξιολογήστε την απόδοση του μοντέλου μου, ακρίβεια 0,97."
Ισχυρή προτροπή: "Έχω ένα μοντέλο ανίχνευσης απάτης. Το θετικό ποσοστό κλάσης είναι 1,5%. Η ακρίβεια αναφέρεται ως 0,97. Εξηγήστε γιατί αυτή η μέτρηση μπορεί να είναι παραπλανητική, πείτε μου ποιες μετρήσεις (ακρίβεια, ανάκληση, PR-AUC) να προτιμήσω και γιατί. Επίσης, υπολογίστε πόσο ακριβές είναι ένα "καλέστε τα πάντα αρνητικά" με τα πραγματικά προστιθέμενα δεδομένα βάσης."
Διαφορά: η ισχυρή προτροπή δίνει αναλογία κλάσης και επιχειρηματικό πλαίσιο. ζητά επίσης μια σύγκριση βασικού μοντέλου — αυτή είναι η πιο σημαντική βάση για το αν μια μέτρηση έχει νόημα.
Βασική γραμμή: η μέτρηση χωρίς σύγκριση δεν έχει νόημα
Μια μέτρηση δεν είναι καλή ή κακή από μόνη της. Είναι καλό ή κακό σύμφωνα με ένα βασικό μοντέλο. Το βασικό μοντέλο είναι η απλούστερη λύση που σου έρχεται στο μυαλό: «πάντα να λες στην τάξη της πλειοψηφίας», «επαναλάβετε την αξία της προηγούμενης εβδομάδας», «μάντεψε το μέσο». Εάν το μοντέλο σας δεν μπορεί να περάσει ξεκάθαρα αυτή την απλή λύση, όλη η πολυπλοκότητα είναι άχρηστη.
Προσοχή: Η πρόταση «Το μοντέλο μου είναι 85% ακριβές» από μόνη της δεν λέει τίποτα. Εάν το βασικό μοντέλο έχει ήδη 84%, το μοντέλο σας είναι σχεδόν άχρηστο. Εάν το βασικό μοντέλο έχει 50%, το μοντέλο σας είναι τέλειο. Να μιλάτε πάντα με όρους του βασικού μοντέλου.
Διασταυρούμενη επικύρωση και εμπιστοσύνη
Ένας διαχωρισμός εκπαίδευσης/δοκιμών μπορεί να οφείλεται σε τύχη. Διασταυρούμενη επικύρωση: η διαίρεση των δεδομένων σε k μέρη και η διαδοχική δοκιμή κάθε μέρους δείχνει πόσο σταθερή είναι η απόδοση. Στην πενταπλάσια διασταυρούμενη επικύρωση λαμβάνετε πέντε διαφορετικές βαθμολογίες. Η μέση τιμή και η τυπική τους απόκλιση είναι σημαντικές. Εάν ο μέσος όρος είναι 80%, αλλά η απόκλιση είναι ±12%, το μοντέλο σας είναι ασταθές — μπορεί να συμπεριφέρεται πολύ διαφορετικά στην επόμενη παρτίδα δεδομένων.
Αυτό είναι επίσης κρίσιμο για τη «σύγκριση δύο μοντέλων». Αν το μοντέλο Α πήρε 81% και το μοντέλο Β 82%, είναι πραγματικά καλύτερο το Β; Εάν η απόκλιση είναι ±3%, αυτή η διαφορά μπορεί να είναι θόρυβος. Σκεφτείτε εάν η διαφορά είναι σημαντική πριν αποφασίσετε.
Συντονισμός υπερπαραμέτρων: με επικύρωση, όχι δοκιμή
Οι υπερπαράμετροι (ρυθμίσεις που καθορίζονται χειροκίνητα πριν από την εκπαίδευση—ρυθμός μάθησης, βάθος δέντρου, κ.λπ.) ορίζονται με το σύνολο επικύρωσης. Το σετ δοκιμής χρησιμοποιείται μόνο στο τέλος, μία φορά. Εάν επιλέξετε υπερπαραμέτρους κοιτάζοντας το σύνολο δοκιμών, το σύνολο δοκιμών θα μολυνθεί και η απόδοση που αναφέρετε θα είναι αισιόδοξη, κάτι που δεν συμβαίνει στην πραγματικότητα.
Η τεχνητή νοημοσύνη είναι ένας καλός βοηθός στο σχεδιασμό του χώρου αναζήτησης υπερπαραμέτρων και στη σύνταξη του κώδικα αναζήτησης (αναζήτηση πλέγματος, τυχαία αναζήτηση, βελτιστοποίηση Bayesian). Αλλά εξακολουθείτε να αποφασίζετε "ποια μέτρηση θα βελτιστοποιήσουμε;"
τρεις μίνι θήκες
Περίπτωση 1 - Παγίδα ακρίβειας. Μια ιατρική ομάδα ήταν περήφανη για ένα μοντέλο που εντόπισε μια σπάνια ασθένεια: 98% ακρίβεια. Όταν έγινε η σύγκριση του βασικού μοντέλου, φάνηκε η αλήθεια: αφού το ποσοστό της νόσου ήταν 2%, το μοντέλο που έλεγε «καλέστε όλους υγιείς» έλαβε επίσης 98%. Η ανάκληση του μοντέλου ήταν μόνο 11% — έλειπαν οι περισσότεροι ασθενείς. Μόλις η μέτρηση μετατράπηκε σε PR-AUC, μετρήθηκε η πραγματική απόδοση και το μοντέλο επανασχεδιάστηκε.
Περίπτωση 2 - Λάθος ο θόρυβος ως προς την πρόοδο. Μια ομάδα ξόδεψε μήνες βελτιώνοντας το μοντέλο από 86,2% σε 86,9%. Η διασταυρούμενη επικύρωση έδειξε ότι η προκατάληψη ήταν ±1,4% — επομένως η «βελτίωση» 0,7 βαθμών ήταν στατιστικός θόρυβος. Η ομάδα είχε σπαταλήσει τρεις εβδομάδες σε εξωπραγματικά κέρδη. Μάθημα: μην δηλώσετε νίκη χωρίς να επαληθεύσετε ότι η βελτίωση είναι μεγαλύτερη από την απόκλιση.
Περίπτωση 3 - Μόλυνση του σετ δοκιμής. Ένας μηχανικός εξέτασε επανειλημμένα το σετ δοκιμών για να επιλέξει τις καλύτερες υπερπαραμέτρους. Το 91% που ανέφερε μειώθηκε στο 83% στην παραγωγή. Γιατί: είχε επιλέξει εν αγνοία του το μοντέλο αναλόγως κοιτάζοντας το σετ δοκιμών ξανά και ξανά (overlearning on the test set). Η αναφερόμενη και η πραγματική απόδοση αλληλεπικαλύπτονταν όταν χρησιμοποιήθηκε ξεχωριστό σύνολο επικύρωσης.
Αντιγράψιμα πρότυπα
Βοηθήστε με να επιλέξω τη σωστή μέτρηση για αυτό το πρόβλημα ταξινόμησης. Πρόβλημα: [τι προβλέπεται] Κατανομή τάξης: [θετικός συντελεστής
Αξιολογήστε τη σύγκριση των ακόλουθων δύο μοντέλων. Διασταυρούμενη επικύρωση μοντέλου Α: [κατάλογος βαθμολογιών] Διασταυρούμενη επικύρωση μοντέλου Β: [λίστα βαθμολογιών] Υπολογίστε τη μέση και τυπική απόκλιση. Είναι στατιστικά σημαντική η διαφορά ή είναι απλώς θόρυβος εντός της απόκλισης; Ποιο θα μου προτείνατε να διαλέξω και γιατί;
Ελέγξτε αυτόν τον κωδικό εκπαίδευσης για τα ακόλουθα: 1) Επιλέγονται οι υπερπαράμετροι με το σύνολο δοκιμής ή το σύνολο επικύρωσης; 2) Η πρόωρη διακοπή παρακολουθείται με το σωστό σύνολο; 3) Υπάρχουν ενδείξεις υπερμάθησης (διαφορά απώλειας προπόνησης/επικύρωσης); Κωδικός: [κωδικός]
Ποιο από τα MAE, RMSE και MAPE πρέπει να αναφέρω για αυτό το πρόβλημα παλινδρόμησης; Κλίμακα της μεταβλητής στόχου: [εύρος] Είναι τα μεγάλα σφάλματα δυσανάλογα κακά (RMSE) ή είναι όλα ίσα (MAE); Υπάρχουν τιμές κοντά στο μηδέν (παραμορφώνουν το MAPE); Προτείνετε με σύντομη αιτιολόγηση.
Πίνακας μετρικής επιλογής
Τύπος προβλήματος
Κατάλληλη μέτρηση
Να αποφεύγεται
Γιατί
Μη ισορροπημένη ταξινόμηση
PR-AUC, F1, ανάκληση
Ακρίβεια
Η κλάση πλειοψηφίας διογκώνει τη μέτρηση
Ισορροπημένη ταξινόμηση
Ακρίβεια, ROC-AUC
—
Αξιόπιστο σε ισορροπημένα δεδομένα
Παλινδρόμηση (σημαντική ακραία τιμή)
RMSE
ΧΑΡΤΗΣ (αν μηδέν)
Τιμωρεί τα μεγάλα λάθη
Παλινδρόμηση (ίσο βάρος)
MAE
—
Εύκολο στην ερμηνεία
Κατάταξη/σύσταση
NDCG, Recall@K
Ακρίβεια
Η σειρά είναι σημαντική
Συνήθη λάθη
- Χρήση ακρίβειας σε μη ισορροπημένα δεδομένα. Το πιο συνηθισμένο μετρικό σφάλμα.
- Δεν γίνονται συγκρίσεις βασικών μοντέλων. Κάνει τη μέτρηση να χάνει το νόημά της.
- Εξετάζοντας το σύνολο δοκιμών για υπερπαραμέτρους. Αισιόδοξο, μη ρεαλιστικό αποτέλεσμα.
- Βασίζεται σε ένα ενιαίο διαμέρισμα. Χωρίς διασταυρούμενη επικύρωση δεν θα δείτε την προκατάληψη.
- Λάθος θόρυβος για πρόοδο. Οι μικρές «βελτιώσεις» από την απόκλιση είναι κυρίως τύχη.
- Αγνοώντας το επιχειρηματικό πλαίσιο. Η ισορροπία ακριβείας/ανάκλησης είναι μια επιχειρηματική απόφαση.
Συνοπτικά
Η πραγματική ικανότητα στην εκπαίδευση μοντέλων δεν είναι να παράγεις υψηλό αριθμό, αλλά να γνωρίζεις τι σημαίνει αυτός ο αριθμός. Το πρόβλημα και το επιχειρηματικό πλαίσιο καθορίζουν τη σωστή μέτρηση. ερμηνεύουν κάθε μέτρηση σύμφωνα με ένα βασικό μοντέλο. Μετρήστε την προκατάληψη με διασταυρούμενη επικύρωση και μην μπερδεύετε τον θόρυβο ως πρόοδο. Χρησιμοποιήστε το σετ δοκιμής μόνο στο τέλος, μία φορά. Η τεχνητή νοημοσύνη είναι ο συνεργάτης σας στον σχεδιασμό πειραμάτων, αλλά η απόφαση του «αρκετά καλού» εξαρτάται από εσάς και τη δική σας.
Εργασία εφαρμογής
Για ένα μοντέλο ταξινόμησης: (1) γράψτε την κατανομή κλάσης, (2) δημιουργήστε ένα κατάλληλο βασικό μοντέλο και μετρήστε τη βαθμολογία του, (3) αξιολογήστε το μοντέλο σας με πενταπλάσια διασταυρούμενη επικύρωση και αναφέρετε τη μέση και τυπική απόκλιση, (4) υπολογίστε τη μέτρηση κατάλληλη για το πρόβλημα (π.χ. PR-AUC) αντί για ακρίβεια. Σημειώστε εάν το μοντέλο σας ξεπερνά το βασικό μοντέλο με μεγάλο περιθώριο χωρίς προκατάληψη.
λίστα ελέγχου
- [ ] Επέλεξα τη μέτρηση με βάση τον τύπο του προβλήματος και το επιχειρηματικό πλαίσιο.
- [ ] Έφτιαξα ένα βασικό μοντέλο και το συγκρίναμε.
- [ ] Ανέφεραν τη μέση τιμή και την απόκλιση με διασταυρούμενη επικύρωση.
- [ ] Επιβεβαίωσα ότι η βελτίωση είναι μεγαλύτερη από την απόκλιση.
- [ ] Επέλεξα τις υπερπαραμέτρους με το σύνολο επικύρωσης.
- [ ] Χρησιμοποίησα το δοκιμαστικό σετ μόνο μία φορά, στο τέλος.