Κέρδη:
- Δυνατότητα καθιέρωσης γενικευμένου γραμμικού μοντέλου (GLM), παράγοντα κινδύνου, τιμολογίων και ασφάλιστρων κινδύνου με την υποστήριξη της τεχνητής νοημοσύνης και τη μετάφραση των συντελεστών στην επιχειρηματική γλώσσα
- Δυνατότητα συζήτησης για την ισορροπία της επιλογής μεταβλητών, της αλληλεπίδρασης, της υπερπροσαρμογής και της ερμηνείας των μοντέλων μηχανικής μάθησης (GBM) με τεχνητή νοημοσύνη
- Να μπορούμε να κατανοήσουμε ότι το μοντέλο τιμολόγησης είναι απαλλαγμένο από απαγορευμένες/μεροληπτικές μεταβλητές και η συμμόρφωση του τελικού τιμολογίου με τη νομοθεσία και τον ανταγωνισμό επαφίεται στον αναλογιστή.
Η τιμή ενός ασφαλιστηρίου συμβολαίου δεν καθορίζεται τυχαία. Ο κίνδυνος τροχαίου ατυχήματος για έναν 22χρονο οδηγό με νέο δίπλωμα που ζει σε μεγάλη πόλη είναι στατιστικά υψηλότερος από αυτόν ενός 45χρονου οδηγού με 20ετή εμπειρία. Σε ένα δίκαιο σύστημα, τα ασφάλιστρα θα πρέπει επίσης να είναι διαφορετικά. Η δουλειά του αναλογιστή να μετρήσει αυτή τη διαφορά και να την αντικατοπτρίσει στην τιμή ονομάζεται ταξινόμηση τιμών και κινδύνου. Σε αυτήν την ενότητα, θα συζητήσουμε το γενικευμένο γραμμικό μοντέλο (GLM), την αναλογιστική ραχοκοκαλιά της τιμολόγησης και τις εναλλακτικές λύσεις μηχανικής εκμάθησης, και θα δούμε πώς να χρησιμοποιήσετε με ασφάλεια την τεχνητή νοημοσύνη σε αυτή τη διαδικασία.
Μερικοί βασικοί όροι. Ο παράγοντας κινδύνου είναι η μεταβλητή που επηρεάζει τον κίνδυνο και χρησιμοποιείται στην τιμολόγηση (ηλικία, ηλικία οχήματος, περιοχή, χρήση για την οποία προορίζεται). Το τιμολόγιο είναι ένα σύνολο κανόνων που καθορίζουν πώς θα υπολογιστεί το ασφάλιστρο σύμφωνα με παράγοντες κινδύνου. Το ασφάλιστρο κινδύνου είναι το καθαρό κόστος της αναμενόμενης ζημίας. Όταν προστεθούν τα έξοδα, οι προμήθειες, τα περιθώρια κέρδους και το κόστος κεφαλαίου, διαμορφώνεται το εμπορικό ασφάλιστρο (τιμή πώλησης). Ας θυμίσουμε από την αρχή: Η τεχνητή νοημοσύνη προτείνει μεταβλητές, χτίζει μοντέλα, εξηγεί συντελεστές. Αλλά ποια μεταβλητή είναι νόμιμη και ηθική και εάν το τελικό τιμολόγιο συμμορφώνεται με τη νομοθεσία και τον ανταγωνισμό ανήκει στον αναλογιστή και στη μονάδα συμμόρφωσης.
Γιατί το GLM είναι το πρότυπο στην αναλογιστική
Η πιο χρησιμοποιούμενη μέθοδος στην τιμολόγηση είναι η GLM. Το GLM σημαίνει "γενικευμένο γραμμικό μοντέλο": επεκτείνει την κλασική γραμμική παλινδρόμηση για να ταιριάζει σε μη κανονικά κατανεμημένους στόχους, όπως δεδομένα ζημιών. Έχει δύο βασικά στοιχεία. Οικογένεια κατανομής: Το Poisson επιλέγεται για συχνότητα, το γάμμα επιλέγεται για την ένταση (λογική στη μονάδα 2). Συνάρτηση συνδέσμου (σύνδεσμος): συνήθως λογαριθμική, η οποία επιτρέπει στους παράγοντες να έχουν πολλαπλασιαστικό αποτέλεσμα. Η πολλαπλασιαστική δομή είναι πολύ πολύτιμη στην αναλογιστική, επειδή έτσι ακριβώς διαμορφώνεται το τιμολόγιο: βασικό ασφάλιστρο × συντελεστής ηλικίας × συντελεστής περιοχής × συντελεστής οχήματος.
Το μεγαλύτερο πλεονέκτημα του GLM είναι η ερμηνευτικότητα. Ένας συντελεστής σας λέει άμεσα: "η ομάδα νεαρών οδηγών αυξάνει τη συχνότητα κατά 1,6 φορές σε σύγκριση με την ομάδα αναφοράς." Αυτή η διαφάνεια είναι κρίσιμη με τρεις τρόπους: (1) η ρυθμιστική αρχή και ο εσωτερικός έλεγχος μπορούν να κατανοήσουν και να εγκρίνουν το μοντέλο. (2) είναι ορατό ένα απαγορευμένο/μεροληπτικό αποτέλεσμα. (3) η λογική των τιμών μπορεί να εξηγηθεί στην ομάδα πωλήσεων και διαχείρισης. Πιο πολύπλοκα μοντέλα μηχανικής εκμάθησης (παρακάτω) μερικές φορές παρέχουν μεγαλύτερη ακρίβεια, αλλά σε βάρος της διαφάνειας.
Υπόδειξη: Ο συντελεστής GLM είναι σε κλίμακα καταγραφής. Ζητήστε από το AI να μετατρέψει τον συντελεστή σε "πολλαπλασιαστικό παράγοντα" με exp(coefficient). Θα ήταν πολύ πιο εύκολο να μεταφραστεί στην επιχειρηματική γλώσσα (π.χ. συντελεστής 0,47 → παράγοντας ≈ 1,60 → «60% πιο επικίνδυνο»).
Μεταβλητή επιλογή, υπερπροσαρμογή και μηχανική εκμάθηση
Η πιο κρίσιμη απόφαση στην τιμολόγηση είναι ποιες μεταβλητές θα παραμείνουν στο μοντέλο. Υπάρχουν δύο παγίδες. Λίγες μεταβλητές τυφλώνουν το μοντέλο: αν χαθεί ο σημαντικός παράγοντας κινδύνου, η τιμή θα είναι λάθος. Η υπερβολικά μεταβλητή / υπερβολική προσαρμογή κάνει το μοντέλο να απομνημονεύει δεδομένα του παρελθόντος: το μοντέλο μπερδεύει τον θόρυβο ως σήμα και αποτυγχάνει με τις νέες πολιτικές. Η ισορροπία δημιουργείται μέσω της διασταυρούμενης επικύρωσης — διαίρεσης των δεδομένων σε δοκίμια εκπαίδευσης και δοκιμής και δοκιμής σε δεδομένα που δεν βλέπει το μοντέλο, απλότητας και αναλογιστικής συλλογιστικής.
Η αλληλεπίδραση είναι επίσης σημαντική: μερικές φορές η συνδυασμένη επίδραση δύο παραγόντων διαφέρει από το άθροισμα των ξεχωριστών επιπτώσεών τους (ένα νεανικό + σπορ όχημα μπορεί να είναι πιο επικίνδυνο από το άθροισμα των επιμέρους επιπτώσεών τους). Στο GLM, οι αλληλεπιδράσεις προστίθενται ρητά.
Τα τελευταία χρόνια, μοντέλα όπως το GBM (gradient boosting machine — μια ισχυρή μέθοδος μηχανικής εκμάθησης που συνδυάζει πολλά μικρά δέντρα αποφάσεων) έχουν γίνει κοινά στην τιμολόγηση. Αυτά καταγράφουν αυτόματα πολύπλοκα μοτίβα και αλληλεπιδράσεις, δίνοντας συχνά πιο ακριβείς προβλέψεις από το GLM. Έχει όμως ένα τίμημα: την τάση να είσαι «μαύρο κουτί». Κοινή πρακτική σήμερα είναι η χρήση GBM για ανακάλυψη και δημιουργία ιδεών και GLM για το τελικό διαφανές τιμολόγιο. ή ερμηνεία της εξόδου GBM με εργαλεία επεξήγησης όπως το SHAP.
Ο παρακάτω πίνακας συγκρίνει τις δύο προσεγγίσεις:
κριτήριο
GLM
GBM (μηχανική εκμάθηση)
Ερμηνευσιμότητα
Υψηλό (συντελεστής ενεργός)
Χαμηλό (απαιτείται εργαλείο σχολιασμού)
Λήψη αλληλεπίδρασης
Προστέθηκε χειροκίνητα
αυτόματο
Κίνδυνος υπερβολικής τοποθέτησης
χαμηλός-μεσαίος
Υψηλό (απαιτείται προσεκτική προσαρμογή)
Έγκριση ρυθμιστή/ελέγχου
εύκολο
Δύσκολο, απαιτεί πρόσθετη τεκμηρίωση
Τυπική χρήση
τελικό τιμολόγιο
ανακάλυψη, σύγκριση
Πώς να χρησιμοποιήσετε το AI στην τιμολόγηση
1) Μετάφραση του συντελεστή GLM στην επιχειρηματική γλώσσα:
Ρύθμισα μια συχνότητα GLM (Poisson, σύνδεσμος καταγραφής). Μερικοί συντελεστές (κλίμακα καταγραφής): ηλικιακή_ομάδα_18_25: 0,47 ; περιοχή_πλειοψηφία: 0,22 ; arac_yasi_10plus: -0,15. Μετατρέψτε το καθένα σε πολλαπλασιαστή με την exp() και εξηγήστε το με μια πρόταση που μπορεί να κατανοήσει ένας διαχειριστής. Υπενθυμίστε επίσης ποια είναι η ομάδα αναφοράς.
2) Συζήτηση μεταβλητής/αλληλεπίδρασης:
Ο ρόλος σας: βοηθός τιμών. Οι υποψήφιες μεταβλητές μου για το μοντέλο συχνότητας κυκλοφορίας είναι: ηλικία, φύλο, περιοχή, ηλικία οχήματος, ισχύς κινητήρα, ετήσια χιλιόμετρα, επάγγελμα. - Ποιες μεταβλητές ενδέχεται να είναι επικίνδυνες από κανονιστική/δεοντολογική άποψη (π.χ. έμμεση διάκριση); - Ποιες διμερείς αλληλεπιδράσεις θα είχε νόημα να δοκιμάσουμε; - Ποια βήματα επαλήθευσης πρέπει να ακολουθήσω για να αποφύγω την υπερβολική τοποθέτηση; Λήψη αποφάσεων; Δώσε μου το πλαίσιο για έλεγχο και συζήτηση.
3) Κωδικός ελέγχου υπερπροσαρμογής:
Γράψτε σχολιασμένο κώδικα που αξιολογεί ένα GLM με k-fold cross-validation χρησιμοποιώντας Python + scikit-learn / statsmodels. Χρησιμοποιήστε την απόκλιση Poisson ως μέτρηση. Συγκρίνετε τις βαθμολογίες της προπόνησης και των τεστ και εξηγήστε στη γραμμή σχολίων πώς να διαβάζετε την πινακίδα υπερπροσαρμογής. Η βιβλιοθήκη είναι ψεύτικη.
4) Διακρίσεις/υποκατάστατος μεταβλητός έλεγχος:
Ο «ταχυδρομικός κώδικας» αποδείχθηκε ότι ήταν μια ισχυρή μεταβλητή στο μοντέλο τιμολόγησης μου. Εξηγήστε τον κίνδυνο αυτό να αντιπροσωπεύει έμμεσα ένα απαγορευμένο χαρακτηριστικό (π.χ. εθνικότητα, εισόδημα) ως μεταβλητή αντιπροσώπου. - Τι ανάλυση πρέπει να κάνω για να δοκιμάσω αυτόν τον κίνδυνο; - Ποιες εναλλακτικές λύσεις υπάρχουν για τη μείωση του κινδύνου; Παροχή νομικών συμβουλών. σχεδιάσει ένα τεχνικό και ηθικό πλαίσιο.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμη προτροπή:
Καθιερώστε το καλύτερο μοντέλο τιμολόγησης για την ασφάλιση κυκλοφορίας.
Το "Best" είναι απροσδιόριστο. Χωρίς δεδομένα, χωρίς περιορισμούς, χωρίς νομοθεσία. Το AI δίνει μια γενική, ανεφάρμοστη απάντηση.
Ισχυρή προτροπή:
Ο ρόλος σας: βοηθός του αναλογιστή τιμολόγησης. Πλαίσιο: Κατασκευάζω ένα μοντέλο συχνότητας διακλάδωσης κυκλοφορίας, GLM (Poisson, σύνδεσμος καταγραφής). Οι μεταβλητές που έχω: ηλικιακή ομάδα, ηλικία οχήματος, περιοχή (επαρχία), ετήσια χιλιόμετρα, προβλεπόμενη χρήση. Περιορισμός: το φύλο δεν μπορεί να χρησιμοποιηθεί από τη νομοθεσία. Πρέπει να αποφύγω την έμμεση διάκριση. Εργασία: 1) Προτείνετε αρχική προδιαγραφή μοντέλου με αυτές τις μεταβλητές (συμπεριλαμβανομένων των ομάδων αναφοράς). 2) Δώστε λόγους για 2 αλληλεπιδράσεις που πρέπει να δοκιμάσω. 3) Δώστε μια λίστα βημάτων για να ελέγξετε την υπερπροσαρμογή.4) Προσθέστε ιδιαίτερη προσοχή στην «περιοχή» όσον αφορά την έμμεση διάκριση. Θα πάρω την απόφαση. Παρέχετε το πλαίσιο και την αιτιολόγηση.
τρεις μίνι θήκες
Περίπτωση 1 — Η αξία της διαφάνειας. Μια εταιρεία παρουσίασε ένα πολύ ακριβές μοντέλο τιμολόγησης που κατασκεύασε με GBM στη ρυθμιστική αρχή, αλλά δεν μπορούσε να εξηγήσει τους συντελεστές. η έγκριση καθυστέρησε. Ο αναλογιστής κατασκεύασε ένα GLM που λάμβανε τα ίδια σήματα. Η ακρίβεια μειώθηκε κατά 2 τοις εκατό, αλλά επειδή μπορούσε να ληφθεί υπόψη κάθε παράγοντας, το μοντέλο επικυρώθηκε μέσα σε ένα μήνα. Το GBM αποθηκεύτηκε για αναγνώριση, το GLM έγινε τιμολόγιο. Η YZ δημιούργησε γρήγορα τον κώδικα και την περιγραφή του ρυθμιστή συγκρίνοντας την απόδοση των δύο μοντέλων.
Περίπτωση 2 — Η παγίδα υπερπροσαρμογής. Ένας βοηθός έλαβε τέλεια βαθμολογία στα δεδομένα εκπαίδευσης όταν πρόσθεσε περισσότερες από 40 μεταβλητές και πολλές αλληλεπιδράσεις στο μοντέλο. Αλλά κατά τη διασταυρούμενη επικύρωση, η βαθμολογία του τεστ κατέρρευσε: το μοντέλο είχε απομνημονεύσει τον θόρυβο. Η απόδοση του πραγματικού κόσμου αυξήθηκε όταν ο αριθμός των μεταβλητών μειώθηκε σε 12 και απλοποιήθηκε. Μάθημα: κοιτάξτε το πρωτόγνωρο σκορ δεδομένων, όχι το σκορ προπόνησης.
Περίπτωση 3 — Έμμεση διάκριση. Σε ένα μοντέλο, η μεταβλητή "γειτονιά" εξηγούσε έντονα το premium. Η ανάλυση έδειξε ότι αυτή η μεταβλητή αλληλεπικαλύπτεται σε μεγάλο βαθμό με την εθνοτική συγκέντρωση, δηλ. ήταν ένας αντιπρόσωπος ενός απαγορευμένου χαρακτηριστικού. Ο αναλογιστής αντικατέστησε αυτή τη μεταβλητή με πιο ουδέτερους δείκτες κινδύνου (τύπος δρόμου, κατάσταση στάθμευσης). τόσο οι ηθικοί όσο και οι νομικοί κίνδυνοι έχουν μειωθεί. Η τεχνητή νοημοσύνη παρήγαγε ανάλυση συσχέτισης που μετρά την επικάλυψη και εναλλακτικές προτάσεις μεταβλητών. Ο αναλογιστής και η μονάδα συμμόρφωσης έλαβαν την απόφαση.
Συνήθη λάθη
- Κάνοντας το ανερμήνευτο μοντέλο την απόλυτη συνταγή. Μια τιμή που δεν μπορεί να εξηγηθεί στη ρυθμιστική αρχή, τον έλεγχο και τον πελάτη είναι μη βιώσιμη. Η διαφάνεια είναι απαραίτητη.
- Βασιζόμενος στη βαθμολογία εκπαίδευσης. Η υπερπροσαρμογή ανιχνεύεται μόνο σε μη ορατά δεδομένα (διασταυρούμενη επικύρωση).
- Χρήση απαγορευμένων/υποκατάστατων μεταβλητών χωρίς έλεγχο. Μεταβλητές όπως ο ταχυδρομικός κώδικας και το επάγγελμα ενδέχεται να φέρουν έμμεση διάκριση. Φροντίστε να το δοκιμάσετε.
- Συγχέοντας το ασφάλιστρο κινδύνου με το εμπορικό ασφάλιστρο. Το καθαρό κόστος ζημιάς από μόνο του δεν είναι η τιμή πώλησης. προστίθενται έξοδα, κέρδη και κόστος κεφαλαίου.
- Αφήνοντας τον συντελεστή σε ημερολογιακή κλίμακα και παρερμηνεύοντάς τον. Ο σχολιασμός χωρίς τη μετατροπή του σε πολλαπλασιαστή με την exp() θα προκαλέσει σφάλμα.
Προσοχή: Η σύσταση της τεχνητής νοημοσύνης για το μοντέλο που "δίνει την καλύτερη ακρίβεια" δεν είναι αυτόματα το μοντέλο που "πρέπει να χρησιμοποιηθεί". Η διαφάνεια, η δικαιοσύνη και η συμμόρφωση με τη νομοθεσία είναι υποχρεωτικά κριτήρια καθώς και η ακρίβεια στην αναλογιστική τιμολόγηση.
Συνοπτικά
Η τιμολόγηση είναι η διαδικασία μέτρησης του κινδύνου με παράγοντες κινδύνου και μετατροπής του σε ένα δίκαιο ασφάλιστρο. Το GLM είναι το πρότυπο της αναλογιστικής τιμολόγησης με την πολλαπλασιαστική και ερμηνεύσιμη δομή του. Οι συντελεστές μετατρέπονται σε παράγοντες με exp(). Τα μοντέλα μηχανικής εκμάθησης όπως το GBM μπορεί να είναι πιο ακριβή, αλλά μειώνουν τη διαφάνεια και χρησιμοποιούνται συνήθως για ανακάλυψη. Η επιλογή μεταβλητών θα πρέπει να προστατεύεται από την υπερπροσαρμογή με διασταυρούμενη επικύρωση και η έμμεση διάκριση (υποκατάστατη μεταβλητή) θα πρέπει να ελέγχεται προσεκτικά. Το AI δημιουργεί το μοντέλο, γράφει κώδικα και εξηγεί τον συντελεστή. Όμως η νομική-δεοντολογική συμμόρφωση και το τελικό τιμολόγιο ανήκουν στην αναλογιστική μονάδα και τη μονάδα συμμόρφωσης.
Εργασία εφαρμογής
Καταγράψτε 5-6 παράγοντες κινδύνου για έναν κύριο. Ζητήστε από το AI (α) μια αρχική προδιαγραφή του GLM με αυτούς τους παράγοντες, (β) 2 αλληλεπιδράσεις για να δοκιμάσετε και το σκεπτικό τους, (γ) έναν έλεγχο μεταβλητών που ενδέχεται να διατρέχουν κίνδυνο έμμεσης διάκρισης. Στη συνέχεια, δώστε ένα παράδειγμα 3 συντελεστών καταγραφής, ζητήστε από το AI να το μετατρέψει σε πολλαπλασιαστή με το exp() και να το μεταφέρει στην επιχειρηματική γλώσσα και να επαληθεύσει τους παράγοντες με μη αυτόματο τρόπο.
λίστα ελέγχου
- [ ] Μπορεί το μοντέλο μου να ερμηνευτεί; Μπορώ να μεταφράσω τον αντίκτυπο κάθε παράγοντα στην επιχειρηματική γλώσσα;
- [ ] Έχω ελέγξει για υπερπροσαρμογή με διασταυρούμενη επικύρωση;
- [ ] Έχω κάνει σάρωση για έμμεση διάκριση για απαγορευμένες μεταβλητές και μεταβλητές μεσολάβησης;
- [ ] Έχω συνειδητά διαχωρίσει το ασφάλιστρο κινδύνου από το εμπορικό ασφάλιστρο;
- [ ] Μετέτρεψα τους συντελεστές σε πολλαπλασιαστές με την exp() και τους ερμήνευσα σωστά;
- [ ] Πήρα την τελική τιμολογιακή απόφαση μαζί με τη νομοθεσία και τη μονάδα συμμόρφωσης;