Μονάδες
1. Εισαγωγή στην Τεχνητή Νοημοσύνη στην Αναλογιστική Επιστήμη: Ρόλοι, Όρια, Έλεγχος ταυτότητας και Απόρρητο 2. Μοντελοποίηση ζημιών: Διακρίσεις συχνότητας-βαρύτητας και υποστηριζόμενη ανάλυση τεχνητής νοημοσύνης 3. Λογαριασμός κράτησης (παροχής): Επαλήθευση με IBNR, Chain Ladder και Τεχνητή Νοημοσύνη 4. Ταξινόμηση τιμολόγησης και κινδύνου: GLM, Tariffing και Τεχνητή Νοημοσύνη 5. Λογαριασμοί ζωής και συνταξιοδότησης: θνησιμότητα, πρόσοδος και ευθύνη 6. Προετοιμασία Δεδομένων και Μηχανική Χαρακτηριστικών: Χειρισμός Αναλογιστικών Δεδομένων με Τεχνητή Νοημοσύνη 7. Ανάλυση Σεναρίων και Δοκιμή Στρες: Διαχείριση Αβεβαιότητας 8. Solvency II, Κεφαλαιακή Επάρκεια και Επικύρωση Μοντέλου 9. Αναφορά και Επικοινωνία: Αναλογιστική Έκθεση, Παρουσίαση Διοίκησης και Ρυθμιστική Γλώσσα 10. Ηθική, Διακρίσεις, Εμπιστευτικότητα και Επαγγελματική Υπευθυνότητα 11. Αναλογιστική ροή εργασιών από άκρο σε άκρο, ενσωμάτωση τεχνητής νοημοσύνης και προστασία του μέλλοντος
Μονάδα 6 / 11

Προετοιμασία Δεδομένων και Μηχανική Χαρακτηριστικών: Χειρισμός Αναλογιστικών Δεδομένων με Τεχνητή Νοημοσύνη

Κέρδη:

  • Δυνατότητα ανίχνευσης τιμών που λείπουν, ακραίων τιμών, έκθεσης και προβλημάτων ποιότητας δεδομένων σε δεδομένα πολιτικής και βλάβης με υποστήριξη τεχνητής νοημοσύνης και δημιουργία προσχέδιο διόρθωσης
  • Μηχανική χαρακτηριστικών (νέα παραγωγή μεταβλητών, ομαδοποίηση, κωδικοποίηση) και κανονικοποίηση έκθεσης στην τεχνητή νοημοσύνη με το σωστό πλαίσιο
  • Κατανοήστε ότι οι μετασχηματισμοί δεδομένων που προτείνονται από την τεχνητή νοημοσύνη θα πρέπει να ελέγχονται από έναν αναλογιστή έναντι του κινδύνου διαρροής δεδομένων και κρυφής μεροληψίας.

Το λιγότερο συζητημένο αλλά και πιο χρονοβόρο μέρος της αναλογιστικής εργασίας είναι η προετοιμασία δεδομένων. Οι έμπειροι αναλογιστές γνωρίζουν ότι τον περισσότερο χρόνο ενός έργου μοντελοποίησης αφιερώνεται στον καθαρισμό, τον συνδυασμό και τη διόρθωση των δεδομένων. Ανεξάρτητα από το πόσο κομψό είναι το μοντέλο, εάν τα δεδομένα εισόδου είναι κατεστραμμένα, η έξοδος είναι κατεστραμμένη - με λίγα λόγια, "σκουπίδια μέσα, σκουπίδια έξω". Σε αυτήν την ενότητα, θα δούμε τυπικά προβλήματα δεδομένων πολιτικής και αξιώσεων, πώς να τα εντοπίσουμε και να τα διορθώσουμε με τεχνητή νοημοσύνη και την προσέγγιση της μηχανικής χαρακτηριστικών (που προέρχονται από νέες μεταβλητές που είναι πιο ενημερωτικές από τα υπάρχοντα δεδομένα).

Μια προειδοποίηση από την αρχή: η προετοιμασία δεδομένων είναι ένα φαινομενικά τεχνικό και αθώο βήμα, αλλά εδώ κρύβονται τα πιο επικίνδυνα λάθη. Μια εσφαλμένη κανονικοποίηση έκθεσης, μια κρυφή διαρροή δεδομένων ή μια άθελα εισαγόμενη μεροληψία καταστρέφει σιωπηλά όλα τα επόμενα μοντέλα. Η τεχνητή νοημοσύνη επιταχύνει πολύ αυτό το βήμα, αλλά αν αφεθεί ανεξέλεγκτη, μεγεθύνει επίσης τον κίνδυνο.

Τυπικά προβλήματα αναλογιστικών δεδομένων

Τα δεδομένα πολιτικής και αξιώσεων σχεδόν ποτέ δεν φτάνουν καθαρά. Τα πιο συνηθισμένα προβλήματα είναι: Λείπουν τιμές: ορισμένες πολιτικές έχουν κενή ηλικία, επάγγελμα ή περιοχή οχήματος. Η τυφλή πλήρωση με τον μέσο όρο μπορεί να δημιουργήσει προκατάληψη. η ίδια η έλλειψη μερικές φορές μεταφέρει πληροφορίες (οι αγνοούμενοι είναι μια διαφορετική ομάδα). Outliers: παράλογα αρχεία όπως αρνητικό ασφάλιστρο, ασφαλισμένος 200 ετών, συμβόλαιο μηδενικής έκθεσης. Πρέπει να γίνει διάκριση εάν πρόκειται για σφάλματα δεδομένων ή για πραγματικές περιπτώσεις αιχμής. Ασυνέπεια: διαφορετικές ορθογραφίες της ίδιας περιοχής ("Istanbul", "Istanbul", "34"), σύγχυση μορφής ημερομηνίας. Διπλότυπες καταχωρήσεις: εισαγωγή της ίδιας ζημιάς δύο φορές.

Αλλά το πιο κρίσιμο ζήτημα που αφορά την αναλογιστική είναι η έκθεση. Εάν μια πολιτική ξεκινά στα μέσα του έτους, παρέχει μια κλασματική έκθεση (π.χ. 0,5 έτη) για εκείνο το έτος, όχι ένα πλήρες "έτος πολιτικής". Τα ποσοστά συχνότητας και ζημιάς θα πρέπει πάντα να κανονικοποιούνται στην έκθεση. Διαφορετικά, τα βραχυπρόθεσμα συμβόλαια φαίνονται υψηλού κινδύνου. Το AI μπορεί να κωδικοποιήσει τον υπολογισμό της έκθεσης, αλλά πρέπει να παρέχετε τον ορισμό και τον επιχειρηματικό κανόνα.

Ο παρακάτω πίνακας συνοψίζει τυπικά προβλήματα και τη σωστή προσέγγιση:

πρόβλημα

λάθος προσέγγιση

σωστή προσέγγιση

λείπει τιμή

Συμπληρώστε όλα με μέσο όρο

Αναλύστε την ανεπάρκεια. μερικές φορές ανοίγει μια ξεχωριστή κατηγορία

ακραία

Αυτόματη διαγραφή

Διάκριση μεταξύ σφάλματος δεδομένων και πραγματικού δυνητικού πελάτη

έκθεση

Μετρήστε όλες τις πολιτικές για 1 έτος

Υπολογίστε την κλασματική έκθεση

Ασυνέπεια κατηγορίας

αγνοήστε

Ταίριασμα με το τυπικό λεξικό

επαναλαμβανόμενη βλάβη

μην παρατηρείς

Κατάργηση διπλότυπων με βασικά πεδία

Μηχανική χαρακτηριστικών: αντλώντας γνώση από δεδομένα

Η μηχανική χαρακτηριστικών είναι η τέχνη της εξαγωγής νέων μεταβλητών που είναι πιο χρήσιμες για το μοντέλο από υπάρχουσες ακατέργαστες μεταβλητές. Παραδείγματα: "ηλικία" από την ημερομηνία γέννησης, "ηλικιακή ομάδα" (binning) από την ηλικία, "τμήμα κινδύνου" από το μοντέλο μάρκας οχήματος, "ετήσια εκτίμηση χιλιομέτρων" από συνδυασμό διεύθυνσης-πολιτικής. Ένα καλό χαρακτηριστικό φέρει ισχυρότερο σήμα από τα πρωτογενή δεδομένα και αυξάνει τόσο την ακρίβεια όσο και την ερμηνευτικότητα του μοντέλου.

Τρεις τεχνικές χρησιμοποιούνται συχνά στην αναλογιστική εργασία. Δέσμευση: διαχωρισμός μιας συνεχούς μεταβλητής (ηλικίας) σε σημαντικές ομάδες. Αυτό καταγράφει μη γραμμικές σχέσεις και κάνει το τιμολόγιο αναγνώσιμο. Κωδικοποίηση: μετατροπή κατηγορικών μεταβλητών (περιοχή) σε αριθμητική μορφή κατάλληλη για το μοντέλο. Η κωδικοποίηση βάσει κινδύνου (που αντιπροσωπεύει κάθε κατηγορία με το δικό της ποσοστό ζημιάς) είναι κοινή, αλλά θα πρέπει να γίνεται με προσοχή. Κανονικοποίηση: καθιστώντας τα πάντα συγκρίσιμα διαιρώντας τα με την έκθεσή τους. Το AI δημιουργεί γρήγορα τον κώδικα για αυτούς τους μετασχηματισμούς. Αλλά πρέπει να εγκρίνετε τη λογική κάθε μετασχηματισμού.

Συμβουλή: Η κωδικοποίηση στόχου είναι ισχυρή αλλά επιρρεπής σε διαρροή δεδομένων: το μοντέλο "απατάει" εάν συμπεριλάβετε τη ζημιά μιας σειράς κατά τον υπολογισμό της μέσης ζημιάς μιας κατηγορίας. Πάντα να το κάνετε αυτό εντός των δεδομένων εκπαίδευσης, σε ένα μοτίβο διασταυρούμενης επικύρωσης.

Ο πιο ύπουλος κίνδυνος: διαρροές δεδομένων και σιωπηρή προκατάληψη

Η διαρροή δεδομένων είναι η εισαγωγή πληροφοριών στο μοντέλο που στην πραγματικότητα δεν υπάρχουν τη στιγμή της πρόβλεψης. Κλασικό παράδειγμα: εισαγωγή μιας μεταβλητής που περιέχει το αποτέλεσμα, όπως "απαιτήσεις που πληρώθηκαν", σε ένα μοντέλο που προβλέπει το ποσό της αξίωσης. Το μοντέλο φαίνεται τέλειο στα δεδομένα δοκιμής, αλλά είναι άχρηστο στον πραγματικό κόσμο, επειδή αυτές οι πληροφορίες δεν είναι διαθέσιμες τη στιγμή της πρόβλεψης. Η διαρροή είναι συχνά κρυμμένη και συλλαμβάνεται μόνο από προσεκτική αναλογιστική συλλογιστική — η τεχνητή νοημοσύνη συνήθως δεν παρατηρεί, μερικές φορές μάλιστα επαινεί τη διαρροή μεταβλητή ως "πολύ ισχυρό προγνωστικό".

Ο δεύτερος ύπουλος κίνδυνος είναι η σιωπηρή προκατάληψη. Εάν τα δεδομένα ιστορικού αντιπροσωπεύουν άδικα μια συγκεκριμένη ομάδα (για παράδειγμα, μια περιοχή έχει απορριφθεί ιστορικά πάρα πολλές πολιτικές), τα χαρακτηριστικά που προέρχονται από αυτά τα δεδομένα φέρουν αυτήν την προκατάληψη και το μοντέλο την αναπαράγει στο μέλλον. Η φάση της μηχανικής χαρακτηριστικών είναι η πιο κρίσιμη στιγμή κατά την οποία αυτή η μεροληψία μπορεί να αναγνωριστεί και να διορθωθεί.

Προσοχή: Προτού χαρείτε όταν μια μεταβλητή «βελτιώνει τρομερά την προγνωστική ισχύ», ρωτήστε: είναι αυτή η μεταβλητή πράγματι παρούσα τη στιγμή της πρόβλεψης ή περιλαμβάνει το μέλλον; Ένα αποτέλεσμα που φαίνεται πολύ καλό είναι συχνά σημάδι διαρροής.

Πώς να χρησιμοποιήσετε το AI στην προετοιμασία δεδομένων

1) Έλεγχος ποιότητας δεδομένων:

Ο ρόλος σας: βοηθός ποιότητας δεδομένων. Έχετε απόδοση αναλογιστικού συμβολαίου. Στήλες: Αναγνωριστικό_πολιτικής, ημερομηνία_έναρξης, ημερομηνία_λήξης, ηλικία, περιοχή, ηλικία_οχήματος, πριμοδότηση, αριθμός_αξιώσεων, ποσό_αίτησης. Δώστε μου μια λίστα ελέγχου και σκίτσο κώδικα Python (pandas): - Μετρήστε τις τιμές που λείπουν ανά στήλη. έτη) από την έναρξη/τέλος. ΜΗΝ διαγράψετε. Απλώς αναφέρετέ το για να αποφασίσω.

2) Παραγωγή χαρακτηριστικών:

Θέλω να αντλήσω νέες δυνατότητες από τα δεδομένα επισκεψιμότητάς μου. Διαθέσιμο: ηλικία, ηλικία_οχήματος, περιοχή, ετήσια_χλμ, τύπος_χρήσης.- Ποιες ομάδες ηλικιών και χιλιομέτρων (binning) προτείνετε, γιατί;- Πώς μπορώ να κάνω κωδικοποίηση βάσει κινδύνου για "περιοχή" χωρίς διαρροή δεδομένων;- Προτείνετε 3 νέα χαρακτηριστικά που αξίζει να δοκιμάσετε και γράψτε την αναλογιστική αιτιολόγηση για καθεμία. θα αποφασίσω.

3) Έλεγχος διαρροής:

Το μοντέλο μου προβλέπει την ΠΙΘΑΝΟΤΗΤΑ ζημιάς με τις ακόλουθες μεταβλητές: ηλικία, περιοχή, ηλικία_οχήματος, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. Ποιες από αυτές τις μεταβλητές ενέχουν κίνδυνο διαρροής δεδομένων; Για καθένα, αξιολογήστε εάν θα είναι διαθέσιμο τη στιγμή της πρόβλεψης. Καταγράψτε τα ύποπτα και γιατί.

4) Ομαλοποίηση έκθεσης:

Ορισμένες από τις πολιτικές μου ξεκινούν στα μέσα του έτους. Εξηγήστε και κωδικοποιήστε την κανονικοποίηση της έκθεσης για να υπολογίσετε σωστά τη συχνότητα: συχνότητα = συνολικός αριθμός_αξιώσεων / συνολική έκθεση (πολιτική-έτος). Δείξτε με ένα παράδειγμα πώς να υπολογίσετε την έκθεση του ασφαλιστηρίου που ξεκινά στα μέσα του έτους.

Αδύναμη προτροπή / Ισχυρή προτροπή

Αδύναμη προτροπή:

Καθαρίστε τα δεδομένα και ετοιμάστε το για το μοντέλο.

Η τεχνητή νοημοσύνη δεν γνωρίζει ποια στήλη είναι ποια, επιχειρηματικοί κανόνες, ορισμός έκθεσης. Μπορεί να διαγράψει τυφλά και να συμπληρώσει και να καταστρέψει τα δεδομένα.

Ισχυρή προτροπή:

Ο ρόλος σας: βοηθός προετοιμασίας αναλογιστικών δεδομένων. Λεξικό δεδομένων: Policy_id (ταυτότητα), start/end_date (περίοδος πολιτικής), ηλικία (αναμενόμενη 16-90), premium (πρέπει να είναι >0), request_count (>=0), request_amount (>=0). Εργασία:1) Γράψτε κανόνα εύλογης λογικότητας για κάθε στήλη και REPORT παραβίαση παραβάσεων. έκθεση.3) 3 διαφορετικές στρατηγικές για την έλλειψη «ηλικίας» (διαγραφή). / μέσος όρος / ξεχωριστή κατηγορία) υπάρχει με συν-πλην. Αφήστε την απόφαση σε εμένα.4) Προειδοποίηση εάν υπάρχει στήλη που μπορεί να ενέχει κίνδυνο διαρροής.Αυτόματη διαγραφή οποιασδήποτε εγγραφής. Θα εγκρίνω κάθε απόφαση.

τρεις μίνι θήκες

Περίπτωση 1 — Σφάλμα έκθεσης. Σε ένα χαρτοφυλάκιο, οι βραχυπρόθεσμες (3μηνες) ταξιδιωτικές πολιτικές μετρήθηκαν ως πλήρη έτη, επομένως η συχνότητα εμφανίστηκε τέσσερις φορές χαμηλότερη από ό,τι ήταν στην πραγματικότητα. Η τιμή έπεσε λάθος. Όταν ο αναλογιστής υπολόγισε το άνοιγμα ως κλάσμα (0,25 έτος πολιτικής), η πραγματική συχνότητα αποκαλύφθηκε και το τιμολόγιο διορθώθηκε. Η τεχνητή νοημοσύνη δημιούργησε κλασματικό κώδικα έκθεσης. Ο αναλογιστής έδωσε τον ορισμό.

Περίπτωση 2 — Λανθάνουσα διαρροή. Όταν ένας βοηθός πρόσθεσε τη μεταβλητή "χρόνος κλεισίματος αρχείου" στο μοντέλο πιθανότητας βλάβης, η ακρίβεια αυξήθηκε δραματικά. Η χαρά ήταν βραχύβια: αυτή η μεταβλητή μπορούσε να γίνει γνωστή μόνο αφού είχε συμβεί η ζημιά, που σημαίνει ότι δεν ήταν διαθέσιμη τη στιγμή της πρόβλεψης. Όταν αφαιρέθηκε η διαρροή μεταβλητή, το μοντέλο μειώθηκε σε ρεαλιστικό επίπεδο. Επαίνεσε τη μεταβλητή AI ως «ισχυρό προγνωστικό». Η κρίση του αναλογιστή έπιασε την παγίδα.

Περίπτωση 3 — Αντιγραφή μεροληψίας. Μια εταιρεία εξήγαγε ένα μοτίβο «απόρριψης εφαρμογής» από ιστορικά δεδομένα και το έβαλε στο νέο μοντέλο. Η ανάλυση έδειξε ότι οι προηγούμενες απορρίψεις συγκεντρώθηκαν δυσανάλογα σε μια συγκεκριμένη γειτονιά, πράγμα που σημαίνει ότι υπήρχε μια ιστορική προκατάληψη. Αυτό το χαρακτηριστικό αφαιρέθηκε από το μοντέλο και αντικαταστάθηκε με πιο ουδέτερους δείκτες κινδύνου. Η τεχνητή νοημοσύνη παρήγαγε την ανάλυση μετρώντας την επικάλυψη του προτύπου με τη γειτονιά. Η ηθική απόφαση ελήφθη από τον αναλογιστή και τη μονάδα συμμόρφωσης.

Συνήθη λάθη

  • Συμπλήρωση τιμών που λείπουν με τον μέσο όρο χωρίς σκέψη. Η ίδια η έλλειψη μπορεί να είναι γνώση. Η συμπλήρωσή του στα τυφλά δημιουργεί προκατάληψη.
  • Αυτόματη διαγραφή ακραίων στοιχείων. Μερικά είναι αληθινά περιστατικά άκρων. Η διαγραφή δεδομένων χωρίς να τα διαχωρίζει από σφάλματα καταστρέφει τις πληροφορίες.
  • Μη ομαλοποίηση της έκθεσης. Η καταμέτρηση των βραχυπρόθεσμων συμβολαίων ως πλήρους ετών στρεβλώνει τη συχνότητα και στρεβλώνει την τιμή.
  • Δεν παρατηρείτε διαρροή δεδομένων. Ένα πολύ καλό αποτέλεσμα είναι συχνά σημάδι μιας μεταβλητής που αφορά το μέλλον. Αναρωτηθείτε εάν κάθε μεταβλητή είναι παρούσα τη στιγμή της πρόβλεψης.
  • Φέρνοντας έμμεση προκατάληψη στο μέλλον. Η αδικία στα ιστορικά δεδομένα μπορεί να διαρρεύσει σε παράγωγα χαρακτηριστικά. Ελέγξτε το στο στάδιο χαρακτηριστικών.

Συνοπτικά

Η αναλογιστική μοντελοποίηση αφορά σε μεγάλο βαθμό την προετοιμασία δεδομένων. Εάν η είσοδος είναι κατεστραμμένη, η έξοδος είναι επίσης κατεστραμμένη. Τυπικά προβλήματα είναι οι τιμές που λείπουν, οι ακραίες τιμές, οι ασυνέπειες και οι επικαλύψεις. Το κρίσιμο αναλογιστικό ζήτημα είναι η ομαλοποίηση της έκθεσης. Η μηχανική χαρακτηριστικών — ομαδοποίηση, κωδικοποίηση, κανονικοποίηση — αντλεί ισχυρότερα σήματα από δεδομένα. Οι πιο ύπουλοι κίνδυνοι είναι η διαρροή δεδομένων και η σιωπηρή μεροληψία. και τα δύο αποτυπώνονται μόνο με αναλογιστικό σκεπτικό. Το AI επιταχύνει πολύ αυτό το βήμα: η σάρωση δημιουργεί κώδικα και προτάσεις. Αλλά μην διαγράφετε αυτόματα καμία εγγραφή, αφήστε τους ανθρώπους να ελέγξουν για διαρροές και προκατάληψη και να εγκρίνουν κάθε μετατροπή.

Εργασία εφαρμογής

Προετοιμάστε ένα μικρό ανώνυμο λεξικό δεδομένων πολιτικής (5-7 στήλες, εύλογο εύρος από την καθεμία). Ζητήστε από το AI (α) τον κανόνα λογικότητας και τον κωδικό αναφοράς παραβίασης για κάθε στήλη, (β) τον υπολογισμό κλασματικής έκθεσης, (γ) προτάσεις για 3 νέες δυνατότητες που μπορείτε να δοκιμάσετε. Στη συνέχεια, προσθέστε μια σκόπιμη μεταβλητή "παγίδα διαρροής" στη λίστα (π.χ. "αποζημίωση που καταβλήθηκε") και ελέγξτε εάν το AI την αντιλαμβάνεται ως διαρροή.

λίστα ελέγχου

  • [ ] Έχω αναλύσει γιατί προτού διαγράψω τα ελλείποντα και τα ακραία;
  • [ ] Έχω κλασματοποιήσει και κανονικοποιήσει σωστά την έκθεση;
  • [ ] Έχω γράψει την αναλογιστική αιτιολόγηση για κάθε νέο χαρακτηριστικό;
  • [ ] Έχω αναρωτηθεί εάν κάθε μεταβλητή είναι πράγματι παρούσα (διαρροή) τη στιγμή της πρόβλεψης;
  • [ ] Έχω κάνει σάρωση για σιωπηρή μεροληψία σε παράγωγα χαρακτηριστικά;
  • [ ] Δεν είχα την τεχνητή νοημοσύνη να διαγράψει αυτόματα τυχόν αρχεία και να εγκρίνει κάθε απόφαση ο ίδιος;