युनिट्स
1. वास्तविक विज्ञानातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण आणि गोपनीयता 2. नुकसान मॉडेलिंग: वारंवारता-तीव्रता भेदभाव आणि कृत्रिम बुद्धिमत्ता समर्थित विश्लेषण 3. राखीव (तरतुदी) खाते: IBNR, चेन लॅडर आणि आर्टिफिशियल इंटेलिजन्ससह पडताळणी 4. किंमत आणि जोखीम वर्गीकरण: GLM, दरपत्रक आणि कृत्रिम बुद्धिमत्ता 5. जीवन आणि सेवानिवृत्ती खाती: मृत्युदर, वार्षिकी आणि दायित्व 6. डेटा तयार करणे आणि वैशिष्ट्य अभियांत्रिकी: कृत्रिम बुद्धिमत्तेसह वास्तविक डेटा हाताळणे 7. परिस्थिती विश्लेषण आणि ताण चाचणी: अनिश्चितता व्यवस्थापित करणे 8. सॉल्व्हन्सी II, भांडवल पर्याप्तता आणि मॉडेल प्रमाणीकरण 9. रिपोर्टिंग आणि कम्युनिकेशन: ऍक्च्युरी रिपोर्ट, मॅनेजमेंट प्रेझेंटेशन आणि रेग्युलेटरी लँग्वेज 10. नैतिकता, भेदभाव, गोपनीयता आणि व्यावसायिक जबाबदारी 11. एंड-टू-एंड ॲक्चुरियल वर्कफ्लो, एआय इंटिग्रेशन आणि फ्यूचर-प्रूफिंग
युनिट 6 / 11

डेटा तयार करणे आणि वैशिष्ट्य अभियांत्रिकी: कृत्रिम बुद्धिमत्तेसह वास्तविक डेटा हाताळणे

नफा:

  • पॉलिसीमधील गहाळ मूल्ये, आउटलियर्स, एक्सपोजर आणि डेटा गुणवत्ता समस्या शोधण्याची क्षमता आणि कृत्रिम बुद्धिमत्ता समर्थनासह डेटा खराब करणे आणि सुधारणा मसुदा तयार करणे
  • वैशिष्ट्य अभियांत्रिकी (नवीन व्हेरिएबल डेरिव्हेशन, ग्रुपिंग, कोडिंग) आणि योग्य संदर्भासह कृत्रिम बुद्धिमत्तेचे एक्सपोजर सामान्यीकरण
  • हे समजून घ्या की आर्टिफिशियल इंटेलिजन्सद्वारे सुचविलेल्या डेटा ट्रान्सफॉर्मेशनचे डेटा लीकेज आणि लपविलेल्या पूर्वाग्रहाच्या जोखमीच्या विरूद्ध ऍक्च्युअरीद्वारे ऑडिट केले जावे.

कमीत कमी बोलल्या गेलेल्या परंतु एक्चुरियल कामाचा सर्वाधिक वेळ घेणारा भाग म्हणजे डेटा तयार करणे. अनुभवी ऍक्च्युअरींना माहित आहे की मॉडेलिंग प्रकल्पाचा बहुतेक वेळ डेटा साफ करणे, एकत्र करणे आणि दुरुस्त करण्यात खर्च होतो. मॉडेल कितीही सुंदर असले तरीही, इनपुट डेटा दूषित असल्यास, आउटपुट दूषित आहे—थोडक्यात, "कचरा आत, कचरा बाहेर." या युनिटमध्ये, आम्ही पॉलिसी आणि क्लेम डेटाच्या ठराविक समस्या, AI सह त्यांना कसे शोधायचे आणि कसे सोडवायचे आणि वैशिष्ट्य अभियांत्रिकी (विद्यमान डेटामधून अधिक माहितीपूर्ण असलेले नवीन व्हेरिएबल्स व्युत्पन्न केलेले) दृष्टीकोन पाहू.

सुरुवातीपासून एक चेतावणी: डेटा तयार करणे ही एक तांत्रिक आणि निष्पाप पायरी आहे, परंतु येथेच सर्वात धोकादायक त्रुटी लपवल्या जातात. चुकीचे एक्सपोजर नॉर्मलायझेशन, छुपा डेटा लीक किंवा नकळत सुरू केलेला पूर्वाग्रह शांतपणे त्यानंतरच्या सर्व मॉडेल्सला दूषित करतो. AI या पायरीला मोठ्या प्रमाणात गती देते, परंतु अनियंत्रित राहिल्यास, ते जोखीम देखील वाढवते.

वास्तविक डेटाच्या वैशिष्ट्यपूर्ण समस्या

धोरण आणि दावे डेटा जवळजवळ कधीही स्वच्छ येत नाही. सर्वात सामान्य समस्या आहेत: गहाळ मूल्ये: काही धोरणांमध्ये वाहनाचे वय, व्यवसाय किंवा प्रदेश रिक्त आहेत. हे आंधळेपणाने सरासरीने भरल्याने पक्षपात होऊ शकतो; कमतरतेमध्येच कधी कधी माहिती असते (गहाळ एक वेगळा गट असतो). आउटलियर्स: अतार्किक नोंदी जसे की नकारात्मक प्रीमियम, 200 वर्ष जुना विमाधारक, शून्य-एक्सपोजर पॉलिसी. या डेटा एरर किंवा रिअल एज केसेस आहेत की नाही हे वेगळे करणे आवश्यक आहे. विसंगती: एकाच प्रदेशातील भिन्न शब्दलेखन ("इस्तंबूल", "इस्तंबूल", "34"), तारखेचे स्वरूप गोंधळ. डुप्लिकेट नोंदी: एकाच नुकसानाची दोनदा नोंद.

परंतु एक्चुरियलसाठी विशिष्ट सर्वात गंभीर समस्या एक्सपोजर आहे. पॉलिसी वर्षाच्या मध्यात सुरू झाल्यास, ती त्या वर्षासाठी फ्रॅक्शनल एक्सपोजर (उदा. ०.५ वर्षे) प्रदान करते, पूर्ण “पॉलिसी-वर्ष” नाही. वारंवारता आणि नुकसान दर नेहमी एक्सपोजर सामान्य केले पाहिजे; अन्यथा अल्पकालीन धोरणे उच्च जोखीम दर्शवतात. एआय एक्सपोजर गणना कोड करू शकते, परंतु आपण व्याख्या आणि व्यवसाय नियम प्रदान करणे आवश्यक आहे.

खालील सारणी ठराविक समस्या आणि योग्य दृष्टीकोन सारांशित करते:

समस्या

चुकीचा दृष्टीकोन

योग्य दृष्टीकोन

गहाळ मूल्य

सर्व सरासरी भरा

कमतरतेचे विश्लेषण करा; कधी कधी स्वतंत्र श्रेणी उघडा

बाहेरील

स्वयं हटवा

डेटा एरर आणि रिअल लीडमधील फरक ओळखा

एक्सपोजर

1 वर्षासाठी सर्व पॉलिसी मोजा

फ्रॅक्शनल एक्सपोजरची गणना करा

श्रेणी विसंगती

दुर्लक्ष करा

मानक शब्दकोशाशी जुळवा

आवर्ती नुकसान

लक्षात येत नाही

की फील्डसह डुप्लिकेट करा

वैशिष्ट्य अभियांत्रिकी: डेटामधून ज्ञान मिळवणे

वैशिष्ट्य अभियांत्रिकी ही नवीन व्हेरिएबल्स तयार करण्याची कला आहे जी सध्याच्या रॉ व्हेरिएबल्समधून मॉडेलसाठी अधिक उपयुक्त आहेत. उदाहरणे: जन्म तारखेपासून "वय", वयानुसार "वयोगट" (बिनिंग), वाहन मेक-मॉडेलमधील "जोखीम विभाग", पत्ता-पॉलिसी संयोजनातील "वार्षिक मायलेज अंदाज". एका चांगल्या वैशिष्ट्यामध्ये कच्च्या डेटापेक्षा अधिक मजबूत सिग्नल असतो आणि मॉडेलची अचूकता आणि स्पष्टीकरण दोन्ही वाढवते.

ॲक्च्युरियल कामात तीन तंत्रे वारंवार वापरली जातात. बंधनकारक: एक सतत चल (वय) अर्थपूर्ण गटांमध्ये वेगळे करणे; हे नॉन-लिनियर रिलेशनशिप कॅप्चर करते आणि टॅरिफ वाचनीय बनवते. एन्कोडिंग: वर्गीय चल (प्रदेश) मॉडेलसाठी योग्य असलेल्या संख्यात्मक स्वरूपात रूपांतरित करणे; जोखीम-आधारित कोडिंग (प्रत्येक श्रेणीचे स्वतःच्या नुकसान दरासह प्रतिनिधित्व करणे) सामान्य आहे परंतु सावधगिरीने केले पाहिजे. सामान्यीकरण: प्रत्येक गोष्ट त्याच्या प्रदर्शनाद्वारे विभाजित करून तुलनात्मक बनवणे. AI त्वरीत या परिवर्तनांसाठी कोड व्युत्पन्न करते; परंतु आपण प्रत्येक परिवर्तनाचे तर्क मान्य केले पाहिजे.

टीप: लक्ष्य एन्कोडिंग शक्तिशाली आहे परंतु डेटा लीक होण्याची शक्यता आहे: श्रेणीच्या सरासरी नुकसानाची गणना करताना आपण पंक्तीचे स्वतःचे नुकसान समाविष्ट केल्यास मॉडेल "फसवणूक करते". हे नेहमी प्रशिक्षण डेटामध्ये, क्रॉस-व्हॅलिडेशन पॅटर्नमध्ये करा.

सर्वात कपटी धोका: डेटा लीक आणि गर्भित पूर्वाग्रह

डेटा लीकेज म्हणजे मॉडेलमध्ये माहितीचा परिचय करून देणे जी भविष्यवाणीच्या वेळी प्रत्यक्षात अस्तित्वात नाही. उत्कृष्ट उदाहरण: दाव्याच्या रकमेचा अंदाज लावणाऱ्या मॉडेलमध्ये "दावे दिलेले दावे" सारखे परिणाम असलेले व्हेरिएबल सादर करणे. मॉडेल चाचणी डेटामध्ये परिपूर्ण दिसते परंतु वास्तविक जगात निरुपयोगी आहे कारण ती माहिती भविष्यवाणीच्या वेळी उपलब्ध नसते. गळती बहुतेक वेळा लपलेली असते आणि फक्त काळजीपूर्वक वास्तविक तर्काने पकडली जाते — AI सहसा लक्षात घेत नाही, कधीकधी गळती व्हेरिएबलचे "अत्यंत शक्तिशाली अंदाजकर्ता" म्हणून प्रशंसा देखील करते.

दुसरा कपटी धोका गर्भित पूर्वाग्रह आहे. जर ऐतिहासिक डेटा एखाद्या विशिष्ट गटाचे अयोग्यरित्या प्रतिनिधित्व करत असेल (उदाहरणार्थ, एखाद्या क्षेत्रास ऐतिहासिकदृष्ट्या बऱ्याच पॉलिसी नाकारल्या गेल्या आहेत), त्या डेटामधून प्राप्त केलेली वैशिष्ट्ये हा पूर्वाग्रह बाळगतात आणि मॉडेल भविष्यात त्याची प्रतिकृती बनवतात. वैशिष्ट्य अभियांत्रिकी टप्पा हा सर्वात गंभीर क्षण आहे जेव्हा हा पूर्वाग्रह ओळखला जाऊ शकतो आणि दुरुस्त केला जाऊ शकतो.

सावधगिरी: जेव्हा व्हेरिएबल "भविष्य वर्तविण्याची शक्ती कमालीची सुधारते" तेव्हा आनंदी होण्याआधी विचारा: हे व्हेरिएबल भविष्यवाणीच्या वेळी प्रत्यक्षात उपस्थित आहे की भविष्याचा समावेश आहे? खूप छान दिसणारा परिणाम हे अनेकदा गळतीचे लक्षण असते.

डेटा तयार करताना एआय कसे वापरावे

1) डेटा गुणवत्ता तपासणी:

तुमची भूमिका: डेटा गुणवत्ता सहाय्यक. तुमच्याकडे एक्चुरियल पॉलिसी उत्पन्न आहे. स्तंभ: पॉलिसी_आयडी, प्रारंभ_तारीख, समाप्ती_तारीख, वय, प्रदेश, वाहन_वय, प्रीमियम, दावा_गणना, दावा_रक्कम. मला एक चेकलिस्ट आणि पायथन (पँडा) कोड स्केच द्या:- स्तंभानुसार गहाळ मूल्ये मोजा.- अवास्तव मूल्ये ध्वजांकित करा (नकारात्मक प्रीमियम, वय, 101, <अंतिम अंश, <अंतिम 16). एक्सपोजर (वर्षांमध्ये) सुरुवातीपासून/शेवटपासून. हटवू नका; फक्त त्याचा अहवाल द्या म्हणजे मी ठरवू शकेन.

2) वैशिष्ट्य व्युत्पन्न:

मला माझ्या रहदारी डेटामधून नवीन वैशिष्ट्ये मिळवायची आहेत. उपलब्ध: वय, वाहन_वय, प्रदेश, वार्षिक_किमी, वापर_प्रकार.- तुम्ही कोणते वयोगट आणि किमी गट (बिनिंग) शिफारस करता, का?- डेटा लीकेजशिवाय मी 'प्रदेश' साठी जोखीम-आधारित कोडींग कसे करू शकतो?- प्रयत्न करण्यासारखे 3 नवीन वैशिष्ट्ये सुचवा आणि प्रत्येकासाठी वास्तविक प्रमाण लिहा. मी ठरवेन.

3) गळती तपासणी:

माझे मॉडेल खालील चलांसह नुकसानाच्या संभाव्यतेचा अंदाज लावते: वय, प्रदेश, वाहन_वय, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. यापैकी कोणत्या व्हेरिएबल्समुळे डेटा लीक होण्याचा धोका आहे? प्रत्येकासाठी, भविष्यवाणीच्या वेळी ते उपलब्ध असेल की नाही याचे मूल्यांकन करा. संशयास्पदांची यादी करा आणि का.

4) एक्सपोजर सामान्यीकरण:

माझी काही पॉलिसी वर्षाच्या मध्यात सुरू होतात. वारंवारता अचूकपणे मोजण्यासाठी एक्सपोजर सामान्यीकरण स्पष्ट करा आणि कोड करा: वारंवारता = एकूण दावा_गणना / एकूण एक्सपोजर (पॉलिसी-वर्ष). वर्षाच्या मध्यात सुरू होणाऱ्या पॉलिसीच्या एक्सपोजरची गणना कशी करायची हे उदाहरणासह दाखवा.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

डेटा साफ करा आणि मॉडेलसाठी तयार करा.

AI ला माहित नाही की कोणता स्तंभ कोणता आहे, व्यवसाय नियम, एक्सपोजर व्याख्या; हे आंधळेपणाने हटवू शकते आणि डेटा भरू शकते आणि दूषित करू शकते.

शक्तिशाली सूचना:

तुमची भूमिका: वास्तविक डेटा तयार करणे सहाय्यक. डेटा शब्दकोश: पॉलिसी_आयडी (ओळख), प्रारंभ/समाप्ती_तारीख (पॉलिसी कालावधी), वय (अपेक्षित 16-90), प्रीमियम (0 >0 असणे आवश्यक आहे), दावा_गणना (>=0), दावा_रक्कम (>=0). कार्य:1) प्रत्येक स्तंभासाठी वाजवीपणा नियम लिहा आणि जीआरपीओ कोड (आरईई) 2) कॉलम. फ्रॅक्शनल एक्सपोजरची गणना करा. 3) 'वय' गहाळ करण्यासाठी 3 भिन्न धोरणे (हटवा). / सरासरी / स्वतंत्र श्रेणी) प्लस-वजा सह उपस्थित; निर्णय माझ्यावर सोपवा. 4) जर एखादा स्तंभ गळतीचा धोका असेल तर चेतावणी द्या. कोणतेही रेकॉर्ड स्वयंचलितपणे हटवणे; प्रत्येक निर्णयाला मी मान्यता देईन.

तीन लहान प्रकरणे

केस 1 - एक्सपोजर त्रुटी. एका पोर्टफोलिओमध्ये, अल्प-मुदतीची (3-महिने) प्रवास धोरणे पूर्ण वर्षे म्हणून गणली गेली, त्यामुळे वारंवारता प्रत्यक्षात होते त्यापेक्षा चार पट कमी दिसून आली; किंमत चुकीच्या पद्धतीने पडली. जेव्हा एक्च्युअरीने एक्सपोजरची अपूर्णांक (0.25 पॉलिसी-वर्ष) गणना केली, तेव्हा वास्तविक वारंवारता उघड झाली आणि दर दुरुस्त केला गेला. AI व्युत्पन्न फ्रॅक्शनल एक्सपोजर कोड; ॲक्च्युअरीने व्याख्या दिली.

केस 2 - सुप्त गळती. जेव्हा एखाद्या मदतनीसाने नुकसान संभाव्यता मॉडेलमध्ये "फाइल बंद करण्याची वेळ" व्हेरिएबल जोडले, तेव्हा अचूकता नाटकीयरित्या वाढली. हा आनंद अल्पकालीन होता: नुकसान झाल्यानंतरच हे परिवर्तन ओळखले जाऊ शकते, याचा अर्थ अंदाजाच्या वेळी ते उपलब्ध नव्हते. लीकी व्हेरिएबल काढून टाकल्यावर, मॉडेल वास्तववादी पातळीवर कमी झाले. त्याने एआय व्हेरिएबलचे “शक्तिशाली भविष्यकथक” म्हणून कौतुक केले; ऍक्च्युअरीच्या निकालाने सापळा पकडला.

केस 3 - पूर्वाग्रहाची प्रतिकृती. एका कंपनीने ऐतिहासिक डेटामधून "ॲप्लिकेशन रिजेक्शन" पॅटर्न मिळवला आणि तो नवीन मॉडेलमध्ये टाकला. विश्लेषणाने दर्शविले की भूतकाळातील नकार एका विशिष्ट अतिपरिचित क्षेत्रामध्ये असमानतेने केंद्रित होते, याचा अर्थ एक ऐतिहासिक पूर्वाग्रह होता. हे वैशिष्ट्य मॉडेलमधून काढून टाकण्यात आले आणि अधिक तटस्थ जोखीम निर्देशकांसह बदलले. AI ने पॅटर्नचे अतिपरिचित क्षेत्र मोजणारे विश्लेषण तयार केले; नैतिक निर्णय एक्च्युअरी आणि अनुपालन युनिटने घेतला होता.

सामान्य चुका

  • विचार न करता गहाळ मूल्ये सरासरीने भरणे. अभाव स्वतः ज्ञान असू शकते; ते आंधळेपणाने भरल्याने पूर्वग्रह निर्माण होतो.
  • आउटलायर्स आपोआप हटवा. काही खरे धार केस आहेत; त्रुटींपासून वेगळे न करता डेटा हटवल्याने माहिती नष्ट होते.
  • एक्सपोजर सामान्य करत नाही. लहान पॉलिसींची पूर्ण वर्ष म्हणून गणना केल्याने वारंवारता विकृत होते आणि किंमत विकृत होते.
  • डेटा लीक लक्षात येत नाही. खूप चांगले परिणाम हे बहुधा भविष्याचा समावेश असलेल्या परिवर्तनाचे लक्षण असते; प्रत्येक व्हेरिएबल अंदाजाच्या वेळी उपस्थित आहे की नाही याची चौकशी करा.
  • भविष्यात गर्भित पूर्वाग्रह आणणे. ऐतिहासिक डेटामधील अन्याय व्युत्पन्न वैशिष्ट्यांमध्ये लीक होऊ शकतो; वैशिष्ट्य टप्प्यावर ते तपासा.

सारांशात

वास्तविक मॉडेलिंग मुख्यतः डेटा तयार करण्याबद्दल आहे; इनपुट दूषित असल्यास, आउटपुट देखील दूषित आहे. ठराविक समस्या गहाळ मूल्ये, बाह्य, विसंगती आणि डुप्लिकेशन आहेत; गंभीर वास्तविक समस्या एक्सपोजर सामान्यीकरण आहे. वैशिष्ट्य अभियांत्रिकी — ग्रुपिंग, कोडिंग, नॉर्मलायझेशन — डेटामधून मजबूत सिग्नल मिळवते. सर्वात कपटी धोके म्हणजे डेटा लीक आणि गर्भित पूर्वाग्रह; दोन्ही फक्त एक्चुरियल तर्काने पकडले जातात. AI या पायरीला मोठ्या प्रमाणात गती देते: स्कॅनिंग कोड आणि शिफारसी व्युत्पन्न करते. परंतु कोणतेही रेकॉर्ड आपोआप हटवू नका, मानवांना लीक आणि पूर्वाग्रह तपासू द्या आणि प्रत्येक रूपांतरण मंजूर करू द्या.

अर्ज कार्य

एक छोटा निनावी पॉलिसी डेटा शब्दकोश तयार करा (5-7 स्तंभ, प्रत्येकाची वाजवी श्रेणी). AI ला (a) प्रत्येक स्तंभासाठी वाजवीपणाचे नियम आणि उल्लंघन अहवाल कोड, (b) फ्रॅक्शनल एक्सपोजर गणना, (c) प्रयत्न करण्यासाठी 3 नवीन वैशिष्ट्यांसाठी सूचना विचारा. नंतर सूचीमध्ये हेतुपुरस्सर "लीक ट्रॅप" व्हेरिएबल जोडा (उदा. "भरपाई दिलेली") आणि AI ते लीक म्हणून पकडते की नाही ते तपासा.

चेकलिस्ट

  • गहाळ आणि आउटलायर्स का हटवण्यापूर्वी मी विश्लेषण केले आहे का?
  • [ ] मी एक्सपोजर योग्यरित्या विभक्त आणि सामान्य केले आहे का?
  • [ ] मी प्रत्येक नवीन व्युत्पन्न वैशिष्ट्यासाठी एक्चुरियल औचित्य लिहिले आहे का?
  • [ ] मी प्रश्न केला आहे की प्रत्येक व्हेरिएबल प्रेडिक्शनच्या वेळी प्रत्यक्षात उपस्थित (गळती) आहे का?
  • [ ] मी व्युत्पन्न वैशिष्ट्यांमध्ये अंतर्निहित पूर्वाग्रहासाठी स्कॅन केले आहे का?
  • [ ] माझ्याकडे AI ने कोणतेही रेकॉर्ड आपोआप हटवले नाही आणि प्रत्येक निर्णयाला स्वतः मान्यता दिली नाही का?