इकाइयाँ
1. बीमांकिक विज्ञान में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, प्रमाणीकरण और गोपनीयता 2. क्षति मॉडलिंग: आवृत्ति-गंभीरता भेदभाव और कृत्रिम बुद्धिमत्ता समर्थित विश्लेषण 3. रिजर्व (प्रावधान) खाता: आईबीएनआर, चेन लैडर और आर्टिफिशियल इंटेलिजेंस के साथ सत्यापन 4. मूल्य निर्धारण और जोखिम वर्गीकरण: जीएलएम, टैरिफिंग और आर्टिफिशियल इंटेलिजेंस 5. जीवन और सेवानिवृत्ति खाते: मृत्यु दर, वार्षिकी और देयता 6. डेटा तैयारी और फ़ीचर इंजीनियरिंग: आर्टिफिशियल इंटेलिजेंस के साथ बीमांकिक डेटा को संभालना 7. परिदृश्य विश्लेषण और तनाव परीक्षण: अनिश्चितता का प्रबंधन 8. सॉल्वेंसी II, पूंजी पर्याप्तता और मॉडल सत्यापन 9. रिपोर्टिंग और संचार: एक्चुअरी रिपोर्ट, प्रबंधन प्रस्तुति और नियामक भाषा 10. नैतिकता, भेदभाव, गोपनीयता और व्यावसायिक जिम्मेदारी 11. एंड-टू-एंड एक्चुरियल वर्कफ़्लो, एआई इंटीग्रेशन और फ्यूचर-प्रूफ़िंग
इकाई 6 / 11

डेटा तैयारी और फ़ीचर इंजीनियरिंग: आर्टिफिशियल इंटेलिजेंस के साथ बीमांकिक डेटा को संभालना

लाभ:

  • नीति में गुम मूल्यों, आउटलेर्स, एक्सपोज़र और डेटा गुणवत्ता की समस्याओं का पता लगाने और कृत्रिम बुद्धिमत्ता समर्थन के साथ डेटा को नुकसान पहुंचाने और एक सुधार मसौदा तैयार करने की क्षमता
  • फ़ीचर इंजीनियरिंग (नए चर व्युत्पत्ति, समूहीकरण, कोडिंग) और सही संदर्भ के साथ कृत्रिम बुद्धिमत्ता के लिए एक्सपोज़र सामान्यीकरण
  • समझें कि कृत्रिम बुद्धिमत्ता द्वारा सुझाए गए डेटा परिवर्तनों का डेटा रिसाव और छिपे हुए पूर्वाग्रह के जोखिम के खिलाफ एक्चुअरी द्वारा ऑडिट किया जाना चाहिए।

बीमांकिक कार्य का सबसे कम चर्चित लेकिन सबसे अधिक समय लेने वाला हिस्सा डेटा तैयार करना है। अनुभवी बीमांकिक जानते हैं कि मॉडलिंग प्रोजेक्ट का अधिकांश समय डेटा की सफाई, संयोजन और सुधार में व्यतीत होता है। कोई फर्क नहीं पड़ता कि मॉडल कितना सुंदर है, यदि इनपुट डेटा भ्रष्ट है, तो आउटपुट भ्रष्ट है - संक्षेप में, "कचरा अंदर, कचरा बाहर।" इस इकाई में, हम नीति और दावा डेटा की विशिष्ट समस्याओं को देखेंगे, एआई के साथ उनका पता कैसे लगाएं और उन्हें कैसे ठीक करें, और फीचर इंजीनियरिंग (नए चर जो मौजूदा डेटा से अधिक जानकारीपूर्ण हैं) दृष्टिकोण देखेंगे।

शुरू से ही एक चेतावनी: डेटा तैयार करना एक तकनीकी और निर्दोष कदम प्रतीत होता है, लेकिन यहीं सबसे खतरनाक त्रुटियाँ छिपी होती हैं। गलत एक्सपोज़र सामान्यीकरण, छिपा हुआ डेटा लीक, या अनजाने में पेश किया गया पूर्वाग्रह बाद के सभी मॉडलों को चुपचाप भ्रष्ट कर देता है। एआई इस कदम को काफी तेज कर देता है, लेकिन अगर इसे अनियंत्रित छोड़ दिया जाए तो यह जोखिम भी बढ़ा देता है।

बीमांकिक डेटा की विशिष्ट समस्याएं

नीति और दावों का डेटा लगभग कभी भी साफ-सुथरा नहीं आता। सबसे आम समस्याएँ हैं: गुम मान: कुछ पॉलिसियों में वाहन की आयु, व्यवसाय या क्षेत्र रिक्त होता है। आँख मूँद कर इन्हें औसत से भरने से पूर्वाग्रह पैदा हो सकता है; कमी स्वयं कभी-कभी जानकारी ले जाती है (लापता एक अलग समूह है)। आउटलायर्स: नकारात्मक प्रीमियम, 200 साल पुरानी बीमाकृत, शून्य-एक्सपोज़र पॉलिसी जैसे अतार्किक रिकॉर्ड। यह स्पष्ट किया जाना चाहिए कि ये डेटा त्रुटियाँ हैं या वास्तविक किनारे के मामले हैं। असंगतता: एक ही क्षेत्र की अलग-अलग वर्तनी ("इस्तांबुल", "इस्तांबुल", "34"), दिनांक प्रारूप भ्रम। डुप्लिकेट प्रविष्टियाँ: एक ही क्षति की दो बार प्रविष्टि।

लेकिन बीमांकिक से संबंधित सबसे महत्वपूर्ण मुद्दा एक्सपोज़र है। यदि कोई पॉलिसी मध्य वर्ष में शुरू होती है, तो यह उस वर्ष के लिए आंशिक एक्सपोज़र (जैसे 0.5 वर्ष) प्रदान करती है, न कि पूर्ण "पॉलिसी-वर्ष"। आवृत्ति और क्षति दर को हमेशा जोखिम के अनुसार सामान्यीकृत किया जाना चाहिए; अन्यथा अल्पावधि नीतियां उच्च जोखिम वाली प्रतीत होती हैं। एआई एक्सपोज़र गणना को कोड कर सकता है, लेकिन आपको परिभाषा और व्यावसायिक नियम प्रदान करना होगा।

निम्न तालिका विशिष्ट समस्याओं और सही दृष्टिकोण का सारांश प्रस्तुत करती है:

समस्या

ग़लत दृष्टिकोण

सही दृष्टिकोण

लुप्त मूल्य

सभी को औसत से भरें

कमी का विश्लेषण करें; कभी-कभी एक अलग श्रेणी खोलें

बाह्य

स्वतः हटाएं

डेटा त्रुटि और वास्तविक लीड के बीच अंतर करें

प्रदर्शन

1 वर्ष के लिए सभी पॉलिसियों की गणना करें

आंशिक एक्सपोज़र की गणना करें

श्रेणी असंगति

अनदेखा करें

मानक शब्दकोश से मिलान करें

आवर्ती क्षति

ध्यान मत दो

प्रमुख फ़ील्ड के साथ डुप्लिकेट हटाएँ

फ़ीचर इंजीनियरिंग: डेटा से ज्ञान प्राप्त करना

फ़ीचर इंजीनियरिंग नए वेरिएबल्स प्राप्त करने की कला है जो मौजूदा कच्चे वेरिएबल्स से मॉडल के लिए अधिक उपयोगी होते हैं। उदाहरण: जन्म की तारीख से "आयु", उम्र से "आयु समूह" (बिनिंग), वाहन के मेक-मॉडल से "जोखिम खंड", पता-नीति संयोजन से "वार्षिक लाभ अनुमान"। एक अच्छी सुविधा कच्चे डेटा की तुलना में अधिक मजबूत संकेत देती है और मॉडल की सटीकता और व्याख्या दोनों को बढ़ाती है।

बीमांकिक कार्य में तीन तकनीकों का अक्सर उपयोग किया जाता है। बाइंडिंग: एक सतत चर (आयु) को सार्थक समूहों में अलग करना; यह गैर-रेखीय संबंधों को पकड़ता है और टैरिफ को पठनीय बनाता है। एन्कोडिंग: श्रेणीबद्ध चर (क्षेत्र) को मॉडल के लिए उपयुक्त संख्यात्मक प्रारूप में परिवर्तित करना; जोखिम-आधारित कोडिंग (प्रत्येक श्रेणी को उसकी अपनी क्षति दर के साथ दर्शाना) आम है लेकिन इसे सावधानी से किया जाना चाहिए। सामान्यीकरण: हर चीज़ को उसके एक्सपोज़र से विभाजित करके तुलनीय बनाना। AI इन परिवर्तनों के लिए शीघ्रता से कोड तैयार करता है; लेकिन आपको प्रत्येक परिवर्तन के तर्क को स्वीकार करना होगा।

युक्ति: लक्ष्य एन्कोडिंग शक्तिशाली है लेकिन डेटा रिसाव की संभावना है: यदि आप किसी श्रेणी की औसत क्षति की गणना करते समय पंक्ति की अपनी क्षति को शामिल करते हैं तो मॉडल "धोखा" देता है। इसे हमेशा प्रशिक्षण डेटा के भीतर, क्रॉस-वैलिडेशन पैटर्न में करें।

सबसे घातक ख़तरा: डेटा लीक और अंतर्निहित पूर्वाग्रह

डेटा लीक उस मॉडल में जानकारी का परिचय है जो भविष्यवाणी के समय वास्तव में मौजूद नहीं है। उत्कृष्ट उदाहरण: परिणाम वाले एक चर को शामिल करना, जैसे कि "भुगतान किए गए दावों" को एक मॉडल में पेश करना जो दावे की राशि की भविष्यवाणी करता है। मॉडल परीक्षण डेटा में बिल्कुल सही दिखता है लेकिन वास्तविक दुनिया में बेकार है क्योंकि भविष्यवाणी के समय वह जानकारी उपलब्ध नहीं होती है। रिसाव को अक्सर छिपाया जाता है और केवल सावधानीपूर्वक बीमांकिक तर्क द्वारा ही पकड़ा जाता है - एआई आमतौर पर ध्यान नहीं देता है, कभी-कभी रिसाव वाले चर की "बहुत शक्तिशाली भविष्यवक्ता" के रूप में प्रशंसा भी करता है।

दूसरा घातक ख़तरा अंतर्निहित पूर्वाग्रह है। यदि ऐतिहासिक डेटा गलत तरीके से किसी विशेष समूह का प्रतिनिधित्व करता है (उदाहरण के लिए, किसी क्षेत्र को ऐतिहासिक रूप से कई नीतियों से वंचित किया गया है), तो उस डेटा से प्राप्त विशेषताएं उस पूर्वाग्रह को ले जाती हैं और मॉडल इसे भविष्य में दोहराता है। फ़ीचर इंजीनियरिंग चरण सबसे महत्वपूर्ण क्षण है जब इस पूर्वाग्रह को पहचाना और ठीक किया जा सकता है।

सावधानी: इससे पहले कि आप खुश हों जब एक चर "भविष्यवाणी की शक्ति में जबरदस्त सुधार करता है", पूछें: क्या यह चर वास्तव में भविष्यवाणी के समय मौजूद है, या इसमें भविष्य शामिल है? जो परिणाम बहुत अच्छा दिखता है वह अक्सर रिसाव का संकेत होता है।

डेटा तैयार करने में AI का उपयोग कैसे करें

1) डेटा गुणवत्ता स्क्रीनिंग:

आपकी भूमिका: डेटा गुणवत्ता सहायक। आपके पास बीमांकिक पॉलिसी उपज है। कॉलम: पॉलिसी_आईडी, प्रारंभ_तिथि, समाप्ति_तिथि, आयु, क्षेत्र, वाहन_आयु, प्रीमियम, दावा_गणना, दावा_राशि। मुझे एक चेकलिस्ट और पायथन (पांडा) कोड स्केच दें: - कॉलम द्वारा लापता मानों की गणना करें। - अनुचित मानों को ध्वजांकित करें (नकारात्मक प्रीमियम, आयु<16 या >100, अंत<प्रारंभ)। - प्रारंभ/अंत से आंशिक जोखिम (वर्षों में) की गणना करें। हटाएं नहीं; बस इसकी रिपोर्ट करें ताकि मैं निर्णय ले सकूं।

2) फ़ीचर व्युत्पत्ति:

मैं अपने ट्रैफ़िक डेटा से नई सुविधाएँ प्राप्त करना चाहता हूँ। उपलब्ध: आयु, वाहन_आयु, क्षेत्र, वार्षिक_किमी, उपयोग_प्रकार। - आप किस आयु और किमी समूह (बिनिंग) की अनुशंसा करते हैं, क्यों? - मैं डेटा रिसाव के बिना 'क्षेत्र' के लिए जोखिम-आधारित कोडिंग कैसे कर सकता हूं? - कोशिश करने लायक 3 नई सुविधाओं का सुझाव दें और प्रत्येक के लिए बीमांकिक औचित्य लिखें। मैं निर्णय लूंगा.

3) रिसाव निरीक्षण:

मेरा मॉडल निम्नलिखित चर के साथ क्षति की संभावना की भविष्यवाणी करता है: आयु, क्षेत्र, वाहन_आयु, PAID_CLAIM_FLAG, SETTLEMENT_DAYS। इनमें से कौन सा वेरिएबल डेटा लीक का खतरा पैदा करता है? प्रत्येक के लिए, मूल्यांकन करें कि क्या यह भविष्यवाणी के समय उपलब्ध होगा। संदिग्ध लोगों की सूची बनाएं और क्यों?

4) एक्सपोज़र सामान्यीकरण:

मेरी कुछ पॉलिसियाँ वर्ष के मध्य में शुरू होती हैं। आवृत्ति की सही गणना करने के लिए एक्सपोज़र सामान्यीकरण को समझाएं और कोड करें: आवृत्ति = कुल दावा_गणना / कुल एक्सपोज़र (पॉलिसी-वर्ष)। एक उदाहरण के साथ दिखाएँ कि वर्ष के मध्य में शुरू होने वाली पॉलिसी के एक्सपोज़र की गणना कैसे करें।

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

डेटा साफ़ करें और इसे मॉडल के लिए तैयार करें।

एआई को नहीं पता कि कौन सा कॉलम कौन सा है, व्यावसायिक नियम, एक्सपोज़र परिभाषा; यह आंख मूंदकर डेटा को डिलीट, फिल और करप्ट कर सकता है।

शक्तिशाली संकेत:

आपकी भूमिका: बीमांकिक डेटा तैयारी सहायक। डेटा शब्दकोश: पॉलिसी_आईडी (पहचान), प्रारंभ/अंत_दिनांक (पॉलिसी अवधि), आयु (अपेक्षित 16-90), प्रीमियम (>0 होना चाहिए), दावा_गणना (>=0), दावा_राशि (>=0)। कार्य:1) प्रत्येक कॉलम के लिए तर्कसंगतता नियम लिखें और रिपोर्ट उल्लंघन (हटाना)।2) आंशिक जोखिम की गणना करने के लिए कोड दें। 3) लापता 'आयु' के लिए 3 अलग-अलग रणनीतियां (हटाएं)। / औसत / अलग श्रेणी) प्लस-माइनस के साथ मौजूद; निर्णय मुझ पर छोड़ दें।4) यदि कोई कॉलम लीक होने का खतरा हो तो चेतावनी दें। किसी भी रिकॉर्ड का स्वचालित विलोपन; मैं हर फैसले को मंजूरी दूंगा.

तीन मिनी मामले

केस 1 - एक्सपोज़र त्रुटि। एक पोर्टफोलियो में, अल्पकालिक (3-महीने) यात्रा पॉलिसियों को पूरे वर्ष के रूप में गिना गया था, इसलिए आवृत्ति वास्तव में जितनी थी उससे चार गुना कम दिखाई दी; कीमत गलत तरीके से गिरी. जब एक्चुअरी ने अंश (0.25 पॉलिसी-वर्ष) के रूप में एक्सपोज़र की गणना की, तो वास्तविक आवृत्ति सामने आई और टैरिफ को सही किया गया। एआई ने भिन्नात्मक एक्सपोज़र कोड उत्पन्न किया; बीमांकिक ने परिभाषा दी.

केस 2 - गुप्त रिसाव। जब एक सहायक ने क्षति संभावना मॉडल में "फ़ाइल बंद करने का समय" चर जोड़ा, तो सटीकता में नाटकीय रूप से वृद्धि हुई। खुशी अल्पकालिक थी: इस परिवर्तन को क्षति होने के बाद ही जाना जा सकता था, जिसका अर्थ है कि यह भविष्यवाणी के समय उपलब्ध नहीं था। जब लीक वैरिएबल को हटा दिया गया, तो मॉडल यथार्थवादी स्तर तक कम हो गया। उन्होंने एआई वैरिएबल की "शक्तिशाली भविष्यवक्ता" के रूप में प्रशंसा की; बीमांकिक के फैसले ने जाल पकड़ लिया।

केस 3 - पूर्वाग्रह की प्रतिकृति। एक कंपनी ने ऐतिहासिक डेटा से "एप्लिकेशन अस्वीकृति" पैटर्न प्राप्त किया और इसे नए मॉडल में डाल दिया। विश्लेषण से पता चला कि पिछली अस्वीकृतियाँ असंगत रूप से एक विशेष पड़ोस में केंद्रित थीं, जिसका अर्थ है कि एक ऐतिहासिक पूर्वाग्रह था। इस सुविधा को मॉडल से हटा दिया गया और अधिक तटस्थ जोखिम संकेतकों के साथ बदल दिया गया। एआई ने पड़ोस के साथ पैटर्न के ओवरलैप को मापने वाला विश्लेषण तैयार किया; नैतिक निर्णय बीमांकिक और अनुपालन इकाई द्वारा किया गया था।

सामान्य गलतियाँ

  • बिना सोचे समझे लुप्त मानों को माध्य से भरना। अभाव स्वयं ज्ञान का हो सकता है; इसे आँख मूँद कर भरने से पूर्वाग्रह पैदा होता है।
  • आउटलेर्स को स्वचालित रूप से हटाएं। कुछ सच्चे किनारे के मामले हैं; डेटा को त्रुटियों से अलग किए बिना हटाने से जानकारी नष्ट हो जाती है।
  • एक्सपोज़र को सामान्य नहीं किया जा रहा है. छोटी पॉलिसियों को पूर्ण वर्ष के रूप में गिनने से आवृत्ति विकृत हो जाती है और कीमत विकृत हो जाती है।
  • डेटा लीक पर ध्यान नहीं दिया जा रहा है. बहुत अच्छा परिणाम अक्सर भविष्य से जुड़े परिवर्तन का संकेत होता है; प्रश्न करें कि क्या भविष्यवाणी के समय प्रत्येक चर मौजूद है।
  • भविष्य में अंतर्निहित पूर्वाग्रह लाना। ऐतिहासिक डेटा में अन्याय व्युत्पन्न विशेषताओं में लीक हो सकता है; फ़ीचर चरण में इसकी जाँच करें.

संक्षेप में

बीमांकिक मॉडलिंग मुख्यतः डेटा तैयार करने के बारे में है; यदि इनपुट दूषित है, तो आउटपुट भी दूषित है। विशिष्ट समस्याएं गुम मूल्य, आउटलेर, विसंगतियां और दोहराव हैं; महत्वपूर्ण बीमांकिक मुद्दा एक्सपोज़र सामान्यीकरण है। फ़ीचर इंजीनियरिंग - समूहीकरण, कोडिंग, सामान्यीकरण - डेटा से मजबूत संकेत प्राप्त करता है। सबसे खतरनाक खतरे डेटा लीक और अंतर्निहित पूर्वाग्रह हैं; दोनों को केवल बीमांकिक तर्क द्वारा ही पकड़ लिया जाता है। AI इस चरण को बहुत तेज़ कर देता है: स्कैनिंग से कोड और सिफ़ारिशें उत्पन्न होती हैं। लेकिन किसी भी रिकॉर्ड को स्वचालित रूप से न हटाएं, मनुष्यों को लीक और पूर्वाग्रह की जांच करने दें और प्रत्येक रूपांतरण को मंजूरी दें।

आवेदन कार्य

एक छोटा अनाम नीति डेटा शब्दकोश तैयार करें (5-7 कॉलम, प्रत्येक की उचित सीमा)। एआई से (ए) प्रत्येक कॉलम के लिए तर्कसंगतता नियम और उल्लंघन रिपोर्ट कोड, (बी) आंशिक एक्सपोजर गणना, (सी) 3 नई सुविधाओं के सुझाव के लिए प्रयास करें। फिर सूची में एक जानबूझकर "लीक ट्रैप" वैरिएबल जोड़ें (उदाहरण के लिए "मुआवजा भुगतान") और परीक्षण करें कि क्या एआई इसे लीक के रूप में पकड़ता है।

चेकलिस्ट

  • [ ] क्या मैंने मिसिंग और आउटलेर्स को हटाने से पहले इसका विश्लेषण किया है कि क्यों?
  • [ ] क्या मैंने एक्सपोज़र को सही ढंग से अंशांकित और सामान्यीकृत किया है?
  • [ ] क्या मैंने प्रत्येक नई व्युत्पन्न सुविधा के लिए बीमांकिक औचित्य लिखा है?
  • [ ] क्या मैंने सवाल किया है कि क्या भविष्यवाणी के समय प्रत्येक चर वास्तव में मौजूद (रिसाव) है?
  • [ ] क्या मैंने व्युत्पन्न विशेषताओं में निहित पूर्वाग्रह के लिए स्कैन किया है?
  • [ ] क्या मेरे पास AI स्वचालित रूप से किसी भी रिकॉर्ड को हटाने और प्रत्येक निर्णय को स्वयं अनुमोदित करने की सुविधा नहीं है?