નફો:
- પોલિસીમાં ગુમ થયેલ મૂલ્યો, આઉટલાયર, એક્સપોઝર અને ડેટા ગુણવત્તા સમસ્યાઓ શોધવાની ક્ષમતા અને આર્ટિફિશિયલ ઇન્ટેલિજન્સ સપોર્ટ સાથે ડેટાને નુકસાન પહોંચાડવા અને કરેક્શન ડ્રાફ્ટ તૈયાર કરવાની ક્ષમતા
- ફીચર એન્જિનિયરિંગ (નવું ચલ વ્યુત્પત્તિ, જૂથ, કોડિંગ) અને યોગ્ય સંદર્ભ સાથે કૃત્રિમ બુદ્ધિમત્તા માટે એક્સપોઝર નોર્મલાઇઝેશન
- સમજો કે આર્ટિફિશિયલ ઇન્ટેલિજન્સ દ્વારા સૂચવવામાં આવેલા ડેટા ટ્રાન્સફોર્મેશનનું ડેટા લીકેજ અને છુપાયેલા પૂર્વગ્રહના જોખમ સામે એક્ચ્યુરી દ્વારા ઓડિટ કરવું જોઈએ.
એક્ચ્યુરિયલ વર્કનો સૌથી ઓછો સમય લેતો ભાગ ડેટા તૈયાર કરવાનો છે. અનુભવી એક્ચ્યુઅરી જાણે છે કે મોડેલિંગ પ્રોજેક્ટનો મોટાભાગનો સમય ડેટાને સાફ કરવામાં, સંયોજિત કરવામાં અને સુધારવામાં પસાર થાય છે. મોડલ ગમે તેટલું ભવ્ય હોય, જો ઇનપુટ ડેટા દૂષિત હોય, તો આઉટપુટ દૂષિત છે—ટૂંકમાં, "કચરો અંદર, કચરો બહાર કાઢો." આ એકમમાં, અમે નીતિ અને દાવાઓના ડેટાની સામાન્ય સમસ્યાઓ, AI સાથે તેમને કેવી રીતે શોધી અને તેને ઠીક કરવા અને ફિચર એન્જિનિયરિંગ (નવા ચલો કે જે હાલના ડેટામાંથી વધુ માહિતીપ્રદ છે) અભિગમ જોઈશું.
શરૂઆતથી એક ચેતવણી: ડેટા તૈયાર કરવું એ મોટે ભાગે તકનીકી અને નિર્દોષ પગલું છે, પરંતુ આ તે છે જ્યાં સૌથી ખતરનાક ભૂલો છુપાવે છે. ખોટો એક્સપોઝર નોર્મલાઇઝેશન, છુપાયેલ ડેટા લીક અથવા અજાણતા રજૂ કરાયેલ પૂર્વગ્રહ પછીના તમામ મોડલ્સને ચુપચાપ દૂષિત કરે છે. AI આ પગલાને મોટા પ્રમાણમાં વેગ આપે છે, પરંતુ જો અનિયંત્રિત છોડવામાં આવે, તો તે જોખમને પણ વધારે છે.
એક્ચ્યુરિયલ ડેટાની લાક્ષણિક સમસ્યાઓ
નીતિ અને દાવાઓનો ડેટા લગભગ ક્યારેય સાફ આવતો નથી. સૌથી સામાન્ય સમસ્યાઓ છે: ગુમ થયેલ મૂલ્યો: કેટલીક નીતિઓમાં વાહનની ઉંમર, વ્યવસાય અથવા પ્રદેશ ખાલી હોય છે. આંધળાપણે આને સરેરાશ સાથે ભરવાથી પક્ષપાત થઈ શકે છે; ઉણપ પોતે કેટલીકવાર માહિતી વહન કરે છે (ગુમ થયેલ એક અલગ જૂથ છે). આઉટલિયર્સ: અતાર્કિક રેકોર્ડ્સ જેમ કે નેગેટિવ પ્રીમિયમ, 200-વર્ષ જૂનો વીમો, ઝીરો-એક્સપોઝર પોલિસી. આ ડેટા ભૂલો છે કે વાસ્તવિક ધારના કિસ્સાઓ છે કે કેમ તે ઓળખવું આવશ્યક છે. અસંગતતા: સમાન પ્રદેશની વિવિધ જોડણીઓ ("ઇસ્તાંબુલ", "ઇસ્તાંબુલ", "34"), તારીખ ફોર્મેટની મૂંઝવણ. ડુપ્લિકેટ એન્ટ્રીઓ: સમાન નુકસાનની બે વાર એન્ટ્રી.
પરંતુ એક્ચ્યુરિયલ માટે વિશિષ્ટ સૌથી જટિલ મુદ્દો એક્સપોઝર છે. જો કોઈ પોલિસી વર્ષના મધ્યમાં શરૂ થાય છે, તો તે તે વર્ષ માટે અપૂર્ણાંક એક્સપોઝર (દા.ત. 0.5 વર્ષ) પ્રદાન કરે છે, સંપૂર્ણ "પોલીસી-વર્ષ" નહીં. આવર્તન અને નુકસાન દર હંમેશા એક્સપોઝર માટે સામાન્ય કરવા જોઈએ; અન્યથા ટૂંકા ગાળાની નીતિઓ ઉચ્ચ જોખમી દેખાય છે. AI એક્સપોઝર ગણતરીને કોડ કરી શકે છે, પરંતુ તમારે વ્યાખ્યા અને વ્યવસાય નિયમ પ્રદાન કરવો આવશ્યક છે.
નીચેનું કોષ્ટક લાક્ષણિક સમસ્યાઓ અને યોગ્ય અભિગમનો સારાંશ આપે છે:
સમસ્યા
ખોટો અભિગમ
યોગ્ય અભિગમ
ખૂટતું મૂલ્ય
સરેરાશ સાથે બધા ભરો
ઉણપનું વિશ્લેષણ કરો; ક્યારેક એક અલગ શ્રેણી ખોલો
બાહ્ય
સ્વતઃ કાઢી નાખો
ડેટા ભૂલ અને વાસ્તવિક લીડ વચ્ચેનો તફાવત
એક્સપોઝર
1 વર્ષ માટેની તમામ પોલિસીની ગણતરી કરો
અપૂર્ણાંક એક્સપોઝરની ગણતરી કરો
શ્રેણીની અસંગતતા
અવગણો
પ્રમાણભૂત શબ્દકોશ સાથે મેચ કરો
પુનરાવર્તિત નુકસાન
નોટિસ નથી
કી ફીલ્ડ સાથે ડુપ્લિકેટ કરો
ફીચર એન્જિનિયરિંગ: ડેટામાંથી જ્ઞાન મેળવવું
ફીચર એન્જિનિયરિંગ એ નવા વેરિયેબલ્સ મેળવવાની કળા છે જે હાલના કાચા ચલોમાંથી મોડેલ માટે વધુ ઉપયોગી છે. ઉદાહરણો: જન્મ તારીખથી "વય", ઉંમરથી "વય જૂથ" (બિનિંગ), વાહન બનાવવાના મોડલમાંથી "જોખમ સેગમેન્ટ", સરનામાં-પોલીસી સંયોજનમાંથી "વાર્ષિક માઇલેજ અંદાજ". સારી સુવિધા કાચા ડેટા કરતાં વધુ મજબૂત સિગ્નલ ધરાવે છે અને મોડેલની ચોકસાઈ અને અર્થઘટનક્ષમતા બંનેમાં વધારો કરે છે.
એક્ચ્યુરિયલ વર્કમાં ત્રણ તકનીકોનો વારંવાર ઉપયોગ થાય છે. બંધનકર્તા: સતત ચલ (વય) ને અર્થપૂર્ણ જૂથોમાં અલગ કરવું; આ બિન-રેખીય સંબંધોને કેપ્ચર કરે છે અને ટેરિફને વાંચવા યોગ્ય બનાવે છે. એન્કોડિંગ: વર્ગીકૃત ચલો (પ્રદેશ) ને મોડેલ માટે યોગ્ય સંખ્યાત્મક ફોર્મેટમાં રૂપાંતરિત કરવું; જોખમ-આધારિત કોડિંગ (દરેક શ્રેણીને તેના પોતાના નુકસાન દર સાથે રજૂ કરે છે) સામાન્ય છે પરંતુ સાવધાની સાથે કરવું જોઈએ. સામાન્યીકરણ: દરેક વસ્તુને તેના એક્સપોઝર દ્વારા વિભાજીત કરીને તુલનાત્મક બનાવે છે. AI ઝડપથી આ પરિવર્તનો માટે કોડ જનરેટ કરે છે; પરંતુ તમારે દરેક પરિવર્તનના તર્કને મંજૂર કરવું આવશ્યક છે.
ટીપ: લક્ષ્ય એન્કોડિંગ શક્તિશાળી છે પરંતુ ડેટા લીક થવાની સંભાવના છે: જો તમે શ્રેણીના સરેરાશ નુકસાનની ગણતરી કરતી વખતે પંક્તિના પોતાના નુકસાનનો સમાવેશ કરો તો મોડેલ "ચીટ્સ" કરે છે. આ હંમેશા તાલીમ ડેટાની અંદર, ક્રોસ-વેલિડેશન પેટર્નમાં કરો.
સૌથી કપટી ભય: ડેટા લીક અને ગર્ભિત પૂર્વગ્રહ
ડેટા લિકેજ એ મોડેલમાં માહિતીનો પરિચય છે જે આગાહીના સમયે ખરેખર અસ્તિત્વમાં નથી. ઉત્તમ ઉદાહરણ: દાવાની રકમની આગાહી કરતા મોડેલમાં "દાવા ચૂકવવામાં આવ્યા" જેવા પરિણામ ધરાવતા ચલનો પરિચય. મોડેલ ટેસ્ટ ડેટામાં સંપૂર્ણ લાગે છે પરંતુ વાસ્તવિક દુનિયામાં તે નકામું છે કારણ કે તે માહિતી આગાહીના સમયે ઉપલબ્ધ નથી. લીકેજ ઘણીવાર છુપાયેલું હોય છે અને માત્ર સાવચેત એક્ચ્યુરિયલ તર્ક દ્વારા પકડવામાં આવે છે - AI સામાન્ય રીતે ધ્યાન આપતું નથી, કેટલીકવાર લીકી વેરીએબલને "ખૂબ શક્તિશાળી આગાહી કરનાર" તરીકે વખાણ પણ કરે છે.
બીજો કપટી ભય ગર્ભિત પૂર્વગ્રહ છે. જો ઐતિહાસિક ડેટા અયોગ્ય રીતે કોઈ ચોક્કસ જૂથનું પ્રતિનિધિત્વ કરે છે (ઉદાહરણ તરીકે, એક વિસ્તારને ઐતિહાસિક રીતે ઘણી બધી નીતિઓ નકારી કાઢવામાં આવી છે), તો તે ડેટામાંથી મેળવેલી સુવિધાઓ તે પૂર્વગ્રહને વહન કરે છે અને મોડેલ ભવિષ્યમાં તેની નકલ કરે છે. ફીચર એન્જિનિયરિંગ તબક્કો એ સૌથી નિર્ણાયક ક્ષણ છે જ્યારે આ પૂર્વગ્રહને ઓળખી અને સુધારી શકાય છે.
સાવધાન: જ્યારે ચલ "અનુમાનની શક્તિમાં જબરદસ્ત સુધારો કરે છે" ત્યારે તમે આનંદ કરો તે પહેલાં પૂછો: શું આ ચલ વાસ્તવમાં આગાહીના સમયે હાજર છે, અથવા તેમાં ભવિષ્ય સામેલ છે? પરિણામ જે ખૂબ સારું લાગે છે તે ઘણીવાર લીકની નિશાની છે.
ડેટાની તૈયારીમાં AI નો ઉપયોગ કેવી રીતે કરવો
1) ડેટા ગુણવત્તા તપાસ:
તમારી ભૂમિકા: ડેટા ગુણવત્તા સહાયક. તમારી પાસે એક્ચ્યુરિયલ પોલિસી યીલ્ડ છે. કૉલમ્સ: પોલિસી_આઈડી, શરૂઆતની_તારીખ, સમાપ્તિ_તારીખ, ઉંમર, પ્રદેશ, વાહન_વય, પ્રીમિયમ, દાવો_ગણતરી, દાવો_રકમ. મને એક ચેકલિસ્ટ અને પાયથોન (પાંડા) કોડ સ્કેચ આપો:- કૉલમ દ્વારા ખૂટતા મૂલ્યોની ગણતરી કરો.- ગેરવાજબી મૂલ્યોને ફ્લેગ કરો (નકારાત્મક પ્રીમિયમ, <આર્ટ-અંત, 16-016). શરૂઆત/અંતથી એક્સપોઝર (વર્ષોમાં). કાઢી નાખશો નહીં; ફક્ત તેની જાણ કરો જેથી હું નક્કી કરી શકું.
2) લક્ષણ વ્યુત્પત્તિ:
હું મારા ટ્રાફિક ડેટામાંથી નવી સુવિધાઓ મેળવવા માંગુ છું. ઉપલબ્ધ: ઉંમર, વાહન_વય, પ્રદેશ, વાર્ષિક_કિમી, વપરાશ_પ્રકાર.- તમે કયા વય અને કિમી જૂથો (બિનિંગ)ની ભલામણ કરો છો, શા માટે?- ડેટા લીક થયા વિના હું 'પ્રદેશ' માટે જોખમ-આધારિત કોડિંગ કેવી રીતે કરી શકું?- પ્રયાસ કરવા યોગ્ય 3 નવી સુવિધાઓ સૂચવો અને દરેક માટે એક્ચ્યુરિયલ વાજબીતા લખો. હું નક્કી કરીશ.
3) લીક નિરીક્ષણ:
મારું મૉડલ નીચેના ચલો સાથે નુકસાનની સંભાવનાની આગાહી કરે છે: ઉંમર, પ્રદેશ, વાહન_વય, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. આમાંથી કયા ચલો ડેટા લીક થવાનું જોખમ ઊભું કરે છે? દરેક માટે, તે આગાહીના સમયે ઉપલબ્ધ હશે કે કેમ તેનું મૂલ્યાંકન કરો. શંકાસ્પદ અને શા માટે સૂચિબદ્ધ કરો.
4) એક્સપોઝર નોર્મલાઇઝેશન:
મારી કેટલીક નીતિઓ વર્ષના મધ્યમાં શરૂ થાય છે. આવર્તનની યોગ્ય રીતે ગણતરી કરવા માટે એક્સપોઝર નોર્મલાઇઝેશન સમજાવો અને કોડ કરો: આવર્તન = કુલ દાવો_ગણતરી / કુલ એક્સપોઝર (પોલીસી-વર્ષ). વર્ષના મધ્યમાં શરૂ થતી પોલિસીના એક્સપોઝરની ગણતરી કેવી રીતે કરવી તે ઉદાહરણ સાથે બતાવો.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
ડેટા સાફ કરો અને તેને મોડેલ માટે તૈયાર કરો.
AI જાણતું નથી કે કયો કૉલમ છે, વ્યવસાયના નિયમો, એક્સપોઝરની વ્યાખ્યા; તે આંધળાપણે કાઢી શકે છે અને ડેટાને ભરી શકે છે અને બગાડી શકે છે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: એક્ચ્યુરિયલ ડેટા તૈયારી સહાયક. ડેટા શબ્દકોશ: પોલિસી_આઈડી (ઓળખ), શરૂઆત/અંતિમ_તારીખ (પોલીસી અવધિ), ઉંમર (અપેક્ષિત 16-90), પ્રીમિયમ (0 >0 હોવું જોઈએ), દાવો_ગણતરી (>=0), દાવો_રકમ (>=0). કાર્ય:1) દરેક કૉલમ અને કોડ માટે વાજબીતાનો નિયમ લખો. અપૂર્ણાંક એક્સપોઝરની ગણતરી કરો. 3) 'ઉંમર' ખૂટે છે (કાઢી નાખો) માટે 3 વિવિધ વ્યૂહરચના. / સરેરાશ / અલગ શ્રેણી) વત્તા-માઈનસ સાથે હાજર છે; નિર્ણય મારા પર છોડો. 4) જો કોઈ કૉલમ હોય તો ચેતવણી આપો જે લીક થવાનું જોખમ ઊભું કરી શકે છે. કોઈપણ રેકોર્ડને આપમેળે કાઢી નાખવા; હું દરેક નિર્ણયને મંજૂર કરીશ.
ત્રણ નાના કેસો
કેસ 1 - એક્સપોઝર ભૂલ. એક પોર્ટફોલિયોમાં, ટૂંકા ગાળાની (3-મહિનાની) ટ્રાવેલ પોલિસીને સંપૂર્ણ વર્ષ તરીકે ગણવામાં આવતી હતી, તેથી આવર્તન વાસ્તવમાં હતી તેના કરતાં ચાર ગણી ઓછી દેખાઈ હતી; કિંમત ખોટી રીતે ઘટી. જ્યારે એક્ચ્યુરી અપૂર્ણાંક (0.25 પોલિસી-વર્ષ) તરીકે એક્સપોઝરની ગણતરી કરે છે, ત્યારે વાસ્તવિક આવર્તન જાહેર કરવામાં આવી હતી અને ટેરિફમાં સુધારો કરવામાં આવ્યો હતો. AI જનરેટેડ ફ્રેક્શનલ એક્સપોઝર કોડ; એક્ચ્યુરીએ વ્યાખ્યા આપી.
કેસ 2 - સુપ્ત લીક. જ્યારે હેલ્પરે ડેમેજ પ્રોબેબિલિટી મોડેલમાં "ફાઈલ ક્લોઝર ટાઈમ" વેરીએબલ ઉમેર્યું, ત્યારે ચોકસાઈ નાટકીય રીતે વધી. આનંદ અલ્પજીવી હતો: નુકસાન થયા પછી જ આ ચલ જાણી શકાય છે, એટલે કે આગાહી સમયે તે ઉપલબ્ધ ન હતું. જ્યારે લીકી વેરીએબલ દૂર કરવામાં આવ્યું હતું, ત્યારે મોડેલ વાસ્તવિક સ્તરે ઘટ્યું હતું. તેણે AI વેરીએબલની "શક્તિશાળી આગાહી કરનાર" તરીકે પ્રશંસા કરી; એક્ચ્યુરીના ચુકાદાએ જાળ પકડી.
કેસ 3 - પૂર્વગ્રહની નકલ. એક કંપનીએ ઐતિહાસિક ડેટામાંથી "એપ્લિકેશન અસ્વીકાર" પેટર્ન મેળવ્યું અને તેને નવા મોડેલમાં મૂક્યું. વિશ્લેષણ દર્શાવે છે કે ભૂતકાળના અસ્વીકાર અપ્રમાણસર રીતે ચોક્કસ પડોશમાં કેન્દ્રિત હતા, એટલે કે ત્યાં એક ઐતિહાસિક પૂર્વગ્રહ હતો. આ સુવિધાને મોડેલમાંથી દૂર કરવામાં આવી હતી અને વધુ તટસ્થ જોખમ સૂચકાંકો સાથે બદલવામાં આવી હતી. AI એ પડોશી સાથે પેટર્નના ઓવરલેપને માપતા વિશ્લેષણનું નિર્માણ કર્યું; નૈતિક નિર્ણય એક્ચ્યુરી અને અનુપાલન એકમ દ્વારા લેવામાં આવ્યો હતો.
સામાન્ય ભૂલો
- વિચાર્યા વિના સરેરાશ સાથે ખૂટતા મૂલ્યો ભરવા. અભાવ પોતે જ્ઞાન હોઈ શકે છે; તેને આંધળી રીતે ભરવાથી પૂર્વગ્રહ પેદા થાય છે.
- આઉટલીયર્સને આપમેળે કાઢી નાખો. કેટલાક સાચા ધાર કિસ્સાઓ છે; ડેટાને ભૂલોથી અલગ કર્યા વિના કાઢી નાખવાથી માહિતીનો નાશ થાય છે.
- એક્સપોઝરને સામાન્ય બનાવતા નથી. ટૂંકી પૉલિસીને સંપૂર્ણ વર્ષ તરીકે ગણવાથી આવર્તન વિકૃત થાય છે અને કિંમત વિકૃત થાય છે.
- ડેટા લીકેજની નોંધ લેતા નથી. ખૂબ સારું પરિણામ એ ઘણીવાર ભવિષ્યને સંડોવતા ચલની નિશાની હોય છે; ક્વેરી કરો કે શું દરેક ચલ આગાહી સમયે હાજર છે.
- ભવિષ્યમાં ગર્ભિત પૂર્વગ્રહ લાવવો. ઐતિહાસિક માહિતીમાં અન્યાય વ્યુત્પન્ન લક્ષણોમાં લીક થઈ શકે છે; ફીચર સ્ટેજ પર તેને તપાસો.
સારાંશમાં
એક્ચ્યુરિયલ મોડેલિંગ મોટાભાગે ડેટા તૈયાર કરવા વિશે છે; જો ઇનપુટ દૂષિત છે, તો આઉટપુટ પણ દૂષિત છે. લાક્ષણિક સમસ્યાઓ ગુમ થયેલ મૂલ્યો, આઉટલીયર, અસંગતતા અને ડુપ્લિકેશન છે; નિર્ણાયક એક્ચ્યુરિયલ મુદ્દો એક્સપોઝર નોર્મલાઇઝેશન છે. ફીચર એન્જિનિયરિંગ — ગ્રુપિંગ, કોડિંગ, નોર્મલાઇઝેશન — ડેટામાંથી મજબૂત સંકેતો મેળવે છે. સૌથી કપટી જોખમો ડેટા લીકેજ અને ગર્ભિત પૂર્વગ્રહ છે; બંને માત્ર એક્ચ્યુરિયલ તર્ક દ્વારા કબજે કરવામાં આવે છે. AI આ પગલાને ખૂબ જ ઝડપી બનાવે છે: સ્કેનિંગ કોડ અને ભલામણો જનરેટ કરે છે. પરંતુ કોઈપણ રેકોર્ડ્સ આપમેળે કાઢી નાખશો નહીં, માનવોને લીક્સ અને પૂર્વગ્રહની તપાસ કરવા દો અને દરેક રૂપાંતરણને મંજૂરી આપો.
એપ્લિકેશન કાર્ય
એક નાનો અનામી પોલિસી ડેટા શબ્દકોશ તૈયાર કરો (5-7 કૉલમ, દરેકની વાજબી શ્રેણી). AI ને દરેક કૉલમ માટે (a) વ્યાજબીતાના નિયમ અને ઉલ્લંઘન રિપોર્ટ કોડ, (b) અપૂર્ણાંક એક્સપોઝર ગણતરી, (c) 3 નવી સુવિધાઓ અજમાવવા માટેના સૂચનો માટે પૂછો. પછી સૂચિમાં ઇરાદાપૂર્વક "લીક ટ્રેપ" ચલ ઉમેરો (દા.ત. "વળતર ચૂકવાયેલ") અને પરીક્ષણ કરો કે શું AI તેને લીક તરીકે પકડે છે.
ચેકલિસ્ટ
- [ ] શું મેં વિશ્લેષણ કર્યું છે કે ગુમ થયેલ અને આઉટલીયરને કાઢી નાખતા પહેલા શા માટે?
- [ ] શું મેં એક્સપોઝરને યોગ્ય રીતે વિભાજિત અને સામાન્ય બનાવ્યું છે?
- [ ] શું મેં દરેક નવી વ્યુત્પન્ન વિશેષતા માટે એક્ચ્યુરિયલ વાજબીપણું લખ્યું છે?
- [ ] શું મેં પ્રશ્ન કર્યો છે કે શું આગાહી સમયે દરેક ચલ વાસ્તવમાં હાજર છે (લિકેજ)?
- [ ] શું મેં વ્યુત્પન્ન સુવિધાઓમાં ગર્ભિત પૂર્વગ્રહ માટે સ્કેન કર્યું છે?
- [ ] શું મારી પાસે AI એ કોઈપણ રેકોર્ડને આપમેળે કાઢી નાખ્યો નથી અને દરેક નિર્ણયને મારી જાતે મંજૂર કર્યો છે?