നേട്ടങ്ങൾ:
- പോളിസിയിലെ നഷ്ടമായ മൂല്യങ്ങൾ, ഔട്ട്ലറുകൾ, എക്സ്പോഷർ, ഡാറ്റ ഗുണനിലവാര പ്രശ്നങ്ങൾ എന്നിവ കണ്ടെത്താനും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് സപ്പോർട്ട് ഉപയോഗിച്ച് ഡാറ്റയെ നശിപ്പിക്കാനുമുള്ള കഴിവ്, ഒരു തിരുത്തൽ ഡ്രാഫ്റ്റ് നിർമ്മിക്കുക
- ഫീച്ചർ എഞ്ചിനീയറിംഗ് (പുതിയ വേരിയബിൾ ഡെറിവേഷൻ, ഗ്രൂപ്പിംഗ്, കോഡിംഗ്), ശരിയായ സന്ദർഭത്തിൽ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിലേക്കുള്ള എക്സ്പോഷർ നോർമലൈസേഷൻ
- ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് നിർദ്ദേശിക്കുന്ന ഡാറ്റാ പരിവർത്തനങ്ങൾ ഡാറ്റ ചോർച്ചയുടെയും മറഞ്ഞിരിക്കുന്ന പക്ഷപാതത്തിൻ്റെയും അപകടസാധ്യതയ്ക്കെതിരെ ഒരു ആക്ച്വറി ഓഡിറ്റ് ചെയ്യണമെന്ന് മനസ്സിലാക്കുക.
ആക്ച്വറിയൽ ജോലിയുടെ ഏറ്റവും കുറച്ച് സമയമെടുക്കുന്നതും എന്നാൽ കൂടുതൽ സമയം ചെലവഴിക്കുന്നതും ഡാറ്റ തയ്യാറാക്കലാണ്. ഒരു മോഡലിംഗ് പ്രോജക്റ്റിൻ്റെ ഭൂരിഭാഗം സമയവും ഡാറ്റ വൃത്തിയാക്കുന്നതിനും സംയോജിപ്പിക്കുന്നതിനും ശരിയാക്കുന്നതിനുമാണ് ചെലവഴിക്കുന്നതെന്ന് പരിചയസമ്പന്നരായ ആക്ച്വറികൾക്ക് അറിയാം. മോഡൽ എത്ര മനോഹരമാണെങ്കിലും, ഇൻപുട്ട് ഡാറ്റ കേടായാൽ, ഔട്ട്പുട്ട് കേടാണ്-ചുരുക്കത്തിൽ, "ഗാർബേജ് ഇൻ, ഗാർബേജ് ഔട്ട്." ഈ യൂണിറ്റിൽ, പോളിസിയുടെയും ക്ലെയിം ഡാറ്റയുടെയും സാധാരണ പ്രശ്നങ്ങൾ, AI ഉപയോഗിച്ച് അവ എങ്ങനെ കണ്ടെത്താം, പരിഹരിക്കാം, ഫീച്ചർ എഞ്ചിനീയറിംഗ് (നിലവിലുള്ള ഡാറ്റയിൽ നിന്ന് കൂടുതൽ വിവരദായകമായ പുതിയ വേരിയബിളുകൾ ഉരുത്തിരിഞ്ഞത്) സമീപനം എന്നിവ ഞങ്ങൾ കാണും.
തുടക്കം മുതലുള്ള ഒരു മുന്നറിയിപ്പ്: ഡാറ്റ തയ്യാറാക്കൽ സാങ്കേതികവും നിരപരാധിയും ആണെന്ന് തോന്നുന്ന ഒരു ഘട്ടമാണ്, എന്നാൽ ഇവിടെയാണ് ഏറ്റവും അപകടകരമായ പിശകുകൾ മറഞ്ഞിരിക്കുന്നത്. തെറ്റായ എക്സ്പോഷർ നോർമലൈസേഷൻ, മറഞ്ഞിരിക്കുന്ന ഡാറ്റ ചോർച്ച അല്ലെങ്കിൽ അറിയാതെ അവതരിപ്പിച്ച പക്ഷപാതം എന്നിവ തുടർന്നുള്ള എല്ലാ മോഡലുകളെയും നിശബ്ദമായി നശിപ്പിക്കുന്നു. AI ഈ ഘട്ടത്തെ വളരെയധികം ത്വരിതപ്പെടുത്തുന്നു, പക്ഷേ അനിയന്ത്രിതമായി വിടുകയാണെങ്കിൽ, അത് അപകടസാധ്യത വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു.
ആക്ച്വറിയൽ ഡാറ്റയുടെ സാധാരണ പ്രശ്നങ്ങൾ
പോളിസിയും ക്ലെയിം ഡാറ്റയും മിക്കവാറും ഒരിക്കലും വൃത്തിയാകില്ല. ഏറ്റവും സാധാരണമായ പ്രശ്നങ്ങൾ ഇവയാണ്: നഷ്ടമായ മൂല്യങ്ങൾ: ചില പോളിസികൾക്ക് വാഹനത്തിൻ്റെ പ്രായം, ജോലി അല്ലെങ്കിൽ പ്രദേശം എന്നിവ ശൂന്യമാണ്. അന്ധമായി ഇവ ശരാശരിയിൽ നിറയ്ക്കുന്നത് പക്ഷപാതം സൃഷ്ടിക്കും; പോരായ്മ തന്നെ ചിലപ്പോൾ വിവരങ്ങൾ വഹിക്കുന്നു (കാണാതായവർ മറ്റൊരു ഗ്രൂപ്പാണ്). ഔട്ട്ലയറുകൾ: നെഗറ്റീവ് പ്രീമിയം, 200 വർഷം പഴക്കമുള്ള ഇൻഷുറൻസ്, സീറോ-എക്സ്പോഷർ പോളിസി തുടങ്ങിയ യുക്തിരഹിതമായ രേഖകൾ. ഇവ ഡാറ്റ പിശകുകളാണോ യഥാർത്ഥ എഡ്ജ് കേസുകളാണോ എന്ന് വേർതിരിച്ചറിയണം. പൊരുത്തക്കേട്: ഒരേ പ്രദേശത്തിൻ്റെ വ്യത്യസ്ത അക്ഷരവിന്യാസങ്ങൾ ("ഇസ്താംബുൾ", "ഇസ്താംബുൾ", "34"), തീയതി ഫോർമാറ്റ് ആശയക്കുഴപ്പം. ഡ്യൂപ്ലിക്കേറ്റ് എൻട്രികൾ: ഒരേ കേടുപാടുകൾ രണ്ടുതവണ.
എന്നാൽ ആക്ച്വറിയലിൻ്റെ ഏറ്റവും നിർണായകമായ പ്രശ്നം എക്സ്പോഷർ ആണ്. ഒരു പോളിസി വർഷം പകുതിയോടെ ആരംഭിക്കുകയാണെങ്കിൽ, അത് ആ വർഷത്തേക്ക് ഒരു ഫ്രാക്ഷണൽ എക്സ്പോഷർ (ഉദാ. 0.5 വർഷം) നൽകുന്നു, പൂർണ്ണമായ "നയ-വർഷം" അല്ല. ആവൃത്തിയും കേടുപാടുകളും എല്ലായ്പ്പോഴും എക്സ്പോഷറിന് സാധാരണമാക്കണം; അല്ലെങ്കിൽ ഹ്രസ്വകാല പോളിസികൾ ഉയർന്ന അപകടസാധ്യതയുള്ളതായി തോന്നുന്നു. AI-ക്ക് എക്സ്പോഷർ കണക്കുകൂട്ടൽ കോഡ് ചെയ്യാൻ കഴിയും, എന്നാൽ നിങ്ങൾ നിർവചനവും ബിസിനസ്സ് നിയമവും നൽകണം.
ഇനിപ്പറയുന്ന പട്ടിക സാധാരണ പ്രശ്നങ്ങളും ശരിയായ സമീപനവും സംഗ്രഹിക്കുന്നു:
പ്രശ്നം
തെറ്റായ സമീപനം
ശരിയായ സമീപനം
നഷ്ടപ്പെട്ട മൂല്യം
എല്ലാം ശരാശരി ഉപയോഗിച്ച് പൂരിപ്പിക്കുക
കുറവ് വിശകലനം ചെയ്യുക; ചിലപ്പോൾ ഒരു പ്രത്യേക വിഭാഗം തുറക്കുക
പുറത്തുള്ള
സ്വയമേവ ഇല്ലാതാക്കുക
ഡാറ്റ പിശകും യഥാർത്ഥ ലീഡും തമ്മിൽ വേർതിരിക്കുക
എക്സ്പോഷർ
ഒരു വർഷത്തേക്കുള്ള എല്ലാ പോളിസികളും എണ്ണുക
ഫ്രാക്ഷണൽ എക്സ്പോഷർ കണക്കാക്കുക
വിഭാഗത്തിലെ പൊരുത്തക്കേട്
അവഗണിക്കുക
സാധാരണ നിഘണ്ടുവുമായി പൊരുത്തപ്പെടുത്തുക
ആവർത്തിച്ചുള്ള കേടുപാടുകൾ
ശ്രദ്ധിക്കരുത്
പ്രധാന ഫീൽഡുകൾ ഉപയോഗിച്ച് ഡ്യൂപ്ലിക്കേറ്റ് ചെയ്യുക
ഫീച്ചർ എഞ്ചിനീയറിംഗ്: ഡാറ്റയിൽ നിന്ന് അറിവ് നേടുന്നു
നിലവിലുള്ള റോ വേരിയബിളുകളിൽ നിന്ന് മോഡലിന് കൂടുതൽ ഉപയോഗപ്രദമായ പുതിയ വേരിയബിളുകൾ ഉരുത്തിരിയുന്ന കലയാണ് ഫീച്ചർ എഞ്ചിനീയറിംഗ്. ഉദാഹരണങ്ങൾ: ജനനത്തീയതി മുതലുള്ള "പ്രായം", പ്രായം മുതൽ "ഏജ് ഗ്രൂപ്പ്" (ബിന്നിംഗ്), വാഹന നിർമ്മാണ മോഡലിൽ നിന്നുള്ള "റിസ്ക് സെഗ്മെൻ്റ്", വിലാസ-നയ സംയോജനത്തിൽ നിന്നുള്ള "വാർഷിക മൈലേജ് എസ്റ്റിമേറ്റ്". ഒരു നല്ല ഫീച്ചർ റോ ഡാറ്റയേക്കാൾ ശക്തമായ സിഗ്നൽ വഹിക്കുകയും മോഡലിൻ്റെ കൃത്യതയും വ്യാഖ്യാനവും വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു.
ആക്ച്വറിയൽ വർക്കിൽ മൂന്ന് ടെക്നിക്കുകൾ പതിവായി ഉപയോഗിക്കുന്നു. ബൈൻഡിംഗ്: തുടർച്ചയായ വേരിയബിളിനെ (പ്രായം) അർത്ഥവത്തായ ഗ്രൂപ്പുകളായി വേർതിരിക്കുന്നു; ഇത് രേഖീയമല്ലാത്ത ബന്ധങ്ങൾ പിടിച്ചെടുക്കുകയും താരിഫ് റീഡബിൾ ആക്കുകയും ചെയ്യുന്നു. എൻകോഡിംഗ്: കാറ്റഗറിക്കൽ വേരിയബിളുകൾ (പ്രദേശം) മോഡലിന് അനുയോജ്യമായ ഒരു സംഖ്യാ ഫോർമാറ്റിലേക്ക് പരിവർത്തനം ചെയ്യുന്നു; അപകടസാധ്യത അടിസ്ഥാനമാക്കിയുള്ള കോഡിംഗ് (ഓരോ വിഭാഗത്തെയും അതിൻ്റേതായ നാശനഷ്ട നിരക്ക് പ്രതിനിധീകരിക്കുന്നു) സാധാരണമാണ്, എന്നാൽ ജാഗ്രതയോടെ ചെയ്യണം. നോർമലൈസേഷൻ: എല്ലാം അതിൻ്റെ എക്സ്പോഷർ കൊണ്ട് ഹരിച്ചുകൊണ്ട് താരതമ്യപ്പെടുത്തുന്നു. ഈ പരിവർത്തനങ്ങൾക്കുള്ള കോഡ് AI വേഗത്തിൽ സൃഷ്ടിക്കുന്നു; എന്നാൽ ഓരോ പരിവർത്തനത്തിൻ്റെയും യുക്തി നിങ്ങൾ അംഗീകരിക്കണം.
നുറുങ്ങ്: ടാർഗെറ്റ് എൻകോഡിംഗ് ശക്തമാണെങ്കിലും ഡാറ്റ ചോർച്ചയ്ക്ക് സാധ്യതയുണ്ട്: ഒരു വിഭാഗത്തിൻ്റെ ശരാശരി നാശനഷ്ടം കണക്കാക്കുമ്പോൾ ഒരു വരിയുടെ സ്വന്തം കേടുപാടുകൾ ഉൾപ്പെടുത്തിയാൽ മോഡൽ "ചതിക്കുന്നു". പരിശീലന ഡാറ്റയ്ക്കുള്ളിൽ, ക്രോസ്-വാലിഡേഷൻ പാറ്റേണിൽ ഇത് എല്ലായ്പ്പോഴും ചെയ്യുക.
ഏറ്റവും വഞ്ചനാപരമായ അപകടം: ഡാറ്റ ചോർച്ചയും പരോക്ഷമായ പക്ഷപാതവും
പ്രവചന സമയത്ത് യഥാർത്ഥത്തിൽ നിലവിലില്ലാത്ത മോഡലിലേക്ക് വിവരങ്ങൾ അവതരിപ്പിക്കുന്നതാണ് ഡാറ്റ ചോർച്ച. ക്ലാസിക് ഉദാഹരണം: ക്ലെയിം തുക പ്രവചിക്കുന്ന ഒരു മോഡലിലേക്ക് "പണമടച്ച ക്ലെയിമുകൾ" പോലെയുള്ള ഫലം ഉൾക്കൊള്ളുന്ന ഒരു വേരിയബിൾ അവതരിപ്പിക്കുന്നു. ടെസ്റ്റ് ഡാറ്റയിൽ മോഡൽ മികച്ചതായി കാണപ്പെടുന്നു, എന്നാൽ പ്രവചന സമയത്ത് ആ വിവരങ്ങൾ ലഭ്യമല്ലാത്തതിനാൽ യഥാർത്ഥ ലോകത്ത് ഉപയോഗശൂന്യമാണ്. ചോർച്ച പലപ്പോഴും മറഞ്ഞിരിക്കുകയും ശ്രദ്ധാപൂർവ്വമായ ന്യായവാദത്താൽ മാത്രം പിടിക്കപ്പെടുകയും ചെയ്യുന്നു - AI സാധാരണയായി ശ്രദ്ധിക്കില്ല, ചിലപ്പോൾ ചോർന്നൊലിക്കുന്ന വേരിയബിളിനെ "വളരെ ശക്തമായ പ്രവചനം" എന്ന് പുകഴ്ത്തുന്നു.
രണ്ടാമത്തെ വഞ്ചനാപരമായ അപകടം പരോക്ഷമായ പക്ഷപാതമാണ്. ചരിത്രപരമായ ഡാറ്റ അന്യായമായി ഒരു പ്രത്യേക ഗ്രൂപ്പിനെ പ്രതിനിധീകരിക്കുന്നുവെങ്കിൽ (ഉദാഹരണത്തിന്, ഒരു പ്രദേശത്തിന് ചരിത്രപരമായി നിരവധി നയങ്ങൾ നിരസിക്കപ്പെട്ടിട്ടുണ്ട്), ആ ഡാറ്റയിൽ നിന്ന് ഉരുത്തിരിഞ്ഞ സവിശേഷതകൾ ആ പക്ഷപാതത്തെ വഹിക്കുകയും മോഡൽ അത് ഭാവിയിലേക്ക് പകർത്തുകയും ചെയ്യുന്നു. ഈ പക്ഷപാതം തിരിച്ചറിയാനും തിരുത്താനും കഴിയുന്ന ഏറ്റവും നിർണായക നിമിഷമാണ് ഫീച്ചർ എഞ്ചിനീയറിംഗ് ഘട്ടം.
മുൻകരുതൽ: ഒരു വേരിയബിൾ “പ്രവചന ശക്തി വളരെയധികം മെച്ചപ്പെടുത്തുമ്പോൾ” നിങ്ങൾ സന്തോഷിക്കുന്നതിനുമുമ്പ് ചോദിക്കുക: പ്രവചന സമയത്ത് ഈ വേരിയബിൾ യഥാർത്ഥത്തിൽ നിലവിലുണ്ടോ അതോ ഭാവിയിൽ ഉൾപ്പെട്ടിട്ടുണ്ടോ? വളരെ മനോഹരമായി കാണപ്പെടുന്ന ഫലം പലപ്പോഴും ചോർച്ചയുടെ അടയാളമാണ്.
ഡാറ്റ തയ്യാറാക്കലിൽ AI എങ്ങനെ ഉപയോഗിക്കാം
1) ഡാറ്റ ഗുണനിലവാര സ്ക്രീനിംഗ്:
നിങ്ങളുടെ റോൾ: ഡാറ്റ ക്വാളിറ്റി അസിസ്റ്റൻ്റ്. നിങ്ങൾക്ക് ആക്ച്വറിയൽ പോളിസി യീൽഡ് ഉണ്ട്. കോളങ്ങൾ: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount.എനിക്ക് ഒരു ചെക്ക്ലിസ്റ്റും Python (pandas) കോഡ് സ്കെച്ചും തരൂ:- കാണാത്ത മൂല്യങ്ങൾ കോളം അനുസരിച്ച് എണ്ണുക.- യുക്തിരഹിതമായ മൂല്യങ്ങൾ ഫ്ലാഗ് ചെയ്യുക (നെഗറ്റീവ് പ്രീമിയം > <06 end, 10 വയസ്സ്). തുടക്കം/അവസാനം മുതൽ ഫ്രാക്ഷണൽ എക്സ്പോഷർ (വർഷങ്ങളിൽ) ഇല്ലാതാക്കരുത്; എനിക്ക് തീരുമാനിക്കാൻ കഴിയുന്ന തരത്തിൽ റിപ്പോർട്ട് ചെയ്യുക.
2) ഫീച്ചർ ഡെറിവേഷൻ:
എൻ്റെ ട്രാഫിക് ഡാറ്റയിൽ നിന്ന് പുതിയ ഫീച്ചറുകൾ ലഭിക്കാൻ ഞാൻ ആഗ്രഹിക്കുന്നു. ലഭ്യം: പ്രായം, വാഹനത്തിൻ്റെ_പ്രായം, പ്രദേശം, വാർഷിക_കി.മീ., ഉപയോഗ_തരം.- ഏത് പ്രായവും കി.മീ ഗ്രൂപ്പുകളും (ബിന്നിംഗ്) നിങ്ങൾ ശുപാർശ ചെയ്യുന്നു, എന്തുകൊണ്ട്?- ഡാറ്റ ചോർച്ചയില്ലാതെ 'മേഖല'യ്ക്കായി എനിക്ക് എങ്ങനെ അപകടസാധ്യത അടിസ്ഥാനമാക്കിയുള്ള കോഡിംഗ് നടത്താനാകും?- ഓരോന്നിൻ്റെയും യഥാർത്ഥ ന്യായീകരണം പരീക്ഷിച്ച് എഴുതേണ്ട 3 പുതിയ സവിശേഷതകൾ നിർദ്ദേശിക്കുക. ഞാൻ തീരുമാനിക്കും.
3) ചോർച്ച പരിശോധന:
എൻ്റെ മോഡൽ ഇനിപ്പറയുന്ന വേരിയബിളുകൾ ഉപയോഗിച്ച് കേടുപാടുകൾ ഉണ്ടാകാനുള്ള സാധ്യത പ്രവചിക്കുന്നു: പ്രായം, പ്രദേശം, വാഹന_പ്രായം, PAID_CLAIM_FLAG, SETTLEMENT_DAYS. ഈ വേരിയബിളുകളിൽ ഏതാണ് ഡാറ്റ ചോർച്ചയ്ക്ക് സാധ്യതയുള്ളത്? ഓരോന്നിനും, പ്രവചന സമയത്ത് അത് ലഭ്യമാകുമോ എന്ന് വിലയിരുത്തുക. സംശയാസ്പദമായവയും എന്തുകൊണ്ടെന്നും പട്ടികപ്പെടുത്തുക.
4) എക്സ്പോഷർ നോർമലൈസേഷൻ:
എൻ്റെ ചില പോളിസികൾ വർഷം പകുതിയോടെ ആരംഭിക്കുന്നു. ഫ്രീക്വൻസി ശരിയായി കണക്കാക്കാൻ എക്സ്പോഷർ നോർമലൈസേഷൻ വിശദീകരിക്കുകയും കോഡ് ചെയ്യുകയും ചെയ്യുക: ഫ്രീക്വൻസി = ടോട്ടൽ ക്ലെയിം_കൗണ്ട് / ടോട്ടൽ എക്സ്പോഷർ (നയ-വർഷം). വർഷത്തിൻ്റെ മധ്യത്തിൽ ആരംഭിക്കുന്ന പോളിസിയുടെ എക്സ്പോഷർ എങ്ങനെ കണക്കാക്കാമെന്ന് ഒരു ഉദാഹരണ സഹിതം കാണിക്കുക.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
ഡാറ്റ വൃത്തിയാക്കി മോഡലിനായി തയ്യാറാക്കുക.
ബിസിനസ്സ് നിയമങ്ങൾ, എക്സ്പോഷർ നിർവചനം, ഏത് കോളം ഏതാണെന്ന് AI-ക്ക് അറിയില്ല; ഇതിന് ഡാറ്റ അന്ധമായി ഇല്ലാതാക്കാനും പൂരിപ്പിക്കാനും കേടാക്കാനും കഴിയും.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: ആക്ച്വറിയൽ ഡാറ്റ തയ്യാറാക്കൽ അസിസ്റ്റൻ്റ്. ഡാറ്റ നിഘണ്ടു: പോളിസി_ഐഡി (ഐഡൻ്റിറ്റി), ആരംഭ/അവസാന_തീയതി (നയ കാലയളവ്), പ്രായം (പ്രതീക്ഷിക്കുന്നത് 16-90), പ്രീമിയം (>0 ആയിരിക്കണം), ക്ലെയിം_കൗണ്ട് (>=0), ക്ലെയിം_തുക (>=0). ടാസ്ക്: 1) ഓരോ കോളത്തിനും ന്യായമായ നിയമങ്ങൾ രേഖപ്പെടുത്തുക. exposure.3) 'പ്രായം' നഷ്ടപ്പെടുന്നതിനുള്ള 3 വ്യത്യസ്ത തന്ത്രങ്ങൾ (ഇല്ലാതാക്കുക). / ശരാശരി / പ്രത്യേക വിഭാഗം) പ്ലസ്-മൈനസിനൊപ്പം ഉണ്ട്; തീരുമാനം എനിക്ക് വിടുക.4) ചോർച്ചയ്ക്ക് സാധ്യതയുള്ള ഒരു കോളം ഉണ്ടെങ്കിൽ മുന്നറിയിപ്പ് നൽകുക. ഏതെങ്കിലും റെക്കോർഡ് സ്വയമേവ ഇല്ലാതാക്കൽ; എല്ലാ തീരുമാനങ്ങളും ഞാൻ അംഗീകരിക്കും.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - എക്സ്പോഷർ പിശക്. ഒരു പോർട്ട്ഫോളിയോയിൽ, ഹ്രസ്വകാല (3-മാസം) ട്രാവൽ പോളിസികൾ മുഴുവൻ വർഷങ്ങളായി കണക്കാക്കപ്പെട്ടിരുന്നു, അതിനാൽ ആവൃത്തി യഥാർത്ഥത്തിൽ ഉണ്ടായിരുന്നതിനേക്കാൾ നാലിരട്ടി കുറവാണ്; വില തെറ്റായി കുറഞ്ഞു. ആക്ച്വറി എക്സ്പോഷറിനെ ഒരു ഭിന്നസംഖ്യയായി കണക്കാക്കിയപ്പോൾ (0.25 പോളിസി വർഷം), യഥാർത്ഥ ആവൃത്തി വെളിപ്പെടുത്തുകയും താരിഫ് ശരിയാക്കുകയും ചെയ്തു. AI ഫ്രാക്ഷണൽ എക്സ്പോഷർ കോഡ് സൃഷ്ടിച്ചു; ആക്ച്വറി നിർവചനം നൽകി.
കേസ് 2 - ഒളിഞ്ഞിരിക്കുന്ന ചോർച്ച. ഒരു സഹായി "ഫയൽ ക്ലോഷർ ടൈം" വേരിയബിൾ നാശനഷ്ട സാധ്യത മോഡലിലേക്ക് ചേർത്തപ്പോൾ, കൃത്യത ഗണ്യമായി വർദ്ധിച്ചു. സന്തോഷം ഹ്രസ്വകാലമായിരുന്നു: കേടുപാടുകൾ സംഭവിച്ചതിനുശേഷം മാത്രമേ ഈ വേരിയബിൾ അറിയാൻ കഴിയൂ, അതായത് പ്രവചന സമയത്ത് അത് ലഭ്യമല്ലായിരുന്നു. ചോർന്നൊലിക്കുന്ന വേരിയബിൾ നീക്കം ചെയ്തപ്പോൾ, മോഡൽ ഒരു റിയലിസ്റ്റിക് തലത്തിലേക്ക് കുറഞ്ഞു. AI വേരിയബിളിനെ "ശക്തമായ പ്രവചനം" എന്ന് അദ്ദേഹം പ്രശംസിച്ചു; ആക്ച്വറിയുടെ വിധി കെണിയിൽ കുടുങ്ങി.
കേസ് 3 - പക്ഷപാതത്തിൻ്റെ പകർപ്പ്. ഒരു കമ്പനി ചരിത്രപരമായ ഡാറ്റയിൽ നിന്ന് ഒരു "അപ്ലിക്കേഷൻ റിജക്ഷൻ" പാറ്റേൺ ഉരുത്തിരിഞ്ഞ് പുതിയ മോഡലിൽ ഉൾപ്പെടുത്തി. മുൻകാല നിരാകരണങ്ങൾ ഒരു പ്രത്യേക അയൽപക്കത്തിൽ ആനുപാതികമായി കേന്ദ്രീകരിച്ചിട്ടില്ലെന്ന് വിശകലനം കാണിച്ചു, അതായത് ചരിത്രപരമായ ഒരു പക്ഷപാതം ഉണ്ടായിരുന്നു. ഈ ഫീച്ചർ മോഡലിൽ നിന്ന് നീക്കം ചെയ്യുകയും പകരം കൂടുതൽ ന്യൂട്രൽ റിസ്ക് ഇൻഡിക്കേറ്ററുകൾ നൽകുകയും ചെയ്തു. അയൽപക്കവുമായി പാറ്റേണിൻ്റെ ഓവർലാപ്പ് അളക്കുന്ന വിശകലനം AI നിർമ്മിച്ചു; ആക്ച്വറിയും കംപ്ലയൻസ് യൂണിറ്റും ചേർന്നാണ് ധാർമ്മിക തീരുമാനം എടുത്തത്.
സാധാരണ തെറ്റുകൾ
- നഷ്ടമായ മൂല്യങ്ങൾ ചിന്തിക്കാതെ ശരാശരി ഉപയോഗിച്ച് പൂരിപ്പിക്കുക. അഭാവം തന്നെ അറിവായിരിക്കാം; അന്ധമായി പൂരിപ്പിക്കുന്നത് മുൻവിധി സൃഷ്ടിക്കുന്നു.
- ഔട്ട്ലറുകൾ സ്വയമേവ ഇല്ലാതാക്കുക. ചിലത് യഥാർത്ഥ എഡ്ജ് കേസുകളാണ്; പിശകുകളിൽ നിന്ന് വേർതിരിക്കാതെ ഡാറ്റ ഇല്ലാതാക്കുന്നത് വിവരങ്ങൾ നശിപ്പിക്കുന്നു.
- എക്സ്പോഷർ നോർമലൈസ് ചെയ്യുന്നില്ല. ഷോർട്ട് പോളിസികളെ മുഴുവൻ വർഷങ്ങളായി കണക്കാക്കുന്നത് ആവൃത്തിയെ വളച്ചൊടിക്കുകയും വിലയെ വികലമാക്കുകയും ചെയ്യുന്നു.
- ഡാറ്റ ചോർച്ച ശ്രദ്ധിക്കുന്നില്ല. വളരെ നല്ല ഫലം പലപ്പോഴും ഭാവിയിൽ ഉൾപ്പെടുന്ന ഒരു വേരിയബിളിൻ്റെ അടയാളമാണ്; പ്രവചന സമയത്ത് ഓരോ വേരിയബിളും ഉണ്ടോ എന്ന് അന്വേഷിക്കുക.
- ഭാവിയിലേക്ക് പരോക്ഷമായ പക്ഷപാതം കൊണ്ടുവരുന്നു. ചരിത്രപരമായ ഡാറ്റയിലെ അനീതി ഉരുത്തിരിഞ്ഞ സവിശേഷതകളിലേക്ക് ചോർന്നേക്കാം; ഫീച്ചർ ഘട്ടത്തിൽ ഇത് പരിശോധിക്കുക.
ചുരുക്കത്തിൽ
ആക്ച്വറിയൽ മോഡലിംഗ് പ്രധാനമായും ഡാറ്റ തയ്യാറാക്കലാണ്; ഇൻപുട്ട് കറപ്റ്റ് ആണെങ്കിൽ ഔട്ട്പുട്ടും കറപ്റ്റ് ആണ്. നഷ്ടമായ മൂല്യങ്ങൾ, ഔട്ട്ലറുകൾ, പൊരുത്തക്കേടുകൾ, ഡ്യൂപ്ലിക്കേഷൻ എന്നിവയാണ് സാധാരണ പ്രശ്നങ്ങൾ; എക്സ്പോഷർ നോർമലൈസേഷനാണ് നിർണായകമായ പ്രശ്നം. ഫീച്ചർ എഞ്ചിനീയറിംഗ് - ഗ്രൂപ്പിംഗ്, കോഡിംഗ്, നോർമലൈസേഷൻ - ഡാറ്റയിൽ നിന്ന് ശക്തമായ സിഗ്നലുകൾ ലഭിക്കുന്നു. ഏറ്റവും വഞ്ചനാപരമായ അപകടങ്ങൾ ഡാറ്റ ചോർച്ചയും പരോക്ഷമായ പക്ഷപാതവുമാണ്; രണ്ടും വസ്തുനിഷ്ഠമായ ന്യായവാദത്താൽ മാത്രം പിടിക്കപ്പെടുന്നു. AI ഈ ഘട്ടത്തെ വളരെയധികം വേഗത്തിലാക്കുന്നു: സ്കാനിംഗ് കോഡും ശുപാർശകളും സൃഷ്ടിക്കുന്നു. എന്നാൽ ഒരു റെക്കോർഡും സ്വയമേവ ഇല്ലാതാക്കരുത്, ചോർച്ചയും പക്ഷപാതവും പരിശോധിക്കാൻ മനുഷ്യരെ അനുവദിക്കുകയും ഓരോ പരിവർത്തനവും അംഗീകരിക്കുകയും ചെയ്യുക.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു ചെറിയ അജ്ഞാത നയ ഡാറ്റ നിഘണ്ടു (5-7 കോളങ്ങൾ, ഓരോന്നിൻ്റെയും ന്യായമായ ശ്രേണി) തയ്യാറാക്കുക. (എ) ഓരോ നിരയുടെയും ന്യായമായ നിയമവും ലംഘന റിപ്പോർട്ട് കോഡും, (ബി) ഫ്രാക്ഷണൽ എക്സ്പോഷർ കണക്കുകൂട്ടൽ, (സി) പരീക്ഷിക്കുന്നതിനുള്ള 3 പുതിയ ഫീച്ചറുകൾക്കുള്ള നിർദ്ദേശങ്ങൾ എന്നിവയ്ക്കായി AI-യോട് ചോദിക്കുക. തുടർന്ന് ലിസ്റ്റിലേക്ക് മനഃപൂർവമായ ഒരു “ലീക്ക് ട്രാപ്പ്” വേരിയബിൾ ചേർക്കുക (ഉദാ: “നഷ്ടപരിഹാരം നൽകി”) കൂടാതെ AI അത് ചോർച്ചയായി പിടിക്കുന്നുണ്ടോയെന്ന് പരിശോധിക്കുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] കാണാത്തതും പുറത്തുള്ളവയും ഇല്ലാതാക്കുന്നതിന് മുമ്പ് എന്തുകൊണ്ടെന്ന് ഞാൻ വിശകലനം ചെയ്തിട്ടുണ്ടോ?
- [ ] ഞാൻ എക്സ്പോഷർ ശരിയായി ഭിന്നിപ്പിച്ച് നോർമലൈസ് ചെയ്തിട്ടുണ്ടോ?
- [ ] പുതുതായി ഉരുത്തിരിഞ്ഞ ഓരോ ഫീച്ചറിനും ഞാൻ യഥാർത്ഥ ന്യായീകരണം എഴുതിയിട്ടുണ്ടോ?
- [ ] പ്രവചന സമയത്ത് ഓരോ വേരിയബിളും യഥാർത്ഥത്തിൽ (ലീക്കേജ്) ഉണ്ടോ എന്ന് ഞാൻ ചോദ്യം ചെയ്തിട്ടുണ്ടോ?
- [ ] ഉരുത്തിരിഞ്ഞ ഫീച്ചറുകളിൽ പരോക്ഷമായ പക്ഷപാതത്തിനായി ഞാൻ സ്കാൻ ചെയ്തിട്ടുണ്ടോ?
- [ ] AI സ്വയമേവ ഏതെങ്കിലും രേഖകൾ ഇല്ലാതാക്കുകയും എല്ലാ തീരുമാനങ്ങളും സ്വയം അംഗീകരിക്കുകയും ചെയ്തില്ലേ?