লাভ:
- নীতিতে অনুপস্থিত মান, বহিঃপ্রকাশ, এক্সপোজার এবং ডেটা মানের সমস্যা সনাক্ত করার ক্ষমতা এবং কৃত্রিম বুদ্ধিমত্তা সহায়তার সাথে ডেটা ক্ষতি করে এবং একটি সংশোধন খসড়া তৈরি করার ক্ষমতা
- ফিচার ইঞ্জিনিয়ারিং (নতুন পরিবর্তনশীল ডেরিভেশন, গ্রুপিং, কোডিং) এবং সঠিক প্রসঙ্গের সাথে কৃত্রিম বুদ্ধিমত্তার এক্সপোজার স্বাভাবিককরণ
- বুঝুন যে কৃত্রিম বুদ্ধিমত্তা দ্বারা প্রস্তাবিত ডেটা রূপান্তরগুলি ডেটা ফাঁস এবং লুকানো পক্ষপাতের ঝুঁকির বিরুদ্ধে একজন অ্যাকচুয়ারি দ্বারা নিরীক্ষা করা উচিত।
সবচেয়ে কম কথা বলা হলেও অ্যাকচুয়ারিয়াল কাজের সবচেয়ে বেশি সময় লাগে ডেটা প্রস্তুতি। অভিজ্ঞ অভিনেতারা জানেন যে একটি মডেলিং প্রকল্পের বেশিরভাগ সময় ডেটা পরিষ্কার, একত্রিত এবং সংশোধন করতে ব্যয় করা হয়। মডেল যতই মার্জিত হোক না কেন, যদি ইনপুট ডেটা দূষিত হয়, আউটপুট দূষিত হয়—সংক্ষেপে, "আবর্জনা ভিতরে, আবর্জনা আউট।" এই ইউনিটে, আমরা নীতি এবং দাবির ডেটার সাধারণ সমস্যা, কীভাবে এআই-এর সাহায্যে সেগুলিকে শনাক্ত করা এবং ঠিক করা যায় এবং বৈশিষ্ট্য প্রকৌশলী (বিদ্যমান ডেটা থেকে আরও তথ্যপূর্ণ নতুন ভেরিয়েবল প্রাপ্ত) পদ্ধতি দেখতে পাব।
শুরু থেকেই একটি সতর্কবাণী: ডেটা প্রস্তুতি একটি আপাতদৃষ্টিতে প্রযুক্তিগত এবং নির্দোষ পদক্ষেপ, কিন্তু এখানেই সবচেয়ে বিপজ্জনক ত্রুটি লুকিয়ে থাকে। একটি ভুল এক্সপোজার স্বাভাবিকীকরণ, একটি লুকানো ডেটা ফাঁস, বা অনিচ্ছাকৃতভাবে প্রবর্তিত পক্ষপাত নীরবে সমস্ত পরবর্তী মডেলগুলিকে দূষিত করে। এআই এই পদক্ষেপটিকে ব্যাপকভাবে ত্বরান্বিত করে, কিন্তু যদি অনিয়ন্ত্রিত থাকে তবে এটি ঝুঁকিকেও বাড়িয়ে তোলে।
অ্যাকচুয়ারিয়াল ডেটার সাধারণ সমস্যা
নীতি এবং দাবি তথ্য প্রায় পরিষ্কার পৌঁছান না. সবচেয়ে সাধারণ সমস্যা হল: অনুপস্থিত মান: কিছু নীতিতে গাড়ির বয়স, পেশা বা অঞ্চল ফাঁকা আছে। অন্ধভাবে এগুলিকে গড় দিয়ে পূরণ করা পক্ষপাত সৃষ্টি করতে পারে; ঘাটতি নিজেই কখনও কখনও তথ্য বহন করে (অনুপস্থিত একটি ভিন্ন গ্রুপ)। আউটলায়ার্স: অযৌক্তিক রেকর্ড যেমন নেতিবাচক প্রিমিয়াম, 200 বছরের পুরনো বীমাকৃত, শূন্য-এক্সপোজার পলিসি। এগুলি ডেটা ত্রুটি বা বাস্তব প্রান্তের ক্ষেত্রে কিনা তা অবশ্যই আলাদা করা উচিত। অসঙ্গতি: একই অঞ্চলের বিভিন্ন বানান ("ইস্তানবুল", "ইস্তানবুল", "34"), তারিখ বিন্যাস বিভ্রান্তি। ডুপ্লিকেট এন্ট্রি: একই ক্ষতি দুবার এন্ট্রি।
কিন্তু অ্যাকচুয়ারিয়ালের জন্য নির্দিষ্ট সবচেয়ে জটিল সমস্যা হল এক্সপোজার। যদি একটি পলিসি বছরের মাঝামাঝি শুরু হয়, তবে এটি সেই বছরের জন্য একটি ভগ্নাংশের এক্সপোজার (যেমন 0.5 বছর) প্রদান করে, একটি সম্পূর্ণ "পলিসি-বছর" নয়। ফ্রিকোয়েন্সি এবং ক্ষতির হার সবসময় এক্সপোজার স্বাভাবিক করা উচিত; অন্যথায় স্বল্পমেয়াদী নীতিগুলি উচ্চ ঝুঁকিপূর্ণ বলে মনে হয়। AI এক্সপোজার গণনা কোড করতে পারে, তবে আপনাকে অবশ্যই সংজ্ঞা এবং ব্যবসার নিয়ম প্রদান করতে হবে।
নিম্নলিখিত সারণীটি সাধারণ সমস্যা এবং সঠিক পদ্ধতির সংক্ষিপ্ত বিবরণ দেয়:
সমস্যা
ভুল পদ্ধতি
সঠিক পদ্ধতি
অনুপস্থিত মান
গড় দিয়ে সব পূরণ করুন
ঘাটতি বিশ্লেষণ; কখনও কখনও একটি পৃথক বিভাগ খুলুন
outlier
অটো ডিলিট
তথ্য ত্রুটি এবং বাস্তব সীসা মধ্যে পার্থক্য
এক্সপোজার
1 বছরের জন্য সমস্ত নীতি গণনা করুন
ভগ্নাংশের এক্সপোজার গণনা করুন
বিভাগের অসঙ্গতি
উপেক্ষা
মানক অভিধানের সাথে মেলে
পুনরাবৃত্ত ক্ষতি
লক্ষ্য করবেন না
মূল ক্ষেত্রগুলির সাথে অনুলিপি করুন৷
বৈশিষ্ট্য প্রকৌশল: তথ্য থেকে জ্ঞান আহরণ
ফিচার ইঞ্জিনিয়ারিং হল নতুন ভেরিয়েবল বের করার শিল্প যা বিদ্যমান কাঁচা ভেরিয়েবল থেকে মডেলের জন্য বেশি উপযোগী। উদাহরণ: জন্ম তারিখ থেকে "বয়স", বয়স থেকে "বয়স গ্রুপ" (বাইনিং), যানবাহন তৈরির মডেল থেকে "ঝুঁকির বিভাগ", ঠিকানা-নীতি সমন্বয় থেকে "বার্ষিক মাইলেজের অনুমান"। একটি ভাল বৈশিষ্ট্য কাঁচা ডেটার তুলনায় একটি শক্তিশালী সংকেত বহন করে এবং মডেলটির যথার্থতা এবং ব্যাখ্যাযোগ্যতা উভয়ই বাড়ায়।
তিনটি কৌশল প্রায়শই অ্যাকচুয়ারিয়াল কাজে ব্যবহৃত হয়। বাঁধাই: একটি ক্রমাগত পরিবর্তনশীল (বয়স) অর্থপূর্ণ গোষ্ঠীতে বিভক্ত করা; এটি অ-রৈখিক সম্পর্ক ক্যাপচার করে এবং ট্যারিফকে পাঠযোগ্য করে তোলে। এনকোডিং: শ্রেণীগত ভেরিয়েবল (অঞ্চল) কে মডেলের জন্য উপযুক্ত একটি সংখ্যাসূচক বিন্যাসে রূপান্তর করা; ঝুঁকি-ভিত্তিক কোডিং (প্রতিটি বিভাগকে তার নিজস্ব ক্ষতির হারের সাথে উপস্থাপন করা) সাধারণ কিন্তু সতর্কতার সাথে করা উচিত। স্বাভাবিকীকরণ: সবকিছুকে তার এক্সপোজার দ্বারা ভাগ করে তুলনামূলক করা। এআই দ্রুত এই রূপান্তরের জন্য কোড তৈরি করে; কিন্তু আপনাকে অবশ্যই প্রতিটি রূপান্তরের যুক্তি অনুমোদন করতে হবে।
টিপ: টার্গেট এনকোডিং শক্তিশালী কিন্তু ডেটা ফাঁসের প্রবণ: মডেলটি "প্রতারণা করে" যদি আপনি একটি বিভাগের গড় ক্ষতি গণনা করার সময় একটি সারির নিজস্ব ক্ষতি অন্তর্ভুক্ত করেন। সর্বদা এটি প্রশিক্ষণ ডেটার মধ্যে, ক্রস-ভ্যালিডেশন প্যাটার্নে করুন।
সবচেয়ে ভয়ঙ্কর বিপদ: তথ্য ফাঁস এবং অন্তর্নিহিত পক্ষপাত
ডেটা ফাঁস হল মডেলে তথ্যের প্রবর্তন যা ভবিষ্যদ্বাণী করার সময় বাস্তবে বিদ্যমান নেই। ক্লাসিক উদাহরণ: ফলাফল ধারণকারী একটি পরিবর্তনশীল প্রবর্তন, যেমন "দাবীর অর্থ প্রদান করা হয়েছে" এমন একটি মডেলের মধ্যে যা দাবির পরিমাণের পূর্বাভাস দেয়। মডেলটি পরীক্ষার ডেটাতে নিখুঁত দেখায় কিন্তু বাস্তব জগতে অকেজো কারণ ভবিষ্যদ্বাণী করার সময় সেই তথ্যটি পাওয়া যায় না। লিকেজ প্রায়ই লুকানো থাকে এবং শুধুমাত্র সতর্ক অ্যাকচুয়ারিয়াল যুক্তি দ্বারা ধরা পড়ে — এআই সাধারণত লক্ষ্য করে না, কখনও কখনও এমনকি ফাঁস ভেরিয়েবলটিকে "খুব শক্তিশালী ভবিষ্যদ্বাণীকারী" হিসাবে প্রশংসা করে।
দ্বিতীয় প্রতারক বিপদ হল অন্তর্নিহিত পক্ষপাত। যদি ঐতিহাসিক ডেটা অন্যায়ভাবে একটি নির্দিষ্ট গোষ্ঠীর প্রতিনিধিত্ব করে (উদাহরণস্বরূপ, একটি এলাকা ঐতিহাসিকভাবে অনেকগুলি নীতি অস্বীকার করা হয়েছে), সেই ডেটা থেকে প্রাপ্ত বৈশিষ্ট্যগুলি সেই পক্ষপাত বহন করে এবং মডেলটি ভবিষ্যতে এটিকে প্রতিলিপি করে৷ বৈশিষ্ট্য ইঞ্জিনিয়ারিং পর্যায় হল সবচেয়ে গুরুত্বপূর্ণ মুহূর্ত যখন এই পক্ষপাতটি স্বীকৃত এবং সংশোধন করা যেতে পারে।
সতর্কতা: আপনি আনন্দ করার আগে যখন একটি পরিবর্তনশীল "ভবিষ্যদ্বাণী করার ক্ষমতা ব্যাপকভাবে উন্নত করে" জিজ্ঞাসা করুন: এই পরিবর্তনশীলটি কি ভবিষ্যদ্বাণীর সময় আসলে উপস্থিত ছিল, নাকি এটি ভবিষ্যতের সাথে জড়িত? একটি ফলাফল যা খুব ভাল দেখায় তা প্রায়ই একটি ফুটো একটি চিহ্ন.
ডেটা প্রস্তুতিতে এআই কীভাবে ব্যবহার করবেন
1) ডেটা গুণমান স্ক্রীনিং:
আপনার ভূমিকা: ডেটা গুণমান সহকারী। আপনার প্রকৃত নীতির ফলন আছে। কলাম: policy_id, start_date, end_date, age, region, vehicle_age, premium, claim_count, claim_amount. আমাকে একটি চেকলিস্ট এবং পাইথন (পান্ডাস) কোড স্কেচ দিন:- কলাম দ্বারা অনুপস্থিত মানগুলি গণনা করুন।- অযৌক্তিক মানগুলিকে ফ্ল্যাগ করুন (নেতিবাচক প্রিমিয়াম, বয়স, <art-01, <art-01<)। এক্সপোজার (বছরে) শুরু/শেষ থেকে। মুছে ফেলবেন না; শুধু রিপোর্ট করুন যাতে আমি সিদ্ধান্ত নিতে পারি।
2) বৈশিষ্ট্য আহরণ:
আমি আমার ট্রাফিক ডেটা থেকে নতুন বৈশিষ্ট্য পেতে চাই। উপলভ্য: বয়স, যানবাহনের_বয়স, অঞ্চল, বার্ষিক_কিমি, ব্যবহারের_প্রকার।- আপনি কোন বয়স এবং কিমি গোষ্ঠী (বিনিং) সুপারিশ করেন, কেন?- ডেটা ফাঁস ছাড়া 'অঞ্চল'-এর জন্য আমি কীভাবে ঝুঁকি-ভিত্তিক কোডিং করতে পারি?- চেষ্টা করার মতো 3টি নতুন বৈশিষ্ট্য প্রস্তাব করুন এবং প্রতিটির জন্য বাস্তবিক ন্যায্যতা লিখুন। আমি সিদ্ধান্ত নেব।
3) লিক পরিদর্শন:
আমার মডেল নিম্নলিখিত ভেরিয়েবলগুলির সাথে ক্ষতির সম্ভাবনার পূর্বাভাস দেয়: বয়স, অঞ্চল, গাড়ির_বয়স, PAID_CLAIM_FLAG, SETTLEMENT_DAYS৷ এই ভেরিয়েবলগুলির মধ্যে কোনটি ডেটা ফাঁসের ঝুঁকি তৈরি করে? প্রতিটির জন্য, এটি ভবিষ্যদ্বাণী করার সময় উপলব্ধ হবে কিনা তা মূল্যায়ন করুন। সন্দেহজনকদের তালিকা করুন এবং কেন।
4) এক্সপোজার স্বাভাবিককরণ:
আমার কিছু নীতি বছরের মাঝামাঝি শুরু হয়। সঠিকভাবে ফ্রিকোয়েন্সি গণনা করার জন্য এক্সপোজার স্বাভাবিককরণ ব্যাখ্যা করুন এবং কোড করুন: ফ্রিকোয়েন্সি = মোট দাবি_গণনা / মোট এক্সপোজার (নীতি-বছর)। বছরের মাঝামাঝি থেকে শুরু হওয়া নীতির এক্সপোজার কীভাবে গণনা করা যায় তা একটি উদাহরণ সহ দেখান।
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট:
ডেটা পরিষ্কার করুন এবং মডেলের জন্য প্রস্তুত করুন।
এআই জানে না কোন কলাম কোনটি, ব্যবসার নিয়ম, এক্সপোজার সংজ্ঞা; এটি অন্ধভাবে মুছে ফেলতে এবং পূরণ করতে পারে এবং ডেটা দূষিত করতে পারে।
শক্তিশালী প্রম্পট:
আপনার ভূমিকা: অ্যাকচুয়ারিয়াল ডেটা প্রস্তুতি সহকারী। ডেটা অভিধান: পলিসি_আইডি (পরিচয়), শুরু/শেষ_তারিখ (পলিসির সময়কাল), বয়স (প্রত্যাশিত 16-90), প্রিমিয়াম (হতে হবে >0), দাবি_গণনা (>=0), দাবি_অর্থ (>=0)। টাস্ক:1) প্রতিটি কলামের জন্য যুক্তিসঙ্গততার নিয়ম লিখুন এবং জিপিওল কোড (2) থেকে কোড লিখুন। ভগ্নাংশের এক্সপোজার গণনা করুন। 3) 'বয়স' অনুপস্থিত হওয়ার জন্য 3টি ভিন্ন কৌশল (মুছুন)। / গড় / পৃথক বিভাগ) প্লাস-মাইনাস সহ উপস্থিত; সিদ্ধান্তটি আমার উপর ছেড়ে দিন। 4) যদি এমন কোনও কলাম থাকে যা ফাঁস হওয়ার ঝুঁকি তৈরি করতে পারে তবে সতর্ক করুন। যেকোনো রেকর্ড স্বয়ংক্রিয়ভাবে মুছে ফেলা; আমি প্রতিটি সিদ্ধান্ত অনুমোদন করব।
তিনটি মিনি কেস
কেস 1 - এক্সপোজার ত্রুটি। একটি পোর্টফোলিওতে, স্বল্প-মেয়াদী (3-মাস) ভ্রমণ নীতিগুলি পূর্ণ বছর হিসাবে গণনা করা হয়েছিল, তাই ফ্রিকোয়েন্সিটি প্রকৃতপক্ষে চারগুণ কম ছিল; দাম ভুলভাবে পড়ে গেছে। যখন অ্যাকচুয়ারি একটি ভগ্নাংশ (0.25 পলিসি-বছর) হিসাবে এক্সপোজার গণনা করে, তখন প্রকৃত ফ্রিকোয়েন্সি প্রকাশিত হয়েছিল এবং ট্যারিফ সংশোধন করা হয়েছিল। AI ভগ্নাংশ এক্সপোজার কোড তৈরি করেছে; অভিনেতা সংজ্ঞা দিয়েছেন।
কেস 2 - সুপ্ত ফাঁস। যখন একজন সাহায্যকারী ক্ষতির সম্ভাবনা মডেলে "ফাইল বন্ধ করার সময়" ভেরিয়েবল যোগ করে, তখন নির্ভুলতা নাটকীয়ভাবে বৃদ্ধি পায়। আনন্দটি স্বল্পস্থায়ী ছিল: এই পরিবর্তনশীলটি শুধুমাত্র ক্ষতি হওয়ার পরেই জানা যাবে, যার অর্থ পূর্বাভাসের সময় এটি উপলব্ধ ছিল না। যখন ফুটো ভেরিয়েবলটি সরানো হয়েছিল, মডেলটি একটি বাস্তবসম্মত স্তরে হ্রাস পেয়েছে। তিনি AI ভেরিয়েবলকে "শক্তিশালী ভবিষ্যদ্বাণীকারী" হিসাবে প্রশংসা করেছিলেন; অভিযুক্তের রায় ফাঁদ ধরা.
কেস 3 - পক্ষপাতের প্রতিলিপি। একটি কোম্পানি ঐতিহাসিক তথ্য থেকে একটি "অ্যাপ্লিকেশন প্রত্যাখ্যান" প্যাটার্ন প্রাপ্ত করেছে এবং এটিকে নতুন মডেলে রেখেছে। বিশ্লেষণে দেখা গেছে যে অতীতের প্রত্যাখ্যানগুলি অসামঞ্জস্যপূর্ণভাবে একটি নির্দিষ্ট আশেপাশে কেন্দ্রীভূত ছিল, যার অর্থ একটি ঐতিহাসিক পক্ষপাত ছিল। এই বৈশিষ্ট্যটি মডেল থেকে সরানো হয়েছে এবং আরও নিরপেক্ষ ঝুঁকি সূচক দিয়ে প্রতিস্থাপিত হয়েছে। AI আশপাশের সাথে প্যাটার্নের ওভারল্যাপ পরিমাপ করে বিশ্লেষণ তৈরি করেছে; নৈতিক সিদ্ধান্ত অ্যাকচুয়ারি এবং কমপ্লায়েন্স ইউনিট দ্বারা নেওয়া হয়েছিল।
সাধারণ ভুল
- চিন্তা না করে গড় দিয়ে অনুপস্থিত মান পূরণ করা। অভাব নিজেই জ্ঞান হতে পারে; অন্ধভাবে এটি পূরণ করা কুসংস্কার তৈরি করে।
- স্বয়ংক্রিয়ভাবে outliers মুছে ফেলুন. কিছু সত্য প্রান্ত ক্ষেত্রে; ত্রুটি থেকে পৃথক না করে তথ্য মুছে ফেলা তথ্য ধ্বংস করে।
- এক্সপোজার স্বাভাবিক করা হয় না। সংক্ষিপ্ত নীতিগুলিকে পূর্ণ বছর হিসাবে গণনা করা ফ্রিকোয়েন্সি বিকৃত করে এবং মূল্যকে বিকৃত করে।
- তথ্য ফাঁস লক্ষ্য না. খুব ভাল ফলাফল প্রায়ই ভবিষ্যত জড়িত একটি পরিবর্তনশীল একটি চিহ্ন; ভবিষ্যদ্বাণী করার সময় প্রতিটি ভেরিয়েবল উপস্থিত আছে কিনা তা অনুসন্ধান করুন।
- ভবিষ্যতে অন্তর্নিহিত পক্ষপাত আনা. ঐতিহাসিক তথ্যে অবিচার উদ্ভূত বৈশিষ্ট্যে ফাঁস করতে পারে; বৈশিষ্ট্য পর্যায়ে এটি পরীক্ষা করুন.
সংক্ষেপে
অ্যাকচুয়ারিয়াল মডেলিং মূলত ডেটা প্রস্তুত করার বিষয়ে; ইনপুট দূষিত হলে, আউটপুটও দূষিত হয়। সাধারণ সমস্যা হল মান অনুপস্থিত, বহিঃপ্রকাশ, অসঙ্গতি, এবং অনুলিপি; ক্রিটিক্যাল অ্যাকচুয়ারিয়াল সমস্যা হল এক্সপোজার নরমালাইজেশন। বৈশিষ্ট্য প্রকৌশল — গ্রুপিং, কোডিং, স্বাভাবিকীকরণ — ডেটা থেকে শক্তিশালী সংকেত প্রাপ্ত করে। সবচেয়ে ভয়ঙ্কর বিপদ হল তথ্য ফাঁস এবং অন্তর্নিহিত পক্ষপাত; উভয়ই শুধুমাত্র বাস্তবিক যুক্তি দ্বারা ধরা হয়। এআই এই পদক্ষেপটিকে ব্যাপকভাবে গতি দেয়: স্ক্যানিং কোড এবং সুপারিশ তৈরি করে। কিন্তু স্বয়ংক্রিয়ভাবে কোনো রেকর্ড মুছে ফেলবেন না, মানুষকে ফাঁস এবং পক্ষপাতের জন্য পরীক্ষা করতে দিন এবং প্রতিটি রূপান্তরকে অনুমোদন করতে দিন।
আবেদন টাস্ক
একটি ছোট বেনামী নীতি ডেটা অভিধান প্রস্তুত করুন (5-7 কলাম, প্রতিটির যুক্তিসঙ্গত পরিসর)। AI-কে জিজ্ঞাসা করুন (a) প্রতিটি কলামের জন্য যুক্তিসঙ্গততার নিয়ম এবং লঙ্ঘন রিপোর্ট কোড, (b) ভগ্নাংশের এক্সপোজার গণনা, (c) 3টি নতুন বৈশিষ্ট্য চেষ্টা করার জন্য পরামর্শ। তারপরে তালিকায় একটি ইচ্ছাকৃত "লিক ট্র্যাপ" ভেরিয়েবল যোগ করুন (যেমন "ক্ষতিপূরণ দেওয়া") এবং পরীক্ষা করুন যে AI এটিকে লিক হিসাবে ধরেছে কিনা।
চেকলিস্ট
- অনুপস্থিত এবং বহিরাগত মুছে ফেলার আগে কেন আমি বিশ্লেষণ করেছি?
- [ ] আমি কি সঠিকভাবে এক্সপোজারকে ভগ্নাংশ এবং স্বাভাবিককরণ করেছি?
- [ ] আমি কি প্রতিটি নতুন প্রাপ্ত বৈশিষ্ট্যের জন্য অ্যাকচুয়ারিয়াল ন্যায্যতা লিখেছি?
- [ ] আমি কি প্রশ্ন করেছি যে ভবিষ্যদ্বাণী করার সময় প্রতিটি ভেরিয়েবল আসলে উপস্থিত (ফাঁস) কিনা?
- [ ] আমি কি প্রাপ্ত বৈশিষ্ট্যগুলিতে অন্তর্নিহিত পক্ষপাতের জন্য স্ক্যান করেছি?
- [ ] আমি কি AI স্বয়ংক্রিয়ভাবে কোনো রেকর্ড মুছে ফেলিনি এবং প্রতিটি সিদ্ধান্ত নিজেই অনুমোদন করিনি?