ইউনিট
1. তথ্য বিজ্ঞান এবং বিশ্লেষণে কৃত্রিম বুদ্ধিমত্তার ভূমিকা: কর্মপ্রবাহ, ভূমিকা, সীমানা, বৈধতা এবং নীতিশাস্ত্র 2. ডেটা সংগ্রহ এবং উত্স বোঝা: স্কিমা, নমুনা, গুণমান এবং লিক সচেতনতা 3. ডেটা ক্লিনিং এবং প্রিপ্রসেসিং: অনুপস্থিত মান, আউটলিয়ার এবং টাইপ রূপান্তর 4. অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA): বিতরণ, সম্পর্ক, এবং প্রাথমিক অন্তর্দৃষ্টি 5. ফিচার ইঞ্জিনিয়ারিং: ভেরিয়েন্ট তৈরি করা, কোডিং, স্কেলিং এবং লিকেজ এড়ানো 6. মডেল বিল্ডিং: সমস্যা সংজ্ঞা, অ্যালগরিদম নির্বাচন, এবং প্রশিক্ষণ/পরীক্ষা বিভক্ত 7. মডেল মূল্যায়ন: মেট্রিক্স, ক্রস-ভ্যালিডেশন এবং এক্সট্রিম লার্নিং 8. ভিজ্যুয়ালাইজেশন এবং গল্প বলা: সঠিক গ্রাফিক্স, সৎ গ্রাফিক্স 9. কোড জেনারেশন: পাইথন (পান্ডা) এবং এসকিউএল দিয়ে এআই-সহায়তা বিশ্লেষণ 10. ডেটা লিকেজ এবং প্রজননযোগ্যতা: নীরব বিপর্যয় এবং শৃঙ্খলা 11. MLOps ফাউন্ডেশন, নীতিশাস্ত্র, গোপনীয়তা এবং দায়িত্বশীল বিশ্লেষণ
ইউনিট 4 / 11

অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA): বিতরণ, সম্পর্ক, এবং প্রাথমিক অন্তর্দৃষ্টি

লাভ:

  • উপযুক্ত গ্রাফ (হিস্টোগ্রাম, বক্স প্লট, স্ক্যাটার প্লট) সহ ভেরিয়েবলের বিতরণ, কেন্দ্র, স্প্রেড এবং অসঙ্গতিগুলি অন্বেষণ করার ক্ষমতা।
  • কার্যকারণে বিভ্রান্ত না করে পারস্পরিক সম্পর্ককে সঠিকভাবে ব্যাখ্যা করার এবং স্ক্যাটার প্লটের সাথে একসাথে পড়ার ক্ষমতা
  • সারাংশের পরিসংখ্যান বিভ্রান্তিকর হতে পারে তা বোঝার ক্ষমতা (Anscombe পাঠ) এবং অনুমান বিকাশ করে যা মডেলিংয়ের দিকনির্দেশ করে।

একটি মডেল তৈরি করার আগে, তথ্য জানা প্রয়োজন। একজন ডাক্তার যেমন রোগীকে পরীক্ষা না করে ওষুধ লিখে দেন না, তেমনি একজন ডেটা সায়েন্টিস্ট ডেটা "পরীক্ষা" না করে একটি মডেল তৈরি করেন না। এই পরীক্ষাটিকে অনুসন্ধানমূলক ডেটা বিশ্লেষণ (সংক্ষেপে ইডিএ) বলা হয়: এটি দৃশ্যত এবং গ্রাফিকভাবে ডেটার বিতরণ, সম্পর্ক, আশ্চর্য এবং ফাঁদ আবিষ্কার করার পর্যায়। EDA এর উদ্দেশ্য হল অনুমান তৈরি করা, ত্রুটি ধরা এবং মডেলিং এর দিকনির্দেশ করা। কৃত্রিম বুদ্ধিমত্তা এই পর্যায়ে একটি খুব শক্তিশালী সহকারী: এটি পরামর্শ দেয় কোন চার্ট উপযুক্ত, তার কোড লেখে, একটি বিতরণ ব্যাখ্যা করে। কিন্তু একজন ব্যক্তি তার/তার ক্ষেত্রের জ্ঞান দিয়ে সিদ্ধান্ত নেয়, সে যে প্যাটার্ন দেখছে তা বাস্তব নাকি কাকতালীয়।

EDA কি জন্য দেখায়?

EDA চারটি প্রশ্নের উত্তর চায়। ডিস্ট্রিবিউশন: প্রতিটি ভেরিয়েবল কীভাবে বিতরণ করা হয়—এটি কি প্রতিসম, তির্যক, নাকি দ্বি-শিখরযুক্ত? কেন্দ্রীয় প্রবণতা এবং বিস্তার: গড়, মধ্যমা, আদর্শ বিচ্যুতি কি? সম্পর্ক: ভেরিয়েবলগুলি কীভাবে একে অপরের সাথে সম্পর্কিত? অসঙ্গতি: অপ্রত্যাশিত মান, ফাঁক, গ্রুপিং আছে? এই চারটি প্রশ্ন কোন বৈশিষ্ট্য কাজ করবে এবং কোন মডেল উপযুক্ত তা নির্ধারণ করে।

আসুন কিছু মৌলিক ধারণা সংজ্ঞায়িত করা যাক। একটি হিস্টোগ্রাম হল একটি গ্রাফ যা একটি সংখ্যাসূচক পরিবর্তনশীলের মানকে ব্যবধানে বিভক্ত করে এবং দেখায় যে প্রতিটি ব্যবধানে কতগুলি পর্যবেক্ষণ রয়েছে; এটি বিতরণ দেখতে দ্রুততম উপায়। Skewness হল বণ্টনের এক দিকে স্থানান্তর; আয়ের মতো ভেরিয়েবলগুলি ডানদিকে তির্যক (সংখ্যাগরিষ্ঠ কম, কিছু খুব বেশি)। একটি বক্স প্লট এক নজরে মধ্যমা, চতুর্থাংশ এবং আউটলায়ার্স দেখায়। একটি স্ক্যাটার প্লট বিন্দুর মেঘের সাথে দুটি সংখ্যাসূচক ভেরিয়েবলের সম্পর্ক দেখায়।

পারস্পরিক সম্পর্ক: একটি সম্পর্ক আছে কিন্তু সতর্ক থাকুন

পারস্পরিক সম্পর্ক - কিভাবে দুটি ভেরিয়েবল একসাথে চলে তার একটি পরিমাপ; -1 এবং +1-এর মধ্যে একটি সংখ্যা হল EDA-র সবচেয়ে বেশি ব্যবহৃত এবং সবচেয়ে ভুল বোঝানো টুল। +1 মানে নিখুঁত সহ-বৃদ্ধি, -1 মানে নিখুঁত বিপরীত সম্পর্ক, 0 মানে রৈখিক সম্পর্ক নেই। দুটি বড় ফাঁদ আছে। প্রথমত, বিখ্যাত নিয়ম: পারস্পরিক সম্পর্ক কার্যকারণ নয়। আইসক্রিম বিক্রির সাথে সাথে দম বন্ধ হওয়ার ঘটনা বেড়েছে; একটি অন্যটির দিকে নিয়ে যায় বলে নয়, বরং গ্রীষ্ম (লুকানো তৃতীয় পরিবর্তনশীল) উভয়কেই ট্রিগার করে। দ্বিতীয়ত, পারস্পরিক সম্পর্ক শুধুমাত্র রৈখিক সম্পর্ক পরিমাপ করে; এটি 0-এর কাছাকাছি একটি শক্তিশালী কিন্তু বক্ররেখার সম্পর্ক নির্দেশ করতে পারে। তাই পারস্পরিক সম্পর্ক দেখার সময়, স্ক্যাটার প্লটটিও দেখতে ভুলবেন না।

সতর্কতা: যখন AI একটি পারস্পরিক সম্পর্ক নম্বর দেয়, তখন এটি "A বাড়ায় B" এর মতো কার্যকারণ ভাষায় চলে যেতে পারে। এটা বিপজ্জনক। পারস্পরিক সম্পর্ক শুধুমাত্র একসঙ্গে আন্দোলন নির্দেশ করে; শুধুমাত্র অভিজ্ঞতা, ডোমেইন জ্ঞান, এবং সতর্ক অনুমান কারণ স্থাপন করে।

Anscombe কোয়ার্টেট: কেন শুধু সংখ্যা তাকান না

পরিসংখ্যানে একটি বিখ্যাত উদাহরণ রয়েছে: Anscombe কোয়ার্টেট। চারটি ভিন্ন ডেটা সেটের প্রায় একই গড়, একই ভিন্নতা এবং একই পারস্পরিক সম্পর্ক (0.82); কিন্তু যখন গ্রাফ করা হয়, তখন সেগুলি সম্পূর্ণ আলাদা দেখায়—একটি সরলরেখা, একটি বাঁকা, একটি একক বহিরাগত দ্বারা টানা একটি মেঘ। পাঠটি পরিষ্কার: সারাংশ পরিসংখ্যান বিভ্রান্তিকর, গ্রাফের দিকে তাকানো আবশ্যক। AI আপনাকে গড় এবং পারস্পরিক সম্পর্ক দিতে পারে, কিন্তু গ্রাফটি না দেখে সেই সংখ্যাগুলিকে বিশ্বাস করা Anscombe ফাঁদে পড়ে যাচ্ছে।

নীচের সারণীটি সংক্ষিপ্ত করে যে চার্ট কোন প্রশ্নটির সাথে খাপ খায়:

প্রশ্ন

উপযুক্ত গ্রাফিক

কি দেখায়

একটি একক ভেরিয়েবলের বন্টন

হিস্টোগ্রাম / কেডিই

আকৃতি, তির্যকতা, শীর্ষবিন্দুর সংখ্যা

কেন্দ্র এবং outliers

বক্স প্লট

মধ্যমা, চতুর্থ, বহির্মুখী

দুই সংখ্যার সম্পর্ক

স্ক্যাটার চার্ট

দিক, শক্তি, বক্রতা

বিভাগ তুলনা

বার চার্ট

গ্রুপের মধ্যে পার্থক্য

সময়ের সাথে পরিবর্তন

লাইন চার্ট

প্রবণতা, ঋতু

বহুমুখী সম্পর্ক

পারস্পরিক সম্পর্ক তাপ মানচিত্র

সাধারণ সম্পর্ক ম্যাট্রিক্স

সিম্পসনের প্যারাডক্স: একত্রিত ডেটা মিথ্যা বলতে পারে

ইডিএ-তে একটি গোপন ফাঁদ যা সম্পর্কে সচেতন হতে হবে সিম্পসনের প্যারাডক্স: একটি প্যাটার্ন একটি দিক দেখাতে পারে যখন সমস্ত ডেটা একসাথে পরীক্ষা করা হয়, কিন্তু যখন ডেটা অর্থপূর্ণ উপগোষ্ঠীতে বিভক্ত হয় তখন বিপরীত হয়। ক্লাসিক উদাহরণ: একটি বিশ্ববিদ্যালয়ে মহিলা আবেদনকারীদের জন্য সামগ্রিক গ্রহণযোগ্যতার হার পুরুষদের তুলনায় কম বলে মনে হয়; কিন্তু বিভাগ অনুযায়ী বিভাগ দেখলে দেখা যায়, বেশিরভাগ বিভাগেই পুরুষের তুলনায় নারীদের গ্রহণযোগ্যতার হার বেশি। কোথা থেকে? মহিলারা আরও প্রতিযোগিতামূলক (নিম্ন গ্রহণযোগ্যতার হার) বিভাগে আবেদন করেছেন; সম্মিলিত সংখ্যা এই লুকানো ভেরিয়েবল সংরক্ষণ করে। পাঠটি পরিষ্কার: মোট বা গড় দেখার সময়, অর্থপূর্ণ উপগোষ্ঠীতে (সেগমেন্ট, পিরিয়ড, চ্যানেল) বিভক্ত হলে সেই সংখ্যাটি একই গল্প বলে কিনা তা পরীক্ষা করে দেখুন। যখন AI আপনাকে একটি সম্মিলিত হার দেয়, "আপনি এটিকে ভাগ করার সময় এটি এখনও বৈধ কিনা" জিজ্ঞাসা করা শুরুতেই সবচেয়ে বিভ্রান্তিকর ফলাফল ধরবে।

তিনটি মিনি কেস

কেস 1 - দুটি লুকানো পাহাড়। একজন বিশ্লেষক গড় গ্রাহক বয়স 41 খুঁজে পেয়েছেন এবং এটিকে "মধ্যবয়সী ভিড়" হিসাবে রিপোর্ট করেছেন। কিন্তু হিস্টোগ্রাম দুটি শিখর দেখিয়েছে: 22-28 এবং 55-62 বয়সের গ্রুপ। গড় 41 আসলে কাউকে প্রতিনিধিত্ব করেনি। পাঠ: গড়কে বিশ্বাস করার আগে বিতরণের পরিকল্পনা করুন।

কেস 2 - মিথ্যা পারস্পরিক সম্পর্ক। একটি দল "বিজ্ঞাপন ব্যয়" এবং "বিক্রয়" এর মধ্যে একটি 0.78 পারস্পরিক সম্পর্ক খুঁজে পেয়েছে এবং বাজেট দ্বিগুণ করেছে। যাইহোক, উভয়ই যেটি সূচনা করেছিল তা ছিল মৌসুমী প্রচারণা; প্রচার-প্রচারণার সময়, সম্পর্ক 0.10-এ নেমে আসে। 340 হাজার TL অতিরিক্ত বিজ্ঞাপন প্রত্যাশিত রিটার্ন দেয়নি। পাঠ: কার্যকারণের জন্য ভুল পারস্পরিক সম্পর্ক ব্যয়বহুল।

কেস 3 - একমাত্র বিপরীতের দ্বারা আঁকা লাইন। একটি রিয়েল এস্টেট বিশ্লেষণ বর্গ ফুটেজ এবং মূল্যের মধ্যে একটি শক্তিশালী সম্পর্ক দেখিয়েছে (r=0.80)। যখন স্ক্যাটার প্লট আঁকা হয়েছিল, প্রায় পুরো সম্পর্কটি একটি একক 12 মিলিয়ন TL বিলাসবহুল ভিলা দ্বারা তৈরি হয়েছিল; যখন সেই বিন্দুটি সরানো হয়, তখন পারস্পরিক সম্পর্ক 0.31 এ নেমে আসে। পাঠ: সর্বদা স্ক্যাটার প্লটের সাথে পারস্পরিক সম্পর্ক পড়ুন।

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) স্বয়ংক্রিয় EDA সারাংশ:

আমার কাছে পান্ডা ডিএফ আছে। তৈরি করে এমন কোড লিখুন: (1) df.info() এবং df.describe(), (2) প্রতিটি সংখ্যাসূচক কলামের জন্য হিস্টোগ্রাম, (3) প্রতিটি শ্রেণীবদ্ধ কলামের জন্য গণনা। মন্তব্য করবেন না, শুধু আবিষ্কার কোড তৈরি করুন; আমি নিদর্শন ব্যাখ্যা.

2) পারস্পরিক সম্পর্ক + চাক্ষুষ (কার্যকারণ সতর্কতার সাথে):

সাংখ্যিক কলামগুলির জন্য একটি পারস্পরিক সম্পর্ক ম্যাট্রিক্স এবং একটি তাপ মানচিত্র আঁকে এমন কোড লিখুন। এছাড়াও 3টি সর্বোচ্চ পারস্পরিক সম্পর্কযুক্ত জোড়ার একটি স্ক্যাটার প্লট আঁকুন। আউটপুটে একটি মন্তব্য লাইন যোগ করুন যা আপনাকে মনে করিয়ে দেয় যে পারস্পরিক সম্পর্ক কার্যকারণকে বোঝায় না। কার্যকারণ দাবি করবেন না।

3) বিতরণ নির্ণয়:

"আয়_টিএল" কলামের জন্য: কোড লিখুন যা হিস্টোগ্রাম, বক্স প্লট, তির্যক মান এবং মধ্যক/মান তুলনা তৈরি করে। আমি বন্টন তির্যক কি না ব্যাখ্যা করব; শুধু কোড দিন।

4) সেগমেন্ট তুলনা:

"চ্যানেল" (ওয়েব/মোবাইল) দ্বারা গ্রাহকদের তুলনা করুন: এমন কোড লিখুন যা প্রতিটি চ্যানেলের জন্য গড় পরিমাণ, গড় পরিমাণ, অর্ডারের সংখ্যা এবং পরিমাণ বিতরণের একটি বক্সপ্লট তৈরি করে। দুটি চ্যানেলের মধ্যে পার্থক্যের পরিসংখ্যানগত তাত্পর্যের জন্য কোন পরীক্ষাটি উপযুক্ত তা পরামর্শ দিন, তবে সিদ্ধান্ত আমার উপর নির্ভর করে।

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল প্রম্পট:

এই ডেটাতে আকর্ষণীয় কিছু খুঁজুন।

"আকর্ষণীয়" অনির্ধারিত; AI ডেটা দেখতে পায় না, তাই এটি হয় এটি তৈরি করে বা সাধারণ বিবৃতি দেয়। কোন দিক নেই, কোন পরিবর্তনশীল, কোন উদ্দেশ্য নেই।

শক্তিশালী প্রম্পট:

আপনার ভূমিকা: EDA সহকারী। df কলাম: বয়স (int), Income_tl (ফ্লোট), শহর (বিভাগ), চ্যানেল (ওয়েব/মোবাইল), পরিমাণ (ফ্লোট)। উদ্দেশ্য: "পরিমাণ" কে প্রভাবিত করার কারণগুলি আবিষ্কার করা। টাস্ক: (1) পরিমাণের বণ্টনের কোড প্লট করা, (2) পরিমাণ এবং বয়স এবং আয়_tl-এর মধ্যে বন্টন গ্রাফ, (3) চ্যানেল ব্রেকডাউনে পরিমাণের বক্স প্লট। একটি কার্যকারণ দাবি প্রতিষ্ঠা করা; শুধু আবিষ্কার কোড তৈরি করুন এবং আমি প্যাটার্ন ব্যাখ্যা করব।

এখানে, উদ্দেশ্য, পরিবর্তনশীলতা এবং "কারণ দাবি করার" সীমা স্পষ্ট।

সাধারণ ভুল

  • শুধুমাত্র সংক্ষিপ্ত পরিসংখ্যানের উপর নির্ভর করা। Anscombe কোয়ার্টেট দেখায়, একই গড় খুব ভিন্ন বন্টন লুকিয়ে রাখে; চার্ট দেখুন।
  • কার্যকারণ জন্য ভুল পারস্পরিক সম্পর্ক. সহ-ক্রিয়া নির্দেশ করে না যে একটি অন্যটির দিকে নিয়ে যায়; লুকানো ভেরিয়েবল থেকে সতর্ক থাকুন।
  • একটি বিক্ষিপ্ত প্লট ছাড়া পারস্পরিক সম্পর্ক খুঁজছেন. একটি একক আউটলিয়ার বা বক্রতা সংখ্যাটিকে বিভ্রান্ত করে।
  • গড় সহ একটি টু-পিকড/স্ক্যুড ডিস্ট্রিবিউশনের সারসংক্ষেপ। গড় কাউকে প্রতিনিধিত্ব করতে পারে না।
  • EDA এড়িয়ে যাওয়া এবং সরাসরি মডেলে যাওয়া। অচেনা তথ্য মানে অন্ধ মডেল।
টিপ: প্রতিটি নতুন ডেটা সেটের সাথে, প্রথম 30 মিনিট শুধু গ্রাফ অঙ্কন করুন: প্রতিটি সংখ্যার হিস্টোগ্রাম, উল্লেখযোগ্য জোড়ার স্ক্যাটার প্লট, বিভাগগুলির বার চার্ট। এই 30 মিনিট ভবিষ্যত মডেলিং ত্রুটিগুলিকে আগামী দিনের জন্য প্রতিরোধ করে৷

সংক্ষেপে

EDA হল একটি মডেল তৈরি করার আগে ডেটা জানার পর্যায় এবং চারটি প্রশ্নের উত্তর খোঁজে: বিতরণ, কেন্দ্র-স্প্রেড, সম্পর্ক এবং অসঙ্গতি। সংক্ষিপ্ত পরিসংখ্যান বিভ্রান্তিকর হতে পারে; গ্রাফের দিকে তাকানো আবশ্যক (Anscombe লেকচার)। পারস্পরিক সম্পর্ক একটি শক্তিশালী হাতিয়ার, কিন্তু কার্যকারণ নয় এবং অবশ্যই একটি স্ক্যাটার প্লটের সাথে পড়া উচিত। গ্রাফিক্স এবং কোড লেখার পরামর্শ দেওয়ার জন্য এআই একটি দুর্দান্ত এক্সিলারেটর; কিন্তু লোকেরা তাদের ক্ষেত্রের জ্ঞান দিয়ে ব্যাখ্যা করে যে তারা যে প্যাটার্নটি দেখছে তা বাস্তব নাকি কাকতালীয়।

আবেদন টাস্ক

একটি ডেটাসেট চয়ন করুন এবং শুধু EDA করুন: কমপক্ষে তিনটি সংখ্যাসূচক ভেরিয়েবলের একটি হিস্টোগ্রাম, দুই জোড়া ভেরিয়েবলের একটি স্ক্যাটার প্লট এবং একটি পারস্পরিক সম্পর্ক তাপ মানচিত্র বের করুন৷ অন্তত একটি "আশ্চর্য" খুঁজুন (যেমন দুটি চূড়া সহ একটি বিতরণ, মিথ্যা পারস্পরিক সম্পর্কের জন্য একজন প্রার্থী, একটি একক বহিরাগত দ্বারা আকৃষ্ট সম্পর্ক) এবং এটি একটি বাক্যে ব্যাখ্যা করুন। কোনো কার্যকারণ দাবি না করেই লিখুন।

চেকলিস্ট

  • [ ] আমি কি প্রতিটি সংখ্যাসূচক পরিবর্তনশীলের বন্টন গ্রাফ করেছি?
  • [ ] আমি কি স্ক্যাটারপ্লটের সাথে পারস্পরিক সম্পর্ক দেখেছি?
  • আমি কি কার্যকারণ এবং পারস্পরিক সম্পর্ক আলাদা রেখেছি?
  • [ ] আমি কি তির্যক বা দুই-শীর্ষ বিতরণ লক্ষ্য করিনি এবং গড়কে অন্ধভাবে বিশ্বাস করিনি?
  • [ ] আমি কি আমার EDA ফলাফল থেকে অন্তত একটি মডেলিং দিক/অনুমান নিয়েছি?