ইউনিট
1. তথ্য বিজ্ঞান এবং বিশ্লেষণে কৃত্রিম বুদ্ধিমত্তার ভূমিকা: কর্মপ্রবাহ, ভূমিকা, সীমানা, বৈধতা এবং নীতিশাস্ত্র 2. ডেটা সংগ্রহ এবং উত্স বোঝা: স্কিমা, নমুনা, গুণমান এবং লিক সচেতনতা 3. ডেটা ক্লিনিং এবং প্রিপ্রসেসিং: অনুপস্থিত মান, আউটলিয়ার এবং টাইপ রূপান্তর 4. অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA): বিতরণ, সম্পর্ক, এবং প্রাথমিক অন্তর্দৃষ্টি 5. ফিচার ইঞ্জিনিয়ারিং: ভেরিয়েন্ট তৈরি করা, কোডিং, স্কেলিং এবং লিকেজ এড়ানো 6. মডেল বিল্ডিং: সমস্যা সংজ্ঞা, অ্যালগরিদম নির্বাচন, এবং প্রশিক্ষণ/পরীক্ষা বিভক্ত 7. মডেল মূল্যায়ন: মেট্রিক্স, ক্রস-ভ্যালিডেশন এবং এক্সট্রিম লার্নিং 8. ভিজ্যুয়ালাইজেশন এবং গল্প বলা: সঠিক গ্রাফিক্স, সৎ গ্রাফিক্স 9. কোড জেনারেশন: পাইথন (পান্ডা) এবং এসকিউএল দিয়ে এআই-সহায়তা বিশ্লেষণ 10. ডেটা লিকেজ এবং প্রজননযোগ্যতা: নীরব বিপর্যয় এবং শৃঙ্খলা 11. MLOps ফাউন্ডেশন, নীতিশাস্ত্র, গোপনীয়তা এবং দায়িত্বশীল বিশ্লেষণ
ইউনিট 2 / 11

ডেটা সংগ্রহ এবং উত্স বোঝা: স্কিমা, নমুনা, গুণমান এবং লিক সচেতনতা

লাভ:

  • বিভিন্ন ডেটা উত্স (ডাটাবেস, API, ফাইল, ওয়েব স্ক্র্যাপিং) এবং প্রতিটির ত্রুটিগুলি সনাক্ত করার এবং স্কিমা সঠিকভাবে বোঝার ক্ষমতা
  • নমুনা জনসংখ্যা এবং নির্বাচন পক্ষপাত প্রতিনিধিত্ব করে কিনা তা মূল্যায়ন করে পুনরাবৃত্তিযোগ্য নমুনা সঞ্চালনের ক্ষমতা
  • সংগ্রহের পর্যায়ে ডেটা ফাঁস দূর করার ক্ষমতা এবং প্রতিটি কলামে 'পূর্বাভাস দেওয়ার সময় এটি আমার কাছে থাকবে' প্রশ্ন জিজ্ঞাসা করে আইনী/নৈতিক সীমানা পর্যবেক্ষণ করার ক্ষমতা?

প্রতিটি বিশ্লেষণ আপনার সংগ্রহ করা ডেটার গুণমানের মতোই ভাল। এমনকি বিশ্বের সবচেয়ে উন্নত মডেলটিও অবিশ্বস্ত ফলাফল আনবে যদি এটি এমন ডেটার সাথে কাজ করে যা ভুলভাবে সংগ্রহ করা হয়, পক্ষপাতমূলকভাবে নমুনা করা হয় বা ভবিষ্যতের তথ্য রয়েছে। কম্পিউটার বিজ্ঞানে, এই নীতিটিকে "আবর্জনা ইন, আবর্জনা আউট" (আবর্জনা ইন, আবর্জনা আউট) হিসাবে সংক্ষিপ্ত করা হয়েছে। এই ইউনিটে, আমরা ডেটা সংগ্রহের পর্যায়টি কভার করব: উত্স বোঝা, নমুনা নেওয়া, গুণমানের প্রশ্ন জিজ্ঞাসা করা এবং প্রথম দিন থেকে ডেটা ফাঁসের ঝুঁকি সম্পর্কে সতর্ক থাকা। কৃত্রিম বুদ্ধিমত্তা এই পর্যায়ে একটি শক্তিশালী সাহায্য; এসকিউএল কোয়েরি লেখে, API নথির সারসংক্ষেপ করে, ডেটা চুক্তির খসড়া তৈরি করে। কিন্তু আপনি কোন ডেটা সংগ্রহ করেন এবং সেই ডেটা আপনাকে প্রতিনিধিত্ব করে কিনা তা মানুষই নির্ধারণ করে।

তথ্যের উৎস সম্পর্কে জানা

ডেটা বিভিন্ন জায়গা থেকে আসে এবং প্রতিটি উৎসের নিজস্ব ত্রুটি রয়েছে। ডেটাবেস (সারণীতে সংরক্ষিত কাঠামোগত ডেটা, সাধারণত এসকিউএল দিয়ে জিজ্ঞাসা করা হয়) হল সবচেয়ে সাধারণ উৎস; এটি নির্ভরযোগ্য, তবে এটির স্কিমটি ভালভাবে বোঝা প্রয়োজন। API (অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস) লাইভ ডেটা সরবরাহ করে তবে গতি সীমা এবং বিন্যাস পরিবর্তনের ঝুঁকি বহন করে। ফাইলগুলি (CSV, Excel, JSON) নমনীয় কিন্তু বিন্যাসের অসঙ্গতি প্রবণ। ওয়েব স্ক্র্যাপিং শক্তিশালী, কিন্তু এর আইনি এবং নৈতিক সীমা রয়েছে; প্রতিটি সাইট স্ক্র্যাপ করা যাবে না.

মনোযোগ: ওয়েব স্ক্র্যাপিং এবং স্বয়ংক্রিয় ডেটা সংগ্রহের জন্য, সাইটের ব্যবহারের শর্তাবলী, robots.txt ফাইল এবং KVKK/GDPR মেনে চলুন। অননুমোদিত তথ্য সংগ্রহ আইনি দায় তৈরি করে। তথ্য নিরাপত্তার প্রেক্ষাপটে, শুধুমাত্র সেই সিস্টেমে ডেটা সংগ্রহের টুল ব্যবহার করুন যার জন্য আপনি অনুমোদিত এবং প্রতিরক্ষা/বিশ্লেষণের উদ্দেশ্যে; অননুমোদিত প্রবেশ বা স্ক্র্যাপিং নিষিদ্ধ.

স্কিমা বোঝা: ডেটার সাথে পরিচিত হওয়া

একটি ডেটা সেট সংগ্রহ করার আগে, আপনাকে অবশ্যই এর স্কিমা বুঝতে হবে (কলামগুলির নাম, তাদের ডেটা প্রকার, তাদের অর্থ এবং একে অপরের সাথে তাদের সম্পর্ক)। AI এখানে একটি "ডেটা ডিকশনারী" তৈরি করতে খুবই উপযোগী - প্রতিটি কলামের অর্থ কী তা ব্যাখ্যা করে একটি টেবিল। কিন্তু AI যে ব্যাখ্যাগুলি তৈরি করে তা হল ভবিষ্যদ্বাণী; ডেটা তৈরিকারী দলের সাথে প্রতিটি কলামের প্রকৃত অর্থ নিশ্চিত করুন। উদাহরণস্বরূপ, "স্থিতি" নামের একটি কলামে 0/1/2 থাকতে পারে; শুধুমাত্র উদ্ভূত দলই জানে যে এগুলো "মুলতুবি/অনুমোদিত/বাতিল" নাকি অন্য কিছু।

নিম্নলিখিত সারণীতে মৌলিক সম্পদের ধরন এবং সতর্কতাগুলি সংক্ষিপ্ত করা হয়েছে:

উৎস

শক্তিশালী পয়েন্ট

ফাঁদ

কিভাবে AI সাহায্য করে

এসকিউএল ডাটাবেস

কাঠামোগত, নির্ভরযোগ্য

জটিল যোগদান

একটি প্রশ্নের খসড়া লেখেন

API

লাইভ ডেটা

গতি সীমা, আকৃতি পরিবর্তন

নথির সারাংশ, কোড টানুন

CSV/এক্সেল

নমনীয়, দ্রুত

বিন্যাসের অসঙ্গতি

কোড পড়ুন/পার্স করুন

ওয়েব স্ক্র্যাপিং

ব্যাপক নাগাল

আইনি/নৈতিক সীমা

খসড়া পার্সিং (কর্তৃপক্ষের মধ্যে)

লগ/ইভেন্ট ডেটা

বিস্তারিত

বিশাল আয়তন

ফিল্টারিং ক্যোয়ারী

দৃষ্টান্ত: অংশ কি সমগ্র প্রতিনিধিত্ব করে?

বেশিরভাগ সময়, আপনি পুরো ডেটার পরিবর্তে একটি নমুনা (জনসংখ্যা থেকে নির্বাচিত একটি উপসেট) নিয়ে কাজ করেন। সমালোচনামূলক প্রশ্ন হল: এই নমুনা কি জনসংখ্যার প্রতিনিধিত্ব করে? নির্বাচন পক্ষপাত সবচেয়ে সাধারণ ফাঁদ. উদাহরণস্বরূপ, আপনি যদি শুধুমাত্র মোবাইল অ্যাপ থেকে ব্যবহারকারীদের নমুনা নেন, তাহলে আপনি ওয়েব ব্যবহারকারীদের দেখতে পাবেন না এবং আপনার ফলাফল বিভ্রান্তিকর হবে। এলোমেলো নমুনা (প্রতিটি রেকর্ডে নির্বাচিত হওয়ার সমান সুযোগ রয়েছে) বেশিরভাগ ক্ষেত্রেই সবচেয়ে নিরাপদ; কিন্তু টাইম সিরিজ ডেটাতে, বিভাজন এলোমেলোভাবে না করে কালানুক্রমিকভাবে করা হয় (আমরা ইউনিট 7 এবং 10 এ এটি দেখতে পাব)।

প্রথম দিন থেকে সচেতনতা ফাঁস

ডেটা ফাঁস বেশিরভাগ বিপর্যয়ের উত্স এবং সাধারণত ডেটা সংগ্রহের পর্যায়ে উদ্ভূত হয়। উদাহরণ: ভবিষ্যদ্বাণী করার সময় "এটি বাতিল করা হয়েছিল", আপনি যদি ডেটাতে "বাতিল তারিখ" কলাম যোগ করেন, মডেলটি ভবিষ্যতের দিকে নজর দেয়। সংগ্রহের পর্বের সময়, প্রতিটি কলামের জন্য একটি প্রশ্ন জিজ্ঞাসা করুন: "আমি ভবিষ্যদ্বাণী করার সময় কি আসলেই এই তথ্য থাকবে?" উত্তর না হলে, সেই কলামটি লিক হচ্ছে। আমরা ইউনিট 10 এ এই বিষয়টি গভীরভাবে কভার করব; তবে সচেতনতা শুরু করা উচিত প্রথম দিন থেকেই।

তিনটি মিনি কেস

কেস 1 - প্রতিনিধিত্বের সমস্যা। একটি ব্যাংক তার ক্রেডিট রিস্ক মডেলের (18,500 রেকর্ড) জন্য শুধুমাত্র অনুমোদিত ঋণের তথ্য সংগ্রহ করেছে। প্রত্যাখ্যান তথ্য ছিল না. মডেলটি বাস্তব জগতে ভুল ছিল কারণ এটি কখনই দেখেনি যে প্রত্যাখ্যান কীভাবে আচরণ করবে। পাঠ: নমুনাটি সমগ্র জনসংখ্যার প্রতিনিধি হওয়া উচিত যেখান থেকে আপনি আপনার সিদ্ধান্ত নিচ্ছেন।

কেস 2 — নীরব ফর্ম পরিবর্তন। একটি দল প্রতিদিন একটি API থেকে দামের ডেটা তুলছিল। একদিন, API প্রদানকারী মুদ্রা পরিবর্তন করে USD থেকে EUR করে, কিন্তু ডোমেনের নাম একই ছিল। 12 দিনের জন্য ভুল ইউনিটে ডেটা সংগ্রহ করা হয়েছিল; 3,200টি লাইন নষ্ট হয়ে গেছে। পাঠ: নিয়মিতভাবে API ডেটাতে ভলিউম এবং বিন্যাসের ধারাবাহিকতা পরীক্ষা করুন।

কেস 3 - প্রারম্ভিক ফুটো। একটি "মন্থন" অনুমানের জন্য ডেটা সংগ্রহ করার সময় একজন বিশ্লেষক "অ্যাকাউন্ট বন্ধের কারণ" কলামটি অন্তর্ভুক্ত করেছেন। গ্রাহক চলে যাওয়ার পরেই এই কলামটি পূরণ করা হয়েছিল। মডেলটি পরীক্ষার সেটে 97% নির্ভুলতা দিয়েছে; এটি উত্পাদনে কাজ করেনি কারণ পূর্বাভাসের সময় সেই কলামটি খালি ছিল। পাঠ: প্রতিটি কলামে প্রশ্ন জিজ্ঞাসা করুন "আমার কাছে কি ভবিষ্যদ্বাণী করার সময় এটি আছে?"

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) ডেটা অভিধান নিষ্কাশন:

আপনার ভূমিকা: তথ্য বিজ্ঞানী সহকারী। নীচে একটি টেবিলের কলামের নাম এবং নমুনা (বেনামী) মান রয়েছে। প্রতিটি কলামের জন্য, একটি টেবিলে এর আনুমানিক অর্থ, ডেটাটাইপ এবং সম্ভাব্য গুণমানের ঝুঁকি তালিকাভুক্ত করুন। "নিশ্চিতকরণ প্রয়োজনীয়" হিসাবে আপনি নিশ্চিত নন এমন কলামগুলি চিহ্নিত করুন; অর্থ তৈরি করা। কলাম: [এখানে পেস্ট করুন]

2) নমুনা কোড (এলোমেলো, পুনরাবৃত্তিযোগ্য):

আমার কাছে পান্ডা ডিএফ আছে। 200,000 সারি থেকে একটি প্রতিনিধি 5% এলোমেলো নমুনা বের করে এমন কোড লিখুন। random_state=42 ব্যবহার করুন (প্রজননযোগ্যতার জন্য)। নমুনার শ্রেণী বন্টন জনসংখ্যার অনুরূপ কিনা তা পরীক্ষা করতে কোড যোগ করুন।

3) ফাঁস স্ক্যানিং প্রশ্ন:

আমি আপনাকে কলাম এই তালিকা দিতে হবে. আমার লক্ষ্য হল ভবিষ্যদ্বাণী করা "এটি কি বাতিল" (0/1)। প্রতিটি কলামের জন্য, ভবিষ্যদ্বাণী করার সময় এটি আমার কাছে থাকবে কিনা তা মূল্যায়ন করুন এবং এটিকে "নিরাপদ/সন্দেহজনক/লিক" হিসেবে চিহ্নিত করুন। আপনার যুক্তি এক বাক্যে লিখুন। কলাম: [তালিকা]

4) SQL পুল ক্যোয়ারী খসড়া:

PostgreSQL এ আমার "অর্ডার" এবং "গ্রাহক" টেবিল আছে। একটি JOIN ক্যোয়ারী লিখুন যা গ্রাহক শহরের সাথে গত 90 দিনের অর্ডারগুলিকে একত্রিত করে এবং প্রতি শহর প্রতি অর্ডারের মোট পরিমাণ এবং সংখ্যা ফেরত দেয়৷ তারিখ ফিল্টার এবং NULL শহরগুলি কীভাবে পরিচালনা করা হয় তা ব্যাখ্যা করুন। আমি প্রশ্নটি চালাব এবং এটি যাচাই করব।

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল প্রম্পট:

এই ডাটাবেস থেকে আমাকে একটি ভাল নমুনা ডেটা টানুন।

"ভাল" অস্পষ্ট; কোন পেইন্টিং, কোন সময়কাল, কোন আকার, কোন উদ্দেশ্য স্পষ্ট নয়। AI শুধুমাত্র একটি জেনেরিক, সম্ভবত ভুল প্রশ্ন তৈরি করবে।

শক্তিশালী প্রম্পট:

আপনার ভূমিকা: এসকিউএল সহকারী। আমার একটি "লেনদেন" টেবিল আছে: কলাম আইডি, গ্রাহক_আইডি, তারিখ (টাইমস্ট্যাম্প), পরিমাণ (সংখ্যাসূচক), চ্যানেল (পাঠ্য: 'ওয়েব'/'মোবাইল')। টাস্ক: একটি পুনরাবৃত্তিযোগ্য (ORDER BY সহ নির্ধারক) কোয়েরি লিখুন যা 2024 সালের জন্য প্রতিটি চ্যানেল থেকে 10,000 প্রতিনিধি সারি প্রদান করে। উদ্দেশ্য: চ্যানেল তুলনামূলক বিশ্লেষণ। আপনার প্রশ্নের অনুমান তালিকা.

এখানে টেবিল, উদ্দেশ্য, আকার এবং পুনরাবৃত্তিযোগ্যতা পরিষ্কার।

সাধারণ ভুল

  • নমুনার প্রতিনিধিত্ব প্রশ্নবিদ্ধ না. সহজে অ্যাক্সেসযোগ্য ডেটা সঠিক তথ্য নয়; নির্বাচনের পক্ষপাতিত্ব ফলাফলকে বিকৃত করে।
  • AI-তে কলামের অর্থ মানিয়ে নেওয়া। উৎস দল অর্থ জানে; এটি নিশ্চিত না করে AI পূর্বাভাস ব্যবহার করবেন না।
  • API ফরম্যাট/ইউনিট পরিবর্তন ট্র্যাক করা হচ্ছে না। নীরব পরিবর্তন দিনের জন্য দূষিত তথ্য সংগ্রহ করে।
  • সংগ্রহ পর্যায়ে ফাঁস উপেক্ষা. প্রশ্ন "আমার কাছে কি ভবিষ্যদ্বাণী করার সময় এটি আছে" প্রাথমিকভাবে জিজ্ঞাসা করা না হলে, মডেলটি মিথ্যা সাফল্য দেবে।
  • অননুমোদিত বা অবৈধ তথ্য সংগ্রহ। robots.txt, ব্যবহারের শর্তাবলী এবং KVKK লঙ্ঘন একটি গুরুতর ঝুঁকি।
টিপ: প্রতিটি নতুন ডেটা উত্সের জন্য একটি এক-পৃষ্ঠার "ডেটা কার্ড" রাখুন: উত্স, পুল তারিখ, সারির সংখ্যা, পরিচিত সীমানা এবং কলামগুলি ফাঁসের ঝুঁকিতে। এই কার্ডটি কয়েক মাস পরে "এই ডেটা কী ছিল" প্রশ্ন এবং পুনরুত্পাদনযোগ্যতা সংরক্ষণ করে৷

সংক্ষেপে

বিশ্লেষণের গুণমান সংগৃহীত ডেটার গুণমানের দ্বারা সীমাবদ্ধ। উত্স (ডাটাবেস, API, ফাইল, স্ক্র্যাপ) এবং স্কিমা ভালভাবে জানুন; নিশ্চিত করুন যে নমুনা জনসংখ্যার প্রতিনিধি; প্রতিটি কলামকে জিজ্ঞাসা করে প্রথম দিন থেকে ফুটো দূর করুন "পূর্বাভাসের সময় এটি আমার কাছে আছে?" ক্যোয়ারী এবং ডকুমেন্টের কাজের জন্য এআই একটি দুর্দান্ত ত্বরণকারী, কিন্তু মানুষই সিদ্ধান্ত নেয় কোন ডেটা সংগ্রহ করতে হবে এবং এর প্রতিনিধিত্ব। কর্তৃত্ব, আইন এবং গোপনীয়তার সীমা সর্বদা প্রথমে আসে।

আবেদন টাস্ক

একটি ডেটা উত্স চয়ন করুন (আপনার নিজের ব্যবসা বা অনুমান থেকে)। উপরে "ডেটা অভিধান নিষ্কাশন" টেমপ্লেট সহ AI থেকে একটি ডেটা অভিধানের খসড়া পান; তারপর প্রতিটি কলাম ম্যানুয়ালি মূল্যায়ন করে দেখুন এটি ফাঁস হয়েছে কিনা। অন্তত একটি সন্দেহজনক/লিক কলাম খুঁজে বের করার চেষ্টা করুন এবং এক বাক্যে লিখুন কেন এটি ঝুঁকিপূর্ণ।

চেকলিস্ট

  • [ ] আমি কি উৎস দলের সাথে ডেটা উৎস এবং স্কিমা নিশ্চিত করেছি?
  • [ ] আমি কি পরীক্ষা করেছি যে নমুনাটি জনসংখ্যার প্রতিনিধি?
  • [ ] আমি কি প্রতিটি কলামে প্রশ্ন জিজ্ঞাসা করেছি "আনুমানিক সময়ে এটি আমার কাছে থাকবে?"
  • [ ] আমি কি নমুনাকে পুনরাবৃত্তিযোগ্য (স্থির বীজ) করেছি?
  • [ ] আমি কি আইনগত/নৈতিক (কর্তৃপক্ষ, robots.txt, KVKK) সংগ্রহের সীমা পরীক্ষা করেছি?