লাভ:
- বিভিন্ন ডেটা উত্স (ডাটাবেস, API, ফাইল, ওয়েব স্ক্র্যাপিং) এবং প্রতিটির ত্রুটিগুলি সনাক্ত করার এবং স্কিমা সঠিকভাবে বোঝার ক্ষমতা
- নমুনা জনসংখ্যা এবং নির্বাচন পক্ষপাত প্রতিনিধিত্ব করে কিনা তা মূল্যায়ন করে পুনরাবৃত্তিযোগ্য নমুনা সঞ্চালনের ক্ষমতা
- সংগ্রহের পর্যায়ে ডেটা ফাঁস দূর করার ক্ষমতা এবং প্রতিটি কলামে 'পূর্বাভাস দেওয়ার সময় এটি আমার কাছে থাকবে' প্রশ্ন জিজ্ঞাসা করে আইনী/নৈতিক সীমানা পর্যবেক্ষণ করার ক্ষমতা?
প্রতিটি বিশ্লেষণ আপনার সংগ্রহ করা ডেটার গুণমানের মতোই ভাল। এমনকি বিশ্বের সবচেয়ে উন্নত মডেলটিও অবিশ্বস্ত ফলাফল আনবে যদি এটি এমন ডেটার সাথে কাজ করে যা ভুলভাবে সংগ্রহ করা হয়, পক্ষপাতমূলকভাবে নমুনা করা হয় বা ভবিষ্যতের তথ্য রয়েছে। কম্পিউটার বিজ্ঞানে, এই নীতিটিকে "আবর্জনা ইন, আবর্জনা আউট" (আবর্জনা ইন, আবর্জনা আউট) হিসাবে সংক্ষিপ্ত করা হয়েছে। এই ইউনিটে, আমরা ডেটা সংগ্রহের পর্যায়টি কভার করব: উত্স বোঝা, নমুনা নেওয়া, গুণমানের প্রশ্ন জিজ্ঞাসা করা এবং প্রথম দিন থেকে ডেটা ফাঁসের ঝুঁকি সম্পর্কে সতর্ক থাকা। কৃত্রিম বুদ্ধিমত্তা এই পর্যায়ে একটি শক্তিশালী সাহায্য; এসকিউএল কোয়েরি লেখে, API নথির সারসংক্ষেপ করে, ডেটা চুক্তির খসড়া তৈরি করে। কিন্তু আপনি কোন ডেটা সংগ্রহ করেন এবং সেই ডেটা আপনাকে প্রতিনিধিত্ব করে কিনা তা মানুষই নির্ধারণ করে।
তথ্যের উৎস সম্পর্কে জানা
ডেটা বিভিন্ন জায়গা থেকে আসে এবং প্রতিটি উৎসের নিজস্ব ত্রুটি রয়েছে। ডেটাবেস (সারণীতে সংরক্ষিত কাঠামোগত ডেটা, সাধারণত এসকিউএল দিয়ে জিজ্ঞাসা করা হয়) হল সবচেয়ে সাধারণ উৎস; এটি নির্ভরযোগ্য, তবে এটির স্কিমটি ভালভাবে বোঝা প্রয়োজন। API (অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস) লাইভ ডেটা সরবরাহ করে তবে গতি সীমা এবং বিন্যাস পরিবর্তনের ঝুঁকি বহন করে। ফাইলগুলি (CSV, Excel, JSON) নমনীয় কিন্তু বিন্যাসের অসঙ্গতি প্রবণ। ওয়েব স্ক্র্যাপিং শক্তিশালী, কিন্তু এর আইনি এবং নৈতিক সীমা রয়েছে; প্রতিটি সাইট স্ক্র্যাপ করা যাবে না.
মনোযোগ: ওয়েব স্ক্র্যাপিং এবং স্বয়ংক্রিয় ডেটা সংগ্রহের জন্য, সাইটের ব্যবহারের শর্তাবলী, robots.txt ফাইল এবং KVKK/GDPR মেনে চলুন। অননুমোদিত তথ্য সংগ্রহ আইনি দায় তৈরি করে। তথ্য নিরাপত্তার প্রেক্ষাপটে, শুধুমাত্র সেই সিস্টেমে ডেটা সংগ্রহের টুল ব্যবহার করুন যার জন্য আপনি অনুমোদিত এবং প্রতিরক্ষা/বিশ্লেষণের উদ্দেশ্যে; অননুমোদিত প্রবেশ বা স্ক্র্যাপিং নিষিদ্ধ.
স্কিমা বোঝা: ডেটার সাথে পরিচিত হওয়া
একটি ডেটা সেট সংগ্রহ করার আগে, আপনাকে অবশ্যই এর স্কিমা বুঝতে হবে (কলামগুলির নাম, তাদের ডেটা প্রকার, তাদের অর্থ এবং একে অপরের সাথে তাদের সম্পর্ক)। AI এখানে একটি "ডেটা ডিকশনারী" তৈরি করতে খুবই উপযোগী - প্রতিটি কলামের অর্থ কী তা ব্যাখ্যা করে একটি টেবিল। কিন্তু AI যে ব্যাখ্যাগুলি তৈরি করে তা হল ভবিষ্যদ্বাণী; ডেটা তৈরিকারী দলের সাথে প্রতিটি কলামের প্রকৃত অর্থ নিশ্চিত করুন। উদাহরণস্বরূপ, "স্থিতি" নামের একটি কলামে 0/1/2 থাকতে পারে; শুধুমাত্র উদ্ভূত দলই জানে যে এগুলো "মুলতুবি/অনুমোদিত/বাতিল" নাকি অন্য কিছু।
নিম্নলিখিত সারণীতে মৌলিক সম্পদের ধরন এবং সতর্কতাগুলি সংক্ষিপ্ত করা হয়েছে:
উৎস
শক্তিশালী পয়েন্ট
ফাঁদ
কিভাবে AI সাহায্য করে
এসকিউএল ডাটাবেস
কাঠামোগত, নির্ভরযোগ্য
জটিল যোগদান
একটি প্রশ্নের খসড়া লেখেন
API
লাইভ ডেটা
গতি সীমা, আকৃতি পরিবর্তন
নথির সারাংশ, কোড টানুন
CSV/এক্সেল
নমনীয়, দ্রুত
বিন্যাসের অসঙ্গতি
কোড পড়ুন/পার্স করুন
ওয়েব স্ক্র্যাপিং
ব্যাপক নাগাল
আইনি/নৈতিক সীমা
খসড়া পার্সিং (কর্তৃপক্ষের মধ্যে)
লগ/ইভেন্ট ডেটা
বিস্তারিত
বিশাল আয়তন
ফিল্টারিং ক্যোয়ারী
দৃষ্টান্ত: অংশ কি সমগ্র প্রতিনিধিত্ব করে?
বেশিরভাগ সময়, আপনি পুরো ডেটার পরিবর্তে একটি নমুনা (জনসংখ্যা থেকে নির্বাচিত একটি উপসেট) নিয়ে কাজ করেন। সমালোচনামূলক প্রশ্ন হল: এই নমুনা কি জনসংখ্যার প্রতিনিধিত্ব করে? নির্বাচন পক্ষপাত সবচেয়ে সাধারণ ফাঁদ. উদাহরণস্বরূপ, আপনি যদি শুধুমাত্র মোবাইল অ্যাপ থেকে ব্যবহারকারীদের নমুনা নেন, তাহলে আপনি ওয়েব ব্যবহারকারীদের দেখতে পাবেন না এবং আপনার ফলাফল বিভ্রান্তিকর হবে। এলোমেলো নমুনা (প্রতিটি রেকর্ডে নির্বাচিত হওয়ার সমান সুযোগ রয়েছে) বেশিরভাগ ক্ষেত্রেই সবচেয়ে নিরাপদ; কিন্তু টাইম সিরিজ ডেটাতে, বিভাজন এলোমেলোভাবে না করে কালানুক্রমিকভাবে করা হয় (আমরা ইউনিট 7 এবং 10 এ এটি দেখতে পাব)।
প্রথম দিন থেকে সচেতনতা ফাঁস
ডেটা ফাঁস বেশিরভাগ বিপর্যয়ের উত্স এবং সাধারণত ডেটা সংগ্রহের পর্যায়ে উদ্ভূত হয়। উদাহরণ: ভবিষ্যদ্বাণী করার সময় "এটি বাতিল করা হয়েছিল", আপনি যদি ডেটাতে "বাতিল তারিখ" কলাম যোগ করেন, মডেলটি ভবিষ্যতের দিকে নজর দেয়। সংগ্রহের পর্বের সময়, প্রতিটি কলামের জন্য একটি প্রশ্ন জিজ্ঞাসা করুন: "আমি ভবিষ্যদ্বাণী করার সময় কি আসলেই এই তথ্য থাকবে?" উত্তর না হলে, সেই কলামটি লিক হচ্ছে। আমরা ইউনিট 10 এ এই বিষয়টি গভীরভাবে কভার করব; তবে সচেতনতা শুরু করা উচিত প্রথম দিন থেকেই।
তিনটি মিনি কেস
কেস 1 - প্রতিনিধিত্বের সমস্যা। একটি ব্যাংক তার ক্রেডিট রিস্ক মডেলের (18,500 রেকর্ড) জন্য শুধুমাত্র অনুমোদিত ঋণের তথ্য সংগ্রহ করেছে। প্রত্যাখ্যান তথ্য ছিল না. মডেলটি বাস্তব জগতে ভুল ছিল কারণ এটি কখনই দেখেনি যে প্রত্যাখ্যান কীভাবে আচরণ করবে। পাঠ: নমুনাটি সমগ্র জনসংখ্যার প্রতিনিধি হওয়া উচিত যেখান থেকে আপনি আপনার সিদ্ধান্ত নিচ্ছেন।
কেস 2 — নীরব ফর্ম পরিবর্তন। একটি দল প্রতিদিন একটি API থেকে দামের ডেটা তুলছিল। একদিন, API প্রদানকারী মুদ্রা পরিবর্তন করে USD থেকে EUR করে, কিন্তু ডোমেনের নাম একই ছিল। 12 দিনের জন্য ভুল ইউনিটে ডেটা সংগ্রহ করা হয়েছিল; 3,200টি লাইন নষ্ট হয়ে গেছে। পাঠ: নিয়মিতভাবে API ডেটাতে ভলিউম এবং বিন্যাসের ধারাবাহিকতা পরীক্ষা করুন।
কেস 3 - প্রারম্ভিক ফুটো। একটি "মন্থন" অনুমানের জন্য ডেটা সংগ্রহ করার সময় একজন বিশ্লেষক "অ্যাকাউন্ট বন্ধের কারণ" কলামটি অন্তর্ভুক্ত করেছেন। গ্রাহক চলে যাওয়ার পরেই এই কলামটি পূরণ করা হয়েছিল। মডেলটি পরীক্ষার সেটে 97% নির্ভুলতা দিয়েছে; এটি উত্পাদনে কাজ করেনি কারণ পূর্বাভাসের সময় সেই কলামটি খালি ছিল। পাঠ: প্রতিটি কলামে প্রশ্ন জিজ্ঞাসা করুন "আমার কাছে কি ভবিষ্যদ্বাণী করার সময় এটি আছে?"
চারটি অনুলিপিযোগ্য টেমপ্লেট
1) ডেটা অভিধান নিষ্কাশন:
আপনার ভূমিকা: তথ্য বিজ্ঞানী সহকারী। নীচে একটি টেবিলের কলামের নাম এবং নমুনা (বেনামী) মান রয়েছে। প্রতিটি কলামের জন্য, একটি টেবিলে এর আনুমানিক অর্থ, ডেটাটাইপ এবং সম্ভাব্য গুণমানের ঝুঁকি তালিকাভুক্ত করুন। "নিশ্চিতকরণ প্রয়োজনীয়" হিসাবে আপনি নিশ্চিত নন এমন কলামগুলি চিহ্নিত করুন; অর্থ তৈরি করা। কলাম: [এখানে পেস্ট করুন]
2) নমুনা কোড (এলোমেলো, পুনরাবৃত্তিযোগ্য):
আমার কাছে পান্ডা ডিএফ আছে। 200,000 সারি থেকে একটি প্রতিনিধি 5% এলোমেলো নমুনা বের করে এমন কোড লিখুন। random_state=42 ব্যবহার করুন (প্রজননযোগ্যতার জন্য)। নমুনার শ্রেণী বন্টন জনসংখ্যার অনুরূপ কিনা তা পরীক্ষা করতে কোড যোগ করুন।
3) ফাঁস স্ক্যানিং প্রশ্ন:
আমি আপনাকে কলাম এই তালিকা দিতে হবে. আমার লক্ষ্য হল ভবিষ্যদ্বাণী করা "এটি কি বাতিল" (0/1)। প্রতিটি কলামের জন্য, ভবিষ্যদ্বাণী করার সময় এটি আমার কাছে থাকবে কিনা তা মূল্যায়ন করুন এবং এটিকে "নিরাপদ/সন্দেহজনক/লিক" হিসেবে চিহ্নিত করুন। আপনার যুক্তি এক বাক্যে লিখুন। কলাম: [তালিকা]
4) SQL পুল ক্যোয়ারী খসড়া:
PostgreSQL এ আমার "অর্ডার" এবং "গ্রাহক" টেবিল আছে। একটি JOIN ক্যোয়ারী লিখুন যা গ্রাহক শহরের সাথে গত 90 দিনের অর্ডারগুলিকে একত্রিত করে এবং প্রতি শহর প্রতি অর্ডারের মোট পরিমাণ এবং সংখ্যা ফেরত দেয়৷ তারিখ ফিল্টার এবং NULL শহরগুলি কীভাবে পরিচালনা করা হয় তা ব্যাখ্যা করুন। আমি প্রশ্নটি চালাব এবং এটি যাচাই করব।
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট:
এই ডাটাবেস থেকে আমাকে একটি ভাল নমুনা ডেটা টানুন।
"ভাল" অস্পষ্ট; কোন পেইন্টিং, কোন সময়কাল, কোন আকার, কোন উদ্দেশ্য স্পষ্ট নয়। AI শুধুমাত্র একটি জেনেরিক, সম্ভবত ভুল প্রশ্ন তৈরি করবে।
শক্তিশালী প্রম্পট:
আপনার ভূমিকা: এসকিউএল সহকারী। আমার একটি "লেনদেন" টেবিল আছে: কলাম আইডি, গ্রাহক_আইডি, তারিখ (টাইমস্ট্যাম্প), পরিমাণ (সংখ্যাসূচক), চ্যানেল (পাঠ্য: 'ওয়েব'/'মোবাইল')। টাস্ক: একটি পুনরাবৃত্তিযোগ্য (ORDER BY সহ নির্ধারক) কোয়েরি লিখুন যা 2024 সালের জন্য প্রতিটি চ্যানেল থেকে 10,000 প্রতিনিধি সারি প্রদান করে। উদ্দেশ্য: চ্যানেল তুলনামূলক বিশ্লেষণ। আপনার প্রশ্নের অনুমান তালিকা.
এখানে টেবিল, উদ্দেশ্য, আকার এবং পুনরাবৃত্তিযোগ্যতা পরিষ্কার।
সাধারণ ভুল
- নমুনার প্রতিনিধিত্ব প্রশ্নবিদ্ধ না. সহজে অ্যাক্সেসযোগ্য ডেটা সঠিক তথ্য নয়; নির্বাচনের পক্ষপাতিত্ব ফলাফলকে বিকৃত করে।
- AI-তে কলামের অর্থ মানিয়ে নেওয়া। উৎস দল অর্থ জানে; এটি নিশ্চিত না করে AI পূর্বাভাস ব্যবহার করবেন না।
- API ফরম্যাট/ইউনিট পরিবর্তন ট্র্যাক করা হচ্ছে না। নীরব পরিবর্তন দিনের জন্য দূষিত তথ্য সংগ্রহ করে।
- সংগ্রহ পর্যায়ে ফাঁস উপেক্ষা. প্রশ্ন "আমার কাছে কি ভবিষ্যদ্বাণী করার সময় এটি আছে" প্রাথমিকভাবে জিজ্ঞাসা করা না হলে, মডেলটি মিথ্যা সাফল্য দেবে।
- অননুমোদিত বা অবৈধ তথ্য সংগ্রহ। robots.txt, ব্যবহারের শর্তাবলী এবং KVKK লঙ্ঘন একটি গুরুতর ঝুঁকি।
টিপ: প্রতিটি নতুন ডেটা উত্সের জন্য একটি এক-পৃষ্ঠার "ডেটা কার্ড" রাখুন: উত্স, পুল তারিখ, সারির সংখ্যা, পরিচিত সীমানা এবং কলামগুলি ফাঁসের ঝুঁকিতে। এই কার্ডটি কয়েক মাস পরে "এই ডেটা কী ছিল" প্রশ্ন এবং পুনরুত্পাদনযোগ্যতা সংরক্ষণ করে৷
সংক্ষেপে
বিশ্লেষণের গুণমান সংগৃহীত ডেটার গুণমানের দ্বারা সীমাবদ্ধ। উত্স (ডাটাবেস, API, ফাইল, স্ক্র্যাপ) এবং স্কিমা ভালভাবে জানুন; নিশ্চিত করুন যে নমুনা জনসংখ্যার প্রতিনিধি; প্রতিটি কলামকে জিজ্ঞাসা করে প্রথম দিন থেকে ফুটো দূর করুন "পূর্বাভাসের সময় এটি আমার কাছে আছে?" ক্যোয়ারী এবং ডকুমেন্টের কাজের জন্য এআই একটি দুর্দান্ত ত্বরণকারী, কিন্তু মানুষই সিদ্ধান্ত নেয় কোন ডেটা সংগ্রহ করতে হবে এবং এর প্রতিনিধিত্ব। কর্তৃত্ব, আইন এবং গোপনীয়তার সীমা সর্বদা প্রথমে আসে।
আবেদন টাস্ক
একটি ডেটা উত্স চয়ন করুন (আপনার নিজের ব্যবসা বা অনুমান থেকে)। উপরে "ডেটা অভিধান নিষ্কাশন" টেমপ্লেট সহ AI থেকে একটি ডেটা অভিধানের খসড়া পান; তারপর প্রতিটি কলাম ম্যানুয়ালি মূল্যায়ন করে দেখুন এটি ফাঁস হয়েছে কিনা। অন্তত একটি সন্দেহজনক/লিক কলাম খুঁজে বের করার চেষ্টা করুন এবং এক বাক্যে লিখুন কেন এটি ঝুঁকিপূর্ণ।
চেকলিস্ট
- [ ] আমি কি উৎস দলের সাথে ডেটা উৎস এবং স্কিমা নিশ্চিত করেছি?
- [ ] আমি কি পরীক্ষা করেছি যে নমুনাটি জনসংখ্যার প্রতিনিধি?
- [ ] আমি কি প্রতিটি কলামে প্রশ্ন জিজ্ঞাসা করেছি "আনুমানিক সময়ে এটি আমার কাছে থাকবে?"
- [ ] আমি কি নমুনাকে পুনরাবৃত্তিযোগ্য (স্থির বীজ) করেছি?
- [ ] আমি কি আইনগত/নৈতিক (কর্তৃপক্ষ, robots.txt, KVKK) সংগ্রহের সীমা পরীক্ষা করেছি?