ইউনিট
1. তথ্য বিজ্ঞান এবং বিশ্লেষণে কৃত্রিম বুদ্ধিমত্তার ভূমিকা: কর্মপ্রবাহ, ভূমিকা, সীমানা, বৈধতা এবং নীতিশাস্ত্র 2. ডেটা সংগ্রহ এবং উত্স বোঝা: স্কিমা, নমুনা, গুণমান এবং লিক সচেতনতা 3. ডেটা ক্লিনিং এবং প্রিপ্রসেসিং: অনুপস্থিত মান, আউটলিয়ার এবং টাইপ রূপান্তর 4. অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA): বিতরণ, সম্পর্ক, এবং প্রাথমিক অন্তর্দৃষ্টি 5. ফিচার ইঞ্জিনিয়ারিং: ভেরিয়েন্ট তৈরি করা, কোডিং, স্কেলিং এবং লিকেজ এড়ানো 6. মডেল বিল্ডিং: সমস্যা সংজ্ঞা, অ্যালগরিদম নির্বাচন, এবং প্রশিক্ষণ/পরীক্ষা বিভক্ত 7. মডেল মূল্যায়ন: মেট্রিক্স, ক্রস-ভ্যালিডেশন এবং এক্সট্রিম লার্নিং 8. ভিজ্যুয়ালাইজেশন এবং গল্প বলা: সঠিক গ্রাফিক্স, সৎ গ্রাফিক্স 9. কোড জেনারেশন: পাইথন (পান্ডা) এবং এসকিউএল দিয়ে এআই-সহায়তা বিশ্লেষণ 10. ডেটা লিকেজ এবং প্রজননযোগ্যতা: নীরব বিপর্যয় এবং শৃঙ্খলা 11. MLOps ফাউন্ডেশন, নীতিশাস্ত্র, গোপনীয়তা এবং দায়িত্বশীল বিশ্লেষণ
ইউনিট 1 / 11

তথ্য বিজ্ঞান এবং বিশ্লেষণে কৃত্রিম বুদ্ধিমত্তার ভূমিকা: কর্মপ্রবাহ, ভূমিকা, সীমানা, বৈধতা এবং নীতিশাস্ত্র

লাভ:

  • ডেটা সায়েন্সের ছয়-পর্যায়ের কর্মপ্রবাহ (সমস্যা সংজ্ঞা, সংগ্রহ, পরিচ্ছন্নতা, আবিষ্কার, মডেলিং, যোগাযোগ) এবং যে কর্তৃপক্ষের অধীনে কৃত্রিম বুদ্ধিমত্তা কাজ ঝুঁকির স্তর অনুযায়ী প্রতিটি পর্যায়ে কাজ করে তা আলাদা করার ক্ষমতা
  • একটি শৃঙ্খলা প্রয়োগ করার ক্ষমতা যা প্রতিটি কৃত্রিম বুদ্ধিমত্তার আউটপুটকে উত্সের সাথে সংযুক্ত করে, এটি চালানো এবং তুলনা করে এবং বিশেষজ্ঞ ফিল্টারিংয়ের মাধ্যমে এটিকে যাচাই করে।
  • প্রথম দিন থেকে প্রজননযোগ্যতা এবং গোপনীয়তা নীতিগুলি (কোড লেখা, নাম প্রকাশ না করা) বিশ্লেষণের অভ্যাসে পরিণত করার ক্ষমতা

কাঁচা, অগোছালো এবং প্রায়ই "মিথ্যা" ডেটা প্রতিদিন একজন ডেটা বিজ্ঞানীর ডেস্কে পড়ে। বিক্রয় সারণীতে, তারিখ কলাম তিনটি ভিন্ন বিন্যাসে লেখা হয়; গ্রাহক সংখ্যা কিছু লাইনে ফাঁকা; একটি কলামের নাম "আয়", কিন্তু এতে TL এবং USD উভয় মানই রয়েছে। ডেটা সায়েন্সের কাজ হল এই বিশৃঙ্খলা থেকে একটি নির্ভরযোগ্য সিদ্ধান্ত নেওয়া: ডেটা সংগ্রহ করা, এটি পরিষ্কার করা, এটি অন্বেষণ করা, একটি মডেল তৈরি করা, ফলাফল যাচাই করা এবং এটিকে একটি গল্পে পরিণত করা। কৃত্রিম বুদ্ধিমত্তা (এআই, বা সংক্ষিপ্ত কম্পিউটার সিস্টেমের জন্য এআই যা পাঠ্য এবং কোড তৈরি করতে পারে, প্যাটার্ন চিনতে পারে, সংক্ষিপ্ত করতে পারে এবং ভবিষ্যদ্বাণী করতে পারে) এই চেইনের প্রতিটি লিঙ্ককে স্পর্শ করতে পারে: মিনিটের মধ্যে ক্লিনআপ কোড লেখা, অনুসন্ধানমূলক বিশ্লেষণের জন্য গ্রাফের সুপারিশ করা, একটি মডেলের মেট্রিক ব্যাখ্যা করা, একটি SQL কোয়েরি সংশোধন করা। কিন্তু একই AI আপনাকে একটি আত্মবিশ্বাসী বানোয়াটও দিতে পারে যেমন "সম্পর্ক 0.72" ডেটার জন্য যা এটি কখনও দেখেনি।

এই প্রথম ইউনিট একটি লাইব্রেরি ভূমিকা নয়. এর উদ্দেশ্য হ'ল ডেটা সায়েন্স ওয়ার্কফ্লোতে AI কোথায় রাখবেন এবং কোথায় রাখবেন না তা স্পষ্ট করা। আসুন শুরু থেকে মূল নীতিটি তুলে ধরা যাক: AI একজন সহকারী, ডেটা বিজ্ঞানী নয়। কোন ডেটা সংগ্রহ করতে হবে, কোন মেট্রিকের উপর সিদ্ধান্ত নিতে হবে, কোন মডেলকে উৎপাদনে রাখতে হবে এবং কোথায় নৈতিক সীমারেখা আঁকতে হবে তার সিদ্ধান্ত যোগ্য বিশেষজ্ঞের উপর নির্ভর করে। একটি অসমাপ্ত AI আউটপুট ঝুঁকিপূর্ণ, যেমন একটি স্বাক্ষরবিহীন বিশ্লেষণ প্রতিবেদন।

ডেটা সায়েন্স ওয়ার্কফ্লো: এন্ড-টু-এন্ড ম্যাপ

একটি ডেটা প্রকল্প বোঝার জন্য, এটি ছয়টি ধাপে বিভক্ত করা সহায়ক। এই সমগ্র মডিউল এই মানচিত্র অনুসরণ করে.

1. সমস্যার সংজ্ঞা: আমরা কি পরিমাপ করি, কেন, কোন সিদ্ধান্তকে সমর্থন করি? এই পর্যায়টি AI কে অর্পণ করা হয় না; এটি সেই ব্যক্তি যিনি কাজটি সংজ্ঞায়িত করেন।

2. ডেটা সংগ্রহ: উত্স সনাক্ত করা, ডেটা বের করা, নমুনা নেওয়া। (ইউনিট 2)

3. ডেটা পরিষ্কার এবং প্রিপ্রসেসিং: অনুপস্থিত মান, আউটলিয়ার, টাইপ রূপান্তর। (ইউনিট 3)

4. অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA - অনুসন্ধানমূলক ডেটা বিশ্লেষণ, "চোখের দ্বারা" ডেটার বিতরণ এবং সম্পর্কগুলিকে স্বীকৃতি দেওয়ার পর্যায়): (ইউনিট 4)

5. ফিচার ইঞ্জিনিয়ারিং এবং মডেলিং: পরিবর্তনশীল প্রজন্ম, অ্যালগরিদম নির্বাচন, প্রশিক্ষণ, মূল্যায়ন। (একক 5, 6, 7)

6. কমিউনিকেশন এবং প্রোডাকশন: ভিজ্যুয়ালাইজেশন, স্টোরি, এমএলওপস (মডেলটি লাইভ নেওয়া এবং এটি পর্যবেক্ষণ করার শৃঙ্খলা)। (ইউনিট 8, 11)

AI এই ছয়টি পর্যায়ের প্রতিটিতে একটি ভিন্ন কর্তৃপক্ষের সাথে কাজ করে। নীচের সারণী কর্তৃপক্ষের এই বন্টন সংক্ষিপ্ত করে; এটি মডিউলের একক সবচেয়ে গুরুত্বপূর্ণ টেবিল।

মঞ্চ

AI এর ভূমিকা

ঝুঁকির স্তর

কে অনুমোদন করে

সমস্যার সংজ্ঞা

বুদ্ধিমত্তার অংশীদার

কম

ডেটা সায়েন্টিস্ট + স্টেকহোল্ডার

একটি ক্লিনআপ কোড লিখুন

কোড স্কেচ জেনারেটর

মাঝারি

ডেটা সায়েন্টিস্ট (কোড পড়ে)

EDA মন্তব্য

প্যাটার্ন পরামর্শক

মাঝারি

তথ্য বিজ্ঞানী

বৈশিষ্ট্য প্রজন্ম

আইডিয়া এবং কোড জেনারেটর

মাঝারি উচ্চ

লিক নিয়ন্ত্রণ একটি আবশ্যক

মডেল নির্বাচন/মেট্রিক

পরামর্শদাতা

উচ্চ

তথ্য বিজ্ঞানী

উৎপাদনে রাখার সিদ্ধান্ত

অক্জিলিয়ারী ইনপুট

খুব উচ্চ

দল + ব্যবসার মালিক

নৈতিকতা/গোপনীয়তা অনুমোদন

উদ্দীপক

খুব উচ্চ

মানুষ, সবসময়

এই চার্ট থেকে একটি বাক্য মনে রাখবেন: দাগ বাড়ার সাথে সাথে AI এর ভূমিকা সঙ্কুচিত হয় এবং মানুষের অনুমোদন বাড়তে থাকে।

কেন যাচাইকরণ এই ব্যবসার হৃদয়

এআই ভাষার মডেলগুলি নিশ্চিত দেখায়, তবে তারা নিশ্চিত নাও হতে পারে। প্রযুক্তিগত ভাষায়, একে হ্যালুসিনেশন বলা হয়: এটি একটি সাবলীল বাক্যে অস্তিত্বহীন তথ্যের মডেল তৈরি করা যেন এটি সত্য। তথ্য বিজ্ঞানে, এটি তিনটি আকারে আসে। প্রথমটি একটি জাল নম্বর: আপনি যদি কোনও ডেটা না দিয়ে মডেলটিকে "গড় অর্ডারের পরিমাণ কত" জিজ্ঞাসা করেন, তবে এটি আত্মবিশ্বাসের সাথে আপনাকে একটি নম্বর বলবে, যদিও এটি কখনও আপনার ডেটা দেখেনি। দ্বিতীয়টি এমন একটি ফাংশন যা বিদ্যমান নেই: মডেলটি এমন একটি ফাংশন প্রস্তাব করতে পারে যা একেবারেই নেই, যেমন pandas.read_excel_fast()৷ তৃতীয়, ভুল পরিসংখ্যানগত ব্যাখ্যা: মডেলটি মসৃণভাবে একটি ক্লাসিক পরিসংখ্যানগত ত্রুটি পুনরাবৃত্তি করতে পারে যেমন "p-মান 0.04, তাই অনুমানটি 96% সঠিক"।

যাচাইকরণ শৃঙ্খলা তিনটি ধাপ নিয়ে গঠিত:

  1. উত্সের লিঙ্ক: প্রতিটি নম্বর, হার এবং প্রবণতা আপনার ডেটা থেকে আসা উচিত, AI এর মেমরি নয়। কোডের জন্য AI ব্যবহার করুন যা ডেটাতে কাজ করে, এটি ডেটা মনে রাখার জন্য নয়।
  2. চালান এবং তুলনা করুন: AI দ্বারা প্রদত্ত কোডের প্রতিটি অংশ নিজেই চালান; প্রতিটি মেট্রিক এটি তৈরি করে একটি স্বাধীন বেসলাইনের সাথে তুলনা করুন।
  3. বিশেষজ্ঞ ফিল্টার: আউটপুট পরিসংখ্যান এবং ডোমেন জ্ঞানের বিরোধিতা করে কিনা তা নিজের জন্য পরীক্ষা করুন।
সতর্কতা: AI দ্বারা লিখিত একটি বিশ্লেষণকে না চালিয়ে একটি উপস্থাপনায় রাখা এবং এটি পড়া একটি স্বাক্ষরবিহীন প্রতিবেদন উপস্থাপন করার মতো। কোডটি কাজ করে তার মানে এই নয় যে এটি সঠিক; একটি কোড যা ভুল কলামের যোগফল দেয় তাও ত্রুটি ছাড়াই কাজ করে।

প্রজননযোগ্যতা: একই ফলাফল দুবার করতে সক্ষম হওয়া

ডেটা সায়েন্সের নীরব কিন্তু সমালোচনামূলক নীতি হল প্রজননযোগ্যতা: যখন আপনি ছয় মাস পরে আবার একটি বিশ্লেষণ চালান বা অন্য কম্পিউটারে, আপনি একই ফলাফল পাবেন। AI এর সাথে কাজ করার সময় এই ঝুঁকি বাড়ে, কারণ আপনি যখন AI কে বলেন "এই গ্রাফটি তৈরি করুন" এবং এটি ম্যানুয়ালি চালাতে, পদক্ষেপগুলি অদৃশ্য হয়ে যায়। নিয়ম: প্রতিটি পদক্ষেপ অবশ্যই কোড এবং সংস্করণ নিয়ন্ত্রণে নিবন্ধিত হতে হবে (যেমন গিট); এলোমেলোতা জড়িত পদক্ষেপে, এলোমেলো বীজ (এলোমেলো নম্বর জেনারেটরের প্রাথমিক মান; যদি স্থির করা হয়, ফলাফল পুনরাবৃত্তিযোগ্য হবে) স্থির করা উচিত। আমরা ইউনিট 10 এ এই বিষয়টিকে আরও গভীর করব; আপাতত, এই অভ্যাসটি গ্রহণ করুন: "হাতে ক্লিক করবেন না, কোডে লিখুন।"

তিনটি মিনি কেস

কেস 1 - নিরাপদ ত্বরণ। একজন ই-কমার্স বিশ্লেষক সাধারণত 240 হাজার সারিগুলির একটি অর্ডার টেবিল পরিষ্কার করতে অর্ধেক দিন ব্যয় করবেন। তিনি AI কে কলামের নাম এবং প্রথম 5 টি সারি (ব্যক্তিগত ডেটা ছাড়া) দিয়েছিলেন এবং পান্ডা পরিষ্কারের কোড চেয়েছিলেন। AI 8 সেকেন্ডে খসড়া তৈরি করেছে; বিশ্লেষক লাইন দ্বারা কোড লাইন পড়েন, তারিখ পার্সিং-এ একটি ত্রুটি সংশোধন করেন এবং এটি চালান। সময়কাল: 4 ঘন্টার পরিবর্তে 35 মিনিট। এআই কোড প্রদান করেছে, যাচাইকরণ মানুষের কাছেই থেকে গেছে।

কেস 2 — তৈরি করা মেট্রিক ফাঁদ। একজন ইন্টার্ন এআইকে জিজ্ঞাসা করেছিলেন, "এই ডেটাতে র্যান্ডম ফরেস্ট কতটা সঠিক?" মডেলের প্রশিক্ষণ ছাড়াই। "প্রায় 89%," এআই বলেছে। ইন্টার্ন এই উপস্থাপনা মধ্যে রাখা; যখন প্রকৃত মডেল প্রশিক্ষিত হয়েছিল, তখন নির্ভুলতা ছিল 71%। ভুল: AI কে ডেটা এবং মডেল না দিয়ে মেট্রিক্সের জন্য অপেক্ষা করা।

কেস 3 - নীরব ফাঁস। একটি দল AI-প্রস্তাবিত ধারণাটিকে "বৈশিষ্ট্য হিসাবে লক্ষ্য পরিবর্তনশীলের গড় যোগ করুন" প্রশ্ন না করেই বাস্তবায়ন করেছে। মডেলটি পরীক্ষার সেটে 98% পারফর্ম করেছে কিন্তু উৎপাদনে বিপর্যস্ত হয়েছে কারণ বৈশিষ্ট্যটি ভবিষ্যতের তথ্য ফাঁস করছে (ডেটা লিক, ইউনিট 10)। ভুল: পরিসংখ্যানগতভাবে এআই সুপারিশ ফিল্টারিং নয়।

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল প্রম্পট:

এই বিক্রয় ডেটা বিশ্লেষণ করুন এবং আমাকে গড় আয় বলুন।

এই দাবিটি ত্রুটিপূর্ণ: এআইকে ডেটা দেওয়া হয়নি, তাই "গড় আয়" শুধুমাত্র তৈরি করা যেতে পারে। না কলাম, না সময়কাল, না মুদ্রা স্পষ্ট।

শক্তিশালী প্রম্পট:

আপনার ভূমিকা: একজন ডেটা বিজ্ঞানীকে সাহায্য করা সহকারী। আমার কাছে একটি পান্ডা ডেটাফ্রেম আছে: df. কলাম:- order_date (টেক্সট, ফরম্যাটে "2024-03-01")- amount_tl (দশমিক, কিছু সারিতে NaN)- গ্রাহক_আইডি (পূর্ণসংখ্যা) টাস্ক: (1) পান্ডাস কোড লিখুন যা গড় পরিমাণ গণনা করে, (2) ব্যাখ্যা করুন যে এটি কীভাবে NaN মানগুলি পরিচালনা করে, (3) কোডটি অনুমানগুলিকে তালিকাভুক্ত করে। ডেটা সামগ্রী তৈরি করবেন না; শুধু কোড তৈরি করুন এবং আমি চালাব এবং ফলাফল যাচাই করব।

এই অনুরোধে, পরিকল্পনা, প্রত্যাশা এবং "বানোয়াট নিষেধাজ্ঞা" স্পষ্ট। আপনি এখনও চালান এবং নিজেই আউটপুট যাচাই করুন।

নৈতিকতা এবং গোপনীয়তার সূচনা

ডেটা সায়েন্স প্রায়ই ব্যক্তিগত ডেটা নিয়ে কাজ করে: গ্রাহক, রোগী, কর্মচারী রেকর্ড। Türkiye-তে KVKK (Personal Data Protection Law) এবং ইউরোপে GDPR এই ডেটা রক্ষা করে। পাবলিক এআই টুলে আপনার আসল নাম, আইডি, ইমেল বা ঠিকানা পেস্ট করা একটি লঙ্ঘন। নিয়ম: শেয়ার করার আগে ডেটা বেনামী করুন, প্রয়োজনে শুধুমাত্র স্কিমা (কলামের নাম, প্রকার) এবং ডামি উদাহরণ সারি প্রদান করুন। আমরা ইউনিট 11-এ নীতিশাস্ত্রের বিষয়টি গভীর করব; চলুন শুরু থেকে নীতি রাখা যাক: ডেটা বোঝার জন্য, এর গঠন ভাগ করা, এর বিষয়বস্তু নয়, প্রায়শই যথেষ্ট।

সাধারণ ভুল

  • AI কে ডেটা না দিয়েই সংখ্যা/মেট্রিক্সের জন্য অপেক্ষা করা। মডেল ডেটা অ্যাক্সেস করতে পারে না; তার দেওয়া নম্বরটি ভুয়া। সর্বদা ফলাফল গণনা এবং রান আছে.
  • ভাবছেন যে কাজের কোড সঠিক। যে কোডটি ভুল কলামকে ম্যানিপুলেট করে তাও ত্রুটি ছাড়াই চলে; যুক্তি না পড়ে বিশ্বাস করবেন না।
  • খোলা টুলে প্রকৃত ব্যক্তিগত তথ্য আটকানো। নাম, আইডি নম্বর, ই-মেইল কখনো শেয়ার করা হয় না; ডায়াগ্রামই যথেষ্ট।
  • ম্যানুয়ালি পদক্ষেপগুলি করা এবং সেগুলি কোডে না লিখুন৷ পুনরুত্পাদনযোগ্য নয় এমন বিশ্লেষণ অবিশ্বস্ত।
  • প্রশ্ন ছাড়াই পরিসংখ্যানের AI এর ব্যাখ্যা গ্রহণ করা। এআই পি-মান এবং পারস্পরিক সম্পর্কের মতো ধারণাগুলিতে ক্লাসিক ভুলগুলি পুনরাবৃত্তি করতে পারে।
টিপ: আপনার প্রতিটি AI সেশনে একটি সংক্ষিপ্ত "নিয়ম লাইন" অন্তর্ভুক্ত করুন: "ডেটা বিষয়বস্তু তৈরি করবেন না; শুধু কোড/বিশ্লেষণ তৈরি করুন এবং আমি ফলাফলটি চালাব এবং যাচাই করব; যেখানে আপনি অনিশ্চিত সেখানে 'নিশ্চিত নন' নির্দেশ করুন।" এই একক বাক্যটি হ্যালুসিনেশনের ঝুঁকি উল্লেখযোগ্যভাবে হ্রাস করে।

সংক্ষেপে

AI হল ডেটা সায়েন্সের একটি শক্তিশালী সহকারী: এটি ক্লিনিং কোড, EDA ব্যাখ্যা, মডেল সুপারিশ এবং ভিজ্যুয়ালাইজেশনকে ত্বরান্বিত করে। কিন্তু সমস্যার সংজ্ঞা, মেট্রিক নির্বাচন, উৎপাদন সিদ্ধান্ত এবং নৈতিক সীমানা মানুষের অন্তর্গত। কর্মপ্রবাহের ছয়টি পর্যায় রয়েছে এবং ঝুঁকি বাড়ার সাথে সাথে AI এর ভূমিকা ছোট হয়ে যায়। তিনটি অভ্যাস হল সবকিছুর ভিত্তি: সোর্স লিঙ্কিং (বৈধতা), প্রজননযোগ্যতা (কোডিং), এবং বেনামীকরণ (গোপনীয়তা)। একবার আপনি এই তিনটি অভ্যন্তরীণ করে ফেললে, বাকি মডিউলের প্রতিটি টুল আপনার জন্য একটি নিরাপদ ত্বরণকারী হয়ে ওঠে।

আবেদন টাস্ক

আপনার কাছে থাকা একটি ছোট টেবিলের একটি স্কিমা তৈরি করুন (বা একটি অনুমানমূলক): কলামের নাম, প্রকার এবং 2-3টি ডামি উদাহরণ সারি (প্রকৃত ব্যক্তিগত ডেটা ছাড়া)। উপরের "শক্তিশালী প্রম্পট" টেমপ্লেটটি ব্যবহার করে একটি সারাংশ পরিসংখ্যান কোডের জন্য AI-কে জিজ্ঞাসা করুন। কোডটি চালান, আউটপুটটিকে একটি ম্যানুয়াল মানের সাথে তুলনা করুন, যেকোন মিথ্যা অনুমান পরীক্ষা করুন এবং 5টি বুলেট পয়েন্টে আপনার ফলাফলগুলি নোট করুন৷

চেকলিস্ট

  • আমি কি আসল ব্যক্তিগত ডেটার পরিবর্তে এআইকে একটি স্কিমা এবং একটি জাল নমুনা দিয়েছি?
  • [ ] আমি কি কোডটি পড়েছি এবং এটি লাইন দ্বারা উত্পাদিত কোড রান করেছি?
  • [ ] আমি কি আউটপুটে প্রতিটি সংখ্যা স্বাধীনভাবে যাচাই করেছি?
  • [ ] আমি কি কোডে বিশ্লেষণের প্রতিটি ধাপ লিখেছি এবং এটি পুনরাবৃত্তিযোগ্য করে তুলেছি?
  • [ ] আমি কি মিশনের ঝুঁকির মাত্রা নির্ধারণ করেছি এবং একজন মানুষকে চূড়ান্ত সিদ্ধান্ত দিয়েছি?