লাভ:
- ডেটা সায়েন্সের ছয়-পর্যায়ের কর্মপ্রবাহ (সমস্যা সংজ্ঞা, সংগ্রহ, পরিচ্ছন্নতা, আবিষ্কার, মডেলিং, যোগাযোগ) এবং যে কর্তৃপক্ষের অধীনে কৃত্রিম বুদ্ধিমত্তা কাজ ঝুঁকির স্তর অনুযায়ী প্রতিটি পর্যায়ে কাজ করে তা আলাদা করার ক্ষমতা
- একটি শৃঙ্খলা প্রয়োগ করার ক্ষমতা যা প্রতিটি কৃত্রিম বুদ্ধিমত্তার আউটপুটকে উত্সের সাথে সংযুক্ত করে, এটি চালানো এবং তুলনা করে এবং বিশেষজ্ঞ ফিল্টারিংয়ের মাধ্যমে এটিকে যাচাই করে।
- প্রথম দিন থেকে প্রজননযোগ্যতা এবং গোপনীয়তা নীতিগুলি (কোড লেখা, নাম প্রকাশ না করা) বিশ্লেষণের অভ্যাসে পরিণত করার ক্ষমতা
কাঁচা, অগোছালো এবং প্রায়ই "মিথ্যা" ডেটা প্রতিদিন একজন ডেটা বিজ্ঞানীর ডেস্কে পড়ে। বিক্রয় সারণীতে, তারিখ কলাম তিনটি ভিন্ন বিন্যাসে লেখা হয়; গ্রাহক সংখ্যা কিছু লাইনে ফাঁকা; একটি কলামের নাম "আয়", কিন্তু এতে TL এবং USD উভয় মানই রয়েছে। ডেটা সায়েন্সের কাজ হল এই বিশৃঙ্খলা থেকে একটি নির্ভরযোগ্য সিদ্ধান্ত নেওয়া: ডেটা সংগ্রহ করা, এটি পরিষ্কার করা, এটি অন্বেষণ করা, একটি মডেল তৈরি করা, ফলাফল যাচাই করা এবং এটিকে একটি গল্পে পরিণত করা। কৃত্রিম বুদ্ধিমত্তা (এআই, বা সংক্ষিপ্ত কম্পিউটার সিস্টেমের জন্য এআই যা পাঠ্য এবং কোড তৈরি করতে পারে, প্যাটার্ন চিনতে পারে, সংক্ষিপ্ত করতে পারে এবং ভবিষ্যদ্বাণী করতে পারে) এই চেইনের প্রতিটি লিঙ্ককে স্পর্শ করতে পারে: মিনিটের মধ্যে ক্লিনআপ কোড লেখা, অনুসন্ধানমূলক বিশ্লেষণের জন্য গ্রাফের সুপারিশ করা, একটি মডেলের মেট্রিক ব্যাখ্যা করা, একটি SQL কোয়েরি সংশোধন করা। কিন্তু একই AI আপনাকে একটি আত্মবিশ্বাসী বানোয়াটও দিতে পারে যেমন "সম্পর্ক 0.72" ডেটার জন্য যা এটি কখনও দেখেনি।
এই প্রথম ইউনিট একটি লাইব্রেরি ভূমিকা নয়. এর উদ্দেশ্য হ'ল ডেটা সায়েন্স ওয়ার্কফ্লোতে AI কোথায় রাখবেন এবং কোথায় রাখবেন না তা স্পষ্ট করা। আসুন শুরু থেকে মূল নীতিটি তুলে ধরা যাক: AI একজন সহকারী, ডেটা বিজ্ঞানী নয়। কোন ডেটা সংগ্রহ করতে হবে, কোন মেট্রিকের উপর সিদ্ধান্ত নিতে হবে, কোন মডেলকে উৎপাদনে রাখতে হবে এবং কোথায় নৈতিক সীমারেখা আঁকতে হবে তার সিদ্ধান্ত যোগ্য বিশেষজ্ঞের উপর নির্ভর করে। একটি অসমাপ্ত AI আউটপুট ঝুঁকিপূর্ণ, যেমন একটি স্বাক্ষরবিহীন বিশ্লেষণ প্রতিবেদন।
ডেটা সায়েন্স ওয়ার্কফ্লো: এন্ড-টু-এন্ড ম্যাপ
একটি ডেটা প্রকল্প বোঝার জন্য, এটি ছয়টি ধাপে বিভক্ত করা সহায়ক। এই সমগ্র মডিউল এই মানচিত্র অনুসরণ করে.
1. সমস্যার সংজ্ঞা: আমরা কি পরিমাপ করি, কেন, কোন সিদ্ধান্তকে সমর্থন করি? এই পর্যায়টি AI কে অর্পণ করা হয় না; এটি সেই ব্যক্তি যিনি কাজটি সংজ্ঞায়িত করেন।
2. ডেটা সংগ্রহ: উত্স সনাক্ত করা, ডেটা বের করা, নমুনা নেওয়া। (ইউনিট 2)
3. ডেটা পরিষ্কার এবং প্রিপ্রসেসিং: অনুপস্থিত মান, আউটলিয়ার, টাইপ রূপান্তর। (ইউনিট 3)
4. অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA - অনুসন্ধানমূলক ডেটা বিশ্লেষণ, "চোখের দ্বারা" ডেটার বিতরণ এবং সম্পর্কগুলিকে স্বীকৃতি দেওয়ার পর্যায়): (ইউনিট 4)
5. ফিচার ইঞ্জিনিয়ারিং এবং মডেলিং: পরিবর্তনশীল প্রজন্ম, অ্যালগরিদম নির্বাচন, প্রশিক্ষণ, মূল্যায়ন। (একক 5, 6, 7)
6. কমিউনিকেশন এবং প্রোডাকশন: ভিজ্যুয়ালাইজেশন, স্টোরি, এমএলওপস (মডেলটি লাইভ নেওয়া এবং এটি পর্যবেক্ষণ করার শৃঙ্খলা)। (ইউনিট 8, 11)
AI এই ছয়টি পর্যায়ের প্রতিটিতে একটি ভিন্ন কর্তৃপক্ষের সাথে কাজ করে। নীচের সারণী কর্তৃপক্ষের এই বন্টন সংক্ষিপ্ত করে; এটি মডিউলের একক সবচেয়ে গুরুত্বপূর্ণ টেবিল।
মঞ্চ
AI এর ভূমিকা
ঝুঁকির স্তর
কে অনুমোদন করে
সমস্যার সংজ্ঞা
বুদ্ধিমত্তার অংশীদার
কম
ডেটা সায়েন্টিস্ট + স্টেকহোল্ডার
একটি ক্লিনআপ কোড লিখুন
কোড স্কেচ জেনারেটর
মাঝারি
ডেটা সায়েন্টিস্ট (কোড পড়ে)
EDA মন্তব্য
প্যাটার্ন পরামর্শক
মাঝারি
তথ্য বিজ্ঞানী
বৈশিষ্ট্য প্রজন্ম
আইডিয়া এবং কোড জেনারেটর
মাঝারি উচ্চ
লিক নিয়ন্ত্রণ একটি আবশ্যক
মডেল নির্বাচন/মেট্রিক
পরামর্শদাতা
উচ্চ
তথ্য বিজ্ঞানী
উৎপাদনে রাখার সিদ্ধান্ত
অক্জিলিয়ারী ইনপুট
খুব উচ্চ
দল + ব্যবসার মালিক
নৈতিকতা/গোপনীয়তা অনুমোদন
উদ্দীপক
খুব উচ্চ
মানুষ, সবসময়
এই চার্ট থেকে একটি বাক্য মনে রাখবেন: দাগ বাড়ার সাথে সাথে AI এর ভূমিকা সঙ্কুচিত হয় এবং মানুষের অনুমোদন বাড়তে থাকে।
কেন যাচাইকরণ এই ব্যবসার হৃদয়
এআই ভাষার মডেলগুলি নিশ্চিত দেখায়, তবে তারা নিশ্চিত নাও হতে পারে। প্রযুক্তিগত ভাষায়, একে হ্যালুসিনেশন বলা হয়: এটি একটি সাবলীল বাক্যে অস্তিত্বহীন তথ্যের মডেল তৈরি করা যেন এটি সত্য। তথ্য বিজ্ঞানে, এটি তিনটি আকারে আসে। প্রথমটি একটি জাল নম্বর: আপনি যদি কোনও ডেটা না দিয়ে মডেলটিকে "গড় অর্ডারের পরিমাণ কত" জিজ্ঞাসা করেন, তবে এটি আত্মবিশ্বাসের সাথে আপনাকে একটি নম্বর বলবে, যদিও এটি কখনও আপনার ডেটা দেখেনি। দ্বিতীয়টি এমন একটি ফাংশন যা বিদ্যমান নেই: মডেলটি এমন একটি ফাংশন প্রস্তাব করতে পারে যা একেবারেই নেই, যেমন pandas.read_excel_fast()৷ তৃতীয়, ভুল পরিসংখ্যানগত ব্যাখ্যা: মডেলটি মসৃণভাবে একটি ক্লাসিক পরিসংখ্যানগত ত্রুটি পুনরাবৃত্তি করতে পারে যেমন "p-মান 0.04, তাই অনুমানটি 96% সঠিক"।
যাচাইকরণ শৃঙ্খলা তিনটি ধাপ নিয়ে গঠিত:
- উত্সের লিঙ্ক: প্রতিটি নম্বর, হার এবং প্রবণতা আপনার ডেটা থেকে আসা উচিত, AI এর মেমরি নয়। কোডের জন্য AI ব্যবহার করুন যা ডেটাতে কাজ করে, এটি ডেটা মনে রাখার জন্য নয়।
- চালান এবং তুলনা করুন: AI দ্বারা প্রদত্ত কোডের প্রতিটি অংশ নিজেই চালান; প্রতিটি মেট্রিক এটি তৈরি করে একটি স্বাধীন বেসলাইনের সাথে তুলনা করুন।
- বিশেষজ্ঞ ফিল্টার: আউটপুট পরিসংখ্যান এবং ডোমেন জ্ঞানের বিরোধিতা করে কিনা তা নিজের জন্য পরীক্ষা করুন।
সতর্কতা: AI দ্বারা লিখিত একটি বিশ্লেষণকে না চালিয়ে একটি উপস্থাপনায় রাখা এবং এটি পড়া একটি স্বাক্ষরবিহীন প্রতিবেদন উপস্থাপন করার মতো। কোডটি কাজ করে তার মানে এই নয় যে এটি সঠিক; একটি কোড যা ভুল কলামের যোগফল দেয় তাও ত্রুটি ছাড়াই কাজ করে।
প্রজননযোগ্যতা: একই ফলাফল দুবার করতে সক্ষম হওয়া
ডেটা সায়েন্সের নীরব কিন্তু সমালোচনামূলক নীতি হল প্রজননযোগ্যতা: যখন আপনি ছয় মাস পরে আবার একটি বিশ্লেষণ চালান বা অন্য কম্পিউটারে, আপনি একই ফলাফল পাবেন। AI এর সাথে কাজ করার সময় এই ঝুঁকি বাড়ে, কারণ আপনি যখন AI কে বলেন "এই গ্রাফটি তৈরি করুন" এবং এটি ম্যানুয়ালি চালাতে, পদক্ষেপগুলি অদৃশ্য হয়ে যায়। নিয়ম: প্রতিটি পদক্ষেপ অবশ্যই কোড এবং সংস্করণ নিয়ন্ত্রণে নিবন্ধিত হতে হবে (যেমন গিট); এলোমেলোতা জড়িত পদক্ষেপে, এলোমেলো বীজ (এলোমেলো নম্বর জেনারেটরের প্রাথমিক মান; যদি স্থির করা হয়, ফলাফল পুনরাবৃত্তিযোগ্য হবে) স্থির করা উচিত। আমরা ইউনিট 10 এ এই বিষয়টিকে আরও গভীর করব; আপাতত, এই অভ্যাসটি গ্রহণ করুন: "হাতে ক্লিক করবেন না, কোডে লিখুন।"
তিনটি মিনি কেস
কেস 1 - নিরাপদ ত্বরণ। একজন ই-কমার্স বিশ্লেষক সাধারণত 240 হাজার সারিগুলির একটি অর্ডার টেবিল পরিষ্কার করতে অর্ধেক দিন ব্যয় করবেন। তিনি AI কে কলামের নাম এবং প্রথম 5 টি সারি (ব্যক্তিগত ডেটা ছাড়া) দিয়েছিলেন এবং পান্ডা পরিষ্কারের কোড চেয়েছিলেন। AI 8 সেকেন্ডে খসড়া তৈরি করেছে; বিশ্লেষক লাইন দ্বারা কোড লাইন পড়েন, তারিখ পার্সিং-এ একটি ত্রুটি সংশোধন করেন এবং এটি চালান। সময়কাল: 4 ঘন্টার পরিবর্তে 35 মিনিট। এআই কোড প্রদান করেছে, যাচাইকরণ মানুষের কাছেই থেকে গেছে।
কেস 2 — তৈরি করা মেট্রিক ফাঁদ। একজন ইন্টার্ন এআইকে জিজ্ঞাসা করেছিলেন, "এই ডেটাতে র্যান্ডম ফরেস্ট কতটা সঠিক?" মডেলের প্রশিক্ষণ ছাড়াই। "প্রায় 89%," এআই বলেছে। ইন্টার্ন এই উপস্থাপনা মধ্যে রাখা; যখন প্রকৃত মডেল প্রশিক্ষিত হয়েছিল, তখন নির্ভুলতা ছিল 71%। ভুল: AI কে ডেটা এবং মডেল না দিয়ে মেট্রিক্সের জন্য অপেক্ষা করা।
কেস 3 - নীরব ফাঁস। একটি দল AI-প্রস্তাবিত ধারণাটিকে "বৈশিষ্ট্য হিসাবে লক্ষ্য পরিবর্তনশীলের গড় যোগ করুন" প্রশ্ন না করেই বাস্তবায়ন করেছে। মডেলটি পরীক্ষার সেটে 98% পারফর্ম করেছে কিন্তু উৎপাদনে বিপর্যস্ত হয়েছে কারণ বৈশিষ্ট্যটি ভবিষ্যতের তথ্য ফাঁস করছে (ডেটা লিক, ইউনিট 10)। ভুল: পরিসংখ্যানগতভাবে এআই সুপারিশ ফিল্টারিং নয়।
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট:
এই বিক্রয় ডেটা বিশ্লেষণ করুন এবং আমাকে গড় আয় বলুন।
এই দাবিটি ত্রুটিপূর্ণ: এআইকে ডেটা দেওয়া হয়নি, তাই "গড় আয়" শুধুমাত্র তৈরি করা যেতে পারে। না কলাম, না সময়কাল, না মুদ্রা স্পষ্ট।
শক্তিশালী প্রম্পট:
আপনার ভূমিকা: একজন ডেটা বিজ্ঞানীকে সাহায্য করা সহকারী। আমার কাছে একটি পান্ডা ডেটাফ্রেম আছে: df. কলাম:- order_date (টেক্সট, ফরম্যাটে "2024-03-01")- amount_tl (দশমিক, কিছু সারিতে NaN)- গ্রাহক_আইডি (পূর্ণসংখ্যা) টাস্ক: (1) পান্ডাস কোড লিখুন যা গড় পরিমাণ গণনা করে, (2) ব্যাখ্যা করুন যে এটি কীভাবে NaN মানগুলি পরিচালনা করে, (3) কোডটি অনুমানগুলিকে তালিকাভুক্ত করে। ডেটা সামগ্রী তৈরি করবেন না; শুধু কোড তৈরি করুন এবং আমি চালাব এবং ফলাফল যাচাই করব।
এই অনুরোধে, পরিকল্পনা, প্রত্যাশা এবং "বানোয়াট নিষেধাজ্ঞা" স্পষ্ট। আপনি এখনও চালান এবং নিজেই আউটপুট যাচাই করুন।
নৈতিকতা এবং গোপনীয়তার সূচনা
ডেটা সায়েন্স প্রায়ই ব্যক্তিগত ডেটা নিয়ে কাজ করে: গ্রাহক, রোগী, কর্মচারী রেকর্ড। Türkiye-তে KVKK (Personal Data Protection Law) এবং ইউরোপে GDPR এই ডেটা রক্ষা করে। পাবলিক এআই টুলে আপনার আসল নাম, আইডি, ইমেল বা ঠিকানা পেস্ট করা একটি লঙ্ঘন। নিয়ম: শেয়ার করার আগে ডেটা বেনামী করুন, প্রয়োজনে শুধুমাত্র স্কিমা (কলামের নাম, প্রকার) এবং ডামি উদাহরণ সারি প্রদান করুন। আমরা ইউনিট 11-এ নীতিশাস্ত্রের বিষয়টি গভীর করব; চলুন শুরু থেকে নীতি রাখা যাক: ডেটা বোঝার জন্য, এর গঠন ভাগ করা, এর বিষয়বস্তু নয়, প্রায়শই যথেষ্ট।
সাধারণ ভুল
- AI কে ডেটা না দিয়েই সংখ্যা/মেট্রিক্সের জন্য অপেক্ষা করা। মডেল ডেটা অ্যাক্সেস করতে পারে না; তার দেওয়া নম্বরটি ভুয়া। সর্বদা ফলাফল গণনা এবং রান আছে.
- ভাবছেন যে কাজের কোড সঠিক। যে কোডটি ভুল কলামকে ম্যানিপুলেট করে তাও ত্রুটি ছাড়াই চলে; যুক্তি না পড়ে বিশ্বাস করবেন না।
- খোলা টুলে প্রকৃত ব্যক্তিগত তথ্য আটকানো। নাম, আইডি নম্বর, ই-মেইল কখনো শেয়ার করা হয় না; ডায়াগ্রামই যথেষ্ট।
- ম্যানুয়ালি পদক্ষেপগুলি করা এবং সেগুলি কোডে না লিখুন৷ পুনরুত্পাদনযোগ্য নয় এমন বিশ্লেষণ অবিশ্বস্ত।
- প্রশ্ন ছাড়াই পরিসংখ্যানের AI এর ব্যাখ্যা গ্রহণ করা। এআই পি-মান এবং পারস্পরিক সম্পর্কের মতো ধারণাগুলিতে ক্লাসিক ভুলগুলি পুনরাবৃত্তি করতে পারে।
টিপ: আপনার প্রতিটি AI সেশনে একটি সংক্ষিপ্ত "নিয়ম লাইন" অন্তর্ভুক্ত করুন: "ডেটা বিষয়বস্তু তৈরি করবেন না; শুধু কোড/বিশ্লেষণ তৈরি করুন এবং আমি ফলাফলটি চালাব এবং যাচাই করব; যেখানে আপনি অনিশ্চিত সেখানে 'নিশ্চিত নন' নির্দেশ করুন।" এই একক বাক্যটি হ্যালুসিনেশনের ঝুঁকি উল্লেখযোগ্যভাবে হ্রাস করে।
সংক্ষেপে
AI হল ডেটা সায়েন্সের একটি শক্তিশালী সহকারী: এটি ক্লিনিং কোড, EDA ব্যাখ্যা, মডেল সুপারিশ এবং ভিজ্যুয়ালাইজেশনকে ত্বরান্বিত করে। কিন্তু সমস্যার সংজ্ঞা, মেট্রিক নির্বাচন, উৎপাদন সিদ্ধান্ত এবং নৈতিক সীমানা মানুষের অন্তর্গত। কর্মপ্রবাহের ছয়টি পর্যায় রয়েছে এবং ঝুঁকি বাড়ার সাথে সাথে AI এর ভূমিকা ছোট হয়ে যায়। তিনটি অভ্যাস হল সবকিছুর ভিত্তি: সোর্স লিঙ্কিং (বৈধতা), প্রজননযোগ্যতা (কোডিং), এবং বেনামীকরণ (গোপনীয়তা)। একবার আপনি এই তিনটি অভ্যন্তরীণ করে ফেললে, বাকি মডিউলের প্রতিটি টুল আপনার জন্য একটি নিরাপদ ত্বরণকারী হয়ে ওঠে।
আবেদন টাস্ক
আপনার কাছে থাকা একটি ছোট টেবিলের একটি স্কিমা তৈরি করুন (বা একটি অনুমানমূলক): কলামের নাম, প্রকার এবং 2-3টি ডামি উদাহরণ সারি (প্রকৃত ব্যক্তিগত ডেটা ছাড়া)। উপরের "শক্তিশালী প্রম্পট" টেমপ্লেটটি ব্যবহার করে একটি সারাংশ পরিসংখ্যান কোডের জন্য AI-কে জিজ্ঞাসা করুন। কোডটি চালান, আউটপুটটিকে একটি ম্যানুয়াল মানের সাথে তুলনা করুন, যেকোন মিথ্যা অনুমান পরীক্ষা করুন এবং 5টি বুলেট পয়েন্টে আপনার ফলাফলগুলি নোট করুন৷
চেকলিস্ট
- আমি কি আসল ব্যক্তিগত ডেটার পরিবর্তে এআইকে একটি স্কিমা এবং একটি জাল নমুনা দিয়েছি?
- [ ] আমি কি কোডটি পড়েছি এবং এটি লাইন দ্বারা উত্পাদিত কোড রান করেছি?
- [ ] আমি কি আউটপুটে প্রতিটি সংখ্যা স্বাধীনভাবে যাচাই করেছি?
- [ ] আমি কি কোডে বিশ্লেষণের প্রতিটি ধাপ লিখেছি এবং এটি পুনরাবৃত্তিযোগ্য করে তুলেছি?
- [ ] আমি কি মিশনের ঝুঁকির মাত্রা নির্ধারণ করেছি এবং একজন মানুষকে চূড়ান্ত সিদ্ধান্ত দিয়েছি?