ইউনিট
1. এমএল ইঞ্জিনিয়ারিংয়ে কৃত্রিম বুদ্ধিমত্তা: ভূমিকা, সীমানা, বৈধতা এবং দায়িত্ব 2. ডেটা পাইপলাইন: সংগ্রহ, পরিষ্কার, ট্যাগিং এবং সংস্করণ 3. মডেল প্রশিক্ষণ এবং মূল্যায়ন: সঠিক মেট্রিক্স, সৎ বেঞ্চমার্কিং 4. LLM আবেদন: RAG এর সাথে আপনার নিজস্ব ডেটার উপর ভিত্তি করে উত্তর 5. এলএলএম অ্যাপ্লিকেশন: এজেন্ট, টুলিং এবং সিকিউর অটোমেশন 6. ফাইন-টিউনিং বেসিস: কখন, কীভাবে এবং কী ঝুঁকি নিয়ে 7. MLOps এবং স্থাপনা: ল্যাব থেকে উৎপাদনে মডেল সরানো 8. ইভাল এবং মনিটরিং: মডেলটি উত্পাদনে আসলে কী করে তা জানা 9. নিরাপত্তা এবং গোপনীয়তা: এআই সিস্টেম রক্ষা করা 10. পক্ষপাত, নৈতিকতা এবং খরচ: দায়িত্বশীল এবং টেকসই এআই ইঞ্জিনিয়ারিং 11. প্রজননযোগ্যতা এবং এন্ড-টু-এন্ড প্রজেক্ট: সবকিছুর সমন্বয়
ইউনিট 3 / 11

মডেল প্রশিক্ষণ এবং মূল্যায়ন: সঠিক মেট্রিক্স, সৎ বেঞ্চমার্কিং

লাভ:

  • সমস্যার ধরন এবং ব্যবসায়িক প্রসঙ্গের জন্য উপযুক্ত মেট্রিক বেছে নেওয়ার ক্ষমতা (ভারসাম্যহীন ডেটাতে PR-AUC/রিকল, রিগ্রেশনে MAE/RMSE) এবং ওভার/আন্ডার লার্নিং চিনতে পারে
  • প্রতিটি মেট্রিককে একটি বেসলাইনের বিপরীতে ব্যাখ্যা করার ক্ষমতা এবং বিচ্যুতি পরিমাপ করার ক্ষমতা এবং ক্রস-ভ্যালিডেশনের সাথে অগ্রগতি থেকে আলাদা শব্দ
  • যাচাইকরণ সেটের সাথে হাইপারপ্যারামিটার টিউন করে এবং শুধুমাত্র শেষে পরীক্ষা সেট ব্যবহার করে অ-আশাবাদী ফলাফলের রিপোর্ট করার ক্ষমতা

মডেল প্রশিক্ষণ (প্রশিক্ষণ: ডেটা থেকে প্যাটার্ন শেখার প্রক্রিয়া) এমএল ইঞ্জিনিয়ারিংয়ের সবচেয়ে দৃশ্যমান কিন্তু সবচেয়ে বিভ্রান্তিকর পদক্ষেপ। এটি প্রদর্শিত হয় কারণ এটি "নির্ভুলতা 95%" এর মতো একটি সন্তোষজনক সংখ্যা তৈরি করে। বিভ্রান্তিকর কারণ সেই সংখ্যাটি প্রায়ই ভুল প্রশ্নের সঠিক উত্তর। এই ইউনিটে ইঞ্জিনিয়ারিং ডিসিপ্লিনের সাথে শিক্ষা ও মূল্যায়ন নিয়ে আলোচনা করা হয়; আমরা পরীক্ষামূলক ডিজাইনে অংশীদার হিসাবে কৃত্রিম বুদ্ধিমত্তা ব্যবহার করি এবং পরিমাপের উপর ভিত্তি করে সিদ্ধান্ত নিই।

প্রশিক্ষণ চক্রের যুক্তি

একটি মডেল একটি ক্ষতি ফাংশন কমিয়ে ডেটাতে প্যাটার্ন শিখে: একটি ফাংশন যা সংখ্যাগতভাবে মডেলের ত্রুটি পরিমাপ করে। অপ্টিমাইজেশান অ্যালগরিদম (যেমন গ্রেডিয়েন্ট ডিসেন্ট) ধাপে ধাপে পরামিতিগুলি সামঞ্জস্য করে ক্ষতি হ্রাস করে। উদ্দেশ্য প্রশিক্ষণের ডেটা মুখস্থ করা নয়, বরং এটিকে অভূতপূর্ব ডেটাতে সাধারণীকরণ করা।

দুটি প্রধান বিপদ:

  • ওভারফিটিং: মডেলটি প্রশিক্ষণের ডেটা মুখস্থ করে এবং নতুন ডেটাতে ব্যর্থ হয়। প্রশিক্ষণের সাফল্য বেশি, যাচাইকরণের সাফল্য কম।
  • আন্ডারফিটিং: মডেল প্যাটার্ন ক্যাপচার করতে পারে না; প্রশিক্ষণ এবং যাচাইকরণ সাফল্য উভয়ই কম।

ভারসাম্য খোঁজা শিক্ষার শিল্প। এই ভারসাম্য নিরীক্ষণ করার জন্য বৈধকরণ সেট রয়েছে: প্রশিক্ষণের সাফল্য বৃদ্ধির সাথে সাথে যদি বৈধতা সাফল্য হ্রাস পেতে শুরু করে, ওভারলার্নিং শুরু হয়েছে।

টিপ: প্রতিটি ধাপে একসাথে প্রশিক্ষণ এবং বৈধতা হারানোর পরিকল্পনা করুন। যে বিন্দুতে দুটি বক্ররেখা বিচ্ছিন্ন হতে শুরু করে সেখানে ওভারলার্নিং শুরু হয় এবং এটি "প্রথম দিকে থামার" সঠিক মুহূর্ত।

মেট্রিক নির্বাচন: সবচেয়ে গুরুত্বপূর্ণ সিদ্ধান্ত

ভুল মেট্রিক একটি ভাল মডেল খারাপ দেখায় এবং একটি খারাপ মডেল ভাল দেখায়। সমস্যা মেট্রিক নির্ধারণ করে:

  • ভারসাম্যহীন শ্রেণীবিভাগ (একটি শ্রেণী খুবই বিরল, যেমন জালিয়াতি): যথার্থতা বিভ্রান্তিকর। একটি মডেল যা বলে "সবকিছু স্বাভাবিক করুন" 99% নির্ভুলতা পাবে কিন্তু একটিও জালিয়াতি ধরা পড়বে না৷ পরিবর্তে, নির্ভুলতা (আমি যা ধরেছি তার কতটা আসলে ইতিবাচক), রিকল (আমি যা ধরেছি তার কতটা সত্য পজিটিভ) এবং তাদের ব্যালেন্স F1 বা PR-AUC ব্যবহার করা হয়।
  • সুষম শ্রেণীবিভাগ: যথার্থতা এবং ROC-AUC উপযুক্ত হতে পারে।
  • রিগ্রেশন (সংখ্যা অনুমান): MAE (মানে পরম ত্রুটি), RMSE (বড় ত্রুটিগুলিকে শাস্তি দেয়), MAPE (শতাংশ ত্রুটি)।
  • র‌্যাঙ্কিং/সুপারিশ: NDCG, MRR, Recall@K.

নির্ভুলতা বা প্রত্যাহার গুরুত্বপূর্ণ কিনা তা ব্যবসার প্রসঙ্গে নির্ভর করে। ক্যানসার স্ক্রীনিং-এর ক্ষেত্রে প্রত্যাহার (কোনও রোগীকে অনুপস্থিত নয়) একটি অগ্রাধিকার; স্প্যাম ফিল্টারে নির্ভুলতা (স্প্যামে গুরুত্বপূর্ণ ই-মেইল না পাঠানো) গুরুত্বপূর্ণ। এটি একটি ব্যবসায়িক সিদ্ধান্ত, প্রযুক্তিগত নয় এবং এটি প্রকৌশলী এবং মালিক দ্বারা একসাথে করা হয়৷

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল প্রম্পট: "আমার মডেলের কর্মক্ষমতা মূল্যায়ন করুন, নির্ভুলতা 0.97।"

শক্তিশালী প্রম্পট: "আমার কাছে একটি জালিয়াতি সনাক্তকরণ মডেল আছে; ইতিবাচক শ্রেণির হার হল 1.5%। নির্ভুলতা 0.97 হিসাবে রিপোর্ট করা হয়েছে। কেন এই মেট্রিকটি বিভ্রান্তিকর হতে পারে তা ব্যাখ্যা করুন, আমাকে বলুন কোন মেট্রিকগুলি (নির্ভুলতা, রিকল, PR-AUC) আমার পছন্দ করা উচিত এবং কেন। এছাড়াও গণনা করুন কতটা নির্ভুল একটি 'কললাইন মডেল আমি নেতিবাচক তথ্য যোগ করতে পারি, তাই এই মডেলটি নেতিবাচক সবকিছু দেখতে পাবে।"

পার্থক্য: শক্তিশালী প্রম্পট শ্রেণী অনুপাত এবং ব্যবসার প্রসঙ্গ দেয়; এটি একটি বেসলাইন মডেল তুলনার জন্যও জিজ্ঞাসা করে — এটি একটি মেট্রিক অর্থপূর্ণ কিনা তার জন্য এটি সবচেয়ে গুরুত্বপূর্ণ অ্যাঙ্কর।

বেসলাইন: তুলনা ছাড়া মেট্রিক অর্থহীন

একটি মেট্রিক নিজেই ভাল বা খারাপ নয়; এটি একটি মৌলিক মডেল অনুযায়ী ভাল বা খারাপ। মৌলিক মডেল হল সবচেয়ে সহজ সমাধান যা মনে আসে: "সর্বদা সংখ্যাগরিষ্ঠ শ্রেণীকে বলুন", "গত সপ্তাহের মান পুনরাবৃত্তি করুন", "গড় অনুমান করুন"। যদি আপনার মডেলটি এই সহজ সমাধানটি পরিষ্কারভাবে পাস করতে না পারে তবে সমস্ত জটিলতা কিছুই নয়।

সতর্কতা: "আমার মডেল 85% সঠিক" বাক্যটি নিজেই কিছু বলে না। যদি বেস মডেল ইতিমধ্যে 84% পায়, আপনার মডেল প্রায় মূল্যহীন; যদি বেস মডেল 50% পায়, আপনার মডেল নিখুঁত। সর্বদা মৌলিক মডেলের পরিপ্রেক্ষিতে কথা বলুন।

ক্রস বৈধতা এবং বিশ্বাস

একটি একক প্রশিক্ষণ/পরীক্ষা বিভাজন সুযোগের কারণে হতে পারে। ক্রস-ভ্যালিডেশন: ডেটাকে k অংশে ভাগ করা এবং প্রতিটি অংশকে পর্যায়ক্রমে পরীক্ষা করা দেখায় যে কার্যক্ষমতা কতটা স্থিতিশীল। 5-গুণ ক্রস যাচাইকরণে আপনি পাঁচটি ভিন্ন স্কোর পাবেন; তাদের গড় এবং আদর্শ বিচ্যুতি গুরুত্বপূর্ণ। যদি গড় 80% হয় কিন্তু বিচ্যুতি ±12% হয়, আপনার মডেলটি অস্থির - এটি ডেটার পরবর্তী ব্যাচে খুব ভিন্নভাবে আচরণ করতে পারে।

এটি "দুই মডেল তুলনা" এর জন্যও গুরুত্বপূর্ণ। যদি মডেল A 81% এবং মডেল B 82% পায় তবে B কি সত্যিই ভাল? বিচ্যুতি ±3% হলে, এই পার্থক্য গোলমাল হতে পারে। সিদ্ধান্ত নেওয়ার আগে পার্থক্যটি তাৎপর্যপূর্ণ কিনা তা বিবেচনা করুন।

হাইপারপ্যারামিটার টিউনিং: যাচাইকরণ সহ, পরীক্ষা নয়

হাইপারপ্যারামিটার (প্রশিক্ষণের আগে ম্যানুয়ালি নির্ধারিত সেটিংস—শেখার হার, গাছের গভীরতা ইত্যাদি) যাচাইকরণ সেটের সাথে সেট করা হয়। পরীক্ষা সেট শুধুমাত্র শেষে ব্যবহার করা হয়, একবার. আপনি যদি পরীক্ষার সেট দেখে হাইপারপ্যারামিটার নির্বাচন করেন, তাহলে পরীক্ষার সেটটি দূষিত হবে এবং আপনার রিপোর্ট করা কর্মক্ষমতা আশাবাদী হবে যা বাস্তবে তা নয়।

কৃত্রিম বুদ্ধিমত্তা হাইপারপ্যারামিটার সার্চ স্পেস ডিজাইন করতে এবং সার্চ কোড (গ্রিড সার্চ, র্যান্ডম সার্চ, বায়েসিয়ান অপ্টিমাইজেশান) লেখার জন্য একটি ভাল সহায়ক। কিন্তু আপনি এখনও সিদ্ধান্ত নেন "আমরা কোন মেট্রিক অপ্টিমাইজ করব?"

তিনটি মিনি কেস

কেস 1 - সঠিকতা ফাঁদ। একটি মেডিকেল দল এমন একটি মডেলের জন্য গর্বিত ছিল যা একটি বিরল রোগ সনাক্ত করেছে: 98% নির্ভুলতা। যখন মৌলিক মডেল তুলনা করা হয়েছিল, তখন সত্য উত্থাপিত হয়েছিল: যেহেতু রোগের হার ছিল 2%, যে মডেলটি "সবাইকে সুস্থ বল" বলেছিল সেটিও 98% পেয়েছে। মডেলটির প্রত্যাহার ছিল মাত্র 11% - বেশিরভাগ রোগী অনুপস্থিত। একবার মেট্রিককে PR-AUC-তে রূপান্তরিত করা হলে, প্রকৃত কর্মক্ষমতা পরিমাপ করা হয় এবং মডেলটিকে পুনরায় ডিজাইন করা হয়।

কেস 2 - অগ্রগতির জন্য ভুল গোলমাল। একটি দল 86.2% থেকে 86.9% পর্যন্ত মডেলটিকে উন্নত করতে কয়েক মাস ব্যয় করেছে। ক্রস-ভ্যালিডেশন দেখায় যে পক্ষপাত ছিল ±1.4% — তাই 0.7 পয়েন্ট "উন্নতি" ছিল পরিসংখ্যানগত গোলমাল। দলটি অবাস্তব উপার্জনে তিন সপ্তাহ নষ্ট করেছে। পাঠ: উন্নতি যে বিচ্যুতির চেয়ে বড় তা যাচাই না করে বিজয় ঘোষণা করবেন না।

কেস 3 - পরীক্ষার সেটের দূষণ। সেরা হাইপারপ্যারামিটারগুলি বেছে নিতে একজন প্রকৌশলী বারবার পরীক্ষার সেটের দিকে তাকালেন। 91% এটি উৎপাদনে 83% এ নেমে গেছে। কেন: তিনি অজান্তেই পরীক্ষার সেটটি বারবার দেখে (পরীক্ষা সেটে ওভারলার্নিং) দেখে সেই অনুযায়ী মডেলটি নির্বাচন করেছিলেন। একটি পৃথক বৈধতা সেট ব্যবহার করা হলে রিপোর্ট করা এবং প্রকৃত কর্মক্ষমতা ওভারল্যাপ করা হয়।

অনুলিপিযোগ্য টেমপ্লেট

এই শ্রেণিবিন্যাসের সমস্যার জন্য সঠিক মেট্রিক বেছে নিতে আমাকে সাহায্য করুন। সমস্যা: [কি ভবিষ্যদ্বাণী করা হয়েছে] শ্রেণি বিতরণ: [ধনাত্মক হার

নিম্নলিখিত দুটি মডেলের তুলনা মূল্যায়ন করুন। মডেল A ক্রস-ভ্যালিডেশন: [স্কোরের তালিকা] মডেল বি ক্রস-ভ্যালিডেশন: [স্কোরের তালিকা] গড় এবং মানক বিচ্যুতি গণনা করুন। পার্থক্যটি কি পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ নাকি এটি বিচ্যুতির মধ্যে শুধু গোলমাল? আমি কোনটি বেছে নেওয়ার সুপারিশ করবেন এবং কেন?

নিম্নলিখিতগুলির জন্য এই প্রশিক্ষণ কোডটি পরীক্ষা করুন: 1) হাইপারপ্যারামিটারগুলি কি পরীক্ষার সেট বা বৈধতা সেটের সাথে নির্বাচন করা হয়েছে? 2) সঠিক সেটের সাথে কি তাড়াতাড়ি বন্ধ করা হয়?

এই রিগ্রেশন সমস্যার জন্য MAE, RMSE এবং MAPE-এর মধ্যে কোনটি আমার রিপোর্ট করা উচিত? টার্গেট ভেরিয়েবলের স্কেল: [রেঞ্জ] বড় ত্রুটিগুলি কি অসামঞ্জস্যপূর্ণভাবে খারাপ (RMSE), নাকি তারা সব সমান (MAE)? সেখানে কি শূন্যের কাছাকাছি মান আছে (এগুলি কি MAPE বিকৃত করে)? সংক্ষিপ্ত ন্যায্যতার সাথে পরামর্শ দিন।

মেট্রিক নির্বাচন টেবিল

সমস্যার ধরন

উপযুক্ত মেট্রিক

এড়ানোর জন্য

কেন

ভারসাম্যহীন শ্রেণীবিভাগ

PR-AUC, F1, প্রত্যাহার

নির্ভুলতা

সংখ্যাগরিষ্ঠ শ্রেণী মেট্রিক স্ফীত করে

সুষম শ্রেণীবিভাগ

নির্ভুলতা, ROC-AUC

-

সুষম ডেটাতে নির্ভরযোগ্য

রিগ্রেশন (উল্লেখযোগ্য বহিঃপ্রকাশ)

RMSE

MAPE (শূন্য হলে)

বড় ভুলের শাস্তি দেয়

রিগ্রেশন (সমান ওজন)

এমএই

-

ব্যাখ্যা করা সহজ

র‌্যাঙ্কিং/সুপারিশ

NDCG, Recal@K

নির্ভুলতা

অর্ডার গুরুত্বপূর্ণ

সাধারণ ভুল

  • ভারসাম্যহীন ডেটাতে নির্ভুলতা ব্যবহার করা। সবচেয়ে সাধারণ মেট্রিক ত্রুটি।
  • বেস মডেল তুলনা করা না. এটি মেট্রিক এর অর্থ হারায়।
  • হাইপারপ্যারামিটারের জন্য পরীক্ষার সেট দেখছি। আশাবাদী, অবাস্তব ফলাফল।
  • একটি একক বগির উপর নির্ভরশীল। ক্রস-ভ্যালিডেশন ছাড়া আপনি পক্ষপাত দেখতে পাবেন না।
  • অগ্রগতির জন্য ভুল গোলমাল। বিচ্যুতি থেকে ছোট "উন্নতি" বেশিরভাগই ভাগ্য।
  • ব্যবসার প্রেক্ষাপট উপেক্ষা করা। নির্ভুলতা/রিকল ব্যালেন্স একটি ব্যবসায়িক সিদ্ধান্ত।

সংক্ষেপে

মডেল প্রশিক্ষণের আসল দক্ষতা একটি উচ্চ সংখ্যা তৈরি করা নয়, তবে সেই সংখ্যার অর্থ কী তা জানা। সমস্যা এবং ব্যবসার প্রেক্ষাপট সঠিক মেট্রিক নির্ধারণ করে; একটি বেসলাইন মডেল অনুযায়ী প্রতিটি মেট্রিক ব্যাখ্যা; ক্রস-ভ্যালিডেশন দিয়ে পক্ষপাতিত্ব পরিমাপ করুন এবং অগ্রগতির জন্য গোলমাল ভুল করবেন না; পরীক্ষার সেটটি শুধুমাত্র শেষে, একবার ব্যবহার করুন। AI হল এক্সপেরিমেন্ট ডিজাইনে আপনার অংশীদার, কিন্তু "যথেষ্ট ভাল" সিদ্ধান্তটি আপনার এবং আপনারই।

আবেদন টাস্ক

একটি শ্রেণিবিন্যাস মডেলের জন্য: (1) শ্রেণি বিতরণ লিখুন, (2) একটি উপযুক্ত বেস মডেল তৈরি করুন এবং এর স্কোর পরিমাপ করুন, (3) 5-গুণ ক্রস বৈধতা দিয়ে আপনার মডেলটি মূল্যায়ন করুন এবং গড় এবং মান বিচ্যুতি রিপোর্ট করুন, (4) সঠিকতার পরিবর্তে সমস্যাটির জন্য উপযুক্ত মেট্রিক গণনা করুন (যেমন PR-AUC)। আপনার মডেল পক্ষপাত ছাড়াই একটি বড় ব্যবধানে বেসলাইন মডেলকে হারায় কিনা তা লিখুন।

চেকলিস্ট

  • [ ] আমি সমস্যার ধরন এবং ব্যবসার প্রেক্ষাপটের উপর ভিত্তি করে মেট্রিক বেছে নিয়েছি।
  • [ ] আমি একটি বেস মডেল তৈরি করেছি এবং এটির সাথে তুলনা করেছি।
  • [ ] আমি ক্রস-ভ্যালিডেশন সহ গড় এবং বিচ্যুতি রিপোর্ট করেছি।
  • [ ] আমি নিশ্চিত করেছি যে উন্নতি বিচ্যুতির চেয়ে বেশি।
  • [ ] আমি যাচাইকরণ সেটের সাথে হাইপারপ্যারামিটার নির্বাচন করেছি।
  • [ ] আমি শুধুমাত্র একবার পরীক্ষার সেটটি ব্যবহার করেছি, একেবারে শেষে।