ইউনিট
1. এমএল ইঞ্জিনিয়ারিংয়ে কৃত্রিম বুদ্ধিমত্তা: ভূমিকা, সীমানা, বৈধতা এবং দায়িত্ব 2. ডেটা পাইপলাইন: সংগ্রহ, পরিষ্কার, ট্যাগিং এবং সংস্করণ 3. মডেল প্রশিক্ষণ এবং মূল্যায়ন: সঠিক মেট্রিক্স, সৎ বেঞ্চমার্কিং 4. LLM আবেদন: RAG এর সাথে আপনার নিজস্ব ডেটার উপর ভিত্তি করে উত্তর 5. এলএলএম অ্যাপ্লিকেশন: এজেন্ট, টুলিং এবং সিকিউর অটোমেশন 6. ফাইন-টিউনিং বেসিস: কখন, কীভাবে এবং কী ঝুঁকি নিয়ে 7. MLOps এবং স্থাপনা: ল্যাব থেকে উৎপাদনে মডেল সরানো 8. ইভাল এবং মনিটরিং: মডেলটি উত্পাদনে আসলে কী করে তা জানা 9. নিরাপত্তা এবং গোপনীয়তা: এআই সিস্টেম রক্ষা করা 10. পক্ষপাত, নৈতিকতা এবং খরচ: দায়িত্বশীল এবং টেকসই এআই ইঞ্জিনিয়ারিং 11. প্রজননযোগ্যতা এবং এন্ড-টু-এন্ড প্রজেক্ট: সবকিছুর সমন্বয়
ইউনিট 11 / 11

প্রজননযোগ্যতা এবং এন্ড-টু-এন্ড প্রজেক্ট: সবকিছুর সমন্বয়

লাভ:

  • চারটি স্তম্ভের সাথে প্রজননযোগ্যতা নিশ্চিত করার ক্ষমতা (বীজ নির্ধারণ, ডেটা সংস্করণ, মিডিয়া ফ্রিজিং, পরীক্ষা নিরীক্ষণ) এবং একই রানের পুনরাবৃত্তি করার সময় একই ফলাফল তৈরি করা
  • এন্ড-টু-এন্ড চেইনে মডিউলের সমস্ত স্টপ (মেট্রিক্স, ডেটা, মডেল, এলএলএম উপাদান, ইভাল, ন্যায্যতা, নিরাপত্তা, বিতরণ, পর্যবেক্ষণ) একত্রিত করার ক্ষমতা
  • প্রতিটি স্টপে গুরুত্বপূর্ণ সিদ্ধান্তটি মানুষের সাথে থাকে তা যাচাই করার ক্ষমতা এবং একটি নিরীক্ষণযোগ্য পদ্ধতিতে প্রকল্পটি নথিভুক্ত করা

একটি ML প্রকল্পের সবচেয়ে ছলনাময় ব্যর্থতা একটি ক্র্যাশ নয়; "আবার একই ফলাফল পাচ্ছেন না।" আপনি যদি তিন মাস আগে যে মডেলটি তৈরি করেছিলেন তার আজকের স্কোর পুনরুত্পাদন করতে না পারলে, আপনি সত্যিই সেই মডেলটিকে নিয়ন্ত্রণ করবেন না। এই ক্লোজিং ইউনিটে, আমরা প্রজননযোগ্যতাকে আরও গভীর করি: একই ইনপুটগুলির সাথে নির্ভরযোগ্যভাবে একই ফলাফল প্রাপ্ত করার এবং সম্পূর্ণ মডিউলটিকে শেষ-থেকে-এন্ড প্রজেক্ট ডিসিপ্লিনে একত্রিত করার ক্ষমতা।

কেন প্রজননযোগ্যতা কঠিন

সাধারণ সফটওয়্যারে একই কোড একই আউটপুট দেয়। এমএল-এ আরও অনেক ভেরিয়েবল রয়েছে যা ফলাফল নির্ধারণ করে:

  • এলোমেলোতা: ডেটা এলোমেলো হওয়া, ওজন শুরু করা, ডেটা বিভাজন - সবই এলোমেলোতার উপর নির্ভর করে।
  • ডেটা: একই কোড বিভিন্ন ডেটা সংস্করণ সহ বিভিন্ন মডেল তৈরি করে।
  • পরিবেশ: লাইব্রেরি সংস্করণ, হার্ডওয়্যার (CPU/GPU), এমনকি অপারেটিং সিস্টেম ফলাফল পরিবর্তন করতে পারে।
  • লুকানো কেস: একটি অসংরক্ষিত হাইপারপ্যারামিটার, একটি ম্যানুয়াল প্রিপ্রসেসিং ধাপ, একটি অলক্ষ্য নির্বাচন।

পুনরুৎপাদনযোগ্যতা একটি "সুন্দর" নয় কিন্তু একটি বৈজ্ঞানিক এবং প্রকৌশল অপরিহার্য। একটি ফলাফল যা পুনরুত্পাদন করা যাবে না এমন একটি দাবি যা প্রমাণ করা যায় না।

প্রজননযোগ্যতার চারটি স্তম্ভ

1. এলোমেলোতা ঠিক করুন। সমস্ত এলোমেলো বীজ এক জায়গায় সেট করুন: ডেটা বিভাজন, মডেল প্রাথমিককরণ, ডেটা শাফলিং। স্থির বীজ "একই ফলাফল যখন আপনি একই রান পুনরাবৃত্তি" গ্যারান্টি ভিত্তি।

2. ডেটা সংস্করণ। প্রতিটি পরীক্ষা কোন ডেটা সংস্করণের সাথে সঞ্চালিত হয়েছিল তা রেকর্ড করুন (ইউনিট 2-এ ডেটা সংস্করণ)। "সর্বশেষ তথ্য" অস্পষ্ট; "ডেটা সংস্করণ v3, হ্যাশ abc123" সঠিক।

3. মাঝারি হিমায়িত. সমস্ত নির্ভরতাকে তাদের সঠিক সংস্করণে পিন করুন (উদাহরণ. প্রয়োজনীয় সংস্করণে numpy==1.26.4, বা একটি ধারক চিত্র)। "সর্বশেষ সংস্করণ" একদিন সবকিছু ভেঙে দেবে।

4. সবকিছু ট্র্যাক করুন (পরীক্ষা ট্র্যাকিং)। প্রতিটি পরীক্ষার জন্য স্বয়ংক্রিয়ভাবে সংরক্ষণ করুন: কোড সংস্করণ (গিট কমিট), ডেটা সংস্করণ, সমস্ত হাইপারপ্যারামিটার, মেট্রিক্স এবং আউটপুট কাঠামো। MLflow, Weights & Biases এর মত এক্সপেরিমেন্ট ট্র্যাকিং টুলগুলি পদ্ধতিগতভাবে এটি করে। নিবন্ধন ছাড়া, "কোন সেটিংটি সেরা ছিল" প্রশ্নটি উত্তরহীন থেকে যায়।

সতর্কতা: "আমি পরে মনে রাখব" সবচেয়ে ব্যয়বহুল ভুল। দুই সপ্তাহ পরে আপনি মনে করতে পারবেন না কোন বীজ, কোন ডেটা, কোন হাইপারপ্যারামিটার আপনি ব্যবহার করেছেন। স্বয়ংক্রিয় ট্র্যাকিং মেমরির উপর নির্ভরতা দূর করে।

দুর্বল পন্থা / শক্তিশালী পন্থা

দুর্বল: "আমি সেরা মডেল খুঁজে পেয়েছি, এটি নোটবুকে রয়েছে, আমি মনে করি এর স্কোর ছিল 89%।"

শক্তিশালী: "পরীক্ষার ট্র্যাকিং টুলে #147 চালান: git কমিট a3f9c, ডেটা সংস্করণ v3 (হ্যাশ abc123), বীজ 42, সমস্ত হাইপারপ্যারামিটার নিবন্ধিত, PR-AUC 0.887 পরীক্ষা করা। যখন আমি আবার একই কমান্ড চালাই, আমি বিট করে একই ফলাফল পাই। মডেলটি রেজিস্ট্রিতে এই রানের উপর নির্ভর করে।"

পার্থক্য: শক্তিশালী পদ্ধতির ফলাফল একটি মেমরি উপর ভিত্তি করে নয়, কিন্তু একটি স্থির এবং পর্যবেক্ষণ চেইন উপর ভিত্তি করে. প্রত্যেকে প্রতিবার একই ফলাফল দিতে পারে।

এন্ড-টু-এন্ড প্রজেক্ট: মডিউলের সমন্বয়

এখন পুরো মডিউলটিকে একটি একক প্রকল্প প্রবাহে একত্রিত করা যাক। একটি বাস্তব এমএল সিস্টেম এই স্টপের মধ্য দিয়ে যায় এবং প্রতিটি স্টপ আগেরটির উপর তৈরি হয়:

  1. সমস্যার সংজ্ঞা: আমরা কী সমাধান করছি, সাফল্য কীভাবে পরিমাপ করব (ইউনিট 3: সঠিক মেট্রিক, ব্যবসার প্রসঙ্গ)। মেট্রিক এবং থ্রেশহোল্ড শুরু থেকেই পরিষ্কার।
  2. ডেটা পাইপলাইন: সংগ্রহ, বৈধতা, পরিষ্কার, লিক-মুক্ত বিভাজন, সংস্করণ (ইউনিট 2)।
  3. মডেল উন্নয়ন: প্রশিক্ষণ, বেসলাইন তুলনা, ক্রস-বৈধতা, কঠিন বীজ (ইউনিট 3 + এই ইউনিট)।
  4. LLM উপাদান (যদি প্রযোজ্য হয়): RAG (ইউনিট 4) এবং/অথবা এজেন্ট (ইউনিট 5); প্রয়োজনে ফাইন-টিউনিং (ইউনিট 6)।
  5. মূল্যায়ন: প্রান্ত এবং নিরাপত্তা কেস সহ ইভাল ক্লাস্টার, এলএলএম সিস্টেমে মাল্টি-লেয়ার ইভাল (ইউনিট 8)।
  6. ন্যায়বিচার এবং নীতিশাস্ত্র নিরীক্ষা: উপগোষ্ঠী বিশ্লেষণ, মডেল কার্ড, ব্যাখ্যাযোগ্যতা (ইউনিট 10)।
  7. নিরাপত্তা নিরীক্ষা: প্রম্পট ইনজেকশন, গোপনীয়তা, সাপ্লাই চেইন (ইউনিট 9)।
  8. বিতরণ: প্যাকেজিং, ধীরে ধীরে বিতরণ, রোলব্যাক, মডেল রেজিস্ট্রি (ইউনিট 7)।
  9. মনিটরিং: থ্রি-লেয়ার মনিটরিং, ড্রিফ্ট অ্যালার্ম (ইউনিট 8)।
  10. প্রজননযোগ্যতা: বীজ, ডেটা সংস্করণ, মিডিয়া এবং পুরো চেইন জুড়ে পরীক্ষা ট্র্যাকিং (এই ইউনিট)।

এই প্রবাহে, AI হল একটি অ্যাক্সিলারেটর এবং প্রতিটি স্টপে ব্লুপ্রিন্ট জেনারেটর; কিন্তু মেট্রিক নির্বাচন, ডেটা সিদ্ধান্ত, ন্যায্যতা অগ্রাধিকার, স্থাপনার থ্রেশহোল্ড এবং প্রকাশের অনুমোদন — গুরুত্বপূর্ণ সিদ্ধান্তগুলি মানুষের সাথে থাকে। এটি মডিউলের সারমর্ম।

ডকুমেন্টেশন: ভবিষ্যতে আপনাকে ধন্যবাদ হবে

একটি ভাল এমএল প্রকল্প নিজেই নথি। সর্বনিম্নভাবে, নিম্নলিখিতগুলি লিখতে হবে: সমস্যা এবং সাফল্যের মানদণ্ড, ডেটা উত্স এবং সংস্করণ, মডেল নির্বাচন এবং ন্যায্যতা, মূল্যায়ন ফলাফল (সাবগ্রুপ সহ), পরিচিত সীমা এবং ঝুঁকি, স্থাপনা এবং পুনরুদ্ধার পদ্ধতি, পর্যবেক্ষণ পরিকল্পনা। এই নথিটি সেই ব্যক্তির সেরা বন্ধু (হয়তো আপনিই) যিনি ছয় মাস পরে প্রকল্পে ফিরে আসেন।

তিনটি মিনি কেস

কেস 1 - হারানো ফলাফল। একজন প্রকৌশলী একটি দুর্দান্ত মডেলকে প্রশিক্ষণ দিয়েছেন, কিন্তু তিনি বীজটি ঠিক করেননি এবং ডেটা সংস্করণটি সংরক্ষণ করেননি। তিনি যখন চাকরি ছেড়েছিলেন, তখন কেউ সেই ফলাফল পুনরুত্পাদন করতে পারেনি; মডেলটি একটি "ব্ল্যাক বক্স কিংবদন্তি" হয়ে ওঠে এবং শেষ পর্যন্ত স্ক্র্যাচ থেকে নির্মিত হয়েছিল। সপ্তাহ নষ্ট হয়েছে। পাঠ: একটি অ-পুনরুত্পাদনযোগ্য ফলাফল একটি অস্তিত্বহীন ফলাফল।

কেস 2 - পরিবেশের পতন। একটি দল নির্ভরতা ঠিক করেনি। যখন একটি লাইব্রেরি স্বয়ংক্রিয়ভাবে আপডেট করা হয়, মডেল আউটপুট নীরবে পরিবর্তিত হয় এবং উত্পাদন ব্যাহত হয়। সমস্যা খুঁজে পেতে দিন লেগেছে। যখন নির্ভরতাগুলি হিমায়িত করা হয়েছিল এবং নির্দিষ্ট সংস্করণগুলির সাথে ধারক করা হয়েছিল, তখন সমস্যাটি আর ঘটেনি। পাঠ: পরিবেশ হিমায়িত করুন।

কেস 3 - পর্যবেক্ষণ ক্ষমতা. একটি দল স্বয়ংক্রিয়ভাবে প্রতিটি পরীক্ষা নিরীক্ষণ. তিন মাস পরে, একটি নিয়ন্ত্রক নিরীক্ষা চলাকালীন, তারা "কোন ডেটা সহ, কোন সেটিংস সহ, কোন গ্রুপে এটি কী পারফরম্যান্স পেয়েছে?" প্রশ্নের উত্তর দিয়েছিল। মিনিটের মধ্যে একটি সম্পূর্ণ রেকর্ডিং সহ। পরিদর্শন মসৃণ হয়েছে. পাঠ: মনিটরিং একটি কমপ্লায়েন্স টুল, শুধুমাত্র একটি ইঞ্জিনিয়ারিং নয়।

অনুলিপিযোগ্য টেমপ্লেট

এই ML প্রকল্পের জন্য একটি পুনরুত্পাদনযোগ্যতা পরীক্ষা করুন।- সমস্ত এলোমেলোতার বীজ কি স্থির (বিভক্ত, শুরু করা, এলোমেলো)?- ডেটা সংস্করণ করা হয়েছে?- নির্ভরতাগুলি কি সঠিক সংস্করণে হিমায়িত করা হয়েছে?- প্রতিটি পরীক্ষা (কোড কমিট, ডেটা, হাইপারপ্যারামিটার, মেট্রিক) ট্র্যাক করা হয়? প্রতিটি অনুপস্থিত কলামের জন্য কীভাবে এটি ঠিক করা যায় সে সম্পর্কে সুনির্দিষ্ট পদক্ষেপগুলি লিখুন৷ প্রকল্পের কাঠামো: [বর্ণনা]

এই এন্ড-টু-এন্ড এমএল প্রকল্পের জন্য একটি পরিকল্পনা কঙ্কাল তৈরি করুন। সমস্যা: [বর্ণনা] নিম্নলিখিত স্টপগুলি কভার করুন এবং প্রতিটি স্টপে মানবিক সিদ্ধান্ত কোথায় রয়েছে তা চিহ্নিত করুন: সমস্যা/মেট্রিক, পাইপলাইন, মডেল, (RAG/এজেন্ট/ফাইন-টিউন?), ইভাল, ন্যায্যতা, নিরাপত্তা, বিতরণ, পর্যবেক্ষণ, প্রজননযোগ্যতা। প্রতিটি স্টপের জন্য প্রধান ঝুঁকি এবং যাচাইকরণ ধাপ লিখুন।

এই প্রকল্পের জন্য একটি প্রযুক্তিগত ডকুমেন্টেশন টেমপ্লেট তৈরি করুন। বিভাগ: সমস্যা+সফলতার মাপকাঠি, ডেটা (উৎস+সংস্করণ), মডেল নির্বাচন+ন্যায্যতা, মূল্যায়ন (সাবগ্রুপ সহ), পরিচিত সীমা+ঝুঁকি, স্থাপনা+রোলব্যাক, পর্যবেক্ষণ পরিকল্পনা। প্রশ্ন হিসাবে প্রতিটি বিভাগের জন্য ক্ষেত্রগুলি পূরণ করতে দিন।

আমার পরীক্ষা নিরীক্ষণ সেটআপ পরীক্ষা করুন: এটি কি প্রতিটি রানে স্বয়ংক্রিয়ভাবে সংরক্ষিত হয়: গিট কমিট, ডেটা সংস্করণ/হ্যাশ, সমস্ত হাইপারপ্যারামিটার, সমস্ত মেট্রিক্স, পরিবেশ (লাইব্রেরি সংস্করণ)? আমি আবার একই রান চালানোর সময় একই ফলাফল পেতে পারি? সেটআপ: [বর্ণনা]। ত্রুটিগুলি তালিকাভুক্ত করুন এবং সংশোধন করুন।

প্রজননযোগ্যতা কলাম টেবিল

কলাম

কি স্থির

গাড়ির উদাহরণ

এলোমেলোতা

সব বীজ

বীজ সেটিং

ডেটা

ডেটা সংস্করণ/হ্যাশ

ডিভিসি

পরিবেশ

লাইব্রেরি সংস্করণ

প্রয়োজনীয়তা পিন, ডকার

মনিটরিং

কোড+ডেটা+সেটিং+মেট্রিক

MLflow, W&B

সাধারণ ভুল

  • বীজ ঠিক করা হচ্ছে না। ফলাফল পুনরাবৃত্তি করা যাবে না.
  • ডেটা সংস্করণ সংরক্ষণ করা হচ্ছে না। "কি ডেটা দিয়ে?" উত্তরহীন থেকে যায়।
  • জমাট নেশা না. একটি আপডেট নিঃশব্দে সবকিছু ভেঙে দেবে।
  • পরীক্ষা-নিরীক্ষাকে স্মৃতিতে ছেড়ে দেওয়া। দুই সপ্তাহ পরে কিছুই মনে নেই।
  • সমালোচনামূলক সিদ্ধান্ত কৃত্রিম বুদ্ধিমত্তার উপর ছেড়ে দেওয়া। মেট্রিক্স, ন্যায়বিচার এবং বণ্টনের সিদ্ধান্ত জনগণের কাছে থাকা উচিত।
  • ডকুমেন্টেশন স্থগিত করা। ভবিষ্যতের দল (এবং আপনি) মূল্য দিতে হবে।

সংক্ষেপে

প্রজননযোগ্যতা হল গুরুতর এমএল ইঞ্জিনিয়ারিং-এর স্বাক্ষর: অ-প্রজননযোগ্য ফলাফল হল অপ্রমাণযোগ্য দাবি। এটি চারটি কলাম সহ আসে — এলোমেলোতা, সংস্করণ ডেটা, ফ্রিজ পরিবেশ, প্রতিটি পরীক্ষা ট্র্যাক করুন। একটি এন্ড-টু-এন্ড প্রজেক্ট এই মডিউলের সমস্ত স্টপকে একত্রিত করে (মেট্রিক, ডেটা, মডেল, এলএলএম উপাদান, ইভাল, ন্যায্যতা, নিরাপত্তা, বিতরণ, পর্যবেক্ষণ) একটি আন্তঃসংযুক্ত চেইনে; কৃত্রিম বুদ্ধিমত্তা প্রতিটি স্টপে একটি ত্বরক, কিন্তু সমালোচনামূলক সিদ্ধান্ত মানুষের সাথে থাকে। সবকিছু নথিভুক্ত করুন — ভবিষ্যতের দল এবং অডিটের জন্য। এই ডিসিপ্লিন হল ফ্রেমওয়ার্ক যা মডিউল জুড়ে আপনি যা শিখেন তা বজায় রাখে।

আবেদন টাস্ক

চারটি প্রজননযোগ্যতা স্তম্ভের বিপরীতে একটি এমএল প্রকল্প পরীক্ষা করুন: বীজ কি অপরিবর্তনীয়, ডেটা সংস্করণ করা হয়, পরিবেশ কি হিমায়িত হয়, পরীক্ষাগুলি কি ট্র্যাক করা হয়? কোনো অনুপস্থিত কলাম ঠিক করুন এবং প্রমাণ করুন যে আপনি একই রান দুইবার চালাতে পারেন এবং একই ফলাফল পেতে পারেন। তারপর এক পৃষ্ঠায় প্রকল্পের এন্ড-টু-এন্ড ফ্লো (10 স্টপ) আউটপুট করুন এবং প্রতিটি স্টপে "মানুষের সিদ্ধান্ত কোথায়" চিহ্নিত করুন। অবশেষে, একটি ছোট প্রযুক্তিগত ডকুমেন্টেশন খসড়া লিখুন।

চেকলিস্ট

  • [ ] সমস্ত এলোমেলোতা বীজ স্থির.
  • [] প্রতিটি পরীক্ষার সাথে ডেটা সংস্করণ/হ্যাশ রেকর্ড করা হয়।
  • [ ] নির্ভরতাগুলি দৃঢ় সংস্করণে (পিন/কন্টেইনার) হিমায়িত করা হয়।
  • [ ] প্রতিটি পরীক্ষা স্বয়ংক্রিয়ভাবে পর্যবেক্ষণ করা হয় (কোড+ডেটা+সেটিং+মেট্রিক)।
  • [ ] যখন আমি একই রানের পুনরাবৃত্তি করি, আমি একই ফলাফল পাই।
  • [ ] আমি যাচাই করেছি এবং নথিভুক্ত করেছি যে শেষ থেকে শেষ প্রবাহের সমালোচনামূলক সিদ্ধান্তগুলি মানুষের দ্বারা নেওয়া হয়৷

মডিউল পরীক্ষা

1. একজন এমএল প্রকৌশলী হিসাবে, কর্মপ্রবাহে কৃত্রিম বুদ্ধিমত্তার অবস্থান করার সময় সর্বোত্তম পন্থা কী?

  • ক) AI হল কম ঝুঁকিপূর্ণ ব্যবসায় একটি ত্বরণকারী; মেট্রিক্স, ডেটা এবং উত্পাদনের মতো গুরুত্বপূর্ণ সিদ্ধান্তগুলি বৈধ থাকে এবং মানুষের উপর ছেড়ে দেওয়া হয় ✔
  • খ) যতক্ষণ AI আউটপুটগুলি ভাল দেখায়, ততক্ষণ যাচাইয়ের প্রয়োজন নেই
  • গ) মডেলটিকে কৃত্রিম বুদ্ধিমত্তায় উৎপাদনে রাখার সিদ্ধান্ত ছেড়ে দিলে সময় বাঁচে।
  • ঘ) কৃত্রিম বুদ্ধিমত্তা শুধুমাত্র টেক্সট লেখার জন্য উপযোগী, ডেটা এবং মডেল কাজের সাথে এর কোন সম্পর্ক নেই

বর্ণনা: AI হল কম-ঝুঁকির, সহজে যাচাইকৃত কাজ যেমন কোড, ডেটা ডাইজেস্ট এবং নথিগুলির জন্য একটি শক্তিশালী অ্যাক্সিলারেটর; যাইহোক, অর্থ, গোপনীয়তা, এবং আইনি দায়, যেমন মেট্রিক নির্বাচন, কোন ডেটা প্রশিক্ষণে যায় এবং মডেলটিকে উৎপাদনের জন্য প্রভাবিত করে এমন সিদ্ধান্তের দায়িত্ব যোগ্য প্রকৌশলী এবং দলের উপর বর্তায়। যাচাই ছাড়া প্রতিটি আউটপুট ব্যবহার করা উচিত নয়।

2. কেন স্কিমা বৈধতা একটি ডেটা পাইপলাইনের শুরুতে স্থাপন করা হয়?

  • ক) কারণ এটি সরাসরি মডেলের নির্ভুলতা বাড়ায়
  • খ) কারণ এটি ডেটা সংস্করণকে অপ্রয়োজনীয় করে তোলে
  • গ) কারণ এটি দূষিত ডেটাকে দ্রুততম এবং সস্তায় ধরা দেয় এবং পরবর্তী ধাপে ফাঁস হতে বাধা দেয় ✔
  • ঘ) কারণ এটি লেবেলিংয়ের প্রয়োজনীয়তা দূর করে

ব্যাখ্যা: আগের দুর্নীতিগ্রস্ত ডেটা ধরা হয়, এটি ঠিক করা সস্তা। স্কিমা বৈধতা লাইনের শুরুতে প্রত্যাশিত প্রকার এবং পরিসরের বাইরের ডেটা প্রত্যাখ্যান করে প্রশিক্ষণ বা উৎপাদনে চুপচাপ ফাঁস হওয়া থেকে দুর্নীতিগ্রস্ত ডেটা প্রতিরোধ করে (যেমন, ইউনিট পরিবর্তনের সাথে মূল্য 100x পরিবর্তন); উৎপাদনে ধরা একই ত্রুটি অনেক গুণ বেশি ব্যয়বহুল।

3. সময় (টাইম সিরিজ) জড়িত সমস্যায় প্রশিক্ষণ এবং পরীক্ষায় ডেটা ভাগ করার সময় সঠিক পদ্ধতি কী?

  • ক) এলোমেলো বিভাজন ব্যবহার করা কারণ এটি সর্বদা ন্যায্য পদ্ধতি
  • খ) টেম্পোরাল স্প্লিটিং ব্যবহার করে: অতীতের সাথে প্রশিক্ষণ এবং ভবিষ্যতে পরীক্ষা করে ফুটো প্রতিরোধ করুন ✔
  • গ) প্রশিক্ষণ এবং পরীক্ষা উভয় হিসাবে সমস্ত ডেটা ব্যবহার করা
  • ঘ) প্রশিক্ষণের আগে স্কেলিং প্যারামিটারে পরীক্ষার ডেটা অন্তর্ভুক্ত করা

ব্যাখ্যা: টাইম সিরিজে এলোমেলোভাবে বিভক্ত করা মডেলটিকে একটি 'ভবিষ্যত-দর্শন' সুবিধা দেয় যা উত্পাদনে কখনই ঘটবে না এবং কৃত্রিমভাবে মেট্রিক্সকে (টেম্পোরাল লিকেজ) স্ফীত করে। সঠিকটি হল সাময়িক বিভাগ: অতীতের সাথে ট্রেন, ভবিষ্যতে পরীক্ষা। এটি প্রকৃত কর্মক্ষমতা পরিমাপ করে যা এটি উত্পাদনে রাখে।

4. কেন 1.5% ইতিবাচক শ্রেণীর হার সহ একটি জালিয়াতি সনাক্তকরণ মডেলে নির্ভুলতা বিভ্রান্তিকর?

  • ক) কারণ ভারসাম্যহীন ডেটাতে যথার্থতা সবসময় কম থাকে
  • খ) কারণ Accuracy শুধুমাত্র রিগ্রেশন সমস্যায় ব্যবহার করা যেতে পারে
  • গ) কারণ নির্ভুলতা গণনার জন্য প্রচুর প্রক্রিয়াকরণ শক্তির প্রয়োজন হয়
  • D) এমনকি সংখ্যাগরিষ্ঠ শ্রেণীর ভবিষ্যদ্বাণী করে এমন একটি তুচ্ছ মডেলও খুব সঠিক হতে পারে, এইভাবে প্রকৃত সাফল্য লুকিয়ে রাখে ✔

ব্যাখ্যা: ভারসাম্যহীন ডেটাতে, এমনকি একটি মৌলিক মডেল যা বলে যে 'কল সবকিছু নেতিবাচক' প্রায় 98.5% নির্ভুলতা পায় তবে একটিও জালিয়াতি ধরা পড়বে না। অতএব, ভারসাম্যহীন শ্রেণীবিভাগে, নির্ভুলতার পরিবর্তে নির্ভুলতা, প্রত্যাহার, F1 বা PR-AUC ব্যবহার করা হয় এবং প্রতিটি মেট্রিক একটি বেস মডেল অনুযায়ী ব্যাখ্যা করা হয়।

5. একটি মডেলের মেট্রিক সম্পর্কে কথা বলার সময় কেন বেসলাইন তুলনা অপরিহার্য?

  • ক) কারণ বেস মডেল সবসময়ই আসল মডেলের চেয়ে ভালো
  • খ) কারণ এটি পরিষ্কার যে একটি মেট্রিক অর্থপূর্ণ কিনা শুধুমাত্র একটি সাধারণ বেসলাইন মডেলের সাথে তুলনা করলে ✔
  • গ) কারণ বেস মডেল ক্রস-ভ্যালিডেশনকে অপ্রয়োজনীয় করে তোলে
  • ঘ) কারণ মৌলিক মডেল আইনগতভাবে প্রতিটি প্রতিবেদনে প্রয়োজন

ব্যাখ্যা: একটি মেট্রিক নিজেই ভাল বা খারাপ নয়; এটি একটি মৌলিক মডেল অনুযায়ী ভাল বা খারাপ। '85% সঠিক' বাক্যটির অর্থ প্রায় মূল্যহীন যদি বেস মডেলটি ইতিমধ্যে 84% পায়, এবং যদি এটি 50% পায় তাহলে নিখুঁত। তুলনামূলক অ্যাঙ্কর ছাড়া মেট্রিক অর্থহীন।

6. কোনটি সবচেয়ে গুরুত্বপূর্ণ নিরাপত্তা উপাদান যা RAG (পুনরুদ্ধার-অগমেন্টেড জেনারেশন) সিস্টেমের উৎপাদন প্রম্পটে অন্তর্ভুক্ত করা উচিত?

  • ক) শুধুমাত্র প্রদত্ত উৎসের উপর নির্ভর করার নির্দেশনা, উৎসের অস্তিত্ব না থাকলে 'আমি জানি না' বলা এবং উৎসটি উদ্ধৃত করা ✔
  • খ) মডেলকে যতটা সম্ভব দীর্ঘ এবং সৃজনশীল উত্তর তৈরি করতে বলা
  • গ) মডেলটি সম্পদের চেয়ে নিজস্ব শিক্ষাগত জ্ঞানকে অগ্রাধিকার দেয়
  • ঘ) কমান্ড হিসাবে আনা নথিতে সমস্ত নির্দেশাবলী প্রয়োগ করুন

ব্যাখ্যা: RAG-এর একক সবচেয়ে গুরুত্বপূর্ণ নির্দেশ হল মডেলকে শুধুমাত্র প্রদত্ত উৎসের উপর নির্ভর করতে বলা, এবং যদি তথ্যটি উৎসে না থাকে, তাহলে 'আমি জানি না' বলুন এবং এটি তৈরি না করে উৎসটি উল্লেখ করুন। এই ট্রায়াড ব্যতীত, মডেলটি প্রসঙ্গ উপেক্ষা করতে পারে এবং হ্যালুসিনেশন তৈরি করতে পারে এবং উত্তরটি যাচাই করা যায় না।

7. একটি RAG সিস্টেম ভুল উত্তর দেয়। রোগ নির্ণয় শুরু করার সেরা জায়গা কোথায়?

  • ক) প্রথমে আনার পরিমাপ করা হচ্ছে (Recall@K): সঠিক অংশটি কি কখনও আসে? ✔
  • খ) অবিলম্বে একটি বড় এক সঙ্গে মডেল প্রতিস্থাপন
  • গ) এলোমেলোভাবে প্রম্পট পরিবর্তন করুন এবং চেষ্টা চালিয়ে যান
  • ঘ) সূক্ষ্ম-টিউনিং সহ মডেলের মধ্যে সমস্ত নথি এমবেড করা

ব্যাখ্যা: RAG এর দুর্বলতম লিঙ্কটি সাধারণত আনা হয়, উৎপাদন নয়। যদি সঠিক অংশটি কখনই আনা না হয়, মডেলটি সেই তথ্য তৈরি করতে পারে না, প্রম্পট যতই উন্নত করা হোক না কেন। অতএব, সঠিক অংশটি এসেছে কিনা তা দেখার জন্য প্রথমে Recall@K পরিমাপ করা হয়; যদি আনয়ন ভাল হয়, তাহলে উত্পাদন এবং প্রম্পট পরীক্ষা করা হয়।

8. কোন এজেন্টকে একটি টুল দেওয়ার সময় মানুষের অনুমোদনের পিছনে কোন কাজগুলি রাখা উচিত?

  • ক) কোনটিই নয়; এজেন্টকে স্বায়ত্তশাসিতভাবে প্রতিটি ক্রিয়া সম্পাদন করতে সক্ষম হতে হবে
  • খ) শুধুমাত্র বিপরীত ক্রিয়া যেমন ডেটা পড়া এবং অনুসন্ধান করা
  • গ) অপরিবর্তনীয় বা উচ্চ প্রভাব ক্রিয়া যেমন অর্থ স্থানান্তর, মুছে ফেলা, পাঠানো ✔
  • ঘ) শুধুমাত্র গণনা জড়িত কর্ম

বর্ণনা: অ্যাকশন ঝুঁকি স্তর দ্বারা পৃথক করা হয়. পুনরুদ্ধারযোগ্য কাজ যেমন পড়া, অনুসন্ধান করা, গণনা করা এবং খসড়া তৈরি করা স্বায়ত্তশাসিতভাবে করা যেতে পারে; যাইহোক, অপরিবর্তনীয় বা উচ্চ-প্রভাবমূলক ক্রিয়াকলাপ যেমন অর্থ স্থানান্তর, ইমেল পাঠানো, ডেটা মুছে ফেলা, অর্ডার দেওয়া ইত্যাদির জন্য মানুষের অনুমোদন প্রয়োজন। প্রতিটি অপরিবর্তনীয় কর্ম সম্মতি সাপেক্ষে হতে হবে.

9. পরোক্ষ প্রম্পট ইনজেকশনের ঝুঁকির বিরুদ্ধে সর্বোত্তম নকশা পদ্ধতি কী?

  • ক) সিস্টেম প্রম্পটে 'খারাপ নির্দেশ উপেক্ষা করুন' একটি একক বাক্য যোগ করাই যথেষ্ট
  • খ) বাহ্যিক বিষয়বস্তুর নির্দেশাবলীর উপর নির্ভর করে মডেলটিকে আরও কর্তৃত্ব দিন
  • গ) কোনো সতর্কতা অবলম্বন না করা কারণ ইনজেকশন প্রতিরোধযোগ্য নয়
  • ঘ) বাহ্যিক বিষয়বস্তুকে অবিশ্বস্ত ডেটা হিসাবে বিচ্ছিন্ন করা এবং ন্যূনতম অনুমোদন, অনুমোদন এবং আউটপুট নিয়ন্ত্রণ সহ স্তরযুক্ত প্রতিরক্ষা স্থাপন করা ✔

বর্ণনা: এজেন্ট বা RAG দ্বারা প্রক্রিয়া করা বাহ্যিক বিষয়বস্তু, যেমন একটি ওয়েব পৃষ্ঠা, নথি, ইমেল, ইত্যাদি, অবিশ্বস্ত ডেটা এবং এতে গোপন নির্দেশ থাকতে পারে। সঠিক পন্থা হল স্তরযুক্ত প্রতিরক্ষা: বাহ্যিক বিষয়বস্তুকে 'ডেটা, কমান্ড নয়' হিসাবে স্পষ্ট সীমাবদ্ধতার সাথে বিচ্ছিন্ন করা, ন্যূনতম অনুমোদন প্রয়োগ করা, মানুষের অনুমোদনের সাথে অপরিবর্তনীয় ক্রিয়াগুলিকে আবদ্ধ করা এবং আউটপুট নিরীক্ষণ করা। নির্দেশের একক লাইন যথেষ্ট নয়।

10. ফাইন-টিউনিং বা RAG দিয়ে সমস্যা সমাধান করা উচিত কিনা তা সিদ্ধান্ত নেওয়ার সময় প্রধান পার্থক্য কী?

  • ক) তথ্য সমস্যাগুলি RAG দিয়ে আরও ভালভাবে সমাধান করা হয়, আচরণ/ফরম্যাট সমস্যাগুলি সূক্ষ্ম-টিউনিংয়ের মাধ্যমে আরও ভালভাবে সমাধান করা হয় ✔
  • খ) প্রতিটি সমস্যা সবসময় ফাইন-টিউনিংয়ের মাধ্যমে সমাধান করা উচিত
  • C) RAG শুধুমাত্র কোড জেনারেশনের জন্য ব্যবহার করা হয়, ফাইন-টিউনিং শুধুমাত্র অনুবাদের জন্য ব্যবহার করা হয়
  • D) ফাইন-টিউনিং সবসময় RAG-এর চেয়ে সস্তা এবং দ্রুত আপডেট করা যায়

ব্যাখ্যা: মডেল নতুন তথ্য শেখানোর ক্ষেত্রে ফাইন-টিউনিং দুর্বল এবং ঝুঁকিপূর্ণ; কিন্তু শিক্ষণ আচরণ, বিন্যাস, স্বন এবং শৈলীতে শক্তিশালী। 'মডেল কোম্পানি আমাদের ডেটা জানে না' একটি তথ্য সমস্যা এবং এটি RAG-এর অন্তর্গত। 'আমাদের কঠোর বিন্যাসে মডেলটি সর্বদা আউটপুট হতে দিন' একটি আচরণগত সমস্যা এবং সূক্ষ্ম-টিউনিংয়ের প্রার্থী৷ উপরন্তু, সূক্ষ্ম-টিউনিংয়ের আগে প্রম্পট এবং কয়েকটি-শট গ্রহণ করা উচিত।

11. একটি নতুন মডেল উত্পাদন করার সময় নিরাপদ স্থাপনার জন্য কোনটি বাধ্যতামূলক?

  • ক) মডেলটি পরীক্ষায় ভাল হলে, এটি সরাসরি 100% ট্রাফিকের জন্য খুলুন
  • খ) স্থাপনের পরে মোটেও মনিটরিং স্থাপন না করা
  • গ) পর্যায়ক্রমে স্থাপনা (ছায়া/ক্যানারি) এবং একটি প্রাক-পরীক্ষিত রোলব্যাক পরিকল্পনা ✔
  • ঘ) মূল্যায়ন থ্রেশহোল্ড পূরণ না হলেও মডেল প্রকাশ করা

ব্যাখ্যা: নতুন মডেলটি সরাসরি সমস্ত ট্রাফিকের জন্য খোলা ঝুঁকিপূর্ণ; ভুল হলে সবাই ক্ষতিগ্রস্ত হয়। সঠিক জিনিসটি হল এটি একটি ধীরে ধীরে বিতরণ (ছায়া, ক্যানারি) এবং প্রতিটি বিতরণের একটি পরীক্ষিত রোলব্যাক পরিকল্পনা রয়েছে। একটি বন্টন একটি clawback পরিকল্পনা ছাড়া সম্পূর্ণ হয় না; কয়েক মিনিটের মধ্যে পূর্ববর্তী সংস্করণে প্রত্যাবর্তন করতে সক্ষম হওয়া ব্যবহারকারীকে রক্ষা করে যখন মডেলটি উত্পাদনে অপ্রত্যাশিতভাবে আচরণ করে।

12. কিভাবে একটি ML মডেল উত্পাদনে 'নিঃশব্দে' ব্যর্থ হতে পারে এবং এটি ধরার উপায় কী?

  • ক) মডেলটি ভেঙে পড়ে; সার্ভার লগ এটি দেখায়
  • খ) ভুল না করে ভুল ভবিষ্যদ্বাণী তৈরি করে; ✔ এটি অপারেশনাল, ইনপুট এবং আউটপুট স্তরযুক্ত পর্যবেক্ষণ ক্যাপচার করে
  • গ) মডেল কখনই নীরবে ব্যর্থ হতে পারে না, সর্বদা শঙ্কা
  • ঘ) কোনো অবক্ষয় ধরার জন্য শুধু লেটেন্সি পর্যবেক্ষণ করাই যথেষ্ট

ব্যাখ্যা: মডেলটি ক্র্যাশ বা ত্রুটি ছাড়াই ভুল ভবিষ্যদ্বাণী তৈরি করে ব্যর্থ হতে পারে; এর প্রধান কারণ ডাটা ড্রিফট এবং কনসেপ্ট ড্রিফ্ট। শুধুমাত্র অপারেশনাল মেট্রিক্স (লেটেন্সি, ত্রুটির হার) পর্যবেক্ষণ করা যথেষ্ট নয়; ইনপুট বিতরণ এবং আউটপুট/ভবিষ্যদ্বাণী বিতরণও পর্যবেক্ষণ করা উচিত। প্রকৃত ফলাফল বিলম্বিত হলে ইনপুট ড্রিফ্ট প্রাথমিক সতর্কতা দেয়।

13. একটি LLM সিস্টেম মূল্যায়ন করার জন্য LLM-এ-জজ ব্যবহার করার সময় কোন নীতি অপরিহার্য?

  • ক) এলএলএম-রেফারি সর্বদা সঠিক, মানুষের যাচাইকরণ অপ্রয়োজনীয়
  • খ) রেফারিকে শুধুমাত্র উত্তরের দৈর্ঘ্যের উপর ভিত্তি করে সিদ্ধান্ত নিতে হবে।
  • গ) রেফারি ব্যবহার করার সময় নিয়ম-ভিত্তিক নিয়ন্ত্রণ এবং মানব মূল্যায়ন সম্পূর্ণভাবে বাতিল করা উচিত
  • ঘ) বিচারকের স্কোর একটি মানব-লেবেলযুক্ত নমুনা দিয়ে ক্রমাঙ্কিত করা উচিত এবং তাদের বিশ্বাসযোগ্য হওয়ার আগে তাদের পক্ষপাত পরিমাপ করা উচিত ✔

বর্ণনা: এলএলএম-রেফারিও একটি মডেল; এটি হ্যালুসিনেটরি, পক্ষপাতদুষ্ট (দীর্ঘ, আত্মবিশ্বাসী উত্তরের পক্ষে) এবং অসঙ্গতিপূর্ণ হতে পারে। অতএব, রেফারির স্কোরগুলি অবশ্যই একটি মানব লেবেলযুক্ত নমুনা দিয়ে ক্যালিব্রেট করা উচিত এবং উত্পাদন সিদ্ধান্ত নেওয়ার আগে তাদের পদ্ধতিগত পক্ষপাত অবশ্যই পরিমাপ করা উচিত। একজন অযাচাইকৃত রেফারি মিথ্যা আস্থা দেয়।

14. মডেল পক্ষপাতের মূল্যায়ন করার সময় কেন সামগ্রিক নির্ভুলতার দিকে তাকানো অপর্যাপ্ত?

  • ক) সামগ্রিক নির্ভুলতা যথেষ্ট কারণ এটি সর্বদা সবচেয়ে খারাপ দলের কর্মক্ষমতা প্রতিফলিত করে
  • খ) সামগ্রিক নির্ভুলতা একাই অপর্যাপ্ত কারণ এটি উপগোষ্ঠীর মধ্যে পদ্ধতিগত পার্থক্য (লুকানো বৈষম্য) অস্পষ্ট করতে পারে ✔
  • গ) কারণ নির্ভুলতা একটি মেট্রিক যার সাথে পক্ষপাতের কোনো সম্পর্ক নেই
  • D) পক্ষপাত শুধুমাত্র মডেল থেকে আসে এবং ডেটার সাথে কোন সম্পর্ক নেই।

ব্যাখ্যা: সামগ্রিক নির্ভুলতা উপগোষ্ঠীর মধ্যে পদ্ধতিগত পার্থক্যকে অস্পষ্ট করতে পারে। উদাহরণস্বরূপ, যখন সামগ্রিক নির্ভুলতা 88%, রিকল এক গ্রুপে 91% এবং অন্য গ্রুপে 67% হতে পারে; মডেল পদ্ধতিগতভাবে যে গ্রুপ মিস. অতএব, মডেলটিকে উপগোষ্ঠীর (জনসংখ্যা/সেগমেন্ট) ভিত্তিতে মূল্যায়ন করা উচিত এবং ন্যায়বিচারের কোন সংজ্ঞাকে অগ্রাধিকার দেওয়া উচিত তা স্টেকহোল্ডারদের সাথে সিদ্ধান্ত নেওয়া উচিত।

15. একটি ML ফলাফল পুনরুত্পাদনযোগ্য হওয়ার জন্য কোন চারটি জিনিস একসাথে ঠিক করতে হবে?

  • ক) শুধুমাত্র মডেলের নাম, আকার, মূল্য এবং প্রকাশের তারিখ
  • খ) শুধুমাত্র GPU ব্র্যান্ড এবং ইন্টারনেট গতি
  • গ) শুধুমাত্র মডেলের চূড়ান্ত নির্ভুলতা স্কোর; বাকিটা স্মৃতিতে রাখা যায়
  • ঘ) এলোমেলোতা বীজ, ডেটা সংস্করণ, পরিবেশ (নির্ভরতা সংস্করণ) এবং পরীক্ষা ট্র্যাকিং ✔

বর্ণনা: চারটি স্তম্ভের মাধ্যমে প্রজননযোগ্যতা অর্জন করা হয়: এলোমেলোতা বীজ ঠিক করা, ডেটা সংস্করণ (সংস্করণ/হ্যাশ), পরিবেশকে হিমায়িত করা (সঠিক লাইব্রেরি সংস্করণ/ধারক), এবং প্রতিটি পরীক্ষা ট্র্যাক করা (কোড কমিট, ডেটা, হাইপারপ্যারামিটার, মেট্রিক)। এই চেইন ছাড়া একই ফলাফল পুনরুত্পাদন করা সম্ভব নয়; একটি অ-পুনরুত্পাদনযোগ্য ফলাফল এমন একটি দাবি যা প্রমাণ করা যায় না।