লাভ:
- সমস্যার ধরন এবং ব্যবসায়িক প্রসঙ্গের জন্য উপযুক্ত মেট্রিক বেছে নেওয়ার ক্ষমতা (ভারসাম্যহীন ডেটাতে PR-AUC/রিকল, রিগ্রেশনে MAE/RMSE) এবং ওভার/আন্ডার লার্নিং চিনতে পারে
- প্রতিটি মেট্রিককে একটি বেসলাইনের বিপরীতে ব্যাখ্যা করার ক্ষমতা এবং বিচ্যুতি পরিমাপ করার ক্ষমতা এবং ক্রস-ভ্যালিডেশনের সাথে অগ্রগতি থেকে আলাদা শব্দ
- যাচাইকরণ সেটের সাথে হাইপারপ্যারামিটার টিউন করে এবং শুধুমাত্র শেষে পরীক্ষা সেট ব্যবহার করে অ-আশাবাদী ফলাফলের রিপোর্ট করার ক্ষমতা
মডেল প্রশিক্ষণ (প্রশিক্ষণ: ডেটা থেকে প্যাটার্ন শেখার প্রক্রিয়া) এমএল ইঞ্জিনিয়ারিংয়ের সবচেয়ে দৃশ্যমান কিন্তু সবচেয়ে বিভ্রান্তিকর পদক্ষেপ। এটি প্রদর্শিত হয় কারণ এটি "নির্ভুলতা 95%" এর মতো একটি সন্তোষজনক সংখ্যা তৈরি করে। বিভ্রান্তিকর কারণ সেই সংখ্যাটি প্রায়ই ভুল প্রশ্নের সঠিক উত্তর। এই ইউনিটে ইঞ্জিনিয়ারিং ডিসিপ্লিনের সাথে শিক্ষা ও মূল্যায়ন নিয়ে আলোচনা করা হয়; আমরা পরীক্ষামূলক ডিজাইনে অংশীদার হিসাবে কৃত্রিম বুদ্ধিমত্তা ব্যবহার করি এবং পরিমাপের উপর ভিত্তি করে সিদ্ধান্ত নিই।
প্রশিক্ষণ চক্রের যুক্তি
একটি মডেল একটি ক্ষতি ফাংশন কমিয়ে ডেটাতে প্যাটার্ন শিখে: একটি ফাংশন যা সংখ্যাগতভাবে মডেলের ত্রুটি পরিমাপ করে। অপ্টিমাইজেশান অ্যালগরিদম (যেমন গ্রেডিয়েন্ট ডিসেন্ট) ধাপে ধাপে পরামিতিগুলি সামঞ্জস্য করে ক্ষতি হ্রাস করে। উদ্দেশ্য প্রশিক্ষণের ডেটা মুখস্থ করা নয়, বরং এটিকে অভূতপূর্ব ডেটাতে সাধারণীকরণ করা।
দুটি প্রধান বিপদ:
- ওভারফিটিং: মডেলটি প্রশিক্ষণের ডেটা মুখস্থ করে এবং নতুন ডেটাতে ব্যর্থ হয়। প্রশিক্ষণের সাফল্য বেশি, যাচাইকরণের সাফল্য কম।
- আন্ডারফিটিং: মডেল প্যাটার্ন ক্যাপচার করতে পারে না; প্রশিক্ষণ এবং যাচাইকরণ সাফল্য উভয়ই কম।
ভারসাম্য খোঁজা শিক্ষার শিল্প। এই ভারসাম্য নিরীক্ষণ করার জন্য বৈধকরণ সেট রয়েছে: প্রশিক্ষণের সাফল্য বৃদ্ধির সাথে সাথে যদি বৈধতা সাফল্য হ্রাস পেতে শুরু করে, ওভারলার্নিং শুরু হয়েছে।
টিপ: প্রতিটি ধাপে একসাথে প্রশিক্ষণ এবং বৈধতা হারানোর পরিকল্পনা করুন। যে বিন্দুতে দুটি বক্ররেখা বিচ্ছিন্ন হতে শুরু করে সেখানে ওভারলার্নিং শুরু হয় এবং এটি "প্রথম দিকে থামার" সঠিক মুহূর্ত।
মেট্রিক নির্বাচন: সবচেয়ে গুরুত্বপূর্ণ সিদ্ধান্ত
ভুল মেট্রিক একটি ভাল মডেল খারাপ দেখায় এবং একটি খারাপ মডেল ভাল দেখায়। সমস্যা মেট্রিক নির্ধারণ করে:
- ভারসাম্যহীন শ্রেণীবিভাগ (একটি শ্রেণী খুবই বিরল, যেমন জালিয়াতি): যথার্থতা বিভ্রান্তিকর। একটি মডেল যা বলে "সবকিছু স্বাভাবিক করুন" 99% নির্ভুলতা পাবে কিন্তু একটিও জালিয়াতি ধরা পড়বে না৷ পরিবর্তে, নির্ভুলতা (আমি যা ধরেছি তার কতটা আসলে ইতিবাচক), রিকল (আমি যা ধরেছি তার কতটা সত্য পজিটিভ) এবং তাদের ব্যালেন্স F1 বা PR-AUC ব্যবহার করা হয়।
- সুষম শ্রেণীবিভাগ: যথার্থতা এবং ROC-AUC উপযুক্ত হতে পারে।
- রিগ্রেশন (সংখ্যা অনুমান): MAE (মানে পরম ত্রুটি), RMSE (বড় ত্রুটিগুলিকে শাস্তি দেয়), MAPE (শতাংশ ত্রুটি)।
- র্যাঙ্কিং/সুপারিশ: NDCG, MRR, Recall@K.
নির্ভুলতা বা প্রত্যাহার গুরুত্বপূর্ণ কিনা তা ব্যবসার প্রসঙ্গে নির্ভর করে। ক্যানসার স্ক্রীনিং-এর ক্ষেত্রে প্রত্যাহার (কোনও রোগীকে অনুপস্থিত নয়) একটি অগ্রাধিকার; স্প্যাম ফিল্টারে নির্ভুলতা (স্প্যামে গুরুত্বপূর্ণ ই-মেইল না পাঠানো) গুরুত্বপূর্ণ। এটি একটি ব্যবসায়িক সিদ্ধান্ত, প্রযুক্তিগত নয় এবং এটি প্রকৌশলী এবং মালিক দ্বারা একসাথে করা হয়৷
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট: "আমার মডেলের কর্মক্ষমতা মূল্যায়ন করুন, নির্ভুলতা 0.97।"
শক্তিশালী প্রম্পট: "আমার কাছে একটি জালিয়াতি সনাক্তকরণ মডেল আছে; ইতিবাচক শ্রেণির হার হল 1.5%। নির্ভুলতা 0.97 হিসাবে রিপোর্ট করা হয়েছে। কেন এই মেট্রিকটি বিভ্রান্তিকর হতে পারে তা ব্যাখ্যা করুন, আমাকে বলুন কোন মেট্রিকগুলি (নির্ভুলতা, রিকল, PR-AUC) আমার পছন্দ করা উচিত এবং কেন। এছাড়াও গণনা করুন কতটা নির্ভুল একটি 'কললাইন মডেল আমি নেতিবাচক তথ্য যোগ করতে পারি, তাই এই মডেলটি নেতিবাচক সবকিছু দেখতে পাবে।"
পার্থক্য: শক্তিশালী প্রম্পট শ্রেণী অনুপাত এবং ব্যবসার প্রসঙ্গ দেয়; এটি একটি বেসলাইন মডেল তুলনার জন্যও জিজ্ঞাসা করে — এটি একটি মেট্রিক অর্থপূর্ণ কিনা তার জন্য এটি সবচেয়ে গুরুত্বপূর্ণ অ্যাঙ্কর।
বেসলাইন: তুলনা ছাড়া মেট্রিক অর্থহীন
একটি মেট্রিক নিজেই ভাল বা খারাপ নয়; এটি একটি মৌলিক মডেল অনুযায়ী ভাল বা খারাপ। মৌলিক মডেল হল সবচেয়ে সহজ সমাধান যা মনে আসে: "সর্বদা সংখ্যাগরিষ্ঠ শ্রেণীকে বলুন", "গত সপ্তাহের মান পুনরাবৃত্তি করুন", "গড় অনুমান করুন"। যদি আপনার মডেলটি এই সহজ সমাধানটি পরিষ্কারভাবে পাস করতে না পারে তবে সমস্ত জটিলতা কিছুই নয়।
সতর্কতা: "আমার মডেল 85% সঠিক" বাক্যটি নিজেই কিছু বলে না। যদি বেস মডেল ইতিমধ্যে 84% পায়, আপনার মডেল প্রায় মূল্যহীন; যদি বেস মডেল 50% পায়, আপনার মডেল নিখুঁত। সর্বদা মৌলিক মডেলের পরিপ্রেক্ষিতে কথা বলুন।
ক্রস বৈধতা এবং বিশ্বাস
একটি একক প্রশিক্ষণ/পরীক্ষা বিভাজন সুযোগের কারণে হতে পারে। ক্রস-ভ্যালিডেশন: ডেটাকে k অংশে ভাগ করা এবং প্রতিটি অংশকে পর্যায়ক্রমে পরীক্ষা করা দেখায় যে কার্যক্ষমতা কতটা স্থিতিশীল। 5-গুণ ক্রস যাচাইকরণে আপনি পাঁচটি ভিন্ন স্কোর পাবেন; তাদের গড় এবং আদর্শ বিচ্যুতি গুরুত্বপূর্ণ। যদি গড় 80% হয় কিন্তু বিচ্যুতি ±12% হয়, আপনার মডেলটি অস্থির - এটি ডেটার পরবর্তী ব্যাচে খুব ভিন্নভাবে আচরণ করতে পারে।
এটি "দুই মডেল তুলনা" এর জন্যও গুরুত্বপূর্ণ। যদি মডেল A 81% এবং মডেল B 82% পায় তবে B কি সত্যিই ভাল? বিচ্যুতি ±3% হলে, এই পার্থক্য গোলমাল হতে পারে। সিদ্ধান্ত নেওয়ার আগে পার্থক্যটি তাৎপর্যপূর্ণ কিনা তা বিবেচনা করুন।
হাইপারপ্যারামিটার টিউনিং: যাচাইকরণ সহ, পরীক্ষা নয়
হাইপারপ্যারামিটার (প্রশিক্ষণের আগে ম্যানুয়ালি নির্ধারিত সেটিংস—শেখার হার, গাছের গভীরতা ইত্যাদি) যাচাইকরণ সেটের সাথে সেট করা হয়। পরীক্ষা সেট শুধুমাত্র শেষে ব্যবহার করা হয়, একবার. আপনি যদি পরীক্ষার সেট দেখে হাইপারপ্যারামিটার নির্বাচন করেন, তাহলে পরীক্ষার সেটটি দূষিত হবে এবং আপনার রিপোর্ট করা কর্মক্ষমতা আশাবাদী হবে যা বাস্তবে তা নয়।
কৃত্রিম বুদ্ধিমত্তা হাইপারপ্যারামিটার সার্চ স্পেস ডিজাইন করতে এবং সার্চ কোড (গ্রিড সার্চ, র্যান্ডম সার্চ, বায়েসিয়ান অপ্টিমাইজেশান) লেখার জন্য একটি ভাল সহায়ক। কিন্তু আপনি এখনও সিদ্ধান্ত নেন "আমরা কোন মেট্রিক অপ্টিমাইজ করব?"
তিনটি মিনি কেস
কেস 1 - সঠিকতা ফাঁদ। একটি মেডিকেল দল এমন একটি মডেলের জন্য গর্বিত ছিল যা একটি বিরল রোগ সনাক্ত করেছে: 98% নির্ভুলতা। যখন মৌলিক মডেল তুলনা করা হয়েছিল, তখন সত্য উত্থাপিত হয়েছিল: যেহেতু রোগের হার ছিল 2%, যে মডেলটি "সবাইকে সুস্থ বল" বলেছিল সেটিও 98% পেয়েছে। মডেলটির প্রত্যাহার ছিল মাত্র 11% - বেশিরভাগ রোগী অনুপস্থিত। একবার মেট্রিককে PR-AUC-তে রূপান্তরিত করা হলে, প্রকৃত কর্মক্ষমতা পরিমাপ করা হয় এবং মডেলটিকে পুনরায় ডিজাইন করা হয়।
কেস 2 - অগ্রগতির জন্য ভুল গোলমাল। একটি দল 86.2% থেকে 86.9% পর্যন্ত মডেলটিকে উন্নত করতে কয়েক মাস ব্যয় করেছে। ক্রস-ভ্যালিডেশন দেখায় যে পক্ষপাত ছিল ±1.4% — তাই 0.7 পয়েন্ট "উন্নতি" ছিল পরিসংখ্যানগত গোলমাল। দলটি অবাস্তব উপার্জনে তিন সপ্তাহ নষ্ট করেছে। পাঠ: উন্নতি যে বিচ্যুতির চেয়ে বড় তা যাচাই না করে বিজয় ঘোষণা করবেন না।
কেস 3 - পরীক্ষার সেটের দূষণ। সেরা হাইপারপ্যারামিটারগুলি বেছে নিতে একজন প্রকৌশলী বারবার পরীক্ষার সেটের দিকে তাকালেন। 91% এটি উৎপাদনে 83% এ নেমে গেছে। কেন: তিনি অজান্তেই পরীক্ষার সেটটি বারবার দেখে (পরীক্ষা সেটে ওভারলার্নিং) দেখে সেই অনুযায়ী মডেলটি নির্বাচন করেছিলেন। একটি পৃথক বৈধতা সেট ব্যবহার করা হলে রিপোর্ট করা এবং প্রকৃত কর্মক্ষমতা ওভারল্যাপ করা হয়।
অনুলিপিযোগ্য টেমপ্লেট
এই শ্রেণিবিন্যাসের সমস্যার জন্য সঠিক মেট্রিক বেছে নিতে আমাকে সাহায্য করুন। সমস্যা: [কি ভবিষ্যদ্বাণী করা হয়েছে] শ্রেণি বিতরণ: [ধনাত্মক হার
নিম্নলিখিত দুটি মডেলের তুলনা মূল্যায়ন করুন। মডেল A ক্রস-ভ্যালিডেশন: [স্কোরের তালিকা] মডেল বি ক্রস-ভ্যালিডেশন: [স্কোরের তালিকা] গড় এবং মানক বিচ্যুতি গণনা করুন। পার্থক্যটি কি পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ নাকি এটি বিচ্যুতির মধ্যে শুধু গোলমাল? আমি কোনটি বেছে নেওয়ার সুপারিশ করবেন এবং কেন?
নিম্নলিখিতগুলির জন্য এই প্রশিক্ষণ কোডটি পরীক্ষা করুন: 1) হাইপারপ্যারামিটারগুলি কি পরীক্ষার সেট বা বৈধতা সেটের সাথে নির্বাচন করা হয়েছে? 2) সঠিক সেটের সাথে কি তাড়াতাড়ি বন্ধ করা হয়?
এই রিগ্রেশন সমস্যার জন্য MAE, RMSE এবং MAPE-এর মধ্যে কোনটি আমার রিপোর্ট করা উচিত? টার্গেট ভেরিয়েবলের স্কেল: [রেঞ্জ] বড় ত্রুটিগুলি কি অসামঞ্জস্যপূর্ণভাবে খারাপ (RMSE), নাকি তারা সব সমান (MAE)? সেখানে কি শূন্যের কাছাকাছি মান আছে (এগুলি কি MAPE বিকৃত করে)? সংক্ষিপ্ত ন্যায্যতার সাথে পরামর্শ দিন।
মেট্রিক নির্বাচন টেবিল
সমস্যার ধরন
উপযুক্ত মেট্রিক
এড়ানোর জন্য
কেন
ভারসাম্যহীন শ্রেণীবিভাগ
PR-AUC, F1, প্রত্যাহার
নির্ভুলতা
সংখ্যাগরিষ্ঠ শ্রেণী মেট্রিক স্ফীত করে
সুষম শ্রেণীবিভাগ
নির্ভুলতা, ROC-AUC
-
সুষম ডেটাতে নির্ভরযোগ্য
রিগ্রেশন (উল্লেখযোগ্য বহিঃপ্রকাশ)
RMSE
MAPE (শূন্য হলে)
বড় ভুলের শাস্তি দেয়
রিগ্রেশন (সমান ওজন)
এমএই
-
ব্যাখ্যা করা সহজ
র্যাঙ্কিং/সুপারিশ
NDCG, Recal@K
নির্ভুলতা
অর্ডার গুরুত্বপূর্ণ
সাধারণ ভুল
- ভারসাম্যহীন ডেটাতে নির্ভুলতা ব্যবহার করা। সবচেয়ে সাধারণ মেট্রিক ত্রুটি।
- বেস মডেল তুলনা করা না. এটি মেট্রিক এর অর্থ হারায়।
- হাইপারপ্যারামিটারের জন্য পরীক্ষার সেট দেখছি। আশাবাদী, অবাস্তব ফলাফল।
- একটি একক বগির উপর নির্ভরশীল। ক্রস-ভ্যালিডেশন ছাড়া আপনি পক্ষপাত দেখতে পাবেন না।
- অগ্রগতির জন্য ভুল গোলমাল। বিচ্যুতি থেকে ছোট "উন্নতি" বেশিরভাগই ভাগ্য।
- ব্যবসার প্রেক্ষাপট উপেক্ষা করা। নির্ভুলতা/রিকল ব্যালেন্স একটি ব্যবসায়িক সিদ্ধান্ত।
সংক্ষেপে
মডেল প্রশিক্ষণের আসল দক্ষতা একটি উচ্চ সংখ্যা তৈরি করা নয়, তবে সেই সংখ্যার অর্থ কী তা জানা। সমস্যা এবং ব্যবসার প্রেক্ষাপট সঠিক মেট্রিক নির্ধারণ করে; একটি বেসলাইন মডেল অনুযায়ী প্রতিটি মেট্রিক ব্যাখ্যা; ক্রস-ভ্যালিডেশন দিয়ে পক্ষপাতিত্ব পরিমাপ করুন এবং অগ্রগতির জন্য গোলমাল ভুল করবেন না; পরীক্ষার সেটটি শুধুমাত্র শেষে, একবার ব্যবহার করুন। AI হল এক্সপেরিমেন্ট ডিজাইনে আপনার অংশীদার, কিন্তু "যথেষ্ট ভাল" সিদ্ধান্তটি আপনার এবং আপনারই।
আবেদন টাস্ক
একটি শ্রেণিবিন্যাস মডেলের জন্য: (1) শ্রেণি বিতরণ লিখুন, (2) একটি উপযুক্ত বেস মডেল তৈরি করুন এবং এর স্কোর পরিমাপ করুন, (3) 5-গুণ ক্রস বৈধতা দিয়ে আপনার মডেলটি মূল্যায়ন করুন এবং গড় এবং মান বিচ্যুতি রিপোর্ট করুন, (4) সঠিকতার পরিবর্তে সমস্যাটির জন্য উপযুক্ত মেট্রিক গণনা করুন (যেমন PR-AUC)। আপনার মডেল পক্ষপাত ছাড়াই একটি বড় ব্যবধানে বেসলাইন মডেলকে হারায় কিনা তা লিখুন।
চেকলিস্ট
- [ ] আমি সমস্যার ধরন এবং ব্যবসার প্রেক্ষাপটের উপর ভিত্তি করে মেট্রিক বেছে নিয়েছি।
- [ ] আমি একটি বেস মডেল তৈরি করেছি এবং এটির সাথে তুলনা করেছি।
- [ ] আমি ক্রস-ভ্যালিডেশন সহ গড় এবং বিচ্যুতি রিপোর্ট করেছি।
- [ ] আমি নিশ্চিত করেছি যে উন্নতি বিচ্যুতির চেয়ে বেশি।
- [ ] আমি যাচাইকরণ সেটের সাথে হাইপারপ্যারামিটার নির্বাচন করেছি।
- [ ] আমি শুধুমাত্র একবার পরীক্ষার সেটটি ব্যবহার করেছি, একেবারে শেষে।