লাভ:
- মডেলের অবক্ষয়ের নীরব কারণ (ডেটা ড্রিফ্ট, কনসেপ্ট ড্রিফ্ট, আপস্ট্রিম ত্রুটি) চিনতে এবং তিন-স্তর (অপারেশনাল, ইনপুট, আউটপুট) পর্যবেক্ষণ স্থাপন করার ক্ষমতা
- নিয়ম চেক, এলএলএম-রেফারি এবং মানব মূল্যায়ন সহ একাধিক স্তরে এলএলএম সিস্টেমগুলি মূল্যায়ন করার ক্ষমতা এবং এলএলএম-রেফারি মানব নোঙ্গর দিয়ে ক্রমাঙ্কন করার ক্ষমতা
- এজ এবং সিকিউরিটি কেস সমন্বিত একটি ইভাল সেট ডিজাইন করার ক্ষমতা এবং প্রতিটি ধরা ত্রুটিকে একটি স্থায়ী টেস্ট কেসে পরিণত করার ক্ষমতা
একবার একটি মডেল উৎপাদনে গেলে, আপনার কাজ শেষ হয় না; আসল দায়িত্ব শুরু হয়। কারণ মডেলটি নিঃশব্দে ভেঙে যেতে পারে যখন কেউ তাকায় না। এই ইউনিটে, আমরা দুটি পরিপূরক শৃঙ্খলা কভার করি: মূল্যায়ন (পদ্ধতিগতভাবে মডেলের গুণমান পরিমাপ) এবং পর্যবেক্ষণ (উৎপাদনে মডেলের ধ্রুবক পর্যবেক্ষণ)। বিশেষ করে এলএলএম সিস্টেমে, ইভাল আরও কঠিন এবং ক্লাসিক্যাল এমএল-এর চেয়ে বেশি যত্নের প্রয়োজন।
কেন নিঃশব্দে ভেঙে যাচ্ছে উৎপাদন মডেল
একটি বাগ ক্র্যাশ হয়, লগ প্রিন্ট হয়, অ্যালার্ম বন্ধ হয়ে যায়। একটি ML মডেল, অন্যদিকে, ত্রুটি সৃষ্টি না করেই ভুল হতে পারে। অবক্ষয়ের তিনটি প্রধান কারণ:
- ডেটা ড্রিফ্ট: ইনপুট ডেটা বিতরণ সময়ের সাথে পরিবর্তিত হয় (নতুন পণ্য, ব্যবহারকারীর আচরণ পরিবর্তন, ঋতুতা)। মডেল একই থাকে কিন্তু পৃথিবী বদলে যায়।
- ধারণা প্রবাহ: ইনপুট-আউটপুট সম্পর্ক পরিবর্তিত হয়। জালিয়াতি কৌশল এবং স্প্যাম প্যাটার্ন বিকশিত হয়; গতকাল যা সঠিক ছিল আজ ভুল হবে।
- আপস্ট্রিম দুর্নীতি: একটি তথ্য উৎস বিন্যাস পরিবর্তন করে, একটি এলাকা মুক্ত হয়; মডেলটি দূষিত ইনপুট সহ নীরবে নিঃশব্দে ঝরছে৷
ট্রেসিং এই নীরব বিকৃতিকে শ্রবণযোগ্য করে তুলছে।
কি দেখতে হবে: তিন স্তর
ভাল পর্যবেক্ষণ তিনটি স্তর কভার করে:
- অপারেশনাল মেট্রিক্স: বিলম্ব, ত্রুটি হার, অনুরোধের পরিমাণ, সম্পদ ব্যবহার। "সিস্টেম কি দাঁড়িয়ে আছে?"
- ডেটা/ইনপুট মেট্রিক্স: প্রশিক্ষণে ইনপুট বিতরণ কি একই রকম? অনুপস্থিত মান হার বেড়েছে? নতুন বিভাগ এসেছে? "মডেল কি পরিচিত ডেটা দেখছে?"
- মডেল/আউটপুট মেট্রিক্স: ভবিষ্যদ্বাণী বিতরণ লগ? আত্মবিশ্বাসের স্কোর কমে গেছে? আর সম্ভব হলে স্থল সত্যের তুলনায় নির্ভুলতা কত? "মডেলটি কি এখনও সঠিক?"
তৃতীয় স্তরটি সবচেয়ে মূল্যবান কিন্তু সবচেয়ে কঠিন; কারণ প্রকৃত ফলাফল সাধারণত বিলম্বের সাথে আসে (ঋণ পরিশোধ করা হবে কি না তা কয়েক মাস পরে স্পষ্ট হয়ে যায়)।
টিপ: যদি প্রকৃত ফলাফল বিলম্বিত হয়, প্রথমে ইনপুট এবং পূর্বাভাস বিতরণ নিরীক্ষণ করুন। ইনপুট ডিস্ট্রিবিউশনের স্থানান্তর সঠিকতা হ্রাসের একটি প্রাথমিক চিহ্ন এবং প্রকৃত ফলাফলের জন্য অপেক্ষা না করেই একটি অ্যালার্ম বাড়াতে পারে।
এলএলএম সিস্টেমের মূল্যায়ন: বিশেষ চ্যালেঞ্জ
ক্লাসিক্যাল এমএল-এ, "সঠিক উত্তর" পরিষ্কার (শ্রেণী 0 বা 1)। অন্যদিকে, এলএলএম ফলাফল উন্মুক্ত: একই প্রশ্নের অনেকগুলো সঠিক উত্তর থাকতে পারে, "সঠিকতা" একটি সংখ্যার সাথে খাপ খায় না। এলএলএম ইভাল পদ্ধতি:
- উল্লেখিত মেট্রিক্স: আদর্শ উত্তরের সাথে আউটপুট তুলনা করা। সীমিত; কারণ এটি ভিন্নভাবে প্রকাশিত সঠিক উত্তরটিকে "ভুল" হিসাবে বিবেচনা করতে পারে।
- নিয়ম-ভিত্তিক চেক: আউটপুট বৈধ JSON? কোন নিষিদ্ধ শব্দ আছে? এটা পছন্দসই ক্ষেত্র ধারণ করে? সস্তা, নির্ভরযোগ্য, টাইট।
- এলএলএম-বিচারক (এলএলএম-বিচারক): একটি মডেলকে জিজ্ঞাসা করবেন না "এই উত্তরটি কি এই মানদণ্ড অনুসারে ভাল?" এটা স্কেল, কিন্তু রেফারি নিজেই যাচাই করা আবশ্যক.
- মানব পর্যালোচনা: গোল্ড স্ট্যান্ডার্ড কিন্তু ব্যয়বহুল এবং ধীর। এটি নমুনায় ব্যবহৃত হয়।
অনুশীলনে এগুলি একসাথে ব্যবহার করা হয়: প্রতিটি আউটপুটের সস্তা নিয়ম পরীক্ষা, একটি বড় নমুনার উপর LLM-বিচারক, একটি ছোট কিন্তু কঠোর নমুনার উপর মানুষের মূল্যায়ন।
দুর্বল পন্থা / শক্তিশালী পন্থা
দুর্বল: "এলএলএম-আমি রেফারিকে জিজ্ঞাসা করেছি, আমাদের উত্তরগুলির 92% ভাল ছিল। সিস্টেমটি দুর্দান্ত।"
Güçlü: "আমরা প্রথমে 100টি প্রিন্টআউটে মানব-লেবেল দিয়েছিলাম। আমরা একই 100টি প্রিন্টআউটে LLM-বিচারককে চালিয়েছিলাম এবং মানব-বিচারকের চুক্তি পরিমাপ করেছি — 85% চুক্তি, গ্রহণযোগ্য। আমরা নথিভুক্ত করেছি যেখানে বিচারক পদ্ধতিগতভাবে ভুল করেছেন (অন্যায়ভাবে দীর্ঘ উত্তর খুঁজে পাওয়ার প্রবণতা) এবং তার স্কোর ঠিক করেছিলাম তখনই আমরা বিচারকে বিশ্বাস করেছি।"
পার্থক্য: শক্তিশালী পদ্ধতি রেফারিকে একজন মানব নোঙ্গর দিয়ে যাচাই করে, অন্ধভাবে নয়। একজন অযাচাই করা এলএলএম-রেফারি সুন্দর চেহারার কিন্তু মিথ্যা আত্মবিশ্বাস দেয়।
মনোযোগ: এলএলএম-রেফারিও একজন মডেল; হ্যালুসিনোজেনিক, পক্ষপাতদুষ্ট (দীর্ঘ/আত্মবিশ্বাসী উত্তরের পক্ষে), অসঙ্গতিপূর্ণ হতে পারে। উৎপাদন সিদ্ধান্ত নেওয়ার আগে মানব ট্যাগ দিয়ে রেফারির স্কোর ক্যালিব্রেট করুন।
মূল্যায়ন সেট: সাবধানে পরিকল্পিত
একটি ভাল ইভাল সেট বাস্তব ব্যবহার এবং কঠিন ক্ষেত্রে বিভিন্ন প্রতিনিধিত্ব করে। সহজ উদাহরণ দিয়ে ভরা একটি ইভাল আপনাকে মিথ্যা আত্মবিশ্বাসে ছেড়ে দেবে। এটি ইভাল ক্লাস্টারে রাখতে ভুলবেন না:
- এজ কেস: খালি ইনপুট, খুব দীর্ঘ ইনপুট, অস্বাভাবিক বিন্যাস।
- পরিচিত হার্ড কেস: উদাহরণ যেখানে মডেল অতীতে ভুল করেছে (একটি রিগ্রেশন পরীক্ষা হিসাবে)।
- নিরাপত্তা ঘটনা: প্রম্পট ইনজেকশন প্রচেষ্টা, দূষিত অনুরোধ, গোপনীয়তা লঙ্ঘন ফাঁদ.
ইভাল ক্লাস্টার সময়ের সাথে সাথে বৃদ্ধি পায়: প্রতিটি নতুন বাগ যা আপনি উৎপাদনে ধরতে পারেন তা পরবর্তী মূল্যায়নের জন্য একটি পরীক্ষার ক্ষেত্রে পরিণত হয়।
অ্যালার্ম এবং হস্তক্ষেপ
অ্যালার্ম ছাড়া মনিটরিং অসম্পূর্ণ থেকে যায়। প্রতিটি গুরুত্বপূর্ণ মেট্রিকের জন্য একটি থ্রেশহোল্ড এবং একটি প্রতিক্রিয়া পরিকল্পনা থাকা উচিত: "ইনপুট ড্রিফ্ট X অতিক্রম করলে প্রকৌশলীকে অবহিত করুন", "ত্রুটির হার Y-এর বেশি হলে অটো রোল ব্যাক"। অ্যালার্মগুলিকে অর্থপূর্ণ রাখুন — অনেকগুলি মিথ্যা অ্যালার্ম দলকে সংবেদনশীল করে তোলে এবং তাদের আসল অ্যালার্ম মিস করে।
তিনটি মিনি কেস
কেস 1 - প্রাথমিক সতর্কতা। একটি চাহিদা পূর্বাভাস মডেলের প্রকৃত নির্ভুলতা শুধুমাত্র সপ্তাহের শেষে স্পষ্ট হয়ে ওঠে। দলটি ইনপুট বিতরণ পর্যবেক্ষণ করছিল এবং মঙ্গলবার একটি নতুন পণ্য বিভাগের আকস্মিক উত্থান দেখেছিল - যা মডেলটি কখনও দেখেনি। তারা নির্ভুলতা ড্রপের জন্য অপেক্ষা না করেই মডেলটি আপডেট করেছে। ইনপুট পর্যবেক্ষণ সংরক্ষিত দিন.
কেস 2 - যাচাই করা হয়নি রেফারি। একটি দল এলএলএম-পর্যালোচকের উপর ভিত্তি করে "আমাদের গুণমান চমৎকার" রিপোর্ট করেছে। যখন গ্রাহকের অভিযোগ বেড়েছে, তখন মানব পর্যবেক্ষণ চালু করা হয়েছিল: রেফারি আত্মবিশ্বাসী কিন্তু ভুল উত্তরগুলিকে "ভাল" বলে গণ্য করেছেন। একবার রেফারিকে মানব ট্যাগ দিয়ে ক্রমাঙ্কিত করা হলে, প্রকৃত গুণমানটি প্রকাশিত হয়েছিল এবং অনেক কম ছিল। পাঠ: যাচাই না করে রেফারিকে বিশ্বাস করবেন না।
কেস 3 - রিগ্রেশন টেস্টিং। একটি তাত্ক্ষণিক পরিবর্তন একটি সমস্যা সমাধান করে যখন নীরবে অন্যটি ভেঙে দেয়। কিন্তু দলটি ইভাল বালতিতে অতীতের বাগগুলি রেখেছিল; যখন এই ক্লাস্টারে নতুন পরিবর্তন পরীক্ষা করা হয়েছিল, তখন ভাঙা কেসটি অবিলম্বে ধরা পড়ে এবং পরিবর্তনটি ঠিক করা হয়েছিল। পাঠ: প্রতিটি স্থির বাগ একটি স্থায়ী পরীক্ষার ক্ষেত্রে পরিণত হওয়া উচিত।
অনুলিপিযোগ্য টেমপ্লেট
এই উৎপাদন মডেলের জন্য একটি ট্র্যাকিং পরিকল্পনা তৈরি করুন। তিনটি স্তর কভার করুন: 1) অপারেশনাল (লেটেন্সি, এরর রেট, ভলিউম) 2) ইনপুট/ডেটা (ডিস্ট্রিবিউশন শিফট, অনুপস্থিত মান, নতুন বিভাগ) 3) মডেল/আউটপুট (ভবিষ্যদ্বাণী বিতরণ, আত্মবিশ্বাস, যথার্থতা সম্ভব হলে) মডেল: [বর্ণনা]। প্রকৃত ফলাফল আসতে কতক্ষণ সময় লাগে: [সময়কাল] প্রতিটি মেট্রিকের জন্য থ্রেশহোল্ড এবং হস্তক্ষেপের সুপারিশ যোগ করুন।
এই এলএলএম সিস্টেমের জন্য একটি মূল্যায়ন (মূল্যায়ন) কৌশল প্রস্তাব করুন। টাস্ক: [বর্ণনা] স্তরগুলি নির্ধারণ করুন:- প্রতিটি আউটপুটে কোন নিয়ম-ভিত্তিক চেকগুলি চালানো উচিত?- এলএলএম-সালিশকারীকে কোন মানদণ্ডের মূল্যায়ন করা উচিত এবং কীভাবে সেগুলিকে যাচাই করা উচিত (মানব অ্যাঙ্কর)?- কোন নমুনায় মানবিক মূল্যায়ন করা উচিত? ই-মূল্যায়নের ক্ষেত্রে নিরাপত্তা নির্ধারণ করা উচিত।
এই এলএলএম-রেফারি প্রম্পটটি পরীক্ষা করুন:- মূল্যায়নের মানদণ্ড কি পরিষ্কার বা বিষয়ভিত্তিক?- এটি কি দৈর্ঘ্য/আস্থার পক্ষপাতের প্রবণ?- আমি কীভাবে রেফারিকে মানব ট্যাগ দিয়ে ক্যালিব্রেট করব? রেফারি প্রম্পট: [প্রম্পট]
এই মনিটরিং অ্যালার্মের জন্য একটি প্রতিক্রিয়া রানবুক লিখুন৷ অ্যালার্ম: [যেমন ইনপুট ড্রিফ্ট থ্রেশহোল্ড অতিক্রম করেছে] অবশ্যই থাকতে হবে: প্রাথমিক নিয়ন্ত্রণ পদক্ষেপ, সম্ভাব্য কারণ, রোলব্যাক মানদণ্ড, কাকে জানাতে হবে।
অবনতি কারণ টেবিল
বিকৃতি
উপসর্গ
প্রাথমিক সনাক্তকরণের উপায়
তথ্য প্রবাহ
ইনপুট বন্টন পরিবর্তন
ইনপুট বিতরণ পর্যবেক্ষণ
ধারণা পরিবর্তন
ন্যায়পরায়ণতা নীরবে পড়ে যায়
ভবিষ্যদ্বাণী + প্রকৃত তুলনা
আপস্ট্রিম ত্রুটি
ক্ষেত্রগুলি খালি হয়ে যায়/ফরম্যাটে পরিবর্তন হয়
স্কিমা যাচাইকরণ + অনুপস্থিত হার
মডেলের অসঙ্গতি
আউটপুট বন্টন স্থানান্তর
আউটপুট বিতরণ পর্যবেক্ষণ
সাধারণ ভুল
- মনিটরিং স্থাপন না করা। মডেলটি নীরবে ভেঙে যায়, কেউ এটি দেখে না।
- শুধুমাত্র অপারেশনাল মেট্রিক্স ট্র্যাক করুন। সিস্টেম আপ, কিন্তু ভবিষ্যদ্বাণী ভুল হতে পারে.
- রেফারি যাচাই না করেই এলএলএম ব্যবহার করা। এটি মিথ্যা আত্মবিশ্বাস দেয়।
- সহজ উদাহরণ সহ Eval. এটি প্রকৃত অসুবিধা নির্দেশ করে না।
- ইভালে অতীতের ত্রুটিগুলি অন্তর্ভুক্ত নয়। একই ত্রুটি আবার ফিরে আসে।
- জোরে অ্যালার্ম। দলটি সংবেদনশীল হয়ে পড়ে, আসল অ্যালার্ম মিস করে।
সংক্ষেপে
মডেল উত্পাদন ত্রুটি সৃষ্টি ছাড়া ভুল হতে পারে; তাই ইভাল এবং পর্যবেক্ষণ উন্নয়নের মতোই গুরুত্বপূর্ণ। তিনটি স্তরে পর্যবেক্ষণ স্থাপন করুন (অপারেশনাল, ইনপুট, আউটপুট); প্রকৃত ফলাফল বিলম্বিত হলে একটি প্রাথমিক সতর্কতা হিসাবে ইনপুট ড্রিফ্ট ব্যবহার করুন। এলএলএম সিস্টেমে, ইভাল ওপেন-এন্ডেড; নিয়ম চেক, LLM-রেফারি, এবং মানুষের মূল্যায়ন একসাথে ব্যবহার করুন — তবে LLM-রেফারিকে একজন মানব নোঙ্গর দিয়ে যাচাই করতে ভুলবেন না। এজ এবং সিকিউরিটি কেস দিয়ে আপনার ইভাল ক্লাস্টারকে সমৃদ্ধ করুন এবং ধরা পড়া প্রতিটি ত্রুটিকে একটি স্থায়ী টেস্ট কেসে পরিণত করুন।
আবেদন টাস্ক
একটি উত্পাদন (বা কাছাকাছি-উৎপাদন) মডেলের জন্য একটি তিন-স্তর পর্যবেক্ষণ পরিকল্পনা লিখুন এবং কমপক্ষে একটি ইনপুট-বন্টন মেট্রিকের জন্য থ্রেশহোল্ড + অ্যালার্ম সংজ্ঞায়িত করুন। আপনার যদি একটি LLM সিস্টেম থাকে: মানুষের সাথে 30 আউটপুট ট্যাগ করুন, একই আউটপুটগুলিতে একজন LLM-রেফারি চালান এবং মানব-রেফারি চুক্তি পরিমাপ করুন; রেফারির পদ্ধতিগত পক্ষপাত নোট করুন। আপনার eval ক্লাস্টারে কমপক্ষে 3টি প্রান্ত এবং 2টি নিরাপত্তা কেস যোগ করুন।
চেকলিস্ট
- [ ] মনিটরিং তিনটি স্তর (অপারেশনাল, ইনপুট, আউটপুট) কভার করে।
- প্রকৃত ফলাফল বিলম্বিত হলে আমি প্রাথমিক সতর্কতা হিসাবে ইনপুট ড্রিফ্ট ব্যবহার করি।
- [ ] আমি মানব লেবেল দিয়ে এলএলএম-সালিশকারীকে ক্যালিব্রেট করেছি।
- [ ] ইভাল ক্লাস্টারে প্রান্ত এবং নিরাপত্তা কেস রয়েছে।
- [ ] আমার ধরা প্রতিটি বাগকে আমি একটি স্থায়ী পরীক্ষার ক্ষেত্রে পরিণত করেছি৷
- প্রতিটি গুরুত্বপূর্ণ মেট্রিকের একটি থ্রেশহোল্ড এবং প্রতিক্রিয়া পরিকল্পনা রয়েছে।