ইউনিট 5 / 11

মডেল নির্বাচন: সঠিক কাজের জন্য সঠিক মডেল

লাভ:

  • সামর্থ্য, গতি এবং খরচের উপর মডেল পরিবার (দ্রুত/ভারসাম্য/শক্তিশালী) তুলনা করতে পারেন
  • টাস্ক জটিলতা অনুযায়ী মডেল নির্বাচন এবং রাউটিং কৌশল ডিজাইন করে
  • একটি ছোট সেট ইভাল সহ প্রমাণের ভিত্তিতে মডেল নির্বাচন

LLM ইন্টিগ্রেশনে আপনার টাকা এবং মানের জন্য সবচেয়ে বেশি ধাক্কা যেটি নির্ধারণ করে তা হল আপনি কোন মডেলটি ব্যবহার করবেন। সাধারণ রিফ্লেক্স হল "সবচেয়ে শক্তিশালী মডেল নির্বাচন করুন"; যাইহোক, এর অর্থ প্রায়ই অপ্রয়োজনীয় খরচ এবং বিলম্ব। সঠিক পন্থা হল হালকা মডেল বেছে নেওয়া যা প্রতিটি কাজ সম্পন্ন করে এবং সেই পছন্দটিকে পরিমাপের উপর ভিত্তি করে, অনুমানের উপর নয়। এই ইউনিটে, আপনি সামর্থ্য/গতি/খরচ অক্ষের উপর মডেল পরিবারের তুলনা করবেন, টাস্ক জটিলতা অনুসারে একটি মডেল রাউটিং কৌশল স্থাপন করবেন এবং একটি ছোট সেট মূল্যায়নের সাথে নির্বাচনের প্রমাণ দেবেন।

মডেল পরিবার বোঝা

প্রদানকারীরা সাধারণত তিনটি শ্রেণী অফার করে: দ্রুত/সস্তা, স্থিতিশীল এবং শক্তিশালী। তাদের মধ্যে সম্পর্ক তিনটি অক্ষে সংক্ষিপ্ত করা হয়েছে: ক্ষমতা (কঠিন কাজ সমাধান করার ক্ষমতা), গতি (বিলম্বন), খরচ (টোকেন মূল্য)।

ক্লাস

উদাহরণ

প্রতিভা

গতি

খরচ

উপলব্ধ কাজ

দ্রুত

হাইকু 4.5

মাঝারি

খুব উচ্চ

কম

শ্রেণীবিভাগ, লেবেলিং, সংক্ষিপ্ত সারাংশ, অভিযোজন

সুষম

সনেট 5

উচ্চ

উচ্চ

মাঝারি

সাধারণ উদ্দেশ্য, কোডিং, বহু-পদক্ষেপ প্রবাহ, বেশিরভাগ এজেন্ট কাজ

শক্তিশালী

ওপাস 4.8

সর্বোচ্চ

মাঝারি

উচ্চ

জটিল যুক্তি, দীর্ঘ পরিসরের স্বায়ত্তশাসিত কাজ, কঠিন বিশ্লেষণ

সমালোচনামূলক অন্তর্দৃষ্টি: আরও শক্তিশালী মডেল প্রতিটি কাজে ভাল পারফর্ম করে না। একটি সাধারণ "জরুরি বা না" লেবেলিংয়ে, শক্তিশালী মডেল এবং দ্রুত মডেল একই সঠিক উত্তর দেয়; একমাত্র পার্থক্য হল শক্তিশালী 5 গুণ বেশি ব্যয়বহুল এবং ধীর। অতিরিক্ত প্রতিভা তখনই মূল্য উৎপন্ন করে যখন মিশনের প্রয়োজন হয়।

ধাপে ধাপে: কীভাবে একটি মডেল চয়ন করবেন?

  1. টাস্ক শ্রেণীবদ্ধ করুন। এটা কি রুটিন/প্যাটার্নযুক্ত (লেবেলিং, অনুমান), নাকি ওপেন-এন্ডেড/মাল্টি-স্টেপ (বিশ্লেষণ, পরিকল্পনা, কোড)?
  2. হালকা প্রার্থী দিয়ে শুরু করুন। দ্রুত মডেল দিয়ে এটি চেষ্টা করুন. যদি যথেষ্ট হয়, থামুন।
  3. যদি এটি যথেষ্ট না হয়, একটি উচ্চ শ্রেণী পর্যন্ত সরানো. যদি নির্ভুলতা কম হয়, তাহলে ভারসাম্যপূর্ণ একটিতে যান, যদি তা যথেষ্ট না হয় তবে শক্তিশালীটিতে যান।
  4. পরিমাপ করুন, অনুমান করবেন না। প্রতিটি প্রার্থীর নির্ভুলতা এবং খরচের একটি ছোট সেট ইভালের সাথে তুলনা করুন (নীচে)।
  5. পুনর্নির্দেশ সেট আপ করুন। একটি একক মডেলের সাথে সংযোগ করার পরিবর্তে, একটি "রাউটার" দিয়ে সঠিক মডেলে কাজটি বিতরণ করুন।

মডেল রাউটিং

বাস্তব কাজের চাপ মিশ্র হয়: বেশিরভাগ আগত অনুরোধগুলি সহজ, কিছু কঠিন। এটা তাদের সব শক্তিশালী মডেল পাঠাতে একটি অপচয়; দ্রুত মডেলে তাদের সব পাঠানোর মান হ্রাস পায়। রাউটিং এর সমাধান করে: একটি সস্তা মডেল (বা একটি সাধারণ নিয়ম) প্রথমে টাস্ককে শ্রেণীবদ্ধ করে, তারপর কাজটি উপযুক্ত মডেলে যায়।

# রাউটার প্রম্পট (সস্তা মডেলের সাথে কাজ করে) আগত অনুরোধটিকে তার অসুবিধা অনুসারে শ্রেণিবদ্ধ করুন। শুধুমাত্র নিম্নলিখিত JSON ফেরত দিন:{"difficulty": "simple|complex"}সহজ: একক-পদক্ষেপ, সূত্রভিত্তিক, সংক্ষিপ্ত-উত্তর। জটিল: বহু-পদক্ষেপের যুক্তি, বিশ্লেষণ, বা দীর্ঘ প্রজন্মের প্রয়োজন। অনুরোধ: """{{request}}"""

  • সহজ → দ্রুত মডেলে যান (সস্তা, দ্রুত)।
  • জটিল → শক্তিশালী মডেলে যান (ব্যয় কিন্তু প্রয়োজনীয়)।

এই প্যাটার্নটি উল্লেখযোগ্যভাবে গড় খরচ কমায় কারণ বেশিরভাগ ট্রাফিক সাধারণত সহজ।

পরামর্শ: একটি রেফারেল সিদ্ধান্তের জন্য সর্বদা একটি LLM প্রয়োজন হয় না। "টেক্সট 20 শব্দের কম হলে দ্রুত মডেলে যান" এর মতো সহজ নিয়মগুলিও একটি গাইড এবং শূন্য অতিরিক্ত টোকেন খরচ নিয়ে আসে। প্রথমে নিয়ম চেষ্টা করুন।

লিংকিং চয়েস টু এভিডেন্স: দ্য স্মল ইভাল ক্লাস্টার

"এটি আমার কাছে ভাল দেখাচ্ছে" এর উপর ভিত্তি করে একটি মডেল নির্বাচন করবেন না। ইভাল (মূল্যায়ন সেট) নমুনার একটি ছোট সেট যার জন্য সঠিক উত্তর জানা যায়; আপনি এই সেটে প্রতিটি মডেল চালান এবং নির্ভুলতা, খরচ এবং বিলম্বিতা পরিমাপ করুন।

# ইভাল সেটআপ টেমপ্লেট1) 20-50টি বাস্তব উদাহরণ সংগ্রহ করুন, প্রতিটিতে "সঠিক উত্তর" হাতে লিখুন। 2) এই সেটে প্রতিটি মডেল (দ্রুত/ভারসাম্যপূর্ণ/শক্তিশালী) চালান।3) প্রতিটি মডেলের জন্য: সংশোধনের সংখ্যা, গড় থ্রুপুট টোকেন, অনুরোধ প্রতি খরচ, গড় সময়। 4) "পর্যাপ্ত সঠিকতা প্রদান করে" এমন মডেল বেছে নিন।

# ইভাল তুলনা টেবিল (ভরাট) মডেল | নির্ভুলতা | অনুরোধ প্রতি খরচ | গড় সময়কাল হাইকু | ...% | ... $ | ... snSonnet | ...% | ... $ | ... snOpus | ...% | ... $ | ...সেকেন্ড

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট (মডেল নির্বাচন সিদ্ধান্ত)

# দুর্বল (সিদ্ধান্তের কোন ভিত্তি নেই) আসুন সেরা মডেলটি ব্যবহার করি, বাজেট গুরুত্বপূর্ণ নয়।

# স্ট্রং (পরিমাপের উপর ভিত্তি করে সিদ্ধান্ত) 50 টি নমুনার মধ্যে, হাইকু 96% নির্ভুলতা দিয়েছে, সনেট দিয়েছে 97% নির্ভুলতা; পার্থক্য পরিসংখ্যানগতভাবে নগণ্য। হাইকু বেছে নেওয়া হয়েছিল কারণ এটি 5 গুণ সস্তা এবং 2 গুণ দ্রুত। যদি নির্ভুলতা 95% এর নিচে নেমে যায়, তাহলে সনেটে আপগ্রেড করার সিদ্ধান্ত স্বয়ংক্রিয়ভাবে নেওয়া হবে।

শক্তিশালী সংস্করণ; নির্বাচনকে একটি সংখ্যা, একটি থ্রেশহোল্ড এবং একটি বৃদ্ধির নিয়মে আবদ্ধ করে। এটি উভয়ই আজকের সিদ্ধান্তকে রক্ষা করে এবং ভবিষ্যতের পরিবর্তন পরিচালনা করে।

তিনটি মিনি কেস

কেস 1 — অপ্রতিরোধ্য মডেল থেকে পালান। একটি কল সেন্টার ওপাসের সাথে সমস্ত কথোপকথনের সারাংশ তৈরি করছিল; মাসিক বিল বেশি ছিল। 40-নমুনা ইভালে, সনেট সঠিকতার দিক থেকে Opus থেকে 1% পিছিয়ে ছিল কিন্তু খরচ এক-তৃতীয়াংশ। তারা সারসংক্ষেপ কাজ সনেটে স্থানান্তরিত করেছে; কোনো গুণগত অভিযোগ ছাড়াই মাসিক খরচ $9,000 থেকে $3,100 এ নেমে এসেছে।

কেস 2 — পুনর্নির্দেশ সহ মিশ্র ট্র্যাফিক। একটি আইনি প্রযুক্তি দলের অনুরোধের 80% ছিল সাধারণ নথি ট্যাগিং, 20% জটিল চুক্তি বিশ্লেষণ। তারা সব শক্তিশালী মডেলের কাছে পাঠাচ্ছিল। তারা একটি সস্তা রাউটার যুক্ত করেছে এবং হাইকুতে সহজ কাজ এবং অপাসে জটিল কাজগুলি বিতরণ করেছে; গড় অনুরোধের খরচ 64% কমেছে, যখন বিশ্লেষণের মান বজায় রাখা হয়েছিল।

কেস 3 - পরিমাপ ছাড়াই আকার কমানোর খরচ। খরচ কমাতে, একটি দল দ্রুত মডেলে সরাসরি জটিল মেডিকেল কোড নিষ্কাশন হ্রাস করেছে; তারা মূল্যায়ন করেনি। লাইভে, নির্ভুলতা 92% থেকে 78% এ নেমে আসে, যার ফলে ভুল অনুমান ফিরে আসে। তাদের প্রথমে ইভাল করতে হয়েছিল: সেই কাজটির জন্য শক্তিশালী মডেলের প্রয়োজন ছিল। পাঠ: হ্রাস এবং উচ্চতা উভয়ই পরিমাপ দ্বারা সম্পন্ন হয়।

সাধারণ ভুল

  • "শক্তিশালী মডেল" রিফ্লেক্স: সাধারণ কাজে অপচয় এবং অপ্রয়োজনীয় বিলম্ব।
  • পরিমাপ ছাড়াই মডেল পরিবর্তন: হ্রাস এবং বৃদ্ধি উভয়ই ইভাল ছাড়াই ঝুঁকিপূর্ণ।
  • একটি একক মডেলে লক করা: মিশ্র ট্র্যাফিকের রাউটিং প্রায়শই আরও কার্যকর হয়৷
  • এলএলএম-এর জন্য রাউটারকে সর্বদা ভুল করা: সহজ নিয়মগুলি শূন্য খরচে কাজ করতে পারে।
  • একটি বুস্ট থ্রেশহোল্ড সেট না করা: সঠিকতা কমে গেলে কী হবে তা আগে থেকেই সংজ্ঞায়িত করা উচিত।
  • মডেল সংস্করণ ঠিক করা হচ্ছে না: আপনি উৎপাদনে কোন মডেল/সংস্করণে কাজ করছেন তা রেকর্ড করুন; সংস্করণ পরিবর্তন আচরণ পরিবর্তন হতে পারে.

গভীরতর: স্থায়ী ইভাল এবং ক্রমবর্ধমান বিচার

মডেল নির্বাচন এককালীন সিদ্ধান্ত নয়। প্রদানকারীরা নতুন মডেল প্রবর্তন করে, দাম পরিবর্তন হয়, আপনার কাজের বিবরণ বিকশিত হয়। তাই একবার ইভাল ক্লাস্টার সেট আপ করুন এবং ভুলবেন না; জীবিত সত্তার মত ধরে রাখুন। যখন একটি নতুন মডেল আসে, আপনি এটির মাধ্যমে একই 20-50 নমুনা চালান, টেবিল আপডেট করুন এবং আবার আপনার সিদ্ধান্ত নিন। এটি আপনাকে "প্যাটার্ন-স্যুইচিং অন্তর্দৃষ্টি" ফাঁদ থেকে রক্ষা করে।

দ্বিতীয় উন্নত কৌশল হল ফলব্যাক/ক্যাসকেড প্যাটার্ন। আপনি প্রথমে সস্তা মডেলকে কাজটি দিন; যদি আউটপুটে কম আত্মবিশ্বাস থাকে বা যাচাইকরণ স্তর (ইউনিট 11) এটি প্রত্যাখ্যান করে, আপনি একই অনুরোধটি বাড়িয়ে দেন। তাই বেশিরভাগ ট্রাফিক সস্তা মডেলে সমাধান করা হয়, শুধুমাত্র অবশিষ্ট সংখ্যালঘুরা ব্যয়বহুল মডেলে যায়। এটি স্থির একক-মডেল পদ্ধতির চেয়ে সস্তা এবং আরও টেকসই।

তৃতীয় পয়েন্ট হল যে eval শুধুমাত্র নির্ভুলতাই নয় খরচ এবং বিলম্বও অন্তর্ভুক্ত করে। যদি একটি মডেল 1% বেশি নির্ভুল কিন্তু 3 গুণ বেশি ব্যয়বহুল এবং 2 গুণ ধীর হয়, তবে বেশিরভাগ চাকরির জন্য ট্রেড-অফটি মূল্যবান নয়। তিনটি অক্ষ বরাবর সিদ্ধান্ত নিন (নির্ভুলতা, খরচ, লেটেন্সি) এবং একটি "পর্যাপ্ততা থ্রেশহোল্ড" সংজ্ঞায়িত করুন: "যদি নির্ভুলতা 95% এর উপরে হয়, তাহলে সবচেয়ে সস্তাটি বেছে নিন।"

অবশেষে, আপনি কোন মডেল/সংস্করণটি উৎপাদনে ব্যবহার করেছেন তা রেকর্ড করুন। যদি একদিন আউটপুট গুণমান পরিবর্তন হয়, আপনি প্রথম জিনিসটি দেখতে পাবেন মডেল সংস্করণ পরিবর্তন হয়েছে কিনা। সংস্করণ ট্রেসেবিলিটি গুণমানের সমস্যার মূল কারণ খুঁজে বের করা দ্রুত করে তোলে।

আরও একটি সতর্কতা: ইভাল ক্লাস্টার আপনার প্রকৃত কাজের চাপকে প্রতিনিধিত্ব করবে। শুধুমাত্র সহজ উদাহরণগুলির সমন্বয়ে একটি ইভাল লুকিয়ে থাকে যেখানে মডেলটি কঠিন ক্ষেত্রে হোঁচট খায় এবং আপনাকে মিথ্যা আত্মবিশ্বাসের দিকে নিয়ে যায়। একটি ভাল eval; এটিতে সাধারণ সহজ উদাহরণগুলির পাশাপাশি আপনি বাস্তবে সম্মুখীন হন এমন কোণার কেসগুলি অন্তর্ভুক্ত করে (অস্পষ্ট, অসম্পূর্ণ, পরস্পরবিরোধী ইনপুট)। এই কঠিন সংখ্যালঘু আপনার মডেল পছন্দ নির্ধারণ করে, কারণ প্রতিটি মডেল যেভাবেই হোক সহজ সংখ্যাগরিষ্ঠতায় সফল হয়। আপনার ইভালকে পর্যায়ক্রমে নতুন বাস্তব উদাহরণ খাওয়ানোর মাধ্যমে তাজা এবং প্রতিনিধিত্ব রাখুন।

সংক্ষেপে

সঠিক মডেল হল সবচেয়ে হালকা মডেল যা কাজটি সম্পন্ন করে; আরও শক্তিশালী প্রতিটি কাজে ভাল নয়, এটি আরও ব্যয়বহুল এবং ধীর। টাস্ককে শ্রেণীবদ্ধ করা এবং সবচেয়ে হালকা প্রার্থী থেকে শুরু করে, রাউটিং সহ মিশ্র ট্র্যাফিক বন্টন করা এবং একটি ছোট সেট ইভাল দিয়ে নির্বাচনকে প্রমাণ করা মান বজায় রেখে খরচ অনেক গুণ কমিয়ে দেয়।

আবেদন টাস্ক

একটি কাজের চাপ চয়ন করুন। (1) কাজটিকে সহজ/জটিল হিসাবে শ্রেণীবদ্ধ করুন। (2) 20টি বাস্তব উদাহরণের একটি ছোট ইভাল সেট ডিজাইন করুন (তাদের সঠিক উত্তর সহ)। (3) তিনটি মডেল ক্লাসের জন্য নির্ভুলতা/খরচ/সময় তুলনা সারণি তৈরি করার জন্য একটি পরিকল্পনা আঁকুন। (4) আপনার যদি মিশ্র ট্রাফিক থাকে, একটি রাউটিং নিয়ম লিখুন এবং একটি বৃদ্ধির থ্রেশহোল্ড সেট করুন৷

চেকলিস্ট

  • [ ] আমি সামর্থ্য/গতি/খরচ অক্ষে মডেল পরিবারের তুলনা করতে পারি।
  • আমি "হালকা সফল মডেল" নীতি প্রয়োগ করতে পারি।
  • [] আমি টাস্ক জটিলতা অনুযায়ী মডেল রাউটিং সেট আপ করতে পারি।
  • [ ] ইভালের একটি ছোট সেট দিয়ে আমি নির্বাচনকে প্রমাণের সাথে আবদ্ধ করতে পারি।
  • [] আমি একটি আপগ্রেড/ডিমোশন থ্রেশহোল্ড সংজ্ঞায়িত করতে পারি।