وحدة 5 / 11

اختيار النموذج: النموذج المناسب للوظيفة المناسبة

المكاسب:

  • يمكن مقارنة مجموعة الطرازات (سريعة/متوازنة/قوية) من حيث القدرة والسرعة والتكلفة
  • تصميم اختيار النموذج واستراتيجيات التوجيه وفقًا لتعقيد المهمة
  • يعتمد اختيار النموذج على الأدلة مع مجموعة صغيرة من التقييمات

القرار الوحيد الذي يحدد أفضل ما لديك من المال والجودة في تكامل LLM هو النموذج الذي تستخدمه. رد الفعل الشائع هو "اختيار النموذج الأقوى"؛ ومع ذلك، فإن هذا يعني في كثير من الأحيان تكاليف وتأخيرات غير ضرورية. النهج الصحيح هو اختيار النموذج الأخف الذي ينجز كل مهمة ويبني هذا الاختيار على القياس، وليس التخمين. في هذه الوحدة، ستقوم بمقارنة مجموعة النماذج على محور القدرة/السرعة/التكلفة، وإنشاء استراتيجية توجيه النموذج وفقًا لتعقيد المهمة، وإثبات الاختيار من خلال مجموعة صغيرة من التقييمات.

فهم الأسرة النموذجية

يقدم مقدمو الخدمة عمومًا ثلاث فئات: سريع/رخيص، ومستقر، وقوي. تتلخص العلاقة بينهما في ثلاثة محاور: القدرة (القدرة على حل المهام الصعبة)، السرعة (زمن الوصول)، التكلفة (السعر الرمزي).

فئة

مثال

المواهب

السرعة

التكلفة

المهام المتاحة

سريع

هايكو 4.5

متوسطة

عالية جدا

منخفض

التصنيف، وضع العلامات، ملخص موجز، التوجه

متوازن

السوناتة 5

عالية

عالية

متوسطة

الأغراض العامة، والترميز، والتدفق متعدد الخطوات، ومعظم أعمال الوكيل

قوي

أوبوس 4.8

أعلى

متوسطة

عالية

التفكير المعقد، والمهام المستقلة طويلة المدى، والتحليل الصعب

رؤية حاسمة: النموذج الأقوى لا يؤدي أداءً أفضل في كل وظيفة. في التصنيف البسيط "عاجل أم لا"، يعطي النموذج القوي والنموذج السريع نفس الإجابة الصحيحة؛ والفرق الوحيد هو أن القوة أغلى بخمس مرات وأبطأ. إن الموهبة الإضافية لا تنتج قيمة إلا عندما تتطلب المهمة ذلك.

خطوة بخطوة: كيفية اختيار النموذج؟

  1. تصنيف المهمة. هل هي روتينية/منقوشة (وضع العلامات، الاستدلال)، أم مفتوحة/متعددة الخطوات (التحليل، التخطيط، التعليمات البرمجية)؟
  2. ابدأ بالمرشح الأخف. جربه مع النموذج السريع. إذا كان هذا كافيا، توقف.
  3. إذا لم يكن ذلك كافيا، فانتقل إلى فئة أعلى. إذا كانت الدقة منخفضة فانتقل إلى المتوازن، وإذا لم يكن ذلك كافيا فانتقل إلى القوي.
  4. قم بالقياس، لا تخمن. قارن دقة وتكلفة كل مرشح بمجموعة صغيرة من التقييمات (أدناه).
  5. إعداد إعادة التوجيه. بدلاً من الاتصال بنموذج واحد، قم بتوزيع المهمة على النموذج الصحيح باستخدام "جهاز التوجيه".

توجيه النموذج

أعباء العمل الحقيقية مختلطة: معظم الطلبات الواردة بسيطة، وبعضها صعب. إنها مضيعة لإرسالهم جميعًا إلى النموذج القوي؛ يؤدي إرسالها جميعًا إلى النموذج السريع إلى تقليل الجودة. التوجيه يحل هذه المشكلة: يقوم نموذج رخيص (أو قاعدة بسيطة) بتصنيف المهمة أولاً، ثم تنتقل المهمة إلى النموذج المناسب.

# موجه الراوتر (يعمل بالطراز الرخيص) تصنيف الطلب الوارد حسب صعوبته. قم بإرجاع JSON التالي فقط:{"difficulty": "simple|complex"}بسيط: خطوة واحدة، صيغة، إجابة قصيرة. معقد: يتطلب التفكير متعدد الخطوات، أو التحليل، أو الجيل الطويل.الطلب: """{{request}}"""

  • انتقل إلى النموذج البسيط → السريع (رخيص وسريع).
  • انتقل إلى النموذج المعقد → القوي (باهظ الثمن ولكنه ضروري).

يؤدي هذا النمط إلى تقليل متوسط ​​التكلفة بشكل كبير لأن معظم حركة المرور تكون بسيطة بشكل عام.

نصيحة: لا يتطلب قرار الإحالة دائمًا الحصول على LLM. القواعد البسيطة مثل "انتقل إلى النموذج السريع إذا كان النص أقل من 20 كلمة" هي أيضًا دليل ولا تجلب أي تكلفة رمزية إضافية. جرب القاعدة أولاً.

ربط الاختيار بالأدلة: مجموعة التقييم الصغيرة

لا تختار نموذجًا بناءً على "يبدو أفضل بالنسبة لي". التقييم (مجموعة التقييم) عبارة عن مجموعة صغيرة من العينات التي تُعرف الإجابة الصحيحة عنها؛ تقوم بتشغيل كل نموذج في هذه المجموعة وقياس الدقة والتكلفة ووقت الاستجابة.

# قالب إعداد التقييم 1) اجمع 20-50 مثالًا حقيقيًا، واكتب "الإجابة الصحيحة" يدويًا على كل منها. 2) قم بتشغيل كل نموذج (سريع/متوازن/قوي) في هذه المجموعة. 3) لكل نموذج: عدد التصحيحات، متوسط ​​رموز الإنتاجية، التكلفة لكل طلب، متوسط ​​الوقت. 4) اختر النموذج الذي "يعطي دقة كافية أرخص".

# نموذج جدول المقارنة التقييمية (ملء) | دقة | التكلفة لكل طلب | متوسط ​​المدةهايكو | ...% | ... $ | ... سنسونيت | ...% | ... $ | ... snOpus | ...% | ... $ | ...ثانية

موجه ضعيف / موجه قوي (قرار اختيار النموذج)

# ضعيف (لا يوجد أساس لاتخاذ القرار) فلنستخدم النموذج الأفضل، الميزانية ليست مهمة.

# قوي (قرار يعتمد على القياس) في تقييم 50 عينة، أعطى Haiku دقة بنسبة 96%، وأعطت Sonnet دقة 97%؛ الفرق غير مهم إحصائيا. تم اختيار Haiku لأنه أرخص بخمس مرات وأسرع مرتين. إذا انخفضت الدقة إلى أقل من 95%، فسيتم اتخاذ قرار الترقية إلى Sonnet تلقائيًا.

نسخة قوية؛ يربط التحديد برقم وعتبة وقاعدة تصعيد. وهذا يدافع عن قرار اليوم ويدير التغيير المستقبلي.

ثلاث حالات صغيرة

الحالة 1 - الهروب من النموذج المهيمن. كان مركز الاتصال ينتج جميع ملخصات المحادثات مع Opus؛ الفاتورة الشهرية كانت مرتفعة. عند تقييم 40 عينة، كانت Sonnet متأخرة بنسبة 1% عن Opus من حيث الدقة ولكنها تكلفت الثلث. قاموا بنقل العمل التلخيصي إلى السوناتة؛ انخفضت التكلفة الشهرية من 9000 دولار إلى 3100 دولار، مع عدم وجود شكاوى حول الجودة.

الحالة 2 - حركة مرور مختلطة مع إعادة التوجيه. 80% من طلبات فريق التكنولوجيا القانونية كانت عبارة عن علامات بسيطة على المستندات، و20% عبارة عن تحليل عقود معقد. لقد كانوا يرسلونهم جميعًا إلى النموذج القوي. لقد أضافوا جهاز توجيه رخيصًا ووزعوا وظائف بسيطة على Haiku ووظائف معقدة على Opus؛ انخفض متوسط ​​تكلفة الطلب بنسبة 64%، مع الحفاظ على جودة التحليل.

الحالة 3 - تكلفة التقليص دون قياس. ولتقليل التكلفة، قام أحد الفرق بتقليص استخراج الكود الطبي المعقد مباشرةً إلى النموذج السريع؛ لم يقيموا. في البث المباشر، انخفضت الدقة من 92% إلى 78%، مما أدى إلى عودة استنتاجات غير صحيحة. كان عليهم التقييم أولاً: تلك المهمة تتطلب النموذج القوي. الدرس: التصغير والرفع يتم بالقياس.

الأخطاء الشائعة

  • منعكس "النموذج الأقوى": الإسراف والتأخير غير الضروري في المهام البسيطة.
  • تغيير النموذج دون قياس: يعتبر كل من التخفيض والتكبير محفوفين بالمخاطر دون تقييم.
  • القفل في نموذج واحد: غالبًا ما يكون التوجيه في حركة المرور المختلطة أكثر كفاءة.
  • أخطأ دائمًا في الخلط بين جهاز التوجيه وLLM: يمكن أن تعمل القواعد البسيطة دون أي تكلفة.
  • عدم تحديد حد التعزيز: ماذا يحدث إذا كان يجب تحديد انخفاض الدقة مسبقًا.
  • عدم إصلاح إصدار النموذج: سجل النموذج/الإصدار الذي تعمل عليه في الإنتاج؛ قد يؤدي تغيير الإصدار إلى تغيير السلوك.

أعمق: إدامة التقييم والمحاكمة التزايدية

اختيار النموذج ليس قرارًا لمرة واحدة. يقدم مقدمو الخدمة نماذج جديدة، وتتغير الأسعار، ويتطور وصف وظيفتك. لذا قم بإعداد مجموعة التقييم مرة واحدة ولا تنس؛ الاحتفاظ بها مثل كائن حي. عندما يظهر نموذج جديد، يمكنك تشغيل نفس العينات من 20 إلى 50 عينة من خلاله، وتحديث الجدول، واتخاذ قرارك مرة أخرى. وهذا يحميك من فخ "حدس تبديل النمط".

التقنية المتقدمة الثانية هي النمط الاحتياطي / المتتالي. أنت تعطي المهمة للنموذج الرخيص أولاً؛ إذا كانت ثقة المخرجات منخفضة أو رفضته طبقة التحقق (الوحدة 11)، فيمكنك تصعيد نفس الطلب. لذلك يتم حل معظم حركة المرور على النموذج الرخيص، مع انتقال الأقلية المتبقية إلى النموذج الباهظ الثمن. وهذا أرخص وأكثر متانة من نهج النموذج الفردي الثابت.

النقطة الثالثة هي أن التقييم لا يشمل الدقة فحسب، بل يشمل أيضًا التكلفة وزمن الوصول. إذا كان النموذج أكثر دقة بنسبة 1% ولكنه أكثر تكلفة بثلاث مرات وأبطأ مرتين، فإن المقايضة لا تستحق العناء بالنسبة لمعظم الوظائف. اتخذ القرار على ثلاثة محاور (الدقة، التكلفة، زمن الوصول) وحدد "عتبة الاكتفاء": "إذا كانت الدقة أعلى من 95%، فاختر الأرخص".

وأخيرًا، قم بتسجيل النموذج/الإصدار الذي استخدمته في الإنتاج. إذا تغيرت جودة الإخراج يومًا ما، فإن أول شيء ستنظر إليه هو ما إذا كان إصدار النموذج قد تغير. تعمل إمكانية تتبع الإصدار على تسهيل العثور على السبب الجذري لمشكلات الجودة.

تحذير آخر: يجب أن تمثل مجموعة التقييم عبء العمل الفعلي لديك. إن التقييم الذي يتكون من أمثلة سهلة فقط يخفي حيث يتعثر النموذج في الحالات الصعبة ويمنحك ثقة زائفة. تقييم جيد ويتضمن أمثلة سهلة شائعة بالإضافة إلى حالات ركنية تواجهها في الواقع (مدخلات غامضة وغير كاملة ومتناقضة). هذه الأقلية الصعبة هي التي تحدد اختيارك للنموذج، لأن كل نموذج ينجح في الأغلبية السهلة على أية حال. حافظ على تقييمك متجددًا وممثلًا عن طريق تغذيته دوريًا بأمثلة حقيقية جديدة.

باختصار

النموذج الصحيح هو النموذج الأخف الذي ينجز المهمة؛ الأقوى ليس هو الأفضل في كل وظيفة، بل هو أكثر تكلفة وأبطأ. يؤدي تصنيف المهمة والبدء من المرشح الأخف، وتوزيع حركة المرور المختلطة مع التوجيه، وإثبات الاختيار بمجموعة صغيرة من التقييمات إلى تقليل التكلفة عدة مرات مع الحفاظ على الجودة.

مهمة التطبيق

اختر عبء العمل. (1) تصنيف المهمة إلى بسيطة / معقدة. (2) صمم مجموعة تقييم صغيرة مكونة من 20 مثالاً حقيقياً (مع إجاباتها الصحيحة). (3) ضع خطة لملء جدول مقارنة الدقة/التكلفة/الوقت لفئات النماذج الثلاثة. (4) إذا كانت لديك حركة مرور مختلطة، فاكتب قاعدة توجيه وقم بتعيين حد التصعيد.

قائمة مرجعية

  • [ ] يمكنني مقارنة عائلة الطراز على محور القدرة/السرعة/التكلفة.
  • [ ] يمكنني تطبيق مبدأ "أخف نموذج ناجح".
  • [ ] يمكنني إعداد توجيه النموذج وفقًا لتعقيد المهمة.
  • [ ] مع مجموعة صغيرة من التقييم يمكنني ربط الاختيار بالأدلة.
  • [ ] يمكنني تحديد حد الترقية/خفض الرتبة.