एकाइ 5 / 11

मोडेल चयन: सही कामको लागि सही मोडेल

लाभ:

  • क्षमता, गति र लागत मा मोडेल परिवार (छिटो / सन्तुलित / शक्तिशाली) तुलना गर्न सक्नुहुन्छ
  • कार्य जटिलता अनुसार मोडेल चयन र मार्ग रणनीतिहरू डिजाइन गर्दछ
  • इभलहरूको सानो सेटको साथ प्रमाणमा आधार मोडेल चयन

LLM एकीकरणमा तपाइँको पैसा र गुणस्तरको लागि तपाइँको सबैभन्दा ब्यांग निर्धारण गर्ने एकल निर्णय तपाइँ कुन मोडेल प्रयोग गर्नुहुन्छ। सामान्य रिफ्लेक्स "बलियो मोडेल छान्नुहोस्" हो; यद्यपि, यसको अर्थ अक्सर अनावश्यक लागत र ढिलाइ हुन्छ। सही दृष्टिकोण भनेको सबैभन्दा हल्का मोडेल छनोट गर्नु हो जसले प्रत्येक कार्यलाई पूरा गर्दछ र त्यो छनौटलाई मापनमा आधारित गर्दछ, अनुमानमा होइन। यस एकाइमा, तपाईंले क्षमता/गति/लागत अक्षमा मोडेल परिवारको तुलना गर्नुहुनेछ, कार्य जटिलता अनुसार मोडेल राउटिंग रणनीति स्थापना गर्नुहुनेछ, र मूल्याङ्कनहरूको सानो सेटको साथ चयनको प्रमाण दिनुहुनेछ।

मोडेल परिवार बुझ्दै

प्रदायकहरूले सामान्यतया तीन वर्गहरू प्रस्ताव गर्छन्: छिटो/सस्तो, स्थिर र शक्तिशाली। तिनीहरू बीचको सम्बन्ध तीन अक्षहरूमा संक्षेप गरिएको छ: क्षमता (कठीन कार्यहरू समाधान गर्ने शक्ति), गति (विलम्बता), लागत (टोकन मूल्य)।

कक्षा

उदाहरण

प्रतिभा

गति

लागत

उपलब्ध कार्यहरू

छिटो

हाइकु ४.५

मध्यम

धेरै उच्च

कम

वर्गीकरण, लेबलिंग, संक्षिप्त सारांश, अभिमुखीकरण

सन्तुलित

सनेट ५

उच्च

उच्च

मध्यम

सामान्य उद्देश्य, कोडिङ, बहु-चरण प्रवाह, धेरै एजेन्ट काम

बलियो

ओपस ४.८

उच्चतम

मध्यम

उच्च

जटिल तर्क, लामो दूरीको स्वायत्त कार्यहरू, कठिन विश्लेषण

आलोचनात्मक अन्तरदृष्टि: अधिक शक्तिशाली मोडेलले हरेक काममा राम्रो प्रदर्शन गर्दैन। साधारण "अत्यावश्यक वा होइन" लेबलिङमा, बलियो मोडेल र द्रुत मोडेलले एउटै सही जवाफ दिन्छ; फरक यति मात्र हो कि शक्तिशाली ५ गुणा महँगो र ढिलो हुन्छ। मिशनको आवश्यकता पर्दा मात्र अतिरिक्त प्रतिभाले मूल्य उत्पादन गर्छ।

चरण द्वारा चरण: एक मोडेल कसरी छनौट गर्ने?

  1. कार्य वर्गीकरण गर्नुहोस्। के यो नियमित/प्याटर्न गरिएको (लेबलिङ, अनुमान), वा खुला-अन्त/बहु-चरण (विश्लेषण, योजना, कोड)?
  2. सबैभन्दा हल्का उम्मेद्वारको साथ सुरु गर्नुहोस्। छिटो मोडेलको साथ प्रयास गर्नुहोस्। यदि पर्याप्त छ भने, रोक्नुहोस्।
  3. यदि यो पर्याप्त छैन भने, उच्च कक्षामा जानुहोस्। यदि सटीकता कम छ भने, सन्तुलितमा जानुहोस्, यदि त्यो पर्याप्त छैन भने, बलियोमा जानुहोस्।
  4. मापन गर्नुहोस्, अनुमान नगर्नुहोस्। प्रत्येक उम्मेद्वारको शुद्धता र लागतलाई इभलको सानो सेट (तल) सँग तुलना गर्नुहोस्।
  5. पुनर्निर्देशन सेट अप गर्नुहोस्। एकल मोडेलमा जडान गर्नुको सट्टा, "राउटर" को साथ सही मोडेलमा कार्य वितरण गर्नुहोस्।

मोडेल रूटिङ

वास्तविक कार्यभारहरू मिश्रित छन्: धेरै आगमन अनुरोधहरू सरल छन्, केही गाह्रो छन्। ती सबैलाई शक्तिशाली मोडेलमा पठाउनु बेकार हो; ती सबैलाई द्रुत मोडेलमा पठाउँदा गुणस्तर घटाउँछ। रूटिङले यसलाई समाधान गर्छ: सस्तो मोडेल (वा साधारण नियम) पहिले कार्य वर्गीकरण गर्छ, त्यसपछि काम उपयुक्त मोडेलमा जान्छ।

# राउटर प्रम्प्ट (सस्तो मोडेलको साथ काम गर्दछ) आगमन अनुरोधलाई यसको कठिनाई अनुसार वर्गीकृत गर्नुहोस्। निम्न JSON मात्र फर्काउनुहोस्:{"कठिनाई": "सरल|जटिल"}सरल: एकल-चरण, सूत्रीय, छोटो-उत्तर। जटिल: बहु-चरण तर्क, विश्लेषण, वा लामो पुस्ता आवश्यक छ। अनुरोध: """{{अनुरोध}}"""

  • सरल → छिटो मोडेलमा जानुहोस् (सस्तो, छिटो)।
  • जटिल → शक्तिशाली मोडेलमा जानुहोस् (महंगा तर आवश्यक)।

यो ढाँचाले औसत लागतलाई उल्लेखनीय रूपमा घटाउँछ किनभने धेरै जसो ट्राफिक सामान्यतया सरल हुन्छ।

सुझाव: रेफरल निर्णयलाई सधैं LLM आवश्यक पर्दैन। "पाठ 20 शब्दहरू भन्दा कम भएमा छिटो मोडेलमा जानुहोस्" जस्ता सरल नियमहरू पनि मार्गदर्शक हुन् र शून्य अतिरिक्त टोकन लागत ल्याउँछन्। पहिले नियम प्रयास गर्नुहोस्।

प्रमाणमा छनौट लिंक गर्दै: सानो इभल क्लस्टर

"यो मलाई राम्रो देखिन्छ" मा आधारित मोडेल छनौट नगर्नुहोस्। Eval (मूल्याङ्कन सेट) नमूनाहरूको सानो सेट हो जसको लागि सही उत्तर थाहा हुन्छ; तपाइँ यस सेटमा प्रत्येक मोडेल चलाउनुहुन्छ र शुद्धता, लागत, र विलम्बता मापन गर्नुहुन्छ।

# Eval सेटअप टेम्प्लेट1) 20-50 वास्तविक उदाहरणहरू सङ्कलन गर्नुहोस्, प्रत्येकमा "सही जवाफ" हातले लेख्नुहोस्।

# Eval तुलना तालिका (भर्नुहोस्) मोडेल | शुद्धता | प्रति अनुरोध लागत | औसत अवधि हाइकु | ...% | ... $ | ... snSonnet | ...% | ... $ | ... snOpus | ...% | ... $ | ...सेकेन्ड

कमजोर प्रम्प्ट / बलियो प्रम्प्ट (मोडेल चयन निर्णय)

# कमजोर (निर्णयको कुनै आधार छैन) उत्तम मोडल प्रयोग गरौं, बजेट महत्त्वपूर्ण छैन।

# स्ट्रङ्ग (मापनमा आधारित निर्णय) ५० वटा नमूनाहरूको तुलनामा हाइकुले ९६% सटीकता दियो, सनेटले ९७% शुद्धता दियो; भिन्नता सांख्यिकीय रूपमा नगण्य छ। हाइकु ५ गुणा सस्तो र २ गुणा छिटो भएकाले छनोट गरिएको हो । यदि शुद्धता 95% भन्दा कम छ भने, Sonnet मा स्तरवृद्धि गर्ने निर्णय स्वतः बनाइनेछ।

शक्तिशाली संस्करण; चयनलाई संख्या, थ्रेसहोल्ड र एस्केलेसन नियममा बाँध्छ। यसले आजको निर्णयको रक्षा गर्छ र भविष्यको परिवर्तनलाई प्रबन्ध गर्दछ।

तीन मिनी केसहरू

केस १ - अति शक्तिशाली मोडेलबाट बच्नुहोस्। एउटा कल सेन्टरले ओपससँग सबै कुराकानी सारांशहरू उत्पादन गरिरहेको थियो; मासिक बिल धेरै थियो। 40-नमूना eval मा, Sonnet शुद्धता मा Opus 1% पछि थियो तर लागत एक तिहाई थियो। तिनीहरूले संक्षिप्त कार्यलाई सनेटमा सारियो; मासिक लागत $ 9,000 बाट $ 3,100 मा घट्यो, कुनै गुणस्तर गुनासो बिना।

केस २ - रिडिरेक्शनको साथ मिश्रित ट्राफिक। कानूनी प्राविधिक टोलीका 80% अनुरोधहरू साधारण कागजात ट्यागिङ थिए, 20% जटिल सम्झौता विश्लेषण थिए। तिनीहरूले ती सबै शक्तिशाली मोडेलमा पठाउँदै थिए। तिनीहरूले सस्तो राउटर थपे र हाइकुमा साधारण कामहरू र ओपसमा जटिल कामहरू वितरण गरे। औसत अनुरोध लागत 64% ले घट्यो, जबकि विश्लेषण गुणस्तर कायम राखिएको थियो।

केस 3 - मापन बिना आकार घटाउने लागत। लागत घटाउनको लागि, एउटा टोलीले जटिल मेडिकल कोड निकासीलाई सीधा द्रुत मोडेलमा घटायो; तिनीहरूले मूल्याङ्कन गरेनन्। प्रत्यक्षमा, शुद्धता 92% बाट 78% मा घट्यो, परिणामस्वरूप गलत निष्कर्षहरू फिर्ता भयो। तिनीहरूले पहिले मूल्याङ्कन गर्नुपर्छ: त्यो कार्य शक्तिशाली मोडेल आवश्यक थियो। पाठ: घटाउने र उचाइ दुवै मापन द्वारा गरिन्छ।

सामान्य गल्तीहरू

  • "बलियो मोडेल" रिफ्लेक्स: अपशिष्ट र साधारण कार्यहरूमा अनावश्यक ढिलाइ।
  • मापन नगरी मोडेल परिवर्तन गर्दै: घटाउने र विस्तार गर्ने दुबै जोखिमपूर्ण छन्।
  • एकल मोडेलमा लक गर्दै: मिश्रित ट्राफिकमा रूटिङ प्रायः अधिक कुशल हुन्छ।
  • LLM का लागि राउटरलाई सधैं गल्ती गर्दै: सरल नियमहरूले शून्य लागतमा काम गर्न सक्छ।
  • बूस्ट थ्रेसहोल्ड सेट गर्दैन: के हुन्छ यदि सटीकता ड्रप अग्रिम परिभाषित गरिनु पर्छ।
  • मोडेल संस्करण फिक्स गर्दैन: तपाईले उत्पादनमा काम गरिरहनुभएको मोडेल/संस्करण रेकर्ड गर्नुहोस्; संस्करण परिवर्तन व्यवहार परिवर्तन हुन सक्छ।

गहिरो: स्थायी Eval र वृद्धिशील परीक्षण

मोडेल छनोट एक पटकको निर्णय होइन। प्रदायकहरूले नयाँ मोडेलहरू प्रस्तुत गर्छन्, मूल्यहरू परिवर्तन हुन्छन्, तपाईंको कामको विवरण विकसित हुन्छ। त्यसैले एक पटक eval क्लस्टर सेटअप गर्नुहोस् र नबिर्सनुहोस्; यसलाई जीवित प्राणी जस्तै राख्नुहोस्। जब एउटा नयाँ मोडेल बाहिर आउँछ, तपाइँ त्यस मार्फत 20-50 नमूनाहरू चलाउनुहोस्, तालिका अपडेट गर्नुहोस्, र तपाइँको निर्णय फेरि लिनुहोस्। यसले तपाईंलाई "ढाँचा-स्विचिंग अन्तर्ज्ञान" जालबाट जोगाउँछ।

दोस्रो उन्नत प्रविधि फलब्याक / क्यास्केड ढाँचा हो। तपाईंले पहिले सस्तो मोडेललाई कार्य दिनुहुन्छ; यदि आउटपुटमा कम विश्वास छ वा प्रमाणिकरण तह (एकाइ 11) ले यसलाई अस्वीकार गर्छ भने, तपाइँ उही अनुरोधलाई बढाउनुहुन्छ। त्यसैले धेरैजसो ट्राफिक सस्तो मोडेलमा समाधान हुन्छ, बाँकी अल्पसंख्यकहरू महँगो मोडेलमा जान्छ। यो निश्चित एकल मोडेल दृष्टिकोण भन्दा सस्तो र अधिक टिकाउ छ।

तेस्रो बिन्दु यो हो कि eval मा सटीकता मात्र होइन लागत र विलम्बता पनि समावेश छ। यदि मोडेल 1% बढी सटीक छ तर 3 गुणा बढी महँगो र 2 गुणा ढिलो छ भने, धेरैजसो कामहरूको लागि ट्रेड-अफ यसको लायक छैन। तीनवटा अक्षहरूमा निर्णय गर्नुहोस् (सटीकता, लागत, विलम्बता) र "पर्याप्तता सीमा" परिभाषित गर्नुहोस्: "यदि शुद्धता 95% भन्दा माथि छ भने, सस्तो छनौट गर्नुहोस्।"

अन्तमा, तपाईंले उत्पादनमा प्रयोग गर्नुभएको मोडेल/संस्करण रेकर्ड गर्नुहोस्। यदि एक दिन आउटपुट गुणस्तर परिवर्तन हुन्छ, तपाईले हेर्नुहुनेछ कि पहिलो कुरा मोडेल संस्करण परिवर्तन भएको छ कि छैन। संस्करण ट्रेसेबिलिटीले गुणस्तर समस्याहरूको मूल कारण पत्ता लगाउन छिटो बनाउँछ।

एउटा थप चेतावनी: eval क्लस्टरले तपाईंको वास्तविक कार्यभारलाई प्रतिनिधित्व गर्नुपर्छ। सजिलो उदाहरणहरू मात्र समावेश भएको एउटा इभल लुकाउँछ जहाँ मोडेलले कठिन परिस्थितिहरूमा ठोकर खान्छ र तपाईंलाई झूटो विश्वासमा लुकाउँछ। एक राम्रो eval; यसमा सामान्य सरल उदाहरणहरू साथै तपाईंले वास्तविकतामा सामना गर्नुहुने कुना केसहरू समावेश गर्दछ (अस्पष्ट, अपूर्ण, विरोधाभासी इनपुटहरू)। यो कठिन अल्पसंख्यकले तपाइँको मोडेल छनोट निर्धारण गर्दछ, किनकि हरेक मोडेल जे भए पनि सजिलो बहुमतमा सफल हुन्छ। समय समयमा यसलाई नयाँ वास्तविक उदाहरण खुवाएर आफ्नो Eval ताजा र प्रतिनिधि राख्नुहोस्।

संक्षेपमा

सही मोडेल सबैभन्दा हल्का मोडेल हो जसले काम गर्छ; अधिक शक्तिशाली हरेक काम मा राम्रो छैन, यो केवल अधिक महँगो र ढिलो छ। कार्यको वर्गीकरण गर्ने र सबैभन्दा हल्का उम्मेदवारबाट सुरु गर्ने, राउटिङको साथ मिश्रित ट्राफिक वितरण गर्ने, र इभालहरूको सानो सेटको साथ चयनलाई प्रमाणित गर्नाले गुणस्तर कायम राख्दा लागत धेरै पटक घटाउँछ।

आवेदन कार्य

कार्यभार छान्नुहोस्। (१) कार्यलाई सरल/जटिलको रूपमा वर्गीकरण गर्नुहोस्। (2) 20 वास्तविक उदाहरणहरू (तिनीहरूको सहि उत्तरहरू सहित) को सानो इभल सेट डिजाइन गर्नुहोस्। (३) तीनवटा मोडेल कक्षाहरूको लागि शुद्धता/लागत/समय तुलना तालिका भर्ने योजना बनाउनुहोस्। (४) यदि तपाइँसँग मिश्रित ट्राफिक छ भने, एक मार्ग नियम लेख्नुहोस् र एस्केलेसन थ्रेसहोल्ड सेट गर्नुहोस्।

चेकलिस्ट

  • [] म मोडेल परिवारलाई क्षमता/गति/लागत अक्षमा तुलना गर्न सक्छु।
  • [ ] म "सबैभन्दा हल्का सफल मोडेल" सिद्धान्त लागू गर्न सक्छु।
  • [] म कार्य जटिलता अनुसार मोडेल रूटिङ सेटअप गर्न सक्छु।
  • [ ] eval को एक सानो सेट संग म प्रमाण को लागी चयन बाँध्न सक्छु।
  • [] म अपग्रेड/डिमोसन थ्रेसहोल्ड परिभाषित गर्न सक्छु।