इकाई 2 / 11

टोकन और मूल्य निर्धारण तर्क

लाभ:

  • टोकन, इनपुट/आउटपुट टोकन भेद और टोकनाइजेशन की अवधारणा को समझाएं।
  • टोकन की संख्या और इकाई मूल्य से अनुरोध की लागत और मासिक कार्यभार की गणना कर सकते हैं
  • लागत पर मॉडल चयन और शीघ्र लंबाई के प्रभाव की तुलना कर सकते हैं

आप एलएलएम एपीआई के अर्थशास्त्र को समझे बिना बड़े पैमाने पर समाधान नहीं बना सकते। एक डेमो एक बार चलता है; मुख्य बात यह अनुमान लगाने में सक्षम होना है कि प्रति माह हजारों कॉल आने पर बिल कितना होगा। इस इकाई में हम चीजों के धन पक्ष को स्थापित करते हैं: टोकन क्या है, इनपुट और आउटपुट की कीमत अलग-अलग क्यों होती है, अनुरोध की लागत की गणना कैसे करें, और मासिक कार्यभार का बजट कैसे बनाएं। यह जानकारी आपको बाद की इकाइयों में अनुकूलन तकनीकों (कैशिंग, मॉडल चयन, बैच) की वापसी को मापने की अनुमति देती है।

टोकन क्या है?

टोकन सबसे छोटी इकाई है जिसमें मॉडल टेक्स्ट को प्रोसेस करता है। एक शब्द हमेशा एक संकेत नहीं होता; टोकन आमतौर पर किसी शब्द का एक हिस्सा होता है। मोटे तौर पर, अंग्रेजी में, 1 टोकन ≈ 4 अक्षर ≈ 0.75 शब्द है। तुर्की और कोड में, अनुपात भिन्न होता है: तुर्की शब्द अक्सर अपनी प्रत्यय संरचना और वर्णमाला के कारण अंग्रेजी की तुलना में अधिक टोकन में विभाजित होते हैं। इसलिए, आंख से अनुमान लगाने के बजाय प्रदाता के टोकन गिनती उपकरण से टोकन की संख्या को मापना आवश्यक है।

टोकनाइजेशन (पाठ को टोकन में विभाजित करने की प्रक्रिया) प्रत्येक मॉडल के लिए भिन्न हो सकती है। इसके दो व्यावहारिक परिणाम हैं: (1) एक ही पाठ से विभिन्न मॉडलों में अलग-अलग संख्या में टोकन प्राप्त हो सकते हैं; (2) अन्य प्रदाताओं (उदाहरण के लिए ओपनएआई की टिकटोकन लाइब्रेरी) के टोकननाइज़र के साथ की गई भविष्यवाणियां क्लाउड के लिए गलत होंगी - आप जिस मॉडल का उपयोग कर रहे हैं उसके लिए टोकन गिनती टिप का उपयोग करें।

संकेत: "कितने टोकन के बारे में?" प्रश्न का आँख मूँद कर उत्तर न दें। टोकन गिनती एपीआई के माध्यम से एक प्रतिनिधि पाठ पास करें; माप के आधार पर बजट निर्णय।

इनपुट और आउटपुट टोकन

चालान में दो आइटम शामिल हैं:

  • इनपुट टोकन: जो कुछ भी आप मॉडल को भेजते हैं - सिस्टम प्रॉम्प्ट, पिछले दौरे, उपयोगकर्ता संदेश, दस्तावेज़ीकरण यदि कोई हो। इन्हें एक ही बार में संसाधित किया जाता है।
  • आउटपुट टोकन: मॉडल द्वारा उत्पन्न प्रतिक्रिया। प्रत्येक आउटपुट टोकन के लिए, मॉडल चरण दर चरण गणना करता है।

अधिकांश प्रदाताओं के लिए, आउटपुट इनपुट से कई गुना अधिक महंगा है। कारण सरल है: टोकन-दर-टोकन आउटपुट उत्पन्न करने की तुलना में इनपुट को एक बार में पढ़ना सस्ता है। इस विषमता को जानने से पता चलता है कि "संक्षिप्त उत्तरों की आवश्यकता" जैसे अनुकूलन इतने प्रभावी क्यों हैं।

नमूना मूल्य (प्रति 1 मिलियन टोकन, यूएसडी)

नीचे दी गई तालिका एक संदर्भ है; समय के साथ कीमतें बदल सकती हैं, कृपया अपने प्रदाता की वर्तमान सूची की पुष्टि करें।

मॉडल वर्ग

नमूना मॉडल

इनपुट ($/1M)

आउटपुट ($/1M)

विशिष्ट उपयोग

तेज़/सस्ता

हाइकु 4.5

1.00

5.00

वर्गीकरण, लेबलिंग, सरल सारांश

संतुलित

सॉनेट 5

3.00

15.00

सामान्य प्रयोजन, कोडिंग, एजेंट कार्य

मजबूत

ओपस 4.8

5.00

25.00

जटिल तर्क, लंबी दूरी के कार्य

प्रत्येक कक्षा में, आउटपुट इनपुट का 5 गुना है; इसके अलावा, शक्तिशाली मॉडल का इनपुट भी सस्ते मॉडल के इनपुट से 5 गुना अधिक है। ये दो अक्ष (इनपुट↔आउटपुट और मॉडल वर्ग) आपके लागत निर्णयों की रूपरेखा बनाते हैं।

लागत की गणना कैसे करें?

सूत्र सरल है:

लागत = (इनपुट_टोकन / 1,000,000) × इनपुट_प्राइस + (आउटपुट_टोकन / 1,000,000) × आउटपुट_प्राइस

नमूना खाता. सॉनेट 5 के साथ एक अनुरोध: 1,500 इनपुट टोकन, 400 आउटपुट टोकन।

इनपुट = 1,500 / 1,000,000 × 3.00 = $0.0045 आउटपुट = 400 / 1,000,000 × 15.00 = $0.0060 कुल = $0.0105 (लगभग 1 सेंट)

एक कॉल सस्ती लगती है. लेकिन मात्रा से गुणा करें: प्रति दिन 20,000 कॉल → $210 प्रति दिन, ~$6,300 प्रति माह। यहीं पर पैमाना काम आता है।

मासिक बजट टेम्पलेट

कार्यभार की मासिक लागत निकालने के लिए, इस टेम्पलेट का उपयोग करें:

1) प्रति अनुरोध औसत इनपुट टोकन: ......2) प्रति अनुरोध औसत आउटपुट टोकन: ......3) प्रति दिन अनुरोधों की संख्या: ......4) प्रति माह काम किए गए दिन: ......5) प्रति अनुरोध लागत = (1)/1एम×इनपुट_प्राइस + (2)/1एम×आउटपुट_प्राइस6) मासिक लागत = (5) × (3) × (4)

इस पैटर्न को एक स्प्रेडशीट में डालना और यह देखना कि जब आप मॉडल बदलते हैं तो योग कैसे निकलता है, मॉडल चयन (यूनिट 5) और कैश (यूनिट 6) निर्णयों का प्रतीक है।

प्रतिलिपि योग्य टेम्पलेट्स के साथ प्रॉम्प्ट को छोटा करना

अधिकांश लागत अनावश्यक रूप से लंबे संकेतों और बर्बाद आउटपुट से आती है। नीचे दिए गए टेम्पलेट प्रत्यक्ष बचत प्रदान करते हैं।

# आउटपुट लंबाई सीमित करें. अधिकतम 3 आइटमों के साथ उत्तर दें। एक तर्क या परिचयात्मक वाक्य जोड़ें.

# केवल अनुरोधित फ़ील्ड लौटाएँ केवल निम्नलिखित JSON लौटाएँ, कोई अन्य पाठ न जोड़ें: {"श्रेणी": "...", "तत्कालता": "निम्न|मध्यम|उच्च"}

# अनावश्यक संदर्भ हटाएं, निम्नलिखित पाठ से केवल दिनांक और राशि हटाएं। संपूर्ण पाठ को न दोहराएं। पाठ: """{{पाठ}}"""

# लंबे भाषण को सारांशित करें (इनपुट बचत) इस भाषण को 5 आइटमों में सारांशित करें। मैं आगामी दौरों में पूर्ण अतीत के स्थान पर इस सारांश का उपयोग करूँगा। भाषण: """{{अतीत}}"""

कमजोर प्रॉम्प्ट/मजबूत प्रॉम्प्ट (लागत के संदर्भ में)

# WEAK (आउटपुट जारी करता है, महंगा) इस समर्थन अनुरोध का विश्लेषण करें और मुझे एक व्यापक समीक्षा लिखें।

# मजबूत (उत्पादन में बाधा, सस्ता और पूर्वानुमान योग्य) इस समर्थन अनुरोध को वर्गीकृत करें। बस निम्नलिखित JSON लौटाएँ:

कमजोर संस्करण शायद 500 आउटपुट टोकन उत्पन्न करता है; मजबूत संस्करण ~15. क्योंकि आउटपुट महंगा है, यह प्रति कॉल एक महत्वपूर्ण अंतर है और वॉल्यूम के साथ कई गुना बढ़ जाता है।

तीन मिनी मामले

केस 1 - लॉन्ग प्रॉम्प्ट की छिपी हुई लागत। चूंकि लेखांकन स्वचालन ने प्रत्येक चालान को क्रमबद्ध किया, इसने प्रत्येक अनुरोध के लिए इनपुट के रूप में 40-पृष्ठ "नियम पुस्तिका" जोड़ी: प्रति अनुरोध ~ 12,000 इनपुट टोकन। सॉनेट 5 के साथ 12,000/1एम×3 = $0.036 अभी-अभी दर्ज किया गया है। 5,000 बिल प्रति दिन → $180 प्रति दिन। नियम पुस्तिका (यूनिट 6) को कैशिंग करने से इनपुट लागत ~90% कम हो गई।

केस 2 - मॉडल का आकार छोटा करने का लाभ। एक टीम ओपस 4.8: 300 इनपुट + 10 आउटपुट टोकन के साथ सरल "सकारात्मक/नकारात्मक" भावना टैगिंग कर रही थी। ओपस की लागत 300/1M×5 + 10/1M×25 = $0.00175। हाइकु पर स्विच करने पर, 300/1M×1 + 10/1M×5 = $0.00035 - 5x सस्ता, सटीकता में अंतर अथाह था। प्रति माह 3 मिलियन कॉल पर, अंतर $5,250 → $1,050 है।

केस 3 - आउटपुट जारी करना। जब कोई मार्केटिंग टीम उत्पाद विवरण तैयार करती है, तो वह आउटपुट पर कोई सीमा निर्धारित नहीं करती है; मॉडल ने कभी-कभी 1,500 टोकन कहा। जब मैंने "अधिकतम 60 शब्द" निर्देश जोड़ा, तो औसत आउटपुट 900 से गिरकर 90 टोकन हो गया। चूँकि छपाई महंगी थी, मासिक बिल एक तिहाई कम हो गया और पाठ अधिक उपयोगी हो गए।

सामान्य गलतियाँ

  • आँख से टोकन का अनुमान लगाना: आप विशेष रूप से तुर्की और कोड में गलत हो सकते हैं। उपाय।
  • यह मानते हुए कि इनपुट और आउटपुट समान हैं: आउटपुट आमतौर पर बहुत अधिक महंगा है; अधिकांश अनुकूलन आउटपुट को छोटा करने से आता है।
  • एक कॉल के सस्ते होने से मूर्ख मत बनो: निर्णय मात्रा के आधार पर किया जाता है। $0.01 × मिलियन = $10,000.
  • किसी अन्य प्रदाता के टोकननाइज़र के साथ भविष्यवाणी: गलत परिणाम देता है; मॉडल के टोकन गिनती उपकरण का उपयोग करें।
  • बातचीत के इतिहास का असीमित विस्तार: प्रत्येक दौर को प्रविष्टि में जोड़ा जाता है; लंबी बातचीत में सारांश प्रस्तुत करें।
  • `max_tokens` को अनावश्यक रूप से ऊंचा रखना: बजट योजना और कटौती के जोखिम को छुपाता है; यथार्थवादी मूल्य दें.

गहरा: संदर्भ विंडो और लंबी इनपुट लागत

यह देखना महत्वपूर्ण है कि कीमत केवल "प्रति अनुरोध" के बजाय "बातचीत के दौरान" कैसे बढ़ती है। मॉडल द्वारा संसाधित किए जा सकने वाले पाठ की कुल मात्रा को संदर्भ विंडो कहा जाता है; इनपुट और आउटपुट का योग इस विंडो में फिट होना चाहिए। आधुनिक मॉडल बहुत बड़ी विंडो (सैकड़ों हजारों, यहां तक ​​कि लाखों टोकन) की पेशकश करते हैं, लेकिन इसका मतलब यह नहीं है कि आप इसे "अनंत काल तक भर सकते हैं" - आप विंडो में जो कुछ भी डालते हैं उसे इनपुट के रूप में बिल किया जाता है।

लंबी बातचीत का जाल यह है: प्रत्येक नए दौर के साथ आप पूरा इतिहास फिर से भेजते हैं (इकाई 1 में राज्यविहीनता)। 20-दौर की बातचीत में, 20वें अनुरोध में इनपुट के रूप में पूरे पहले 19 राउंड शामिल होते हैं। इस प्रकार, जैसे-जैसे बातचीत लंबी होती जाती है, प्रति अनुरोध लागत रैखिक के बजाय संचयी रूप से बढ़ती है। एक एजेंट सहायक के साथ 50-दौर की बातचीत पहले दौर में इनपुट लागत को दर्जनों गुना बढ़ा सकती है।

इसे प्रबंधित करने के दो तरीके हैं। पहला रीकैप है: पुराने राउंड को एक रीकैप ब्लॉक में संपीड़ित करना, केवल अंतिम कुछ राउंड को कच्चा रखना। दूसरा है शीघ्र कैशिंग (इकाई 6): निश्चित संदर्भ को पूरी कीमत पर बार-बार संसाधित करने के बजाय कीमत के दसवें हिस्से पर पढ़ना। साथ में, वे लंबे, संदर्भ-गहन कार्यभार पर बिल को काफी कम कर देते हैं। इसलिए सांकेतिक अर्थशास्त्र पूरे सत्र के डिज़ाइन के बारे में है, एक भी अनुरोध के बारे में नहीं।

संक्षेप में

टोकन सबसे छोटी इकाई है जिसमें पाठ संसाधित किया जाता है; इनपुट और आउटपुट की कीमत अलग-अलग होती है, और आउटपुट अक्सर बहुत अधिक महंगा होता है। लागत इकाई मूल्य से गुणा किए गए टोकन की संख्या है, और वास्तविक निर्णय मात्रा द्वारा किया जाता है। प्रॉम्प्ट को छोटा करना, आउटपुट को सीमित करना और कार्य को पूरा करने वाले सबसे हल्के मॉडल को चुनना सबसे प्रत्यक्ष लीवर हैं जो लागत को कई गुना कम कर देते हैं।

आवेदन कार्य

अपना खुद का एक कार्य चुनें. (1) एक प्रतिनिधि संकेत के लिए इनपुट और अनुमानित आउटपुट टोकन की संख्या निर्धारित करें (यदि संभव हो तो टोकन गिनती उपकरण से मापें)। (2) तीन मॉडल वर्गों के लिए प्रति अनुरोध लागत की गणना करें। (3) अपने दैनिक अनुरोधों की संख्या का अनुमान लगाएं और तीन मॉडलों के लिए मासिक बजट प्राप्त करें। (4) आउटपुट को छोटा करने और अपेक्षित बचत को नोट करने के लिए एक निर्देश जोड़ें।

चेकलिस्ट

  • [ ] मैं टोकन की अवधारणा को समझा सकता हूं और टोकनीकरण मॉडल के आधार पर भिन्न होता है।
  • [ ] मुझे पता है कि इनपुट और आउटपुट टोकन की कीमत अलग-अलग क्यों होती है।
  • [ ] मैं सूत्र के साथ अनुरोध की लागत की गणना कर सकता हूं।
  • [ ] मैं एक टेम्पलेट का उपयोग करके कार्यभार के लिए मासिक बजट बना सकता हूं।
  • [ ] मैं एक उदाहरण के साथ आउटपुट और मॉडल कटौती को छोटा करने का लाभ दिखा सकता हूं।