इकाइयाँ
1. एआई प्रदाता पारिस्थितिकी तंत्र: मानचित्र, अवधारणाएं और 'कोई सर्वश्रेष्ठ मॉडल नहीं' 2. बंद वजन और खुला वजन: नियंत्रण, लागत और गोपनीयता का संतुलन 3. अमेरिकी दिग्गज गहराई में: एंथ्रोपिक, ओपनएआई, गूगल 4. अन्य मजबूत खिलाड़ी: मेटा, मिस्ट्रल, एक्सएआई, डीपसीक, कोहेयर 5. टोकन, कॉन्टेक्स्ट विंडो और मल्टीमॉडैलिटी: मॉडल का दिमाग कैसे काम करता है 6. मूल्य निर्धारण तर्क: सांकेतिक अर्थव्यवस्था और लागत-गुणवत्ता संतुलन 7. मॉडल स्तर और क्षमताएं: तर्क, गति, और छोटे/बड़े मॉडल चयन 8. डेटा संप्रभुता, केवीकेके/ईयू और गोपनीयता: आप डेटा किसे सौंपते हैं? 9. सही मॉडल चुनना: निर्णय वृक्ष और मॉडल पोर्टफोलियो 10. शुरू से अंत तक अनुप्रयोग: मूल्यांकन, सत्यापन, नैतिकता और सीमाएँ
इकाई 5 / 10

टोकन, कॉन्टेक्स्ट विंडो और मल्टीमॉडैलिटी: मॉडल का दिमाग कैसे काम करता है

लाभ:

  • रोजमर्रा की भाषा में टोकन, संदर्भ विंडो और मल्टीमॉडलिटी की अवधारणाओं को समझाने की क्षमता
  • निदान करें कि किसी कार्य के लिए व्यापक संदर्भ या बहुविधता की आवश्यकता है या नहीं
  • यह ध्यान में रखने की क्षमता कि ये अवधारणाएँ लागत और मॉडल चयन को कैसे प्रभावित करती हैं

अब तक हम प्रदाताओं और मॉडल प्रकारों से परिचित हैं। हालाँकि, सही मॉडल चयन के लिए, यह समझना भी आवश्यक है कि मॉडल "अंदर" कैसे काम करते हैं; क्योंकि कीमत, क्षमता और उपलब्धता निर्णय सभी तीन मुख्य अवधारणाओं पर निर्भर करते हैं: टोकन, संदर्भ विंडो और मल्टीमॉडैलिटी। कोई व्यक्ति जो इन अवधारणाओं को नहीं जानता है वह मूल्य पत्रक नहीं पढ़ सकता है और आश्चर्य नहीं कर सकता है कि "क्या यह दस्तावेज़ मॉडल में फिट होगा?" प्रश्न का उत्तर नहीं दे सकता और यह नहीं देख सकता कि दृश्य प्रसंस्करण कब आवश्यक है। इस इकाई के अंत तक, आप इन तीन अवधारणाओं को रोजमर्रा की भाषा में समझाने में सक्षम होंगे, यह पता लगा सकेंगे कि किसी कार्य के लिए व्यापक संदर्भ या बहुविधता की आवश्यकता है या नहीं, और लागत पर उनके प्रभाव को ध्यान में रख सकेंगे।

टोकन: वर्ड के बजाय मॉडल द्वारा प्रयुक्त इकाई

आर्टिफिशियल इंटेलिजेंस मॉडल टेक्स्ट को शब्द दर शब्द नहीं, बल्कि छोटे टुकड़ों में संसाधित करते हैं जिन्हें टोकन कहा जाता है। एक टोकन; यह एक शब्द, एक शब्द का हिस्सा, एक विराम चिह्न या एक स्थान हो सकता है। एक मोटा हिसाब लगाने के लिए: अंग्रेजी में, एक औसत टोकन लगभग चार अक्षर का होता है, और 100 शब्द लगभग 130-150 टोकन के होते हैं। तुर्की में, प्रत्यय और लंबे शब्दों के कारण यह दर थोड़ी अधिक हो सकती है; दूसरे शब्दों में, समान अर्थ वाला एक तुर्की पाठ अंग्रेजी की तुलना में थोड़ा अधिक टोकन लेता है।

यह जानना क्यों महत्वपूर्ण है? क्योंकि हर चीज का शुल्क लिया जाता है और टोकन में मापा जाता है। आपके द्वारा मॉडल को भेजा गया टेक्स्ट (इनपुट) और मॉडल द्वारा उत्पादित प्रतिक्रिया (आउटपुट) को अलग-अलग टोकन के रूप में गिना जाता है। आपका चालान और मॉडल की क्षमता दोनों टोकन में हैं।

युक्ति: किसी पाठ में कितने टोकन हैं इसका मोटा अनुमान लगाने के लिए, वर्णों की संख्या को चार से विभाजित करें। 4,000 अक्षर का ईमेल लगभग 1,000 टोकन के बराबर होता है। तुर्की में, सुरक्षित पक्ष पर बने रहने के लिए थोड़ा अधिक मान लें।

संदर्भ विंडो: मॉडल की "शॉर्ट टर्म मेमोरी"

संदर्भ विंडो टोकन की कुल मात्रा है जिसे मॉडल एक समय में ध्यान में रख सकता है। इस विंडो में इनपुट और आउटपुट एक साथ फिट होने चाहिए। इसे ऐसे समझें कि आप एक बार में मेज पर कितना कागज फैला सकते हैं: जो कागज मेज पर फिट नहीं बैठता वह उस समय आपकी दृष्टि के क्षेत्र से बाहर है।

यदि किसी मॉडल की संदर्भ विंडो 200,000 टोकन है, तो यह लगभग 150,000 शब्दों या कई मध्यम आकार की पुस्तकों के बराबर है। 1 मिलियन टोकन समग्र रूप से बहुत बड़े दस्तावेज़ों को संसाधित कर सकते हैं। आज कुछ शक्तिशाली मॉडल (उदाहरण के लिए क्लाउड ओपस 4.8 और सॉनेट 5) 10 लाख टोकन संदर्भ प्रदान करते हैं, जबकि हल्के मॉडल अक्सर छोटी खिड़कियों के साथ आते हैं (उदाहरण के लिए हाइकु 4.5 के लिए 200,000 टोकन)।

यह महत्वपूर्ण क्यों है? क्योंकि यदि कोई दस्तावेज़ संदर्भ विंडो में फिट नहीं होता है, तो मॉडल इसे एक साथ नहीं देख सकता है। आप 200,000 टोकन मॉडल को संपूर्ण रूप से 500 पेज का अनुबंध नहीं दे सकते; आप या तो दस्तावेज़ को भागों में विभाजित कर सकते हैं (जिससे भागों के बीच संबंध ख़त्म हो सकता है) या व्यापक संदर्भ वाला एक मॉडल चुनें।

सावधानी: प्रत्येक दस्तावेज़ को भरना बुद्धिमानी नहीं है क्योंकि यह सिर्फ इसलिए है क्योंकि संदर्भ विंडो बड़ी है। आप विंडो में जितने अधिक टोकन डालेंगे, उतना अधिक भुगतान करेंगे, और कभी-कभी मॉडल बहुत लंबे टेक्स्ट में मध्य विवरण को मिस कर सकता है। अक्सर केवल वही हिस्सा भेजना सस्ता और अधिक सटीक होता है जो काम करता है।

कॉन्टेक्स्ट विंडो एक निर्णय मानदंड है

खोज

अनुमानित आवश्यक संदर्भ

उचित स्तर

संक्षिप्त ईमेल प्रतिक्रिया

कई सौ टोकन

हल्का

एक पेज का सारांश

कई हजार टोकन

हल्का/संतुलित

40 पृष्ठ की रिपोर्ट विश्लेषण

~30,000 टोकन

संतुलित/मजबूत

300 पेज की अनुबंध समीक्षा

~250,000 टोकन

व्यापक सन्दर्भ के साथ सशक्त

एक साथ सैकड़ों दस्तावेज़ संसाधित करें

500,000+ टोकन

व्यापकतम सन्दर्भ

यह तालिका "कौन सा मॉडल?" प्रश्न का उत्तर देती है। यह दर्शाता है कि प्रश्न के भाग का उत्तर सीधे दस्तावेज़ के आकार से दिया गया है। छोटी नौकरियों के लिए बड़े संदर्भ वाला महंगा मॉडल खरीदना बर्बादी है; छोटी खिड़की वाला मॉडल बड़े दस्तावेज़ों के लिए अपर्याप्त है।

बहुविधता: पाठ से परे जाना

मल्टीमॉडैलिटी एक मॉडल की केवल टेक्स्ट ही नहीं, बल्कि कई प्रकार के डेटा (छवि, ऑडियो, कभी-कभी वीडियो) को संभालने की क्षमता है। यहां "मोडल" का अर्थ "डेटा प्रकार" है; मल्टीमॉडल का अर्थ है "कई प्रकार"।

  • केवल-पाठ मॉडल: केवल लिखित पाठ को पढ़ता और लिखता है।
  • मल्टीमॉडल मॉडल: किसी बिल की तस्वीर पढ़ सकता है, ग्राफ़ पर रुझान की व्याख्या कर सकता है, हस्तलिखित नोट को डिकोड कर सकता है, कभी-कभी वॉयस रिकॉर्डिंग को ट्रांसक्राइब कर सकता है।

यह महत्वपूर्ण क्यों है? क्योंकि आपके व्यवसाय की प्रकृति के लिए बहुविधता की आवश्यकता हो सकती है। एक लेखांकन टीम जो चालान छवियों से राशि निकालती है, एक ई-कॉमर्स टीम जो उत्पाद फ़ोटो को वर्गीकृत करती है, या एक बीमा टीम जो क्षति फ़ोटो का मूल्यांकन करती है, यह काम उस मॉडल के साथ नहीं कर सकती है जो केवल पाठ पढ़ता है। इन कार्यों के लिए दृश्य प्रसंस्करण आवश्यक है।

तीन यथार्थवादी मामले

केस 1 - टोकन लागत आश्चर्य। प्रत्येक ब्लॉग पोस्ट बनाते समय एक सामग्री टीम मॉडल को 20 पेज का "ब्रांड गाइड" दस्तावेज़ भी भेजती है। यह मार्गदर्शिका लगभग 15,000 टोकन की है। वे प्रति माह 2,000 लेख तैयार करते हैं; तो बस गाइड को बार-बार भेजने का मतलब है 30 मिलियन टोकन इनपुट। गाइड को छोटा करके और केवल संबंधित अनुभाग (लगभग 2,000 टोकन) भेजकर, वे इनपुट को एक-सातवें तक कम कर देते हैं और बिल को काफी कम कर देते हैं।

केस 2 - संदर्भ विंडो पर्याप्त नहीं है। एक कानूनी फर्म 280 पेज के विलय समझौते की समीक्षा कराना चाहती है। उन्होंने जो पहला मॉडल आज़माया उसमें 200,000 टोकन की बाइंडिंग थी और दस्तावेज़ फिट नहीं था; जब दस्तावेज़ को फाड़ दिया जाता है, तो मॉडल यह ध्यान नहीं दे पाता कि पहले खंड का एक लेख अंतिम खंड के एक लेख का खंडन करता है। जब यह 1 मिलियन टोकन संदर्भ वाले मॉडल पर स्विच करता है, तो यह दस्तावेज़ को समग्र रूप से पढ़ता है और विरोधाभास को पकड़ता है। यहां संदर्भ विंडो सीधे सटीकता निर्धारित करती है।

केस 3 - मल्टीमॉडैलिटी जरूरी है। एक बीमा कंपनी वाहन क्षति तस्वीरों से प्रारंभिक आकलन करना चाहती है। यह उस मॉडल के साथ असंभव है जो केवल पाठ पढ़ता है; एक मल्टीमॉडल मॉडल जो तस्वीर को "देखता" है, आवश्यक है। जब वे मल्टीमॉडल मॉडल पर स्विच करते हैं, तो वे एक प्री-स्क्रीनिंग सिस्टम स्थापित करते हैं जो फोटो में क्षति के स्थान और गंभीरता को मोटे तौर पर वर्गीकृत करता है और विशेषज्ञ को निर्देशित करता है। हालाँकि, वे ध्यान देते हैं कि एक मानव विशेषज्ञ अंतिम निर्णय लेता है; क्योंकि मॉडल एक प्रारंभिक स्क्रीनिंग टूल है, अंतिम शब्द नहीं।

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

इस दस्तावेज़ को संक्षेप में प्रस्तुत करें. [बहुत लंबा दस्तावेज़ चिपकाया गया]

शक्तिशाली संकेत:

नीचे 40 पेज की रिपोर्ट का सारांश प्रस्तुत करें। पहले रिपोर्ट में टोकन की अनुमानित संख्या का अनुमान लगाएं और हमें बताएं कि क्या यह एक विशिष्ट संतुलित मॉडल की संदर्भ विंडो में फिट बैठता है। फिर इस प्रारूप में सारांश दें: 5-आइटम कार्यकारी सारांश + 3 जोखिम भरे निष्कर्ष। रिपोर्ट में केवल जानकारी का उपयोग करें; जिस भाग के बारे में आप निश्चित नहीं हैं उसे "रिपोर्ट में स्पष्ट नहीं" के रूप में चिह्नित करें। [रिपोर्ट]

शक्तिशाली प्रॉम्प्ट टोकन/संदर्भ दोनों से अवगत है और आउटपुट के प्रारूप और सत्यापन को नियंत्रित करता है।

कॉपी करने योग्य टेम्पलेट

1. टोकन भविष्यवाणी:

निम्नलिखित पाठ के लिए टोकन की अनुमानित संख्या का अनुमान लगाएं और इनपुट लागत के संदर्भ में इसकी व्याख्या करें: "[पाठ]"। इसे थोड़ा गोल करें, यह ध्यान में रखते हुए कि यह तुर्की है।

2. संदर्भ उपलब्धता जांच:

मेरा काम निम्नलिखित दस्तावेज़ों को संसाधित करना है: प्रति माह औसत [पेज] [मात्रा] दस्तावेज़। इस आकार के लिए किस संदर्भ विंडो की आवश्यकता है? प्रकाश/संतुलित/मजबूत स्तरों में से कौन सा पर्याप्त होगा? यदि इसे नष्ट करने की आवश्यकता हो तो क्या जोखिम उत्पन्न होता है?

3. बहुविधता निदान:

मेरा वर्कफ़्लो: [विवरण]। क्या इस स्ट्रीम में दृश्य, श्रव्य या वीडियो प्रसंस्करण है? यदि हां, तो क्या मल्टीमॉडल मॉडल की आवश्यकता है, या इसे टेक्स्ट (ओसीआर/ट्रांसक्रिप्शन) में परिवर्तित किया जा सकता है और टेक्स्ट मॉडल के साथ हल किया जा सकता है? दोनों रास्तों के फायदे/नुकसान की तुलना करें।

4. प्रसंग अनुकूलन:

मैं प्रत्येक अनुरोध के साथ मॉडल को एक दस्तावेज़ भेजता हूं, लेकिन इसमें से अधिकांश अनावश्यक है। मैं इस दस्तावेज़ से वे हिस्से कैसे निकालूं जो वास्तव में [कार्य] के लिए आवश्यक हैं? इनपुट कम करने के 3 ठोस तरीके सुझाएं और अनुमानित टोकन बचत का संकेत दें।

सामान्य गलतियाँ

  • टोकन को शब्द समझना: टोकन शब्द से भिन्न है; चालान और क्षमता हमेशा टोकन में होती है, शब्दों में गणना करना भ्रामक है।
  • यह सोचना कि संदर्भ विंडो अनंत है: प्रत्येक मॉडल की एक सीमा होती है; यदि दस्तावेज़ फिट नहीं बैठता है, तो मॉडल संपूर्ण नहीं देख सकता है।
  • अनावश्यक बड़े संदर्भ का उपयोग करना: छोटी नौकरी के लिए बड़े संदर्भ वाला एक महंगा मॉडल खरीदना; या हर अनुरोध के लिए बड़े-बड़े दस्तावेज़ भरें और व्यर्थ भुगतान करें।
  • बहुविधता को मानते हुए: प्रत्येक मॉडल दृश्यों को संसाधित नहीं कर सकता; दृश्य कार्य के लिए, यह पुष्टि किए बिना प्रारंभ करें कि मॉडल मल्टीमॉडल है।
  • तुर्की के टोकन भार को भूलना: तुर्की पाठ आम तौर पर एक ही अर्थ के लिए थोड़े अधिक टोकन का उपभोग करते हैं; लागत आकलन में इसे नजरअंदाज किया जा रहा है।

संक्षेप में

  • टोकन वह छोटी इकाई है जिसमें मॉडल टेक्स्ट को संसाधित करता है; इनपुट और आउटपुट को टोकन के रूप में अलग-अलग मापा और बिल किया जाता है।
  • संदर्भ विंडो कुल टोकन है जिसे मॉडल एक समय में ध्यान में रख सकता है; दस्तावेज़ का आकार सीधे मॉडल चयन को प्रभावित करता है।
  • मल्टीमॉडैलिटी दृश्य/ऑडियो जैसे गैर-पाठ डेटा को संसाधित करने की मॉडल की क्षमता है; यह दृश्यात्मक कार्यों के लिए आवश्यक है।
  • ये तीन अवधारणाएँ "कौन सा मॉडल?" प्रश्न के लिए प्रासंगिक हैं। साथ ही "इसकी लागत कितनी है?" यह प्रश्नों का आधार बनता है।

आवेदन कार्य

अपने व्यवसाय में आवर्ती AI कार्य चुनें। पहले टेम्प्लेट (टोकन भविष्यवाणी) से गणना करें कि इस कार्य में एक सामान्य इनपुट में कितने टोकन हैं। फिर टेम्प्लेट 2 (संदर्भ उपलब्धता जांच) के साथ निर्धारित करें कि कौन सा स्तर पर्याप्त है। यदि आपके पास दृश्य कार्य है, तो स्पष्ट करें कि क्या तीसरे टेम्पलेट (मल्टीमोडेलिटी डायग्नोसिस) के साथ मल्टीमॉडल मॉडल की आवश्यकता है। हम अगली इकाई की लागत गणना में परिणामी टोकन अनुमान का उपयोग करेंगे।

चेकलिस्ट

  • [ ] मैं टोकन की अवधारणा को जानता हूं और मोटे तौर पर यह अनुमान कैसे लगाया जा सकता है कि किसी पाठ में कितने टोकन हैं।
  • [ ] मैं संदर्भ विंडो को "टेबल/मेमोरी" सादृश्य से समझा सकता हूं।
  • [ ] मैं मूल्यांकन कर सकता हूं कि कोई दस्तावेज़ किसी मॉडल में फिट होगा या नहीं।
  • [ ] जब मल्टीमॉडैलिटी आवश्यक हो तो मैं निदान कर सकता हूं।
  • [ ] मैं तुर्की के टोकन ओवरहेड और अनावश्यक संदर्भ की लागत को ध्यान में रखता हूं।