નફો:
- રોજિંદા ભાષામાં ટોકન, સંદર્ભ વિન્ડો અને મલ્ટિમોડેલિટીના ખ્યાલોને સમજાવવાની ક્ષમતા
- નિદાન કરો કે શું કાર્યને વ્યાપક સંદર્ભ અથવા બહુવિધતાની જરૂર છે
- આ ખ્યાલો કિંમત અને મોડેલની પસંદગીને કેવી રીતે અસર કરે છે તે ધ્યાનમાં લેવાની ક્ષમતા
અત્યાર સુધી અમે પ્રદાતાઓ અને મોડેલ પ્રકારોથી પરિચિત છીએ. જો કે, યોગ્ય મોડેલની પસંદગી માટે, તે સમજવું પણ જરૂરી છે કે મોડેલો "અંદર" કેવી રીતે કાર્ય કરે છે; કારણ કે કિંમત, ક્ષમતા અને પ્રાપ્યતાના નિર્ણયો ત્રણ મુખ્ય ખ્યાલો પર આધાર રાખે છે: ટોકન, સંદર્ભ વિન્ડો અને મલ્ટિમોડેલિટી. જે વ્યક્તિ આ વિભાવનાઓને જાણતો નથી તે કિંમત શીટ વાંચી શકતો નથી અને આશ્ચર્ય પામી શકે છે કે "શું આ દસ્તાવેજ મોડેલમાં ફિટ થશે?" પ્રશ્નનો જવાબ આપી શકતા નથી અને વિઝ્યુઅલ પ્રોસેસિંગ ક્યારે આવશ્યક છે તે જોઈ શકતા નથી. આ એકમના અંત સુધીમાં, તમે આ ત્રણ વિભાવનાઓને રોજિંદા ભાષામાં સમજાવી શકશો, નિદાન કરી શકશો કે નોકરીને વ્યાપક સંદર્ભની જરૂર છે કે મલ્ટિમોડેલિટી, અને ખર્ચ પર તેમની અસરને ધ્યાનમાં લેશો.
ટોકન: શબ્દને બદલે મોડેલ દ્વારા વપરાતો એકમ
આર્ટિફિશિયલ ઇન્ટેલિજન્સ મોડલ ટેક્સ્ટને શબ્દ દ્વારા નહીં, પરંતુ ટોકન્સ તરીકે ઓળખાતા નાના ટુકડાઓમાં પ્રક્રિયા કરે છે. એક ટોકન; તે શબ્દ, શબ્દનો ભાગ, વિરામચિહ્ન અથવા જગ્યા હોઈ શકે છે. રફ ગણતરી કરવા માટે: અંગ્રેજીમાં, સરેરાશ ટોકન લગભગ ચાર અક્ષરો છે, અને 100 શબ્દો લગભગ 130-150 ટોકન્સ છે. ટર્કિશમાં, પ્રત્યય અને લાંબા શબ્દોને કારણે આ દર થોડો વધારે હોઈ શકે છે; બીજા શબ્દોમાં કહીએ તો, સમાન અર્થ સાથે ટર્કિશ ટેક્સ્ટ અંગ્રેજી કરતાં સહેજ વધુ ટોકન્સ વાપરે છે.
આ જાણવું શા માટે મહત્વનું છે? કારણ કે દરેક વસ્તુ ટોકનમાં ચાર્જ અને માપવામાં આવે છે. તમે મોડેલને મોકલો છો તે ટેક્સ્ટ (ઇનપુટ) અને મોડેલ દ્વારા ઉત્પાદિત પ્રતિસાદ (આઉટપુટ) અલગ ટોકન્સ તરીકે ગણવામાં આવે છે. તમારું ઇન્વોઇસ અને મોડેલની ક્ષમતા બંને ટોકન્સમાં છે.
ટીપ: ટેક્સ્ટમાં કેટલા ટોકન્સ છે તેનો અંદાજ મેળવવા માટે, અક્ષરોની સંખ્યાને ચાર વડે વિભાજીત કરો. 4,000 અક્ષરનો ઈમેલ આશરે 1,000 ટોકન્સ છે. ટર્કિશમાં, સલામત બાજુ પર રહેવા માટે થોડું ઊંચું ધારો.
સંદર્ભ વિન્ડો: મોડેલની "શોર્ટ ટર્મ મેમરી"
સંદર્ભ વિન્ડો એ ટોકન્સની કુલ રકમ છે જેને મોડેલ એક સમયે ધ્યાનમાં રાખી શકે છે. ઇનપુટ અને આઉટપુટ આ વિન્ડોમાં એકસાથે ફિટ હોવા જોઈએ. એક જ સમયે ટેબલ પર તમે જેટલા કાગળ ફેલાવી શકો છો તેટલા કાગળની જેમ તેનો વિચાર કરો: ટેબલ પર જે કાગળ ફિટ થતો નથી તે તે ક્ષણે તમારી દ્રષ્ટિની બહાર છે.
જો મોડેલની સંદર્ભ વિન્ડો 200,000 ટોકન્સ હોય, તો તે લગભગ 150,000 શબ્દો અથવા ઘણી મધ્યમ કદની પુસ્તકો સમાન છે. 1 મિલિયન ટોકન્સ એકંદરે ઘણા મોટા દસ્તાવેજો પર પ્રક્રિયા કરી શકે છે. આજે કેટલાક શક્તિશાળી મોડલ (દા.ત. ક્લાઉડ ઓપસ 4.8 અને સોનેટ 5) 1 મિલિયન ટોકન સંદર્ભો ઓફર કરે છે, જ્યારે હળવા વજનના મોડલ ઘણીવાર નાની વિન્ડો સાથે આવે છે (દા.ત. હાઈકુ 4.5 માટે 200,000 ટોકન્સ).
શા માટે તે મહત્વનું છે? કારણ કે જો કોઈ દસ્તાવેજ સંદર્ભ વિંડોમાં બંધબેસતું નથી, તો મોડેલ તે બધું એકસાથે જોઈ શકતું નથી. તમે 200,000 ટોકન મોડલને સંપૂર્ણ રીતે 500 પાનાનો કોન્ટ્રાક્ટ આપી શકતા નથી; તમે કાં તો દસ્તાવેજને ભાગોમાં વિભાજીત કરો (જે ભાગો વચ્ચેનો સંબંધ ગુમાવી શકે છે) અથવા વ્યાપક સંદર્ભ સાથે મોડેલ પસંદ કરો.
સાવધાન: દરેક દસ્તાવેજને ભરવું તે મુજબની નથી કારણ કે તે ફક્ત સંદર્ભ વિંડો મોટી હોવાને કારણે છે. તમે વિન્ડોમાં જેટલા વધુ ટોકન્સ મૂકો છો, તેટલું વધુ તમે ચૂકવણી કરો છો, અને કેટલીકવાર મોડલ ખૂબ લાંબા ગ્રંથોમાં મધ્યમ વિગતોને ચૂકી શકે છે. જે કામ કરે છે તે જ ભાગ મોકલવો તે ઘણીવાર સસ્તું અને વધુ સચોટ હોય છે.
સંદર્ભ વિન્ડો એક નિર્ણય માપદંડ છે
ક્વેસ્ટ
અંદાજિત જરૂરી સંદર્ભ
યોગ્ય સ્તર
ટૂંકા ઇમેઇલ પ્રતિસાદ
કેટલાક સો ટોકન્સ
હલકો
એક પૃષ્ઠ સારાંશ
કેટલાક હજાર ટોકન્સ
પ્રકાશ/સંતુલિત
40-પૃષ્ઠ અહેવાલ વિશ્લેષણ
~30,000 ટોકન્સ
સંતુલિત/મજબૂત
300-પૃષ્ઠ કરાર સમીક્ષા
~250,000 ટોકન્સ
વ્યાપક સંદર્ભ સાથે શક્તિશાળી
એકસાથે સેંકડો દસ્તાવેજો પર પ્રક્રિયા કરો
500,000+ ટોકન્સ
વ્યાપક સંદર્ભ
આ કોષ્ટક પ્રશ્નનો જવાબ આપે છે "કયું મોડેલ?" તે દર્શાવે છે કે પ્રશ્નનો ભાગ દસ્તાવેજના કદ દ્વારા સીધો જવાબ આપવામાં આવે છે. ટૂંકી નોકરીઓ માટે મોટા સંદર્ભ સાથે મોંઘા મોડલ ખરીદવું એ વ્યર્થ છે; નાની વિંડો સાથેનું મોડેલ મોટા દસ્તાવેજો માટે અપૂરતું છે.
બહુવિધતા: ટેક્સ્ટથી આગળ વધવું
મલ્ટિમોડેલિટી એ એક મોડેલની માત્ર ટેક્સ્ટ જ નહીં, બહુવિધ પ્રકારના ડેટા (ઇમેજ, ઑડિઓ, ક્યારેક વિડિયો)ને હેન્ડલ કરવાની ક્ષમતા છે. અહીં "મોડલ" નો અર્થ "ડેટા પ્રકાર" છે; મલ્ટિમોડલનો અર્થ "ઘણા પ્રકારના" થાય છે.
- ફક્ત-ટેક્સ્ટ મોડલ: ફક્ત લખાયેલ ટેક્સ્ટ વાંચે છે અને લખે છે.
- મલ્ટીમોડલ મોડલ: બિલનો ફોટો વાંચી શકે છે, ગ્રાફ પરના વલણનું અર્થઘટન કરી શકે છે, હસ્તલિખિત નોંધને ડીકોડ કરી શકે છે, કેટલીકવાર વૉઇસ રેકોર્ડિંગને ટ્રાંસ્ક્રાઇબ કરી શકે છે.
શા માટે તે મહત્વનું છે? કારણ કે તમારા વ્યવસાયની પ્રકૃતિને મલ્ટિમોડેલિટીની જરૂર પડી શકે છે. એક એકાઉન્ટિંગ ટીમ કે જે ઇન્વૉઇસ ઈમેજીસમાંથી રકમ કાઢે છે, ઈ-કોમર્સ ટીમ કે જે પ્રોડક્ટના ફોટાને વર્ગીકૃત કરે છે અથવા વીમા ટીમ કે જે નુકસાનના ફોટાનું મૂલ્યાંકન કરે છે તે માત્ર ટેક્સ્ટ વાંચતા મોડેલ સાથે આ કામ કરી શકતી નથી. આ કાર્યો માટે વિઝ્યુઅલ પ્રોસેસિંગ આવશ્યક છે.
ત્રણ વાસ્તવિક કેસો
કેસ 1 - ટોકન ખર્ચ આશ્ચર્ય. સામગ્રી ટીમ મોડેલને 20-પૃષ્ઠ "બ્રાન્ડ માર્ગદર્શિકા" દસ્તાવેજ પણ મોકલે છે કારણ કે તેઓ દરેક બ્લોગ પોસ્ટ બનાવે છે. આ માર્ગદર્શિકા લગભગ 15,000 ટોકન્સ છે. તેઓ દર મહિને 2,000 લેખોનું ઉત્પાદન કરે છે; તેથી ફક્ત માર્ગદર્શિકાને વારંવાર મોકલવાનો અર્થ છે 30 મિલિયન ટોકન્સ ઇનપુટ. માર્ગદર્શિકા ટૂંકી કરીને અને માત્ર સંબંધિત વિભાગ (લગભગ 2,000 ટોકન્સ) મોકલીને, તેઓ ઇનપુટને સાતમા ભાગ સુધી ઘટાડે છે અને બિલમાં નોંધપાત્ર ઘટાડો કરે છે.
કેસ 2 - સંદર્ભ વિન્ડો પૂરતી નથી. કાયદાકીય પેઢી 280 પાનાના મર્જર કરારની સમીક્ષા કરવા માંગે છે. તેઓએ જે પ્રથમ મોડેલનો પ્રયાસ કર્યો તેમાં 200,000 ટોકન્સનું બંધન હતું અને દસ્તાવેજ બંધબેસતો ન હતો; જ્યારે દસ્તાવેજ ફાટી જાય છે, ત્યારે મોડેલ એ નોંધી શકતું નથી કે પ્રથમ વિભાગનો લેખ છેલ્લા વિભાગના લેખનો વિરોધાભાસ કરે છે. જ્યારે તે 1 મિલિયન ટોકન સંદર્ભ સાથે મોડેલ પર સ્વિચ કરે છે, ત્યારે તે સમગ્ર દસ્તાવેજને વાંચે છે અને વિરોધાભાસને પકડે છે. અહીં સંદર્ભ વિન્ડો સીધી ચોકસાઈ નક્કી કરે છે.
કેસ 3 - મલ્ટિમોડેલિટી આવશ્યક છે. વીમા કંપની વાહનના નુકસાનના ફોટોગ્રાફ્સ પરથી પ્રાથમિક આકારણી કરવા માંગે છે. આ એક મોડેલ સાથે અશક્ય છે જે ફક્ત ટેક્સ્ટ વાંચે છે; મલ્ટિમોડલ મોડેલ કે જે ફોટોગ્રાફને "જુએ છે" તે જરૂરી છે. જ્યારે તેઓ મલ્ટિમોડલ મોડલ પર સ્વિચ કરે છે, ત્યારે તેઓ પ્રી-સ્ક્રીનિંગ સિસ્ટમની સ્થાપના કરે છે જે ફોટામાં સ્થાન અને નુકસાનની ગંભીરતાને અંદાજે વર્ગીકૃત કરે છે અને નિષ્ણાતને નિર્દેશિત કરે છે. જો કે, તેઓ નોંધે છે કે માનવ નિષ્ણાત અંતિમ નિર્ણય લે છે; કારણ કે મોડેલ એ પ્રારંભિક સ્ક્રીનીંગ સાધન છે, અંતિમ શબ્દ નથી.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
આ દસ્તાવેજનો સારાંશ આપો. [ખૂબ લાંબો દસ્તાવેજ પેસ્ટ કર્યો]
શક્તિશાળી પ્રોમ્પ્ટ:
નીચે 40-પૃષ્ઠ અહેવાલનો સારાંશ આપો. પહેલા રિપોર્ટમાં ટોકન્સની અંદાજિત સંખ્યાનો અંદાજ કાઢો અને અમને જણાવો કે તે સામાન્ય સંતુલિત મોડલની સંદર્ભ વિંડોમાં બંધબેસે છે કે કેમ. પછી આ ફોર્મેટમાં સારાંશ આપો: 5-આઇટમ એક્ઝિક્યુટિવ સારાંશ + 3 જોખમી તારણો. રિપોર્ટમાંની માહિતીનો જ ઉપયોગ કરો; જે ભાગ વિશે તમને ખાતરી નથી તે "રિપોર્ટમાં સ્પષ્ટ નથી" તરીકે ચિહ્નિત કરો. [અહેવાલ]
પાવરફુલ પ્રોમ્પ્ટ ટોકન/સંદર્ભ વાકેફ બંને છે અને આઉટપુટના ફોર્મેટ અને ચકાસણીને નિયંત્રિત કરે છે.
નકલ કરી શકાય તેવા નમૂનાઓ
1. ટોકન અનુમાન:
નીચેના ટેક્સ્ટ માટે ટોકન્સની અંદાજિત સંખ્યાનો અંદાજ કાઢો અને ઇનપુટ ખર્ચના સંદર્ભમાં તેનું અર્થઘટન કરો: "[TEXT]". તે ટર્કિશ છે તે ધ્યાનમાં લેતા, તેને થોડું ગોળ કરો.
2. સંદર્ભ ઉપલબ્ધતા તપાસ:
મારું કામ નીચેના દસ્તાવેજો પર પ્રક્રિયા કરવાનું છે: દર મહિને [QTY] દસ્તાવેજોના સરેરાશ [PAGES]. આ કદને કયા સંદર્ભ વિંડોની જરૂર છે? પ્રકાશ/સંતુલિત/મજબૂત સ્તરોમાંથી કયું સ્તર પૂરતું હશે? જો તેને તોડી નાખવાની જરૂર હોય તો શું જોખમ ઊભું થાય છે?
3. બહુવિધ નિદાન:
મારો વર્કફ્લો: [વર્ણન]. શું આ સ્ટ્રીમમાં વિઝ્યુઅલ, ઑડિઓ અથવા વિડિયો પ્રોસેસિંગ છે? જો એમ હોય તો, શું મલ્ટિમોડલ મોડલ જરૂરી છે, અથવા તેને ટેક્સ્ટ (OCR/ટ્રાન્સક્રિપ્શન)માં રૂપાંતરિત કરી શકાય છે અને ટેક્સ્ટ મોડેલ સાથે ઉકેલી શકાય છે? બે પાથના ગુણદોષની સરખામણી કરો.
4. સંદર્ભ ઑપ્ટિમાઇઝેશન:
હું દરેક વિનંતી સાથે મોડેલને એક દસ્તાવેજ મોકલું છું, પરંતુ તેમાંના મોટા ભાગના બિનજરૂરી છે. આ દસ્તાવેજમાંથી [ટાસ્ક] માટે ખરેખર જરૂરી હોય તેવા ભાગોને હું કેવી રીતે બહાર કાઢી શકું? ઇનપુટ ઘટાડવાની 3 નક્કર રીતો સૂચવો અને અંદાજિત ટોકન બચત સૂચવો.
સામાન્ય ભૂલો
- શબ્દ માટે ટોકન ભૂલવું: ટોકન શબ્દથી અલગ છે; ઇન્વોઇસ અને ક્ષમતા હંમેશા ટોકન્સમાં હોય છે, શબ્દોમાં ગણતરી કરવી એ ભ્રામક છે.
- વિચારવું કે સંદર્ભ વિંડો અનંત છે: દરેક મોડેલની મર્યાદા હોય છે; જો દસ્તાવેજ બંધબેસતો નથી, તો મોડેલ સંપૂર્ણ જોઈ શકશે નહીં.
- બિનજરૂરી મોટા સંદર્ભનો ઉપયોગ કરવો: ટૂંકા કામ માટે મોટા સંદર્ભ સાથે ખર્ચાળ મોડેલ ખરીદવું; અથવા દરેક વિનંતી માટે વિશાળ દસ્તાવેજો ભરો અને નિરર્થક ચૂકવણી કરો.
- મલ્ટિમોડેલિટી ધારી રહ્યા છીએ: દરેક મોડેલ વિઝ્યુઅલ પર પ્રક્રિયા કરી શકતું નથી; દ્રશ્ય કાર્ય માટે, મોડેલ મલ્ટિમોડલ છે તેની પુષ્ટિ કર્યા વિના પ્રારંભ કરો.
- ટર્કિશના ટોકન લોડને ભૂલી જવું: ટર્કિશ ગ્રંથો સામાન્ય રીતે સમાન અર્થ માટે થોડા વધુ ટોકન્સ વાપરે છે; ખર્ચ અંદાજમાં આને અવગણવું.
સારાંશમાં
- ટોકન એ નાનું એકમ છે જેમાં મોડેલ ટેક્સ્ટ પર પ્રક્રિયા કરે છે; ઇનપુટ અને આઉટપુટ ટોકન્સ તરીકે અલગથી માપવામાં આવે છે અને ઇન્વોઇસ કરવામાં આવે છે.
- સંદર્ભ વિન્ડો એ કુલ ટોકન્સ છે જેને મોડેલ એક સમયે ધ્યાનમાં રાખી શકે છે; દસ્તાવેજનું કદ મોડેલની પસંદગીને સીધી અસર કરે છે.
- મલ્ટિમોડેલિટી એ વિઝ્યુઅલ/ઓડિયો જેવા નોન-ટેક્સ્ટ ડેટા પર પ્રક્રિયા કરવાની મોડેલની ક્ષમતા છે; તે દ્રશ્ય કાર્યો માટે જરૂરી છે.
- આ ત્રણ વિભાવનાઓ બંને પ્રશ્ન "કયા મોડેલ?" સાથે સંબંધિત છે. તેમજ "તેની કિંમત કેટલી છે?" તે પ્રશ્નોનો આધાર બનાવે છે.
એપ્લિકેશન કાર્ય
તમારા વ્યવસાયમાં રિકરિંગ AI કાર્ય પસંદ કરો. આ કાર્યમાં સામાન્ય ઇનપુટ કેટલા ટોકન્સ છે તેની ગણતરી કરવા માટે 1 લી ટેમ્પલેટ (ટોકન અનુમાન) રાખો. પછી નમૂના 2 (સંદર્ભ ઉપલબ્ધતા તપાસ) સાથે કયું સ્તર પૂરતું છે તે નિર્ધારિત કરો. જો તમારી પાસે વિઝ્યુઅલ જોબ હોય, તો સ્પષ્ટ કરો કે શું 3જી ટેમ્પલેટ (મલ્ટીમોડાલિટી ડાયગ્નોસિસ) સાથે મલ્ટિમોડલ મોડલ જરૂરી છે. અમે પરિણામી ટોકન અંદાજનો ઉપયોગ આગામી એકમની કિંમતની ગણતરીમાં કરીશું.
ચેકલિસ્ટ
- [ ] હું ટોકનનો ખ્યાલ જાણું છું અને ટેક્સ્ટમાં કેટલા ટોકન્સ છે તેનો અંદાજ કેવી રીતે લગાવવો.
- [ ] હું સંદર્ભ વિન્ડોને "ટેબલ/મેમરી" સમાનતા સાથે સમજાવી શકું છું.
- [ ] હું મૂલ્યાંકન કરી શકું છું કે દસ્તાવેજ મોડેલમાં ફિટ થશે કે કેમ.
- જ્યારે મલ્ટિમોડેલિટી આવશ્યક હોય ત્યારે હું નિદાન કરી શકું છું.
- [ ] હું ટર્કિશના ટોકન ઓવરહેડ અને બિનજરૂરી સંદર્ભની કિંમતને ધ્યાનમાં લઉં છું.