એકમો
1. AI પ્રદાતા ઇકોસિસ્ટમ: નકશો, ખ્યાલો અને 'કોઈ શ્રેષ્ઠ મોડલ નથી' 2. બંધ વજન અને ખુલ્લું વજન: નિયંત્રણ, કિંમત અને ગોપનીયતાનું સંતુલન 3. યુએસ જાયન્ટ્સ ઊંડાણપૂર્વક: એન્થ્રોપિક, ઓપનએઆઈ, ગૂગલ 4. અન્ય મજબૂત ખેલાડીઓ: મેટા, મિસ્ટ્રલ, xAI, ડીપસીક, કોહેરે 5. ટોકન, સંદર્ભ વિન્ડો અને મલ્ટિમોડેલિટી: મોડેલનું મન કેવી રીતે કાર્ય કરે છે 6. પ્રાઇસીંગ લોજિક: ટોકન ઇકોનોમી અને કોસ્ટ-ક્વોલિટી બેલેન્સ 7. મોડલ સ્તર અને ક્ષમતાઓ: તર્ક, ઝડપ અને નાના/મોટા મોડલની પસંદગી 8. ડેટા સાર્વભૌમત્વ, KVKK/EU અને ગોપનીયતા: તમે કોને ડેટા સોંપો છો? 9. યોગ્ય મોડલ પસંદ કરી રહ્યા છીએ: નિર્ણય વૃક્ષ અને મોડેલ પોર્ટફોલિયો 10. એન્ડ-ટુ-એન્ડ એપ્લિકેશન: મૂલ્યાંકન, માન્યતા, નીતિશાસ્ત્ર અને સીમાઓ
એકમ 5 / 10

ટોકન, સંદર્ભ વિન્ડો અને મલ્ટિમોડેલિટી: મોડેલનું મન કેવી રીતે કાર્ય કરે છે

નફો:

  • રોજિંદા ભાષામાં ટોકન, સંદર્ભ વિન્ડો અને મલ્ટિમોડેલિટીના ખ્યાલોને સમજાવવાની ક્ષમતા
  • નિદાન કરો કે શું કાર્યને વ્યાપક સંદર્ભ અથવા બહુવિધતાની જરૂર છે
  • આ ખ્યાલો કિંમત અને મોડેલની પસંદગીને કેવી રીતે અસર કરે છે તે ધ્યાનમાં લેવાની ક્ષમતા

અત્યાર સુધી અમે પ્રદાતાઓ અને મોડેલ પ્રકારોથી પરિચિત છીએ. જો કે, યોગ્ય મોડેલની પસંદગી માટે, તે સમજવું પણ જરૂરી છે કે મોડેલો "અંદર" કેવી રીતે કાર્ય કરે છે; કારણ કે કિંમત, ક્ષમતા અને પ્રાપ્યતાના નિર્ણયો ત્રણ મુખ્ય ખ્યાલો પર આધાર રાખે છે: ટોકન, સંદર્ભ વિન્ડો અને મલ્ટિમોડેલિટી. જે વ્યક્તિ આ વિભાવનાઓને જાણતો નથી તે કિંમત શીટ વાંચી શકતો નથી અને આશ્ચર્ય પામી શકે છે કે "શું આ દસ્તાવેજ મોડેલમાં ફિટ થશે?" પ્રશ્નનો જવાબ આપી શકતા નથી અને વિઝ્યુઅલ પ્રોસેસિંગ ક્યારે આવશ્યક છે તે જોઈ શકતા નથી. આ એકમના અંત સુધીમાં, તમે આ ત્રણ વિભાવનાઓને રોજિંદા ભાષામાં સમજાવી શકશો, નિદાન કરી શકશો કે નોકરીને વ્યાપક સંદર્ભની જરૂર છે કે મલ્ટિમોડેલિટી, અને ખર્ચ પર તેમની અસરને ધ્યાનમાં લેશો.

ટોકન: શબ્દને બદલે મોડેલ દ્વારા વપરાતો એકમ

આર્ટિફિશિયલ ઇન્ટેલિજન્સ મોડલ ટેક્સ્ટને શબ્દ દ્વારા નહીં, પરંતુ ટોકન્સ તરીકે ઓળખાતા નાના ટુકડાઓમાં પ્રક્રિયા કરે છે. એક ટોકન; તે શબ્દ, શબ્દનો ભાગ, વિરામચિહ્ન અથવા જગ્યા હોઈ શકે છે. રફ ગણતરી કરવા માટે: અંગ્રેજીમાં, સરેરાશ ટોકન લગભગ ચાર અક્ષરો છે, અને 100 શબ્દો લગભગ 130-150 ટોકન્સ છે. ટર્કિશમાં, પ્રત્યય અને લાંબા શબ્દોને કારણે આ દર થોડો વધારે હોઈ શકે છે; બીજા શબ્દોમાં કહીએ તો, સમાન અર્થ સાથે ટર્કિશ ટેક્સ્ટ અંગ્રેજી કરતાં સહેજ વધુ ટોકન્સ વાપરે છે.

આ જાણવું શા માટે મહત્વનું છે? કારણ કે દરેક વસ્તુ ટોકનમાં ચાર્જ અને માપવામાં આવે છે. તમે મોડેલને મોકલો છો તે ટેક્સ્ટ (ઇનપુટ) અને મોડેલ દ્વારા ઉત્પાદિત પ્રતિસાદ (આઉટપુટ) અલગ ટોકન્સ તરીકે ગણવામાં આવે છે. તમારું ઇન્વોઇસ અને મોડેલની ક્ષમતા બંને ટોકન્સમાં છે.

ટીપ: ટેક્સ્ટમાં કેટલા ટોકન્સ છે તેનો અંદાજ મેળવવા માટે, અક્ષરોની સંખ્યાને ચાર વડે વિભાજીત કરો. 4,000 અક્ષરનો ઈમેલ આશરે 1,000 ટોકન્સ છે. ટર્કિશમાં, સલામત બાજુ પર રહેવા માટે થોડું ઊંચું ધારો.

સંદર્ભ વિન્ડો: મોડેલની "શોર્ટ ટર્મ મેમરી"

સંદર્ભ વિન્ડો એ ટોકન્સની કુલ રકમ છે જેને મોડેલ એક સમયે ધ્યાનમાં રાખી શકે છે. ઇનપુટ અને આઉટપુટ આ વિન્ડોમાં એકસાથે ફિટ હોવા જોઈએ. એક જ સમયે ટેબલ પર તમે જેટલા કાગળ ફેલાવી શકો છો તેટલા કાગળની જેમ તેનો વિચાર કરો: ટેબલ પર જે કાગળ ફિટ થતો નથી તે તે ક્ષણે તમારી દ્રષ્ટિની બહાર છે.

જો મોડેલની સંદર્ભ વિન્ડો 200,000 ટોકન્સ હોય, તો તે લગભગ 150,000 શબ્દો અથવા ઘણી મધ્યમ કદની પુસ્તકો સમાન છે. 1 મિલિયન ટોકન્સ એકંદરે ઘણા મોટા દસ્તાવેજો પર પ્રક્રિયા કરી શકે છે. આજે કેટલાક શક્તિશાળી મોડલ (દા.ત. ક્લાઉડ ઓપસ 4.8 અને સોનેટ 5) 1 મિલિયન ટોકન સંદર્ભો ઓફર કરે છે, જ્યારે હળવા વજનના મોડલ ઘણીવાર નાની વિન્ડો સાથે આવે છે (દા.ત. હાઈકુ 4.5 માટે 200,000 ટોકન્સ).

શા માટે તે મહત્વનું છે? કારણ કે જો કોઈ દસ્તાવેજ સંદર્ભ વિંડોમાં બંધબેસતું નથી, તો મોડેલ તે બધું એકસાથે જોઈ શકતું નથી. તમે 200,000 ટોકન મોડલને સંપૂર્ણ રીતે 500 પાનાનો કોન્ટ્રાક્ટ આપી શકતા નથી; તમે કાં તો દસ્તાવેજને ભાગોમાં વિભાજીત કરો (જે ભાગો વચ્ચેનો સંબંધ ગુમાવી શકે છે) અથવા વ્યાપક સંદર્ભ સાથે મોડેલ પસંદ કરો.

સાવધાન: દરેક દસ્તાવેજને ભરવું તે મુજબની નથી કારણ કે તે ફક્ત સંદર્ભ વિંડો મોટી હોવાને કારણે છે. તમે વિન્ડોમાં જેટલા વધુ ટોકન્સ મૂકો છો, તેટલું વધુ તમે ચૂકવણી કરો છો, અને કેટલીકવાર મોડલ ખૂબ લાંબા ગ્રંથોમાં મધ્યમ વિગતોને ચૂકી શકે છે. જે કામ કરે છે તે જ ભાગ મોકલવો તે ઘણીવાર સસ્તું અને વધુ સચોટ હોય છે.

સંદર્ભ વિન્ડો એક નિર્ણય માપદંડ છે

ક્વેસ્ટ

અંદાજિત જરૂરી સંદર્ભ

યોગ્ય સ્તર

ટૂંકા ઇમેઇલ પ્રતિસાદ

કેટલાક સો ટોકન્સ

હલકો

એક પૃષ્ઠ સારાંશ

કેટલાક હજાર ટોકન્સ

પ્રકાશ/સંતુલિત

40-પૃષ્ઠ અહેવાલ વિશ્લેષણ

~30,000 ટોકન્સ

સંતુલિત/મજબૂત

300-પૃષ્ઠ કરાર સમીક્ષા

~250,000 ટોકન્સ

વ્યાપક સંદર્ભ સાથે શક્તિશાળી

એકસાથે સેંકડો દસ્તાવેજો પર પ્રક્રિયા કરો

500,000+ ટોકન્સ

વ્યાપક સંદર્ભ

આ કોષ્ટક પ્રશ્નનો જવાબ આપે છે "કયું મોડેલ?" તે દર્શાવે છે કે પ્રશ્નનો ભાગ દસ્તાવેજના કદ દ્વારા સીધો જવાબ આપવામાં આવે છે. ટૂંકી નોકરીઓ માટે મોટા સંદર્ભ સાથે મોંઘા મોડલ ખરીદવું એ વ્યર્થ છે; નાની વિંડો સાથેનું મોડેલ મોટા દસ્તાવેજો માટે અપૂરતું છે.

બહુવિધતા: ટેક્સ્ટથી આગળ વધવું

મલ્ટિમોડેલિટી એ એક મોડેલની માત્ર ટેક્સ્ટ જ નહીં, બહુવિધ પ્રકારના ડેટા (ઇમેજ, ઑડિઓ, ક્યારેક વિડિયો)ને હેન્ડલ કરવાની ક્ષમતા છે. અહીં "મોડલ" નો અર્થ "ડેટા પ્રકાર" છે; મલ્ટિમોડલનો અર્થ "ઘણા પ્રકારના" થાય છે.

  • ફક્ત-ટેક્સ્ટ મોડલ: ફક્ત લખાયેલ ટેક્સ્ટ વાંચે છે અને લખે છે.
  • મલ્ટીમોડલ મોડલ: બિલનો ફોટો વાંચી શકે છે, ગ્રાફ પરના વલણનું અર્થઘટન કરી શકે છે, હસ્તલિખિત નોંધને ડીકોડ કરી શકે છે, કેટલીકવાર વૉઇસ રેકોર્ડિંગને ટ્રાંસ્ક્રાઇબ કરી શકે છે.

શા માટે તે મહત્વનું છે? કારણ કે તમારા વ્યવસાયની પ્રકૃતિને મલ્ટિમોડેલિટીની જરૂર પડી શકે છે. એક એકાઉન્ટિંગ ટીમ કે જે ઇન્વૉઇસ ઈમેજીસમાંથી રકમ કાઢે છે, ઈ-કોમર્સ ટીમ કે જે પ્રોડક્ટના ફોટાને વર્ગીકૃત કરે છે અથવા વીમા ટીમ કે જે નુકસાનના ફોટાનું મૂલ્યાંકન કરે છે તે માત્ર ટેક્સ્ટ વાંચતા મોડેલ સાથે આ કામ કરી શકતી નથી. આ કાર્યો માટે વિઝ્યુઅલ પ્રોસેસિંગ આવશ્યક છે.

ત્રણ વાસ્તવિક કેસો

કેસ 1 - ટોકન ખર્ચ આશ્ચર્ય. સામગ્રી ટીમ મોડેલને 20-પૃષ્ઠ "બ્રાન્ડ માર્ગદર્શિકા" દસ્તાવેજ પણ મોકલે છે કારણ કે તેઓ દરેક બ્લોગ પોસ્ટ બનાવે છે. આ માર્ગદર્શિકા લગભગ 15,000 ટોકન્સ છે. તેઓ દર મહિને 2,000 લેખોનું ઉત્પાદન કરે છે; તેથી ફક્ત માર્ગદર્શિકાને વારંવાર મોકલવાનો અર્થ છે 30 મિલિયન ટોકન્સ ઇનપુટ. માર્ગદર્શિકા ટૂંકી કરીને અને માત્ર સંબંધિત વિભાગ (લગભગ 2,000 ટોકન્સ) મોકલીને, તેઓ ઇનપુટને સાતમા ભાગ સુધી ઘટાડે છે અને બિલમાં નોંધપાત્ર ઘટાડો કરે છે.

કેસ 2 - સંદર્ભ વિન્ડો પૂરતી નથી. કાયદાકીય પેઢી 280 પાનાના મર્જર કરારની સમીક્ષા કરવા માંગે છે. તેઓએ જે પ્રથમ મોડેલનો પ્રયાસ કર્યો તેમાં 200,000 ટોકન્સનું બંધન હતું અને દસ્તાવેજ બંધબેસતો ન હતો; જ્યારે દસ્તાવેજ ફાટી જાય છે, ત્યારે મોડેલ એ નોંધી શકતું નથી કે પ્રથમ વિભાગનો લેખ છેલ્લા વિભાગના લેખનો વિરોધાભાસ કરે છે. જ્યારે તે 1 મિલિયન ટોકન સંદર્ભ સાથે મોડેલ પર સ્વિચ કરે છે, ત્યારે તે સમગ્ર દસ્તાવેજને વાંચે છે અને વિરોધાભાસને પકડે છે. અહીં સંદર્ભ વિન્ડો સીધી ચોકસાઈ નક્કી કરે છે.

કેસ 3 - મલ્ટિમોડેલિટી આવશ્યક છે. વીમા કંપની વાહનના નુકસાનના ફોટોગ્રાફ્સ પરથી પ્રાથમિક આકારણી કરવા માંગે છે. આ એક મોડેલ સાથે અશક્ય છે જે ફક્ત ટેક્સ્ટ વાંચે છે; મલ્ટિમોડલ મોડેલ કે જે ફોટોગ્રાફને "જુએ છે" તે જરૂરી છે. જ્યારે તેઓ મલ્ટિમોડલ મોડલ પર સ્વિચ કરે છે, ત્યારે તેઓ પ્રી-સ્ક્રીનિંગ સિસ્ટમની સ્થાપના કરે છે જે ફોટામાં સ્થાન અને નુકસાનની ગંભીરતાને અંદાજે વર્ગીકૃત કરે છે અને નિષ્ણાતને નિર્દેશિત કરે છે. જો કે, તેઓ નોંધે છે કે માનવ નિષ્ણાત અંતિમ નિર્ણય લે છે; કારણ કે મોડેલ એ પ્રારંભિક સ્ક્રીનીંગ સાધન છે, અંતિમ શબ્દ નથી.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા પ્રોમ્પ્ટ:

આ દસ્તાવેજનો સારાંશ આપો. [ખૂબ લાંબો દસ્તાવેજ પેસ્ટ કર્યો]

શક્તિશાળી પ્રોમ્પ્ટ:

નીચે 40-પૃષ્ઠ અહેવાલનો સારાંશ આપો. પહેલા રિપોર્ટમાં ટોકન્સની અંદાજિત સંખ્યાનો અંદાજ કાઢો અને અમને જણાવો કે તે સામાન્ય સંતુલિત મોડલની સંદર્ભ વિંડોમાં બંધબેસે છે કે કેમ. પછી આ ફોર્મેટમાં સારાંશ આપો: 5-આઇટમ એક્ઝિક્યુટિવ સારાંશ + 3 જોખમી તારણો. રિપોર્ટમાંની માહિતીનો જ ઉપયોગ કરો; જે ભાગ વિશે તમને ખાતરી નથી તે "રિપોર્ટમાં સ્પષ્ટ નથી" તરીકે ચિહ્નિત કરો. [અહેવાલ]

પાવરફુલ પ્રોમ્પ્ટ ટોકન/સંદર્ભ વાકેફ બંને છે અને આઉટપુટના ફોર્મેટ અને ચકાસણીને નિયંત્રિત કરે છે.

નકલ કરી શકાય તેવા નમૂનાઓ

1. ટોકન અનુમાન:

નીચેના ટેક્સ્ટ માટે ટોકન્સની અંદાજિત સંખ્યાનો અંદાજ કાઢો અને ઇનપુટ ખર્ચના સંદર્ભમાં તેનું અર્થઘટન કરો: "[TEXT]". તે ટર્કિશ છે તે ધ્યાનમાં લેતા, તેને થોડું ગોળ કરો.

2. સંદર્ભ ઉપલબ્ધતા તપાસ:

મારું કામ નીચેના દસ્તાવેજો પર પ્રક્રિયા કરવાનું છે: દર મહિને [QTY] દસ્તાવેજોના સરેરાશ [PAGES]. આ કદને કયા સંદર્ભ વિંડોની જરૂર છે? પ્રકાશ/સંતુલિત/મજબૂત સ્તરોમાંથી કયું સ્તર પૂરતું હશે? જો તેને તોડી નાખવાની જરૂર હોય તો શું જોખમ ઊભું થાય છે?

3. બહુવિધ નિદાન:

મારો વર્કફ્લો: [વર્ણન]. શું આ સ્ટ્રીમમાં વિઝ્યુઅલ, ઑડિઓ અથવા વિડિયો પ્રોસેસિંગ છે? જો એમ હોય તો, શું મલ્ટિમોડલ મોડલ જરૂરી છે, અથવા તેને ટેક્સ્ટ (OCR/ટ્રાન્સક્રિપ્શન)માં રૂપાંતરિત કરી શકાય છે અને ટેક્સ્ટ મોડેલ સાથે ઉકેલી શકાય છે? બે પાથના ગુણદોષની સરખામણી કરો.

4. સંદર્ભ ઑપ્ટિમાઇઝેશન:

હું દરેક વિનંતી સાથે મોડેલને એક દસ્તાવેજ મોકલું છું, પરંતુ તેમાંના મોટા ભાગના બિનજરૂરી છે. આ દસ્તાવેજમાંથી [ટાસ્ક] માટે ખરેખર જરૂરી હોય તેવા ભાગોને હું કેવી રીતે બહાર કાઢી શકું? ઇનપુટ ઘટાડવાની 3 નક્કર રીતો સૂચવો અને અંદાજિત ટોકન બચત સૂચવો.

સામાન્ય ભૂલો

  • શબ્દ માટે ટોકન ભૂલવું: ટોકન શબ્દથી અલગ છે; ઇન્વોઇસ અને ક્ષમતા હંમેશા ટોકન્સમાં હોય છે, શબ્દોમાં ગણતરી કરવી એ ભ્રામક છે.
  • વિચારવું કે સંદર્ભ વિંડો અનંત છે: દરેક મોડેલની મર્યાદા હોય છે; જો દસ્તાવેજ બંધબેસતો નથી, તો મોડેલ સંપૂર્ણ જોઈ શકશે નહીં.
  • બિનજરૂરી મોટા સંદર્ભનો ઉપયોગ કરવો: ટૂંકા કામ માટે મોટા સંદર્ભ સાથે ખર્ચાળ મોડેલ ખરીદવું; અથવા દરેક વિનંતી માટે વિશાળ દસ્તાવેજો ભરો અને નિરર્થક ચૂકવણી કરો.
  • મલ્ટિમોડેલિટી ધારી રહ્યા છીએ: દરેક મોડેલ વિઝ્યુઅલ પર પ્રક્રિયા કરી શકતું નથી; દ્રશ્ય કાર્ય માટે, મોડેલ મલ્ટિમોડલ છે તેની પુષ્ટિ કર્યા વિના પ્રારંભ કરો.
  • ટર્કિશના ટોકન લોડને ભૂલી જવું: ટર્કિશ ગ્રંથો સામાન્ય રીતે સમાન અર્થ માટે થોડા વધુ ટોકન્સ વાપરે છે; ખર્ચ અંદાજમાં આને અવગણવું.

સારાંશમાં

  • ટોકન એ નાનું એકમ છે જેમાં મોડેલ ટેક્સ્ટ પર પ્રક્રિયા કરે છે; ઇનપુટ અને આઉટપુટ ટોકન્સ તરીકે અલગથી માપવામાં આવે છે અને ઇન્વોઇસ કરવામાં આવે છે.
  • સંદર્ભ વિન્ડો એ કુલ ટોકન્સ છે જેને મોડેલ એક સમયે ધ્યાનમાં રાખી શકે છે; દસ્તાવેજનું કદ મોડેલની પસંદગીને સીધી અસર કરે છે.
  • મલ્ટિમોડેલિટી એ વિઝ્યુઅલ/ઓડિયો જેવા નોન-ટેક્સ્ટ ડેટા પર પ્રક્રિયા કરવાની મોડેલની ક્ષમતા છે; તે દ્રશ્ય કાર્યો માટે જરૂરી છે.
  • આ ત્રણ વિભાવનાઓ બંને પ્રશ્ન "કયા મોડેલ?" સાથે સંબંધિત છે. તેમજ "તેની કિંમત કેટલી છે?" તે પ્રશ્નોનો આધાર બનાવે છે.

એપ્લિકેશન કાર્ય

તમારા વ્યવસાયમાં રિકરિંગ AI કાર્ય પસંદ કરો. આ કાર્યમાં સામાન્ય ઇનપુટ કેટલા ટોકન્સ છે તેની ગણતરી કરવા માટે 1 લી ટેમ્પલેટ (ટોકન અનુમાન) રાખો. પછી નમૂના 2 (સંદર્ભ ઉપલબ્ધતા તપાસ) સાથે કયું સ્તર પૂરતું છે તે નિર્ધારિત કરો. જો તમારી પાસે વિઝ્યુઅલ જોબ હોય, તો સ્પષ્ટ કરો કે શું 3જી ટેમ્પલેટ (મલ્ટીમોડાલિટી ડાયગ્નોસિસ) સાથે મલ્ટિમોડલ મોડલ જરૂરી છે. અમે પરિણામી ટોકન અંદાજનો ઉપયોગ આગામી એકમની કિંમતની ગણતરીમાં કરીશું.

ચેકલિસ્ટ

  • [ ] હું ટોકનનો ખ્યાલ જાણું છું અને ટેક્સ્ટમાં કેટલા ટોકન્સ છે તેનો અંદાજ કેવી રીતે લગાવવો.
  • [ ] હું સંદર્ભ વિન્ડોને "ટેબલ/મેમરી" સમાનતા સાથે સમજાવી શકું છું.
  • [ ] હું મૂલ્યાંકન કરી શકું છું કે દસ્તાવેજ મોડેલમાં ફિટ થશે કે કેમ.
  • જ્યારે મલ્ટિમોડેલિટી આવશ્યક હોય ત્યારે હું નિદાન કરી શકું છું.
  • [ ] હું ટર્કિશના ટોકન ઓવરહેડ અને બિનજરૂરી સંદર્ભની કિંમતને ધ્યાનમાં લઉં છું.