એકમ 2 / 11

ટોકન અને પ્રાઇસીંગ લોજિક

નફો:

  • ટોકન, ઇનપુટ/આઉટપુટ ટોકન ભેદ અને ટોકનાઇઝેશનનો ખ્યાલ સમજાવો.
  • ટોકન્સની સંખ્યા અને એકમની કિંમત પરથી વિનંતીની કિંમત અને માસિક વર્કલોડની ગણતરી કરી શકે છે
  • મોડલ પસંદગીની અસર અને કિંમત પર પ્રોમ્પ્ટ લંબાઈની તુલના કરી શકે છે

તમે LLM API ના અર્થશાસ્ત્રને સમજ્યા વિના સ્કેલ પર ઉકેલ બનાવી શકતા નથી. એક ડેમો એકવાર ચાલે છે; મુખ્ય વસ્તુ એ છે કે દર મહિને હજારો કૉલ્સ કરવામાં આવે ત્યારે બિલ શું હશે તેની આગાહી કરવામાં સક્ષમ થવું. આ એકમમાં અમે વસ્તુઓની મની બાજુ સેટ કરીએ છીએ: ટોકન શું છે, શા માટે ઇનપુટ અને આઉટપુટની કિંમત અલગ-અલગ છે, વિનંતીની કિંમતની ગણતરી કેવી રીતે કરવી અને માસિક વર્કલોડનું બજેટ કેવી રીતે બનાવવું. આ માહિતી તમને અનુગામી એકમોમાં ઑપ્ટિમાઇઝેશન તકનીકો (કેશિંગ, મોડેલ પસંદગી, બેચ) ના વળતરને માપવાની મંજૂરી આપે છે.

ટોકન શું છે?

ટોકન એ સૌથી નાનું એકમ છે જેમાં મોડેલ ટેક્સ્ટ પર પ્રક્રિયા કરે છે. શબ્દ હંમેશા ટોકન હોતો નથી; ટોકન સામાન્ય રીતે શબ્દનો એક ભાગ છે. સામાન્ય રીતે કહીએ તો, અંગ્રેજીમાં, 1 ટોકન ≈ 4 અક્ષરો ≈ 0.75 શબ્દો છે. ટર્કીશ અને કોડમાં, ગુણોત્તર બદલાય છે: ટર્કિશ શબ્દો તેની પ્રત્યય રચના અને મૂળાક્ષરોને કારણે ઘણીવાર અંગ્રેજી કરતાં વધુ ટોકન્સમાં વિભાજિત થાય છે. તેથી, આંખ દ્વારા અનુમાન લગાવવાને બદલે પ્રદાતાના ટોકન કાઉન્ટિંગ ટૂલ વડે ટોકન્સની સંખ્યા માપવી જરૂરી છે.

ટોકનાઇઝેશન (ટેક્સ્ટને ટોકન્સમાં વિભાજિત કરવાની પ્રક્રિયા) દરેક મોડેલ માટે અલગ હોઈ શકે છે. આના બે વ્યવહારુ પરિણામો છે: (1) સમાન ટેક્સ્ટ વિવિધ મોડેલોમાં ટોકન્સની વિવિધ સંખ્યાઓ પેદા કરી શકે છે; (2) અન્ય પ્રદાતાઓ (દા.ત. OpenAI ની ટિકટોકન લાઇબ્રેરી) ના ટોકનાઇઝર્સ સાથે કરવામાં આવેલી આગાહીઓ ક્લાઉડ માટે અચોક્કસ હશે — તમે જે મોડેલનો ઉપયોગ કરી રહ્યાં છો તેના માટે ટોકન ગણતરી ટીપનો ઉપયોગ કરો.

સંકેત: "કેટલા ટોકન્સ વિશે?" આંધળા રીતે પ્રશ્નનો જવાબ ન આપો. ટોકન કાઉન્ટિંગ API દ્વારા પ્રતિનિધિ ટેક્સ્ટ પાસ કરો; માપન પર બેઝ બજેટ નિર્ણયો.

ઇનપુટ અને આઉટપુટ ટોકન્સ

ભરતિયું બે વસ્તુઓ ધરાવે છે:

  • ઇનપુટ ટોકન્સ: તમે જે કંઈપણ મોડેલ પર મોકલો છો — સિસ્ટમ પ્રોમ્પ્ટ, ભૂતકાળના પ્રવાસો, વપરાશકર્તા સંદેશ, દસ્તાવેજીકરણ જો કોઈ હોય તો. આ બધા એક જ સમયે પ્રક્રિયા કરવામાં આવે છે.
  • આઉટપુટ ટોકન્સ: મોડેલ દ્વારા ઉત્પાદિત પ્રતિસાદ. દરેક આઉટપુટ ટોકન માટે, મૉડલ તબક્કાવાર ગણતરી કરે છે.

મોટાભાગના પ્રદાતાઓ સાથે, આઉટપુટ ઇનપુટ કરતાં અનેક ગણું મોંઘું છે. કારણ સરળ છે: આઉટપુટ ટોકન-બાય-ટોકન ઉત્પન્ન કરવા કરતાં એક જ સમયે ઇનપુટ વાંચવું સસ્તું છે. આ અસમપ્રમાણતાને જાણવું એ સમજાવે છે કે શા માટે "સંક્ષિપ્ત જવાબોની જરૂર છે" જેવા ઑપ્ટિમાઇઝેશન એટલા અસરકારક છે.

નમૂના કિંમતો (1 મિલિયન ટોકન્સ દીઠ, USD)

નીચેનું કોષ્ટક એક સંદર્ભ છે; કિંમતો સમય સાથે બદલાઈ શકે છે, કૃપા કરીને તમારા પોતાના પ્રદાતાની વર્તમાન સૂચિની પુષ્ટિ કરો.

મોડેલ વર્ગ

નમૂના મોડેલ

ઇનપુટ ($/1M)

આઉટપુટ ($/1M)

લાક્ષણિક ઉપયોગ

ઝડપી/સસ્તું

હાઈકુ 4.5

1.00

5.00

વર્ગીકરણ, લેબલીંગ, સરળ સારાંશ

સંતુલિત

સોનેટ 5

3.00

15.00

સામાન્ય હેતુ, કોડિંગ, એજન્ટ કાર્ય

મજબૂત

ઓપસ 4.8

5.00

25.00

જટિલ તર્ક, લાંબા અંતરના કાર્યો

દરેક વર્ગમાં, આઉટપુટ ઇનપુટ કરતાં 5 ગણું છે; તદુપરાંત, શક્તિશાળી મોડેલનું ઇનપુટ પણ સસ્તા મોડલના ઇનપુટ કરતાં 5 ગણું છે. આ બે અક્ષો (ઇનપુટ↔આઉટપુટ અને મોડેલ ક્લાસ) તમારા ખર્ચના નિર્ણયોનું માળખું બનાવે છે.

ખર્ચની ગણતરી કેવી રીતે કરવી?

સૂત્ર સરળ છે:

કિંમત = (ઇનપુટ_ટોકન / 1,000,000) × ઇનપુટ_કિંમત + (આઉટપુટ_ટોકન / 1,000,000) × આઉટપુટ_કિંમત

નમૂના ખાતું. સોનેટ 5: 1,500 ઇનપુટ ટોકન્સ, 400 આઉટપુટ ટોકન્સ સાથેની વિનંતી.

ઇનપુટ = 1,500 / 1,000,000 × 3.00 = $0.0045 આઉટપુટ = 400 / 1,000,000 × 15.00 = $0.0060 કુલ = $0.0105 (લગભગ 1 સેન્ટ)

એક કૉલ સસ્તો લાગે છે. પરંતુ વોલ્યુમ દ્વારા ગુણાકાર કરો: દરરોજ 20,000 કૉલ્સ → $210 પ્રતિ દિવસ, ~$6,300 પ્રતિ મહિને. આ તે છે જ્યાં સ્કેલ રમતમાં આવે છે.

માસિક બજેટનો નમૂનો

વર્કલોડની માસિક કિંમત કાઢવા માટે, આ નમૂનાનો ઉપયોગ કરો:

1) વિનંતી દીઠ સરેરાશ ઇનપુટ ટોકન: ......2) વિનંતી દીઠ સરેરાશ આઉટપુટ ટોકન: ......3) દિવસ દીઠ વિનંતીઓની સંખ્યા: ......4) દિવસ દીઠ કામ કર્યું: ......5) વિનંતી દીઠ કિંમત = (1)/1M×input_price + (2)/1M×output_price6) માસિક કિંમત = (5) × (3) × (3)

આ પેટર્નને સ્પ્રેડશીટમાં રેડવું અને જ્યારે તમે મોડલ બદલો ત્યારે સરવાળો કેવી રીતે ચાલે છે તે જોવું એ મોડેલની પસંદગી (એકમ 5) અને કૅશ (એકમ 6) નિર્ણયોને મૂર્ત બનાવે છે.

કૉપિ કરી શકાય તેવા નમૂનાઓ સાથે પ્રોમ્પ્ટને ટૂંકું કરવું

મોટાભાગનો ખર્ચ બિનજરૂરી રીતે લાંબા પ્રોમ્પ્ટ અને વેડફાઇ જતી આઉટપુટમાંથી આવે છે. નીચેના નમૂનાઓ સીધી બચત પ્રદાન કરે છે.

# આઉટપુટ લંબાઈ મર્યાદિત કરો. વધુમાં વધુ 3 વસ્તુઓ સાથે જવાબ આપો. તર્ક અથવા પ્રારંભિક વાક્ય ઉમેરો.

# ફક્ત વિનંતી કરેલ ફીલ્ડ પરત કરો ફક્ત નીચે આપેલ JSON પરત કરો, અન્ય કોઈ ટેક્સ્ટ ઉમેરશો નહીં:{"category": "...", "તાકીદ": "low|medium|high"}

# બિનજરૂરી સંદર્ભ દૂર કરો નીચેના ટેક્સ્ટમાંથી ફક્ત તારીખ અને રકમ દૂર કરો. સમગ્ર ટેક્સ્ટનું પુનરાવર્તન કરશો નહીં. ટેક્સ્ટ: """{{text}}"""

# લાંબા ભાષણનો સારાંશ આપો (ઇનપુટ બચત) આ ભાષણનો 5 આઇટમમાં સારાંશ આપો. હું પછીના રાઉન્ડમાં સંપૂર્ણ ભૂતકાળને બદલે આ સારાંશનો ઉપયોગ કરીશ. વાણી: """{{ભૂતકાળ}}"""

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ (ખર્ચની દ્રષ્ટિએ)

# નબળું (આઉટપુટ રિલીઝ કરે છે, ખર્ચાળ)આ સમર્થન વિનંતીનું વિશ્લેષણ કરો અને મને એક વ્યાપક સમીક્ષા લખો.

# સ્ટ્રોંગ (આઉટપુટને મર્યાદિત કરે છે, સસ્તું અને અનુમાનિત) આ સપોર્ટ વિનંતીને વર્ગીકૃત કરો. ફક્ત નીચે આપેલ JSON પરત કરો:{"category":"invoice|technical|refund|other","urgency":"low|medium|high"}વર્ણન લખશો નહીં.

નબળા સંસ્કરણ કદાચ 500 આઉટપુટ ટોકન્સ ઉત્પન્ન કરે છે; મજબૂત સંસ્કરણ ~15. કારણ કે આઉટપુટ ખર્ચાળ છે, આ કોલ દીઠ નોંધપાત્ર તફાવત છે અને વોલ્યુમ સાથે ગુણાકાર થાય છે.

ત્રણ મિની કેસ

કેસ 1 — લાંબા પ્રોમ્પ્ટની છુપી કિંમત. એકાઉન્ટિંગ ઓટોમેશન દરેક ઇન્વૉઇસને સૉર્ટ કરે છે, તે દરેક વિનંતીમાં ઇનપુટ તરીકે 40-પૃષ્ઠની "નિયમ પુસ્તક" ઉમેરે છે: વિનંતી દીઠ ~12,000 ઇનપુટ ટોકન્સ. સોનેટ 5 સાથે 12,000/1M×3 = $0.036 હમણાં જ દાખલ થયું. 5,000 બિલ પ્રતિ દિવસ → $180 પ્રતિ દિવસ. રૂલબુક (યુનિટ 6) કેશ કરીને ઇનપુટ ખર્ચ ~90% ઘટ્યો.

કેસ 2 - મોડલનું કદ ઘટાડવાનું વળતર. એક ટીમ ઓપસ 4.8: 300 ઇનપુટ + 10 આઉટપુટ ટોકન્સ સાથે સરળ "સકારાત્મક/નકારાત્મક" સેન્ટિમેન્ટ ટેગિંગ કરી રહી હતી. ઓપસની કિંમત 300/1M×5 + 10/1M×25 = $0.00175. હાઈકુ પર સ્વિચ કરવું, 300/1M×1 + 10/1M×5 = $0.00035 — 5x સસ્તું, ચોકસાઈમાં તફાવત અમાપ હતો. દર મહિને 3 મિલિયન કોલ પર, તફાવત $5,250 → $1,050 છે.

કેસ 3 - આઉટપુટ બહાર પાડવું. જ્યારે માર્કેટિંગ ટીમ ઉત્પાદન વર્ણનનું ઉત્પાદન કરે છે, ત્યારે તે આઉટપુટ પર કોઈ મર્યાદા નક્કી કરે છે; મોડલ કેટલીકવાર 1,500 ટોકન્સ કહે છે. જ્યારે મેં "60 શબ્દો મહત્તમ" સૂચના ઉમેર્યું, ત્યારે સરેરાશ આઉટપુટ 900 થી ઘટીને 90 ટોકન્સ થઈ ગયું. પ્રિન્ટિંગ મોંઘું હોવાથી, માસિક બિલ ત્રીજા ભાગથી ઓછું થઈ ગયું અને ગ્રંથો વધુ ઉપયોગી બન્યા.

સામાન્ય ભૂલો

  • આંખ દ્વારા ટોકનનું અનુમાન લગાવવું: તમે ખાસ કરીને ટર્કિશ અને કોડમાં ખોટા હોઈ શકો છો. માપ.
  • ધારો કે ઇનપુટ અને આઉટપુટ સમાન છે: આઉટપુટ સામાન્ય રીતે વધુ ખર્ચાળ હોય છે; મોટાભાગના ઑપ્ટિમાઇઝેશન આઉટપુટને ટૂંકાવીને આવે છે.
  • એક કોલની સસ્તીતાથી મૂર્ખ ન બનો: નિર્ણય વોલ્યુમ દ્વારા લેવામાં આવે છે. $0.01 × મિલિયન = $10,000.
  • અન્ય પ્રદાતાના ટોકનાઇઝર સાથે અનુમાન: ખોટા પરિણામો આપે છે; મોડેલના ટોકન ગણતરી સાધનનો ઉપયોગ કરો.
  • વાતચીત ઇતિહાસનું અમર્યાદિત વિસ્તરણ: દરેક રાઉન્ડ એન્ટ્રીમાં ઉમેરવામાં આવે છે; લાંબી વાતચીતમાં સારાંશ આપો.
  • `મેક્સ_ટોકન્સ`ને બિનજરૂરી રીતે ઊંચું રાખવું: બજેટ પ્લાન અને કાપ થવાનું જોખમ છુપાવે છે; વાસ્તવિક મૂલ્ય આપો.

વધુ ઊંડો: સંદર્ભ વિન્ડો અને લાંબી ઇનપુટ કિંમત

માત્ર "વિનંતી દીઠ" નહીં પણ "વાર્તાલાપ દરમિયાન" કિંમત કેવી રીતે વધે છે તે જોવાનું મહત્વપૂર્ણ છે. ટેક્સ્ટની કુલ રકમ કે જે મોડેલ પ્રક્રિયા કરી શકે છે તેને સંદર્ભ વિન્ડો કહેવામાં આવે છે; ઇનપુટ અને આઉટપુટનો સરવાળો આ વિન્ડોમાં ફિટ હોવો જોઈએ. આધુનિક મોડલ્સ ખૂબ મોટી વિન્ડો ઓફર કરે છે (સેંકડો હજારો, લાખો ટોકન્સ પણ), પરંતુ તેનો અર્થ એ નથી કે તમે તેને "અનંતપણે ભરી શકો છો" — તમે જે પણ વિંડોમાં મૂકો છો તે ઇનપુટ તરીકે બિલ કરવામાં આવે છે.

લાંબી વાતચીતમાં છટકું આ છે: દરેક નવા રાઉન્ડ સાથે તમે આખો ઇતિહાસ ફરીથી મોકલો છો (એકમ 1 માં રાજ્યવિહીનતા). 20-રાઉન્ડની વાતચીતમાં, 20મી વિનંતી ઇનપુટ તરીકે સમગ્ર પ્રથમ 19 રાઉન્ડને વહન કરે છે. આમ, જેમ જેમ વાતચીત લાંબી થાય છે, વિનંતી દીઠ ખર્ચ રેખીયને બદલે સંચિત રીતે વધે છે. એજન્ટ સહાયક સાથે 50-રાઉન્ડની વાતચીત પ્રથમ રાઉન્ડ કરતા ડઝન ગણી ઇનપુટ ખર્ચ પેદા કરી શકે છે.

આને સંચાલિત કરવાની બે રીત છે. પ્રથમ રીકેપ છે: જૂના રાઉન્ડને એક જ રીકેપ બ્લોકમાં સંકુચિત કરવું, માત્ર છેલ્લા કેટલાક રાઉન્ડને કાચા રાખીને. બીજું પ્રોમ્પ્ટ કેશીંગ છે (એકમ 6): નિયત સંદર્ભને સંપૂર્ણ કિંમતે વારંવાર પ્રક્રિયા કરવાને બદલે કિંમતના દસમા ભાગમાં વાંચવું. એકસાથે, તેઓ લાંબા, સંદર્ભ-સઘન વર્કલોડ પરના બિલને નોંધપાત્ર રીતે ઘટાડે છે. તેથી ટોકન અર્થશાસ્ત્ર સમગ્ર સત્રની ડિઝાઇન વિશે છે, એક પણ વિનંતી નહીં.

સારાંશમાં

ટોકન એ સૌથી નાનું એકમ છે જેમાં ટેક્સ્ટ પર પ્રક્રિયા કરવામાં આવે છે; ઇનપુટ અને આઉટપુટની કિંમત અલગ-અલગ હોય છે, અને આઉટપુટ ઘણીવાર વધુ ખર્ચાળ હોય છે. કિંમત એ એકમ કિંમત દ્વારા ગુણાકાર કરાયેલ ટોકનની સંખ્યા છે, અને વાસ્તવિક નિર્ણય વોલ્યુમ દ્વારા લેવામાં આવે છે. પ્રોમ્પ્ટને ટૂંકાવીને, આઉટપુટને મર્યાદિત કરવું, અને સૌથી હળવા મોડેલને પસંદ કરવું જે કાર્યને પૂર્ણ કરે છે તે સૌથી સીધા લિવર છે જે ઘણી વખત ખર્ચ ઘટાડે છે.

એપ્લિકેશન કાર્ય

તમારું પોતાનું કાર્ય પસંદ કરો. (1) પ્રતિનિધિ પ્રોમ્પ્ટ માટે ઇનપુટ અને અંદાજિત આઉટપુટ ટોકન્સની સંખ્યા નક્કી કરો (જો શક્ય હોય તો ટોકન ગણતરી સાધન વડે માપો). (2) ત્રણ મોડેલ વર્ગો માટે વિનંતી દીઠ ખર્ચની ગણતરી કરો. (3) તમારી વિનંતીઓની દૈનિક સંખ્યાનો અંદાજ કાઢો અને ત્રણ મોડલ માટે માસિક બજેટ મેળવો. (4) આઉટપુટ ટૂંકો કરવા માટે સૂચના ઉમેરો અને અપેક્ષિત બચતની નોંધ કરો.

ચેકલિસ્ટ

  • [ ] હું ટોકન્સનો ખ્યાલ સમજાવી શકું છું અને ટોકનાઇઝેશન મોડલના આધારે બદલાય છે.
  • [ ] હું જાણું છું કે શા માટે ઇનપુટ અને આઉટપુટ ટોકન્સની કિંમત અલગ-અલગ છે.
  • [ ] હું સૂત્ર વડે વિનંતીની કિંમતની ગણતરી કરી શકું છું.
  • [ ] હું ટેમ્પલેટનો ઉપયોગ કરીને વર્કલોડ માટે માસિક બજેટ બનાવી શકું છું.
  • [ ] હું ઉદાહરણ સાથે આઉટપુટ અને મોડલ ઘટાડવાના ફાયદાને બતાવી શકું છું.