એકમ 5 / 11

મોડલ પસંદગી: યોગ્ય જોબ માટે યોગ્ય મોડલ

નફો:

  • ક્ષમતા, ઝડપ અને કિંમત પર મોડેલ પરિવાર (ઝડપી/સંતુલિત/શક્તિશાળી) ની તુલના કરી શકે છે
  • કાર્ય જટિલતા અનુસાર મોડેલ પસંદગી અને રૂટીંગ વ્યૂહરચનાઓ ડિઝાઇન કરે છે
  • ઇવલ્સના નાના સેટ સાથે પુરાવા પર આધારિત મોડેલની પસંદગી

LLM એકીકરણમાં તમારા પૈસા અને ગુણવત્તા માટે સૌથી વધુ બેંગ નક્કી કરે છે તે એકમાત્ર નિર્ણય એ છે કે તમે કયા મોડેલનો ઉપયોગ કરો છો. સામાન્ય રીફ્લેક્સ "સૌથી મજબૂત મોડેલ પસંદ કરો" છે; જો કે, આનો અર્થ ઘણીવાર બિનજરૂરી ખર્ચ અને વિલંબ થાય છે. યોગ્ય અભિગમ એ છે કે દરેક કાર્યને પરિપૂર્ણ કરતા હળવા મોડેલને પસંદ કરવું અને તે પસંદગીને અનુમાન પર નહીં, માપ પર આધારિત છે. આ એકમમાં, તમે ક્ષમતા/સ્પીડ/ખર્ચ અક્ષ પર મોડેલ પરિવારની તુલના કરશો, કાર્યની જટિલતા અનુસાર મોડેલ રૂટીંગ વ્યૂહરચના સ્થાપિત કરશો અને મૂલ્યાંકનના નાના સમૂહ સાથે પસંદગીનો પુરાવો આપશો.

મોડેલ પરિવારને સમજવું

પ્રદાતાઓ સામાન્ય રીતે ત્રણ વર્ગો ઓફર કરે છે: ઝડપી/સસ્તા, સ્થિર અને શક્તિશાળી. તેમની વચ્ચેનો સંબંધ ત્રણ અક્ષો પર સંક્ષિપ્ત છે: ક્ષમતા (મુશ્કેલ કાર્યોને હલ કરવાની શક્તિ), ઝડપ (લેટન્સી), કિંમત (ટોકન કિંમત).

વર્ગ

ઉદાહરણ

પ્રતિભા

ઝડપ

ખર્ચ

ઉપલબ્ધ કાર્યો

ઝડપી

હાઈકુ 4.5

મધ્યમ

ખૂબ ઊંચી

નીચું

વર્ગીકરણ, લેબલીંગ, સંક્ષિપ્ત સારાંશ, અભિગમ

સંતુલિત

સોનેટ 5

ઉચ્ચ

ઉચ્ચ

મધ્યમ

સામાન્ય હેતુ, કોડિંગ, મલ્ટી-સ્ટેપ ફ્લો, મોટાભાગના એજન્ટ કાર્ય

મજબૂત

ઓપસ 4.8

સૌથી વધુ

મધ્યમ

ઉચ્ચ

જટિલ તર્ક, લાંબા અંતરની સ્વાયત્ત કાર્યો, મુશ્કેલ વિશ્લેષણ

નિર્ણાયક આંતરદૃષ્ટિ: વધુ શક્તિશાળી મોડેલ દરેક કાર્ય પર વધુ સારું પ્રદર્શન કરતું નથી. સરળ "તાકીદ કે નહીં" લેબલિંગમાં, મજબૂત મોડેલ અને ઝડપી મોડેલ સમાન સાચો જવાબ આપે છે; માત્ર એટલો જ તફાવત છે કે શક્તિશાળી 5 ગણો વધુ ખર્ચાળ અને ધીમો છે. વધારાની પ્રતિભા ત્યારે જ મૂલ્ય ઉત્પન્ન કરે છે જ્યારે મિશનને તેની જરૂર હોય.

પગલું દ્વારા પગલું: મોડેલ કેવી રીતે પસંદ કરવું?

  1. કાર્યનું વર્ગીકરણ કરો. શું તે નિયમિત/પેટર્નવાળી (લેબલિંગ, અનુમાન), અથવા ઓપન-એન્ડેડ/મલ્ટી-સ્ટેપ (વિશ્લેષણ, આયોજન, કોડ) છે?
  2. સૌથી હળવા ઉમેદવારથી શરૂઆત કરો. ઝડપી મોડેલ સાથે પ્રયાસ કરો. જો તે પૂરતું છે, તો રોકો.
  3. જો તે પૂરતું ન હોય, તો ઉચ્ચ વર્ગમાં જાઓ. જો ચોકસાઈ ઓછી હોય, તો સંતુલિત પર જાઓ, જો તે પૂરતું ન હોય, તો મજબૂત પર જાઓ.
  4. માપો, અનુમાન ન કરો. દરેક ઉમેદવારની સચોટતા અને કિંમતની તુલના એક નાના સમૂહ (નીચે) સાથે કરો.
  5. રીડાયરેક્શન સેટ કરો. એક મોડેલ સાથે કનેક્ટ થવાને બદલે, કાર્યને "રાઉટર" વડે યોગ્ય મોડેલ પર વિતરિત કરો.

મોડલ રૂટીંગ

વાસ્તવિક વર્કલોડ મિશ્રિત છે: મોટાભાગની આવનારી વિનંતીઓ સરળ છે, કેટલીક મુશ્કેલ છે. તે બધાને શક્તિશાળી મોડેલ પર મોકલવા માટે કચરો છે; તે બધાને ઝડપી મોડેલ પર મોકલવાથી ગુણવત્તામાં ઘટાડો થાય છે. રૂટીંગ આને હલ કરે છે: એક સસ્તું મોડલ (અથવા એક સરળ નિયમ) પહેલા કાર્યનું વર્ગીકરણ કરે છે, પછી જોબ યોગ્ય મોડલ પર જાય છે.

# રાઉટર પ્રોમ્પ્ટ (સસ્તા મોડલ સાથે કામ કરે છે) આવનારી વિનંતીને તેની મુશ્કેલી અનુસાર વર્ગીકૃત કરો. ફક્ત નીચે આપેલ JSON પરત કરો:{"મુશ્કેલી": "સરળ|જટિલ"}સરળ: એક-પગલાં, સૂત્ર, ટૂંકા-જવાબ. જટિલ: બહુ-પગલાંની તર્ક, વિશ્લેષણ અથવા લાંબી પેઢીની જરૂર છે. વિનંતી: """{{request}}"""

  • સરળ → ઝડપી મોડેલ (સસ્તા, ઝડપી) પર જાઓ.
  • જટિલ → શક્તિશાળી મોડેલ પર જાઓ (ખર્ચાળ પરંતુ જરૂરી).

આ પેટર્ન નોંધપાત્ર રીતે સરેરાશ ખર્ચ ઘટાડે છે કારણ કે મોટાભાગનો ટ્રાફિક સામાન્ય રીતે સરળ હોય છે.

ટીપ: રેફરલ નિર્ણય માટે હંમેશા એલએલએમની જરૂર હોતી નથી. "જો ટેક્સ્ટ 20 શબ્દો કરતાં ઓછી હોય તો ઝડપી મોડેલ પર જાઓ" જેવા સરળ નિયમો પણ માર્ગદર્શિકા છે અને શૂન્ય વધારાની ટોકન કિંમત લાવે છે. પહેલા નિયમ અજમાવી જુઓ.

લિંકિંગ ચોઇસ ટુ એવિડન્સ: ધ સ્મોલ ઇવલ ક્લસ્ટર

"તે મને વધુ સારું લાગે છે" ના આધારે મોડેલ પસંદ કરશો નહીં. Eval (મૂલ્યાંકન સમૂહ) એ નમૂનાઓનો એક નાનો સમૂહ છે જેના માટે સાચો જવાબ જાણીતો છે; તમે આ સેટ પર દરેક મોડેલ ચલાવો છો અને ચોકસાઈ, કિંમત અને વિલંબને માપો છો.

# Eval સેટઅપ ટેમ્પલેટ1) 20-50 વાસ્તવિક ઉદાહરણો એકત્રિત કરો, દરેક પર "સાચો જવાબ" લખો. 2) આ સેટ પર દરેક મોડેલ (ઝડપી/સંતુલિત/મજબૂત) ચલાવો.3) દરેક મોડેલ માટે: સુધારકોની સંખ્યા, સરેરાશ થ્રુપુટ ટોકન્સ, વિનંતી દીઠ કિંમત, સરેરાશ સમય.4) "પર્યાપ્ત સસ્તી ચોકસાઈ" આપે છે તે મોડેલ પસંદ કરો.

# Eval સરખામણી કોષ્ટક (ભરો) મોડેલ | ચોકસાઈ | વિનંતી દીઠ કિંમત | સરેરાશ અવધિ હાયકુ | ...% | ... $ | ... snSonnet | ...% | ... $ | ... snOpus | ...% | ... $ | ...સેકન્ડ

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ (મોડલ પસંદગી નિર્ણય)

# નબળા (નિર્ણય માટે કોઈ આધાર નથી) ચાલો શ્રેષ્ઠ મોડેલનો ઉપયોગ કરીએ, બજેટ મહત્વપૂર્ણ નથી.

# સ્ટ્રોંગ (માપ પર આધારિત નિર્ણય) 50 નમૂનાઓની તુલનામાં, હાઈકુએ 96% ચોકસાઈ આપી, સોનેટે 97% ચોકસાઈ આપી; તફાવત આંકડાકીય રીતે નજીવો છે. હાઈકુ પસંદ કરવામાં આવ્યું હતું કારણ કે તે 5 ગણું સસ્તું અને 2 ગણું ઝડપી છે. જો ચોકસાઈ 95% ની નીચે જાય, તો સોનેટ પર અપગ્રેડ કરવાનો નિર્ણય આપમેળે લેવામાં આવશે.

શક્તિશાળી સંસ્કરણ; પસંદગીને સંખ્યા, થ્રેશોલ્ડ અને એસ્કેલેશન નિયમ સાથે જોડે છે. આ બંને આજના નિર્ણયનો બચાવ કરે છે અને ભાવિ પરિવર્તનનું સંચાલન કરે છે.

ત્રણ મિની કેસ

કેસ 1 - અતિશય શક્તિવાળા મોડેલમાંથી છટકી જાઓ. એક કોલ સેન્ટર ઓપસ સાથેની તમામ વાતચીતના સારાંશનું નિર્માણ કરતું હતું; માસિક બિલ ઊંચું હતું. 40-સેમ્પલ ઇવલ પર, સૉનેટ ચોકસાઈમાં ઓપસથી 1% પાછળ હતું પરંતુ તેની કિંમત એક તૃતીયાંશ હતી. તેઓએ સારાંશ કાર્યને સોનેટમાં ખસેડ્યું; ગુણવત્તાની ફરિયાદો વિના, માસિક ખર્ચ $9,000 થી ઘટીને $3,100 થયો.

કેસ 2 — રીડાયરેક્શન સાથે મિશ્ર ટ્રાફિક. કાનૂની ટેક ટીમની 80% વિનંતીઓ સરળ દસ્તાવેજ ટેગિંગની હતી, 20% જટિલ કરાર વિશ્લેષણ હતી. તેઓ આ બધાને પાવરફુલ મોડલ પાસે મોકલી રહ્યા હતા. તેઓએ એક સસ્તું રાઉટર ઉમેર્યું અને હાઈકુમાં સરળ નોકરીઓ અને ઓપસમાં જટિલ નોકરીઓનું વિતરણ કર્યું; સરેરાશ વિનંતી ખર્ચમાં 64% ઘટાડો થયો છે, જ્યારે વિશ્લેષણની ગુણવત્તા જાળવી રાખવામાં આવી હતી.

કેસ 3 — માપ્યા વિના કદ ઘટાડવાની કિંમત. ખર્ચ ઘટાડવા માટે, એક ટીમે જટિલ તબીબી કોડના નિષ્કર્ષણને સીધા જ ઝડપી મોડેલમાં ઘટાડી દીધું; તેઓ મૂલ્યવાન ન હતા. લાઇવમાં, ચોકસાઈ 92% થી ઘટીને 78% થઈ ગઈ, પરિણામે ખોટા અનુમાનો પાછા આવ્યા. તેઓએ સૌપ્રથમ મૂલ્યાંકન કરવું પડ્યું: તે કાર્ય માટે શક્તિશાળી મોડેલની જરૂર હતી. પાઠ: ઘટાડો અને ઉંચાઈ બંને માપ દ્વારા કરવામાં આવે છે.

સામાન્ય ભૂલો

  • "સૌથી મજબૂત મોડેલ" રીફ્લેક્સ: સરળ કાર્યોમાં કચરો અને બિનજરૂરી વિલંબ.
  • માપ્યા વિના મોડલ બદલવું: ઘટાડો અને વિસ્તરણ બંને ઇવેલ વિના જોખમી છે.
  • એક મૉડલમાં લૉક કરવું: મિશ્ર ટ્રાફિકમાં રાઉટિંગ ઘણીવાર વધુ કાર્યક્ષમ હોય છે.
  • એલએલએમ માટે હંમેશા રાઉટરની ભૂલ કરવી: સરળ નિયમો શૂન્ય ખર્ચે કામ કરી શકે છે.
  • બુસ્ટ થ્રેશોલ્ડ સેટ ન કરવું: જો ચોકસાઈમાં ઘટાડો અગાઉથી વ્યાખ્યાયિત થવો જોઈએ તો શું થાય છે.
  • મૉડલ વર્ઝનને ઠીક ન કરવું: તમે ઉત્પાદનમાં કયા મૉડલ/વર્ઝન પર કામ કરી રહ્યાં છો તે રેકોર્ડ કરો; સંસ્કરણમાં ફેરફાર વર્તનને બદલી શકે છે.

ડીપર: કાયમી ઇવલ અને ઇન્ક્રીમેન્ટલ ટ્રાયલ

મોડેલની પસંદગી એ એક વખતનો નિર્ણય નથી. પ્રદાતાઓ નવા મોડલ રજૂ કરે છે, કિંમતો બદલાય છે, તમારું જોબ વર્ણન વિકસિત થાય છે. તેથી એકવાર eval ક્લસ્ટર સેટ કરો અને ભૂલશો નહીં; તેને જીવંત પ્રાણીની જેમ પકડી રાખો. જ્યારે નવું મોડલ બહાર આવે છે, ત્યારે તમે તેના દ્વારા સમાન 20-50 નમૂનાઓ ચલાવો છો, ટેબલ અપડેટ કરો અને તમારો નિર્ણય ફરીથી લો. આ તમને "પેટર્ન-સ્વિચિંગ ઇન્ટ્યુશન" ટ્રેપથી બચાવે છે.

બીજી અદ્યતન તકનીક એ ફોલબેક / કાસ્કેડ પેટર્ન છે. તમે પ્રથમ સસ્તા મોડેલને કાર્ય આપો છો; જો આઉટપુટમાં ઓછો વિશ્વાસ હોય અથવા વેરિફિકેશન લેયર (એકમ 11) તેને નકારે, તો તમે તે જ વિનંતીને આગળ વધારશો. તેથી મોટાભાગનો ટ્રાફિક સસ્તા મોડલ પર ઉકેલાઈ જાય છે, બાકી માત્ર લઘુમતી મોંઘા મોડલ પર જાય છે. આ નિશ્ચિત સિંગલ-મોડલ અભિગમ કરતાં સસ્તું અને વધુ ટકાઉ બંને છે.

ત્રીજો મુદ્દો એ છે કે eval માં માત્ર ચોકસાઈ જ નહીં પરંતુ ખર્ચ અને વિલંબનો પણ સમાવેશ થાય છે. જો મોડેલ 1% વધુ સચોટ પરંતુ 3 ગણું વધુ મોંઘું અને 2 ગણું ધીમું હોય, તો મોટાભાગની નોકરીઓ માટે ટ્રેડ-ઓફ તે મૂલ્યવાન નથી. ત્રણ અક્ષો (ચોકસાઈ, કિંમત, લેટન્સી) સાથે નિર્ણય લો અને "પર્યાપ્તતા થ્રેશોલ્ડ" વ્યાખ્યાયિત કરો: "જો ચોકસાઈ 95% થી વધુ હોય, તો સૌથી સસ્તો પસંદ કરો."

છેલ્લે, તમે ઉત્પાદનમાં કયા મોડેલ/વર્ઝનનો ઉપયોગ કર્યો હતો તે રેકોર્ડ કરો. જો એક દિવસ આઉટપુટ ગુણવત્તા બદલાય છે, તો તમે પ્રથમ વસ્તુ જોશો કે મોડેલ સંસ્કરણ બદલાયું છે કે કેમ. વર્ઝન ટ્રેસેબિલિટી ગુણવત્તા સમસ્યાઓના મૂળ કારણને શોધવાનું ઝડપી બનાવે છે.

એક વધુ ચેતવણી: eval ક્લસ્ટર તમારા વાસ્તવિક વર્કલોડને રજૂ કરે છે. માત્ર સરળ ઉદાહરણોનો સમાવેશ કરતી ઇવેલ છુપાવે છે જ્યાં મોડેલ મુશ્કેલ કેસોમાં ઠોકર ખાય છે અને તમને ખોટા વિશ્વાસમાં લઈ જાય છે. એક સારી eval; તેમાં સામાન્ય સરળ ઉદાહરણો તેમજ તમને વાસ્તવિકતામાં મળેલા કોર્નર કેસોનો સમાવેશ થાય છે (અસ્પષ્ટ, અપૂર્ણ, વિરોધાભાસી ઇનપુટ્સ). આ મુશ્કેલ લઘુમતી તમારી મોડેલની પસંદગી નક્કી કરે છે, કારણ કે દરેક મોડેલ કોઈપણ રીતે સરળ બહુમતીમાં સફળ થાય છે. સમયાંતરે નવા વાસ્તવિક ઉદાહરણો ખવડાવીને તમારા Eval ને તાજી અને પ્રતિનિધિ રાખો.

સારાંશમાં

યોગ્ય મોડલ એ સૌથી હલકું મોડેલ છે જે કામ પૂર્ણ કરે છે; વધુ શક્તિશાળી એ દરેક કામમાં સારું નથી હોતું, તે માત્ર વધુ ખર્ચાળ અને ધીમું છે. કાર્યનું વર્ગીકરણ કરવું અને સૌથી હળવા ઉમેદવારથી શરૂ કરીને, મિશ્ર ટ્રાફિકને રૂટીંગ સાથે વિતરિત કરવું, અને ઇવેલ્સના નાના સમૂહ સાથે પસંદગીને પ્રમાણિત કરવાથી ગુણવત્તા જાળવી રાખવાથી કિંમત ઘણી વખત ઘટાડે છે.

એપ્લિકેશન કાર્ય

વર્કલોડ પસંદ કરો. (1) કાર્યને સરળ/જટિલ તરીકે વર્ગીકૃત કરો. (2) 20 વાસ્તવિક ઉદાહરણો (તેમના સાચા જવાબો સાથે)નો એક નાનો ઇવેલ સેટ ડિઝાઇન કરો. (3) ત્રણ મોડલ વર્ગો માટે સચોટતા/ખર્ચ/સમયની સરખામણી કોષ્ટક તૈયાર કરવા માટે એક યોજના બનાવો. (4) જો તમારી પાસે મિશ્ર ટ્રાફિક હોય, તો રૂટીંગ નિયમ લખો અને એસ્કેલેશન થ્રેશોલ્ડ સેટ કરો.

ચેકલિસ્ટ

  • [ ] હું ક્ષમતા/સ્પીડ/ખર્ચ અક્ષ પર મોડેલ પરિવારની તુલના કરી શકું છું.
  • [ ] હું "સૌથી હળવા સફળ મોડેલ" સિદ્ધાંતને લાગુ કરી શકું છું.
  • [] હું કાર્ય જટિલતા અનુસાર મોડલ રૂટીંગ સેટ કરી શકું છું.
  • [ ] ઇવલના નાના સમૂહ સાથે હું પસંદગીને પુરાવા સાથે બાંધી શકું છું.
  • [ ] હું અપગ્રેડ/ડિમોશન થ્રેશોલ્ડ વ્યાખ્યાયિત કરી શકું છું.