નફો:
- ક્ષમતા, ઝડપ અને કિંમત પર મોડેલ પરિવાર (ઝડપી/સંતુલિત/શક્તિશાળી) ની તુલના કરી શકે છે
- કાર્ય જટિલતા અનુસાર મોડેલ પસંદગી અને રૂટીંગ વ્યૂહરચનાઓ ડિઝાઇન કરે છે
- ઇવલ્સના નાના સેટ સાથે પુરાવા પર આધારિત મોડેલની પસંદગી
LLM એકીકરણમાં તમારા પૈસા અને ગુણવત્તા માટે સૌથી વધુ બેંગ નક્કી કરે છે તે એકમાત્ર નિર્ણય એ છે કે તમે કયા મોડેલનો ઉપયોગ કરો છો. સામાન્ય રીફ્લેક્સ "સૌથી મજબૂત મોડેલ પસંદ કરો" છે; જો કે, આનો અર્થ ઘણીવાર બિનજરૂરી ખર્ચ અને વિલંબ થાય છે. યોગ્ય અભિગમ એ છે કે દરેક કાર્યને પરિપૂર્ણ કરતા હળવા મોડેલને પસંદ કરવું અને તે પસંદગીને અનુમાન પર નહીં, માપ પર આધારિત છે. આ એકમમાં, તમે ક્ષમતા/સ્પીડ/ખર્ચ અક્ષ પર મોડેલ પરિવારની તુલના કરશો, કાર્યની જટિલતા અનુસાર મોડેલ રૂટીંગ વ્યૂહરચના સ્થાપિત કરશો અને મૂલ્યાંકનના નાના સમૂહ સાથે પસંદગીનો પુરાવો આપશો.
મોડેલ પરિવારને સમજવું
પ્રદાતાઓ સામાન્ય રીતે ત્રણ વર્ગો ઓફર કરે છે: ઝડપી/સસ્તા, સ્થિર અને શક્તિશાળી. તેમની વચ્ચેનો સંબંધ ત્રણ અક્ષો પર સંક્ષિપ્ત છે: ક્ષમતા (મુશ્કેલ કાર્યોને હલ કરવાની શક્તિ), ઝડપ (લેટન્સી), કિંમત (ટોકન કિંમત).
વર્ગ
ઉદાહરણ
પ્રતિભા
ઝડપ
ખર્ચ
ઉપલબ્ધ કાર્યો
ઝડપી
હાઈકુ 4.5
મધ્યમ
ખૂબ ઊંચી
નીચું
વર્ગીકરણ, લેબલીંગ, સંક્ષિપ્ત સારાંશ, અભિગમ
સંતુલિત
સોનેટ 5
ઉચ્ચ
ઉચ્ચ
મધ્યમ
સામાન્ય હેતુ, કોડિંગ, મલ્ટી-સ્ટેપ ફ્લો, મોટાભાગના એજન્ટ કાર્ય
મજબૂત
ઓપસ 4.8
સૌથી વધુ
મધ્યમ
ઉચ્ચ
જટિલ તર્ક, લાંબા અંતરની સ્વાયત્ત કાર્યો, મુશ્કેલ વિશ્લેષણ
નિર્ણાયક આંતરદૃષ્ટિ: વધુ શક્તિશાળી મોડેલ દરેક કાર્ય પર વધુ સારું પ્રદર્શન કરતું નથી. સરળ "તાકીદ કે નહીં" લેબલિંગમાં, મજબૂત મોડેલ અને ઝડપી મોડેલ સમાન સાચો જવાબ આપે છે; માત્ર એટલો જ તફાવત છે કે શક્તિશાળી 5 ગણો વધુ ખર્ચાળ અને ધીમો છે. વધારાની પ્રતિભા ત્યારે જ મૂલ્ય ઉત્પન્ન કરે છે જ્યારે મિશનને તેની જરૂર હોય.
પગલું દ્વારા પગલું: મોડેલ કેવી રીતે પસંદ કરવું?
- કાર્યનું વર્ગીકરણ કરો. શું તે નિયમિત/પેટર્નવાળી (લેબલિંગ, અનુમાન), અથવા ઓપન-એન્ડેડ/મલ્ટી-સ્ટેપ (વિશ્લેષણ, આયોજન, કોડ) છે?
- સૌથી હળવા ઉમેદવારથી શરૂઆત કરો. ઝડપી મોડેલ સાથે પ્રયાસ કરો. જો તે પૂરતું છે, તો રોકો.
- જો તે પૂરતું ન હોય, તો ઉચ્ચ વર્ગમાં જાઓ. જો ચોકસાઈ ઓછી હોય, તો સંતુલિત પર જાઓ, જો તે પૂરતું ન હોય, તો મજબૂત પર જાઓ.
- માપો, અનુમાન ન કરો. દરેક ઉમેદવારની સચોટતા અને કિંમતની તુલના એક નાના સમૂહ (નીચે) સાથે કરો.
- રીડાયરેક્શન સેટ કરો. એક મોડેલ સાથે કનેક્ટ થવાને બદલે, કાર્યને "રાઉટર" વડે યોગ્ય મોડેલ પર વિતરિત કરો.
મોડલ રૂટીંગ
વાસ્તવિક વર્કલોડ મિશ્રિત છે: મોટાભાગની આવનારી વિનંતીઓ સરળ છે, કેટલીક મુશ્કેલ છે. તે બધાને શક્તિશાળી મોડેલ પર મોકલવા માટે કચરો છે; તે બધાને ઝડપી મોડેલ પર મોકલવાથી ગુણવત્તામાં ઘટાડો થાય છે. રૂટીંગ આને હલ કરે છે: એક સસ્તું મોડલ (અથવા એક સરળ નિયમ) પહેલા કાર્યનું વર્ગીકરણ કરે છે, પછી જોબ યોગ્ય મોડલ પર જાય છે.
# રાઉટર પ્રોમ્પ્ટ (સસ્તા મોડલ સાથે કામ કરે છે) આવનારી વિનંતીને તેની મુશ્કેલી અનુસાર વર્ગીકૃત કરો. ફક્ત નીચે આપેલ JSON પરત કરો:{"મુશ્કેલી": "સરળ|જટિલ"}સરળ: એક-પગલાં, સૂત્ર, ટૂંકા-જવાબ. જટિલ: બહુ-પગલાંની તર્ક, વિશ્લેષણ અથવા લાંબી પેઢીની જરૂર છે. વિનંતી: """{{request}}"""
- સરળ → ઝડપી મોડેલ (સસ્તા, ઝડપી) પર જાઓ.
- જટિલ → શક્તિશાળી મોડેલ પર જાઓ (ખર્ચાળ પરંતુ જરૂરી).
આ પેટર્ન નોંધપાત્ર રીતે સરેરાશ ખર્ચ ઘટાડે છે કારણ કે મોટાભાગનો ટ્રાફિક સામાન્ય રીતે સરળ હોય છે.
ટીપ: રેફરલ નિર્ણય માટે હંમેશા એલએલએમની જરૂર હોતી નથી. "જો ટેક્સ્ટ 20 શબ્દો કરતાં ઓછી હોય તો ઝડપી મોડેલ પર જાઓ" જેવા સરળ નિયમો પણ માર્ગદર્શિકા છે અને શૂન્ય વધારાની ટોકન કિંમત લાવે છે. પહેલા નિયમ અજમાવી જુઓ.
લિંકિંગ ચોઇસ ટુ એવિડન્સ: ધ સ્મોલ ઇવલ ક્લસ્ટર
"તે મને વધુ સારું લાગે છે" ના આધારે મોડેલ પસંદ કરશો નહીં. Eval (મૂલ્યાંકન સમૂહ) એ નમૂનાઓનો એક નાનો સમૂહ છે જેના માટે સાચો જવાબ જાણીતો છે; તમે આ સેટ પર દરેક મોડેલ ચલાવો છો અને ચોકસાઈ, કિંમત અને વિલંબને માપો છો.
# Eval સેટઅપ ટેમ્પલેટ1) 20-50 વાસ્તવિક ઉદાહરણો એકત્રિત કરો, દરેક પર "સાચો જવાબ" લખો. 2) આ સેટ પર દરેક મોડેલ (ઝડપી/સંતુલિત/મજબૂત) ચલાવો.3) દરેક મોડેલ માટે: સુધારકોની સંખ્યા, સરેરાશ થ્રુપુટ ટોકન્સ, વિનંતી દીઠ કિંમત, સરેરાશ સમય.4) "પર્યાપ્ત સસ્તી ચોકસાઈ" આપે છે તે મોડેલ પસંદ કરો.
# Eval સરખામણી કોષ્ટક (ભરો) મોડેલ | ચોકસાઈ | વિનંતી દીઠ કિંમત | સરેરાશ અવધિ હાયકુ | ...% | ... $ | ... snSonnet | ...% | ... $ | ... snOpus | ...% | ... $ | ...સેકન્ડ
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ (મોડલ પસંદગી નિર્ણય)
# નબળા (નિર્ણય માટે કોઈ આધાર નથી) ચાલો શ્રેષ્ઠ મોડેલનો ઉપયોગ કરીએ, બજેટ મહત્વપૂર્ણ નથી.
# સ્ટ્રોંગ (માપ પર આધારિત નિર્ણય) 50 નમૂનાઓની તુલનામાં, હાઈકુએ 96% ચોકસાઈ આપી, સોનેટે 97% ચોકસાઈ આપી; તફાવત આંકડાકીય રીતે નજીવો છે. હાઈકુ પસંદ કરવામાં આવ્યું હતું કારણ કે તે 5 ગણું સસ્તું અને 2 ગણું ઝડપી છે. જો ચોકસાઈ 95% ની નીચે જાય, તો સોનેટ પર અપગ્રેડ કરવાનો નિર્ણય આપમેળે લેવામાં આવશે.
શક્તિશાળી સંસ્કરણ; પસંદગીને સંખ્યા, થ્રેશોલ્ડ અને એસ્કેલેશન નિયમ સાથે જોડે છે. આ બંને આજના નિર્ણયનો બચાવ કરે છે અને ભાવિ પરિવર્તનનું સંચાલન કરે છે.
ત્રણ મિની કેસ
કેસ 1 - અતિશય શક્તિવાળા મોડેલમાંથી છટકી જાઓ. એક કોલ સેન્ટર ઓપસ સાથેની તમામ વાતચીતના સારાંશનું નિર્માણ કરતું હતું; માસિક બિલ ઊંચું હતું. 40-સેમ્પલ ઇવલ પર, સૉનેટ ચોકસાઈમાં ઓપસથી 1% પાછળ હતું પરંતુ તેની કિંમત એક તૃતીયાંશ હતી. તેઓએ સારાંશ કાર્યને સોનેટમાં ખસેડ્યું; ગુણવત્તાની ફરિયાદો વિના, માસિક ખર્ચ $9,000 થી ઘટીને $3,100 થયો.
કેસ 2 — રીડાયરેક્શન સાથે મિશ્ર ટ્રાફિક. કાનૂની ટેક ટીમની 80% વિનંતીઓ સરળ દસ્તાવેજ ટેગિંગની હતી, 20% જટિલ કરાર વિશ્લેષણ હતી. તેઓ આ બધાને પાવરફુલ મોડલ પાસે મોકલી રહ્યા હતા. તેઓએ એક સસ્તું રાઉટર ઉમેર્યું અને હાઈકુમાં સરળ નોકરીઓ અને ઓપસમાં જટિલ નોકરીઓનું વિતરણ કર્યું; સરેરાશ વિનંતી ખર્ચમાં 64% ઘટાડો થયો છે, જ્યારે વિશ્લેષણની ગુણવત્તા જાળવી રાખવામાં આવી હતી.
કેસ 3 — માપ્યા વિના કદ ઘટાડવાની કિંમત. ખર્ચ ઘટાડવા માટે, એક ટીમે જટિલ તબીબી કોડના નિષ્કર્ષણને સીધા જ ઝડપી મોડેલમાં ઘટાડી દીધું; તેઓ મૂલ્યવાન ન હતા. લાઇવમાં, ચોકસાઈ 92% થી ઘટીને 78% થઈ ગઈ, પરિણામે ખોટા અનુમાનો પાછા આવ્યા. તેઓએ સૌપ્રથમ મૂલ્યાંકન કરવું પડ્યું: તે કાર્ય માટે શક્તિશાળી મોડેલની જરૂર હતી. પાઠ: ઘટાડો અને ઉંચાઈ બંને માપ દ્વારા કરવામાં આવે છે.
સામાન્ય ભૂલો
- "સૌથી મજબૂત મોડેલ" રીફ્લેક્સ: સરળ કાર્યોમાં કચરો અને બિનજરૂરી વિલંબ.
- માપ્યા વિના મોડલ બદલવું: ઘટાડો અને વિસ્તરણ બંને ઇવેલ વિના જોખમી છે.
- એક મૉડલમાં લૉક કરવું: મિશ્ર ટ્રાફિકમાં રાઉટિંગ ઘણીવાર વધુ કાર્યક્ષમ હોય છે.
- એલએલએમ માટે હંમેશા રાઉટરની ભૂલ કરવી: સરળ નિયમો શૂન્ય ખર્ચે કામ કરી શકે છે.
- બુસ્ટ થ્રેશોલ્ડ સેટ ન કરવું: જો ચોકસાઈમાં ઘટાડો અગાઉથી વ્યાખ્યાયિત થવો જોઈએ તો શું થાય છે.
- મૉડલ વર્ઝનને ઠીક ન કરવું: તમે ઉત્પાદનમાં કયા મૉડલ/વર્ઝન પર કામ કરી રહ્યાં છો તે રેકોર્ડ કરો; સંસ્કરણમાં ફેરફાર વર્તનને બદલી શકે છે.
ડીપર: કાયમી ઇવલ અને ઇન્ક્રીમેન્ટલ ટ્રાયલ
મોડેલની પસંદગી એ એક વખતનો નિર્ણય નથી. પ્રદાતાઓ નવા મોડલ રજૂ કરે છે, કિંમતો બદલાય છે, તમારું જોબ વર્ણન વિકસિત થાય છે. તેથી એકવાર eval ક્લસ્ટર સેટ કરો અને ભૂલશો નહીં; તેને જીવંત પ્રાણીની જેમ પકડી રાખો. જ્યારે નવું મોડલ બહાર આવે છે, ત્યારે તમે તેના દ્વારા સમાન 20-50 નમૂનાઓ ચલાવો છો, ટેબલ અપડેટ કરો અને તમારો નિર્ણય ફરીથી લો. આ તમને "પેટર્ન-સ્વિચિંગ ઇન્ટ્યુશન" ટ્રેપથી બચાવે છે.
બીજી અદ્યતન તકનીક એ ફોલબેક / કાસ્કેડ પેટર્ન છે. તમે પ્રથમ સસ્તા મોડેલને કાર્ય આપો છો; જો આઉટપુટમાં ઓછો વિશ્વાસ હોય અથવા વેરિફિકેશન લેયર (એકમ 11) તેને નકારે, તો તમે તે જ વિનંતીને આગળ વધારશો. તેથી મોટાભાગનો ટ્રાફિક સસ્તા મોડલ પર ઉકેલાઈ જાય છે, બાકી માત્ર લઘુમતી મોંઘા મોડલ પર જાય છે. આ નિશ્ચિત સિંગલ-મોડલ અભિગમ કરતાં સસ્તું અને વધુ ટકાઉ બંને છે.
ત્રીજો મુદ્દો એ છે કે eval માં માત્ર ચોકસાઈ જ નહીં પરંતુ ખર્ચ અને વિલંબનો પણ સમાવેશ થાય છે. જો મોડેલ 1% વધુ સચોટ પરંતુ 3 ગણું વધુ મોંઘું અને 2 ગણું ધીમું હોય, તો મોટાભાગની નોકરીઓ માટે ટ્રેડ-ઓફ તે મૂલ્યવાન નથી. ત્રણ અક્ષો (ચોકસાઈ, કિંમત, લેટન્સી) સાથે નિર્ણય લો અને "પર્યાપ્તતા થ્રેશોલ્ડ" વ્યાખ્યાયિત કરો: "જો ચોકસાઈ 95% થી વધુ હોય, તો સૌથી સસ્તો પસંદ કરો."
છેલ્લે, તમે ઉત્પાદનમાં કયા મોડેલ/વર્ઝનનો ઉપયોગ કર્યો હતો તે રેકોર્ડ કરો. જો એક દિવસ આઉટપુટ ગુણવત્તા બદલાય છે, તો તમે પ્રથમ વસ્તુ જોશો કે મોડેલ સંસ્કરણ બદલાયું છે કે કેમ. વર્ઝન ટ્રેસેબિલિટી ગુણવત્તા સમસ્યાઓના મૂળ કારણને શોધવાનું ઝડપી બનાવે છે.
એક વધુ ચેતવણી: eval ક્લસ્ટર તમારા વાસ્તવિક વર્કલોડને રજૂ કરે છે. માત્ર સરળ ઉદાહરણોનો સમાવેશ કરતી ઇવેલ છુપાવે છે જ્યાં મોડેલ મુશ્કેલ કેસોમાં ઠોકર ખાય છે અને તમને ખોટા વિશ્વાસમાં લઈ જાય છે. એક સારી eval; તેમાં સામાન્ય સરળ ઉદાહરણો તેમજ તમને વાસ્તવિકતામાં મળેલા કોર્નર કેસોનો સમાવેશ થાય છે (અસ્પષ્ટ, અપૂર્ણ, વિરોધાભાસી ઇનપુટ્સ). આ મુશ્કેલ લઘુમતી તમારી મોડેલની પસંદગી નક્કી કરે છે, કારણ કે દરેક મોડેલ કોઈપણ રીતે સરળ બહુમતીમાં સફળ થાય છે. સમયાંતરે નવા વાસ્તવિક ઉદાહરણો ખવડાવીને તમારા Eval ને તાજી અને પ્રતિનિધિ રાખો.
સારાંશમાં
યોગ્ય મોડલ એ સૌથી હલકું મોડેલ છે જે કામ પૂર્ણ કરે છે; વધુ શક્તિશાળી એ દરેક કામમાં સારું નથી હોતું, તે માત્ર વધુ ખર્ચાળ અને ધીમું છે. કાર્યનું વર્ગીકરણ કરવું અને સૌથી હળવા ઉમેદવારથી શરૂ કરીને, મિશ્ર ટ્રાફિકને રૂટીંગ સાથે વિતરિત કરવું, અને ઇવેલ્સના નાના સમૂહ સાથે પસંદગીને પ્રમાણિત કરવાથી ગુણવત્તા જાળવી રાખવાથી કિંમત ઘણી વખત ઘટાડે છે.
એપ્લિકેશન કાર્ય
વર્કલોડ પસંદ કરો. (1) કાર્યને સરળ/જટિલ તરીકે વર્ગીકૃત કરો. (2) 20 વાસ્તવિક ઉદાહરણો (તેમના સાચા જવાબો સાથે)નો એક નાનો ઇવેલ સેટ ડિઝાઇન કરો. (3) ત્રણ મોડલ વર્ગો માટે સચોટતા/ખર્ચ/સમયની સરખામણી કોષ્ટક તૈયાર કરવા માટે એક યોજના બનાવો. (4) જો તમારી પાસે મિશ્ર ટ્રાફિક હોય, તો રૂટીંગ નિયમ લખો અને એસ્કેલેશન થ્રેશોલ્ડ સેટ કરો.
ચેકલિસ્ટ
- [ ] હું ક્ષમતા/સ્પીડ/ખર્ચ અક્ષ પર મોડેલ પરિવારની તુલના કરી શકું છું.
- [ ] હું "સૌથી હળવા સફળ મોડેલ" સિદ્ધાંતને લાગુ કરી શકું છું.
- [] હું કાર્ય જટિલતા અનુસાર મોડલ રૂટીંગ સેટ કરી શકું છું.
- [ ] ઇવલના નાના સમૂહ સાથે હું પસંદગીને પુરાવા સાથે બાંધી શકું છું.
- [ ] હું અપગ્રેડ/ડિમોશન થ્રેશોલ્ડ વ્યાખ્યાયિત કરી શકું છું.