નફો:
- સમસ્યાના પ્રકાર અને વ્યવસાય સંદર્ભ માટે યોગ્ય મેટ્રિક પસંદ કરવાની ક્ષમતા (અસંતુલિત ડેટામાં PR-AUC/રિકોલ, રીગ્રેશનમાં MAE/RMSE) અને વધુ/અંડર લર્નિંગને ઓળખવાની ક્ષમતા
- દરેક મેટ્રિકને આધારરેખા સામે અર્થઘટન કરવાની ક્ષમતા અને વિચલનને માપવાની ક્ષમતા અને ક્રોસ-વેલિડેશન સાથે પ્રગતિથી અલગ અવાજ
- માન્યતા સેટ સાથે હાયપરપેરામીટર્સને ટ્યુન કરીને અને માત્ર અંતે ટેસ્ટ સેટનો ઉપયોગ કરીને બિન-આશાવાદી પરિણામોની જાણ કરવાની ક્ષમતા
મોડેલ તાલીમ (તાલીમ: ડેટામાંથી પેટર્ન શીખવાની પ્રક્રિયા) એ એમએલ એન્જિનિયરિંગનું સૌથી દૃશ્યમાન પરંતુ સૌથી ભ્રામક પગલું છે. તે દેખાય છે કારણ કે તે "ચોક્કસતા 95%" જેવી સંતોષકારક સંખ્યા ઉત્પન્ન કરે છે. ભ્રામક કારણ કે તે નંબર ઘણીવાર ખોટા પ્રશ્નનો સાચો જવાબ હોય છે. આ એકમમાં, એન્જિનિયરિંગ શિસ્ત સાથે શિક્ષણ અને મૂલ્યાંકનની ચર્ચા કરવામાં આવે છે; અમે પ્રાયોગિક ડિઝાઇનમાં ભાગીદાર તરીકે કૃત્રિમ બુદ્ધિમત્તાનો ઉપયોગ કરીએ છીએ અને માપન પર નિર્ણય લઈએ છીએ.
તાલીમ ચક્રનો તર્ક
એક મોડેલ નુકશાન કાર્યને ઘટાડીને ડેટામાં પેટર્ન શીખે છે: એક કાર્ય જે આંકડાકીય રીતે મોડેલની ભૂલને માપે છે. ઑપ્ટિમાઇઝેશન અલ્ગોરિધમ (દા.ત. ગ્રેડિયન્ટ ડિસેન્ટ) તબક્કાવાર પરિમાણોને સમાયોજિત કરીને નુકસાન ઘટાડે છે. ઉદ્દેશ્ય તાલીમ ડેટાને યાદ રાખવાનો નથી, પરંતુ તેને અભૂતપૂર્વ ડેટામાં સામાન્ય બનાવવાનો છે.
બે મુખ્ય જોખમો:
- ઓવરફિટિંગ: મોડેલ તાલીમ ડેટાને યાદ રાખે છે અને નવા ડેટા પર નિષ્ફળ જાય છે. તાલીમ સફળતા વધારે છે, ચકાસણી સફળતા ઓછી છે.
- અંડરફિટિંગ: મોડેલ પેટર્નને પકડી શકતું નથી; તાલીમ અને માન્યતા બંને સફળતા ઓછી છે.
સંતુલન શોધવું એ શિક્ષણની કળા છે. આ સંતુલનને મોનિટર કરવા માટે માન્યતા સમૂહ છે: જો માન્યતાની સફળતા ઘટવા લાગે છે જ્યારે તાલીમની સફળતા વધે છે, તો ઓવરલેર્નિંગ શરૂ થઈ ગયું છે.
ટીપ: દરેક પગલા પર તાલીમ અને માન્યતાની ખોટ એકસાથે બનાવો. જે બિંદુએ બે વળાંકો અલગ થવાનું શરૂ કરે છે તે તે સ્થાન છે જ્યાં અતિશય શીખવાની શરૂઆત થાય છે અને તે "વહેલાં રોકાવા" માટે યોગ્ય ક્ષણ છે.
મેટ્રિક પસંદગી: સૌથી મહત્વપૂર્ણ નિર્ણય
ખોટા મેટ્રિકથી સારા મોડલ ખરાબ દેખાય છે અને ખરાબ મોડલ સારું દેખાય છે. સમસ્યા મેટ્રિક નક્કી કરે છે:
- અસંતુલિત વર્ગીકરણ (એક વર્ગ ખૂબ જ દુર્લભ છે, દા.ત. છેતરપિંડી): ચોકસાઈ ભ્રામક છે. એક મોડેલ કે જે કહે છે કે "બધું સામાન્ય કરો" 99% ચોકસાઈ મેળવશે પરંતુ એક પણ છેતરપિંડી પકડશે નહીં. તેના બદલે, ચોકસાઇ (મેં જે પકડ્યું તેમાંથી કેટલું ખરેખર હકારાત્મક છે), યાદ કરો (મેં જે પકડ્યું તેમાંથી કેટલું સાચું હકારાત્મક છે) અને તેમની બેલેન્સ F1 અથવા PR-AUC નો ઉપયોગ કરવામાં આવે છે.
- સંતુલિત વર્ગીકરણ: ચોકસાઈ અને ROC-AUC યોગ્ય હોઈ શકે છે.
- રીગ્રેસન (સંખ્યાનો અંદાજ): MAE (સરેરાશ સંપૂર્ણ ભૂલ), RMSE (મોટી ભૂલોને દંડિત કરે છે), MAPE (ટકામાં ભૂલ).
- રેન્કિંગ/સુઝાવ: NDCG, MRR, Recall@K.
ચોકસાઇ અથવા યાદ મહત્વનું છે કે કેમ તે વ્યવસાયના સંદર્ભ પર આધાર રાખે છે. કેન્સર સ્ક્રિનિંગમાં રિકોલ (કોઈપણ દર્દી ખૂટે નહીં) એ પ્રાથમિકતા છે; સ્પામ ફિલ્ટરમાં ચોકસાઈ (સ્પામમાં મહત્વપૂર્ણ ઈ-મેઈલ ન મોકલવી) મહત્વપૂર્ણ છે. આ એક વ્યવસાયિક નિર્ણય છે, તકનીકી નથી, અને એન્જિનિયર અને માલિક દ્વારા એકસાથે લેવામાં આવે છે.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ: "મારા મોડેલના પ્રદર્શનનું મૂલ્યાંકન કરો, ચોકસાઈ 0.97."
શક્તિશાળી પ્રોમ્પ્ટ: "મારી પાસે છેતરપિંડી શોધ મોડલ છે; હકારાત્મક વર્ગ દર 1.5% છે. ચોકસાઈ 0.97 તરીકે નોંધવામાં આવી છે. આ મેટ્રિક કેમ ગેરમાર્ગે દોરનારું હોઈ શકે છે તે સમજાવો, મને કહો કે કયા મેટ્રિક્સ (ચોકસાઇ, યાદ, PR-AUC) મારે પસંદ કરવા જોઈએ અને શા માટે. એ પણ ગણતરી કરો કે 'કૉલ લાઇન' કેટલી સચોટ છે, આ મોડલ પર દરેક વસ્તુ નકારાત્મક જોવા મળે છે, જેથી હું વાસ્તવિક ડેટાને જોઈ શકું.
તફાવત: શક્તિશાળી પ્રોમ્પ્ટ વર્ગ ગુણોત્તર અને વ્યવસાય સંદર્ભ આપે છે; તે બેઝલાઇન મોડલ સરખામણી માટે પણ પૂછે છે — મેટ્રિક અર્થપૂર્ણ છે કે કેમ તે માટે આ સૌથી મહત્વપૂર્ણ એન્કર છે.
બેઝલાઇન: સરખામણી વિના મેટ્રિક અર્થહીન છે
મેટ્રિક પોતે સારું કે ખરાબ નથી હોતું; મૂળભૂત મોડેલ મુજબ તે સારું કે ખરાબ છે. મૂળભૂત મોડલ એ સૌથી સરળ ઉકેલ છે જે ધ્યાનમાં આવે છે: "હંમેશા બહુમતી વર્ગને કહો", "છેલ્લા અઠવાડિયેના મૂલ્યનું પુનરાવર્તન કરો", "માર્ગનો અંદાજ કાઢો". જો તમારું મોડેલ આ સરળ ઉકેલને સ્પષ્ટ રીતે પસાર કરી શકતું નથી, તો બધી જટિલતા કંઈ નથી.
સાવધાન: વાક્ય "મારું મોડેલ 85% સચોટ છે" પોતે કંઈપણ કહેતું નથી. જો બેઝ મોડેલ પહેલાથી જ 84% મેળવે છે, તો તમારું મોડેલ લગભગ નકામું છે; જો બેઝ મોડલ 50% મેળવે છે, તો તમારું મોડેલ સંપૂર્ણ છે. હંમેશા મૂળભૂત મોડેલના સંદર્ભમાં બોલો.
ક્રોસ-વેલિડેશન અને ટ્રસ્ટ
એક જ તાલીમ/પરીક્ષણ વિભાજન તકને કારણે હોઈ શકે છે. ક્રોસ-વેલિડેશન: ડેટાને k ભાગોમાં વિભાજીત કરીને અને દરેક ભાગનું ક્રમિક પરીક્ષણ કરવાથી પ્રદર્શન કેટલું સ્થિર છે તે દર્શાવે છે. 5-ફોલ્ડ ક્રોસ વેલિડેશનમાં તમને પાંચ અલગ-અલગ સ્કોર મળે છે; તેમનું સરેરાશ અને પ્રમાણભૂત વિચલન મહત્વપૂર્ણ છે. જો સરેરાશ 80% છે પરંતુ વિચલન ±12% છે, તો તમારું મોડેલ અસ્થિર છે — તે ડેટાના આગલા બેચમાં ખૂબ જ અલગ રીતે વર્તે છે.
આ "બે મોડલ સરખામણી" માટે પણ મહત્વપૂર્ણ છે. જો મોડેલ A ને 81% અને મોડેલ B ને 82% મળ્યું, તો શું B ખરેખર સારું છે? જો વિચલન ±3% છે, તો આ તફાવત અવાજ હોઈ શકે છે. નક્કી કરતા પહેલા તફાવત નોંધપાત્ર છે કે કેમ તે ધ્યાનમાં લો.
હાયપરપેરામીટર ટ્યુનિંગ: માન્યતા સાથે, પરીક્ષણ નહીં
હાયપરપેરામીટર્સ (સેટિંગ્સ પ્રશિક્ષણ પહેલાં જાતે જ નક્કી કરવામાં આવે છે-શિક્ષણ દર, વૃક્ષની ઊંડાઈ, વગેરે.) માન્યતા સેટ સાથે સેટ કરવામાં આવે છે. ટેસ્ટ સેટનો ઉપયોગ માત્ર એક જ વાર અંતે થાય છે. જો તમે ટેસ્ટ સેટ જોઈને હાયપરપેરામીટર પસંદ કરો છો, તો ટેસ્ટ સેટ દૂષિત થશે અને તમે જે કામગીરીની જાણ કરો છો તે આશાવાદી હશે જે વાસ્તવિકતામાં નથી.
હાઇપરપેરામીટર સર્ચ સ્પેસ ડિઝાઇન કરવામાં અને સર્ચ કોડ (ગ્રીડ સર્ચ, રેન્ડમ સર્ચ, બાયસિયન ઓપ્ટિમાઇઝેશન) લખવામાં આર્ટિફિશિયલ ઇન્ટેલિજન્સ એ સારી સહાયક છે. પરંતુ તમે હજી પણ નક્કી કરો છો "અમે કયા મેટ્રિકને ઑપ્ટિમાઇઝ કરીશું?"
ત્રણ નાના કેસો
કેસ 1 - ચોકસાઈ છટકું. એક તબીબી ટીમને એવા મોડેલ પર ગર્વ હતો જેણે એક દુર્લભ રોગ શોધી કાઢ્યો: 98% ચોકસાઈ. જ્યારે મૂળભૂત મોડેલની સરખામણી કરવામાં આવી હતી, ત્યારે સત્ય બહાર આવ્યું હતું: રોગનો દર 2% હોવાથી, "દરેકને સ્વસ્થ કહો" કહેતા મોડેલને પણ 98% પ્રાપ્ત થયા. મોડેલનું રિકોલ ફક્ત 11% હતું - મોટાભાગના દર્દીઓ ખૂટે છે. એકવાર મેટ્રિક PR-AUC માં રૂપાંતરિત થઈ ગયા પછી, વાસ્તવિક પ્રદર્શન માપવામાં આવ્યું અને મોડેલને ફરીથી ડિઝાઇન કરવામાં આવ્યું.
કેસ 2 - પ્રગતિ માટે ખોટો અવાજ. એક ટીમે મોડલને 86.2% થી 86.9% સુધી સુધારવા માટે મહિનાઓ ગાળ્યા. ક્રોસ-વેલિડેશન દર્શાવે છે કે પૂર્વગ્રહ ±1.4% હતો — તેથી 0.7 પોઈન્ટ "સુધારો" આંકડાકીય અવાજ હતો. ટીમે અવાસ્તવિક કમાણી પર ત્રણ અઠવાડિયા વેડફ્યા હતા. પાઠ: વિચલન કરતાં સુધારો વધારે છે તેની ચકાસણી કર્યા વિના વિજયની ઘોષણા કરશો નહીં.
કેસ 3 - ટેસ્ટ સેટનું દૂષણ. શ્રેષ્ઠ હાયપરપેરામીટર્સ પસંદ કરવા માટે એક એન્જિનિયરે વારંવાર ટેસ્ટ સેટને જોયો. 91% તે ઉત્પાદનમાં ઘટીને 83% નોંધાયું હતું. શા માટે: તેણે અજાણતાં જ ટેસ્ટ સેટને વારંવાર જોઈને (ટેસ્ટ સેટ પર ઓવરલેર્નિંગ) તે મુજબ મોડેલ પસંદ કર્યું હતું. જ્યારે અલગ માન્યતા સેટનો ઉપયોગ કરવામાં આવ્યો હતો ત્યારે રિપોર્ટ કરેલ અને વાસ્તવિક કામગીરી ઓવરલેપ થઈ હતી.
નકલ કરી શકાય તેવા નમૂનાઓ
આ વર્ગીકરણ સમસ્યા માટે યોગ્ય મેટ્રિક પસંદ કરવામાં મને મદદ કરો. સમસ્યા: [શું અનુમાન છે] વર્ગ વિતરણ: [ધન દર
નીચેના બે મોડલ્સની સરખામણીનું મૂલ્યાંકન કરો. મોડલ A ક્રોસ-વેલિડેશન: [સ્કોર્સની સૂચિ] મોડલ B ક્રોસ-વેલિડેશન: [સ્કોર્સની સૂચિ] સરેરાશ અને પ્રમાણભૂત વિચલનની ગણતરી કરો. શું તફાવત આંકડાકીય રીતે મહત્વપૂર્ણ છે અથવા તે વિચલનની અંદર માત્ર અવાજ છે? તમે કયું પસંદ કરવાની ભલામણ કરશો અને શા માટે?
નીચેના માટે આ તાલીમ કોડ તપાસો:1) શું હાઇપરપેરામીટર્સ ટેસ્ટ સેટ અથવા વેલિડેશન સેટ સાથે પસંદ કરવામાં આવ્યા છે? 2) શું વહેલું બંધ કરવાનું સાચા સેટ સાથે મોનિટર કરવામાં આવે છે? 3) શું ઓવરલેર્નિંગ (તાલીમ/માન્યતા નુકશાન તફાવત)ના કોઈ ચિહ્નો છે? કોડ: [કોડ]
આ રીગ્રેસન સમસ્યા માટે મારે કયા MAE, RMSE અને MAPE ની જાણ કરવી જોઈએ?લક્ષ્ય ચલનો સ્કેલ: [શ્રેણી]શું મોટી ભૂલો અપ્રમાણસર રીતે ખરાબ છે (RMSE), અથવા તે બધા સમાન છે (MAE)?શું ત્યાં મૂલ્યો શૂન્યની નજીક છે (શું તેઓ MAPEને વિકૃત કરે છે)?સંક્ષિપ્ત વાજબીતા સાથે સૂચન કરો.
મેટ્રિક પસંદગી કોષ્ટક
સમસ્યાનો પ્રકાર
યોગ્ય મેટ્રિક
ટાળવા માટે
શા માટે
અસંતુલિત વર્ગીકરણ
PR-AUC, F1, રિકોલ
ચોકસાઈ
બહુમતી વર્ગ મેટ્રિકને વધારે છે
સંતુલિત વર્ગીકરણ
ચોકસાઈ, ROC-AUC
-
સંતુલિત ડેટામાં વિશ્વસનીય
રીગ્રેશન (નોંધપાત્ર આઉટલીયર)
RMSE
MAPE (જો શૂન્ય હોય તો)
મોટી ભૂલોને સજા આપે છે
રીગ્રેશન (સમાન વજન)
MAE
-
અર્થઘટન કરવા માટે સરળ
રેન્કિંગ/ ભલામણ
એનડીસીજી, રિકોલ @ કે
ચોકસાઈ
ઓર્ડર મહત્વપૂર્ણ છે
સામાન્ય ભૂલો
- અસંતુલિત ડેટા પર ચોકસાઈનો ઉપયોગ. સૌથી સામાન્ય મેટ્રિક ભૂલ.
- બેઝ મૉડલની સરખામણી ન કરવી. તે મેટ્રિકને તેનો અર્થ ગુમાવે છે.
- હાઇપરપેરામીટર્સ માટે ટેસ્ટ સેટ જોઈ રહ્યા છીએ. આશાવાદી, અવાસ્તવિક પરિણામ.
- એક જ કમ્પાર્ટમેન્ટ પર આધાર રાખવો. ક્રોસ-વેલિડેશન વિના તમે પૂર્વગ્રહ જોશો નહીં.
- પ્રગતિ માટે ખોટો અવાજ. વિચલનમાંથી નાના "સુધારણાઓ" મોટે ભાગે નસીબ છે.
- વ્યવસાય સંદર્ભને અવગણવું. ચોકસાઇ/રિકોલ સંતુલન એ વ્યવસાયનો નિર્ણય છે.
સારાંશમાં
મૉડલ પ્રશિક્ષણમાં વાસ્તવિક કૌશલ્ય એ ઉચ્ચ સંખ્યા પેદા કરવાની નથી, પરંતુ તે સંખ્યાનો અર્થ શું છે તે જાણવું છે. સમસ્યા અને વ્યવસાય સંદર્ભ યોગ્ય મેટ્રિક નક્કી કરે છે; બેઝલાઇન મોડેલ અનુસાર દરેક મેટ્રિકનું અર્થઘટન કરો; ક્રોસ-વેલિડેશન સાથે પૂર્વગ્રહને માપો અને પ્રગતિ માટે ઘોંઘાટને ભૂલશો નહીં; ટેસ્ટ સેટનો ઉપયોગ ફક્ત એક જ સમયે કરો. AI એ પ્રયોગ ડિઝાઇનમાં તમારું ભાગીદાર છે, પરંતુ "પર્યાપ્ત સારા" નો નિર્ણય તમારા અને તમારા પર છે.
એપ્લિકેશન કાર્ય
વર્ગીકરણ મોડેલ માટે: (1) વર્ગ વિતરણ લખો, (2) યોગ્ય આધાર મોડેલ બનાવો અને તેનો સ્કોર માપો, (3) 5-ગણા ક્રોસ માન્યતા સાથે તમારા મોડેલનું મૂલ્યાંકન કરો અને સરેરાશ અને પ્રમાણભૂત વિચલનની જાણ કરો, (4) ચોકસાઈને બદલે સમસ્યા માટે યોગ્ય મેટ્રિકની ગણતરી કરો (દા.ત. PR-AUC). લખો કે તમારું મોડેલ પૂર્વગ્રહ વિના મોટા માર્જિનથી બેઝલાઇન મોડલને હરાવે છે કે કેમ.
ચેકલિસ્ટ
- [ ] મેં સમસ્યાના પ્રકાર અને વ્યવસાય સંદર્ભના આધારે મેટ્રિક પસંદ કર્યું.
- [ ] મેં બેઝ મોડેલ બનાવ્યું અને તેની સામે સરખામણી કરી.
- [ ] મેં ક્રોસ-વેલિડેશન સાથે સરેરાશ અને વિચલનની જાણ કરી.
- [ ] મેં પુષ્ટિ કરી કે સુધારણા વિચલન કરતા વધારે છે.
- [ ] મેં માન્યતા સમૂહ સાથે હાયપરપેરામીટર પસંદ કર્યા છે.
- [ ] મેં માત્ર એક જ વાર ટેસ્ટ સેટનો ઉપયોગ કર્યો છે, ખૂબ જ અંતે.