നേട്ടങ്ങൾ:
- പ്രശ്ന തരത്തിനും ബിസിനസ്സ് സന്ദർഭത്തിനും അനുയോജ്യമായ മെട്രിക് തിരഞ്ഞെടുക്കാനുള്ള കഴിവ് (അസന്തുലിതമായ ഡാറ്റയിൽ പിആർ-എയുസി/വീണ്ടെടുക്കൽ, റിഗ്രഷനിൽ എംഎഇ/ആർഎംഎസ്ഇ) കൂടാതെ പഠനത്തിൽ കൂടുതൽ/അടിസ്ഥാനത്തിൽ തിരിച്ചറിയുക
- ഓരോ മെട്രിക്കും അടിസ്ഥാനരേഖയ്ക്കെതിരെ വ്യാഖ്യാനിക്കാനും വ്യതിയാനം അളക്കാനും ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് പുരോഗതിയിൽ നിന്ന് ശബ്ദത്തെ വേർതിരിക്കാനും ഉള്ള കഴിവ്
- മൂല്യനിർണ്ണയ സെറ്റ് ഉപയോഗിച്ച് ഹൈപ്പർപാരാമീറ്ററുകൾ ട്യൂൺ ചെയ്തും അവസാനത്തിൽ മാത്രം ടെസ്റ്റ് സെറ്റ് ഉപയോഗിച്ചും ശുഭാപ്തിവിശ്വാസമില്ലാത്ത ഫലങ്ങൾ റിപ്പോർട്ട് ചെയ്യാനുള്ള കഴിവ്
മാതൃകാ പരിശീലനം (പരിശീലനം: ഡാറ്റയിൽ നിന്ന് പാറ്റേണുകൾ പഠിക്കുന്ന പ്രക്രിയ) ML എഞ്ചിനീയറിംഗിൻ്റെ ഏറ്റവും ദൃശ്യവും എന്നാൽ തെറ്റിദ്ധരിപ്പിക്കുന്നതുമായ ഘട്ടമാണ്. "കൃത്യത 95%" പോലെയുള്ള തൃപ്തികരമായ സംഖ്യ ഉത്പാദിപ്പിക്കുന്നതിനാലാണ് ഇത് ദൃശ്യമാകുന്നത്. തെറ്റിദ്ധരിപ്പിക്കുന്നത് കാരണം ആ നമ്പർ പലപ്പോഴും തെറ്റായ ചോദ്യത്തിനുള്ള ശരിയായ ഉത്തരമാണ്. ഈ യൂണിറ്റിൽ, വിദ്യാഭ്യാസവും മൂല്യനിർണ്ണയവും എഞ്ചിനീയറിംഗ് വിഭാഗവുമായി ചർച്ചചെയ്യുന്നു; പരീക്ഷണാത്മക രൂപകല്പനയിൽ പങ്കാളിയായി ഞങ്ങൾ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിക്കുകയും അളവെടുപ്പിൽ തീരുമാനമെടുക്കുകയും ചെയ്യുന്നു.
പരിശീലന ചക്രത്തിൻ്റെ യുക്തി
ഒരു ലോസ് ഫംഗ്ഷൻ കുറയ്ക്കുന്നതിലൂടെ ഒരു മോഡൽ ഡാറ്റയിലെ പാറ്റേൺ പഠിക്കുന്നു: മോഡലിൻ്റെ പിശക് സംഖ്യാപരമായി അളക്കുന്ന ഒരു ഫംഗ്ഷൻ. ഒപ്റ്റിമൈസേഷൻ അൽഗോരിതം (ഉദാ. ഗ്രേഡിയൻ്റ് ഡിസെൻ്റ്) പാരാമീറ്ററുകൾ ഘട്ടം ഘട്ടമായി ക്രമീകരിച്ചുകൊണ്ട് നഷ്ടം കുറയ്ക്കുന്നു. പരിശീലന ഡാറ്റ മനഃപാഠമാക്കുകയല്ല, അഭൂതപൂർവമായ ഡാറ്റയിലേക്ക് അതിനെ സാമാന്യവൽക്കരിക്കുക എന്നതാണ് ലക്ഷ്യം.
രണ്ട് പ്രധാന അപകടങ്ങൾ:
- ഓവർഫിറ്റിംഗ്: മോഡൽ പരിശീലന ഡാറ്റ മനഃപാഠമാക്കുകയും പുതിയ ഡാറ്റയിൽ പരാജയപ്പെടുകയും ചെയ്യുന്നു. പരിശീലന വിജയം ഉയർന്നതാണ്, സ്ഥിരീകരണ വിജയം കുറവാണ്.
- അണ്ടർഫിറ്റിംഗ്: മോഡലിന് പാറ്റേൺ ക്യാപ്ചർ ചെയ്യാൻ കഴിയില്ല; പരിശീലനവും മൂല്യനിർണ്ണയ വിജയവും കുറവാണ്.
ബാലൻസ് കണ്ടെത്തുന്നത് വിദ്യാഭ്യാസ കലയാണ്. ഈ ബാലൻസ് നിരീക്ഷിക്കാൻ മൂല്യനിർണ്ണയ സെറ്റ് ഉണ്ട്: പരിശീലന വിജയം വർദ്ധിക്കുമ്പോൾ മൂല്യനിർണ്ണയ വിജയം കുറയാൻ തുടങ്ങിയാൽ, ഓവർലേണിംഗ് ആരംഭിച്ചു.
നുറുങ്ങ്: ഓരോ ഘട്ടത്തിലും പരിശീലനവും മൂല്യനിർണ്ണയ നഷ്ടവും ഒരുമിച്ച് പ്ലോട്ട് ചെയ്യുക. രണ്ട് വളവുകളും വ്യതിചലിക്കാൻ തുടങ്ങുന്ന ഘട്ടത്തിലാണ് ഓവർലേണിംഗ് ആരംഭിക്കുന്നത്, അത് "നേരത്തെ നിർത്താനുള്ള" ശരിയായ നിമിഷമാണ്.
മെട്രിക് തിരഞ്ഞെടുപ്പ്: ഏറ്റവും നിർണായകമായ തീരുമാനം
തെറ്റായ മെട്രിക് ഒരു നല്ല മോഡലിനെ മോശവും മോശം മോഡലിനെ നല്ലതുമാക്കുന്നു. പ്രശ്നം മെട്രിക് നിർണ്ണയിക്കുന്നു:
- അസന്തുലിതമായ വർഗ്ഗീകരണം (ഒരു ക്ലാസ് വളരെ അപൂർവമാണ്, ഉദാ. വഞ്ചന): കൃത്യത തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്. "എല്ലാം സാധാരണമായി വിളിക്കുക" എന്ന് പറയുന്ന ഒരു മോഡലിന് 99% കൃത്യത ലഭിക്കും, എന്നാൽ ഒരു തട്ടിപ്പും പിടിക്കപ്പെടില്ല. പകരം, കൃത്യത (ഞാൻ പിടിച്ചതിൽ എത്രത്തോളം യഥാർത്ഥത്തിൽ പോസിറ്റീവ് ആണ്), തിരിച്ചുവിളിക്കുക (ഞാൻ പിടിച്ചതിൽ എത്രത്തോളം യഥാർത്ഥ പോസിറ്റീവ് ആണ്), അവയുടെ ബാലൻസ് F1 അല്ലെങ്കിൽ PR-AUC എന്നിവ ഉപയോഗിക്കുന്നു.
- സമതുലിതമായ വർഗ്ഗീകരണം: കൃത്യതയും ROC-AUC ഉം ഉചിതമായേക്കാം.
- റിഗ്രഷൻ (നമ്പർ എസ്റ്റിമേഷൻ): MAE (അർഥം സമ്പൂർണ്ണ പിശക്), RMSE (വലിയ പിശകുകൾക്ക് പിഴ ചുമത്തുന്നു), MAPE (ശതമാനത്തിലെ പിശക്).
- റാങ്കിംഗ്/ശുപാർശ: NDCG, MRR, Recall@K.
കൃത്യതയോ തിരിച്ചുവിളിക്കലോ പ്രധാനമാണോ എന്നത് ബിസിനസ്സ് സന്ദർഭത്തെ ആശ്രയിച്ചിരിക്കുന്നു. ക്യാൻസർ സ്ക്രീനിംഗിൽ തിരിച്ചുവിളിക്കുക (ഒരു രോഗിയെയും കാണാതെ പോകരുത്) മുൻഗണനയാണ്; സ്പാം ഫിൽട്ടറിലെ സൂക്ഷ്മത (സ്പാമിലേക്ക് പ്രധാനപ്പെട്ട ഇ-മെയിലുകൾ അയക്കാതിരിക്കുക) പ്രധാനമാണ്. ഇതൊരു ബിസിനസ്സ് തീരുമാനമാണ്, സാങ്കേതികമായ ഒന്നല്ല, എഞ്ചിനീയറും ഉടമയും ചേർന്ന് എടുത്തതാണ്.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്: "എൻ്റെ മോഡലിൻ്റെ പ്രകടനം വിലയിരുത്തുക, കൃത്യത 0.97."
ശക്തമായ നിർദ്ദേശം: "എനിക്കൊരു തട്ടിപ്പ് കണ്ടെത്തൽ മോഡൽ ഉണ്ട്; പോസിറ്റീവ് ക്ലാസ് നിരക്ക് 1.5% ആണ്. കൃത്യത 0.97 ആയി റിപ്പോർട്ട് ചെയ്തിട്ടുണ്ട്. ഈ മെട്രിക് തെറ്റിദ്ധരിപ്പിക്കുന്നത് എന്തുകൊണ്ടാണെന്ന് വിശദീകരിക്കുക, ഏത് മെട്രിക്കുകളാണ് (പ്രിസിഷൻ, റീകോൾ, PR-AUC) ഞാൻ തിരഞ്ഞെടുക്കേണ്ടതെന്നും എന്തുകൊണ്ടാണെന്നും പറയൂ. കൂടാതെ, ഈ ഡാറ്റാ ചേർത്തിരിക്കുന്ന അടിസ്ഥാന മൂല്യം എത്രത്തോളം കൃത്യമായി കണക്കാക്കാം, അതിനാൽ ഈ ഡാറ്റാ മോഡൽ എത്ര കൃത്യമായും ചേർക്കും."
വ്യത്യാസം: ശക്തമായ പ്രോംപ്റ്റ് ക്ലാസ് അനുപാതവും ബിസിനസ്സ് സന്ദർഭവും നൽകുന്നു; ഇത് ഒരു അടിസ്ഥാന മോഡൽ താരതമ്യത്തിനും ആവശ്യപ്പെടുന്നു - ഒരു മെട്രിക് അർത്ഥവത്തായതാണോ എന്നതിനുള്ള ഏറ്റവും പ്രധാനപ്പെട്ട ആങ്കർ ഇതാണ്.
അടിസ്ഥാനം: താരതമ്യമില്ലാത്ത മെട്രിക് അർത്ഥശൂന്യമാണ്
ഒരു മെട്രിക് സ്വയം നല്ലതോ ചീത്തയോ അല്ല; അടിസ്ഥാന മാതൃകയനുസരിച്ച് ഇത് നല്ലതോ ചീത്തയോ ആണ്. അടിസ്ഥാന മാതൃക എന്നത് മനസ്സിൽ വരുന്ന ഏറ്റവും ലളിതമായ പരിഹാരമാണ്: "എപ്പോഴും ഭൂരിപക്ഷ വിഭാഗത്തോട് പറയുക", "കഴിഞ്ഞ ആഴ്ചയിലെ മൂല്യം ആവർത്തിക്കുക", "അർത്ഥം ഊഹിക്കുക". നിങ്ങളുടെ മോഡലിന് ഈ ലളിതമായ പരിഹാരം വ്യക്തമായി കടന്നുപോകാൻ കഴിയുന്നില്ലെങ്കിൽ, എല്ലാ സങ്കീർണ്ണതയും ഒന്നിനും വേണ്ടിയല്ല.
മുന്നറിയിപ്പ്: "എൻ്റെ മോഡൽ 85% കൃത്യമാണ്" എന്ന വാചകം തന്നെ ഒന്നും പറയുന്നില്ല. അടിസ്ഥാന മോഡലിന് ഇതിനകം 84% ലഭിച്ചാൽ, നിങ്ങളുടെ മോഡൽ ഏതാണ്ട് വിലപ്പോവില്ല; അടിസ്ഥാന മോഡലിന് 50% ലഭിക്കുകയാണെങ്കിൽ, നിങ്ങളുടെ മോഡൽ മികച്ചതാണ്. എല്ലായ്പ്പോഴും അടിസ്ഥാന മോഡലിൻ്റെ അടിസ്ഥാനത്തിൽ സംസാരിക്കുക.
ക്രോസ് മൂല്യനിർണ്ണയവും വിശ്വാസവും
ഒരൊറ്റ പരിശീലനം/ടെസ്റ്റിംഗ് വിഭജനം ആകസ്മികത മൂലമാകാം. ക്രോസ്-വാലിഡേഷൻ: ഡാറ്റയെ k ഭാഗങ്ങളായി വിഭജിച്ച് ഓരോ ഭാഗവും തുടർച്ചയായി പരിശോധിക്കുന്നത് പ്രകടനം എത്രത്തോളം സ്ഥിരതയുള്ളതാണെന്ന് കാണിക്കുന്നു. 5 മടങ്ങ് ക്രോസ് മൂല്യനിർണ്ണയത്തിൽ നിങ്ങൾക്ക് അഞ്ച് വ്യത്യസ്ത സ്കോറുകൾ ലഭിക്കും; അവയുടെ ശരാശരിയും സ്റ്റാൻഡേർഡ് ഡീവിയേഷനും പ്രധാനമാണ്. ശരാശരി 80% ആണെങ്കിലും വ്യതിയാനം ± 12% ആണെങ്കിൽ, നിങ്ങളുടെ മോഡൽ അസ്ഥിരമാണ് - അടുത്ത ബാച്ച് ഡാറ്റയിൽ ഇത് വളരെ വ്യത്യസ്തമായി പെരുമാറിയേക്കാം.
"രണ്ട് മോഡൽ താരതമ്യത്തിനും" ഇത് നിർണായകമാണ്. മോഡൽ എയ്ക്ക് 81 ശതമാനവും മോഡൽ ബിക്ക് 82 ശതമാനവും ലഭിച്ചാൽ, ബി ശരിക്കും മികച്ചതാണോ? വ്യതിയാനം ± 3% ആണെങ്കിൽ, ഈ വ്യത്യാസം ശബ്ദമായിരിക്കാം. തീരുമാനിക്കുന്നതിന് മുമ്പ് വ്യത്യാസം പ്രധാനമാണോ എന്ന് പരിഗണിക്കുക.
ഹൈപ്പർപാരാമീറ്റർ ട്യൂണിംഗ്: മൂല്യനിർണ്ണയത്തോടെ, പരിശോധനയല്ല
ഹൈപ്പർപാരാമീറ്ററുകൾ (പരിശീലനത്തിന് മുമ്പ് സ്വമേധയാ നിർണ്ണയിക്കുന്ന ക്രമീകരണങ്ങൾ-പഠന നിരക്ക്, മരത്തിൻ്റെ ആഴം മുതലായവ) മൂല്യനിർണ്ണയ സെറ്റ് ഉപയോഗിച്ച് സജ്ജീകരിച്ചിരിക്കുന്നു. ടെസ്റ്റ് സെറ്റ് അവസാനം ഒരു തവണ മാത്രമേ ഉപയോഗിക്കൂ. ടെസ്റ്റ് സെറ്റ് നോക്കി നിങ്ങൾ ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുക്കുകയാണെങ്കിൽ, ടെസ്റ്റ് സെറ്റ് മലിനമാക്കപ്പെടും, നിങ്ങൾ റിപ്പോർട്ട് ചെയ്യുന്ന പ്രകടനം ശുഭാപ്തിവിശ്വാസമുള്ളതായിരിക്കും, അത് യഥാർത്ഥത്തിൽ അങ്ങനെയല്ല.
ഹൈപ്പർപാരാമീറ്റർ സെർച്ച് സ്പേസ് രൂപകൽപ്പന ചെയ്യുന്നതിനും സെർച്ച് കോഡ് (ഗ്രിഡ് സെർച്ച്, റാൻഡം സെർച്ച്, ബയേസിയൻ ഒപ്റ്റിമൈസേഷൻ) എഴുതുന്നതിനും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് നല്ലൊരു സഹായിയാണ്. എന്നാൽ "ഞങ്ങൾ ഏത് മെട്രിക് ഒപ്റ്റിമൈസ് ചെയ്യണമെന്ന്" നിങ്ങൾ ഇപ്പോഴും തീരുമാനിക്കുന്നു.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - കൃത്യത കെണി. ഒരു അപൂർവ രോഗം കണ്ടെത്തിയ ഒരു മാതൃകയിൽ ഒരു മെഡിക്കൽ സംഘം അഭിമാനിക്കുന്നു: 98% കൃത്യത. അടിസ്ഥാന മോഡൽ താരതമ്യം നടത്തിയപ്പോൾ, സത്യം വെളിപ്പെട്ടു: രോഗ നിരക്ക് 2% ആയതിനാൽ, "എല്ലാവരെയും ആരോഗ്യത്തോടെ വിളിക്കൂ" എന്ന് പറഞ്ഞ മോഡലിനും 98% ലഭിച്ചു. മോഡലിൻ്റെ തിരിച്ചുവിളി 11% മാത്രമായിരുന്നു - മിക്ക രോഗികളെയും കാണാതായി. മെട്രിക് PR-AUC ആയി പരിവർത്തനം ചെയ്തുകഴിഞ്ഞാൽ, യഥാർത്ഥ പ്രകടനം അളക്കുകയും മോഡൽ പുനർരൂപകൽപ്പന ചെയ്യുകയും ചെയ്തു.
കേസ് 2 - പുരോഗതിക്കായി തെറ്റായ ശബ്ദം. 86.2% ൽ നിന്ന് 86.9% ആയി മോഡൽ മെച്ചപ്പെടുത്താൻ ഒരു ടീം മാസങ്ങൾ ചെലവഴിച്ചു. പക്ഷപാതം ± 1.4% ആണെന്ന് ക്രോസ്-വാലിഡേഷൻ കാണിച്ചു - അതിനാൽ 0.7 പോയിൻ്റ് "മെച്ചപ്പെടുത്തൽ" സ്റ്റാറ്റിസ്റ്റിക്കൽ നോയിസ് ആയിരുന്നു. അയഥാർത്ഥ വരുമാനത്തിനായി ടീം മൂന്നാഴ്ച പാഴാക്കി. പാഠം: വ്യതിയാനത്തേക്കാൾ മെച്ചമാണ് വലുതെന്ന് പരിശോധിക്കാതെ വിജയം പ്രഖ്യാപിക്കരുത്.
കേസ് 3 - ടെസ്റ്റ് സെറ്റിൻ്റെ മലിനീകരണം. മികച്ച ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുക്കാൻ ഒരു എഞ്ചിനീയർ ടെസ്റ്റ് സെറ്റ് ആവർത്തിച്ച് നോക്കി. അത് റിപ്പോർട്ട് ചെയ്ത 91% ഉത്പാദനത്തിൽ 83% ആയി കുറഞ്ഞു. എന്തുകൊണ്ട്: ടെസ്റ്റ് സെറ്റ് വീണ്ടും വീണ്ടും നോക്കി (ടെസ്റ്റ് സെറ്റിൽ ഓവർലേണിംഗ്) അതനുസരിച്ച് അവൻ അറിയാതെ മോഡൽ തിരഞ്ഞെടുത്തു. ഒരു പ്രത്യേക മൂല്യനിർണ്ണയ സെറ്റ് ഉപയോഗിക്കുമ്പോൾ റിപ്പോർട്ടുചെയ്തതും യഥാർത്ഥവുമായ പ്രകടനം ഓവർലാപ്പ് ചെയ്തു.
പകർത്താവുന്ന ടെംപ്ലേറ്റുകൾ
ഈ വർഗ്ഗീകരണ പ്രശ്നത്തിന് ശരിയായ മെട്രിക് തിരഞ്ഞെടുക്കാൻ എന്നെ സഹായിക്കൂ. പ്രശ്നം: [പ്രവചിക്കപ്പെട്ടത്] ക്ലാസ് വിതരണം: [പോസിറ്റീവ് നിരക്ക്
ഇനിപ്പറയുന്ന രണ്ട് മോഡലുകളുടെ താരതമ്യം വിലയിരുത്തുക. മോഡൽ എ ക്രോസ് മൂല്യനിർണ്ണയം: [സ്കോറുകളുടെ പട്ടിക] മോഡൽ ബി ക്രോസ് മൂല്യനിർണ്ണയം: [സ്കോറുകളുടെ പട്ടിക] ശരാശരിയും സ്റ്റാൻഡേർഡ് ഡീവിയേഷനും കണക്കാക്കുക. വ്യത്യാസം സ്ഥിതിവിവരക്കണക്ക് പ്രാധാന്യമുള്ളതാണോ അതോ വ്യതിചലനത്തിനുള്ളിലെ ശബ്ദം മാത്രമാണോ? ഏതാണ് തിരഞ്ഞെടുക്കാൻ നിങ്ങൾ ശുപാർശ ചെയ്യുന്നത്, എന്തുകൊണ്ട്?
ഇനിപ്പറയുന്നവയ്ക്കായി ഈ പരിശീലന കോഡ് പരിശോധിക്കുക:1) ടെസ്റ്റ് സെറ്റ് അല്ലെങ്കിൽ വാലിഡേഷൻ സെറ്റ് ഉപയോഗിച്ച് ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുത്തിട്ടുണ്ടോ?2) ശരിയായ സെറ്റ് ഉപയോഗിച്ച് നേരത്തെ നിർത്തുന്നത് നിരീക്ഷിക്കുന്നുണ്ടോ?3) ഓവർലേണിംഗിൻ്റെ എന്തെങ്കിലും ലക്ഷണങ്ങളുണ്ടോ (പരിശീലനം/സാധുവാക്കൽ നഷ്ട വ്യത്യാസം)? കോഡ്: [കോഡ്]
ഈ റിഗ്രഷൻ പ്രശ്നത്തിന് MAE, RMSE, MAPE എന്നിവയിൽ ഏതാണ് ഞാൻ റിപ്പോർട്ട് ചെയ്യേണ്ടത്? ടാർഗെറ്റ് വേരിയബിളിൻ്റെ സ്കെയിൽ: [range]വലിയ പിശകുകൾ ആനുപാതികമായി മോശമാണോ (RMSE), അതോ അവയെല്ലാം തുല്യമാണോ (MAE)? പൂജ്യത്തിനടുത്തുള്ള മൂല്യങ്ങൾ ഉണ്ടോ (അവ MAPE-നെ വളച്ചൊടിക്കുന്നുണ്ടോ)? ഹ്രസ്വമായ ന്യായീകരണത്തോടെ നിർദ്ദേശിക്കുക.
മെട്രിക് തിരഞ്ഞെടുക്കൽ പട്ടിക
പ്രശ്നത്തിൻ്റെ തരം
ഉചിതമായ മെട്രിക്
ഒഴിവാക്കണം
എന്തിന്
അസന്തുലിതമായ വർഗ്ഗീകരണം
PR-AUC, F1, തിരിച്ചുവിളിക്കുക
കൃത്യത
ഭൂരിഭാഗം ക്ലാസ് മെട്രിക് ഊതിപ്പെരുപ്പിക്കുന്നു
സമതുലിതമായ വർഗ്ഗീകരണം
കൃത്യത, ROC-AUC
—
സമതുലിതമായ ഡാറ്റയിൽ വിശ്വസനീയം
റിഗ്രഷൻ (കാര്യമായ ഔട്ട്ലൈയർ)
ആർഎംഎസ്ഇ
MAPE (പൂജ്യം ആണെങ്കിൽ)
വലിയ തെറ്റുകൾ ശിക്ഷിക്കുന്നു
റിഗ്രഷൻ (തുല്യ ഭാരം)
എം.എ.ഇ
—
വ്യാഖ്യാനിക്കാൻ എളുപ്പമാണ്
റാങ്കിംഗ്/ശുപാർശ
NDCG, Recall@K
കൃത്യത
ക്രമം പ്രധാനമാണ്
സാധാരണ തെറ്റുകൾ
- അസന്തുലിതമായ ഡാറ്റയിൽ കൃത്യത ഉപയോഗിക്കുന്നു. ഏറ്റവും സാധാരണമായ മെട്രിക് പിശക്.
- അടിസ്ഥാന മോഡൽ താരതമ്യം ചെയ്യുന്നില്ല. ഇത് മെട്രിക്കിൻ്റെ അർത്ഥം നഷ്ടപ്പെടുത്തുന്നു.
- ഹൈപ്പർപാരാമീറ്ററുകൾക്കായുള്ള ടെസ്റ്റ് സെറ്റ് നോക്കുന്നു. ശുഭാപ്തിവിശ്വാസം, അയഥാർത്ഥമായ ഫലം.
- ഒരൊറ്റ കമ്പാർട്ട്മെൻ്റിനെ ആശ്രയിക്കുന്നു. ക്രോസ്-വാലിഡേഷൻ കൂടാതെ നിങ്ങൾ പക്ഷപാതം കാണില്ല.
- ശബ്ദം പുരോഗതിക്കായി തെറ്റിദ്ധരിക്കുന്നു. വ്യതിയാനത്തിൽ നിന്നുള്ള ചെറിയ "മെച്ചപ്പെടുത്തലുകൾ" മിക്കവാറും ഭാഗ്യമാണ്.
- ബിസിനസ്സ് പശ്ചാത്തലം അവഗണിക്കുന്നു. പ്രിസിഷൻ/റികോൾ ബാലൻസ് എന്നത് ഒരു ബിസിനസ് തീരുമാനമാണ്.
ചുരുക്കത്തിൽ
മാതൃകാ പരിശീലനത്തിലെ യഥാർത്ഥ വൈദഗ്ദ്ധ്യം ഉയർന്ന സംഖ്യ ഉൽപ്പാദിപ്പിക്കുക എന്നതല്ല, ആ സംഖ്യയുടെ അർത്ഥമെന്താണെന്ന് അറിയുക എന്നതാണ്. പ്രശ്നവും ബിസിനസ്സ് സന്ദർഭവും ശരിയായ മെട്രിക് നിർണ്ണയിക്കുന്നു; ഓരോ മെട്രിക്കും അടിസ്ഥാന മാതൃക അനുസരിച്ച് വ്യാഖ്യാനിക്കുക; ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് പക്ഷപാതം അളക്കുക, ശബ്ദത്തെ പുരോഗതിയായി തെറ്റിദ്ധരിക്കരുത്; ടെസ്റ്റ് സെറ്റ് അവസാനം, ഒരു തവണ മാത്രം ഉപയോഗിക്കുക. പരീക്ഷണ രൂപകൽപനയിൽ AI നിങ്ങളുടെ പങ്കാളിയാണ്, എന്നാൽ "മതി" എന്ന തീരുമാനം നിങ്ങൾക്കും നിങ്ങളുടേതുമാണ്.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു ക്ലാസിഫിക്കേഷൻ മോഡലിന്: (1) ക്ലാസ് ഡിസ്ട്രിബ്യൂഷൻ എഴുതുക, (2) അനുയോജ്യമായ ഒരു അടിസ്ഥാന മോഡൽ നിർമ്മിക്കുകയും അതിൻ്റെ സ്കോർ അളക്കുകയും ചെയ്യുക, (3) നിങ്ങളുടെ മോഡൽ 5-മടങ്ങ് ക്രോസ് മൂല്യനിർണ്ണയത്തോടെ വിലയിരുത്തി ശരാശരിയും സ്റ്റാൻഡേർഡ് ഡീവിയേഷനും റിപ്പോർട്ട് ചെയ്യുക, (4) കൃത്യതയ്ക്ക് പകരം പ്രശ്നത്തിന് അനുയോജ്യമായ മെട്രിക് (ഉദാ. PR-AUC) കണക്കാക്കുക. നിങ്ങളുടെ മോഡൽ ബേസ്ലൈൻ മോഡലിനെ പക്ഷപാതമില്ലാതെ വലിയ മാർജിനിൽ തോൽപ്പിക്കുന്നുണ്ടോ എന്ന് എഴുതുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] പ്രശ്ന തരത്തെയും ബിസിനസ്സ് സന്ദർഭത്തെയും അടിസ്ഥാനമാക്കി ഞാൻ മെട്രിക് തിരഞ്ഞെടുത്തു.
- [ ] ഞാൻ ഒരു അടിസ്ഥാന മോഡൽ നിർമ്മിക്കുകയും അതിനോട് താരതമ്യം ചെയ്യുകയും ചെയ്തു.
- [ ] ഞാൻ ശരാശരിയും വ്യതിയാനവും ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് റിപ്പോർട്ട് ചെയ്തു.
- [ ] വ്യതിയാനത്തേക്കാൾ മെച്ചപ്പെടുത്തൽ വലുതാണെന്ന് ഞാൻ സ്ഥിരീകരിച്ചു.
- [ ] ഞാൻ മൂല്യനിർണ്ണയ സെറ്റ് ഉള്ള ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുത്തു.
- [ ] ഞാൻ ടെസ്റ്റ് സെറ്റ് ഒരു തവണ മാത്രമേ ഉപയോഗിച്ചുള്ളൂ, അവസാനം.