യൂണിറ്റുകൾ
1. ഡാറ്റാ സയൻസിലും അനലിറ്റിക്‌സിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: വർക്ക്ഫ്ലോ, റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത 2. വിവര ശേഖരണവും ഉറവിട ധാരണയും: സ്കീമ, സാമ്പിളിംഗ്, ഗുണനിലവാരം, ചോർച്ച അവബോധം 3. ഡാറ്റ ക്ലീനിംഗും പ്രീപ്രോസസിംഗും: നഷ്‌ടമായ മൂല്യം, ഔട്ട്‌ലിയർ, തരം പരിവർത്തനം 4. എക്സ്പ്ലോറേറ്ററി ഡാറ്റ അനാലിസിസ് (EDA): വിതരണങ്ങൾ, ബന്ധങ്ങൾ, പ്രാരംഭ സ്ഥിതിവിവരക്കണക്കുകൾ 5. ഫീച്ചർ എഞ്ചിനീയറിംഗ്: വേരിയൻ്റുകൾ സൃഷ്ടിക്കുന്നു, കോഡിംഗ്, സ്കെയിലിംഗ്, ചോർച്ച ഒഴിവാക്കൽ 6. മോഡൽ ബിൽഡിംഗ്: പ്രശ്ന നിർവചനം, അൽഗോരിതം തിരഞ്ഞെടുക്കൽ, പരിശീലനം/ടെസ്റ്റ് വിഭജനം 7. മോഡൽ മൂല്യനിർണ്ണയം: മെട്രിക്‌സ്, ക്രോസ്-വാലിഡേഷൻ, എക്‌സ്ട്രീം ലേണിംഗ് 8. ദൃശ്യവൽക്കരണവും കഥപറച്ചിലും: കൃത്യമായ ഗ്രാഫിക്സ്, സത്യസന്ധമായ ഗ്രാഫിക്സ് 9. കോഡ് ജനറേഷൻ: പൈത്തൺ (പാണ്ടകൾ), SQL എന്നിവയ്‌ക്കൊപ്പമുള്ള AI-അസിസ്റ്റഡ് അനാലിസിസ് 10. ഡാറ്റ ചോർച്ചയും പുനരുൽപ്പാദനവും: നിശബ്ദ ദുരന്തങ്ങളും അച്ചടക്കവും 11. MLOps ഫൗണ്ടേഷൻ, എത്തിക്സ്, പ്രൈവസി, റെസ്‌പോൺസിബിൾ അനലിറ്റിക്‌സ്
യൂണിറ്റ് 7 / 11

മോഡൽ മൂല്യനിർണ്ണയം: മെട്രിക്‌സ്, ക്രോസ്-വാലിഡേഷൻ, എക്‌സ്ട്രീം ലേണിംഗ്

നേട്ടങ്ങൾ:

  • ജോലിയുടെ ഉദ്ദേശ്യമനുസരിച്ച് ക്ലാസിഫിക്കേഷനും റിഗ്രഷൻ മെട്രിക്‌സും (കൺഫ്യൂഷൻ മാട്രിക്‌സ്, പ്രിസിഷൻ/റീക്കോൾ/F1, MAE/RMSE/R²) തിരഞ്ഞെടുത്ത് വ്യാഖ്യാനിക്കാനുള്ള കഴിവ്
  • പരിശീലനവും ടെസ്റ്റ് സ്കോറുകളും താരതമ്യം ചെയ്തുകൊണ്ട് ഓവർലേണിംഗ് കണ്ടെത്താനും ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് വിശ്വസനീയമായ പ്രകടനം നേടാനുമുള്ള കഴിവ്
  • ഓരോ മോഡലും ഒരു ബേസ്‌ലൈനുമായി താരതമ്യപ്പെടുത്തി യഥാർത്ഥ മൂല്യം ചേർക്കുന്നുണ്ടോ എന്ന് വിലയിരുത്താനുള്ള കഴിവ്

ഒരു മോഡൽ സജ്ജീകരിക്കുന്നത് എളുപ്പമാണ്; ഇത് യഥാർത്ഥത്തിൽ പ്രവർത്തിക്കുന്നുണ്ടോ എന്ന് സത്യസന്ധമായി അളക്കാൻ പ്രയാസമാണ്. ഈ യൂണിറ്റിൻ്റെ വിഷയം ഒരു ഡാറ്റാ സയൻ്റിസ്റ്റിൻ്റെ ഏറ്റവും നിർണായകമായ വൈദഗ്ധ്യമാണ്: ശരിയായ അളവുകൾ ഉപയോഗിച്ച് മോഡൽ വിലയിരുത്തുക, വിശ്വസനീയമായ പ്രവചന പ്രകടനം നേടുക, ഏറ്റവും വഞ്ചനാപരമായ കെണി പിടിക്കുക: ഓവർലേണിംഗ് (മെമ്മറിസേഷൻ). AI അളവുകൾ കണക്കാക്കുകയും വ്യാഖ്യാനിക്കുകയും താരതമ്യം ചെയ്യുകയും ചെയ്യുന്നു; എന്നാൽ നിങ്ങളുടെ ബിസിനസ്സിന് അനുയോജ്യമായ മെട്രിക് ഏതെന്നും ഒരു മോഡൽ "മതിയായത്" ആണോ എന്നും തീരുമാനിക്കേണ്ടത് മനുഷ്യനാണ്. തെറ്റായ മെട്രിക് നോക്കുന്ന ഒരു ടീമിന് മാസങ്ങളോളം മോശം മോഡലിനെ "വിജയം" ആയി തെറ്റിദ്ധരിച്ചേക്കാം.

എന്തുകൊണ്ട് കൃത്യത മതിയാകുന്നില്ല: ആശയക്കുഴപ്പം മാട്രിക്സ്

വർഗ്ഗീകരണത്തിൽ മനസ്സിൽ വരുന്ന ആദ്യത്തെ മെട്രിക് കൃത്യതയാണ് (കൃത്യത - ശരിയായ പ്രവചനങ്ങളുടെ ആകെ അനുപാതം). എന്നാൽ യൂണിറ്റ് 6 ൽ നമ്മൾ കണ്ടതുപോലെ, അസന്തുലിതമായ ഡാറ്റ ഉപയോഗിച്ച് കൃത്യത തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്. ഒരു മികച്ച തുടക്കം കൺഫ്യൂഷൻ മാട്രിക്സ് ആണ് - പ്രവചനങ്ങളെ നാല് ബിന്നുകളായി വിഭജിക്കുന്ന ഒരു പട്ടിക:

  • ട്രൂ പോസിറ്റീവ് (ടിപി): യഥാർത്ഥത്തിൽ വ്യാജമായതിനെ ഞങ്ങൾ വ്യാജമെന്ന് വിളിച്ചു. (നല്ലത്)
  • ട്രൂ നെഗറ്റീവ് (TN): ഞങ്ങൾ പറഞ്ഞത് ശരിക്കും ശുദ്ധമാണ്. (നല്ലത്)
  • ഫാൾസ് പോസിറ്റീവ് (FP): വൃത്തിയുള്ളത് വ്യാജമാണെന്ന് ഞങ്ങൾ തെറ്റിദ്ധരിച്ചു. (തെറ്റായ അലാറം)
  • തെറ്റായ നെഗറ്റീവ് (FN): ഞങ്ങൾ വ്യാജം നഷ്‌ടപ്പെടുകയും അതിനെ ക്ലീൻ എന്ന് വിളിക്കുകയും ചെയ്തു. (നഷ്ടപ്പെട്ട ഭീഷണി)

ഈ നാല് ബോക്സുകളിൽ നിന്ന് രണ്ട് പ്രധാന മെട്രിക്കുകൾ ഉരുത്തിരിഞ്ഞു. കൃത്യത: "ഞാൻ വ്യാജമെന്ന് വിളിക്കുന്നവയിൽ എത്രത്തോളം വ്യാജമാണ്?" - തെറ്റായ അലാറം ചെലവുകൾ ഉയർന്നതാണെങ്കിൽ പ്രധാനമാണ്. സെൻസിറ്റിവിറ്റി (ഇംഗ്ലീഷിൽ തിരിച്ചുവിളിക്കുക): "ഞാൻ എത്ര യഥാർത്ഥ വ്യാജന്മാരെ പിടികൂടി?" - ഒരു ഭീഷണി നഷ്‌ടപ്പെടുമ്പോൾ അത് വിലയേറിയതാണ്. രണ്ടും പലപ്പോഴും പരസ്പരം വൈരുദ്ധ്യത്തിലാണ്: നിങ്ങൾ പരിധി താഴ്ത്തി "വ്യാജം" എന്ന് പറഞ്ഞാൽ, ഓർമ്മപ്പെടുത്തൽ വർദ്ധിക്കും, പക്ഷേ കൃത്യത കുറയുന്നു. ഇവ രണ്ടിൻ്റെയും സന്തുലിത ശരാശരി (ഹാർമോണിക് ശരാശരി) ആണ് F1 സ്കോർ.

ശ്രദ്ധിക്കുക: "ഏത് മെട്രിക് പ്രധാനമാണ്" എന്ന ചോദ്യത്തിനുള്ള ഉത്തരം ഒരു ബിസിനസ്സ് തീരുമാനമാണ്, സാങ്കേതികമായ ഒന്നല്ല. കാൻസർ സ്‌ക്രീനിംഗിൽ ഒരു കേസ് നഷ്‌ടപ്പെടുന്നത് (കുറഞ്ഞ തിരിച്ചുവിളിക്കൽ) വിനാശകരമാണ്; സ്പാം ഫിൽട്ടറിൽ സ്പാമിലേക്ക് (കുറഞ്ഞ കൃത്യത) ഒരു പ്രധാന ഇമെയിൽ അയയ്ക്കുന്നത് അരോചകമാണ്. ചെലവ് മെട്രിക് നിർണ്ണയിക്കുന്നു.

റിഗ്രഷൻ മെട്രിക്സ്

ഔട്ട്പുട്ട് നമ്പറുകളാണെങ്കിൽ, വ്യത്യസ്ത അളവുകൾ ഉപയോഗിക്കുന്നു. MAE (അർത്ഥം സമ്പൂർണ്ണ പിശക്): എസ്റ്റിമേറ്റുകൾ യഥാർത്ഥ ശരാശരിയിൽ നിന്ന് എത്രമാത്രം വ്യതിചലിക്കുന്നു, അതേ യൂണിറ്റിൽ (ഉദാ. "ഞങ്ങൾക്ക് ശരാശരി 4,200 TL തെറ്റാണ്"). RMSE (റൂട്ട് മീൻ സ്‌ക്വയേർഡ് എറർ): പ്രധാന പിശകുകൾക്ക് കൂടുതൽ കഠിനമായി പിഴ ചുമത്തുകയും ഔട്ട്‌ലൈയറുകളോട് സംവേദനക്ഷമത കാണിക്കുകയും ചെയ്യുന്നു. R² (R-squared — coficiency of determination): മോഡൽ വിശദീകരിക്കുന്ന ടാർഗെറ്റിലെ വ്യതിയാനം എത്രയാണ് (1 ന് അടുത്ത് നല്ലത്, 0 ശരാശരി പ്രവചിക്കുന്നത് പോലെ മോശമാണ്, നെഗറ്റീവ് അതിലും മോശമാണ്).

ഏറ്റവും വഞ്ചനാപരമായ കെണി: ഓവർലേണിംഗ്

ഓവർഫിറ്റിംഗ് - മോഡൽ പരിശീലന ഡാറ്റ മനഃപാഠമാക്കുന്നു, എന്നാൽ പുതിയ ഡാറ്റയിൽ പരാജയപ്പെടുന്നു - ഡാറ്റാ സയൻസിലെ ഏറ്റവും സാധാരണമായ തെറ്റാണ്. ലക്ഷണം വ്യക്തമാണ്: പരിശീലന സെറ്റിൽ മോഡൽ മികച്ചതാണ് (98%), ടെസ്റ്റ് സെറ്റിൽ മോശം (72%). ഡാറ്റയിലെ യഥാർത്ഥ പാറ്റേണല്ല, ആ പ്രത്യേക സാമ്പിളിൻ്റെ ശബ്ദമാണ് മോഡൽ ഓർമ്മിച്ചത്. വിപരീതവും ഉണ്ട്: അണ്ടർഫിറ്റിംഗ് - പരിശീലനത്തിലും പരിശോധനയിലും മോഡൽ മോശമാണ്, കാരണം പാറ്റേൺ ക്യാപ്‌ചർ ചെയ്യാൻ വളരെ ലളിതമാണ്.

ഓവർലേണിംഗിനെ ചെറുക്കാനുള്ള വഴികൾ: മോഡൽ ലളിതമാക്കൽ, കൂടുതൽ ഡാറ്റ, റെഗുലറൈസേഷൻ - മോഡലിനെ സങ്കീർണ്ണമാക്കുന്നതിൽ നിന്ന് തടയുന്ന ഗണിതശാസ്ത്ര ബ്രേക്ക് - ഏറ്റവും പ്രധാനമായി, ക്രോസ്-വാലിഡേഷൻ.

ക്രോസ് മൂല്യനിർണ്ണയം: ഒറ്റ പാളി വിശ്വസിക്കരുത്

ഒരൊറ്റ പരിശീലനം/ടെസ്റ്റ് പോഡ് ഭാഗ്യമോ നിർഭാഗ്യമോ ആകാം; ആ സാമ്പിൾ എളുപ്പമായതിനാൽ നിങ്ങൾക്ക് ടെസ്റ്റ് സെറ്റിന് ഉയർന്ന മാർക്ക് ലഭിക്കും. ക്രോസ്-വാലിഡേഷൻ (ചുരുക്കത്തിൽ CV) ഇത് പരിഹരിക്കുന്നു. ഏറ്റവും സാധാരണമായ രൂപം k-fold CV ആണ്: ഡാറ്റയെ k ഭാഗങ്ങളായി തിരിച്ചിരിക്കുന്നു (ഉദാ. 5); ഓരോ റൗണ്ടിലും, ഒരു ഭാഗം ടെസ്റ്റിംഗും ബാക്കിയുള്ളത് പരിശീലനവുമാണ്; ഇത് 5 തവണ കറങ്ങുകയും 5 സ്കോറുകൾ ശരാശരി കണക്കാക്കുകയും ചെയ്യുന്നു. അതിനാൽ, പ്രകടനം ഒന്നിലധികം വിഭജനങ്ങളുടെ ശരാശരിയെ അടിസ്ഥാനമാക്കിയുള്ളതാണെന്ന് നിങ്ങൾ കാണും, ഒരൊറ്റ ലക്കി സ്പ്ലിറ്റല്ല. സ്കോറുകളുടെ വിതരണവും വിവരദായകമാണ്: വളരെ അസ്ഥിരമായ സ്കോറുകൾ (ഒരു നിലയിൽ 85%, മറ്റൊന്ന് 62%) മോഡൽ അസ്ഥിരമാണെന്ന് സൂചിപ്പിക്കുന്നു.

സമയ ശ്രേണിയിൽ സാധാരണ k-fold ഉപയോഗിക്കുന്നില്ല (ഭാവിയെ ചോർത്തുന്നു); പകരം, നിങ്ങൾ "ഫോർവേർഡ് ചെയിനിംഗ്" (സമയ ശ്രേണി വിഭജനം) ചെയ്യുന്നു: എല്ലായ്പ്പോഴും ഭൂതകാലത്തെ പരിശീലിപ്പിക്കുകയും ഭാവി പരീക്ഷിക്കുകയും ചെയ്യുക.

മെട്രിക്

പ്രശ്നത്തിൻ്റെ തരം

എപ്പോഴാണ് അത് പ്രധാനം?

കൃത്യത

വർഗ്ഗീകരണം

ക്ലാസുകൾ സമതുലിതമാണെങ്കിൽ

കൃത്യത

വർഗ്ഗീകരണം

തെറ്റായ അലാറം ചെലവേറിയതാണ്

സംവേദനക്ഷമത (ഓർമ്മപ്പെടുത്തൽ)

വർഗ്ഗീകരണം

നഷ്ടപ്പെടുത്തുന്നത് ചെലവേറിയതാണെങ്കിൽ

F1

വർഗ്ഗീകരണം

ബാലൻസ് വേണമെങ്കിൽ

എം.എ.ഇ

റിഗ്രഷൻ

വ്യാഖ്യാനിക്കാവുന്ന തെറ്റ്

ആർഎംഎസ്ഇ

റിഗ്രഷൻ

വലിയ തെറ്റുകൾ നിർണായകമാണെങ്കിൽ

റിഗ്രഷൻ

വിശദീകരണ ശക്തി

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - ഉയർന്ന കൃത്യതയുടെ മിഥ്യാധാരണ. ഒരു തട്ടിപ്പ് മോഡൽ 99.2% കൃത്യത കാണിക്കുകയും ടീം ആഘോഷിക്കുകയും ചെയ്തു. കൺഫ്യൂഷൻ മാട്രിക്സ് നോക്കുമ്പോൾ, യഥാർത്ഥമായത്: ഡാറ്റയിലെ വ്യാജ നിരക്ക് 0.8% ആയിരുന്നു; "എല്ലാം വ്യക്തമാണ്" എന്ന് പറഞ്ഞുകൊണ്ട് മോഡലിന് മിക്കവാറും വ്യാജങ്ങളൊന്നും പിടികിട്ടിയില്ല. തിരിച്ചുവിളിച്ചത് 6% ആയിരുന്നു. പാഠം: അളവുകൾ നോക്കുക, കൃത്യതയല്ല.

കേസ് 2 - ഒളിഞ്ഞിരിക്കുന്ന ഓവർലേണിംഗ്. പരിശീലന സെറ്റിൽ ഒരു ടീം ഡെലിവർ ചെയ്യുകയും XGBoost 97% ആയി ഉയർത്തുകയും ചെയ്തു. ടെസ്റ്റ് സെറ്റ് 69% ആയിരുന്നു, പക്ഷേ ആരും നോക്കിയില്ല. നിർമ്മാണത്തിൽ മോഡൽ തകർന്നു. ക്രോസ്-വാലിഡേഷൻ നടത്തിയിരുന്നെങ്കിൽ, ഫോൾഡുകൾ തമ്മിലുള്ള വലിയ വ്യത്യാസം (ഓവർലേണിംഗ്) തുടക്കം മുതൽ കാണാമായിരുന്നു. പാഠം: വിദ്യാഭ്യാസ സ്‌കോറല്ല, സിവിയെയും ടെസ്റ്റ് സ്‌കോറിനെയും വിശ്വസിക്കുക.

കേസ് 3 - ലക്കി സ്പ്ലിറ്റ്. ഒറ്റ വിഭജനത്തിൽ 88% ലഭിച്ചതിൽ ഒരു അനലിസ്റ്റ് സന്തോഷിച്ചു. അവൻ്റെ സഹപ്രവർത്തകൻ 5 മടങ്ങ് CV ചെയ്തപ്പോൾ, സ്കോറുകൾ 88%, 71%, 83%, 64%, 79% - ശരാശരി 77% ആണ്, പക്ഷേ ഇത് വളരെ അസ്ഥിരമാണ്. മോഡൽ അസ്ഥിരമായിരുന്നു; സിംഗിൾ കമ്പാർട്ട്മെൻ്റ് തെറ്റിദ്ധരിപ്പിക്കുന്നതായിരുന്നു. പാഠം: വ്യക്തിഗത ബിന്നല്ല, CV ശരാശരിയും വിതരണവും നോക്കുക.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) മുഴുവൻ വർഗ്ഗീകരണ റിപ്പോർട്ട്:

എനിക്ക് പരിശീലനം ലഭിച്ച മോഡലും ടെസ്റ്റ് സെറ്റും ഉണ്ട്. ജനറേറ്റ് ചെയ്യുക: കൺഫ്യൂഷൻ മാട്രിക്സ്, പ്രിസിഷൻ, റീകോൾ, F1 (ഓരോ ക്ലാസിനും) പിന്തുണയുടെ എണ്ണവും. ഞാൻ അനുമാനിക്കുകയാണ്, പക്ഷേ ഇത് എൻ്റെ തീരുമാനമാണ്: ഏത് മെട്രിക് ആണ് പ്രധാനമെന്ന് ഞാൻ നിങ്ങളോട് പറയും. അസന്തുലിതമായ ഡാറ്റ ഉപയോഗിച്ച് കൃത്യത തെറ്റിദ്ധരിപ്പിക്കുമെന്ന് ശ്രദ്ധിക്കുക.

2) ഓവർലേണിംഗ് നിയന്ത്രണം:

ട്രെയിനിംഗ്, ടെസ്റ്റ് സെറ്റുകളിൽ എൻ്റെ മോഡലിൻ്റെ സ്കോറുകൾ വശങ്ങളിലായി പ്രിൻ്റ് ചെയ്യുക. അവ തമ്മിലുള്ള വ്യത്യാസം കണക്കാക്കുക, ഒരു വലിയ വ്യത്യാസം ഓവർലേണിംഗിൻ്റെ അടയാളമായതിനാൽ മുന്നറിയിപ്പ് നൽകുക. വ്യത്യാസം വലുതാണെങ്കിൽ, ക്രമപ്പെടുത്തൽ അല്ലെങ്കിൽ ലളിതമാക്കാൻ നിർദ്ദേശിക്കുക.

3) ക്രോസ് മൂല്യനിർണ്ണയം:

5 മടങ്ങ് ക്രോസ് മൂല്യനിർണ്ണയം നടത്തുക (സ്ട്രാറ്റിഫൈഡ്, വർഗ്ഗീകരണത്തിന്). ഓരോ ഫോൾഡിൻ്റെയും സ്കോർ, ശരാശരി, സ്റ്റാൻഡേർഡ് ഡീവിയേഷൻ എന്നിവ പ്രിൻ്റ് ചെയ്യുക. സ്കോറുകൾ വളരെ അസ്ഥിരമാണെങ്കിൽ (ഉയർന്ന എസ്ടിഡി), മോഡൽ അസ്ഥിരമാണെന്ന് സൂചിപ്പിക്കുക. പൈപ്പ് ലൈനുകൾ ഉപയോഗിക്കുക, അങ്ങനെ പരിവർത്തനങ്ങൾ ഓരോ ലെയറിലുമുള്ള പരിശീലന ഭാഗത്തിൽ നിന്ന് മാത്രമേ പഠിക്കൂ.

4) അടിസ്ഥാന താരതമ്യം:

ഒരു ഡമ്മിക്ലാസിഫയർ ബേസ്‌ലൈൻ ഉപയോഗിച്ച് എൻ്റെ മോഡലിൻ്റെ മെട്രിക് വശങ്ങളിലായി വയ്ക്കുക. മോഡൽ അടിസ്ഥാനരേഖയെ ഗണ്യമായി തോൽപ്പിക്കുന്നുണ്ടോ? അത് കടന്നുപോകുന്നില്ലെങ്കിൽ, മോഡൽ യഥാർത്ഥ മൂല്യം ചേർക്കുന്നില്ലെന്ന് വ്യക്തമാക്കുക.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്:

എൻ്റെ മോഡൽ നല്ലതാണോ?

"നല്ലത്" എന്നത് നിർവചിക്കപ്പെട്ടിട്ടില്ല; ഏത് മെട്രിക്, ഏത് പരിധി, ഏത് അടിസ്ഥാനരേഖ എന്നിവ വ്യക്തമല്ല. AI-ക്ക് ഒരൊറ്റ കൃത്യത നമ്പർ നൽകാനും തെറ്റിദ്ധരിപ്പിക്കാനും കഴിയും.

ശക്തമായ നിർദ്ദേശം:

നിങ്ങളുടെ റോൾ: മൂല്യനിർണ്ണയ സഹായി. വർഗ്ഗീകരണം, അസന്തുലിതമായ ഡാറ്റ (12% പോസിറ്റീവ്). മുൻഗണന: തിരിച്ചുവിളിക്കുക (പോസിറ്റീവുകൾ നഷ്‌ടപ്പെടുത്തരുത്). ടാസ്‌ക്: (1) കൺഫ്യൂഷൻ മാട്രിക്‌സ്,(2) പ്രിസിഷൻ/റീകോൾ/എഫ്1, (3) 5-ഫോൾഡ് സ്‌ട്രാറ്റിഫൈഡ് സിവി ശരാശരിയും എസ്ടിഡിയും,(4) ഡമ്മിക്ലാസിഫയർ ബേസ്‌ലൈൻ താരതമ്യം. തിരിച്ചുവിളിക്കലിലും അടിസ്ഥാന വ്യത്യാസത്തിലും ശ്രദ്ധ കേന്ദ്രീകരിക്കുക, കൃത്യതയല്ല. അഭിപ്രായം പറയൂ, പക്ഷെ ഞാൻ അന്തിമ തീരുമാനം എടുക്കും.

ഇവിടെ, മെട്രിക് മുൻഗണന, സിവി, അടിസ്ഥാന അവസ്ഥ എന്നിവ വ്യക്തമാണ്.

സാധാരണ തെറ്റുകൾ

  • അസന്തുലിതമായ ഡാറ്റയിൽ കൃത്യത വിശ്വസിക്കുന്നു. 99% കൃത്യത ന്യൂനപക്ഷ വിഭാഗത്തെ പിടികൂടിയേക്കില്ല; കൺഫ്യൂഷൻ മാട്രിക്സ് നോക്കുക.
  • നിങ്ങളുടെ വിദ്യാഭ്യാസ സ്കോർ നോക്കുക. ഉയർന്ന വിദ്യാഭ്യാസം, കുറഞ്ഞ ടെസ്റ്റ് സ്കോർ ഓവർലേണിംഗ് ആണ്; എപ്പോഴും രണ്ട് സ്കോറുകൾ താരതമ്യം ചെയ്യുക.
  • ഒരൊറ്റ കമ്പാർട്ട്മെൻ്റിനെ ആശ്രയിക്കുന്നു. ലക്കി ഡിവിഷൻ തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്; ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് ശരാശരിയും വിതരണവും നോക്കുക.
  • അടിസ്ഥാനരേഖയുമായി താരതമ്യപ്പെടുത്തുന്നില്ല. മോഡൽ ഒരു മണ്ടൻ പ്രവചകനെ തോൽപ്പിക്കുന്നുണ്ടോ എന്നറിയാതെ നിങ്ങൾക്ക് "നല്ലത്" എന്ന് പറയാൻ കഴിയില്ല.
  • സമയ ശ്രേണിയിൽ സാധാരണ k-fold ഉപയോഗിക്കുന്നത്. അത് ഭാവിയെ ചോർത്തുന്നു; സമയ ശ്രേണി വിഭജനം ആവശ്യമാണ്.
നുറുങ്ങ്: ഓരോ മോഡലിനും അടുത്തായി മൂന്ന് നമ്പറുകൾ എഴുതുക: പരിശീലന സ്കോർ, ക്രോസ്-വാലിഡേഷൻ ശരാശരി, അടിസ്ഥാന സ്കോർ. ഈ മൂവരും ഒറ്റനോട്ടത്തിൽ ഓവർ ലേണിംഗ് (പരിശീലനം >> CV) കൂടാതെ വിലകുറച്ച് (CV ≈ ബേസ്‌ലൈൻ) വെളിപ്പെടുത്തുന്നു.

ചുരുക്കത്തിൽ

ഒരു മോഡൽ നിർമ്മിക്കുന്നത് എളുപ്പമാണ്, പക്ഷേ അത് സത്യസന്ധമായി വിലയിരുത്തുന്നത് ബുദ്ധിമുട്ടാണ്. വർഗ്ഗീകരണത്തിൽ, ആശയക്കുഴപ്പം മാട്രിക്സ്, കൃത്യത, തിരിച്ചുവിളിക്കൽ എന്നിവ കൃത്യതയേക്കാൾ കൂടുതൽ വിവരദായകമാണ്; ജോലിയുടെ വില ഏതാണ് പ്രധാനമെന്ന് നിർണ്ണയിക്കുന്നു. MAE, RMSE, R² എന്നിവ റിഗ്രഷനിൽ ഉപയോഗിക്കുന്നു. ഏറ്റവും വഞ്ചനാപരമായ കെണി ഓവർലേണിംഗ് ആണ്: എല്ലായ്പ്പോഴും പരിശീലനവും ടെസ്റ്റ് സ്കോറും താരതമ്യം ചെയ്യുക. ക്രോസ് മൂല്യനിർണ്ണയത്തിൻ്റെ ശരാശരിയിലും വിതരണത്തിലും ആശ്രയിക്കുക, ഒരു വിഭജനം പോലുമില്ല; എല്ലാം അടിസ്ഥാനരേഖയുമായി താരതമ്യം ചെയ്യുക. AI ഇവയെല്ലാം കണക്കാക്കുന്നു, എന്നാൽ ഏത് മെട്രിക് ഉപയോഗിക്കണമെന്ന് തീരുമാനിക്കേണ്ടത് മനുഷ്യനാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു ക്ലാസിഫിക്കേഷൻ മോഡലിനായി കൺഫ്യൂഷൻ മാട്രിക്സ്, പ്രിസിഷൻ, റീകോൾ, എഫ്1 എന്നിവ എക്സ്ട്രാക്റ്റ് ചെയ്യുക; തുടർന്ന് 5-മടങ്ങ് ക്രോസ് മൂല്യനിർണ്ണയം നടത്തുകയും ഫോൾഡുകളിലുടനീളം സ്കോർ വിതരണം നോക്കുകയും ചെയ്യുക. അവസാനമായി, പരിശീലന സ്കോർ, സിവി ശരാശരി, ഒരു അടിസ്ഥാന സ്കോർ എന്നിവ വശങ്ങളിലായി എഴുതുക. നിങ്ങളുടെ മോഡൽ കൂടുതൽ പഠിച്ച് അടിസ്ഥാനരേഖ കടന്നുപോകുന്നുണ്ടോ എന്ന് ഒറ്റ വാചകത്തിൽ കമൻ്റ് ചെയ്യുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] ഞാൻ കൃത്യതയ്ക്ക് പകരം ജോലിയുടെ യഥാർത്ഥ മെട്രിക് (കൃത്യത/വീണ്ടെടുക്കൽ/F1 മുതലായവ) നോക്കിയിട്ടുണ്ടോ?
  • [ ] ഞാൻ കൺഫ്യൂഷൻ മാട്രിക്സ് പരിശോധിച്ചിട്ടുണ്ടോ?
  • [ ] ഞാൻ പരിശീലനവും ടെസ്റ്റ് സ്‌കോറും താരതമ്യം ചെയ്‌ത് ഓവർലേണിംഗിനായി പരിശോധിച്ചിട്ടുണ്ടോ?
  • [ ] ഞാൻ ശരാശരിയും വിതരണവും ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് നോക്കിയിട്ടുണ്ടോ?
  • [] ഞാൻ മോഡലിനെ അടിസ്ഥാനരേഖയുമായി താരതമ്യം ചെയ്തിട്ടുണ്ടോ?