യൂണിറ്റുകൾ
1. ML എഞ്ചിനീയറിംഗിലെ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ്: പങ്ക്, അതിരുകൾ, മൂല്യനിർണ്ണയം, ഉത്തരവാദിത്തം 2. ഡാറ്റ പൈപ്പ്ലൈൻ: ശേഖരണം, ശുദ്ധീകരണം, ടാഗിംഗ്, പതിപ്പ് 3. മാതൃകാ പരിശീലനവും മൂല്യനിർണ്ണയവും: കൃത്യമായ അളവുകൾ, സത്യസന്ധമായ ബെഞ്ച്മാർക്കിംഗ് 4. LLM അപേക്ഷ: RAG ഉപയോഗിച്ചുള്ള നിങ്ങളുടെ സ്വന്തം ഡാറ്റയെ അടിസ്ഥാനമാക്കിയുള്ള ഉത്തരങ്ങൾ 5. LLM ആപ്ലിക്കേഷൻ: ഏജൻ്റ്സ്, ടൂളിംഗ്, സെക്യൂർ ഓട്ടോമേഷൻ 6. ഫൈൻ-ട്യൂണിംഗ് അടിസ്ഥാനം: എപ്പോൾ, എങ്ങനെ, എന്ത് അപകടസാധ്യതയോടെ 7. MLOps, വിന്യാസം: ലാബിൽ നിന്ന് ഉൽപ്പാദനത്തിലേക്ക് മോഡൽ മാറ്റുന്നു 8. ഇവലും മോണിറ്ററിംഗും: ഉൽപ്പാദനത്തിൽ മോഡൽ യഥാർത്ഥത്തിൽ എന്താണ് ചെയ്യുന്നതെന്ന് അറിയുക 9. സുരക്ഷയും സ്വകാര്യതയും: AI സിസ്റ്റങ്ങളെ പ്രതിരോധിക്കുന്നു 10. പക്ഷപാതം, ധാർമ്മികത, ചെലവ്: ഉത്തരവാദിത്തവും സുസ്ഥിരവുമായ AI എഞ്ചിനീയറിംഗ് 11. പുനരുൽപാദനക്ഷമതയും എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റും: എല്ലാം സംയോജിപ്പിക്കുന്നു
യൂണിറ്റ് 3 / 11

മാതൃകാ പരിശീലനവും മൂല്യനിർണ്ണയവും: കൃത്യമായ അളവുകൾ, സത്യസന്ധമായ ബെഞ്ച്മാർക്കിംഗ്

നേട്ടങ്ങൾ:

  • പ്രശ്‌ന തരത്തിനും ബിസിനസ്സ് സന്ദർഭത്തിനും അനുയോജ്യമായ മെട്രിക് തിരഞ്ഞെടുക്കാനുള്ള കഴിവ് (അസന്തുലിതമായ ഡാറ്റയിൽ പിആർ-എയുസി/വീണ്ടെടുക്കൽ, റിഗ്രഷനിൽ എംഎഇ/ആർഎംഎസ്ഇ) കൂടാതെ പഠനത്തിൽ കൂടുതൽ/അടിസ്ഥാനത്തിൽ തിരിച്ചറിയുക
  • ഓരോ മെട്രിക്കും അടിസ്ഥാനരേഖയ്‌ക്കെതിരെ വ്യാഖ്യാനിക്കാനും വ്യതിയാനം അളക്കാനും ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് പുരോഗതിയിൽ നിന്ന് ശബ്ദത്തെ വേർതിരിക്കാനും ഉള്ള കഴിവ്
  • മൂല്യനിർണ്ണയ സെറ്റ് ഉപയോഗിച്ച് ഹൈപ്പർപാരാമീറ്ററുകൾ ട്യൂൺ ചെയ്തും അവസാനത്തിൽ മാത്രം ടെസ്റ്റ് സെറ്റ് ഉപയോഗിച്ചും ശുഭാപ്തിവിശ്വാസമില്ലാത്ത ഫലങ്ങൾ റിപ്പോർട്ട് ചെയ്യാനുള്ള കഴിവ്

മാതൃകാ പരിശീലനം (പരിശീലനം: ഡാറ്റയിൽ നിന്ന് പാറ്റേണുകൾ പഠിക്കുന്ന പ്രക്രിയ) ML എഞ്ചിനീയറിംഗിൻ്റെ ഏറ്റവും ദൃശ്യവും എന്നാൽ തെറ്റിദ്ധരിപ്പിക്കുന്നതുമായ ഘട്ടമാണ്. "കൃത്യത 95%" പോലെയുള്ള തൃപ്തികരമായ സംഖ്യ ഉത്പാദിപ്പിക്കുന്നതിനാലാണ് ഇത് ദൃശ്യമാകുന്നത്. തെറ്റിദ്ധരിപ്പിക്കുന്നത് കാരണം ആ നമ്പർ പലപ്പോഴും തെറ്റായ ചോദ്യത്തിനുള്ള ശരിയായ ഉത്തരമാണ്. ഈ യൂണിറ്റിൽ, വിദ്യാഭ്യാസവും മൂല്യനിർണ്ണയവും എഞ്ചിനീയറിംഗ് വിഭാഗവുമായി ചർച്ചചെയ്യുന്നു; പരീക്ഷണാത്മക രൂപകല്പനയിൽ പങ്കാളിയായി ഞങ്ങൾ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിക്കുകയും അളവെടുപ്പിൽ തീരുമാനമെടുക്കുകയും ചെയ്യുന്നു.

പരിശീലന ചക്രത്തിൻ്റെ യുക്തി

ഒരു ലോസ് ഫംഗ്‌ഷൻ കുറയ്ക്കുന്നതിലൂടെ ഒരു മോഡൽ ഡാറ്റയിലെ പാറ്റേൺ പഠിക്കുന്നു: മോഡലിൻ്റെ പിശക് സംഖ്യാപരമായി അളക്കുന്ന ഒരു ഫംഗ്ഷൻ. ഒപ്റ്റിമൈസേഷൻ അൽഗോരിതം (ഉദാ. ഗ്രേഡിയൻ്റ് ഡിസെൻ്റ്) പാരാമീറ്ററുകൾ ഘട്ടം ഘട്ടമായി ക്രമീകരിച്ചുകൊണ്ട് നഷ്ടം കുറയ്ക്കുന്നു. പരിശീലന ഡാറ്റ മനഃപാഠമാക്കുകയല്ല, അഭൂതപൂർവമായ ഡാറ്റയിലേക്ക് അതിനെ സാമാന്യവൽക്കരിക്കുക എന്നതാണ് ലക്ഷ്യം.

രണ്ട് പ്രധാന അപകടങ്ങൾ:

  • ഓവർഫിറ്റിംഗ്: മോഡൽ പരിശീലന ഡാറ്റ മനഃപാഠമാക്കുകയും പുതിയ ഡാറ്റയിൽ പരാജയപ്പെടുകയും ചെയ്യുന്നു. പരിശീലന വിജയം ഉയർന്നതാണ്, സ്ഥിരീകരണ വിജയം കുറവാണ്.
  • അണ്ടർഫിറ്റിംഗ്: മോഡലിന് പാറ്റേൺ ക്യാപ്‌ചർ ചെയ്യാൻ കഴിയില്ല; പരിശീലനവും മൂല്യനിർണ്ണയ വിജയവും കുറവാണ്.

ബാലൻസ് കണ്ടെത്തുന്നത് വിദ്യാഭ്യാസ കലയാണ്. ഈ ബാലൻസ് നിരീക്ഷിക്കാൻ മൂല്യനിർണ്ണയ സെറ്റ് ഉണ്ട്: പരിശീലന വിജയം വർദ്ധിക്കുമ്പോൾ മൂല്യനിർണ്ണയ വിജയം കുറയാൻ തുടങ്ങിയാൽ, ഓവർലേണിംഗ് ആരംഭിച്ചു.

നുറുങ്ങ്: ഓരോ ഘട്ടത്തിലും പരിശീലനവും മൂല്യനിർണ്ണയ നഷ്ടവും ഒരുമിച്ച് പ്ലോട്ട് ചെയ്യുക. രണ്ട് വളവുകളും വ്യതിചലിക്കാൻ തുടങ്ങുന്ന ഘട്ടത്തിലാണ് ഓവർലേണിംഗ് ആരംഭിക്കുന്നത്, അത് "നേരത്തെ നിർത്താനുള്ള" ശരിയായ നിമിഷമാണ്.

മെട്രിക് തിരഞ്ഞെടുപ്പ്: ഏറ്റവും നിർണായകമായ തീരുമാനം

തെറ്റായ മെട്രിക് ഒരു നല്ല മോഡലിനെ മോശവും മോശം മോഡലിനെ നല്ലതുമാക്കുന്നു. പ്രശ്നം മെട്രിക് നിർണ്ണയിക്കുന്നു:

  • അസന്തുലിതമായ വർഗ്ഗീകരണം (ഒരു ക്ലാസ് വളരെ അപൂർവമാണ്, ഉദാ. വഞ്ചന): കൃത്യത തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്. "എല്ലാം സാധാരണമായി വിളിക്കുക" എന്ന് പറയുന്ന ഒരു മോഡലിന് 99% കൃത്യത ലഭിക്കും, എന്നാൽ ഒരു തട്ടിപ്പും പിടിക്കപ്പെടില്ല. പകരം, കൃത്യത (ഞാൻ പിടിച്ചതിൽ എത്രത്തോളം യഥാർത്ഥത്തിൽ പോസിറ്റീവ് ആണ്), തിരിച്ചുവിളിക്കുക (ഞാൻ പിടിച്ചതിൽ എത്രത്തോളം യഥാർത്ഥ പോസിറ്റീവ് ആണ്), അവയുടെ ബാലൻസ് F1 അല്ലെങ്കിൽ PR-AUC എന്നിവ ഉപയോഗിക്കുന്നു.
  • സമതുലിതമായ വർഗ്ഗീകരണം: കൃത്യതയും ROC-AUC ഉം ഉചിതമായേക്കാം.
  • റിഗ്രഷൻ (നമ്പർ എസ്റ്റിമേഷൻ): MAE (അർഥം സമ്പൂർണ്ണ പിശക്), RMSE (വലിയ പിശകുകൾക്ക് പിഴ ചുമത്തുന്നു), MAPE (ശതമാനത്തിലെ പിശക്).
  • റാങ്കിംഗ്/ശുപാർശ: NDCG, MRR, Recall@K.

കൃത്യതയോ തിരിച്ചുവിളിക്കലോ പ്രധാനമാണോ എന്നത് ബിസിനസ്സ് സന്ദർഭത്തെ ആശ്രയിച്ചിരിക്കുന്നു. ക്യാൻസർ സ്‌ക്രീനിംഗിൽ തിരിച്ചുവിളിക്കുക (ഒരു രോഗിയെയും കാണാതെ പോകരുത്) മുൻഗണനയാണ്; സ്പാം ഫിൽട്ടറിലെ സൂക്ഷ്മത (സ്പാമിലേക്ക് പ്രധാനപ്പെട്ട ഇ-മെയിലുകൾ അയക്കാതിരിക്കുക) പ്രധാനമാണ്. ഇതൊരു ബിസിനസ്സ് തീരുമാനമാണ്, സാങ്കേതികമായ ഒന്നല്ല, എഞ്ചിനീയറും ഉടമയും ചേർന്ന് എടുത്തതാണ്.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്: "എൻ്റെ മോഡലിൻ്റെ പ്രകടനം വിലയിരുത്തുക, കൃത്യത 0.97."

ശക്തമായ നിർദ്ദേശം: "എനിക്കൊരു തട്ടിപ്പ് കണ്ടെത്തൽ മോഡൽ ഉണ്ട്; പോസിറ്റീവ് ക്ലാസ് നിരക്ക് 1.5% ആണ്. കൃത്യത 0.97 ആയി റിപ്പോർട്ട് ചെയ്തിട്ടുണ്ട്. ഈ മെട്രിക് തെറ്റിദ്ധരിപ്പിക്കുന്നത് എന്തുകൊണ്ടാണെന്ന് വിശദീകരിക്കുക, ഏത് മെട്രിക്കുകളാണ് (പ്രിസിഷൻ, റീകോൾ, PR-AUC) ഞാൻ തിരഞ്ഞെടുക്കേണ്ടതെന്നും എന്തുകൊണ്ടാണെന്നും പറയൂ. കൂടാതെ, ഈ ഡാറ്റാ ചേർത്തിരിക്കുന്ന അടിസ്ഥാന മൂല്യം എത്രത്തോളം കൃത്യമായി കണക്കാക്കാം, അതിനാൽ ഈ ഡാറ്റാ മോഡൽ എത്ര കൃത്യമായും ചേർക്കും."

വ്യത്യാസം: ശക്തമായ പ്രോംപ്റ്റ് ക്ലാസ് അനുപാതവും ബിസിനസ്സ് സന്ദർഭവും നൽകുന്നു; ഇത് ഒരു അടിസ്ഥാന മോഡൽ താരതമ്യത്തിനും ആവശ്യപ്പെടുന്നു - ഒരു മെട്രിക് അർത്ഥവത്തായതാണോ എന്നതിനുള്ള ഏറ്റവും പ്രധാനപ്പെട്ട ആങ്കർ ഇതാണ്.

അടിസ്ഥാനം: താരതമ്യമില്ലാത്ത മെട്രിക് അർത്ഥശൂന്യമാണ്

ഒരു മെട്രിക് സ്വയം നല്ലതോ ചീത്തയോ അല്ല; അടിസ്ഥാന മാതൃകയനുസരിച്ച് ഇത് നല്ലതോ ചീത്തയോ ആണ്. അടിസ്ഥാന മാതൃക എന്നത് മനസ്സിൽ വരുന്ന ഏറ്റവും ലളിതമായ പരിഹാരമാണ്: "എപ്പോഴും ഭൂരിപക്ഷ വിഭാഗത്തോട് പറയുക", "കഴിഞ്ഞ ആഴ്‌ചയിലെ മൂല്യം ആവർത്തിക്കുക", "അർത്ഥം ഊഹിക്കുക". നിങ്ങളുടെ മോഡലിന് ഈ ലളിതമായ പരിഹാരം വ്യക്തമായി കടന്നുപോകാൻ കഴിയുന്നില്ലെങ്കിൽ, എല്ലാ സങ്കീർണ്ണതയും ഒന്നിനും വേണ്ടിയല്ല.

മുന്നറിയിപ്പ്: "എൻ്റെ മോഡൽ 85% കൃത്യമാണ്" എന്ന വാചകം തന്നെ ഒന്നും പറയുന്നില്ല. അടിസ്ഥാന മോഡലിന് ഇതിനകം 84% ലഭിച്ചാൽ, നിങ്ങളുടെ മോഡൽ ഏതാണ്ട് വിലപ്പോവില്ല; അടിസ്ഥാന മോഡലിന് 50% ലഭിക്കുകയാണെങ്കിൽ, നിങ്ങളുടെ മോഡൽ മികച്ചതാണ്. എല്ലായ്പ്പോഴും അടിസ്ഥാന മോഡലിൻ്റെ അടിസ്ഥാനത്തിൽ സംസാരിക്കുക.

ക്രോസ് മൂല്യനിർണ്ണയവും വിശ്വാസവും

ഒരൊറ്റ പരിശീലനം/ടെസ്റ്റിംഗ് വിഭജനം ആകസ്മികത മൂലമാകാം. ക്രോസ്-വാലിഡേഷൻ: ഡാറ്റയെ k ഭാഗങ്ങളായി വിഭജിച്ച് ഓരോ ഭാഗവും തുടർച്ചയായി പരിശോധിക്കുന്നത് പ്രകടനം എത്രത്തോളം സ്ഥിരതയുള്ളതാണെന്ന് കാണിക്കുന്നു. 5 മടങ്ങ് ക്രോസ് മൂല്യനിർണ്ണയത്തിൽ നിങ്ങൾക്ക് അഞ്ച് വ്യത്യസ്ത സ്‌കോറുകൾ ലഭിക്കും; അവയുടെ ശരാശരിയും സ്റ്റാൻഡേർഡ് ഡീവിയേഷനും പ്രധാനമാണ്. ശരാശരി 80% ആണെങ്കിലും വ്യതിയാനം ± 12% ആണെങ്കിൽ, നിങ്ങളുടെ മോഡൽ അസ്ഥിരമാണ് - അടുത്ത ബാച്ച് ഡാറ്റയിൽ ഇത് വളരെ വ്യത്യസ്തമായി പെരുമാറിയേക്കാം.

"രണ്ട് മോഡൽ താരതമ്യത്തിനും" ഇത് നിർണായകമാണ്. മോഡൽ എയ്ക്ക് 81 ശതമാനവും മോഡൽ ബിക്ക് 82 ശതമാനവും ലഭിച്ചാൽ, ബി ശരിക്കും മികച്ചതാണോ? വ്യതിയാനം ± 3% ആണെങ്കിൽ, ഈ വ്യത്യാസം ശബ്ദമായിരിക്കാം. തീരുമാനിക്കുന്നതിന് മുമ്പ് വ്യത്യാസം പ്രധാനമാണോ എന്ന് പരിഗണിക്കുക.

ഹൈപ്പർപാരാമീറ്റർ ട്യൂണിംഗ്: മൂല്യനിർണ്ണയത്തോടെ, പരിശോധനയല്ല

ഹൈപ്പർപാരാമീറ്ററുകൾ (പരിശീലനത്തിന് മുമ്പ് സ്വമേധയാ നിർണ്ണയിക്കുന്ന ക്രമീകരണങ്ങൾ-പഠന നിരക്ക്, മരത്തിൻ്റെ ആഴം മുതലായവ) മൂല്യനിർണ്ണയ സെറ്റ് ഉപയോഗിച്ച് സജ്ജീകരിച്ചിരിക്കുന്നു. ടെസ്റ്റ് സെറ്റ് അവസാനം ഒരു തവണ മാത്രമേ ഉപയോഗിക്കൂ. ടെസ്റ്റ് സെറ്റ് നോക്കി നിങ്ങൾ ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുക്കുകയാണെങ്കിൽ, ടെസ്റ്റ് സെറ്റ് മലിനമാക്കപ്പെടും, നിങ്ങൾ റിപ്പോർട്ട് ചെയ്യുന്ന പ്രകടനം ശുഭാപ്തിവിശ്വാസമുള്ളതായിരിക്കും, അത് യഥാർത്ഥത്തിൽ അങ്ങനെയല്ല.

ഹൈപ്പർപാരാമീറ്റർ സെർച്ച് സ്പേസ് രൂപകൽപ്പന ചെയ്യുന്നതിനും സെർച്ച് കോഡ് (ഗ്രിഡ് സെർച്ച്, റാൻഡം സെർച്ച്, ബയേസിയൻ ഒപ്റ്റിമൈസേഷൻ) എഴുതുന്നതിനും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് നല്ലൊരു സഹായിയാണ്. എന്നാൽ "ഞങ്ങൾ ഏത് മെട്രിക് ഒപ്റ്റിമൈസ് ചെയ്യണമെന്ന്" നിങ്ങൾ ഇപ്പോഴും തീരുമാനിക്കുന്നു.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - കൃത്യത കെണി. ഒരു അപൂർവ രോഗം കണ്ടെത്തിയ ഒരു മാതൃകയിൽ ഒരു മെഡിക്കൽ സംഘം അഭിമാനിക്കുന്നു: 98% കൃത്യത. അടിസ്ഥാന മോഡൽ താരതമ്യം നടത്തിയപ്പോൾ, സത്യം വെളിപ്പെട്ടു: രോഗ നിരക്ക് 2% ആയതിനാൽ, "എല്ലാവരെയും ആരോഗ്യത്തോടെ വിളിക്കൂ" എന്ന് പറഞ്ഞ മോഡലിനും 98% ലഭിച്ചു. മോഡലിൻ്റെ തിരിച്ചുവിളി 11% മാത്രമായിരുന്നു - മിക്ക രോഗികളെയും കാണാതായി. മെട്രിക് PR-AUC ആയി പരിവർത്തനം ചെയ്‌തുകഴിഞ്ഞാൽ, യഥാർത്ഥ പ്രകടനം അളക്കുകയും മോഡൽ പുനർരൂപകൽപ്പന ചെയ്യുകയും ചെയ്തു.

കേസ് 2 - പുരോഗതിക്കായി തെറ്റായ ശബ്ദം. 86.2% ൽ നിന്ന് 86.9% ആയി മോഡൽ മെച്ചപ്പെടുത്താൻ ഒരു ടീം മാസങ്ങൾ ചെലവഴിച്ചു. പക്ഷപാതം ± 1.4% ആണെന്ന് ക്രോസ്-വാലിഡേഷൻ കാണിച്ചു - അതിനാൽ 0.7 പോയിൻ്റ് "മെച്ചപ്പെടുത്തൽ" സ്റ്റാറ്റിസ്റ്റിക്കൽ നോയിസ് ആയിരുന്നു. അയഥാർത്ഥ വരുമാനത്തിനായി ടീം മൂന്നാഴ്ച പാഴാക്കി. പാഠം: വ്യതിയാനത്തേക്കാൾ മെച്ചമാണ് വലുതെന്ന് പരിശോധിക്കാതെ വിജയം പ്രഖ്യാപിക്കരുത്.

കേസ് 3 - ടെസ്റ്റ് സെറ്റിൻ്റെ മലിനീകരണം. മികച്ച ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുക്കാൻ ഒരു എഞ്ചിനീയർ ടെസ്റ്റ് സെറ്റ് ആവർത്തിച്ച് നോക്കി. അത് റിപ്പോർട്ട് ചെയ്ത 91% ഉത്പാദനത്തിൽ 83% ആയി കുറഞ്ഞു. എന്തുകൊണ്ട്: ടെസ്റ്റ് സെറ്റ് വീണ്ടും വീണ്ടും നോക്കി (ടെസ്റ്റ് സെറ്റിൽ ഓവർലേണിംഗ്) അതനുസരിച്ച് അവൻ അറിയാതെ മോഡൽ തിരഞ്ഞെടുത്തു. ഒരു പ്രത്യേക മൂല്യനിർണ്ണയ സെറ്റ് ഉപയോഗിക്കുമ്പോൾ റിപ്പോർട്ടുചെയ്‌തതും യഥാർത്ഥവുമായ പ്രകടനം ഓവർലാപ്പ് ചെയ്‌തു.

പകർത്താവുന്ന ടെംപ്ലേറ്റുകൾ

ഈ വർഗ്ഗീകരണ പ്രശ്നത്തിന് ശരിയായ മെട്രിക് തിരഞ്ഞെടുക്കാൻ എന്നെ സഹായിക്കൂ. പ്രശ്നം: [പ്രവചിക്കപ്പെട്ടത്] ക്ലാസ് വിതരണം: [പോസിറ്റീവ് നിരക്ക്

ഇനിപ്പറയുന്ന രണ്ട് മോഡലുകളുടെ താരതമ്യം വിലയിരുത്തുക. മോഡൽ എ ക്രോസ് മൂല്യനിർണ്ണയം: [സ്കോറുകളുടെ പട്ടിക] മോഡൽ ബി ക്രോസ് മൂല്യനിർണ്ണയം: [സ്കോറുകളുടെ പട്ടിക] ശരാശരിയും സ്റ്റാൻഡേർഡ് ഡീവിയേഷനും കണക്കാക്കുക. വ്യത്യാസം സ്ഥിതിവിവരക്കണക്ക് പ്രാധാന്യമുള്ളതാണോ അതോ വ്യതിചലനത്തിനുള്ളിലെ ശബ്ദം മാത്രമാണോ? ഏതാണ് തിരഞ്ഞെടുക്കാൻ നിങ്ങൾ ശുപാർശ ചെയ്യുന്നത്, എന്തുകൊണ്ട്?

ഇനിപ്പറയുന്നവയ്‌ക്കായി ഈ പരിശീലന കോഡ് പരിശോധിക്കുക:1) ടെസ്റ്റ് സെറ്റ് അല്ലെങ്കിൽ വാലിഡേഷൻ സെറ്റ് ഉപയോഗിച്ച് ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുത്തിട്ടുണ്ടോ?2) ശരിയായ സെറ്റ് ഉപയോഗിച്ച് നേരത്തെ നിർത്തുന്നത് നിരീക്ഷിക്കുന്നുണ്ടോ?3) ഓവർലേണിംഗിൻ്റെ എന്തെങ്കിലും ലക്ഷണങ്ങളുണ്ടോ (പരിശീലനം/സാധുവാക്കൽ നഷ്ട വ്യത്യാസം)? കോഡ്: [കോഡ്]

ഈ റിഗ്രഷൻ പ്രശ്‌നത്തിന് MAE, RMSE, MAPE എന്നിവയിൽ ഏതാണ് ഞാൻ റിപ്പോർട്ട് ചെയ്യേണ്ടത്? ടാർഗെറ്റ് വേരിയബിളിൻ്റെ സ്കെയിൽ: [range]വലിയ പിശകുകൾ ആനുപാതികമായി മോശമാണോ (RMSE), അതോ അവയെല്ലാം തുല്യമാണോ (MAE)? പൂജ്യത്തിനടുത്തുള്ള മൂല്യങ്ങൾ ഉണ്ടോ (അവ MAPE-നെ വളച്ചൊടിക്കുന്നുണ്ടോ)? ഹ്രസ്വമായ ന്യായീകരണത്തോടെ നിർദ്ദേശിക്കുക.

മെട്രിക് തിരഞ്ഞെടുക്കൽ പട്ടിക

പ്രശ്നത്തിൻ്റെ തരം

ഉചിതമായ മെട്രിക്

ഒഴിവാക്കണം

എന്തിന്

അസന്തുലിതമായ വർഗ്ഗീകരണം

PR-AUC, F1, തിരിച്ചുവിളിക്കുക

കൃത്യത

ഭൂരിഭാഗം ക്ലാസ് മെട്രിക് ഊതിപ്പെരുപ്പിക്കുന്നു

സമതുലിതമായ വർഗ്ഗീകരണം

കൃത്യത, ROC-AUC

സമതുലിതമായ ഡാറ്റയിൽ വിശ്വസനീയം

റിഗ്രഷൻ (കാര്യമായ ഔട്ട്‌ലൈയർ)

ആർഎംഎസ്ഇ

MAPE (പൂജ്യം ആണെങ്കിൽ)

വലിയ തെറ്റുകൾ ശിക്ഷിക്കുന്നു

റിഗ്രഷൻ (തുല്യ ഭാരം)

എം.എ.ഇ

വ്യാഖ്യാനിക്കാൻ എളുപ്പമാണ്

റാങ്കിംഗ്/ശുപാർശ

NDCG, Recall@K

കൃത്യത

ക്രമം പ്രധാനമാണ്

സാധാരണ തെറ്റുകൾ

  • അസന്തുലിതമായ ഡാറ്റയിൽ കൃത്യത ഉപയോഗിക്കുന്നു. ഏറ്റവും സാധാരണമായ മെട്രിക് പിശക്.
  • അടിസ്ഥാന മോഡൽ താരതമ്യം ചെയ്യുന്നില്ല. ഇത് മെട്രിക്കിൻ്റെ അർത്ഥം നഷ്ടപ്പെടുത്തുന്നു.
  • ഹൈപ്പർപാരാമീറ്ററുകൾക്കായുള്ള ടെസ്റ്റ് സെറ്റ് നോക്കുന്നു. ശുഭാപ്തിവിശ്വാസം, അയഥാർത്ഥമായ ഫലം.
  • ഒരൊറ്റ കമ്പാർട്ട്മെൻ്റിനെ ആശ്രയിക്കുന്നു. ക്രോസ്-വാലിഡേഷൻ കൂടാതെ നിങ്ങൾ പക്ഷപാതം കാണില്ല.
  • ശബ്ദം പുരോഗതിക്കായി തെറ്റിദ്ധരിക്കുന്നു. വ്യതിയാനത്തിൽ നിന്നുള്ള ചെറിയ "മെച്ചപ്പെടുത്തലുകൾ" മിക്കവാറും ഭാഗ്യമാണ്.
  • ബിസിനസ്സ് പശ്ചാത്തലം അവഗണിക്കുന്നു. പ്രിസിഷൻ/റികോൾ ബാലൻസ് എന്നത് ഒരു ബിസിനസ് തീരുമാനമാണ്.

ചുരുക്കത്തിൽ

മാതൃകാ പരിശീലനത്തിലെ യഥാർത്ഥ വൈദഗ്ദ്ധ്യം ഉയർന്ന സംഖ്യ ഉൽപ്പാദിപ്പിക്കുക എന്നതല്ല, ആ സംഖ്യയുടെ അർത്ഥമെന്താണെന്ന് അറിയുക എന്നതാണ്. പ്രശ്നവും ബിസിനസ്സ് സന്ദർഭവും ശരിയായ മെട്രിക് നിർണ്ണയിക്കുന്നു; ഓരോ മെട്രിക്കും അടിസ്ഥാന മാതൃക അനുസരിച്ച് വ്യാഖ്യാനിക്കുക; ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് പക്ഷപാതം അളക്കുക, ശബ്ദത്തെ പുരോഗതിയായി തെറ്റിദ്ധരിക്കരുത്; ടെസ്റ്റ് സെറ്റ് അവസാനം, ഒരു തവണ മാത്രം ഉപയോഗിക്കുക. പരീക്ഷണ രൂപകൽപനയിൽ AI നിങ്ങളുടെ പങ്കാളിയാണ്, എന്നാൽ "മതി" എന്ന തീരുമാനം നിങ്ങൾക്കും നിങ്ങളുടേതുമാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു ക്ലാസിഫിക്കേഷൻ മോഡലിന്: (1) ക്ലാസ് ഡിസ്ട്രിബ്യൂഷൻ എഴുതുക, (2) അനുയോജ്യമായ ഒരു അടിസ്ഥാന മോഡൽ നിർമ്മിക്കുകയും അതിൻ്റെ സ്കോർ അളക്കുകയും ചെയ്യുക, (3) നിങ്ങളുടെ മോഡൽ 5-മടങ്ങ് ക്രോസ് മൂല്യനിർണ്ണയത്തോടെ വിലയിരുത്തി ശരാശരിയും സ്റ്റാൻഡേർഡ് ഡീവിയേഷനും റിപ്പോർട്ട് ചെയ്യുക, (4) കൃത്യതയ്ക്ക് പകരം പ്രശ്നത്തിന് അനുയോജ്യമായ മെട്രിക് (ഉദാ. PR-AUC) കണക്കാക്കുക. നിങ്ങളുടെ മോഡൽ ബേസ്‌ലൈൻ മോഡലിനെ പക്ഷപാതമില്ലാതെ വലിയ മാർജിനിൽ തോൽപ്പിക്കുന്നുണ്ടോ എന്ന് എഴുതുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] പ്രശ്ന തരത്തെയും ബിസിനസ്സ് സന്ദർഭത്തെയും അടിസ്ഥാനമാക്കി ഞാൻ മെട്രിക് തിരഞ്ഞെടുത്തു.
  • [ ] ഞാൻ ഒരു അടിസ്ഥാന മോഡൽ നിർമ്മിക്കുകയും അതിനോട് താരതമ്യം ചെയ്യുകയും ചെയ്തു.
  • [ ] ഞാൻ ശരാശരിയും വ്യതിയാനവും ക്രോസ്-വാലിഡേഷൻ ഉപയോഗിച്ച് റിപ്പോർട്ട് ചെയ്തു.
  • [ ] വ്യതിയാനത്തേക്കാൾ മെച്ചപ്പെടുത്തൽ വലുതാണെന്ന് ഞാൻ സ്ഥിരീകരിച്ചു.
  • [ ] ഞാൻ മൂല്യനിർണ്ണയ സെറ്റ് ഉള്ള ഹൈപ്പർപാരാമീറ്ററുകൾ തിരഞ്ഞെടുത്തു.
  • [ ] ഞാൻ ടെസ്റ്റ് സെറ്റ് ഒരു തവണ മാത്രമേ ഉപയോഗിച്ചുള്ളൂ, അവസാനം.