നേട്ടങ്ങൾ:
- ജോലിയുടെ യഥാർത്ഥ ചെലവ് അനുസരിച്ച് പ്രശ്നത്തിൻ്റെ തരവും (വർഗ്ഗീകരണം, റിഗ്രഷൻ, ക്ലസ്റ്ററിംഗ്) വിജയ മാനദണ്ഡവും നിർവചിക്കാനുള്ള കഴിവ്
- ഡാറ്റ സത്യസന്ധമായി വിഭജിക്കാനുള്ള കഴിവ് (ടെസ്റ്റ് സെറ്റിൽ സ്പർശിക്കാതെ; സമയ ശ്രേണിയിൽ കാലക്രമത്തിൽ) ചോർച്ചയില്ലാത്ത മൂല്യനിർണ്ണയ അടിസ്ഥാനം സ്ഥാപിക്കുക
- ലളിതമായ അടിസ്ഥാനരേഖയിൽ ആരംഭിച്ച് അത് അർഹിക്കുന്ന സമയത്ത് മാത്രം സങ്കീർണ്ണത ചേർത്തുകൊണ്ട് വ്യാഖ്യാനിക്കാവുന്ന മാതൃക തിരഞ്ഞെടുക്കാനുള്ള കഴിവ്.
ഇതുവരെ ഞങ്ങൾ ഡാറ്റ ശേഖരിക്കുകയും അത് വൃത്തിയാക്കുകയും പര്യവേക്ഷണം ചെയ്യുകയും സവിശേഷതകൾ നിർമ്മിക്കുകയും ചെയ്തു. ഇപ്പോൾ ഞങ്ങൾ യഥാർത്ഥ ജോലിയിലേക്ക് വരുന്നു, ഒരു മാതൃക നിർമ്മിക്കുന്നു. ഡാറ്റയിൽ നിന്ന് ഒരു പാറ്റേൺ പഠിക്കുകയും പുതിയ സാഹചര്യങ്ങൾക്കായി പ്രവചനങ്ങൾ നിർമ്മിക്കുകയും ചെയ്യുന്ന ഒരു ഗണിത ഘടനയാണ് മോഡൽ. എന്നാൽ ഒരു മോഡൽ നിർമ്മിക്കുന്നതിൻ്റെ ഏറ്റവും നിർണായകമായ ഭാഗം കോഡ് തന്നെയല്ല, മറിച്ച് അതിന് മുമ്പുള്ള രണ്ട് തീരുമാനങ്ങളാണ്: ശരിയായ പ്രശ്നം നിർവചിക്കുകയും ഡാറ്റ ശരിയായി വിഭജിക്കുകയും ചെയ്യുക. അൽഗോരിതം തിരഞ്ഞെടുക്കൽ, കോഡ് റൈറ്റിംഗ്, പാരാമീറ്റർ ട്യൂണിംഗ് എന്നിവയിൽ AI ഒരു ശക്തമായ ഉപദേശകനാണ്; എന്നാൽ എന്താണ് പ്രവചിക്കേണ്ടതെന്നും വിജയമെന്താണെന്നും തീരുമാനിക്കേണ്ടത് ഒരാളാണ്. ഒരു തെറ്റായി നിർവചിക്കപ്പെട്ട ഒരു പ്രശ്നം തികച്ചും എഴുതിയ ഒരു മാതൃകയിൽ പോലും പ്രവർത്തിക്കില്ല.
പ്രശ്ന നിർവചനം ആദ്യം: ഞങ്ങൾ എന്താണ് പ്രവചിക്കുന്നത്
ഓരോ മോഡലിംഗ് ജോലിയും ആരംഭിക്കുന്നത് ഒരു ചോദ്യത്തിലാണ്, ഈ ചോദ്യം മോഡലിൻ്റെ തരം നിർണ്ണയിക്കുന്നു. വർഗ്ഗീകരണം — ഔട്ട്പുട്ട് ഒരു വിഭാഗമാണ്: "ഈ ഉപഭോക്താവ് പോകുമോ അതോ താമസിക്കുമോ?", "ഈ ഇടപാട് വ്യാജമാണോ?". റിഗ്രഷൻ (ഇംഗ്ലീഷ് റിഗ്രഷനിൽ - ഔട്ട്പുട്ട് ഒരു സംഖ്യയാണ്): "ഈ വീടിൻ്റെ വില എത്രയാണ്?", "അടുത്ത മാസം എത്ര ഓർഡറുകൾ വരും?". ക്ലസ്റ്ററിംഗ് (ലേബൽ ചെയ്യാത്ത ഡാറ്റയെ സ്വാഭാവിക ഗ്രൂപ്പുകളായി വിഭജിക്കുന്നു): "എൻ്റെ ഉപഭോക്താക്കളെ എത്ര സ്വാഭാവിക സെഗ്മെൻ്റുകളായി തിരിച്ചിരിക്കുന്നു?".
പ്രശ്ന പ്രസ്താവനയുടെ രണ്ടാം ഭാഗമാണ് വിജയ മാനദണ്ഡം: ഈ മോഡൽ "നല്ലത്" എന്നതിൻ്റെ അർത്ഥമെന്താണ്? ഒരു തട്ടിപ്പ് മാതൃകയിൽ, ഒരു വഞ്ചകനെ കാണാതെ പോകുന്നത് സത്യസന്ധനായ ഒരു ഉപഭോക്താവിനെ ആകസ്മികമായി തടയുന്നതിനേക്കാൾ വളരെ ചെലവേറിയതാണ്; അതിനാൽ, "പൊതു കൃത്യത" അല്ല, മറിച്ച് "വഞ്ചകരെ പിടികൂടുന്നതിനുള്ള നിരക്ക്" മുന്നിലേക്ക് വരുന്നു. നിങ്ങൾ ആദ്യം മുതൽ ഈ മാനദണ്ഡം നിർവചിച്ചില്ലെങ്കിൽ, ബിസിനസ്സ് ഉടമയ്ക്കൊപ്പം, പ്രവർത്തിക്കാത്ത ഒരു "വളരെ കൃത്യമായ" മോഡൽ നിങ്ങൾക്ക് ലഭിക്കും (യൂണിറ്റ് 7-ലെ മെട്രിക്കുകളിലേക്ക് ഞങ്ങൾ ആഴത്തിൽ പോകും).
മുന്നറിയിപ്പ്: "കൃത്യത" തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്. 1000 ഇടപാടുകളിൽ 10 എണ്ണവും വഞ്ചനയുള്ളതാണെങ്കിൽ, "ഒന്നും വഞ്ചനയല്ല" എന്ന് പറയുന്ന ഒരു മണ്ടൻ മോഡൽ 99% കൃത്യത നൽകും, പക്ഷേ ഒരു തട്ടിപ്പുകാരനെപ്പോലും പിടികൂടാൻ കഴിയില്ല. പ്രശ്നത്തിൻ്റെ യഥാർത്ഥ വിലയെ അടിസ്ഥാനമാക്കി വിജയ മാനദണ്ഡം തിരഞ്ഞെടുക്കുക.
പരിശീലനം/ടെസ്റ്റ് വിഭജനം: മാതൃകയുടെ സത്യസന്ധമായ പരിശോധന
പഠിച്ച ഡാറ്റ ഉപയോഗിച്ച് ഒരു മോഡൽ പരീക്ഷിക്കുന്നത് പരീക്ഷയിൽ അവൻ/അവൾ പഠിച്ച അതേ ചോദ്യങ്ങൾ വിദ്യാർത്ഥിയോട് ചോദിക്കുന്നതിന് തുല്യമാണ്; അവൻ ഉയർന്ന മാർക്ക് വാങ്ങുന്നു, പക്ഷേ അയാൾക്ക് ശരിക്കും അറിയാവുന്നത് കാണിക്കുന്നില്ല. അതിനാൽ ഞങ്ങൾ ഡാറ്റ രണ്ടായി വിഭജിക്കുന്നു (പലപ്പോഴും മൂന്ന്):
- പരിശീലന സെറ്റ് (ഇംഗ്ലീഷിലുള്ള പരിശീലന സെറ്റ്, സാധാരണയായി 70-80%): മോഡൽ ഇതിൽ പഠിക്കുന്നു.
- ടെസ്റ്റ് സെറ്റ് (ടെസ്റ്റ് സെറ്റ്, സാധാരണയായി 20-30%): മോഡൽ ഇത് കാണുന്നില്ല; യഥാർത്ഥ പ്രകടനം ഇവിടെ അളക്കുന്നു.
- മൂല്യനിർണ്ണയ സെറ്റ്: മോഡൽ ക്രമീകരണത്തിനായി ഉപയോഗിക്കുന്ന ഇൻ്റർമീഡിയറ്റ് സെറ്റ് (ഏത് പാരാമീറ്റർ മികച്ചതാണ്); ടെസ്റ്റ് സെറ്റ് "വൃത്തിയായി" സൂക്ഷിക്കാൻ.
ഏറ്റവും അടിസ്ഥാന നിയമം: പരിശീലന സമയത്ത് ടെസ്റ്റ് സെറ്റ് ഒരിക്കലും സ്പർശിക്കില്ല. സ്കെയിലിംഗ്, കോഡിംഗ്, ഫീച്ചർ സെലക്ഷൻ - എല്ലാം പരിശീലന സെറ്റിൽ നിന്ന് പഠിച്ച് ടെസ്റ്റിംഗിലേക്ക് പ്രയോഗിക്കുന്നു (യൂണിറ്റ് 5 ൽ നിന്നുള്ള ചോർച്ച തത്വം). മോഡൽ യഥാർത്ഥ ലോകം കാണുന്നത് ആദ്യമായിട്ടാണ് ടെസ്റ്റ് സെറ്റ്; നിങ്ങൾ ഇത് വളരെ നേരത്തെ ഓണാക്കിയാൽ യഥാർത്ഥ പ്രകടനം നിങ്ങൾക്കറിയില്ല.
സമയ ശ്രേണി ഒഴിവാക്കൽ: നിങ്ങളുടെ ഡാറ്റ സമയത്തെ ആശ്രയിച്ചിരിക്കുന്നുവെങ്കിൽ (വിൽപ്പന, സ്റ്റോക്ക് മാർക്കറ്റ്, ഡിമാൻഡ്), ക്രമരഹിതമായ വിഭജനം നടക്കില്ല. കാരണം ക്രമരഹിതമായ വിഭജനം മോഡലിന് ഭാവി കാണാനും ഭൂതകാലം പ്രവചിക്കാനും കാരണമാകുന്നു - ഇത് ചോർച്ചയാണ്. പകരം, കാലക്രമത്തിൽ വിഭജിക്കുക: പഴയ കാലഘട്ടത്തിൽ പരിശീലിപ്പിക്കുക, പുതിയ കാലഘട്ടം ഉപയോഗിച്ച് പരീക്ഷിക്കുക.
അൽഗോരിതം തിരഞ്ഞെടുക്കൽ: ലളിതം മുതൽ സങ്കീർണ്ണത വരെ
തുടക്കക്കാരുടെ ഏറ്റവും സാധാരണമായ തെറ്റ് ഏറ്റവും സങ്കീർണ്ണമായ മോഡലിൽ നിന്ന് ആരംഭിക്കുക എന്നതാണ്. ശരിയായ സമീപനം വിപരീതമാണ്: ആദ്യം ഒരു ലളിതമായ അടിസ്ഥാനം സ്ഥാപിക്കുക. ഒരു വർഗ്ഗീകരണത്തിൽ "എല്ലായ്പ്പോഴും ഭൂരിപക്ഷ ക്ലാസ് ഊഹിക്കുക"; ഒരു റിഗ്രഷനിൽ "എപ്പോഴും ശരാശരി കണക്കാക്കുക". ഈ മണ്ടൻ മോഡൽ ഒരു അടിസ്ഥാനം നൽകുന്നു; നിങ്ങളുടെ യഥാർത്ഥ മോഡലിന് ഇത് മറികടക്കാൻ കഴിയുന്നില്ലെങ്കിൽ, ഒരു പ്രശ്നമുണ്ട്. തുടർന്ന് ലളിതവും വ്യാഖ്യാനിക്കാവുന്നതുമായ മോഡലുകളിലേക്ക് നീങ്ങുക.
മാതൃക
പ്രശ്നത്തിൻ്റെ തരം
ശക്തമായ പോയിൻ്റ്
ബലഹീനത
അടിസ്ഥാനരേഖ (ഭൂരിപക്ഷം/ശരാശരി)
രണ്ടും
ബെഞ്ച്മാർക്ക് നൽകുന്നു
പഠിക്കുന്നില്ല
ലോജിസ്റ്റിക് റിഗ്രഷൻ
വർഗ്ഗീകരണം
ലളിതം, വ്യാഖ്യാനിക്കാവുന്നത്
രേഖീയ ബന്ധം മാത്രം
ലീനിയർ റിഗ്രഷൻ
റിഗ്രഷൻ
ലളിതവും വേഗതയേറിയതും
രേഖീയ അനുമാനം
തീരുമാന വൃക്ഷം
രണ്ടും
വ്യാഖ്യാനിക്കാവുന്ന
എളുപ്പമുള്ള ഓർമ്മപ്പെടുത്തലുകൾ
ക്രമരഹിതമായ വനം
രണ്ടും
ശക്തമായ, മോടിയുള്ള
വ്യാഖ്യാനം കുറവാണ്
ഗ്രേഡിയൻ്റ് ബൂസ്റ്റിംഗ് (XGBoost മുതലായവ)
രണ്ടും
വളരെ ശക്തമായ
ക്രമീകരിക്കാൻ ബുദ്ധിമുട്ട്, ഓർമ്മപ്പെടുത്താനുള്ള സാധ്യത
നിയമം: ഏറ്റവും ലളിതമായ "നല്ലത്" മോഡൽ തിരഞ്ഞെടുക്കുക. മിക്ക ബിസിനസ് സന്ദർഭങ്ങളിലും അധികാരത്തേക്കാൾ വിലപ്പെട്ടതാണ് വ്യാഖ്യാനം; "ബ്ലാക്ക് ബോക്സ് അങ്ങനെ പറഞ്ഞതിനാൽ" എന്നതിനേക്കാൾ "നിങ്ങളുടെ കടവും വരുമാന അനുപാതവും കൂടുതലായതിനാൽ" വായ്പ നിരസിക്കൽ വിശദീകരിക്കുന്നതാണ് നല്ലത്.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - തെറ്റായ പ്രശ്ന നിർവചനം. "ഉപഭോക്താവ് സംതൃപ്തനാണോ" എന്നതിനെ അടിസ്ഥാനമാക്കി ഒരു ടീം ഒരു വർഗ്ഗീകരണ മോഡൽ നിർമ്മിച്ചു, എന്നാൽ വിജയ മാനദണ്ഡമായി "കൃത്യത" തിരഞ്ഞെടുത്തു. ഡാറ്റയിൽ, 88% ഉപഭോക്താക്കളും സംതൃപ്തരാണ്; എല്ലാവരേയും "സംതൃപ്തരാണ്" എന്ന് വിളിച്ച് മോഡലിന് 88% കൃത്യത ലഭിച്ചു, അസംതൃപ്തരായ ആളുകളെ ഒരിക്കലും പിടികൂടിയില്ല - യഥാർത്ഥ ലക്ഷ്യം അവരെ കണ്ടെത്തുകയായിരുന്നെങ്കിലും. പാഠം: യഥാർത്ഥ ലക്ഷ്യത്തെ അടിസ്ഥാനമാക്കി വിജയ മാനദണ്ഡം തിരഞ്ഞെടുക്കുക.
കേസ് 2 - കമ്പാർട്ട്മെൻ്റിൽ സമയം ചോർച്ച. ഒരു ഡിമാൻഡ് പ്രവചന പദ്ധതിയിൽ, ഡാറ്റ ക്രമരഹിതമായി വിഭജിക്കപ്പെട്ടു. മോഡൽ 93% കൃത്യത നൽകിയെങ്കിലും ഉൽപ്പാദനത്തിൽ തകർന്നു, കാരണം പരിശീലനത്തിൽ ജനുവരി, പിന്നെ നവംബർ, ഡിസംബർ ഡാറ്റയോടെ പ്രവചിച്ചിരുന്നു - അത് ഭാവി കണ്ടു. ഞങ്ങൾ ക്രോണോളജിക്കൽ ഡിവിഷനിലേക്ക് മാറിയപ്പോൾ, യഥാർത്ഥ പ്രകടനം 74% ആയി വർദ്ധിച്ചു. പാഠം: സമയ ശ്രേണിയിലെ കാലക്രമ വിഭജനം.
കേസ് 3 - അനാവശ്യ സങ്കീർണ്ണത. ഒരു വിശകലന വിദഗ്ധൻ ഒരു ആഴത്തിലുള്ള ന്യൂറൽ നെറ്റ്വർക്ക് ഉപയോഗിച്ച് നേരിട്ട് ആരംഭിച്ചു, ആഴ്ചകളോളം അത് ട്യൂൺ ചെയ്തു, 81% കൃത്യത ലഭിച്ചു. പിന്നീട് ഒരു സഹപ്രവർത്തകന് 20 ലൈനുകളുള്ള ലോജിസ്റ്റിക് റിഗ്രഷനോടെ 80% ലഭിച്ചു - വളരെ വേഗമേറിയതും വ്യാഖ്യാനിക്കാവുന്നതും പരിപാലിക്കാൻ എളുപ്പവുമാണ്. പാഠം: അടിസ്ഥാനരേഖയും ലളിതമായ മോഡലും ഉപയോഗിച്ച് ആരംഭിക്കുക, അത് അർഹിക്കുന്ന സമയത്ത് സങ്കീർണ്ണത ചേർക്കുക.
പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ
1) പ്രശ്നത്തിൻ്റെ നിർവചനം വ്യക്തമാക്കുന്നത്:
നിങ്ങളുടെ റോൾ: മോഡലിംഗ് കൺസൾട്ടൻ്റ്. ഈ ജോലി നിർവചിക്കാൻ എന്നെ സഹായിക്കൂ: "എനിക്ക് ഉപഭോക്തൃ ചോർച്ച കുറയ്ക്കണം." എന്നോട് ചോദിക്കുകയും വ്യക്തമാക്കുകയും ചെയ്യുക: (1) ഇതൊരു വർഗ്ഗീകരണമോ റിഗ്രഷനോ ആണോ, (2) കൃത്യമായി ടാർഗെറ്റ് വേരിയബിൾ എന്താണ്, അത് എങ്ങനെ നിർവചിക്കണം, (3) വിജയ മാനദണ്ഡം എന്തായിരിക്കണം, എന്തുകൊണ്ട്. തീരുമാനം എൻ്റേതാണ്; നിങ്ങൾ ചോദ്യങ്ങളും ഓപ്ഷനുകളും അവതരിപ്പിക്കുന്നു.
2) സുരക്ഷിത പരിശീലനം/ടെസ്റ്റ് കമ്പാർട്ട്മെൻ്റ്:
80%/20% ട്രെയിനിംഗ്/ടെസ്റ്റിംഗ് ആയി എൻ്റെ ഡിഎഫ് വിഭജിക്കുക. ക്ലാസ് ഡിസ്ട്രിബ്യൂഷൻ (സ്ട്രാറ്റിഫൈ) നിലനിർത്തുക.random_state=42. ഇതൊരു ടൈം സീരീസ് അല്ല (സ്വതന്ത്ര നിരീക്ഷണങ്ങൾ). ഡിവിഷനുശേഷം ഓരോ സെറ്റിൻ്റെയും ക്ലാസ് അനുപാതം പ്രിൻ്റ് ചെയ്യുക. പരിവർത്തനങ്ങളൊന്നും പ്രയോഗിക്കാതെ തന്നെ ടെസ്റ്റ് സെറ്റിലേക്ക് സ്പ്ലിറ്റിംഗ് കോഡ് നൽകുക.
3) സമയ ശ്രേണി കാലക്രമ വിഭജനം:
ഡാറ്റ സമയത്തെ ആശ്രയിച്ചിരിക്കുന്നു (തീയതി കോളം: order_date). ക്രമരഹിതമല്ല, കാലക്രമത്തിൽ വിഭജിക്കുക: ഏറ്റവും പഴയ 80% പരിശീലനം, ഏറ്റവും പുതിയ 20% പരിശോധന. പരിശീലന, ടെസ്റ്റിംഗ് തീയതി ശ്രേണികൾ പ്രിൻ്റ് ഔട്ട് ചെയ്യുക, അതുവഴി ഭാവി ചോർന്നിട്ടില്ലെന്ന് എനിക്ക് പരിശോധിക്കാനാകും.
4) ഒരു അടിസ്ഥാന ക്രമീകരണം:
എനിക്ക് ഒരു വർഗ്ഗീകരണ പ്രശ്നമുണ്ട് (ലക്ഷ്യം: 0/1 ചവിട്ടുക). ആദ്യം ഒരു ബേസ്ലൈൻ സ്ഥാപിക്കുക: ഡമ്മിക്ലാസിഫയർ ഉപയോഗിച്ച് പരിശീലന/ടെസ്റ്റിംഗ് കൃത്യത അളക്കുക, അത് എല്ലായ്പ്പോഴും ഭൂരിപക്ഷ വിഭാഗത്തെ പ്രവചിക്കുന്നു. തുടർന്ന് ഒരു ലളിതമായ ലോജിസ്റ്റിക് റിഗ്രഷൻ പരിശീലിപ്പിച്ച് അത് ബേസ്ലൈനിനെ മറികടക്കുന്നുണ്ടോ എന്ന് താരതമ്യം ചെയ്യുക. രണ്ടിൻ്റെയും മെട്രിക്സ് വശങ്ങളിലായി കാണിക്കുക.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
ഈ ഡാറ്റ ഉപയോഗിച്ച് മികച്ച മോഡൽ നിർമ്മിക്കുക.
"മികച്ചത്" എന്നത് നിർവചിക്കപ്പെട്ടിട്ടില്ല; പ്രശ്നത്തിൻ്റെ തരമോ ലക്ഷ്യമോ വിജയ മാനദണ്ഡമോ വിഭജന തന്ത്രമോ ഇല്ല. AI ഒരു റാൻഡം പാറ്റേൺ സൃഷ്ടിക്കുന്നു, ഒരുപക്ഷേ ചോർച്ച.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: മോഡലിംഗ് അസിസ്റ്റൻ്റ്. പ്രശ്നം: വർഗ്ഗീകരണം, ടാർഗെറ്റ് "ചർൺ" (0/1), ക്ലാസ് അസന്തുലിതാവസ്ഥയുണ്ട് (~12% ചർൺ). വിജയ മാനദണ്ഡം: ചതിക്കുന്നവരെ തിരിച്ചുവിളിക്കുന്നത് മുൻഗണനയാണ്. ഡാറ്റ സ്വതന്ത്ര നിരീക്ഷണം (സമയ ശ്രേണി അല്ല). ടാസ്ക്: (1) 80/20% സ്ട്രാറ്റിഫൈഡ് സ്പ്ലിറ്റ്, (2) ഡമ്മിക്ലാസിഫയർ ബേസ്ലൈൻ, (3) ലോജിസ്റ്റിക് റിഗ്രഷൻ, പൈപ്പ്ലൈനിലെ എല്ലാ പരിവർത്തനങ്ങളും പരിശീലനത്തിൽ നിന്ന് മാത്രം പഠിച്ചു. വിഭജിക്കുന്നതിന് മുമ്പ് ടെസ്റ്റ് സെറ്റിൽ തൊടരുത്.
ഇവിടെ പ്രശ്നത്തിൻ്റെ തരം, അസന്തുലിതാവസ്ഥ, മാനദണ്ഡം, ചോർച്ച അളവ് എന്നിവ വ്യക്തമാണ്.
സാധാരണ തെറ്റുകൾ
- യഥാർത്ഥ ലക്ഷ്യത്തിനനുസരിച്ച് വിജയ മാനദണ്ഡം തിരഞ്ഞെടുക്കുന്നില്ല. അസന്തുലിതമായ ഡാറ്റയിലെ "കൃത്യത" തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്; നിങ്ങൾക്ക് ന്യൂനപക്ഷ വിഭാഗത്തെ പിടിച്ചെടുക്കണമെങ്കിൽ, തിരിച്ചുവിളിക്കൽ മുന്നിൽ വരുന്നു.
- പരിശീലന സമയത്ത് ടെസ്റ്റ് സെറ്റിൽ സ്പർശിക്കുന്നു. വിഭജിക്കുന്നതിന് മുമ്പ് സ്കെയിലിംഗ്/എൻകോഡിംഗ് ചെയ്യുന്നത് ചോർച്ചയുള്ളതും യഥാർത്ഥ പ്രകടനം മറയ്ക്കുന്നതുമാണ്.
- സമയ ശ്രേണിയിൽ ക്രമരഹിതമായ വിഭജനം. മോഡൽ ഭാവി കാണുന്നു, ഉൽപ്പാദനത്തിൽ തകരുന്നു; കാലാനുസൃതമായ വിഭജനം അത്യാവശ്യമാണ്.
- അടിസ്ഥാനരേഖ സ്ഥാപിക്കാതെ സങ്കീർണ്ണമായ ഒരു മാതൃകയിലേക്ക് കുതിക്കുന്നു. മാനദണ്ഡങ്ങൾ ഇല്ലാതെ ഒരു മോഡൽ ശരിക്കും നല്ലതാണോ അല്ലയോ എന്ന് നിങ്ങൾക്ക് അറിയാൻ കഴിയില്ല.
- വ്യാഖ്യാനത്തെ അവഗണിക്കുന്നു. ബിസിനസ്സ് തീരുമാനങ്ങളിൽ, ലളിതമായി വിശദീകരിക്കാവുന്ന മാതൃക പലപ്പോഴും ബ്ലാക്ക് ബോക്സിനേക്കാൾ വിലപ്പെട്ടതാണ്.
നുറുങ്ങ്: നിങ്ങൾ ഒരു മോഡൽ നിർമ്മിക്കാൻ തുടങ്ങുന്നതിനുമുമ്പ്, ഒരു വാചകം എഴുതുക: "ഈ മോഡൽ _____ പ്രവചിക്കും, അതിൻ്റെ വിജയം മെട്രിക് _____ കൊണ്ട് അളക്കും, കാരണം ജോലിയുടെ യഥാർത്ഥ വില _____ ആണ്." നിങ്ങൾക്ക് ഈ വാചകം പൂരിപ്പിക്കാൻ കഴിയുന്നില്ലെങ്കിൽ, നിങ്ങൾ ഇതുവരെ കോഡ് എഴുതാൻ തയ്യാറായിട്ടില്ല.
ചുരുക്കത്തിൽ
ഒരു മോഡൽ നിർമ്മിക്കുന്നതിൻ്റെ ഏറ്റവും നിർണായകമായ ഭാഗം കോഡല്ല, അതിനു മുമ്പുള്ള തീരുമാനങ്ങളാണ്: ശരിയായ പ്രശ്നം നിർവചിക്കുക (വർഗ്ഗീകരണം അല്ലെങ്കിൽ റിഗ്രഷൻ, എന്താണ് ലക്ഷ്യം, വിജയ മാനദണ്ഡം) കൂടാതെ ഡാറ്റയെ ന്യായമായി വിഭജിക്കുക (ടെസ്റ്റ് സെറ്റിൽ തൊടാതെ; സമയ ശ്രേണിയിൽ കാലക്രമം). എല്ലായ്പ്പോഴും ഒരു ലളിതമായ അടിസ്ഥാനരേഖയിൽ ആരംഭിക്കുകയും അത് അർഹിക്കുന്ന സമയത്ത് മാത്രം സങ്കീർണ്ണത ചേർക്കുകയും ചെയ്യുക; ഭൂരിഭാഗം ബിസിനസ്സ് സന്ദർഭങ്ങളിലും അധികാരത്തെക്കാൾ വ്യാഖ്യാനം വിലമതിക്കുന്നു. അൽഗോരിതം തിരഞ്ഞെടുക്കുന്നതിലും കോഡിലും AI ശക്തമായ ഒരു ഉപദേശകനാണ്, എന്നാൽ നിങ്ങൾ എന്താണ് പ്രവചിക്കേണ്ടതെന്നും എന്തുകൊണ്ടാണെന്നും മനുഷ്യൻ തീരുമാനിക്കുന്നു.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു പ്രവചന പ്രശ്നം നിർവചിച്ച് ഇനിപ്പറയുന്ന വാചകം രേഖാമൂലം പൂർത്തിയാക്കുക: "ഈ മോഡൽ ___ (ക്ലാസിഫിക്കേഷൻ/റിഗ്രഷൻ) പ്രവചിക്കും, ലക്ഷ്യം ___ ആണ്, വിജയ മാനദണ്ഡം ___ ആണ്, കാരണം ___." തുടർന്ന് ശരിയായ തന്ത്രം ഉപയോഗിച്ച് ഡാറ്റ വിഭജിക്കുക (അത് ഒരു സമയ ശ്രേണിയാണെങ്കിൽ കാലക്രമം), ഒരു അടിസ്ഥാനരേഖ സ്ഥാപിക്കുക, കൂടാതെ ഒരു ലളിതമായ പാറ്റേൺ ആ അടിസ്ഥാനരേഖയെ തകർക്കുന്നുണ്ടോ എന്ന് അളക്കുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] പ്രശ്നത്തിൻ്റെ തരവും (ക്ലാസിഫിക്കേഷൻ/റിഗ്രഷൻ) ലക്ഷ്യവും ഞാൻ വ്യക്തമായി നിർവചിച്ചിട്ടുണ്ടോ?
- [] ജോലിയുടെ യഥാർത്ഥ വിലയെ അടിസ്ഥാനമാക്കി ഞാൻ വിജയ മാനദണ്ഡം തിരഞ്ഞെടുത്തിട്ടുണ്ടോ?
- [ ] പരിശീലന സമയത്ത് ഞാൻ ടെസ്റ്റ് സെറ്റ് സ്പർശിക്കാതെ ഉപേക്ഷിച്ചോ?
- [ ] ഇതൊരു സമയ ശ്രേണി ആണെങ്കിൽ, ഞാൻ അതിനെ കാലക്രമത്തിൽ വിഭജിച്ചിട്ടുണ്ടോ?
- [ ] സങ്കീർണ്ണമായ മാതൃകയിലേക്ക് നീങ്ങുന്നതിന് മുമ്പ് ഞാൻ ഒരു അടിസ്ഥാനരേഖ സ്ഥാപിച്ചിട്ടുണ്ടോ?