നേട്ടങ്ങൾ:
- ഡാറ്റ ചോർച്ചയുടെ തരങ്ങൾ തിരിച്ചറിയാനുള്ള കഴിവ് (ലക്ഷ്യം, സമയം, പ്രീപ്രൊസസ്സിംഗ്, ഗ്രൂപ്പുചെയ്ത വരി) കൂടാതെ 'സത്യമാകാൻ വളരെ നല്ലതാണ്' സ്കോർ ഒരു അലാറമായി അന്വേഷിക്കുക
- ടെസ്റ്റ് സെറ്റ്, പൈപ്പ്ലൈൻ, ശരിയായ വിഭജനം (കാലക്രമം/ഗ്രൂപ്പ്ഡ്) എന്നിവയുടെ നേരത്തെയുള്ള വേർതിരിവിലൂടെ ചോർച്ച തടയാനുള്ള കഴിവ്
- സ്ഥിരമായ വിത്തുകൾ, പതിപ്പ് നിയന്ത്രണം, മാനുവൽ ഘട്ടങ്ങൾ നീക്കം ചെയ്യൽ എന്നിവ ഉപയോഗിച്ച് വിശകലനം പുനർനിർമ്മിക്കാനുള്ള കഴിവ്
ഡാറ്റാ സയൻസിൽ ഏറ്റവും കൂടുതൽ പരിശ്രമം പാഴാക്കുന്ന രണ്ട് തെറ്റുകളുണ്ട്, അവ രണ്ടും വഞ്ചനാപരമാണ്, കാരണം എല്ലാം "ശരിയാണെന്ന് തോന്നുമ്പോൾ" അവ ദുരന്തത്തിലേക്ക് നയിക്കുന്നു. ആദ്യത്തേത് ഡാറ്റ ചോർച്ചയാണ്: ടെസ്റ്റ് സെറ്റിൽ മോഡൽ മികച്ച രീതിയിൽ പ്രവർത്തിക്കുന്നു, പക്ഷേ ഉൽപ്പാദനത്തിൽ തകരുന്നു. രണ്ടാമത്തേത് പുനരുൽപ്പാദിപ്പിക്കാനാവാത്തതാണ്: നിങ്ങൾ ആറുമാസത്തിനുശേഷം ഒരു വിശകലനം നടത്തുകയും തികച്ചും വ്യത്യസ്തമായ ഫലം നേടുകയും ചെയ്യുന്നു. ഈ രണ്ട് കെണികളും ആഴത്തിൽ അറിയാനും ഒഴിവാക്കാനും ഈ യൂണിറ്റ് സമർപ്പിക്കുന്നു. AI-യ്ക്ക് രണ്ട് അപകടസാധ്യതകളും വർദ്ധിപ്പിക്കാൻ കഴിയും (വേഗത്തിൽ സൃഷ്ടിക്കുന്നു, മറഞ്ഞിരിക്കുന്ന ചോർച്ച നിർദ്ദേശിക്കുന്നു, നിങ്ങൾക്ക് സ്വമേധയാലുള്ള നടപടികൾ സ്വീകരിക്കുന്നത് എളുപ്പമാക്കുന്നു) എന്നാൽ ശരിയായി ഉപയോഗിക്കുകയാണെങ്കിൽ അവ കുറയ്ക്കാനും കഴിയും. വ്യത്യാസം അച്ചടക്കത്തിലാണ്.
ഡാറ്റ ചോർച്ച: ക്ലെയർവോയൻ്റ് മോഡൽ
പരിശീലന സമയത്ത് മോഡലിന് യഥാർത്ഥ പ്രവചന സമയത്ത് ലഭിക്കാത്ത വിവരങ്ങൾ കാണുമ്പോഴാണ് ഡാറ്റ ചോർച്ച. ഈ വിവരങ്ങൾ ഉപയോഗിച്ച് മോഡൽ "ചതി" ചെയ്യുന്നു, ടെസ്റ്റ് സെറ്റിൽ മികച്ചതായി കാണപ്പെടുന്നു, പക്ഷേ ആ വിവരങ്ങളില്ലാതെ ഉൽപ്പാദനത്തിൽ തകരുന്നു. ചോർച്ചയുടെ ലക്ഷണം മിക്കവാറും എല്ലായ്പ്പോഴും ഒരുപോലെയാണ്: സത്യമാകാൻ വളരെ നല്ലതാണ്. 99% കൃത്യത കാണുമ്പോൾ നിങ്ങൾ സന്തോഷിക്കുന്നതിനുമുമ്പ്, നിങ്ങൾ ചോർച്ചകൾക്കായി നോക്കണം.
ചോർച്ചയുടെ പ്രധാന തരങ്ങൾ ഇവയാണ്:
1. ഗോൾ ചോർച്ച: ഒരു സവിശേഷത ലക്ഷ്യത്തിൻ്റെ ഫലമാണ്. "റദ്ദാക്കപ്പെട്ടു" പ്രവചനത്തിൽ, "റദ്ദാക്കൽ തീയതി" അല്ലെങ്കിൽ "റീഫണ്ട് തുക" നിരകൾ ലക്ഷ്യത്തിൻ്റെ ഫലമാണ്; ഫലം വ്യക്തമാകുമ്പോൾ മാത്രമേ അവ പൂരിപ്പിക്കൂ.
2. സമയ ചോർച്ച: ഭാവിയിലെ വിവരങ്ങൾ ഭൂതകാലത്തിലേക്ക് കൊണ്ടുവരുന്നു. "അവസാന 30 ദിവസത്തെ ശരാശരി" കണക്കാക്കുമ്പോൾ, പ്രവചന ദിവസത്തിന് ശേഷമുള്ള ദിവസങ്ങൾ ഉൾപ്പെടുത്തുക, അല്ലെങ്കിൽ സമയ ശ്രേണി ക്രമരഹിതമായി വിഭജിക്കുക.
3. പ്രീ-പ്രോസസ്സിംഗ് ചോർച്ച: പരിശീലന/ടെസ്റ്റിംഗ് പാർട്ടീഷന് മുമ്പ് എല്ലാ ഡാറ്റയിൽ നിന്നും സ്കെയിലിംഗ്, ഫില്ലിംഗ്, കോഡിംഗ് തുടങ്ങിയ പരിവർത്തനങ്ങൾ പഠിക്കുക. ടെസ്റ്റ് ഡാറ്റയുടെ ശരാശരി പരിശീലനം പരിശീലനത്തെ തടസ്സപ്പെടുത്തുന്നു.
4. ഡ്യൂപ്ലിക്കേറ്റ്/ഗ്രൂപ്പ് ചെയ്ത വരി ചോർച്ച: പരിശീലനത്തിലും പരിശോധനയിലും ഒരേ വ്യക്തിയുടെ വരികൾ ഉണ്ട് (ഒരേ രോഗിയുടെ രണ്ട് സന്ദർശനങ്ങൾ വ്യത്യസ്ത സെറ്റുകളിൽ). മോഡൽ വ്യക്തിയെ മനഃപാഠമാക്കുന്നു.
ചോർച്ച തരം
എങ്ങനെയാണ് ജനിക്കുന്നത്
എങ്ങനെ തടയാം
ലക്ഷ്യം ചോർച്ച
ലക്ഷ്യത്തിൻ്റെ ഫലമായ കോളം
"പ്രവചന സമയത്ത് എനിക്ക് അത് ഉണ്ടോ" ടെസ്റ്റ്
സമയം ചോർച്ച
ഭാവിയെ ഭൂതകാലത്തിലേക്ക് കൊണ്ടുവരുന്നു
ക്രോണോളജിക്കൽ ഡിവിഷൻ, വിൻഡോ നിയന്ത്രണം
പ്രീപ്രോസസ്സിംഗ് ലീക്ക്
പ്രീ-വിഭജന പരിവർത്തനം
പൈപ്പ്ലൈൻ, പരിശീലനത്തിൽ നിന്ന് മാത്രം അനുയോജ്യമാണ്
ഗ്രൂപ്പുചെയ്ത വരി ചോർച്ച
രണ്ട് സെറ്റുകളിലായി ഒരേ യൂണിറ്റ്
ഗ്രൂപ്പ് പ്രകാരം വിഭജിക്കുക (GroupKFold)
ചോർച്ച തടയാനുള്ള ഒരേയൊരു അച്ചടക്കം
എല്ലാ തരത്തിലുമുള്ള ചോർച്ചകൾക്കുള്ള പൊതുവായ പരിഹാരം ഒരു വാചകത്തിലേക്ക് ചുരുങ്ങുന്നു: യഥാർത്ഥ ഭാവിയെ അനുകരിക്കുന്നതിന് ടെസ്റ്റ് സെറ്റ് എത്രയും വേഗം ഒറ്റപ്പെടുത്തുക, അതിനെ ഒന്നും "പഠിപ്പിക്കരുത്". പ്രായോഗികമായി, ഇത് അർത്ഥമാക്കുന്നത്: ആദ്യം വിഭജിക്കുക, പരിശീലനത്തിൽ നിന്ന് മാത്രം എല്ലാ പരിവർത്തനങ്ങളും പഠിക്കുകയും ഒരു പൈപ്പ്ലൈനിൽ പ്രയോഗിക്കുകയും ചെയ്യുക (എല്ലാ ഘട്ടങ്ങളും ഒരൊറ്റ ചെയിനിൽ ശേഖരിക്കുന്ന ഒരു ഘടന). ഓരോ ഫീച്ചറിനും, "പ്രവചന സമയത്ത് ഈ വിവരം എനിക്കുണ്ടോ?" എന്ന ചോദ്യം ചോദിക്കുക. സമയമുണ്ടെങ്കിൽ, അത് കാലക്രമത്തിൽ വിഭജിക്കുക; ഒരേ യൂണിറ്റ് ആവർത്തനമാണെങ്കിൽ, ഗ്രൂപ്പായി ഹരിക്കുക.
മുന്നറിയിപ്പ്: ചോർച്ചയുടെ ഏറ്റവും അപകടകരമായ വശം അത് ഒരു വിജയമായി സ്വയം അവതരിപ്പിക്കുന്നു എന്നതാണ്. ഒരു മോശം മോഡൽ വ്യക്തമായും മോശം ഫലങ്ങൾ ഉണ്ടാക്കുകയും ശ്രദ്ധിക്കപ്പെടുകയും ചെയ്യും; ചോർന്ന മോഡൽ മികച്ച രീതിയിൽ പ്രവർത്തിക്കുന്നു, എല്ലാവരേയും സന്തോഷിപ്പിക്കുന്നു, ഉൽപ്പാദനത്തിൽ ഉൾപ്പെടുത്തുന്നു - അവിടെയാണ് തകർച്ച ആരംഭിക്കുന്നത്. അതുകൊണ്ടാണ് ഒരു "വളരെ നല്ല" ഫലം ആഘോഷത്തിനല്ല, ഭയപ്പെടുത്താൻ കാരണമാകുന്നത്.
പുനരുൽപാദനക്ഷമത: ഒരേ ഫലം രണ്ടുതവണ ലഭിക്കുന്നു
മറ്റൊരു സമയത്ത്, മറ്റൊരു മെഷീനിൽ നിങ്ങൾ വീണ്ടും ഒരു വിശകലനം നടത്തുമ്പോൾ അതേ ഫലം ലഭിക്കാനുള്ള കഴിവാണ് പുനരുൽപാദനക്ഷമത. ഇതില്ലാതെ, നിങ്ങളുടെ വിശകലനം സാന്ദർഭികമാണ്, ശാസ്ത്രീയമല്ല. പുനരുൽപാദനക്ഷമതയെ തടസ്സപ്പെടുത്തുന്ന പ്രധാന കാരണങ്ങളും പരിഹാരങ്ങളും:
സ്വമേധയാലുള്ള ഘട്ടങ്ങൾ: Excel-ൽ ഒരു സെൽ സ്വമേധയാ മാറ്റുന്നു, ഒരു ചാർട്ട് സ്വമേധയാ എഡിറ്റുചെയ്യുന്നു. പരിഹാരം: കോഡിൽ ഓരോ ഘട്ടവും ഉണ്ടായിരിക്കുക.
പരിഹരിക്കപ്പെടാത്ത ക്രമരഹിതത: മോഡൽ പരിശീലനം, സാമ്പിൾ, വിഭജനം എന്നിവയിൽ ക്രമരഹിതത ഉൾപ്പെടുന്നു. പരിഹാരം: ക്രമരഹിതമായ വിത്ത് ശരിയാക്കുക (റാൻഡം ജനറേറ്ററിൻ്റെ പ്രാരംഭ മൂല്യം) (random_state=42).
പതിപ്പ് മാറ്റുന്നു: ലൈബ്രറി പതിപ്പ് മാറുമ്പോൾ ഫലം മാറിയേക്കാം. പരിഹാരം: ഡിപൻഡൻസികൾ പരിഹരിക്കുക (requirements.txt, പരിസ്ഥിതി ഫയൽ).
റെക്കോർഡ് സൂക്ഷിക്കുന്നില്ല: ഏത് ഡാറ്റ, ഏത് കോഡ്, ഏത് പാരാമീറ്റർ ഉപയോഗിച്ചുവെന്ന് വ്യക്തമല്ല. പരിഹാരം: പതിപ്പ് നിയന്ത്രണവും (Git — കോഡിൻ്റെ എല്ലാ പതിപ്പുകളും സംരക്ഷിക്കുന്ന സിസ്റ്റം) ഡാറ്റ പതിപ്പിംഗും.
"ഇത് എൻ്റെ മെഷീനിൽ മാത്രമേ പ്രവർത്തിക്കൂ": പരിഹാരം: പരിസ്ഥിതി രേഖപ്പെടുത്തുക, സാധ്യമെങ്കിൽ കണ്ടെയ്നറുകൾ (ഡോക്കർ) ഉപയോഗിക്കുക.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - ലക്ഷ്യ ചോർച്ച. ഒരു ആരോഗ്യ വിശകലനത്തിൽ "രോഗിയെ വീണ്ടും പ്രവേശിപ്പിക്കുമോ" എന്ന് പ്രവചിക്കുന്ന "പോസ്റ്റ്-ഡിസ്ചാർജ് മരുന്ന്" കോളം ഫീച്ചർ ചെയ്തു. രോഗിയെ ഡിസ്ചാർജ് ചെയ്തതിനുശേഷം മാത്രമാണ് ഈ കോളം പൂരിപ്പിച്ചത്. മോഡൽ 96% നൽകി, ഉത്പാദനത്തിൽ 61%. 8 ആഴ്ചത്തെ പദ്ധതി മാലിന്യമായിരുന്നു. പാഠം: ഓരോ സവിശേഷതയും "പ്രവചന സമയത്ത് അത് നിലവിലുണ്ടോ?"
കേസ് 2 - പ്രീപ്രോസസ്സിംഗ് ലീക്ക്. ഒരു ടീം എല്ലാ ഡാറ്റയും സ്കെയിൽ ചെയ്യുകയും പിന്നീട് അത് വിഭജിക്കുകയും ചെയ്തു. ടെസ്റ്റ് ഡാറ്റയുടെ ശരാശരി സ്കെയിലിംഗിൽ ഉൾപ്പെട്ടിരുന്നു. CV സ്കോർ 89%, യഥാർത്ഥ ഉത്പാദനം 76%. ഞാൻ പൈപ്പ്ലൈനിലേക്ക് മാറുകയും പരിശീലനത്തിൽ നിന്ന് പരിവർത്തനങ്ങളെക്കുറിച്ച് പഠിക്കുകയും ചെയ്തപ്പോൾ വ്യാജ വിജയം അപ്രത്യക്ഷമായി. പാഠം: ആദ്യം വിഭജിക്കുക, പിന്നീട് രൂപാന്തരപ്പെടുത്തുക.
കേസ് 3 - പുനരുൽപ്പാദിപ്പിക്കുന്നതിൽ പരാജയം. മൂന്ന് മാസത്തിന് ശേഷം മാനേജ്മെൻ്റിന് സമർപ്പിച്ച ചാർട്ട് അപ്ഡേറ്റ് ചെയ്യാൻ ഒരു അനലിസ്റ്റ് ആഗ്രഹിച്ചു, പക്ഷേ അത് എങ്ങനെയാണ് നിർമ്മിച്ചതെന്ന് ഓർമ്മയില്ല; Excel-ൽ നിരവധി ഘട്ടങ്ങൾ സ്വമേധയാ ചെയ്തു. ഫലം ഫലം കണ്ടില്ല, വിശ്വാസം തകർന്നു. പാഠം: മാനുവൽ ഘട്ടങ്ങളൊന്നുമില്ല, എല്ലാം കോഡിലും Git-ലുമാണ്.
പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ
1) ചോർച്ച പരിശോധന:
നിങ്ങളുടെ റോൾ: ലീക്ക് ഇൻസ്പെക്ടർ. ടാർഗെറ്റ്: "ചർൺ" (0/1), പ്രവചന റഫറൻസ് തീയതി: റെക്കോർഡ്_ഡേറ്റ്. ഈ സവിശേഷതകളുടെ ലിസ്റ്റ് ഞാൻ നിങ്ങൾക്ക് തരാം. ഓരോ ഫീച്ചറിനും: (എ) ഇത് ലക്ഷ്യത്തിൻ്റെ അനന്തരഫലമാണോ, (ബി) പ്രവചന സമയത്ത് ഇത് എനിക്ക് ലഭ്യമാണോ, (സി) സമയ ജാലകത്തിൽ ഭാവി ഉൾപ്പെടുന്നുണ്ടോ? "സുരക്ഷിതമല്ലാത്തത്/സംശയാസ്പദമായ/ചോർച്ച" എന്ന് അടയാളപ്പെടുത്തി ഒരു കാരണം എഴുതുക. സവിശേഷതകൾ: [ലിസ്റ്റ്]
2) ചോർച്ചയില്ലാത്ത പൈപ്പ്ലൈൻ:
സ്ക്ലേൺ പൈപ്പ്ലൈൻ സജ്ജീകരിക്കുക: ആദ്യം സ്പ്ലിറ്റ് ട്രെയിൻ/ടെസ്റ്റ് (സ്ട്രാറ്റിഫൈഡ്, സീഡ്=42), തുടർന്ന് പരിശീലനത്തിൽ നിന്ന് മാത്രം പൈപ്പ്ലൈനിലേക്ക് എല്ലാ പ്രീപ്രോസസിംഗും (ഇംപ്യൂട്ട്, സ്കെയിൽ, എൻകോഡ്) ഘടിപ്പിക്കുക. എന്തുകൊണ്ടാണ് കോഡ് ചോർച്ചയില്ലാത്തതെന്ന് വിശദീകരിക്കുക, ഏത് ഘട്ടമാണ് എവിടെ നിന്നാണ് പഠിച്ചത്.
3) പുനരുൽപ്പാദന ചെക്ക്ലിസ്റ്റ് കോഡ്:
എൻ്റെ വിശകലനം പുനരുൽപ്പാദിപ്പിക്കാൻ ഞാൻ ആഗ്രഹിക്കുന്നു. ചേർക്കുന്ന കോഡ്/ഘടന നിർദ്ദേശിക്കുക: (1) എല്ലാ ക്രമരഹിതതയ്ക്കും ഹാർഡ് സീഡ്, (2) ഉപയോഗിച്ച പ്രിൻ്റിംഗ് ലൈബ്രറി പതിപ്പുകൾ, (3) ഡാറ്റയ്ക്കും ഔട്ട്പുട്ടിനുമുള്ള തീയതി/പതിപ്പ് ടാഗ്. സ്വമേധയാലുള്ള ഘട്ടങ്ങളൊന്നും ഇല്ലെന്ന് ഉറപ്പാക്കാൻ എനിക്ക് ഒരു ചെക്ക്ലിസ്റ്റും നൽകുക.
4) ഗ്രൂപ്പുചെയ്ത പാർട്ടീഷൻ (അതേ യൂണിറ്റ് ചോർച്ച):
ഡാറ്റയിൽ ഒരേ customer_id ഒന്നിലധികം വരികളിൽ നിലവിലുണ്ട്. പരിശീലനത്തിലും പരിശോധനയിലും ഒരേ ഉപഭോക്താവിനെ തടയുന്ന ഒരു വിഭജനം (GroupKFold orGroupShuffleSplit, group = customer_id) ഉണ്ടാക്കുക. വിഭജിച്ചതിന് ശേഷം രണ്ട് സെറ്റുകളിലും ഉപഭോക്താക്കളൊന്നും ഇല്ലെന്ന് പരിശോധിക്കാൻ കോഡ് ഉൾപ്പെടുത്തുക.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
എൻ്റെ മോഡൽ 98% കൃത്യത നൽകി, അത് മികച്ചതല്ലേ? കോഡ് ഒപ്റ്റിമൈസ് ചെയ്യുക.
98% ആഘോഷിക്കുന്നത് ചോർച്ച മറയ്ക്കുന്നു. ഒപ്റ്റിമൈസ് ചെയ്യുന്നതിന് മുമ്പ്, ഈ സ്കോർ യഥാർത്ഥമാണോ അല്ലയോ എന്ന് ചോദ്യം ചെയ്യണം.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: ലീക്ക് ഇൻസ്പെക്ടർ. ടെസ്റ്റ് സെറ്റിൽ എൻ്റെ മോഡൽ 98% കൃത്യത നൽകുന്നു, അത് എനിക്ക് "സത്യമാകാൻ വളരെ നല്ലതാണ്" എന്ന് തോന്നുന്നു. പരിശോധിക്കുക: (1) ടാർഗെറ്റിൻ്റെ ഫലമായ ഏതെങ്കിലും സവിശേഷതകൾ, (2) വിഭജിക്കുന്നതിന് മുമ്പ് നടത്തിയ പരിവർത്തനങ്ങൾ, (3) രണ്ട് സെറ്റുകളിലായി ഒരേ യൂണിറ്റ്, (4) എന്തെങ്കിലും സമയ ചോർച്ചയുണ്ടോ. സംശയാസ്പദമായ എന്തെങ്കിലും പോയിൻ്റുകൾ പട്ടികപ്പെടുത്തുക; സ്കോർ ശരിയാക്കാതെ ചോർച്ച കണ്ടെത്തുന്നതിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുക.
ഇവിടെ ഉയർന്ന സ്കോർ എന്നത് ചോദ്യം ചെയ്യപ്പെടാനുള്ള അടയാളമായാണ് കണക്കാക്കുന്നത്, ആഘോഷിക്കപ്പെടാനുള്ളതല്ല.
സാധാരണ തെറ്റുകൾ
- "വളരെ നല്ല" ഫലം ആഘോഷിക്കുന്നു. വളരെ നല്ല സ്കോർ ഒരു ലീക്ക് അലേർട്ടാണ്, ഒരു നേട്ടമല്ല.
- വിഭജനത്തിന് മുമ്പുള്ള എല്ലാ ഡാറ്റയിൽ നിന്നും പരിവർത്തനം പഠിക്കുന്നു. ഏറ്റവും സാധാരണമായ ചോർച്ച; പൈപ്പ്ലൈൻ ഉപയോഗിച്ച് ആദ്യം വിഭജിക്കുക.
- ക്രമരഹിതമായി സമയ ശ്രേണി വിഭജിക്കുന്നു. മോഡൽ ഭാവി കാണുന്നു; കാലാനുസൃതമായ വിഭജനം നിർബന്ധമാണ്.
- ഒരേ യൂണിറ്റ് രണ്ട് സെറ്റുകളായി വിടുന്നു. മോഡൽ വ്യക്തിയെ മനഃപാഠമാക്കുന്നു; ഗ്രൂപ്പായി വിഭജിക്കുക.
- സ്വമേധയാ പ്രവേശിച്ച് കോഡിലേക്ക് എഴുതുന്നില്ല. വിശകലനം അപ്രസക്തമാകും; എല്ലാം കോഡിലും ജിറ്റിലും ആയിരിക്കണം.
നുറുങ്ങ്: നിങ്ങളുടെ പ്രോജക്റ്റിൻ്റെ തുടക്കത്തിൽ രണ്ട് വാക്യങ്ങളുള്ള "ബഹുമാനത്തിൻ്റെ പ്രതിജ്ഞ" എഴുതുക: "ഞാൻ ടെസ്റ്റ് സെറ്റ് നിർമ്മാണത്തിൽ കാണുന്നതിന് മുമ്പ് ഒരു തരത്തിലും സ്പർശിച്ചിട്ടില്ല. ഓരോ ഘട്ടവും കോഡിലാണ്, വിത്ത് ഉറപ്പിച്ചിരിക്കുന്നു." നിങ്ങൾക്ക് ഈ രണ്ട് വാക്യങ്ങൾ സത്യസന്ധമായി ഒപ്പിടാൻ കഴിയുന്നില്ലെങ്കിൽ, നിങ്ങളുടെ ഫലം ഇതുവരെ വിശ്വസനീയമല്ല.
ചുരുക്കത്തിൽ
ഡാറ്റ ചോർച്ചയും പുനരുൽപ്പാദിപ്പിക്കാതിരിക്കലും ഡാറ്റാ സയൻസിലെ ഏറ്റവും ചെലവേറിയ നിശബ്ദ പിശകുകളാണ്. ചോർച്ച എന്നത് ഭാവിയെക്കുറിച്ചുള്ള മോഡലിൻ്റെ കാഴ്ചപ്പാടാണ്, അത് തെറ്റായ വിജയമായി സ്വയം അവതരിപ്പിക്കുന്നു; ടെസ്റ്റ് സെറ്റ് നേരത്തെ വിഭജിക്കുക, പരിശീലനത്തിൽ നിന്ന് (പൈപ്പ്ലൈൻ) പരിവർത്തനങ്ങൾ പഠിക്കുക, ഓരോ ഫീച്ചറിലും "പ്രവചന സമയത്ത് എനിക്കത് ഉണ്ടോ" എന്ന ചോദ്യം ചോദിക്കുക, ശരിയായ വിഭജനം (കാലക്രമം/ഗ്രൂപ്പ്) ചെയ്യുക എന്നതാണ് പരിഹാരം. ഒരേ ഫലം രണ്ടുതവണ നേടാൻ കഴിയുന്നതാണ് പുനരുൽപാദനക്ഷമത; സ്റ്റെപ്പുകൾ സ്വമേധയാ നീക്കം ചെയ്യുക, വിത്ത് പിൻ ചെയ്യുക, പതിപ്പുകൾ മരവിപ്പിക്കുക, എല്ലാം Git-ൽ സൂക്ഷിക്കുക എന്നിവയാണ് അവൻ്റെ പരിഹാരം. AI-ക്ക് ഈ അപകടസാധ്യതകൾ കൂട്ടുകയോ കുറയ്ക്കുകയോ ചെയ്യാം; നിങ്ങളുടെ അച്ചടക്കമാണ് നിർണ്ണയിക്കുന്നത്.
ആപ്ലിക്കേഷൻ ടാസ്ക്
നിങ്ങൾ നിർമ്മിച്ച ഒരു മോഡലിൻ്റെ (അല്ലെങ്കിൽ സാങ്കൽപ്പികമായത്) ഫീച്ചർ ലിസ്റ്റ് എടുത്ത് ഓരോ ഫീച്ചറിലും "പ്രവചന സമയത്ത് ഈ വിവരം എനിക്കുണ്ടോ?" എന്ന ചോദ്യം ചോദിക്കുക. എഴുത്തിൽ; കുറഞ്ഞത് ഒരു ലീക്ക് കാൻഡിഡേറ്റെങ്കിലും കണ്ടെത്തുക. തുടർന്ന് നിങ്ങളുടെ വിശകലനം പുനർനിർമ്മിക്കുന്നതിന് ഒരു ചെക്ക്ലിസ്റ്റ് പൂരിപ്പിക്കുക: വിത്ത് ഉറപ്പിച്ചിട്ടുണ്ടോ, മാനുവൽ ഘട്ടങ്ങളുണ്ടോ, പതിപ്പുകൾ രജിസ്റ്റർ ചെയ്തിട്ടുണ്ടോ, അവ Git-ലാണോ. പോരായ്മകൾ പരിഹരിക്കുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] ലീക്ക് അലേർട്ടായി ഞാൻ "ശരിയാകാൻ വളരെ നല്ലതാണ്" സ്കോർ ചോദിച്ചോ?
- [ ] വിഭജനത്തിനു ശേഷമുള്ള എല്ലാ പരിവർത്തനങ്ങളും ഞാൻ പരിശീലനത്തിൽ നിന്ന് പഠിച്ചോ?
- [ ] ഞാൻ സമയം/ഗ്രൂപ്പ് ഘടന (കാലക്രമം/ഗ്രൂപ്പ്കെഫോൾഡ്) അനുസരിച്ച് വിഭജിച്ചിട്ടുണ്ടോ?
- [ ] സ്ഥിരമായ വിത്ത് ഉപയോഗിച്ച് ഞാൻ എല്ലാ ക്രമരഹിതതയും ആവർത്തിച്ചിട്ടുണ്ടോ?
- [ ] ഞാൻ മാനുവൽ ഘട്ടങ്ങൾ നീക്കം ചെയ്ത് എല്ലാം കോഡിലും പതിപ്പ് നിയന്ത്രണത്തിലും സൂക്ഷിച്ചോ?