നേട്ടങ്ങൾ:
- നഷ്ടമായ ഡാറ്റ തരങ്ങൾ (MCAR/MAR/MNAR), ഔട്ട്ലറുകൾ, കോഡിംഗ് പിശകുകൾ എന്നിവ തിരിച്ചറിയാനും ക്ലീനപ്പ് കോഡും ഡയഗ്നോസ്റ്റിക്സും നിർമ്മിക്കുന്നതിന് ശരിയായ ഡാറ്റ ഉപയോഗിച്ച് AI ഉപയോഗിക്കാനുമുള്ള കഴിവ്
- ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് നിർദ്ദേശിക്കുന്ന ഓരോ ക്ലീനിംഗ് ഘട്ടവും (ഇല്ലാതാക്കൽ, അസൈൻമെൻ്റ്, പരിവർത്തനം) എങ്ങനെ വിശകലന ഫലത്തെ ബാധിക്കുമെന്നും റിവേഴ്സിബിൾ, ഡോക്യുമെൻ്റഡ് വർക്ക്ഫ്ലോ സ്ഥാപിക്കുമെന്നും കാണാനുള്ള കഴിവ്
- ക്ലീനപ്പ് തീരുമാനങ്ങൾ ഡാറ്റ സൃഷ്ടിക്കുന്ന പ്രക്രിയയെക്കുറിച്ചുള്ള അറിവിനെ അടിസ്ഥാനമാക്കിയുള്ളതാണെന്നും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഒരു സൂപ്പർവൈസ്ഡ് അസിസ്റ്റൻ്റാണെന്നും അന്ധനായ ഒരു ഓട്ടോമാറ്റണല്ലെന്നും നിലനിർത്തുന്നു
അനുഭവപരിചയമുള്ള ഓരോ അനലിസ്റ്റിനും ഒരു സത്യം അറിയാം: ഒരു അനുഭവപരമായ പ്രോജക്റ്റിൻ്റെ ഭൂരിഭാഗം സമയവും മോഡലിംഗ് അല്ല, മറിച്ച് ഡാറ്റ ക്ലീനിംഗ് (ഡാറ്റയിലെ പിശകുകൾ, ഒഴിവാക്കലുകൾ, പൊരുത്തക്കേടുകൾ എന്നിവ ശരിയാക്കി വിശകലനത്തിന് തയ്യാറാക്കുന്നതിനുള്ള പ്രവർത്തനം). ഒരു ഏകദേശ ചട്ടം പോലെ, ഏകദേശം 70-80% സമയവും ഡാറ്റ മനസ്സിലാക്കാനും വൃത്തിയാക്കാനും രൂപാന്തരപ്പെടുത്താനും പോകുന്നു; യഥാർത്ഥ വിശകലനത്തിന് 20-30% മാത്രമേ അവശേഷിക്കുന്നുള്ളൂ. ഈ യൂണിറ്റിൽ, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് (AI) ഈ ഭാരിച്ച ഭാരം എങ്ങനെ ലഘൂകരിക്കുന്നുവെന്ന് ഞങ്ങൾ ഘട്ടം ഘട്ടമായി കാണും, എന്നാൽ ഏതൊക്കെ തീരുമാനങ്ങൾ ഇപ്പോഴും നിങ്ങളോടൊപ്പം ഉണ്ടായിരിക്കണം, എന്തുകൊണ്ട്.
രണ്ട് അടിസ്ഥാന വസ്തുതകൾ ആദ്യം വെക്കാം. ആദ്യം, ക്ലീനിംഗ് തീരുമാനങ്ങൾ ഡാറ്റ ഉൽപ്പാദിപ്പിക്കുന്ന പ്രക്രിയയെക്കുറിച്ചുള്ള നിങ്ങളുടെ അറിവിനെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്: എന്തുകൊണ്ടാണ് ഒരു മൂല്യം നഷ്ടമായതെന്നും ഒരു സംഖ്യ അമിതമായിരിക്കുന്നത് എന്തുകൊണ്ടാണെന്നും നിങ്ങൾക്ക് മാത്രമേ അറിയൂ. AI ഡാറ്റ കാണുന്നില്ല, സന്ദർഭം അറിയില്ല; കോഡ് എഴുതുന്നു, തീരുമാനങ്ങൾ എടുക്കുന്നില്ല. രണ്ടാമതായി, ഓരോ ക്ലീനിംഗ് ഘട്ടവും വിശകലന ഫലം മാറ്റിയേക്കാം. ഒരു ഔട്ട്ലിയർ ഇല്ലാതാക്കുന്നത് ഗുണകത്തെ വിപരീതമാക്കും; നഷ്ടമായത് ശരാശരി ഉപയോഗിച്ച് പൂരിപ്പിക്കുന്നത് കൃത്രിമമായി വ്യത്യാസം കുറയ്ക്കും. അതിനാൽ വൃത്തിയാക്കൽ പഴയപടിയാക്കാവുന്നതും ഡോക്യുമെൻ്റ് ചെയ്തതുമായിരിക്കണം: അസംസ്കൃത ഡാറ്റ ഒരിക്കലും തൊടരുത്, കോഡിലെ ഓരോ ഘട്ടവും ചെയ്യുക, ഓരോ ഘട്ടത്തിൻ്റെയും ആഘാതം രേഖപ്പെടുത്തുക.
ഘട്ടം ഘട്ടമായുള്ള ക്ലീനിംഗ് വർക്ക്ഫ്ലോ
1. ഡാറ്റ അറിയുക. ആദ്യം ഘടന കാണുക: വരികളുടെ എണ്ണം (നിരീക്ഷണങ്ങൾ), നിരകൾ (വേരിയബിളുകൾ), ഓരോ വേരിയബിളിൻ്റെയും തരം (സംഖ്യ, വർഗ്ഗീകരണം, തീയതി), സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ, കാണാതായവയുടെ എണ്ണം. ഈ "ഡാറ്റ പ്രൊഫൈൽ" കോഡിനായി നിങ്ങൾക്ക് AI-യോട് ആവശ്യപ്പെടാം; എന്നാൽ നിങ്ങൾ ഔട്ട്പുട്ട് വായിച്ച് "എന്തുകൊണ്ടാണ് ഈ വേരിയബിൾ വാചകമായി വന്നത്?"
2. നഷ്ടമായ ഡാറ്റ മനസ്സിലാക്കുകയും തരംതിരിക്കുകയും ചെയ്യുക. നഷ്ടപ്പെട്ട ഡാറ്റ മൂന്ന് തരങ്ങളായി തിരിച്ചിരിക്കുന്നു. MCAR (യാദൃശ്ചികമായി പൂർണ്ണമായും കാണുന്നില്ല): കാണാതായത് എന്തെങ്കിലും കാരണമല്ല, ഉദാഹരണത്തിന് ഒരു സെൻസർ ക്രമരഹിതമായി പരാജയപ്പെട്ടു. MAR (യാദൃശ്ചികമായി കാണുന്നില്ല): കാണാതെ പോകുന്നത് മറ്റ് നിരീക്ഷിച്ച വേരിയബിളുകളെ ആശ്രയിച്ചിരിക്കുന്നു, ഉദാഹരണത്തിന് പ്രായമായ ആളുകൾ പലപ്പോഴും ഒരു ചോദ്യം ശൂന്യമായി വിടുന്നു, പക്ഷേ നിങ്ങൾക്ക് പ്രായം അറിയാം. MNAR (യാദൃശ്ചികമായി കാണുന്നില്ല): കാണാതാവുന്നത് നിരീക്ഷിക്കപ്പെടാത്ത മൂല്യത്തെ ആശ്രയിച്ചിരിക്കുന്നു, ഉദാഹരണത്തിന് ഉയർന്ന വരുമാനമുള്ളവർ അവരുടെ വരുമാനം റിപ്പോർട്ട് ചെയ്യുന്നില്ല. ഈ വ്യത്യാസം നിർണായകമാണ്, കാരണം ഇത് പരിഹാര രീതി നിർണ്ണയിക്കുന്നു, കൂടാതെ AI-ക്ക് നിങ്ങൾക്കായി ഇത് തീരുമാനിക്കാൻ കഴിയില്ല.
3. കുറവ് കൈകാര്യം ചെയ്യുക. ഓപ്ഷനുകൾ: ലിസ്റ്റ്വൈസ് ഡിലീഷൻ, മീഡിയൻ/മീഡിയൻ ഇംപ്യൂട്ടേഷൻ, മോഡൽ അടിസ്ഥാനമാക്കിയുള്ള മൾട്ടിപ്പിൾ ഇംപ്യൂട്ടേഷൻ. MCAR-ൽ ഇല്ലാതാക്കുന്നത് താരതമ്യേന സുരക്ഷിതമാണെങ്കിലും സാമ്പിൾ വലുപ്പം കുറയ്ക്കുന്നു. MAR-ൽ ഒന്നിലധികം അസൈൻമെൻ്റ് കൂടുതൽ അനുയോജ്യമാണ്. ഒരു ലളിതമായ രീതിയും MNAR-ൽ നിഷ്പക്ഷത ഉറപ്പുനൽകുന്നില്ല; കുറവുള്ള സംവിധാനം മാതൃകയാക്കണം അല്ലെങ്കിൽ കുറഞ്ഞത് ഒരു സെൻസിറ്റിവിറ്റി വിശകലനം നടത്തണം. ശരാശരി പൂരിപ്പിക്കൽ എളുപ്പവും അപകടകരവുമാണ്: ഇത് വ്യത്യാസം കുറയ്ക്കുന്നു, ബന്ധങ്ങളെ ദുർബലപ്പെടുത്തുന്നു, അനിശ്ചിതത്വം മറയ്ക്കുന്നു.
4. ഔട്ട്ലറുകൾ പരിശോധിക്കുക. മറ്റുള്ളവരിൽ നിന്ന് വളരെ അകലെ നിൽക്കുന്ന ഒരു നിരീക്ഷണമാണ് ഔട്ട്ലൈയർ. രണ്ട് ചോദ്യങ്ങൾ വേർതിരിക്കുക: ഇതൊരു പിശകാണോ (ഡേറ്റാ എൻട്രിയിൽ വയസ്സ് 999 എന്ന് എഴുതിയിരിക്കുന്നു) അതോ ഇത് യഥാർത്ഥ എന്നാൽ അതിരുകടന്ന മൂല്യമാണോ (ഒരു ശതകോടീശ്വരൻ്റെ വരുമാനം)? ബഗുകൾ പരിഹരിക്കുക; യഥാർത്ഥ ഔട്ട്ലറുകൾ ഇല്ലാതാക്കരുത്, കാരണം അവ ഡാറ്റയെ പ്രതിനിധീകരിക്കുന്നു. "അത് ശല്യപ്പെടുത്തുന്നതിനാൽ" ഔട്ട്ലിയർ ഇല്ലാതാക്കുന്നത് നിങ്ങൾ ഡാറ്റയെ ഫലത്തിലേക്ക് വ്യതിചലിപ്പിക്കുകയാണ്.
5. കോഡിംഗും സ്ഥിരതയും. വിഭാഗങ്ങൾ ("പുരുഷൻ", "പുരുഷൻ", "ഇ" എല്ലാം ഒരു കോഡിലേക്ക്) സ്റ്റാൻഡേർഡ് ചെയ്യുക, തീയതികൾ ഒരു ഫോർമാറ്റിലേക്കും യൂണിറ്റുകൾ ഒരു സ്കെയിലിലേക്കും കൊണ്ടുവരിക, തനിപ്പകർപ്പ് വരികൾ കണ്ടെത്തുക. AI മികച്ച രീതിയിൽ സഹായിക്കുന്ന അപകടസാധ്യത കുറഞ്ഞ ഘട്ടമാണിത്.
6. പ്രമാണവും മരവിപ്പിക്കലും. ഓരോ ഘട്ടവും കോഡും ഒരു കമൻ്റ് ലൈനും ഉപയോഗിച്ച് റെക്കോർഡ് ചെയ്യുക, അസംസ്കൃതവും വൃത്തിയാക്കിയതുമായ ഡാറ്റ പ്രത്യേകം സൂക്ഷിക്കുക. അപ്പോൾ ഒരു റഫറി ചോദിക്കുമ്പോൾ "എന്തുകൊണ്ടാണ് ഈ നിരീക്ഷണങ്ങൾ ഒഴിവാക്കിയത്?" നിങ്ങളുടെ ഉത്തരം തയ്യാറാണ്.
മുന്നറിയിപ്പ്: ഫലങ്ങളെ അടിസ്ഥാനമാക്കി ക്ലീനിംഗ് തീരുമാനങ്ങൾ എടുക്കരുത്. "നിങ്ങൾ ഈ വരി ഇല്ലാതാക്കുമ്പോൾ, ഗുണകം പ്രാധാന്യമർഹിക്കുന്നു" എന്ന് പറയുന്ന ഒരു വരി ഇല്ലാതാക്കുന്നത് പി-ഹാക്കിംഗിൻ്റെ ഏറ്റവും വഞ്ചനാപരമായ രൂപമാണ്, അത് അടുത്ത യൂണിറ്റിൽ നമുക്ക് കാണാം.
താരതമ്യ പട്ടിക: നഷ്ടമായ ഡാറ്റാ രീതികൾ
രീതി
എപ്പോഴാണ് അത് ഉചിതം?
അപകടം
AI യുടെ പങ്ക്
ഒരു വരി ഇല്ലാതാക്കുക
MCAR, കുറഞ്ഞ മിസ്സിംഗ് നിരക്ക്
സാമ്പിൾ ചെറുതായി മാറുന്നു, MAR/MNAR-ൽ പക്ഷപാതം
കോഡ് എഴുതുന്നു; നിങ്ങൾ തീരുമാനിക്കുക
ശരാശരി/മധ്യസ്ഥ അസൈൻമെൻ്റ്
ദ്രുത പ്രാഥമിക വിശകലനം
വ്യത്യാസം കുറയ്ക്കുന്നു, ബന്ധം മറയ്ക്കുന്നു
ഇത് എളുപ്പമാണെങ്കിലും ശുപാർശ ചെയ്യുന്നില്ല; മുന്നറിയിപ്പ് നൽകണം
ഒന്നിലധികം അസൈൻമെൻ്റ് (MI)
MAR, പ്രധാനപ്പെട്ട വേരിയബിളുകൾ
ശരിയായി ഇൻസ്റ്റാൾ ചെയ്തില്ലെങ്കിൽ, അത് തെറ്റിദ്ധരിപ്പിക്കും
കോഡും പാക്കേജും ശുപാർശ ചെയ്യുന്നു (എലികൾ)
മെക്കാനിസം മോഡലിംഗ്
എം.എൻ.ആർ
സങ്കീർണ്ണമായ, അനുമാന-തീവ്രമായ
ഡ്രാഫ്റ്റ് മാത്രം; വിദഗ്ധൻ ആവശ്യമാണ്
പകർത്താവുന്ന നാല് നിർദ്ദേശങ്ങൾ
1. ഡാറ്റ പ്രൊഫൈലിംഗ്:
നിങ്ങളുടെ റോൾ: ഡാറ്റ ക്ലീൻസിംഗ് അസിസ്റ്റൻ്റ്. ഞാൻ ഡാറ്റ പങ്കിടുന്നില്ല, എനിക്ക് R കോഡ് വേണം. എനിക്ക് 'ഡിജിറ്റ്' എന്നൊരു ഡാറ്റ.ഫ്രെയിം ഉണ്ട്; വേരിയബിളുകൾ: ഐഡി, പ്രായം (സംഖ്യാ), വരുമാനം (സംഖ്യാ), വിദ്യാഭ്യാസം (വിഭാഗീയം), പ്രദേശം (വർഗ്ഗീയം), തീയതി (തീയതി). ടാസ്ക്: ഓരോ വേരിയബിളിനും തരം, നഷ്ടമായ സംഖ്യയും നിരക്കും സൃഷ്ടിക്കുന്ന കോഡ് എഴുതുക, സംഖ്യകൾക്കുള്ള സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ, വർഗ്ഗീകരണത്തിനുള്ള ആവൃത്തി പട്ടിക. കമൻ്റ് ലൈൻ ചേർക്കുക.
2. നഷ്ടമായ ഡാറ്റ രോഗനിർണയം:
മുകളിലുള്ള 'അക്ക' ഡാറ്റയ്ക്കായി നഷ്ടമായ പാറ്റേൺ പരിശോധിക്കുന്ന കോഡ് എഴുതുക: - ഓരോ വേരിയബിളിൻ്റെയും നഷ്ടമായ നിരക്ക്, - മറ്റ് വേരിയബിളുകളുമായുള്ള നഷ്ടതയുടെ ബന്ധം കാണിക്കുന്ന ഒരു ലളിതമായ പട്ടിക/ഗ്രാഫ്. ഞാൻ കോഡിൻ്റെ ഔട്ട്പുട്ട് നോക്കി MCAR/MAR/MNAR വേർതിരിവ് ഉണ്ടാക്കും; നിങ്ങൾ ഡയഗ്നോസ്റ്റിക് ടൂൾ നിർമ്മിക്കുക, അസൈൻമെൻ്റ് രീതി തീരുമാനിക്കരുത്.
3. ഔട്ട്ലിയർ പരിശോധന (ഇല്ലാതാക്കലല്ല):
വേരിയബിൾ 'വരുമാനം' എന്നതിനായുള്ള കോഡ് എഴുതുക, അത് ഇല്ലാതാക്കാതെ തന്നെ ഔട്ട്ലൈയറുകളെ പരിശോധിക്കുന്നു: ബോക്സ്പ്ലോട്ട്, ഐക്യുആർ അടിസ്ഥാനമാക്കിയുള്ള ബൗണ്ടുകൾ, പട്ടിക ലിസ്റ്റിംഗ് ഔട്ട്ലിയർ നിരീക്ഷണങ്ങൾ + മൂല്യങ്ങൾ. ഇവ തെറ്റുകളാണോ യഥാർത്ഥമാണോ എന്ന് ഞാൻ നോക്കും. സ്വയമേവ ഇല്ലാതാക്കൽ ചേർക്കുക.
4. കോഡിംഗ് സ്റ്റാൻഡേർഡൈസേഷൻ:
'വിദ്യാഭ്യാസ' വേരിയബിളിൽ, മൂല്യങ്ങൾ സമ്മിശ്രമായി എഴുതിയിരിക്കുന്നു: "പ്രൈമറി സ്കൂൾ", "പ്രൈമറി സ്കൂൾ", "പ്രൈമറി", "ഹൈസ്കൂൾ", "ഹൈസ്കൂൾ", "യൂണിവേഴ്സിറ്റി", "യൂണിവേഴ്സിറ്റി". ഇവയെ സ്ഥിരതയുള്ള വിഭാഗങ്ങളിലേക്ക് റീകോഡ് ചെയ്യുന്ന R കോഡ് എഴുതുക; മാപ്പിംഗ് പട്ടിക വ്യക്തമായി കാണിക്കുക, അങ്ങനെ എനിക്ക് ഓരോ പരിവർത്തനവും സ്ഥിരീകരിക്കാൻ കഴിയും. നിങ്ങൾ തിരിച്ചറിയാത്ത മൂല്യം "അജ്ഞാതൻ" എന്ന് സജ്ജമാക്കുക.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
ഡാറ്റ വൃത്തിയാക്കുക, വിടവുകൾ പൂരിപ്പിക്കുക, പുറത്തുള്ളവ ഉപേക്ഷിക്കുക.
ഈ ആവശ്യം അപകടകരമാണ്: ഇത് AI-ക്ക് അന്ധമായ അധികാരം നൽകുന്നു. ഏതുതരം മിസ്സിംഗ്, ഏതുതരം പൂരിപ്പിക്കൽ, എന്ത് വൈരുദ്ധ്യാത്മക സത്യം - ഇതൊന്നും വ്യക്തമല്ല. ഫലം രഹസ്യമായി പക്ഷപാതപരമായ ഡാറ്റ സെറ്റായിരിക്കാം.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: ക്ലീനിംഗ് അസിസ്റ്റൻ്റ്, നിങ്ങൾ തീരുമാനമെടുക്കുന്നയാളല്ല. ഓരോ ഘട്ടത്തിൻ്റെയും ആഘാതം റിപ്പോർട്ടുചെയ്യുന്ന കോഡ് പടിപടിയായി പോയി എഴുതുക: 1) നഷ്ടമായ പാറ്റേൺ കാണിക്കുക (ഇല്ലാതാക്കരുത്/ഫിൽ ചെയ്യരുത്), 2) ഔട്ട്ലിയർ കാൻഡിഡേറ്റുകളെ പട്ടികപ്പെടുത്തുക (ഇല്ലാതാക്കരുത്), 3) മാപ്പിംഗ് ടേബിളിലെ കാറ്റഗറി പൊരുത്തക്കേടുകൾ പരിഹരിക്കുക. ഓരോ ഘട്ടത്തിനും ശേഷം വരികളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പ്രിൻ്റ് ചെയ്യുക, അതുവഴി എനിക്ക് മാറ്റം കാണാനും സ്ഥിരീകരിക്കാനും കഴിയും. സ്വയമേവയുള്ള അസൈൻമെൻ്റ്/ഇല്ലാതാക്കൽ ഉൾപ്പെടുത്തൽ.
വ്യത്യാസം വ്യക്തമാണ്: ശക്തമായ ഇച്ഛാശക്തി AI-യെ ഒരു സൂപ്പർവൈസ്ഡ് അസിസ്റ്റൻ്റായി സ്ഥാപിക്കുകയും റിവേഴ്സിബിൾ, ഡോക്യുമെൻ്റഡ് സ്റ്റെപ്പുകൾ നിർമ്മിക്കുകയും ചെയ്യുന്നു.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - ശരാശരി അസൈൻമെൻ്റ് ട്രാപ്പ്. ഒരു അനലിസ്റ്റിൻ്റെ 5,000 ആളുകളുടെ വരുമാന ഡാറ്റയിൽ 18% കാണുന്നില്ല. "വിടവുകൾ നികത്താൻ" അദ്ദേഹം AI-യോട് പറഞ്ഞു; AI അവയെല്ലാം ശരാശരിയാക്കി. ഫലം: വരുമാനത്തിൻ്റെ വ്യത്യാസം 22% കുറഞ്ഞു, വിദ്യാഭ്യാസ-വരുമാന ബന്ധത്തിൻ്റെ ഗുണകം അതിനെക്കാൾ ദുർബലമായി മാറി. ശരിയായ വഴി: പോരായ്മ MAR ആയിരുന്നു (വിദ്യാഭ്യാസം കാരണം), ഒന്നിലധികം അസൈൻമെൻ്റുകൾ (എലികൾ) നികത്തേണ്ടതുണ്ട്. പാഠം: പൂരിപ്പിക്കൽ രീതി മെക്കാനിസത്തെ ആശ്രയിച്ചിരിക്കുന്നു.
കേസ് 2 - ഔട്ട്ലിയർ ക്ലീനിംഗ് കണ്ടെത്തലിനെ വിപരീതമാക്കുന്നു. ഒരു സ്ഥാപന ഡാറ്റയിൽ 3 വളരെ വലിയ സ്ഥാപനങ്ങൾ (മൊത്തം നിരീക്ഷണത്തിൻ്റെ 0.6%) ഉണ്ടായിരുന്നു. AI യുടെ "ക്ലീനിംഗ്" നിർദ്ദേശത്താൽ ഇവ ഇല്ലാതാക്കി; സ്കെയിൽ കോഫിഫിഷ്യൻ്റ് സമ്പദ്വ്യവസ്ഥ പോസിറ്റീവിൽ നിന്ന് നെഗറ്റീവ് ആയി മാറി. എന്നിരുന്നാലും, ആ 3 കമ്പനികൾ യഥാർത്ഥവും വ്യവസായത്തിൻ്റെ ഒരു പ്രധാന ഭാഗവുമായിരുന്നു. ഇല്ലാതാക്കുന്നതിനുപകരം പൂർണ്ണവും കരുത്തുറ്റതുമായ എസ്റ്റിമേഷനോടെ റിപ്പോർട്ട് ചെയ്യുക എന്നതായിരുന്നു ശരിയായ മാർഗം. പാഠം: യഥാർത്ഥ ഔട്ട്ലറുകൾ ഡാറ്റയാണ്, ശബ്ദമല്ല.
കേസ് 3 - നിശബ്ദ കോഡിംഗ് പിശക്. ഒരു പാനലിൽ, തീയതി വേരിയബിൾ രണ്ട് വ്യത്യസ്ത ഫോർമാറ്റുകളിൽ വന്നു ("2020-03-01", "01/03/2020"). AI നിർമ്മിച്ച കോമ്പിനേഷൻ കോഡ് അവയെ വ്യത്യസ്ത മൂല്യങ്ങളായി തെറ്റിദ്ധരിച്ചപ്പോൾ, 1,400 നിരീക്ഷണങ്ങൾ പൊരുത്തപ്പെടുന്നില്ല, വളർച്ചാ നിരക്ക് പരിഹാസ്യമായി. നിരകളുടെ എണ്ണം നിരീക്ഷകൻ പരിശോധിച്ചില്ലെങ്കിൽ കാര്യമില്ല. പാഠം: ഓരോ ഘട്ടത്തിനുശേഷവും നിരീക്ഷണ എണ്ണവും സാനിറ്റി പരിശോധനയും നിർബന്ധമാണ്.
സാധാരണ തെറ്റുകൾ
- ശരാശരി ഉപയോഗിച്ച് വിടവ് അന്ധമായി പൂരിപ്പിക്കുന്നു. ഇത് വ്യത്യാസം കുറയ്ക്കുകയും അനിശ്ചിതത്വം മറയ്ക്കുകയും MAR/MNAR-ൽ പക്ഷപാതം സൃഷ്ടിക്കുകയും ചെയ്യുന്നു. ആദ്യം മെക്കാനിസം തരംതിരിക്കുക.
- "അത് ശല്യപ്പെടുത്തുന്നതിനാൽ" ഔട്ട്ലിയർ ഇല്ലാതാക്കുന്നു. യഥാർത്ഥ ഔട്ട്ലറുകൾ ഡാറ്റയെ പ്രതിനിധീകരിക്കുന്നു; ഇല്ലാതാക്കുന്നത് ഫലം വളച്ചൊടിക്കുന്നു. തെറ്റ് തിരുത്തുക, യഥാർത്ഥമായത് നിലനിർത്തുക.
- റോ ഡാറ്റ ടാപ്പുചെയ്യുന്നു. അസംസ്കൃത ഡാറ്റ ഒരിക്കലും പരിഷ്ക്കരിക്കരുത്; കോഡ് ഉപയോഗിച്ച് എല്ലാ ക്ലീനപ്പുകളും ഒരു പ്രത്യേക പകർപ്പിൽ ചെയ്യുക, അങ്ങനെ അത് പഴയപടിയാക്കാനാകും.
- പടികളുടെ ആഘാതം അളക്കുന്നില്ല. ഓരോ ഘട്ടത്തിനും ശേഷവും വരികളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പരിശോധിച്ചില്ലെങ്കിൽ, നിശബ്ദ പിശകുകൾ കുമിഞ്ഞുകൂടും.
- ഫലമായി വൃത്തിയാക്കൽ. "നിങ്ങൾ ഈ വരി ചേർക്കുമ്പോൾ, ഫലം മികച്ചതാകുന്നു" എന്നതിൻ്റെ യുക്തി p-ഹാക്കിംഗ് ആണ്; വിശകലന ഫലത്തിന് മുമ്പും സ്വതന്ത്രമായും ക്ലീനിംഗ് ആസൂത്രണം ചെയ്യണം.
നുറുങ്ങ്: ശുചീകരണത്തിന് മുമ്പും ശേഷവും ഒരേ അടിസ്ഥാന സ്ഥിതിവിവരക്കണക്കുകൾ (അർത്ഥം, ശരാശരി, നിരീക്ഷണങ്ങളുടെ എണ്ണം, കുറച്ച് പരസ്പര ബന്ധങ്ങൾ) വയ്ക്കുന്ന ഒരു "മുമ്പ്/പിന്നീട്" പട്ടിക സൂക്ഷിക്കുക. അപ്രതീക്ഷിതമായ ഒരു കുതിച്ചുചാട്ടമാണ് മറഞ്ഞിരിക്കുന്ന പിശകിൻ്റെ ഏറ്റവും മികച്ച സൂചന.
ചുരുക്കത്തിൽ
അനുഭവപരമായ ജോലിയുടെ ഏറ്റവും കൂടുതൽ സമയം ചെലവഴിക്കുന്നതും തീരുമാനമെടുക്കേണ്ടതുമായ ഘട്ടമാണ് ഡാറ്റ ക്ലീനിംഗ്. AI ഇതിൽ ഒരു ശക്തമായ കോഡ് ജനറേറ്ററാണ്, പക്ഷേ അതിന് ഷോട്ടുകൾ വിളിക്കാൻ കഴിയില്ല: നിങ്ങൾ കാണാതായ ഡാറ്റ തരം (MCAR/MAR/MNAR) തരംതിരിക്കുക, ഔട്ട്ലൈയർ ഒരു പിശകാണോ യഥാർത്ഥമാണോ എന്ന് നിർണ്ണയിക്കുക, ഓരോ ഘട്ടവും പഴയപടിയാക്കുകയും രേഖപ്പെടുത്തുകയും ചെയ്യുക. AI-ന് അന്ധമായ "വ്യക്തമായ" അധികാരം നൽകുന്നതിനുപകരം, ആഘാതം അളക്കുകയും സാധൂകരിക്കുകയും ചെയ്യുന്ന ഒരു ഘട്ടം ഘട്ടമായുള്ള വർക്ക്ഫ്ലോ സ്ഥാപിക്കുക. ഓരോ ഘട്ടത്തിനുശേഷവും നിരീക്ഷണങ്ങളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പരിശോധിക്കുന്നത് നിശബ്ദ പിശകുകൾക്കുള്ള മികച്ച മറുമരുന്നാണ്.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു ഡാറ്റാ സെറ്റിൽ (നിങ്ങളുടെ സ്വന്തം ഡാറ്റ അല്ലെങ്കിൽ ഒരു സാമ്പിൾ സെറ്റ്) വിട്ടുപോയതും പുറത്തുള്ളതുമായ രണ്ട് വേരിയബിളുകളെങ്കിലും തിരഞ്ഞെടുക്കുക. മുകളിലുള്ള "ഘട്ടം ഘട്ടമായി, ഇല്ലാതാക്കരുത്/ഫിൽ ചെയ്യരുത്" എന്ന നിർദ്ദേശം വഴി AI-യിൽ നിന്ന് ഒരു ഡയഗ്നോസ്റ്റിക് കോഡ് അഭ്യർത്ഥിച്ച് അത് പ്രവർത്തിപ്പിക്കുക. ന്യൂനതയെ MCAR/MAR/MNAR എന്ന് തരംതിരിച്ച് നിങ്ങളുടെ ന്യായീകരണം ഒരു വാചകത്തിൽ എഴുതുക. പരസ്പര വിരുദ്ധമായ സ്ഥാനാർത്ഥികളെ ഓരോന്നായി പരിശോധിച്ച് ഏതാണ് തെറ്റ്, ഏതാണ് യഥാർത്ഥമെന്ന് തീരുമാനിക്കുക. അവസാനമായി, വൃത്തിയാക്കുന്നതിന് മുമ്പോ ശേഷമോ ഒരു "മുൻപ്-പിന്നീട്" പട്ടിക തയ്യാറാക്കി എന്തെങ്കിലും അപ്രതീക്ഷിത മാറ്റങ്ങൾ ഉണ്ടെങ്കിൽ റിപ്പോർട്ട് ചെയ്യുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] ഞാൻ റോ ഡാറ്റ മാറ്റാതെ ഒരു പ്രത്യേക പകർപ്പിൽ വൃത്തിയാക്കി.
- [ ] ഞാൻ ന്യൂനതയെ MCAR/MAR/MNAR എന്ന് തരംതിരിക്കുകയും അതിനനുസരിച്ച് രീതി തിരഞ്ഞെടുക്കുകയും ചെയ്തു.
- [ ] ഞാൻ പുറത്തുള്ളവ ഓരോന്നായി പരിശോധിച്ചു, അവ തെറ്റുകളാണോ യഥാർത്ഥമാണോ എന്ന്; ഞാൻ അത് അന്ധമായി ഇല്ലാതാക്കിയിട്ടില്ല.
- [ ] ഓരോ ക്ലീനിംഗ് ഘട്ടത്തിനും ശേഷം ഞാൻ നിരീക്ഷണങ്ങളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പരിശോധിച്ചു.
- [ ] ഞാൻ എല്ലാ ഘട്ടങ്ങളും കോഡും ഒരു കമൻ്റ് ലൈനും ഉപയോഗിച്ച് രേഖപ്പെടുത്തി; തിരിച്ചുള്ള.
- [ ] ഞാൻ ക്ലീനിംഗ് അടിസ്ഥാനമാക്കിയുള്ളത് ഡാറ്റ ഉൽപ്പാദിപ്പിക്കുന്ന പ്രക്രിയയെക്കുറിച്ചുള്ള അറിവിനെ അടിസ്ഥാനമാക്കിയാണ്, വിശകലന ഫലത്തെ അടിസ്ഥാനമാക്കിയല്ല.