യൂണിറ്റുകൾ
1. സാമ്പത്തികശാസ്ത്രത്തിലും സ്ഥിതിവിവരക്കണക്കിലും കൃത്രിമബുദ്ധി: റോളുകൾ, അതിരുകൾ, ആധികാരികത, സ്വകാര്യത 2. ഡാറ്റ ക്ലീനിംഗും തയ്യാറാക്കലും: നഷ്ടപ്പെട്ട ഡാറ്റ, ഔട്ട്‌ലറുകൾ, കോഡിംഗ് 3. പര്യവേക്ഷണ ഡാറ്റാ വിശകലനവും ദൃശ്യവൽക്കരണവും: കൃത്രിമ ബുദ്ധി ഉപയോഗിച്ച് ഗ്രാഫിംഗും വ്യാഖ്യാനവും 4. ലീനിയർ റിഗ്രഷൻ: മോഡൽ ബിൽഡിംഗ്, കോഫിഫിഷ്യൻ്റ് ഇൻ്റർപ്രെട്ടേഷൻ, അനുമാനങ്ങൾ 5. റിഗ്രഷൻ ഡയഗ്‌നോസ്റ്റിക്‌സും ലംഘനങ്ങളും: കോളിനാരിറ്റി, ഹെറ്ററോസെഡസ്‌റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ 6. അനുമാന പരിശോധനയും പി-മൂല്യവും: പ്രാധാന്യം, ശക്തി, ഒന്നിലധികം താരതമ്യങ്ങൾ 7. പി-ഹാക്കിംഗ്, ഹാർക്കിംഗ്, സ്റ്റാറ്റിസ്റ്റിക്കൽ ഇൻ്റഗ്രിറ്റി: കൃത്രിമ ബുദ്ധിയുടെ യുഗത്തിലെ അപകടങ്ങൾ 8. സമയ ശ്രേണി വിശകലനം: നിശ്ചലത, അരിമ, പ്രവചനം 9. കാരണവും നയ വിശകലനവും: ഡിഐഡി, ഐവി, ആർഡിഡി, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് 10. കോഡ് ജനറേഷനും പുനരുൽപ്പാദനവും: ആർ/പൈത്തൺ, വേർഷനിംഗ്, റീപ്രൊഡ്യൂസിബിലിറ്റി 11. റിപ്പോർട്ട് റൈറ്റിംഗ്, ആശയവിനിമയം, ധാർമ്മികത: ഫലങ്ങൾ അവതരിപ്പിക്കൽ, അതിരുകൾ ആശയവിനിമയം
യൂണിറ്റ് 2 / 11

ഡാറ്റ ക്ലീനിംഗും തയ്യാറാക്കലും: നഷ്ടപ്പെട്ട ഡാറ്റ, ഔട്ട്‌ലറുകൾ, കോഡിംഗ്

നേട്ടങ്ങൾ:

  • നഷ്‌ടമായ ഡാറ്റ തരങ്ങൾ (MCAR/MAR/MNAR), ഔട്ട്‌ലറുകൾ, കോഡിംഗ് പിശകുകൾ എന്നിവ തിരിച്ചറിയാനും ക്ലീനപ്പ് കോഡും ഡയഗ്‌നോസ്റ്റിക്‌സും നിർമ്മിക്കുന്നതിന് ശരിയായ ഡാറ്റ ഉപയോഗിച്ച് AI ഉപയോഗിക്കാനുമുള്ള കഴിവ്
  • ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് നിർദ്ദേശിക്കുന്ന ഓരോ ക്ലീനിംഗ് ഘട്ടവും (ഇല്ലാതാക്കൽ, അസൈൻമെൻ്റ്, പരിവർത്തനം) എങ്ങനെ വിശകലന ഫലത്തെ ബാധിക്കുമെന്നും റിവേഴ്‌സിബിൾ, ഡോക്യുമെൻ്റഡ് വർക്ക്ഫ്ലോ സ്ഥാപിക്കുമെന്നും കാണാനുള്ള കഴിവ്
  • ക്ലീനപ്പ് തീരുമാനങ്ങൾ ഡാറ്റ സൃഷ്ടിക്കുന്ന പ്രക്രിയയെക്കുറിച്ചുള്ള അറിവിനെ അടിസ്ഥാനമാക്കിയുള്ളതാണെന്നും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഒരു സൂപ്പർവൈസ്ഡ് അസിസ്റ്റൻ്റാണെന്നും അന്ധനായ ഒരു ഓട്ടോമാറ്റണല്ലെന്നും നിലനിർത്തുന്നു

അനുഭവപരിചയമുള്ള ഓരോ അനലിസ്റ്റിനും ഒരു സത്യം അറിയാം: ഒരു അനുഭവപരമായ പ്രോജക്റ്റിൻ്റെ ഭൂരിഭാഗം സമയവും മോഡലിംഗ് അല്ല, മറിച്ച് ഡാറ്റ ക്ലീനിംഗ് (ഡാറ്റയിലെ പിശകുകൾ, ഒഴിവാക്കലുകൾ, പൊരുത്തക്കേടുകൾ എന്നിവ ശരിയാക്കി വിശകലനത്തിന് തയ്യാറാക്കുന്നതിനുള്ള പ്രവർത്തനം). ഒരു ഏകദേശ ചട്ടം പോലെ, ഏകദേശം 70-80% സമയവും ഡാറ്റ മനസ്സിലാക്കാനും വൃത്തിയാക്കാനും രൂപാന്തരപ്പെടുത്താനും പോകുന്നു; യഥാർത്ഥ വിശകലനത്തിന് 20-30% മാത്രമേ അവശേഷിക്കുന്നുള്ളൂ. ഈ യൂണിറ്റിൽ, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് (AI) ഈ ഭാരിച്ച ഭാരം എങ്ങനെ ലഘൂകരിക്കുന്നുവെന്ന് ഞങ്ങൾ ഘട്ടം ഘട്ടമായി കാണും, എന്നാൽ ഏതൊക്കെ തീരുമാനങ്ങൾ ഇപ്പോഴും നിങ്ങളോടൊപ്പം ഉണ്ടായിരിക്കണം, എന്തുകൊണ്ട്.

രണ്ട് അടിസ്ഥാന വസ്തുതകൾ ആദ്യം വെക്കാം. ആദ്യം, ക്ലീനിംഗ് തീരുമാനങ്ങൾ ഡാറ്റ ഉൽപ്പാദിപ്പിക്കുന്ന പ്രക്രിയയെക്കുറിച്ചുള്ള നിങ്ങളുടെ അറിവിനെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്: എന്തുകൊണ്ടാണ് ഒരു മൂല്യം നഷ്‌ടമായതെന്നും ഒരു സംഖ്യ അമിതമായിരിക്കുന്നത് എന്തുകൊണ്ടാണെന്നും നിങ്ങൾക്ക് മാത്രമേ അറിയൂ. AI ഡാറ്റ കാണുന്നില്ല, സന്ദർഭം അറിയില്ല; കോഡ് എഴുതുന്നു, തീരുമാനങ്ങൾ എടുക്കുന്നില്ല. രണ്ടാമതായി, ഓരോ ക്ലീനിംഗ് ഘട്ടവും വിശകലന ഫലം മാറ്റിയേക്കാം. ഒരു ഔട്ട്‌ലിയർ ഇല്ലാതാക്കുന്നത് ഗുണകത്തെ വിപരീതമാക്കും; നഷ്ടമായത് ശരാശരി ഉപയോഗിച്ച് പൂരിപ്പിക്കുന്നത് കൃത്രിമമായി വ്യത്യാസം കുറയ്ക്കും. അതിനാൽ വൃത്തിയാക്കൽ പഴയപടിയാക്കാവുന്നതും ഡോക്യുമെൻ്റ് ചെയ്തതുമായിരിക്കണം: അസംസ്‌കൃത ഡാറ്റ ഒരിക്കലും തൊടരുത്, കോഡിലെ ഓരോ ഘട്ടവും ചെയ്യുക, ഓരോ ഘട്ടത്തിൻ്റെയും ആഘാതം രേഖപ്പെടുത്തുക.

ഘട്ടം ഘട്ടമായുള്ള ക്ലീനിംഗ് വർക്ക്ഫ്ലോ

1. ഡാറ്റ അറിയുക. ആദ്യം ഘടന കാണുക: വരികളുടെ എണ്ണം (നിരീക്ഷണങ്ങൾ), നിരകൾ (വേരിയബിളുകൾ), ഓരോ വേരിയബിളിൻ്റെയും തരം (സംഖ്യ, വർഗ്ഗീകരണം, തീയതി), സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ, കാണാതായവയുടെ എണ്ണം. ഈ "ഡാറ്റ പ്രൊഫൈൽ" കോഡിനായി നിങ്ങൾക്ക് AI-യോട് ആവശ്യപ്പെടാം; എന്നാൽ നിങ്ങൾ ഔട്ട്പുട്ട് വായിച്ച് "എന്തുകൊണ്ടാണ് ഈ വേരിയബിൾ വാചകമായി വന്നത്?"

2. നഷ്‌ടമായ ഡാറ്റ മനസ്സിലാക്കുകയും തരംതിരിക്കുകയും ചെയ്യുക. നഷ്ടപ്പെട്ട ഡാറ്റ മൂന്ന് തരങ്ങളായി തിരിച്ചിരിക്കുന്നു. MCAR (യാദൃശ്ചികമായി പൂർണ്ണമായും കാണുന്നില്ല): കാണാതായത് എന്തെങ്കിലും കാരണമല്ല, ഉദാഹരണത്തിന് ഒരു സെൻസർ ക്രമരഹിതമായി പരാജയപ്പെട്ടു. MAR (യാദൃശ്ചികമായി കാണുന്നില്ല): കാണാതെ പോകുന്നത് മറ്റ് നിരീക്ഷിച്ച വേരിയബിളുകളെ ആശ്രയിച്ചിരിക്കുന്നു, ഉദാഹരണത്തിന് പ്രായമായ ആളുകൾ പലപ്പോഴും ഒരു ചോദ്യം ശൂന്യമായി വിടുന്നു, പക്ഷേ നിങ്ങൾക്ക് പ്രായം അറിയാം. MNAR (യാദൃശ്ചികമായി കാണുന്നില്ല): കാണാതാവുന്നത് നിരീക്ഷിക്കപ്പെടാത്ത മൂല്യത്തെ ആശ്രയിച്ചിരിക്കുന്നു, ഉദാഹരണത്തിന് ഉയർന്ന വരുമാനമുള്ളവർ അവരുടെ വരുമാനം റിപ്പോർട്ട് ചെയ്യുന്നില്ല. ഈ വ്യത്യാസം നിർണായകമാണ്, കാരണം ഇത് പരിഹാര രീതി നിർണ്ണയിക്കുന്നു, കൂടാതെ AI-ക്ക് നിങ്ങൾക്കായി ഇത് തീരുമാനിക്കാൻ കഴിയില്ല.

3. കുറവ് കൈകാര്യം ചെയ്യുക. ഓപ്‌ഷനുകൾ: ലിസ്റ്റ്വൈസ് ഡിലീഷൻ, മീഡിയൻ/മീഡിയൻ ഇംപ്യൂട്ടേഷൻ, മോഡൽ അടിസ്ഥാനമാക്കിയുള്ള മൾട്ടിപ്പിൾ ഇംപ്യൂട്ടേഷൻ. MCAR-ൽ ഇല്ലാതാക്കുന്നത് താരതമ്യേന സുരക്ഷിതമാണെങ്കിലും സാമ്പിൾ വലുപ്പം കുറയ്ക്കുന്നു. MAR-ൽ ഒന്നിലധികം അസൈൻമെൻ്റ് കൂടുതൽ അനുയോജ്യമാണ്. ഒരു ലളിതമായ രീതിയും MNAR-ൽ നിഷ്പക്ഷത ഉറപ്പുനൽകുന്നില്ല; കുറവുള്ള സംവിധാനം മാതൃകയാക്കണം അല്ലെങ്കിൽ കുറഞ്ഞത് ഒരു സെൻസിറ്റിവിറ്റി വിശകലനം നടത്തണം. ശരാശരി പൂരിപ്പിക്കൽ എളുപ്പവും അപകടകരവുമാണ്: ഇത് വ്യത്യാസം കുറയ്ക്കുന്നു, ബന്ധങ്ങളെ ദുർബലപ്പെടുത്തുന്നു, അനിശ്ചിതത്വം മറയ്ക്കുന്നു.

4. ഔട്ട്‌ലറുകൾ പരിശോധിക്കുക. മറ്റുള്ളവരിൽ നിന്ന് വളരെ അകലെ നിൽക്കുന്ന ഒരു നിരീക്ഷണമാണ് ഔട്ട്‌ലൈയർ. രണ്ട് ചോദ്യങ്ങൾ വേർതിരിക്കുക: ഇതൊരു പിശകാണോ (ഡേറ്റാ എൻട്രിയിൽ വയസ്സ് 999 എന്ന് എഴുതിയിരിക്കുന്നു) അതോ ഇത് യഥാർത്ഥ എന്നാൽ അതിരുകടന്ന മൂല്യമാണോ (ഒരു ശതകോടീശ്വരൻ്റെ വരുമാനം)? ബഗുകൾ പരിഹരിക്കുക; യഥാർത്ഥ ഔട്ട്‌ലറുകൾ ഇല്ലാതാക്കരുത്, കാരണം അവ ഡാറ്റയെ പ്രതിനിധീകരിക്കുന്നു. "അത് ശല്യപ്പെടുത്തുന്നതിനാൽ" ഔട്ട്‌ലിയർ ഇല്ലാതാക്കുന്നത് നിങ്ങൾ ഡാറ്റയെ ഫലത്തിലേക്ക് വ്യതിചലിപ്പിക്കുകയാണ്.

5. കോഡിംഗും സ്ഥിരതയും. വിഭാഗങ്ങൾ ("പുരുഷൻ", "പുരുഷൻ", "ഇ" എല്ലാം ഒരു കോഡിലേക്ക്) സ്റ്റാൻഡേർഡ് ചെയ്യുക, തീയതികൾ ഒരു ഫോർമാറ്റിലേക്കും യൂണിറ്റുകൾ ഒരു സ്കെയിലിലേക്കും കൊണ്ടുവരിക, തനിപ്പകർപ്പ് വരികൾ കണ്ടെത്തുക. AI മികച്ച രീതിയിൽ സഹായിക്കുന്ന അപകടസാധ്യത കുറഞ്ഞ ഘട്ടമാണിത്.

6. പ്രമാണവും മരവിപ്പിക്കലും. ഓരോ ഘട്ടവും കോഡും ഒരു കമൻ്റ് ലൈനും ഉപയോഗിച്ച് റെക്കോർഡ് ചെയ്യുക, അസംസ്കൃതവും വൃത്തിയാക്കിയതുമായ ഡാറ്റ പ്രത്യേകം സൂക്ഷിക്കുക. അപ്പോൾ ഒരു റഫറി ചോദിക്കുമ്പോൾ "എന്തുകൊണ്ടാണ് ഈ നിരീക്ഷണങ്ങൾ ഒഴിവാക്കിയത്?" നിങ്ങളുടെ ഉത്തരം തയ്യാറാണ്.

മുന്നറിയിപ്പ്: ഫലങ്ങളെ അടിസ്ഥാനമാക്കി ക്ലീനിംഗ് തീരുമാനങ്ങൾ എടുക്കരുത്. "നിങ്ങൾ ഈ വരി ഇല്ലാതാക്കുമ്പോൾ, ഗുണകം പ്രാധാന്യമർഹിക്കുന്നു" എന്ന് പറയുന്ന ഒരു വരി ഇല്ലാതാക്കുന്നത് പി-ഹാക്കിംഗിൻ്റെ ഏറ്റവും വഞ്ചനാപരമായ രൂപമാണ്, അത് അടുത്ത യൂണിറ്റിൽ നമുക്ക് കാണാം.

താരതമ്യ പട്ടിക: നഷ്‌ടമായ ഡാറ്റാ രീതികൾ

രീതി

എപ്പോഴാണ് അത് ഉചിതം?

അപകടം

AI യുടെ പങ്ക്

ഒരു വരി ഇല്ലാതാക്കുക

MCAR, കുറഞ്ഞ മിസ്സിംഗ് നിരക്ക്

സാമ്പിൾ ചെറുതായി മാറുന്നു, MAR/MNAR-ൽ പക്ഷപാതം

കോഡ് എഴുതുന്നു; നിങ്ങൾ തീരുമാനിക്കുക

ശരാശരി/മധ്യസ്ഥ അസൈൻമെൻ്റ്

ദ്രുത പ്രാഥമിക വിശകലനം

വ്യത്യാസം കുറയ്ക്കുന്നു, ബന്ധം മറയ്ക്കുന്നു

ഇത് എളുപ്പമാണെങ്കിലും ശുപാർശ ചെയ്യുന്നില്ല; മുന്നറിയിപ്പ് നൽകണം

ഒന്നിലധികം അസൈൻമെൻ്റ് (MI)

MAR, പ്രധാനപ്പെട്ട വേരിയബിളുകൾ

ശരിയായി ഇൻസ്റ്റാൾ ചെയ്തില്ലെങ്കിൽ, അത് തെറ്റിദ്ധരിപ്പിക്കും

കോഡും പാക്കേജും ശുപാർശ ചെയ്യുന്നു (എലികൾ)

മെക്കാനിസം മോഡലിംഗ്

എം.എൻ.ആർ

സങ്കീർണ്ണമായ, അനുമാന-തീവ്രമായ

ഡ്രാഫ്റ്റ് മാത്രം; വിദഗ്ധൻ ആവശ്യമാണ്

പകർത്താവുന്ന നാല് നിർദ്ദേശങ്ങൾ

1. ഡാറ്റ പ്രൊഫൈലിംഗ്:

നിങ്ങളുടെ റോൾ: ഡാറ്റ ക്ലീൻസിംഗ് അസിസ്റ്റൻ്റ്. ഞാൻ ഡാറ്റ പങ്കിടുന്നില്ല, എനിക്ക് R കോഡ് വേണം. എനിക്ക് 'ഡിജിറ്റ്' എന്നൊരു ഡാറ്റ.ഫ്രെയിം ഉണ്ട്; വേരിയബിളുകൾ: ഐഡി, പ്രായം (സംഖ്യാ), വരുമാനം (സംഖ്യാ), വിദ്യാഭ്യാസം (വിഭാഗീയം), പ്രദേശം (വർഗ്ഗീയം), തീയതി (തീയതി). ടാസ്‌ക്: ഓരോ വേരിയബിളിനും തരം, നഷ്‌ടമായ സംഖ്യയും നിരക്കും സൃഷ്‌ടിക്കുന്ന കോഡ് എഴുതുക, സംഖ്യകൾക്കുള്ള സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ, വർഗ്ഗീകരണത്തിനുള്ള ആവൃത്തി പട്ടിക. കമൻ്റ് ലൈൻ ചേർക്കുക.

2. നഷ്‌ടമായ ഡാറ്റ രോഗനിർണയം:

മുകളിലുള്ള 'അക്ക' ഡാറ്റയ്‌ക്കായി നഷ്‌ടമായ പാറ്റേൺ പരിശോധിക്കുന്ന കോഡ് എഴുതുക: - ഓരോ വേരിയബിളിൻ്റെയും നഷ്‌ടമായ നിരക്ക്, - മറ്റ് വേരിയബിളുകളുമായുള്ള നഷ്‌ടതയുടെ ബന്ധം കാണിക്കുന്ന ഒരു ലളിതമായ പട്ടിക/ഗ്രാഫ്. ഞാൻ കോഡിൻ്റെ ഔട്ട്‌പുട്ട് നോക്കി MCAR/MAR/MNAR വേർതിരിവ് ഉണ്ടാക്കും; നിങ്ങൾ ഡയഗ്നോസ്റ്റിക് ടൂൾ നിർമ്മിക്കുക, അസൈൻമെൻ്റ് രീതി തീരുമാനിക്കരുത്.

3. ഔട്ട്‌ലിയർ പരിശോധന (ഇല്ലാതാക്കലല്ല):

വേരിയബിൾ 'വരുമാനം' എന്നതിനായുള്ള കോഡ് എഴുതുക, അത് ഇല്ലാതാക്കാതെ തന്നെ ഔട്ട്‌ലൈയറുകളെ പരിശോധിക്കുന്നു: ബോക്‌സ്‌പ്ലോട്ട്, ഐക്യുആർ അടിസ്ഥാനമാക്കിയുള്ള ബൗണ്ടുകൾ, പട്ടിക ലിസ്റ്റിംഗ് ഔട്ട്‌ലിയർ നിരീക്ഷണങ്ങൾ + മൂല്യങ്ങൾ. ഇവ തെറ്റുകളാണോ യഥാർത്ഥമാണോ എന്ന് ഞാൻ നോക്കും. സ്വയമേവ ഇല്ലാതാക്കൽ ചേർക്കുക.

4. കോഡിംഗ് സ്റ്റാൻഡേർഡൈസേഷൻ:

'വിദ്യാഭ്യാസ' വേരിയബിളിൽ, മൂല്യങ്ങൾ സമ്മിശ്രമായി എഴുതിയിരിക്കുന്നു: "പ്രൈമറി സ്കൂൾ", "പ്രൈമറി സ്കൂൾ", "പ്രൈമറി", "ഹൈസ്കൂൾ", "ഹൈസ്കൂൾ", "യൂണിവേഴ്സിറ്റി", "യൂണിവേഴ്സിറ്റി". ഇവയെ സ്ഥിരതയുള്ള വിഭാഗങ്ങളിലേക്ക് റീകോഡ് ചെയ്യുന്ന R കോഡ് എഴുതുക; മാപ്പിംഗ് പട്ടിക വ്യക്തമായി കാണിക്കുക, അങ്ങനെ എനിക്ക് ഓരോ പരിവർത്തനവും സ്ഥിരീകരിക്കാൻ കഴിയും. നിങ്ങൾ തിരിച്ചറിയാത്ത മൂല്യം "അജ്ഞാതൻ" എന്ന് സജ്ജമാക്കുക.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്:

ഡാറ്റ വൃത്തിയാക്കുക, വിടവുകൾ പൂരിപ്പിക്കുക, പുറത്തുള്ളവ ഉപേക്ഷിക്കുക.

ഈ ആവശ്യം അപകടകരമാണ്: ഇത് AI-ക്ക് അന്ധമായ അധികാരം നൽകുന്നു. ഏതുതരം മിസ്സിംഗ്, ഏതുതരം പൂരിപ്പിക്കൽ, എന്ത് വൈരുദ്ധ്യാത്മക സത്യം - ഇതൊന്നും വ്യക്തമല്ല. ഫലം രഹസ്യമായി പക്ഷപാതപരമായ ഡാറ്റ സെറ്റായിരിക്കാം.

ശക്തമായ നിർദ്ദേശം:

നിങ്ങളുടെ റോൾ: ക്ലീനിംഗ് അസിസ്റ്റൻ്റ്, നിങ്ങൾ തീരുമാനമെടുക്കുന്നയാളല്ല. ഓരോ ഘട്ടത്തിൻ്റെയും ആഘാതം റിപ്പോർട്ടുചെയ്യുന്ന കോഡ് പടിപടിയായി പോയി എഴുതുക: 1) നഷ്‌ടമായ പാറ്റേൺ കാണിക്കുക (ഇല്ലാതാക്കരുത്/ഫിൽ ചെയ്യരുത്), 2) ഔട്ട്‌ലിയർ കാൻഡിഡേറ്റുകളെ പട്ടികപ്പെടുത്തുക (ഇല്ലാതാക്കരുത്), 3) മാപ്പിംഗ് ടേബിളിലെ കാറ്റഗറി പൊരുത്തക്കേടുകൾ പരിഹരിക്കുക. ഓരോ ഘട്ടത്തിനും ശേഷം വരികളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പ്രിൻ്റ് ചെയ്യുക, അതുവഴി എനിക്ക് മാറ്റം കാണാനും സ്ഥിരീകരിക്കാനും കഴിയും. സ്വയമേവയുള്ള അസൈൻമെൻ്റ്/ഇല്ലാതാക്കൽ ഉൾപ്പെടുത്തൽ.

വ്യത്യാസം വ്യക്തമാണ്: ശക്തമായ ഇച്ഛാശക്തി AI-യെ ഒരു സൂപ്പർവൈസ്ഡ് അസിസ്റ്റൻ്റായി സ്ഥാപിക്കുകയും റിവേഴ്‌സിബിൾ, ഡോക്യുമെൻ്റഡ് സ്റ്റെപ്പുകൾ നിർമ്മിക്കുകയും ചെയ്യുന്നു.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - ശരാശരി അസൈൻമെൻ്റ് ട്രാപ്പ്. ഒരു അനലിസ്റ്റിൻ്റെ 5,000 ആളുകളുടെ വരുമാന ഡാറ്റയിൽ 18% കാണുന്നില്ല. "വിടവുകൾ നികത്താൻ" അദ്ദേഹം AI-യോട് പറഞ്ഞു; AI അവയെല്ലാം ശരാശരിയാക്കി. ഫലം: വരുമാനത്തിൻ്റെ വ്യത്യാസം 22% കുറഞ്ഞു, വിദ്യാഭ്യാസ-വരുമാന ബന്ധത്തിൻ്റെ ഗുണകം അതിനെക്കാൾ ദുർബലമായി മാറി. ശരിയായ വഴി: പോരായ്മ MAR ആയിരുന്നു (വിദ്യാഭ്യാസം കാരണം), ഒന്നിലധികം അസൈൻമെൻ്റുകൾ (എലികൾ) നികത്തേണ്ടതുണ്ട്. പാഠം: പൂരിപ്പിക്കൽ രീതി മെക്കാനിസത്തെ ആശ്രയിച്ചിരിക്കുന്നു.

കേസ് 2 - ഔട്ട്‌ലിയർ ക്ലീനിംഗ് കണ്ടെത്തലിനെ വിപരീതമാക്കുന്നു. ഒരു സ്ഥാപന ഡാറ്റയിൽ 3 വളരെ വലിയ സ്ഥാപനങ്ങൾ (മൊത്തം നിരീക്ഷണത്തിൻ്റെ 0.6%) ഉണ്ടായിരുന്നു. AI യുടെ "ക്ലീനിംഗ്" നിർദ്ദേശത്താൽ ഇവ ഇല്ലാതാക്കി; സ്കെയിൽ കോഫിഫിഷ്യൻ്റ് സമ്പദ്‌വ്യവസ്ഥ പോസിറ്റീവിൽ നിന്ന് നെഗറ്റീവ് ആയി മാറി. എന്നിരുന്നാലും, ആ 3 കമ്പനികൾ യഥാർത്ഥവും വ്യവസായത്തിൻ്റെ ഒരു പ്രധാന ഭാഗവുമായിരുന്നു. ഇല്ലാതാക്കുന്നതിനുപകരം പൂർണ്ണവും കരുത്തുറ്റതുമായ എസ്റ്റിമേഷനോടെ റിപ്പോർട്ട് ചെയ്യുക എന്നതായിരുന്നു ശരിയായ മാർഗം. പാഠം: യഥാർത്ഥ ഔട്ട്‌ലറുകൾ ഡാറ്റയാണ്, ശബ്ദമല്ല.

കേസ് 3 - നിശബ്ദ കോഡിംഗ് പിശക്. ഒരു പാനലിൽ, തീയതി വേരിയബിൾ രണ്ട് വ്യത്യസ്ത ഫോർമാറ്റുകളിൽ വന്നു ("2020-03-01", "01/03/2020"). AI നിർമ്മിച്ച കോമ്പിനേഷൻ കോഡ് അവയെ വ്യത്യസ്ത മൂല്യങ്ങളായി തെറ്റിദ്ധരിച്ചപ്പോൾ, 1,400 നിരീക്ഷണങ്ങൾ പൊരുത്തപ്പെടുന്നില്ല, വളർച്ചാ നിരക്ക് പരിഹാസ്യമായി. നിരകളുടെ എണ്ണം നിരീക്ഷകൻ പരിശോധിച്ചില്ലെങ്കിൽ കാര്യമില്ല. പാഠം: ഓരോ ഘട്ടത്തിനുശേഷവും നിരീക്ഷണ എണ്ണവും സാനിറ്റി പരിശോധനയും നിർബന്ധമാണ്.

സാധാരണ തെറ്റുകൾ

  • ശരാശരി ഉപയോഗിച്ച് വിടവ് അന്ധമായി പൂരിപ്പിക്കുന്നു. ഇത് വ്യത്യാസം കുറയ്ക്കുകയും അനിശ്ചിതത്വം മറയ്ക്കുകയും MAR/MNAR-ൽ പക്ഷപാതം സൃഷ്ടിക്കുകയും ചെയ്യുന്നു. ആദ്യം മെക്കാനിസം തരംതിരിക്കുക.
  • "അത് ശല്യപ്പെടുത്തുന്നതിനാൽ" ഔട്ട്‌ലിയർ ഇല്ലാതാക്കുന്നു. യഥാർത്ഥ ഔട്ട്‌ലറുകൾ ഡാറ്റയെ പ്രതിനിധീകരിക്കുന്നു; ഇല്ലാതാക്കുന്നത് ഫലം വളച്ചൊടിക്കുന്നു. തെറ്റ് തിരുത്തുക, യഥാർത്ഥമായത് നിലനിർത്തുക.
  • റോ ഡാറ്റ ടാപ്പുചെയ്യുന്നു. അസംസ്‌കൃത ഡാറ്റ ഒരിക്കലും പരിഷ്‌ക്കരിക്കരുത്; കോഡ് ഉപയോഗിച്ച് എല്ലാ ക്ലീനപ്പുകളും ഒരു പ്രത്യേക പകർപ്പിൽ ചെയ്യുക, അങ്ങനെ അത് പഴയപടിയാക്കാനാകും.
  • പടികളുടെ ആഘാതം അളക്കുന്നില്ല. ഓരോ ഘട്ടത്തിനും ശേഷവും വരികളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പരിശോധിച്ചില്ലെങ്കിൽ, നിശബ്ദ പിശകുകൾ കുമിഞ്ഞുകൂടും.
  • ഫലമായി വൃത്തിയാക്കൽ. "നിങ്ങൾ ഈ വരി ചേർക്കുമ്പോൾ, ഫലം മികച്ചതാകുന്നു" എന്നതിൻ്റെ യുക്തി p-ഹാക്കിംഗ് ആണ്; വിശകലന ഫലത്തിന് മുമ്പും സ്വതന്ത്രമായും ക്ലീനിംഗ് ആസൂത്രണം ചെയ്യണം.
നുറുങ്ങ്: ശുചീകരണത്തിന് മുമ്പും ശേഷവും ഒരേ അടിസ്ഥാന സ്ഥിതിവിവരക്കണക്കുകൾ (അർത്ഥം, ശരാശരി, നിരീക്ഷണങ്ങളുടെ എണ്ണം, കുറച്ച് പരസ്പര ബന്ധങ്ങൾ) വയ്ക്കുന്ന ഒരു "മുമ്പ്/പിന്നീട്" പട്ടിക സൂക്ഷിക്കുക. അപ്രതീക്ഷിതമായ ഒരു കുതിച്ചുചാട്ടമാണ് മറഞ്ഞിരിക്കുന്ന പിശകിൻ്റെ ഏറ്റവും മികച്ച സൂചന.

ചുരുക്കത്തിൽ

അനുഭവപരമായ ജോലിയുടെ ഏറ്റവും കൂടുതൽ സമയം ചെലവഴിക്കുന്നതും തീരുമാനമെടുക്കേണ്ടതുമായ ഘട്ടമാണ് ഡാറ്റ ക്ലീനിംഗ്. AI ഇതിൽ ഒരു ശക്തമായ കോഡ് ജനറേറ്ററാണ്, പക്ഷേ അതിന് ഷോട്ടുകൾ വിളിക്കാൻ കഴിയില്ല: നിങ്ങൾ കാണാതായ ഡാറ്റ തരം (MCAR/MAR/MNAR) തരംതിരിക്കുക, ഔട്ട്‌ലൈയർ ഒരു പിശകാണോ യഥാർത്ഥമാണോ എന്ന് നിർണ്ണയിക്കുക, ഓരോ ഘട്ടവും പഴയപടിയാക്കുകയും രേഖപ്പെടുത്തുകയും ചെയ്യുക. AI-ന് അന്ധമായ "വ്യക്തമായ" അധികാരം നൽകുന്നതിനുപകരം, ആഘാതം അളക്കുകയും സാധൂകരിക്കുകയും ചെയ്യുന്ന ഒരു ഘട്ടം ഘട്ടമായുള്ള വർക്ക്ഫ്ലോ സ്ഥാപിക്കുക. ഓരോ ഘട്ടത്തിനുശേഷവും നിരീക്ഷണങ്ങളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പരിശോധിക്കുന്നത് നിശബ്ദ പിശകുകൾക്കുള്ള മികച്ച മറുമരുന്നാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു ഡാറ്റാ സെറ്റിൽ (നിങ്ങളുടെ സ്വന്തം ഡാറ്റ അല്ലെങ്കിൽ ഒരു സാമ്പിൾ സെറ്റ്) വിട്ടുപോയതും പുറത്തുള്ളതുമായ രണ്ട് വേരിയബിളുകളെങ്കിലും തിരഞ്ഞെടുക്കുക. മുകളിലുള്ള "ഘട്ടം ഘട്ടമായി, ഇല്ലാതാക്കരുത്/ഫിൽ ചെയ്യരുത്" എന്ന നിർദ്ദേശം വഴി AI-യിൽ നിന്ന് ഒരു ഡയഗ്നോസ്റ്റിക് കോഡ് അഭ്യർത്ഥിച്ച് അത് പ്രവർത്തിപ്പിക്കുക. ന്യൂനതയെ MCAR/MAR/MNAR എന്ന് തരംതിരിച്ച് നിങ്ങളുടെ ന്യായീകരണം ഒരു വാചകത്തിൽ എഴുതുക. പരസ്പര വിരുദ്ധമായ സ്ഥാനാർത്ഥികളെ ഓരോന്നായി പരിശോധിച്ച് ഏതാണ് തെറ്റ്, ഏതാണ് യഥാർത്ഥമെന്ന് തീരുമാനിക്കുക. അവസാനമായി, വൃത്തിയാക്കുന്നതിന് മുമ്പോ ശേഷമോ ഒരു "മുൻപ്-പിന്നീട്" പട്ടിക തയ്യാറാക്കി എന്തെങ്കിലും അപ്രതീക്ഷിത മാറ്റങ്ങൾ ഉണ്ടെങ്കിൽ റിപ്പോർട്ട് ചെയ്യുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] ഞാൻ റോ ഡാറ്റ മാറ്റാതെ ഒരു പ്രത്യേക പകർപ്പിൽ വൃത്തിയാക്കി.
  • [ ] ഞാൻ ന്യൂനതയെ MCAR/MAR/MNAR എന്ന് തരംതിരിക്കുകയും അതിനനുസരിച്ച് രീതി തിരഞ്ഞെടുക്കുകയും ചെയ്തു.
  • [ ] ഞാൻ പുറത്തുള്ളവ ഓരോന്നായി പരിശോധിച്ചു, അവ തെറ്റുകളാണോ യഥാർത്ഥമാണോ എന്ന്; ഞാൻ അത് അന്ധമായി ഇല്ലാതാക്കിയിട്ടില്ല.
  • [ ] ഓരോ ക്ലീനിംഗ് ഘട്ടത്തിനും ശേഷം ഞാൻ നിരീക്ഷണങ്ങളുടെ എണ്ണവും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും പരിശോധിച്ചു.
  • [ ] ഞാൻ എല്ലാ ഘട്ടങ്ങളും കോഡും ഒരു കമൻ്റ് ലൈനും ഉപയോഗിച്ച് രേഖപ്പെടുത്തി; തിരിച്ചുള്ള.
  • [ ] ഞാൻ ക്ലീനിംഗ് അടിസ്ഥാനമാക്കിയുള്ളത് ഡാറ്റ ഉൽപ്പാദിപ്പിക്കുന്ന പ്രക്രിയയെക്കുറിച്ചുള്ള അറിവിനെ അടിസ്ഥാനമാക്കിയാണ്, വിശകലന ഫലത്തെ അടിസ്ഥാനമാക്കിയല്ല.