നേട്ടങ്ങൾ:
- ഉചിതമായ ഗ്രാഫുകൾ (ഹിസ്റ്റോഗ്രാം, ബോക്സ് പ്ലോട്ട്, സ്കാറ്റർ പ്ലോട്ട്) ഉപയോഗിച്ച് വേരിയബിളുകളുടെ വിതരണം, കേന്ദ്രം, വ്യാപനം, അപാകതകൾ എന്നിവ പര്യവേക്ഷണം ചെയ്യാനുള്ള കഴിവ്.
- പരസ്പര ബന്ധത്തെ ശരിയായി വ്യാഖ്യാനിക്കാനും, കാര്യകാരണവുമായി ആശയക്കുഴപ്പത്തിലാക്കാതെ സ്കാറ്റർ പ്ലോട്ടിനൊപ്പം വായിക്കാനുമുള്ള കഴിവ്
- സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ തെറ്റിദ്ധരിപ്പിക്കുന്നതാണെന്ന് മനസ്സിലാക്കാനുള്ള കഴിവ് (അൻസ്കോംബ് പാഠം) കൂടാതെ മോഡലിംഗിൻ്റെ ദിശ നിർണ്ണയിക്കുന്ന അനുമാനങ്ങൾ വികസിപ്പിക്കുകയും ചെയ്യുന്നു.
ഒരു മോഡൽ നിർമ്മിക്കുന്നതിന് മുമ്പ്, ഡാറ്റ അറിയേണ്ടത് ആവശ്യമാണ്. രോഗിയെ പരിശോധിക്കാതെ ഒരു ഡോക്ടർ മരുന്ന് നിർദേശിക്കാത്തതുപോലെ, ഡാറ്റ "പരിശോധിക്കാതെ" ഒരു ഡാറ്റ ശാസ്ത്രജ്ഞൻ ഒരു മാതൃക നിർമ്മിക്കുന്നില്ല. ഈ പരിശോധനയെ പര്യവേക്ഷണ ഡാറ്റ വിശകലനം എന്ന് വിളിക്കുന്നു (ചുരുക്കത്തിൽ EDA): ഇത് ഡാറ്റയുടെ വിതരണം, ബന്ധങ്ങൾ, ആശ്ചര്യങ്ങൾ, കെണികൾ എന്നിവ ദൃശ്യമായും ഗ്രാഫിക്കലായും കണ്ടെത്തുന്നതിനുള്ള ഘട്ടമാണ്. EDA യുടെ ലക്ഷ്യം അനുമാനങ്ങൾ സൃഷ്ടിക്കുക, പിശകുകൾ കണ്ടെത്തുക, മോഡലിംഗ് ദിശ നിർണ്ണയിക്കുക എന്നിവയാണ്. ഈ ഘട്ടത്തിൽ ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് വളരെ ശക്തമായ ഒരു സഹായിയാണ്: ഏത് ചാർട്ട് അനുയോജ്യമാണെന്ന് ഇത് നിർദ്ദേശിക്കുന്നു, അതിൻ്റെ കോഡ് എഴുതുന്നു, ഒരു വിതരണത്തെ വ്യാഖ്യാനിക്കുന്നു. എന്നാൽ ഒരു വ്യക്തി താൻ കാണുന്ന പാറ്റേൺ യഥാർത്ഥമാണോ യാദൃശ്ചികമാണോ എന്ന് അവൻ്റെ/അവളുടെ ഫീൽഡ് അറിവ് ഉപയോഗിച്ച് തീരുമാനിക്കുന്നു.
EDA എന്താണ് അന്വേഷിക്കുന്നത്?
EDA നാല് ചോദ്യങ്ങൾക്ക് ഉത്തരം തേടുന്നു. വിതരണം: ഓരോ വേരിയബിളും എങ്ങനെ വിതരണം ചെയ്യപ്പെടുന്നു-അത് സമമിതിയാണോ, ചരിഞ്ഞതാണോ അല്ലെങ്കിൽ രണ്ട് കൊടുമുടിയാണോ? കേന്ദ്ര പ്രവണതയും വ്യാപനവും: എന്താണ് ശരാശരി, ശരാശരി, സ്റ്റാൻഡേർഡ് ഡീവിയേഷൻ? ബന്ധങ്ങൾ: വേരിയബിളുകൾ പരസ്പരം എങ്ങനെ ബന്ധപ്പെട്ടിരിക്കുന്നു? അപാകതകൾ: അപ്രതീക്ഷിത മൂല്യങ്ങളും വിടവുകളും ഗ്രൂപ്പിംഗുകളും ഉണ്ടോ? ഈ നാല് ചോദ്യങ്ങൾ ഏത് ഫീച്ചർ പ്രവർത്തിക്കുമെന്നും ഏത് മോഡൽ അനുയോജ്യമാണെന്നും നിർണ്ണയിക്കുന്നു.
നമുക്ക് ചില അടിസ്ഥാന ആശയങ്ങൾ നിർവചിക്കാം. ഒരു സംഖ്യാ വേരിയബിളിൻ്റെ മൂല്യങ്ങളെ ഇടവേളകളായി വിഭജിക്കുകയും ഓരോ ഇടവേളയിലും എത്ര നിരീക്ഷണങ്ങളുണ്ടെന്ന് കാണിക്കുകയും ചെയ്യുന്ന ഒരു ഗ്രാഫാണ് ഹിസ്റ്റോഗ്രാം; വിതരണം കാണാനുള്ള ഏറ്റവും വേഗമേറിയ മാർഗമാണിത്. ഒരു ദിശയിലേക്കുള്ള വിതരണത്തിൻ്റെ മാറ്റമാണ് സ്കെവ്നെസ്; വരുമാനം പോലുള്ള വേരിയബിളുകൾ വലതുവശത്തേക്ക് വളഞ്ഞിരിക്കുന്നു (ഭൂരിപക്ഷവും താഴ്ന്നതും കുറച്ച് വളരെ ഉയർന്നതും). ഒരു ബോക്സ് പ്ലോട്ട് മീഡിയൻ, ക്വാർട്ടൈൽസ്, ഔട്ട്ലറുകൾ എന്നിവ ഒറ്റനോട്ടത്തിൽ കാണിക്കുന്നു. ഒരു സ്കാറ്റർ പ്ലോട്ട് പോയിൻ്റുകളുടെ ഒരു ക്ലൗഡുമായി രണ്ട് സംഖ്യാ വേരിയബിളുകളുടെ ബന്ധം കാണിക്കുന്നു.
പരസ്പരബന്ധം: ഒരു ബന്ധമുണ്ട്, പക്ഷേ ശ്രദ്ധിക്കുക
പരസ്പരബന്ധം - രണ്ട് വേരിയബിളുകൾ എങ്ങനെ ഒരുമിച്ച് നീങ്ങുന്നു എന്നതിൻ്റെ അളവ്; -1 നും +1 നും ഇടയിലുള്ള ഒരു സംഖ്യ - EDA-യുടെ ഏറ്റവും കൂടുതൽ ഉപയോഗിക്കുന്നതും തെറ്റിദ്ധരിക്കപ്പെട്ടതുമായ ഉപകരണമാണ്. +1 എന്നാൽ തികഞ്ഞ സഹവർദ്ധനവ്, -1 എന്നാൽ തികഞ്ഞ വിപരീത ബന്ധം, 0 എന്നാൽ രേഖീയ ബന്ധമില്ല. രണ്ട് വലിയ കെണികളുണ്ട്. ആദ്യം, പ്രസിദ്ധമായ നിയമം: പരസ്പരബന്ധം കാരണമല്ല. ഐസ് ക്രീം വിൽപനയിൽ ശ്വാസംമുട്ടൽ കേസുകൾ വർദ്ധിക്കുന്നു; ഒന്ന് മറ്റൊന്നിലേക്ക് നയിക്കുന്നതുകൊണ്ടല്ല, മറിച്ച് വേനൽക്കാലം (മറഞ്ഞിരിക്കുന്ന മൂന്നാമത്തെ വേരിയബിൾ) രണ്ടും ട്രിഗർ ചെയ്യുന്നു. രണ്ടാമതായി, പരസ്പരബന്ധം രേഖീയ ബന്ധത്തെ മാത്രം അളക്കുന്നു; ഇത് 0-ന് അടുത്തുള്ള ശക്തമായ എന്നാൽ വളഞ്ഞ ബന്ധത്തെ സൂചിപ്പിക്കാം. അതിനാൽ പരസ്പരബന്ധം നോക്കുമ്പോൾ, സ്കാറ്റർ പ്ലോട്ടും നോക്കുന്നത് ഉറപ്പാക്കുക.
മുന്നറിയിപ്പ്: AI ഒരു പരസ്പര ബന്ധ നമ്പർ നൽകുമ്പോൾ, അത് "A വർദ്ധിപ്പിക്കുന്നു B" പോലെയുള്ള കാര്യകാരണമായ ഭാഷയിലേക്ക് വഴുതിവീണേക്കാം. ഇത് അപകടകരമാണ്. പരസ്പരബന്ധം ഒരുമിച്ചുള്ള ചലനത്തെ സൂചിപ്പിക്കുന്നു; അനുഭവം, ഡൊമെയ്ൻ അറിവ്, സൂക്ഷ്മമായ അനുമാനം എന്നിവ മാത്രമേ കാരണം സ്ഥാപിക്കൂ.
അൻസ്കോംബ് ക്വാർട്ടറ്റ്: എന്തുകൊണ്ട് നമ്പർ മാത്രം നോക്കരുത്
സ്ഥിതിവിവരക്കണക്കുകളിൽ പ്രശസ്തമായ ഒരു ഉദാഹരണമുണ്ട്: അൻസ്കോംബ് ക്വാർട്ടറ്റ്. നാല് വ്യത്യസ്ത ഡാറ്റാ സെറ്റുകൾക്ക് ഏതാണ്ട് ഒരേ ശരാശരി, ഒരേ വ്യതിയാനം, ഒരേ പരസ്പര ബന്ധമുണ്ട് (0.82); എന്നാൽ ഗ്രാഫ് ചെയ്യുമ്പോൾ, അവ തികച്ചും വ്യത്യസ്തമായി കാണപ്പെടുന്നു - ഒരു നേർരേഖ, ഒന്ന് വളഞ്ഞ, ഒരു മേഘം ഒരൊറ്റ ഔട്ട്ലിയർ വലിച്ചെടുക്കുന്നു. പാഠം വ്യക്തമാണ്: സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്, ഗ്രാഫ് നോക്കുന്നത് നിർബന്ധമാണ്. AI-ന് നിങ്ങൾക്ക് ശരാശരിയും പരസ്പര ബന്ധവും നൽകാൻ കഴിയും, എന്നാൽ ഗ്രാഫ് കാണാതെ ആ നമ്പറുകളെ വിശ്വസിക്കുന്നത് അൻസ്കോംബ് കെണിയിൽ വീഴുകയാണ്.
ചുവടെയുള്ള പട്ടിക ഏത് ചാർട്ട് ഏത് ചോദ്യത്തിന് അനുയോജ്യമാണ് എന്ന് സംഗ്രഹിക്കുന്നു:
ചോദ്യം
അനുയോജ്യമായ ഗ്രാഫിക്
എന്ത് കാണിക്കുന്നു
ഒരൊറ്റ വേരിയബിളിൻ്റെ വിതരണം
ഹിസ്റ്റോഗ്രാം / കെഡിഇ
ആകൃതി, വക്രത, ലംബങ്ങളുടെ എണ്ണം
കേന്ദ്രവും പുറമ്പോക്കുകളും
ബോക്സ് പ്ലോട്ട്
മീഡിയൻ, ക്വാർട്ടൈൽസ്, ഔട്ട്ലറുകൾ
രണ്ട് സംഖ്യകളുടെ ബന്ധം
സ്കാറ്റർ ചാർട്ട്
ദിശ, ശക്തി, വക്രത
വിഭാഗം താരതമ്യം
ബാർ ചാർട്ട്
ഗ്രൂപ്പുകൾ തമ്മിലുള്ള വ്യത്യാസം
കാലത്തിനനുസരിച്ച് മാറ്റം
ലൈൻ ചാർട്ട്
പ്രവണത, കാലാനുസൃതത
ബഹുമുഖ ബന്ധം
പരസ്പര ബന്ധ താപ മാപ്പ്
പൊതുവായ ബന്ധ മാട്രിക്സ്
സിംപ്സൻ്റെ വിരോധാഭാസം: സംഗ്രഹിച്ച ഡാറ്റ നുണ പറയാനാകും
സിംപ്സണിൻ്റെ വിരോധാഭാസത്തെക്കുറിച്ച് അറിഞ്ഞിരിക്കേണ്ട EDA-യിലെ ഒരു ഒളിഞ്ഞിരിക്കുന്ന കെണി: എല്ലാ ഡാറ്റയും ഒരുമിച്ച് പരിശോധിക്കുമ്പോൾ ഒരു പാറ്റേൺ ഒരു ദിശ കാണിച്ചേക്കാം, എന്നാൽ ഡാറ്റയെ അർത്ഥവത്തായ ഉപഗ്രൂപ്പുകളായി വിഭജിക്കുമ്പോൾ വിപരീതമായി. ക്ലാസിക് ഉദാഹരണം: ഒരു സർവ്വകലാശാലയിലെ സ്ത്രീ അപേക്ഷകരുടെ മൊത്തത്തിലുള്ള സ്വീകാര്യത നിരക്ക് പുരുഷന്മാരേക്കാൾ കുറവാണെന്ന് തോന്നുന്നു; എന്നാൽ വകുപ്പുകൾ തിരിച്ച് നോക്കുമ്പോൾ, മിക്ക വകുപ്പുകളിലും സ്ത്രീകളുടെ സ്വീകാര്യത നിരക്ക് പുരുഷന്മാരേക്കാൾ കൂടുതലാണ്. എവിടെനിന്ന്? കൂടുതൽ മത്സരാധിഷ്ഠിത (കുറഞ്ഞ സ്വീകാര്യത നിരക്ക്) വകുപ്പുകളിലേക്ക് സ്ത്രീകൾ അപേക്ഷിച്ചു; സംയോജിത സംഖ്യ ഈ മറഞ്ഞിരിക്കുന്ന വേരിയബിളിനെ സംഭരിക്കുന്നു. പാഠം വ്യക്തമാണ്: മൊത്തമോ ശരാശരിയോ നോക്കുമ്പോൾ, അർത്ഥവത്തായ ഉപഗ്രൂപ്പുകളായി (വിഭാഗം, കാലയളവ്, ചാനൽ) വിഭജിക്കുമ്പോൾ ആ സംഖ്യ അതേ കഥ പറയുന്നുണ്ടോ എന്ന് പരിശോധിക്കുന്നത് ഉറപ്പാക്കുക. AI നിങ്ങൾക്ക് ഒരു സംയോജിത നിരക്ക് നൽകുമ്പോൾ, "നിങ്ങൾ ഇത് വിഭജിക്കുമ്പോൾ അത് ഇപ്പോഴും സാധുതയുള്ളതാണോ" എന്ന് ചോദിക്കുന്നത് വഴിതെറ്റിക്കുന്ന മിക്ക ഫലങ്ങളും തുടക്കത്തിൽ തന്നെ ലഭിക്കും.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - രണ്ട് മറഞ്ഞിരിക്കുന്ന കുന്നുകൾ. ഒരു വിശകലന വിദഗ്ധൻ ശരാശരി ഉപഭോക്താവിൻ്റെ പ്രായം 41 ആണെന്ന് കണ്ടെത്തി അത് "മധ്യവയസ്ക്കരായ ജനക്കൂട്ടം" എന്ന് റിപ്പോർട്ട് ചെയ്തു. എന്നാൽ ഹിസ്റ്റോഗ്രാം രണ്ട് കൊടുമുടികൾ കാണിച്ചു: 22-28, 55-62 പ്രായ വിഭാഗങ്ങൾ. ശരാശരി 41 യഥാർത്ഥത്തിൽ ആരെയും പ്രതിനിധീകരിക്കുന്നില്ല. പാഠം: ശരാശരിയെ വിശ്വസിക്കുന്നതിന് മുമ്പ് വിതരണം പ്ലോട്ട് ചെയ്യുക.
കേസ് 2 - വ്യാജമായ പരസ്പരബന്ധം. ഒരു ടീം "പരസ്യ ചെലവും" "വിൽപനയും" തമ്മിൽ 0.78 പരസ്പരബന്ധം കണ്ടെത്തി, ബജറ്റ് ഇരട്ടിയാക്കി. എന്നിരുന്നാലും, രണ്ടിനും പ്രേരണ നൽകിയത് സീസണൽ പ്രചാരണങ്ങളായിരുന്നു; ഓഫ് കാമ്പെയ്ൻ കാലയളവിൽ, ബന്ധം 0.10 ആയി കുറഞ്ഞു. 340 ആയിരം TL അധിക പരസ്യം പ്രതീക്ഷിച്ച വരുമാനം നൽകിയില്ല. പാഠം: കാര്യകാരണമായി പരസ്പരബന്ധം തെറ്റിദ്ധരിക്കുന്നത് ചെലവേറിയതാണ്.
കേസ് 3 - ലോൺ കോൺട്രാരിയൻ വരച്ച വര. ഒരു റിയൽ എസ്റ്റേറ്റ് വിശകലനം ചതുരശ്ര അടിയും വിലയും തമ്മിലുള്ള ശക്തമായ ബന്ധം കാണിച്ചു (r=0.80). സ്കാറ്റർ പ്ലോട്ട് വരച്ചപ്പോൾ, ഏതാണ്ട് മുഴുവൻ ബന്ധവും സൃഷ്ടിക്കപ്പെട്ടത് 12 ദശലക്ഷം TL ആഡംബര വില്ലയാണ്; ആ പോയിൻ്റ് നീക്കം ചെയ്തപ്പോൾ, പരസ്പരബന്ധം 0.31 ആയി കുറഞ്ഞു. പാഠം: സ്കാറ്റർ പ്ലോട്ടിനൊപ്പം എപ്പോഴും പരസ്പരബന്ധം വായിക്കുക.
പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ
1) ഓട്ടോമാറ്റിക് EDA സംഗ്രഹം:
എനിക്ക് പാണ്ടകൾ ഡിഎഫ് ഉണ്ട്. ഉൽപ്പാദിപ്പിക്കുന്ന കോഡ് എഴുതുക: (1) df.info() കൂടാതെ df.describe(), (2) ഓരോ സംഖ്യാ കോളത്തിനും ഹിസ്റ്റോഗ്രാം, (3) ഓരോ തരം കോളത്തിനും എണ്ണം. അഭിപ്രായമിടരുത്, കണ്ടെത്തൽ കോഡ് സൃഷ്ടിക്കുക; ഞാൻ പാറ്റേണുകൾ വ്യാഖ്യാനിക്കുന്നു.
2) പരസ്പരബന്ധം + ദൃശ്യം (കാര്യകാരണത്തിൻ്റെ മുന്നറിയിപ്പോടെ):
സംഖ്യാ നിരകൾക്കായി ഒരു കോറിലേഷൻ മാട്രിക്സും ഒരു ഹീറ്റ് മാപ്പും വരയ്ക്കുന്ന കോഡ് എഴുതുക. ഏറ്റവും ഉയർന്ന പരസ്പര ബന്ധമുള്ള 3 ജോഡികളുടെ ഒരു സ്കാറ്റർ പ്ലോട്ടും വരയ്ക്കുക. പരസ്പരബന്ധം കാരണത്തെ സൂചിപ്പിക്കുന്നില്ലെന്ന് നിങ്ങളെ ഓർമ്മപ്പെടുത്തുന്ന ഒരു കമൻ്റ് ലൈൻ ഔട്ട്പുട്ടിലേക്ക് ചേർക്കുക. കാര്യകാരണ വാദങ്ങൾ ഉന്നയിക്കരുത്.
3) വിതരണ രോഗനിർണയം:
"income_tl" കോളത്തിന്: ഹിസ്റ്റോഗ്രാം, ബോക്സ് പ്ലോട്ട്, സ്ക്യൂനെസ് മൂല്യം, മീഡിയൻ/മീൻ താരതമ്യം എന്നിവ നിർമ്മിക്കുന്ന കോഡ് എഴുതുക. വിതരണം വളച്ചൊടിച്ചതാണോ അല്ലയോ എന്ന് ഞാൻ വ്യാഖ്യാനിക്കും; കോഡ് നൽകിയാൽ മതി.
4) സെഗ്മെൻ്റ് താരതമ്യം:
"ചാനൽ" (വെബ്/മൊബൈൽ) പ്രകാരം ഉപഭോക്താക്കളെ താരതമ്യം ചെയ്യുക: ഓരോ ചാനലിനും ശരാശരി തുക, ശരാശരി തുക, ഓർഡറുകളുടെ എണ്ണം, തുക വിതരണം എന്നിവയുടെ ഒരു ബോക്സ്പ്ലോട്ട് നിർമ്മിക്കുന്ന കോഡ് എഴുതുക. രണ്ട് ചാനലുകൾ തമ്മിലുള്ള വ്യത്യാസത്തിൻ്റെ സ്ഥിതിവിവരക്കണക്ക് പ്രാധാന്യത്തിന് ഏത് പരിശോധനയാണ് അനുയോജ്യമെന്ന് നിർദ്ദേശിക്കുക, പക്ഷേ തീരുമാനം ഞാനാണ്.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
ഈ ഡാറ്റയിൽ രസകരമായ എന്തെങ്കിലും കണ്ടെത്തുക.
"രസകരമായ" എന്നത് നിർവചിക്കപ്പെട്ടിട്ടില്ല; AI ഡാറ്റ കാണുന്നില്ല, അതിനാൽ അത് ഒന്നുകിൽ അത് ഉണ്ടാക്കുകയോ പൊതുവായ പ്രസ്താവനകൾ നടത്തുകയോ ചെയ്യുന്നു. ദിശയില്ല, വേരിയബിളുകളില്ല, ലക്ഷ്യമില്ല.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: EDA അസിസ്റ്റൻ്റ്. df നിരകൾ: പ്രായം (int), income_tl (ഫ്ലോട്ട്), നഗരം (വിഭാഗം), ചാനൽ (വെബ്/മൊബൈൽ), തുക (ഫ്ലോട്ട്). ഉദ്ദേശ്യം: "തുക" ബാധിക്കുന്ന ഘടകങ്ങൾ കണ്ടെത്തുന്നതിന്. ടാസ്ക്: (1) തുകയുടെ വിതരണത്തെ കുറിച്ചുള്ള കോഡ്, (2) തുകയും പ്രായവും വരുമാനവും തമ്മിലുള്ള വിതരണ ഗ്രാഫുകൾ, (3) ചാനൽ ബ്രേക്ക്ഡൗണിലെ തുകയുടെ ബോക്സ് പ്ലോട്ട്. ഒരു കാര്യകാരണ അവകാശവാദം സ്ഥാപിക്കൽ; കണ്ടെത്തൽ കോഡ് സൃഷ്ടിക്കുക, ഞാൻ പാറ്റേൺ വ്യാഖ്യാനിക്കും.
ഇവിടെ, "കാരണവാദം അവകാശപ്പെടുന്നതിൻ്റെ" ഉദ്ദേശ്യവും വേരിയബിളുകളും പരിധിയും വ്യക്തമാണ്.
സാധാരണ തെറ്റുകൾ
- സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളെ മാത്രം ആശ്രയിക്കുന്നു. അൻസ്കോംബ് ക്വാർട്ടറ്റ് കാണിക്കുന്നതുപോലെ, അതേ അർത്ഥം വളരെ വ്യത്യസ്തമായ വിതരണങ്ങളെ മറയ്ക്കുന്നു; ചാർട്ട് കാണുക.
- കാര്യകാരണമായി പരസ്പരബന്ധം തെറ്റിദ്ധരിക്കുന്നു. കോ-ആക്ഷൻ സൂചിപ്പിക്കുന്നത് ഒന്ന് മറ്റൊന്നിലേക്ക് നയിക്കുന്നു എന്നല്ല; മറഞ്ഞിരിക്കുന്ന വേരിയബിളുകൾ സൂക്ഷിക്കുക.
- സ്കാറ്റർ പ്ലോട്ട് ഇല്ലാതെ പരസ്പരബന്ധം നോക്കുന്നു. ഒരൊറ്റ ഔട്ട്ലിയർ അല്ലെങ്കിൽ വക്രത സംഖ്യയെ തെറ്റിദ്ധരിപ്പിക്കുന്നു.
- രണ്ട്-പീക്ക്/സ്ക്യൂഡ് ഡിസ്ട്രിബ്യൂഷനെ ശരാശരി ഉപയോഗിച്ച് സംഗ്രഹിക്കുന്നു. ശരാശരി ആരെയും പ്രതിനിധീകരിക്കുന്നില്ലായിരിക്കാം.
- EDA ഒഴിവാക്കി നേരെ മോഡലിലേക്ക് പോകുന്നു. തിരിച്ചറിയപ്പെടാത്ത ഡാറ്റ അർത്ഥമാക്കുന്നത് അന്ധമായ മോഡൽ എന്നാണ്.
നുറുങ്ങ്: ഓരോ പുതിയ ഡാറ്റാ സെറ്റിലും, ആദ്യ 30 മിനിറ്റ് ഗ്രാഫുകൾ വരയ്ക്കാൻ ചെലവഴിക്കുക: ഓരോ സംഖ്യയുടെയും ഹിസ്റ്റോഗ്രാം, പ്രധാനപ്പെട്ട ജോഡികളുടെ സ്കാറ്റർ പ്ലോട്ട്, വിഭാഗങ്ങളുടെ ബാർ ചാർട്ട്. ഈ 30 മിനിറ്റ് ഭാവി മോഡലിംഗ് പിശകുകൾ വരും ദിവസങ്ങളിൽ തടയുന്നു.
ചുരുക്കത്തിൽ
EDA എന്നത് ഒരു മോഡൽ നിർമ്മിക്കുന്നതിന് മുമ്പ് ഡാറ്റ അറിയുകയും നാല് ചോദ്യങ്ങൾക്ക് ഉത്തരം തേടുകയും ചെയ്യുന്ന ഘട്ടമാണ്: വിതരണം, സെൻ്റർ-സ്പ്രെഡ്, ബന്ധങ്ങൾ, അപാകതകൾ. സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകൾ തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്; ഗ്രാഫ് നോക്കുന്നത് നിർബന്ധമാണ് (Anscombe lecture). പരസ്പരബന്ധം ഒരു ശക്തമായ ഉപകരണമാണ്, പക്ഷേ കാര്യകാരണം അങ്ങനെയല്ല, തീർച്ചയായും ഒരു സ്കാറ്റർ പ്ലോട്ടുമായി ചേർന്ന് വായിക്കേണ്ടതാണ്. ഗ്രാഫിക്സും റൈറ്റിംഗ് കോഡും നിർദ്ദേശിക്കുന്നതിനുള്ള മികച്ച ആക്സിലറേറ്ററാണ് AI; എന്നാൽ അവർ കാണുന്ന പാറ്റേൺ യഥാർത്ഥമാണോ യാദൃശ്ചികമാണോ എന്ന് ആളുകൾ അവരുടെ ഫീൽഡ് അറിവ് ഉപയോഗിച്ച് വ്യാഖ്യാനിക്കുന്നു.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു ഡാറ്റാസെറ്റ് തിരഞ്ഞെടുത്ത് EDA ചെയ്യുക: കുറഞ്ഞത് മൂന്ന് സംഖ്യാ വേരിയബിളുകളുടെ ഒരു ഹിസ്റ്റോഗ്രാം, രണ്ട് ജോഡി വേരിയബിളുകളുടെ ഒരു സ്കാറ്റർ പ്ലോട്ട്, ഒരു കോറിലേഷൻ ഹീറ്റ് മാപ്പ് എന്നിവ എക്സ്ട്രാക്റ്റുചെയ്യുക. കുറഞ്ഞത് ഒരു "ആശ്ചര്യം" കണ്ടെത്തുക (രണ്ട് കൊടുമുടികളുള്ള ഒരു വിതരണം, വ്യാജമായ പരസ്പര ബന്ധത്തിനുള്ള ഒരു കാൻഡിഡേറ്റ്, ഒരൊറ്റ ഔട്ട്ലിയർ ആകർഷിക്കുന്ന ബന്ധം) അത് ഒരു വാക്യത്തിൽ വിശദീകരിക്കുക. കാര്യകാരണ വാദങ്ങൾ ഉന്നയിക്കാതെ എഴുതുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] ഓരോ സംഖ്യാ വേരിയബിളിൻ്റെയും വിതരണം ഞാൻ ഗ്രാഫ് ചെയ്തിട്ടുണ്ടോ?
- [ ] സ്കാറ്റർപ്ലോട്ടുമായുള്ള പരസ്പര ബന്ധങ്ങൾ ഞാൻ നോക്കിയോ?
- [ ] ഞാൻ കാര്യകാരണബന്ധവും പരസ്പര ബന്ധവും വേർപെടുത്തിയിട്ടുണ്ടോ?
- [ ] ഞാൻ ചരിഞ്ഞതോ രണ്ട്-പീക്ക് ചെയ്തതോ ആയ വിതരണങ്ങൾ ശ്രദ്ധിച്ചില്ലേ, ഒപ്പം ശരാശരിയെ അന്ധമായി വിശ്വസിക്കുകയും ചെയ്തില്ലേ?
- [ ] എൻ്റെ EDA കണ്ടെത്തലുകളിൽ നിന്ന് ഞാൻ കുറഞ്ഞത് ഒരു മോഡലിംഗ് വശം / അനുമാനം ഉരുത്തിരിഞ്ഞിട്ടുണ്ടോ?