നേട്ടങ്ങൾ:
- ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് പിന്തുണയോടെ വിവരണാത്മക സ്ഥിതിവിവരക്കണക്കുകളും വിതരണ/ബന്ധ ചാർട്ടുകളും നിർമ്മിക്കാനും ഡാറ്റയ്ക്കും ചോദ്യത്തിനും അനുസരിച്ച് ശരിയായ ചാർട്ട് തരം തിരഞ്ഞെടുക്കാനുമുള്ള കഴിവ്
- ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് നിർമ്മിക്കുന്ന ചിത്രങ്ങളിലെ തെറ്റിദ്ധരിപ്പിക്കുന്ന ചോയിസുകൾ (ഡാഷ്ഡ് ആക്സിസ്, അനുചിതമായ സ്കെയിൽ, അമിതമായ മിനുസപ്പെടുത്തൽ) തിരിച്ചറിയാനും സത്യസന്ധമായ വിഷ്വലൈസേഷൻ തത്വങ്ങൾ പ്രയോഗിക്കാനുമുള്ള കഴിവ്
- പര്യവേക്ഷണ വിശകലനം അനുമാനങ്ങൾ സൃഷ്ടിക്കുന്നതിനും അതേ ഡാറ്റ ഉപയോഗിച്ച് കണ്ടെത്തലും സ്ഥിരീകരണവും ഉണ്ടാക്കുന്നതിനുള്ള കെണിയുമാണ് (ഇത് പി-ഹാക്കിംഗിലേക്കുള്ള വാതിൽ തുറക്കുന്നു) എന്ന് വേർതിരിച്ചറിയാൻ കഴിയും.
ഡാറ്റ വൃത്തിയാക്കിയ ശേഷം, അത് അറിയുക എന്നതാണ് അനുഭവ ഗവേഷകൻ്റെ ആദ്യ ജോലി. ഈ ഘട്ടത്തെ പര്യവേക്ഷണ ഡാറ്റ വിശകലനം (EDA - Exploratory Data Analysis) എന്ന് വിളിക്കുന്നു: ഗ്രാഫുകളും സംഗ്രഹ സ്ഥിതിവിവരക്കണക്കുകളും ഉപയോഗിച്ച് ഡാറ്റ പരിശോധിക്കുകയും അതിൻ്റെ ഘടന, പാറ്റേണുകൾ, ആശ്ചര്യങ്ങൾ എന്നിവ കാണുകയും ചെയ്യുന്ന പ്രക്രിയയാണിത്. ഇതുവരെ ഒരു സിദ്ധാന്തം പരീക്ഷിക്കുകയല്ല ലക്ഷ്യം, പക്ഷേ ഡാറ്റയുമായി പരിചയപ്പെടാനും ചോദ്യങ്ങൾ സൃഷ്ടിക്കാനും ഭാവിയിൽ നിങ്ങൾ നിർമ്മിക്കുന്ന മോഡലിന് അടിത്തറയിടാനുമാണ്. ഈ യൂണിറ്റിൽ, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് (AI) എങ്ങനെയാണ് EDA, ദൃശ്യവൽക്കരണം എന്നിവയെ ത്വരിതപ്പെടുത്തുന്നതെന്ന് നമ്മൾ കാണും, എന്നാൽ അത് നിർമ്മിക്കുന്ന ഗ്രാഫിക്സ് എന്തുകൊണ്ട് ശ്രദ്ധാപൂർവ്വം ഓഡിറ്റ് ചെയ്യണം.
ആദ്യം നമുക്ക് രണ്ട് അടിസ്ഥാന വ്യത്യാസങ്ങൾ ഉണ്ടാക്കാം. ആദ്യം, വിവരണാത്മക സ്ഥിതിവിവരക്കണക്കുകൾ (മധ്യം, ശരാശരി, സ്റ്റാൻഡേർഡ് ഡീവിയേഷൻ, ക്വാർട്ടൈൽസ് തുടങ്ങിയ ഡാറ്റയെ സംഗ്രഹിക്കുന്ന സംഖ്യകൾ), വിഷ്വലൈസേഷൻ (ഒരേ വിവരങ്ങൾ ഗ്രാഫിക്കായി കാണിക്കുന്നു) എന്നിവ പരസ്പരം പൂരകമാക്കുന്നു; അവർ ഒരുമിച്ച് ഡാറ്റ വിവരിക്കുന്നു. രണ്ടാമത്തേതും ഏറ്റവും നിർണായകവും: കണ്ടെത്തലും സ്ഥിരീകരണവും വേർതിരിക്കേണ്ടതാണ്. പര്യവേക്ഷണ വിശകലനം അനുമാനങ്ങൾ സൃഷ്ടിക്കുന്നതിനാണ്; അതേ ഡാറ്റ ഉപയോഗിച്ച് അനുമാനം പര്യവേക്ഷണം ചെയ്യുകയും "ഞാൻ ഇത് പരീക്ഷിച്ചു, അത് പ്രാധാന്യമർഹിക്കുന്നതായി കണ്ടെത്തി" എന്ന് പറയുകയും ചെയ്യുന്നത് പി-ഹാക്കിംഗിലേക്കുള്ള വാതിൽ തുറക്കുന്നു, അത് നമുക്ക് അടുത്ത യൂണിറ്റിൽ കാണാം. ഡാറ്റ നോക്കുന്നതും ഒരു പാറ്റേൺ കാണുന്നതും സൗജന്യമാണ്; എന്നാൽ അതേ ഡാറ്റയിൽ ആ പാറ്റേൺ "തെളിയിക്കപ്പെട്ട കണ്ടെത്തൽ" ആയി പ്രഖ്യാപിക്കുന്നത് തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്.
ഘട്ടം ഘട്ടമായുള്ള പര്യവേക്ഷണ വിശകലനം
1. ഏകീകൃത കാഴ്ച. ഓരോ വേരിയബിളും വ്യക്തിഗതമായി പരിശോധിക്കുക: അതിൻ്റെ വിതരണം സമമിതിയിലാണോ അല്ലെങ്കിൽ വളഞ്ഞതാണോ; എത്ര കുന്നുകൾ ഉണ്ട്; പുറത്തുള്ളവർ എവിടെയാണ്? സംഖ്യാ വേരിയബിളുകൾക്കായി, ഹിസ്റ്റോഗ്രാം (മൂല്യങ്ങളെ ശ്രേണികളായി വിഭജിച്ച് ഫ്രീക്വൻസി കാണിക്കുന്ന പ്ലോട്ട്), ബോക്സ്പ്ലോട്ട് (ബോക്സ്പ്ലോട്ട് - മീഡിയൻ, ക്വാർട്ടൈൽ, എക്സ്ട്രീം മൂല്യങ്ങൾ കാണിക്കുന്ന ചാർട്ട്); കാറ്റഗറിക്കൽ വേരിയബിളുകൾക്കായി, ഫ്രീക്വൻസി ടേബിളുകളും ബാർ ചാർട്ടുകളും ഉപയോഗിക്കുക.
2. Bivariate view. രണ്ട് വേരിയബിളുകൾ തമ്മിലുള്ള ബന്ധം കാണുക: രണ്ട് സംഖ്യാ വേരിയബിളുകൾക്കായുള്ള സ്കാറ്റർ പ്ലോട്ട് (ഓരോ നിരീക്ഷണവും x-y പ്ലെയിനിൽ ഒരു പോയിൻ്റായി കാണിക്കുന്നു), സംഖ്യാ-വിഭാഗത്തിന് ഗ്രൂപ്പുചെയ്ത ബോക്സ് പ്ലോട്ട്, രണ്ട് വിഭാഗങ്ങൾക്ക് ക്രോസ്ടാബ്. കോറിലേഷൻ കോഫിഫിഷ്യൻ്റ് നോക്കുന്നതിന് മുമ്പ്, സ്കാറ്റർ പ്ലോട്ട് നോക്കുന്നത് ഉറപ്പാക്കുക: ഒരേ പരസ്പരബന്ധത്തിന് വളരെ വ്യത്യസ്തമായ പാറ്റേണുകൾ കാണിക്കാൻ കഴിയും (പ്രസിദ്ധമായ അൻസ്കോംബ് ക്വാർട്ടറ്റ് ഇത് തെളിയിക്കുന്നു; നാല് ഡാറ്റാ സെറ്റുകൾക്ക് ഏതാണ്ട് സമാനമായ സ്ഥിതിവിവരക്കണക്കുകൾ ഉണ്ട്, എന്നാൽ പ്ലോട്ട് ചെയ്യുമ്പോൾ അവ തികച്ചും വ്യത്യസ്തമായി മാറുന്നു).
3. ശരിയായ ചാർട്ട് തരം തിരഞ്ഞെടുക്കുക. ചാർട്ട് തരം നിങ്ങളുടെ ചോദ്യത്തെയും ഡാറ്റ തരത്തെയും ആശ്രയിച്ചിരിക്കുന്നു. വിതരണത്തിനുള്ള ഹിസ്റ്റോഗ്രാം; ബന്ധത്തിന് ചിതറുന്നു; കാലത്തിനനുസരിച്ച് മാറ്റുന്നതിനുള്ള ലൈൻ ചാർട്ട്; വിഭാഗം താരതമ്യത്തിനുള്ള ബാർ ചാർട്ട്; മൊത്തത്തിലുള്ള ഭാഗങ്ങളുടെ അനുപാതത്തിനായി (ശ്രദ്ധാപൂർവ്വം) അടുക്കിയിരിക്കുന്ന ബാർ. AI വേഗത്തിൽ നിങ്ങൾക്കായി കോഡ് സൃഷ്ടിക്കുന്നു, എന്നാൽ "ഏത് ചോദ്യത്തിനുള്ള ഗ്രാഫ്" എന്ന തീരുമാനം നിങ്ങളുടേതാണ്.
4. പാറ്റേൺ ശ്രദ്ധിക്കുക, ഫലങ്ങൾ പ്രഖ്യാപിക്കരുത്. നിങ്ങൾ കാണുന്ന ഏതെങ്കിലും രസകരമായ പാറ്റേൺ "കണ്ടെത്തൽ കുറിപ്പ്" ആയി രേഖപ്പെടുത്തുക, എന്നാൽ അത് സ്ഥിരീകരിച്ച കണ്ടെത്തലായി കണക്കാക്കരുത്. സ്ഥിരീകരണം ഒരു പ്രത്യേക ഘട്ടത്തിലാണ് ചെയ്യുന്നത്, വെവ്വേറെ ഡാറ്റ അല്ലെങ്കിൽ മുൻകൂട്ടി നിശ്ചയിച്ച ഷെഡ്യൂൾ ഉപയോഗിച്ച്.
സത്യസന്ധമായ ദൃശ്യവൽക്കരണ തത്വങ്ങൾ
ഗ്രാഫിക് ബോധ്യപ്പെടുത്തുന്നു; അതുകൊണ്ട് തന്നെ അതിൻ്റെ തെറ്റിദ്ധരിപ്പിക്കുന്ന ശക്തിയും കൂടുതലാണ്. AI-ക്ക് സൗന്ദര്യാത്മകവും എന്നാൽ ചിലപ്പോൾ തെറ്റിദ്ധരിപ്പിക്കുന്നതുമായ തിരഞ്ഞെടുപ്പുകൾ നടത്താൻ കഴിയും. ഈ നയങ്ങൾ പരിശോധിക്കുക:
- ബാർ ചാർട്ടുകളിൽ, y-അക്ഷം പൂജ്യത്തിൽ തുടങ്ങണം. ഡാഷ് ചെയ്ത അക്ഷം ചെറിയ വ്യത്യാസങ്ങൾ വലുതായി കാണിക്കുന്നു.
- സ്കെയിൽ സ്ഥിരതയുള്ളതായിരിക്കണം. രണ്ട് ചാർട്ടുകൾ താരതമ്യം ചെയ്യുകയാണെങ്കിൽ, ഒരേ അക്ഷ ശ്രേണി ഉപയോഗിക്കുക.
- അമിതമായ മിനുസപ്പെടുത്തൽ യഥാർത്ഥ പാറ്റേൺ മറയ്ക്കാൻ കഴിയും. ഒരു ട്രെൻഡ് ലൈൻ മനോഹരമായി കാണപ്പെടുന്നു, പക്ഷേ അത് ഡാറ്റയെ വളരെയധികം "സ്മൂത്ത്" ചെയ്താൽ, അത് തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്.
- വർണ്ണവും 3D അലങ്കാരവും ശ്രദ്ധയെ വികലമാക്കുന്നു, ഡാറ്റയല്ല. ലാളിത്യം തിരഞ്ഞെടുക്കുക.
- നഷ്ടമായ ഡാറ്റയും സാമ്പിൾ വലുപ്പവും ദൃശ്യമായിരിക്കണം. "n=12", "n=12,000" എന്നിവ ഒരേപോലെ കാണരുത്.
ശ്രദ്ധിക്കുക: AI നിർമ്മിച്ച ഗ്രാഫിക്സ് മനോഹരമായതിനാൽ, അവ ശരിയല്ല. ബാർ ചാർട്ടിൽ പൂജ്യത്തിൽ നിന്ന് അക്ഷം ആരംഭിക്കാതിരിക്കുകയും രണ്ട് ഗ്രൂപ്പുകൾ തമ്മിലുള്ള വ്യത്യാസം പെരുപ്പിച്ചു കാണിക്കുകയും ചെയ്യുന്നതാണ് ഏറ്റവും സാധാരണമായ തെറ്റ്. എല്ലായ്പ്പോഴും അച്ചുതണ്ട് പരിശോധിക്കുക.
താരതമ്യ ചാർട്ട്: ചോദ്യം → ചാർട്ട്
ചോദിക്കുക
ശരിയായ ചാർട്ട്
സാധാരണ തെറ്റ്
ഈ വേരിയബിൾ എങ്ങനെയാണ് വിതരണം ചെയ്യുന്നത്?
ഹിസ്റ്റോഗ്രാം/ബോക്സ് പ്ലോട്ട്
പൈ ചാർട്ട് ഉപയോഗിക്കുക
രണ്ട് സംഖ്യാ വേരിയബിളുകൾ ബന്ധപ്പെട്ടിട്ടുണ്ടോ?
സ്കാറ്റർ പ്ലോട്ട്
പരസ്പര ബന്ധങ്ങളുടെ എണ്ണം മാത്രം നോക്കുക
കാലക്രമേണ അത് എങ്ങനെ മാറിയിരിക്കുന്നു?
ലൈൻ ചാർട്ട്
ഒരു ബാർ ചാർട്ട് ഉപയോഗിച്ച് ഒരു ട്രെൻഡ് പറയുന്നു
ഗ്രൂപ്പുകൾ തമ്മിലുള്ള വ്യത്യാസം എന്താണ്?
ഗ്രൂപ്പുചെയ്ത ബോക്സ്/ബാർ (ആദ്യം മുതൽ)
വെട്ടിച്ചുരുക്കിയ അച്ചുതണ്ട് വടി
ഭാഗം-മുഴുവൻ അനുപാതം?
അടുക്കിയ ബാർ (ജാഗ്രതയോടെ)
മൾട്ടി-സ്ലൈസ് പൈ ചാർട്ട്
പകർത്താവുന്ന നാല് നിർദ്ദേശങ്ങൾ
1. സ്വയമേവ കണ്ടെത്തൽ കോഡ്:
നിങ്ങളുടെ റോൾ: EDA അസിസ്റ്റൻ്റ്. ഞാൻ ഡാറ്റ പങ്കിടുന്നില്ല, എനിക്ക് R (ggplot2) കോഡ് വേണം. 'data' data.frame-ൽ സംഖ്യാപരമായ (വരുമാനം, പ്രായം, ചെലവ്), കാറ്റഗറിക്കൽ (പ്രദേശം, വിദ്യാഭ്യാസം) വേരിയബിളുകൾ ഉണ്ട്. ടാസ്ക്: ഓരോ സംഖ്യയ്ക്കും ഒരു ഹിസ്റ്റോഗ്രാം, ഓരോ കാറ്റഗറിക്കലിനും ഒരു ബാർ ചാർട്ട്, വരുമാനം~ പ്രായത്തിനായി ഒരു സ്കാറ്റർ പ്ലോട്ട് എന്നിവ നിർമ്മിക്കുന്ന കോഡ് എഴുതുക. ബാർ ചാർട്ടുകളിൽ, y-അക്ഷം ZERO ൽ നിന്ന് ആരംഭിക്കട്ടെ. കമൻ്റ് ലൈൻ ചേർക്കുക.
2. പരസ്പര ബന്ധ അവലോകനം (പരസ്പരബന്ധം + വിഷ്വൽ ഒരുമിച്ച്):
വരുമാനത്തിനും ചെലവിനുമുള്ള പിയേഴ്സൺ പരസ്പരബന്ധം കണക്കാക്കുകയും ഒരു സ്കാറ്റർ പ്ലോട്ട് + ലീനിയർ ട്രെൻഡ് പ്ലോട്ട് ചെയ്യുകയും ചെയ്യുന്ന കോഡ് എഴുതുക. പരസ്പര ബന്ധത്തിൻ്റെ എണ്ണം (Anscombe മുന്നറിയിപ്പ്) വിശ്വസിക്കുന്നതിന് മുമ്പ് ചാർട്ട് പരിശോധിക്കാൻ എന്നെ ഓർമ്മിപ്പിക്കുന്ന ഒരു കമൻ്റ് ലൈൻ ചേർക്കുക. ട്രെൻഡ് ലൈൻ അമിതമായി സ്മൂത്ത് ചെയ്യരുത്.
3. സമഗ്രത ഓഡിറ്റ്:
സത്യസന്ധമായ ദൃശ്യവൽക്കരണത്തിനായി ഇനിപ്പറയുന്ന ggplot കോഡ് പരിശോധിക്കുക:[code]. ഇനിപ്പറയുന്നവ പരിശോധിച്ച് ശരിയാക്കുക: y-അക്ഷം പൂജ്യത്തിൽ നിന്നാണോ ആരംഭിക്കുന്നത്, സ്കെയിൽ സ്ഥിരതയുള്ളതാണോ, സാമ്പിൾ വലുപ്പം ദൃശ്യമാണോ, അമിതമായ മിനുസപ്പെടുത്തൽ ഉണ്ടോ? നിങ്ങൾ വരുത്തിയ ഓരോ തിരുത്തലിൻ്റെയും ന്യായീകരണം വിശദീകരിക്കുക.
4. ഒരു കണ്ടെത്തൽ കുറിപ്പ് നിർമ്മിക്കുന്നു (കണ്ടെത്തലല്ല):
ഞാൻ നിർമ്മിക്കുന്ന ഗ്രാഫുകളെ അടിസ്ഥാനമാക്കി, നിരീക്ഷണങ്ങളെ ഒരു 'കണ്ടെത്തൽ കുറിപ്പ്' ആയി പട്ടികപ്പെടുത്തുക; ഓരോ ഇനവും 'പരിശോധിക്കേണ്ട സിദ്ധാന്തം' എന്ന ഭാഷയിൽ എഴുതുക, 'നിർണ്ണായകമായ കണ്ടെത്തൽ' എന്നല്ല. ഉദാഹരണം: 'ഉന്നത വിദ്യാഭ്യാസത്തിലെ വരുമാനം കൂടുതൽ വ്യാപിച്ചുകിടക്കുന്നതായി തോന്നുന്നു; പ്രത്യേക ഡാറ്റ ഉപയോഗിച്ച് പരിശോധിക്കണം.' കാര്യകാരണപരവും നിർണ്ണായകവുമായ പ്രസ്താവനകൾ ഒഴിവാക്കുക.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
വിളവിൽ നിന്ന് നല്ല ഗ്രാഫുകൾ ഉണ്ടാക്കി അവ എന്താണ് അർത്ഥമാക്കുന്നത് എന്ന് എന്നോട് പറയുക.
ഈ പ്രോംപ്റ്റ് തെറ്റിദ്ധരിപ്പിക്കുന്ന ഔട്ട്പുട്ടിനെ ക്ഷണിക്കുന്നു: “മനോഹരമായത്” സൗന്ദര്യശാസ്ത്രത്തിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്നു, അതേസമയം “അതിൻ്റെ അർത്ഥം” കണ്ടെത്തലിൽ നിന്ന് കൃത്യമായ നിഗമനത്തിലേക്ക് കുതിക്കാൻ AI യെ പ്രേരിപ്പിക്കുന്നു. കാര്യകാരണപരവും അതിശയോക്തിപരവുമായ അഭിപ്രായങ്ങൾ പിന്നാലെയുണ്ട്.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: സത്യസന്ധമായ EDA അസിസ്റ്റൻ്റ്. ടാസ്ക്: (1) എൻ്റെ ചോദ്യത്തിന് അനുയോജ്യമായ ചാർട്ട് തിരഞ്ഞെടുത്ത് ന്യായീകരണം എഴുതുക, (2) ബാർ ചാർട്ടുകളിൽ പൂജ്യത്തിൽ നിന്ന് അക്ഷം ആരംഭിക്കുക, (3) കണ്ടെത്തൽ കുറിപ്പ് ഭാഷയിൽ ഔട്ട്പുട്ട് വ്യാഖ്യാനിക്കുക: കൃത്യമായ/കാരണപരമായ ക്ലെയിമുകളൊന്നും നിർദ്ദേശിക്കരുത്: "സാമ്പിൾ ചെറുതാണെങ്കിൽ ഞാൻ പ്രവർത്തിപ്പിക്കും" (4 സാമ്പിൾ ചെറുതാണെങ്കിൽ) എന്ന ഭാഷയിൽ ഞാൻ പ്രവർത്തിക്കും. എൻ്റെ സ്വന്തം പരിതസ്ഥിതിയിൽ ചാർട്ട് ചെയ്ത് അത് പരിശോധിച്ചുറപ്പിക്കുക.
വ്യത്യാസം: ശക്തമായ ഇച്ഛാശക്തി ചാർട്ട് തരത്തെ ന്യായീകരിക്കുന്നു, സത്യസന്ധതയുടെ നിയമങ്ങൾ അടിച്ചേൽപ്പിക്കുന്നു, സ്ഥിരീകരണവുമായി കണ്ടെത്തലിനെ ആശയക്കുഴപ്പത്തിലാക്കുന്നില്ല.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - ഡിസ്ക്രീറ്റ് ആക്സിസ് അതിശയോക്തി. ഒരു ബാർ ചാർട്ടിൽ രണ്ട് ശാഖകളുടെ (7.8, 8.0; 10-ൽ) സംതൃപ്തി സ്കോറുകൾ ഒരു അനലിസ്റ്റ് കാണിച്ചു. 7.5 മുതൽ YZ അക്ഷം ആരംഭിക്കുമ്പോൾ, രണ്ടാമത്തെ ശാഖ ആദ്യത്തേതിനേക്കാൾ ഏകദേശം ഇരട്ടി ഉയരത്തിൽ പ്രത്യക്ഷപ്പെട്ടു; വ്യത്യാസം 2.5% മാത്രമായിരുന്നു. തെറ്റായ ധാരണയിൽ ഒരു ശാഖയ്ക്ക് പ്രതിഫലം നൽകാൻ മാനേജ്മെൻ്റ് തയ്യാറെടുക്കുകയായിരുന്നു. ഞാൻ ആദ്യം മുതൽ അച്ചുതണ്ട് ആരംഭിച്ചപ്പോൾ വ്യത്യാസം ഏതാണ്ട് അദൃശ്യമായിരുന്നു. പാഠം: അച്ചുതണ്ട് തിരഞ്ഞെടുക്കൽ മാത്രം ധാരണ മാറ്റുന്നു.
കേസ് 2 - പരസ്പര ബന്ധത്തെ വിശ്വസിക്കുകയും ചാർട്ട് ഒഴിവാക്കുകയും ചെയ്യുന്നു. ഒരു ഗവേഷകൻ രണ്ട് വേരിയബിളുകൾക്കിടയിൽ r = 0.81 കാണുകയും "ശക്തമായ രേഖീയ ബന്ധം" എഴുതുകയും ചെയ്തു. അവൻ്റെ കൺസൾട്ടൻ്റ് സ്കാറ്റർ പ്ലോട്ട് ആവശ്യപ്പെട്ടപ്പോൾ, ആ ബന്ധം യഥാർത്ഥത്തിൽ ഒരു തീവ്ര നിരീക്ഷണം മൂലമാണെന്ന് കാണപ്പെട്ടു, ആ പോയിൻ്റ് നീക്കം ചെയ്തപ്പോൾ, പരസ്പരബന്ധം 0.12 ആയി കുറഞ്ഞു. പാഠം: പരസ്പര ബന്ധങ്ങളുടെ എണ്ണം ഒരു ഗ്രാഫിന് പകരമല്ല; എപ്പോഴും ചിതറിക്കിടക്കുന്നതിലേക്ക് നോക്കുക.
കേസ് 3 - സ്ഥിരീകരണത്തോടൊപ്പം ആശയക്കുഴപ്പമുണ്ടാക്കുന്ന കണ്ടെത്തൽ. ഒരു വിദ്യാർത്ഥി 40-വേരിയബിൾ ഡാറ്റാ സെറ്റിലെ എല്ലാ ജോഡിവൈസ് കോറിലേഷനുകളും നോക്കി, ഏറ്റവും ഉയർന്നത് തിരഞ്ഞെടുത്ത് (r=0.52) എഴുതി, "വിദ്യാഭ്യാസവും സമ്പാദ്യവും തമ്മിൽ ഞങ്ങൾ ഒരു സുപ്രധാന ബന്ധം കണ്ടെത്തി (p=0.004)." എന്നിരുന്നാലും, 40 വേരിയബിളുകളിൽ നൂറുകണക്കിന് ജോഡികൾ ഉണ്ടായിരുന്നു; ഏറ്റവും ഉയർന്നത് തിരഞ്ഞെടുത്തത് അവസരം കാരണം തെറ്റായ കണ്ടെത്തലായിരുന്നു. പാഠം: കണ്ടെത്തിയ പാറ്റേൺ അതേ ഡാറ്റയിൽ "പരീക്ഷിച്ച് പ്രാധാന്യമുള്ളതായി പ്രഖ്യാപിക്കാൻ" കഴിയില്ല; പ്രത്യേക സ്ഥിരീകരണം ആവശ്യമാണ്.
സാധാരണ തെറ്റുകൾ
- ബാർ ചാർട്ടിൽ പൂജ്യത്തിൽ നിന്ന് അക്ഷം ആരംഭിക്കുന്നില്ല. ഇത് ചെറിയ വ്യത്യാസത്തെ പെരുപ്പിച്ചു കാണിക്കുന്നു; ഏറ്റവും സാധാരണമായ ദൃശ്യ നുണ. എപ്പോഴും പരിശോധിക്കുക.
- പരസ്പരബന്ധം നോക്കുകയും ചാർട്ട് ഒഴിവാക്കുകയും ചെയ്യുന്നു. ഒരേ പരസ്പരബന്ധം വളരെ വ്യത്യസ്തമായ പാറ്റേണുകളിൽ നിന്നാണ് വരുന്നത്; ഒരു ബാഹ്യ ബന്ധത്തിന് അനുയോജ്യമാകും. ആദ്യം, ചിതറിക്കൽ.
- കണ്ടെത്തലിൽ കണ്ടെത്തിയ പാറ്റേൺ അതേ ഡാറ്റയിലെ "തെളിവ്" ആയി കണക്കാക്കുന്നു. ഇതാണ് പി-ഹാക്കിംഗിലേക്കുള്ള ഗേറ്റ്വേ; സ്ഥിരീകരണം പ്രത്യേകം ചെയ്യുന്നു.
- തെറ്റായ ചാർട്ട് തരം. ട്രെൻഡിനുള്ള ബാർ, വിതരണത്തിനുള്ള പൈ തുടങ്ങിയ പൊരുത്തങ്ങൾ തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്. ചോദ്യത്തെ അടിസ്ഥാനമാക്കി ഒരു തരം തിരഞ്ഞെടുക്കുക.
- സാമ്പിൾ വലുപ്പം മറയ്ക്കുന്നു. n=8 ഉം n=8,000 ഉം ഒരേ ഗ്രാഫിൽ ഒരുപോലെ കാണരുത്; അനിശ്ചിതത്വം കാണിക്കണം.
നുറുങ്ങ്: ഒരു ചാർട്ട് പ്രസിദ്ധീകരിക്കുന്നതിന് മുമ്പ്, സ്വയം ചോദിക്കുക: "ഞാൻ അച്ചുതണ്ട് മാറ്റിയാൽ കഥ മാറുമോ?" ഉത്തരം അതെ എന്നാണെങ്കിൽ, നിങ്ങൾ ഒരു സത്യസന്ധമല്ലാത്ത സ്ഥലത്ത് നിന്ന് പിവറ്റ് ആരംഭിച്ചിരിക്കാം.
ചുരുക്കത്തിൽ
പര്യവേക്ഷണ ഡാറ്റ വിശകലനം എന്നത് ഡാറ്റയെ കണ്ടുമുട്ടുന്നതിനും പാറ്റേണുകൾ കാണുന്നതിനും അനുമാനങ്ങൾ സൃഷ്ടിക്കുന്നതിനുമുള്ള ഘട്ടമാണ്; അത് സ്ഥിരീകരണമല്ല. AI വേഗത്തിൽ വിവരണാത്മക സ്ഥിതിവിവരക്കണക്കുകളും ഗ്രാഫ് കോഡും സൃഷ്ടിക്കുന്നു, എന്നാൽ നിങ്ങളുടെ ചോദ്യത്തെ അടിസ്ഥാനമാക്കി നിങ്ങൾ ഗ്രാഫ് തരം തിരഞ്ഞെടുക്കുകയും ന്യായത്തിൻ്റെ തത്വങ്ങൾ നിയന്ത്രിക്കുകയും ചെയ്യുന്നു (പൂജ്യം അക്ഷം, സ്ഥിരതയുള്ള സ്കെയിൽ, വ്യക്തമായ അനിശ്ചിതത്വം). കോറിലേഷൻ നമ്പർ വിശ്വസിക്കുന്നതിന് മുമ്പ് സ്കാറ്റർ നോക്കുക; കണ്ടെത്തലിൽ നിങ്ങൾ കണ്ടെത്തിയ പാറ്റേൺ അതേ ഡാറ്റയിൽ "തെളിവ്" ആയി പ്രഖ്യാപിക്കരുത്. AI യുടെ മനോഹരമായ ഗ്രാഫ് ശരിയായ ഗ്രാഫ് എന്നല്ല അർത്ഥമാക്കുന്നത്.
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു ഡാറ്റാ സെറ്റിൽ കുറഞ്ഞത് മൂന്ന് വേരിയബിളുകളെങ്കിലും തിരഞ്ഞെടുക്കുക. സത്യസന്ധത നിയമങ്ങൾ നടപ്പിലാക്കുന്ന പ്രോംപ്റ്റ് ഉപയോഗിച്ച് പര്യവേക്ഷണ ഗ്രാഫുകൾ (ഹിസ്റ്റോഗ്രാം, സ്കാറ്റർ, ബോക്സ്ഡ്) നിർമ്മിക്കുന്ന കോഡിനായി AI-യോട് ആവശ്യപ്പെടുക. ഓരോ ചാർട്ടിനും: (1) ചോദ്യത്തിനുള്ള ചാർട്ട് തരത്തിൻ്റെ അനുയോജ്യത പരിശോധിക്കുക, (2) അച്ചുതണ്ടിൻ്റെ സത്യസന്ധത, (3) സാമ്പിൾ വലുപ്പത്തിൻ്റെ ദൃശ്യപരത. അനുമാന ഭാഷയിൽ കുറഞ്ഞത് ഒരു "കണ്ടെത്തൽ കുറിപ്പ്" എഴുതുക ("...വെവ്വേറെ പരീക്ഷിച്ചതായി തോന്നുന്നു"). കൗണ്ടും സ്കട്ടറും തമ്മിലുള്ള പരസ്പരബന്ധം പരിശോധിച്ച് അവ തമ്മിൽ പൊരുത്തക്കേടുണ്ടെങ്കിൽ റിപ്പോർട്ട് ചെയ്യുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] എൻ്റെ ചോദ്യത്തെയും ഡാറ്റാ തരത്തെയും അടിസ്ഥാനമാക്കി ഞാൻ ചാർട്ട് തരം തിരഞ്ഞെടുത്തു.
- [ ] ബാർ ചാർട്ടുകളിൽ, ഞാൻ പൂജ്യത്തിൽ നിന്ന് y-അക്ഷം ആരംഭിക്കുന്നു; ഞാൻ അച്ചുതണ്ട് സത്യസന്ധത പരിശോധിച്ചു.
- [ ] പരസ്പരബന്ധം വിശ്വസിക്കുന്നതിന് മുമ്പ് ഞാൻ സ്കാറ്റർപ്ലോട്ടിലേക്ക് നോക്കി.
- [ ] ഞാൻ ഗ്രാഫിൽ സാമ്പിൾ വലുപ്പവും അനിശ്ചിതത്വവും പ്രതിഫലിപ്പിച്ചു.
- [ ] ഞാൻ പര്യവേക്ഷണത്തിൽ കണ്ടെത്തിയ പാറ്റേണുകൾ "തെളിവ്" എന്നതിലുപരി "പരീക്ഷണത്തിന് വിധേയമാക്കേണ്ട സിദ്ധാന്തം" എന്നാണ് ഞാൻ എഴുതിയത്.
- [ ] സ്ഥിരീകരണത്തിനായി ഞാൻ ഒരേ ഡാറ്റ ഉപയോഗിക്കില്ലെന്നും ഒരു പ്രത്യേക ഘട്ടം ആവശ്യമാണെന്നും ഞാൻ കുറിച്ചു.