യൂണിറ്റുകൾ
1. സാമ്പത്തികശാസ്ത്രത്തിലും സ്ഥിതിവിവരക്കണക്കിലും കൃത്രിമബുദ്ധി: റോളുകൾ, അതിരുകൾ, ആധികാരികത, സ്വകാര്യത 2. ഡാറ്റ ക്ലീനിംഗും തയ്യാറാക്കലും: നഷ്ടപ്പെട്ട ഡാറ്റ, ഔട്ട്‌ലറുകൾ, കോഡിംഗ് 3. പര്യവേക്ഷണ ഡാറ്റാ വിശകലനവും ദൃശ്യവൽക്കരണവും: കൃത്രിമ ബുദ്ധി ഉപയോഗിച്ച് ഗ്രാഫിംഗും വ്യാഖ്യാനവും 4. ലീനിയർ റിഗ്രഷൻ: മോഡൽ ബിൽഡിംഗ്, കോഫിഫിഷ്യൻ്റ് ഇൻ്റർപ്രെട്ടേഷൻ, അനുമാനങ്ങൾ 5. റിഗ്രഷൻ ഡയഗ്‌നോസ്റ്റിക്‌സും ലംഘനങ്ങളും: കോളിനാരിറ്റി, ഹെറ്ററോസെഡസ്‌റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ 6. അനുമാന പരിശോധനയും പി-മൂല്യവും: പ്രാധാന്യം, ശക്തി, ഒന്നിലധികം താരതമ്യങ്ങൾ 7. പി-ഹാക്കിംഗ്, ഹാർക്കിംഗ്, സ്റ്റാറ്റിസ്റ്റിക്കൽ ഇൻ്റഗ്രിറ്റി: കൃത്രിമ ബുദ്ധിയുടെ യുഗത്തിലെ അപകടങ്ങൾ 8. സമയ ശ്രേണി വിശകലനം: നിശ്ചലത, അരിമ, പ്രവചനം 9. കാരണവും നയ വിശകലനവും: ഡിഐഡി, ഐവി, ആർഡിഡി, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് 10. കോഡ് ജനറേഷനും പുനരുൽപ്പാദനവും: ആർ/പൈത്തൺ, വേർഷനിംഗ്, റീപ്രൊഡ്യൂസിബിലിറ്റി 11. റിപ്പോർട്ട് റൈറ്റിംഗ്, ആശയവിനിമയം, ധാർമ്മികത: ഫലങ്ങൾ അവതരിപ്പിക്കൽ, അതിരുകൾ ആശയവിനിമയം
യൂണിറ്റ് 5 / 11

റിഗ്രഷൻ ഡയഗ്‌നോസ്റ്റിക്‌സും ലംഘനങ്ങളും: കോളിനാരിറ്റി, ഹെറ്ററോസെഡസ്‌റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ

നേട്ടങ്ങൾ:

  • കൃത്രിമബുദ്ധി പിന്തുണയുള്ള ഡയഗ്നോസ്റ്റിക് ടെസ്റ്റുകളും ഗ്രാഫിക്സും ഉപയോഗിച്ച് മൾട്ടികോളിനെയാരിറ്റി, ഹെറ്ററോസ്സെഡാസ്റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ തുടങ്ങിയ ലംഘനങ്ങൾ കണ്ടെത്താനുള്ള കഴിവ്
  • ഓരോ ലംഘനവും കോഫിഫിഷ്യൻ്റ് എസ്റ്റിമേറ്റുകളോ സ്റ്റാൻഡേർഡ് പിശകുകളോ വളച്ചൊടിക്കുന്നുണ്ടോ എന്ന് വേർതിരിച്ചറിയാനും ഉചിതമായ തിരുത്തൽ തിരഞ്ഞെടുക്കാനുമുള്ള കഴിവ് (ശക്തമായ സ്റ്റാൻഡേർഡ് പിശക്, പരിവർത്തനം, മോഡൽ റിവിഷൻ)
  • AI നിർദ്ദേശിച്ച പരിഹാരങ്ങൾ പ്രശ്നം മറച്ചുവെക്കുന്നതിനുപകരം പരിഹരിക്കുന്നുവെന്നും ഡാറ്റ ഉൽപ്പാദിപ്പിക്കുന്ന പ്രക്രിയയെക്കുറിച്ചുള്ള ധാരണയെ അടിസ്ഥാനമാക്കിയുള്ളതാണ് രോഗനിർണയം എന്നും പരിശോധിക്കാനുള്ള കഴിവ്

ഒരു റിഗ്രഷൻ്റെ ഔട്ട്പുട്ട് വായിക്കുന്നത് എളുപ്പമാണ്; അവനെ വിശ്വസിക്കാൻ പ്രയാസമാണ്. ഗുണകങ്ങൾ നിഷ്പക്ഷമായതിനാൽ, സ്റ്റാൻഡേർഡ് പിശകുകൾ ശരിയാണ്, കൂടാതെ പി-മൂല്യങ്ങൾ സാധുവാണ്, മുമ്പത്തെ യൂണിറ്റിൽ ഞങ്ങൾ അവതരിപ്പിച്ച അനുമാനങ്ങളെ ആശ്രയിച്ചിരിക്കുന്നു. ഈ യൂണിറ്റിൽ, ഞങ്ങൾ ഏറ്റവും സാധാരണമായ മൂന്ന് ലംഘനങ്ങൾ കവർ ചെയ്യും: മൾട്ടികോളിനെയാരിറ്റി, ഹെറ്ററോസ്സെഡാസ്റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ. ഓരോന്നിനും ഞങ്ങൾ മൂന്ന് ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകും: അത് എങ്ങനെ നിർണ്ണയിക്കും, അത് തകർക്കുന്നതെന്താണ് (കോഫിഫിഷ്യൻ്റ് അല്ലെങ്കിൽ സ്റ്റാൻഡേർഡ് പിശക്), അത് എങ്ങനെ പരിഹരിക്കാം. ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് (AI) ഡയഗ്നോസ്റ്റിക് പരിശോധനയ്ക്കും തിരുത്തലിനും കോഡ് സൃഷ്ടിക്കുന്നു; എന്നാൽ ഏത് ലംഘനമാണ് യഥാർത്ഥത്തിൽ പ്രശ്‌നമെന്നും പരിഹരിക്കുന്നത് പ്രശ്‌നം പരിഹരിക്കുമോയെന്നും നിങ്ങൾ തീരുമാനിക്കുക.

നമുക്ക് മുന്നിൽ ഏറ്റവും നിർണായകമായ വേർതിരിവ് ഉണ്ടാക്കാം: ഒരു ലംഘനം കോഫിഫിഷ്യൻ്റ് എസ്റ്റിമേറ്റിനെ വികലമാക്കുമോ അതോ സാധാരണ പിശകുകളെ മാത്രമാണോ? ഈ വ്യത്യാസം പരിഹാരം നിർണ്ണയിക്കുന്നു. ഗുണകത്തെ വികലമാക്കുന്ന ഒരു പ്രശ്‌നത്തിന് (ഉദാ. എക്സോജെനിറ്റി ലംഘനം) മോഡലിനെ പുനർവിചിന്തനം ചെയ്യേണ്ടതുണ്ട്; സ്റ്റാൻഡേർഡ് പിശക് (ഹെറ്ററോസ്സെഡാസ്റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ) മാത്രം വളച്ചൊടിക്കുന്ന ഒരു പ്രശ്നം സാധാരണ പിശക് തിരുത്തൽ വഴി പലപ്പോഴും പരിഹരിക്കപ്പെടും. AI-യുടെ ഒരു സാധാരണ തെറ്റ്, സാധാരണ പിശക് തിരുത്തുന്ന ഒരു സാങ്കേതികത പ്രയോഗിക്കുകയും തുടർന്ന് പ്രശ്നം "പരിഹരിച്ചു" എന്ന് പ്രഖ്യാപിക്കുകയും ചെയ്യുക എന്നതാണ്; അതേസമയം, അടിസ്ഥാന ഘടന ഇപ്പോഴും അവിടെ ഉണ്ടായിരിക്കാം.

ലംഘനം 1: മൾട്ടികോളിനാരിറ്റി

എന്തുകൊണ്ട്? രണ്ടോ അതിലധികമോ വിശദീകരണ വേരിയബിളുകൾ പരസ്പരം ശക്തമായി ബന്ധപ്പെട്ടിരിക്കുന്നു; ഉദാഹരണത്തിന്, "മൊത്തം വർഷത്തെ പരിചയം", "പ്രായം" എന്നിവ മാതൃകയിൽ ഉൾപ്പെടുത്തുന്നു. ഈ വേരിയബിളുകൾ ഏതാണ്ട് ഒരേ വിവരങ്ങൾ വഹിക്കുന്നതിനാൽ, മോഡലിന് അവയെ വേർതിരിക്കുന്നത് ബുദ്ധിമുട്ടാണ്.

അത് എന്താണ് തകർക്കുന്നത്? കോഫിഫിഷ്യൻ്റ് എസ്റ്റിമേറ്റുകൾ പക്ഷപാതരഹിതമായി തുടരുന്നു, പക്ഷേ അസ്ഥിരമായി മാറുന്നു: സ്റ്റാൻഡേർഡ് പിശകുകൾ പെരുകുന്നു, ആത്മവിശ്വാസ ഇടവേളകൾ വർദ്ധിക്കുന്നു, വ്യക്തിഗത ഗുണകങ്ങൾ നിസ്സാരമായി മാറിയേക്കാം, അതേസമയം മോഡൽ മൊത്തത്തിൽ പ്രാധാന്യമുള്ളതായിരിക്കാം (എഫ്-ടെസ്റ്റ്). ഒരു ചെറിയ ഡാറ്റ മാറ്റം ഗുണകത്തെ ഗണ്യമായി നീക്കുന്നു.

എങ്ങനെയാണ് രോഗനിർണയം നടത്തുന്നത്? VIF (വേരിയൻസ് ഇൻഫ്ലേഷൻ ഫാക്ടർ): ഓരോ വേരിയബിളിനും, ആ വേരിയബിളിനെ മറ്റുള്ളവർ എത്രമാത്രം വിശദീകരിക്കുന്നു എന്ന് ഇത് അളക്കുന്നു. ഒരു പരുക്കൻ പരിധി എന്ന നിലയിൽ, VIF > 5 (ചിലത് 10) ജാഗ്രത ആവശ്യമാണ്. കൂടാതെ, വിശദീകരണ വേരിയബിളുകൾ തമ്മിലുള്ള പരസ്പര ബന്ധ മാട്രിക്സ് പരിശോധിക്കുന്നു.

എങ്ങനെ ശരിയാക്കാം? പരസ്പര ബന്ധമുള്ള വേരിയബിളുകളിലൊന്ന് ഉപേക്ഷിക്കുക, അവയെ സംയോജിപ്പിക്കുക (ഒരു സൂചിക ഉണ്ടാക്കുക), അല്ലെങ്കിൽ (സിദ്ധാന്തം ആവശ്യമെങ്കിൽ) രണ്ടും നിലനിർത്തുകയും വ്യക്തിഗത ഗുണകങ്ങളെ വ്യാഖ്യാനിക്കുന്നത് ഒഴിവാക്കുകയും ചെയ്യുക. ഏത് വേരിയബിൾ നിലകൊള്ളുന്നു എന്നത് ഒരു സൈദ്ധാന്തിക തീരുമാനമാണ്, സ്ഥിതിവിവരക്കണക്കല്ല - AI ഉന്മൂലനം നിർദ്ദേശിക്കുന്നു, നിങ്ങൾ ന്യായീകരണം നൽകുന്നു.

ലംഘനം 2: ഹെറ്ററോസെഡസ്‌റ്റിസിറ്റി

എന്തുകൊണ്ട്? നിരീക്ഷണങ്ങളിലുടനീളം പിശക് പദത്തിൻ്റെ വ്യത്യാസം സ്ഥിരമല്ല. സാധാരണ ഉദാഹരണം: വരുമാനം വർദ്ധിക്കുന്നതിനനുസരിച്ച്, ചെലവിന് ചുറ്റുമുള്ള വ്യാപനവും വർദ്ധിക്കുന്നു; കുറഞ്ഞ വരുമാനത്തിൽ ഇടുങ്ങിയതും ഉയർന്ന വരുമാനത്തിൽ വീതിയുള്ളതുമായ ഒരു "ഫണൽ" പാറ്റേൺ രൂപപ്പെടുന്നു.

അത് എന്താണ് തകർക്കുന്നത്? കോഫിഫിഷ്യൻ്റ് എസ്റ്റിമേറ്റുകൾ വീണ്ടും നിഷ്പക്ഷമാണ് - ഇത് പ്രധാനമാണ്. വികലമാകുന്നത് സ്റ്റാൻഡേർഡ് പിശകുകളാണ്: അവ തെറ്റായി കണക്കാക്കുന്നു, അതിനാൽ പി-മൂല്യങ്ങളും ആത്മവിശ്വാസ ഇടവേളകളും വിശ്വസനീയമല്ല. അതിനാൽ നിങ്ങളുടെ ഗുണകം ശരിയായ കേന്ദ്രത്തിലാണ്, എന്നാൽ "നിങ്ങൾ എത്രത്തോളം ആത്മവിശ്വാസത്തിലാണ്" എന്ന ചോദ്യത്തിനുള്ള ഉത്തരം തെറ്റാണ്.

എങ്ങനെയാണ് രോഗനിർണയം നടത്തുന്നത്? പ്രവചിച്ച മൂല്യങ്ങൾ (ഫണൽ പാറ്റേൺ അന്വേഷിക്കുന്നു) കൂടാതെ ഔപചാരിക പരിശോധനകൾ എന്നിവയ്‌ക്കെതിരായ അവശിഷ്ടങ്ങളുടെ സ്‌കാറ്റർ പ്ലോട്ട്: ബ്രൂഷ്-പാഗൻ ടെസ്റ്റ്, വൈറ്റ് ടെസ്റ്റ്. ചെറിയ പി-മൂല്യം "സ്ഥിരമായ വ്യത്യാസമില്ല" എന്ന് പറയുന്നു.

എങ്ങനെ ശരിയാക്കാം? കരുത്തുറ്റ സ്റ്റാൻഡേർഡ് പിശകുകൾ ഉപയോഗിക്കുന്നതാണ് ഏറ്റവും സാധാരണവും പ്രായോഗികവുമായ പരിഹാരം (റോബസ്റ്റ് / ഹെറ്ററോസ്‌കെഡാസ്റ്റിസിറ്റി-കൺസിസ്റ്റൻ്റ്, എച്ച്‌സി സ്റ്റാൻഡേർഡ് പിശകുകൾ): ഇത് ഗുണകത്തെ മാറ്റില്ല, ലംഘനത്തിനുള്ള സ്റ്റാൻഡേർഡ് പിശക് ശരിയാക്കുന്നു. ഇതര: ആശ്രിത വേരിയബിൾ (ലോഗ് പോലെ) അല്ലെങ്കിൽ വെയ്റ്റഡ് എൽസിഎം രൂപാന്തരപ്പെടുത്തുന്നു. കരുത്തുറ്റ സ്റ്റാൻഡേർഡ് പിശകുകൾ ഇന്ന് പ്രായോഗിക പ്രവർത്തനങ്ങളിൽ മിക്കവാറും സ്ഥിരസ്ഥിതിയായി മാറിയിരിക്കുന്നു.

ലംഘനം 3: യാന്ത്രികബന്ധം

എന്തുകൊണ്ട്? പിശക് നിബന്ധനകൾ പരസ്പരം സ്വതന്ത്രമല്ല; സമയ ശ്രേണിയിൽ ഇത് ഏറ്റവും സാധാരണമാണ്: ഒരു കാലഘട്ടത്തിലെ പിശക് അടുത്തതിനെ ബാധിക്കുന്നു (ഉദാ. ഷോക്ക് ശേഷമുള്ള കാലഘട്ടങ്ങളിൽ അവശിഷ്ടം പോസിറ്റീവ് ആയി തുടരും).

അത് എന്താണ് തകർക്കുന്നത്? വീണ്ടും, ഇത് പ്രാഥമികമായി സ്റ്റാൻഡേർഡ് പിശകുകളെ വളച്ചൊടിക്കുന്നു (പലപ്പോഴും അവയെ കുറച്ചുകാണുന്നു, തെറ്റായ പ്രാധാന്യം സൃഷ്ടിക്കുന്നു); ഗുണകങ്ങൾ എൽസിസിയിൽ നിഷ്പക്ഷമായി നിലകൊള്ളുന്നു, പക്ഷേ അവയുടെ ഫലപ്രാപ്തി നഷ്ടപ്പെടുന്നു.

എങ്ങനെയാണ് രോഗനിർണയം നടത്തുന്നത്? ഡർബിൻ-വാട്‌സൺ ടെസ്റ്റ് (ഫസ്റ്റ്-ഓർഡർ ഓട്ടോകോറിലേഷനായി), ബ്രൂഷ്-ഗോഡ്ഫ്രെ ടെസ്റ്റ് (കൂടുതൽ പൊതുവായത്), കൂടാതെ ലാഗ്ഡ് മൂല്യങ്ങൾക്കെതിരായ അവശിഷ്ടങ്ങളുടെ പ്ലോട്ടുകൾ.

എങ്ങനെ ശരിയാക്കാം? Newey-West (HAC — ഓട്ടോകോറിലേഷൻ, ഹെറ്ററോസ്‌കെഡാസ്റ്റിസിറ്റി എന്നിവയെ പ്രതിരോധിക്കും) സ്റ്റാൻഡേർഡ് പിശകുകൾ, മോഡലിലേക്ക് ലാഗ്ഡ് പദങ്ങൾ ചേർക്കൽ, അല്ലെങ്കിൽ ഉചിതമായ സമയ ശ്രേണി മോഡലിലേക്ക് മാറൽ (യൂണിറ്റ് 8).

മുൻകരുതൽ: ഹെറ്ററോസ്‌സെഡസ്‌റ്റിസിറ്റിയും ഓട്ടോകോറിലേഷനും സാധാരണ പിശകിനെ വളച്ചൊടിക്കുന്നു, ഗുണകത്തെയല്ല. അതിനാൽ, "കോഫിഫിഷ്യൻ്റ് പ്രാധാന്യമുള്ളതായിരുന്നു" എന്ന് പറയുന്നതിന് മുമ്പ്, സ്റ്റാൻഡേർഡ് പിശക് ശരിയായി കണക്കാക്കിയിട്ടുണ്ടെന്ന് ഉറപ്പാക്കുക; അല്ലാത്തപക്ഷം അർത്ഥപൂർണത ഒരു മിഥ്യയാകാം.

താരതമ്യ ചാർട്ട്

ലംഘനം

എന്താണ് തകർക്കുന്നത്

രോഗനിർണയം

സാധാരണ പരിഹാരം

മൾട്ടി-ലിങ്ക്

സ്റ്റാൻഡേർഡ് പിശകുകൾ വർദ്ധിപ്പിക്കുന്നു, ഗുണകത്തെ അസ്ഥിരമാക്കുന്നു

വിഐഎഫ്, കോറിലേഷൻ മാട്രിക്സ്

വേരിയബിൾ കുറയ്ക്കുക/സംയോജിപ്പിക്കുക (സിദ്ധാന്തമനുസരിച്ച്)

വിജാതീയത

സ്റ്റാൻഡേർഡ് പിശകുകൾ (കോഫിഫിഷ്യൻ്റ് നിഷ്പക്ഷത)

ബ്രൂഷ്-പാഗൻ, വെള്ള, ശേഷിക്കുന്ന പ്ലോട്ട്

റോബസ്റ്റ് (HC) സ്റ്റാൻഡേർഡ് പിശക്, പരിവർത്തനം

ഓട്ടോകോറിലേഷൻ

സ്റ്റാൻഡേർഡ് പിശകുകൾ (കോഫിഫിഷ്യൻ്റ് നിഷ്പക്ഷത)

ഡർബിൻ-വാട്സൺ, ബ്രൂഷ്-ഗോഡ്ഫ്രെ

Newey-West (HAC), കാലതാമസം നേരിട്ട കാലാവധി

പകർത്താവുന്ന നാല് നിർദ്ദേശങ്ങൾ

1. പൂർണ്ണമായ ഡയഗ്നോസ്റ്റിക് പാക്കേജ്:

നിങ്ങളുടെ റോൾ: റിഗ്രഷൻ ഡയഗ്നോസ്റ്റിക് അസിസ്റ്റൻ്റ്. എനിക്ക് R കോഡ് വേണം, ഞാൻ ഡാറ്റ പങ്കിടുന്നില്ല. മോഡൽ: lm (ചെലവ് ~ വരുമാനം + പ്രായം + പ്രദേശം, ഡാറ്റ = ഡാറ്റ). ടാസ്‌ക്ക്: (1) VIF കണക്കാക്കുക, (2) ബ്രൂഷ്-പാഗൻ, ബാക്കിയുള്ള എസ്റ്റിമേറ്റ് പ്ലോട്ട് എന്നിവയ്‌ക്കൊപ്പം ടെസ്റ്റ് ഹെറ്ററോസ്‌കെഡാസ്‌റ്റിസിറ്റി, (3) ഡർബിൻ-വാട്‌സണുമായുള്ള ടെസ്റ്റ് ഓട്ടോകോറിലേഷൻ. ഓരോ ടെസ്റ്റും എന്ത് ലംഘനമാണ് അളക്കുന്നതെന്നും പി-മൂല്യം എങ്ങനെ വ്യാഖ്യാനിക്കണമെന്നും കമൻ്റ് ലൈനിൽ വിശദീകരിക്കുക. തിരുത്തൽ APPLICATION; രോഗനിർണയം ഉണ്ടാക്കുക.

2. ശക്തമായ സ്റ്റാൻഡേർഡ് പിശക്:

ഒരേ മോഡലിന് (സാൻഡ്‌വിച്ച് + lmtest പാക്കേജുകൾ) ഹെറ്ററോസ്‌കെഡാസ്റ്റിസിറ്റി-റോബസ്റ്റ് (HC3) സ്റ്റാൻഡേർഡ് പിശകുകൾ ഉപയോഗിച്ച് കോഫിഫിഷ്യൻ്റ് ടേബിളിനെ പുനർനിർമ്മിക്കുന്ന R കോഡ് എഴുതുക. ക്ലാസിക്കൽ, റോബസ്റ്റ് സ്റ്റാൻഡേർഡ് പിശകുകൾ വശങ്ങളിലായി കാണിക്കുന്ന ഒരു പട്ടിക നിർമ്മിക്കുക, അതുവഴി എനിക്ക് വ്യത്യാസം കാണാൻ കഴിയും. ഗുണകങ്ങൾ മാറില്ല, സാധാരണ പിശകുകൾ മാത്രമേ മാറുന്നുള്ളൂ എന്ന് കമൻ്റ് ലൈനിൽ ഊന്നിപ്പറയുക.

3. ഒന്നിലധികം ലിങ്ക് അവലോകനം:

ഉയർന്ന VIF ഉള്ള വേരിയബിളുകളുടെ ഒരു ലിസ്റ്റ് എനിക്ക് തരൂ: ഏത് വേരിയബിളുകൾക്കാണ് സൈദ്ധാന്തികമായി ഒരേ കാര്യം അളക്കാൻ കഴിയുക, അവ നിലനിർത്തുന്നതിന് ശക്തമായ സാഹചര്യമുണ്ട്. സ്വയമേവ യോഗ്യത നേടരുത്; സിദ്ധാന്തത്തിൻ്റെ അടിസ്ഥാനത്തിൽ ഞാൻ തീരുമാനമെടുക്കും. VIF നോക്കുന്നതും വേരിയബിളുകൾ അസൈൻ ചെയ്യുന്നതും തെറ്റാകുന്നത് എന്തുകൊണ്ടാണെന്നും വിശദീകരിക്കുക.

4. ഓട്ടോകോറിലേഷൻ തിരുത്തൽ:

എൻ്റെ ടൈം സീരീസ് റിഗ്രഷനിൽ, ബ്രൂഷ്-ഗോഡ്ഫ്രേ p-വാല്യൂ 0.001 ആയിരുന്നു. Newey-West (HAC) സ്റ്റാൻഡേർഡ് പിശകുകളുള്ള കോഫിഫിഷ്യൻ്റ് ടേബിൾ നിർമ്മിക്കുന്ന R കോഡ് എഴുതുക, ഒപ്പം ലാഗ് തിരഞ്ഞെടുക്കുന്നത് എങ്ങനെയെന്ന് വിശദീകരിക്കുക. ഈ തിരുത്തൽ ഓട്ടോകോറിലേഷൻ്റെ കാരണം പരിഹരിക്കുന്നില്ല, അത് അനുമാനം ശരിയാക്കുന്നു.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായ പ്രോംപ്റ്റ്:

എൻ്റെ റിഗ്രഷനിൽ എന്തെങ്കിലും പ്രശ്നമുണ്ടോ? എങ്കിൽ അത് ശരിയാക്കുക.

ഈ നിർദ്ദേശം AI-യെ ഒരു അന്ധമായ "ഫിക്സ്" മോഡിൽ നിർത്തുന്നു: ഇതിന് പരിശോധനകൾ ഒഴിവാക്കാനും നേരിട്ടുള്ള പരിവർത്തനം അല്ലെങ്കിൽ വേരിയബിൾ എലിമിനേഷൻ പ്രയോഗിക്കാനും കഴിയും, ഏത് ലംഘനമാണ് യഥാർത്ഥത്തിൽ നിലനിൽക്കുന്നതെന്നും അത് എന്താണ് തകർന്നതെന്നും കാണിക്കാതെ.

ശക്തമായ നിർദ്ദേശം:

നിങ്ങളുടെ റോൾ: ഡയഗ്നോസ്റ്റിക് അസിസ്റ്റൻ്റ്, ഓട്ടോ കറക്റ്റർ അല്ല. മൂന്ന് ലംഘനങ്ങൾക്കായുള്ള ആദ്യ പരിശോധന വെവ്വേറെ (മൾട്ടികോളിനാരിറ്റി, ഹെറ്ററോസ്സെഡാസ്റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ) കൂടാതെ ഓരോന്നിനും: ഏത് ടെസ്റ്റ്, ഫലം എങ്ങനെ വായിക്കാം, അത് കോഫിഷ്യൻ്റ് അല്ലെങ്കിൽ സ്റ്റാൻഡേർഡ് പിശക് ലംഘിക്കുന്നു. തുടർന്ന്, യഥാർത്ഥത്തിൽ കണ്ടെത്തിയ ലംഘനത്തിന് ഒരു പരിഹാരം നിർദ്ദേശിക്കുക, പരിഹരിച്ച പ്രശ്നം പരിഹരിച്ചെന്ന് എനിക്ക് എങ്ങനെ പരിശോധിക്കാമെന്ന് വിശദീകരിക്കുക.

വ്യത്യാസം: ദൃഢമായ ഇച്ഛാശക്തി തിരുത്തുന്നതിന് മുമ്പ് രോഗനിർണയത്തെ പ്രേരിപ്പിക്കുകയും "അത് തകർക്കുന്നത്" തമ്മിലുള്ള വ്യക്തമായ വ്യത്യാസം ആവശ്യപ്പെടുകയും ചെയ്യുന്നു.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - വ്യാജമായ പ്രാധാന്യം (ഹെറ്ററോസ്‌സെഡസ്‌റ്റിസിറ്റി). ചെലവ് ~ റവന്യൂ മോഡലിലെ റവന്യൂ കോഫിഫിഷ്യൻ്റ് p=0.01-ൽ "പ്രധാനമാണ്" എന്ന് ഒരു വിശകലന വിദഗ്ധൻ കണ്ടെത്തി. എന്നാൽ ഇപ്പോൾ അദ്ദേഹത്തിൻ്റെ ചാർട്ടിൽ ഒരു പ്രത്യേക ഫണൽ പാറ്റേൺ ഉണ്ടായിരുന്നു. ശക്തമായ സ്റ്റാൻഡേർഡ് പിശകുകൾ പ്രയോഗിച്ചപ്പോൾ, p-മൂല്യം 0.09 ആയി വർദ്ധിച്ചു; അർത്ഥപൂർണ്ണത നഷ്ടപ്പെടുന്നു. തെറ്റായി കണക്കാക്കിയ സ്റ്റാൻഡേർഡ് പിശക് സൃഷ്ടിച്ച ഒരു മിഥ്യാധാരണയായിരുന്നു ആദ്യ ഫലം. പാഠം: സ്റ്റാൻഡേർഡ് പിശക് തിരുത്താതെ പ്രാധാന്യം വിശ്വസിക്കാൻ കഴിയില്ല.

കേസ് 2 - ബ്ലൈൻഡ് വേരിയബിൾ ഉന്മൂലനം. ഒരു വിദ്യാർത്ഥി മോഡലിൽ നിന്ന് "എക്സ്പീരിയൻസ്" വേരിയബിൾ ഉപേക്ഷിച്ചു, കാരണം അവൻ്റെ VIF ഉയർന്നതാണ്; ഗുണകങ്ങൾ "ശുദ്ധീകരിച്ചു" എന്നാൽ മോഡലിൻ്റെ സൈദ്ധാന്തിക അർത്ഥം വികലമായിരുന്നു, കാരണം അനുഭവം താൽപ്പര്യത്തിൻ്റെ പ്രധാന വേരിയബിളാണ്. ശരിയായ മാർഗം: പ്രായം കുറയ്ക്കുക, അനുഭവം നിലനിർത്തുക, അല്ലെങ്കിൽ രണ്ടും കൂട്ടിച്ചേർക്കുക. പാഠം: വിഐഎഫ് പരിധി മാത്രം ഒഴിവാക്കാനുള്ള അടിസ്ഥാനമല്ല; സിദ്ധാന്തം നിർണ്ണയിക്കുന്നു.

കേസ് 3 - ഓട്ടോകോറിലേഷൻ വഴി മറഞ്ഞിരിക്കുന്ന അനിശ്ചിതത്വം. ഒരു ടൈം സീരീസ് പഠനത്തിൽ, ഡർബിൻ-വാട്സൺ അവഗണിക്കപ്പെട്ടു; ഗുണകം വളരെ "കൃത്യമായി" (ഇടുങ്ങിയ ആത്മവിശ്വാസ ഇടവേള) തോന്നി. ന്യൂവേ-വെസ്റ്റ് സ്റ്റാൻഡേർഡ് പിശകുകൾ പ്രയോഗിച്ചപ്പോൾ, ആത്മവിശ്വാസ ഇടവേള ഇരട്ടിയാകുകയും നയ ശുപാർശ കൂടുതൽ യാഥാസ്ഥിതികമാവുകയും ചെയ്തു. പാഠം: സ്വയബന്ധം അനിശ്ചിതത്വത്തെ കുറച്ചുകാണാം.

സാധാരണ തെറ്റുകൾ

  • ഒരു കോഫിഫിഷ്യൻ്റ് പ്രശ്‌നമായി സ്റ്റാൻഡേർഡ് പിശകിനെ വളച്ചൊടിക്കുന്ന ലംഘനത്തെ തെറ്റിദ്ധരിപ്പിക്കുന്നു. ഹെറ്ററോസെഡസ്‌റ്റിസിറ്റിയും ഓട്ടോകോറിലേഷനും ഗുണകത്തെ വികലമാക്കുന്നില്ല; പരിഭ്രാന്തരാകരുത്, മോഡൽ അനാവശ്യമായി പുനർനിർമ്മിക്കുക, ആദ്യം സാധാരണ പിശക് ശരിയാക്കുക.
  • VIF നോക്കുകയും അന്ധമായി വേരിയബിളുകൾ നൽകുകയും ചെയ്യുന്നു. VIF ഉയർന്നതായതിനാൽ സൈദ്ധാന്തികമായി ആവശ്യമായ ഒരു വേരിയബിൾ നീക്കം ചെയ്യുന്നത് മോഡലിനെ അർത്ഥശൂന്യമാക്കുന്നു.
  • തിരുത്തൽ പരിശോധിക്കുന്നില്ല. ശക്തമായ സ്റ്റാൻഡേർഡ് പിശക് പ്രയോഗിച്ചതിന് ശേഷം, ലംഘനം യഥാർത്ഥത്തിൽ അനുമാനം ശരിയാക്കുന്നുണ്ടോയെന്ന് പരിശോധിക്കുക; "ഞാൻ ഇത് പ്രയോഗിച്ചു, അത് കഴിഞ്ഞു" എന്ന് പറയരുത്.
  • രോഗനിർണയം കൂടാതെ പരിഹരിക്കുക. ഏത് ലംഘനമാണ് നിലവിലുളളതെന്ന് പരിശോധിക്കാതെ രൂപാന്തരം/എലിമിനേഷൻ പ്രയോഗിക്കുന്നത്, ഇല്ലാത്തിടത്ത് പ്രശ്നം "പരിഹരിക്കാനും" ഉള്ളത് മറയ്ക്കാനും കഴിയും.
  • എന്തുകൊണ്ടോ ശരിയാക്കുന്നു. ന്യൂയി-വെസ്റ്റ് ഓട്ടോകോറിലേഷൻ്റെ കാരണം പരിഹരിക്കുന്നില്ല; അത് അനുമാനം ശരിയാക്കുന്നു. ഘടനാപരമായ പ്രശ്നമുണ്ടെങ്കിൽ, മോഡൽ മാറ്റണം.
നുറുങ്ങ്: ഓരോ ലംഘനത്തിനും, "ഇത് ഗുണകത്തെ നശിപ്പിക്കുകയാണോ അതോ അതിലുള്ള എൻ്റെ വിശ്വാസമാണോ?" ഉത്തരം "ആത്മവിശ്വാസം" ആണെങ്കിൽ, പരിഹാരം മിക്കവാറും എല്ലായ്‌പ്പോഴും സാധാരണ പിശക് തിരുത്തലാണ്, മോഡൽ പുനർനിർമ്മിക്കുന്നില്ല.

ചുരുക്കത്തിൽ

റിഗ്രഷൻ ഡയഗ്നോസ്റ്റിക്സ് ഔട്ട്പുട്ടിനെ വിശ്വസിക്കുന്നതിനുള്ള ഒരു മുൻവ്യവസ്ഥയാണ്. മൂന്ന് സാധാരണ ലംഘനങ്ങളിൽ, മൾട്ടികോളിനാരിറ്റി ഗുണകത്തെ അസ്ഥിരമാക്കുകയും സാധാരണ പിശക് വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു; മറുവശത്ത്, ഹെറ്ററോസ്‌കെഡാസ്‌റ്റിസിറ്റിയും ഓട്ടോകോറിലേഷനും ഗുണകത്തെ നിഷ്‌പക്ഷമായി വിടുകയും സാധാരണ പിശകിനെ വികലമാക്കുകയും ചെയ്യുന്നു. AI ഡയഗ്നോസ്റ്റിക്, ഫിക്സ് കോഡ് സൃഷ്ടിക്കുന്നു, എന്നാൽ ഏത് ലംഘനമാണ് യഥാർത്ഥ പ്രശ്‌നം, ഏത് വേരിയൻ്റ് സൈദ്ധാന്തികമായി തുടരുന്നു, പരിഹരിക്കൽ പ്രശ്നം പരിഹരിക്കുമോ എന്ന് നിങ്ങൾ തീരുമാനിക്കുന്നു. "എന്താണ് തകരുന്നത്" എന്ന വ്യത്യാസം വ്യക്തമാക്കാതെ പരിഭ്രാന്തിയോ അന്ധമായ തിരുത്തലോ ശരിയല്ല.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു മൾട്ടിവേരിയേറ്റ് റിഗ്രഷൻ സജ്ജീകരിച്ച് രോഗനിർണ്ണയങ്ങൾ മാത്രം നൽകുന്ന ഒരു കോഡിനായി AI-യോട് ആവശ്യപ്പെടുക (തിരുത്തലുകളൊന്നുമില്ല): VIF, Breusch-Pagan/White, Durbin-Watson/Breusch-Godfrey. ഓരോ ടെസ്റ്റിനും, ഫലം വ്യാഖ്യാനിച്ച്, ലംഘനം കോഫിഫിഷ്യനെ അല്ലെങ്കിൽ സ്റ്റാൻഡേർഡ് പിശകിനെ വികലമാക്കുന്നുണ്ടോ എന്ന് സൂചിപ്പിക്കുക. നിങ്ങൾ കണ്ടെത്തുന്ന ഒരു യഥാർത്ഥ ലംഘനത്തിന് (ഉദാ. ഹെറ്ററോസെഡസ്‌റ്റിസിറ്റി), ശക്തമായ സ്റ്റാൻഡേർഡ് പിശകുകൾ പ്രയോഗിക്കുകയും ക്ലാസിക്കൽ, കരുത്തുറ്റ ഫലങ്ങൾ കൂട്ടിച്ചേർക്കുകയും ചെയ്യുക; കോഫിഫിഷ്യൻ്റ് മാറില്ലെങ്കിലും സ്റ്റാൻഡേർഡ് പിശക് മാറുന്നുവെന്ന് കാണിക്കുക. ഒരു ഖണ്ഡികയിൽ, തിരുത്തൽ നിങ്ങളുടെ പ്രാധാന്യത്തെ എങ്ങനെ ബാധിച്ചുവെന്ന് റിപ്പോർട്ട് ചെയ്യുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] ഞാൻ മൂന്ന് ലംഘനങ്ങൾ (മൾട്ടികോളിനാരിറ്റി, ഹെറ്ററോസ്‌കെഡാസ്റ്റിസിറ്റി, ഓട്ടോകോറിലേഷൻ) വെവ്വേറെ പരീക്ഷിച്ചു.
  • [ ] ഓരോ ലംഘനത്തിനും, അത് ഗുണകത്തെ വളച്ചൊടിക്കുന്നതോ സാധാരണ പിശകോ എന്ന് ഞാൻ വേർതിരിച്ചു.
  • [ ] ഞാൻ വിഐഎഫ് മാത്രമല്ല, സിദ്ധാന്തത്തിൽ മൾട്ടികോളിനെയാരിറ്റിയിൽ വേരിയബിൾ എലിമിനേഷൻ അടിസ്ഥാനമാക്കിയുള്ളതാണ്.
  • [ ] ഞാൻ അടിസ്ഥാന പിശക് ഉപയോഗിച്ചു, ഭിന്നശേഷി/ഓട്ടോകോറിലേഷൻ (HC/HAC).
  • [ ] തിരുത്തലിനുശേഷം, എൻ്റെ അനുമാനത്തിൽ ലംഘനത്തിൻ്റെ ആഘാതം ഞാൻ പരിശോധിക്കുകയും പരിശോധിക്കുകയും ചെയ്തു.
  • [ ] സാധാരണ പിശക് തിരുത്തൽ എൻ്റെ പ്രാധാന്യ ഫലത്തെ എങ്ങനെ ബാധിച്ചുവെന്ന് ഞാൻ റിപ്പോർട്ട് ചെയ്യുന്നു.