നേട്ടങ്ങൾ:
- ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് സപ്പോർട്ട് ഉള്ള ഒരു ലീനിയർ റിഗ്രഷൻ മോഡൽ നിർമ്മിക്കാനുള്ള കഴിവ്, ഗുണകങ്ങൾ, സ്റ്റാൻഡേർഡ് പിശകുകൾ, R-സ്ക്വയർ എന്നിവ കൃത്യവും നോൺ-കാരണമല്ലാത്തതുമായ ഭാഷയിൽ വ്യാഖ്യാനിക്കുക
- മോഡൽ അടിസ്ഥാനമാക്കിയുള്ള അടിസ്ഥാന അനുമാനങ്ങൾ (രേഖീയത, എക്സോജെനിറ്റി, സ്ഥിരമായ വ്യതിയാനം) എന്നിവയും അവ ലംഘിക്കപ്പെടുമ്പോൾ എന്താണ് സംഭവിക്കുന്നതെന്ന് മനസിലാക്കാനുള്ള കഴിവ്, അനുമാന നിയന്ത്രണത്തിനായി കൃത്രിമബുദ്ധി ഉപയോഗിക്കുക.
- ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉൽപ്പാദിപ്പിക്കുന്ന കോഫിഫിഷ്യൻ്റ് വ്യാഖ്യാനങ്ങളിലെ അമിതമായ കാര്യകാരണ ക്ലെയിമുകളും അവഗണിക്കപ്പെട്ട വേരിയബിൾ പ്രശ്നങ്ങളും തിരിച്ചറിയാനും തിരുത്താനുമുള്ള കഴിവ്
ഇക്കണോമെട്രിക്സിൻ്റെയും അപ്ലൈഡ് സ്റ്റാറ്റിസ്റ്റിക്സിൻ്റെയും നട്ടെല്ലാണ് ലീനിയർ റിഗ്രഷൻ. അതിൻ്റെ ഏറ്റവും ലളിതമായ രൂപത്തിൽ, ഒന്നോ അതിലധികമോ സ്വതന്ത്ര വേരിയബിളുകളുമായുള്ള (വിദ്യാഭ്യാസം, അനുഭവം പോലുള്ള വിശദീകരണ ഘടകങ്ങൾ) ഒരു രേഖീയ ബന്ധത്തിലൂടെ ഒരു ആശ്രിത വേരിയബിൾ (വരുമാനം പോലുള്ള നിങ്ങൾ വിശദീകരിക്കാൻ ആഗ്രഹിക്കുന്ന ഫലം) എങ്ങനെ വ്യത്യാസപ്പെടുന്നുവെന്ന് ഇത് കണക്കാക്കുന്നു. മോഡലിന് ഫോം ഉണ്ട്: വരുമാനം = β0 + β1 · വിദ്യാഭ്യാസം + β2 · അനുഭവം + u. ഇവിടെ β (ബീറ്റ) ഗുണകങ്ങൾ ബന്ധത്തിൻ്റെ വലുപ്പം കാണിക്കുന്നു, കൂടാതെ മോഡലിന് വിശദീകരിക്കാൻ കഴിയാത്ത പിശക് പദം (എല്ലാ നിരീക്ഷിക്കപ്പെടാത്ത ഇഫക്റ്റുകളും) u കാണിക്കുന്നു. ഈ യൂണിറ്റിൽ, ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് (AI) റിഗ്രഷൻ നിർമ്മാണത്തെയും വ്യാഖ്യാനത്തെയും വേഗത്തിലാക്കുന്നത് എങ്ങനെയെന്ന് നമ്മൾ കാണും, എന്നാൽ മിക്കപ്പോഴും തെറ്റുകൾ സംഭവിക്കുന്നത് എന്തിനാണ് കോഫിഫിഷ്യൻ്റ് വ്യാഖ്യാനം.
നമുക്ക് ആദ്യം മുതൽ അടിസ്ഥാന ഉദ്ദേശ്യം നൽകാം: AI റിഗ്രഷൻ കോഡ് എഴുതുന്നു, ഔട്ട്പുട്ട് പട്ടിക സംഘടിപ്പിക്കുന്നു, കോഫിഫിഷ്യൻ്റ് വ്യാഖ്യാനത്തിനായി ഒരു ഡ്രാഫ്റ്റ് നിർമ്മിക്കുന്നു. എന്നാൽ ഏത് വേരിയബിളുകൾ മോഡലിലേക്ക് (മോഡൽ സ്പെസിഫിക്കേഷൻ) പോകുന്നു എന്നത് നിങ്ങളുടെ തീരുമാനമാണ്. AI യുടെ ഏറ്റവും അപകടകരമായ ശീലം "X വർദ്ധിപ്പിക്കുന്നു Y" പോലെയുള്ള സാധാരണ റിഗ്രഷൻ ഗുണകങ്ങളെ കാര്യകാരണ ഭാഷയിൽ അവതരിപ്പിക്കുക എന്നതാണ്; അതേസമയം മിക്ക റിഗ്രെഷനുകളും ബന്ധം (പരസ്പരബന്ധം) കാണിക്കുന്നു.
സ്റ്റെപ്പ്വൈസ് റിഗ്രഷൻ വർക്ക്ഫ്ലോ
1. സിദ്ധാന്തം ഉപയോഗിച്ച് മാതൃക നിർമ്മിക്കുക. ഏതൊക്കെ വേരിയബിളുകൾ ആശ്രിതമായിരിക്കും, ഏതാണ് സ്വതന്ത്രമാകുക എന്നത് സ്ഥിതിവിവരക്കണക്കുകളിൽ നിന്നല്ല, ഫീൽഡ് അറിവിൽ നിന്നും സിദ്ധാന്തത്തിൽ നിന്നും വരുന്നു. "ഏതൊക്കെ ഘടകങ്ങൾ ഈ ഫലത്തെ യുക്തിപരമായി ബാധിക്കുന്നു?" എന്നതിൻ്റെ യുക്തി. "ഞാൻ ഡാറ്റയിൽ എന്ത് നൽകിയാലും ഗുണകം പ്രാധാന്യമർഹിക്കുന്നു" എന്നതിൻ്റെ യുക്തിയല്ല.
2. ഊഹിക്കുക. ഏറ്റവും സാധാരണമായ രീതി OLS ആണ് (ഓർഡിനറി ലീസ്റ്റ് സ്ക്വയറുകൾ): നിരീക്ഷിച്ചതും പ്രവചിച്ചതുമായ മൂല്യങ്ങൾ തമ്മിലുള്ള സ്ക്വയർ വ്യത്യാസങ്ങളുടെ ആകെത്തുക കുറയ്ക്കുന്ന വിധത്തിൽ ഇത് ഗുണകങ്ങളെ തിരഞ്ഞെടുക്കുന്നു. AI ഇതിനുള്ള കോഡ് സൃഷ്ടിക്കുന്നു (R-ൽ lm(), പൈത്തണിലെ സ്റ്റാറ്റ്സ് മോഡലുകൾ).
3. ഔട്ട്പുട്ട് വായിക്കുക. റിഗ്രഷൻ ഔട്ട്പുട്ടിൽ നാല് കാര്യങ്ങൾക്കായി നോക്കുക: കോഫിഫിഷ്യൻ്റ് (ബന്ധത്തിൻ്റെ ദിശയും വ്യാപ്തിയും), സ്റ്റാൻഡേർഡ് പിശക് (ഗുണകത്തിൻ്റെ ഏകദേശ അനിശ്ചിതത്വം), ടി-സ്റ്റാറ്റിസ്റ്റിക്, പി-മൂല്യം (കോഫിഫിഷ്യൻ്റ് പൂജ്യത്തിൽ നിന്ന് വ്യത്യസ്തമാണെന്നതിൻ്റെ തെളിവുകളുടെ ശക്തി), R-സ്ക്വയർ (ആശ്രിത വേരിയബിളിലെ വ്യതിയാനം എത്രയെന്ന് മോഡൽ വിശദീകരിക്കുന്നു, 0 മുതൽ 1 വരെ). ഉയർന്ന R-സ്ക്വയർ എന്നാൽ "നല്ല മോഡൽ" എന്നല്ല അർത്ഥമാക്കുന്നത്; കാര്യകാരണബന്ധം തീരെയില്ല.
4. ഗുണകം ശരിയായി വ്യാഖ്യാനിക്കുക. വിദ്യാഭ്യാസ ഗുണകം 1,200 ആണെങ്കിൽ, ശരിയായ വ്യാഖ്യാനം ഇതാണ്: "മറ്റ് വേരിയബിളുകൾ സ്ഥിരമായതിനാൽ, വിദ്യാഭ്യാസത്തിലെ ഒരു വർഷത്തെ വർദ്ധനവ് ശരാശരി 1,200 യൂണിറ്റ് ഉയർന്ന വരുമാനവുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു." തെറ്റായ വ്യാഖ്യാനം: "മറ്റൊരു വർഷത്തെ വിദ്യാഭ്യാസം വരുമാനം 1,200 വർദ്ധിപ്പിക്കുന്നു." രണ്ടാമത്തേത് കാര്യകാരണത്തിൻ്റെ അവകാശവാദമാണ്, ഉചിതമായ രൂപകൽപ്പന ഉപയോഗിച്ച് മാത്രമേ പ്രതിരോധിക്കാൻ കഴിയൂ (യൂണിറ്റ് 9).
5. അനുമാനങ്ങൾ പരിശോധിക്കുക. റിഗ്രഷൻ്റെ സാധുത ചില അനുമാനങ്ങളെ ആശ്രയിച്ചിരിക്കുന്നു (ചുവടെ). AI ഡയഗ്നോസ്റ്റിക് കോഡ് സൃഷ്ടിക്കുന്നു; നിങ്ങൾ അഭിപ്രായം പറയൂ.
ലീനിയർ റിഗ്രഷൻ്റെ അടിസ്ഥാന അനുമാനങ്ങൾ
ഗുണകങ്ങൾ നിഷ്പക്ഷമായിരിക്കുന്നതിനും (രേഖാ കേന്ദ്രീകൃതമായത്) സാധാരണ പിശകുകൾ വിശ്വസനീയമാകുന്നതിനും ക്ലാസിക്കൽ ലീനിയർ മോഡൽ അടിസ്ഥാനമാക്കിയുള്ള അനുമാനങ്ങൾ ആവശ്യമാണ്:
- രേഖീയത: ബന്ധം പരാമീറ്ററുകളിൽ രേഖീയമാണ് (ആവശ്യമെങ്കിൽ ലോഗ്/സ്ക്വയർ പദങ്ങളിൽ നീട്ടി).
- എക്സോജെനിറ്റി (സീറോ സോപാധിക ശരാശരി): പിശക് പദത്തിന് വിശദീകരണ വേരിയബിളുകളുമായി ബന്ധമില്ല. ഇത് ഏറ്റവും നിർണായകവും പതിവായി ലംഘിക്കപ്പെടുന്നതുമായ അനുമാനമാണ്; ലംഘനം ഒഴിവാക്കിയ വേരിയബിൾ ബയസ് സൃഷ്ടിക്കുന്നു.
- സ്ഥിരമായ വ്യതിയാനം (ഹോമോസ്സെഡസ്റ്റിസിറ്റി): എല്ലാ നിരീക്ഷണങ്ങളിലും പിശക് പദത്തിൻ്റെ വ്യതിയാനം ഒന്നുതന്നെയാണ് (ലംഘനം: ഹെറ്ററോസ്സെഡസ്റ്റിസിറ്റി - യൂണിറ്റ് 5).
- യാന്ത്രിക ബന്ധത്തിൻ്റെ അഭാവം: പിശകുകൾ പരസ്പരം സ്വതന്ത്രമാണ് (സമയ ശ്രേണിയിലെ പതിവ് ലംഘനങ്ങൾ - യൂണിറ്റുകൾ 5 ഉം 8 ഉം).
- അങ്ങേയറ്റത്തെ മൾട്ടികോളിനിയറിറ്റിയുടെ അഭാവം: വിശദീകരണ വേരിയബിളുകൾ പരസ്പരം ഏതാണ്ട് സമാനമല്ല (യൂണിറ്റ് 5).
മുന്നറിയിപ്പ്: വേരിയബിൾ ബയസ് അവഗണിക്കുന്നതാണ് ഏറ്റവും അപകടകരമായ പ്രശ്നം. വരുമാനവും വിദ്യാഭ്യാസവുമായി (ഉദാ: കുടുംബ പശ്ചാത്തലം, കഴിവ്) ബന്ധപ്പെട്ട ഒരു ഘടകം നിങ്ങളുടെ മാതൃകയിൽ നിന്ന് നിങ്ങൾ ഒഴിവാക്കുകയാണെങ്കിൽ, ഈ നഷ്ടപ്പെട്ട ഘടകത്തിൻ്റെ പ്രഭാവം വിദ്യാഭ്യാസ ഗുണകം ഏറ്റെടുക്കുകയും അത് വർദ്ധിപ്പിക്കുകയും ചെയ്യും. കാണാതായ വേരിയബിൾ അറിയാൻ AI-ക്ക് കഴിയില്ല; നിങ്ങളുടെ ഫീൽഡ് അറിവിന് മാത്രമേ അത് പിടിച്ചെടുക്കാൻ കഴിയൂ.
താരതമ്യ പട്ടിക: ശരിയും തെറ്റായ ഗുണക വ്യാഖ്യാനവും
ഔട്ട്പുട്ട്
തെറ്റായ (കാരണപരമായ) വ്യാഖ്യാനം
ശരിയായ (ബന്ധപ്പെട്ട) വ്യാഖ്യാനം
വിദ്യാഭ്യാസ ഗുണകം = 1.200
"വിദ്യാഭ്യാസം വരുമാനം 1,200 വർദ്ധിപ്പിക്കുന്നു"
"ഒരു വർഷത്തെ കൂടുതൽ വിദ്യാഭ്യാസം, സെറ്റെറിസ് പാരിബസ്, 1,200 ഉയർന്ന വരുമാനവുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു."
R² = 0.68
"മോഡൽ യാഥാർത്ഥ്യം മനസ്സിലാക്കി"
"68% മാറ്റവും വിശദീകരിച്ചിട്ടുണ്ട്; കാര്യകാരണബന്ധം കാണിക്കുന്നില്ല"
p <0.01
"ആഘാതം വളരെ വലുതാണ്"
"ഗുണകം പൂജ്യത്തിൽ നിന്ന് വ്യത്യസ്തമാണെന്നതിന് ശക്തമായ തെളിവ്; മാഗ്നിറ്റ്യൂഡ് വ്യതിരിക്തമാണ്"
നെഗറ്റീവ് ഗുണകം
"എക്സ് വൈയെ കുറയ്ക്കുന്നു"
"എക്സ് കൂടുന്നതിനനുസരിച്ച് Y ശരാശരി കുറയുന്നു; എന്തിനാണ് മറ്റൊരു പ്രശ്നം?"
പകർത്താവുന്ന നാല് നിർദ്ദേശങ്ങൾ
1. റിഗ്രഷൻ കോഡ് സൃഷ്ടിക്കുന്നു:
നിങ്ങളുടെ റോൾ: ഇക്കണോമെട്രിക്സ് കോഡ് അസിസ്റ്റൻ്റ്. ഞാൻ ഡാറ്റ പങ്കിടുന്നില്ല, എനിക്ക് R കോഡ് വേണം. ഡാറ്റ.ഫ്രെയിമിൽ 'ഡാറ്റ', വരുമാനം (ആശ്രിതൻ), വിദ്യാഭ്യാസം, അനുഭവം, ലിംഗഭേദം (വിഭാഗീയം). ടാസ്ക്: വരുമാനം ~ വിദ്യാഭ്യാസം + അനുഭവം + ലിംഗഭേദം എന്നിവയ്ക്കായി lm() ഉപയോഗിച്ച് റിഗ്രഷൻ കോഡ് എഴുതുക, സംഗ്രഹ ഔട്ട്പുട്ടും ഗുണകങ്ങളുടെ ആത്മവിശ്വാസ ഇടവേളയും (കോൺഫിൻറ്റ്) കാണിക്കുക. ഓരോ ഭാഗവും ഒരു കമൻ്റ് ലൈൻ ഉപയോഗിച്ച് വിശദീകരിക്കുക. ഞാൻ ഓടി ഫലം പരിശോധിക്കും.
2. ഗുണക വ്യാഖ്യാനത്തിൻ്റെ രേഖാചിത്രം (ബന്ധപ്പെട്ട ഭാഷയിൽ):
താഴെയുള്ള റിഗ്രഷൻ ഔട്ട്പുട്ട് വ്യാഖ്യാനിക്കുക, എന്നാൽ നിയമങ്ങൾ:- ആപേക്ഷിക ഭാഷയിൽ ഗുണകങ്ങൾ എഴുതുക ("അനുബന്ധം"), കാര്യകാരണ ഭാഷ ഉപയോഗിക്കരുത്, "മറ്റ് വേരിയബിളുകൾ സ്ഥിരാങ്കം" ചേർക്കുക,- R-സ്ക്വയർ 'കാരണത്വം' ആയി ചേർക്കുക,- ഫലത്തിൻ്റെ വലുപ്പവുമായി പ്രാധാന്യം ആശയക്കുഴപ്പത്തിലാക്കരുത്. ഔട്ട്പുട്ട്: [പട്ടിക]
3. അനുമാന പരിശോധന കോഡ്:
വരുമാനം ~ വിദ്യാഭ്യാസം + അനുഭവ മാതൃക (ആർ) എന്നതിനായി ഒരു അനുമാന രോഗനിർണയ കോഡ് എഴുതുക: ശേഷിക്കുന്ന-ഫിറ്റിംഗ് (അവശിഷ്ടമായ) ഗ്രാഫുകൾ, QQ ഗ്രാഫ്, അവശിഷ്ടങ്ങളുടെ വിതരണം. ഓരോ ഗ്രാഫും ഏത് അനുമാനമാണ് പരിശോധിക്കുന്നതെന്ന് കമൻ്റ് ലൈനിൽ വിശദീകരിക്കുക. തിരുത്തൽ നിർദ്ദേശിക്കുക; ഒരു രോഗനിർണയം നടത്തുക, ഞാൻ തീരുമാനമെടുക്കും.
4. നഷ്ടമായ വേരിയബിൾ ചോദ്യം:
വരുമാനം ~ വിദ്യാഭ്യാസ മാതൃകയിൽ അവഗണിക്കപ്പെട്ട വേരിയബിൾ ബയസിൻ്റെ അപകടസാധ്യത പരിഗണിക്കാൻ എന്നെ സഹായിക്കൂ. വരുമാനവും വിദ്യാഭ്യാസവുമായി ബന്ധപ്പെട്ടതും എന്നാൽ മാതൃകയിലല്ലാത്തതുമായ സാധ്യമായ വേരിയബിളുകൾ പട്ടികപ്പെടുത്തുക (ഉദാ. കുടുംബ പശ്ചാത്തലം, പ്രദേശം, കഴിവ്) കൂടാതെ ഓരോന്നും വിദ്യാഭ്യാസ ഗുണകത്തെ ഏത് ദിശയിലാണ് പക്ഷപാതം കാണിക്കുന്നതെന്ന് വിശദീകരിക്കുക. ഇതൊരു നിശ്ചയമല്ല, പരിഗണനകളുടെ ഒരു പട്ടികയാകട്ടെ; ഞാൻ തീരുമാനം എടുക്കും.
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
ഈ റിഗ്രഷൻ ഔട്ട്പുട്ട് വ്യാഖ്യാനിച്ച് ഫലങ്ങൾ വിശദീകരിക്കുക.
ഈ പ്രോംപ്റ്റ് AI റിലീസ് ചെയ്യുന്നു; "പരിശീലനം വരുമാനം വർദ്ധിപ്പിക്കുന്നു", "മോഡൽ വളരെ വിജയകരമാണ്" തുടങ്ങിയ കാര്യകാരണപരവും അതിശയോക്തിപരവുമായ വാക്യങ്ങൾ നിർമ്മിക്കാൻ സാധ്യതയുണ്ട്.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: ശ്രദ്ധാപൂർവ്വമായ ഇക്കണോമെട്രിക്സ് അസിസ്റ്റൻ്റ്. ഔട്ട്പുട്ട് വ്യാഖ്യാനിക്കുക, പക്ഷേ: (1) എല്ലാ ഗുണകങ്ങളും ആപേക്ഷിക ഭാഷയിൽ എഴുതുക, (2) "മറ്റെല്ലാ സെറ്ററിസ് പാരിബസ്" പാറ്റേൺ ഉപയോഗിക്കുക, (3) R-സ്ക്വയേഡ് കാര്യകാരണമായി തെറ്റിദ്ധരിക്കരുത്, (4) ഇഫക്റ്റ് വലുപ്പത്തിൽ നിന്ന് പ്രത്യേക പ്രാധാന്യം, (5) മോഡലിൻ്റെ എക്സോജെനിറ്റി അനുമാനം പരിശോധിക്കുന്നതിൽ പരാജയം ശ്രദ്ധിക്കുക, ഓവർലോക്ക് സാധ്യത. ഔട്ട്പുട്ട്: [പട്ടിക]
വ്യത്യാസം: ശക്തമായ ഇച്ഛാശക്തി കാര്യകാരണ ഭാഷയെ നിരോധിക്കുന്നു, അവ്യക്തതയും അനുമാനത്തിൻ്റെ പരിധികളും ദൃശ്യമാക്കുന്നു.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - കാര്യകാരണമായ ഭാഷാ കെണി. ഒരു അനലിസ്റ്റ് തൻ്റെ പരസ്യ ~ വിൽപ്പന റിഗ്രഷനിൽ പരസ്യ ഗുണകം 2.4 ആണെന്ന് കണ്ടെത്തി, AI ബ്ലൂപ്രിൻ്റ് ഇപ്രകാരം ഉപയോഗിച്ചു: "പരസ്യങ്ങൾക്കായി ചെലവഴിക്കുന്ന ഓരോ യൂണിറ്റും വിൽപ്പന 2.4 യൂണിറ്റ് വർദ്ധിപ്പിക്കുന്നു." മാനേജ്മെൻ്റ് അതിനനുസരിച്ച് ബജറ്റ് പെരുപ്പിച്ചു; അതേസമയം, ഉയർന്ന വിൽപ്പനയുള്ള കാലഘട്ടങ്ങളിൽ ഇതിനകം തന്നെ കൂടുതൽ പരസ്യങ്ങൾ (വിപരീത കാരണങ്ങളാൽ) ഉണ്ടായിരുന്നു, ഗുണകം ഇത് പ്രതിഫലിപ്പിക്കുന്നു. പാഠം: സാധാരണ പിന്മാറ്റം കാര്യകാരണത്തിൻ്റെ തെളിവല്ല; ദിശ വ്യക്തമല്ല.
കേസ് 2 - ഓവർലുക്ക്ഡ് വേരിയബിൾ. ഒരു പഠനത്തിൽ, വരുമാനം ~ വിദ്യാഭ്യാസ ഗുണകം 1,900 ആയിരുന്നു. മാതൃകയിൽ രക്ഷാകർതൃ വിദ്യാഭ്യാസവും പ്രദേശവും ചേർത്തപ്പോൾ, ഗുണകം 1.150 ആയി കുറഞ്ഞു. ആദ്യ മാതൃകയിൽ, വിദ്യാഭ്യാസം യഥാർത്ഥത്തിൽ കുടുംബ പശ്ചാത്തലത്തിൻ്റെ ചില സ്വാധീനം ഏറ്റെടുത്തു. പാഠം: കാണാതായതും പരസ്പരബന്ധിതവുമായ ഒരു വേരിയബിൾ ഗുണകത്തെ വർദ്ധിപ്പിക്കുന്നു; ഡൊമെയ്ൻ അറിവ് ഉപയോഗിച്ച് സാധ്യമായ പോരായ്മകൾ പരിഗണിക്കുക.
കേസ് 3 - ഉയർന്ന ആർ-സ്ക്വയർ മിഥ്യ. ഒരു വിദ്യാർത്ഥി R²=0.94 കണ്ടു "എൻ്റെ മോഡൽ തികഞ്ഞതാണ്" എന്ന് പറഞ്ഞു. എന്നാൽ സ്വതന്ത്ര വേരിയബിളുകളിലൊന്ന് ആശ്രിത വേരിയബിളിന് ഏതാണ്ട് സമാനമാണ് (ഇതിനകം വിൽപ്പനയിൽ ഉൾപ്പെടുത്തിയിട്ടുള്ള ഒരു ഇനം). മോഡൽ യാഥാർത്ഥ്യത്തെ വിശദീകരിക്കുകയല്ല, അത് സ്വയം വിശദീകരിക്കുകയായിരുന്നു. പാഠം: ഉയർന്ന R-സ്ക്വയർ മോഡൽ ഗുണനിലവാരം ഉറപ്പുനൽകുന്നില്ല; ലോജിക് പരിശോധന ആവശ്യമാണ്.
സാധാരണ തെറ്റുകൾ
- ഗുണകത്തെ കാര്യകാരണമായി വ്യാഖ്യാനിക്കുന്നു. "വർദ്ധിക്കുന്നു/കുറയുന്നു" ഭാഷ രൂപകല്പനയാൽ സംരക്ഷിക്കപ്പെടാത്ത പക്ഷം തെറ്റാണ്; "അനുബന്ധം" എന്ന് പറയുക.
- അവഗണിക്കപ്പെട്ട വേരിയബിളിനെ അവഗണിക്കുന്നു. X, Y എന്നിവയുമായി ബന്ധപ്പെട്ട ഒരു കാണാതായ ഘടകം ഗുണകത്തെ പക്ഷപാതമാക്കുന്നു; സാധ്യമായ പോരായ്മകൾ പരിഗണിക്കുക.
- വിജയത്തിൻ്റെ അളവുകോലായി R-സ്ക്വയർ തെറ്റിദ്ധരിപ്പിക്കുക. ഉയർന്ന R-സ്ക്വയർ എന്നത് കാര്യകാരണമോ ശരിയായ മാതൃകയോ അർത്ഥമാക്കുന്നില്ല; ഇത് വേരിയബിൾ ചോർച്ചയുടെ അടയാളമായിരിക്കാം.
- മഹത്വവുമായി പ്രാധാന്യത്തെ ആശയക്കുഴപ്പത്തിലാക്കുന്നു. p<0.05 പ്രഭാവം വലുതാണെന്ന് സൂചിപ്പിക്കുന്നില്ല; ഗുണകത്തിൻ്റെ പ്രായോഗിക വ്യാപ്തിയും കാണുക.
- അനുമാനങ്ങൾ പരിശോധിക്കാതെ വ്യാഖ്യാനിക്കുന്നു. ലംഘനങ്ങൾ സ്റ്റാൻഡേർഡ് പിശകുകളും വ്യാഖ്യാനവും വളച്ചൊടിക്കുന്നു; രോഗനിർണയം ഒഴിവാക്കാനാവില്ല.
സൂചന: ഓരോ ഗുണകത്തിനും, "എനിക്ക് ഈ ബന്ധം വിപരീത ദിശയിൽ വിശദീകരിക്കാമോ? അല്ലെങ്കിൽ രണ്ടിനെയും ബാധിക്കുന്ന മൂന്നാമത്തെ ഘടകം ഉണ്ടോ?" പേന പേപ്പറിൽ തൊടുന്നതിനുമുമ്പ് ഈ രണ്ട് ചോദ്യങ്ങൾ കാര്യകാരണമായ അമിതവ്യാഖ്യാനത്തെ നിർത്തുന്നു.
ചുരുക്കത്തിൽ
ഒരു ഫലത്തിൻ്റെ വിശദീകരണ ഘടകങ്ങളുമായുള്ള ബന്ധം അളക്കുന്നതിനുള്ള അടിസ്ഥാന ഉപകരണമാണ് ലീനിയർ റിഗ്രഷൻ. മോഡലിൻ്റെ കോഡ്, ഔട്ട്പുട്ട് ലേഔട്ട്, വ്യാഖ്യാന രൂപരേഖ എന്നിവ AI വേഗത്തിൽ നിർമ്മിക്കുന്നു; എന്നാൽ മോഡൽ സ്പെസിഫിക്കേഷൻ, ഗുണകത്തിൻ്റെ ആപേക്ഷിക വ്യാഖ്യാനം, അവഗണിക്കപ്പെട്ട വേരിയബിളുകളുടെ അപകടസാധ്യത എന്നിവ വിദഗ്ദ്ധൻ്റെ ഉത്തരവാദിത്തമാണ്. ഏറ്റവും സാധാരണമായ തെറ്റ് ഗുണകത്തെ കാരണമായി അവതരിപ്പിക്കുന്നതാണ് ("വർദ്ധിക്കുന്നു"); ശരിയായ ഭാഷ ആപേക്ഷികമാണ് ("ബന്ധം, മറ്റെല്ലാം സ്ഥിരമാണ്"). ഉയർന്ന R-സ്ക്വയർ വിജയമോ കാര്യകാരണമോ അല്ല; അനുമാനങ്ങൾ പരിശോധിക്കാതെ ഒരു വ്യാഖ്യാനവും സുരക്ഷിതമല്ല (പ്രത്യേകിച്ച് എക്സോജെനിറ്റി).
ആപ്ലിക്കേഷൻ ടാസ്ക്
ഒരു ഡാറ്റാ സെറ്റിൽ ഒരു ആശ്രിതവും കുറഞ്ഞത് രണ്ട് സ്വതന്ത്ര വേരിയബിളുകളുമുള്ള ഒരു റിഗ്രഷൻ സജ്ജീകരിക്കുക. AI-യിൽ നിന്ന് കോഡ് അഭ്യർത്ഥിച്ച് പ്രവർത്തിപ്പിക്കുക. ആദ്യം, ഗുണകങ്ങളെ ആപേക്ഷിക ഭാഷയിൽ AI വ്യാഖ്യാനിക്കുക, തുടർന്ന് നിങ്ങൾ ഓരോ കാരണ പ്രസ്താവനയും അവലോകനം ചെയ്യുകയും ശരിയാക്കുകയും ചെയ്യുക. മോഡലിലേക്ക് സാധ്യതയുള്ള ഒരു വേരിയബിൾ ചേർക്കുകയും പ്രധാന ഗുണകം എങ്ങനെ മാറുന്നുവെന്ന് നിരീക്ഷിക്കുകയും ഒഴിവാക്കിയ വേരിയബിൾ ബയസിൻ്റെ ചട്ടക്കൂടിനുള്ളിലെ ഒരു ഖണ്ഡികയിൽ ഇത് വ്യാഖ്യാനിക്കുകയും ചെയ്യുക. അവസാനമായി, അനുമാന ഡയഗ്നോസ്റ്റിക് പ്ലോട്ടുകൾ നിർമ്മിക്കുകയും ഏത് അനുമാനമാണ് ദൃഢമാണെന്നും സംശയാസ്പദമായി കാണപ്പെടുന്നതെന്നും ശ്രദ്ധിക്കുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] ഞാൻ ഡാറ്റയെ അടിസ്ഥാനമാക്കിയല്ല, സിദ്ധാന്തത്തെയും ഫീൽഡ് അറിവിനെയും അടിസ്ഥാനമാക്കിയാണ് മോഡൽ നിർമ്മിച്ചത്.
- [ ] ഞാൻ ഗുണകങ്ങളെ ആപേക്ഷിക ഭാഷയിൽ വ്യാഖ്യാനിച്ചു ("സെറ്ററിസ് പാരിബസുമായി ബന്ധപ്പെട്ടത്").
- [ ] കാര്യകാരണമായ ക്ലെയിമുകൾക്ക് ഒരു പ്രത്യേക ഡിസൈൻ ആവശ്യമാണെന്ന് ഞാൻ ശ്രദ്ധിച്ചു.
- [ ] സാധ്യമായ അവഗണിക്കപ്പെട്ട വേരിയബിളുകൾ പരിഗണിച്ച് പ്രധാന ഗുണകത്തിൻ്റെ സംവേദനക്ഷമത ഞാൻ പരിശോധിച്ചു.
- [ ] വിജയത്തിൻ്റെ/കാരണാത്മകതയുടെ അളവുകോലായി ഞാൻ R-സ്ക്വയർ അവതരിപ്പിച്ചില്ല.
- [ ] സാങ്കൽപ്പിക ഡയഗ്നോസ്റ്റിക് പ്ലോട്ടുകൾ നിർമ്മിക്കുകയും വ്യാഖ്യാനിക്കുകയും ചെയ്യുന്നു; നിയമലംഘനം നടന്നിട്ടുണ്ടോ എന്ന് ഞാൻ വിലയിരുത്തി.